Zurück zur Übersicht
BranchennachrichtenKI-SicherheitLLMCybersecurity

Sicherheitslücke bei KI-Modellen: Forscher extrahieren verborgene Gedankengänge aus proprietären APIs

Ein neuer Forschungsbericht mit dem Titel „Stealing Reasoning Traces from Proprietary LLM APIs“ deckt eine kritische Schwachstelle bei führenden KI-Anbietern wie OpenAI, Anthropic und Google auf. Durch eine Methode namens „Encrypted Thought Injection“ ist es möglich, die eigentlich verborgenen Denkprozesse (Reasoning Traces) leistungsstarker Modelle zu stehlen. Dabei werden verschlüsselte Datenblöcke, die normalerweise nur zur Fortführung von Konversationen dienen, in schwächere, manipulierte Modelle injiziert. Diese geben die internen Überlegungen des Ursprungsmodells daraufhin im Klartext aus. Die Analyse zeigt, dass die extrahierten Daten exakt mit der Anzahl der vom System gemeldeten „Thinking Tokens“ übereinstimmen. Bei den Untersuchungen wurden zudem hunderte technische Identifikatoren sowie sensible Informationen wie PII und Zugangsdaten in den Datenströmen entdeckt.

Hacker News

Die wichtigsten Punkte

  • Neue Angriffsmethode entdeckt: Forscher demonstrieren, wie verborgene Denkprozesse (Reasoning Traces) aus geschlossenen KI-APIs extrahiert werden können.
  • Ausnutzung der Portabilität: Verschlüsselte Gedankenblöcke können aus ihrem ursprünglichen Kontext gerissen und in andere Modelle injiziert werden.
  • Betroffene Anbieter: Die Schwachstelle wurde bei Modellen von OpenAI, Anthropic und Google nachgewiesen.
  • Datenleck-Risiko: Neben den Denkprozessen wurden technische Identifikatoren, personenbezogene Daten (PII) und Anmeldedaten in den Traces gefunden.
  • Präzise Rekonstruktion: Die extrahierten Texte entsprechen exakt der Anzahl der vom System angegebenen verborgenen Token.

Analyse

Die Mechanik der „Encrypted Thought Injection“

Moderne KI-Anbieter senden die internen Gedankengänge eines Modells oft als verschlüsselten Block an den Client zurück. Dieser Block wird bei einer Fortsetzung der Konversation wieder an den Server gesendet, um den Kontext zu wahren. Die Forschung zeigt nun, dass diese Blöcke „portabel“ sind. Das bedeutet, ein verschlüsselter Gedankenblock eines hochleistungsfähigen Modells (wie Claude 4 Opus) kann abgefangen und in ein schwächeres, durch einen Jailbreak manipuliertes Modell (wie Claude Haiku) eingespeist werden. Das schwächere Modell fungiert dabei als Entschlüsselungswerkzeug und gibt die ursprünglichen, geheimen Gedankengänge wortwörtlich im Klartext aus.

Umfang und gefundene Daten

Die Untersuchung basierte unter anderem auf der Lösung von 120 Codeforces-Problemen. Dabei korrelierte die Länge der dekodierten Texte präzise mit der Anzahl der „Hidden Thinking Tokens“, die von der API gemeldet wurden. Besonders besorgniserregend ist die Art der extrahierten Informationen. In den über 6.700 gesammelten Datenpunkten fanden die Forscher 351 eindeutige geleakte Elemente, darunter 204 technische Identifikatoren, 126 personenbezogene Informationen (PII) und 23 Sätze von Zugangsdaten (Credentials). Dies verdeutlicht, dass die internen Denkprozesse der Modelle weitaus mehr sensible Informationen enthalten können, als in der finalen Textausgabe sichtbar ist.

Bedeutung für die KI-Branche

Dieser Durchbruch in der Sicherheitsforschung stellt das aktuelle Vertrauensmodell von „Hidden Reasoning“ in Frage. Während Anbieter versuchen, die internen Logikschritte ihrer Modelle zu verbergen – sei es zum Schutz des geistigen Eigentums oder zur Verbesserung der Nutzererfahrung –, zeigt dieser Angriff, dass die aktuelle technische Umsetzung der Verschlüsselung unzureichend ist. Für die Branche bedeutet dies eine notwendige Überarbeitung der API-Sicherheit und der Art und Weise, wie Kontextdaten zwischen Client und Server übertragen werden, um Industriespionage und den Abfluss sensibler Daten zu verhindern.

Häufig gestellte Fragen

Frage: Was ist eine „Reasoning Trace“?

Eine Reasoning Trace ist die Abfolge von internen Gedankengängen, die ein KI-Modell durchläuft, bevor es eine endgültige Antwort generiert. Diese Schritte sind für den Nutzer normalerweise nicht sichtbar.

Frage: Welche Modelle sind von dieser Sicherheitslücke betroffen?

Die Forscher konnten den Angriff erfolgreich bei den führenden Modellen der großen Anbieter OpenAI, Anthropic und Google demonstrieren.

Frage: Welche Gefahr besteht durch das Auslesen dieser Daten?

Neben dem Diebstahl von geistigem Eigentum (wie das Modell denkt) besteht die Gefahr, dass sensible Daten wie Passwörter oder persönliche Informationen, die das Modell während des Denkprozesses verarbeitet, an die Öffentlichkeit gelangen.

Ähnliche Nachrichten

Nvidia-Chef Jensen Huang hält KI-Sorgen für übertrieben: Null Prozent Risiko laut CBS-Interview
Branchennachrichten

Nvidia-Chef Jensen Huang hält KI-Sorgen für übertrieben: Null Prozent Risiko laut CBS-Interview

In einem Interview mit CBS Sunday Morning hat Nvidia-Chef Jensen Huang die bestehenden Ängste vor künstlicher Intelligenz als übertrieben zurückgewiesen und behauptet, es bestehe eine Wahrscheinlichkeit von null Prozent für ein Untergangsszenario durch KI. Ein Bericht des Magazins The Verge von Autor Terrence O’Brien ordnet diese Aussage kritisch ein und merkt an, dass diese Haltung wenig überraschend sei. Als Person, die wirtschaftlich am stärksten vom anhaltenden KI-Boom profitieren könnte, stelle Huang seine eigene Einschätzung über die Ansichten langjähriger KI-Forschender, die sich teils seit Jahrzehnten wissenschaftlich mit den potenziellen Gefahren und Risiken der Technologie auseinandersetzen. Der Bericht hebt damit die deutliche Diskrepanz zwischen den wirtschaftlichen Interessen führender Hardware-Hersteller und den Warnungen aus der wissenschaftlichen Forschungsgemeinschaft hervor.

Cybersicherheit von Energiesystemen: Warum Menschen und nicht abtrünnige KI das größte Sicherheitsrisiko für kritische Infrastrukturen bleiben
Branchennachrichten

Cybersicherheit von Energiesystemen: Warum Menschen und nicht abtrünnige KI das größte Sicherheitsrisiko für kritische Infrastrukturen bleiben

Aktuelle aufsehenerregende Cyberangriffe schüren zunehmend die Angst vor einer außer Kontrolle geratenen künstlichen Intelligenz, die theoretisch die gesamte Menschheit vernichten könnte. Ein Bericht von Justine Calma auf The Verge verdeutlicht jedoch, dass nicht autonome KI-Systeme, sondern nach wie vor menschliche Akteure die größte Bedrohung für die Cybersicherheit unserer Energiesysteme darstellen. Kritische Infrastrukturen der Energieversorgung waren bereits vor den jüngsten Vorfällen in besorgniserregendem Maße anfällig für Cyberattacken, und dieses Sicherheitsrisiko nimmt weiter spürbar zu. Joshua Corman, Experte für öffentliche Sicherheit und Resilienz, beschreibt die Situation drastisch: Die Systeme seien schon immer leichte Beute gewesen und hätten bisher lediglich vom Wohlwollen beziehungsweise Appetit der Angreifer überlebt. Der Artikel mahnt zur Fokussierung auf bestehende Verwundbarkeiten.

Metas KI-Assistent Muse sorgt für Diskussionen: Effektive Funktionen, Mac-App und offene Fragen zur Selbstdarstellung
Branchennachrichten

Metas KI-Assistent Muse sorgt für Diskussionen: Effektive Funktionen, Mac-App und offene Fragen zur Selbstdarstellung

Meta hat mit Muse einen neuen KI-Assistenten bereitgestellt, der in der Praxis als durchaus leistungsfähig wahrgenommen wird, zugleich jedoch als unheimlich empfunden werden kann. Dieser Eindruck hängt unter anderem mit der neuen Mac-App zusammen, die weitreichende Zugriffsrechte auf zentrale Anwendungen wie Nachrichten, den Kalender und Notizen besitzt. Trotz seiner beachtlichen Fähigkeiten zeigt das System jedoch eine bemerkenswerte Schwäche: Muse ist offenbar nicht in der Lage, sich selbst und seine Funktionsweise zutreffend zu beschreiben. Auf diese Diskrepanz wies unter anderem Jason Aten, Contributing Editor beim Inc Magazine, über die Plattform Threads hin. Der Fall verdeutlicht das Spannungsfeld zwischen effektiver digitaler Assistenz und den Bedenken bezüglich Transparenz sowie Systemgrenzen bei tief ins Betriebssystem integrierten KI-Werkzeugen. Erfahren Sie hier alle wesentlichen Fakten und Hintergründe zum aktuellen Diskurs.