Zurück zur Übersicht
BranchennachrichtenKI-SicherheitLLMCybersecurity

Sicherheitslücke bei KI-Modellen: Forscher extrahieren verborgene Gedankengänge aus proprietären APIs

Ein neuer Forschungsbericht mit dem Titel „Stealing Reasoning Traces from Proprietary LLM APIs“ deckt eine kritische Schwachstelle bei führenden KI-Anbietern wie OpenAI, Anthropic und Google auf. Durch eine Methode namens „Encrypted Thought Injection“ ist es möglich, die eigentlich verborgenen Denkprozesse (Reasoning Traces) leistungsstarker Modelle zu stehlen. Dabei werden verschlüsselte Datenblöcke, die normalerweise nur zur Fortführung von Konversationen dienen, in schwächere, manipulierte Modelle injiziert. Diese geben die internen Überlegungen des Ursprungsmodells daraufhin im Klartext aus. Die Analyse zeigt, dass die extrahierten Daten exakt mit der Anzahl der vom System gemeldeten „Thinking Tokens“ übereinstimmen. Bei den Untersuchungen wurden zudem hunderte technische Identifikatoren sowie sensible Informationen wie PII und Zugangsdaten in den Datenströmen entdeckt.

Hacker News

Die wichtigsten Punkte

  • Neue Angriffsmethode entdeckt: Forscher demonstrieren, wie verborgene Denkprozesse (Reasoning Traces) aus geschlossenen KI-APIs extrahiert werden können.
  • Ausnutzung der Portabilität: Verschlüsselte Gedankenblöcke können aus ihrem ursprünglichen Kontext gerissen und in andere Modelle injiziert werden.
  • Betroffene Anbieter: Die Schwachstelle wurde bei Modellen von OpenAI, Anthropic und Google nachgewiesen.
  • Datenleck-Risiko: Neben den Denkprozessen wurden technische Identifikatoren, personenbezogene Daten (PII) und Anmeldedaten in den Traces gefunden.
  • Präzise Rekonstruktion: Die extrahierten Texte entsprechen exakt der Anzahl der vom System angegebenen verborgenen Token.

Analyse

Die Mechanik der „Encrypted Thought Injection“

Moderne KI-Anbieter senden die internen Gedankengänge eines Modells oft als verschlüsselten Block an den Client zurück. Dieser Block wird bei einer Fortsetzung der Konversation wieder an den Server gesendet, um den Kontext zu wahren. Die Forschung zeigt nun, dass diese Blöcke „portabel“ sind. Das bedeutet, ein verschlüsselter Gedankenblock eines hochleistungsfähigen Modells (wie Claude 4 Opus) kann abgefangen und in ein schwächeres, durch einen Jailbreak manipuliertes Modell (wie Claude Haiku) eingespeist werden. Das schwächere Modell fungiert dabei als Entschlüsselungswerkzeug und gibt die ursprünglichen, geheimen Gedankengänge wortwörtlich im Klartext aus.

Umfang und gefundene Daten

Die Untersuchung basierte unter anderem auf der Lösung von 120 Codeforces-Problemen. Dabei korrelierte die Länge der dekodierten Texte präzise mit der Anzahl der „Hidden Thinking Tokens“, die von der API gemeldet wurden. Besonders besorgniserregend ist die Art der extrahierten Informationen. In den über 6.700 gesammelten Datenpunkten fanden die Forscher 351 eindeutige geleakte Elemente, darunter 204 technische Identifikatoren, 126 personenbezogene Informationen (PII) und 23 Sätze von Zugangsdaten (Credentials). Dies verdeutlicht, dass die internen Denkprozesse der Modelle weitaus mehr sensible Informationen enthalten können, als in der finalen Textausgabe sichtbar ist.

Bedeutung für die KI-Branche

Dieser Durchbruch in der Sicherheitsforschung stellt das aktuelle Vertrauensmodell von „Hidden Reasoning“ in Frage. Während Anbieter versuchen, die internen Logikschritte ihrer Modelle zu verbergen – sei es zum Schutz des geistigen Eigentums oder zur Verbesserung der Nutzererfahrung –, zeigt dieser Angriff, dass die aktuelle technische Umsetzung der Verschlüsselung unzureichend ist. Für die Branche bedeutet dies eine notwendige Überarbeitung der API-Sicherheit und der Art und Weise, wie Kontextdaten zwischen Client und Server übertragen werden, um Industriespionage und den Abfluss sensibler Daten zu verhindern.

Häufig gestellte Fragen

Frage: Was ist eine „Reasoning Trace“?

Eine Reasoning Trace ist die Abfolge von internen Gedankengängen, die ein KI-Modell durchläuft, bevor es eine endgültige Antwort generiert. Diese Schritte sind für den Nutzer normalerweise nicht sichtbar.

Frage: Welche Modelle sind von dieser Sicherheitslücke betroffen?

Die Forscher konnten den Angriff erfolgreich bei den führenden Modellen der großen Anbieter OpenAI, Anthropic und Google demonstrieren.

Frage: Welche Gefahr besteht durch das Auslesen dieser Daten?

Neben dem Diebstahl von geistigem Eigentum (wie das Modell denkt) besteht die Gefahr, dass sensible Daten wie Passwörter oder persönliche Informationen, die das Modell während des Denkprozesses verarbeitet, an die Öffentlichkeit gelangen.

Ähnliche Nachrichten

Agency-Agents: Eine vollständige KI-Experten-Agentur für spezialisierte Workflows und professionelle Ergebnisse
Branchennachrichten

Agency-Agents: Eine vollständige KI-Experten-Agentur für spezialisierte Workflows und professionelle Ergebnisse

Das neue GitHub-Projekt „agency-agents“ von msitarzewski stellt ein umfassendes System spezialisierter KI-Agenten vor, das als virtuelle Agentur fungiert. Die Plattform bietet eine Vielzahl von Expertenprofilen, die von Frontend-Entwicklern bis hin zu Community-Managern für Reddit reichen. Jeder Agent ist mit einer spezifischen Persönlichkeit, definierten Prozessen und dem Ziel ausgestattet, professionelle Ergebnisse zu liefern. Besonders hervorzuheben ist die Kombination aus kreativen Impulsgebern und kritischen Prüfinstanzen, die eine ausgewogene Projektentwicklung ermöglichen sollen. Das Projekt zielt darauf ab, komplexe Aufgaben durch ein koordiniertes Team aus KI-Spezialisten zu lösen, die über die Fähigkeiten einfacher Chatbots hinausgehen und reife Projektergebnisse (Deliverables) produzieren.

Semantica: Graph-native Infrastruktur für kontextorientierte und rückverfolgbare KI-Systeme veröffentlicht
Branchennachrichten

Semantica: Graph-native Infrastruktur für kontextorientierte und rückverfolgbare KI-Systeme veröffentlicht

Das Projekt Semantica von semantica-agi stellt eine spezialisierte, graph-native Infrastruktur vor, die gezielt für die Entwicklung von kontextbezogenen und rückverfolgbaren KI-Systemen konzipiert wurde. In einer Zeit, in der die Transparenz und der inhaltliche Zusammenhang von KI-Entscheidungen immer wichtiger werden, bietet Semantica eine technologische Basis, die Datenbeziehungen nativ abbildet. Die Architektur zielt darauf ab, die Grundlage für fortgeschrittene KI-Anwendungen (AGI) zu legen, indem sie die Rückverfolgbarkeit von Prozessen direkt in der Infrastrukturschicht verankert. Damit adressiert das Projekt zentrale Herausforderungen bei der Erstellung komplexer, kontextbewusster KI-Modelle.

ChatGPT und Gemini erreichen historischen Meilenstein: Jeweils über eine Milliarde Nutzer weltweit
Branchennachrichten

ChatGPT und Gemini erreichen historischen Meilenstein: Jeweils über eine Milliarde Nutzer weltweit

In einem bemerkenswerten Wendepunkt für die Technologiebranche haben sowohl ChatGPT von OpenAI als auch Gemini von Google die Marke von einer Milliarde monatlichen Nutzern überschritten. Google-CEO Sundar Pichai gab bekannt, dass Gemini das am schnellsten wachsende Produkt in der Geschichte des Unternehmens ist und sich nun in die Riege der 14 Google-Dienste einreiht, die diesen massiven Meilenstein erreicht haben. Während Google diesen Erfolg feiert, unterstreicht die Tatsache, dass ChatGPT diesen Punkt ebenfalls erreicht hat, den intensiven Wettbewerb im Bereich der generativen KI. Dieser Bericht analysiert die Bedeutung dieses Wachstums und die Positionierung der beiden führenden KI-Plattformen im globalen Markt auf Basis der aktuellen Meldungen von The Verge.