返回列表
行业新闻人工智能安全大语言模型API漏洞

窃取专有LLM API推理痕迹:通过加密注入提取模型思维链

一项最新研究揭示了专有大语言模型(LLM)API的安全漏洞。研究人员发现,模型供应商返回给客户端的加密推理块具有可移植性。通过将强模型(如Claude 4.8 Opus)的加密推理块注入到同供应商的弱模型(如Claude 4.5 Haiku)中,并利用越狱手段,可以逐字提取原本隐藏的推理过程。该方法已在OpenAI、Anthropic和Google的尖端模型上得到验证。

Hacker News

核心要点

  • 漏洞机制:模型供应商将推理过程以加密块形式返回给客户端,这些加密块在对话继续时会被传回服务器。
  • 可移植性攻击:加密推理块具有可移植性,可以脱离原始上下文,被注入到同一供应商的其他模型中。
  • 跨模型提取:通过将强模型的加密块注入到已越狱的弱模型中,研究者成功实现了对强模型原始推理过程的逐字转录。
  • 广泛影响:该攻击手段已在OpenAI、Anthropic和Google等主流厂商的尖端模型中得到证实。
  • 数据泄露风险:研究中发现了数百项泄露信息,包括技术标识符、个人身份信息(PII)及凭据等。

详细分析

加密推理块的安全性缺陷

在当前的专有LLM API架构中,为了维持对话的连贯性,模型生成的推理过程(Thinking Trace)通常被封装在一个加密块中发送给用户端。当用户进行下一轮对话时,该加密块会随请求一同返回服务器。然而,研究发现这些加密块并未与特定的对话上下文或模型实例进行强绑定,这种“可移植性”成为了安全漏洞的根源。

注入与转录攻击流程

攻击者首先获取强模型(如Claude-Opus-4-8)生成的加密推理块。随后,攻击者利用一个同供应商但性能较弱且已被“越狱”的模型(如Claude-Haiku-4-5)。通过向弱模型发送特定指令(如要求其逐字抄录附加的推理内容),弱模型会解析并输出原本属于强模型的隐藏推理过程。实验显示,解码后的推理内容在Token数量上与API报告的隐藏思考Token数高度吻合。

泄露内容的统计与发现

通过对120个Codeforces问题的测试以及其他场景的尝试,研究人员收集到了大量泄露数据。在总计670个样本中,包含了351个独特的泄露项。具体包括204个技术标识符、126项个人身份信息(PII)以及23个凭据信息。这表明隐藏的推理痕迹中可能包含敏感的系统信息或用户数据。

行业影响

该研究对AI行业具有重大的警示意义。首先,它挑战了目前主流模型供应商保护知识产权和用户隐私的技术手段,证明了仅靠加密块传输推理痕迹是不够的。其次,这可能迫使OpenAI、Anthropic和Google等公司重新设计其API通信协议,以增强推理数据的隔离性和安全性。此外,这也引发了关于“隐藏推理”透明度的讨论,即模型在思考过程中究竟处理了哪些敏感信息。

常见问题

问题:什么是“加密推理块的可移植性”?

它是指模型供应商发给客户端的加密数据包可以被重新利用。攻击者可以将其从原始对话中取出,放入另一个不同的模型请求中,而服务器依然会接受并解析该数据包。

问题:这种攻击方式是否需要破解供应商的加密算法?

不需要。攻击者利用的是逻辑漏洞,即通过弱模型作为“翻译官”来读取加密内容,而不是直接破解加密算法本身。

问题:研究中发现了哪些具体的泄露信息?

研究人员发现了包括技术标识符、个人身份信息(PII)和凭据在内的多种敏感数据,这说明模型的推理痕迹中可能记录了不应公开的底层信息。

相关新闻

AI能否设计电路板?EEBench探讨GPT-6 Astra与代码化硬件设计的未来
行业新闻

AI能否设计电路板?EEBench探讨GPT-6 Astra与代码化硬件设计的未来

随着OpenAI在GPT-6 Astra演示中展示其在KiCad电路板上的操作能力,AI在电子设计领域的潜力引发广泛关注。EEBench指出,尽管AI拥有深厚的电子知识储备,但传统GUI工具的操作限制了其发挥。通过采用atopile声明式代码工具,AI可以直接处理电气约束并进行仿真,从而更有效地完成复杂的硬件设计任务。EEBench旨在通过这种方式,建立衡量AI电子设计能力的科学基准。

OpenAI发布GPT-6 Astra并宣告AGI时代降临:AI行业的新纪元与定义之争
行业新闻

OpenAI发布GPT-6 Astra并宣告AGI时代降临:AI行业的新纪元与定义之争

OpenAI正式推出了其备受期待的下一代大模型GPT-6 Astra,并高调宣布人类已正式步入“AGI(通用人工智能)时代”。这一重磅消息不仅标志着大模型技术的又一次飞跃,也引发了关于AGI定义及其社会影响的广泛争议。本文将结合《The Verge》的最新报道,深入剖析GPT-6 Astra的发布背景、OpenAI对AGI时代的定调,以及英伟达在这一浪潮中的战略扩张。

微软反击《纽约时报》版权诉讼:Copilot 极少复现原文实质内容
行业新闻

微软反击《纽约时报》版权诉讼:Copilot 极少复现原文实质内容

微软在最新的法律文件中辩称,其 AI 助手 Copilot 极少复现新闻文章或书籍中的完整句子,更无法替代原始作品。作为与《纽约时报》及相关作者版权诉讼取证过程的一部分,微软提交了 820 万次 Copilot 交互记录,旨在证明其产品在实际使用中并未发生大规模侵权行为。