长久以来,OpenAI、Anthropic、谷歌三大 AI 巨头都将模型内部思维链(CoT 推理轨迹) 视作核心护城河。为防止竞品通过 API 逆向蒸馏自家大模型,厂商统一将模型思考过程加密封装,仅对外返回最终答案,加密推理块交由客户端存储,以此兼顾知识产权保护与服务器存储成本。
但一篇刚发布的学术论文《Stealing Reasoning Traces from Proprietary LLM APIs》(arXiv:2608.09867)彻底击碎了行业的安全幻觉:无需破解加密算法、无需入侵厂商服务器,仅通过普通 API 调用、几百美元成本,就能完整扒出旗舰模型隐藏的全部思考逻辑,同时衍生出模型蒸馏、大规模隐私泄露、安全越狱、隐形恶意注入四大高危攻击向量,直接动摇闭源大模型的商业与安全根基。
本文结合论文原文、行业公开测试数据,完整拆解漏洞原理、四类攻击危害、背后行业争议与厂商修复方案。
一、厂商加密思维链的底层设计:看似完美,实则存在致命架构缺陷
1. 厂商的加密防护逻辑
GPT、Claude Opus、Gemini Pro 等高阶模型处理复杂问题时,会先生成完整推理过程(思维链),再输出精简答案。为避免竞争对手直接获取推理逻辑复刻模型,2026 年起三家厂商同步上线隐藏推理机制:
研究团队爬取 GitHub、Hugging Face 公开开发者会话日志,累计采集 315320 条加密推理块,批量解码后挖出海量敏感信息:
367 条用户身份信息(姓名、身份证、住址、银行卡);
182 类权限凭证:62 个可用 API 密钥、33 组账号密码、30 条私人邮箱、24 个访问令牌、7 份私钥。
最危险的场景:大量敏感内容仅存在加密思维链中,对外明文输出已做脱敏处理。举例:开发者让 AI 清理代码中的密钥,最终回复已将密钥打码隐藏,但模型内部思考过程完整留存原始密钥;开发者公开对话日志时,完全忽略加密推理块携带明文凭证,造成不可逆泄露。普通用户无法自主清洗、解密推理块,隐私风险完全不可控。
(三)安全越狱:绕过对齐防护,提取模型内部有害推演逻辑
当下自动化 AI 智能体、多任务工作流普遍依赖加密推理块保存任务中间状态。攻击者可提前在加密推理块内植入隐形恶意指令(例如静默上传本地文件、篡改输出结果、跳转恶意接口),再将包含载荷的推理块公开分享。
其他开发者导入该推理块接续任务时,模型会自动执行隐藏恶意指令,全程无任何明文提示、日志无痕迹留存,相当于给 AI 工作流植入看不见的病毒,对企业自动化 Agent 业务形成毁灭性安全隐患。
四、研究团队背景:非大厂自研,漏洞披露时间线耐人寻味
本次论文由三大机构联合发布:MATS Research、德国图宾根大学、马克斯・普朗克智能系统研究所,外加第三方 AI 安全公司 Snyk,并非 OpenAI、Anthropic、谷歌内部团队。
漏洞曝光背后存在行业疑点:密码学家 Matthew Green 早在 2026 年 5 月就向厂商反馈推理块跨会话重放风险,但三家厂商初期均判定风险可控、未紧急修复;直到研究团队完整复现规模化攻击、形成可落地论文后,厂商才批量上线补丁。
行业长期存在传闻:头部 AI 厂商之间早已通过 API 互相抓取推理痕迹,只是此前缺少低成本、可规模化的成熟方案。本次漏洞曝光后,极低的攻击成本、极高的商业收益,让跨厂商蒸馏行为几乎无法监管。
五、厂商修复方案与长期根治思路
闭源模型依靠推理能力构建的技术壁垒,在低成本 API 攻击下极易突破,开源模型追赶的技术门槛持续降低;
开发者、企业使用 AI 接口、公开会话日志时,必须警惕加密推理块携带的隐形敏感数据,公开发布前需完整清理推理缓存。
结语
这篇论文撕开了 AI 行业心照不宣的秘密:厂商加密隐藏的模型思维链并非绝对安全。几百元成本即可完成蒸馏、批量窃取隐私、突破安全限制,暴露出当前闭源大模型架构设计的底层缺陷。
尽管厂商已紧急修复本次漏洞,但同类跨上下文、跨模型重放类安全隐患仍有复发可能。对于 AI 从业者、开发者而言,既要重视接口调用带来的知识产权风险,也要规范会话日志、推理缓存的对外分享流程,规避隐私泄露与恶意注入双重风险。