Anthropic指控7家中国AI实验室蒸馏Claude,专家称防不胜防
nashnova research
Anthropic发布154页报告,指控7家中国AI实验室大规模窃取Claude模型能力;安全研究者刘艺判断,反蒸馏是一场注定失败的战役,真正的博弈在商业而非技术。
什么叫"蒸馏",Anthropic到底在指控什么?
"蒸馏"(distillation)是指用一个强模型的输出去训练另一个模型——不用自己从头攒数据,直接"抄答案"来学。
Anthropic称,7家中国实验室用被盗信用卡、伪造账号和API密钥批量访问Claude,有的甚至把用户请求直接转发给Claude、或从第三方购买对话记录用于训练。
这意味着→ 指控的核心不只是"偷看答案",而是系统性、有组织地大规模提取模型能力,涉及身份伪造和数据倒卖。
这不是第一次——Anthropic之前已经出手过?
2026年2月,Anthropic就曾点名DeepSeek、月之暗面和MiniMax,称三家通过约2.4万个虚假账号与Claude交互超1600万次。
此后Anthropic加强了防线,OpenAI和谷歌也在持续识别和应对类似攻击。
用大白话说= 蒸馏不是个别事件,而是行业级别的持续攻防,几乎所有美国前沿模型公司都在应对。
三层防线是怎么运作的?
安全研究者刘艺将反蒸馏措施归纳为三层:内嵌分类器检测到提取行为直接拒绝请求;产品层压缩思维链(模型的推理过程)再输出,隐藏原始逻辑;外挂检测器监控输出与思维链的重叠度,超标就封号。
Anthropic还利用前缀缓存(prefix caching,一种复用提示词的技术)——发现哪几组提示词共享同一缓存,就能锁定背后是同一个蒸馏者。
这意味着→ 防线的核心逻辑是从调用行为反推意图:谁在短时间内大量请求、集中提取固定数据集,谁就是嫌疑人。
能抓到行为,但能证明吗?
刘艺指出,Anthropic能识别疑似蒸馏行为,却很难获得确证——"它可以指控某家公司尝试蒸馏Claude,却很难证明数据真的进入了对方的模型。"
这反映出 开源模型只公开权重(模型参数)而不公开训练数据集,从权重反推蒸馏来源在技术上极为困难。
用大白话说= 能看到有人"偷拍",但很难证明对方真把照片洗出来用了。
为什么说反蒸馏"注定失败"——真正保护的是什么?
刘艺直言:反蒸馏在技术上是"伪命题"——"模型只要让人用,就有泄露风险;只要蒸馏效率高过自己攒数据,就一定会先来蒸馏你。"
他认为反蒸馏真正保护的不是模型本身,而是建立在技术领先之上的商业价值——提高对手数据采集成本、拖慢竞争者、延长领先窗口,同时通过公开报告占领舆论、保护估值。
这意味着→ 154页报告与其说是技术文档,不如说是一份面向投资人和监管层的商业声明。
产品架构转变能不能从根本上解决问题?
同日,OpenAI正式推出Agents API公测版,将中间思维链和执行过程完全隐藏,用户只获得任务结果。
刘艺评价:"在这种场景下再想蒸馏,成本可能会更高。"——产品架构从"给你答案"变成"只给你结果",蒸馏者连可抄的内容都拿不到。
用大白话说= 这比封号、分类器更能实质性抬高蒸馏门槛,但能否真正阻断,仍是未知数。
市场有风险,内容仅供研究参考,不构成投资建议。
