Anthropic指控7家中國AI實驗室蒸餾Claude,專家稱防不勝防
nashnova research
Anthropic發布154頁報告,指控7家中國AI實驗室大規模竊取Claude模型能力;安全研究者劉藝判斷,反蒸餾是一場注定失敗的戰役,真正的博弈在商業而非技術。
甚麼叫「蒸餾」,Anthropic到底在指控甚麼?
「蒸餾」(distillation)是指用一個強模型的輸出去訓練另一個模型——不用自己從頭收集數據,直接「抄答案」來學。
Anthropic稱,7家中國實驗室用被盜信用卡、偽造帳號和API密鑰批量存取Claude,有的甚至把用戶請求直接轉發給Claude、或從第三方購買對話記錄用於訓練。
這意味著→ 指控的核心不只是「偷看答案」,而是系統性、有組織地大規模提取模型能力,涉及身份偽造和數據倒賣。
這不是第一次——Anthropic之前已經出手過?
2026年2月,Anthropic曾點名DeepSeek、月之暗面和MiniMax,稱三家透過約2.4萬個虛假帳號與Claude交互超1600萬次。
此後Anthropic加強了防線,OpenAI和Google亦在持續識別和應對類似攻擊。
簡單來說= 蒸餾不是個別事件,而是行業級別的持續攻防,幾乎所有美國前沿模型公司都在應對。
三層防線是怎樣運作的?
安全研究者劉藝將反蒸餾措施歸納為三層:內嵌分類器偵測到提取行為直接拒絕請求;產品層壓縮思維鏈(模型的推理過程)再輸出,隱藏原始邏輯;外掛偵測器監控輸出與思維鏈的重疊度,超標即封號。
Anthropic還利用前綴緩存(prefix caching,一種複用提示詞的技術)——發現哪幾組提示詞共享同一緩存,就能鎖定背後是同一個蒸餾者。
這意味著→ 防線的核心邏輯是從調用行為反推意圖:誰在短時間內大量請求、集中提取固定數據集,誰就是嫌疑人。
能抓到行為,但能證明嗎?
劉藝指出,Anthropic能識別疑似蒸餾行為,卻很難獲得確證——「它可以指控某家公司嘗試蒸餾Claude,卻很難證明數據真的進入了對方的模型。」
這反映出 開源模型只公開權重(模型參數)而不公開訓練數據集,從權重反推蒸餾來源在技術上極為困難。
簡單來說= 能看到有人「偷拍」,但很難證明對方真把照片洗出來用了。
為甚麼說反蒸餾「注定失敗」——真正保護的是甚麼?
劉藝直言:反蒸餾在技術上是「偽命題」——「模型只要讓人用,就有洩露風險;只要蒸餾效率高過自己收集數據,就一定會先來蒸餾你。」
他認為反蒸餾真正保護的不是模型本身,而是建立在技術領先之上的商業價值——提高對手數據採集成本、拖慢競爭者、延長領先窗口,同時透過公開報告佔領輿論、保護估值。
這意味著→ 154頁報告與其說是技術文檔,不如說是一份面向投資人和監管層的商業聲明。
產品架構轉變能否從根本上解決問題?
同日,OpenAI正式推出Agents API公測版,將中間思維鏈和執行過程完全隱藏,用戶只獲得任務結果。
劉藝評價:「在這種場景下再想蒸餾,成本可能會更高。」——產品架構從「給你答案」變成「只給你結果」,蒸餾者連可抄的內容都拿不到。
簡單來說= 這比封號、分類器更能實質性抬高蒸餾門檻,但能否真正阻斷,仍是未知數。
市场有风险,内容仅供研究参考,不构成投资建议。
