中國AI業界質疑Kimi K3基準造假與蒸餾爭議
N.R. Finch
月之暗面發布Kimi K3後,中國開發者社區內部出現基準刷分與蒸餾造假的詳細指控,爭議已從單一公司蔓延至整個中國大模型行業——這不只是技術糾紛,更關乎AI基準成績的可信度根基。
K3的成績單到底有多亮眼?
Kimi K3在Arena前端編程排行榜得分1679,超過Anthropic Fable 5的1631和GPT-5.6 Sol的1618。
月之暗面將K3定位為參數量2.8萬億的開放權重模型,但自己亦承認整體性能仍落後於最強閉源模型。
這意味著→ K3的賣點是「接近美國前沿」,而非「超越」——編程排行榜上的領先,尚不等於全面能力的領先。
36Kr援引的測試顯示,開發者認可K3的界面生成能力,但反映其在部分同類任務上速度較慢。
中國開發者的指控說了甚麼?
一名GitHub用戶「RainPPR」發布了一份詳細但未經獨立核實的文件,將當前中國AI行業描述為「大規模蒸餾時代」。
文件指控智谱AI的GLM團隊在2026年四五月間提取了Anthropic系統中經Fernet加密的「推理數據塊」——簡單來說=就是把別人模型藏起來的思考過程偷偷拿出來,用於訓練自己的模型。
文件還指控月之暗面通過污染評測數據、從日誌中識別評估提示詞、將部分請求路由至Fable原始模型等方式刷高基準分數。
文件稱月之暗面解散了強化學習團隊,轉而依賴監督微調,並以「架構創新」為由掩蓋對蒸餾輸出的依賴。
這些指控站得住腳嗎?
上述指控均屬嚴重性質,但沒有獨立審計證據支撐。智谱AI與月之暗面均未公開回應。
網絡上流傳的部分「Kimi自稱Claude」截圖,已有討論指出其中存在偽造內容,相關「身份污染」說法的可信度存疑。
這意味著→ 目前的局面是「有詳細指控、無硬證據」——既不能坐實造假,也無法排除嫌疑。
蒸餾本身有錯嗎?爭議的邊界在哪?
蒸餾(用一個大模型的輸出來訓練另一個小模型)本身是AI開發中的通行做法,並不違規。
爭議核心在於兩點:獲取數據的手段是否繞過了訪問限制,以及基準和產品宣傳是否如實披露了對他方系統的依賴。
RainPPR的文件還稱月之暗面、騰訊、阿里巴巴、MiniMax和DeepSeek均跟進了更大規模的蒸餾項目。這反映出爭議已從單一公司擴展至整個中國大模型行業。
高定價能撐多久?
K3的輸出價格為每百萬token 100元人民幣,較上一代Kimi K2.6高出約270%,亦高於多家中國主要競爭對手。
輸入價格為每百萬token 20元(緩存未命中)或2元(緩存命中)。
月之暗面的邏輯是:中國前沿模型即便開放權重,也應獲得合理商業回報。這意味著→ 月之暗面在賭市場願意為「接近美國水平」付高價。
但若性能優勢無法在編程之外的推理、可靠性、工具調用和延遲等維度得到驗證,高價策略能否維持用戶規模,將是K3商業可行性的關鍵考驗。
Content is for reference only, not financial advice.