中国AI业界质疑Kimi K3基准造假与蒸馏争议
N.R. Finch
月之暗面发布Kimi K3后,中国开发者社区内部出现基准刷分与蒸馏造假的详细指控,争议已从单一公司蔓延至整个中国大模型行业——这不只是技术纠纷,更关乎AI基准成绩的可信度根基。
K3的成绩单到底有多亮眼?
Kimi K3在Arena前端编程排行榜得分1679,超过Anthropic Fable 5的1631和GPT-5.6 Sol的1618。
月之暗面将K3定位为参数量2.8万亿的开放权重模型,但自己也承认整体性能仍落后于最强闭源模型。
这意味着→ K3的卖点是"接近美国前沿",而非"超越"——编程排行榜上的领先,尚不等于全面能力的领先。
36Kr援引的测试显示,开发者认可K3的界面生成能力,但反映其在部分同类任务上速度较慢。
中国开发者的指控说了什么?
一名GitHub用户"RainPPR"发布了一份详细但未经独立核实的文件,将当前中国AI行业描述为"大规模蒸馏时代"。
文件指控智谱AI的GLM团队在2026年四五月间提取了Anthropic系统中经Fernet加密的"推理数据块"——用大白话说=就是把别人模型藏起来的思考过程偷偷拿出来,用于训练自己的模型。
文件还指控月之暗面通过污染评测数据、从日志中识别评估提示词、将部分请求路由至Fable原始模型等方式刷高基准分数。
文件称月之暗面解散了强化学习团队,转而依赖监督微调,并以"架构创新"为由掩盖对蒸馏输出的依赖。
这些指控站得住脚吗?
上述指控均属严重性质,但没有独立审计证据支撑。智谱AI与月之暗面均未公开回应。
网络上流传的部分"Kimi自称Claude"截图,已有讨论指出其中存在伪造内容,相关"身份污染"说法的可信度存疑。
这意味着→ 目前的局面是"有详细指控、无硬证据"——既不能坐实造假,也无法排除嫌疑。
蒸馏本身有错吗?争议的边界在哪?
蒸馏(用一个大模型的输出来训练另一个小模型)本身是AI开发中的通行做法,并不违规。
争议核心在于两点:获取数据的手段是否绕过了访问限制,以及基准和产品宣传是否如实披露了对他方系统的依赖。
RainPPR的文件还称月之暗面、腾讯、阿里巴巴、MiniMax和DeepSeek均跟进了更大规模的蒸馏项目。这反映出争议已从单一公司扩展至整个中国大模型行业。
高定价能撑多久?
K3的输出价格为每百万token 100元人民币,较上一代Kimi K2.6高出约270%,也高于多家中国主要竞争对手。
输入价格为每百万token 20元(缓存未命中)或2元(缓存命中)。
月之暗面的逻辑是:中国前沿模型即便开放权重,也应获得合理商业回报。这意味着→ 月之暗面在赌市场愿意为"接近美国水平"付高价。
但如果性能优势无法在编程之外的推理、可靠性、工具调用和延迟等维度得到验证,高价策略能否维持用户规模,将是K3商业可行性的关键考验。
Content is for reference only, not financial advice.