Claude Fable 5以64%成功率登顶AI编程榜

Taylor Wilson
Published todayAbout 4 min read

Anthropic旗下Claude Fable 5在MirrorCode编程基准测试中以64%成功率登顶,第二名GPT-5.6 Sol仅约21%——这意味着前沿AI模型已能独立完成部分中大型软件工程任务,编程自动化的商业化拐点正在被量化验证。

01

MirrorCode到底在测什么?

MirrorCode是一项极限编程基准测试:模型被丢进一个隔离环境——没有互联网、没有原始源码、没有第三方依赖,只能看到高层文档和部分测试用例。
用大白话说=相当于把一个程序员关进小黑屋,只给他说明书和几道考试题,让他从零写出一个行为完全一致的新程序
判定标准极严:可见测试与隐藏测试必须同时100%通过,差一个边缘案例即判失败。最新榜单从25个目标程序中选取15个中大型目标,每个目标用两种语言各跑三次。
02

64% vs 21%——这个差距说明什么?

Claude Fable 5成功率64%,GPT-5.6 Sol约21%,差距超过三倍。
这意味着→在"给定明确目标、结果可自动验收"的工程场景中,Fable 5已能稳定完成近三分之二的中大型任务,而竞争模型还停留在五分之一。
这反映出前沿模型之间的编程能力已不是微调级别的差异,而是代际级分化
03

冷门语言Ada上照样能打——为什么这很重要?

Fable 5在主流语言Go上成功率64%,切换到冷门语言Ada后仍达61%,仅降3个百分点。
Ada(一种主要用于航空航天、国防等安全关键系统的编程语言)的公开训练语料极少——据StarCoder数据,Python占比约8%,Ada仅约0.034%,前者是后者的约230倍。
用大白话说=训练数据里几乎没见过Ada,但Fable 5照样能写出来。这说明它不是在"背答案",而是从逻辑层面理解程序行为。对比之下,GPT-5.5从17%跌至5%,语言一换就"露馅"。
04

一次任务最高花2600美元——值吗?

MirrorCode单次预算上限为100亿Token,最长允许连续运行7天。论文记录的最贵一次任务连续跑了19天,花费2600美元
以生物信息学工具gotree为例:原有约1.6万行Go代码和40余个命令,Claude Opus 4.7耗时14小时、花费251美元,通过了2001项测试中的2000项,完成度99.95%——仅因一个日期注释的边缘案例未达100%通关线。
Epoch AI估计人类工程师完成同等任务至少需要两周至十七周。这意味着→即使按2600美元的极端上限算,相比人类工程师数周的薪资成本,AI在"目标明确、可自动验收"的任务上已具备成本优势
05

这对AI编程的商业化意味着什么?

MirrorCode的64%成功率,是对"项目级AI委托"的一次量化验证——不是写一段函数,而是独立完成一个中大型软件项目。
这意味着→在目标明确、结果可自动验收的前提下,前沿模型已越过"辅助工具"阶段,开始触及独立交付的门槛。
但关键问题仍未解答:这一能力边界能否在更广泛、更模糊的工程场景中持续复现?从64%到可商业化部署,中间的验证路径才刚刚开始。

Content is for reference only, not financial advice.

Claude Fable 5以64%成功率登顶AI编程榜 · nashnova