Claude Fable 5以64%成功率登頂AI程式設計榜
Taylor Wilson
Anthropic旗下Claude Fable 5在MirrorCode編程基準測試中以64%成功率登頂,第二名GPT-5.6 Sol僅約21%——這意味著前沿AI模型已能獨立完成部分中大型軟件工程任務,編程自動化的商業化拐點正被量化驗證。
MirrorCode到底在測甚麼?
MirrorCode是一項極限編程基準測試:模型被丟進一個隔離環境——沒有互聯網、沒有原始源碼、沒有第三方依賴,只能看到高層文檔和部分測試用例。
簡單來說=等於把一個程式員關進小黑屋,只給他說明書和幾道考試題,讓他從零寫出一個行為完全一致的新程式。
判定標準極嚴:可見測試與隱藏測試必須同時100%通過,差一個邊緣案例即判失敗。最新榜單從25個目標程式中選取15個中大型目標,每個目標用兩種語言各跑三次。
64% vs 21%——這個差距說明甚麼?
Claude Fable 5成功率64%,GPT-5.6 Sol約21%,差距超過三倍。
這意味著→在「給定明確目標、結果可自動驗收」的工程場景中,Fable 5已能穩定完成近三分之二的中大型任務,而競爭模型還停留在五分之一。
這反映出前沿模型之間的編程能力已不是微調級別的差異,而是代際級分化。
冷門語言Ada上照樣能打——為甚麼這很重要?
Fable 5在主流語言Go上成功率64%,切換到冷門語言Ada後仍達61%,僅降3個百分點。
Ada(一種主要用於航空航天、國防等安全關鍵系統的編程語言)的公開訓練語料極少——據StarCoder數據,Python佔比約8%,Ada僅約0.034%,前者是後者的約230倍。
說白了=訓練數據裡幾乎沒見過Ada,但Fable 5照樣寫得出來。這說明它不是在「背答案」,而是從邏輯層面理解程式行為。對比之下,GPT-5.5從17%跌至5%,語言一換就「露餡」。
一次任務最高花2600美元——值唔值?
MirrorCode單次預算上限為100億Token,最長允許連續運行7天。論文記錄的最貴一次任務連續跑了19天,花費2600美元。
以生物信息學工具gotree為例:原有約1.6萬行Go代碼和40餘個命令,Claude Opus 4.7耗時14小時、花費251美元,通過了2001項測試中的2000項,完成度99.95%——僅因一個日期註釋的邊緣案例未達100%通關線。
Epoch AI估計人類工程師完成同等任務至少需要兩周至十七周。這意味著→即使按2600美元的極端上限算,相比人類工程師數周的薪資成本,AI在「目標明確、可自動驗收」的任務上已具備成本優勢。
這對AI編程的商業化意味著甚麼?
MirrorCode的64%成功率,是對「項目級AI委託」的一次量化驗證——不是寫一段函數,而是獨立完成一個中大型軟件項目。
這意味著→在目標明確、結果可自動驗收的前提下,前沿模型已越過「輔助工具」階段,開始觸及獨立交付的門檻。
但關鍵問題仍未解答:這一能力邊界能否在更廣泛、更模糊的工程場景中持續複現?從64%到可商業化部署,中間的驗證路徑才剛剛開始。
Content is for reference only, not financial advice.