OpenAI發布GPT-5.6構建者指南,最小模型成本降25倍

Nashnova编辑部
Published todayAbout 3 min read

OpenAI發佈GPT-5.6構建者指南,最小模型Luna在關鍵測試中逼近三個月前旗艦水平,成本卻從33美元降至1.33美元——AI推理的價格門檻正被快速壓平。

01

成本降了25倍,究竟發生了甚麼?

Luna是GPT-5.6家族中最小的模型。在BrowseComp測試中取得84.04%,僅比三個月前旗艦GPT-5.5的84.36%低0.32個百分點。
但完成同一測試的總花費從33.27美元降到1.33美元,壓縮約25倍
這意味著→ 三個月前只有旗艦才做到的事,現在最小型號就能做,而且幾乎不花錢。簡單來說= 以前要開大貨車才拉得動的貨,現在電動三輪車就夠了。
02

Sol在高難度測試上跳漲,靠的是甚麼?

ARC-AGI-3(將AI放進從未見過的2D遊戲場景,要求它自行摸索規則的測試)是目前頂尖模型尚未突破50%的高難度基準。
GPT-5.6 Sol此前在官方榜單只得7.8%,原因是官方測試框架會在每步推理後清空模型的內部思考過程,並從最舊內容開始截斷上下文。
研究員伊蘭·比吉奧泰德·桑德斯換用Responses API,開啟「推理保留」和「壓縮」功能後,得分跳至38.3%,同時輸出Token減少6倍
這意味著→ 分數暴漲不是模型變聰明了,而是之前的測試方式把它的「思考筆記」反覆擦掉,換了方式就釋放出已有的能力。
03

三種慳錢部署法,各省在哪?

程序化工具調用:模型直接寫代碼在沙箱裡批量執行工具,毋須逐次來回交互。金融研究公司Rogo實測顯示,質量持平,輸入Token用量減少21%
原生多智能體架構:主模型將任務拆分給多個子模型並行處理。ChatGPT的Ultra檔默認跑四個智能體同時運行。產品公司Obvious聯合創辦人喬恩·貝爾表示,同時提交六份需求,模型邊寫邊搭邊討論,全程穩定。
提示詞緩存:緩存有效期延長至至少30分鐘,支持自定義斷點。AI公司Ploy對一段29,000 token的共享提示詞設斷點後,未命中緩存的輸入減少28%
04

Ultrafast模式:快14倍,但取捨真的消除了嗎?

OpenAI同日發佈Ultrafast模式預覽版,GPT-5.6 Sol最高可達每秒750個Token,速度提升最多14倍,已在API上線。
此前行業默認存在一個取捨——要實時響應速度,就得換小模型、犧牲智能水平。Ultrafast聲稱在維持Sol智能的同時實現高速輸出。
這反映出 OpenAI正試圖同時壓低成本和延遲兩個維度,但這一取捨是否真正消除,仍有待開發者大規模實測驗證。

Content is for reference only, not financial advice.