OpenAI发布GPT-5.6构建者指南,最小模型成本降25倍
Nashnova编辑部
OpenAI发布GPT-5.6构建者指南,其最小模型Luna在关键测试中逼近三个月前旗舰水平,成本却从33美元降至1.33美元——AI推理的价格门槛正在被快速压平。
成本降了25倍,到底发生了什么?
Luna是GPT-5.6家族中最小的模型。在BrowseComp测试中,它拿到84.04%,仅比三个月前旗舰GPT-5.5的84.36%低0.32个百分点。
但完成同一测试的总花费从33.27美元降到1.33美元,压缩约25倍。
这意味着→ 三个月前只有旗舰才能做的事,现在最小号就能做,而且几乎不花钱。用大白话说= 以前开大卡车才能拉的货,现在电动三轮就够了。
Sol在高难度测试上跳涨,靠的是什么?
ARC-AGI-3(一个把AI扔进没见过的2D游戏里、让它自己摸规则的测试)是目前顶尖模型尚未突破50%的高难度基准。
GPT-5.6 Sol此前在官方榜单只得7.8%,原因是官方测试框架会在每一步推理后清空模型的内部思考过程,并从最旧内容开始截断上下文。
研究员伊兰·比吉奥和泰德·桑德斯换用Responses API,开启「推理保留」和「压缩」功能后,得分跳到38.3%,同时输出Token减少6倍。
这意味着→ 分数暴涨不是模型变聪明了,而是之前的测试方式把它的"思考笔记"反复擦掉,换了方式就释放出已有的能力。
三种省钱部署法,各省在哪?
程序化工具调用:模型直接写代码在沙箱里批量跑工具,不用一次次来回交互。金融研究公司Rogo实测显示,质量持平,输入Token用量减少21%。
原生多智能体架构:主模型把任务拆给多个子模型并行处理。ChatGPT的Ultra档默认跑四个智能体同时运行。产品公司Obvious联合创始人乔恩·贝尔称,同时提交六份需求,模型边写边搭边讨论,全程稳定。
提示词缓存:缓存有效期延长至至少30分钟,支持自定义断点。AI公司Ploy对一段29,000 token的共享提示词设断点后,未命中缓存的输入减少28%。
Ultrafast模式:快14倍,但取舍真消除了吗?
OpenAI同日发布Ultrafast模式预览版,GPT-5.6 Sol最高可达每秒750个Token,速度提升最多14倍,已在API上线。
此前行业默认存在一个取舍——要实时响应速度,就得换小模型、牺牲智能水平。Ultrafast声称在维持Sol智能的同时实现高速输出。
这反映出 OpenAI正试图同时压低成本和延迟两个维度,但这一取舍是否真正消除,仍有待开发者大规模实测验证。
Content is for reference only, not financial advice.