GPT-6 Astra高端用户全量开放,性能数据出炉

nashnova research
今天发布阅读约 4 分钟

OpenAI在发布仅两天后就向所有高端付费用户全量开放GPT-6 Astra,基准测试显示桌面操作任务领先上代但综合智能评分仍落后Claude Fable 5.1,这意味着旗舰模型的竞争格局尚未定型。

01

为什么两天就全量放开?

9月3日分阶段发布当天,Pro用户因排队问题强烈反弹,CEO萨姆·奥特曼在X平台公开道歉,承认是一次「混乱的发布」
仅隔两天,9月5日Astra即向所有Pro、Enterprise和Business Premium用户全量开放,可在ChatGPT Work和Codex中直接调用,API同步上线
这意味着→ 这不是按计划推进,而是舆论压力下的加速回应。Plus和普通Business用户仍需再等数日。
02

Astra到底比上代强多少?

在OSWorld 2.0(模拟人类操作电脑桌面的测试)上,Astra得分72.6%,上代GPT-5.6 Sol为65.7%,提升约7个百分点。
单任务平均耗时从75分钟压缩至40分钟,准确率与速度同步提升。
用大白话说= 让AI像人一样操作电脑这件事,Astra比上代又快又准,但这只是一个维度的成绩。
03

综合评分为什么还是输Claude?

在Artificial Analysis的独立综合智能指数上,Astra得分61.2,Anthropic同周发布的Claude Fable 5.1得分65.7,差距4.5分
两项基准测的是不同维度:OSWorld测"动手操作",综合智能指数测"全面思考"。Astra在前者领先,在后者落后。
这反映出 当前AI旗舰模型的竞争已不再是单一跑分定胜负——每家都有自己的强项和短板。
04

开发者拿Astra做了什么?

开发者马特·舒默用Astra在虚幻引擎中构建曼哈顿街区场景,采用"管理者循环"架构:一个Astra实例拆任务,另一个执行,最多同时调用96个子智能体并行推进,历时一周。
开发者汤姆·克尔查向Astra输入一张蒸汽火车旧图纸,数分钟内在Blender中生成3295个可编辑对象,该演示在X平台获得逾75万次浏览
免疫学家德里亚·乌努特马兹仅输入一句指令,Astra自动完成解说、动画和图像生成,产出一段T细胞教学视频——这位研究T细胞逾35年的科学家表示,成片质量超出预期
05

为什么OpenAI建议开发者"做减法"?

随全量开放同步发布的模型指南中,OpenAI工程师维克托·努涅斯建议开发者逐一审计现有AGENTS.md和Skills文件,定性为"强烈建议"。
原因是Astra对指令的敏感度高于前代:含糊规则会触发反复确认,冲突规则会导致任务中断
用大白话说= 过去为弥补模型能力不足而堆上去的补丁式提示词,在Astra上可能反而成为干扰源。指令不是越多越好,而是越精准越好。
06

接下来看什么?

Astra综合智能评分与Claude Fable 5.1之间的4.5分差距,能否在后续版本中收窄,是判断OpenAI旗舰模型竞争力的关键节点。
这意味着→ 对投资者而言,单项跑分领先不等于产品领先;综合能力差距才是决定市场格局的变量。

市场有风险,内容仅供研究参考,不构成投资建议。

GPT-6 Astra高端用户全量开放,性能数据出炉 · nashnova