GPT-6 Astra高端用戶全量開放,性能數據出爐

nashnova research
今天发布阅读约 4 分钟

OpenAI發布僅兩天後即向所有高端付費用戶全量開放GPT-6 Astra,基準測試顯示桌面操作任務領先上代但綜合智能評分仍落後Claude Fable 5.1,這意味著旗艦模型的競爭格局尚未定型。

01

為甚麼兩天就全量放開?

9月3日分階段發布當天,Pro用戶因排隊問題強烈反彈,CEO薩姆·奧特曼在X平台公開道歉,承認是一次「混亂的發布」
僅隔兩天,9月5日Astra即向所有Pro、Enterprise和Business Premium用戶全量開放,可在ChatGPT Work和Codex中直接調用,API同步上線
這意味著→ 這不是按計劃推進,而是輿論壓力下的加速回應。Plus和普通Business用戶仍需再等數日。
02

Astra到底比上代強多少?

在OSWorld 2.0(模擬人類操作電腦桌面的測試)上,Astra得分72.6%,上代GPT-5.6 Sol為65.7%,提升約7個百分點。
單任務平均耗時從75分鐘壓縮至40分鐘,準確率與速度同步提升。
簡單來說= 讓AI像人一樣操作電腦這件事,Astra比上代又快又準,但這只是一個維度的成績。
03

綜合評分為甚麼還是輸Claude?

在Artificial Analysis的獨立綜合智能指數上,Astra得分61.2,Anthropic同周發布的Claude Fable 5.1得分65.7,差距4.5分
兩項基準測的是不同維度:OSWorld測「動手操作」,綜合智能指數測「全面思考」。Astra在前者領先,而在後者落後。
這反映出 當前AI旗艦模型的競爭已不再是單一跑分定勝負——每家都有自己的強項和短板。
04

開發者拿Astra做了甚麼?

開發者馬特·舒默用Astra在虛幻引擎中構建曼哈頓街區場景,採用「管理者循環」架構:一個Astra實例拆任務,另一個執行,最多同時調用96個子智能體並行推進,歷時一周。
開發者湯姆·克爾查向Astra輸入一張蒸汽火車舊圖紙,數分鐘內在Blender中生成3295個可編輯對象,該演示在X平台獲得逾75萬次瀏覽
免疫學家德里亞·烏努特馬茲僅輸入一句指令,Astra自動完成解說、動畫和圖像生成,產出一段T細胞教學影片——這位研究T細胞逾35年的科學家表示,成片質素超出預期
05

為甚麼OpenAI建議開發者「做減法」?

隨全量開放同步發布的模型指南中,OpenAI工程師維克托·努涅斯建議開發者逐一審計現有AGENTS.md和Skills文件,定性為「強烈建議」。
原因是Astra對指令的敏感度高於前代:含糊規則會觸發反覆確認,衝突規則會導致任務中斷
說白了= 過去為彌補模型能力不足而堆上去的補丁式提示詞,在Astra上可能反而成為干擾源。指令不是越多越好,而是越精準越好。
06

接下來看甚麼?

Astra綜合智能評分與Claude Fable 5.1之間的4.5分差距,能否在後續版本中收窄,是判斷OpenAI旗艦模型競爭力的關鍵節點。
這意味著→ 對投資者而言,單項跑分領先不等於產品領先;綜合能力差距才是決定市場格局的變量。

市场有风险,内容仅供研究参考,不构成投资建议。

GPT-6 Astra高端用戶全量開放,性能數據出爐 · nashnova