xAI發布Grok 4.6,智能體測試躋身第一梯隊,定價約為競品一半
Nashnova编辑部
馬斯克旗下xAI發布Grok 4.6,多項智能體測試進入前沿第一梯隊,API起售價僅為競品約一半——性能追平頂級的同時,價格戰已經打響。
Grok 4.6到底考了多少分?
在GDPVal-AA v2測試中,Grok 4.6取得1753 Elo,高於GPT-5.6 Sol Max的1728分和Claude Fable 5 Max的1741分,較上代Grok 4.5 High的1526分大幅提升。
Artificial Analysis Intelligence Index中獲得61分,與GPT-5.6 Sol Max持平。
但並非全面領先:DeepSWE 1.1和Terminal-Bench v3.0中,GPT-5.6 Sol Max成績仍高於Grok 4.6。這意味著→ Grok 4.6已躋身第一梯隊,但不是「全面超越」。
價錢便宜一半,真有這麼抵?
API起售價:每百萬輸入Token 2美元、輸出6美元,另有速度更快但價格翻倍的版本。xAI稱定價約為其他前沿模型的一半。
投資機構Atreides Management首席投資官加文·貝克稱,Grok 4.6性能大致相當於Fable 5 Max,但輸入價格低80%、輸出價格低88%。分析師金·莫尼斯亦指出,其價格甚至低於Sonnet 5,性能卻至少處於頂級水平。
但要留意:API單價≠實際使用成本。不同模型的Token消耗量、推理強度和任務路徑各有差異。簡單來說=「便宜一半」是標價對比,不代表每個具體任務都恰好慳50%。
智能體能力升級在哪?
Grok 4.6經歷了比上代更長的補充訓練,加入了經篩選的模型生成推理數據和高質量工程數據,並改進了優化器。
核心變化:新模型在長任務中開始自主測試和驗證——執行下一步之前,會先檢查此前的工作。簡單來說=以前是「一口氣做完再交卷」,現在是「邊做邊自查」。
具體成績:CursorBench v3.2達到69.9%(上代66.7%);APEX-Agents達到57.5%(上代47.1%);AA-Briefcase達到1577分(上代1313分)。
生態接入和後續預期?
Grok 4.6已接入Cursor、Grok Build,並通過OpenRouter、Vercel、Cloudflare等合作夥伴提供。首週在Cursor和Grok Build中提供2倍包含用量。
加文·貝克預計下一代Grok 4.7將是規模明顯更大的模型,可能將Cursor和SpaceX數據納入預訓練——但這是投資人判斷,並非xAI官方確認的產品路線。
這反映出當前沿模型能力差距收窄,價格和推理成本的平衡正成為開發者選模型的關鍵變量。Grok 4.6的低價策略能否轉化為實質市場份額,是接下來最值得觀察的驗證節點。
Content is for reference only, not financial advice.