xAI发布Grok 4.6,智能体测试跻身第一梯队,定价约为竞品一半

Nashnova编辑部
Published todayAbout 4 min read

马斯克旗下xAI发布Grok 4.6,多项智能体测试进入前沿第一梯队,API起售价仅为竞品约一半——性能追平顶级的同时,价格战已经打响。

01

Grok 4.6到底考了多少分?

在GDPVal-AA v2测试中,Grok 4.6取得1753 Elo,高于GPT-5.6 Sol Max的1728分和Claude Fable 5 Max的1741分,较上代Grok 4.5 High的1526分大幅提升。
Artificial Analysis Intelligence Index中获得61分,与GPT-5.6 Sol Max持平。
但并非全面领先:DeepSWE 1.1和Terminal-Bench v3.0中,GPT-5.6 Sol Max成绩仍高于Grok 4.6。这意味着→ Grok 4.6已跻身第一梯队,但不是"全面超越"。
02

价格便宜一半,真有这么香?

API起售价:每百万输入Token 2美元、输出6美元,另有速度更快但价格翻倍的版本。xAI称定价约为其他前沿模型的一半。
投资机构Atreides Management首席投资官加文·贝克称,Grok 4.6性能大致相当于Fable 5 Max,但输入价格低80%、输出价格低88%。分析师金·莫尼斯也指出,其价格甚至低于Sonnet 5,性能却至少处于顶级水平。
但要注意:API单价≠实际使用成本。不同模型的Token消耗量、推理强度和任务路径都不同。用大白话说="便宜一半"是标价对比,不代表每个具体任务都恰好省50%。
03

智能体能力升级在哪?

Grok 4.6经历了比上代更长的补充训练,加入了经筛选的模型生成推理数据和高质量工程数据,并改进了优化器。
核心变化:新模型在长任务中开始自主测试和验证——执行下一步之前,会先检查此前的工作。用大白话说=以前是"一口气做完再交卷",现在是"边做边自查"。
具体成绩:CursorBench v3.2达到69.9%(上代66.7%);APEX-Agents达到57.5%(上代47.1%);AA-Briefcase达到1577分(上代1313分)。
04

生态接入和后续预期?

Grok 4.6已接入Cursor、Grok Build,并通过OpenRouter、Vercel、Cloudflare等合作伙伴提供。首周在Cursor和Grok Build中提供2倍包含用量
加文·贝克预计下一代Grok 4.7将是规模明显更大的模型,可能将Cursor和SpaceX数据纳入预训练——但这是投资人判断,并非xAI官方确认的产品路线
这反映出当前沿模型能力差距收窄,价格和推理成本的平衡正成为开发者选模型的关键变量。Grok 4.6的低价策略能否转化为实质市场份额,是接下来最值得观察的验证节点。

Content is for reference only, not financial advice.

xAI发布Grok 4.6,智能体测试跻身第一梯队,定价约为竞品一半 · nashnova