下载 nashnova App

博客

从“回答问题”到“完成工作”:GPT-6 Astra 如何重估 AI 基础设施需求

9 月 4 日,美国三大股指集体下跌。道琼斯工业平均指数、标普 500 指数和纳斯达克综合指数分别收跌 0.51%、0.38% 和 0.29%。强于预期的就业报告推高了市场对利率路径的预期,并对久期较长的资产形成压力。半导体板块却逆势上涨:SOXX 涨约 3.5%,SMH 上涨 2.61%。

领涨公司的构成比板块涨幅本身更值得关注。闪迪(SNDK)上涨 11.90%,科磊(KLAC)上涨 7.32%,迈威尔科技(MRVL)上涨 7.05%,美光科技(MU)上涨 6.10%,泛林集团(LRCX)上涨 5.12%。相比之下,英伟达(NVDA)仅上涨 0.84%,博通(AVGO)仅上涨 0.21%(westock,2026 年 9 月 4 日收盘数据)。

这不是一轮由主要 GPU 公司引领的行情,也不是整个科技板块的普遍上涨。资金主要流向了存储、半导体设备和连接相关资产。

一天前,OpenAI 在发布说明中介绍了 GPT-6 Astra。该模型面向推理、编程、计算机操作、研究、文档创建和高难度端到端任务。新增能力包括异步工具调用、任务执行过程中的实时引导,以及在对话过程中调整推理强度。此次发布属于有限范围开放,并非全面公开上线。

9 月 4 日的行情可以理解为三股力量共同作用的结果。Astra 延长了市场对 AI 需求周期的预期;存储供应紧张和半导体设备行业的基本面,为行情提供了支撑;半导体板块内部向前期落后或周期性更强的公司轮动,则进一步放大了涨幅。Astra 是叙事层面的催化剂,但无法单独解释整轮行情。

盘面信息比发布事件更值得关注

如果投资者交易的只是一次规模更大的前沿模型训练,英伟达和博通理应位于涨幅榜前列。然而,当天涨幅最大的公司却是 SNDK、KLAC、MRVL、MU 和 LRCX。

这些公司分别对应三个更实际的问题:数据将存储在哪里,新增半导体产能如何建设,以及信息将如何在规模不断扩大的计算集群中传输。

闪迪和美光提供 NAND、DRAM 及企业级存储相关产品。科磊和泛林集团位于晶圆制造设备及过程控制产业链。迈威尔的数据中心业务则包括连接产品和定制芯片。

GPU 计算仍然是 AI 基础设施的核心,但当天市场边际重估的对象主要是产能、设备和互连。持仓最拥挤的计算龙头未能领涨,说明这并不是一次简单的“新模型发布,所以买入 GPU”行情。

价格走势可以显示投资者买入了什么,却不能直接证明他们为何买入。Astra 于 9 月 3 日发布,半导体板块于 9 月 4 日上涨,这一顺序只能证明时间上的先后,不能证明因果关系。

存储价格、供应限制、设备周期预期,以及相关公司在事件发生前的相对表现,也都在影响市场。将整轮行情完全归因于 Astra,会混淆短期催化剂与真正决定企业盈利的基本面因素。

Astra 同时改变了任务时长与交互界面

当模型能够以更快速度或更少 token 完成已有任务时,单次推理的成本会下降。如果降价带来的新增使用量不足以抵消效率提升,这种变化反而可能削弱基础设施需求。

Astra 更值得关注的变化,是 AI 从离散请求转向持续执行。任务可以在后台继续运行,工具调用可以异步进行,用户能够在任务执行过程中重新引导模型,模型也可以根据任务阶段动态调整推理强度。

计算机操作能力还改变了 AI 与软件系统的集成方式。

传统智能体依赖软件供应商开放的 API。每连接一个新系统,通常都需要处理身份认证、字段映射、工作流设计和后续维护。能够识别图形界面并执行鼠标、键盘操作的智能体,则可以进入没有 API、API 不完整,或正式集成成本过高的软件系统。

这并不意味着权限管理、安全控制和审计记录不再重要。它降低的是验证某项工作流能否自动化的成本。企业可以先在现有软件环境中尝试自动执行任务,再决定是否围绕正式接口重建整个流程。

对于旧式企业软件和大量长尾内部工具而言,这一差异可能直接决定自动化项目能否启动。

性能提升与能力扩张,对基础设施需求的影响并不相同。性能提升会减少模型完成已有任务所需的资源;能力扩张则会把过去不具备经济可行性的任务纳入可服务市场。

Astra 同时包含这两种变化。对于需要持续数小时、跨越多个工具并保存中间状态的任务,能力扩张对总基础设施需求的影响可能更大。

OpenAI 的发布信息还显示,Astra 拥有 105 万 token 的上下文窗口、12.8 万 token 的最大输出长度,标准 API 价格为每百万输入 token 10 美元、每百万输出 token 50 美元。

上下文窗口描述的是模型一次能够接收多少信息,并不能直接说明完成一项任务需要多少成本。缓存、摘要压缩、工具返回内容的大小、输入与输出的比例,以及服务架构,都会影响实际资源消耗。

推理消耗开始以“工作日”衡量

9 月 6 日,OpenAI 发布了其内部研究团队的使用数据。截至 8 月中旬,每一个人类工作日对应 3.1 个智能体工作日(agent-workdays)。

按照标准 API 价格折算,研究人员每日推理使用量的中位数超过 600 美元,第 90 百分位超过 7,000 美元。智能体总运行时长在 6 月之前一直低于人类工作时长,随后超过后者。8 月的实验数量也达到自 2025 年 1 月开始统计以来的最高水平。

与基于图形界面操作轨迹推算 token 消耗相比,这些数字更有参考价值。

其中的 600 美元和 7,000 美元,是按照标准 API 价格计算的内部使用等价值,并不是 OpenAI 研究人员实际支付的现金成本。在不知道输入输出比例和缓存折扣的情况下,也无法将这些金额准确换算成 token 数量。

不过,这些数据至少说明了两点:推理正在从偶发查询转向持续运行;不同研究人员之间的 AI 使用强度差异很大。

衡量 AI 使用的单位也在发生变化。

问答型产品通常可以使用日活跃用户、请求次数和单次请求成本进行评估。长时间运行的智能体,还需要统计智能体工作日、任务持续时间、并发智能体数量和人工介入次数。

总 token 数量增加,可能来自任务变长、用户增加,也可能来自失败尝试增多。如果没有以任务为单位的分母,推理量上升本身并不能说明经济效益是否改善。

OpenAI 的分析还显示,高层规划在 token 消耗中所占的比例仍然较低。大部分 token 用于执行环节,包括构建、运行、分析和提供技术支持。

智能体正在接手研究流程中的更多步骤,但这些数据尚不能证明它们已经能够独立选择正确的研究方向。

这也限制了可以从实验数量中得出的结论。实验增加可能意味着研究速度提高,也可能来自单次实验成本下降、并行度提高,或尝试一个想法的门槛降低。

要证明生产率真正提升,还需要更多指标,包括实验成功率、从提出想法到形成结论所需的时间、最终研究成果的价值,以及人类投入的监督时间。

为什么存储、设备和互连率先上涨

单轮查询的服务周期较短,需要保存的状态也较少。服务商可以通过批处理和调度,提高 GPU 的利用效率。

长时间运行的任务则需要保留更多状态,等待外部工具响应,并持续处理不断产生的中间结果。当用户同时运行多个智能体时,处于活跃状态的上下文数量也会增加。

这类工作负载提高了高带宽内存(HBM)的容量与带宽、节点间连接、企业级固态硬盘及存储输入输出的重要性。

键值缓存(KV cache)用于保存历史注意力状态。智能体的执行轨迹、检查点、中间文件、失败任务的重放数据和审计日志也都需要存储。分布在多个节点上的任务还会持续占用网络带宽。

仅根据 Astra 公布的上下文窗口,无法计算它所需要的基础设施规模。实际需求取决于模型架构、上下文压缩方式、缓存命中率、计算精度、批处理方式和服务编排。

目前公开信息不足以估算一项典型 Astra 任务需要多少内存或多少加速器。如果假设一个持续数小时的任务会把全部 token 始终保留在同一个 KV cache 中,也不符合产品公布的 105 万 token 上下文限制,以及生产推理系统管理状态的实际方式。

计算资源仍然不可或缺。更长的任务通常意味着更多推理步骤,模型能力提升也会继续推动训练投资。

9 月 4 日的市场结构,更适合被理解为对边际敏感度的重新定价。存储供应和晶圆制造产能的调整速度较慢,互连则是大型计算集群扩展过程中的主要约束之一。

当市场上调边际需求预期时,这些环节的盈利弹性可能高于计算龙头,因为后者的估值中已经包含了较高的增长预期。

根据多家媒体对发布活动的报道,一名公司研究人员表示,Astra 是第一个在得克萨斯州 Stargate 设施中使用超过 10 万块 GPU 进行预训练的模型。

多家媒体重复引用了这一说法,但 OpenAI 发布页面的正文中并没有可以直接对应的内容。因此,这一数字应被视为发布活动中公司人员的公开表述,而不是已经通过发布说明直接核实的数据。

三个智能体工作日不等于三倍生产率

智能体工作日衡量的是运行时长,而不是输出质量。

一个智能体可以运行八小时并完成一系列有价值的实验,也可能在错误路径上持续运行八小时。OpenAI 披露,在此前六个月中,即使是最终成功、持续四到八小时的任务,也有超过一半至少需要一次人工介入。

人工介入可能包括修正目标、授予访问权限、判断中间结果,或重新启动任务。OpenAI 没有披露介入后有多少任务需要回滚、多少工作需要重新执行,也没有说明有多少中间结果最终被放弃。

因此,3.1 个智能体工作日不能被描述为效率、产出或收入提高了 3.1 倍。将一个人类工作日与 3.1 个智能体工作日直接相加,并得出名义计算需求增加 4.1 倍的结论,同样缺乏依据。

运行时长与有效生产能力不是同一个概念。

自主程度与需求之间也存在两面性。更长的自主运行会提高每次尝试的资源消耗,但也可能让错误在得到纠正前持续更长时间。人工介入率下降,则意味着一个人可以同时监督更多任务。

因此,人工介入率的下降速度,将是判断推理需求能否从实验阶段进入生产环境的重要指标。

如果最长任务时长继续增加,但四到八小时任务的人工介入率仍高于 50%,企业部署仍会受到监督能力的约束。

如果介入率显著下降,即使单个任务时长没有翻倍,一个人也可能管理更多并发工作。与新的模型基准测试相比,未来关于人工介入率和单个成功任务成本的数据,对判断基础设施需求更有价值。

基础设施需求最终仍需转化为收入

从模型能力到资本开支之间,还要经过任务采用、资源消耗、基础设施利用率和现金回报等多个环节。

Astra 的产品能力和 OpenAI 内部的使用强度,都有直接披露作为支持。大规模企业采用、任务层面的经济性,以及云基础设施投资回报,目前仍存在较大不确定性。

阶段

可跟踪指标

验证标准

当前状态

任务采用

真实工作完成率和付费客户留存率的季度披露

连续多个季度稳定披露,且完成率持续提高

部分验证

推理经济性

单个成功任务成本、缓存 token 使用量、人工介入率

任务成本和介入率同时下降

仍属预期

基础设施利用率

云端 AI 收入、数据中心部署率、GPU 租赁价格

收入和利用率能够支持资本开支

部分验证

存储与设备

TrendForce 月度 DRAM/NAND 合约价格、设备订单、交付周期

价格、订单和交付周期同步走强

部分验证

资本回报

超大规模云厂商资本开支指引、折旧年限和自由现金流

资本开支增长没有导致现金回报持续恶化

仍属预期

目前缺失的最重要指标,是单个成功任务的成本。

在采用初期,总 token、运行时长和实验次数都可能快速增加。只有当完成可比任务所需的计算资源和人力成本持续下降时,使用量才能转化为可扩展的收入。

云服务商可以提前建设基础设施,但最终仍需由部署率、AI 收入和自由现金流来验证这些投资。

软件公司不会平均受益

Astra 操作现有软件界面的能力,也为按席位收费的软件即服务公司引入了新的变量。

如果一名员工能够监督多个智能体,完成过去需要多个软件用户承担的工作,客户可能会减少低价值席位。对软件公司的收入影响,取决于它们能否从按席位收费,转向按照使用量、工作流或完成结果收费。

企业软件的价值并不仅来自操作界面。

专有数据、行业工作流、监管资质、审计记录、实体履约能力和责任承担,都很难被通用计算机操作模型取代。掌握这些资产的软件供应商,可以把智能体整合进产品,并按照工作流或结果收取更高费用。

主要提供标准化界面和轻量协作功能的产品,面临的风险则更高。

界面操作能力不会消除 API。对于需要可预测行为、严格访问控制和稳定机器可读输出的高频生产工作流,API 仍然更合适。

图形界面操作更适用于长尾系统、旧式应用,以及自动化项目的实验阶段。大多数企业部署可能会在较长时间内保持混合模式。

9 月 4 日的行情表明,投资者愿意为 AI 从短时调用转向长时间执行进行定价,并将产能、设备和连接视为对这一变化更敏感的受益环节。

但这轮行情并不能证明 Astra 已经带来了相应订单,也不能证明每一个智能体工作日都能转化为有价值的产出。

利率和通胀仍然是影响估值的贴现率约束。它们不会改变长时间运行的智能体对资源的需求,却可能主导短期股票表现。产业机制与股票回报发生的时间,应当分开分析。

接下来最值得跟踪的三组数据,是四到八小时任务的人工介入率、单个成功任务成本,以及云端 AI 收入相对于资本开支的变化。

如果其中两项长期未能改善,9 月 4 日的行情将更接近一次预期重估,而不是实际需求已经兑现的证据。