GPU紧缺推高替代需求,亚马逊自研AI芯片获更多开发者采用

nashnova research
2026-05-19发布阅读约 5 分钟

据The Information报道,亚马逊自研AI芯片Trainium正在获得更多AI开发者关注。过去,Trainium主要依靠Anthropic、OpenAI等大客户锁定长期容量;现在,部分中小开发者也开始认真评估将训练或推理任务迁移到Trainium。

GPU紧缺改变选择环境

GPU供应紧张是首要推动因素,英伟达最新GPU仍面临严重排队和配额限制。多位使用或接触Trainium的人士表示,亚马逊向客户强调Trainium拥有更多可用容量,并愿意在价格上保持灵活,这让其自研芯片的吸引力开始上升。

不过,Trainium距离全面挑战英伟达仍有差距。部分开发者此前使用时曾遇到模型支持滞后、文档不足和适配成本高等问题。虽然这些问题正在快速改善,但英伟达CUDA生态的迁移壁垒短期内难以消除。亚马逊自身也未完全转向Trainium,支撑其购物业务的AI模型仍主要依赖英伟达芯片。

Trainium当前更准确定位为英伟达的补充与制衡,而非直接替代。其短期机会在于GPU紧缺、推理成本下降和AWS容量确定性;长期变量则是亚马逊能否将大客户优化经验转化为低门槛的开发者生态。

软件短板正在补齐

软件改善也是一个关键的增量。Trainium过去的最大短板不在硬件性能,而在于开发者工具、文档、模型支持及开源兼容性。英伟达凭借CUDA构建了强大软件壁垒,亚马逊必须让Neuron软件足够易用才能推动迁移。

最近几个月,这一短板已显著改善。多位客户反馈,亚马逊加强了Trainium的文档和技术支持,并提升了对主流开源工具的兼容性。去年12月推出的原生PyTorch集成,进一步降低了迁移成本——PyTorch是多数AI开发者的默认框架。

Superlinked CEO Daniel Svonava的经历具有代表性。该公司帮助企业运行AI模型,亚马逊为其提供了20万美元AWS积分用于Trainium测试。

“我们一直以来都把软件支持不足作为主要障碍,但这种情况在过去几个月里发生了改变。这个障碍已经消除了。”

推理成本优势开始显现

成本优势也开始出现在具体案例中。Loka机器学习负责人Bojan Jakimovski透露,一位客户今年早些时候将推理工作负载迁移至第二代Trainium芯片,测试显示相比英伟达H100,成本最高可降低35%。但在大语言模型训练场景,他仍优先推荐英伟达。

这说明Trainium当前最清晰的突破口仍是推理,而不是全面替代GPU训练。推理业务对单位成本和稳定容量更为敏感,若Trainium能持续证明性价比,亚马逊有望显著改善AI云业务的利润率。

亚马逊CEO Andy Jassy此前也把自研芯片和推理经济性直接联系起来。他在今年1月接受采访时表示,公司会继续购买英伟达芯片,但如果要建设收费更低、利润率可持续的大型推理业务,没有自研芯片会处于战略劣势。

大客户锁定未来产能

需求端也正在给亚马逊更强的锁量支撑。报道称,OpenAI已承诺使用约2吉瓦Trainium容量,包括Trainium3和未来Trainium4。Anthropic则承诺未来十年在AWS支出超过1000亿美元,其中包括Trainium容量。

上月底,亚马逊称Trainium2基本售罄,Trainium3接近全部认购,距离广泛可用还有约18个月的Trainium4也已有大量容量被预订。亚马逊发言人称,Trainium客户群不只包括OpenAI和Anthropic,还包括Uber和Decart等客户。

市场有风险,内容仅供研究参考,不构成投资建议。

GPU紧缺推高替代需求,亚马逊自研AI芯片获更多开发者采用 · nashnova