Meta定制AMD芯片算力减半,研究机构批其决策文化失当

Alina Collins
Published todayAbout 5 min read
01

Meta到底要AMD砍掉什么?

Meta基础设施团队要求AMD定制一款大幅缩水的MI450X:计算单元减半,HBM内存堆叠从12层降到8层,内存容量缩水近三分之二
标准版MI450X采用2纳米制程、混合键合封装(一种让两块芯片直接贴合的工艺)、12层HBM4内存堆叠,代表当前封装与存储密度的上限。
Meta给出的理由是:这款芯片面向推荐系统,需要提高CPU与GPU的计算比例。这意味着→ Meta认为推荐系统不需要满血算力,用"够用就行"的思路来定规格。
02

为什么SemiAnalysis说这是"灾难性"决定?

做出这一决定时,Meta旗下超级智能实验室TBD Lab尚未成立。等TBD Lab上线后,这款被砍过规格的芯片对它"毫无吸引力"。
SemiAnalysis判断,TBD Lab将大幅倾向于英伟达Vera Rubin,AMD在Meta的实际出货量会因此受到严重冲击。
SemiAnalysis甚至直接呼吁AMD绕开Meta基础设施团队,与TBD Lab直接对接,推动采购标准版MI450X。用大白话说= 研究机构认为Meta自己的采购团队正在把AMD往外推,建议AMD换个人谈。
03

逾25亿美元收购Rivos,买来了什么?

Meta于2024年以逾25亿美元收购芯片公司Rivos,但据SemiAnalysis披露,内部鲜有人真正理解这笔交易的战略逻辑,推动交易的人士此后已趋于沉默。
交易结构本身埋下隐患:Rivos创始团队坚持全员打包出售,Meta被迫买下整家公司后大幅裁撤不需要的部门。现有团队管理者将Rivos工程师视为"免费人力",原有架构迅速瓦解。
收购的核心价值——Rivos的SIMT架构GPU知识产权——已随"Olympus"芯片项目取消而消失。接替方案"Phoebe"项目预计最早2028年流片,内部对其能否落地并不乐观。
人员流失同样严重:约30%的Rivos员工在近期裁员中离职,联合创始人马克·海特已离开,多名前Rivos人员在今年5月首批限制性股票归属后转投芯片初创公司Nuvacore。
04

Grand Teton和Ariel——定制化偏执的代价有多大?

Meta为H100定制的服务器Grand Teton额外增加了交换机托盘、固态硬盘和网卡,目的是为每台服务器提供更多直连存储。结果投产后,模型团队实际使用量远低于预期,该设计最终被放弃
进入Blackwell时代,Meta的定制方案Ariel将标准GB200每颗Grace CPU搭配两颗B200 GPU的配置改为一对一,GPU数量减半。SemiAnalysis测算,Ariel方案的总拥有成本比标准方案高出14%,多花的钱换来的CPU和内存恰恰是大模型团队不需要的。
Meta的GB300服务器已回归标准配置。这意味着→ Meta自己用行动否定了Ariel方案,但试错的成本已经付出。
05

文化根源在哪里?

SemiAnalysis将问题归因于Meta基础设施团队的六个月绩效考核周期:每轮淘汰最末10%至15%的员工,团队倾向于追求短期可见成果而非长期技术布局。
部分管理者热衷于推动高曝光度但快速可交付的项目,交付后迅速转向——内部称之为"粉刷门面"(window washing)。供应链团队在工程决策中话语权有限,进一步放大了问题。
这反映出一个更深层的信号:部分供应商已因Meta频繁变动方向而降低对其新项目的优先级,转而优先保障亚马逊或谷歌的需求。
随着Meta着手向外部客户出售算力,这种内部文化的代价将更加直接地暴露在市场面前——届时决策失误的成本不再只是内部消化。

Content is for reference only, not financial advice.

Meta定制AMD芯片算力减半,研究机构批其决策文化失当 · nashnova