Jeff Dean:推理硬件是AI普及下一关键瓶颈
Taylor Wilson
谷歌首席科学家杰夫·迪恩称,AI智能体能力已超预期,但制约大规模普及的核心瓶颈正从模型能力转向推理硬件效率——若延迟能降低50倍,将催生全新应用形态。
迪恩说AI进展超预期,超在哪里?
他去年判断"AI已达初级工程师水平",现在确认基本准确,部分维度甚至更快。
关键超预期点:基于智能体的系统已能连续运行数天甚至数周,完成极为复杂的任务。这意味着→ AI不再是"问一句答一句"的工具,而是能独立执行长周期项目的系统。
迪恩认为市场普遍低估了这一点——"这将是一件影响很大的事"。
为什么说推理硬件是下一个瓶颈?
迪恩将问题定义得很清楚:模型能力已经不是最大制约,推理硬件的效率才是。
他用一个历史类比说明:2001年他主导将谷歌搜索索引从硬盘迁到内存,硬件架构的跃迁直接决定了产品能力的上限。用大白话说= 模型再聪明,跑得慢、耗能高,用户体验和成本都过不了关。
他提出一个量化标杆:若推理延迟能降低50倍,将从根本上改变AI产品的边界,催生目前无法实现的应用形态。
硬件层面的能耗差距有多夸张?
迪恩指出一个底层事实:把数据从高带宽内存(HBM,加速器芯片旁边的高速存储)搬到处理器,消耗的能量是实际做一次乘法运算的上千倍。
这意味着→ 当前AI系统的能耗大头不在"算",而在"搬数据"。这直接决定了为什么要做批处理、为什么系统架构如此复杂。
他给出两个优化方向:一是尽量减少数据搬运,二是用极低精度运算,把所需精度直接内建到硬件中。用大白话说= 少搬、轻算,从物理层解决问题。
"上下文工程"是什么,为什么小团队有机会?
迪恩指出,AI进步的驱动力正在转向:不再只是"更大模型、更多数据",而是模型之外的系统工程——检索、工具调用、记忆管理、智能体编排,业界称之为上下文工程(context engineering,围绕模型搭建的整套辅助系统)。
这反映出一个结构性变化:门槛降了。"以前训练模型需要海量GPU和数据,但做上下文工程,你只需要一个类似Gemini的API接口,"迪恩说。
用大白话说= 小团队不用自己造发动机,拿现成的发动机,在外围搭系统,就能做出差异化产品。
智能体容易"脱轨",怎么解决?
智能体执行超过三四十步后容易偏离目标,这是当前普遍难题。
迪恩给出两类策略:一是给模型提供技能和提示,让它尽量走熟悉的路径;二是用多智能体架构——让另一个模型对多条路径进行评估和筛选。
这意味着→ 解决方案不是让单个模型更强,而是用系统设计来约束和纠偏。
创业者该去哪里找机会?
迪恩的筛选标准很明确:找当前通用模型成功率接近0%或1%的问题,而非20%。后者意味着通用模型正在快速追赶,窗口期很短。
两类场景有结构性优势:一是能接触到通用模型拿不到的特殊数据;二是针对极难的特定问题,训练专用小模型,以低成本获得高精度。他以AlphaFold为例,认为材料科学、芯片设计等领域存在类似机会。
对于2027年,迪恩预测机器学习系统自身的自动化将大幅提高,形成"用AI优化AI"的闭环。他同时强调:未来真正稀缺的不是执行力,而是判断力——"知道该让智能体去解决什么问题"。
Content is for reference only, not financial advice.