Jeff Dean:推理硬體是AI普及下一關鍵瓶頸

Taylor Wilson
Published todayAbout 4 min read

Google首席科學家Jeff Dean表示,AI智能體能力已超預期,但制約大規模普及的核心瓶頸正從模型能力轉向推理硬件效率——若延遲能降低50倍,將催生全新應用形態。

01

Dean說AI進展超預期,超在哪裏?

他去年判斷「AI已達初級工程師水平」,現在確認基本準確,部分維度甚至更快。
關鍵超預期點:基於智能體的系統已能連續運行數天甚至數周,完成極為複雜的任務。這意味著→ AI不再是「問一句答一句」的工具,而是能獨立執行長周期項目的系統。
Dean認為市場普遍低估了這一點——「這將是一件影響很大的事」。
02

為甚麼說推理硬件是下一個瓶頸?

Dean將問題定義得很清楚:模型能力已經不是最大制約,推理硬件的效率才是
他用一個歷史類比說明:2001年他主導將Google搜索索引從硬盤遷到內存,硬件架構的躍遷直接決定了產品能力的上限。簡單來說= 模型再聰明,跑得慢、耗能高,用戶體驗和成本都過不了關。
他提出一個量化標杆:若推理延遲能降低50倍,將從根本上改變AI產品的邊界,催生目前無法實現的應用形態。
03

硬件層面的能耗差距有多誇張?

Dean指出一個底層事實:將數據從高帶寬內存(HBM,加速器晶片旁邊的高速存儲)搬到處理器,消耗的能量是實際做一次乘法運算的上千倍
這意味著→ 當前AI系統的能耗大頭不在「算」,而在「搬數據」。這直接決定了為何需要批處理、為何系統架構如此複雜。
他給出兩個優化方向:一是盡量減少數據搬運,二是用極低精度運算,將所需精度直接內建到硬件中。簡單來說= 少搬、輕算,從物理層解決問題。
04

「上下文工程」是甚麼,為甚麼小團隊有機會?

Dean指出,AI進步的驅動力正在轉向:不再只是「更大模型、更多數據」,而是模型之外的系統工程——檢索、工具調用、記憶管理、智能體編排,業界稱之為上下文工程(context engineering,圍繞模型搭建的整套輔助系統)。
這反映出一個結構性變化:門檻降了。「以前訓練模型需要海量GPU和數據,但做上下文工程,你只需要一個類似Gemini的API接口,」Dean說。
說白了= 小團隊毋須自己造引擎,拿現成的引擎,在外圍搭系統,就能做出差異化產品。
05

智能體容易「脫軌」,怎麼解決?

智能體執行超過三四十步後容易偏離目標,這是當前普遍難題。
Dean給出兩類策略:一是為模型提供技能和提示,令其盡量走熟悉的路徑;二是用多智能體架構——由另一個模型對多條路徑進行評估和篩選。
這意味著→ 解決方案不是令單個模型更強,而是用系統設計來約束和糾偏。
06

創業者該去哪裏找機會?

Dean的篩選標準很明確:找當前通用模型成功率接近0%或1%的問題,而非20%。後者意味著通用模型正在快速追趕,窗口期很短。
兩類場景有結構性優勢:一是能接觸到通用模型拿不到的特殊數據;二是針對極難的特定問題,訓練專用小模型,以低成本獲得高精度。他以AlphaFold為例,認為材料科學、晶片設計等領域存在類似機會。
對於2027年,Dean預測機器學習系統自身的自動化將大幅提高,形成「用AI優化AI」的閉環。他同時強調:未來真正稀缺的不是執行力,而是判斷力——「知道該讓智能體去解決甚麼問題」。

Content is for reference only, not financial advice.

Jeff Dean:推理硬體是AI普及下一關鍵瓶頸 · nashnova