阿里Qwen3.8開源2.4T參數旗艦模型

Nashnova编辑部
Published todayAbout 4 min read

阿里巴巴首次將旗艦級大模型Qwen3.8以開放權重發佈,總參數2.4T,打破此前「小模型開源、大模型只賣API」的慣例——這意味著開發者第一次能直接拿到Max級別的完整模型權重。

01

為甚麼這次開源不一樣?

過去Qwen每代都是雙軌制:小模型(如72B)開放權重,旗艦Max只提供API調用。
Qwen3.8-2.4T是首次把Max級別模型直接放出來,開發者可以自行部署、修改、商用。
這意味著→ 阿里主動放棄了旗艦模型的「圍牆花園」,用開源換生態——競爭從賣API轉向爭奪開發者社區
02

2.4T參數的模型長甚麼樣?

總共92層、2.4T參數,但每個Token只激活其中95B——這是MoE架構(混合專家,把模型分成512個「專家」小模組,每次只調用10個幹活,慳算力)。
注意力機制用的是「混合架構」:69層線性注意力 + 23層傳統全注意力,比例約3:1。簡單來說= 大部分層用慳算力的「快通道」,每隔三層插一層精度更高的「慢通道」,兼顧速度同質量。
原生上下文262K Token,可擴展到約100萬Token,並做了多Token預測(MTP,一次猜3個詞而非逐詞生成,加快推理速度)訓練。
03

同月之暗面Kimi K3有幾相似?

K3的93層中同樣是69層線性注意力 + 24層全注意力,比例亦約3:1——兩家架構高度趨同
主要差異:K3額外引入了注意力殘差(AttnRes)機制,允許模型重新組合多個歷史層的輸出;Qwen3.8仍用較傳統的Pre-Norm殘差結構。
這反映出 2—3T參數級的旗艦模型正在架構層面快速收斂,差異化空間愈來愈細。
04

部署門檻降到甚麼程度?

完整精度(BF16/FP8)至少需要兩台英偉達B300或AMD MI355X節點
第三方框架Inferact提供FP4量化版本,壓縮後可在單節點上跑起來。簡單來說= 從「兩台頂級伺服器」降到「一台」,雖然仍然貴,但部署門檻砍了一半。
推理階段組合使用張量並行(TP,把矩陣計算拆到多塊GPU)、數據並行(DP)和專家並行(EP,把不同專家分到不同GPU),透過融合通信降低調度開銷。
05

後訓練的重心去了邊度?

Qwen把Agent執行列為核心升級方向——自主規劃、環境反饋處理、端到端任務完成。
評測增量集中在Agent任務:Terminal Bench從74.5→86.6,PaperBench從64.8→93.0,JobBench從31.3→53.4;而傳統知識推理基準GPQA Diamond僅從92.4微升至92.6。
這意味著→ 旗艦模型的競爭焦點正從「答題更準」轉向「能獨立做嘢」——單輪問答的邊際收益已經好薄,長程Agent先係增量戰場
06

開源許可證藏了甚麼門檻?

開源版是純文字、僅thinking模式、262K上下文;雲端Max額外支援視覺輸入、non-thinking模式、預設1M上下文和內置工具——並非完整複刻。
許可證從Apache 2.0改為專用的Qwen3.8-Max License:允許商用,但月活超1億或月收入超2000萬美元須顯著展示模型名稱;MaaS或AI工作助手企業、年收入超5000萬美元須另行授權。
Kimi K3同樣採用自訂許可證、設置類似門檻。這反映出 頭部開源模型正在形成新共識:小團隊隨便用,大公司要付費或署名——開源的定義正在被重新劃線。

Content is for reference only, not financial advice.

阿里Qwen3.8開源2.4T參數旗艦模型 · nashnova