阿里Qwen3.8开源2.4T参数旗舰模型
Nashnova编辑部
阿里巴巴首次将旗舰级大模型Qwen3.8以开放权重发布,总参数2.4T,打破此前「小模型开源、大模型只卖API」的惯例——这意味着开发者第一次能直接拿到Max级别的完整模型权重。
为什么这次开源不一样?
过去Qwen每代都是双轨制:小模型(如72B)开放权重,旗舰Max只提供API调用。
Qwen3.8-2.4T是首次把Max级别模型直接放出来,开发者可以自己部署、修改、商用。
这意味着→ 阿里主动放弃了旗舰模型的"围墙花园",用开源换生态——竞争从卖API转向争夺开发者社区。
2.4T参数的模型长什么样?
总共92层、2.4T参数,但每个Token只激活其中95B——这是MoE架构(混合专家,把模型分成512个"专家"小模块,每次只调用10个干活,省算力)。
注意力机制用的是"混合架构":69层线性注意力 + 23层传统全注意力,比例约3:1。用大白话说= 大部分层用省算力的"快通道",每隔三层插一层精度更高的"慢通道",兼顾速度和质量。
原生上下文262K Token,可扩展到约100万Token,并做了多Token预测(MTP,一次猜3个词而非逐词生成,加快推理速度)训练。
跟月之暗面Kimi K3有多像?
K3的93层中同样是69层线性注意力 + 24层全注意力,比例也约3:1——两家架构高度趋同。
主要差异:K3额外引入了注意力残差(AttnRes)机制,允许模型重新组合多个历史层的输出;Qwen3.8仍用较传统的Pre-Norm残差结构。
这反映出 2—3T参数级的旗舰模型正在架构层面快速收敛,差异化空间越来越小。
部署门槛降到了什么程度?
完整精度(BF16/FP8)至少需要两台英伟达B300或AMD MI355X节点。
第三方框架Inferact提供FP4量化版本,压缩后可在单节点上跑起来。用大白话说= 从"两台顶级服务器"降到"一台",虽然仍然贵,但部署门槛砍了一半。
推理阶段组合使用张量并行(TP,把矩阵计算拆到多块GPU)、数据并行(DP)和专家并行(EP,把不同专家分到不同GPU),通过融合通信降低调度开销。
后训练的重心去了哪里?
Qwen把Agent执行列为核心升级方向——自主规划、环境反馈处理、端到端任务完成。
评测增量集中在Agent任务:Terminal Bench从74.5→86.6,PaperBench从64.8→93.0,JobBench从31.3→53.4;而传统知识推理基准GPQA Diamond仅从92.4微升至92.6。
这意味着→ 旗舰模型的竞争焦点正从"答题更准"转向"能独立干活"——单轮问答的边际收益已经很薄,长程Agent才是增量战场。
开源许可证藏了什么门槛?
开源版是纯文本、仅thinking模式、262K上下文;云端Max额外支持视觉输入、non-thinking模式、默认1M上下文和内置工具——并非完整复刻。
许可证从Apache 2.0改为专用的Qwen3.8-Max License:允许商用,但月活超1亿或月收入超2000万美元须显著展示模型名称;MaaS或AI工作助手企业、年收入超5000万美元须另行授权。
Kimi K3同样采用自定义许可证、设置类似门槛。这反映出 头部开源模型正在形成新共识:小团队随便用,大公司要付费或署名——开源的定义正在被重新划线。
Content is for reference only, not financial advice.