AMD发布Gorgon Halo,本地AI支持3000亿参数模型
Claire Weston
AMD推出下一代桌面AI芯片Gorgon Halo,统一内存扩至192GB,可在本地运行3000亿参数大模型——这意味着DeepSeek、Qwen等开源模型有望脱离云端、直接跑在你的电脑上。
3000亿参数塞进一台电脑,怎么做到的?
Gorgon Halo对应Ryzen AI Max 400系列,统一内存从上一代的128GB扩至192GB,本地可运行模型的参数上限从2000亿提升至3000亿,增幅50%。
这意味着→ DeepSeek、腾讯等开发商的大型开源模型可以直接部署在桌面端,不必依赖云端GPU集群。
用大白话说= 以前这些大模型只能在数据中心跑,现在一台高配笔记本或工作站就够了。
企业为什么要把AI搬到本地?
AMD归纳了三重优势:数据不出设备,降低泄露风险;断网仍可运行,不受网络中断影响;省掉云端token计费,控制推理成本。
AMD预计,随着智能体数量增加,企业AI支出将从一次性GPU采购转向持续性token费用。
这意味着→ 本地推理不只是技术偏好,而是企业控制AI总拥有成本的关键杠杆。
模型越来越小,和本地AI有什么关系?
AMD高级副总裁杰克·惠恩援引数据:2025年GPT-4开源版需约1200亿参数才能在GPQA基准测试中得分80;七个月后,参数仅90亿至270亿的Qwen模型已超越上一代前沿模型的研究生级推理能力。
这反映出模型小型化正在加速——同等智能所需的参数量在急剧下降。
用大白话说= 模型变小了,设备跑得动了,本地AI的可行性窗口正在快速打开。
软件生态怎么配套?
AMD围绕ROCm软件栈(一套让开发者在AMD硬件上跑AI的开源工具)构建开放平台:开发者可在Halo上开发、微调模型,再部署至Instinct GPU和EPYC服务器,无需重写代码。
AMD同步扩大与Hugging Face的合作,提供针对Halo优化的模型、工具链和智能体工作流。
这意味着→ AMD试图用"一次开发、多端部署"的策略,降低开发者从英伟达生态迁移的门槛。
企业怎么管住这些AI智能体?
AMD与思科(Cisco)合作,整合Cloud Control、AI Defense等安全工具,实现token用量监控、AI成本分析及智能体权限管理。
行为异常或超出授权权限的智能体可在网络层被直接隔离。
用大白话说= 企业不仅要让AI跑起来,还得像管员工一样管住每个智能体——谁花了多少token、谁越权了,一目了然。
落地节奏如何?
惠恩透露,已有逾35款基于Halo架构的产品由惠普、华硕、宏碁、联想等OEM规划,覆盖笔记本、工作站、一体机、迷你PC及开发平台。
Gorgon Halo将进一步扩展至更多商用和企业AI设备。
这意味着→ 硬件铺货已有雏形,但企业是否真的愿意把大模型推理从数据中心搬到桌面端,仍是验证这套商业逻辑的关键节点。
Content is for reference only, not financial advice.