三星Hot Chips 2026展示LPDDR5X-PIM,AI推理速度提升2.28倍
Nashnova编辑部
三星在Hot Chips 2026上展示LPDDR5X存内计算芯片,Llama 3.1 8B推理吞吐量提升至3.01倍——这意味着边缘AI设备有望绕开昂贵的HBM,用更便宜的内存做更多的活。
推理速度提升两倍多——到底快在哪?
在三星自家边缘AI芯片上跑Llama 3.1 8B模型,换上LPDDR5X-PIM后,运行时间从12.3秒降至5.4秒,快了约2.28倍。
推理吞吐量从每秒27.0个token跃升至81.3个token,约为原来的3.01倍。
这意味着→ 同一块边缘芯片,不换处理器、只换内存方案,AI回答速度就能翻两到三倍。
用大白话说= 以前大模型在手机或边缘盒子上"想一句话"要半秒,现在不到零点二秒。
"存内计算"到底在干什么?
PIM(存内计算)的核心思路:把一部分计算直接搬到内存芯片内部完成,数据不用来回搬运。
LPDDR5X-PIM内部带宽达到614 GB/s,而传统DRAM对外带宽仅76.8 GB/s,内部通道快了约八倍。
这意味着→ 瓶颈从"算力不够"变成了"数据搬运太慢";PIM直接在数据存放的地方算,省掉了搬运这一步。
能直接插到现有系统里吗?
三星保留了JEDEC标准的561球封装,物理接口和现有LPDDR5X一致。
通过"地址对齐模式"把DRAM地址映射为PIM指令,现有内存控制器基本不用改。
用大白话说= 对设备厂商来说,这不是"推倒重来",而是"换一颗料就能用"——这正是过去很多新型存储架构推不动的原因。
三星已开放模拟器、数据手册和SDK,厂商可按需申请试用。
为什么现在推这个?HBM太贵了
三星援引数据:HBM在AI芯片组件支出中的占比从2024年Q1的52%攀升至2025年Q4的63%,存储成本越来越重。
美光在同场大会上指出,HBM所需晶圆面积约为DDR5的三倍,且"肯定不会缩小"。
这意味着→ 如果所有AI推理都用HBM,硬件账单会越来越难看;LPDDR5X-PIM瞄准的就是"不需要HBM那么大带宽、但又想跑得更快"的推理场景。
它能取代HBM吗?
不能。LPDDR5X-PIM的外部带宽远低于HBM,高吞吐量训练场景仍须依赖HBM。
三星的定位很精准:针对推理负载,在内存内部完成部分计算,减少数据跨接口传输,用更低成本换更高有效吞吐。
这反映出存储行业的一个趋势——不再追求单一指标(带宽最大化),而是按场景分层:训练用HBM,推理用PIM。
数据可信吗?下一步看什么?
本次性能数据为三星内部测量,非独立基准测试;且两种方案生成的输出存在差异,精度优化仍在进行。
下一代LPDDR6-PIM已列入计划,正推进JEDEC标准化。
用大白话说= 数字好看,但还没经过第三方验证;量产后能不能同时保住速度和精度,才是真正的考试。
市场有风险,内容仅供研究参考,不构成投资建议。