SK海力士推进PIM、HBF和SALT-KV,HBM战略向推理工作负载延伸
nashnova research
SK海力士在AI基础设施峰会上发布三条面向推理场景的新技术路线——PIM、HBF、SALT-KV,标志着其内存战略从单纯配套GPU训练,正式向推理侧的延迟、容量与成本三角难题延伸。
PIM到底解决什么问题?
AI推理的"解码"环节需要反复在内存和加速器之间搬运数据,搬运本身就是瓶颈。
PIM(存内计算,把简单运算直接放在内存芯片内部或旁边做)的思路是:数据不动,计算过去,从而大幅减少搬运次数。
这意味着→ 和传统方案里常用的SRAM相比,PIM在相同芯片面积下容量约为SRAM的300倍,同时保持较高的内部带宽。
用大白话说= SRAM像一张小桌子,速度快但放不了多少东西;PIM像把仓库改造成自带流水线的车间,东西不用搬出去就能加工。
新架构和"机架级PIM"是怎么回事?
SK海力士提出把内存芯片与计算芯片物理分开,再通过混合键合(一种让两块芯片直接面对面贴合的工艺)垂直连接。
这意味着→ 计算单元不再挤占内存芯片的面积,既省空间又让算力离数据更近。
更长远的构想是把PIM从单颗芯片扩展到整个服务器机架层面,呼应行业向机架级计算演进的趋势。
HBF为什么被称为"新的内存层级"?
当前内存体系里,HBM(高带宽内存)快但贵且容量有限,SSD便宜大容量但慢——中间存在一段空白。
HBF(高带宽闪存)把3D NAND(一种高密度闪存结构)的大容量与TSV(硅通孔,芯片之间垂直打孔互连的技术)结合,用接近闪存的成本提供接近HBM的带宽。
这意味着→ 对于长上下文推理、大批量服务等容量优先、成本敏感的场景,HBF提供了一个此前不存在的性价比选项。
SALT-KV在软件层面解决什么?
随着对话轮次增加和多步骤推理变多,KV缓存(模型用来记住上下文的临时数据)体积持续膨胀,全部放在最贵的HBM里不现实。
SALT-KV是一套软件调度方案:把缓存数据切块,评估每块的复用概率与存储成本,然后按特性分配到HBM、DRAM或SSD不同层级。
用大白话说= 相当于给缓存数据做了一次"冷热分拣"——常用的留在快车道,不常用的挪到便宜仓库,整体成本下降而服务不中断。
这些技术背后的系统级逻辑是什么?
SK海力士本月在台湾SEMICON展上已将数据搬运定性为计算领域的下一个主要瓶颈。
从HBM4代起,基础芯片可用逻辑制程制造,为在DRAM堆叠附近增加功能留出空间——不必每项操作都回传加速器。
这反映出一个更深层的信号:内存厂商正从"卖元器件"转向与客户协同设计系统,PIM、HBF与SALT-KV能否按时量产并通过客户认证,将是这条路线商业可行性的关键验证节点。
市场有风险,内容仅供研究参考,不构成投资建议。
