• 周日. 9 月 13th, 2026

存内计算救了大模型推理:1.95 倍加速背后的脏活

存内计算芯片特写图:DRAM 存储单元内嵌运算单元,数据在内存阵列里就地完成矩阵乘法存内计算示意图

大模型推理卡到爆,不是因为算力不够——是因为数据搬不过去。每生成一个 token,GPU 要去 HBM 里搬运 KV cache,而这条搬运带宽,已经成为整条流水线里最慢的传送带。有一项 9 月新出的工程方案做了一件反直觉的事:不再搬运数据,而是把运算直接搬到内存里去做。结果比常规 GPU 流水线快近 2 倍,能耗降到原来的五分之一,且不需要改一颗内存颗粒。

一、为什么”搬数据”成了 LLM 推理的瓶颈

把 KV cache 想象成一座巨型仓库。每生成一个 token,GPU 就要派人去仓库里翻出跟这个字相关的所有历史片段,搬回工位上做矩阵乘法。这条搬运路径就是”内存墙”。HBM 是 GPU 旁边最贵的贵金属,它的带宽决定了 GPU 一秒能翻几页账本——而大模型每翻一页都越来越厚。

工程师们试过很多解法:把 KV cache 压缩、把多个请求合并、把过期的条目扔掉……但都属于”在仓库门口做分流”。根本问题没变:仓库不在工位上

二、存内计算(PIM):把运算塞进仓库里

存内计算这条路其实走了十多年。思路很简单:既然数据搬运这么贵,干脆让内存颗粒自己会算——在 DRAM 阵列的每个存储单元旁,放一组小小的算术单元,让乘法和累加直接在数据住的地方完成。

听起来完美。但 PIM 一直卡在一个现实问题上:实验室里跑得通的 PIM,放到生产环境里立刻拉胯。原因是生产环境里 KV cache 的生命周期极其复杂——分配、写入、共享、缓存、回收——每一项都跟 PIM 硬件的”理想化假设”对不上。

传统 PIM 研究像是在空房间里展示扫地机器人——一旦房间里堆满家具,机器人就卡死了。

三、这道题的三角冲突:读高效、写高效、容量大,三选二

生产环境的 KV cache 不是静态的,它要随时接收新生成的 token,也要随时把历史片段拿出来做注意力矩阵运算。这两个操作对内存布局的要求正好相反:

  • 为了矩阵运算高效,数据得横向铺开——一行就是一个完整向量,乘法器可以一次扫完;
  • 为了写入高效,新生成的 token 最好纵向堆叠——一列就是一条历史轨迹,单 token 写入只动一行;
  • 为了容量利用,内存要能细粒度共享——一条向量不能霸占整行,得切碎了放。

三项要求两两打架。读高效会拖慢写,写高效会浪费容量,细粒度共享会让矩阵运算散成满地碎片。这就是 PIM 卡在生产门口十年的根本原因

四、这套方案怎么破:用”两层颗粒度”绕开三角冲突

9 月新出的这套工程方案走了一条聪明的路——不强迫内存只满足一种使用方式,而是在同一块 DRAM 里同时维护两套颗粒度

具体做法:把 KV cache 拆成两层。

  • 细颗粒对应”逻辑块”——一个 token 一个块,写入和回收都在这里完成,永远不动;
  • 粗颗粒对应”物理行”——多个细颗粒拼成一行,专门给矩阵运算用。

两层之间用一个叫 Commit Zone 的”暂存区”连接:写入时先落到细颗粒上,等这一段 token 攒齐了再统一搬运到粗颗粒去做注意力运算——搬运成本被分摊到整段 token,而不是每个 token 都要付一次搬运费。

这样的设计结果是:读、写、容量三件事第一次同时拿满

五、实测成绩:1.95 倍加速 + 4.83 倍能效

这套方案用 vLLM 当对照组(生产环境最主流的推理引擎之一),把 KV cache 命中率做基线。新方案在主流大模型推理场景里跑出来的数据是:

  • 端到端加速:平均 1.95 倍——已经快到接近无损了;
  • 能耗:降到原来的 1/4.83——数据搬运是大头,省了这部分,省出来的就是钱;
  • KV cache 命中率:跟 GPU 原生方案基本持平——没有为了 PIM 牺牲服务质量。

最关键的一点是:这套方案不需要改 PIM 内存颗粒。所有改进都发生在软件运行层——也就是任何用现成商用 PIM 硬件的服务器都能立刻跑起来。这跟过去十年”必须等下一代 PIM 芯片”的路线完全不同。

六、为什么这件事比”快 2 倍”本身更重要

单纯看 1.95 倍加速不算颠覆——GPU 一年也能挤 30% 性能出来。但 PIM 路线真正的价值不在性能数字,而在三件 GPU 永远做不到的事:

  1. 带宽不再稀缺:HBM 带宽是 GPU 架构的物理瓶颈,PIM 直接绕开它;
  2. 能耗结构改变:数据搬运能耗是 GPU 的主要耗电来源,PIM 让这部分接近于零;
  3. 扩展性不再受限于显存:内存密度可以比 HBM 高一个数量级,未来塞更大模型不是梦。

七、PIM 真正落地的三个工程门槛

这套方案扫清了”能不能跑通”的问题,但离真正商用还有三道坎:

  • 硬件生态:目前支持 PIM 的商用内存型号还很少,主流服务器还在用传统 DRAM;
  • 软件栈兼容:每家 PIM 厂商的指令集不一样,不像 CUDA 那样统一;
  • 运维习惯:数据中心的运维人员要重新理解”内存不只是存储,还是算力”这件事。

它意味着什么

大模型推理的成本结构,正在悄悄分裂成两条路:

  • GPU 路线继续往更大显存、更高带宽、更先进制程堆——这条路让英伟达继续赚大头;
  • PIM 路线绕开 HBM,让数据搬运这件事彻底消失在内存里——这条路让传统内存厂商有机会从”卖 DRAM”升级成”卖算力”。

未来五年,最赚钱的可能不是显存做得多快,而是谁先把”算”这件事塞进”存”里

大模型的内存墙问题,本质上不是工程问题,而是架构问题——谁先承认”数据搬运是浪费”,谁就先找到下一代 AI 算力的钥匙。


本站编辑整理,资料来源公开网络。如有技术错误欢迎指正。

admin77

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注