• 周日. 9 月 13th, 2026

FIBER 重塑 GPU 调度:跳出 GEMM 桎梏

现代 GPU 裸片上张量核心阵列与解耦执行纤维的概念示意图,纤维以发光细线悬浮于共享寄存器池之上

现代 GPU 把 Tensor Core 推进了 AI 推理的主舞台,但调度粒度仍然停留在 SIMT 时代的设定里:每个线程绑定一份寄存器,整组线程必须同步进出 GEMM。一旦工作负载里混进归一化、softmax、注意力投影之外的非 GEMM 操作,调度器就只能让 Tensor Core 空转。这是 Ampere 之后每一代新卡都被讨论的话题。

2026 年 8 月,Liu 等人在一项新的 GPU 架构研究中,把这种尴尬拆到了底层:他们给出的方案叫 FIBER——一种把执行线程与私有寄存器所有权解耦的新型 SIMT 模型。FIBER 让执行实例 fiber 不再随身携带寄存器,而是通过一个共享视图去访问 SM 上的物理寄存器池。这一改动释放了之前被锁死的两个自由度:并行度可以动态伸缩,数据流可以做到寄存器粒度的精细调度。

一、从寄存器私有到共享视图

传统 GPU 里,寄存器是跟着线程走的,编译器为每个 fiber 静态分配一份固定窗口。这意味着同一个 warp 内的所有线程在同一时刻只能看到相同大小的数据切片,调度单元也只能按 warp 粒度推送算子。

FIBER 把这一约束翻转过来:fiber 只保留最小控制状态,执行时通过共享寄存器地址访问物理池。这样调度器可以临时把若干 fiber 合并成一个大窗口做矩阵乘,也可以在非 GEMM 段把窗口切碎,让多个 fiber 共享同一组寄存器的不同区域。操作数供给链从「专属寄存」走向「共享池」,是这次架构调整的核心。

二、为什么 GEMM 之外的算子也能跑得快

现代大模型推理里,矩阵乘并不是时间花得最多的部分。RMSNorm、RoPE、KV 缓存写入、注意力掩码、采样前后的数值变换,这些非 GEMM 操作散落在 GEMM 周围,被 GEMM 调度节奏拖着走,往往造成 Tensor Core 等待数据、通用流水线又无事可做的尴尬错位。

FIBER 的灵活调度让 GEMM 与非 GEMM 可以同时在 SM 上铺开。GEMM 仍然从寄存器池拿到完整操作数,但周边的辅助算子能以前所未有的粒度插入同一份寄存器视图。论文给出的混合精度 LLM 推理场景下,Ampere 端到端跑出 2.25 倍提速,其中原始 FP16 计算只占 1.15 倍,剩下的提速几乎全来自非 GEMM 段被重新编排。

三、跨代际结果与可复用性

研究团队在 Ampere、Hopper、Blackwell 三个代际上都跑了端到端测试。Ampere 上 2.25 倍、Hopper 上 1.8 倍、Blackwell 上 2.09 倍,单 kernel 的峰值提速达到 2.49 倍。值得注意的是 Hopper 与 Blackwell 本就在 Tensor Core 周边加了更多专用数据通路,新方案在这种代际下依然跑出两位数百分比的提升,说明问题不在硬件而在调度。

论文同时给出 ISA、微架构与编译器的协同改造:新增的共享寄存器寻址模式让 fiber 之间可以无冲突地读同一组寄存器;编译器把 fiber 映射与寄存器分配作为同一阶段决策,避免了过去先决定线程数再硬塞寄存器的低效路径。这是一次软硬件联动、而不是单点优化的典型例子。

四、对芯片工程师意味着什么

对关心 GPU 微架构的工程师来说,FIBER 给出了一个明确信号:Tensor Core 性能不再只依赖峰值算力指标。当调度粒度被细化到寄存器级别,把工作负载拆得更细、更动态,已经能让现成的硅片跑出代际差级别的加速。

这也意味着,下一代 GPU 架构在硬件设计之外,会越来越依赖编译器与调度器的协同。硬件把寄存器池做得更深、更可重映射;软件把 fiber 编排做得更智能、对非 GEMM 段更友好。两件事同步推进,才是把「数据搬运空转」这段被浪费的算力真正找回来的关键。

五、回到工作负载本身

把视角拉回工作负载端,FIBER 的真正价值不在某个具体的加速倍数,而在它揭示了 GPU 流水线中长期被忽视的错位:硬件已经在张量计算上堆到了很高的吞吐量,但调度粒度仍停留在 SIMT 的旧设定里。当调度方式被重新设计,原有的硬件潜力才真正有机会被完整用上。

对 AI 推理系统的设计者来说,这项工作提醒了同一件事:在每一代新卡上重新评估「瓶颈到底在哪一步」是值得的,因为 Tensor Core 周边的非 GEMM 段,往往才是决定端到端速度的真正短板。

admin77

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注