浙大:精准压缩线性注意力降显存

发布时间:2026/10/6 8:04:40
浙大:精准压缩线性注意力降显存 📖标题:STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization🌐来源:arXiv, 2609.38169v1🛎️文章简介🔸研究问题:在使用线性注意力机制的大模型中,如何在不损失精度的前提下,对随并发请求增加而膨胀的固定大小循环状态进行低比特量化压缩?🔸主要贡献:论文提出了STEPQuant框架,通过时空联合量化策略,在6-bit精度下几乎无损地压缩循环状态,使服务总显存降低高达68.7%。📝重点思路🔸发现误差传播规律:论文指出直接均匀量化会导致严重精度下降,因为量化误差会在连续的Delta规则更新中累积。研究发现误差影响取决于两个维度:时间上,长寿命记忆中的误差会持续存在;空间上,不同Key行对输出误差的影响不同,且状态幅度在行列间差异巨大。🔸时间维度:生命周期感知位分配。根据量化误差的大小和记忆的持久性(由门控保留率决定)来分配精度。给那些误差大且留存时间长的单元分配更高精度,并在固定预算下优化整体失真,同时保留少量高风险单元为FP16作为锚点。🔸空间维度:Key行感知双轴拟合。针对状态矩阵在Key行和Value列方向均存在异常值的几何特性,提出分别拟合行和列的缩放因子。行缩放因子结合了当前幅度和该行对输出误差的影响权重,列缩放因子则在高影响行上赋予更大权重,从而更精细地适应空间分布。🔸系统实现优化:将STEPQuant集成到SGLang推理引擎中,设计了优化的GPU内核,融合状态重构、Delta更新和读取操作,并异步执行尺度拟合与写回,减少内存流量并提升计算效率。🔎分析总结🔸精度表现优异:在Qwen3.8-27B和Kimi-Linear-48B模型上,6-bit STEPQuant的准确率几乎与FP32基准持平,显著优于均匀INT8和INT6。即使在4-bit配置

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询