AI硬件08-推理芯片:低延迟、低功耗与低成本的三角平衡

发布时间:2026/8/22 2:00:45
AI硬件08-推理芯片:低延迟、低功耗与低成本的三角平衡 推理芯片 vs 训练芯片架构为什么要做减法本文为《AI 硬件体系深度调研》系列第 08 篇。上一篇我们盘点了训练芯片的肌肉量——3nm 制程、HBM3E、1.8TB/s 互联。但训练芯片再猛也不能拿来直接扛线上推理。本篇转向推理芯片看它为什么反其道而行之用减法在低延迟、低功耗、低成本之间找到平衡。黄金 100 字开头你是否用昂贵的训练卡去扛线上推理月底账单吓一跳很多人以为芯片越猛越好却忽略了推理场景的功耗与成本。本文讲清推理芯片为何反其道行之——靠减法把延迟和成本压下来。一、推理芯片的减法哲学先说一个反直觉的结论推理芯片的架构逻辑和训练芯片是相反的。1.1 训练要猛推理要省训练芯片追求的是高算力——因为它要在有限时间内把几万亿参数反复算个遍算力就是生产力。所以训练芯片拼命堆晶体管、堆 HBM、堆互联功耗几百瓦也不在乎因为训练是一次性投入、批量产出。推理芯片完全不同。推理是要线上长期服务的用户每发一条消息芯片就要跑一次前向计算。这个场景的核心矛盾不是算得够不够快而是延迟要低用户等不了回复要快功耗要低芯片 7×24 小时开机功耗直接变成电费成本要低一台服务器要塞尽可能多的推理卡卡越贵、越耗电服务就越亏本。于是推理芯片的设计哲学凝结成一句话“够用算力 极致数据传输效率”。它不追求算力峰值而是追求单位算力下更低的延迟、功耗和成本。1.2 为什么够用就行推理的计算量远小于训练这是够用的前提。训练时每个样本都要做前向 反向传播反向传播的计算量约是前向的 2-3 倍而推理只有前向没有反向。再加上推理时 batch 通常较小线上服务往往一次只处理几个请求对算力的绝对需求天然比训练低一个量级。所以推理芯片根本不需要训练芯片那种2000 TFLOPS的怪兽算力——它需要的算力是刚好覆盖峰值请求的量多出来的都是浪费。砍掉冗余算力省下来的面积和功耗正好投给更关键的东西数据搬运和延迟控制。 一句话训练芯片是赛车追求极限速度推理芯片是网约车追求油耗低、起步快、拉客多。两种车都要会跑但优化的目标完全不同。再用一组数字把这个够用量化。训练一个 700 亿参数的大模型假设数据量是 10 万亿 token总的浮点运算量大约是10^24 次 FLOP 量级——这是天文数字必须靠几千张训练卡、跑几个月。而同样这个模型做一次单条推理前向计算量只有约10^12 次 FLOP差了 12 个数量级。同样是算训练是搬一座山推理是搬一粒沙。搬山需要挖掘机和卡车训练芯片的峰值算力搬沙只需要一把小铲子推理芯片的够用算力。拿挖掘机去一粒一粒搬沙不是不行而是贵得离谱、笨得要命——这就是拿训练卡跑推理的真实写照。1.3 “减法不是阉割”这里要澄清一个误区推理芯片砍算力不是偷工减料而是把钱花在刀刃上。砍掉的是训练专属的冗余反向传播、梯度累积、超大 batch 吞吐省下来的晶体管和功耗被重新投向了三个方向——低精度计算、KV Cache 管理、动态功耗控制。这三个方向正是接下来三章要展开的内容。顺着减法哲学再看推理芯片的真实落地场景会更有体感。推理芯片不是只给聊天机器人用的它已经渗透进无数条业务链路手机端侧的语音助手唤醒词识别、语音转文字延迟要毫秒级功耗要低到不烫手、不耗电自动驾驶的实时感知摄像头画面要在毫秒内完成目标检测延迟高一点就是事故推荐系统的排序模型每秒上百万次请求单次延迟几十毫秒成本必须低到几乎忽略边缘端的工业质检产线上实时判定产品瑕疵需要小体积、低功耗、够用的推理算力。这些场景有一个共同点它们都不需要训练芯片那种把算力堆到极致的能力但都极度在意延迟、功耗和成本。理解了这些场景也就理解了推理芯片为什么一定要做减法——因为它服务的从来不是算得更猛而是用得刚刚好。二、计算单元裁剪小而精推理芯片的第一处减法砍在计算单元上。2.1 阵列更小训练芯片的脉动阵列边长动辄 256、512恨不得越大越好因为训练是计算密集型。而推理芯片的阵列明显更小——因为推理的单次计算量小阵列太大了反而会有大量 PE 闲置纯属浪费面积和功耗。更小的阵列意味着什么更少的晶体管、更低的漏电、更小的散热压力。把这些省下来的资源用在更精准的地方比堆大阵列划算得多。2.2 定向优化低精度INT8/FP8推理芯片的计算单元几乎为低精度而生。训练芯片在 FP16/BF16 上发力而推理芯片直接押注INT8/FP8INT88 位整数推理的主力精度。权重和激活都量化到 8 位整数乘加器可以做得极小极省电FP88 位浮点给对精度更敏感的部分如某些大模型的首尾层留一点余量。为什么要低精度因为低精度 高算力密度。同样面积的晶体管做 8 位乘加数量是 16 位的两倍、32 位的四倍。推理芯片靠 INT8/FP8把算力密度提升了一倍以上——也就是说用更少的面积拿到了足够的算力。⚠️ 避坑警告推理的 INT8 不是随便截断的而是要经过量化校准。直接用 FP32 权重硬转 INT8精度会暴跌。工程上要用少量校准数据统计每层权重的数值分布确定合适的缩放系数才能量而不损。量化校准的常见做法有两种各有取舍训练后量化PTQ不重新训练直接用少量校准数据统计每层的缩放系数。成本低、速度快但对敏感层可能掉精度量化感知训练QAT在训练阶段就模拟低精度效果让模型学会在 INT8 下工作。精度保持最好但需要重新训练、成本高。 一句话PTQ 是事后补救QAT 是先天预防。实际落地时通常先上 PTQ 快速验证敏感层再用 QAT 或保留 FP16 兜底——混合精度思路再次出现。2.3 砍掉训练专属模块推理芯片的减法还体现在物理上砍掉了训练专属的模块。训练芯片里那些为反向传播、梯度计算、优化器服务的硬件单元推理芯片统统不要。因为这些功能在推理时一次都用不上留着就是白耗电。这也是为什么推理芯片的有效算力占比反而更高——它没有为永远不会执行的功能浪费任何晶体管。砍掉无用的留下的都是有用的这正是小而精的由来。除了砍模块和降精度推理芯片的计算单元还常叠加两类省算力的技巧值得一并记住稀疏化Sparsity模型权重里大量数值接近零这些零权重乘任何数都是零根本不用算。推理芯片支持结构化稀疏直接把整块零权重跳过算力消耗进一步下降算子融合Operator Fusion把多个相邻的小算子比如矩阵乘 激活函数合并成一个大算子一次算完减少中间结果的读写次数既省算力又省带宽。 一句话砍模块是做减法降精度是换小号稀疏化是跳过零算子融合是合并同类项。四管齐下推理芯片的计算单元才能做到又小又省、又足够快。三、内存优化只留权重与 KV Cache推理芯片的第二处减法砍在内存系统上。3.1 只存两样东西权重 KV Cache训练芯片的显存里塞满了权重、梯度、优化器状态、激活缓存……五花八门动辄几百 GB。而推理芯片的显存只需要存两样东西模型权重这是知识本身必须常驻KV Cache这是上下文记忆推理时动态生成、不断增长。没有梯度、没有优化器状态、没有反向激活缓存——训练芯片里占大头的那几样推理芯片统统不用存。于是推理芯片的显存需求天然比训练芯片低了一个数量级。3.2 KV Cache 是什么这里必须把 KV Cache 讲清楚因为它是推理芯片内存设计的核心。在大模型推理的 Decode 阶段每生成一个 token都要和之前所有的 token 做注意力计算。如果没有缓存就得把前面所有 token 的 Key 和 Value重新算一遍——计算量随生成长度平方级增长慢得没法用。KV Cache 的做法是把每个 token 的 Key 和 Value 向量算出来后存进显存下次直接用。这样每生成一个新 token只需算新 token 的 K/V再和缓存里的历史 K/V 做注意力计算量从平方级降到线性级。 一句话KV Cache 是推理芯片的草稿纸把已经算过的注意力中间结果存下来避免反复重算。它省的是计算但代价是占用显存——这正是推理芯片内存系统的核心矛盾。KV Cache 到底吃多少显存我们算一笔账。假设一个 70B 参数、80 层、64 头的大模型用 INT8 做 KV Cache每生成一个 token每层每头会产生一对 128 维的 K 和 V 向量。粗略估算单个 token 的 KV Cache 约几百 KB 到 1 MB。生成长度一拉长问题就来了生成 4096 个 tokenKV Cache 就会累积到几个 GB如果同时服务几十个并发用户KV Cache 直接吃掉几十 GB 显存。所以推理芯片的显存真正的大头往往不是权重而是这堆越用越多的 KV Cache。这也解释了为什么推理芯片要集成专用的 KV Cache 控制器——因为 KV Cache 的读写模式非常特殊它一边增长、一边被高频随机访问传统的通用内存控制器根本吃不消必须用专门硬件来优化这个持续增长的草稿纸。3.3 片上缓存更小 专用 KV Cache 控制器推理芯片的内存优化具体落在两处片上缓存更小推理的复用模式更规整不需要训练芯片那么大的 SRAM 缓存小缓存就够用省面积省功耗集成 KV Cache 控制器用一个专门的硬件单元来管理 KV Cache 的读写、淘汰、分块把 KV Cache 的访存效率做到极致。这个KV Cache 控制器是推理芯片的独门设计——训练芯片根本不需要它因为训练没有历史上下文不断增长这个问题。专门为推理的内存模式定制硬件正是推理芯片极致数据传输效率的体现。3.4 内存优化的本质推理芯片内存优化的本质是**“精准”**训练芯片的内存系统是大而全什么都要装推理芯片的内存系统是小而准只装权重和 KV Cache并把这两样的访问效率做到极致。省掉不必要的内容专注必要内容的吞吐这就是推理的数据效率哲学。这里再补一个容易被忽略的点推理芯片的数据效率还藏在批处理Batching里。线上推理的单个请求算力需求很小如果一次只处理一个请求芯片的大部分算力和带宽都会被浪费。所以推理芯片会做动态批处理——把多个到达时间接近的请求拼成一批一起算。拼批有两个直接好处一是提高算力利用率让裁剪后的小阵列也能跑满二是摊薄权重读取成本——权重读进片上缓存后一批请求共享同一次读取均摊到每个请求的带宽开销就小了。这就是极致数据传输效率的另一个侧面不是让单次访问变快而是让每一次访问都被更多请求复用。 一句话推理芯片的省一半靠砍去掉不需要的一半靠复用让需要的一次用够。砍出面积和功耗复用出效率和延迟两者合起来才是完整的推理芯片内存哲学。四、功耗控制动态调度到 1/10推理芯片的第三处减法砍在功耗上这也是最狠的一刀。4.1 功耗为什么要压到 1/10训练芯片功耗动辄 300-500W但它不是 7×24 小时满载——训练任务跑完就停机或者阶段性满载。推理芯片不一样它要长期在线、随时待命功耗直接转化为电费账单。一个数据中心如果塞满几百瓦的推理卡电费和散热成本会高到离谱。所以推理芯片的功耗必须压到训练芯片的 1/10 以内——也就是1W 到 100W这个量级。单卡功耗压下来数据中心才能多塞卡、少烧钱。4.2 动态调度不用的部分就断电推理芯片压功耗的绝招是动态调度。它有三个维度的动态动态阵列规模请求少时只启用阵列的一小部分其余部分直接关断power gating几乎不耗电动态电压/频率DVFS负载低时降低电压和频率功耗随负载弹性伸缩动态精度简单请求用 INT8复杂请求才上 FP8/FP16按需分配精度。这三招的核心思想是一致的负载有多重就用多少电绝不为闲置的算力付电费。 生活化类比训练芯片是随时全油门的赛车推理芯片是带启停系统的汽车——红灯一停就熄火绿灯一踩就走。平时怠速几乎不耗油需要动力时再唤醒。这就是推理芯片功耗能低到 1/10 的秘密。这三招在工程上各有讲究展开说Power Gating电源门控不是降频而是直接切断电路供电。关断的模块几乎零功耗但唤醒需要重新上电延迟通常在微秒级。适合长时间闲置的场景DVFS动态电压频率调节不切电而是降低电压和频率。切换速度快、延迟小但省电幅度不如关断彻底。适合短时间轻载的场景时钟门控Clock Gating最细粒度的一招关掉暂时不用的时钟信号让寄存器不再翻转。几乎零延迟、零副作用是推理芯片里用得最多的基础省电手段。 一句话Power Gating 是关总闸DVFS 是调小电流Clock Gating 是随手关灯。三招组合才能把推理芯片的功耗从几百瓦一路压到个位数瓦特。4.3 功耗与延迟的平衡当然动态调度不是没有代价的——断电和唤醒都需要时间。如果为了省电把阵列关得太彻底突发流量来了唤醒来不及就会造成延迟飙升。所以推理芯片的功耗控制本质上是在低功耗和低延迟之间走钢丝关得越狠越省电但唤醒越慢关得越浅延迟越稳但越费电。好的推理芯片靠的是精准的负载预测和快速唤醒机制让这条钢丝走得又稳又省。这根钢丝到底有多细我们拆一下推理的延迟预算。线上推理对延迟通常有硬性约束比如首 token 延迟要控制在 500ms 以内、后续每个 token 要在 30-50ms 以内。这几十毫秒里芯片要完成取数、矩阵乘、激活、写回、再取数……任何一环慢半拍用户就会感觉卡顿。而动态功耗控制的唤醒恰好就发生在这个紧张的时间窗口里。如果请求突然涌入芯片要从深度省电状态拉满算力唤醒时间哪怕只多几毫秒都可能让首 token 延迟超标。所以推理芯片在省电和延迟之间通常要保留一个浅睡眠的中间态——不彻底关断而是降到低功耗待命保证唤醒够快。这正是工程上最见功力、也最容易被外行忽略的细节。五、与训练芯片的架构对照最后把推理芯片和训练芯片并排放一起做一个系统对照。5.1 三大差异一张表维度训练芯片推理芯片计算单元大阵列、FP16/BF16 为主小阵列、INT8/FP8 定向优化算力密度翻倍内存系统权重梯度优化器激活大而全只存权重KV Cache配专用控制器功耗300-500W动态调度压到训练芯片 1/10 以内1-100W这三大差异正好对应推理芯片的减法三刀砍计算、砍内存、砍功耗。砍完之后的推理芯片不再是训练芯片的缩水版而是一个为推理场景重新设计的、逻辑完全不同的新物种。5.2 底层逻辑的分野更深一层看训练芯片和推理芯片的分野源自它们面对的核心矛盾不同训练芯片的核心矛盾是**“算力 vs 带宽”**——算力强但带宽追不上所以拼命堆带宽、做数据复用推理芯片的核心矛盾是**延迟、功耗、成本的三角平衡**——三者互相制约必须在它们之间找到最优解。这就解释了为什么两者的架构会走向不同方向训练往大而猛走推理往小而省走。不是谁更高级而是各自解决了各自场景的痛点。再往成本这个维度深挖一步。推理服务的账是这么算的假设一张训练卡卖 20 万元、功耗 400W用它跑推理一台服务器塞 8 张卡光硬件就要 160 万电费一年还要吃掉几十万。而推理芯片因为砍了算力和功耗单卡价格可以降到训练卡的几分之一功耗降到 100W 以内——同样一台服务器能塞更多卡、电费更少单位请求的服务成本直线下降。推理是一门走量的生意单次请求赚得再少只要成本够低、能服务海量请求总量就很可观。反之单次请求算得再快如果成本降不下来规模一大就亏。所以推理芯片的减法最终落点是把单位算力的成本打下来——这才是推理芯片在商业上真正的胜负手。5.3 三角平衡的工程艺术推理芯片的终极命题是低延迟、低功耗、低成本三者的平衡低延迟用户要快延迟是体验的底线低功耗电费要省功耗是成本的底线低成本芯片要便宜否则推理服务不赚钱。这三者互相拉扯要低延迟就得保持算力在线功耗就下不来要低功耗就得动态关断延迟就可能抖动要低成本就得砍面积砍工艺但性能和功耗又受影响。推理芯片的设计就是在这三条线围成的三角形里找一个最划算的落点。 一句话总结训练芯片比的是峰值推理芯片比的是平衡。谁能在延迟、功耗、成本之间取得最优平衡谁就能在推理这个走量的市场上胜出。落到具体选型上这个三角平衡会分化出不同的产品取向云端推理芯片优先保吞吐和并发功耗可以放宽到 100W 量级边缘推理芯片优先保功耗和成本延迟要稳、电要省算力够用即可端侧推理芯片则把功耗压到 1W 以下靠 NPU 与主芯片协同。同一个推理需求落点不同三角的侧重就不同——这再次印证推理芯片没有万能解只有最合适解。配图图 1推理芯片三大差异模块图裁剪阵列 / KV Cache / 功耗控制flowchart TB subgraph 推理芯片三大差异 A[裁剪阵列br/小而精 INT8/FP8] -- C[低延迟] B[专用内存br/权重KV Cache控制器] -- C D[动态功耗控制br/阵列/电压/频率调度] -- C C --|三角平衡| E[低延迟 低功耗 低成本] end推理芯片通过裁剪计算阵列、定制 KV Cache 内存、动态功耗控制三大模块共同支撑低延迟、低功耗、低成本的三角平衡。图 2训练芯片 vs 推理芯片 功耗与精度对照xychart-beta title 训练芯片 vs 推理芯片功耗与精度 x-axis [训练芯片, 推理芯片] y-axis 相对值 0 -- 10 bar [10, 1] line [6, 8]柱状为功耗对比训练芯片满额推理芯片压到约 1/10折线为算力密度随精度优化推理芯片 INT8/FP8 密度更高故折线略高。写在最后推理芯片的本质是一场精打细算的减法革命砍掉冗余算力、砍掉训练专属内存、砍掉不必要的功耗换来低延迟、低功耗、低成本的三角平衡。它不追求最强只追求最合适——在推理这个走量的战场上合适比强大更重要。下一篇我们深入推理的卡脖子阶段——Decode 阶段的内存带宽瓶颈看看推理时芯片到底卡在哪、又该怎么破。【思考题】推理芯片砍了算力遇到突发流量峰值算力不够怎么办靠什么弹性兜底欢迎探讨。提示可以从批处理、队列、混合部署、云上弹性扩容等角度想想。【系列文章预告】下一篇深入推理的卡脖子阶段——Decode 阶段的内存带宽瓶颈。标签推理芯片、INT8、KV Cache、低功耗、架构裁剪、AI推理、芯片对比推理芯片逻辑为够用算力 极致数据传输效率与训练本质不同差异一为计算单元裁剪阵列更小、定向优化 INT8/FP8 低精度、算力密度提升一倍以上差异二为内存系统定向优化只存模型权重 KV Cache、片上缓存更小、集成 KV Cache 控制器差异三为功耗控制模块动态调度阵列规模/电压/频率、功耗压到训练芯片 1/10 以内。