OpenAI 自研 3nm 芯片引发能效竞赛:AI 规模化的新瓶颈

发布时间:2026/8/29 16:30:30
OpenAI 自研 3nm 芯片引发能效竞赛:AI 规模化的新瓶颈 OpenAI 首颗 3nm 自研芯片开发周期只用了 9 个月并在能效上直接对标 NVIDIA 的下一代平台——这则消息真正让人意外的地方不是 OpenAI 开始做芯片而是竞争维度变了从“谁的模型更强”变成了“谁的电费能跑出更多 token”。芯片能效过去是硬件工程师 PPT 里的技术参数现在是 AI 公司的生死线。背后的逻辑不难理解模型参数可以继续膨胀数据中心却不能无限扩建电网也不会因为大模型的需求而多发电。当算力需求以指数增长电力和散热就成了比晶体管更稀缺的资源。这篇文章不打算复读新闻标题。我会把这件事拆成三层来讲第一为什么能效才是 AI 规模化的硬约束第二OpenAI 这类定制芯片在技术上靠什么实现能效超越第三作为普通开发者我们如何用一套可执行的方法去评估芯片和模型的能效并据此调整自己的技术选型。先把核心判断放在前面OpenAI 自研芯片的本质不是“再制造一块 GPU”而是把模型、编译器、运行时和硅片握在同一家公司手里。能效提升的真正来源不只是 3nm 制程更是“为 Transformer 重新设计计算与数据流”带来的系统性收益。1. 为什么“能效超越”比“性能超越”更有分量这几年 AI 行业有两个加速过程模型的规模和推理的调用量都在涨而且涨幅远超摩尔定律能覆盖的范围。一个模型从百亿参数涨到万亿参数算力需求是按数量级涨的与此同时把模型从实验环境搬到线上服务推理请求的并发量又是另一个数量级的增长。两股力量叠加让“算力供给”从技术问题变成了资源问题。资源问题的核心是功耗。数据中心能建多大往往不取决于机房面积而取决于供电容量和散热能力。今天一台 AI 服务器动辄上千瓦一个集群就是几十兆瓦直接逼近一个中型城市的用电规模。在这种约束下芯片的“性能/功耗”比值直接决定了同样的电费能支撑多少用户请求、多少 token 输出。能效为什么比峰值性能更值得关注因为峰值性能是实验室数据能效是运营数据。一块芯片的 FP8 算力是 1000 TFLOPS 也好2000 TFLOPS 也好真实业务关心的是在 700W 功耗限制下它每秒能生成多少 token每个 token 消耗多少焦耳。分母一旦被电力成本锚定能效就成了比绝对性能更现实的指标。这里可以做一个粗糙的估算。假设某个推理任务生成一个 token 需要 3 焦耳那么生成 100 万 token 就是 300 万焦耳大约 0.83 千瓦时。如果芯片的能效提升 1 倍同样的电费就能多服务一倍的请求或者把单位成本降一半。在推理价格战打得火热的今天这个差距足以改变一家公司的毛利结构。所以当“OpenAI Jalapeño 芯片能效超越 Vera Rubin”这类消息出现时我认为它传递的信号比“某颗芯片跑分第一”要重要得多它说明 AI 竞赛的下一阶段拼的不是谁把芯片做得多大而是谁把每一瓦特用得最狠。2. 自研芯片的信号OpenAI 到底在解决什么问题先回答一个很多人会问的问题OpenAI 是一家模型公司为什么要自己造芯片最直接的原因是通用 GPU 的成本结构在推理场景下越来越不划算。NVIDIA 的 GPU 是为“所有计算”设计的它既要跑图形、科学计算也要跑训练和推理芯片上大量晶体管和调度逻辑服务于通用性。而 OpenAI 的负载高度集中Transformer 架构、自回归解码、GQA 注意力、MoE 稀疏激活几乎都是可预测的算子组合。为这种确定负载定制一颗 ASIC可以把每一块硅片面积都花在刀刃上省掉通用芯片上大量用不上的逻辑换来的就是能效优势。另一个原因是供给和成本的控制力。头部 AI 公司的 GPU 采购量巨大但产能、价格、交付周期都受供应商牵制。自研芯片一旦形成规模至少在推理场景有了议价权和备份方案。这不是意气之争而是成本战略当推理量达到每天数万亿 token 的级别每 token 成本下降一个数量级都会转化成巨大的利润空间。关于“9 个月造出 3nm 芯片”这个说法我的判断是大概率不是从一张白纸开始设计而是从架构定义到流片验收的紧耦合开发。9 个月意味着团队高度复用成熟 IP与代工厂、EDA 工具链深度绑定并且把芯片功能