「美版 DeepSeek」第一次交卷:Beam 追到了 GLM-5.2,但差了最新一代一整代

发布时间:2026/10/11 4:30:52
「美版 DeepSeek」第一次交卷:Beam 追到了 GLM-5.2,但差了最新一代一整代 「美版 DeepSeek」第一次交卷Beam 追到了 GLM-5.2但差了最新一代一整代2026 年 10 月 5 日美国的 Reflection 发布Beam—— 它的第一个开放权重模型。一天后法国的 Mistral 发布Mistral Large 4它有史以来最大的模型。两家在发布时不约而同地选了同一组对照目标GLM、Kimi、DeepSeek、Qwen。这篇文章不讲「谁第一」讲三件更有信息量的事① 「美版 DeepSeek」这个外号哪里不对② 两组能说明格局的第三方数据③ 两家的商业模式其实在抄同一条路。一、先把两组第三方数据放在最前面这两组数字不是厂商说的是平台侧的① Hugging Face过去一年中国模型占平台总下载量约 41%而且是月度下载和累计下载双双超过美国。② Vercel AI Gateway开放权重模型处理了平台 56% 的生产 token2026 年 8 月这个比例在去年 12 月还不到 10%。第二条尤其值得停一下。它说的是生产流量不是下载量、不是 star 数。八个月从不到 10% 到 56%—— 这意味着开放权重模型已经不是「研究者的替代品」而是真在跑业务。这两组数据是后面所有对比的背景板不是因为「西方终于也开源了」值得写而是因为开源这条赛道上追赶的方向和几年前反过来了。二、「美版 DeepSeek」这个外号有一半是错的先说名字的来源。Reflection 成立于2024 年两位创始人都来自 Google DeepMindCEO Misha Laskin—— 曾负责 Gemini 的reward modelingCTO Ioannis Antonoglou—— 参与AlphaGo / AlphaZero后来领导 Gemini 的RLHF工作但它最初并不是要做「美版 DeepSeek」。公司一开始聚焦自主编程想用强化学习做一个能独立完成复杂任务的系统而且当时的判断是 ——西方会持续出现足够强的开放模型Reflection 可以直接在上面做。真正改掉这条路线的是 DeepSeek V3。按创始人的说法在中国开放模型快速推进、而西方长期没有对等替代品之后公司决定自己训练前沿开放模型目标逐渐明确为「把开放模型的前沿带回西方」。所以「美版 DeepSeek」这个外号指的是「位置」——西方阵营里对标 DeepSeek 的那一个 ——而不是「路线」。而路线恰恰相反。看 Beam 的强化学习规模项数字同时占用的 GPU10,500 张 Nvidia GB300连续训练时长4 周生成的 rollouts超过 1 亿最后一轮 RL 就同时占了一万多张最新的 GB300。加上公司融资数十亿美元、拿到英伟达的大额投资、通过合作锁定大量算力 ——它是「重量级版 DeepSeek」不是低成本版。这一点如果不说清读者会把「美版 DeepSeek」自动理解成「便宜的那个」而事实相反。三、Beam 的定位不比绝对能力比「单位算力换多少智能」Beam 的基本参数MoE 架构总参 501B每 token 激活 23B面向coding / reasoning / agent三类负载预训练23.8 万亿 token发布时还在最后的红队测试阶段权重、技术报告、开发工具计划10 月内放出它自己主打的是什么不是绝对能力是推理效率。官方宣称在某些高级推理任务上Beam 能用GLM-5.2 约 1/4 到 1/3 的推理算力达到相当的性能。这是一个「单位算力产出」的卖点。Misha 把 Beam 定位成「mainstay model」主力模型——企业可以长期跑的那个而不是只追排行榜的最大模型。这个定位并不新鲜DeepSeek 当初打动市场的逻辑里也有一部分是「不在于它是不是第一而在于达到某个能力要花多少钱」。但差别在成本结构上DeepSeek 的叙事里有「低成本」这个前提而 Reflection 的前提是一万多张 GB300 和数十亿美元融资。同一个道理两种完全不同的实现路径。四、差距有多大Beam 追平的是上一代官方承认Kimi K3 在绝对能力上仍然领先。把基准表摊开看这个「差一代」是具体的基准BeamGLM-5.2GLM-5.3Kimi K3DeepSeek V4.1 FlashDeepSWE v1.1Agent 编程44.444.061.068.074.2Terminal Bench v2.180.1—88.288.390.6Humanity’s Last Exam36.2—42.346.9—怎么读这张表Beam 44.4 对 GLM-5.2 44.0—— 几乎打平。这是它「追上了上一代」的证据但对 GLM-5.3 的 61.0、Kimi K3 的 68.0、DeepSeek V4.1 Flash 的 74.2—— 差距是一整个代际不是小数点后的差距Terminal Bench 和 HLE 上也是一致的模式Beam 落在「最新一代中国模型」之下所以准确的说法是Beam 把美国的开放模型拉回到了中国顶级模型的附近但只追平了上一代的 GLM-5.2和中国最新一轮开放模型还差大约一代。五、Mistral Large 4从零自训的万亿参数和一份「自测」Mistral 这边压力更大。两三年前它是开放模型领域最有代表性的公司但随着 DeepSeek / Qwen / Kimi / GLM 快速迭代它在前沿能力榜上的存在感持续下滑。今年 9 月CEO Arthur Mensch 在采访里被直接问Mistral 的模型已经掉出Artificial Analysis 排名的前 20是不是被美国和中国落下了他当时的回答是新一代大模型即将发布公司已规划了明年两代产品新融资的很大一部分将用于扩大训练算力未来可调用的训练算力可能增加约 20 倍。两周后Mistral Large 4 发布。项数字激活参数52B总参数1.05 万亿视觉编码器16 亿参数多模态原生支持语言160上下文100 万 token训练硬件约3,800 张 Nvidia Grace Blackwell训练地点欧洲、Mistral 自己的数据中心从零训练发布状态API 预览已开完整权重 10 月底放出「从零自训 欧洲自有数据中心」是这一版最值得注意的定位选择——它不只是技术参数也是商业主张见第七节。它给的三个成绩Coding Agent Index超过 DeepSeek V4 Pro 和 Qwen 3.8 Max低于 Kimi K3Surge AI 盲测代码质量3.74—— 低于 Claude Opus 5 的 4.22但高于 Kimi K3 的 3.59、GLM-5.3 的 3.60、GLM-5.2 的 3.40AutomationBench657 个跨应用业务流程含 Gmail / Sheets / Slack / Salesforce超过 Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Pro低于 GLM-5.3⚠️ 这里必须写清一条边界以上数据大部分来自 Mistral 自己的测试而且Large 4 还在公开预览阶段真正的权重尚未放出。其中 Surge AI 那个第三方盲测是少数非自测的数据点。六、安全能力一个不常被提的卖点Mistral 这次专门介绍了网络安全能力这在开源模型发布里不常见Artificial Analysis Cyber Index 全球前 5「复现并修复真实漏洞」任务上达到82%——该测试的最高分Cybench完成93%的挑战而它强调的重点不是分数是机制Mistral 特意指出部分闭源模型因为安全拒答机制几乎无法完成某些漏洞复现任务而开放权重模型允许企业自定义安全策略可以部署在私有云或本地环境。这是一个把「开源」当作安全论据、而不是安全风险的论证结构。它成立与否取决于场景 —— 但作为一种商业话术它是对「开源更危险」这一常见说法的正面反驳。七、两家的商业模式其实在抄同一条路模型之外Reflection 和 Mistral 走的是国产厂商已经初步验证过的那条路。Reflection全栈 AI 基础设施向上基础模型 → 推理 → Agent → 软件 → 企业部署向下算力管理、集群调度长期自建数据中心Misha 给的公式收入潜力 智能密度 × 算力规模 × 企业信任他的论证开放模型本身不一定直接赚钱但能创造巨大的推理需求——就像Kubernetes 本身开源却推动了云市场它甚至把自己类比早期的 AWS 和 GCPAWS 起初是亚马逊为了解决自己的服务器基础设施问题Google Cloud 来自支撑搜索业务的大规模分布式能力。Reflection 的逻辑是为了训练前沿模型它本来就得解决万亿 token 服务、数十亿 Agent 沙箱、GPU 调度这些问题 ——这些内部技术最终可以像云计算一样对外输出Mistral欧洲版全栈 AI同时建自研模型 企业定制平台 欧洲算力基础设施主张小而高效、可定制、可部署的开放模型比只追最大规模的通用模型更符合企业需求Arthur 的判断欧洲企业不能把核心 AI 能力建立在「外国厂商是否愿意继续提供服务」之上也不能把技术底座交给别国的模型 —— 所以不只是自训模型还要在欧洲建数据中心八、两家对「为什么必须开源」的判断已经趋同这是全文最值得记的一段。一个在欧洲、一个在美国但两位创始人对开放模型的判断越来越接近核心判断AI 市场已经从**「谁能提供最好用的 API」走到「谁拥有模型、谁控制基础设施」**。Misha 把闭源 API 比作「租房」过去三年企业调用 OpenAI / Anthropic / Google 的模型本质上是租智能。这在市场早期足够简单、足够高效。但当 AI 真正进入企业核心业务事情就变了——「几年前还很小的创业公司长成了大企业大企业自己也开始真正用 AI于是所有权市场自然出现。」如果要「拥有智能」就必须能在自己的基础设施上部署模型、控制数据、修改模型、做定制——而这就要求模型必须足够开放。Ioannis 从技术角度补了一句最前沿的开放模型和闭源模型的差距在缩小「没有技术原因决定开放模型必须永远落后」。只要人才和算力足够开放模型完全有能力达到闭源模型的水平。过去企业不用开放模型核心原因只是「能力不够」现在一批中国开放模型已经能直接替代闭源模型完成大量任务商业迁移的前提已经成立。Arthur 的判断几乎一样随着开放模型能力提升大量企业不再需要为闭源模型继续支付 API 溢价。他最近说Mistral 接触到的约 99% 的企业场景都可以用开放模型完成。九、那为什么过去一年是中国模型跑在前面两家对这个问题的判断也高度一致而且都不是「某一家公司运气好」。Misha 的解释历史视角美国其实曾经拥有最强的开放模型Llama 3 是一个明显节点。但当时美国的 AI 商业市场由 API 主导Meta 或其他公司没有足够强的商业动机去持续开放最前沿的能力。中国的情况不同。DeepSeek V3 是一个重要转折点——中国的开放「智能」第一次在全球形成规模化影响此后出现了更集中的开放模型推进。Misha 认为其中很大一部分动力来自「建设自己的开放权重生态本身就有产业和战略价值」。他还补了一句很实在的「事实上这些中国实验室直到最近都没怎么赚钱。只有现在它们的模型能力足够强、市场也成熟到愿意为开放智能付费才开始产生真正的收入。」Arthur 的解释工程视角中国顶尖实验室的算力低于美国几家最大的 AI 公司但仍高于 Mistral同时它们会充分利用互联网上的数据而且迭代方式已经工业化。这些条件让它们能够快速迭代。小结「美版 DeepSeek」指的是位置不是路线。Reflection 的最后一轮 RL 就占了10,500 张 GB300、跑了 4 周—— 它是重量级版不是低成本版Beam 追平的是上一代DeepSWE v1.1 上 44.4 对 GLM-5.2 的 44.0 几乎打平但对 GLM-5.361.0、Kimi K368.0、DeepSeek V4.1 Flash74.2差一整代。官方也承认 Kimi K3 仍领先它的卖点是「单位算力产出」定位主力模型而非排行榜模型Mistral Large 4 52B 激活 / 1.05T 总参 / 100 万上下文 / 160 语言在欧洲自有数据中心、约 3,800 张 GB300 上从零训练权重 10 月底才放且多数成绩来自自测两组第三方数据是最硬的背景Hugging Face 过去一年中国模型占约41%下载Vercel AI Gateway 上开放权重模型处理了56%的生产 token去年 12 月不到 10%商业模式趋同两家都在往「全栈」走模型 → 推理 → 部署 → 算力区别是 Reflection 讲美国式全栈、Mistral 讲欧洲主权全栈判断趋同市场从「租智能」转向「拥有智能」开放与闭源的能力差距在缩小没有技术原因决定开放模型必须永远落后参考资料内容来源页面日期核验时间全部模型参数、基准表、Hugging Face 41% / Vercel 56% 两组数据、创始背景与引语、商业模式、对中国模型的判断Overseas open-source models are accelerating their development pace again: Mistral and the “US version of DeepSeek” show their hands simultaneously — 36KrInfoQ 稿2026-10-082026-10-09事件交叉确认标题与同日发布海外开源模型重新提速美版 DeepSeek第一次交卷Mistral同时亮牌 — InfoQ2026-10-08标题与日期已核正文未读取页面正文被截断Mistral Large 4 的独立报道用于确认万亿参数与开放权重时间点Mistral推出万亿参数开放权重模型 Mistral Large 42026-10-072026-10-09⚠️ 核验边界必须写明基准数字Beam 的 DeepSWE / Terminal Bench / HLEMistral 的 Coding Agent Index / Surge AI 盲测 / AutomationBench / Cyber Index全部来自厂商自测或厂商转述的第三方测试本文只做转述不做独立复现。Mistral Large 4 的完整权重 10 月底才发布—— 在此之前所有能力数字都应视为预览阶段的自测结果。Beam 的权重、技术报告、开发工具在撰写时也尚未放出官方计划 10 月内。Hugging Face 的 41% 与 Vercel 的 56%是本文引用的两组关键第三方数据但均为二手转述来自 36Kr / InfoQ 文章未直接访问两个平台的原始数据源。「美版 DeepSeek」是媒体叫法不是 Reflection 的官方定位。

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询