DeepSeek V4 Pro / GPT-5.5 / GPT-o3 并列 80.52 分:2026-08-05 Smoke 快测简报

发布时间:2026/9/23 4:36:47
DeepSeek V4 Pro / GPT-5.5 / GPT-o3 并列 80.52 分:2026-08-05 Smoke 快测简报 2026-08-05 赢政指数 Smoke 快测覆盖 9 个模型DeepSeek V4 Pro、GPT-5.5 与 GPT-o3 以 80.52 分并列当日首位。Smoke 为每日 10 题快测适合观察短期信号不等同 Full 周榜结论。一、评测方法本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度主榜公式为0.55 × 代码执行 0.45 × 材料约束。由于每日样本量较小单日分数更适合作为监控信号而不是对模型能力做长期定论。二、当日排名排名模型主榜代码执行材料约束诚信#1DeepSeek V4 Pro80.5210056.7pass#2GPT-5.580.5210056.7pass#3GPT-o380.5210056.7pass#4Claude Sonnet 4.674.0996.946.2pass#5Gemini 2.5 Pro73.7481.364.5pass#6Claude Opus 4.771.947568.2pass#7Gemini 3.1 Pro55.527531.7pass#8Grok 455.527531.7pass#9Qwen3 Max49.7271.922.6pass三、数据解读DeepSeek V4 Pro、GPT-5.5 与 GPT-o3 并列主榜 80.52其代码执行均为 100、材料约束均为 56.7显示出代码执行满分而材料约束中等的结构搭配。Claude Sonnet 4.6 主榜 74.09代码执行 96.9、材料约束 46.2同样呈现代码执行强势、材料约束偏弱的特征。与上一同口径 run 相比Qwen3 Max 主榜下降 35.1 分代码执行 -20.8 分、材料约束 -52.6 分Grok 4 主榜下降 28.8 分代码执行 -25 分、材料约束 -33.5 分Gemini 3.1 Pro 主榜下降 27.6 分代码执行 -22 分、材料约束 -34.4 分Claude Opus 4.7 主榜下降 17.5 分代码执行 -22 分、材料约束 -12 分Gemini 2.5 Pro 主榜下降 15.8 分代码执行 -18.7 分、材料约束 -12.3 分这些降幅集中在材料约束与代码执行两项需后续 run 复核以区分题目抽样波动还是真实退化。四、关键观察头部模型多依赖代码执行高分支撑主榜而材料约束得分普遍较低形成明显结构差异异动模型的同步下滑提示可能存在单日测试波动需通过多轮复测确认稳定性本次未保留可发布的异常信号本文首发于赢政天下 (https://www.winzheng.com)获取更多深度技术内容与资源欢迎访问官网。

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询