Sonnet 5.5 发布:打工人的新旗舰,性能逼近Opus 5.5,价格只要一半

发布时间:2026/9/30 16:57:52
Sonnet 5.5 发布:打工人的新旗舰,性能逼近Opus 5.5,价格只要一半 Claude Sonnet 5.5 终于发了前不久发的 Claude Opus 5.5 毫无疑问是我最想用的模型各方面都是最优的但问题是太贵了。且非常的不经用才发几天我就把它一周额度蹬完了后面一直靠着 Codex 在苦撑所以我急需那款性价比更高的。今天它终于来了先看看价格它是 Opus 5.5 的一半也是目前 Claude 5 系里面最便宜的。当然更便宜的 Haiku 官方透露也会在几星期之内发布。![▲ 图AA 榜单的模型指数与价格除了价格减半它跟上一代 Sonnet 5 的价格其实是一样的。但是官方称做同一件事情它能少花 30% 的 TOKEN生成的速度也会快 30%。所以这真的可谓是加量不加价。而且还有点啊就是 Sonnet 5.5 其实对标的是 GPT-6 Sol所以它们的价格也是完全一样的。从第三方 AA 的数据来看Sonnet 5.5 在各个推理级别都是碾压 GPT 6 Sol 的我画了一个斩杀线可以看到不管 GPT 6 Sol 也好还是 Kimi K3、Opus 5甚至是 Claude Fable 5.1都在它的斩杀范围之内。](https://i-blog.csdnimg.cn/direct/0e3b25b6724c4b9a80a58712e02f6c93.png)![▲ 图AA 指数与费用散点图图上我选的是 Max 档我对比过其他档也类似只有 Medium 是 Sonnet 5.5 和 GPT 6 Sol 是接近的这么看用 Sonnet 5.5 起码得从 High 起步才能拉开差距。性价比之外具体的能力到底怎么样我还没深度测试先看看官方介绍01 性能直逼 Claude 旗舰 Opus 5.5每次发布都会有一堆的 benchmark 值这次当然也不例外了。我们还是从这个表格开始吧。](https://i-blog.csdnimg.cn/direct/be71a7d0826c415f8c95b0e698f7528f.png)![▲ 图官方基准测试对比表从官方列出这个表格来看啊只要瞄一眼你就会发现Sonnet 5.5 这几个关键指标基本上都已经接近 Opus 5.5 了甚至在 Terminal Bench 方面它比这个旗舰的 5.5 还要厉害。Terminal-Bench 4.0 看模型能否在命令行里完成多步骤任务官方注明 Opus 用的是 Xhigh 档的最高成绩。CursorBench 4.0 测真实编码任务Sonnet 5.5 拿到 55.5%接近 Opus 5.5 的 57.8%。编码能力的提升是它接手 Claude Code 日常工作的主要依据。知识工作方面这里用了我们常用的那个指标 GDPval-AA这个指标测试涵盖 44 个职业和 9 个主要行业主要用来评估模型在实际任务中的表现。这一项 Sonnet 5.5 只比 Opus 5.5 低 2 分而隔壁 OpenAI GPT 6 Sol 是什么级别呢它竟然低了近 20%所以 Sonnet 5.5 基本上已经是天花板级别的了。自从 GPT 6 Astra 出来之后呢我会大量使用到电脑操控。那在这项里Sonnet 5.5 的提升非常明显它提升了有 40%已经和 Opus 5.5 持平了。也就是说在电脑操控方面Sonnet 5.5 也是非常能打。第三方的 Artificial Analysis 智能指数可以看到它的各档都非常强。Max 档已经超过了 GPT 6 Astra它的 High 档呢也接近 GPT 6 Sol 的 Max 档。所以还是前面我说的这个如果要用 Sonnet 的 5.5看来至少得从 High 档起步。](https://i-blog.csdnimg.cn/direct/cc47d05de2c24ade884dbcc976fd1d67.png)![▲ 图AA 智能指数各推理档位官方的资料里面给了很详细的各个指标在每个档的表现大家可以去看一下。比如我下面这个图就是 Terminal Bench 在它的各个档位下的表现。可以很明显的看到换一个档位它的性能提升是非常明显的。不管从 Medium 到 High还是 High 到 X High这种提升效果会比 Opus 5.5 还要更夸张。Opus 5.5 实际上来讲到了 High 之后后面的两个档好像就没什么太大变化了。不过这里要注意的是这个参数它对比的 GPT 5.6不是 6-Sol。](https://i-blog.csdnimg.cn/direct/f52815c82df5415e984d82f5ba87aea3.png)![▲ 图Terminal-Bench 4.0 成本对比另一项参数就是知识工作里面呢看来很明显Sonnet 5.5 是碾压 GPT 6 Sol它的 Med 甚至就已经是 GPT-6 Sol 的天花板看来它是打工人的新旗舰。](https://i-blog.csdnimg.cn/direct/75d4ddd174384ea7ba093f49a7183db7.png)![▲ 图AA-Briefcase 成本对比我们可以根据自己的需要来调整推理的级别这样来取得一个最佳的性价比。在 Claude Code 和 Claude APP 里面呢它的默认推理级别都是 Medium。更低的推理级别就意味着响应速度更快使用的 Token 也更少适合日常的工作。那在更高的设置下面Claude 的推理时间就更长检查也会更彻底。02 Sonnet 5.5 是来接日常工作的Anthropic 给两个模型分的工很清楚。Opus 5.5 处理需要长时间判断、边界模糊的复杂工作Sonnet 5.5 更适合范围已经说清楚的日常任务修 bug、改代码以及做文档、幻灯片、表格。官方还特别强调了它的界面设计能力。这个定位很好理解就是目标、任务都很清楚了在执行方面 Sonnet 5.5 最适合不过了。比如项目里已经确定要改什么让模型定位问题、修改文件、检查结果或者材料已经齐了让它整理成一份可以继续编辑的文档。这样的工作不需要每一步都调用最贵的模型。任务目标本身还不清楚、需要在几个方案之间持续权衡时再交给 Opus 5.5 更合适。03 参考资料01AnthropicClaude Sonnet 5.5 发布说明https://www.anthropic.com/claude-sonnet-5-5](https://i-blog.csdnimg.cn/direct/ede6e5f56dc24e948d2e74bbab651167.png)

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询