
最近评测圈有个很有意思的信号Octen Search 在 Artificial Analysis 的搜索评测中拿到了 77 分综合排名第三同时被标注为“速度最快”。如果不是一直盯着这块榜单看第一反应可能都是“这又是哪个新面孔”但仔细往里拆一拆这个成绩背后藏的信息量远比一个排名要大。AI 搜索这个赛道卷到今天已经过了“能不能用”的阶段各家拼的是答案质量、检索覆盖率、响应速度、成本控制这些硬指标。一个没那么大众的产品能杀进头部梯队本身就说明评测的标准化程度已经能照出不少细节。这篇文章我想把这几个关键信息拆开聊77 分是怎么评出来的、第三名到底代表什么、“速度最快”这个标签含金量有多高以及看完榜单之后我们怎么在真实场景里去验证一个 AI 搜索产品到底行不行。适合正在选型的研究型用户、做 AI 产品的从业者还有所有被各种榜单绕得眼花缭乱的人。1. 77 分是怎么评出来的Artificial Analysis 搜索评测的机制和逻辑1.1 为什么这份第三方评测值得看现在随便一搜就能找到各种“AI 搜索排行榜”但大部分不是编辑拍脑袋打分就是厂商自己出的 PR 稿参考价值有限。Artificial Analysis 不太一样它属于第三方独立评测平台核心做法是拿同一套测试集、同样的评测流程去横评不同产品尽量把主观偏好排除在外。这个思路和传统跑分软件类似不关心你宣称自己多强只看实际跑出来的结果。在 AI 圈子里这个平台做的模型能力指数、价格分析、速度基准已经被不少开发者和研究机构当成参考依据。原因无非三点立场相对中立不带厂商利益方法论相对透明能查到测试集和评分方式并且它不是一次性评测而是持续更新产品迭代之后分数会跟着变。所以当一份榜单说 Octen Search 拿了 77 分排在第三这背后有相对可靠的测试流程在支撑不是哪个自媒体随口说出来的。与其摸着石头过河挨个试用不如先看标准化测评结果再结合自己的实际场景做验证。这也是我把这份榜单当切入点的原因。1.2 搜索评测到底在考什么模型评测和搜索评测是两码事。模型评测主要看知识储备、推理能力、代码水平这些“智力”维度搜索评测更复杂考的不只是脑子还包括“找信息”和“用信息”的完整链路。拿 Artificial Analysis 这类搜索评测来说里面通常会覆盖这么几个维度评测维度考的是什么用户能感知到的点答案质量模型能否基于检索结果进行归纳、推理和完整作答回答靠不靠谱、有没有深度信息获取能力能否覆盖到时效性新闻、长尾内容、准确数据搜得全不全、准不准引用与溯源答案有没有明确来源引用链接是否真实可用敢不敢直接信它的结论生成速度从输入 query 到首 Token 返回、完整回答输出的耗时等得久不久、体验流不流畅77 分是综合加权后的结果不代表每一项都拿 77。更合理的理解是它在质量类指标上达到头部及格线以上同时在某个单项上有显著优势——结合榜单标注来看这个优势项就是速度。1.3 77 分放在 AI 搜索里算什么水平经常看各类跑分的人应该有个体感在百分制里80 分以上通常是顶流70 到 80 之间属于优秀档位60 分上下是“能用但明显有短板”。77 分刚好卡在优秀档离顶级还有距离但已经不是“能不能用”的问题而是“在哪些场景下用得更顺手”的问题。拿生活里的例子类比点外卖时看评分4.2 分和 4.8 分的店不一定差出一个层级但 4.2 分大概率意味着某几个环节会偶尔掉链子。AI 搜索也是同理77 分的产品应对日常研究型搜索、资料查找、热点信息获取都够用只是在某些极端复杂的查询上稳定性可能不如前面那两位。理解这个区间之后就不容易被“才排第三”或“也就 77 分”这种话带偏节奏。2. 第三名背后头部搜索产品正在比什么2.1 能进前三的产品走的是两种完全不同的路能在 AI 搜索综合评分里站上前排的产品基本分两类。一类是拥有自研大模型和完整生态的大厂系产品模型、算力、流量入口全都在自己手里靠的是体系作战另一类是专注搜索场景的垂直产品不追求大而全但把检索、排序、生成这一整条链路打磨得非常细致。Octen Search 从公开信息看更接近后者。它不需要照顾一千个使用场景只需要把“搜索”这一件事做透。这类产品的典型打法是把资源集中在信息获取和答案生成的效率上牺牲一部分通用能力换来在搜索任务里的极致表现。评测榜单恰好只看结果不看背景所以这类产品时不时会冲进前排。这对行业的启示挺直接在 AI 时代规模不一定等于排名专注度和单点执行力完全可以弥补资源差距。2.2 排名第三意味着什么第一梯队的位置稳不稳排第三意味着前面还有两个综合评分更高的产品。这三者之间的差距可能只有几分也可能有十分八分的差距具体要看评测周期内的实际数据。但有一点可以确定能稳定排进前三说明它在大多数评测样本里的表现都能维持在优秀档位而不是偶尔一次运气好刷上去的。对于用户来说第三名和第一名在日常使用中的体感差异往往没有分数差距看起来那么大。比如一个产品综合 82 分另一个 77 分差距可能只集中在某些长尾问题、特定领域知识的覆盖度上而大部分人都不会一天到晚去问那些极端刁钻的问题。反而是一些“单项冠军”能带来更直接的体验提升比如打开就出结果的速度、稳定的引用来源。所以我在看这类榜单时从来不会只盯第一名而是会看每个产品是靠什么优势坐上这个位置的。2.3 头部竞争的本质从“有没有”转向“快不快、准不准”AI 搜索赛道前两年的竞争主题是“谁能做出能用的产品”现在的竞争主题已经明显变成“谁能做得更快、更准、更省”。Octen Search 以 77 分排第三并拿下速度第一说明市场对“效率”的权重正在不断提高。搜索体验里有一个常被忽略的事实用户对速度的感知是全链路的。从按下回车到看到第一个字再到完整回答生成完毕任何一环卡顿都会被放大成“这产品不行”。当各家答案质量趋近于同一水平线时响应速度就成了最直观的差异化指标这也是速度排名会单独列出来的原因。3. “速度最快”这个标签含金量比想象中高3.1 搜索场景里的用户耐心比聊天场景还要短用过 AI 搜索的人都会有类似体验传统搜索引擎零点几秒出结果AI 搜索要先理解问题、检索网页、再组织答案天然就慢了一截。一旦响应时间超过几秒用户就会开始焦虑甚至直接划走。业界对生成式搜索的速度预期普遍认为首 Token 返回在两秒内才算比较舒服完整回答能控制在十秒内就属于可接受范围。Octen Search 能在这个维度排第一意味着它在大部分测试请求里都做到了“快到让人几乎感知不到等待”这种体验在搜索这种高频场景里价值比在聊天场景里大得多。毕竟聊天可以等一等搜索是带着明确目的来的等不起。3.2 快从哪里来工程侧的全链路优化具体的架构细节官方没有完整披露过但根据行业通用的做法一个搜索产品要做得快通常会在这几个环节上下功夫第一是检索与生成并行化。传统流程是“先检索完所有资料再开始生成答案”这意味着模型要干等检索结果。现在主流的做法是边检索边生成先把初步框架搭出来再根据陆续返回的资料补充细节整体耗时能压缩一大截。第二是热查询缓存。搜索流量里有一部分是高频重复问题比如天气、常识、常见教程直接命中缓存返回结果就不需要每次都走完整检索链路。当然这要求产品在缓存和时效性之间做取舍新闻类查询不能盲目缓存。第三是模型路由。简单问题走轻量小模型复杂问题才切到重量级模型去处理。大部分搜索请求其实用不着 100B 参数的模型用小模型快速答完既省时间又控成本。第四是流式输出设计。先让用户看到正在生成的内容而不是憋半天一次性吐出一大段。哪怕完整回答需要十秒只要第一行字一秒内出现用户的主观等待感就会降低很多。Octen Search 能把速度做到第一大概率是上述几种方案组合出来的结果而不是单纯靠“换个快模型”。3.3 快而不强的陷阱这个产品是怎么避开的AI 搜索产品里一直有“快而不强”的陷阱把模型换小一点、把检索深度砍掉一点速度自然就上去了但答案质量会直线下滑。评测里有一个关键信息容易被忽略——它拿到的是 77 分综合分不是 60 分。也就是说它在保持质量处于头部梯队的前提下做到了速度最快没有牺牲智商去换速度。这给产品设计提供了一个很好的示范效率优势一定要建立在质量不掉队的基础上否则“快”就失去了意义。反过来看如果哪天出现一个产品跑分只有 40 分但号称速度第一那你得想想它到底牺牲了什么。3.4 不同场景下速度的权重完全不一样速度很重要但不是所有场景都把它放在第一位。做深度调研、论文检索时我宁愿多等十几秒换取答案更全面、引用更扎实但如果是查一个新闻事件、确认一个事实、临时找一段资料那“秒回”带来的体验提升是决定性的。Octen Search 在速度上的优势最适合的正是后一类场景——高频率、短耗时、需要快速拿到结论的信息获取任务。这也说明选 AI 搜索工具不能只看总分得想清楚自己的主要使用场景更吃哪个指标。别人眼里的缺点可能在你这里根本不是问题别人眼里的单项冠军可能在你的场景里也发挥不出价值。4. 看完榜单之后怎么在真实场景里验证一个 AI 搜索产品4.1 自建一套十分钟压力测试题排行榜可以作为起点但最终要不要把它设为默认工具建议花十分钟做一次自己的实测。测试集不用太复杂重点覆盖几类问题就好时效性查询问“今天某项政策或某个公司发布了什么新动态”看它能否抓到最新信息并标注时间。多条件推理设计一个需要同时考虑三四个变量的分析型问题看答案是完整推理还是只罗列资料。长尾小众话题问一个专业领域里的冷门问题检验检索覆盖能力。诱导幻觉类问题问一个不存在的事件或人物看它会不会一本正经地编答案。记录四个维度首字返回时间、完整回答时间、引用来源是否真实可查、连续问十次有没有明显波动。这四项跑完基本就能判断一个产品适不适合自己。4.2 给开发者的额外建议别只看平均分如果你是想把 AI 搜索能力接进自己产品的开发者需要看的比普通用户多一些。平均延迟只能代表理想状态更关键的是延迟分位数和稳定性。接口偶尔一次卡顿可以接受但如果 p95 延迟是平均值的几倍说明系统在压力下的表现不可靠上线之后会被真实流量教做人。另外一个容易踩的坑是只测单请求不看并发。搜索类产品一旦流量上来并发请求会直接影响响应速度。建议做小流量灰度验证用自己业务里的真实 query 去压一压观察延迟分布和错误率再决定要不要全量接入。榜单分数代表产品的理论能力上限生产环境的稳定性才是你能不能用的底线。4.3 解读评测报告最容易犯的三个错误第一个错误是只看总分不看单项。77 分这个数字如果不拆开看你永远不会知道它的强项是速度还是质量也就没法判断适不适合自己的场景。第二个错误是用历史榜单预测未来。AI 搜索产品迭代极快这个月的第一下个月可能跌出前三榜单只是一个时间切片不能当成永久结论。第三个错误是忽略评测集和你自身需求的差异。评测机构有自己定义的“好答案”标准但这个标准不一定贴合你的使用场景。所以任何第三方评测都只是辅助参考真正有说服力的还是自己跑出来的结果。我自己做产品这些年用过很多 AI 搜索工具最大的体感是榜单分数解决的是“要不要试一下”的问题而解决不了“值不值得长期用”的问题。一个产品能在第三方评测里拿 77 分、进前三、做到速度第一确实给了它一个值得被认真对待的理由但这只是起点。最终决定它能不能成为你日常主力工具的永远是你拿自己的问题去反复测试之后得出的结论。评分可以告诉你该看谁但不可以替你做决定。