Jev专题:Jev在科学决策点能顶替大模型吗?选错关系却算出正确标签怎么办

发布时间:2026/9/24 16:31:36
Jev专题:Jev在科学决策点能顶替大模型吗?选错关系却算出正确标签怎么办 1《三年面试五年模拟》AIGC / LLM / AI Agent 算法工程师与开发工程师求职面试秘籍独家资源见 WeThinkIn/AIGC-Interview-Book欢迎 Star2AIGC / LLM / AI Agent 算法岗与开发岗求职面试内推学习社群涵盖 AIGC、LLM 大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI 等方向的最新面试干货与核心知识欢迎加入(https://t.zsxq.com/DZRng)论文标题Jev for Scientific Decisions: Evaluating Semantic Choices and Their Consequences论文作者Boyuan DengJohns Hopkins University通讯作者、Shuyi FanColumbia University、Hongyang ZhangThe Hong Kong Polytechnic University、Xinhong XieThe Pennsylvania State University发表时间2026年9月21日目录一、Jev的System One定位与官方分工二、20道Choice与共享的评测harness三、语义、下游、标签三层分开打分四、12种配置的正确率、延迟与成本五、培养历史题上7次选错却保住标签六、样本20题与参考答案怎么定七、Jev Choice原语与代码分工实践八、总结与思考本文要点1论文把Jev当成科学工作流里的语义决策部件来评20道有出处的Choice、10个案例、每题重复5次、12种模型配置算术全部交给共享代码。2Jev和GPT-5.6 Sol、GPT-6 Astra、Claude Sonnet 5、Claude Opus 5、Kimi K3一样100道语义题全对成功响应中位延迟0.335秒12种配置里最低每1000次成功请求0.0595美元。3方法上的贡献是把选的关系、下游算出的数量、最终标签分开打分。三个对照模型在一道培养历史题上共7次选错下游计数变了标签却一个没错。4短板是样本只有20题参考答案由作者定且6组只有助手复核标签全是inconsistentJev只是与5家持平。5文末附TypeSafe官方文档的Choice调用示例以及按论文分工改写的两题一请求、代码计数写法。2026年9月21日四位分别来自约翰霍普金斯、哥伦比亚、香港理工和宾州州立的作者把一篇短论文挂上arXiv题目叫Jev for Scientific Decisions。我把HTML全文、正文和附录的五张表以及TypeSafe的官方文档对了一遍数字以论文表1和附录C为准。论文只做一件事。科学工作流里经常要先判断一段实验描述说的是什么关系比如十个数据点来自十瓶分别培养的菌液还是同一瓶菌液取了十次。判断完代码才能开始数。作者把这种判断交给Jev和另外11种大模型配置一共20道选择题每题重复5次再分三层打分。结果是Jev和另外5种配置一样100道语义题全对成功响应的中位延迟0.335秒12种配置里最低。另一头的发现更要紧三个对照模型在一道培养历史题上共选错7次下游计数跟着错最终标签却一个都没错。一、Jev的System One定位与官方分工Jev是TypeSafe AI在2026年9月15日发布的模型官方叫它System One决策模型。创始人Diogo Almeida此前在OpenAI做研究公司拿了DCVC领投的4000万美元种子轮。它不生成文本输入一段state加若干事先声明类型的问题一次前向并行返回每个问题的答案和概率分布。三种原语。Noul是是非命题返回P(yes)。Choice是多选一最多255个选项返回选中项、每个选项的概率和一个confidence。Score是有序打分2到10档。定价输入每百万token 0.042美元输出免费官方给的端到端延迟是70到500毫秒上下文64k只支持文本。训练方法叫RLCD官方只公开了名字和目标。官方文档有一页叫Jev 1.13 jaggedness列了九种已知短板第二条就是数学和数字。文档的意思很直接Jev不是计算器计数、日期比较、数值大小都应该放进代码模型只管语义判断。论文的整套评测就是照这条分工搭的。二、20道Choice与共享的评测harness论文2.1节说明材料来源。作者手里有一个开发集20组案例40道科学Choice外加一个工程对照题。其中10组的20道题靠针对段落写的代码规则就能解决不用调模型。剩下10组各有两道题需要模型做语义选择这20道就是对比的全部样本。十个案例的领域散得很开附录表3列全了。钛合金粉末回收的批次来历、疲劳测试的阶梯应力、宇宙学配对模拟、气候大集合的两种强迫协议、电学计量的共享参考、云播撒的配对山脉分配再加四个生物题跨代暴露、细菌培养历史、RNA混样测序、CRISPR嵌合体。每个模型拿到的东西一样证据段落、结构化记录、问题说明和候选含义。参考答案和待验证的声明留在模型输入之外。harness按Jev文档的要求提原子问题每题指向给定证据计数、过滤、算术和标签组合全部留在代码里。Jev走原生Choice接口其他11种模型通过约束JSON schema返回候选编号。一组的两道题在同一次请求里提交。这样证据和下游程序对所有模型固定差别只剩模型选了哪个候选。图1里还画了一条code-only分支绕过模型直接走规则用来检查代码本身。三、语义、下游、标签三层分开打分论文2.2节给了一个很短的形式化。模型f从证据e和带候选的问题Q里选出关系r共享程序g拿着e和r算出科学输出z和最终标签y。参考答案有三份r*、z*、y*各对一层。语义正确要求每道Choice选中的候选和参考完全一致。下游精确要求该案例声明的全部输出字段一致包括计数、布尔关系、符号表达式和未知值类型也要对漏填一个值和明确写未知算两回事。标签正确只看最终那个consistent、inconsistent或insufficient evidence。论文另报一个联合正确要求语义和下游同时全对。为什么要分三层论文说得很直接。程序g可以把不同的关系映射到同一个数量或同一个标签也可以把一个错的关系精确执行出一个错的科学结果。只看标签前一种漏掉错误。只看下游数字后一种又分不清是模型选错还是代码写错。还有一个更硬的理由。交给模型的十个案例参考标签全是inconsistent。一个永远回答inconsistent的基线在标签这一层能拿满分。所以论文明说标签正确率没有区分度实质比较看语义和联合。四、12种配置的正确率、延迟与成本表1是全文的核心结果。每种配置计划50次请求100个语义答案。正确率用计划分母算没返回的请求不给分但和选错分开记。延迟是客户端测到的请求耗时取成功响应的中位数和95分位。成本是每1000次成功响应的已知平均费用r表示服务商账单e表示按token用量估算。配置返回/50语义/100下游联合/50标签/50中位延迟(秒)p95(秒)成本($/1000次)Jev 1.135010050500.3350.4420.0595®GPT-5.6 Luna509949501.5092.7530.2025(e)GPT-5.6 Terra499849491.1662.1471.5391(e)GPT-5.6 Sol5010050501.3852.3703.0470(e)GPT-6 Astra5010050502.3844.4187.6174(e)Claude Sonnet 55010050502.1625.4224.2502(e)Claude Opus 55010050503.2373.96710.6965(e)Qwen3.8 Flash4283414214.18234.3200.4013®Qwen3.8 Max 09025095455014.23621.3934.8302®DeepSeek V4.1 Flash489648485.4498.8210.3508®DeepSeek V4 Pro 0813499849497.56910.0863.4299®Kimi K350100505011.11625.7445.4663®语义全对的有六家Jev、GPT-5.6 Sol、GPT-6 Astra、Claude Sonnet 5、Claude Opus 5、Kimi K3。选错的只有三家Luna错1次Qwen3.8 Flash错1次Qwen3.8 Max错5次7次全落在同一道题上。另一类扣分来自没返回。Terra、两个DeepSeek和Qwen3.8 Flash都有请求没回来。附录C按收到的答案重算Terra是98/98DeepSeek V4.1 Flash是96/96V4 Pro是98/98答了的全对分丢在可用性上。Qwen3.8 Flash只回来42次是可用性最差的一个。延迟这一列差距最大。Jev中位0.335秒p95是0.442秒。语义全对且全部返回的配置里第二快是Sol的1.385秒往后Sonnet 2.162秒Astra 2.384秒Opus 3.237秒Kimi K3到了11.116秒。Qwen两款都在14秒以上p95分别是34秒和21秒。成本上Jev每1000次成功请求0.0595美元折下来一次大约0.00006美元。Sol是3.047美元Opus是10.6965美元。脚注要看清Jev、Qwen、DeepSeek、Kimi是服务商账单OpenAI和Anthropic的是按token用量估算推理设置和缓存状态都会动这个数。论文还写明没返回的请求怎么收费、证据准备、候选构造和人工复核的花费都没算进去。五、培养历史题上7次选错却保住标签B002案例用的是1943年Luria和Delbrück的细菌抗噬菌体突变实验。实验11a的十个样本取自同一瓶培养液实验11的十个样本来自分别培养的十瓶。参考的生长历史计数是(1,10)。第一道Choice问每个系列内部的样本是否共享培养历史第二道问平板上的菌落之间是什么关系。7次错选都在第一道题上。4次把两组顺序颠倒成(10,1)2次判成两组都共享培养历史得到(1,1)1次判成都不共享得到(10,10)。第二道题7次都答对了菌落是克隆后代。这一条正确判断否定了每个菌落代表一次独立突变起源的声明声明里有一个子句被否定最终标签就落到inconsistent。于是出现论文标题里说的后果。生长历史算错了标签照旧正确。附录C给了总数12种配置共收到588份完整响应588个标签全对下游精确的只有581份1176个Choice里对了1169个。差的7份就是这一道题。论文把这条线接到Ho等人2025年在SciFact表格上的发现那篇说声明标签对了单元格级的依据却是错的。这里错的依据换成了一个会被后续分析复用的数量。只看最终结论的评测会把这7次算成满分而工作流已经把错的计数往下游传了。六、样本20题与参考答案怎么定论文的Limitations写得比很多同行诚实我把要紧的几条列出来。样本只有10个案例20道Choice同一套英文材料在5次重复里反复出现重复测的是同样输入下的方差科学样本仍是20题。六家全对意味着这套题对前沿模型已经没有区分度7次错全在一道题上能说明的只是这一道题的难点。参考答案怎么定是第二个问题。附录A.2写明参考选项、下游输出和构造的声明由作者借助助手审阅后决定14组做了人工复核另6组只有助手复核E004、E005、E009三组模型题没有进入额外的来源复核。没有领域专家小组也没有标注者一致性估计。第三标签全是inconsistent20个参考选项里没有一个是not_stated、other或conflicting。模型面对缺证据、有矛盾的情况会不会弃答这套题测不出来。第四开发集和测试集是同一批材料论文自己说这只刻画了所提供的这些决策迁移能力要另建来源分离的新案例。最后是Jev的位置。它和5个配置持平没有领先。它赢的是延迟和成本两列这两列受服务窗口、推理设置和缓存影响论文也只声称在这一次收集里成立。每个模型只跑了一种harness实现哪一部分设计起了作用没有做消融。七、Jev Choice原语与代码分工实践论文没有公开harness代码正文里那句随附代码和结果在v1里没有链接。下面的调用示例出自TypeSafe官方文档我再按论文2.1节描述的分工把它对到B002那道题的形状上。安装Python SDK要求Python不低于3.10客户端从环境变量TYPESAFE_API_KEY读密钥默认调jev-latest。命令出自官方Quick start。pipinstalltypesafe-sdk官方Choice页给的最小示例如下。state是一段文本questions是一个字典每个Choice带instructions和criteriacriteria的键是选项名值是选项说明键和值都会发给模型。fromtypesafe_sdkimportChoice,TypeSafeClientwithTypeSafeClient()asclient:responseclient.system_one(stateMy running shoes arrived in the wrong size. Can I swap them for a size 10?,questions{department:Choice(instructionsWhich team should handle this?,criteria{returns:Exchanges, wrong or damaged items,shipping:Delivery status, delays, lost packages,billing:Charges, invoices, payment problems,},),},)print(response.answers[department].choice)返回的answers[department]有三个字段。choice是概率最高的选项probabilities是所有选项上的分布且和为1confidence由分布的集中程度算出0到1。官方建议列表可能盖不住输入时加一个other或none of the above选项。把这个形状套到论文的B002题上请求大致长成下面这样。这段是我按官方请求格式和论文附录A.3对候选项的描述改写的选项名和证据段落是示意论文原始packet没有公开。fromtypesafe_sdkimportChoice,TypeSafeClient evidence{passage:Experiment 11a: ten samples plated from a single culture. Experiment 11: ten samples, each from a separately grown culture.,records:{exp_11a:[...],exp_11:[...]},# 两列完整的平板记录}questions{culture_history:Choice(instructionsWithin each series, do the plated samples share one culture history? Answer from the passage only.,criteria{shared_11a_separate_11:Series 11a shares one culture; series 11 uses separately grown cultures,separate_11a_shared_11:The reverse assignment,separate_both:Both series use separately grown cultures,shared_both:Both series share one culture,not_stated:The passage does not say,conflicting:The passage gives incompatible statements,},),colony_origin:Choice(instructionsWhat does one colony on a plate represent?,criteria{clonal_descendants:Descendants of one resistant cell,one_origin_per_cell:Each cell is an independent mutation origin,selection_induced:New origins created only at selection,not_stated:The passage does not say,},),}withTypeSafeClient()asclient:answersclient.system_one(stateevidence,questionsquestions).answers historyanswers[culture_history].choice n_11alen(evidence[records][exp_11a])n_11len(evidence[records][exp_11])GROWTH_HISTORIES{shared_11a_separate_11:(1,n_11),separate_11a_shared_11:(n_11a,1),separate_both:(n_11a,n_11),shared_both:(1,1),}countsGROWTH_HISTORIES.get(history)# 参考答案是(1, 10)not_stated或conflicting得到None停止组合标签几处对应论文的地方。两道题放在同一个请求里和论文两题一起提交一致。计数用len在代码里做模型只选关系这是官方jaggedness页第二条和第八条的要求。not_stated和conflicting是论文给每道题都配的显式选项附录A.4规定矛盾优先于外部候选外部候选优先于缺证据三者都会中止标签组合。官方那页还给了一个计数的正解。要数一个列表里有几个水果名官方的做法是给每一项各提一个Noul代码把大于阈值的加起来计数本身不进模型。fromtypesafe_sdkimportNoul,TypeSafeClient clientTypeSafeClient(modeljev-1.13)YES0.5items[typesafe,apple,california,banana,likes,calibration,orange,vertex]resultclient.system_one({items:items},{fitem_{i}:Noul(instructionsfIs items[{i}] the name of a fruit?)foriinrange(len(items))},)countsum(result.nouls[fitem_{i}].noulYESforiinrange(len(items)))论文正文没有提到用confidence做门控也没有报告Jev在那道培养历史题上的概率分布。官方文档的推荐做法是confidence低于某个阈值时交给人这一层论文留空了。八、总结与思考这篇论文最有用的部分是那份评测合同模型选关系、代码算数量、三层分开对参考。数字本身说明的东西有限六家满分要么题目对前沿模型太容易要么这类准备好的决策点确实已经不难。两种解释论文都没有排除。Jev在这类证据已备好、候选已列明、下游已写死的决策点上是一个合理选项。0.335秒和每次0.00006美元的账对一个要跑几万次判断的流水线是实打实的差别。但把证据段落切好、把候选关系列全这两步的成本论文没算这部分在科学工作流里往往才是大头。jaggedness页还写明state里的无关内容会拉低准确率过滤也得在代码里做。不要把这篇当成Jev优于大模型的证据。GPT-5.6 Sol、GPT-6 Astra、两款Claude和Kimi K3在语义这一层与它完全一样。它赢在延迟和成本输在没有任何一道题能把它和这五家分开。要说服人需要一套有not_stated正确答案、有矛盾证据、来源与开发集分离的新题。对做Agent流程的读者三层打分的思路可以直接搬走。任何模型选、代码算的环节都该保留模型选了什么而且要单独对一遍。培养历史题那7次错选如果只看最终标签一辈子发现不了。我最想看的后续有两个。一个是Jev和其他模型在错选那道题上的概率分布confidence能不能提前报警。另一个是同一套harness换成来源分离的测试集后六家还能不能都满分。参考链接论文原文 arXiv 2609.24965 v1Jev for Scientific Decisions2026年9月Jev发布博客 Introducing System One models and JevJev官方文档 docs.typesafe.ai其中Choice原语与Jev 1.13 jaggedness是论文引用的三份文档中的两份Jevals评测方法 How Jevals scores a decision论文引用的基准 PubMedQA、SciFact论文引用的标签与依据分离研究 Ho et al. 2025, Table-text alignment

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询