Harvey LAB贡献指南:如何添加新法律任务

发布时间:2026/9/21 3:31:54
Harvey LAB贡献指南:如何添加新法律任务 Harvey LAB贡献指南如何添加新法律任务【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labsHarvey LABLegal Agent Benchmark是一个开源的法律智能体基准测试项目它内置覆盖 24 个法律执业领域、1600 个真实感法律任务的数据集以及一套可运行、可评分的 Agent 执行框架。除了跑分Harvey LAB 最欢迎的贡献之一就是添加新的法律任务——编写任务说明、合成文档和评分准则rubric。本文是一份面向新手的完整教程带你从零理解任务结构、写好 task.json、打磨评分标准到提交前跑通全部校验命令。先了解Harvey LAB 有哪几种贡献方式在动手之前建议先通读官方的 CONTRIBUTING.md它列出了项目的五条主要贡献路径贡献方式说明适合谁 添加/改进基准任务编写任务指令、文档、交付物和评分准则有法律背景或想练手的贡献者✍️ 打磨 rubric 评分准则让评分标准更具体、可审计熟悉评分机制的贡献者 添加模型适配器将新的 LLM 提供商接入执行框架有工程经验的贡献者 运行评测与批量测试对比模型、诊断失败、生成报告所有贡献者 更新文档保持教程、架构说明与代码同步所有贡献者几条铁律来自贡献规范只使用合成的人物、公司、律所、地址和案件事实绝不包含真实客户材料任务必须自包含在tasks/目录下rubric 必须显式审阅者只读match_criteria就能知道通过长什么样优先提交小而聚焦的 PR并在提交前跑通相关离线测试。环境准备两条命令完成初始化贡献前你需要一个能跑评测的环境。克隆仓库后执行官方安装脚本 scripts/setup.shgit clone https://gitcode.com/GitHub_Trending/ha/harvey-labs cd harvey-labs ./scripts/setup.sh首次运行需要几分钟。之后在仓库根目录的.env文件中配置 API Key默认评委模型需要 Anthropic 的 Key可选其他提供商ANTHROPIC_API_KEY...更完整的入门流程含跑任务、评分、看报告见 docs/tutorial.md。新法律任务目录结构把 task.json 放对位置Harvey LAB 采用文件系统优先的设计详见 docs/architecture.md没有数据库、没有服务一个任务就是一个目录。任务 ID 就是它在tasks/下的斜杠分隔路径支持扁平或嵌套两种形式tasks/practice-area/task-or-workflow/optional-scenario/ ├── task.json # 任务定义指令、交付物、评分准则 └── documents/ # 合成的案件源文档 ├── source-document.docx └── source-spreadsheet.xlsx例如嵌套任务real-estate/extract-psa-key-terms/scenario-01和扁平任务corporate-ma/analyze-qoe-reconciliation都是合法的。想找一个真实例子参考推荐看 tasks/corporate-ma/analyze-qoe-reconciliation/task.json——一个收益质量对账与收购价格分配备忘录任务包含 4 个交付物和数百行细粒度评分准则。task.json 字段详解最小可运行配置task.json是整个任务的灵魂。最小可用配置如下{ title: Analyze Change of Control Provisions Across Targets Material Contracts, work_type: analyze, tags: [MA, due-diligence, change-of-control], instructions: Analyze the source documents and produce coc-analysis-report.docx., deliverables: { coc-analysis-report.docx: coc-analysis-report.docx }, criteria: [ { id: C-001, title: Identifies the key change-of-control consent issue, match_criteria: PASS if the report identifies the material contract that requires consent before closing and explains the consequence. FAIL if it omits the consent issue., deliverables: [coc-analysis-report.docx], sources: [material-contract.docx] } ] }各字段的作用与是否必填字段必填说明title✅人类可读的任务标题instructions✅发送给 Agent 的指令提示词criteria✅内联的全通过all-pass评分准则列表deliverables建议期望产出的文件名映射work_type建议取analyze/draft/review/research之一tags可选用于任务发现与可视化统计每条准则criterion还包含id唯一标识如C-001title准则描述性标题match_criteria实质评分标准——评委 LLM 判分的唯一依据deliverables该准则只读取这些输出文件作用域隔离避免串扰sources可选该准则相关的源文档文件名。写好 rubric让评分标准一眼可判Harvey LAB 采用全通过all-pass计分只有当所有准则全部通过时任务才得 1.0 分否则为 0.0 分原理见 docs/eval-strategies.md。这意味着你写的每一条准则都是发射关键项。官方给出的好准则标准点名具体事实写明要求的事实、问题、条款、计算、截止日期或起草动作带上具体数值相关时写明期望的数字、日期、当事方和阈值❌写清失败模式用FAIL if ...的语言描述常见错误限定交付物范围把准则限定在评委应读取的文件上不加锦上添花的冗余项——它们只会拉低全通过率不产生真实质量信号。另外注意不要添加遗留的weight字段当前计分方案中所有准则等权。提交前验证三条命令跑通再提 PR任务写好后按顺序执行以下验证均来自 CONTRIBUTING.md 的 Validate A Task 章节① 检查任务能否被正确解析uv run python -m utils.describe_task practice-area/task-id这个命令由 utils/describe_task.py 实现会打印任务标题、交付物、文档数量和全部评分准则是快速自查任务结构是否完整的好帮手。② 跑任务完整性测试uv run python -m pytest tests/test_task_integrity.py对应测试文件为 tests/test_task_integrity.py确保你的task.json符合基准的数据模式。③ 做一次短模型冒烟测试可选但推荐uv run python -m harness.run \ --model anthropic/claude-haiku-4-5-20251001 \ --task practice-area/task-id \ --max-turns 20跑完后还可以用 evaluation/run_eval.py 对结果打分看看小模型能过几条准则uv run python -m evaluation.run_eval \ --run-id run-id \ --task practice-area/task-id \ --judge-model claude-sonnet-4-6提交前快速清单提交 PR 前对照检查一下任务目录位于正确的执业领域下结构为tasks/area/task/task.json含title、instructions、criteria三个必填字段所有文档均为合成材料无任何真实客户信息每条准则都有明确的PASS if ...和FAIL if ...表述每条准则的deliverables与顶层deliverables映射一致uv run python -m pytest tests/test_task_integrity.py通过PR 小而聚焦方便审阅完成这些你的新法律任务就能进入基准被 24 个执业领域的评测体系所复用。更多贡献细节模型适配器开发、批量评测 sweeps、文档同步请查阅 CONTRIBUTING.md项目整体架构可参考 docs/architecture.md评测方法论详见 docs/eval-strategies.md。【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询