
人工智能AI 技能AI 评测【免费下载链接】darwin-skill达尔文.skill —— 一个让你的Skill无限进化的系统评估→改进→测试→保留或回滚 | Autoresearch-inspired autonomous skill optimization for Claude Code. Evaluate, improve, test, keep or revert.项目地址https://gitcode.com/gh_mirrors/da/darwin-skill点击查看免费下载本文以 darwin-skill 仓库的 README.md 为主线结合 SKILL.md 中完整的优化循环实现细节、references/skilllens-evidence.md 与 references/runtime-neutrality.md 中的实证数据与审查对照表为你拆解这套「像训练模型一样优化 Agent Skill」的系统它是如何用 9 维加权评分评估一个 SKILL.md、如何在 git 分支上做 hill-climbing 优化、如何用独立子 agent 盲评避免「自己改自己评」的偏差以及如何通过 keep / revert 棘轮机制保证分数只升不降。读完你将掌握达尔文.skill 的完整使用流程Phase 0 → Phase 3、每轮优化的诊断公式weighted_gap、paired 比较与多数决的判定逻辑以及 runtime 中立性 gate 等进阶实践可以直接在自己的 Claude Code、Codex、Cursor、OpenClaw 等 skills-compatible 工具中部署这套优化体系。核心循环评估 → 改进 → 实测验证 → 保留或回滚达尔文.skill 的核心循环是一个只能向前转的棘轮ratchet评估 → 改进 → 实测验证 → 人类确认 → 保留或回滚 → 生成成果卡片。受 Andrej Karpathy 的 autoresearch 项目启发它把「自主实验循环」从模型训练领域搬到了 Skill 优化领域——不再凭感觉手改 SKILL.md而是让每一处改动都有评分、有测试、有回滚保障。从 SKILL.md 的 frontmatter 可以看到这套系统的触发词覆盖了中文与英文的常见表达优化skill、skill评分、自动优化、auto optimize、skill质量检查、达尔文、darwin、skill review、skill打分等。当用户说出这类意图时skill 就会进入完整的自主优化流程。为什么需要这样的系统Skill 生态与结构性审查的局限Agent Skill 生态正在快速扩张Claude Code、Codex、OpenClaw、Trae、CodeBuddy 等工具都支持 SKILL.md 格式。当只有 10 个 Skills 时可以手动维护当数量达到 60 时就需要一套系统化的管理手段。传统的 Skill 审查是纯结构性的检查格式对不对、步骤有没有编号、路径能不能访问。但一个格式完美的 Skill跑出来的实际效果可能很差。达尔文.skill 与这类审查的本质区别在于双重评估它同时评估「结构质量」静态分析 SKILL.md 怎么写和「实际效果」跑测试 prompt 看输出好不好然后只保留真正有改进的修改。正如 SKILL.md 设计哲学中所强调的不只看 SKILL.md 写得规不规范更看改完后实际跑出来的效果是否更好。设计渊源从 autoresearch 到 Skill Optimizer这个项目直接受 Karpathy autoresearch 启发。autoresearch 的做法是写一个program.md定义目标和约束让 agent 自主生成和测试代码变更只保留可测量的改进。达尔文.skill 把同样的思路搬到 Skill 优化两者有清晰的映射关系autoresearch达尔文.skill为什么这样映射program.md本 SKILL.md定义评估标准和约束规则train.py每个待优化的 SKILL.md被优化的资产每次实验只改它val_bpb9 维加权总分满分 100可量化的优化目标git ratchetkeep / revert 机制只保留有改进的 committest settest-prompts.json验证改进是否真的有效全自主运行人在回路Skill 的好坏比 loss 更微妙需要人的判断需要注意一个关键的修正SKILL.md 中明确记录autoresearch 的val_bpb是确定性 loss重跑结果相同而达尔文套用的是LLM-judge 分数随机抽样。因此 v2.1 起9 维 rubric 被当作paired 比较准则而非绝对 metric——这一点在后续「评分规则」章节会详细展开。五条核心原则无论版本如何迭代这套系统始终围绕五条原则运行#原则说明01单一可编辑资产每次只改一个 SKILL.md变量可控改进可归因02双重评估结构评分静态分析 效果验证跑测试看输出03棘轮机制只保留改进自动回滚退步分数只升不降04独立评分评分用子 agent避免「自己改自己评」的偏差SkillLens 实证 LLM 自评仅 46.4% 准确率05人在回路每个 Skill 优化完后暂停用户确认再继续下一个其中「独立评分」与「人在回路」是达尔文区别于纯自动系统的两个支柱也是后面验证机制与 CHECKPOINT 设计的基础。9 维评估体系总分 100评估是整个循环的地基。达尔文.skill 用一套 9 维度加权 rubric 给每个 SKILL.md 打分满分 100。结构维度靠静态分析效果维度必须实测。v2.0 新增的三个维度直接来自微软研究院 SkillLens 论文arXiv:2605.23899实证验证的 rubric 设计。结构维度59 分— 静态分析#维度权重评分标准1Frontmatter 质量7name 规范、description 包含「做什么 何时用 触发词」、≤1024 字符、禁止结尾加「灵活应用/根据情况判断」等空话尾巴2工作流清晰度12步骤明确可执行、有序号、每步有明确输入/输出3失败模式编码12必须显式编码失败模式写出「如果 X 失败 → Y」的明确分支有 fallback 路径、错误恢复只写正向流程而不写失败分支扣 ≥3 分SkillLens meta-skill 维度4检查点设计6关键决策前有用户确认、防止自主失控检查点必须显性标记/STOP/CHECKPOINT仅靠「如果…建议…」措辞不算5可执行具体性18不模糊、有具体参数/格式/示例、可直接执行禁止「建议/可以考虑/根据情况/灵活把握/视情况而定」等软化措辞——出现 ≥3 处扣 ≥3 分SkillLens actionable specificity 维度6资源整合度4references / scripts / assets 引用正确、路径可达效果维度35 分— 需要实测#维度权重评分标准7整体架构12结构层次清晰、不冗余不遗漏冗余/AI 腔废话段落说白了/换句话说/首先其次综上等禁用词出现一处扣 1 分8实测表现23用测试 prompt 跑一遍输出质量是否符合 skill 宣称的能力Meta-skill 维度6 分— 反例与黑名单#维度权重评分标准9反例与黑名单6skill 必须有「不要做什么」的反例清单只写「应该做 X」没有「不要做 Y」扣 ≥3 分红灯/危险动作/反模式应单独章节列出SkillLens risk-action blacklist 维度三个新维度SkillLens 73.8% rubric 药方的核心思想是失败模式编码不是简单「别犯错」式叮嘱而是把已知失败路径显式编码进 skill可执行具体性明文禁止模糊措辞高风险行动黑名单要求rm、git reset --hard、force push 等破坏性操作必须在 skill 中显式列禁。评分规则与绝对分数的边界维度 1-7、9每个维度打 1-10 分乘以权重得到该维度得分维度 8实测表现跑 2-3 个测试 prompt按输出质量打 1-10 分总分 Σ(维度分 × 权重) / 10满分 100实测表现权重最高23 分。Skill 写得再漂亮跑出来效果不好就是零。这里有一条重要的使用边界来自 SKILL.md 的 v2.1 更新也是全仓库最重要的方法论修正⚠️绝对总分只用于 triage粗排「哪支最弱、先改谁」绝不用于 keep/revert。实测发现同一份未改文字换个 judge 评总分可以摆动±8一支只加了 3 个 字元的 skill、单评却 −8.5全是 judge 换尺、非真实退步。keep/revert 一律走 Phase 2 的paired 比较。原因在于LLM judge 给的是「抽样、不是测量」——分数住在「文字 × 该 judge 当下选的标准」里不是文字属性。绝对总分 用两台未校准磅秤量节食前后差值大半是磅秤差paired 比较 同一台磅秤量前后误差相减抵销。pairwise preference absolute scoring是 LLM judge 领域的已知结论RLHF 用 pairwise 不用绝对分正是同一原因。关于「实测表现」维度这是与纯结构评分最大的区别。评分方式为每个 skill 设计 2-3 个典型用户 prompt不是边缘 case是最常见的使用场景用子 agent 执行一个带 skill 跑一个不带 skill 跑baseline对比输出质量从以下角度打分输出是否完成了用户意图相比不带 skill 的 baseline质量提升明显吗有没有 skill 引入的负面影响过度冗余、跑偏、格式奇怪若子 agent 不可用超时/资源限制退化为「干跑验证」读完 skill 后模拟一个典型 prompt 的执行思路判断流程是否合理必须在 results.tsv 标注dry_run。dry_run 比例 30% → 评估失效警告因为 dim8 实测维度权重 23%无 full_test 验证时分数不可信。仓库中的 test-prompts.json 就是这一维度的落地样例它为 darwin-skill 自身设计了 3 个测试场景典型单 skill 优化、全量评估、歧义/失败场景每个 prompt 都附带expected期望行为描述例如歧义场景期望 skill「识别为优化任务 → 询问优化范围 → 按异常表 fallback → 设计测试 prompt 前展示给用户确认检查点」。优化循环五个阶段系统在每个阶段内自主运行但在阶段之间暂停等待人类确认Human in the Loop 三层守关。Phase 0初始化1. 确认优化范围 - 全部skills → 扫描 .claude/skills/*/SKILL.md - 指定skills → 用户指定列表 2. 创建 git 分支auto-optimize/YYYYMMDD-HHMM 3. 初始化 results.tsv如不存在 4. 读取现有 results.tsv 了解历史优化记录Phase 0.5测试 Prompt 设计在评估之前为每个 skill 设计测试 prompt。这步很关键——没有测试 prompt「实测表现」维度就打不了分。for each skill: 1. 读取 SKILL.md理解它做什么 2. 设计2-3个测试prompt覆盖 - 最典型的使用场景happy path - 一个稍复杂或有歧义的场景 3. 保存到 skill目录/test-prompts.json [ {id: 1, prompt: 用户会说的话, expected: 期望输出的简短描述}, {id: 2, prompt: ..., expected: ...} ]展示所有测试 prompt 给用户确认后再进入评估。测试 prompt 的质量决定了优化方向是否正确。Phase 1基线评估Baseline— triage 用途本阶段绝对分数是 triage 排名决定先改谁不是 keep/revert 基准。judge 对 gross 差异会一致「哪支最弱」可信对 fine-grained delta 不可信±8 噪音。keep/revert 在 Phase 2 用 paired 比较。for each skill in 优化范围: # 结构评分主agent可以做 1. 读取 SKILL.md 全文 2. 按维度1-7逐项打分附简短理由 # 效果评分用子agent做独立于主agent 3. 对每个测试promptspawn子agent - with_skill: 带着SKILL.md执行测试prompt - baseline: 不带skill执行同一prompt 4. 对比两组输出打维度8的分 # 汇总 5. 计算加权总分 6. 记录到 results.tsv基线评估完成后展示评分卡表格示意┌──────────────────────────┬───────┬──────────────┬──────────────┐ │ Skill │ Score │ 结构短板 │ 效果短板 │ ├──────────────────────────┼───────┼──────────────┼──────────────┤ │ huashu-proofreading │ 78 │ 边界条件 │ 测试prompt2 │ │ huashu-slides │ 72 │ 指令具体性 │ baseline持平 │ ├──────────────────────────┼───────┼──────────────┼──────────────┤ │ 平均 │ 75 │ │ │ └──────────────────────────┴───────┴──────────────┴──────────────┘ CHECKPOINT · STOP暂停等用户确认再进入优化循环。此外SKILL.md 明确要求 Phase 1 基线评估时强制跑一次 runtime 红灯扫描详见「Runtime 适配性审查」章节命中项会以runtime_warnN写入 results.tsv 的 note 列。Phase 2优化循环单维度 hill-climbing用户确认后按基线分数从低到高排序先优化最弱的。这一阶段实现了完整的「诊断 → 改进 → 验证 → 保留/回滚」闭环for each skill: round 0 while round MAX_ROUNDS (默认3): round 1 # Step 1: 诊断 找出加权短板最大的维度weighted_gap weight × (10 - score) / 10结构或效果都算 # /10 与「总分 Σ(维度分 × 权重) / 10」同标度weighted_gap 就是该维度还能贡献的总分数 # 为什么不用「原始分最低」低权重维度会制造进步幻觉——实战中 # dim9权重6gap 5.3原始分最低被优先修而 dim8权重23加权短板最大11.5却4轮未动 # 加权短板相近差距 ≤ 1.0时回退为原始分升序 # 注意dim2/dim3/dim4 是相关簇修一个时另两个常跟着涨 # → 不要因为 dim3 短板最大就单独修要看整簇短板再决定是否同步改 # Step 2: 提出改进方案 针对该维度生成1个具体改进方案 - 改什么具体段落/行 - 为什么改对应rubric哪条 - 预期提升多少分 # Step 3: 执行改进 编辑 SKILL.md git add commitmessage: optimize {skill}: {改进摘要} # Step 4: Paired 重新评估取代绝对重打分 spawn N3 独立 judge每个【同一次 call 内】读两版 - 改前版git show HEAD:skill-path/SKILL.md上一个 kept commit - 改后版working tree 当前 SKILL.md 照 9 维 rubric 当【比较准则】不是各打绝对分回 {better | worse | tie} margin{clear|slight} 一句理由。 关键同一 judge 在一次 call 内比两版 → 它那把不准的尺对两版【等量作用、在比较时抵销】(within-judge cancellation)。 N 取奇数默认 3close call 升 5。 # Step 5: 共识决策多数决取代「新总分 旧总分」 cur 投 better 的 judge 数wor 投 worse 的 if cur wor: # 多数说改后 ≥ 改前含 tie status keep # 见好就收连续 2 轮多数 judge 判 marginslight 或 tie → break 进 Phase 3 else: # 多数说 worse —— 这才是真退步已扣掉换尺噪音 status revert git revert HEAD创建新commit回滚不用 reset --hard 记录到 results.tsvnote 记 vote 比数 一句 worse 理由 break # 单评绝对分数出现「负 delta」≠ revert 信号必须经 paired 多数判 worse 才 revert # Step 6: 日志 results.tsv 追加行 # CHECKPOINT · 每个 skill 优化完后强制人审 展示该skill的改动摘要 - git diff改前 vs 改后 - 分数变化哪些维度提升/下降 - 测试prompt输出对比如果跑过的话 等用户确认 OK 再继续下一个skill。 如果用户说不好回滚到该skill的优化前版本。这段逻辑浓缩了 v2.1 最重要的机制升级paired 同-judge 比较 奇数 N 多数决。README 的 v2.0 描述是「启动 2 个独立子 agent 重新评分、新分高于旧分保留」而 SKILL.md 的 v2.1 已进一步演进为「每个 judge 在同一次 call 内读改前/改后两版做相对比较」因为实测中绝对分数 ±8 的 judge 噪音会淹没保守编辑的真实增益3~8成为 false-revert 的源头within-judge 比较则让同一把「不准的尺」对两版等量作用、误差相抵销。Phase 2.5探索性重写按需触发当 hill-climbing 连续 2 个 skill 都在 round 1 就 break涨不动时提议一次「探索性重写」1. 选一个瓶颈skill 2. git stash 保存当前最优版本 3. 从头重写SKILL.md不是微调是重新组织结构和表达方式 4. 重新评估 5. if 重写版 stash版: 采用重写版 else: git stash pop 恢复这解决了 hill-climbing 的局部最优问题——有时候需要「先拆后建」才能突破瓶颈。 CHECKPOINT · STOP必须征得用户同意后才执行。Phase 3汇总报告## 优化报告 ### 总览 - 优化skills数N - 总实验次数M - 保留改进XY% - 回滚次数Z - 实测验证A次完整测试 / B次干跑 ### 分数变化 ┌──────────────────────────┬────────┬────────┬────────┐ │ Skill │ Before │ After │ Δ │ ├──────────────────────────┼────────┼────────┼────────┤ │ huashu-proofreading │ 78 │ 87 │ 9 │ │ huashu-slides │ 72 │ 83 │ 11 │ ├──────────────────────────┼────────┼────────┼────────┤ │ 平均 │ 75 │ 85 │ 10 │ └──────────────────────────┴────────┴────────┴────────┘ ### 主要改进 1. [skill-A] 补充了边界条件处理测试输出质量提升明显 2. [skill-B] 重组了workflow结构baseline对比优势增大results.tsv 日志格式所有轮次的评估与决策都落盘到results.tsv位于.claude/skills/darwin-skill/results.tsv9 列格式timestamp commit skill old_score new_score status dimension note eval_mode 2026-03-31T10:00 baseline huashu-proofreading - 78 baseline - 初始评估 full_test 2026-03-31T10:05 a1b2c3d huashu-proofreading 78 84 keep 边界条件 补充fallback full_test 2026-03-31T10:10 b2c3d4e huashu-proofreading 84 82 revert 指令具体性 过度细化 dry_runeval_mode列是数据可信度的关键标识paired同 judge 比改前/改后keep/revert 权威依据full_test子 agent 跑 promptdry_run模拟推演、仅供参考。paired 行中new_score栏记 vote 比数如3-0 betternote 记一句裁断理由2026-06-10T06:30 paired some-skill 绝对 87.3→78.8 judge 噪音 3-0 better paired 推翻单评假退步 paired棘轮机制分数只升不降分数只能上升。每一轮要么改进 Skill要么干净地回滚不会随时间积累局部退化。以示意图中的场景为例轮次 2 的 75 分低于当前最优的 78 分被自动回滚有效基线始终锁定在 78后续改进从 78 继续。这一机制在 git 层面落地为改进通过git commit提交判定退步时通过git revert HEAD创建反向 commit保留可追溯链严禁使用git reset --hard会丢失工作树未提交改动并破坏 CI 历史。反例黑名单八条明文禁止的反模式达尔文.skill 不仅评估别人的 skill也约束自己的优化行为。以下 8 条反例黑名单来自本机 results.tsv 早期 40 次 0 revert 的教训每条都是真实踩过的坑同一个 AI 又改又评——改完后立刻在同一 Claude session 打分会有「我刚改的肯定更好」乐观偏差SkillLens 实证LLM 自评准确率仅 46.4%。替代必须 spawn 独立子 agentkeep/revert 走 paired 比较的奇数 N 多数决不用绝对分数 delta。用git reset --hard当回滚手段——会丢工作树未提交改动、CI 历史断裂。替代应用git revert HEAD创建反向 commit。为凑分而堆冗余——触顶后继续硬改往往是「加废话/加段落让 LLM 觉得更详细」实际质量不变。替代触顶信号连续 2 轮 Δ2 分→ break 进 Phase 3见好就收。跳过测试提示词直接评分——没有 test-prompts 的 dim8 是凭空打分权重 23% 等于编造。替代Phase 0.5 强制设计 2-3 prompts若用户不给默认编 3 个并展示确认。一轮内改多个维度——多变量同时变分数升降无法归因到具体改动。替代每轮 1 个维度相关簇dim2/3/4改其一时观察另两个是否跟涨。干跑比例 30%——dim8 实测维度形同虚设分数虚高早期 40 次记录 67% dry_run、0 revert。替代强制至少 1 个真实 full_testdry_run 多的优化在 results.tsv 显式打 ⚠️。静默跳过异常——遇到 git/tsv 异常时静默继续破坏 ratchet 完整性。替代按异常表 fallback先告知用户再处理。忽视维度相关簇——dim2/3/4 是相关簇单独优化 dim2 时常发现已被前轮 dim3 修复推到顶。替代找最大加权短板维度时同时看相关簇短板决定是否同步改。触发场景每轮 Phase 2 改动前对照本表一次任一反模式命中 → 改方案重写。Runtime 适配性审查独立于评分的 gate 项这是 SKILL.md 中一个值得单独强调的进阶设计skill 应当能在 Claude Code / Codex / Cursor / OpenClaw / Hermes / Gemini CLI / OpenCode 等 50 skills-compatible runtime 上通用——否则其他 agent 解析时会被「在 Claude Code 里」「Claude Code skill」等措辞误判为「不是给我用的」直接拒装实例nuwa-skill 因此被 Marvis agent 拒绝。Phase 1 基线评估时强制跑一次红灯扫描grep -nE (在 Claude Code|Claude Code skill|Claude Code 用户|Cursor only|Codex 中|^\[!\[Claude Code|~/\.claude/skills/[a-z]|/plugin install\b) SKILL.md README.md 2/dev/null输出非空 红灯命中但须先读命中行上下文排除假阳性grep 命令本身/反例引用/讲解该规则的元陈述 假阳性记runtime_scanfalse_positive不改→ 确认是真红灯指令性用法才强制把 Phase 2 第一轮定为 P0「runtime drift 修复」写入 results.tsv 的 note 列runtime_warnN。红灯类型与绿灯改写对照详见 references/runtime-neutrality.md红灯类型典型表现绿灯改写Badge 钉死[![Claude Code Skill]]等单一 runtime badgeAgent Skills Standardskills.sh CompatibleMulti-Runtime三个中立 badge措辞钉死「在 Claude Code 里」「Cursor 用户可以」「在你的 agent 里」/「在任何 skills-compatible runtime 中」安装命令钉死只给~/.claude/skills/路径、只给/plugin install三层结构① 自动检测的一行命令 ② 各 runtime 手动路径 ③ cat 进 context 的 fallback工具调用钉死硬编码mcp__claude-in-chrome__*等单 runtime 能力「用一个 browser automation 工具例如 Claude 的 chrome MCP、Playwright 等」路径硬编码~/.claude/skills/xxx/作为唯一路径同时给出~/.cursor/skills/、~/.codex/skills/等例外允许的「Claude Code 痕迹」frontmatter 触发词、花叔生态内部 skill 名引用、明确标注 runtime-specific 章节、commit message、以及讲解该规则本身的元陈述即假阳性。扫描后必须人工读命中行的上下文再定性——禁止机械按 grep 命中行数定 P0否则任何讲解 runtime 中立性的 skill含 darwin-skill 本身都会永远判自己红灯、陷入自审死循环。异常与边界条件预定义的 fallback 表流程假设环境理想但实操常遇异常。以下预定义 fallback 保证优化过程不会「一跑就卡住」场景触发条件处理动作不在 git 仓库git rev-parse失败询问用户执行git init或回退到文件备份用户选后者则cp SKILL.md SKILL.md.bak.YYYYMMDD-HHMM代替 revertresults.tsv 缺失文件不存在新建并写表头行9 列含 eval_moderesults.tsv 损坏列数不匹配 / 非 TSV备份为.bak.YYYYMMDD-HHMM后重建告知用户分支已存在git checkout -b失败分支名末尾加-2/-3第 3 次失败则切回现有分支并询问继续还是新起git revert失败冲突 / 工作树脏先git stash重试仍失败则从上一个 commit 的 SKILL.md 读出覆盖当前文件手动恢复MAX_ROUNDS 触顶默认 3已跑 3 轮仍有短板不强制 break展示当前最弱维度问用户「继续加 1 轮 / 进入 Phase 2.5 / 收工」优化后超 150% 体积新文件 原 × 1.5拒绝提交回到改进步骤精简删冗余/合并重复再评test-prompts.json 已存在文件已在 skill 目录默认复用并展示问用户「复用 / 重写 / 追加」三选一SKILL.md 找不到目录存在但无 SKILL.md该 skill 终止results.tsv 记statuserror继续下一个分数计算规则浮点精度漂移总分保留 1 位小数改进需严格 旧分不靠四舍五入原则异常先告知用户再按规则处理绝不静默跳过或静默失败。优化策略库按优先级排序当某一轮确定了要优化的维度后改进方向按以下优先级选择每轮只做最高优先级的一个P0: Runtime 适配性问题gate 项命中 → 必须先修——替换红灯措辞、改中立 badge、改三层安装结构、为硬编码工具提供通用替代例外skill 名明确标注单 runtime如xxx-codex的可跳过。P0: 效果问题实测发现的——测试输出偏离用户意图 → 检查误导性指令带 skill 比不带还差 → 可能过度约束考虑精简输出格式不符合预期 → 补充明确的输出模板。P1: 结构性问题——Frontmatter 缺少触发词 → 补充中英文触发词缺少 Phase/Step 结构 → 重组为线性流程缺少用户确认检查点 → 在关键决策处插入。P2: 具体性问题——步骤模糊「处理图片」→ 改为具体操作和参数缺少输入/输出规格 → 补充格式、路径、示例缺少异常处理 → 补充「如果 X 失败则 Y」。P3: 可读性问题——段落过长 → 拆分用表格重复描述 → 合并去重缺少速查 → 添加 TL;DR 或决策树。实战 high-leverage 操作精髓速查SKILL.md 总结了 4 条经实战验证的高杠杆操作huashu-gpt-image 10.85 / huashu-weread-advisor 14.9 / claude-design 16.5详细案例数据见 references/skilllens-evidence.md 的「HL 实战案例」节HL-1dim4显性视觉标记是杠杆加 CHECKPOINT / STOP靠「必须」措辞不行——LLM 解析时扫描视觉标记。4 行改动撬动 dim4 3 分。HL-2dim3if-then 三段式 fallback 表把「症状/解法」两列升级为「触发条件 / 一线修复 / 仍失败兜底」三段式是 SkillLens failure-mechanism encoding 维度的落地。huashu-gpt-image 用 3 张表 23 条三段式将 dim3 从 6.5 推到 10满分。HL-3Phase 2 诊断维度相关簇警告dim2/3/4 是相关簇——修 dim3 时 dim2 常跟着涨。「找最大加权短板维度」时同时看相关簇短板再决定是否同步改。HL-4Phase 2 退出触顶自动 break连续 2 轮 Δ 2 分 → break 进 Phase 3。0.15 是停手信号不是继续信号硬凑 MAX_ROUNDS3 会引入 over-engineering。快速开始与安全提示npx skills add alchaincyf/darwin-skill安装后在任何支持 Skill 的 Agent 工具中说「优化所有 skills」或「优化某个 skill」即可触发。无法访问 GitHub 的用户也可以下载官方 zip 包解压后把 SKILL.md 放到~/.claude/skills/darwin-skill/目录手动安装。使用方式按需选择SKILL.md 的「使用方式」章节全量优化推荐首次使用「优化所有skills」→ Phase 0-3 完整流程默认先基线评估按分数升序优先优化最低 5-10 个单个优化「优化 huashu-slides 这个skill」→ 只对指定 skill 执行 Phase 0.5-2仅评估不改「评估所有skills的质量」→ 只执行 Phase 0.5-1设计测试 prompt 基线评估不进入优化循环查看历史「看看skill优化历史」→ 读取并展示 results.tsv。安全提示README 明确要求在 git 仓库里跑优化并先把你本地对 skill 的改动 commit 或 stash这样 darwin.skill 才能干净地保留或回滚实验改动。进入下一轮优化前先审查 checkpoint 的 diff尤其当 skill 涉及 shell 命令、git 操作、凭证、本地文件或发布流程时。实测验证数据仓库记录了这套系统自身的实战成绩README 与 references/skilllens-evidence.md 均有记载huashu-gpt-image skill80.8 → 91.5 → 91.6510.856 个独立评委共识darwin-skill 自评86.05 → 92.05 → 92.7自指闭环full_test本机 controlled study2026-05-27对 huashu-research 应用 4 类明确质量劣化模糊化指令、删检查点、删异常表、插入 AI 腔废话5 个独立 judge 盲测一致判定 V1 V2Δ 均值 46.55/5 high confidence其中「检查点设计」−6.4与「边界条件覆盖」−5.8是识别最明显、最一致的两项劣化。同时SKILL.md 也明确给出了这套 rubric 的能力边界rubric 能识别 gross degradation5/5 high confidence但不能证明 fine-grained quality difference 也能识别——SkillLens 的 46.4% 准确率正来自细粒度对比darwin-skill 在细粒度判别上仍有失效风险。重要决策仍需人审。版本脉络v2.0 与 v2.1 的演进如果你在 README 中看到的是 v2.0 的描述那么从 SKILL.md 的版本自检可以看到最新实现已经演进到 v2.12026-06-10v2.02026-05-28系统性吸收微软研究院 SkillLensarXiv:2605.23899的 9 维评分药方 SkillOptarXiv:2605.23904的 validation-gated 验证机制 human-in-the-loop 三层守关。五项变化评分标准 8 维 → 9 维验证机制对齐 validation-gated多评委独立审查、评委不复用、早停机制、干跑比例控制Human in the Loop 三层守关反例黑名单 8 条实测验证数据。v2.12026-06-10keep/revert 棘轮从「绝对分数 delta」改为「paired 同-judge 比较 奇数 N 多数决」因为绝对分数 ±8 的 judge 噪音淹没保守编辑的真实增益、是 false-revert 的根源within-judge 比较消除换尺污染绝对分数降级为 triage-only。这是全文前面所有 paired 机制描述的实现版本。此外 SKILL.md 还内置了「版本自检静默」机制每次使用前读取本 skill 目录下的.last-update-check文件一行日期若距今不足 30 天则跳过更新检查到期时才对比本地git rev-parse HEAD与远端ls-remote origin HEAD确认落后后仅在完成任务时附带一句「本 skill 有新版本可用git -C 本目录 pull --ff-only更新」是否更新由用户决定不主动执行。约束规则优化时的边界最后是 SKILL.md 定义的八条约束保证优化不跑偏不改变 skill 的核心功能和用途——只优化「怎么写」和「怎么执行」不改「做什么」不引入新依赖——不添加 skill 原本没有的 scripts 或 references 文件每轮只改一个维度——避免多个变更导致无法归因保持文件大小合理——优化后 SKILL.md 不应超过原始大小的 150%尊重花叔风格——中文为主、简洁为上可回滚——所有改动在 git 分支上用git revert而非reset --hard评分独立性——效果维度必须用子 agent 或至少干跑验证不能在同一上下文里「改完直接评」Runtime 中立性——skill 必须能在任何 skills-compatible runtime 中正常运行除非 skill 名明确绑定单一 runtime。学术依据这套系统的设计直接基于以下学术工作详见 README.md 的 References 章节SkillLens微软研究院arXiv:2605.23899实证验证的 73.8% rubric 药方。达尔文.skill v2.0 的三个新维度Failure Mechanism Encoding / Actionable Specificity / High-Risk Action Blacklist直接来自该论文「同一个 AI 又改又评」反模式的实证来源LLM 自评准确率仅 46.4%也出自此。SkillOpt微软研究院arXiv:2605.23904validation-gated edits 的形式化框架。把 skill 当作 frozen 模型的「外部可训练状态」每次编辑都必须通过独立验证才能保留达尔文.skill v2.0 的多评委独立审查、评委不复用、早停机制、干跑比例控制均对齐该框架。autoresearchAndrej Karpathy达尔文.skill 1.0 的原始灵感来源program.md / train.py / val_bpb / git ratchet / test set 的映射逻辑完全继承自它。达尔文 vs SkillOpt 的关键区别SkillOpt 是全自主系统达尔文.skill 强调 human-in-the-loop——Skill 的好坏比 validation loss 更微妙关键阶段基线评估、单维度优化、回归测试强制暂停让人来做最终判断。正如项目 motto 所说只保留改进时间就站在你这边。项目以 MIT 协议开源LICENSE你可以将其作为独立 skill 安装使用也可以把其中的九维 rubric、paired 比较和棘轮机制当作方法论迁移到自己维护的任意 skill 集合上。赞分享人工智能AI 技能AI 评测【免费下载链接】darwin-skill达尔文.skill —— 一个让你的Skill无限进化的系统评估→改进→测试→保留或回滚 | Autoresearch-inspired autonomous skill optimization for Claude Code. Evaluate, improve, test, keep or revert.项目地址https://gitcode.com/gh_mirrors/da/darwin-skill点击查看免费下载相关推荐skill-validator用 A/B 评估与成对评审度量 .NET Agent Skill 的真实价值skill validator用 A/B 评估与成对评审度量 .NET Agent Skill 的真实价值 本指南深入讲解本仓库中 eng/skill va人工智能AI 技能AI 评测Benchmark开发工具如何用 awesome-llm-apps 的 Self-Improving Agent Skills 基于评估用例自动优化你的 Agent Skill 提示词如何用 awesome llm apps 的 Self Improving Agent Skills 基于评估用例自动优化你的 Agent Skill 提示词示例工程人工智能skill-creator 实战指南用 Claude Code 插件体系从零创建、评测并迭代优化你的 Skillskill creator 实战指南用 Claude Code 插件体系从零创建、评测并迭代优化你的 Skill 本文以官方插件仓库 claude plugiAI 插件开发工具插件系统上一篇NocoBase 生产部署如何用 Nginx 反向代理与静态资源代理下一篇ComfyUI模型太多找不到三步开启树状模型加载让几百个模型秒级定位创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考