
Agent Skills for Context Engineering以 17 个 Agent Skill 与研究者操作系统构建生产级 Agent 系统【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering本文基于仓库根目录的 README.md 展开系统讲解这个上下文工程Context Engineering技能集合解决什么问题、包含哪些技能、如何安装到 Claude Code / Cursor / Codex 等平台以及仓库内建的研究者操作系统Researcher OS如何用确定性门禁和可复现的路由基准来持续演进整个技能库。读完后你应能独立完成技能插件安装、单技能目录级部署并理解技能激活路由的评测方法与数据含义。什么是上下文工程一个受限的注意力预算README 开篇给出的定义是上下文工程Context Engineering是管理语言模型上下文窗口的学科。它不同于提示词工程Prompt Engineering只关注如何写好指令而是面向进入模型有限注意力预算的全部信息做整体策展系统提示词、工具定义、检索文档、消息历史、工具输出。其核心挑战在于上下文窗口的约束不是原始 token 容量而是注意力机制。随着上下文长度增加模型会呈现可预测的退化模式——lost-in-the-middle中间信息被忽略、U 形注意力曲线、注意力稀缺。有效的上下文工程就是找到能最大化期望结果概率的最小高信号 token 集合。这个概念在基础技能 context-fundamentals 中被进一步形式化对 n 个 token注意力机制需要计算 n 平方量级的两两关系模型主要用较短序列训练导致有效容量远低于标称窗口大小。该技能还给出了四条组装配上下文的原则信息性优于穷尽性——只包含对当前决策重要的内容并设计可按需检索的系统位置感知放置——把关键约束放在上下文的开头和结尾注意力最强的位置渐进式披露——启动时只加载技能名和摘要激活时才加载全文迭代策展——上下文工程不是一次性写提示词的练习而是每次向模型传递内容时都要应用的持续纪律。该仓库已被两篇学术工作引用为静态技能架构static skill architecture的基础性参考相关论述指出静态技能已被广泛认可而动态演化技能则开始桥接人工技能工程与自主自我改进。17 个技能的分层地图仓库根目录下 skills/ 包含 17 个技能目录按五个层次组织。这个分层本身就是 README 的核心骨架从概念认知到架构模式到运行优化再到开发方法论与认知架构。基础技能Foundational Skills为所有后续工作建立概念基础技能说明context-fundamentals理解什么是上下文、为什么重要以及 Agent 系统中上下文的解剖结构context-degradation识别上下文失效模式lost-in-middle、投毒、注意力分散与冲突context-compression为长时运行会话设计并评估压缩策略架构技能Architectural Skills覆盖构建有效 Agent 系统的模式与结构技能说明multi-agent-patterns掌握编排者orchestrator、对等peer-to-peer与层级式多智能体架构long-horizon-prompting为长时自主 Agent 与并行编排编写拟形式化任务简报精确的成功谓词、非计数型结果、审计门控的返回条件、努力下限与多样性策略memory-systems设计短期、长期与图结构记忆架构tool-design构建 Agent 能够有效使用的工具filesystem-context用文件系统实现动态上下文发现、工具输出卸载与计划持久化hosted-agents用沙箱 VM、预构建镜像、多玩家支持与多客户端接口构建后台编码 Agent运维技能Operational Skills面向 Agent 系统的持续运行与优化技能说明context-optimization应用压缩compaction、掩码masking与缓存caching策略latent-briefing当 Worker 运行时可控时通过任务引导的 KV 缓存压缩向 Worker 共享任务相关的编排者状态evaluation为 Agent 系统构建评估框架advanced-evaluation掌握 LLM-as-a-Judge 技术直接评分、成对比较、评分表生成与偏差缓解harness-engineering设计自主 Agent 的 harness锁定指标、持久日志、新颖性门、回滚与人工审批边界self-improvement-loops以 harness 本身为优化目标的循环RSI、元 harness 搜索、失败驱动自编辑、演化式脚手架搜索与自修改系统的接受门开发方法论Development Methodology技能说明project-development从构思到部署设计并构建 LLM 项目任务-模型适配分析、流水线架构、结构化输出设计认知架构Cognitive Architecture Skills技能说明bdi-mental-states用形式化 BDI信念-欲望-意图本体模式把外部 RDF 上下文转化为 Agent 心智状态用于审议式推理与可解释性根目录的 SKILL.md 是整个集合的入口元数据文件它声明了集合的name: context-engineering-collection、激活时机从零构建 Agent 系统、优化性能、调试上下文失败、设计多智能体架构等六类场景并以一段话为每个技能给出一句话心智模型供 Agent 在做技能发现时快速判断路由。设计哲学三条原则如何落到文件结构README 给出三条设计原则每一条都能在仓库中找到对应的实体约束。1. 渐进式披露Progressive Disclosure。启动时 Agent 只加载技能名称和描述只有当某个技能被相关任务激活时才加载全文。从源码结构看这一原则由SKILL.md的 frontmatter 承载每个技能的文件头都含name与description两个字段例如 skills/context-fundamentals/SKILL.md 的 description 不仅说明做什么还显式写明哪些邻近技能拥有相邻工作路由信号仅靠这些描述完成——这一点被路由基准实验直接验证见后文。2. 平台无关Platform Agnosticism。技能聚焦可迁移的原则而非厂商特定实现模式适用于 Claude Code、Cursor 以及任何支持技能或自定义指令的 Agent 平台。3. 概念基础 实用示例。示例脚本使用跨环境可用的 Python 伪代码不依赖特定依赖安装。与渐进式披露配套的硬约束是SKILL.md正文保持在 500 行以内贡献规范与技能模板 template/SKILL.md 都明确要求超出部分必须移入references/目录。此外模板还要求每个技能显式声明所有权边界——描述与When to Activate小节必须说明该技能拥有什么、哪些邻近技能拥有相邻工作以防止宽泛技能抢走狭窄技能的激活。这正是后文路由基准要度量的问题技能边界混淆。安装与使用方式一Claude Code 插件市场本仓库是一个Claude Code Plugin Marketplace。市场清单位于 .claude-plugin/marketplace.json其中定义了市场名context-engineering-marketplace与插件context-engineering并逐一列出了 17 个技能目录的相对路径插件本体清单 .plugin/plugin.json 声明skills: ./skills/即宿主从仓库根的skills/目录发现全部技能当前版本为 2.5.0。第 1 步注册市场。在 Claude Code 中执行/plugin marketplace add muratcankoylan/Agent-Skills-for-Context-Engineering第 2 步安装插件。两种方式任选方式 A浏览安装选择Browse and install plugins→context-engineering-marketplace→context-engineering→Install now方式 B命令直装/plugin install context-engineeringcontext-engineering-marketplace安装后17 个技能作为单个插件装入并按任务上下文自动激活。方式二Cursor / Codex / 其他 Open Plugins 宿主仓库同时以 Open Plugins 插件形式发布宿主读取.plugin/plugin.json发现仓库根skills/目录每个子目录含一个SKILL.md。Cursor推荐从插件目录安装或克隆仓库后指向插件根Cursor 通过 Open Plugins 清单发现skills/目录。项目级手动安装时把技能目录复制进.cursor/skills/。README 特别提醒不要依赖仓库符号链接它们在 Windows 和插件打包场景下很脆弱。Codex / GitHub Copilot CLI / 其他 Open Plugins 宿主克隆仓库或将其作为插件目录添加宿主读取.plugin/plugin.json后自动发现全部 17 个技能项目级手动安装时复制到.codex/skills/或宿主文档指定的 Agent Skills 目录。方式三单独安装某个技能目录布局是关键Agent Skills 要求的是目录布局而非单个 markdown 文件。以context-fundamentals为例# Cursor 项目 mkdir -p .cursor/skills cp -R skills/context-fundamentals .cursor/skills/ # Claude Code 项目级安装同样的目录布局 mkdir -p .claude/skills cp -R skills/context-fundamentals .claude/skills/ # Codex 项目级安装 mkdir -p .codex/skills cp -R skills/context-fundamentals .codex/skills/ # 通用 Agent Skills 仓库级安装Codex/OpenAI、Copilot CLI、Open Plugins 宿主 mkdir -p .agents/skills cp -R skills/context-fundamentals .agents/skills/这里有一个明确的反模式不要把SKILL.md拍平成.claude/skills/context-fundamentals.md单文件。那会破坏相对references/路径的解析并违反 Cursor、Claude Code、Codex 共同使用的 Agent Skills 目录规范。方式四自研实现从任意技能中提取原则与模式在自己的 Agent 框架中重新实现——技能被刻意设计为平台无关这正是其可移植性的来源。技能激活场景何时该激活哪个技能README 用一张完整的激活表约束了每个技能的路由语义。这张表与路由基准的expected_primary_skill标签直接对应是整个评测体系的地面真值来源技能激活时机context-fundamentals建立上下文窗口心智模型、规划 Agent 架构或解释上下文组件如何影响模型行为context-degradation诊断注意力失效、上下文投毒、lost-in-middle 行为或长会话中的性能退化context-compression在上下文压力下保留有用状态的同时压缩对话、工具输出或轨迹context-optimization改进 token 效率、检索精度、前缀复用、掩码、分区或预算分配latent-briefingWorker 运行时可控且模型兼容时通过任务引导的 KV 缓存压缩向 Worker 共享编排者轨迹multi-agent-patterns选择协调模式、隔离 Agent 间上下文、设计交接或评估并行 Agent 是否值得long-horizon-prompting撰写或评估长时自主 Agent / 并行编排的启动提示词成功谓词、非计数结果、持久与停止规则、对抗性审计门、组合多样性策略memory-systems跨会话持久化知识、追踪实体演化、选择记忆框架或设计检索与更新语义tool-design定义 Agent-工具契约、合并工具面、改进描述、让工具错误可操作filesystem-context把大体积或需持久化的上下文移入文件、创建草稿本、支持即时发现、通过共享工件协调 Agenthosted-agents在远程沙箱、后台环境、热池或多玩家 Agent 基础设施中运行编码 Agentevaluation为 Agent 行为创建确定性检查、评分表、回归套件、生产监控或质量门advanced-evaluation使用 LLM 评审、成对比较、校准、偏差缓解或人类对齐的质量评估harness-engineering设计带锁定评估器、可编辑面、持久日志、新颖性门、回滚与审批边界的自主循环self-improvement-loops构建自我修改的循环失败驱动的 harness 自编辑、元 harness 搜索、演化式脚手架搜索、上下文机制演化与自修改接受门project-development判断 LLM 是否合适、塑形批处理流水线、创建分阶段工件、估算运营成本bdi-mental-states对 Agent 建模信念、欲望、意图、理性行动轨迹或神经符号状态转换值得注意的细节context-fundamentals的 SKILL.md 中用Do not activate块显式把操作性工作路由给其他技能调试注意力失败 →context-degradationtoken 效率 →context-optimization会话摘要 →context-compression文件卸载 →filesystem-context项目形态 →project-development。这种边界声明式描述不是文档装饰而是路由模型实际消费的路由信号。完整系统示例多技能协同的落地案例examples/ 目录包含 6 个完整系统设计展示多个技能如何协同工作。每个示例都带完整 PRD含架构决策、技能映射哪些概念影响了每个决策与实现指导示例说明应用技能digital-brain-skill面向创始人/创作者的个人操作系统完整 Claude Code 技能含 6 个模块、4 个自动化脚本context-fundamentals, context-optimization, memory-systems, tool-design, multi-agent-patterns, evaluation, project-developmentx-to-book-system监控 X 账号并生成每日综合书的多智能体系统multi-agent-patterns, memory-systems, context-optimization, tool-design, evaluationllm-as-judge-skills生产级 LLM 评估工具TypeScript 实现19 个通过的测试advanced-evaluation, tool-design, context-fundamentals, evaluationbook-sft-pipeline训练模型模仿任意作者风格写作含 Gertrude Stein 案例Pangram 人类评分 70%总成本 2 美元project-development, context-compression, multi-agent-patterns, evaluationinterleaved-thinking推理轨迹优化器捕获、分析 Agent 失败模式并转化为生成的技能evaluation, advanced-evaluation, context-degradation, harness-engineeringlong-horizon-prompt-lab生产级教学网站方法指南、可复制任务简报模板、4 组完整提示词重写、结构化审计与带限定条件的研究/厂商参考目录long-horizon-prompting, harness-engineering, multi-agent-patterns, advanced-evaluation其中 digital-brain-skill 是技能原则 → 系统架构的可追溯范例3 级渐进披露加载SKILL.md → 模块文件 → 数据文件、6 个独立模块、以 schema 优先行的 JSONL 追加式记忆、4 个整合自动化工具其 HOW-SKILLS-BUILT-THIS.md 把每个架构决策逐条映射回具体技能原则。llm-as-judge-skills 则提供带测试的 TypeScript 参考实现直接评分、带位置偏差缓解的成对比较、评分表生成、组合全部能力的 EvaluatorAgent核心实现位于 examples/llm-as-judge-skills/src。book-sft-pipeline 展示两级重叠切块、15 提示词模板防止记忆化以及用现代场景测试区分风格迁移 vs 内容背诵的验证方法。Researcher Operating System把研究转化为可审计的技能变更如果只是静态的技能合集这个仓库只是文集。researcher/ 目录定义了一套基于文件的操作系统让仓库成为复利式真相源compounding source of truth持续发现可信来源 → 按评分表评估 → 提取可落地的机制而非泛泛结论→ 映射到新技能/技能更新/仅参考笔记 → 门禁通过后准备可审查的 PR。该目录刻意保持文件化Agent 无需托管调度器即可检查、续跑、审计工作。生命周期与核心组件运行生命周期为discover - triage - evaluate - extract - map - draft - validate - prepare-pr - human-merge。README 列出的组件清单来源注册表researcher/source-registry.md优先级来源、排除规则、监控查询评分表researcher/rubrics/内容策展、技能变更、harness 变更、成对技能修订四份门禁评分表机制注册表researcher/mechanisms/registry.jsonl 加ledgers/16 个已接受的行为变更作为首要新颖性信号配以追加式append-only的接受/拒绝台账作为机构记忆声明溯源researcher/claims/index.jsonl12 条带来源 URL、证据强度、易变性与最近审阅日期的溯源声明——这也解释了技能正文中(claim-*)内联 ID 的用途数值、基准或厂商性能声明必须有溯源记录支撑否则应弱化措辞或移入带日期的参考材料语料索引researcher/corpus/index.json技能、激活场景、机制 ID、声明 ID 的规范机器可读映射运行状态机researcher/runs/run-id/run-state.jsoninitialized - retrieved - evaluated - proposed - novelty_checked - validated - pr_ready - closed激活回归测试researcher/fixtures/activation-cases.jsonl19 条确定性提示词专门捕捉技能边界混淆对抗基准researcher/benchmarks/试图钻循环空子的场景——重复机制、未检索证据、错误的评分表计算、自我批准的评分表修改、弱证据新颖性连续循环researcher/scripts/ 中loop_*.py加 researcher/orchestration/launchd/收件箱、来源发现、一次一状态推进、每日运维、停放审查队列与 launchd 服务定义技能健康门researcher/scripts/skill_health.py确定性的正文质量评分当前严格语料得分为 0.91170 个被标记技能。运行参数集中在 researcher/orchestration/config.jsonloop_step_minutes: 10每 10 分钟推进一步、loop_discover_hours: 12每 12 小时发现一轮、loop_daily_hour_utc: 6每日 6 点 UTC 运维并设置了max_active_runs: 3、max_runs_per_day: 6、max_parked: 12、max_failures_per_day: 5等预算上限。从配置文件结构看mode目前为dry-run付费 LLM 通道被保留给未来的评审/综合用途。操作者命令先一次性安装校验依赖python3 -m pip install -r requirements-dev.txtrequirements-dev.txt 目前只含pyyaml因此本地门禁的额外负担很轻。随后是全部确定性命令# 确定性门禁也在 CI 中对每个 PR 执行 python3 -m unittest researcher.scripts.tests.test_skill_frontmatter python3 researcher/scripts/validate_platform_compat.py --require-reference-validator python3 researcher/scripts/validate_repo.py --strict python3 researcher/scripts/skill_health.py --strict --no-history python3 researcher/scripts/run_benchmarks.py python3 researcher/scripts/check_activation_cases.py # 单运行就绪检查仅活跃运行 python3 researcher/scripts/validate_run.py --run-dir researcher/runs/run-id # 连续循环手动触发 python3 researcher/scripts/loop_discover.py python3 researcher/scripts/loop_step.py --allow-fetch python3 researcher/scripts/loop_daily.py python3 researcher/scripts/loop_status.py # 连续循环守护进程macOS researcher/orchestration/launchd/install.sh # 安装 launchd 任务10 分钟步进、12 小时发现、每日运维 researcher/orchestration/launchd/uninstall.sh # 移除 launchd 任务守护进程的详细预算与人工审查面见 researcher/runbooks/continuous-operation.md。四条硬保证循环从不调用付费 LLM、不做出站写入HTTP 检索仅用标准库1.5 MB 上限、30 秒超时机制晋升要求记录在案的人工审阅者 通过运行就绪检查所有队列变更都是原子的临时文件 os.replace并经fcntl锁串行化Agent 可以在门禁通过后准备 PR但合并与推送始终由人控制——该目录中不存在任何授权自动合并的流程。路由基准描述就是路由信号技能路由决定给定任务是否加载了正确的技能被端到端基准化通过 Cursor SDKresearcher/benchmarks/sdk-runner/要求 Node 20对 4 个前沿模型执行三轮完整扫描——50 条提示词 × 4 模型 × 3 次重复 每轮 600 次调用。三轮发布的完整报告在 researcher/benchmarks/router/results-published/基线2026-05-15.md定向描述重写后2026-05-15-v2.md含相对基线的增量全语料硬化后2026-05-19.md600/600 可用记录0 格式失败方法论上有两个关键细节见 2026-05-19 报告每次提示词与 15 个技能激活描述以确定性打乱顺序呈现且不加载任何技能全文settingSources: []唯一的 routing 信号就是提示词内的描述——这直接验证了描述即路由信号的设计置信区间为 2000 次重采样的 95% bootstrap。数据标记出的三个技能的描述重写增益技能基线 Top-1重写后增量context-fundamentals0.2550.48923.4ppproject-development0.7501.00025pp达到满分tool-design0.7290.8077.8pp全语料硬化后的分模型 Top-1 / Top-3 准确率模型Top-1Top-3gemini-3.1-pro0.9200.933composer-20.9130.947gpt-5.50.9130.973claude-opus-4-70.8400.9332026-05-19 报告的混淆矩阵显示context-optimization、filesystem-context、harness-engineering、hosted-agents、latent-briefing、memory-systems、multi-agent-patterns、project-development在该轮扫描中全部满分剩余失败集中在已知的模糊边界——无匹配技能负控提示词、一条真正歧义的评估类提示词以及context-fundamentals作为兜底技能的天然宽边界。要精确复现这些数字运行器提供的命令是详见报告Reproducibility一节cd researcher/benchmarks/sdk-runner npm install export CURSOR_API_KEYyour-key node --experimental-strip-types src/runRouter.ts --models claude-opus-4-7,composer-2,gemini-3.1-pro,gpt-5.5 --reps 3 --seed 1 --max-budget-usd 15 python3 ../../scripts/render_router_report.py \ --results ../router/results/date-seed \ --fixture ../router/prompts.jsonl \ --output ../router/results-published/date.md这套描述 → 基准 → 重写 → 再基准的闭环把 README 中渐进式披露从设计口号变成了可测量、可回归的工程指标。仓库结构与技能目录规范每个技能遵循 Agent Skills 规范目录结构为skill-name/ ├── SKILL.md # 必需指令 元数据 ├── scripts/ # 可选演示概念的可用代码 └── references/ # 可选附加文档与资源规范模板在 template/ 目录。对照模板可以看到一个合格技能正文的标准小节是When to Activate含不激活边界块、Core Concepts、Detailed Topics、Practical Guidance、Examples、Guidelines、Gotchas经验型失败模式模板称之为任何技能中信号最高的内容、Integration用纯文本而非链接引用相关技能避免跨目录引用问题与References技能内部引用使用相对于技能自身的./references/...路径文件尾附创建/更新日期、作者与版本号元数据。仓库级辅助文件包括AGENTS.md 与 CLAUDE.md给 Agent 的工作约定、docs/ 目录下的背景研究笔记agentskills、compression、gemini/claude research 等、CHANGELOG.md版本演进记录。贡献约定与许可仓库遵循 Agent Skills 开放开发模式贡献要求遵循技能模板结构提供清晰可执行的指令在合适处给出可运行的示例记录权衡与潜在问题将SKILL.md保持在 500 行以内以保证性能。仓库使用 MIT 许可见 LICENSE技能中的原则源自头部 AI 实验室与框架开发者的研究与生产经验每个技能都附带支撑其建议的研究与案例参考。小结这个仓库的价值密度体现在三层17 个技能目录skills/提供了从上下文解剖到自改进 harness 的可直接安装的知识体系examples/提供了 6 个多技能协同的完整系统设计作为技能 → 架构的映射证明researcher/则用确定性门禁、机制/声明注册表、连续循环与可复现的路由基准让整个语料库的每次变更都有据可查、可回归验证。对构建生产级 Agent 系统的开发者而言既可以按激活场景表把技能装入自己的 Agent 平台也可以直接参照 Researcher OS 的门禁设计为自己的提示词/技能语料库建立同样的演进质量保障。【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考