与提示词完整性测试怎么做)
Webnovel Writer 行为评估Behavior Evals与提示词完整性测试怎么做【免费下载链接】webnovel-writer基于 Claude Code 的长篇网文辅助创作系统解决 AI 写作中的「遗忘」和「幻觉」问题支持 200 万字量级 连载创作。项目地址: https://gitcode.com/GitHub_Trending/we/webnovel-writerWebnovel Writer是基于 Claude Code 的长篇网文辅助创作系统支持 200 万字量级连载。它的大脑是 8 个 Skill 提示词和 4 个 Agent 提示词——一旦提示词悄悄改坏写作流程就会行为漂移。这篇文章手把手教你用它的行为评估Behavior Evals和提示词完整性测试这两套守护机制快速验证整个 AI 写作系统的行为契约没有漂移全程不需要调用 LLM。为什么 AI 写作系统需要行为评估传统软件靠单元测试守护代码而 Webnovel Writer 的核心逻辑写在 Markdown 提示词里SKILL.md、agents/*.md。改一句话、删一段命令示例都可能让 AI 跳过写作闸门或绕过提交链路。因此项目用两层机制锁住行为机制守护对象位置行为评估关键行为契约、Agent 边界、运行时探测run_behavior_evals.py提示词完整性测试提示词结构、引用、CLI 命令test_prompt_integrity.py两者都是确定性静态检查不跑模型、不花钱、几秒出结果可直接放进 CI。三步跑起行为评估克隆、执行、读报告第 1 步获取项目代码git clone https://gitcode.com/GitHub_Trending/we/webnovel-writer第 2 步执行行为评估脚本在项目根目录运行-X utf8保证中文路径与输出不乱码python -X utf8 webnovel-writer/scripts/run_behavior_evals.py --format text脚本会读取用例套件 fast.json逐条执行 18 个用例输出类似OK behavior evals fast: 18/18 passed PASS skill_frontmatter: all skills have name and description PASS write_blocks_before_commit: write flow keeps blocking and runtime gates ...第 3 步看懂退出码与 JSON 报告退出码0 全部通过1 存在 FAIL适合直接接 CI 门禁。加--format json可拿到结构化报告ok/total/passed/failed/ 每条reasonevidence方便接入自动化平台。只想针对某个仓库副本跑可用--root指定根目录见 main()。行为评估在检查什么8 类用例速览评估器注册表 EVALUATORS 内置 8 类探测覆盖从提示词写得对不对到运行时真的动没动skill_frontmatter8 个 Skill 是否都有可路由的namedescription。skill_contract按用例声明的关键句检查契约支持required必须出现、ordered顺序断言、forbidden_patterns禁止出现。例如/webnovel-write必须保留prewrite → precommit → postcommit三道写作闸门且 precommit 必须出现在chapter-commit之前。write_blocking_gate写章流程必须保持阻断式审查 运行时闸门。data_agent_boundary数据 Agent 只产出 JSON 到.webnovel/tmp/禁止直接写 state/index/memory。artifact_ownership写入所有权红线——reviewer 不持 Write、data-agent 是唯一 tmp 写入者。commit_projection_runtime在临时目录里真实调用ChapterCommitService提交一章验证 commit 确实驱动了状态投影这是唯一跑起来的运行时用例。dashboard_read_only仪表盘 API 只允许 GET正则扫描是否存在 POST/PUT/DELETE。user_report_probe4 个场景探测最终报告行为——审查被跳过、数据产物缺失、投影重试自愈、阻断问题必须人工处理。提示词完整性测试静态校验六道关test_prompt_integrity.py 用 pytest 参数化扫描agents/*.md与skills/*/SKILL.md全部提示词核心六道关Frontmatter 完整性Agent 必须有name/description/toolsSkill 必须有name/description。Agent 模板结构每个 Agent 至少包含 4 个编号段落防止提示词骨架被改散。引用完整性提示词里references/、skills/、agents/的相对路径引用必须真实存在——AI 不会读到你让它读的文件。CLI 命令有效性提示词中出现的webnovel.py xxx子命令必须存在于 CLI 注册表杜绝提示词教 AI 执行不存在的命令。无残留引用已删除的文件如workflow_manager.py不得再被提示词提到。跨层红线断言写入所有权与 frontmatter tools 一致、三道 gate 顺序、reviewer 输出字段与 review_schema.py 匹配、禁止旧Task工具名等。一键执行提示词完整性测试根目录已配好 pytest.ini测试路径与 90% 覆盖率门槛都内置python -m pytest webnovel-writer/scripts/data_modules/tests/test_prompt_integrity.py -v只想快速回归行为评估本身是否还绿可以看守护测试 test_run_behavior_evals.py它断言 fast 套件全部通过且用例数不少于 5 个。新手常见问题Q行为评估和 pytest 单元测试什么关系行为评估是独立脚本面向AI 行为契约pytest 里还有一个轻量测试专门保证 fast 套件常绿提示词完整性测试则是纯 pytest 静态扫描。三者叠加构成提示词—行为—运行时三层守护。Q某条 FAIL 了怎么修看reason和evidence即可定位契约类失败通常是提示词里少了某个关键句或顺序颠倒按 evidence 提示改回对应SKILL.md段落再重跑脚本即可全程秒级。Q想加一个新契约检查在 fast.json 加一条skill_contract用例写清required/ordered/forbidden_patterns或在评估器注册表里新增类型提示词契约就有了新的守护。小结行为评估run_behavior_evals.py fast.json8 类评估器验证 AI 写作行为契约退出码可接 CI。提示词完整性测试pytest 静态扫描提示词结构、引用、CLI 命令与写入所有权红线。两者都不需要 LLM是维护 Webnovel Writer 这类提示词驱动系统最经济的行为回归手段。【免费下载链接】webnovel-writer基于 Claude Code 的长篇网文辅助创作系统解决 AI 写作中的「遗忘」和「幻觉」问题支持 200 万字量级 连载创作。项目地址: https://gitcode.com/GitHub_Trending/we/webnovel-writer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考