安全门控系统实战指南:ai-engineering-from-scratch 宪法式规则引擎与内容分类器

发布时间:2026/9/16 15:00:09
安全门控系统实战指南:ai-engineering-from-scratch 宪法式规则引擎与内容分类器 安全门控系统实战指南ai-engineering-from-scratch 宪法式规则引擎与内容分类器【免费下载链接】ai-engineering-from-scratchLearn it. Build it. Ship it for others.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratchai-engineering-from-scratch 是一套从零构建 AI 工程能力的开源课程项目覆盖 416 课、20 个阶段。本文聚焦其中的安全门控系统用宪法式规则引擎约束 AI 输出的行为契约用内容分类器拦截输出侧的毒性、隐私泄露与系统提示泄露两者最终汇入一道端到端安全门控。即使你是新手也能看懂这套给 AI 装安全护栏的完整思路。为什么 LLM 应用需要安全门控系统很多团队只检查用户输入却忽略模型输出——这给了攻击者一击绕过的机会任何输入管道没覆盖的新攻击最终都会落到用户身上。安全门控的核心思想是在请求生命周期的三个检查点设防生成前pre-gen检测器审查用户提示直接拦截高置信度攻击⚡生成中during-gen流式过滤器缓存 token 块发现违禁短语立即终止✅生成后post-gen内容分类器 宪法式规则引擎联合审查完整输出给出最终裁决宪法式规则引擎让 AI 行为有法可依规则引擎解决的是一类契约型约束例如所有包含代码的回复必须结束于可运行代码块、每次拒绝必须给出下一步建议。这类约束无法靠分类器识别只能写成声明式规则。项目内置一份 YAML宪法文件每条规则都包含名称、谓词、严重度和解释模板规则严重度作用no-empty-refusalmedium拒绝回复必须附带建议或转介end-with-runnable-or-assumptionmedium代码回复必须干净收尾no-pii-in-exampleshigh示例中不得出现真实邮箱/电话cite-when-asserting-factlow事实断言必须带引用no-internal-library-leakhigh内部库名称不得出现在输出中bounded-lengthlow回复不超过 800 词规则谓词支持all_of、any_of、not_组合所以单条规则就能表达如果回复含代码就必须以可运行块结尾且不引用内部库这样的复合逻辑。不只是拦截还能自动修复只拦截的规则引擎是半成品。项目内置了修复器Fixer引擎标记违规后修复器按规则执行声明式修补追加缺失内容、替换敏感片段再用结构化 diff记录改动增、删、改逐行可见让评审人员可以审计修复行为。规则文件可直接查看rules.yml。内容分类器输出侧的三道防线内容分类器盯着的是模型真正要发给用户的回复由三个独立分类器组成统一由路由Router决策毒性分类器基于词表的辱骂检测带否定窗口判断you are not a slur 不会误报PII 分类器正则匹配邮箱、电话、社保号、信用卡、IP 地址等形状指令泄露分类器用三元组重叠度对比输出与系统提示识别提示词回声路由按最高严重度执行动作策略规则极其简单严重度动作highblock丢弃输出返回策略拒绝mediumredact打码后再发出lowwarn附加软性提示nonelog记录后原样放行打码是独立进行的——同时命中毒性和 PII 的输出会先后经过两个打码器邮箱变成[redacted-email]卡号变成[redacted-card]。三个分类器的实现见 classifiers.py。三者如何协同端到端安全门控第 87 课把输入检测器、流式过滤器、分类器路由和规则引擎组合成一道完整门控聚合表同样确定任一信号 high 就 blockmedium 就 redactlow 就 warn全部干净才 allow。每个请求还会产出一条完整的RequestTrace审计记录包含各检查点裁决、最终动作与耗时——周一早上评审时一目了然。安全门控系统快速上手运行宪法式规则引擎演示进入 86-constitutional-rules-engine/code 目录执行python3 main.py会跑 3 个草稿回复、打印违规与修复 diff并输出outputs/rules_report.json运行分类器路由演示执行 85-content-classifier-integration/code 下的python3 main.py验证 block / redact / warn / log 四种动作全部被触发关键资料路径清单 规则引擎文档docs/en.md 内容分类器文档docs/en.md 端到端安全门控文档docs/en.md 规则引擎核心实现code/main.py 分类器路由实现code/main.py 前置安全知识phases/18-ethics-safety-alignment/常见问题Q为什么不用一个大模型做内容审核声明式规则和正则分类器零延迟、确定性可测试适合契约型约束神经分类器可以替换进同一套路由管道架构完全不变。Q分类器会不会增加延迟会但可以并行运行——分类器与 token 流式输出同时进行门控只缓冲最后一块再刷出用户几乎无感。Q这套方案适合生产吗项目交付的核心是管道 裁决 审计轨迹这套结构团队可以直接把聚合表和 trace 格式搬进自己的后端再按需替换分类器实现。【免费下载链接】ai-engineering-from-scratchLearn it. Build it. Ship it for others.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-from-scratch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询