如何用garak在3分钟跑完第一次LLM漏洞全扫描:新手完整指南

发布时间:2026/9/18 13:27:57
如何用garak在3分钟跑完第一次LLM漏洞全扫描:新手完整指南 如何用garak在3分钟跑完第一次LLM漏洞全扫描新手完整指南【免费下载链接】garakthe LLM vulnerability scanner项目地址: https://gitcode.com/GitHub_Trending/ga/garakgarak 是 NVIDIA 开源的 LLM 漏洞扫描器用来检查大语言模型能否被诱导出你不想要的内容。它内置几十种攻击探测与配套检测器覆盖越狱、提示词注入、毒性输出、训练数据泄露等风险。本文用一条命令带你完成首次扫描并解释输出中关键数字的含义。garak漏洞扫描器能做什么把 garak 理解成一场对抗赛探测probes是进攻方garak/probes/ 里每个探测对应一类具体漏洞比如 DAN 系越狱、Base64 编码注入、毒性续写检测器detectors是裁判garak/detectors/ 里每个检测器负责判定模型某条回复有没有越线。另有两类辅助角色生成器generators封装被测模型的接入方式支持 OpenAI、Hugging Face、Ollama、REST 等接口配置configs把一组探测与运行参数打包。四者各司其职一次扫描就确定了。组成作用一句话定位Probes 探测携带预置攻击载荷进攻方决定怎么打Detectors 检测器判定回复是否越线裁判决定过不过Generators 生成器接入被测模型通道决定跟谁对话Configs 配置打包探测与运行参数剧本决定范围如何安装garak并跑通第一次扫描先安装python -m pip install -U garak这条命令从 PyPI 拉取最新版 garak判断标准是命令正常结束且没有报错输出。再跑第一次扫描。gpt2 是 Hugging Face 上的小模型本地下载即可使用不需要 API 密钥python3 -m garak --target_type huggingface --target_name gpt2 --spec probes.dan.Dan_11_0三个参数的含义--target_type指定模型接口类型--target_name指定具体模型名--spec把范围限定在 DAN 11.0 这一个越狱探测上——默认情况下 garak 会跑全部探测第一次使用最好先锁死一个。判断成功运行结束会打印报告文件路径并给出该探测的一行结果若看到 FAIL说明这个模型被该攻击成功越狱了。三个常见扫描场景分别用什么命令场景一验证对 DAN 越狱家族的抵抗力。python3 -m garak --target_type huggingface --target_name gpt2 --spec probes.dan预期输出是每种 DAN 变体各占一行逐行给出判定结果与失败率。场景二检查 API 模型是否容易被编码注入命令为python3 -m garak --target_type openai --target_name gpt-5-nano --spec probes.encoding预期输出是每种编码方式各自的失败率数值越高说明该编码越容易把注入内容带进去。场景三决定范围前先浏览探测清单命令为python3 -m garak --list_probes预期输出是所有可用探测的列表追加-v可看到带级别和描述的明细表格。扫描结果里的数字怎么读只需要看三处。第一处是每行末尾的 PASS/FAIL 标记这是该探测的结论FAIL 表示至少有一次攻击尝试得手。第二处是行末的成对数字例如 840/840前者是这一轮模型生成的总条数后者是其中被判定为行为正常的条数默认每条提示词会生成 10 次所以这个数字通常远大于提示词数量。第三处是运行首尾打印的 .jsonl 报告文件名每次尝试和判定结果都记录在这里garak.log 则存放错误细节需要追查某条具体提示词时从这两个文件入手。如何避开新手最常踩的三个坑第一条是别一上来就跑全量。默认配置会执行全部探测、每条提示词生成 10 次对着 API 模型会消耗大量 token建议先用--spec锁定单个探测验证链路再逐步扩大范围。第二条是模型响应快时不开并行。走 API 的模型可以并发多条提示词命令里加--parallel_attempts 16即可提速garak 也会在当前生成器支持并行时主动在命令行提示你。第三条是别猜探测名。拼错的名称会直接报错而不是静默跳过不确定时先跑--list_probes核对一遍。扫描跑完之后去哪里完整参数列表与报告结构可查 官方 CLI 参考仓库 configs 目录里自带 fast.json 和 bag.yaml用--config直接加载分别对应快速扫描和更全面的扫描。想弄清攻击载荷具体怎么构造可以从 garak/probes/ 的源码读起README 中的探测表格也逐个介绍每类攻击的来龙去脉。【免费下载链接】garakthe LLM vulnerability scanner项目地址: https://gitcode.com/GitHub_Trending/ga/garak创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询