
同样一份研究报告摆在桌面上的实现路线其实只有三条手写 Markdown、通用 RAG/向量检索以及 dsh-research-report 这种「证据账本 封存报告」。它们不是谁替代谁而是各自擅长回答不同的问题。选之前先问自己一句你要的是「写得快」还是「经得起追问」。三条路线各自在解决什么路线一手写 Markdown 报告最轻零依赖。你自己找资料、自己判断、自己写。优点是自由观点、论述、结构全听你的。缺点也在这里——报告的可信度完全建立在作者自觉上谁也没法从文件本身验证某条数字是不是抄错了。交出去之后读者只能选择相信。路线二通用 RAG / 向量检索它的强项是「找」。把资料切块、嵌入、存进向量库提问时召回最相似的片段。对于「从一大堆文档里快速找到相关段落」它确实好用。但相似度不等于正确性向量检索给出的是「像」不是「对」。它不会告诉你某条论断的出处能不能逐字核到也不会在你写错数字时拦你一下。路线三dsh-research-report它反过来弱在「找」强在「证」。每条论断都绑定到一个不可变的证据快照逐字节校验最后封存进一个带版本号的目录。它的定位不是替你写而是确保你写下的每条都能找到出处。安装形态可以先看一眼 完整插件清单与汉化避坑指南。一张可核对的对比表维度手写 Markdown通用 RAG 检索dsh-research-report主要能力表达召回核实核对粒度无语义相似度字节级字面量结论可复算否否是封存哈希缺口是否可见不保证不适用是[未核实]等标记核心校验网络依赖取决于你需要嵌入/向量服务零网络结论确定性人工判断概率性确定性表里最关键的一行是「核对粒度」。dsh-research-report 走的是字节级主张里的每个数字和引用片段都必须能在绑定快照里逐字定位。这条路线的代价是它不做语义理解——这是它 v1 的有意选择「可审计胜过聪明」。三个可验证的论据论据一封存哈希任何人都能重算报告封存后目录里并排躺着report.md、manifest.json、verification.jsonl和disconfirmation.jsonl。封存哈希就是manifest.json的 SHA-256而 manifest 自己又携带了报告哈希、每条证据的哈希、每份审计日志的哈希。这意味着「复核」不需要任何特权谁拿到目录谁就能按同一套算法一层层重算对不上就是对不上。论据二SARIF 2.1.0 的机器可读输出独立命令行dsh-research-verify打包在lib/cli.js里零deepseek-ai导入——不挂载插件也能审计任何一个封存目录它会重算封存哈希、report.md哈希和审计日志哈希对每条主张重跑字节级与完整性检查任一已执行的检查失败就以非零状态退出。输出可选 JSON 信封或 SARIF 2.1.0 文档前者方便脚本消费后者能直接交给支持 SARIF 的流水线。论据三零网络零模型的兜底封存之后确定性的verifySealedReport会再跑一遍重算封存哈希与审计哈希、重查每条主张把机器检查结果写进verifier-note.md。它零网络、零模型——即使模型服务挂了机器复核照样能跑完。模型复核在这里只是增强绝不替代。字节级 vs 语义级到底怎么选分歧点其实只有一个你要核对的是字面量还是意思要字面量的场景——数字、引文、法规条款、财务口径——字节级路线更靠得住因为它能给你一个确定的「是/否」还能被第三方复算。要意思的场景——一份材料的主旨、一段论述的逻辑——字节级会显得死板转述式的主张只要找不到可核对的字面量就会被验成unverified更别扭的是一条真主张如果数字缺失、标签却以另一个值出现会被读成contradicted。所以合理的组合是让 RAG 或搜索负责「找」让 dsh-research-report 负责「证」。前者给你候选后者逼你把候选变成可核对的出处。它自己也刻意不做深度研究循环——搜索与抓取复用ctx.web长任务交给ctx.jobs规划与综合仍留给模型。什么时候该选哪条只要表达、无人在意复核手写 Markdown 最快别为流程买单。要从海量文档里捞相关段落通用 RAG 检索更合适它的召回能力是另两条路线比不了的。要交出去、会被追问出处dsh-research-report 的字节级校验、封存哈希与 SARIF 输出才有意义。两者都要用检索当上游、用封存当门禁各司其职。别把它当通用知识库用它没有嵌入、没有语义相似度拿它做相似度召回是用错了工具。想看更多同类插件的中文清单与安装形态可以再翻一次 完整插件清单与汉化避坑指南。总结三条路线的取舍不在「谁更强」而在「你要核对字面量还是意思」——要可复核的出处就选字节级封存这条想对照同类插件的中文清单与安装形态见 完整插件清单与汉化避坑指南。适合与不适合适合需要对数字、引文、条款逐字负责的交付物要把「哪条没核实」明明白白标出来的审查场景需要第三方独立复算结论的协作已有检索能力、只缺一道核实门禁的团队。不适合以观点和论述为主的长文作者——转述会被验成未核实想要一键联网深度检索的人——gather只跑一轮且绝不自动组装把它当向量知识库用的人——它没有嵌入也不做语义相似度。标签dsh-research-report、DeepSeek Harness、选型对比、RAG、证据封存本文由 DeepSeek Harness Hub 自动整理数据来源于插件详情页。