
目录大模型原生缺陷为什么需要 RAGRAG 核心五步流水线拆解向量数据库选型对照表Demo / 生产 / 分布式场景RAG 怎么评估好坏不能靠主观感受企业落地最容易踩的 3 个大坑RAG 进阶玩法Query 改写、GraphRAG、Agentic RAG一句话总结1. 大模型原生缺陷为什么需要 RAG原生大模型相当于闭卷考试存在 3 个硬伤知识过时训练结束之后的新内容模型不知道幻觉不知道的内容也会编造答案硬输出私有知识盲区无法直接读取企业内部文档、业务资料✅ RAG 思路把 AI 变成开卷考试先检索参考资料再基于资料回答只能减少幻觉不能归零。输出答案需要附带引用溯源没有资料就如实说不知道。2. RAG 核心五步流水线拆解完整链路切碎文档 → 向量化 → 混合召回 → Rerank 精排 → 带引用回答STEP1 切碎文档将长文档切分 Chunk设置重叠区不能粗暴拦腰斩断防止上下文断裂丢失信息。注意模型输入存在最大上下文长度超长文本会被静默截断。STEP2 向量化把文本转为向量嵌入语义相近的文本在向量空间距离更近。STEP3 混合召回向量检索 BM25 关键词检索多路召回捞出 Top-K 候选片段。兼顾语义相似度和关键词精准匹配。STEP4 Rerank 精排【提升效果的关键一步】多路召回拿到 20 条候选后通过重排模型筛选出 3~5 条最相关片段是 RAG 效果提升的核心手段。STEP5 带引用回答交给大模型指令限定仅根据以下资料回答输出附带原文引用。你的场景推荐向量库本地 Demo 快速验证Chroma / LanceDB已有 PostgreSQLpgvector中小生产、要过滤和运维Qdrant亿级向量、分布式Milvus关键词 向量混合检索OpenSearch / Weaviate数据、向量、统计一套搞定Doris成熟/ StarRocksBeta⚠️选型三提醒① Doris/StarRocks 向量能力迭代很快落地前务必查阅最新官方文档② 团队熟悉度优先于性能差距如果已有 PGpgvector 往往总成本更低③ 删除文档时向量需要同步清理OLAP 适合批量导入不适合高频实时更新。4. RAG 怎么评估好坏不要凭肉眼主观感觉效果必须先建测试题库量化打分检索侧指标Hit RateTop-K 是否命中正确文档生成侧指标答案忠实于参考资料的忠实度常用评估框架RAGAS❌没有 assessment 的 RAG 调优 玄学迭代5. 企业落地最容易踩的坑重点三个权限、引用、向量同步清理权限过滤检索时按用户权限过滤文档防止跨部门数据泄露比如 A 用户查到 B 部门薪酬引用溯源回答标注来源段落方便人工核查、定位问题僵尸知识文档删除 / 更新时旧向量必须同步清理知识库会残留过时无效信息6. RAG 进阶玩法Query 改写用户口语化提问先改写、做 HyDE再送入检索优化召回质量GraphRAG结合知识图谱擅长多跳推理类复杂问题Agentic RAG让 AI 自主决定查询策略、检索次数自主规划检索动作7. 一句话记住 RAG让 AI先翻书、再答题切碎 → 向量化 → 召回 → 精排 → 带引用生成 落地三件套别忘了评估打分、权限过滤、向量同步清理