上周,有个做制造业的朋友跟我吐槽:他花了两天时间给 AI 助手上传了几十份产品手册,结果客户问”你们的激光切割机能切多厚的钢板?”,AI 回了一句”我们的设备性能优异,欢迎咨询”——手册里明明写着”最大切割厚度:25mm碳钢”,AI 愣是没找到。
他问我:”知识库不是已经建好了吗?为什么 AI 还是乱说?”
这就是为什么你需要读这篇文章。
前几篇我们聊了怎么给 AI 助手搭建知识库——上传文档、设置分段、测试回答。但如果你只停留在”会用”这个阶段,一旦效果不好,就只能干瞪眼。
理解背后的原理,才能知道问题出在哪、该怎么调。
那么这篇文章,我们来讲讲RAG(检索增强生成),就是 AI 助手”查资料回答问题”的核心原理。别被这个英文缩写吓到——读完你会发现,它的逻辑其实跟我们日常查资料的方式一模一样,只不过 AI 把这个过程自动化了。
接下来我们就聊聊:
①AI 助手是怎么从几十份文档里”找到”正确答案的
②当 AI 回答不准时,能判断问题出在”找”还是”答”
③学会在 Coze 里调整关键参数,让知识库的效果翻倍
一、RAG是什么?
RAG = Retrieval Augmented Generation
中文就是:检索增强生成
拆开来理解:
①检索(Retrieval):查资料、找信息
②增强(Augmented):用查到的资料来补充、加强
③生成(Generation):组织语言、生成回答
它和传统的LLM有啥区别?如果要用一个生活里的常识来类比,就类似考试:
传统LLM(闭卷考试) vs RAG(开卷考试)
| 对比维度 | 传统LLM(闭卷考试) | RAG(开卷考试) |
|---|---|---|
| 知识来源 | 训练时的记忆 | 可以现场查阅资料 |
| 时效性 | 训练数据截止日期 | 可以查最新资料 |
| 准确性 | 可能”编造”答案 | 基于真实文档回答 |
| 适用场景 | 通用知识、常识 | 专业领域、公司内部知识 |
①传统LLM:像一位博学但记忆力有限的老教授
②RAG:像一位聪明的研究生,遇到问题会去图书馆查书
所以我们现在就知道了,RAG主要解决的三大问题:
| 问题 | 传统LLM的局限 | RAG的解决方案 |
|---|---|---|
| 1. 知识时效性 | 训练数据有截止日期 | 能查最新上传的文档 |
| 2. 幻觉问题 | 可能编造不存在的信息 | 基于真实文档,不乱编 |
| 3. 知识定制 | 无法接入私有知识 | 可以接入公司内部文档 |
二、RAG的工作流程
1.流程图
[用户提问]
↓
[查询理解]
Agent理解用户想问什么
(类似"听懂问题")
↓
[检索阶段] ← 关键步骤!
├─ 把问题和知识库内容都转成"向量"
│ (把文字变成数字,方便计算相似度)
├─ 计算相似度,找出最相关的内容片段
│ (找"最像"的答案)
└─ 返回Top N个相关片段
↓
[生成阶段]
├─ 把检索到的内容作为"参考资料"
├─ LLM基于这些资料组织语言
└─ 生成最终回答
↓
[输出答案] + [显示引用来源]

2.关键概念解释
这里不得不科普几个概念,不过不用头疼,我们尽量用类比的方式让它们好理解一些。
(1)向量(Embedding)—— RAG的”翻译官”
①什么是向量?
把文字变成一串数字(比如[0.1, 0.5, -0.3, …]),每个数字代表文字的某个”特征”
举个例子:想象给每个知识点一个”坐标位置”:
- “年假制度” 的坐标大约是 (0.8, 0.2, 0.5, …)
- “病假申请” 的坐标大约是 (0.75, 0.25, 0.48, …)
- “薪资发放” 的坐标大约是 (0.1, 0.9, 0.3, …)
“年假”和”病假”因为都属于休假类,坐标非常接近;”薪资”则在完全不同的位置。当你问”怎么请假”,系统就找坐标最近的几个知识点——这比字面匹配聪明得多。
②为什么需要向量?
计算机不懂文字,但擅长计算数字,向量可以表示语义相似性(”请假”和”休假”向量接近)。

(2)相似度计算—— RAG的”匹配引擎”
①如何计算?
计算问题向量和文档向量之间的”距离”,距离越小,相似度越高。
举个例子:就像在图书馆找书。
你要找关于”请假制度”的书,不是靠书名里有没有”请假”两个字,而是靠图书馆员根据你的问题,找出内容最相关的那几本。《员工假期管理规定》《考勤管理办法》这类书,即使书名没有”请假”,也会被精准找到。
(3)召回(Retrieval)—— RAG的”图书管理员”
①什么是召回
从知识库中找出相关内容的过程。不是找到”完全一样”的,而是找到”最相关”的。
以上三个概念,结合例子来看,是不是就好理解多了?
但是你可能会问,那我要怎么用啊?感觉还是很抽象。
那我们还是以coze为例,讲讲在coze中是如何配置的
(4)在 Coze 里,这些概念对应哪些设置?
我们在coze工作流里的知识库检索节点,上传完知识后,会发现底下有几个选项。
如果你对RAG没有任何理解的话,这几个选项你是完全不清楚什么意思的。

我们上面讲了向量、相似度、召回,其实概念都可以对应上这几个选项。我们不需要写代码,只需要理解每个参数的含义,就能调出更好的效果。
①搜索策略:就是选择用哪种方式找内容。「语义」对应向量检索,「全文」对应关键词检索,「混合」是两者结合。大多数场景选「混合」就对了,系统会同时做两种检索,然后综合排序给出最好的结果。
②最大召回数量:相当于告诉 AI”你最多可以翻几份参考资料”。默认是 5 条,一般设 3-5 条就够了。设太多,AI 容易被无关信息干扰;设太少,可能遗漏重要内容。
③最小匹配度:这就是相似度的门槛——只有”考试及格”的内容才会被召回。范围 0 到 1,默认约 0.5。如果你发现 AI 老说”根据现有资料无法回答”,可以试着调低到 0.3;如果回答总跑题,说明门槛太低,调高到 0.6 试试。
④查询改写:这个功能帮 AI 在多轮对话中更准确地理解用户真正想问什么。比如用户先问”你们有哪些设备?”,接着问”最贵的那个多少钱?”——查询改写会帮 AI 把第二个问题理解为”最贵的设备价格是多少”。建议保持默认开启。
总结:对大多数业务场景,搜索策略选「混合」、召回数量设 3-5、其他保持默认,就是一个很好的起点。后续根据测试效果再微调。
三、向量检索 vs 关键词检索
上一部分我们知道了,RAG 在检索阶段会把文字变成向量来计算相似度。但实际上,”找内容”并不只有一种方法。就像我们平时搜索信息一样——有时候你知道确切的关键词(比如搜产品型号”LC-3015″),有时候你只知道大概想找什么(比如”能切厚钢板的设备”)。
所以这一章节也还是介绍下向量检索和关键词检索的概念和区分。
对应到 AI 的知识库检索,也有两种主要方式:向量检索和关键词检索。理解它们的区别,能帮你在效果不好时快速判断问题出在哪里。
1.向量检索(语义检索):AI 不看字面,而是理解你的”意思”。它把问题和文档都转成向量,通过计算”语义距离”来找最相关的内容。好处是能理解同义词和近义词——你说”请假”,它也能找到”休假制度”。缺点是对非常精确的专业术语或型号,有时反而不如直接匹配。
2.关键词检索(全文检索):这是最传统的搜索方式,就像在文档里按 Ctrl+F 搜索一样,找的是字面完全匹配的内容。好处是对产品型号、缩写、专有名词特别精准,缺点是不理解语义——你搜”请假”,包含”休假”但没有”请假”二字的文档就会被漏掉。
实际使用中,最好的方式是两者结合——也就是 Coze 里的「混合」搜索策略。 让语义检索和关键词检索各自发挥优势,然后综合排序,效果最好。
场景:员工问:”我生病了想休息几天,需要什么手续?”
| 检索方式 | 可能匹配到的文档 | 效果评估 |
|---|---|---|
| 关键词检索 | 只找包含”生病”、”休息”、”手续”的文档 | 可能漏掉”病假申请流程”文档 |
| 向量检索 | 找到”病假制度”、”请假流程”、”医疗休假规定” | 更全面,能理解语义 |
| 最佳实践 | 两者结合(多路召回) | 既理解语义,又不漏专业术语 |

四、影响RAG效果的4个因素
再说说哪些因素会影响RAG的效果
因素1:文档质量(基础)
文档质量检查清单:
①✅ 内容清晰准确,没有错别字
②✅ 格式规范,段落分明
③✅ 及时更新,没有过期信息
④✅ 专业术语统一,避免歧义
⑤❌ 避免扫描件图片(文字无法识别)
⑥❌ 避免格式混乱的文档
优化技巧:
①上传前用Word整理一遍
②删除页眉页脚、广告等无关内容
③重要信息用加粗或标题突出
因素2:分段策略(关键)
分段大小的影响:
| 分段大小 | 优点 | 缺点 | 适用场景 |
|---|---|---|---|
| 太小 (<100字) | 检索精准 | 信息不完整,上下文缺失 | 问答对、短条款 |
| 适中 (200-500字) | 信息完整,检索准确 | 可能需要重叠区域 | 大多数文档 |
| 太大 (>1000字) | 上下文丰富 | 检索不精准,包含无关信息 | 需要完整理解的长文档 |
重叠区域的作用:
文档内容:...[段落A结束][段落B开始]...
分段情况:
- **重叠区域(Overlap)的作用**:
分段时,让相邻两段的内容有一部分"重叠",避免关键信息被切断在两段之间。
举个例子:
假设文档内容是:…[段落A:年假规定]…[段落B:申请流程]…
❌ 没有重叠时:
- 分段1:段落A 全部内容
- 分段2:段落B 全部内容
→ 问题:如果关键信息”年假申请须在开始前3天”横跨A结尾和B开头,
检索时两段都给不出完整答案。
✅ 有重叠时(如重叠 10%):
- 分段1:段落A + 段落B 的前10%内容
- 分段2:段落A 的后10%内容 + 段落B + 段落C 的前10%内容
→ 优点:关键信息不会被切断,每段都保留了足够的上下文。
这就是为什么 Coze 分段配置里有「分段重叠度%」这个参数,保持默认 10% 即可。
@@FIG@@<figure class="wp-block-image"><img src="https://duntools.com/wp-content/uploads/2026/08/what-is-rag-explained-4.jpg" alt="配图"/></figure>
### 因素3:检索策略(核心)
**召回数量设置**:
| 召回数量 | 适用场景 | 优缺点 |
|-|-|-|
| **1-2条** | 答案唯一确定 <br/>(如"公司地址") | + 回答简洁 <br/>- 可能遗漏相关信息 |
| **3-5条** | **推荐设置** <br/>大多数问答场景 | + 信息全面 <br/>+ 回答准确 |
| **6-10条** | 复杂问题需要综合多个信息 | + 信息非常全面 <br/>- 回答可能冗长 |
| **>10条** | 一般不推荐 | - 信息过载 <br/>- 生成质量下降 |
**相似度阈值**:
在Coze 对应的配置:「最小匹配度」参数(范围 0-1)
如果设置太低(如 0.1)→ 什么都召回,AI 会被大量无关内容干扰;如果设置太高(如 0.9)→ 很难召回到内容,AI 频繁说"根据现有资料无法回答"
建议保持默认值(约 0.5);如果 Agent 总说"不知道",可适当调低到 0.3;如果回答总跑题,可适当调高到 0.6
### 因素4:生成策略(最后一步)
**提示词设计要点**:
你是一个专业的[角色],请基于以下资料回答问题:
[检索到的资料]
要求: 1. 只使用提供的资料回答 2. 如果资料中没有相关信息,请说”根据现有资料,无法回答这个问题” 3. 回答要简洁明了,不超过3句话 4. 在回答末尾标注信息来源
📋 这套RAG原理相关模板,我整理成模板了
跟着上面步骤搭要花点时间。想直接拿现成的改,加我微信备注「RAG原理」,我发你。
🤔 卡在某一步了?
搭建过程里如果哪一步卡住了,如果你照着做没跑通,或者你们公司情况不太一样,可以找我聊聊,我免费帮你看看怎么调。不合适我也会直说。
扫码加我,备注「RAG原理」领模板
想看更多这类方案,我都整理在 吨师傅工具箱 里了:客户管理、进销存、工单报修……按场景分好类,可以直接抄。


