RAG是什么?业务人员也能读懂的AI查资料原理

上周,有个做制造业的朋友跟我吐槽:他花了两天时间给 AI 助手上传了几十份产品手册,结果客户问”你们的激光切割机能切多厚的钢板?”,AI 回了一句”我们的设备性能优异,欢迎咨询”——手册里明明写着”最大切割厚度:25mm碳钢”,AI 愣是没找到。

他问我:”知识库不是已经建好了吗?为什么 AI 还是乱说?”

这就是为什么你需要读这篇文章。

前几篇我们聊了怎么给 AI 助手搭建知识库——上传文档、设置分段、测试回答。但如果你只停留在”会用”这个阶段,一旦效果不好,就只能干瞪眼。

理解背后的原理,才能知道问题出在哪、该怎么调。

那么这篇文章,我们来讲讲RAG(检索增强生成),就是 AI 助手”查资料回答问题”的核心原理。别被这个英文缩写吓到——读完你会发现,它的逻辑其实跟我们日常查资料的方式一模一样,只不过 AI 把这个过程自动化了。

接下来我们就聊聊:

①AI 助手是怎么从几十份文档里”找到”正确答案的

②当 AI 回答不准时,能判断问题出在”找”还是”答”

③学会在 Coze 里调整关键参数,让知识库的效果翻倍

一、RAG是什么?

RAG = Retrieval Augmented Generation

中文就是:检索增强生成

拆开来理解:

①检索(Retrieval):查资料、找信息

②增强(Augmented):用查到的资料来补充、加强

③生成(Generation):组织语言、生成回答

它和传统的LLM有啥区别?如果要用一个生活里的常识来类比,就类似考试:

传统LLM(闭卷考试) vs RAG(开卷考试)

对比维度传统LLM(闭卷考试)RAG(开卷考试)
知识来源训练时的记忆可以现场查阅资料
时效性训练数据截止日期可以查最新资料
准确性可能”编造”答案基于真实文档回答
适用场景通用知识、常识专业领域、公司内部知识

①传统LLM:像一位博学但记忆力有限的老教授

②RAG:像一位聪明的研究生,遇到问题会去图书馆查书

所以我们现在就知道了,RAG主要解决的三大问题:

问题传统LLM的局限RAG的解决方案
1. 知识时效性训练数据有截止日期能查最新上传的文档
2. 幻觉问题可能编造不存在的信息基于真实文档,不乱编
3. 知识定制无法接入私有知识可以接入公司内部文档

二、RAG的工作流程

1.流程图

[用户提问]
    ↓
[查询理解]
Agent理解用户想问什么
(类似"听懂问题")
    ↓
[检索阶段] ← 关键步骤!
    ├─ 把问题和知识库内容都转成"向量"
    │   (把文字变成数字,方便计算相似度)
    ├─ 计算相似度,找出最相关的内容片段
    │   (找"最像"的答案)
    └─ 返回Top N个相关片段
    ↓
[生成阶段]
    ├─ 把检索到的内容作为"参考资料"
    ├─ LLM基于这些资料组织语言
    └─ 生成最终回答
    ↓
[输出答案] + [显示引用来源]
配图

2.关键概念解释

这里不得不科普几个概念,不过不用头疼,我们尽量用类比的方式让它们好理解一些。

(1)向量(Embedding)—— RAG的”翻译官”

①什么是向量?

把文字变成一串数字(比如[0.1, 0.5, -0.3, …]),每个数字代表文字的某个”特征”

举个例子:想象给每个知识点一个”坐标位置”:

  • “年假制度” 的坐标大约是 (0.8, 0.2, 0.5, …)
  • “病假申请” 的坐标大约是 (0.75, 0.25, 0.48, …)
  • “薪资发放” 的坐标大约是 (0.1, 0.9, 0.3, …)

“年假”和”病假”因为都属于休假类,坐标非常接近;”薪资”则在完全不同的位置。当你问”怎么请假”,系统就找坐标最近的几个知识点——这比字面匹配聪明得多。

②为什么需要向量?

计算机不懂文字,但擅长计算数字,向量可以表示语义相似性(”请假”和”休假”向量接近)。

配图

(2)相似度计算—— RAG的”匹配引擎”

①如何计算?

计算问题向量和文档向量之间的”距离”,距离越小,相似度越高。

举个例子:就像在图书馆找书。

你要找关于”请假制度”的书,不是靠书名里有没有”请假”两个字,而是靠图书馆员根据你的问题,找出内容最相关的那几本。《员工假期管理规定》《考勤管理办法》这类书,即使书名没有”请假”,也会被精准找到。

(3)召回(Retrieval)—— RAG的”图书管理员”

①什么是召回

从知识库中找出相关内容的过程。不是找到”完全一样”的,而是找到”最相关”的。

以上三个概念,结合例子来看,是不是就好理解多了?

但是你可能会问,那我要怎么用啊?感觉还是很抽象。

那我们还是以coze为例,讲讲在coze中是如何配置的

(4)在 Coze 里,这些概念对应哪些设置?

我们在coze工作流里的知识库检索节点,上传完知识后,会发现底下有几个选项。

如果你对RAG没有任何理解的话,这几个选项你是完全不清楚什么意思的。

配图

我们上面讲了向量、相似度、召回,其实概念都可以对应上这几个选项。我们不需要写代码,只需要理解每个参数的含义,就能调出更好的效果。

①搜索策略:就是选择用哪种方式找内容。「语义」对应向量检索,「全文」对应关键词检索,「混合」是两者结合。大多数场景选「混合」就对了,系统会同时做两种检索,然后综合排序给出最好的结果。

②最大召回数量:相当于告诉 AI”你最多可以翻几份参考资料”。默认是 5 条,一般设 3-5 条就够了。设太多,AI 容易被无关信息干扰;设太少,可能遗漏重要内容。

③最小匹配度:这就是相似度的门槛——只有”考试及格”的内容才会被召回。范围 0 到 1,默认约 0.5。如果你发现 AI 老说”根据现有资料无法回答”,可以试着调低到 0.3;如果回答总跑题,说明门槛太低,调高到 0.6 试试。

④查询改写:这个功能帮 AI 在多轮对话中更准确地理解用户真正想问什么。比如用户先问”你们有哪些设备?”,接着问”最贵的那个多少钱?”——查询改写会帮 AI 把第二个问题理解为”最贵的设备价格是多少”。建议保持默认开启。

总结:对大多数业务场景,搜索策略选「混合」、召回数量设 3-5、其他保持默认,就是一个很好的起点。后续根据测试效果再微调。

三、向量检索 vs 关键词检索

上一部分我们知道了,RAG 在检索阶段会把文字变成向量来计算相似度。但实际上,”找内容”并不只有一种方法。就像我们平时搜索信息一样——有时候你知道确切的关键词(比如搜产品型号”LC-3015″),有时候你只知道大概想找什么(比如”能切厚钢板的设备”)。

所以这一章节也还是介绍下向量检索关键词检索的概念和区分。

对应到 AI 的知识库检索,也有两种主要方式:向量检索关键词检索。理解它们的区别,能帮你在效果不好时快速判断问题出在哪里。

1.向量检索(语义检索):AI 不看字面,而是理解你的”意思”。它把问题和文档都转成向量,通过计算”语义距离”来找最相关的内容。好处是能理解同义词和近义词——你说”请假”,它也能找到”休假制度”。缺点是对非常精确的专业术语或型号,有时反而不如直接匹配。

2.关键词检索(全文检索):这是最传统的搜索方式,就像在文档里按 Ctrl+F 搜索一样,找的是字面完全匹配的内容。好处是对产品型号、缩写、专有名词特别精准,缺点是不理解语义——你搜”请假”,包含”休假”但没有”请假”二字的文档就会被漏掉。

实际使用中,最好的方式是两者结合——也就是 Coze 里的「混合」搜索策略。 让语义检索和关键词检索各自发挥优势,然后综合排序,效果最好。

场景:员工问:”我生病了想休息几天,需要什么手续?”

检索方式可能匹配到的文档效果评估
关键词检索只找包含”生病”、”休息”、”手续”的文档可能漏掉”病假申请流程”文档
向量检索找到”病假制度”、”请假流程”、”医疗休假规定”更全面,能理解语义
最佳实践两者结合(多路召回)既理解语义,又不漏专业术语
配图

四、影响RAG效果的4个因素

再说说哪些因素会影响RAG的效果

因素1:文档质量(基础)

文档质量检查清单

①✅ 内容清晰准确,没有错别字

②✅ 格式规范,段落分明

③✅ 及时更新,没有过期信息

④✅ 专业术语统一,避免歧义

⑤❌ 避免扫描件图片(文字无法识别)

⑥❌ 避免格式混乱的文档

优化技巧

①上传前用Word整理一遍

②删除页眉页脚、广告等无关内容

③重要信息用加粗或标题突出

因素2:分段策略(关键)

分段大小的影响

分段大小优点缺点适用场景
太小
(<100字)
检索精准信息不完整,上下文缺失问答对、短条款
适中
(200-500字)
信息完整,检索准确可能需要重叠区域大多数文档
太大
(>1000字)
上下文丰富检索不精准,包含无关信息需要完整理解的长文档

重叠区域的作用

文档内容:...[段落A结束][段落B开始]...
分段情况:
- **重叠区域(Overlap)的作用**:



分段时,让相邻两段的内容有一部分"重叠",避免关键信息被切断在两段之间。



举个例子:


假设文档内容是:…[段落A:年假规定]…[段落B:申请流程]…

❌ 没有重叠时:

  • 分段1:段落A 全部内容
  • 分段2:段落B 全部内容

→ 问题:如果关键信息”年假申请须在开始前3天”横跨A结尾和B开头,

检索时两段都给不出完整答案。

✅ 有重叠时(如重叠 10%):

  • 分段1:段落A + 段落B 的前10%内容
  • 分段2:段落A 的后10%内容 + 段落B + 段落C 的前10%内容

→ 优点:关键信息不会被切断,每段都保留了足够的上下文。


这就是为什么 Coze 分段配置里有「分段重叠度%」这个参数,保持默认 10% 即可。


@@FIG@@<figure class="wp-block-image"><img src="https://duntools.com/wp-content/uploads/2026/08/what-is-rag-explained-4.jpg" alt="配图"/></figure>


### 因素3:检索策略(核心)

**召回数量设置**:

| 召回数量 | 适用场景 | 优缺点 |
|-|-|-|
| **1-2条** | 答案唯一确定    <br/>(如"公司地址") | + 回答简洁    <br/>- 可能遗漏相关信息 |
| **3-5条** | **推荐设置**  <br/>大多数问答场景 | + 信息全面    <br/>+ 回答准确 |
| **6-10条** | 复杂问题需要综合多个信息 | + 信息非常全面    <br/>- 回答可能冗长 |
| **>10条** | 一般不推荐 | - 信息过载    <br/>- 生成质量下降 |

**相似度阈值**:

在Coze 对应的配置:「最小匹配度」参数(范围 0-1)

如果设置太低(如 0.1)→ 什么都召回,AI 会被大量无关内容干扰;如果设置太高(如 0.9)→ 很难召回到内容,AI 频繁说"根据现有资料无法回答"

建议保持默认值(约 0.5);如果 Agent 总说"不知道",可适当调低到 0.3;如果回答总跑题,可适当调高到 0.6

### 因素4:生成策略(最后一步)

**提示词设计要点**:

你是一个专业的[角色],请基于以下资料回答问题:

[检索到的资料]

要求: 1. 只使用提供的资料回答 2. 如果资料中没有相关信息,请说”根据现有资料,无法回答这个问题” 3. 回答要简洁明了,不超过3句话 4. 在回答末尾标注信息来源


📋 这套RAG原理相关模板,我整理成模板了

跟着上面步骤搭要花点时间。想直接拿现成的改,加我微信备注「RAG原理」,我发你。

🤔 卡在某一步了?

搭建过程里如果哪一步卡住了,如果你照着做没跑通,或者你们公司情况不太一样,可以找我聊聊,我免费帮你看看怎么调。不合适我也会直说。

加吨师傅微信咨询飞书多维表格搭建

扫码加我,备注「RAG原理」领模板

想看更多这类方案,我都整理在 吨师傅工具箱 里了:客户管理、进销存、工单报修……按场景分好类,可以直接抄。

相关阅读

滚动至顶部