RAG 是什么?检索增强生成与知识库搭建入门指南
2026-09-22 · UGLYPEAR 研发团队 · 约 8 分钟阅读
一句话说清 RAG
RAG(Retrieval-Augmented Generation,检索增强生成)是一种让大模型"开卷考试"的技术:模型回答问题前,先从一个外挂知识库里检索出相关资料,再把资料和问题一起交给模型组织答案。模型不再是靠训练时"背"下来的通用知识答题,而是基于你指定的资料作答——回答有出处、可追溯、能随时更新。
对应到企业场景:把合同、制度、技术手册、研究报告放进知识库,员工向 AI 提问时,答案来自企业自己的文档,而不是模型的"想象"。这就是RAG 知识库,也是当前企业级 AI 应用落地最主流的架构。
为什么大模型需要外挂知识库
1. 模型不了解你的企业
通用大模型的训练数据来自公开互联网,它不知道你公司的报销制度、产品参数、法律合同。直接问,只能得到泛泛而谈的通用回答。
2. 知识存在截止日期
模型训练完成后,世界还在变化。去年的制度、上个月更新的报价单,模型统统不知道。外挂知识库可以随时更新,新文档入库即刻生效。
3. 幻觉问题
没有依据时,大模型倾向于"编"一个听起来合理的答案。检索增强生成强制模型基于检索到的资料作答,回答可溯源,幻觉率大幅下降。
4. 数据安全
把企业文档全部喂给模型做训练既不现实也不安全。RAG 的知识库可以私有化部署——文档不出内网,模型只是"查阅"资料,而不是"记住"资料。
RAG 知识库搭建的 5 个步骤
一套生产级 RAG 知识库的搭建流程,远不止"把文档丢进向量库"。以下 5 步是行业实践的标准链路:
第 1 步:文档解析
把 PDF、OFD、Word、Excel、PPT、扫描件变成模型可读的结构化文本。难点在扫描件 OCR、表格行列结构保留、版式文档(如政务 OFD 公文)的阅读顺序还原。解析质量是整条链路的地基——实测中,443 页 OFD 版式文档完成解析全流程约需 124 秒,三层解析质检可达 0.924 分(结构层满分)。
第 2 步:文档清洗
去掉页眉、页脚、页码、水印,剔除重复内容。这些"噪音"如果不去除,会污染全链路:AI 回答里会带出页码水印,检索时产生大量误命中。
第 3 步:敏感信息脱敏
合同里的公章、员工证件照、客户个人信息——这些内容一旦入库,检索权限稍有不慎就是数据泄露事故。入库前用 AI 自动检测并打码 13 类敏感信息(人脸、公章、证件、车牌等),处理记录全程可审计,法务与信息安全才敢签字。
第 4 步:智能切片
把长文档切成适合检索的"知识块"。这一步最忌讳固定长度粗暴切块——一句话被切成两半,语义断裂,检索到也答不对。生产级做法是按文档类型差异化切片:合同按条款、手册按章节、FAQ 按问答,每块保留父子关联与元数据(部门、版本、权限)。
第 5 步:三层评测
知识库上线不是终点。结构层(解析完整度)、检索层(HitRate@K / MRR / NDCG)、生成层(忠实度 / 答非所问率)三层指标持续体检,用户点踩自动归因到具体环节(是切片切断语义,还是清洗误删内容),形成优化闭环。
企业知识库搭建最常见的 5 个坑
| 常见坑 | 典型表现 | 正确做法 |
|---|---|---|
| 固定长度切块 | 一句话被切成两半 | 按文档类型切片,保语义完整 |
| 只做向量检索 | 型号、编号查不准 | 元数据过滤前置,关键词+向量混合召回 |
| 没有权限控制 | 实习生能查到薪酬合同 | 知识点级权限标签 |
| 敏感信息裸奔入库 | 公章、证件照进向量库 | 入库前 13 类 AI 脱敏,可审计 |
| 没有评测闭环 | 答错了不知道错在哪 | 三层评测 + 点踩归因到环节 |
RAG 知识库效果 = 模型能力 × 数据质量
市面上主流大模型的能力差距正在缩小,真正拉开企业级 RAG 效果差距的是数据质量:解析是否完整、切片是否保语义、语料是否干净、权限是否清晰。这也是为什么越来越多团队选择专业的数据工程管线来处理"文档到向量库之间"的那段路,而不是全部自研——把工程量最大、最吃经验的部分交给成熟管线,模型与向量库仍可自由选型。
评估一套 RAG 数据预处理方案时,建议重点验证三件事:① 用你最难的文档(扫描件、OFD 公文、复杂表格)实测解析质量;② 检查是否内置脱敏与权限打标;③ 是否有评测闭环让效果可持续优化。了解 UGLYPEAR RAG 数据工程基座,或查看完整实测数据。
常见问题 FAQ
Q:RAG 是什么意思?
RAG 是 Retrieval-Augmented Generation(检索增强生成)的缩写。它先从知识库中检索与问题相关的内容,再把检索结果连同问题一起交给大模型生成回答,让模型基于企业自己的资料作答。
Q:为什么大模型需要外挂知识库?
通用大模型不了解企业内部文档,且知识存在截止日期。外挂知识库让模型即时检索最新专属资料,回答有出处、可追溯,显著减少幻觉。
Q:企业搭建 RAG 知识库分几步?
五步:解析、清洗、脱敏、切片、评测。每一步的质量决定最终回答质量,数据工程做扎实,RAG 才能稳定发挥。
Q:RAG 知识库效果不好,最常见的原因是什么?
绝大多数问题出在数据质量而非模型:粗暴切块、表格错乱、页眉水印污染、敏感信息未脱敏。