结论先行:页眉、页脚、页码、水印、重复段落必须在切片入库前自动检测并去除。这些噪声一旦进入 chunk,会污染检索、稀释相关度,还会把水印里的敏感信息带进向量。
一、噪声从哪里来
企业文档大多从 Word / PDF 导出,天然带着“第 X 页 / 共 Y 页”、公司页眉、保密水印、跨页重复的章节标题。这些元素在每一页重复出现,对语义没有任何贡献,却在检索时与正文抢相关度。
危害比直觉更大。向量检索本质是文本相似度统计,页眉和页码在整篇文档里高度一致,跨文档的 chunk 会因为共享同一段页眉而“假相似”——本来不相关的两份合同,因为同一个公司页眉在向量空间里被拉近。约 80% 的 RAG 效果问题源于数据处理不当,清洗不彻底是最常见的源头之一,而且这类问题不会在解析层报错,只会默默拉低 HitRate@K。
二、清洗要自动化且可审计
清洗不应是人工逐篇删。财报季一天入库几百份文档,人工清洗既慢又不可复现,换个人标准就变了。正确做法是在流水线里自动检测页眉 / 页脚 / 页码 / 水印 / 重复段落并去除,同时输出一份清洗报告。
报告的价值常被低估:它记录每篇文档去除了哪些噪声、各去除了多少、占比多少。审计抽查时能回答“这条数据为什么长这样”;评测回溯时能回答“清洗规则改了之后检索指标为什么波动”。文档预处理占企业 RAG 工程 40%–50% 的工作量,把清洗做成可审计的自动化环节,是这块工作量里回报最高的部分。
| 噪声类型 | 不清洗的后果 |
|---|---|
| 页眉页脚 / 页码 | 每页重复,稀释检索相关度 |
| 水印 | 可能携带敏感标识进入向量 |
| 重复段落 | 造成冗余 chunk,浪费存储与检索名额 |
三、清洗在流水线中的位置
清洗紧跟在解析之后、脱敏与切片之前,整条链路的顺序是解析 → 清洗 → 脱敏 → 压缩 → 切片。这个顺序不是约定俗成,而是有依赖关系的:先清掉页眉页脚这类结构噪声,脱敏才能聚焦于真正的敏感内容,而不是把力气花在页码上;切片也才能拿到干净的语义单元,chunk 之间的边界才可信。
顺序反了会连锁出错。比如先切片再清洗,页眉会被切进不同 chunk,清洗规则要处理的对象从“一行页眉”变成“散落在几百个 chunk 里的页眉碎片”,成本和漏检率都会上升。再比如把清洗压到切片之后、向量化之前,清洗报告里统计到的“文档级去除量”就失去了意义,因为此时已经不存在完整的文档视角,只有一堆待处理的 chunk。位置放对,报告才是干净的。
四、和脱敏配合
水印和页眉里常含公司标识、密级字样,本身就是脱敏要处理的目标。清洗负责去掉结构噪声,脱敏负责抹掉内容里的敏感信息,两者接力把文档变成“既干净又安全”的入库素材。
实践中建议把两者看作同一道工序的两个输出:清洗报告告诉你文档“瘦”了多少,脱敏记录告诉你敏感点在哪。两份报告放在一起,就是入库前的质量证明,出了问题也能顺着报告定位到具体环节。分工可以记成一句话:清洗对付“每页都长一样的东西”,脱敏对付“写了不该写的东西”。前者靠结构规律识别,后者靠内容识别,混在一起做,两边都容易漏。
清洗是解析后的第一道净化。脱敏怎么做见 脱敏必须在向量化之前;切片怎么切见 切片策略;整条链路定位见 为什么 80% 的 RAG 问题出在数据。
落地要点:清洗不是删文本,是产出可审计的证据
- 清洗必须留痕:页眉、页脚、页码、水印、重复段落的每一次删除都要落在清洗报告里,出了 badcase 能回溯到「哪一版规则删了哪一段」,而不是靠猜。
- 警惕水印里的敏感标识:内部水印(如「机密」「草稿」、部门名)不清理,会随 chunk 一起进入向量库——清洗和脱敏在这里是同一件事的两面。
- 重复段落按指纹去重:招股书、年报里大量模板化段落反复出现,不去重会放大存储并让检索结果被同一段话霸屏。
- 清洗规则要过回归:规则一旦调整,必须重跑评测对比,防止「删得更干净了」的同时把有效正文也删了。
清洗之后紧接着就是脱敏——两者共用「检测、处置、留痕」的骨架,顺序上清洗在前。具体的脱敏检测类别与处置方式,见RAG 脱敏流程:为什么必须在向量化之前。
常见问题 FAQ
Q1:页眉页脚不去掉会怎样?
它们每页重复出现,对语义无贡献,却会在检索时与正文抢相关度,还会让不同文档的 chunk 因共享同一页眉而假相似,稀释真正有用的结果,甚至把水印里的敏感标识带进向量。
Q2:清洗应该在流水线哪一步做?
在解析之后、脱敏与切片之前,即解析 → 清洗 → 脱敏 → 压缩 → 切片。先清结构噪声,脱敏才能聚焦敏感内容,切片才能拿到边界干净的语义单元。
Q3:清洗报告有什么用?
记录每篇文档去除了哪些噪声、各去除多少、占比多少。审计抽查时可回溯数据来源,评测回溯时可解释指标波动,是入库前的质量证明。
Q4:清洗和脱敏是什么关系?
清洗去结构噪声(页眉页脚水印重复段),脱敏去内容敏感(人脸印章证件等)。两者接力,把文档变成既干净又安全的入库素材,且都在切片之前完成。
需要搭建企业级 RAG 知识库?了解丑梨AI
私有化部署的 RAG 数据工程基座:解析、清洗、脱敏、压缩、切片、治理、评测一站式流水线,全本地推理,数据不出域,单机可部署。