核心能力
八大能力环环相扣,覆盖文档变成知识的每一米
一、高精度解析
六种格式统一入口,扫描件也能读,表格不散架
企业文档格式五花八门,是知识库建设的第一道坎。基座内置 DeepDoc 版面分析(版面 + 表格结构识别双 ONNX 模型,本地推理),把 PDF、Word、Excel、PPT、OFD、XPS 六大格式统一解析为结构化数据,保留标题层级、段落、表格的行列关系(含合并单元格)与阅读顺序;扫描件自动 OCR 识别。
二、文档清洗
把页眉页脚、水印这些"噪音"挡在知识库门外
页眉页脚、页码、水印、重复内容——这些对人是背景噪音,对 AI 却是污染源:答案里突然冒出一串页码,检索被重复文档干扰。基座在解析后自动标记并清理这些噪音,同时回填清洗报告,处理了什么、删了什么,全部有据可查。
三、AI 智能脱敏
13 类敏感信息,入库前自动打码
文档内嵌图片里的人脸、身份证、公章、车牌、二维码……直接进知识库就是重大泄露隐患。基座复用压缩引擎的 AI 特征保护检测器,在入库前对敏感区域自动高斯模糊/马赛克处理,并输出脱敏报告——每张图片检测到什么、处理了哪里,审计时一清二楚。
四、高性能压缩
一次处理,双重产出:更小的文件 + 更干净的知识
压缩是丑梨的看家本领。图片、音视频、PDF、Office、OFD、XPS、文本 40+ 格式全覆盖,平均压缩率 60%、最高 80%。SSIM/PSNR 双指标质量门控确保"压得小"不等于"压得糊"。对 AI 应用而言,图片压缩直接意味着多模态推理 token 成本下降——实测 GPT-4o 口径节省 85.9%。
五、智能切片
不同文档,不同切法——语义不断裂,检索才精准
固定长度切块是行业最常踩的坑:一句话被拦腰截断,AI 检索到半截信息只能瞎猜。基座按文档类型选择切片策略,并内置四套预设参数,可按业务微调:
| 文档类型 | 切片策略 | 特殊处理 |
|---|---|---|
| 规章制度/合同 | 按条款切 | 条件与结论不可分离 |
| 技术手册 | 按章节+小节 | 型号/参数/适用范围同块 |
| FAQ | 一问一答 | 问题与答案绑定 |
| 表格资料 | 按行组切 | 表头重复,保留行列关系 |
| PPT | 按页面 | 标题+正文+备注一起 |
| 长报告 | 父子双层 | 子块检索,父块生成 |
六、元数据与生命周期
每个知识点自带"身份证",过期知识自动退场
切片完成后,每个知识点自动绑定文档标题、章节路径、发布时间、版本号、来源部门等元数据,并做四级内容增强(面包屑导航、关键词、摘要、假设性问题)。文档更新时走增量处理:新版本自动入库、旧版本自动降权并标记过期,内容哈希保证同一文档不会重复入库。
七、权限打标
谁能看哪条知识,管到知识点级别
薪酬制度只有 HR 和管理层能查,技术文档按部门隔离。基座支持给每个知识点绑定部门、岗位、角色、区域、保密等级标签,检索时先过滤权限再召回——权限校验在数据层完成,不依赖应用层自觉。多租户体系天然隔离不同客户/事业部的知识库。
八、三层评测
知识库好不好,用数字说话,坏答案能追责
知识库不是建完就完事。基座内置三层评测体系:语料级(解析完整度、表格结构率、OCR 精度、脱敏覆盖率)、检索级(HitRate@K、Recall@K、MRR、NDCG@K)、生成级(忠实度、答案相关性、上下文精度)。用户点踩后自动归因:问题出在切片、清洗、脱敏还是元数据,一查便知,badcase 自动回流评测集。