性能评测
不玩概念,只报实测数字 · 全部数据出自项目测试报告,欢迎验证
四组核心实测数据
来自 P2/P3 端到端测试、DeepDoc 管线实测与流水线测试报告
124 秒
443 页 OFD 版式文档
端到端全流程处理
端到端全流程处理
流水线测试报告
0.924
三层解析质检总分
(结构层满分)
(结构层满分)
P2/P3 e2e 测试报告
64%
表格结构误检收敛
版面分析双模型协同
版面分析双模型协同
DeepDoc 管线 73 页实测
85.9%
图片 token 成本节省
(GPT-4o 口径)
(GPT-4o 口径)
多模态推理成本实测
说明:测试对象为真实版式文档(OFD 长文档、含表格与内嵌图片),端到端指"上传→解析→清洗→脱敏→压缩→切片→元数据→质检"全链路。不同文档复杂度下数据会有差异,欢迎用您的文档实测复验。
解析质量:三层评分怎么看
每份文档处理完,都会拿到一张"体检单"
443 页 OFD 文档实测详情
结构层(版面区块、标题层级、阅读顺序是否正确)——满分;关系层(表格行列关系、上下文衔接)与内容层(文字、OCR 准确率)综合后,总体评分 0.924。表格结构误检经过双模型协同收敛 64%。
结构层得分1.00
综合总分(三层加权)0.924
三层评测体系
知识库上线只是开始,持续"体检"才能一直靠谱
语料级:原料好不好
文档进库前把关
衡量预处理本身的质量,每一批文档入库时自动打分。
- 解析完整度
- 表格结构保留率
- OCR 准确率
- 脱敏覆盖率
- 权限命中率
检索级:找得准不准
知识能不能被找到
用标准问题集量化检索效果,定位召回问题。
- HitRate@K / Recall@K
- MRR(平均倒数排名)
- NDCG@K(排序质量)
生成级:答得对不对
最终用户看到的答案
衡量 AI 回答的忠实度与相关性,直接对应业务体验。
- Faithfulness(忠实原文)
- AnswerRelevancy(答非所问率)
- ContextPrecision(上下文精度)
评测怎么闭环:点一下"踩",系统自己找原因
用户对某个回答点踩后,系统自动回溯该答案引用的知识点,归因到具体环节——是切片切断语义、清洗误删内容、脱敏过度,还是元数据缺失?定位结果自动回流评测集,下次策略变更时自动回归验证,指标不达标不放行(回归门禁)。
压缩性能:老本行的数据
压缩引擎是基座的地基,也是直接的成本项
典型压缩效果
| 指标 | 实测值 | 对客户的意义 |
|---|---|---|
| 平均压缩率 | 60%(最高 80%) | 存储成本直接砍半以上 |
| 处理速度 | 内存架构,提升 3-5 倍 | 全流程内存处理,无临时目录磁盘 IO |
| 图像质量门控 | SSIM ≥ 0.92 / PSNR ≥ 30dB | 压得小不等于压得糊,自动寻找最佳参数 |
| 字体去重 | 节省 30-50% 字体空间 | Office 文档冗余字体自动合并 |
| 多模态 token 节省 | 85.9%(GPT-4o 口径) | 图片压缩后再喂大模型,推理账单大幅下降 |