丑梨AI 完成业务升级:高性能文档压缩 × RAG 数据工程基座了解新业务 →

性能评测

不玩概念,只报实测数字 · 全部数据出自项目测试报告,欢迎验证

四组核心实测数据

来自 P2/P3 端到端测试、DeepDoc 管线实测与流水线测试报告

124
443 页 OFD 版式文档
端到端全流程处理
流水线测试报告
0.924
三层解析质检总分
(结构层满分)
P2/P3 e2e 测试报告
64%
表格结构误检收敛
版面分析双模型协同
DeepDoc 管线 73 页实测
85.9%
图片 token 成本节省
(GPT-4o 口径)
多模态推理成本实测
说明:测试对象为真实版式文档(OFD 长文档、含表格与内嵌图片),端到端指"上传→解析→清洗→脱敏→压缩→切片→元数据→质检"全链路。不同文档复杂度下数据会有差异,欢迎用您的文档实测复验。

解析质量:三层评分怎么看

每份文档处理完,都会拿到一张"体检单"

443 页 OFD 文档实测详情

结构层(版面区块、标题层级、阅读顺序是否正确)——满分;关系层(表格行列关系、上下文衔接)与内容层(文字、OCR 准确率)综合后,总体评分 0.924。表格结构误检经过双模型协同收敛 64%

结构层得分1.00
100%
综合总分(三层加权)0.924
92.4%

三层评测体系

知识库上线只是开始,持续"体检"才能一直靠谱

语料级:原料好不好

文档进库前把关

衡量预处理本身的质量,每一批文档入库时自动打分。

  • 解析完整度
  • 表格结构保留率
  • OCR 准确率
  • 脱敏覆盖率
  • 权限命中率

检索级:找得准不准

知识能不能被找到

用标准问题集量化检索效果,定位召回问题。

  • HitRate@K / Recall@K
  • MRR(平均倒数排名)
  • NDCG@K(排序质量)

生成级:答得对不对

最终用户看到的答案

衡量 AI 回答的忠实度与相关性,直接对应业务体验。

  • Faithfulness(忠实原文)
  • AnswerRelevancy(答非所问率)
  • ContextPrecision(上下文精度)

评测怎么闭环:点一下"踩",系统自己找原因

用户对某个回答点踩后,系统自动回溯该答案引用的知识点,归因到具体环节——是切片切断语义、清洗误删内容、脱敏过度,还是元数据缺失?定位结果自动回流评测集,下次策略变更时自动回归验证,指标不达标不放行(回归门禁)。

压缩性能:老本行的数据

压缩引擎是基座的地基,也是直接的成本项

典型压缩效果

指标 实测值 对客户的意义
平均压缩率60%(最高 80%)存储成本直接砍半以上
处理速度内存架构,提升 3-5 倍全流程内存处理,无临时目录磁盘 IO
图像质量门控SSIM ≥ 0.92 / PSNR ≥ 30dB压得小不等于压得糊,自动寻找最佳参数
字体去重节省 30-50% 字体空间Office 文档冗余字体自动合并
多模态 token 节省85.9%(GPT-4o 口径)图片压缩后再喂大模型,推理账单大幅下降

查看压缩引擎技术详情 →

您的文档,跑出什么数字?

带上真实文档预约实测,我们出报告

申请实测