UGLYPEAR AIが事業をアップグレード:高性能ドキュメント圧縮 × RAGデータエンジニアリング基盤新事業を詳しく見る →

性能評価

概念で語らず、実測数字だけを報告 · すべてのデータはプロジェクトテストレポートに基づき、検証を歓迎します

4組のコア実測データ

P2/P3エンドツーエンドテスト、DeepDocパイプライン実測、パイプラインテストレポートに基づく

124
443ページOFD固定レイアウト文書
エンドツーエンド全工程処理
パイプラインテストレポート
0.924
3層解析品質検査の総合スコア
(構造レイヤーで満点)
P2/P3 e2eテストレポート
64%
表構造誤検出の収束
レイアウト解析デュアルモデル協調
DeepDocパイプライン73ページの実測
85.9%
画像トークンコスト削減
(GPT-4o基準)
マルチモーダル推論コストの実測
注記:テスト対象は実際の固定レイアウト文書(表と埋め込み画像を含むOFD長文書)で、エンドツーエンドとは「アップロード→解析→クレンジング→マスキング→圧縮→チャンク分割→メタデータ→品質検査」の全チェーンを指します。文書の複雑度により数値は変動しますので、お客様のドキュメントでの実測再検証を歓迎します。

解析品質:3層スコアの見方

各文書の処理完了後、「診断票」を受け取れます

443ページOFD文書の実測詳細

構造レイヤー(レイアウトブロック、タイトル階層、読書順序が正しいか)——満点;関係レイヤー(表の行列関係、コンテキスト接続)と内容レイヤー(文字、OCR精度)を総合すると、全体スコアは 0.924。表構造誤検出はデュアルモデルの協調によって収束させました 64%

構造レイヤー得点1.00
100%
総合スコア(3層加重)0.924
92.4%

3層評価体系

ナレッジベースの公開は始まりにすぎず、継続的な「健康診断」こそが信頼を保ちます

コーパスレベル:原材料の良し悪し

文書登録前の品質チェック

前処理そのものの品質を測定し、各バッチの文書登録時に自動採点します。

  • 解析の完全性
  • 表構造保持率
  • OCR精度
  • マスキングカバレッジ
  • 権限ヒット率

検索レベル:検索は的確か

知識が見つけられるか

標準質問セットで検索効果を定量化し、リコールの問題を特定します。

  • HitRate@K / Recall@K
  • MRR(平均逆順位)
  • NDCG@K(ランキング品質)

生成レベル:回答は正しいか

エンドユーザーが見る回答

AI回答の忠実度と関連性を測定し、業務体験に直接対応します。

  • Faithfulness(原文への忠実度)
  • AnswerRelevancy(質問への的確率)
  • ContextPrecision(コンテキスト精度)

評価をどう閉ループにするか:「低評価」ひとつで、システムが原因を探します

ユーザーが回答に低評価を付けると、システムは自動的にその回答が引用した知識ポイントを遡り、具体的な工程へ帰属します——チャンク分割が意味を切断したのか、クレンジングが誤って内容を削除したのか、マスキングが過剰だったのか、メタデータが欠落していたのか?特定結果は自動的に評価セットへ回流し、次回の戦略変更時には自動リグレッション検証を行い、指標が基準に達しない場合はリリースしません(リグレッションゲート)。

圧縮性能:本業のデータ

圧縮エンジンは基盤の土台であり、直接のコスト項目でもあります

典型的な圧縮効果

指標 実測値 顧客にとっての意味
平均圧縮率60%(最高80%)ストレージコストを半分以上直接削減
処理速度メモリアーキテクチャ、3-5倍向上全工程をメモリ内で処理、一時ディレクトリのディスクIOなし
画像品質ゲートSSIM ≥ 0.92 / PSNR ≥ 30dB小さく圧縮することはぼやけた圧縮ではありません、最適なパラメータを自動探索
フォント重複排除フォント容量を30-50%節約Office文書の冗長フォントを自動統合
マルチモーダルトークン削減85.9%(GPT-4o基準)画像を圧縮してから大規模モデルへ投入すれば、推論の請求額が大幅に低下します

圧縮エンジンの技術詳細を見る →

お客様のドキュメントでは、どんな数字が出るでしょうか?

実際のドキュメントを持って実測を予約いただければ、私たちがレポートを作成します

実測を申し込む