性能評価
概念で語らず、実測数字だけを報告 · すべてのデータはプロジェクトテストレポートに基づき、検証を歓迎します
4組のコア実測データ
P2/P3エンドツーエンドテスト、DeepDocパイプライン実測、パイプラインテストレポートに基づく
124 秒
443ページOFD固定レイアウト文書
エンドツーエンド全工程処理
エンドツーエンド全工程処理
パイプラインテストレポート
0.924
3層解析品質検査の総合スコア
(構造レイヤーで満点)
(構造レイヤーで満点)
P2/P3 e2eテストレポート
64%
表構造誤検出の収束
レイアウト解析デュアルモデル協調
レイアウト解析デュアルモデル協調
DeepDocパイプライン73ページの実測
85.9%
画像トークンコスト削減
(GPT-4o基準)
(GPT-4o基準)
マルチモーダル推論コストの実測
注記:テスト対象は実際の固定レイアウト文書(表と埋め込み画像を含むOFD長文書)で、エンドツーエンドとは「アップロード→解析→クレンジング→マスキング→圧縮→チャンク分割→メタデータ→品質検査」の全チェーンを指します。文書の複雑度により数値は変動しますので、お客様のドキュメントでの実測再検証を歓迎します。
解析品質:3層スコアの見方
各文書の処理完了後、「診断票」を受け取れます
443ページOFD文書の実測詳細
構造レイヤー(レイアウトブロック、タイトル階層、読書順序が正しいか)——満点;関係レイヤー(表の行列関係、コンテキスト接続)と内容レイヤー(文字、OCR精度)を総合すると、全体スコアは 0.924。表構造誤検出はデュアルモデルの協調によって収束させました 64%。
構造レイヤー得点1.00
総合スコア(3層加重)0.924
3層評価体系
ナレッジベースの公開は始まりにすぎず、継続的な「健康診断」こそが信頼を保ちます
コーパスレベル:原材料の良し悪し
文書登録前の品質チェック
前処理そのものの品質を測定し、各バッチの文書登録時に自動採点します。
- 解析の完全性
- 表構造保持率
- OCR精度
- マスキングカバレッジ
- 権限ヒット率
検索レベル:検索は的確か
知識が見つけられるか
標準質問セットで検索効果を定量化し、リコールの問題を特定します。
- HitRate@K / Recall@K
- MRR(平均逆順位)
- NDCG@K(ランキング品質)
生成レベル:回答は正しいか
エンドユーザーが見る回答
AI回答の忠実度と関連性を測定し、業務体験に直接対応します。
- Faithfulness(原文への忠実度)
- AnswerRelevancy(質問への的確率)
- ContextPrecision(コンテキスト精度)
評価をどう閉ループにするか:「低評価」ひとつで、システムが原因を探します
ユーザーが回答に低評価を付けると、システムは自動的にその回答が引用した知識ポイントを遡り、具体的な工程へ帰属します——チャンク分割が意味を切断したのか、クレンジングが誤って内容を削除したのか、マスキングが過剰だったのか、メタデータが欠落していたのか?特定結果は自動的に評価セットへ回流し、次回の戦略変更時には自動リグレッション検証を行い、指標が基準に達しない場合はリリースしません(リグレッションゲート)。
圧縮性能:本業のデータ
圧縮エンジンは基盤の土台であり、直接のコスト項目でもあります
典型的な圧縮効果
| 指標 | 実測値 | 顧客にとっての意味 |
|---|---|---|
| 平均圧縮率 | 60%(最高80%) | ストレージコストを半分以上直接削減 |
| 処理速度 | メモリアーキテクチャ、3-5倍向上 | 全工程をメモリ内で処理、一時ディレクトリのディスクIOなし |
| 画像品質ゲート | SSIM ≥ 0.92 / PSNR ≥ 30dB | 小さく圧縮することはぼやけた圧縮ではありません、最適なパラメータを自動探索 |
| フォント重複排除 | フォント容量を30-50%節約 | Office文書の冗長フォントを自動統合 |
| マルチモーダルトークン削減 | 85.9%(GPT-4o基準) | 画像を圧縮してから大規模モデルへ投入すれば、推論の請求額が大幅に低下します |