Leistungsevaluierung
Keine Konzepte, nur gemessene Zahlen · alle Daten stammen aus Projekttestberichten, Überprüfung gern gesehen
Vier zentrale Messergebnisse
Aus P2/P3-End-to-End-Tests, DeepDoc-Pipeline-Messungen und Pipeline-Testberichten
End-to-End-Gesamtprozessverarbeitung
(Vollpunktzahl in der Strukturebene)
Layoutanalyse mit zwei koordinierten Modellen
(Kostenbasis GPT-4o)
Parsing-Qualität: Wie liest man die dreistufige Bewertung
Nach der Verarbeitung jedes Dokuments erhalten Sie einen „Prüfbericht“
Details zur Praxismessung des 443-Seiten-OFD-Dokuments
Strukturebene (sind Layoutblöcke, Titelhierarchie und Lesereihenfolge korrekt) –Vollpunktzahl; aus Beziehungsebene (Tabellenzeilen und -spalten, Kontextübergänge) und Inhaltsebene (Text, OCR-Genauigkeit) zusammengesetzt ergibt sich ein Gesamtscore von 0.924. Die Fehlertdetektion bei Tabellenstrukturen wurde durch die Koordination zweier Modelle konvergiert 64%。
Dreistufiges Evaluierungssystem
Der Launch der Wissensdatenbank ist erst der Anfang – nur kontinuierliche „Check-ups“ halten sie zuverlässig
Korpus-Ebene: Ist das Rohmaterial gut?
Misst die Qualität der Vorverarbeitung selbst; jede Dokumentencharge wird bei der Aufnahme automatisch bewertet.
- Parsing-Vollständigkeit
- Erhaltungsrate der Tabellenstruktur
- OCR-Genauigkeit
- Anonymisierungsabdeckung
- Berechtigungstrefferquote
Retrieval-Ebene: Wird genau gefunden?
Quantifiziert die Retrieval-Wirkung mit Standardfragenkatalogen und lokalisiert Recall-Probleme.
- HitRate@K / Recall@K
- MRR (Mean Reciprocal Rank)
- NDCG@K (Ranking-Qualität)
Generierungs-Ebene: Stimmt die Antwort?
Misst Treue und Relevanz der KI-Antworten, direkt abgebildet auf das Geschäftserlebnis.
- Faithfulness (Treue zur Vorlage)
- AnswerRelevancy (Rate themenfremder Antworten)
- ContextPrecision (Kontextpräzision)
So schließt sich der Evaluierungskreislauf: ein Klick auf „Daumen runter“, das System sucht die Ursache selbst
Nachdem ein Nutzer bei einer Antwort „Daumen runter“ geklickt hat, verfolgt das System automatisch die von der Antwort zitierten Wissenspunkte zurück und attribuiert die Ursache auf den konkreten Schritt – hat das Chunking die Semantik zerschnitten, hat die Bereinigung Inhalte fälschlich entfernt, war die Anonymisierung zu aggressiv oder fehlen Metadaten? Das Lokalisierungsergebnis fließt automatisch in den Evaluierungssatz zurück; bei der nächsten Strategieänderung wird automatisch eine Regression geprüft, und die Freigabe erfolgt erst bei Erfüllung der Kennzahlen (Regressions-Gate).
Komprimierungsleistung: Zahlen aus dem alten Handwerk
Die Komprimierungs-Engine ist das Fundament der Basis und zugleich ein direkter Kostenfaktor
Typisches Komprimierungsergebnis
| Kennzahl | Gemessener Wert | Bedeutung für den Kunden |
|---|---|---|
| Durchschnittliche Kompressionsrate | 60% (maximal 80%) | Speicherkosten werden direkt um mehr als die Hälfte gesenkt |
| Verarbeitungsgeschwindigkeit | In-Memory-Architektur, 3-5x schneller | Durchgängige In-Memory-Verarbeitung, kein Datenträger-IO über temporäre Verzeichnisse |
| Gate für Bildqualität | SSIM ≥ 0.92 / PSNR ≥ 30dB | Klein komprimiert heißt nicht unscharf – automatische Suche der optimalen Parameter |
| Schriftart-Deduplizierung | Spart 30-50% Schriftartspeicher | Automatisches Zusammenführen redundanter Schriftarten in Office-Dokumenten |
| Multimodal-Token-Einsparung | 85.9% (Kostenbasis GPT-4o) | Bildkomprimierung vor der Übergabe an das große Modell senkt die Inferenzrechnung deutlich |
Welche Zahlen ergeben Ihre Dokumente?
Vereinbaren Sie eine Messung mit echten Dokumenten – wir liefern den Bericht