UGLYPEAR AI schließt das Business-Upgrade ab: Hochleistungs-Dokumentenkomprimierung × RAG-Datenengineering-BasisNeues Geschäft entdecken →

Leistungsevaluierung

Keine Konzepte, nur gemessene Zahlen · alle Daten stammen aus Projekttestberichten, Überprüfung gern gesehen

Vier zentrale Messergebnisse

Aus P2/P3-End-to-End-Tests, DeepDoc-Pipeline-Messungen und Pipeline-Testberichten

124 Sekunden
443 Seiten OFD-Dokument mit festem Layout
End-to-End-Gesamtprozessverarbeitung
Pipeline-Testbericht
0.924
Gesamtscore der dreistufigen Parsing-Qualitätsprüfung
(Vollpunktzahl in der Strukturebene)
P2/P3-e2e-Testbericht
64%
Konvergenz der Fehlertdetektion bei Tabellenstrukturen
Layoutanalyse mit zwei koordinierten Modellen
DeepDoc-Pipeline, 73 Seiten im Praxistest
85.9%
Einsparung bei Bild-Token-Kosten
(Kostenbasis GPT-4o)
Praxismessung der Multimodal-Inferenzkosten
Hinweis:Getestet wurden echte Dokumente mit festem Layout (lange OFD-Dokumente mit Tabellen und eingebetteten Bildern); „end-to-end“ bezeichnet die durchgängige Kette „Hochladen → Parsing → Bereinigung → Anonymisierung → Komprimierung → Chunking → Metadaten → Qualitätsprüfung“. Die Werte variieren je nach Dokumentkomplexität – eine Nachprüfung mit Ihren eigenen Dokumenten ist willkommen.

Parsing-Qualität: Wie liest man die dreistufige Bewertung

Nach der Verarbeitung jedes Dokuments erhalten Sie einen „Prüfbericht“

Details zur Praxismessung des 443-Seiten-OFD-Dokuments

Strukturebene (sind Layoutblöcke, Titelhierarchie und Lesereihenfolge korrekt) –Vollpunktzahl; aus Beziehungsebene (Tabellenzeilen und -spalten, Kontextübergänge) und Inhaltsebene (Text, OCR-Genauigkeit) zusammengesetzt ergibt sich ein Gesamtscore von 0.924. Die Fehlertdetektion bei Tabellenstrukturen wurde durch die Koordination zweier Modelle konvergiert 64%

Score der Strukturebene1.00
100%
Gesamtscore (dreistufig gewichtet)0.924
92.4%

Dreistufiges Evaluierungssystem

Der Launch der Wissensdatenbank ist erst der Anfang – nur kontinuierliche „Check-ups“ halten sie zuverlässig

Korpus-Ebene: Ist das Rohmaterial gut?

Prüfung vor der Aufnahme der Dokumente

Misst die Qualität der Vorverarbeitung selbst; jede Dokumentencharge wird bei der Aufnahme automatisch bewertet.

  • Parsing-Vollständigkeit
  • Erhaltungsrate der Tabellenstruktur
  • OCR-Genauigkeit
  • Anonymisierungsabdeckung
  • Berechtigungstrefferquote

Retrieval-Ebene: Wird genau gefunden?

Ist das Wissen auffindbar?

Quantifiziert die Retrieval-Wirkung mit Standardfragenkatalogen und lokalisiert Recall-Probleme.

  • HitRate@K / Recall@K
  • MRR (Mean Reciprocal Rank)
  • NDCG@K (Ranking-Qualität)

Generierungs-Ebene: Stimmt die Antwort?

Die Antwort, die der Endnutzer sieht

Misst Treue und Relevanz der KI-Antworten, direkt abgebildet auf das Geschäftserlebnis.

  • Faithfulness (Treue zur Vorlage)
  • AnswerRelevancy (Rate themenfremder Antworten)
  • ContextPrecision (Kontextpräzision)

So schließt sich der Evaluierungskreislauf: ein Klick auf „Daumen runter“, das System sucht die Ursache selbst

Nachdem ein Nutzer bei einer Antwort „Daumen runter“ geklickt hat, verfolgt das System automatisch die von der Antwort zitierten Wissenspunkte zurück und attribuiert die Ursache auf den konkreten Schritt – hat das Chunking die Semantik zerschnitten, hat die Bereinigung Inhalte fälschlich entfernt, war die Anonymisierung zu aggressiv oder fehlen Metadaten? Das Lokalisierungsergebnis fließt automatisch in den Evaluierungssatz zurück; bei der nächsten Strategieänderung wird automatisch eine Regression geprüft, und die Freigabe erfolgt erst bei Erfüllung der Kennzahlen (Regressions-Gate).

Komprimierungsleistung: Zahlen aus dem alten Handwerk

Die Komprimierungs-Engine ist das Fundament der Basis und zugleich ein direkter Kostenfaktor

Typisches Komprimierungsergebnis

Kennzahl Gemessener Wert Bedeutung für den Kunden
Durchschnittliche Kompressionsrate60% (maximal 80%)Speicherkosten werden direkt um mehr als die Hälfte gesenkt
VerarbeitungsgeschwindigkeitIn-Memory-Architektur, 3-5x schnellerDurchgängige In-Memory-Verarbeitung, kein Datenträger-IO über temporäre Verzeichnisse
Gate für BildqualitätSSIM ≥ 0.92 / PSNR ≥ 30dBKlein komprimiert heißt nicht unscharf – automatische Suche der optimalen Parameter
Schriftart-DeduplizierungSpart 30-50% SchriftartspeicherAutomatisches Zusammenführen redundanter Schriftarten in Office-Dokumenten
Multimodal-Token-Einsparung85.9% (Kostenbasis GPT-4o)Bildkomprimierung vor der Übergabe an das große Modell senkt die Inferenzrechnung deutlich

Technische Details der Komprimierungs-Engine ansehen →

Welche Zahlen ergeben Ihre Dokumente?

Vereinbaren Sie eine Messung mit echten Dokumenten – wir liefern den Bericht

Messung anfragen