UGLYPEAR AI schließt das Business-Upgrade ab: Hochleistungs-Dokumentenkomprimierung × RAG-Datenengineering-BasisNeues Geschäft entdecken →

Kernfähigkeiten

Acht Fähigkeiten greifen ineinander und decken jeden Abschnitt des Wegs vom Dokument zum Wissen ab

1. Hochpräzises Parsing

Ein einheitlicher Zugang für sechs Formate, auch Scans lesbar, Tabellen fallen nicht auseinander

Die Vielfalt der Unternehmensdokumentformate ist die erste Hürde beim Aufbau einer Wissensdatenbank. Die Basis verfügt über eine integrierte DeepDoc-Layoutanalyse (zwei ONNX-Modelle für Layout und Tabellenstrukturerkennung, lokale Inferenz) und parst PDF, Word, Excel, PPT, OFD und XPS einheitlich zu strukturierten Daten; dabei bleiben Titelhierarchie, Absätze, Zeilen-Spalten-Beziehungen von Tabellen (einschließlich verbundener Zellen) und die Lesereihenfolge erhalten; gescannte Dokumente werden automatisch per OCR erkannt.

6 FormateEinheitliches Parsing
Zwei ModelleLayout- und Tabellenstrukturerkennung
Automatische OCRAutomatische Erkennung von Scans
0.924Gemessener Gesamtscore der dreistufigen Parsing-Qualitätsprüfung
// Parsing-Ausgabebeispiel (Auszug) { "title": "Produkt-Technisches Handbuch V3.2", "elements": [ { "type": "heading", "level": 1, "text": "Kapitel 1 Produktübersicht" }, { "type": "table", "headers": ["Modell","Leistung","Spannung"], "rows": [["A100","500W","220V"]] }, { "type": "image", "description": "Produktabbildung" } ] }

2. Dokumentenbereinigung

Kopf- und Fußzeilen, Wasserzeichen und anderer „Lärm“ bleiben vor der Wissensdatenbank

Kopf- und Fußzeilen, Seitenzahlen, Wasserzeichen, doppelte Inhalte – für Menschen Hintergrundlärm, für die KI eine Verunreinigungsquelle: In Antworten tauchen plötzlich Seitenzahlen auf, die Suche wird von doppelten Dokumenten gestört. Die Basis markiert und bereinigt diesen Lärm nach dem Parsing automatisch und erstellt zugleich einen Bereinigungsbericht – was verarbeitet und was gelöscht wurde, ist vollständig nachvollziehbar.

Kopf-/Fußzeilen/SeitenzahlenAutomatisch markiert und entfernt
WasserzeichenerkennungWiederverwendete KI-Detektoren
Doppelte DokumenteInhalts-Hash-Deduplizierung
BereinigungsberichtJeder Schritt wird protokolliert

3. KI-Anonymisierung

13 Kategorien sensibler Informationen, vor der Aufnahme automatisch geschwärzt

Gesichter, Ausweise, Amtssiegel, Kfz-Kennzeichen, QR-Codes in eingebetteten Bildern … direkt in die Wissensdatenbank bedeutet ein erhebliches Leckagerisiko. Die Basis nutzt die KI-Merkmalsschutz-Detektoren der Komprimierungs-Engine, wendet vor der Aufnahme automatisch Gaußsche Unschärfe/Mosaik auf sensible Bereiche an und erstellt einen Anonymisierungsbericht – was in jedem Bild erkannt und wo verarbeitet wurde, ist bei der Prüfung vollständig ersichtlich.

13 KategorienDetektoren für sensible Informationen
Gesichter/AusweiseAutomatisches Unschärf-Maskieren
Siegel/UnterschriftenRegionale Erkennung und Verarbeitung
AnonymisierungsberichtPosition und Methode vollständig protokolliert

Vollständige Datensicherheitsarchitektur ansehen →

4. Hochleistungs-Komprimierung

Ein Durchgang, doppeltes Ergebnis: kleinere Dateien + saubereres Wissen

Komprimierung ist das Kernhandwerk von UGLYPEAR. Über 40 Formate abgedeckt: Bilder, Audio/Video, PDF, Office, OFD, XPS, Text; durchschnittliche Kompressionsrate 60%, maximal 80%. Das duale Qualitätsgate SSIM/PSNR sorgt dafür, dass „klein komprimiert“ nicht „unscharf komprimiert“ bedeutet. Für KI-Anwendungen bedeutet Bildkomprimierung direkt sinkende Multimodal-Inferenz-Token-Kosten – im Praxistest 85.9% Ersparnis (Kostenbasis GPT-4o).

60-80%Durchschnittliche Kompressionsrate
40+Dateiformate
SSIM≥0.92Qualitätsgate
85.9%Einsparung bei Bild-Token-Kosten

SmartSlim-Komprimierungsproduktfamilie entdecken →

5. Intelligentes Chunking

Verschiedene Dokumente, verschiedene Schnittmethoden – nur ohne semantische Brüche wird die Suche präzise

Festes Zerlegen in Blocklängen ist der häufigste Fehler der Branche: Ein Satz wird mittig abgeschnitten, und die KI kann mit halben Informationen nur raten. Die Basis wählt die Chunking-Strategie nach Dokumenttyp und enthält vier Parametersätze, die nach Geschäftsanpassung feinjustierbar sind:

Dokumenttyp Chunking-Strategie Besondere Behandlung
Richtlinien/VerträgeKlauselweise zerlegenBedingungen und Schlussfolgerungen nicht trennen
Technische HandbücherKapitel + AbschnitteModell/Parameter/Anwendungsbereich im selben Block
FAQFrage-AntwortFrage und Antwort gebunden
TabellenmaterialNach Zeilengruppen zerlegenKopfzeile wiederholt, Zeilen-Spalten-Beziehungen erhalten
PPTNach SeitenTitel + Text + Anmerkungen gemeinsam
Lange BerichteZweistufig Eltern-KindKindblöcke für die Suche, Elternblöcke für die Generierung

6. Metadaten und Lebenszyklus

Jeder Wissenspunkt trägt seinen „Ausweis“, veraltetes Wissen scheidet automatisch aus

Nach dem Chunking werden an jeden Wissenspunkt automatisch Metadaten wie Dokumenttitel, Kapitelpfad, Veröffentlichungszeitpunkt, Versionsnummer und Quellabteilung gebunden, plus vierstufige Inhaltsanreicherung (Breadcrumb-Navigation, Schlüsselwörter, Zusammenfassung, hypothetische Fragen). Bei Dokumentupdates läuft eine inkrementelle Verarbeitung: Die neue Version wird automatisch aufgenommen, die alte automatisch abgewertet und als veraltet markiert; der Inhalts-Hash verhindert die doppelte Aufnahme desselben Dokuments.

Vierstufige AnreicherungBreadcrumb/Schlüsselwörter/Zusammenfassung/HyDE
VersionsverwaltungMehrstufige Archivierung mit Rollback
Inkrementelle UpdatesGeänderte Teile werden automatisch neu zerlegt
AktualitätsgovernanceVeraltetes Wissen wird automatisch abgewertet

7. Berechtigungskennzeichnung

Wer welchen Wissenspunkt sehen darf, geregelt bis auf Wissenspunkt-Ebene

Gehaltsrichtlinien können nur HR und Führungsebene abfragen, technische Dokumente sind nach Abteilungen isoliert. Die Basis unterstützt das Binden von Tags für Abteilung, Funktion, Rolle, Region und Geheimhaltungsstufe an jeden Wissenspunkt; bei der Suche wird zuerst nach Berechtigungen gefiltert und dann zurückgerufen – die Berechtigungsprüfung erfolgt auf der Datenebene, unabhängig von der Eigenverantwortung der Anwendungsebene. Das Multi-Tenant-System isoliert die Wissensdatenbanken verschiedener Kunden/Geschäftsbereiche von Natur aus.

Wissenspunkt-EbeneGranularität der Berechtigungstags
Multi-TenantNatürliche Datenisolation
Filterung vor der SucheErst filtern, dann zurückrufen
FiltervorschauBerechtigungswirkung überprüfbar

8. Dreistufige Evaluierung

Die Qualität der Wissensdatenbank in Zahlen, schlechte Antworten rückverfolgbar

Eine Wissensdatenbank ist mit dem Aufbau nicht fertig. Die Basis enthält ein dreistufiges Evaluierungssystem: Korpus-Ebene (Parsing-Vollständigkeit, Tabellenstrukturquote, OCR-Genauigkeit, Anonymisierungsabdeckung), Retrieval-Ebene (HitRate@K, Recall@K, MRR, NDCG@K), Generierungs-Ebene (Treue, Antwortrelevanz, Kontextpräzision). Nach einer Abwertung durch Nutzer erfolgt automatisch die Ursachenattributierung: Liegt das Problem beim Chunking, der Bereinigung, der Anonymisierung oder den Metadaten – eine Prüfung genügt; Badcases fließen automatisch in den Evaluierungssatz zurück.

Drei EbenenKorpus/Retrieval/Generierung
Regressions-GateAutomatische Regression bei Strategieänderungen
Attributierung nach AbwertungProbleme bis zum Schritt lokalisiert
DashboardVisualisierung der Qualitätstrends

Messdaten ansehen →

Möchten Sie diese Fähigkeiten auf Ihren Dokumenten im Einsatz sehen?

Demo vereinbaren – Sehen schlägt Hören

Demo vereinbaren Integration und Bereitstellung