Kernfähigkeiten
Acht Fähigkeiten greifen ineinander und decken jeden Abschnitt des Wegs vom Dokument zum Wissen ab
1. Hochpräzises Parsing
Ein einheitlicher Zugang für sechs Formate, auch Scans lesbar, Tabellen fallen nicht auseinander
Die Vielfalt der Unternehmensdokumentformate ist die erste Hürde beim Aufbau einer Wissensdatenbank. Die Basis verfügt über eine integrierte DeepDoc-Layoutanalyse (zwei ONNX-Modelle für Layout und Tabellenstrukturerkennung, lokale Inferenz) und parst PDF, Word, Excel, PPT, OFD und XPS einheitlich zu strukturierten Daten; dabei bleiben Titelhierarchie, Absätze, Zeilen-Spalten-Beziehungen von Tabellen (einschließlich verbundener Zellen) und die Lesereihenfolge erhalten; gescannte Dokumente werden automatisch per OCR erkannt.
2. Dokumentenbereinigung
Kopf- und Fußzeilen, Wasserzeichen und anderer „Lärm“ bleiben vor der Wissensdatenbank
Kopf- und Fußzeilen, Seitenzahlen, Wasserzeichen, doppelte Inhalte – für Menschen Hintergrundlärm, für die KI eine Verunreinigungsquelle: In Antworten tauchen plötzlich Seitenzahlen auf, die Suche wird von doppelten Dokumenten gestört. Die Basis markiert und bereinigt diesen Lärm nach dem Parsing automatisch und erstellt zugleich einen Bereinigungsbericht – was verarbeitet und was gelöscht wurde, ist vollständig nachvollziehbar.
3. KI-Anonymisierung
13 Kategorien sensibler Informationen, vor der Aufnahme automatisch geschwärzt
Gesichter, Ausweise, Amtssiegel, Kfz-Kennzeichen, QR-Codes in eingebetteten Bildern … direkt in die Wissensdatenbank bedeutet ein erhebliches Leckagerisiko. Die Basis nutzt die KI-Merkmalsschutz-Detektoren der Komprimierungs-Engine, wendet vor der Aufnahme automatisch Gaußsche Unschärfe/Mosaik auf sensible Bereiche an und erstellt einen Anonymisierungsbericht – was in jedem Bild erkannt und wo verarbeitet wurde, ist bei der Prüfung vollständig ersichtlich.
4. Hochleistungs-Komprimierung
Ein Durchgang, doppeltes Ergebnis: kleinere Dateien + saubereres Wissen
Komprimierung ist das Kernhandwerk von UGLYPEAR. Über 40 Formate abgedeckt: Bilder, Audio/Video, PDF, Office, OFD, XPS, Text; durchschnittliche Kompressionsrate 60%, maximal 80%. Das duale Qualitätsgate SSIM/PSNR sorgt dafür, dass „klein komprimiert“ nicht „unscharf komprimiert“ bedeutet. Für KI-Anwendungen bedeutet Bildkomprimierung direkt sinkende Multimodal-Inferenz-Token-Kosten – im Praxistest 85.9% Ersparnis (Kostenbasis GPT-4o).
5. Intelligentes Chunking
Verschiedene Dokumente, verschiedene Schnittmethoden – nur ohne semantische Brüche wird die Suche präzise
Festes Zerlegen in Blocklängen ist der häufigste Fehler der Branche: Ein Satz wird mittig abgeschnitten, und die KI kann mit halben Informationen nur raten. Die Basis wählt die Chunking-Strategie nach Dokumenttyp und enthält vier Parametersätze, die nach Geschäftsanpassung feinjustierbar sind:
| Dokumenttyp | Chunking-Strategie | Besondere Behandlung |
|---|---|---|
| Richtlinien/Verträge | Klauselweise zerlegen | Bedingungen und Schlussfolgerungen nicht trennen |
| Technische Handbücher | Kapitel + Abschnitte | Modell/Parameter/Anwendungsbereich im selben Block |
| FAQ | Frage-Antwort | Frage und Antwort gebunden |
| Tabellenmaterial | Nach Zeilengruppen zerlegen | Kopfzeile wiederholt, Zeilen-Spalten-Beziehungen erhalten |
| PPT | Nach Seiten | Titel + Text + Anmerkungen gemeinsam |
| Lange Berichte | Zweistufig Eltern-Kind | Kindblöcke für die Suche, Elternblöcke für die Generierung |
6. Metadaten und Lebenszyklus
Jeder Wissenspunkt trägt seinen „Ausweis“, veraltetes Wissen scheidet automatisch aus
Nach dem Chunking werden an jeden Wissenspunkt automatisch Metadaten wie Dokumenttitel, Kapitelpfad, Veröffentlichungszeitpunkt, Versionsnummer und Quellabteilung gebunden, plus vierstufige Inhaltsanreicherung (Breadcrumb-Navigation, Schlüsselwörter, Zusammenfassung, hypothetische Fragen). Bei Dokumentupdates läuft eine inkrementelle Verarbeitung: Die neue Version wird automatisch aufgenommen, die alte automatisch abgewertet und als veraltet markiert; der Inhalts-Hash verhindert die doppelte Aufnahme desselben Dokuments.
7. Berechtigungskennzeichnung
Wer welchen Wissenspunkt sehen darf, geregelt bis auf Wissenspunkt-Ebene
Gehaltsrichtlinien können nur HR und Führungsebene abfragen, technische Dokumente sind nach Abteilungen isoliert. Die Basis unterstützt das Binden von Tags für Abteilung, Funktion, Rolle, Region und Geheimhaltungsstufe an jeden Wissenspunkt; bei der Suche wird zuerst nach Berechtigungen gefiltert und dann zurückgerufen – die Berechtigungsprüfung erfolgt auf der Datenebene, unabhängig von der Eigenverantwortung der Anwendungsebene. Das Multi-Tenant-System isoliert die Wissensdatenbanken verschiedener Kunden/Geschäftsbereiche von Natur aus.
8. Dreistufige Evaluierung
Die Qualität der Wissensdatenbank in Zahlen, schlechte Antworten rückverfolgbar
Eine Wissensdatenbank ist mit dem Aufbau nicht fertig. Die Basis enthält ein dreistufiges Evaluierungssystem: Korpus-Ebene (Parsing-Vollständigkeit, Tabellenstrukturquote, OCR-Genauigkeit, Anonymisierungsabdeckung), Retrieval-Ebene (HitRate@K, Recall@K, MRR, NDCG@K), Generierungs-Ebene (Treue, Antwortrelevanz, Kontextpräzision). Nach einer Abwertung durch Nutzer erfolgt automatisch die Ursachenattributierung: Liegt das Problem beim Chunking, der Bereinigung, der Anonymisierung oder den Metadaten – eine Prüfung genügt; Badcases fließen automatisch in den Evaluierungssatz zurück.
Möchten Sie diese Fähigkeiten auf Ihren Dokumenten im Einsatz sehen?
Demo vereinbaren – Sehen schlägt Hören