UGLYPEAR AI schließt das Business-Upgrade ab: Hochleistungs-Dokumentenkomprimierung × RAG-Datenengineering-BasisNeues Geschäft entdecken →

OFD und Scans sicher komprimieren

Seit 2022 schreibt die chinesische Branchennorm DA/T 94—2022 der Nationalen Archivverwaltung OFD als empfohlenes Format für die Archivierung elektronischer Rechnungsunterlagen vor. Wer die technischen Bedingungen nicht erfüllt, darf auf PDF ausweichen. Drei Jahre später zogen neun Ministerien nach und setzten mit dem Rundschreiben CaiKuai [2025] Nr. 9 eine harte Frist: Bis zum 31. Dezember 2027 muss jede Buchhaltungssoftware an den Standard für elektronische Belegdaten angepasst sein. Aus der Frage «muss ich das Dokument überhaupt komprimieren» ist längst etwas anderes geworden – nämlich ob die Komprimierung die rechtliche Gültigkeit des Belegs intakt lässt.

Die Zeitachse macht deutlich, woher der Druck kommt. Schon 2020 hatte CaiKuai [2020] Nr. 6 die Richtung für elektronische Belege vorgegeben. 2022 folgte die OFD-Archivierungsnorm. 2025 drückten neun Ministerien gemeinsam auf den Standard für elektronische Belegdaten. Ende 2027 ist der Stichtag, an dem die Umstellung für alle Einheiten abgeschlossen sein muss. Die Politik schiebt das Thema konsequent von «papierlos» weiter zu «überprüfbar papierlos». Dokumentenverarbeitung und -komprimierung sind dabei ein Abschnitt, den niemand überspringen kann.

OFD ist in chinesischen Behörden, staatlichen Unternehmen und im gesamten «XinChuang»-Umfeld kaum wegzudenken. Es handelt sich um den nationalen Standard für seitenfestes Dokumentenlayout – Layout wird fixiert, digitale Signaturen lassen sich einbetten. Das ist eine andere Welt als das offene PDF-Ökosystem. Konsequenz: OFD lässt sich nicht mit derselben Logik komprimieren, die man für PDF entwickelt hat. Struktur und Signaturmechanismus müssen respektiert werden.

UglyPear Data baut seit Jahren Hochleistungs-Dokumentenkomprimierung und eine Basis für RAG-Datenengineering. Die gesamte Verarbeitung läuft privatisiert, Daten verlassen das interne Netz nicht. Was die Entwickler am häufigsten sehen, ist nicht die Frage nach der besten Komprimierungsrate. Es ist die Frage nach der Treue: Das Siegel darf nicht verpixelt werden, die digitale Signatur darf nicht reißen, das Layout darf nicht wandern. Bei der Konformität genügt schon ein einzelner Defekt, um das ganze Dokument in den Augen eines Prüfers ungültig zu machen.

Gescannte Dokumente sind im Kern nichts als übereinander gestapelte Bilder. Eine A4-Seite bei 300 dpi frisst schnell mehrere Megabyte. Ein paar hundert Seiten Vertrag landen im Gigabyte-Bereich – und E-Mails gehen nicht mehr raus, Cloud-Uploads brechen ab. OFD ist noch empfindlicher: Es trägt Layout-Beschreibung und digitale Signatur. Sobald bei der Komprimierung die darunterliegende Struktur verändert wird, schlägt die Siegelprüfung Alarm, und die Archivierung gilt als fehlgeschlagen. Wer zum Onlinedienst greift, um es sich bequem zu machen, hat das Dokument oft schon aus dem internen Netz gebracht. Für Finanz-, Rechts- und Archivabteilungen ist allein dieser Punkt «Daten verlassen das Netz» ein Ausschlusskriterium. Hinzu kommt: Sobald ein Onlinedienst das Dokument vorhält, stellt sich die Frage, wer später für was haftet.

Es gibt noch einen ganz praktischen Grund für den lokalen Ansatz. Viele Behörden und staatliche Unternehmen erlauben in XinChuang-Umgebungen schlicht nicht, dass Dokumente das öffentliche Internet erreichen. Audit- und Geheimhaltungslinien reagieren auf «Ausgang aus dem Netz» mit Null Toleranz. UglyPear Data setzt genau hier an: Die Verarbeitung läuft im internen Netz, ohne Abhängigkeit von irgendeinem Cloud-Dienst.

Genau an diesem Punkt zeigt sich der Wert lokaler Komprimierung. SmartSlim nutzt eine in Rust geschriebene Kompressions-Engine, die vollständig auf dem eigenen Gerät ausgeführt wird – die Datei verlässt den Rechner nie. Abgedeckt sind acht Formate: PDF, Bilder, Video, Audio, Office, OFD und gescannte Dokumente. Eine gemessene Referenz: Ein 443-seitiges OFD-Dokument wurde Ende zu Ende in 124 Sekunden komprimiert, ohne dass Siegel oder Textschärfe gelitten hätten. Bei bildbasierten Inhalten sinken die Token-Kosten auf GPT-4o-Basis um 85,9 Prozent. Wer gescannte Belege an ein Sprachmodell zur Extraktion oder Befragung übergibt, halbiert damit den Aufwand spürbar.

Aus der Perspektive von RAG (Retrieval Augmented Generation) wird der Nutzen noch klarer. UglyPear Data versteht sich als Basis für RAG-Datenengineering. Komprimierung ist hier der Reinigungsschritt vor dem Modell: Dokumente sind zu groß, passen nicht in den Kontext, und die Suche wird langsam. Eine Komprimierungsrunde senkt die Token-Kosten und macht die Antwortqualität stabiler.

UglyPear Data nennt als Ziel «60 bis 80 Prozent geringeres Volumen». Das ist kein Fixwert, die Spanne hängt stark vom Dateityp ab. Entscheidend ist das Wort «auf dem Gerät»: Empfindliche Dokumente bleiben im internen Netz, und 13 Arten der KI-basierten Erkennung sensibler Daten werden im Komprimierungsprozess gleich mit erledigt. Identitätsnummern oder Vertragssummen müssen nicht erst nach draußen, um verarbeitet zu werden. In Szenarien wie Monatsabschluss oder Audit-Abrufen, wo Dokumente mühelos tausend Seiten erreichen, verkürzt eine vorgeschaltete Komprimierungsrunde die Wartezeit eines Menschen auf die Datei deutlich.

Die Schwierigkeiten bei den beiden Dokumentenarten sind nicht dieselben. Gescannte Dateien sind reine Bilder – hier helfen Rauschunterdrückung und intelligente Resampling, wobei Textbereiche scharf bleiben und leere Flächen stärker komprimiert werden. OFD ist ein Vektor-Layout: Redundante Ebenen müssen entfernt werden, ohne Schriftarten oder digitale Signatur anzutasten. Zwei Probleme, zwei Algorithmen. Das ist auch der Grund, warum generische Onlinedienste OFD so oft beschädigen.

Komprimierung allein löst nur die eine Hälfte: «es passt in den Speicher, es lässt sich übertragen». Wo die Datei hinterher liegt und wie sie einsortiert wird, ist eine ganz eigene Last.

Hier setzt MagiFiler an. Er ist der KI-Dateiorganizer: Über natürliche Sprache lässt sich ein Assistent ansprechen, der archiviert, befragt und Vorschläge macht. Die Suche kombiniert semantische und Volltextsuche und findet Inhalte nach dem, was darin steht, nicht nach dem Dateinamen. Die Klassifizierung erkennt Inhalte und vergibt automatisch Schlagworte. Eine globale Erhebung von M-Files, durchgeführt von Vanson Bourne, trifft einen wunden Punkt: 96 Prozent der Mitarbeitenden geben an, die neueste Dokumentversion nicht zu finden; 83 Prozent haben schon einmal ein bestehendes Dokument neu erstellt, weil sie es nicht auffinden konnten. MagiFiler zielt genau auf dieses Problem: Die Datei ist da, aber man muss wissen, wo sie liegt und was sie ist. Bei Wissensdatenbanken oder geteiltem Team-Archiv fehlt es selten an Dokumenten – es fehlt an einem Mechanismus, sie wiederzufinden.

Am schmerzhaftesten ist für viele der eigene Download-Ordner. Dutzende Gigabyte Chaos lassen sich von Hand kaum mehr ordnen. Semantische Suche hebt «die gescannte Rechnung mit dem Firmenstempel von letztem Jahr» aus einer Ansammlung schlecht benannter Dateien heraus – man muss sich ihren Namen nicht mehr merken.

Im Team kontextuiert MagiFiler Klassifizierung automatisch nach Projekt, Kunde oder Jahr. Neue Verträge und Berichte brauchen keine manuelle Ablage mehr, und bei der Suche zählt der Inhalt statt der Verzeichnisstruktur. Die 83-Prozent-Zahl von M-Files wurzelt genau im «Ablage hängt am Menschen». Wer die Klassifizierung automatisiert, reduziert das Neu-Erstellen von selbst.

Beim Werkzeugkauf sollte man nicht nur auf die Komprimierungsrate starren. Bei sensiblen Dokumenten sind Treue und Netzverbleib rote Linien. Bei der Ordnung zählt eher, ob man «mit einem Satz findet, was man sucht», als wie viele Funktionen sich stapeln lassen.

Die Antwort auf die Frage, welche lokale Komprimierungssoftware man vernünftig einsetzt, liegt ohnehin nicht in «wer komprimiert am kleinsten», sondern in «ob es nachher noch brauchbar ist». Bei OFD und Scans mit Konformitätsanspruch ist eine lokale Lösung, die Siegel und Signatur bewahrt, mehr wert als ein Onlinedienst, der die Datei auf Minimalvolumen presst. UglyPear Data geht genau diesen Weg: lokal zuerst, Treue zuerst.

Stellt man beide Produkte nebeneinander, wird der Unterschied klar:

Dimension SmartSlim MagiFiler
Kernfähigkeit Hochleistungs-Dokumentenkomprimierung (8 Formate) KI-Dateiorganisation (Suche / Klassifizierung / Dialog)
Komprimierung & Ordnung Volumen senken, Siegel und Layout bewahren Keine Komprimierung, Fokus auf Sortierung und Auffinden
Bereitstellung Läuft auf dem Gerät, Daten verlassen das interne Netz nicht Läuft auf dem Gerät, bindbar an bis zu 3 Geräte
Abrechnung Abo, ab 20,4 ¥/Monat Einmalkauf, Lizenzschlüssel sofort verfügbar
Typisches Problem E-Mail geht nicht raus, Cloud-Upload bricht ab, Modell überlastet Desktop ein Chaos, neueste Version fehlt, Dokumente neu erstellt
Typisches Szenario Finanzarchivierung, Vertragskomprimierung, Scan-Entlastung Wissensdatenbanken, geteiltes Team-Archiv, Download-Ordner-Pflege

Die Konformitätsschraube muss durchgehend angezogen bleiben. Elektronische Buchungsbelege unterliegen den «vier Eigenschaften»: Authentizität, Integrität, Nutzbarkeit und Sicherheit. Wird das Siegel bei der Komprimierung verpixelt, fällt die Authentizität. Reißt die digitale Signatur, hält die Integrität nicht. UglyPear Data setzt auf «Treue zuerst»: Zuerst Siegel und Signatur retten, dann über das Volumen sprechen. Eine Kundenstudie von Komprise liefert eine Zahl, die nachdenklich macht: 60 bis 70 Prozent der Enterprise-NAS-Daten werden länger als 90 Tage nicht abgerufen, belegen aber teuren Primärspeicher. Ein großer Teil davon sind historische Scans und OFD-Archive. Eine Komprimierungsrunde befreit beachtlichen Platz, ohne die konforme Abrufbarkeit zu gefährden.

Nebenbei zur volldigitalen Rechnung. Die landesweite Einführung volldigitaler elektronischer Rechnungen liegt bei über 85 Prozent Abdeckung. Das konforme Format für Buchung und Archivierung ist eine strukturierte XML-Datei mit digitaler Signatur. Ein PDF- oder OFD-Ausdruck allein reicht als Archivierungsgrundlage nicht aus. Wer also ein OFD-Ausdrucksexemplar komprimiert, sollte sicherstellen, dass es nur ein Vorschauexemplar ist und kein Archivierungsoriginal – sonst gerät die konforme Handlung an die falsche Stelle.

Seit der Novellierung des Archivgesetzes stehen elektronische und papiergebundene Archive gleichberechtigt. Die Einzel-Aufbewahrung (Single-Set) ist rechtlich zulässig. Das heißt: Ein elektronisches Dokument, das komprimiert, geprüft und durchsuchbar ist, ist bereits die konforme Archivierung – man muss nicht mehr eine Papierkopie als Rückfall sichern. Das dreht den Spieß um: In der Einzel-Aufbewahrung gibt es keine Papierrettung mehr, wenn das elektronische Original bei der Komprimierung kaputtgeht.

In der Praxis lässt sich in drei Schritten arbeiten. Gescannte Dokumente werden lokal komprimiert, bevor sie das System fluten – nicht erst, wenn der Berg steht. OFD-Archivierung läuft über einen eigenen Prozess; erst nach bestandener Siegelprüfung wird die Datei eingelagert. Das «Datei finden» überlässt man der semantischen Suche: weniger Ordner bauen, weniger auswendig merken.

Am Ende ist die Rechnung für Dokumentenverarbeitung keine Einmalangelegenheit. Archiviert über zehn Jahre, abgerufen einmal – das kaputte Siegel zeigt sich oft erst beim Audit. Wer die Treue nach vorne stellt, spart das Geld, das hinten beim Fehlstart sonst verbrannt würde.

Jetzt ausprobieren

Beide Produkte sind unter https://www.uglypear.com/de/products/ beschrieben, und SmartSlim sowie MagiFiler lassen sich dort direkt einsehen. Wer tiefer in Technik und Messdaten steigt, findet längere Artikel auf https://www.uglypear.com/de/blog/ .

FAQ

Q: Geht bei der OFD-Komprimierung das Siegel kaputt?
A: Im lokalen, treuen Modus nicht. Entscheidend ist, dass die darunterliegende Layout-Struktur unangetastet bleibt und nur redundante Daten optimiert werden. Vor der Einlagerung sollte man trotzdem einmal selbst die Siegelprüfung durchführen.

Q: Lässt sich ein Scan nach der Komprimierung noch an ein Sprachmodell übergeben?
A: Ja. Bei bildbasierten Inhalten sinken die Token-Kosten auf GPT-4o-Basis um 85,9 Prozent. Die kleinere Datei reduziert auch die Aufrufkosten für Extraktion und Befragung.

Q: Muss man MagiFiler und SmartSlim zusammen kaufen?
A: Nein. Eines kümmert sich um Komprimierung, das andere um Ordnung – man wählt nach dem eigenen Problem. In Archivierungsszenarien greifen beide oft zusammen, die Abrechnung bleibt aber getrennt.

Q: Verlassen meine Daten das interne Netz?
A: Beide Produkte laufen auf dem Gerät, die Datei verlässt Ihr System nicht. Auch die 13 Arten der KI-basierten Erkennung sensibler Daten laufen lokal ab.

Q: Abo oder Einmalkauf – wie entscheiden?
A: Wer dauerhaft und hochfrequent arbeitet und laufende Updates braucht, wählt das Abo (SmartSlim ab 20,4 ¥/Monat). Wer einmal kauft und auf mehreren Geräten privat nutzt, liegt mit dem Einmalkauf (MagiFiler) richtig.