UGLYPEAR AI completa su actualización de negocio: compresión de documentos de alto rendimiento × base de ingeniería de datos RAGConocer el nuevo negocio →

Escaneos y OFD: conserva el sello al comprimir

En 2022 entró en vigor la norma de archivos DA/T 94—2022, que de la Administración Nacional de Archivos de China recomienda el formato OFD para el archivo de documentos contables electrónicos; solo donde no haya condiciones se acepta PDF como alternativa. Tres años después, la circular de nueve ministerios (con el Ministerio de Hacienda entre ellos) fijó el 31 de diciembre de 2027 como plazo para que los softwares contables adapten sus datos al estándar de comprobantes electrónicos. La pregunta ya no es si comprimir, sino cómo hacerlo sin incumplir.

La línea de tiempo dibuja una dirección clara. El documento de 2020 marcó el rumbo de los comprobantes electrónicos; en 2022 aterrizó el estándar de archivo OFD; en 2025 nueve ministerios empujaron de forma conjunta el estándar de datos de comprobantes contables; y finales de 2027 es la fecha tope para la adaptación. La política viene empujando del «sin papel» hacia el «sin papel verificable». El tratamiento y la compresión de documentos se vuelven, tarde o temprano, inevitables.

OFD es casi ineludible en el entorno gubernamental, empresarial y de informática nacional china. Es el estándar nacional de documentos de formato fijo: fija la maquetación, admite firma digital, y no comparte el ecosistema abierto de PDF. Eso implica que comprimir OFD no se puede tratar con la lógica de PDF; hay que respetar su estructura y su mecanismo de firma.

Una firma digital rota convierte un archivo válido en basura a ojos del auditor. Por eso UglyPear Data lleva años construyendo compresión de documentos de alto rendimiento y una base de ingeniería de datos para RAG, todo en despliegue privado: los datos no salen de la red interna. Lo que más revisamos no es la tasa de compresión, sino la fidelidad: el sello no se debe borrar, la firma digital no se debe cortar, la maquetación no se debe descuadrar. En cumplimiento, basta un solo punto flojo para arruinarlo todo.

El escaneo es, en el fondo, una pila de imágenes. Una página A4 a 300 dpi ya se come varios MB; un contrato de cientos de páginas salta al gigabyte, y entonces no sale por correo ni sube a la nube. OFD resulta especialmente delicado: lleva descripción de maquetación y firma digital, y si al comprimir tocas la estructura de base, la verificación del sello salta y el archivo se descarta. Muchos lo pasan a una herramienta en línea por comodidad, y el archivo sale de la red interna. En finanzas, legal o archivo, el solo hecho de que «el dato salga de la red» ya suspende; sin contar que si el servicio en línea guarda tu documento, la responsabilidad posterior queda en el aire.

La prioridad local tiene otro peso real. Bastantes organismos en entornos de informática nacional prohíben que el documento toque la red pública; las líneas de auditoría y confidencialidad son cero tolerancia con la «salida de red». La propuesta de UglyPear Data corre en la red interna, sin depender de ningún servicio en la nube, y encaja con esa exigencia dura.

Aquí la compresión local muestra su valor. SmartSlim, de UglyPear Data, integra un motor de compresión escrito en Rust que corre íntegramente en el equipo: el archivo no abandona tu ordenador. Cubre ocho familias de formato: PDF, imágenes, vídeo, audio, Office, OFD y escaneos. Tenemos una medición real: un documento OFD de 443 páginas se comprimió de extremo a extremo en 124 segundos, con sello y nitidez de texto conservados. En contenido de imagen, medido contra la base GPT-4o, el coste de tokens baja un 85,9 %: al alimentar escaneos a un modelo grande para extracción o preguntas, el gasto se recorta de golpe.

Visto desde el ángulo de RAG (generación aumentada por recuperación), el panorama aclara. UglyPear Data se posiciona como base de ingeniería de datos para RAG; la compresión es la fase de limpieza antes de alimentar al modelo: si el documento es enorme, el contexto no cabe y la recuperación se arrastra. Comprimir antes baja el coste de tokens y la calidad de las respuestas gana estabilidad.

UglyPear Data declara una reducción de volumen del 60 % al 80 %; la cifra varía mucho según el tipo de archivo y no debe tomarse como valor fijo. La clave está en «hecho en el equipo»: el documento sensible queda en la red interna, y la detección de información sensible con IA —13 tipos— se completa dentro del propio flujo de compresión, sin enviar antes el número de ID o el importe del contrato a ningún lugar. En cierres mensuales de finanzas o en requerimientos de auditoría, donde los documentos suman miles de páginas, comprimir una ronda antes de seguir el flujo acorta bastante el tiempo que la gente espera al archivo.

Los dos tipos de documento presentan dificultades distintas. El escaneo es imagen pura: depende del reductor de ruido y del remuestreo inteligente, protegiendo el borde del texto y comprimiendo más la zona en blanco. OFD es maquetación vectorial: hay que quitar capas redundantes sin sacrificar la forma de la fuente ni la firma digital. No es el mismo algoritmo para ambos, y por eso las herramientas en línea genéricas suelen romper el OFD.

Comprimir solo resuelve «cabe en el disco, se envía». Una vez pequeño, dónde encontrarlo y cómo clasificarlo es otro lío.

MagiFiler cubre ese hueco. Es un organizador de archivos con IA: hablas con un asistente en lenguaje natural para que archive, pregunte o sugiera; su búsqueda combina semántica y texto completo, localiza por contenido en vez de adivinar por el nombre de archivo; la clasificación reconoce el contenido y etiqueta de forma automática. Una encuesta global de M-Files realizada con Vanson Bourne es elocuente: el 96 % de los empleados dice que no encuentra la última versión de un documento, y el 83 % ha recreado un documento existente por no dar con él. MagiFiler apunta justo a eso: el archivo está, pero hay que saber dónde está y qué es. En la construcción de bases de conocimiento o en el archivo compartido de equipo, a menudo no falta el archivo, falta el mecanismo de «encontrarlo».

El caso más doloroso para la gente corriente suele ser la carpeta de descargas. Acumular decenas de GB a mano, creando carpetas, apenas sirve; la búsqueda semántica saca «el escaneo del año pasado con el sello» de entre archivos con nombres caóticos, sin que tengas que recordar cómo se llamaba.

Para un equipo, la clasificación con IA de MagiFiler etiqueta por proyecto, cliente o año de forma automática; los contratos y los informes que entran no requieren colocación manual, y al buscar se va por contenido en vez de por árbol de carpetas. Aquel 83 % de recreaciones tiene su raíz en «archivar depende de la persona»; al automatizar la clasificación, la creación repetida baja por sí sola.

Al elegir herramienta, no mires solo la tasa de compresión. Para documentos sensibles, la fidelidad y el no salir de la red son dos líneas rojas; para la necesidad de orden, poder encontrarlo con una frase tiene prioridad sobre amontonar funciones.

La duda que surge entonces es natural: ¿qué software de compresión nacional es de fiar? La respuesta no está en «quién comprime menos», sino en «sigue sirviendo tras comprimir». Para documentos con carga de cumplimiento como OFD o escaneos, una solución local que conserve el sello y la firma vale más que una herramienta en línea que llegue al volumen mínimo. UglyPear Data sigue justo ese camino: prioriza lo local y la fidelidad.

Puestos lado a lado, las diferencias saltan a la vista:

Dimensión SmartSlim MagiFiler
Capacidad central Compresión de documentos de alto rendimiento (8 formatos) Organización de archivos con IA (búsqueda / clasificación / diálogo)
Compresión y orden Reduce volumen, conserva sello y maquetación No comprime; se centra en clasificar y recuperar
Despliegue Corre en el equipo, los datos no salen de la red Corre en el equipo, hasta 3 dispositivos vinculados
Modelo de pago Suscripción desde 20,4 ¥/mes Pago único, clave de licencia instantánea
Dolor que resuelve Correo que no envía, nube que no recibe, modelo que no admite Escritorio en caos, última versión perdida, recreaciones repetidas
Escenario típico Archivo contable, compresión de contratos, adelgazar escaneos Base de conocimiento, archivo compartido de equipo, orden de descargas

El cumplimiento exige mantener la tensión. El comprobante contable electrónico exige las «cuatro propiedades»: autenticidad, integridad, usabilidad y seguridad. Si la compresión borra el sello, la autenticidad falla; si corta la firma digital, la integridad tampoco se sostiene. El enfoque de UglyPear Data coloca la fidelidad por delante: se conserva el sello y la firma antes de tocar el volumen. Komprise aportó una cifra en su estudio de clientes: entre el 60 % y el 70 % de los datos en NAS empresariales no se consultan en más de 90 días, pero ocupan el almacenamiento principal, que es costoso de mantener. Gran parte son escaneos históricos y archivos OFD; una ronda de compresión libera espacio considerable sin estorbar la consulta por cumplimiento.

Conviene mencionar las facturas electrónicas totalmente digitalizadas. Su cobertura supera el 85 % a nivel nacional, y el formato de archivo válido para reembolso y contabilización es el archivo XML estructurado con firma digital; el impreso en PDF u OFD no sirve solo como base de archivo. Por eso, al comprimir un impreso OFD, hay que confirmar que es solo vista previa, no documento de archivo, y no desviar el acto de cumplimiento.

Tras la revisión de la Ley de Archivos, los archivos electrónicos y los en papel tienen igual fuerza legal, y el archivo de un solo juego ya es formalmente viable. Dicho de otra forma: un electrónico que se pueda comprimir, verificar y recuperar ya es archivo conforme, sin imprimir papel de respaldo. Eso exige aún más que la compresión conserve la fidelidad; en archivo de un solo juego, si el electrónico se rompe al comprimir, no hay papel que rescate.

En la práctica, tres movimientos bastan. Antes de entrar al sistema, comprime el escaneo en local; no esperes a que se amontone. El archivo OFD sigue un flujo propio: tras comprimir, verifica el sello y luego ingresa. Deja «buscar el archivo» en manos de la búsqueda semántica; menos carpetas, menos memoria.

Al final, la cuenta del tratamiento de documentos no es de una sola vez. Archivas diez años y consultas una vez; el sello roto suele aparecer en la auditoría. Hacer la fidelidad al principio ahorra el dinero del posterior desastre.

Pruébalo ahora

Ambos productos se presentan en SmartSlim y MagiFiler. Para detalles técnicos y datos de medición real, visita el blog de UglyPear Data. Descarga, prueba en tu equipo y comprueba tú mismo que el sello y la firma siguen intactos tras comprimir.

FAQ

Q: ¿Se borra el sello al comprimir OFD?
A: En compresión local y modo fiel, no. La clave es no tocar la estructura de maquetación de base, solo optimizar datos redundantes; conviene verificar el sello una vez antes de ingresar al archivo.

Q: ¿Puedo alimentar el escaneo comprimido a un modelo grande?
A: Sí. En contenido de imagen, el coste de tokens baja un 85,9 % frente a la base GPT-4o; al reducir el documento, también baja el gasto de llamadas para extracción y preguntas.

Q: ¿Hay que comprar SmartSlim y MagiFiler juntos?
A: No. Uno gestiona la compresión y otro el orden; elige según tu problema. En escenarios de archivo suelen combinarse, pero el pago de cada uno es independiente.

Q: ¿Salen los datos de la red interna?
A: Ambos corren en el equipo; el archivo no abandona tu dispositivo. La detección de información sensible (13 tipos) con IA también se completa en local.

Q: ¿Suscripción o pago único?
A: Uso continuo y frecuente, con actualizaciones, apunta a suscripción (SmartSlim desde 20,4 ¥/mes); compra de una sola vez y varios dispositivos propios apunta a pago único (MagiFiler, clave instantánea, hasta 3 dispositivos).