UGLYPEAR AI completa su actualización de negocio: compresión de documentos de alto rendimiento × base de ingeniería de datos RAGConocer el nuevo negocio →

Ocho capacidades entrelazadas que cubren cada tramo del recorrido del documento al conocimiento

Inicio

Una sola entrada para seis formatos, los escaneos también se leen y las tablas no se deshacen

Los formatos variados de los documentos empresariales son el primer obstáculo para construir la base de conocimientos. La base incorpora DeepDoc, un análisis de maquetación (dos modelos ONNX para maquetación y estructura de tablas, con inferencia local) que unifica el análisis de los seis formatos principales —PDF, Word, Excel, PPT, OFD y XPS— en datos estructurados, conservando los niveles de títulos, los párrafos, las relaciones de filas y columnas de las tablas (incluidas las celdas combinadas) y el orden de lectura; los documentos escaneados se reconocen automáticamente por OCR.

6 tipos

Análisis unificado de formatosDoble modelo
Identificación de maquetación y estructura de tablasOCR automático
Reconocimiento automático de documentos escaneadosPuntuación total medida del control de calidad de análisis en tres capas
0.924// Ejemplo de salida del análisis (extracto)
«Manual técnico del producto V3.2» { "title": «Capítulo 1: Descripción general del producto», "elements": [ { "type": "heading", "level": 1, "text": «Modelo» }, { "type": "table", "headers": [«Potencia»,«Voltaje»,«Imagen de aspecto del producto»], "rows": [["A100","500W","220V"]] }, { "type": "image", "description": II. Limpieza de documentos } ] }

Dejar los «ruidos» como encabezados, pies y marcas de agua fuera de la base de conocimientos

Encabezados, pies, números de página, marcas de agua y contenido duplicado son ruido de fondo para las personas, pero fuentes de contaminación para la IA: en las respuestas aparecen de pronto series de números de página y la recuperación se ve interferida por documentos duplicados. La base marca y limpia automáticamente este ruido tras el análisis, y devuelve un informe de limpieza: qué se procesó y qué se eliminó queda documentado.

Encabezados/pies/números de página

Marcado y eliminación automáticosDetección de marcas de agua
Reutilización de detectores de IADocumentos duplicados
Deduplicación por hash de contenidoInforme de limpieza
Registro de cada operaciónIII. Anonimización inteligente con IA

13 categorías de información sensible, enmascaradas automáticamente antes de entrar en la base

Rostros, documentos de identidad, sellos oficiales, matrículas, códigos QR incrustados en las imágenes de los documentos: darles paso directo a la base de conocimientos es un riesgo grave de fuga. La base reutiliza los detectores de protección de características con IA del motor de compresión para aplicar automáticamente desenfoque gaussiano o mosaico a las regiones sensibles antes de la entrada en la base, y emite un informe de anonimización: qué se detectó en cada imagen y dónde se trató queda claro para la auditoría.

13 categorías

Detector de información sensibleRostros/documentos de identidad
Desenfoque y enmascaramiento automáticosSellos/firmas
Identificación y tratamiento de regionesInforme de anonimización
Registro completo de posición y métodoVer el sistema completo de seguridad de datos →

IV. Compresión de alto rendimiento

Un solo procesamiento, doble resultado: archivos más pequeños + conocimiento más limpio

La compresión es la especialidad de la casa. Cubrimos más de 40 formatos: imágenes, audio y vídeo, PDF, Office, OFD, XPS, texto, con un índice de compresión medio del 60 % y un máximo del 80 %. El doble control de calidad SSIM/PSNR garantiza que «comprimir más» no signifique «enturbiar». Para las aplicaciones de IA, comprimir las imágenes equivale directamente a reducir el coste de tokens de inferencia multimodal: en medición real, un ahorro del 85.9 % según criterio de GPT-4o.

Índice de compresión medio

60-80%Formato de archivo
40+Control de calidad
SSIM≥0.92Ahorro en tokens de imagen
85.9%Conocer la familia de productos de compresión SmartSlim →

V. Segmentación inteligente

A cada documento, su corte: sin semántica rota, la recuperación es precisa

El corte por longitud fija es la trampa más frecuente del sector: una frase queda cortada por la mitad y la IA, al recuperar media información, solo puede adivinar. La base elige la estrategia de segmentación según el tipo de documento e incorpora cuatro juegos de parámetros preestablecidos, ajustables al negocio:

Tipo de documento

Estrategia de segmentación Tratamiento especial Normas internas/contratos
Por cláusulasCondición y conclusión son inseparablesManuales técnicos
Por capítulo+secciónModelo/parámetros/ámbito de aplicación en el mismo bloqueUna pregunta, una respuesta
FAQPregunta y respuesta vinculadasMaterial tabular
Por grupos de filasEncabezados repetidos, conservando las relaciones de filas y columnasPor página
PPTTítulo+cuerpo+notas juntosInformes extensos
Doble nivel padre-hijoRecuperación por subbloques, generación con el bloque padreVI. Metadatos y ciclo de vida

Cada punto de conocimiento lleva su «carnet de identidad», y los conocimientos caducados salen de escena automáticamente

Al terminar la segmentación, cada punto de conocimiento se vincula automáticamente a metadatos como el título del documento, la ruta de capítulos, la fecha de publicación, el número de versión y el departamento de origen, además de recibir un refuerzo de contenido en cuatro niveles (ruta de navegación, palabras clave, resumen, preguntas hipotéticas). Las actualizaciones de documentos siguen un procesamiento incremental: la nueva versión entra automáticamente en la base, la antigua se desprioriza y se marca como caducada, y el hash de contenido impide que un mismo documento entre dos veces.

Refuerzo en cuatro niveles

Ruta de navegación/palabras clave/resumen/HyDEGestión de versiones
Archivado multiversión con reversiónActualización incremental
Re-segmentación automática de las partes modificadasGobierno de la vigencia
Los conocimientos caducados se despriorizan automáticamenteVII. Etiquetado de permisos

Quién puede ver qué conocimiento, controlado hasta el nivel de punto de conocimiento

Solo RR. HH. y la dirección pueden consultar las normas salariales, y los documentos técnicos están aislados por departamento. La base permite vincular a cada punto de conocimiento etiquetas de departamento, puesto, rol, región y nivel de confidencialidad; en la recuperación primero se filtra por permisos y después se recupera: la verificación de permisos se realiza en la capa de datos, sin depender de la diligencia de la capa de aplicación. El sistema multiinquilino aísla de forma natural las bases de conocimientos de distintos clientes o divisiones.

Granularidad de etiquetas de permisos

Nivel de punto de conocimientoGranularidad de las etiquetas de permisos
MultiinquilinoAislamiento natural de los datos
Filtrado previo en la recuperaciónPrimero filtrar, después recuperar
Vista previa del filtradoEfecto de los permisos verificable

VIII. Evaluación en tres capas

La calidad de la base de conocimientos se demuestra con números, y las respuestas erróneas pueden rastrearse

Una base de conocimientos no se acaba al construirla. La base incorpora un sistema de evaluación en tres capas: nivel de corpus (integridad del análisis, tasa de estructura de tablas, precisión de OCR, cobertura de anonimización), nivel de recuperación (HitRate@K, Recall@K, MRR, NDCG@K) y nivel de generación (fidelidad, relevancia de la respuesta, precisión de contexto). Tras un «no me gusta» del usuario, la atribución es automática: si el problema está en la segmentación, la limpieza, la anonimización o los metadatos se averigua de un vistazo, y los badcase fluyen automáticamente al conjunto de evaluación.

tres capascorpus/recuperación/generación
Puerta de regresiónRegresión automática ante cambios de estrategia
Atribución de los «no me gusta»Localización del problema en el eslabón
Panel de controlVisualización de las tendencias de calidad

Ver los datos medidos →

¿Quiere ver estas capacidades funcionando sobre sus documentos?

Reserve una demostración y compruébelo con sus propios ojos

Reservar una demostración Integración y despliegue