Ocho capacidades entrelazadas que cubren cada tramo del recorrido del documento al conocimiento
Inicio
Una sola entrada para seis formatos, los escaneos también se leen y las tablas no se deshacen
Los formatos variados de los documentos empresariales son el primer obstáculo para construir la base de conocimientos. La base incorpora DeepDoc, un análisis de maquetación (dos modelos ONNX para maquetación y estructura de tablas, con inferencia local) que unifica el análisis de los seis formatos principales —PDF, Word, Excel, PPT, OFD y XPS— en datos estructurados, conservando los niveles de títulos, los párrafos, las relaciones de filas y columnas de las tablas (incluidas las celdas combinadas) y el orden de lectura; los documentos escaneados se reconocen automáticamente por OCR.
6 tipos
Dejar los «ruidos» como encabezados, pies y marcas de agua fuera de la base de conocimientos
Encabezados, pies, números de página, marcas de agua y contenido duplicado son ruido de fondo para las personas, pero fuentes de contaminación para la IA: en las respuestas aparecen de pronto series de números de página y la recuperación se ve interferida por documentos duplicados. La base marca y limpia automáticamente este ruido tras el análisis, y devuelve un informe de limpieza: qué se procesó y qué se eliminó queda documentado.
Encabezados/pies/números de página
13 categorías de información sensible, enmascaradas automáticamente antes de entrar en la base
Rostros, documentos de identidad, sellos oficiales, matrículas, códigos QR incrustados en las imágenes de los documentos: darles paso directo a la base de conocimientos es un riesgo grave de fuga. La base reutiliza los detectores de protección de características con IA del motor de compresión para aplicar automáticamente desenfoque gaussiano o mosaico a las regiones sensibles antes de la entrada en la base, y emite un informe de anonimización: qué se detectó en cada imagen y dónde se trató queda claro para la auditoría.
13 categorías
Un solo procesamiento, doble resultado: archivos más pequeños + conocimiento más limpio
La compresión es la especialidad de la casa. Cubrimos más de 40 formatos: imágenes, audio y vídeo, PDF, Office, OFD, XPS, texto, con un índice de compresión medio del 60 % y un máximo del 80 %. El doble control de calidad SSIM/PSNR garantiza que «comprimir más» no signifique «enturbiar». Para las aplicaciones de IA, comprimir las imágenes equivale directamente a reducir el coste de tokens de inferencia multimodal: en medición real, un ahorro del 85.9 % según criterio de GPT-4o.
Índice de compresión medio
A cada documento, su corte: sin semántica rota, la recuperación es precisa
El corte por longitud fija es la trampa más frecuente del sector: una frase queda cortada por la mitad y la IA, al recuperar media información, solo puede adivinar. La base elige la estrategia de segmentación según el tipo de documento e incorpora cuatro juegos de parámetros preestablecidos, ajustables al negocio:
Tipo de documento
| Estrategia de segmentación | Tratamiento especial | Normas internas/contratos |
|---|---|---|
| Por cláusulas | Condición y conclusión son inseparables | Manuales técnicos |
| Por capítulo+sección | Modelo/parámetros/ámbito de aplicación en el mismo bloque | Una pregunta, una respuesta |
| FAQ | Pregunta y respuesta vinculadas | Material tabular |
| Por grupos de filas | Encabezados repetidos, conservando las relaciones de filas y columnas | Por página |
| PPT | Título+cuerpo+notas juntos | Informes extensos |
| Doble nivel padre-hijo | Recuperación por subbloques, generación con el bloque padre | VI. Metadatos y ciclo de vida |
Cada punto de conocimiento lleva su «carnet de identidad», y los conocimientos caducados salen de escena automáticamente
Al terminar la segmentación, cada punto de conocimiento se vincula automáticamente a metadatos como el título del documento, la ruta de capítulos, la fecha de publicación, el número de versión y el departamento de origen, además de recibir un refuerzo de contenido en cuatro niveles (ruta de navegación, palabras clave, resumen, preguntas hipotéticas). Las actualizaciones de documentos siguen un procesamiento incremental: la nueva versión entra automáticamente en la base, la antigua se desprioriza y se marca como caducada, y el hash de contenido impide que un mismo documento entre dos veces.
Refuerzo en cuatro niveles
Quién puede ver qué conocimiento, controlado hasta el nivel de punto de conocimiento
Solo RR. HH. y la dirección pueden consultar las normas salariales, y los documentos técnicos están aislados por departamento. La base permite vincular a cada punto de conocimiento etiquetas de departamento, puesto, rol, región y nivel de confidencialidad; en la recuperación primero se filtra por permisos y después se recupera: la verificación de permisos se realiza en la capa de datos, sin depender de la diligencia de la capa de aplicación. El sistema multiinquilino aísla de forma natural las bases de conocimientos de distintos clientes o divisiones.
Granularidad de etiquetas de permisos
VIII. Evaluación en tres capas
La calidad de la base de conocimientos se demuestra con números, y las respuestas erróneas pueden rastrearse
Una base de conocimientos no se acaba al construirla. La base incorpora un sistema de evaluación en tres capas: nivel de corpus (integridad del análisis, tasa de estructura de tablas, precisión de OCR, cobertura de anonimización), nivel de recuperación (HitRate@K, Recall@K, MRR, NDCG@K) y nivel de generación (fidelidad, relevancia de la respuesta, precisión de contexto). Tras un «no me gusta» del usuario, la atribución es automática: si el problema está en la segmentación, la limpieza, la anonimización o los metadatos se averigua de un vistazo, y los badcase fluyen automáticamente al conjunto de evaluación.
¿Quiere ver estas capacidades funcionando sobre sus documentos?
Reserve una demostración y compruébelo con sus propios ojos