UGLYPEAR AI completa su actualización de negocio: compresión de documentos de alto rendimiento × base de ingeniería de datos RAGConocer el nuevo negocio →

Evaluación de rendimiento

Sin conceptos, solo números medidos · todos los datos proceden de informes de pruebas de proyectos, verifíquelos

Cuatro grupos de datos medidos principales

Procedente de las pruebas e2e P2/P3, de la medición real de la canalización DeepDoc y del informe de pruebas de la canalización

124 segundos
Documento OFD de diseño fijo de 443 páginas
Procesamiento de extremo a extremo de toda la cadena
Informe de pruebas de la canalización
0.924
Puntuación total del control de calidad de análisis en tres capas
(capa de estructura sobre 100)
Informe de pruebas e2e P2/P3
64%
Convergencia de falsas detecciones en la estructura de tablas
Análisis de maquetación con colaboración de doble modelo
Medición real de 73 páginas de la canalización DeepDoc
85.9%
Ahorro en costes de tokens de imagen
(según criterio de GPT-4o)
Medición real del coste de inferencia multimodal
Nota:Los objetos de prueba son documentos reales de diseño fijo (documentos OFD extensos, con tablas e imágenes incrustadas), y «extremo a extremo» abarca toda la cadena «subida → análisis → limpieza → anonimización → compresión → segmentación → metadatos → control de calidad». Los datos varían según la complejidad de cada documento; puede repetir la verificación con sus propios documentos.

Calidad de análisis: cómo leer la puntuación en tres capas

Cada documento procesado recibe su «ficha de chequeo»

Detalles medidos del documento OFD de 443 páginas

Capa de estructura (¿correctos los bloques de maquetación, los niveles de títulos y el orden de lectura?) —puntuación máxima; tras combinar la capa de relaciones (filas y columnas de tablas, conexiones de contexto) con la capa de contenido (texto, precisión de OCR), la puntuación total es 0.924. Las falsas detecciones en la estructura de tablas se reducen mediante la colaboración de doble modelo 64%

Puntuación de la capa de estructura1.00
100%
Puntuación total combinada (ponderación de las tres capas)0.924
92.4%

Sistema de evaluación en tres capas

Poner en línea la base de conocimientos es solo el comienzo: el «chequeo» continuo es lo que la mantiene fiable

Nivel de corpus: ¿es buena la materia prima?

Control antes de que los documentos entren en la base

Mide la calidad del propio preprocesamiento; cada lote de documentos recibe puntuación automática al entrar en la base.

  • Integridad del análisis
  • Tasa de conservación de la estructura de tablas
  • Precisión de OCR
  • Cobertura de anonimización
  • Tasa de acierto de permisos

Nivel de recuperación: ¿encuentra con precisión?

Si el conocimiento puede encontrarse

Cuantifica el efecto de la recuperación con un conjunto estándar de preguntas y localiza los problemas de recuperación.

  • HitRate@K / Recall@K
  • MRR (media del rango recíproco)
  • NDCG@K (calidad del ordenamiento)

Nivel de generación: ¿responde correctamente?

Las respuestas que ve el usuario final

Mide la fidelidad y la relevancia de las respuestas de la IA, con correspondencia directa con la experiencia de negocio.

  • Faithfulness (fidelidad al original)
  • AnswerRelevancy (tasa de respuestas fuera de contexto)
  • ContextPrecision (precisión de contexto)

Cómo se cierra el círculo de la evaluación: un clic en «no me gusta» y el sistema busca la causa por sí solo

Tras un «no me gusta» de un usuario en una respuesta, el sistema retrotrae automáticamente los puntos de conocimiento citados por esa respuesta y atribuye la causa al eslabón concreto: ¿la segmentación cortó la semántica, la limpieza borró contenido por error, la anonimización fue excesiva o faltan metadatos? El resultado de la atribución fluye automáticamente al conjunto de evaluación y, en el próximo cambio de estrategia, se valida con pruebas de regresión automáticas: si las métricas no alcanzan el umbral, no se aprueba (puerta de regresión).

Rendimiento de compresión: los datos de nuestro oficio de siempre

El motor de compresión es el fundamento de la base y también un coste directo

Efectos típicos de compresión

Métrica Valor medido Lo que significa para el cliente
Índice de compresión medio60% (hasta 80%)Reducción de más de la mitad de los costes de almacenamiento
Velocidad de procesamientoArquitectura en memoria: mejora de 3-5 vecesProcesamiento íntegro en memoria, sin E/S de disco en directorios temporales
Control de calidad de imagenSSIM ≥ 0.92 / PSNR ≥ 30dBComprimir no es emborronar: búsqueda automática de los parámetros óptimos
Deduplicación de fuentesAhorro de 30-50% en espacio de fuentesFusión automática de fuentes redundantes en documentos Office
Ahorro en tokens multimodales85.9% (según criterio de GPT-4o)Alimentar los grandes modelos con imágenes ya comprimidas reduce notablemente la factura de inferencia

Ver los detalles técnicos del motor de compresión →

¿Qué números arrojan sus documentos?

Reserve una medición con sus documentos reales y nosotros emitimos el informe

Solicitar una medición real