Evaluación de rendimiento
Sin conceptos, solo números medidos · todos los datos proceden de informes de pruebas de proyectos, verifíquelos
Cuatro grupos de datos medidos principales
Procedente de las pruebas e2e P2/P3, de la medición real de la canalización DeepDoc y del informe de pruebas de la canalización
Procesamiento de extremo a extremo de toda la cadena
(capa de estructura sobre 100)
Análisis de maquetación con colaboración de doble modelo
(según criterio de GPT-4o)
Calidad de análisis: cómo leer la puntuación en tres capas
Cada documento procesado recibe su «ficha de chequeo»
Detalles medidos del documento OFD de 443 páginas
Capa de estructura (¿correctos los bloques de maquetación, los niveles de títulos y el orden de lectura?) —puntuación máxima; tras combinar la capa de relaciones (filas y columnas de tablas, conexiones de contexto) con la capa de contenido (texto, precisión de OCR), la puntuación total es 0.924. Las falsas detecciones en la estructura de tablas se reducen mediante la colaboración de doble modelo 64%。
Sistema de evaluación en tres capas
Poner en línea la base de conocimientos es solo el comienzo: el «chequeo» continuo es lo que la mantiene fiable
Nivel de corpus: ¿es buena la materia prima?
Mide la calidad del propio preprocesamiento; cada lote de documentos recibe puntuación automática al entrar en la base.
- Integridad del análisis
- Tasa de conservación de la estructura de tablas
- Precisión de OCR
- Cobertura de anonimización
- Tasa de acierto de permisos
Nivel de recuperación: ¿encuentra con precisión?
Cuantifica el efecto de la recuperación con un conjunto estándar de preguntas y localiza los problemas de recuperación.
- HitRate@K / Recall@K
- MRR (media del rango recíproco)
- NDCG@K (calidad del ordenamiento)
Nivel de generación: ¿responde correctamente?
Mide la fidelidad y la relevancia de las respuestas de la IA, con correspondencia directa con la experiencia de negocio.
- Faithfulness (fidelidad al original)
- AnswerRelevancy (tasa de respuestas fuera de contexto)
- ContextPrecision (precisión de contexto)
Cómo se cierra el círculo de la evaluación: un clic en «no me gusta» y el sistema busca la causa por sí solo
Tras un «no me gusta» de un usuario en una respuesta, el sistema retrotrae automáticamente los puntos de conocimiento citados por esa respuesta y atribuye la causa al eslabón concreto: ¿la segmentación cortó la semántica, la limpieza borró contenido por error, la anonimización fue excesiva o faltan metadatos? El resultado de la atribución fluye automáticamente al conjunto de evaluación y, en el próximo cambio de estrategia, se valida con pruebas de regresión automáticas: si las métricas no alcanzan el umbral, no se aprueba (puerta de regresión).
Rendimiento de compresión: los datos de nuestro oficio de siempre
El motor de compresión es el fundamento de la base y también un coste directo
Efectos típicos de compresión
| Métrica | Valor medido | Lo que significa para el cliente |
|---|---|---|
| Índice de compresión medio | 60% (hasta 80%) | Reducción de más de la mitad de los costes de almacenamiento |
| Velocidad de procesamiento | Arquitectura en memoria: mejora de 3-5 veces | Procesamiento íntegro en memoria, sin E/S de disco en directorios temporales |
| Control de calidad de imagen | SSIM ≥ 0.92 / PSNR ≥ 30dB | Comprimir no es emborronar: búsqueda automática de los parámetros óptimos |
| Deduplicación de fuentes | Ahorro de 30-50% en espacio de fuentes | Fusión automática de fuentes redundantes en documentos Office |
| Ahorro en tokens multimodales | 85.9% (según criterio de GPT-4o) | Alimentar los grandes modelos con imágenes ya comprimidas reduce notablemente la factura de inferencia |
¿Qué números arrojan sus documentos?
Reserve una medición con sus documentos reales y nosotros emitimos el informe