UGLYPEAR AI complète son évolution : compression de documents haute performance × base d'ingénierie des données RAGDécouvrir la nouvelle activité →

Évaluations de performance

Pas de concepts, uniquement des chiffres mesurés · toutes les données proviennent des rapports de tests de projets, vérification bienvenue

Quatre séries de données clés mesurées

Issus des tests de bout en bout P2/P3, des mesures de la chaîne DeepDoc et des rapports de tests de la chaîne de traitement

124 s
Document OFD à mise en page fixe de 443 pages
Traitement de bout en bout sur toute la chaîne
Rapport de tests de la chaîne de traitement
0.924
Score global d'assurance qualité de l'analyse en trois couches
(couche structure : note maximale)
Rapport de tests e2e P2/P3
64%
Réduction des détections erronées de structures de tableaux
Synergie du double modèle d'analyse de mise en page
73 pages mesurées sur la chaîne DeepDoc
85.9%
Économies de coûts de tokens d'images
(selon les conditions GPT-4o)
Coûts d'inférence multimodale mesurés
Remarque :Les objets testés sont des documents réels à mise en page fixe (longs documents OFD, avec tableaux et images intégrées), et le bout en bout désigne toute la chaîne « téléversement → analyse → nettoyage → anonymisation → compression → découpage → métadonnées → contrôle qualité ». Les chiffres varient selon la complexité des documents ; nous vous invitons à vérifier par un test réel avec vos propres documents.

Qualité de l'analyse : comment lire les trois couches de notation

Chaque document traité reçoit son « bilan de santé »

Détails mesurés sur le document OFD de 443 pages

Couche structure (blocs de mise en page, hiérarchie des titres, correction de l'ordre de lecture) — sur une note maximale ; la couche relations (relations lignes-colonnes des tableaux, enchaînements contextuels) et la couche contenu (texte, précision OCR) sont combinées pour donner la note globale de 0.924. La réduction des détections erronées de structures de tableaux résulte de la synergie du double modèle 64%

Score de la couche structure1.00
100%
Score global (moyenne pondérée des trois couches)0.924
92.4%

Système d'évaluation en trois couches

La mise en production d'une base de connaissances n'est qu'un début, seul un « bilan de santé » continu garantit une fiabilité durable

Niveau corpus : la matière première est-elle bonne

Contrôle avant l'entrée des documents dans la base

Mesure la qualité du prétraitement lui-même, avec une notation automatique à chaque ingestion de lot de documents.

  • Complétude de l'analyse
  • Taux de préservation des structures de tableaux
  • Précision OCR
  • Taux de couverture de l'anonymisation
  • Taux de respect des autorisations

Niveau recherche : la recherche est-elle précise

Les connaissances peuvent-elles être trouvées

Quantifie l'efficacité de la recherche avec un jeu de questions standard, pour localiser les problèmes de rappel.

  • HitRate@K / Recall@K
  • MRR (rang réciproque moyen)
  • NDCG@K (qualité du classement)

Niveau génération : les réponses sont-elles correctes

Réponses vues par les utilisateurs finaux

Mesure la fidélité et la pertinence des réponses de l'IA, en correspondance directe avec l'expérience métier.

  • Faithfulness (fidélité au texte source)
  • AnswerRelevancy (taux de réponses hors sujet)
  • ContextPrecision (précision du contexte)

Comment la boucle se referme : un clic sur « non utile », et le système trouve la cause lui-même

Après qu'un utilisateur a voté négativement sur une réponse, le système remonte automatiquement aux points de connaissance cités par cette réponse et attribue la cause à une étape précise — découpage qui rompt la sémantique, nettoyage qui supprime du contenu à tort, anonymisation excessive, ou métadonnées manquantes ? Le résultat de la localisation retourne automatiquement dans le jeu d'évaluation, et à chaque changement de stratégie une vérification de régression est lancée automatiquement ; sans indicateurs au niveau requis, rien ne passe (barrière de régression).

Performances de compression : les données de notre métier d'origine

Le moteur de compression est le socle de la base, et aussi un poste de coût direct

Effets de compression typiques

Indicateur Valeurs mesurées Ce que cela apporte au client
Taux de compression moyen60 % (jusqu'à 80 %)Coûts de stockage réduits de plus de moitié d'un coup
Vitesse de traitementArchitecture en mémoire, gain de 3 à 5 foisTraitement intégralement en mémoire, aucune entrée/sortie disque dans un répertoire temporaire
Contrôle qualité d'imageSSIM ≥ 0.92 / PSNR ≥ 30dBCompresser petit ne signifie pas compresser flou, recherche automatique des paramètres optimaux
Déduplication des policesÉconomie de 30-50 % de l'espace des policesFusion automatique des polices redondantes des documents Office
Économies de tokens multimodaux85,9 % (selon les conditions GPT-4o)Les images compressées avant d'être données au grand modèle, la facture d'inférence chute nettement

Voir les détails techniques du moteur de compression →

Quels chiffres vos documents produiront-ils ?

Réservez un test avec vos documents réels, nous produisons le rapport

Demander un test