Évaluations de performance
Pas de concepts, uniquement des chiffres mesurés · toutes les données proviennent des rapports de tests de projets, vérification bienvenue
Quatre séries de données clés mesurées
Issus des tests de bout en bout P2/P3, des mesures de la chaîne DeepDoc et des rapports de tests de la chaîne de traitement
Traitement de bout en bout sur toute la chaîne
(couche structure : note maximale)
Synergie du double modèle d'analyse de mise en page
(selon les conditions GPT-4o)
Qualité de l'analyse : comment lire les trois couches de notation
Chaque document traité reçoit son « bilan de santé »
Détails mesurés sur le document OFD de 443 pages
Couche structure (blocs de mise en page, hiérarchie des titres, correction de l'ordre de lecture) — sur une note maximale ; la couche relations (relations lignes-colonnes des tableaux, enchaînements contextuels) et la couche contenu (texte, précision OCR) sont combinées pour donner la note globale de 0.924. La réduction des détections erronées de structures de tableaux résulte de la synergie du double modèle 64%。
Système d'évaluation en trois couches
La mise en production d'une base de connaissances n'est qu'un début, seul un « bilan de santé » continu garantit une fiabilité durable
Niveau corpus : la matière première est-elle bonne
Mesure la qualité du prétraitement lui-même, avec une notation automatique à chaque ingestion de lot de documents.
- Complétude de l'analyse
- Taux de préservation des structures de tableaux
- Précision OCR
- Taux de couverture de l'anonymisation
- Taux de respect des autorisations
Niveau recherche : la recherche est-elle précise
Quantifie l'efficacité de la recherche avec un jeu de questions standard, pour localiser les problèmes de rappel.
- HitRate@K / Recall@K
- MRR (rang réciproque moyen)
- NDCG@K (qualité du classement)
Niveau génération : les réponses sont-elles correctes
Mesure la fidélité et la pertinence des réponses de l'IA, en correspondance directe avec l'expérience métier.
- Faithfulness (fidélité au texte source)
- AnswerRelevancy (taux de réponses hors sujet)
- ContextPrecision (précision du contexte)
Comment la boucle se referme : un clic sur « non utile », et le système trouve la cause lui-même
Après qu'un utilisateur a voté négativement sur une réponse, le système remonte automatiquement aux points de connaissance cités par cette réponse et attribue la cause à une étape précise — découpage qui rompt la sémantique, nettoyage qui supprime du contenu à tort, anonymisation excessive, ou métadonnées manquantes ? Le résultat de la localisation retourne automatiquement dans le jeu d'évaluation, et à chaque changement de stratégie une vérification de régression est lancée automatiquement ; sans indicateurs au niveau requis, rien ne passe (barrière de régression).
Performances de compression : les données de notre métier d'origine
Le moteur de compression est le socle de la base, et aussi un poste de coût direct
Effets de compression typiques
| Indicateur | Valeurs mesurées | Ce que cela apporte au client |
|---|---|---|
| Taux de compression moyen | 60 % (jusqu'à 80 %) | Coûts de stockage réduits de plus de moitié d'un coup |
| Vitesse de traitement | Architecture en mémoire, gain de 3 à 5 fois | Traitement intégralement en mémoire, aucune entrée/sortie disque dans un répertoire temporaire |
| Contrôle qualité d'image | SSIM ≥ 0.92 / PSNR ≥ 30dB | Compresser petit ne signifie pas compresser flou, recherche automatique des paramètres optimaux |
| Déduplication des polices | Économie de 30-50 % de l'espace des polices | Fusion automatique des polices redondantes des documents Office |
| Économies de tokens multimodaux | 85,9 % (selon les conditions GPT-4o) | Les images compressées avant d'être données au grand modèle, la facture d'inférence chute nettement |
Quels chiffres vos documents produiront-ils ?
Réservez un test avec vos documents réels, nous produisons le rapport