Capacités clés
Huit capacités imbriquées les unes dans les autres, couvrant chaque mètre du trajet du document à la connaissance
Un — Analyse de haute précision
Six formats, une seule entrée, les documents numérisés sont lisibles, les tableaux ne se démantèlent pas
L'hétérogénéité des formats de documents d'entreprise est le premier obstacle de la construction d'une base de connaissances. La base intègre l'analyse de mise en page DeepDoc (double modèle ONNX pour la mise en page + les structures de tableaux, inférence locale), qui analyse de manière unifiée les six formats PDF, Word, Excel, PPT, OFD et XPS en données structurées, en préservant la hiérarchie des titres, les paragraphes, les relations lignes-colonnes des tableaux (cellules fusionnées comprises) et l'ordre de lecture ; les documents numérisés sont reconnus par OCR automatique.
Deux — Nettoyage des documents
Empêcher les en-têtes, pieds de page et filigranes, ces « bruits », d'entrer dans la base de connaissances
En-têtes, pieds de page, numéros de page, filigranes, contenu dupliqué — ce sont des bruits de fond pour l'humain, mais des sources de pollution pour l'IA : une série de numéros de page surgit dans les réponses, la recherche est perturbée par des documents en double. La base marque et nettoie automatiquement ces bruits après l'analyse, et restitue en même temps un rapport de nettoyage : ce qui a été traité, ce qui a été supprimé, tout est traçable.
Trois — Anonymisation intelligente par IA
13 catégories d'informations sensibles, masquées automatiquement avant ingestion
Visages, cartes d'identité, sceaux officiels, plaques d'immatriculation, codes QR… dans les images intégrées aux documents : les intégrer directement dans la base de connaissances constitue un risque majeur de fuite. La base réutilise les détecteurs de protection des caractéristiques IA du moteur de compression pour appliquer automatiquement un flou gaussien/mosaïque aux zones sensibles avant ingestion, et produit un rapport d'anonymisation — ce qui a été détecté sur chaque image, quelles zones ont été traitées : tout est limpide lors d'un audit.
Quatre — Compression haute performance
Un seul traitement, double production : des fichiers plus petits + des connaissances plus propres
La compression est la spécialité maison d'UGLYPEAR. Plus de 40 formats couverts : images, audio/vidéo, PDF, Office, OFD, XPS, texte, avec un taux de compression moyen de 60 % et un maximum de 80 %. Le contrôle qualité par double indicateur SSIM/PSNR garantit que « compresser petit » ne signifie pas « compresser flou ». Pour les applications IA, la compression d'images se traduit directement par une baisse des coûts de tokens d'inférence multimodale — 85,9 % d'économies mesurées selon les conditions GPT-4o.
Cinq — Découpage intelligent en segments
À chaque document sa découpe — sans rupture de sens, la recherche devient précise
Le découpage à longueur fixe est le piège le plus courant du secteur : une phrase coupée en son milieu, et l'IA qui ne récupère qu'une information tronquée ne peut que deviner. La base choisit la stratégie de découpage selon le type de document et intègre quatre jeux de paramètres prédéfinis, ajustables selon le métier :
| Type de document | Stratégie de découpage | Traitement spécifique |
|---|---|---|
| Règlements intérieurs/contrats | Découpage par clause | Conditions et conclusions inséparables |
| Manuels techniques | Par chapitre + sous-section | Modèle/paramètres/champ d'application dans le même bloc |
| FAQ | Une question, une réponse | Question et réponse liées |
| Données tabulaires | Découpage par groupes de lignes | En-têtes répétés, relations lignes-colonnes préservées |
| PPT | Par page | Titre + corps + notes ensemble |
| Longs rapports | Deux niveaux parent-enfant | Recherche sur les blocs enfants, génération à partir des blocs parents |
Six — Métadonnées et cycle de vie
Chaque point de connaissance avec sa « carte d'identité », les connaissances obsolètes quittent la scène automatiquement
Une fois le découpage terminé, chaque point de connaissance se lie automatiquement aux métadonnées : titre du document, chemin de chapitre, date de publication, numéro de version, service source, etc., et bénéficie d'un enrichissement du contenu en quatre niveaux (navigation par fil d'Ariane, mots-clés, résumé, questions hypothétiques). Les mises à jour de documents suivent un traitement incrémental : les nouvelles versions sont ingérées automatiquement, les anciennes sont dépriorisées et marquées obsolètes, et le hachage du contenu garantit qu'un même document ne sera pas ingéré deux fois.
Sept — Étiquetage des autorisations
Qui peut voir quel élément de connaissance, géré jusqu'au niveau du point de connaissance
Les règles de rémunération ne sont consultables que par les RH et la direction, les documents techniques sont isolés par service. La base permet de lier à chaque point de connaissance des étiquettes de service, de poste, de rôle, de zone et de niveau de confidentialité, et applique le filtrage des autorisations avant le rappel lors de la recherche — la vérification des autorisations s'effectue au niveau des données, sans dépendre du bon vouloir de la couche applicative. L'architecture multi-tenant isole naturellement les bases de connaissances des différents clients/divisions.
Huit — Évaluation en trois couches
Une base de connaissances qui parle chiffres, des mauvaises réponses que l'on peut responsabiliser
Une base de connaissances ne s'arrête pas une fois construite. La base intègre un système d'évaluation en trois couches : niveau corpus (complétude de l'analyse, taux de structures de tableaux, précision OCR, couverture de l'anonymisation), niveau recherche (HitRate@K, Recall@K, MRR, NDCG@K), niveau génération (fidélité, pertinence des réponses, précision du contexte). Après un vote négatif de l'utilisateur, l'attribution est automatique : le problème vient-il du découpage, du nettoyage, de l'anonymisation ou des métadonnées — une vérification suffit, et les cas négatifs retournent automatiquement dans le jeu d'évaluation.
Vous voulez voir ces capacités à l'œuvre sur vos propres documents ?
Réservez une démonstration, voir c'est croire