UGLYPEAR AI complète son évolution : compression de documents haute performance × base d'ingénierie des données RAGDécouvrir la nouvelle activité →

Capacités clés

Huit capacités imbriquées les unes dans les autres, couvrant chaque mètre du trajet du document à la connaissance

Un — Analyse de haute précision

Six formats, une seule entrée, les documents numérisés sont lisibles, les tableaux ne se démantèlent pas

L'hétérogénéité des formats de documents d'entreprise est le premier obstacle de la construction d'une base de connaissances. La base intègre l'analyse de mise en page DeepDoc (double modèle ONNX pour la mise en page + les structures de tableaux, inférence locale), qui analyse de manière unifiée les six formats PDF, Word, Excel, PPT, OFD et XPS en données structurées, en préservant la hiérarchie des titres, les paragraphes, les relations lignes-colonnes des tableaux (cellules fusionnées comprises) et l'ordre de lecture ; les documents numérisés sont reconnus par OCR automatique.

6 typesAnalyse unifiée des formats
Double modèleReconnaissance de la mise en page et des structures de tableaux
OCR automatiqueReconnaissance automatique des documents numérisés
0.924Score mesuré de l'assurance qualité de l'analyse en trois couches
// Exemple de sortie d'analyse (extrait) { "title": "Manuel technique du produit V3.2", "elements": [ { "type": "heading", "level": 1, "text": "Chapitre 1 : Présentation du produit" }, { "type": "table", "headers": ["Modèle","Puissance","Tension"], "rows": [["A100","500W","220V"]] }, { "type": "image", "description": "Diagramme du produit" } ] }

Deux — Nettoyage des documents

Empêcher les en-têtes, pieds de page et filigranes, ces « bruits », d'entrer dans la base de connaissances

En-têtes, pieds de page, numéros de page, filigranes, contenu dupliqué — ce sont des bruits de fond pour l'humain, mais des sources de pollution pour l'IA : une série de numéros de page surgit dans les réponses, la recherche est perturbée par des documents en double. La base marque et nettoie automatiquement ces bruits après l'analyse, et restitue en même temps un rapport de nettoyage : ce qui a été traité, ce qui a été supprimé, tout est traçable.

En-têtes/pieds de page/numéros de pageMarquage et suppression automatiques
Détection des filigranesRéutilisation des détecteurs IA
Documents en doubleDéduplication par hachage du contenu
Rapport de nettoyageChaque opération est consignée

Trois — Anonymisation intelligente par IA

13 catégories d'informations sensibles, masquées automatiquement avant ingestion

Visages, cartes d'identité, sceaux officiels, plaques d'immatriculation, codes QR… dans les images intégrées aux documents : les intégrer directement dans la base de connaissances constitue un risque majeur de fuite. La base réutilise les détecteurs de protection des caractéristiques IA du moteur de compression pour appliquer automatiquement un flou gaussien/mosaïque aux zones sensibles avant ingestion, et produit un rapport d'anonymisation — ce qui a été détecté sur chaque image, quelles zones ont été traitées : tout est limpide lors d'un audit.

13 catégoriesDétecteurs d'informations sensibles
Visages/pièces d'identitéFloutage et masquage automatiques
Cachets/signaturesReconnaissance et traitement par zones
Rapport d'anonymisationEmplacement + méthode, tout est consigné

Voir le dispositif complet de sécurité des données →

Quatre — Compression haute performance

Un seul traitement, double production : des fichiers plus petits + des connaissances plus propres

La compression est la spécialité maison d'UGLYPEAR. Plus de 40 formats couverts : images, audio/vidéo, PDF, Office, OFD, XPS, texte, avec un taux de compression moyen de 60 % et un maximum de 80 %. Le contrôle qualité par double indicateur SSIM/PSNR garantit que « compresser petit » ne signifie pas « compresser flou ». Pour les applications IA, la compression d'images se traduit directement par une baisse des coûts de tokens d'inférence multimodale — 85,9 % d'économies mesurées selon les conditions GPT-4o.

60-80%Taux de compression moyen
40+Formats de fichiers
SSIM≥0.92Contrôle qualité
85.9%Économies de tokens d'images

Découvrir la famille de produits de compression SmartSlim →

Cinq — Découpage intelligent en segments

À chaque document sa découpe — sans rupture de sens, la recherche devient précise

Le découpage à longueur fixe est le piège le plus courant du secteur : une phrase coupée en son milieu, et l'IA qui ne récupère qu'une information tronquée ne peut que deviner. La base choisit la stratégie de découpage selon le type de document et intègre quatre jeux de paramètres prédéfinis, ajustables selon le métier :

Type de document Stratégie de découpage Traitement spécifique
Règlements intérieurs/contratsDécoupage par clauseConditions et conclusions inséparables
Manuels techniquesPar chapitre + sous-sectionModèle/paramètres/champ d'application dans le même bloc
FAQUne question, une réponseQuestion et réponse liées
Données tabulairesDécoupage par groupes de lignesEn-têtes répétés, relations lignes-colonnes préservées
PPTPar pageTitre + corps + notes ensemble
Longs rapportsDeux niveaux parent-enfantRecherche sur les blocs enfants, génération à partir des blocs parents

Six — Métadonnées et cycle de vie

Chaque point de connaissance avec sa « carte d'identité », les connaissances obsolètes quittent la scène automatiquement

Une fois le découpage terminé, chaque point de connaissance se lie automatiquement aux métadonnées : titre du document, chemin de chapitre, date de publication, numéro de version, service source, etc., et bénéficie d'un enrichissement du contenu en quatre niveaux (navigation par fil d'Ariane, mots-clés, résumé, questions hypothétiques). Les mises à jour de documents suivent un traitement incrémental : les nouvelles versions sont ingérées automatiquement, les anciennes sont dépriorisées et marquées obsolètes, et le hachage du contenu garantit qu'un même document ne sera pas ingéré deux fois.

Enrichissement en quatre niveauxFil d'Ariane/mots-clés/résumé/HyDE
Gestion des versionsArchivage multi-versions avec possibilité de retour arrière
Mise à jour incrémentaleRedécoupage automatique des parties modifiées
Gouvernance de la fraîcheurDépriorisation automatique des connaissances obsolètes

Sept — Étiquetage des autorisations

Qui peut voir quel élément de connaissance, géré jusqu'au niveau du point de connaissance

Les règles de rémunération ne sont consultables que par les RH et la direction, les documents techniques sont isolés par service. La base permet de lier à chaque point de connaissance des étiquettes de service, de poste, de rôle, de zone et de niveau de confidentialité, et applique le filtrage des autorisations avant le rappel lors de la recherche — la vérification des autorisations s'effectue au niveau des données, sans dépendre du bon vouloir de la couche applicative. L'architecture multi-tenant isole naturellement les bases de connaissances des différents clients/divisions.

Niveau point de connaissanceGranularité des étiquettes d'autorisation
Multi-tenantIsolation naturelle des données
Filtrage en amont de la rechercheFiltrage avant rappel
Aperçu du filtrageEfficacité des autorisations vérifiable

Huit — Évaluation en trois couches

Une base de connaissances qui parle chiffres, des mauvaises réponses que l'on peut responsabiliser

Une base de connaissances ne s'arrête pas une fois construite. La base intègre un système d'évaluation en trois couches : niveau corpus (complétude de l'analyse, taux de structures de tableaux, précision OCR, couverture de l'anonymisation), niveau recherche (HitRate@K, Recall@K, MRR, NDCG@K), niveau génération (fidélité, pertinence des réponses, précision du contexte). Après un vote négatif de l'utilisateur, l'attribution est automatique : le problème vient-il du découpage, du nettoyage, de l'anonymisation ou des métadonnées — une vérification suffit, et les cas négatifs retournent automatiquement dans le jeu d'évaluation.

Trois couchesCorpus/recherche/génération
Barrière de régressionRégression automatique lors des changements de stratégie
Attribution des cas négatifsLocalisation des problèmes par étape
Tableau de bordVisualisation des tendances qualité

Voir les données mesurées →

Vous voulez voir ces capacités à l'œuvre sur vos propres documents ?

Réservez une démonstration, voir c'est croire

Réserver une démonstration Intégration et déploiement