UGLYPEAR AI обновил бизнес: высокопроизводительное сжатие документов × RAG-платформа инженерии данныхУзнать о новом направлении →

Ключевые возможности

Восемь возможностей сцеплены между собой и покрывают весь путь документа до знания

Один: высокоточный разбор

Шесть форматов через единый вход, сканы тоже читаются, таблицы не рассыпаются

Разнообразие корпоративных форматов документов — первый барьер при построении базы знаний. Платформа включает DeepDoc-анализ вёрстки (две ONNX-модели для вёрстки и табличной структуры с локальным инференсом) и единым образом разбирает шесть основных форматов — PDF, Word, Excel, PPT, OFD, XPS — в структурированные данные, сохраняя иерархию заголовков, абзацы, связи строк и столбцов таблиц (включая объединённые ячейки) и порядок чтения; для сканов выполняется автоматическое OCR-распознавание.

6 видовЕдиный разбор форматов
Две моделиРаспознавание вёрстки и табличной структуры
Автоматический OCRАвтоматическое распознавание сканов
0.924Итоговый балл трёхуровневого контроля качества разбора
// Пример вывода разбора (фрагмент) { "title": "Техническое руководство по продукту V3.2", "elements": [ { "type": "heading", "level": 1, "text": "Глава 1. Обзор продукта" }, { "type": "table", "headers": ["Модель","Мощность","Напряжение"], "rows": [["A100","500W","220V"]] }, { "type": "image", "description": "Изображение внешнего вида продукта" } ] }

Два: очистка документов

Шум вроде колонтитулов и водяных знаков остаётся за дверями базы знаний

Колонтитулы, номера страниц, водяные знаки, дублирующееся содержимое — для человека это фоновый шум, для ИИ — источник загрязнения: в ответе внезапно всплывает цепочка номеров страниц, поиск сбивается из-за дубликатов. Платформа автоматически помечает и удаляет этот шум после разбора, одновременно формируя отчёт об очистке — что обработано, что удалено, всё можно проверить по записям.

Верхние/нижние колонтитулы/номера страницАвтоматическая пометка и удаление
Детекция водяных знаковПереиспользование ИИ-детекторов
Дублирующиеся документыДедупликация по хешу содержимого
Отчёт об очисткеЗапись каждой операции

Три: ИИ-маскирование данных

13 категорий конфиденциальных данных, автоматически скрываемых до добавления в базу

Лица, удостоверения личности, официальные печати, автономера, QR-коды на встроенных в документы изображениях — прямое попадание их в базу знаний создаёт серьёзный риск утечки. Платформа использует ИИ-детекторы защиты признаков из движка сжатия и перед добавлением в базу автоматически применяет гауссово размытие/мозаику к конфиденциальным областям, формируя отчёт о маскировании — что обнаружено на каждом изображении и где обработано, при аудите видно до мелочей.

13 категорийДетектор конфиденциальных данных
Лица/документыАвтоматическое размытие и скрытие
Печати/подписиРаспознавание и обработка областей
Отчёт о маскированииПолная запись места и способа обработки

Посмотреть полную систему безопасности данных →

Четыре: высокопроизводительное сжатие

Одна обработка — двойной результат: меньшие файлы + более чистые знания

Сжатие — коронное направление UGLYPEAR. Полное покрытие более чем 40 форматов: изображения, аудио и видео, PDF, Office, OFD, XPS, текст; средняя степень сжатия 60%, максимум 80%. Двойной контроль качества по метрикам SSIM/PSNR гарантирует, что «сжать меньше» не значит «сжать хуже». Для ИИ-приложений сжатие изображений напрямую означает снижение стоимости мультимодальных токенов при инференсе — по измерениям, экономия по методике GPT-4o составляет 85.9%.

60-80%Средняя степень сжатия
40+Форматы файлов
SSIM≥0.92Контроль качества
85.9%Экономия токенов изображений

Узнать о семействе продуктов сжатия SmartSlim →

Пять: умное разбиение

Разным документам — разное разбиение: семантика не рвётся, поиск точен

Разбиение на блоки фиксированной длины — самая частая ошибка в отрасли: фраза разрезается пополам, и ИИ, получив половину информации, вынужден догадываться. Платформа выбирает стратегию разбиения по типу документа и включает четыре набора предустановленных параметров с возможностью тонкой настройки под бизнес:

Тип документа Стратегия разбиения Особая обработка
Регламенты/договорыПо пунктам договораУсловия и выводы неотделимы
Технические руководстваПо главам+подразделамМодель/параметры/область применения в одном блоке
FAQОдин вопрос — один ответВопрос и ответ связаны вместе
Табличные материалыПо группам строкПовтор заголовков, сохранение связей строк и столбцов
PPTПо страницамЗаголовок+основной текст+примечания вместе
Длинные отчётыДвухуровневая схема «родитель–потомок»Поиск по дочерним блокам, генерация по родительским

Шесть: метаданные и жизненный цикл

Каждая единица знаний со своим «удостоверением личности», устаревшие знания уходят автоматически

После разбиения каждая единица знаний автоматически привязывается к метаданным: название документа, путь по главам, время публикации, номер версии, отдел-источник и т.д., а также проходит четырёхуровневое усиление содержимого (навигация «хлебные крошки», ключевые слова, резюме, гипотетические вопросы). При обновлении документа используется инкрементальная обработка: новая версия автоматически добавляется в базу, старая автоматически понижается в весе и помечается как устаревшая, а хеш содержимого гарантирует, что один и тот же документ не попадёт в базу дважды.

Четырёхуровневое усилениеХлебные крошки/ключевые слова/резюме/HyDE
Управление версиямиАрхивирование нескольких версий с возможностью отката
Инкрементальное обновлениеАвтоматическое переразбиение изменённых частей
Управление актуальностьюАвтоматическое понижение веса устаревших знаний

Семь: разметка прав доступа

Кто может видеть какие знания — управление на уровне единиц знаний

Просматривать регламент о зарплатах могут только HR и руководство, технические документы изолируются по отделам. Платформа позволяет привязывать к каждой единице знаний метки отдела, должности, роли, региона и уровня секретности; при поиске сначала фильтруются права, затем выполняется выборка — проверка прав происходит на уровне данных и не зависит от добросовестности прикладного слоя. Мультитенантная архитектура естественно изолирует базы знаний разных клиентов/подразделений.

Уровень единиц знанийГранулярность меток прав
МультитенантностьЕстественная изоляция данных
Фильтрация на этапе поискаСначала фильтрация, затем выборка
Предпросмотр фильтрацииПроверяемость прав доступа

Восемь: трёхуровневая оценка

Качество базы знаний — в цифрах, плохие ответы подотчётны

База знаний не заканчивается постройкой. В платформу встроена трёхуровневая система оценки: уровень материала (полнота разбора, сохранность таблиц, точность OCR, покрытие маскированием), уровень поиска (HitRate@K, Recall@K, MRR, NDCG@K), уровень генерации (достоверность, релевантность ответов, точность по контексту). После негативной оценки пользователя атрибуция выполняется автоматически: проблема в разбиении, очистке, маскировании или метаданных — видно с одного взгляда, а неудачные случаи автоматически возвращаются в оценочный набор.

Три уровняМатериал/поиск/генерация
Регрессионный шлюзАвтоматическая регрессия при смене стратегии
Атрибуция по негативной оценкеЛокализация проблемы до этапа
ДашбордВизуализация динамики качества

Посмотреть измеренные данные →

Хотите увидеть, как эти возможности работают на ваших документах?

Записаться на демонстрацию — лучше один раз увидеть

Записаться на демонстрацию Интеграция и развёртывание