Ключевые возможности
Восемь возможностей сцеплены между собой и покрывают весь путь документа до знания
Один: высокоточный разбор
Шесть форматов через единый вход, сканы тоже читаются, таблицы не рассыпаются
Разнообразие корпоративных форматов документов — первый барьер при построении базы знаний. Платформа включает DeepDoc-анализ вёрстки (две ONNX-модели для вёрстки и табличной структуры с локальным инференсом) и единым образом разбирает шесть основных форматов — PDF, Word, Excel, PPT, OFD, XPS — в структурированные данные, сохраняя иерархию заголовков, абзацы, связи строк и столбцов таблиц (включая объединённые ячейки) и порядок чтения; для сканов выполняется автоматическое OCR-распознавание.
Два: очистка документов
Шум вроде колонтитулов и водяных знаков остаётся за дверями базы знаний
Колонтитулы, номера страниц, водяные знаки, дублирующееся содержимое — для человека это фоновый шум, для ИИ — источник загрязнения: в ответе внезапно всплывает цепочка номеров страниц, поиск сбивается из-за дубликатов. Платформа автоматически помечает и удаляет этот шум после разбора, одновременно формируя отчёт об очистке — что обработано, что удалено, всё можно проверить по записям.
Три: ИИ-маскирование данных
13 категорий конфиденциальных данных, автоматически скрываемых до добавления в базу
Лица, удостоверения личности, официальные печати, автономера, QR-коды на встроенных в документы изображениях — прямое попадание их в базу знаний создаёт серьёзный риск утечки. Платформа использует ИИ-детекторы защиты признаков из движка сжатия и перед добавлением в базу автоматически применяет гауссово размытие/мозаику к конфиденциальным областям, формируя отчёт о маскировании — что обнаружено на каждом изображении и где обработано, при аудите видно до мелочей.
Четыре: высокопроизводительное сжатие
Одна обработка — двойной результат: меньшие файлы + более чистые знания
Сжатие — коронное направление UGLYPEAR. Полное покрытие более чем 40 форматов: изображения, аудио и видео, PDF, Office, OFD, XPS, текст; средняя степень сжатия 60%, максимум 80%. Двойной контроль качества по метрикам SSIM/PSNR гарантирует, что «сжать меньше» не значит «сжать хуже». Для ИИ-приложений сжатие изображений напрямую означает снижение стоимости мультимодальных токенов при инференсе — по измерениям, экономия по методике GPT-4o составляет 85.9%.
Пять: умное разбиение
Разным документам — разное разбиение: семантика не рвётся, поиск точен
Разбиение на блоки фиксированной длины — самая частая ошибка в отрасли: фраза разрезается пополам, и ИИ, получив половину информации, вынужден догадываться. Платформа выбирает стратегию разбиения по типу документа и включает четыре набора предустановленных параметров с возможностью тонкой настройки под бизнес:
| Тип документа | Стратегия разбиения | Особая обработка |
|---|---|---|
| Регламенты/договоры | По пунктам договора | Условия и выводы неотделимы |
| Технические руководства | По главам+подразделам | Модель/параметры/область применения в одном блоке |
| FAQ | Один вопрос — один ответ | Вопрос и ответ связаны вместе |
| Табличные материалы | По группам строк | Повтор заголовков, сохранение связей строк и столбцов |
| PPT | По страницам | Заголовок+основной текст+примечания вместе |
| Длинные отчёты | Двухуровневая схема «родитель–потомок» | Поиск по дочерним блокам, генерация по родительским |
Шесть: метаданные и жизненный цикл
Каждая единица знаний со своим «удостоверением личности», устаревшие знания уходят автоматически
После разбиения каждая единица знаний автоматически привязывается к метаданным: название документа, путь по главам, время публикации, номер версии, отдел-источник и т.д., а также проходит четырёхуровневое усиление содержимого (навигация «хлебные крошки», ключевые слова, резюме, гипотетические вопросы). При обновлении документа используется инкрементальная обработка: новая версия автоматически добавляется в базу, старая автоматически понижается в весе и помечается как устаревшая, а хеш содержимого гарантирует, что один и тот же документ не попадёт в базу дважды.
Семь: разметка прав доступа
Кто может видеть какие знания — управление на уровне единиц знаний
Просматривать регламент о зарплатах могут только HR и руководство, технические документы изолируются по отделам. Платформа позволяет привязывать к каждой единице знаний метки отдела, должности, роли, региона и уровня секретности; при поиске сначала фильтруются права, затем выполняется выборка — проверка прав происходит на уровне данных и не зависит от добросовестности прикладного слоя. Мультитенантная архитектура естественно изолирует базы знаний разных клиентов/подразделений.
Восемь: трёхуровневая оценка
Качество базы знаний — в цифрах, плохие ответы подотчётны
База знаний не заканчивается постройкой. В платформу встроена трёхуровневая система оценки: уровень материала (полнота разбора, сохранность таблиц, точность OCR, покрытие маскированием), уровень поиска (HitRate@K, Recall@K, MRR, NDCG@K), уровень генерации (достоверность, релевантность ответов, точность по контексту). После негативной оценки пользователя атрибуция выполняется автоматически: проблема в разбиении, очистке, маскировании или метаданных — видно с одного взгляда, а неудачные случаи автоматически возвращаются в оценочный набор.
Хотите увидеть, как эти возможности работают на ваших документах?
Записаться на демонстрацию — лучше один раз увидеть