Тестирование производительности
Без концепций — только измеренные цифры · все данные взяты из отчётов по проектам, проверяйте
Четыре набора ключевых измеренных данных
Из e2e-тестов P2/P3, измерений DeepDoc-конвейера и отчёта по тестам конвейера
Сквозная обработка полного цикла
(максимум на структурном уровне)
Двухмодельное взаимодействие при анализе вёрстки
(по методике GPT-4o)
Качество разбора: как читать трёхуровневую оценку
После обработки каждый документ получает «лист диспансеризации»
Подробные результаты тестирования OFD-документа на 443 страниц
Структурный уровень (блоки вёрстки, иерархия заголовков, корректность порядка чтения) —максимум; на уровне отношений (связи строк и столбцов таблиц, связность контекста) и уровне содержимого (текст, точность OCR) после агрегации общий балл 0.924. Ошибки распознавания табличной структуры снижены за счёт двухмодельного взаимодействия 64%。
Трёхуровневая система оценки
Запуск базы знаний — только начало; надёжность поддерживает постоянная «диспансеризация»
Уровень материала: качество исходников
Измеряют качество самой предобработки; каждая партия документов автоматически оценивается при добавлении в базу.
- Полнота разбора
- Сохранность табличной структуры
- Точность OCR
- Полнота покрытия маскированием
- Точность соблюдения прав доступа
Уровень поиска: точность нахождения
Количественная оценка эффективности поиска на стандартном наборе вопросов с локализацией проблем полноты выборки.
- HitRate@K / Recall@K
- MRR (средний обратный ранг)
- NDCG@K (качество ранжирования)
Уровень генерации: правильность ответов
Измеряют достоверность и релевантность ответов ИИ, напрямую отражая качество пользовательского опыта.
- Faithfulness (соответствие оригиналу)
- AnswerRelevancy (уровень ответов невпопад)
- ContextPrecision (точность по контексту)
Как замыкается цикл оценки: одно нажатие «плохо» — система сама ищет причину
После того как пользователь ставит «плохо» какому-либо ответу, система автоматически прослеживает единицы знаний, на которые опирался этот ответ, и локализует проблему до конкретного этапа — разбиение разорвало семантику, очистка удалила нужное содержимое, маскирование было избыточным или отсутствуют метаданные? Результат локализации автоматически возвращается в оценочный набор, а при следующем изменении стратегии автоматически проводится регрессионная проверка: если показатели не соответствуют норме, релиз не проходит (регрессионный шлюз).
Производительность сжатия: цифры основного ремесла
Движок сжатия — фундамент платформы и прямой источник затрат
Типичные результаты сжатия
| Показатель | Измеренные значения | Значение для клиента |
|---|---|---|
| Средняя степень сжатия | 60% (максимум 80%) | Затраты на хранение сокращаются более чем вдвое |
| Скорость обработки | Архитектура в памяти, ускорение в 3-5 раза | Обработка полностью в памяти, без дисковых операций ввода-вывода во временных каталогах |
| Контроль качества изображений | SSIM ≥ 0.92 / PSNR ≥ 30dB | Сжать меньше — не значит сжать хуже: автоматический подбор оптимальных параметров |
| Дедупликация шрифтов | Экономия 30-50% объёма шрифтов | Автоматическое объединение избыточных шрифтов в Office-документах |
| Экономия мультимодальных токенов | 85.9% (по методике GPT-4o) | После сжатия изображений перед подачей в большую модель счёт за инференс резко снижается |
Какие цифры покажут ваши документы?
Запишитесь на тестирование с реальными документами — мы подготовим отчёт