Отраслевой стандарт архивного дела DA/T 94—2022, который вступил в силу в 2022 году, закрепил OFD как рекомендуемый формат для архивирования электронных учётных документов — PDF допускается лишь там, где OFD по объективным причинам использовать нельзя. А три года спустя девять ведомств, включая Министерство финансов, выпустили совместное уведомление, обязав все организации завершить адаптацию к стандарту учётных данных на электронных доказательствах до 31 декабря 2027 года. Получается простая вещь: вопрос теперь не в том, сжимать ли сканы и OFD, а в том, как это сделать, чтобы не нарушить правила.
Хронология показывает, куда движется регулятор. В 2020 году появилось первое направляющее распоряжение по электронным доказательствам, в 2022-м — стандарт архивирования OFD, к 2025-му девять ведомств совместно продвигают стандарт учётных данных, и конец 2027-го — жёсткий срок для организаций. Вся логика последних лет одна: от «безбумажности» к «проверяемой безбумажности». Этап обработки и сжатия документов рано или поздно становится обязательным, его не обойти.
OFD в государственном и корпоративном секторе, особенно в средах с требованиями к отечественному ПО, практически незаменим. Это наш национальный стандарт формата фиксированной вёрстки: структура закреплена, поддерживаются цифровые подписи, и экосистема у него иная, чем у открытого PDF. Из этого следует прямое ограничение — к OFD нельзя применять алгоритмы сжатия, написанные для PDF. Здесь важно уважать и структуру, и механизм подписи, иначе файл просто перестанет проходить проверку.
UglyPear Data уже несколько лет строит высокопроизводительное сжатие документов и базу для инженерии данных под RAG, причём полностью в приватном контуре, без выхода данных за пределы внутренней сети. Чаще всего мы смотрим не на то, насколько велико сжатие, а на сохранность: печать не должна «расплыться», цифровая подпись — оборваться, вёрстка — «поехать». В вопросах соответствия требованиям одна-единственная брешь всё и портит.
Скан по своей природе — это стопка изображений. Одна страница A4 при сканировании в 300 dpi легко съедает несколько мегабайт, а договор на сотни страниц уходит в гигабайты. Почта такое не отправляет, облако такое не принимает — это обычное дело. OFD ещё капризнее: за ним стоит описание вёрстки и цифровая подпись. Стоит тронуть нижний слой структуры при сжатии, и проверка печати выдаёт тревогу, а архивная приёмка бракует файл. Многие ради простоты кидают документ в онлайн-сервис — и файл покидает контур. Для финансовых, юридических и архивных отделов сам факт «выхода данных из сети» уже непроходной. А что будет, если онлайн-сервис сохранит ваш документ у себя, — ответственность ведь ничья не снимется.
Локальный приоритет имеет и чисто практический смысл. В немалом числе организаций в среде с требованиями к отечественному ПО документы вообще не имеют права выходить в публичную сеть, а аудит и служба защиты информации к «выходу за контур» нетерпимы. Решение UglyPear Data работает внутри сети, не опирается ни на какие облачные сервисы — и попадает именно в этот жёсткий запрет.
Именно здесь раскрывается ценность локального сжатия. SmartSlim — это встроенный движок сжатия, написанный на Rust. Он целиком исполняется на вашем устройстве, файлы не покидают машину. В охвате — восемь типов форматов: PDF, изображения, видео, аудио, пакет Office, OFD, сканы. Есть замеры на реальных данных: документ OFD на 443 страницы сжимается от начала до конца за 124 секунды, при этом и печать, и чёткость текста сохраняются. Для графики по методике GPT-4o стоимость токенов изображений снижается на 85,9% — когда вы подаёте скан модели на извлечение данных или вопросы-ответы, расходы падают заметно.
Если посмотреть через призму RAG (retrieval-augmented generation, генерации с подключением поиска), картина проясняется. UglyPear Data позиционирует себя как базу инженерии данных под RAG, а сжатие — это этап очистки перед тем, как документ пойдёт в модель: файл слишком велик, контекст его не вмещает, поиск идёт медленно. Прогоняешь сжатие — токенов меньше, и качество ответов становится стабильнее.
Официально заявляемая UglyPear Data формулировка — «объём можно снизить на 60%–80%». По разным типам файлов разброс большой, и это не абсолютная величина. Главное слово здесь — «на устройстве»: чувствительный документ остаётся во внутренней сети, а 13 типов обнаружения чувствительной информации с помощью ИИ проходят прямо в процессе сжатия. Номера удостоверений, суммы в договорах — такие поля не нужно сначала отправлять наружу, а потом обрабатывать. В сценариях вроде месячного закрытия у финансовиков или выгрузки для аудита документы исчисляются тысячами страниц; один прогон сжатия перед основным процессом заметно сокращает время, которое люди тратят на ожидание файлов.
Сложность у двух классов документов разная. Скан — это чистое изображение, тут работают шумоподавление и умная передискретизация: на текстовых зонах сохраняем резкость краёв, пустые области сжимаем сильнее. OFD — векторная вёрстка, и здесь нужно убрать избыточные слои, не повредив при этом ни начертание глифов, ни цифровую подпись. Это два разных алгоритма, и именно поэтому универсальные онлайн-инструменты часто портят OFD.
Но сжать — это лишь половина. Файл стал меньше, а где его найти и как разложить по папкам — отдельная история.
Мой файл MagiFiler закрывает именно этот пробел. Это ИИ-организатор файлов: вы общаетесь с ассистентом на естественном языке, и он сам раскладывает документы, отвечает на вопросы, даёт советы. Поиск в нём двойной — семантический плюс полнотекстовый, то есть定位 по содержанию, а не угадывание по имени файла. Классификация распознаёт содержимое и ставит теги автоматически. Глобальное исследование, которое M-Files заказала у Vanson Bourne, звучит неутешительно: 96% сотрудников говорят, что им трудно найти последнюю версию документа, а 83% хоть раз воссоздали уже существующий файл, потому что не нашли оригинал. MagiFiler и решает эту задачу — файл-то есть, нужно лишь знать, где он и что это. Когда речь о построении базы знаний или общем архиве команды, проблема обычно не в отсутствии файлов, а в отсутствии механизма «найти».
Больнее всего обычному пользователю достаётся папка «Загрузки». Десятки гигабайт хаоса ручным созданием каталогов не победить. Семантический поиск вытаскивает «тот самый скан с печатью за прошлый год» прямо из кучи безобразно названных файлов — и вам не нужно помнить, как он назывался.
Для команд автоклассификация MagiFiler по проекту, клиенту, году расставляет теги сама: новые договоры и отчёты не требуют ручной раскладки, а при поиске вы идёте от содержания, а не от дерева папок. Та самая цифра в 83% повторных созданий коренится как раз в «архивации, завязанной на человека»; автоматизируешь классификацию — повторов становится меньше.
Выбирая инструмент, не смотрите только на коэффициент сжатия. Для чувствительных документов сохранность и невыход за контур — две красные линии. Для задач упорядочивания важнее «найти по одной фразе», чем нагромождение функций.
Закономерно возникает другой вопрос: какое отечественное ПО сжатия надёжно? Ответ не в «кто сожмёт меньше всех», а в «останется ли файл рабочим после сжатия». Для документов с атрибутом соответствия требованиям — таких как OFD и сканы — локальное решение, берегущее печать и подпись, ценнее онлайн-инструмента, который ужал до минимума. UglyPear Data идёт именно по этому пути: локальный приоритет, приоритет сохранности.
Два продукта рядом — и разница видна сразу:
| Параметр | SmartSlim | MagiFiler |
|---|---|---|
| Что делает | Высокопроизводительное сжатие документов (8 форматов) | ИИ-упорядочивание файлов (поиск / классификация / диалог) |
| Сжатие и порядок | Уменьшает объём, бережёт печать и вёрстку | Не сжимает, работает с классификацией и поиском |
| Размещение | Работает на устройстве, данные не покидают сеть | Работает на устройстве, до 3 привязанных устройств |
| Модель оплаты | Подписка от 20,4 ¥/мес | Разовая покупка, лицензионный ключ мгновенно |
| Для какой боли | Почта не отправляет, облако не принимает, модель не вмещает | Рабочий стол в хаосе, нет последней версии, повторные копии |
| Типичный сценарий | Финотчётность, сжатие договоров, «похудение» сканов | База знаний, общий архив команды, порядок в «Загрузках» |
Соответствие требованиям — та нить, которую нельзя ослаблять. Электронные учётные доказательства подчиняются «четырём свойствам»: подлинность, целостность, применимость, безопасность. Сожмёте печать — подлинность нарушена; оборвёте цифровую подпись — целостность не держится. Подход UglyPear Data — «сначала сохранность»: сначала оставляем печать и подпись, и лишь потом говорим об объёме. Исследование клиентской базы Komprise даёт показательную цифру: 60%–70% данных корпоративного NAS не запрашиваются дольше 90 дней, но занимают самое дорогое основное хранилище. Большая часть там — исторические сканы и архивы OFD; один прогон сжатия освобождает заметный объём, не мешая при этом архивной выгрузке по требованию.
Кстати, о полностью цифровых счетах-фактурах. Они уже развёрнуты по всей стране с покрытием свыше 85%, и корректный формат для учёта и архива — это структурированный XML с цифровой подписью; распечатка в PDF или OFD сама по себе не может служить основанием для архива. Поэтому при сжатии печатной копии OFD тем более проверьте, что это именно превью, а не архивный экземпляр, — не перепутайте шаги соответствия.
После поправок в Закон об архивах электронные и бумажные архивы получили равную юридическую силу, и одиночное архивирование (так называемая «однотомная» схема) стало законно допустимым. Иными словами, сжатый, проверяемый и находимый электронный файл сам по себе уже есть корректный архив — печатать бумажную подстраховку не нужно. Но это накладывает обратное требование: этап сжатия обязан сохранять всё как есть. При однотомной схеме, если электронный экземпляр испортится при сжатии, бумажной версии для спасения уже не будет.
На практике можно идти тремя шагами. Сканы сжимайте локально ещё до попадания в систему, не ждите, пока накопится гора. OFD пускайте по отдельному архивному процессу и проверяйте печать после сжатия, прежде чем класть в хранилище. А «где мой файл» доверьте семантическому поиску — меньше папок, меньше нагрузки на память.
В конечном счёте счета за обработку документов не разовые. Архив лежит десять лет, запрашивают раз — а испорченная печать обычно и вскрывается только на аудите. Вложиться в сохранность заранее — значит сэкономить на том, что потом могло бы пойти прахом.
Попробуйте сейчас
Описание обоих продуктов — на странице https://www.uglypear.com/ru/products/, а технические детали и замеры на реальных данных собраны в более длинных материалах блога https://www.uglypear.com/ru/blog/ (см. также SmartSlim и MagiFiler). Если вам нужно беречь печать и подпись при сжатии или навести порядок в собственных файлах, начните с локального запуска — без передачи данных наружу.
FAQ
Q: Печать после сжатия OFD «расплывётся»?
A: При локальном сжатии в режиме сохранности — нет. Ключ в том, чтобы не трогать нижний слой вёрстки, а оптимизировать лишь избыточные данные. Перед помещением в хранилище имеет смысл самим один раз проверить печать.
Q: Скан после сжатия ещё можно подавать в модель?
A: Да. Для графики по методике GPT-4o стоимость токенов изображений падает на 85,9%, а раз файл меньше, то и расход на извлечение и вопросы-ответы снижается.
Q: MagiFiler и SmartSlim нужно покупать вместе?
A: Нет. Один отвечает за сжатие, другой — за упорядочивание; выбирайте под свою задачу. В архивных сценариях они часто работают в паре, но оплата у каждого своя.
Q: Данные покинут внутреннюю сеть?
A: Оба продукта исполняются на устройстве, файлы не уходят с вашего компьютера; 13 типов обнаружения чувствительной информации с помощью ИИ тоже проходят локально.
Q: Подписка или разовая покупка — что брать?
A: Для долгой и частой работы с постоянными обновлениями — подписку (SmartSlim от 20,4 ¥/мес); для однократной покупки и использования на нескольких устройствах — разовую (MagiFiler, ключ сразу).