UGLYPEAR AIが事業をアップグレード:高性能ドキュメント圧縮 × RAGデータエンジニアリング基盤新事業を詳しく見る →

スキャンとOFDの圧縮、印章の保真を優先

2022年に施行されたアーカイブ業界標準 DA/T 94—2022(中国国家档案局)は、版式電子会計資料の保存推奨フォーマットをOFDと定め、やむを得ない場合のみPDFへ退くことを認めている。その三年後、財政部など九部門が連名で通知 财会〔2025〕9号 を出し、各単位の会計ソフトに対して2027年12月31日までに電子証憑の会計データ標準への適合を義務づけた。要するにスキャン文書やOFDをめぐる問いは、もはや「圧縮するか否か」ではなく「どう圧縮すれば違反にならないか」へと移っている。

時系列を並べると潮目が見えてくる。2020年の 财会〔2020〕6号 が電子証憑の方向性を定め、2022年にOFD保存標準が降り、2025年には九部門が電子証憑会計データ標準を一斉に押し進め、2027年末が適合のデッドラインだ。政策は一貫して「ペーパーレス」を「検証可能なペーパーレス」へと引き上げてきた。文書の処理と圧縮という関門は、いずれ避けて通れなくなる。

OFDは国内の官公庁・企業や国産IT(信創)環境ではほぼ避けられない存在だ。版式(レイアウト固定)ドキュメントの国家標準であり、版式が固化してデジタル署名を添えられるため、PDFのようなオープンなエコシステムとは性質が異なる。これは即ち、OFDを扱う際にPDF向けの圧縮ロジックをそのまま流用できず、構造と署名の仕組みを尊重しなければならないことを意味する。

UglyPear Data は高性能文書圧縮とRAGデータエンジニアリング基盤を手がけ、完全なプライベート配置を前提としている。同社が重視するのは圧縮率の高低ではなく「保真」である。印章がにじんではならず、デジタル署名が切れてはならず、版式が崩れてはならない。コンプライアンスは、たった一カ所の破綻で全体が崩れる。

スキャン文書の正体は画像の積み重ねだ。A4を300dpiで一枚スキャンするだけで数MBを消費し、数百ページの契約書なら一気に数GB規模になり、メールに添付できずクラウドにも飛ばせないのが日常茶飯事になる。OFDはさらに繊細で、版式記述とデジタル署名をともなうため、圧縮時に下層構造を触れば検印が警告を発し、アーカイブは不合格と判定される。手軽さからオンラインツールに投げる例が後を絶たないが、結果としてファイルが内網を出てしまう。財務・法務・アーカイブの部署にとって「データが内網を出る」だけで審査は通らない。まして、オンラインサービスが文書を保管し残した場合、その後の責任の所在は誰にあるのか。

ローカル優先にはもう一つ、現実的な意味がある。多くの官公庁・企業は信創環境下で文書の公網送信を許さず、監査や保密のラインは「出網」に対してゼロトレランスだ。UglyPear Data の方式は内網で動き、いかなるクラウドサービスにも依存しない。この硬い要件にぴたりと合う。

ここでローカル圧縮の価値が浮かび上がる。SmartSlim に内蔵された圧縮エンジンはRustで書かれ、すべて本機で動き、ファイルは端末から出ない。PDF、画像、動画、音声、Office、OFD、スキャン文書など8形式に対応する。実測値を一つ挙げよう。443ページのOFD文書を端から端まで124秒で圧縮し、印章と文字の鮮明さをともに保った。画像系コンテンツはGPT-4o基準で換算するとトークンコストを85.9%削減でき、スキャン文書をそのまま大規模言語モデルへ流し込んで抽出や質問応答をさせる際、負荷を大きく刈り取れる。

視点をRAG(検索拡張生成)へ広げると、これがより明確になる。UglyPear Data は自らをRAGデータエンジニアリング基盤と位置づけており、圧縮とはモデルへ渡す前の洗浄工程にあたる。文書が大きすぎるとコンテキストに収まらず、検索も遅くなる。一段階圧縮してトークンコストを下げれば、質問応答の品質もかえって安定する。

同社が公称する「容量を60%–80%削減」は、ファイル種別によって幅が大きく、絶対値としては受け取れない。肝心なのは「本機で完結する」の四文字だ。機微文書は内網に留まり、13種類のAI機微情報検出が圧縮フローのなかでついでに済む。身分証番号や契約金額といった項目を、先に外部へ送ってから処理する必要がない。財務の月次締めや監査の閲覧といった場面では文書が千ページを軽く超える。圧縮を一段挟んでから手続きに進めば、人がファイルを待つ時間はずっと短くなる。

二種類の文書では难点が異なる。スキャン文書は純粋な画像であり、画像のノイズ低減と知的再サンプリングに依存する。文字領域のエッジを保ち、空白領域を多めに圧す。OFDはベクトル版式だから、字形とデジタル署名を残したまま冗長なレイヤーを剥がさねばならない。両者は別のアルゴリズムを使う。だからこそ汎用のオンラインツールがOFDをしばしば壊してしまう。

圧縮だけでは「収まる・送れる」しか解決しない。ファイルが小さくなっても、どこにあるか、どう分類するかは別の悩みだ。

MagiFiler が埋めるのがこの穴である。AIによる賢いファイル整理を担い、自然言語で対話しながらアシスタントに整理・質問・提案をさせる。検索は意味検索と全文検索の二系統で、内容から位置を特定し、ファイル名あてずっぽうに頼らない。分類は内容を読み取って自動でタグを付ける。M-FilesがVanson Bourneに委託したグローバル調査が痛い。96%の従業員が最新版を見つけられず、83%が既存の文書が見つからずに改めて作成したという。MagiFilerが狙うのはまさにこの点だ。ものはまだある。だがそれがどこにあって、何であるかを知らねばならない。ナレッジベースの構築やチーム共有のアーカイブで不足しているのはファイルではなく「見つかる仕組み」であることが多い。

一般利用者を直撃するのは往々にしてダウンロードフォルダだ。数十GBの蓄積を手動でディレクトリを作って片付けるのは実質的に無力だ。意味検索が「昨年のあの公印付きスキャン文書」を、命名が乱雑なファイルの山から直接すくい上げる。名前を覚えていなくても構わない。

チームにとっては、MagiFilerのAI分類がプロジェクト・取引先・年次で自動タグを付け、新着の契約書や帳票を人が手動で納める必要がなくなる。検索はディレクトリ木ではなく内容で行う。M-Filesのあの83%再作成という数字の根は「整理を人に頼る」ことにある。分類を自動化すれば、重複作成は自然に減る。

ツール選びは圧縮率だけを眺めてはならない。機微文書に対しては保真と出網回避が二本の赤線だ。整理の要望に対しては「一言で見つかるか」が機能の羅列より重い。

では国産圧縮ソフトはどれが信頼できるのか。答えは「誰が小さく圧すか」ではなく「圧したあと、まだ使えるか」にある。OFDやスキャン文書のようにコンプライアンス属性を帯びた文書なら、印章と署名を保てるローカル方式のほうが、体積を徹底的に削るオンラインツールより価値がある。UglyPear Data が歩むのは、このローカル優先・保真優先の道である。

二製品を並べると違いが一目でわかる。

比較項目 SmartSlim MagiFiler
中核の能力 高性能文書圧縮(8形式対応) AIファイル整理(検索・分類・対話)
圧縮と整理 体積を削り、印章と版式を保つ 圧縮はせず、分類と検索に専念
配置方式 本機動作、データは内網を出ない 本機動作、最大3台の端末を紐付け
料金体系 月額20.4元からのサブスクリプション 買い切り、ライセンスキー即時発行
対象の悩み メール送信不可、クラウド転送不可、モデル投入不可 デスクトップの散乱、最新版不在、重複作成
典型シナリオ 財務アーカイブ、契約圧縮、スキャン文書の軽量化 ナレッジベース構築、チーム共有アーカイブ、ダウンロードフォルダ整理

コンプライアンスの糸は常に張っておくべきだ。電子会計証憑には「四性」の要件がある。真正性・完全性・利用可能性・安全性である。圧縮で印章をにじませれば真正性が破れ、デジタル署名を断てば完全性も立たない。UglyPear Data の手順は「保真優先」だ。まず印章と署名を残し、そのうえで体積を語る。Kompriseの顧客調査が一つの数字を出している。企業NASデータの60%–70%は90日以上アクセスされていないが、高価なプライマリストレージを占有している。そのなかには歴史的スキャン文書やOFDアーカイブが大量に含まれる。一段圧縮するだけで相当な空間が生まれ、コンプライアンス上の閲覧を妨げない。

ついでに数電発票(全数字化電子発票)の話を添えておく。全国への普及はすでにカバー率85%超に達し、適合する報销・計上・アーカイブの形式はデジタル署名付きXML構造化ファイルだ。PDFやOFDの印刷出力だけではアーカイブの根拠として単独では認められない。したがってOFD印刷出力を圧縮する際は、それが単なるプレビューであり原本ではないことを確認すべきだ。コンプライアンスの動作を横道にそれてはならない。

「档案法」の改正以降、電子アーカイブと紙アーカイブは同等の法的効力を持ち、単式アーカイブ(単套制)が正式に可能になった。言い換えれば、圧縮でき、検印でき、検索できる電子文書そのものが適合アーカイブであり、紙で裏を取る必要はない。これは裏返せば、圧縮工程が保真でなければならないことを要求する。単式アーカイブの下では電子文書が壊れても、紙版が救いの一手にはならない。

実務では三段階で進められる。スキャン文書はシステム投入前にまずローカル圧縮し、山になるのを待たない。OFDアーカイブは専用フローを通し、圧縮後に検印を通してから格納する。そして「ファイルを探す」は意味検索に任せ、フォルダを作りすぎず記憶に頼らない。

結局、文書処理のツケは一度きりではない。十年アーカイブして一度閲覧したとき、壊れた印章は監査の場で顔を出す。保真を前倒しで済ませておくことは、あとで転覆する代償を省くことだ。

今すぐ試す

両製品の説明は SmartSlim および MagiFiler のページにあり、技術の詳細や実測データは https://www.uglypear.com/ja/blog/ に長めの記事を公開している。ローカル完結の圧縮とAIファイル整理、どちらからでも始められる。自社の文書が内網を出ない範囲で、まずは手元のスキャン文書かOFDを一つ、試しに圧縮してみてほしい。

FAQ

Q:OFDを圧縮すると印章がにじみますか?
A:本機圧縮の保真モードではにじみません。要点は下層の版式構造に手を触れず、冗長データだけを最適化することです。格納前にご自身で一度検印を通すことをお勧めする。

Q:スキャン文書を圧縮したあと、大規模言語モデルへ渡せますか?
A:渡せます。画像系コンテンツはGPT-4o基準でトークンコストを85.9%削減でき、文書が小さくなれば抽出や質問応答の呼び出し負荷も下がる。

Q:MagiFilerとSmartSlimは一緒に買う必要がありますか?
A:必要ありません。一方は圧縮を、他方は整理を担い、抱える課題で選べばよい。アーカイブの場面では両者が組み合わされることも多いが、料金はそれぞれ独立している。

Q:データは内網を出ますか?
A:いずれも本機で動き、ファイルは端末から出ない。13種類のAI機微情報検出もローカルで完結する。

Q:サブスクリプションと買い切りはどう使い分けますか?
A:長期かつ高頻度で継続更新を求めるならサブスクリプション(SmartSlimは月額20.4元から)。一度の買い切りで複数端末を自用するなら買い切り(MagiFiler)が向く。