結論先行:スキャンPDFが大きすぎる根本原因は、高DPIスキャンと未圧縮のビットマップ形式がサイズの90%以上を占めていることにあります。解決策は3ステップ:DPIを150に下げる、BMP/可逆形式をJPEG品質75に変換する、OCRテキストレイヤーを追加する。120ページのカラー契約書スキャンは、このフローで95MBから3.2MBに圧縮でき、文字は鮮明に識別でき、コピー・検索が可能です。以下では、まずサイズ増大の原因から説明し、3ステップ方法のパラメータを詳解し、白黒/グレースケール/カラースキャンの差別化戦略をカバーします。
PDF圧縮の全体原理にまだ馴染みがない場合は、まずPDF圧縮の原理と方法を詳解。
1. スキャンPDFはなぜこんなに大きいのか
スキャンPDFは本質的にスキャナーが生成したビットマップをページごとにPDFコンテナに埋め込んだものです。電子的に生成されたPDFとは異なり、スキャンの各ページは完全な1枚の画像であり、サイズは完全に画像によって決まります。サイズの原因を理解することこそが、的確な圧縮の鍵です。
| サイズの原因 | 典型的な割合 | 要因 | 圧縮余地 |
|---|---|---|---|
| 高DPIスキャン | 50%–65% | 300/600DPIスキャン、ピクセルが閲覧要件を大幅に超過 | ★★★★★ |
| 可逆ビットマップ形式 | 20%–35% | BMP/未圧縮TIFF/FlateDecode、非可逆圧縮なし | ★★★★★ |
| カラーモードの無駄 | 5%–15% | 純テキストに1ビット白黒ではなく24ビットカラーを使用 | ★★★★☆ |
| 複数ページの蓄積 | 5%–10% | ページ数が多く、各ページの冗長が積み重なる | ★★★☆☆ |
| PDF構造オーバーヘッド | 1%–3% | ページオブジェクト、クロスリファレンステーブル等 | ★☆☆☆☆ |
上の表から分かるように、高DPIと可逆形式を合わせると80%以上を占め、圧縮の主戦場となります。120ページ300DPIのカラースキャンは、1ページ約0.8MB、合計95MBです — しかし画面閲覧には150DPIで十分で、JPEGに変換後は1ページ0.027MBまで下がり、合計3.2MBで十分です。
2. 3ステップ圧縮方法の詳解
スキャンPDFのサイズ原因に基づき、3ステップの標準化圧縮方法があります。各ステップの原理、適用シナリオ、効果が異なります。下の表で全体比較を行い、その後詳しく解説します。
| ステップ | 方法 | 原理 | 期待圧縮率 | 鮮明度への影響 |
|---|---|---|---|---|
| 1 | DPI削減 | ピクセル密度の削減 | 50%–75% | 画面閲覧ではほぼ差なし |
| 2 | 形式変換 | BMP/TIFF→JPEG | 80%–95% | 品質75は肉眼で許容範囲 |
| 3 | OCRテキストレイヤー | 検索可能テキストを生成 | サイズ+5%〜10% | 可用性の向上 |
1. DPI削減(効果最大)
DPI(1インチあたりのドット数)はスキャンのピクセル密度を決定します。スキャナーのデフォルトは300DPIさらには600DPIですが、画面閲覧には96〜150DPIで十分で、印刷でも200〜300DPIあれば十分です。600DPIを150DPIに下げると、ピクセル数は元の1/16になり、サイズは直接94%削減されます。200DPIに下げても89%削減できます。
具体的な操作:SmartSlimでスキャンPDFを開くと、Rust圧縮エンジンがページごとに画像を分析し、スキャンの種類に応じて最適なDPIを自動的に選択します — 純テキスト白黒は200DPIに、グレースケールは150DPIに、カラーは150DPIに下げます。ダウンサンプリングにはLanczosアルゴリズムを使用してエッジのシャープさを保ち、単純なスケーリングによる文字のぼやけを防ぎます。
| スキャンの種類 | 元のDPI | 推奨DPI | ピクセル削減率 | 可読性 |
|---|---|---|---|---|
| 白黒テキスト | 300 | 200 | 56% | 鮮明に識別可能 |
| 白黒テキスト | 600 | 200 | 89% | 鮮明に識別可能 |
| グレースケールテキスト | 300 | 150 | 75% | 鮮明に識別可能 |
| カラードキュメント | 300 | 150 | 75% | 色がやや薄いが許容範囲 |
| カラー写真ページ | 600 | 200 | 89% | ディテールがやや劣化 |
DPIとPPIの詳細な違いについては、DPI vs PPI:スキャンと印刷の解像度を詳解。
2. 形式変換(削減幅最大)
スキャンPDF内の画像は一般的的に3つのエンコードを使用します:FlateDecode(PNGの可逆圧縮)、CCITT G4(白黒FAX標準)、DCTDecode(JPEG)。多くのスキャナーはデフォルトでFlateDecodeを使用するか、圧縮せず(BMP)にするため、サイズが巨大になります。JPEG品質75に変換すると、80%〜95%のサイズを削減できます。
白黒スキャンにはより良い選択肢があります — JBIG2エンコード。JBIG2は白黒テキスト専用に設計されたエンコードで、繰り返し文字パターンをテンプレートマッチングにより識別し、CCITT G4よりさらに50%–70%小さくなります。100ページの白黒契約書の場合、FlateDecodeで約40MB、CCITT G4で約8MB、JBIG2ではわずか2MBです。SmartSlimは白黒スキャンを自動的に検出し、JBIG2エンコードを有効にします。
| エンコード方式 | 適用タイプ | 100ページのサイズ | FlateDecode比 |
|---|---|---|---|
| FlateDecode(可逆) | 汎用 | 40MB | 基準 |
| CCITT G4 | 白黒 | 8MB | -80% |
| JBIG2 | 白黒 | 2MB | -95% |
| JPEG q75 | グレースケール/カラー | 3.5MB | -91% |
| JPEG q85 | グレースケール/カラー | 5.2MB | -87% |
3. OCRテキストレイヤー(可用性の向上)
スキャンPDFはデフォルトで画像であり、検索もコピーもできません。OCR(光学式文字認識)は画像の上に透明なテキストレイヤーを重ね、スキャンを検索・コピー可能なドキュメントにします。OCRテキストレイヤー自体は5%–10%のサイズ増加にとどまりますが、可用性を大幅に向上させます。
OCRの追加のメリットは圧縮の補助です — テキストレイヤーがあれば、画像レイヤーをより低いDPI(100DPIなど)まで下げることができます。画像がぼやけても、テキストレイヤーで文字を検索・コピーできるからです。SmartSlimはOCR機能を統合しており、圧縮と同時にテキストレイヤーを自動生成し、中英混合認識をサポートし、認識精度は95%以上です。
3. 実践事例:120ページの契約書スキャンを95MBから3.2MBに圧縮
これは企業の調達契約書で、.pdf形式、元のサイズ95.4MBです。120ページA4、300DPIカラースキャン、FlateDecode可逆エンコード使用。電子署名プラットフォームにアップロードする必要があり(10MB制限)、5MB以下が目標です。
ドキュメント特徴: 120ページA4カラースキャン、300DPI(1ページあたり2480×3508ピクセル)、FlateDecodeエンコード、1ページあたり約0.8MB、OCRテキストレイヤーなし。
実行パラメータとサイズ変化:
| ステップ | 操作 | 主なパラメータ | サイズ変化 |
|---|---|---|---|
| 1 | DPI削減 | 300DPI→150DPI, Lanczosダウンサンプリング | 95.4→28.6MB |
| 2 | カラー→グレースケール | 契約書は純テキスト、24ビットカラー→8ビットグレースケール | 28.6→12.4MB |
| 3 | JPEGエンコード | FlateDecode→JPEG q75 | 12.4→3.0MB |
| 4 | OCRテキストレイヤー | 中英認識、透明テキストを重ねる | 3.0→3.2MB |
結果: 3.2MB、圧縮比約29.8:1、圧縮率96.6%。プラットフォームの10MB制限をはるかに下回りました。文字は画面上で鮮明に識別可能で、150DPIの印刷効果も良好、キーワードの全文検索が可能で、条項のテキストをコピーできます。全プロセスはローカルで完結し、契約コンテンツはサードパーティのサーバーを一切経由せず、ビジネス契約の機密保持要件を満たしています。
4. 白黒/グレースケール/カラースキャンの差別化戦略
異なるカラーモードのスキャンは、最適な圧縮戦略が異なります。下の表は3種類のスキャンの比較推奨事項です。
| スキャンの種類 | 典型的なシナリオ | 推奨DPI | 推奨エンコード | 期待圧縮率 |
|---|---|---|---|---|
| 白黒(1位) | 純テキスト契約書/公文書 | 200 | JBIG2 | 95%–98% |
| グレースケール(8ビット) | 署名/手書き文書 | 150 | JPEG q75 | 90%–95% |
| カラー(24ビット) | カラードキュメント/写真ページ | 150 | JPEG q72 | 85%–93% |
| 混合 | 契約書+添付カラーページ | ページ別処理 | ページ別選択 | 90%–96% |
一般的的な原則:純テキストは白黒+JBIG2を優先(圧縮率最大)、署名入りはグレースケール+JPEG、純カラーのみカラー+JPEG。SmartSlimはページごとに色彩複雑度を分析し、ページ別に最適なエンコードを自動選択 — テキストページは白黒JBIG2、署名ページはグレースケールJPEG、カラーページはカラーJPEGに変換し、画一化を防ぎます。スキャンファイルがメールで送信できない問題にお悩みの場合は、PDFが大きすぎてメールで送信できない場合の対処法?3ステップで5MB以下に圧縮。
5. よくある質問(FAQ)
Q1:スキャンPDFが大きすぎる場合、5MB以下に圧縮するには?
3ステップのフローで操作します:DPIを150に下げる、BMP/可逆形式をJPEG品質75に変換する、OCRテキストレイヤーを追加する。120ページのカラー契約書スキャンは95MBから3.2MBに圧縮でき、文字は鮮明に識別でき、コピー・検索が可能です。重要なのは、まずDPIを下げ(割合が最大)、次にJPEG形式に変換し、最後にOCRテキストレイヤーを追加して可用性を向上させることです。白黒スキャンはさらにJBIG2エンコードを使用すると、さらに小さくなります。
Q2:スキャンPDFのDPIを下げた後、文字が見えにくい場合はどうすればいいですか?
純テキストのスキャンは150DPIで十分に鮮明に読めて印刷も可能で、100DPIまで下げてもまだ識別できます。文字が見えにくい場合、多くはスキャン原本自体がぼやけているか、DPIを下げすぎたことが原因です。白黒テキストには200DPI、グレースケールテキストには150DPI、カラースキャンには150DPIを推奨します。また、シャープフィルターを追加して文字のエッジを強調できます。SmartSlimはスキャンの種類を自動的に識別してDPIを割り当て、画一化によるぼやけを防ぎます。
Q3:白黒スキャンとカラースキャンの圧縮方法は同じですか?
同じではありません。白黒スキャンにはJBIG2エンコードを推奨します(CCITT G4よりさらに50%〜70%小さい)。DPIは200まで下げても鮮明です。グレースケールスキャンはJPEG品質75、DPI 150に変換。カラースキャンはJPEG品質72、DPI 150に変換し、カラー情報の損失は許容範囲です。白黒スキャンの圧縮率が最も高く(98%に達可能)、カラースキャンの圧縮率は約90%〜95%です。SmartSlimはスキャンのカラーモードに応じて最適なエンコードを自動的に選択します。
Q4:スキャンPDFにOCRテキストレイヤーを追加するメリットは何ですか?
OCRテキストレイヤーにより、スキャンが画像から検索・コピー可能なドキュメントになります。メリットは3つ:第一に、キーワードの全文検索が可能になり、ページごとに探す必要がない。第二に、テキストを他のドキュメントにコピーできる。第三に、圧縮を補助する — テキストレイヤーがあれば、画像レイヤーをより低いDPIまで下げても、テキストレイヤーでコンテンツを検索できます。OCRテキストレイヤー自体は5%〜10%のサイズ増加ですが、ドキュメントの可用性を大幅に向上させます。SmartSlimはOCR機能を統合しており、圧縮と同時にテキストレイヤーを自動生成します。
まとめ
扫描件PDF太大,根因是高DPIスキャン和可逆ビットマップ形式占了80%以上サイズ。解法である是三步に対して症圧縮:DPI削減効果最大(300→150DPI,50%–75%降幅),形式変換削減幅最大(BMP→JPEG q75,80%–95%降幅;白黒用JBIG2可达98%),OCRテキストレイヤー可用性の向上(+5%–10%サイズ换可搜索可复制)。三步叠加,120页彩色合同から95MB稳定压到3.2MB。
3つのポイントを覚えておいてください:第一に、カラーモードに応じてエンコードを選ぶ — 白黒はJBIG2、グレースケール/カラーはJPEG — 画一化を避ける;第二に、150DPIがスキャン圧縮の黄金バランスポイントで、画面閲覧も印刷も十分;第三に、契約書などの機密ファイルはローカル圧縮を使用し、オンラインツールにアップロードしない。正しいツールと方法を選べば、スキャンPDFのスリム化は実はとてもシンプルです。