결론부터: 스캔본 PDF가 너무 큰 근본 원인은 고DPI 스캔과 무손실 비트맵 포맷이 전체 용적의 90% 이상을 차지하기 때문입니다. 해결 방법은 3단계로 진행합니다. DPI를 150으로 낮추고, BMP/무손실 포맷을 JPEG 품질 75로 변환하며, OCR 텍스트 레이어를 추가합니다. 120페이지 컬러 계약서 스캔본을 이 절차로 압축하면 95MB에서 3.2MB로 줄어들며, 텍스트는 선명하게 식별 가능하고 복사 및 검색도 가능합니다. 아래에서는 용적 발생 원인부터 설명하고, 3단계 방법의 파라미터를 자세히 다루며, 흑백/그레이스케일/컬러 스캔본의 차별화된 전략을 함께 다룹니다.
PDF 압축의 전체 원리에 아직 익숙하지 않다면, 먼저 PDF 압축 원리와 방법 상세 설명을 읽어 보길 권합니다.
1. 스캔본 PDF가 왜 그렇게 큰가
스캔본 PDF는 본질적으로 스캐너가 생성한 비트맵을 페이지별로 PDF 컨테이너에 내장한 것입니다. 전자 생성 PDF와 달리, 스캔본의 각 페이지는 완전한 이미지 한 장이므로 용적이 이미지에 의해 전적으로 결정됩니다. 용적 발생 원리를 이해해야 정확히 압축할 수 있습니다.
| 용적 발생원 | 전형적 비율 | 원인 | 압축 여지 |
|---|---|---|---|
| 고DPI 스캔 | 50%–65% | 300/600DPI 스캔, 픽셀이 읽기 요구량 초과 | ★★★★★ |
| 무손실 비트맵 포맷 | 20%–35% | BMP/무압축 TIFF/FlateDecode, 손실 압축 없음 | ★★★★★ |
| 컬러 모드 낭비 | 5%–15% | 순수 텍스트에 24비트 컬러 사용, 1비트 흑백 미사용 | ★★★★☆ |
| 다페이지 누적 | 5%–10% | 페이지 수 많음, 중복 누적 | ★★★☆☆ |
| PDF 구조 오버헤드 | 1%–3% | 페이지 객체, 교차 참조 테이블 등 | ★☆☆☆☆ |
위 표에서 보듯이 고DPI와 무손실 포맷이 합쳐서 80% 이상을 차지하므로 압축의 주된 전장입니다. 120페이지 300DPI 컬러 스캔본은 페이지당 약 0.8MB로 총 95MB이지만, 화면 읽기에는 150DPI만 필요하고 JPEG로 변환하면 페이지당 0.027MB로 줄어 총 3.2MB면 충분합니다.
2. 3단계 압축 방법 상세
스캔본 PDF의 용적 발생원에 맞춰 3단계 표준 압축 방법이 있습니다. 각 단계의 원리, 적용 시나리오, 효과가 다르므로, 아래 표에서 전체 비교를 먼저 확인한 후 하나씩 자세히 설명합니다.
| 단계 | 방법 | 원리 | 예상 압축률 | 선명도 영향 |
|---|---|---|---|---|
| 1 | DPI 축소 | 픽셀 밀도 감소 | 50%–75% | 화면 읽기에서 거의 차이 없음 |
| 2 | 포맷 변환 | BMP/TIFF→JPEG | 80%–95% | 품질 75에서 육안으로 허용 |
| 3 | OCR 텍스트 레이어 | 검색 가능 텍스트 생성 | 용적+5%–10% | 가용성 향상 |
2.1 DPI 축소(수익 최고)
DPI(인치당 도트 수)는 스캔본의 픽셀 밀도를 결정합니다. 스캐너 기본값은 300DPI 내지 600DPI이지만, 화면 읽기에는 96–150DPI만 필요하고 인쇄에도 200–300DPI면 충분합니다. 600DPI를 150DPI로 낮추면 픽셀 수가 원래의 1/16로 줄어들어 용적이 즉시 94% 감소합니다. 200DPI로 낮춰도 89% 감소합니다.
구체적 조작: SmartSlim으로 스캔본 PDF를 열어, Rust 압축 엔진이 페이지별로 이미지를 분석하고 스캔 유형에 따라 최적 DPI를 자동 선택합니다. 순수 흑백 텍스트는 200DPI, 그레이스케일은 150DPI, 컬러는 150DPI로 축소. 다운샘플링은 Lanczos 알고리즘을 사용하여 가장자리를 선명하게 유지하며, 단순 스케일링으로 인한 텍스트 흐릿함을 피합니다.
| 스캔 유형 | 원본 DPI | 권장 DPI | 픽셀 감소율 | 가독성 |
|---|---|---|---|---|
| 흑백 텍스트 | 300 | 200 | 56% | 선명 식별 가능 |
| 흑백 텍스트 | 600 | 200 | 89% | 선명 식별 가능 |
| 그레이스케일 텍스트 | 300 | 150 | 75% | 선명 식별 가능 |
| 컬러 문서 | 300 | 150 | 75% | 색감 약간 옅어 허용 |
| 컬러 사진 페이지 | 600 | 200 | 89% | 디테일 약간 손실 |
DPI와 PPI의 상세한 차이는 DPI vs PPI: 스캔 및 인쇄 해상도 상세 설명을 참고하시기 바랍니다.
2.2 포맷 변환(감소율 최고)
스캔본 PDF의 이미지는 보통 세 가지 인코딩을 사용합니다. FlateDecode(PNG의 무손실 압축), CCITT G4(흑백 팩스 표준), DCTDecode(JPEG). 많은 스캐너가 기본값으로 FlateDecode를 사용하거나 아예 압축하지 않아(BMP) 용적이 거대합니다. JPEG 품질 75로 변환하면 80%–95% 용적을 줄일 수 있습니다.
흑백 스캔본에는 더 우월한 선택이 있습니다. JBIG2 인코딩. JBIG2는 흑백 텍스트 전용으로 설계된 인코딩으로, 반복되는 글자 형태를 식별해 템플릿 매칭하므로 CCITT G4보다 50%–70% 더 작습니다. 100페이지 흑백 계약서 한 건의 경우, FlateDecode는 약 40MB, CCITT G4는 약 8MB, JBIG2는 2MB에 불과합니다. SmartSlim은 흑백 스캔본을 자동 감지하여 JBIG2 인코딩을 활성화합니다.
| 인코딩 방식 | 적용 유형 | 100페이지 용적 | FlateDecode 대비 |
|---|---|---|---|
| FlateDecode(무손실) | 범용 | 40MB | 기준 |
| CCITT G4 | 흑백 | 8MB | -80% |
| JBIG2 | 흑백 | 2MB | -95% |
| JPEG q75 | 그레이스케일/컬러 | 3.5MB | -91% |
| JPEG q85 | 그레이스케일/컬러 | 5.2MB | -87% |
2.3 OCR 텍스트 레이어(가용성 향상)
스캔본 PDF는 기본적으로 이미지로, 검색하거나 복사할 수 없습니다. OCR(광학 문자 인식)은 이미지 위에 투명한 텍스트 레이어를 중첩하여 스캔본을 검색·복사 가능한 문서로 변환합니다. OCR 텍스트 레이어 자체는 5%–10%만 용적을 증가시키지만, 가용성을 크게 향상시킵니다.
OCR의 추가 이점은 압축 보조입니다. 텍스트 레이어가 있으면 이미지 레이어를 더 낮은 DPI(예: 100DPI)로 낮출 수 있는데, 이미지가 흐릿하더라도 텍스트 레이어를 통해 텍스트를 검색하고 복사할 수 있기 때문입니다. SmartSlim은 OCR 기능을 통합하여, 압축과 동시에 자동으로 텍스트 레이어를 생성하며, 중영문 혼합 인식을 지원하고 정확률 95% 이상입니다.
3. 실전 사례: 120페이지 계약서 스캔본을 95MB에서 3.2MB로
이는 어느 한 기업의 구매 계약서로, .pdf 포맷이며 원본 용적이 95.4MB입니다. 120페이지 A4, 300DPI 컬러 스캔, FlateDecode 무손실 인코딩. 전자 계약 플랫폼(10MB 제한)에 업로드해야 하며, 5MB 이내로 압축하는 것이 목표입니다.
문서 특징: 120페이지 A4 컬러 스캔, 300DPI(페이지당 2480×3508 픽셀), FlateDecode 인코딩, 페이지당 약 0.8MB, OCR 텍스트 레이어 없음.
실행 파라미터와 용적 변화:
| 단계 | 조작 | 핵심 파라미터 | 용적 변화 |
|---|---|---|---|
| 1 | DPI 축소 | 300DPI→150DPI, Lanczos 다운샘플링 | 95.4→28.6MB |
| 2 | 컬러를 그레이스케일로 | 계약은 순수 텍스트, 24비트 컬러→8비트 그레이스케일 | 28.6→12.4MB |
| 3 | JPEG 인코딩 | FlateDecode→JPEG q75 | 12.4→3.0MB |
| 4 | OCR 텍스트 레이어 | 중영문 인식, 투명 텍스트 중첩 | 3.0→3.2MB |
결과: 3.2MB, 압축비 약 29.8:1, 압축률 96.6%. 플랫폼 10MB 제한보다 한참 낮습니다. 텍스트는 화면에서 선명하게 식별 가능하며, 150DPI 인쇄 효과 양호, 키워드 전체 검색 가능, 조항 텍스트 복사 가능. 전체 절차가 로컬에서 완료되어 계약 내용이 어떠한 제3자 서버를 거치지 않으므로 비즈니스 계약의 기밀 요건을 충족합니다.
4. 흑백/그레이스케일/컬러 스캔본의 차별화된 전략
색상 모드가 다른 스캔본은 최적의 압축 전략이 다릅니다. 아래 표에 세 가지 유형의 스캔본에 대한 비교 권장안을 제시합니다.
| 스캔 유형 | 전형적 시나리오 | 권장 DPI | 권장 인코딩 | 예상 압축률 |
|---|---|---|---|---|
| 흑백(1비트) | 순수 텍스트 계약/공문 | 200 | JBIG2 | 95%–98% |
| 그레이스케일(8비트) | 인장/수기 서명 포함 | 150 | JPEG q75 | 90%–95% |
| 컬러(24비트) | 컬러 문서/사진 페이지 | 150 | JPEG q72 | 85%–93% |
| 혼합 | 계약+첨부 컬러 페이지 | 페이지별 처리 | 페이지별 선택 | 90%–96% |
범용 원칙: 순수 텍스트는 흑백+JBIG2를 우선 사용(압축률 최고), 인장 포함은 그레이스케일+JPEG, 순수 컬러 페이지는 컬러+JPEG. SmartSlim은 페이지별로 색상 복잡도를 분석하고 자동으로 최적 인코딩을 선택합니다. 텍스트 페이지는 흑백 JBIG2, 인장 페이지는 그레이스케일 JPEG, 컬러 페이지는 컬러 JPEG로, 일률적 처리를 피합니다. 스캔본이 메일 발송이 안 되는 문제도 겪고 있다면, PDF가 너무 커서 메일 발송이 안 되면? 3단계로 5MB 이내로 압축을 참고하시기 바랍니다.
5. 자주 묻는 질문 FAQ
Q1: 스캔본 PDF가 너무 클 때 5MB 이내로 압축하려면?
3단계 절차로 조작합니다. DPI를 150으로 낮추고, BMP/무손실 포맷을 JPEG 품질 75로 변환하며, OCR 텍스트 레이어를 추가. 120페이지 컬러 계약서 스캔본은 95MB에서 3.2MB로 압축되며, 텍스트는 선명하게 식별 가능하고 복사 및 검색이 가능합니다. 핵심은 먼저 DPI를 낮추고(가장 큰 비중), 그 다음 JPEG 포맷으로 변환하며, 마지막에 OCR 텍스트 레이어를 추가해 가용성을 높이는 순서입니다. 흑백 스캔본은 JBIG2 인코딩을 추가로 사용할 수 있어 용적이 더 작아집니다.
Q2: 스캔본 PDF의 DPI를 낮추니 텍스트가 안 보이면 어떻게 하나요?
순수 텍스트 스캔본의 경우 150DPI면 화면 읽기와 인쇄에 충분히 선명하며, 100DPI로 낮춰도 식별 가능합니다. 텍스트가 안 보인다면 스캔 원본 자체가 흐릿하거나 DPI를 너무 낮춘 것이 원인일 가능성이 큽니다. 흑백 텍스트는 200DPI, 그레이스케일 텍스트는 150DPI, 컬러 스캔본은 150DPI 사용을 권장합니다. 추가로 선명화 필터를 적용해 텍스트 가장자리를 강화할 수 있습니다. SmartSlim은 스캔 유형을 자동 식별하여 DPI를 분배하므로, 일률적 처리로 인한 흐릿함을 피합니다.
Q3: 흑백 스캔본과 컬러 스캔본의 압축 방법은 동일한가요?
동일하지 않습니다. 흑백 스캔본은 JBIG2 인코딩 사용을 권장하며(CCITT G4보다 50%–70% 더 작음), DPI는 200까지 낮춰도 선명합니다. 그레이스케일 스캔본은 JPEG 품질 75로 변환, DPI 150. 컬러 스캔본은 JPEG 품질 72로 변환, DPI 150, 컬러 정보 손실은 허용 가능. 흑백이 압축률이 가장 높고(98%까지), 컬러는 약 90%–95%입니다. SmartSlim은 스캔본의 색상 모드에 따라 최적 인코딩을 자동 선택합니다.
Q4: 스캔본 PDF에 OCR 텍스트 레이어를 추가하면 어떤 이점이 있나요?
OCR 텍스트 레이어는 스캔본을 이미지에서 검색·복사 가능한 문서로 변화시킵니다. 이점은 세 가지입니다. 첫째, 키워드 전체 검색이 가능해 페이지를 하나씩 뒤질 필요가 없습니다. 둘째, 텍스트를 다른 문서로 복사할 수 있습니다. 셋째, 압축을 보조합니다. 텍스트 레이어가 있으면 이미지 레이어를 더 낮은 DPI로 낮춰도 텍스트 레이어를 통해 내용을 검색할 수 있습니다. OCR 텍스트 레이어 자체는 5%–10%만 용적을 증가시키지만, 문서의 가용성을 크게 향상시킵니다. SmartSlim은 OCR 기능을 통합하여, 압축과 동시에 텍스트 레이어를 자동 생성합니다.
결론
스캔본 PDF가 너무 큰 근본 원인은 고DPI 스캔과 무손실 비트맵 포맷이 전체 용적의 80% 이상을 차지하기 때문입니다. 해법은 3단계의 맞춤형 압축입니다. DPI 축소는 수익이 가장 크고(300→150DPI, 50%–75% 감소), 포맷 변환은 감소율이 가장 크며(BMP→JPEG q75, 80%–95% 감소, 흑백은 JBIG2로 98%까지), OCR 텍스트 레이어는 가용성을 향상시킵니다(5%–10% 용적 증가로 검색·복사 가능). 3단계를 조합하면 120페이지 컬러 계약을 95MB에서 안정적으로 3.2MB로 압축할 수 있습니다.
세 가지 사항을 기억하세요. 첫째, 색상 모드에 따라 인코딩을 선택하라. 흑백은 JBIG2, 그레이스케일/컬러는 JPEG, 일률적 처리를 피하라. 둘째, 150DPI가 스캔본 압축의 황금 균형점이며, 화면 읽기와 인쇄 모두에 적합합니다. 셋째, 계약 등 민감 파일은 로컬 압축을 사용하고, 온라인 도구로 업로드하지 마라. 올바른 도구와 방법을 선택하면 스캔본 PDF 감량은 사실 매우 간단합니다.
파일을 압축해야 합니까? SmartSlim을 시도해 보세요
자체 개발한 Rust 압축 엔진 기반, PDF/이미지/영상/Office/OFD 등 10대 40+ 포맷 지원, 로컬 압축으로 데이터가 외부로 유출되지 않습니다.