핵심 역량
8대 역량이 유기적으로 연결되어 문서가 지식이 되는 모든 과정을 커버합니다
1. 고정밀 파싱
6대 포맷 통합 진입점, 스캔 문서도 읽고, 표는 무너지지 않음
기업 문서의 포맷은 제각각이라 지식 베이스 구축의 첫 번째 관문입니다. 기반에는 DeepDoc 레이아웃 분석(레이아웃 + 표 구조 인식 이중 ONNX 모델, 로컬 추론)이 내장되어 있어 PDF, Word, Excel, PPT, OFD, XPS 6대 포맷을 구조화된 데이터로 통합 파싱하고, 제목 계층, 단락, 표의 행렬 관계(병합 셀 포함)와 읽기 순서를 보존합니다; 스캔 문서는 자동 OCR 인식됩니다.
2. 문서 정제
머리글·바닥글, 워터마크 같은 '노이즈'를 지식 베이스 밖으로 차단
머리글·바닥글, 페이지 번호, 워터마크, 중복 콘텐츠——이것들은 사람에게는 배경 소음이지만 AI에게는 오염원입니다: 답변에 갑자기 페이지 번호가 튀어나오고, 검색이 중복 문서에 방해받습니다. 기반은 파싱 후 이러한 노이즈를 자동으로 표시하고 정제하며, 동시에 정제 보고서를 회신합니다——무엇을 처리했고 무엇을 삭제했는지 모두 근거가 있습니다.
3. AI 지능형 마스킹
13개 카테고리 민감 정보, 입고 전 자동 마스킹
문서 내장 이미지 속 얼굴, 신분증, 공인, 차량 번호판, QR 코드 등은 지식 베이스에 바로 들어가면 중대한 유출 위험이 됩니다. 기반은 압축 엔진의 AI 특징 보호 검출기를 재사용하여 입고 전 민감 영역에 자동으로 가우시안 블러/모자이크 처리를 적용하고 마스킹 보고서를 출력합니다——각 이미지에서 무엇을 검출했고 어디를 처리했는지 감사 시 완전히 명확합니다.
4. 고성능 압축
한 번의 처리, 이중 산출: 더 작은 파일 + 더 깨끗한 지식
압축은 UGLYPEAR의 간판 기술입니다. 이미지, 오디오/비디오, PDF, Office, OFD, XPS, 텍스트 40+ 포맷을 전부 커버하며, 평균 압축률 60%, 최고 80%입니다. SSIM/PSNR 이중 지표 품질 게이팅으로 '작게 압축'이 '흐리게 압축'과 같지 않음을 보장합니다. AI 애플리케이션의 경우 이미지 압축은 곧 멀티모달 추론 토큰 비용 감소를 의미합니다——실측 GPT-4o 기준 85.9% 절감.
5. 지능형 청킹
문서마다 다른 분할 방식——의미가 끊기지 않아야 검색이 정확합니다
고정 길이 분할은 업계에서 가장 흔히 저지르는 실수입니다: 한 문장이 중간에 잘리고, AI는 반쪽짜리 정보를 검색해 억지로 추측할 수밖에 없습니다. 기반은 문서 유형에 따라 청킹 전략을 선택하며, 4세트의 사전 설정 파라미터가 내장되어 있어 비즈니스에 따라 미세 조정할 수 있습니다:
| 문서 유형 | 청킹 전략 | 특수 처리 |
|---|---|---|
| 규정/계약서 | 조항별 분할 | 조건과 결론 분리 불가 |
| 기술 매뉴얼 | 챕터+소절별 | 모델/사양/적용 범위 동일 블록 |
| FAQ | 1문 1답 | 질문과 답변 결합 |
| 표 자료 | 행 그룹별 분할 | 표 머리글 반복, 행렬 관계 보존 |
| PPT | 페이지별 | 제목+본문+비고 함께 |
| 긴 보고서 | 부모-자식 이중 계층 | 자식 블록 검색, 부모 블록 생성 |
6. 메타데이터와 라이프사이클
모든 지식 포인트에 '신분증'이 따라오고, 만료 지식은 자동 퇴장
청킹이 완료되면 각 지식 포인트에 문서 제목, 챕터 경로, 게시 시간, 버전 번호, 발행 부서 등 메타데이터가 자동으로 연결되며, 4단계 콘텐츠 증강(브레드크럼 내비게이션, 키워드, 요약, 가설적 질문)이 수행됩니다. 문서가 업데이트되면 증분 처리가 진행됩니다: 새 버전은 자동 입고, 구버전은 자동 강등 및 만료 표시되며, 콘텐츠 해시로 동일 문서의 중복 입고를 방지합니다.
7. 권한 태깅
누가 어떤 지식을 보는지 지식 포인트 수준까지 관리
급여 규정은 HR과 경영진만 조회할 수 있고, 기술 문서는 부서별로 격리됩니다. 기반은 모든 지식 포인트에 부서, 직무, 역할, 지역, 보안 등급 태그를 연결할 수 있으며, 검색 시 권한을 먼저 필터링한 후 리콜합니다——권한 검증은 데이터 계층에서 완료되며 애플리케이션 계층의 자율성에 의존하지 않습니다. 멀티테넌트 체계는 고객/사업부별 지식 베이스를 자연스럽게 격리합니다.
8. 3계층 평가
지식 베이스의 좋고 나쁨은 숫자로 말하고, 나쁜 답변은 책임을 추적할 수 있습니다
지식 베이스는 구축했다고 끝이 아닙니다. 기반에는 3계층 평가 체계가 내장되어 있습니다: 코퍼스 계층(파싱 완전도, 표 구조율, OCR 정밀도, 마스킹 커버리지), 검색 계층(HitRate@K, Recall@K, MRR, NDCG@K), 생성 계층(충실도, 답변 관련성, 컨텍스트 정밀도). 사용자가 '싫어요'를 누르면 자동으로 원인을 규명합니다: 문제가 청킹, 정제, 마스킹, 메타데이터 중 어디에 있는지 한 번 조회하면 알 수 있으며, badcase는 자동으로 평가 세트에 환류됩니다.