UGLYPEAR AI 사업 전환 완료: 고성능 문서 압축 × RAG 데이터 엔지니어링 기반신규 사업 알아보기 →

핵심 역량

8대 역량이 유기적으로 연결되어 문서가 지식이 되는 모든 과정을 커버합니다

1. 고정밀 파싱

6대 포맷 통합 진입점, 스캔 문서도 읽고, 표는 무너지지 않음

기업 문서의 포맷은 제각각이라 지식 베이스 구축의 첫 번째 관문입니다. 기반에는 DeepDoc 레이아웃 분석(레이아웃 + 표 구조 인식 이중 ONNX 모델, 로컬 추론)이 내장되어 있어 PDF, Word, Excel, PPT, OFD, XPS 6대 포맷을 구조화된 데이터로 통합 파싱하고, 제목 계층, 단락, 표의 행렬 관계(병합 셀 포함)와 읽기 순서를 보존합니다; 스캔 문서는 자동 OCR 인식됩니다.

6종포맷 통합 파싱
듀얼 모델레이아웃+표 구조 인식
자동 OCR스캔 문서 자동 인식
0.9243계층 파싱 품질검사 실측 총점
// 파싱 출력 예시(발췌) { "title": '제품 기술 매뉴얼 V3.2', "elements": [ { "type": "heading", "level": 1, "text": '제1장 제품 개요' }, { "type": "table", "headers": ['모델명','전력','전압'], "rows": [["A100","500W","220V"]] }, { "type": "image", "description": '제품 외관도' } ] }

2. 문서 정제

머리글·바닥글, 워터마크 같은 '노이즈'를 지식 베이스 밖으로 차단

머리글·바닥글, 페이지 번호, 워터마크, 중복 콘텐츠——이것들은 사람에게는 배경 소음이지만 AI에게는 오염원입니다: 답변에 갑자기 페이지 번호가 튀어나오고, 검색이 중복 문서에 방해받습니다. 기반은 파싱 후 이러한 노이즈를 자동으로 표시하고 정제하며, 동시에 정제 보고서를 회신합니다——무엇을 처리했고 무엇을 삭제했는지 모두 근거가 있습니다.

머리글/바닥글/페이지 번호자동 표시 제거
워터마크 검출AI 검출기 재사용
중복 문서콘텐츠 해시 중복 제거
정제 보고서모든 단계 기록

3. AI 지능형 마스킹

13개 카테고리 민감 정보, 입고 전 자동 마스킹

문서 내장 이미지 속 얼굴, 신분증, 공인, 차량 번호판, QR 코드 등은 지식 베이스에 바로 들어가면 중대한 유출 위험이 됩니다. 기반은 압축 엔진의 AI 특징 보호 검출기를 재사용하여 입고 전 민감 영역에 자동으로 가우시안 블러/모자이크 처리를 적용하고 마스킹 보고서를 출력합니다——각 이미지에서 무엇을 검출했고 어디를 처리했는지 감사 시 완전히 명확합니다.

13개 카테고리민감 정보 검출기
얼굴/증명서자동 블러 마스킹
인장/서명영역 인식 처리
마스킹 보고서위치+방식 전체 기록

전체 데이터 보안 체계 보기 →

4. 고성능 압축

한 번의 처리, 이중 산출: 더 작은 파일 + 더 깨끗한 지식

압축은 UGLYPEAR의 간판 기술입니다. 이미지, 오디오/비디오, PDF, Office, OFD, XPS, 텍스트 40+ 포맷을 전부 커버하며, 평균 압축률 60%, 최고 80%입니다. SSIM/PSNR 이중 지표 품질 게이팅으로 '작게 압축'이 '흐리게 압축'과 같지 않음을 보장합니다. AI 애플리케이션의 경우 이미지 압축은 곧 멀티모달 추론 토큰 비용 감소를 의미합니다——실측 GPT-4o 기준 85.9% 절감.

60-80%평균 압축률
40+파일 포맷
SSIM≥0.92품질 게이팅
85.9%이미지 토큰 절감

SmartSlim 압축 제품군 알아보기 →

5. 지능형 청킹

문서마다 다른 분할 방식——의미가 끊기지 않아야 검색이 정확합니다

고정 길이 분할은 업계에서 가장 흔히 저지르는 실수입니다: 한 문장이 중간에 잘리고, AI는 반쪽짜리 정보를 검색해 억지로 추측할 수밖에 없습니다. 기반은 문서 유형에 따라 청킹 전략을 선택하며, 4세트의 사전 설정 파라미터가 내장되어 있어 비즈니스에 따라 미세 조정할 수 있습니다:

문서 유형 청킹 전략 특수 처리
규정/계약서조항별 분할조건과 결론 분리 불가
기술 매뉴얼챕터+소절별모델/사양/적용 범위 동일 블록
FAQ1문 1답질문과 답변 결합
표 자료행 그룹별 분할표 머리글 반복, 행렬 관계 보존
PPT페이지별제목+본문+비고 함께
긴 보고서부모-자식 이중 계층자식 블록 검색, 부모 블록 생성

6. 메타데이터와 라이프사이클

모든 지식 포인트에 '신분증'이 따라오고, 만료 지식은 자동 퇴장

청킹이 완료되면 각 지식 포인트에 문서 제목, 챕터 경로, 게시 시간, 버전 번호, 발행 부서 등 메타데이터가 자동으로 연결되며, 4단계 콘텐츠 증강(브레드크럼 내비게이션, 키워드, 요약, 가설적 질문)이 수행됩니다. 문서가 업데이트되면 증분 처리가 진행됩니다: 새 버전은 자동 입고, 구버전은 자동 강등 및 만료 표시되며, 콘텐츠 해시로 동일 문서의 중복 입고를 방지합니다.

4단계 증강브레드크럼/키워드/요약/HyDE
버전 관리다중 버전 아카이빙 및 롤백 가능
증분 업데이트변경 부분 자동 재청킹
시효 관리만료 지식 자동 강등

7. 권한 태깅

누가 어떤 지식을 보는지 지식 포인트 수준까지 관리

급여 규정은 HR과 경영진만 조회할 수 있고, 기술 문서는 부서별로 격리됩니다. 기반은 모든 지식 포인트에 부서, 직무, 역할, 지역, 보안 등급 태그를 연결할 수 있으며, 검색 시 권한을 먼저 필터링한 후 리콜합니다——권한 검증은 데이터 계층에서 완료되며 애플리케이션 계층의 자율성에 의존하지 않습니다. 멀티테넌트 체계는 고객/사업부별 지식 베이스를 자연스럽게 격리합니다.

지식 포인트 단위권한 태그 세분도
멀티테넌트데이터 자연 격리
리콜 전 단계 필터링먼저 필터링 후 리콜
필터 미리보기권한 효과 검증 가능

8. 3계층 평가

지식 베이스의 좋고 나쁨은 숫자로 말하고, 나쁜 답변은 책임을 추적할 수 있습니다

지식 베이스는 구축했다고 끝이 아닙니다. 기반에는 3계층 평가 체계가 내장되어 있습니다: 코퍼스 계층(파싱 완전도, 표 구조율, OCR 정밀도, 마스킹 커버리지), 검색 계층(HitRate@K, Recall@K, MRR, NDCG@K), 생성 계층(충실도, 답변 관련성, 컨텍스트 정밀도). 사용자가 '싫어요'를 누르면 자동으로 원인을 규명합니다: 문제가 청킹, 정제, 마스킹, 메타데이터 중 어디에 있는지 한 번 조회하면 알 수 있으며, badcase는 자동으로 평가 세트에 환류됩니다.

3계층코퍼스/검색/생성
회귀 게이트전략 변경 자동 회귀
'싫어요' 원인 규명문제를 단계별로 규명
대시보드품질 추세 시각화

실측 데이터 보기 →

이러한 역량이 귀사의 문서에서 작동하는 것을 보고 싶으신가요?

데모 신청, 백문이 불여일견

데모 신청 통합 및 배포