UGLYPEAR AI 사업 전환 완료: 고성능 문서 압축 × RAG 데이터 엔지니어링 기반신규 사업 알아보기 →

성능 평가

개념 논의 없이 실측 수치만 보고 · 모든 데이터는 프로젝트 테스트 보고서에서 나왔으며 검증을 환영합니다

4가지 핵심 실측 데이터

P2/P3 엔드투엔드 테스트, DeepDoc 파이프라인 실측 및 파이프라인 테스트 보고서에서 발췌

124
443페이지 OFD 고정 레이아웃 문서
엔드투엔드 전체 경로 처리
파이프라인 테스트 보고서
0.924
3계층 파싱 품질검사 총점
(구조 계층 만점)
P2/P3 e2e 테스트 보고서
64%
표 구조 오검출 감소
레이아웃 분석 듀얼 모델 협업
DeepDoc 파이프라인 73페이지 실측
85.9%
이미지 토큰 비용 절감
(GPT-4o 기준)
멀티모달 추론 비용 실측
설명:테스트 대상은 실제 고정 레이아웃 문서(OFD 장문, 표 및 내장 이미지 포함)이며, 엔드투엔드는 '업로드→파싱→정제→마스킹→압축→청킹→메타데이터→품질검사' 전체 경로를 의미합니다. 문서 복잡도에 따라 수치는 달라질 수 있으며, 귀사의 문서로 실측 재검증을 환영합니다.

파싱 품질: 3계층 점수 보는 법

모든 문서는 처리 완료 후 '진단서'를 받게 됩니다

443페이지 OFD 문서 실측 상세

구조 계층(레이아웃 블록, 제목 계층, 읽기 순서가 올바른지 여부)——만점; 관계 계층(표 행렬 관계, 컨텍스트 연결)과 내용 계층(텍스트, OCR 정확률)을 종합한 후, 전체 점수는 0.924. 표 구조 오검출은 듀얼 모델 협업을 통해 감소되었습니다 64%

구조 계층 점수1.00
100%
종합 총점(3계층 가중치)0.924
92.4%

3계층 평가 체계

지식 베이스 구축은 시작일 뿐, 지속적인 '건강검진'이 있어야 계속 신뢰할 수 있습니다

코퍼스 계층: 원재료가 좋은지 여부

문서 입고 전 검수

전처리 자체의 품질을 측정하며, 문서 입고 시마다 자동으로 점수를 매깁니다.

  • 파싱 완전도
  • 표 구조 보존율
  • OCR 정확률
  • 마스킹 커버리지
  • 권한 적중률

검색 계층: 정확하게 찾는지 여부

지식을 찾을 수 있는지 여부

표준 질문 세트로 검색 효과를 정량화하고 리콜 문제를 파악합니다.

  • HitRate@K / Recall@K
  • MRR(평균 역순위)
  • NDCG@K(정렬 품질)

생성 계층: 답변이 맞는지 여부

최종 사용자가 보는 답변

AI 답변의 충실도와 관련성을 측정하며, 비즈니스 경험과 직접 대응됩니다.

  • Faithfulness(원문 충실도)
  • AnswerRelevancy(엉뚱한 답변 비율)
  • ContextPrecision(컨텍스트 정밀도)

평가가 어떻게 순환되는가: '싫어요' 한 번 클릭하면 시스템이 스스로 원인을 찾습니다

사용자가 특정 답변에 '싫어요'를 누르면 시스템이 해당 답변이 인용한 지식 포인트를 자동으로 역추적하여 구체적인 단계로 원인을 규명합니다——청킹이 의미를 잘랐는지, 정제가 내용을 잘못 삭제했는지, 마스킹이 과도했는지, 메타데이터가 누락되었는지? 규명 결과는 자동으로 평가 세트에 환류되며, 다음 전략 변경 시 자동으로 회귀 검증을 수행하고 지표가 기준에 미달하면 통과시키지 않습니다(회귀 게이트).

압축 성능: 본업의 데이터

압축 엔진은 기반의 토대이자 직접적인 비용 항목입니다

대표적인 압축 효과

지표 실측값 고객에게 의미하는 것
평균 압축률60%(최고 80%)스토리지 비용을 절반 이상 직접 절감
처리 속도메모리 아키텍처, 3-5배 향상전 과정 메모리 처리, 임시 디렉터리 디스크 IO 없음
이미지 품질 게이팅SSIM ≥ 0.92 / PSNR ≥ 30dB작게 압축하는 것이 흐리게 압축하는 것과 같지 않으며, 최적 파라미터를 자동으로 탐색합니다
글꼴 중복 제거글꼴 공간 30-50% 절감Office 문서 중복 글꼴 자동 병합
멀티모달 토큰 절감85.9%(GPT-4o 기준)이미지를 압축한 후 대형 모델에 넣으면 추론 청구액이 크게 줄어듭니다

압축 엔진 기술 상세 보기 →

귀사의 문서는 어떤 수치를 낼까요?

실제 문서를 가지고 실측을 예약하시면, 우리가 보고서를 작성해 드립니다

실측 신청