ATPIA고문서 OCR 연구 프로젝트
RESEARCHINTERNAL BETA · 현재 중지

ATPIA HISTORICAL DOCUMENT OCR

ATPIA 고문서 OCR

AI로 되살리는 옛 문서

조선시대 고서 등 세로쓰기 한자 문서의 영역 검출과 문자 인식을 연구하고 있습니다. 현재는 내부 연구 베타 단계이며 일반 사용자 파일 업로드와 공개 OCR 체험은 제공하지 않습니다.

현재 연구 구조
PageColumnGlyphTop-K 후보Human Review

자동 결과는 정답이 아니며 원문 대조가 필요합니다.

현재 공개 상태공개 소개 페이지는 열려 있습니다.

Research Beta worker는 현재 중지·안전 상태입니다. 승인된 내부 연구자용 기능과 업로드는 별도 접근 통제와 readiness 검증 뒤에만 열립니다.

TECHNOLOGY

한 장의 문서를 여러 단계로 읽습니다

현재 동결한 Architecture Candidate의 처리 경계를 연구 기준에 맞춰 공개합니다.

01

Column Detector

DBNet으로 세로쓰기 문서의 열을 검출하고 x-center 기준으로 순서를 정렬합니다.

02

Glyph Localizer

열 내부의 문자 위치와 crop을 추정합니다. 작은 글자와 불규칙한 간격은 계속 개선 중입니다.

03

Recognizer

20k Stage2B partial fine-tuned recognizer가 문자 후보와 confidence를 제공합니다.

04

Selective Risk

오류 위험이 높은 페이지를 검토 대상으로 분류합니다. AUTO_ACCEPT도 정답 보증이 아닙니다.

PIPELINE

처리 과정

  1. 01

    이미지 검증

    형식·크기·픽셀 수와 처리 범위를 먼저 확인합니다.

  2. 02

    Column 검출

    DBNet으로 세로쓰기 문서의 열을 찾고 읽기 순서를 정렬합니다.

  3. 03

    Glyph 위치 분석

    열 안에서 문자 영역과 crop 위치를 추정합니다.

  4. 04

    문자 후보 생성

    recognizer가 Top-K 후보와 confidence를 함께 제시합니다.

  5. 05

    위험도 분류

    오류 위험이 높은 페이지를 사람 검토 대상으로 보냅니다.

  6. 06

    검토와 기록

    원본 예측과 사람의 교정을 분리해 보존합니다.

SCOPE

검증 범위를 좁게 고지합니다

현재 결과는 모든 고문서에 일반화되는 서비스 정확도가 아니라 연구 benchmark입니다.

검증 중심

행서·석인본 계열

세로쓰기 한자 중심의 비교적 선명한 자료를 우선 검증합니다. 결과도 원문과 대조해야 합니다.

제한적 실험

작은 글자·저대비·불규칙 지면

행서·석인본 안에서도 오류 위험이 높아 selective review를 우선 적용합니다.

성능 미확인

초서·심한 훼손·복잡한 혼합 지면

외부 독립 holdout이 없어 일반화 성능을 주장하지 않습니다.

DEVELOPMENT STATUS

연구 현황

상태 코드는 제품 완성도가 아니라 각 연구 구성요소의 현재 의사결정 상태입니다.

ATPIA 고문서 OCR 구성요소별 개발 상태
구성요소상태의미
Manifest InfrastructureGO대용량 index와 재개 가능한 manifest
DBNet ColumnGO세로쓰기 column 검출 후보
Column InterfaceGO검출 결과와 glyph 경로의 연결
Glyph LocalizerTUNE위치·개수·작은 글자 오류 개선 중
RecognitionGO현재 recognizer 구성 유지
Selective RiskTUNE독립 calibration 확보 후 재보정
Final ArchitecturePENDING독립 평가자료와 추가 Gate 필요
0.49247Official Mean CER
0.65939Official P95
2.84211Worst Page CER
1%CER > 1.0 페이지

CER는 0에 가까울수록 좋습니다. 위 수치는 연구 benchmark이며 상용 정확도나 서비스 보증이 아닙니다.

RESEARCH CASES

공개 승인된 사례를 준비하고 있습니다

현재 외부 독립 자료는 이용허락을 확인 중이므로 권리 확인 전의 원문 이미지를 게시하지 않습니다.

CASE STUDY · 준비 중

승인된 자료가 확보되면 원문 출처, 모델 provenance, 자동 결과, 교정 결과와 오류 유형을 함께 공개합니다. 성공 사례만 선별하지 않습니다.

RESEARCH COLLABORATION

독립 평가자료를 함께 찾습니다

내부 corpus는 train 또는 strict-core에 배정되어 독립 calibration·holdout으로 사용할 문헌이 없습니다.

기관·연구자 협력 범위

문헌 단위 원문과 판독문을 허가된 범위에서 받아 중복 감사, column·glyph annotation, OCR 평가를 진행합니다. 원본과 파생물은 학습 자료와 분리하고 이용조건에 맞춰 보관·삭제합니다.

허가 전 원칙

기관의 공식 이용조건이나 명시적 허가가 없는 이미지는 다운로드·annotation·학습·평가에 사용하지 않습니다.

FAQ

자주 묻는 질문

지금 일반 사용자가 이미지를 올릴 수 있나요?

아니요. 일반 사용자 업로드와 Public Beta는 제공하지 않습니다. Research Beta는 승인된 내부 접근과 worker readiness가 모두 필요합니다.

자동 결과를 그대로 믿어도 되나요?

아니요. confidence와 risk는 검토 우선순위를 돕는 신호입니다. AUTO_ACCEPT도 사람이 확인한 정답을 뜻하지 않습니다.

현재 결과가 모든 고문서에 적용되나요?

아니요. 현재 연구 범위는 행서·석인본 계열 중심이며, 외부 독립 평가자료가 확보되기 전에는 전체 고문서 일반화를 주장하지 않습니다.

내부 Research Beta는 어디서 사용하나요?

현재 worker가 중지되어 있습니다. feature flag, 승인된 접근, readiness가 모두 충족될 때만 별도 비공개 경로가 열립니다.

DATA & RIGHTS

자료와 결과를 책임 있게 다룹니다

원문·결과 분리

업로드 원본, raw prediction, reviewed prediction, export와 audit event는 분리된 저장 정책으로 관리합니다.

공개 범위 제한

권리와 보존 조건이 확인되지 않은 원문·crop·annotation은 공개하지 않습니다. 성능 수치도 적용 범위를 함께 표시합니다.

연구 상태 공개

현재는 `INTERNAL RESEARCH BETA STOPPED SAFE`, `General Research Beta: TUNE`, `Public Beta: NO`입니다.