DUOLABS AI 기능 탐구 4: 명함·영수증·양식을 데이터로 바꾸는 비전·OCR
DUOLABS AI 기능 탐구 네 번째 글은 이미지 속 글자와 항목을 읽어 표와 JSON 데이터로 바꾸는 비전·OCR입니다.
명함, 영수증, 신청서와 현장 사진에는 업무에 필요한 정보가 많지만 그대로는 검색하거나 시스템에 저장하기 어렵습니다. 사람이 이미지를 보고 값을 옮겨 적는 대신, 비전 모델이 화면을 읽고 필요한 필드에 맞춰 구조화할 수 있습니다.
기능 직접 보기: DUOLABS AI 비전·OCR
공개 데모에는 실제 명함, 영수증, 계약서, 신분증이나 고객 문서를 업로드하지 마세요. 가상 정보로 만든 테스트 이미지만 사용해야 합니다.
OCR과 비전 추출은 어떻게 다를까요?
전통적인 OCR의 목표는 이미지에 보이는 글자를 텍스트로 옮기는 것입니다.
세모카페
아메리카노 2 9,000
카페라떼 1 5,000
합계 14,000글자를 읽은 뒤에도 업무 시스템에 넣으려면 품목, 수량, 단가와 금액을 다시 나눠야 합니다. 비전 기반 구조화 추출은 이미지의 배치와 문맥을 함께 보고 원하는 데이터 구조를 직접 만들 수 있습니다.
[
{ "item": "아메리카노", "qty": 2, "amount": 9000 },
{ "item": "카페라떼", "qty": 1, "amount": 5000 }
]두 방식은 경쟁 관계가 아닙니다. 원문 보존이 중요하면 OCR 결과를 먼저 저장하고, 업무 자동화가 목적이면 필요한 항목을 구조화하는 흐름을 함께 사용할 수 있습니다.
DUOLABS AI에서는 무엇을 할 수 있나요?
비전·OCR 화면은 이미지, 추출 스키마, 결과의 세 영역으로 구성됩니다.
1. 이미지를 올립니다
JPG, PNG, WebP 이미지를 끌어다 놓거나 파일 선택으로 업로드할 수 있습니다. 현재 공개 화면은 최대 8MB 이미지까지 받습니다.
이미지가 흐리거나 글자가 너무 작으면 모델이 값을 놓칠 수 있습니다. 가능한 한 정면에서 촬영하고, 문서가 화면을 충분히 채우도록 잘라낸 이미지를 사용하는 편이 좋습니다.
2. 문서 유형과 추출 항목을 선택합니다
화면에는 네 가지 기본 구성이 준비되어 있습니다.
- 명함: 회사명, 이름, 직함, 전화번호, 이메일, 주소
- 영수증: 품목, 수량, 단가, 금액
- 양식·서식: 항목 라벨과 입력된 값
- OCR: 보이는 텍스트를 줄 단위로 추출
기본 구성을 그대로 사용하거나 필드를 추가·삭제할 수 있습니다. 각 필드에는 문자, 숫자, 불리언 자료형과 설명을 지정할 수 있습니다.
“이미지에서 모든 글자를 읽어 줘”보다 “품목을 한 행씩 나누고 금액은 콤마 없는 숫자로 반환해 줘”처럼 문서 유형과 결과 형식을 함께 알려 주면 후속 처리가 쉬워집니다.
3. 비전 모델로 분석합니다
이미지를 이해할 수 있는 모델을 선택해 분석을 실행합니다. 결과는 추출 스키마와 같은 컬럼의 표로 표시되며 JSON 파일로 내려받을 수 있습니다.
다음 단계에서는 이 JSON을 주소록, 비용 처리, 문서 관리나 검수 화면으로 전달할 수 있습니다.
이미지 업로드
→ 문서 유형과 필드 선택
→ 비전 모델 분석
→ 표에서 결과 확인
→ JSON 내보내기
→ 업무 시스템 저장 또는 사람 검수기능별로 어떻게 활용할 수 있을까요?
명함을 연락처 데이터로 변환
행사나 미팅에서 받은 명함의 회사명, 이름, 직함과 연락처를 추출해 CRM 등록 화면에 채울 수 있습니다.
하지만 명함은 개인정보입니다. 수집 목적과 보관 기간을 정하고, 공개 데모가 아닌 보호된 업무 환경에서 처리해야 합니다. 자동으로 저장하기 전에 이메일과 전화번호가 올바른지 확인하는 단계도 필요합니다.
영수증 항목 구조화
영수증 사진에서 품목과 금액을 행 단위로 추출하면 비용 처리 입력을 줄일 수 있습니다. 접힌 종이, 흐린 인쇄, 할인과 세금 표시는 오류가 생기기 쉬운 부분입니다.
품목 금액의 합과 영수증 총액이 일치하는지 별도 계산식으로 확인하고, 기준을 벗어나면 사람에게 검토를 요청해야 합니다.
신청서와 점검표 읽기
정해진 양식의 라벨과 기입 값을 추출하면 신청서 접수나 현장 점검 결과를 디지털 데이터로 바꿀 수 있습니다.
손글씨, 체크박스와 표 병합 셀은 인쇄된 텍스트보다 어렵습니다. 실제 사용하는 양식별 테스트 자료를 만들고 누락률을 측정해야 합니다.
이미지 원문을 OCR 텍스트로 보존
텍스트 줄 모드는 이미지에 보이는 내용을 위에서 아래 순서로 읽는 데 사용할 수 있습니다. 검색 인덱스나 원문 대조 화면을 만들 때 유용합니다.
다만 복잡한 다단 편집, 도장, 배경 무늬가 있는 문서는 읽는 순서가 달라질 수 있습니다. 원본 이미지와 OCR 결과를 함께 보여 주는 검수 화면이 필요합니다.
정확도를 높이는 이미지 준비법
모델을 바꾸기 전에 입력 이미지를 먼저 점검하는 것이 좋습니다.
- 문서가 기울어지지 않게 촬영합니다.
- 글자가 충분히 크게 보이도록 문서 영역을 자릅니다.
- 반사광과 그림자를 줄입니다.
- 여러 문서가 한 이미지에 섞이지 않게 합니다.
- 문서 유형에 맞는 필드와 설명을 사용합니다.
- 숫자, 날짜, 계좌와 연락처는 형식 검증을 추가합니다.
하나의 거대한 이미지보다 페이지나 문서 단위로 나누는 편이 오류를 찾고 다시 처리하기 쉽습니다.
OCR 결과가 곧 사실은 아닙니다
비전 모델은 이미지에 없는 글자를 추정하거나 비슷한 문자를 혼동할 수 있습니다. 특히 다음 정보는 별도의 검증이 필요합니다.
- 0과 O, 1과 I처럼 모양이 비슷한 문자
- 소수점과 천 단위 구분 기호
- 날짜, 계좌번호와 전화번호
- 할인, 부가세와 최종 합계
- 손글씨와 흐릿한 인쇄물
중요 문서에서는 추출 결과만 저장하지 말고 원본 이미지의 해당 위치와 함께 확인할 수 있어야 합니다. 금액이나 계약 조건처럼 영향이 큰 값은 사람이 승인한 뒤 다음 단계로 넘기는 방식이 안전합니다.
이미지 데이터의 보안도 고려해야 합니다
이미지는 텍스트보다 더 많은 정보를 포함할 수 있습니다. 명함의 연락처뿐 아니라 배경에 촬영 장소, 다른 사람의 얼굴이나 내부 문서가 찍힐 수 있습니다. 파일 메타데이터에도 촬영 정보가 남아 있을 수 있습니다.
업무에 필요한 영역만 잘라 사용하고, 업로드 전에 불필요한 배경과 메타데이터를 제거하는 방법을 고려해야 합니다. 모델이 어디에서 실행되는지, 업로드 원본과 결과가 얼마나 보관되는지도 확인해야 합니다.
가상 이미지로 직접 확인해 보기
DUOLABS AI 비전·OCR에서 가상 회사명과 연락처로 만든 명함 이미지나 테스트용 영수증 이미지를 사용해 보세요. 명함, 영수증, 양식, OCR 구성을 바꾸면서 같은 이미지에서 어떤 결과가 나오는지 비교할 수 있습니다.
공개 체험 환경에는 실제 개인정보나 회사 문서를 올리면 안 됩니다. 실서비스에서는 인증, 저장 암호화, 접근 권한, 원본 삭제와 검수 절차를 포함한 전체 데이터 흐름을 설계해야 합니다.
함께 읽기
- DUOLABS AI 기능 탐구 30: 브랜드 규칙을 지키며 버전을 쌓는 콘텐츠 스튜디오DUOLABS AI 기능 탐구 서른 번째 글은 브리프, 채널, 문체와 브랜드 용어를 기준으로 콘텐츠를 만들고 버전을 비교하는 콘텐츠 스튜디오입니다.
- DUOLABS AI 기능 탐구 29: 전사록에서 결정과 할 일을 찾는 회의·통화 인텔리전스DUOLABS AI 기능 탐구 스물아홉 번째 글은 회의와 통화 전사록에서 참가자, 요약, 결정 사항과 담당자별 할 일을 구조화하는 회의·통화 인텔리전스입니다.
- DUOLABS AI 기능 탐구 28: 문서를 분류하고 핵심 필드와 위험을 찾는 문서 인텔리전스DUOLABS AI 기능 탐구 스물여덟 번째 글은 문서 유형을 분류하고 핵심 요약, 필드와 검토 위험을 구조화하는 문서 인텔리전스입니다.
- DUOLABS AI 기능 탐구 27: CSV를 요약하고 질문에 답하는 AI 데이터 분석가DUOLABS AI 기능 탐구 스물일곱 번째 글은 CSV·TSV 데이터를 빠르게 프로파일링하고 자연어 질문에 답하는 AI 데이터 분석가입니다.
- DUOLABS AI 기능 탐구 26: 오류율·지연·비용 임계치를 감시하는 알림·SLA 센터DUOLABS AI 기능 탐구 스물여섯 번째 글은 실행 원장의 오류율, 지연, 비용과 실행 수를 임계값으로 감시하는 알림·SLA 센터입니다.