DUOLABS AI 기능 탐구 3: 비정형 텍스트를 표와 JSON으로 바꾸는 추출 스튜디오
DUOLABS AI 기능 탐구 세 번째 글은 이메일, 문서, 메모처럼 형식이 일정하지 않은 텍스트를 원하는 표와 JSON 구조로 바꾸는 추출 스튜디오입니다.
생성형 AI는 내용을 요약하거나 질문에 답하는 데 익숙하지만, 실제 업무 자동화에서는 “회사명, 담당자, 연락처를 각각 어느 필드에 저장할 것인가”처럼 결과의 구조가 더 중요할 때가 많습니다. 추출 스튜디오는 필요한 항목을 먼저 정의하고, AI가 그 모양에 맞춰 데이터를 정리하도록 돕습니다.
기능 직접 보기: DUOLABS AI 추출 스튜디오
공개 데모에는 실제 고객 문의, 이력서, 연락처나 영업비밀을 입력하지 마세요. 화면에 제공되는 샘플 또는 직접 만든 가상 데이터만 사용해야 합니다.
비정형 텍스트가 왜 문제일까요?
사람은 다음과 같은 문장을 읽고 필요한 정보를 자연스럽게 구분합니다.
세모상사 구매팀에서 다음 주까지 웹사이트 개편 견적을 요청했습니다.
예산은 약 2천만 원이며 담당자는 김가상 팀장입니다.하지만 CRM이나 업무 시스템에 저장하려면 정보를 명확한 필드로 나눠야 합니다.
{
"company": "세모상사",
"department": "구매팀",
"request": "웹사이트 개편 견적",
"budget": 20000000,
"contact": "김가상",
"title": "팀장"
}직원이 내용을 읽고 복사하면 정확하게 처리할 수 있지만, 요청이 많아질수록 반복 작업과 누락이 늘어납니다. 단순한 정규식은 입력 문장이 조금만 달라져도 원하는 값을 찾지 못할 수 있습니다.
구조화 추출은 AI가 문맥을 읽되, 결과는 미리 정한 형식으로 받는 방식입니다.
DUOLABS AI에서는 어떻게 사용하나요?
추출 스튜디오는 입력, 스키마, 결과의 세 영역으로 구성됩니다.
1. 변환할 텍스트를 입력합니다
이메일, 표를 복사한 텍스트, 상담 메모나 문서 내용을 왼쪽 입력 영역에 넣습니다. 영업 리드, 영수증 항목, 이력서 경력처럼 형태가 다른 샘플도 선택할 수 있습니다.
샘플을 사용하면 같은 기능이 문장형 데이터와 줄 단위 데이터에서 어떻게 달라지는지 빠르게 확인할 수 있습니다.
2. 필요한 필드를 스키마로 정의합니다
중앙 영역에서 결과에 필요한 필드 이름과 자료형을 정합니다. 현재 데모에서는 문자, 숫자, 불리언 필드를 만들 수 있습니다.
예를 들어 영업 문의라면 다음과 같이 구성할 수 있습니다.
| 필드 | 자료형 | 설명 |
|---|---|---|
| company | 문자 | 회사명 |
| budget | 숫자 | 예상 예산, 원 단위 |
| urgent | 불리언 | 긴급 요청 여부 |
| request | 문자 | 요청 내용 |
필드 설명은 단순한 메모가 아니라 AI가 값을 판단할 때 참고하는 지시문입니다. amount라고만 적는 것보다 “부가세를 제외한 공급가액, 원 단위 숫자”처럼 의미와 형식을 구체적으로 적는 편이 결과를 안정시키는 데 도움이 됩니다.
정의한 필드는 JSON 스키마로도 확인할 수 있습니다.
3. 모델을 선택하고 추출합니다
사용할 모델을 선택한 뒤 추출을 실행하면 결과가 스키마의 컬럼에 맞춰 표로 표시됩니다. 로컬에서 실행되는 모델을 포함해 환경에 연결된 추출 모델을 선택할 수 있습니다.
결과에는 처리 시간과 사용 모델이 함께 표시되며, 추출한 행은 JSON 파일로 내려받을 수 있습니다. 이 JSON을 CRM, 스프레드시트, 데이터베이스나 후속 자동화의 입력으로 연결할 수 있습니다.
일반 채팅과 무엇이 다른가요?
채팅에 “표로 정리해 줘”라고 요청해도 비슷한 결과를 얻을 수 있습니다. 하지만 답변의 컬럼 이름이나 자료형이 실행할 때마다 달라지면 시스템 연동이 어렵습니다.
추출 스튜디오의 목적은 보기 좋은 답변이 아니라 다음 프로그램이 읽을 수 있는 결과를 만드는 것입니다.
비정형 입력
→ 추출할 필드와 자료형 정의
→ AI 구조화 추출
→ 표에서 결과 검토
→ JSON 내보내기
→ CRM·ERP·업무 시스템 연동구조가 고정되면 사람이 결과를 확인하기도 쉽고, 실패한 필드만 별도로 검증하는 규칙도 만들 수 있습니다.
어떤 업무에 활용할 수 있을까요?
영업 문의 정리
이메일과 상담 메모에서 회사명, 담당자, 연락처, 요청 서비스, 예산과 일정을 추출해 영업 파이프라인에 등록할 수 있습니다. 개인정보가 포함될 수 있으므로 필요한 필드와 보관 목적을 먼저 정해야 합니다.
주문·영수증 항목 변환
품목명, 수량, 단가와 금액을 행 단위로 나누면 회계나 정산 시스템에 전달하기 쉬워집니다. 합계와 세금 계산은 AI 결과만 믿기보다 별도의 계산식으로 다시 검증해야 합니다.
이력서와 신청서 분류
경력 회사, 직무, 기간처럼 반복되는 항목을 추출해 검토 화면에 보여 줄 수 있습니다. 채용과 심사처럼 사람에게 중요한 영향을 주는 업무에서는 AI가 최종 판단을 내려서는 안 되며 담당자의 확인이 필요합니다.
고객 문의 라우팅 준비
문의 내용에서 제품명, 증상, 긴급도와 계약 유형을 추출하면 담당 부서로 전달하기 위한 데이터가 만들어집니다. 이후 분류·라우팅 기능과 결합할 수 있습니다.
좋은 결과를 만드는 스키마 작성법
추출 품질은 모델뿐 아니라 스키마 정의에 크게 영향을 받습니다.
- 필드 이름은 짧고 서로 겹치지 않게 정합니다.
- 설명에 단위, 날짜 형식과 값의 범위를 적습니다.
- 한 필드에 여러 의미를 섞지 않습니다.
- 입력에 없는 값을 임의로 만들지 않도록 지시합니다.
- 숫자와 날짜는 후처리 규칙으로 다시 검증합니다.
- 실제 운영에서 자주 들어오는 예외 입력으로 테스트합니다.
처음부터 필드를 많이 만들기보다 반드시 필요한 항목부터 시작하는 편이 좋습니다. 추출할 값이 모호하면 AI도 일관된 기준을 적용하기 어렵습니다.
개인정보와 오류를 어떻게 다뤄야 할까요?
영업 문의와 이력서에는 개인정보가 포함되기 쉽습니다. 분석에 필요하지 않은 식별 정보는 앞선 글에서 소개한 가드레일·PII 마스킹을 먼저 거치는 방법을 고려할 수 있습니다.
구조화된 결과라고 해서 항상 정확한 것은 아닙니다. 운영 시스템에 자동 저장하기 전 다음 검증이 필요합니다.
- 필수 필드가 비어 있지 않은가
- 숫자 범위와 합계가 맞는가
- 날짜와 전화번호 형식이 유효한가
- 원문에 없는 값이 추가되지 않았는가
- 낮은 신뢰도의 결과를 사람이 검토하는가
AI는 읽고 정리하는 역할을 맡고, 업무 규칙은 코드와 검토 절차로 보완하는 구조가 안전합니다.
샘플로 직접 확인해 보기
DUOLABS AI 추출 스튜디오에서 제공되는 샘플 하나를 선택한 뒤 필드 이름과 설명을 바꿔 보세요. 같은 입력도 어떤 스키마를 요구하느냐에 따라 결과가 어떻게 달라지는지 확인할 수 있습니다.
공개 화면에는 실제 업무 데이터를 붙여넣지 말고 샘플만 사용해야 합니다. 실서비스에 적용할 때는 모델의 실행 위치, 입력 로그, 결과 보관과 접근 권한을 함께 설계해야 합니다.
함께 읽기
- DUOLABS AI 기능 탐구 30: 브랜드 규칙을 지키며 버전을 쌓는 콘텐츠 스튜디오DUOLABS AI 기능 탐구 서른 번째 글은 브리프, 채널, 문체와 브랜드 용어를 기준으로 콘텐츠를 만들고 버전을 비교하는 콘텐츠 스튜디오입니다.
- DUOLABS AI 기능 탐구 29: 전사록에서 결정과 할 일을 찾는 회의·통화 인텔리전스DUOLABS AI 기능 탐구 스물아홉 번째 글은 회의와 통화 전사록에서 참가자, 요약, 결정 사항과 담당자별 할 일을 구조화하는 회의·통화 인텔리전스입니다.
- DUOLABS AI 기능 탐구 28: 문서를 분류하고 핵심 필드와 위험을 찾는 문서 인텔리전스DUOLABS AI 기능 탐구 스물여덟 번째 글은 문서 유형을 분류하고 핵심 요약, 필드와 검토 위험을 구조화하는 문서 인텔리전스입니다.
- DUOLABS AI 기능 탐구 27: CSV를 요약하고 질문에 답하는 AI 데이터 분석가DUOLABS AI 기능 탐구 스물일곱 번째 글은 CSV·TSV 데이터를 빠르게 프로파일링하고 자연어 질문에 답하는 AI 데이터 분석가입니다.
- DUOLABS AI 기능 탐구 26: 오류율·지연·비용 임계치를 감시하는 알림·SLA 센터DUOLABS AI 기능 탐구 스물여섯 번째 글은 실행 원장의 오류율, 지연, 비용과 실행 수를 임계값으로 감시하는 알림·SLA 센터입니다.