RSS

DUOLABS AI 기능 탐구 16: AI 실행 과정을 추적하는 실행 트레이스

DUOLABS AI 기능 탐구 열여섯 번째 글은 여러 AI 기능의 실행 결과를 하나의 원장에 모으고 단계별 흐름과 오류를 확인하는 실행 트레이스입니다.

AI가 틀린 답을 냈다는 사실만으로는 원인을 고칠 수 없습니다. 어떤 모델이 실행됐는지, 검색과 도구 호출 중 어디에서 시간이 걸렸는지, 입력·출력 토큰과 오류가 무엇이었는지 추적할 수 있어야 운영 가능한 시스템이 됩니다.

기능 직접 보기: DUOLABS AI 실행 트레이스

이 화면은 방문자가 함께 사용하는 공개 데모의 실행 기록입니다. 다른 기능을 시험할 때 입력한 내용이 실행 원장이나 오류 기록에 남을 수 있으므로 고객정보, 기밀문서, 인증정보와 내부 식별자를 입력하지 마세요.

실행 트레이스는 AI 작업의 영수증입니다

어시스턴트, 에이전트, 추출, 비전, 배치, 질의응답, 평가와 모델 프로브 등 서로 다른 기능이 공통 실행 원장에 기록됩니다. 각 실행에는 다음과 같은 정보가 연결됩니다.

  • 작업 종류와 기능 식별자
  • 공급자와 모델
  • 성공·실패 상태와 오류 내용
  • 전체 지연 시간
  • 입력·출력 토큰과 추정 비용
  • LLM, 도구, 검색과 평가 단계

현재 화면은 최근 150건을 종류별로 필터링하며, 행을 펼치면 단계 유형·이름·소요 시간과 오류를 확인할 수 있습니다. 상단에는 오늘 실행, 전체 성공률, 누적 토큰과 추정 비용이 요약됩니다.

단계 기록이 병목을 드러냅니다

하나의 에이전트 요청은 여러 단계로 구성될 수 있습니다.

#1 검색  120ms
#2 LLM  1,850ms
#3 도구  430ms
#4 LLM  1,210ms

전체 시간만 보면 모델이 느리다고 생각하기 쉽지만 실제로는 검색이나 외부 API가 병목일 수 있습니다. 단계별 시간을 보면 모델 교체, 캐시, 병렬화, 도구 최적화 중 어디에 투자할지 판단할 수 있습니다.

평균값만 보지 말고 상위 지연 구간과 실패 사례를 함께 봐야 합니다. 간헐적으로 매우 느린 요청은 평균에 가려질 수 있으므로 운영 환경에서는 중앙값과 p95·p99 지연도 집계하는 것이 좋습니다.

실패 기록은 재현 가능한 단서여야 합니다

오류 메시지만 저장하면 “왜 실패했는가”를 알기 어렵습니다. 모델·프롬프트·도구 버전, 요청 식별자, 재시도 횟수와 대체 모델 사용 여부가 함께 있어야 같은 조건을 재현할 수 있습니다.

분산된 웹훅, 작업 큐와 외부 API를 거치는 흐름에는 하나의 상관관계 ID를 전달해야 합니다. 그래야 사용자 요청부터 AI 실행, 후속 저장까지 여러 시스템의 로그를 한 줄로 연결할 수 있습니다.

비용 표시는 청구서가 아니라 추정치입니다

트레이스의 비용은 기록된 토큰과 모델별 단가를 사용한 운영 추정치입니다. 공급자의 실제 청구에는 캐시 토큰, 배치 할인, 최소 과금, 세금과 환율이 다르게 적용될 수 있습니다.

로컬 실행의 API 비용은 0으로 표시되지만 서버 감가상각, 전력, 네트워크와 운영 인건비는 포함되지 않습니다. 재무 판단에는 공급자 청구 데이터와 인프라 비용을 별도로 대조해야 합니다.

관측 데이터 자체가 민감할 수 있습니다

실행 단계의 입력·출력, 오류와 도구 인자에는 개인정보와 비밀값이 포함될 수 있습니다. 로그를 많이 남기는 것이 항상 좋은 것은 아닙니다.

  • 저장 전에 토큰·비밀번호·개인정보 마스킹
  • 사용자·테넌트별 조회 권한 분리
  • 원문 저장이 필요 없는 단계는 메타데이터만 기록
  • 보존 기간과 자동 삭제 정책
  • 저장·전송 암호화와 관리자 조회 감사
  • 장애 분석용 샘플링과 별도 보호 저장소

현재 실행 원장은 기록 실패가 본 AI 기능을 막지 않도록 설계되어 있습니다. 사용자 요청의 가용성에는 유리하지만 기록이 없다고 실행되지 않았다는 뜻은 아닙니다. 운영에서는 로그 누락률도 별도 지표로 감시해야 합니다.

공개 데모에서 흐름 읽기

DUOLABS AI 실행 트레이스에서 종류 필터를 바꾸고 성공·실패 행을 펼쳐 보세요. 같은 기능이라도 모델과 단계 수, 지연 시간이 어떻게 달라지는지 비교할 수 있습니다.

실서비스 관측의 목적은 감시가 아니라 재현, 개선과 책임성입니다. 필요한 정보만 안전하게 기록하고, 장애와 품질 저하를 실제 운영 행동으로 연결할 때 트레이스가 가치가 있습니다.

이전 글: DUOLABS AI 기능 탐구 15: 에이전트의 실행 능력을 검증하는 도구 카탈로그

다음 글: DUOLABS AI 기능 탐구 17: 모델 품질을 반복 측정하는 평가 매트릭스