RSS
AI 자동화

컨텍스트 100만 토큰 시대에도 RAG가 필요할까?

작성자
듀오랩스 대표·5분 읽기

사내 문서 300개를 합치면 80만 토큰쯤 됩니다. 컨텍스트 창이 100만 토큰인 모델이라면 전부 한 번에 넣을 수 있습니다. 그러면 문서를 잘게 자르고, 임베딩을 만들고, 벡터 DB를 운영하고, 검색 품질을 튜닝하던 RAG 파이프라인이 통째로 필요 없어지는 것처럼 보입니다.

실제로 긴 컨텍스트 모델이 나올 때마다 "RAG는 끝났다"는 말이 돕니다. 저는 이 말이 절반만 맞다고 봅니다. 넣을 수 있게 된 것은 사실이지만, 넣은 것을 모델이 잘 쓰는지는 다른 문제입니다.

넣을 수 있다는 것과 잘 쓴다는 것의 차이

Chroma가 2025년 7월에 낸 Context Rot 보고서는 GPT-4.1, Claude 4, Gemini 2.5, Qwen3를 포함한 18개 모델을 시험했습니다. 결론은 간단한 과제에서도 입력이 길어질수록 성능이 눈에 띄게 떨어진다는 것입니다. 모델이 100만 번째 토큰을 100번째 토큰만큼 믿을 만하게 다룬다는 가정이 틀렸다는 것이 보고서의 요지입니다.

떨어지는 방식도 고르지 않았습니다. 질문과 정답 문장의 표현이 비슷하면 길어져도 잘 버티지만, 표현이 다르면 길이에 따라 급격히 나빠졌습니다. 정답과 비슷해 보이는 방해 문장이 하나만 있어도 성능이 떨어졌습니다. 사내 문서는 비슷한 내용이 여러 버전으로 흩어져 있기 마련이라, 이 조건이 가장 잘 들어맞는 자료입니다.

모델에게도 한정된 주의력

Anthropic은 2025년 9월 컨텍스트 엔지니어링 글에서 이 현상을 주의력 예산(attention budget)으로 설명합니다. 트랜스포머에서 각 토큰은 다른 모든 토큰과 관계를 맺습니다. 토큰이 n개면 관계는 n²개입니다. 컨텍스트가 길어질수록 토큰 하나에 돌아가는 주의가 얇아집니다.

사람의 작업 기억에 빗대면 이해가 쉽습니다. 책 한 권을 책상에 펼쳐 둘 수 있다고 해서 그 책 전체를 동시에 떠올리며 답할 수 있는 것은 아닙니다. 필요한 쪽을 찾아 펼치는 일이 여전히 필요합니다.

호출마다 다시 내는 비용

품질 말고도 따질 것이 있습니다. 80만 토큰을 넣으면 질문 한 줄마다 80만 토큰을 과금합니다. 입력 단가가 100만 토큰당 2달러인 모델이라면 질문당 1.6달러입니다. RAG로 관련 문서 몇 개만 골라 5천 토큰을 넣으면 0.01달러입니다. 160배 차이입니다.

프롬프트 캐싱을 쓰면 반복되는 앞부분을 10분의 1 가격으로 읽으니 격차가 줄어듭니다. 그래도 문서가 바뀌면 캐시가 깨지고, 모델이 80만 토큰을 처리하는 동안 사용자가 기다리는 시간은 캐시로도 전부 사라지지 않습니다.

필요할 때 꺼내 읽는 방식

Anthropic의 글이 권하는 방향은 흥미롭게도 벡터 검색도 아니고 전부 넣기도 아닙니다. 파일 경로, 저장된 쿼리, 링크처럼 가벼운 식별자만 들고 있다가 필요한 순간에 불러오는 방식(just-in-time)입니다. 코딩 에이전트가 저장소 전체를 컨텍스트에 넣지 않고 파일 목록을 본 다음 필요한 파일만 여는 것이 바로 이 방식입니다.

같은 글은 긴 작업을 위한 기법 세 가지도 소개합니다. 대화가 한도에 가까워지면 요약해서 새로 시작하는 압축(compaction), 컨텍스트 밖에 메모를 남겨 두고 다시 읽는 구조화된 기록, 세부 탐색을 하위 에이전트에게 맡기고 결과만 받는 구조입니다. 셋 다 컨텍스트에 무엇을 넣을지보다 무엇을 빼 둘지를 다룹니다.

저는 이것을 RAG의 종말이 아니라 RAG의 일반화로 읽습니다. 검색해서 필요한 것만 넣는다는 원리는 그대로이고, 검색하는 주체가 파이프라인에서 에이전트 자신으로 옮겨 갔을 뿐입니다. 검색 방법은 RAG 대표 기술 정리에 따로 모아 두었습니다.

긴 컨텍스트가 이기는 일

그렇다고 긴 컨텍스트가 쓸모없다는 뜻은 아닙니다. 문서 전체를 한 번 훑어야 답이 나오는 일에서는 긴 컨텍스트가 확실히 낫습니다. 계약서 두 개의 조항을 처음부터 끝까지 비교하거나, 회의록 한 달치에서 흐름을 요약하는 일은 검색으로 조각을 고르는 순간 전체 그림을 잃습니다.

반대로 같은 문서 더미에 다른 질문이 계속 들어오는 일, 문서가 자주 바뀌는 일, 답에 출처를 달아야 하는 일은 검색 쪽이 유리합니다. 질문마다 전체를 다시 읽을 이유가 없고, 어느 문서에서 답을 가져왔는지도 검색 단계에서 이미 알 수 있습니다.

한 번 읽을 것인가, 여러 번 찾을 것인가

제가 쓰는 판단 기준은 하나입니다. 이 자료를 한 번 통째로 읽고 끝낼 것인지, 여러 번 조금씩 찾아 쓸 것인지입니다. 한 번이면 긴 컨텍스트에 넣고, 여러 번이면 검색을 둡니다.

컨텍스트 창은 앞으로도 커질 것입니다. 다만 Context Rot 보고서가 보여 준 것처럼 창의 크기와 그 안을 다루는 능력은 같은 속도로 늘지 않았습니다. 여기서부터는 모델마다 다르고 세대마다 달라지는 부분이라, 쓰는 모델에서 직접 재 보는 것 말고는 확실한 답이 없습니다.

마지막 수정:

공유하실 때는 출처(Duolabs)와 원문 주소를 표시해 주세요.