RAG 운영: 전체 재색인을 피하고 캐시는 본 요청을 막지 않는 법
처음 RAG를 짤 때는 문서를 고칠 때마다 전체를 다시 색인했습니다. 문서가 백 개쯤 될 때는 그래도 됐습니다. 잠깐 기다리면 끝났거든요. 그런데 문서가 천 개를 넘고, 거기에 재고 아이템까지 색인에 들어가니 얘기가 달라졌습니다. 전체를 다시 임베딩하면 수천 번 모델을 부르는 셈이고, 그 사이에 질문이 들어오면 답이 늦…
처음 RAG를 짤 때는 문서를 고칠 때마다 전체를 다시 색인했습니다. 문서가 백 개쯤 될 때는 그래도 됐습니다. 잠깐 기다리면 끝났거든요. 그런데 문서가 천 개를 넘고, 거기에 재고 아이템까지 색인에 들어가니 얘기가 달라졌습니다. 전체를 다시 임베딩하면 수천 번 모델을 부르는 셈이고, 그 사이에 질문이 들어오면 답이 늦…
처음 RAG를 짤 때는 벡터 검색만 썼습니다. 코사인 유사도 하나로 충분할 줄 알았죠. 그런데 한국어 질문에서 이상한 일이 잦았습니다. 분명 문서에 있는 단어를 물었는데 검색이 안 됩니다. 비슷한 의미의 다른 문서만 계속 위에 뜹니다. 원인을 찾다 보니, 벡터 검색이 "의미가 비슷한가"는 잘 재는데 "그 단어가 실제로 …
RAG 답변 품질을 재는 정량 프레임워크가 있습니다. RAGAS, TruLens 같은 도구가 답변의 충실도(faithfulness), 관련성, 맥락 적합성을 점수로 냅니다. 처음엔 이런 걸 달아야 하나 고민했습니다. 그런데 막상 혼자 쓰는 RAG를 짜고 보니, 정량 점수보다 답이 거짓말을 안 하게 만드는 "코드"가 먼저…
멀티모달 RAG라는 말을 처음 들었을 때, 이미지를 임베딩해서 문서 텍스트와 같은 벡터 공간에 올리는 걸 상상했습니다. CLIP 같은 모델로 그림과 글을 하나의 공간에 두면, "이런 느낌의 다이어그램 찾아줘" 같은 질문도 답이 나올 것 같았죠.
RAG를 "문서 검색"이라고만 생각하면 놓치는 게 많습니다. 제가 실제로 자연어로 묻고 싶은 질문의 절반은 문서가 아니라 데이터베이스에 들어있는 구조화된 데이터에 대한 것이었습니다. "이 철제장에 뭐 있지", "이 브랜드 물건 중 정리 대기 걸린 건 뭐지", "유효기간 지난 거 있어?". 이런 건 문서로 안 적어둡니다.…
ChatGPT에 문서를 전부 올리면 끝나는 일 아닌가,라고 한동안 생각했습니다. 그런데 제가 쓰는 데이터를 전부 올리는 건 사정이 달랐습니다. 재고 목록, 영업 리드, 기도 기록, 가계부까지 한 사람의 전 삶이 들어있는 DB였거든요. 그래서 로컬 LLM 기반 RAG를 직접 짰습니다. 이 글은 그 과정에서 내린, 그리고 …
9회 Cohere에 이어 열 번째이자 마지막은 NVIDIA입니다. 지금까지 다룬 아홉 회사는 전부 Llama·Qwen·Mistral을 기반 모델로 삼아 그 위에 자기 모델을 세웠습니다. NVIDIA는 그 기반 모델이 학습되고 추론되는 GPU를 만듭니다. 그 회사가 정작 자기 이름 붙은 모델(Nemotron)까지 직접 만…
"모바일에서 사이트가 이상해요."
사내 문서 1,290건을 넣어 둔 RAG 챗봇이 있습니다. 검색은 그럭저럭 맞는 문서를 찾아오는데, 답변이 계속 얕았습니다. 맞는 말이긴 한데 한 줄로 끝나거나, "문서에서 충분한 근거를 찾지 못했습니다"가 나오는 일이 잦았습니다.
8회 LG EXAONE에 이어 아홉 번째는 캐나다의 Cohere입니다. 이 회사는 시리즈 전체에서 가장 독특한 출발점을 가집니다. 설립자 한 명이 이 모든 회사가 쓰는 아키텍처의 원조라는 점입니다. 에이든 고메즈(Aidan Gomez)는 2017년 'Attention Is All You Need', 즉 트랜스포머 논문의…
7회 OpenAI에 이어 여덟 번째는 LG AI Research의 EXAONE입니다. 지금까지 다룬 회사와 결이 다릅니다. 미국·중국·유럽의 빅테크나 스타트업이 아니라, 한국 재벌이 만든 연구소이기 때문입니다. 그리고 한국어라는 '저자원 언어'에서 글로벌 모델이 커버 못 하는 빈틈을 노렸다는 점에서 독자적인 자리를 갖습…
6회 Microsoft Phi에 이어 일곱 번째는 OpenAI입니다. 이 회사는 시리즈 전체에서 가장 모순적인 자리에 있습니다. 이름에 'Open'이 들어가지만, 실제로는 10년 가까이 가장 폐쇄적인 회사였거든요. 그래서 2025년 8월 5일 가중치를 공개했을 때의 충격은, 다른 어떤 회사의 발표보다 컸습니다.
5회 DeepSeek에 이어 여섯 번째는 Microsoft입니다. 지금까지의 회사들이 '누가 가장 크게 만드느냐'로 경쟁했다면, Microsoft는 반대 방향에서 '얼마나 작게 만들 수 있느냐'를 물었습니다. 그리고 그 작은 모델이 GPT-3.5급 품질에 도달한다는 것을 증명해, 업계 전체의 스케일링 신앙에 금을 냈습니…
4회 Alibaba Qwen에 이어 다섯 번째는 DeepSeek입니다. 지금까지의 회사들과 결이 다릅니다. 출신이 빅테크도 연구소도 아닌, 양적 헤지펀드이기 때문입니다. 그래서 이 회사의 이야기는 '어떻게 만들었느냐'보다 '어떻게 세계를 흔들었느냐'로 읽힙니다.
3회 Mistral에 이어 네 번째는 Alibaba의 Qwen입니다. 이 회사는 특이한 출발점을 가졌습니다. 첫 모델의 아키텍처가 Meta의 Llama를 기반으로 했다는 점입니다. 1회에서 Meta가 Llama를 풀어 생태계 표준을 잡겠다고 했었는데, 그 전략이 가장 큰 경쟁자인 중국을 키운 꼴이 되었습니다.
1회 Meta, 2회 Google에 이어 세 번째는 프랑스의 Mistral AI입니다. 이 회사는 두 가지 점에서 앞 두 회사와 다릅니다. 창업 4주 만에 1억 유로를 모금했고, 모델을 처음엔 블로그가 아니라 토렌트로 풀었습니다. 오픈소스 LLM의 문법을 사실상 다시 쓴 회사입니다.
1회 Meta에 이어 두 번째는 Google입니다. 특이한 점은 본질적으로 '폐쇄' 회사였다는 것입니다. Google은 수십 년간 자체 AI 소스코드를 비공개로 유지해 왔고, 그래서 2024년 Gemma를 푼 것은 방향 전환에 가까웠습니다. 왜 마음을 바꿨는지가 이 회의 핵심입니다.
이 연재는 오픈소스 LLM을 만드는 회사들의 역사, 자본 구조, 핵심 인물, 그리고 왜 가중치를 공개했는지를 따집니다. 첫 회은 Meta입니다. Llama 한 모델이 없었다면 오늘날 로컬 LLM 생태계 자체가 성립하지 않았을 것이기 때문입니다.
로컬에서 AI 모델을 돌리다 보면 이런 상식이 생깁니다. 모델이 크면 똑똑하지만 느리다. 대체로 맞습니다.
온프레미스 추론 서버에 모델이 25개, 154GB 쌓여 있었습니다. 저는 필요할 때마다 하나씩 받았고, 어느 시점부터 무엇을 왜 갖고 있는지 설명할 수 없게 됐습니다.