RAG vs Fine-tune — 2026년 시점의 결정 가이드
2023년 답: 거의 항상 RAG. 2026년 답: *조건부*. 4가지 결정 변수와, 둘을 *조합* 하는 게 답인 케이스.
2023년의 답은 깔끔했다 — RAG 가 거의 항상 답. 2024년에 fine-tuning 비용 = $thousands per run, RAG 비용 = vector DB 운영비. fine-tune 의 데이터 큐레이션 + retrain 사이클 도 컸다.
2026년 답은 조건부 다. 4 변수가 결정을 가른다.
변수 1 — 지식이 변하는 빈도
변경 빈도 | 권장
─────────────────────────┼──────────────
주 1회 이상 | RAG (fine-tune 따라잡지 못함)
월 1회 | RAG
분기 1회 | 둘 다 OK
연 1회 | fine-tune 가능
거의 안 변함 | fine-tune 권장지식이 자주 변하는 도메인 (회사 정책, 신규 제품 기능, 시장 데이터) = RAG. 거의 안 변하는 도메인 (의학 분야 기초, 법조문 해석, 회사 style guide) = fine-tune.
변수 2 — 검색의 정확도
RAG 의 핵심은 검색. 검색이 정확하면 RAG 는 fine-tune 보다 좋음. 부정확하면 fine-tune 보다 나쁨.
검색 정확도 (top-1 hit rate) | 권장
─────────────────────────────┼──────────────
> 80% | RAG
60~80% | RAG + fine-tune 조합
< 60% | fine-tune검색 정확도는 embedding model + chunking 전략 으로 결정. 범용 embedding (ada-002 급, 폐쇄망이면 BGE-M3 같은 오픈 웨이트 모델) + 1024 토큰 chunk 면 보통 60~70%. 도메인 특화 embedding 으로 5~10% 추가.
변수 3 — style / format 일관성 요구
도메인 지식 정확도가 아니라 답변의 form 자체 가 정해져 있어야 하는 경우. 예:
- 모든 답변이 한국어 존댓말 (반말 X)
- 모든 답변이 3 문단 (긴 글 X)
- 모든 답변이 우리 회사의 톤
이런 style 통일 은 RAG 로 어려움. system prompt 로 강제 도 부분적. fine-tune 이 답.
CollabOps 사례 — 사용자에게 답변할 때 우리 톤 (특정 단어 우선, 특정 표현 회피). RAG + system prompt 만으로는 80% 일관성. fine-tune 후 95%+.
변수 4 — 비용 함수
시나리오 | RAG 비용 | Fine-tune 비용
──────────────────────────────────┼─────────────┼────────────────
초기 셋업 | $5,000 | $30,000+ (데이터 큐레이션 80%)
월 운영 비용 | $1,500 | $300 (단순 inference)
지식 갱신 (월 1회) | $200 | $5,000 (re-train)
모델 갱신 (분기 1회, 새 base 모델)| $0 | $30,000 (재 fine-tune)지식이 자주 갱신되거나 base 모델이 자주 변하면 RAG 압도적으로 싸다. 반대 시나리오면 fine-tune.
우리 결정 — 조합
CollabOps 의 결정은 둘 다 사용:
용도 | 방법
──────────────────────────┼────────────────────────────
도메인 지식 (자주 변함) | RAG (pgvector + Qwen2.5-Coder-32B)
회사 톤 / 답변 form | Fine-tune (Llama 3 base + 약 800 예시)
사용자 인터페이스 응답 | RAG + fine-tune 모델 (둘이 함께)
배경 분석 / 리포트 | RAG + 큰 모델 (Llama 3.3 70B, GPU 2장)이 조합이 6개월 후 정착한 답. 처음엔 RAG 만 시도, style 일관성 약함을 알고 fine-tune 추가.
전부 오픈 웨이트 모델 + self-hosted 스택인 건 취향이 아니라 요건이다. 우리 고객 대부분이 폐쇄망이라, 우리가 내부에서 검증한 구성을 그대로 고객 GPU 위에 들고 들어가야 한다. 벡터 스토어도 별도 SaaS 없이 이미 운영 중인 Postgres 의 pgvector 로 충분했다. 국산 모델 요건이 있는 조직에는 EXAONE 계열로 교체 가능하다. 운영 디테일은 폐쇄망 Llama/Qwen 9개월 노트에 있다.
권장 의사결정 흐름
1. 지식이 자주 변하나?
예 → RAG
아니오 → 다음
2. 답변 form / style 의 일관성 요구가 있나?
예 → fine-tune (또는 RAG + fine-tune 조합)
아니오 → 다음
3. 검색 정확도가 80%+ 가능한가?
예 → RAG
아니오 → fine-tune
4. 둘 다 답이라면 — *비용 함수* 가 가르는 변수LLM 기반 도메인 시스템을 설계 중인 팀이라면 이 4단계 흐름 (지식 갱신 빈도 → style 일관성 → 검색 정확도 80% → 비용 함수) 을 결정 전에 한 번 돌려볼 것. 기본 가정 은 RAG 로 시작 — 그러나 4 변수 점검 후 fine-tune 또는 조합 이 답일 수 있음. 처음에 잘 결정하면 6개월 후 재설계 비용 ↓.
비슷한 글
에이전트 시대의 Eclipse 플러그인 — 작업 컨텍스트는 20년 전에도 문제였다
Mylyn 이 2000년대에 풀려던 문제와 지금 에이전트 컨텍스트 문제는 같습니다. 달라진 건 그 컨텍스트를 읽는 쪽에 사람만 있는 게 아니라는 점입니다.
김영상
에이전트 시대의 VS Code 확장 — 개발자는 에디터에서 무엇을 보는가
코드 작성 비용이 무너진 뒤 개발자의 시간은 판단과 승인으로 옮겨갔습니다. 그 일들이 왜 에디터 밖에 있으면 안 되는지, VS Code 확장을 만들며 내린 선택들.
이승백
이클립스는 그대로 쓰셔도 됩니다 — IDE 연동과 ITSM 연동에 대한 답
개발툴로 이클립스를 쓰는데 어떻게 연동되냐는 질문과, ITSM 과 연동되냐는 질문은 거의 항상 같이 나온다. 표준 Git 프로토콜이라는 답의 의미, 그리고 ITSM 연동 요구의 진짜 본질이 증적 체인이라는 이야기.
백재민