개발자

로컬 LLM VRAM 계산기

이 모델, 내 GPU에 돌아갈까? — 양자화별 가중치 + KV 캐시 + 오버헤드를 llama.cpp 실측 기준으로.

최종 업데이트 2026년 7월· llama.cpp quantize README 실측 bpw · HuggingFace 공식 config.json (Llama·Qwen·Gemma·EXAONE 등 13종)· 출처: llama.cpp · HuggingFace

모델

양자화 (GGUF)

용량·품질 균형 — 기본 추천 · 약 4.89 bit/가중치 (llama.cpp 실측)

컨텍스트 길이

KV 캐시 정밀도

Llama 3.1 8B · Q4_K_M · 8K 컨텍스트

8.0GB

가중치 4.9 + KV 캐시 1.1 + 오버헤드 약 2.0GB

가중치KV 캐시오버헤드(관행)

내 GPU에 들어갈까?

필요 8.0GB / 가용 12GB → ✅ 여유 있게 구동 가능

양자화가중치총 필요판정
Q2_K3.2GB6.2GB여유
Q3_K_M4.0GB7.1GB여유
Q4_K_M4.9GB8.0GB여유
Q5_K_M5.7GB8.8GB여유
Q6_K6.6GB9.7GB여유
Q8_08.5GB11.6GB빠듯
F1616.1GB19.1GB불가

총 필요 = 가중치 + KV 캐시(8K·F16) + 오버헤드 2GB. 실효 bpw는 모델별 ±1~2% 편차가 있어(대형 모델은 소폭 과대) ‘약’으로 보세요.

본 도구는 참고용입니다
  • 입력값·환경에 따라 결과가 달라질 수 있으며 정확성을 보장하지 않습니다.
  • 중요한 의사결정에는 전문가 조언을 받으세요.
  • 가중치·KV 캐시는 llama.cpp 실측 기반 산술값, 오버헤드는 커뮤니티 관행 추정치입니다. 실제 사용량은 런타임(llama.cpp·ollama·vLLM)·드라이버·배치 설정에 따라 달라지므로 1~2GB 여유를 두고 판단하세요.
알아두면 좋아요

필요 VRAM은 이렇게 계산해요

가중치 = 파라미터 수 × 실효 bit ÷ 8
KV 캐시 = 2 × 레이어 × KV헤드 × head_dim × 컨텍스트 × 2B
총 필요 = 가중치 + KV 캐시 + 오버헤드(1~2GB 관행)
📌 검산 앵커: Llama 3.1 8B Q4_K_M = 8.03B × 4.8944 ÷ 8 = 4.91GB (실제 파일 4.92GB, 오차 0.2%) · KV는 토큰당 128KiB → 32K 컨텍스트에서 4.3GB. 최신 모델은 GQA 덕분에 KV헤드가 8개 수준이라 KV 캐시가 구세대(MHA)보다 4배 이상 작아요.

양자화별 크기 — Llama 3.1 8B 기준 실측

양자화bit/가중치8B 파일70B 파일용도
Q2_K3.163.18GB26.4GB최후 수단
Q3_K_M4.004.02GB34.3GBVRAM 부족 시
Q4_K_M4.894.92GB42.5GB기본 추천
Q5_K_M5.705.73GB50.0GB여유 있으면
Q6_K6.566.60GB57.9GB고품질
Q8_08.508.54GB75.0GB사실상 무손실
F1616.014.96GB141GB+원본

※ bit/가중치는 llama.cpp quantize README의 Llama-3.1-8B 실측값, 파일 크기는 bartowski GGUF 저장소 공표값. 모델·아키텍처에 따라 실효 bit은 ±1~2% 달라집니다.

GPU별 돌아가는 모델 — 한눈에

양자화별 크기를 알아도 ‘그래서 내 카드엔 뭐가 올라가나’가 남죠. 위 계산기를 모델 6종 × GPU 7종으로 돌려, 각 조합에서 표기 용량(8GB=8GiB로 환산)의 92% 이하로 들어가는 가장 높은 양자화를 뽑았습니다.

컨텍스트 8K · KV 캐시 F16 · GPU 표기 용량을 GiB(×230)로 환산한 바이트의 92% 이하 사용 기준. 셀의 GB는 10진 GB라 표기 숫자끼리 나눈 비율은 이보다 커 보입니다(예: 24GB 카드의 22.7GB = 실제 88%). 본 계산기와 같은 공식으로 산출한 값 — 실측은 런타임(llama.cpp·ollama·vLLM)·OS·드라이버에 따라 다릅니다.
GPU (가용 VRAM)Llama 3.1 8BQwen3 14BMistral Small 3 24BQwen3 32BGemma 3 27BLlama 3.3 70B
RTX 4060 (8GB)Q3_K_M
7.1GB
RTX 4070 (12GB)Q8_0
11.6GB
Q3_K_M
10.7GB
RTX 4080 / 5080 (16GB)Q8_0
11.6GB
Q6_K
15.5GB
Q3_K_M
15.1GB
Q2_K
14.0GB
RTX 4090 / 3090 (24GB)F16
19.1GB
Q8_0
19.1GB
Q6_K
22.7GB
Q3_K_M
20.5GB
Q5_K_M
22.7GB
RTX 5090 (32GB)F16
19.1GB
Q8_0
19.1GB
Q8_0
28.4GB
Q6_K
31.1GB
Q6_K
25.6GB
Mac 32GB (가용 24GB)F16
19.1GB
Q8_0
19.1GB
Q6_K
22.7GB
Q3_K_M
20.5GB
Q5_K_M
22.7GB
Mac 64GB (가용 48GB)F16
19.1GB
F16
32.9GB
Q8_0
28.4GB
Q8_0
39.0GB
Q8_0
32.3GB
Q3_K_M
39.9GB

는 8K 컨텍스트에서 92% 기준을 통과하는 양자화가 하나도 없다는 뜻 — 해당 GPU 단독으로는 어렵고 멀티 GPU·CPU 오프로딩·통합메모리를 검토해야 합니다. 는 같은 GiB 환산 기준으로 90%를 넘겨 위 계산기가 ‘빠듯’으로 판정하는 조합이에요. Mac은 Metal 기본 상한(통합메모리의 약 75%)을 가용 용량으로 잡았고, 총량에는 오버헤드 2.0GB가 포함돼 있습니다(공식 수치가 아닌 커뮤니티 관행치).

📌 읽는 법: 24GB가 분수령입니다 — 8B는 F16 원본, 14B는 Q8_0, 24B·27B는 Q5~Q6까지 올라가요. 16GB에서는 24B가 Q3_K_M, 27B가 Q2_K로 내려가 품질 타협이 시작되고, 32B를 Q6_K로 쓰려면 32GB가 필요합니다. 70B는 Mac 64GB(가용 48GB)의 Q3_K_M이 표에서 유일한 통과 조합이에요. 8GB가 Q3_K_M인 것도 컨텍스트 8K를 잡았기 때문 — 4K로 줄이면 Q4_K_M(아래 표의 총 7.4GB)도 같은 기준을 통과합니다.

컨텍스트가 VRAM을 얼마나 먹나

KV 캐시는 컨텍스트 길이에 정비례합니다. 같은 모델·같은 양자화라도 컨텍스트를 어디까지 열어두느냐로 필요량이 3배 넘게 벌어져요.

Llama 3.1 8B · Q4_K_M · KV 캐시 F16 기준. 본 계산기와 같은 공식으로 산출한 값 — 실측은 런타임·OS·드라이버에 따라 다릅니다.
컨텍스트KV 캐시총 필요KV 비중
4K (4,096)0.54GB7.4GB7%
8K (8,192)1.07GB8.0GB13%
32K (32,768)4.29GB11.2GB38%
128K (131,072)17.18GB24.1GB71%

Q4_K_M 기준 모델별 소요량 — 가중치 + KV + 오버헤드

컨텍스트 8K · KV 캐시 F16 기준. 본 계산기와 같은 공식으로 산출한 값 — 실측은 런타임·OS·드라이버에 따라 다릅니다. 오버헤드 2.0GB는 공식 규격이 아니라 CUDA 런타임 + 컴퓨트 버퍼를 잡아둔 커뮤니티 관행치입니다.
모델가중치KV(8K)오버헤드총 필요
Llama 3.1 8B4.9GB1.07GB2.0GB8.0GB
Qwen3 14B9.1GB1.34GB2.0GB12.4GB
Mistral Small 3 24B14.4GB1.34GB2.0GB17.8GB
Gemma 3 27B16.8GB1.17GB2.0GB19.9GB
Qwen3 32B20.1GB2.15GB2.0GB24.2GB
Llama 3.3 70B43.2GB2.68GB2.0GB47.9GB
📌 실전 결론 — 128K는 가중치보다 캐시가 큰 영역: Llama 3.1 8B는 Q4_K_M 가중치가 4.9GB뿐이지만, 컨텍스트를 128K까지 열면 KV 캐시만 17.18GB로 불어나 총 24.1GB — 총량의 71%가 캐시입니다. 즉 128K 컨텍스트는 8B 모델도 24GB급 카드가 필요합니다. 반대로 8K로 제한하면 같은 모델이 8.0GB로 끝나요. 긴 컨텍스트가 꼭 필요하다면 KV 정밀도를 Q8_0으로 낮춰 캐시를 절반으로 줄이는 게 첫 카드고(위 계산기의 ‘KV 캐시 정밀도’에서 바로 비교 가능), 32B급은 가중치 20.1GB에 KV·오버헤드가 붙어 총 24.2GB가 되기 때문에 24GB 카드에서 Q3_K_M으로 내려가게 됩니다.

VRAM이 모자랄 때 — 우선순위 3가지

1️⃣ KV 캐시 양자화

Q8_0 KV는 품질 영향이 거의 없이 캐시를 절반으로. 긴 컨텍스트를 쓴다면 가장 먼저 시도할 옵션이에요.

2️⃣ 컨텍스트 줄이기

KV 캐시는 컨텍스트에 정비례합니다. 128K를 다 쓸 일이 없다면 8~16K로 제한하는 것만으로 수 GB가 절약돼요.

3️⃣ 양자화 한 단계 아래로

Q4_K_M→Q3_K_M은 8B 기준 약 0.9GB 절약. 품질 타협이 시작되는 지점이라 마지막 카드로 쓰세요.

자주 묻는 질문 (FAQ)

Q1. 왜 모델 파일 크기보다 VRAM이 더 필요한가요?

VRAM에는 가중치(=파일 크기) 외에 두 가지가 더 올라갑니다. ① KV 캐시 — 대화 컨텍스트를 기억하는 메모리로, 컨텍스트 길이에 정비례해 커집니다(Llama 3.1 8B는 토큰당 128KiB → 32K 컨텍스트에서 약 4.3GB). ② 런타임 오버헤드 — CUDA 컨텍스트와 연산 버퍼로 1~2GB. 그래서 4.9GB짜리 Q4_K_M 8B 모델도 8GB GPU에서 긴 컨텍스트를 쓰면 빠듯해집니다.

Q2. 양자화는 어떤 걸 골라야 하나요?

커뮤니티 기본 추천은 Q4_K_M(약 4.89bit/가중치)입니다 — 원본 대비 품질 저하가 작으면서 용량이 F16의 약 30%예요. VRAM에 여유가 있으면 Q5_K_M·Q6_K로 올리고, 부족하면 Q3_K_M까지 내려볼 수 있습니다. Q2_K는 품질 손실이 눈에 띄게 커서 큰 모델을 억지로 구겨 넣을 때의 최후 수단으로 보세요. 같은 양자화라도 모델에 따라 실효 bit이 ±1~2% 다릅니다.

Q3. 8GB GPU로는 어떤 모델까지 가능한가요?

7~8B급 Q4_K_M(가중치 약 4.7~4.9GB)이 현실적인 상한입니다. 짧은 컨텍스트(4~8K)라면 여유 있게 돌고, 32K 이상 긴 컨텍스트는 KV 캐시를 Q8_0으로 양자화하면 가능해요. 12~14B는 Q3 계열로 내려야 해서 품질 타협이 필요합니다. 위 계산기에서 GPU를 선택하면 양자화별 판정을 한눈에 볼 수 있어요.

Q4. 70B 모델을 로컬에서 돌릴 수 있나요?

Q4_K_M 기준 가중치만 약 42.5GB라 단일 소비자 GPU(최대 32GB)로는 불가능합니다. 현실적인 방법은 ① 24GB×2 등 멀티 GPU, ② Mac 통합메모리 64GB 이상(GPU 가용 약 48GB), ③ Q2_K(약 26GB)로 낮춰 32GB급에서 구동 — 단 품질 저하 감수. CPU 오프로딩도 가능하지만 속도가 크게 떨어집니다.

Q5. Mac 통합메모리는 왜 75%만 계산하나요?

macOS의 Metal은 기본적으로 통합메모리의 약 75%까지만 GPU 작업 영역으로 허용합니다(recommendedMaxWorkingSetSize, 소용량 기기는 65~70% 수준). 예를 들어 32GB Mac이면 GPU 가용은 약 24GB예요. sysctl iogpu.wired_limit_mb로 상한을 올릴 수 있지만 시스템용 메모리를 침범하므로 OS·앱용 여유를 남겨두는 게 안전합니다.

Q6. KV 캐시 양자화(Q8_0·Q4_0)는 써도 되나요?

llama.cpp의 --cache-type-k/v 옵션으로 KV 캐시를 F16의 절반(Q8_0)이나 1/4(Q4_0)로 줄일 수 있습니다. Q8_0은 품질 영향이 거의 없어 긴 컨텍스트의 표준 선택이고, Q4_0은 장문에서 품질·속도 저하 보고가 있어 신중하게 쓰세요. V 캐시 양자화는 플래시 어텐션 활성화가 필요합니다. 예: 8B 모델 32K 컨텍스트의 KV가 4.3GB→2.1GB로 줄어 16GB GPU 여유가 생깁니다.

Q7. Gemma 3는 왜 KV 캐시가 유난히 작게 나오나요?

Gemma 3는 슬라이딩 윈도 어텐션(SWA) 구조로, 6개 레이어 중 5개는 최근 1,024토큰만 보고 1개만 전체 컨텍스트를 봅니다. 그래서 일반 공식으로 계산하면 5~6배 과대 추정돼요(27B 128K 기준 나이브 66GB vs 실제 약 12GB). 이 계산기는 llama.cpp의 iSWA 구현 기준으로 글로벌/로컬 레이어를 분리 계산합니다.

함께 쓰면 좋은 도구

🪙

AI 토큰 카운터

GPT·Claude 토큰·비용

🛠️

기술 스택 추천기

프로젝트 풀스택 추천

📋

JSON 포맷터

정렬·검증·타입 생성

🔐

Base64 인코더

텍스트↔Base64 변환

🔢

진법 변환기

2·8·10·16진수 변환

📏

단위 변환기

GB·GiB 등 14종 환산