숫자로 따지는 장비 선택
감이 아니라 계산으로. 로컬 AI와 개발 환경에 필요한 장비를 실제 수치로 확인합니다.
계산기
- 로컬 LLM VRAM 계산기
모델·양자화·컨텍스트를 넣으면 필요한 VRAM과 돌아가는 그래픽카드를 알려줍니다.
- 로컬 AI 전기요금 계산기
GPU를 하루 몇 시간 돌리면 요금이 얼마나 오르는지, 누진 구간 이동까지 반영해 계산합니다.
- 파워서플라이 용량 계산기
CPU 최대 전력과 GPU 트랜지언트 스파이크, 다중 GPU 구성까지 반영한 권장 용량.
- 그래픽카드별 LLM 실행 가능표
VRAM 용량별로 어떤 모델이 몇 토큰 컨텍스트까지 올라가는지 한눈에.
글
- 컨텍스트 설정값과 채운 양을 따로 재봤다 — VRAM과 속도는 다른 쪽을 따라간다
num_ctx 설정값과 실제 채운 토큰 수를 한 번에 하나씩만 바꿔가며 측정했습니다. 속도는 채운 양을, VRAM은 설정값을 따라갔습니다.
- 레이어 4개만 CPU로 내려도 속도가 절반 — 오프로드 대가 실측
같은 모델에서 GPU 레이어 수만 바꿔가며 측정했습니다. 48개 중 4개를 CPU로 내리자 생성 속도가 49%로 떨어졌습니다. VRAM이 조금 모자란 것은 조금 느려지는 것이 아닙니다.
- 그래픽카드 전기요금, kWh당 300원 곱셈이 틀리는 이유
같은 GPU를 같은 시간 돌려도 집집마다 추가 요금이 2.7배까지 차이납니다. 누진 구간 이동과 기본요금 점프를 반영해 계산했습니다.
- TDP 340W짜리가 실제로는 222W — 파워 계산기를 실측으로 고쳤다
RTX 3060 두 장에서 추론 중 전력을 재보니 정격의 65%였습니다. 계산기가 과대평가하고 있어 작업 유형 항목을 추가했습니다. 트랜지언트는 왜 검증하지 못했는지도 적었습니다.
- 같은 GPU에서 모델만 바꿔도 토큰당 전기가 5.7배 차이났다
RTX 3060 두 장에서 모델 3종의 생성 속도와 소비 전력을 재고 토큰당 에너지로 환산했습니다. 비율은 5.7배지만 개인 사용에서 절대 금액은 작습니다. 언제 의미가 생기는지까지 정리했습니다.
- VRAM 계산기가 실제와 얼마나 맞는가 — RTX 3060 두 장으로 검증
로컬 LLM VRAM 계산식을 실제 할당량과 대조했습니다. 컨텍스트 증가에 따른 VRAM 증가분이 KV 캐시 이론값보다 2.3% 컸습니다. 측정 방법과 한계를 함께 공개합니다.