로컬 LLM용 GPU 선택: VRAM·속도·신품·중고 가격
작성·운영: 옵티웍 · 내용 검토:
로컬 LLM용 GPU는 VRAM에 원하는 모델이 들어가는지 먼저 확인하고, 같은 모델 조건에서 생성 속도를 비교한 뒤 가격을 판단하세요. 만원당 토큰 수만으로 실사용 가능 여부를 결정하면 안 됩니다.
1. 모델과 양자화부터 정하세요
모델 이름과 파라미터 수만으로 필요한 VRAM이 확정되지는 않습니다. 양자화, 입력 길이, KV 캐시, 런타임 여유 공간까지 필요합니다. 예를 들어 8B 모델을 4.8비트로 저장한 가중치는 약 4.8GB이지만, 실행에 필요한 전체 메모리는 이보다 큽니다. 이는 가중치 계산 예시이지 특정 GPU의 실행 보증이 아닙니다.
2. 같은 조건에서 속도를 비교하세요
비교할 GPU만 바꾸고 모델·양자화·컨텍스트·RAM 조건은 유지하세요. 이 사이트의 30 tok/s 목표를 참고하되, 자신의 작업에서 허용할 수 있는 대기 시간을 우선하세요. 메모리에 들어가더라도 생성 속도가 충분하지 않을 수 있고, RAM 오프로드는 용량 문제를 완화하지만 속도를 떨어뜨릴 수 있습니다.
만원당 tok/s는 같은 조건에서 비용 효율을 비교하는 지표입니다. 신품 가격과 중고 가격은 분리해서 비교하고, 가격이 확인되지 않은 제품은 가성비 순위만으로 판단하지 마세요.
3. 신품·중고 가격은 구매 직전에 다시 확인하세요
사이트 가격은 등록된 참고값이며 실시간 재고·판매가·거래 완료 가격을 보증하지 않습니다. 확인되지 않은 가격은 없는 값으로 취급합니다. 신품은 다나와 등 판매처의 배송비·보증·재고를, 중고는 중고나라 등 실제 매물의 상태·판매 시점·보증 잔여 기간을 확인하세요. 판매자의 호가는 거래가 성사된 가격과 다를 수 있습니다.
노트북 GPU·개조 GPU는 따로 비교하세요
같은 숫자의 모델명이라도 데스크톱 GPU와 Laptop GPU를 동일한 제품으로 취급하면 안 됩니다. VRAM, 대역폭, 전력 제한과 냉각 조건을 각각 확인하세요. 개조 VRAM 카드는 정규 제품과 보증·안정성·호환성 조건이 다를 수 있으므로 메모리 용량이나 가격만 보고 구매하지 마세요.
최종 결정 전에 확인할 것
- 원하는 모델이 목표 컨텍스트에서 메모리에 들어가는가?
- 예상 속도와 첫 답변 대기 시간을 받아들일 수 있는가?
- 사용할 런타임이 해당 GPU·운영체제를 지원하는가?
- 케이스 공간, 전원 공급, 냉각과 제품 보증을 확인했는가?