로컬 LLM 토큰 속도 계산 기준과 30 tok/s의 의미
작성·운영: 옵티웍 · 내용 검토:
토큰 속도는 모델·양자화·메모리 대역폭·실행 환경에 따라 달라집니다. 이 도구의 수치는 실측이 아닌 추정치이며, 30 tok/s는 대화형 사용을 비교하기 위해 정한 사이트 내부 목표입니다.
무엇을 계산하나요?
GPU, 모델, 양자화, 입력 컨텍스트와 시스템 RAM을 선택하면 모델 적재 가능 여부와 생성 속도(tok/s)를 추정합니다. 토큰은 모델이 처리하는 텍스트 단위이며 글자 수와 같지 않습니다. 같은 tok/s라도 언어와 토크나이저가 다르면 읽는 속도가 다르게 느껴질 수 있습니다.
생성 속도 추정 방식
기본 계산은 GPU 메모리 대역폭을 활성 모델 가중치 크기로 나눈 값에 아키텍처 효율을 반영하고, 연산량으로 추정한 상한과 비교합니다. 여기에 양자화 속도 계수와 MoE 보정 등을 적용합니다. 이 계수들은 도구의 휴리스틱이며 제조사의 보증 성능이 아닙니다.
가중치 크기(GB)는 파라미터 수(B) × 양자화 비트 ÷ 8로 근사합니다. 적재 판단에는 전체 모델 가중치, 컨텍스트 길이에 따른 KV 캐시, 실행 여유 공간을 합산합니다. MoE도 전체 모델 적재 용량을 고려하며, 활성 파라미터만큼의 VRAM만 필요하다고 가정하지 않습니다.
VRAM을 초과해 RAM 오프로드로 분류되면 GPU 경로와 시스템 RAM 경로의 처리 시간을 가중 합성합니다. 속도 감소는 오프로드 비율과 RAM 대역폭에 따라 달라지며 항상 일정한 비율은 아닙니다. 통합 메모리는 VRAM과 RAM을 별도 용량으로 중복 합산하지 않습니다.
자동 추천과 표시 속도는 어떻게 읽나요?
속도 체감 화면은 Q4_K_M·4K 기준으로 GPU 메모리에 완전히 들어가고 30 tok/s 이상인 모델 중 사이트 품질 점수가 높은 것을 자동 선택합니다. 해당 모델이 없으면 메모리에 들어가는 모델 중 가장 빠른 것을 보여주며, 30 tok/s 미만이라는 경고를 표시합니다. 품질 점수는 사이트 내부 평가이므로 모든 용도에서 최적이라는 뜻은 아닙니다.
화면의 tok/s는 중심 추정치입니다. 예시 답변은 공통 기준 토크나이저 cl100k_base로 사전에 토큰화합니다. 재생 시간은 기준 토큰 수 ÷ 예상 tok/s이며, 각 단어의 토큰이 모두 쌓였을 때 그 단어를 표시합니다. 선택한 모델의 토크나이저와 같다는 뜻은 아니며 단어 하나를 토큰 하나로 계산하지 않습니다. 첫 토큰 대기와 모델 로딩 시간은 이 재생에 포함하지 않습니다.
30 tok/s면 무조건 충분한가요?
아닙니다. 대화형 사용에서 장비를 비교하기 위한 목표일 뿐, 보편적인 합격 기준은 아닙니다. 짧은 질의응답과 긴 코드 생성은 요구가 다르고, 긴 입력에서는 생성 속도가 빨라도 첫 답변 대기가 길 수 있습니다. 가성비를 볼 때는 먼저 필요한 모델이 메모리에 들어가는지, 원하는 대기 시간을 만족하는지 확인하세요.
다운로드 없는 시뮬레이션과 실측의 차이
재생 버튼은 예시 문장을 예상 출력 시간에 맞춰 단어 단위로 보여 줍니다. 실제 AI 답변을 생성하거나 모델을 내려받지 않으며, 표시하는 기준 토큰은 공통 토크나이저의 결과이지 선택 모델의 실제 토큰화 결과가 아닙니다. 실측을 비교할 때는 같은 모델 파일·양자화·컨텍스트·출력 길이·런타임을 맞춰야 합니다. 노트북은 전력 한도와 발열도 함께 확인하세요.
계산 기준: 이 사이트의 속도 계산 구현과 시뮬레이터. 제품별 실측 벤치마크 전체를 보유했다는 의미가 아닙니다.