FreeToken 초당 토큰 수: 2026년 벤치마크 가이드 - 벤치마크

FreeToken 초당 토큰 수: 2026년 벤치마크 가이드

FreeToken 초당 토큰 수 결과를 읽고, 하드웨어를 비교하며, 2026년 로컬 MoE 추론 성능을 향상하는 방법을 알아보세요.

2026-08-25
FreeToken 팀
빠른 가이드
  • FreeToken 초당 토큰 수는 GPU 캐시 적중률, 시스템 메모리, PCIe 대역폭에 따라 달라집니다.
  • RTX 3090 테스트에서는 로컬 환경에서 약 10~11 디코드 토큰/초를 기록했습니다.
  • 데스크톱 클라이언트 결과는 유사한 테스트에서 약 8.8 토큰/초로 측정되었습니다.
  • 모델 선택이 중요한 이유는 MoE 모델과 밀집 모델의 메모리 요구량이 크게 다르기 때문입니다.
  • 가장 효과적인 개선 방법은 대개 더 빠른 메모리, 더 많은 사용 가능 RAM, 백그라운드 부하 감소입니다.

FreeToken 초당 토큰 수: 이 지표의 의미

FreeToken 초당 토큰 수는 프롬프트 처리가 끝난 후 로컬에서 제공되는 언어 모델이 출력을 생성하는 속도, 즉 디코드 처리량을 의미합니다. 이는 첫 번째 토큰까지 걸리는 시간, 프롬프트 처리 속도, 전체 응답 시간과는 다른 지표입니다. 대화형 채팅에서는 답변이 표시되는 동안 사용자가 주로 체감하는 수치가 바로 디코드 처리량입니다.

FreeToken은 대규모 혼합 전문가 모델을 위한 엣지 네이티브 서빙 시스템입니다. 이 시스템은 전체 전문가 풀을 호스트 메모리에 유지하면서, 사용 가능한 GPU 메모리를 탄력적인 전문가 캐시로 활용합니다. 따라서 성능은 그래픽 카드뿐 아니라 시스템 전체에 의해 결정됩니다.

영상 하이라이트:

  • 단일 RTX 3090 환경에서 약 10~11 디코드 토큰/초를 기록했습니다.
  • 이후 테스트에서 데스크톱 클라이언트는 약 8.8 토큰/초를 보고했습니다.
  • 시스템 RAM 용량과 대역폭이 주요 성능 요인으로 확인되었습니다.
  • 백그라운드 애플리케이션은 사용 가능한 VRAM을 줄이고 처리량에 영향을 줄 수 있습니다.
지표의미중요한 이유
초당 디코드 토큰 수생성된 출력 속도대화형 응답성을 나타냄
프롬프트 처리 속도입력 토큰 처리 속도긴 프롬프트의 시작 지연에 영향
첫 번째 토큰까지 걸리는 시간출력이 시작되기 전의 지연 시간에이전트와 대규모 컨텍스트에서 중요
전체 응답 시간전체 요청에 걸린 시간프롬프트 처리 비용과 디코드 비용을 합산

공개된 FreeToken 연구 논문은 측정된 호스트 메모리와 PCIe 대역폭에 맞춰 시스템이 실행 방식을 조정한다고 설명합니다. 이것이 동일한 GPU를 사용하는 두 컴퓨터에서도 결과가 눈에 띄게 달라질 수 있는 이유입니다.

수치 읽는 방법

초당 토큰 수를 고정된 제품 사양이 아니라 작업 부하를 측정하는 지표로 보세요. 모델, 컨텍스트 길이, 사고 모드 또는 메모리 조건을 변경하면 결과가 크게 달라질 수 있습니다.

구성별 FreeToken 관찰 성능

현재 이용 가능한 테스트에서는 서버 측 측정값과 데스크톱 클라이언트 측 측정값 사이에 실질적인 차이가 나타납니다. 단일 RTX 3090에서 DeepSeek V4 Flash는 일반적인 채팅 프롬프트를 처리할 때 초당 10~11토큰 수준을 유지했습니다. 별도의 데스크톱 클라이언트 실행에서는 초당 8.8토큰이 보고되었습니다. 이 수치는 유용한 참고 기준이지만 보편적으로 보장되는 등급은 아닙니다.

차이는 클라이언트 오버헤드, 운영 체제 동작, 모델 설정, 백그라운드 프로세스 또는 측정 편차에서 발생할 수 있습니다. 사고 모드도 작업 부하를 변화시킵니다. 최대 추론으로 생성된 응답은 짧고 직접적인 답변보다 표시되는 출력 속도가 낮고 완료 과정이 더 길 수 있습니다.

구성모델 또는 모드보고된 디코드 속도실질적인 해석
단일 RTX 3090DeepSeek V4 Flash, 로컬 서버약 10~11 tok/s대화형 채팅에 적합
데스크톱 클라이언트DeepSeek V4 Flash, 사고 기능 활성화약 8.8 tok/s설정이 간편하지만 결과는 다소 느림
단일 RTX 4090 비교DeepSeek V4 Flash고정된 결과는 제공되지 않음하드웨어 비교 기준으로 활용
RTX PRO 6000 연구 등급GLM-5.2 NVFP414.9 tok/s프런티어급 규모의 시연
RTX 5090 연구 등급DeepSeek V4 Flash22~25 tok/s연구 벤치마크이며 3090의 기대치가 아님

연구 평가에서 최신 하드웨어가 더 높은 결과를 보인 것은 최적화된 서빙 런타임, 측정된 대역폭 스케줄링, 특정 벤치마크 조건을 사용했기 때문입니다. 이러한 수치를 소비자용 데스크톱 예상치에 그대로 적용해서는 안 됩니다.

대화형 채팅

일반적인 로컬 대화에서는 프롬프트와 모델 동작에 따라 약 8~11 tok/s도 충분히 빠르게 느껴질 수 있습니다.

에이전트 작업

도구 호출과 반복되는 긴 프롬프트에서는 디코드 속도만큼 첫 번째 토큰까지 걸리는 시간이 중요합니다.

추론 모드

하드웨어가 동일하더라도 장시간 사고 과정은 표시되는 속도를 낮추고 전체 완료 시간을 늘릴 수 있습니다.

유용한 비교 방법은 각 구성에서 동일한 모델, 프롬프트 유형, 컨텍스트 크기, 생성 설정으로 테스트하는 것입니다. 한 번의 완료 결과에 의존하지 말고 여러 응답을 기록하세요. MoE 라우팅은 토큰마다 달라지므로 개별 결과에는 변동이 생길 수 있습니다.

벤치마크 조건을 섞지 마세요

데스크톱 클라이언트 결과, 서버 측 측정값, 연구 벤치마크는 서로 다른 런타임과 설정을 사용할 수 있습니다. 모든 테스트 조건이 일치하지 않는 한 결과는 방향성 위주로 비교하세요.

처리량을 바꾸는 하드웨어 요인

FreeToken에서는 성능 논의의 중심이 순수한 GPU 연산 능력에서 메모리 이동으로 상당 부분 이동합니다. 혼합 전문가 모델은 각 토큰마다 매개변수의 일부만 활성화하지만, 전체 전문가 풀이 시스템 메모리에 계속 준비되어 있어야 할 수 있습니다. 전문가가 GPU에 캐시되어 있지 않으면 런타임은 해당 전문가를 PCIe를 통해 전송하거나 CPU에서 직접 실행할 수 있습니다.

따라서 시스템 메모리 용량이 중요합니다. 테스트에 따르면 일부 로컬 구성에서는 32GB가 시작점이 될 수 있지만, 64GB가 더 여유로운 환경을 제공합니다. 더 큰 모델에는 훨씬 더 많은 메모리가 필요할 수 있습니다. 연구 자료에서는 특히 프런티어급 모델을 위해 수백 GB의 호스트 메모리가 필요한 배포 환경도 설명합니다.

하드웨어 요인FreeToken에 미치는 영향권장 해석
GPU VRAM전문가 캐시 용량을 결정VRAM이 많을수록 캐시 미스 감소 가능
시스템 RAM 용량호스트에 상주하는 전문가를 저장사용 가능한 RAM이 부족하면 로딩 불가
RAM 대역폭CPU 실행과 전송을 지원더 빠른 메모리가 디코드 성능을 향상할 수 있음
PCIe 링크 폭전문가 전송 속도를 제어일반적으로 x16이 x8보다 더 큰 여유를 제공
백그라운드 GPU 사용사용 가능한 VRAM을 감소브라우저, 녹화 도구, 게임이 간섭할 수 있음
저장 장치 속도시작과 모델 로딩에 영향NVMe 저장 장치가 초기 로딩 지연을 줄일 수 있음

연구 논문은 전문가 전송에 대한 플랫폼 수준의 대략적인 차이를 보고합니다. PCIe 4.0 x16을 사용하는 RTX 4090 및 RTX 3090급 시스템은 프리필 과정에서 대규모 전문가 세트를 이동하는 데 수 초가 걸릴 수 있으며, 더 좁은 노트북 링크에서는 더 오래 걸릴 수 있습니다. 디코드 동작은 캐싱과 CPU 공동 실행이 전송 비용의 일부를 숨길 수 있기 때문에 다르게 나타납니다.

최적의 업그레이드 우선순위

단일 GPU FreeToken 시스템에서는 먼저 사용 가능한 RAM 용량을 확보하고, 그다음 메모리 대역폭과 PCIe 조건을 우선적으로 개선하세요. GPU 연산 성능만 추가하는 것으로는 호스트 메모리 병목이 해소되지 않을 수 있습니다.

깔끔한 테스트 환경도 중요합니다. 불필요하게 GPU를 많이 사용하는 소프트웨어를 종료하고, 여러 모델 서비스를 동시에 실행하지 않으며, 운영 체제를 위한 충분한 RAM을 남겨 두세요. 런타임에서 RAM 또는 VRAM 부족을 보고하는 경우 초당 토큰 수에 대한 기대치를 낮추는 것만으로는 로딩 문제가 해결되지 않습니다. 먼저 모델 구성이 시스템에 맞아야 합니다.

단계별 FreeToken 벤치마크 설정

이 과정을 사용해 신뢰할 수 있는 로컬 기준값을 측정하세요. 목표는 비정상적으로 높은 수치 하나를 추구하는 것이 아니라, 변화를 설명할 수 있는 반복 가능한 테스트를 만드는 것입니다.

1

시스템 기록

GPU 모델, VRAM, 시스템 RAM, RAM 세대와 속도, 운영 체제, PCIe 링크, 저장 장치 유형을 기록하세요. 이러한 세부 정보가 결과 간 차이의 많은 부분을 설명합니다.

2

하나의 모델 선택

모든 비교에서 동일한 지원 모델로 시작하세요. DeepSeek V4 Flash는 현재 제공된 단일 GPU 테스트에서 가장 명확한 참고 모델이며, 밀집 모델은 다르게 동작할 수 있습니다.

3

깨끗한 세션 준비

다른 GPU 작업과 백그라운드 추론 서비스를 종료하세요. 모델, 컨텍스트 크기, 온도, 사고 모드, 샘플링 설정을 일관되게 유지하세요.

4

런타임 예열

결과를 기록하기 전에 짧은 프롬프트를 하나 보내세요. 첫 번째 응답에는 로딩 및 캐시 예열 비용이 포함될 수 있으며, 이는 안정 상태의 디코드 속도를 대표하지 않을 수 있습니다.

5

여러 실행 결과 평균

비교 가능한 프롬프트를 최소 세 번 실행하고 표시된 디코드 속도, 프롬프트 처리 속도, 첫 번째 토큰까지 걸리는 시간을 기록하세요. 가장 높은 결과 대신 중앙값이나 평균을 사용하세요.

테스트 변수일정하게 유지할 항목기록 예시
모델동일한 체크포인트와 양자화DeepSeek V4 Flash
프롬프트비슷한 길이와 작업짧은 사실 질문
생성동일한 사고 및 샘플링 모드사고 기능 활성화 또는 비활성화
런타임동일한 클라이언트 또는 서버 경로데스크톱 클라이언트 또는 API 서버
결과여러 실행 결과 기록10.5, 10.1, 10.8 tok/s

데스크톱 클라이언트와 서버 연결 인터페이스를 비교할 때는 각각 별도로 테스트하세요. 현재 결과에 따르면 데스크톱 경로는 편리하지만 측정 속도는 더 낮을 수 있습니다. 그렇다고 모든 작업에서 모델이 자동으로 더 느리다는 뜻은 아닙니다. 인터페이스와 런타임 경로를 기록해야 한다는 의미입니다.

벤치마크 팁

표시된 속도와 응답 조건을 모두 기록하세요. 모델, 컨텍스트, 런타임, 사고 모드에 대한 세부 정보가 없는 수치는 재현하거나 비교하기 어렵습니다.

최적화 체크리스트와 일반적인 한계

FreeToken의 가장 큰 장점은 GPU 메모리, 호스트 메모리, CPU 실행, PCIe 전송을 조율하는 데서 나옵니다. 따라서 실질적인 튜닝은 모델을 변경하거나 더 높은 출력 속도를 기대하기 전에 피할 수 있는 리소스 경합을 제거하는 것부터 시작해야 합니다.

성능 체크리스트:

  • 모델이 사용 가능한 시스템 RAM과 VRAM에 맞는지 확인
  • 시스템에서 사용할 수 있는 가장 빠르고 안정적인 RAM 구성 사용
  • 벤치마크 전에 불필요하게 GPU를 많이 사용하는 애플리케이션 종료
  • 모델, 프롬프트 길이, 사고 설정을 일관되게 유지
  • 여러 번 예열 테스트를 실행하고 초당 토큰 수의 중앙값 기록
증상가능한 원인첫 번째 조치
모델이 시작되지 않음사용 가능한 RAM 또는 VRAM 부족더 작은 모델을 선택하거나 메모리 추가
속도가 크게 변동함전문가 라우팅 및 캐시 미스여러 실행 결과의 평균 계산
데스크톱 결과가 더 낮음클라이언트 또는 런타임 오버헤드서버 경로와 비교
초기 지연이 김프리필 또는 전문가 로딩 비용첫 번째 토큰까지 걸리는 시간을 별도로 측정
다른 애플리케이션이 추론을 느리게 함GPU 또는 메모리 리소스 공유백그라운드 작업 종료

현재 테스트에서는 소프트웨어 성숙도도 고려 사항으로 확인됩니다. FreeToken은 베타 소프트웨어로 설명되어 있으며, 테스트 중 하나의 밀집 Qwen 구성이 예기치 않게 종료되었습니다. 모델 실행 실패는 초당 토큰 수 결과가 아니라 호환성 또는 리소스 문제로 판단해야 합니다.

문제를 해결하려면 로그를 확인하고, 모델이 지원하는 형식을 검증하며, 운영 체제와 다른 애플리케이션이 사용한 메모리를 제외한 뒤 사용 가능한 메모리를 확인하세요. 그런 다음 런타임을 다시 시작하고 테스트를 반복하세요. 한 번의 실행 실패를 모든 모델 구성이 호환되지 않는다는 증거로 해석하지 마세요.

호환성 한계

개념적으로는 적합한 모델이라도 정밀도 형식, 런타임 지원, 메모리 등록 또는 사용 가능한 호스트 리소스 때문에 실행에 실패할 수 있습니다. 속도를 비교하기 전에 호환성을 확인하세요.

Q: RTX 3090에서 FreeToken 초당 토큰 수가 어느 정도면 좋은 결과인가요?

현재 제공된 단일 GPU 테스트에서는 DeepSeek V4 Flash로 약 10~11 디코드 토큰/초를 기록했습니다. 이를 보장된 사양이 아니라 실질적인 참고 기준으로 보세요.

Q: 데스크톱 클라이언트가 초당 약 8.8토큰을 보고한 이유는 무엇인가요?

데스크톱 클라이언트에는 다른 런타임 동작, 인터페이스 오버헤드, 메모리 조건 또는 설정이 포함될 수 있습니다. 이 결과는 대화형 로컬 추론과 대체로 일관되지만, 동일한 조건에서 비교해야 합니다.

Q: 시스템 RAM이 많을수록 항상 초당 토큰 수가 증가하나요?

더 많은 RAM은 주로 모델을 로드할 수 있는지와 사용 가능한 캐시 공간이 얼마나 남는지를 결정합니다. 용량이 충분해지면 처리량에는 RAM 대역폭과 PCIe 동작이 더 큰 영향을 줄 수 있습니다.

Q: 동일한 GPU를 사용하는 두 컴퓨터의 성능이 다른 이유는 무엇인가요?

전문가가 VRAM에 상주하지 않을 때 FreeToken은 호스트 메모리와 PCIe 전송을 사용합니다. RAM 대역폭, PCIe 링크 폭, 백그라운드 애플리케이션, 운영 체제 동작, 런타임 선택이 모두 결과를 바꿀 수 있습니다.