FreeToken tokens por segundo: Guía de benchmarks para 2026 - Benchmarks

FreeToken tokens por segundo: Guía de benchmarks para 2026

Aprende a interpretar los resultados de tokens por segundo de FreeToken, comparar hardware y mejorar el rendimiento de inferencia local de MoE en 2026.

2026-08-25
Equipo de FreeToken
Guía rápida
  • Los tokens por segundo de FreeToken dependen de los aciertos de caché de la GPU, la memoria del sistema y el ancho de banda PCIe.
  • Las pruebas con una RTX 3090 alcanzaron aproximadamente entre 10 y 11 tokens de decodificación por segundo en una configuración local.
  • Los resultados del cliente de escritorio midieron aproximadamente 8,8 tokens por segundo en pruebas comparables.
  • La elección del modelo es importante porque los modelos MoE y los modelos densos generan demandas de memoria muy diferentes.
  • La mejor mejora suele provenir de una memoria más rápida, más RAM utilizable y una menor carga en segundo plano.

FreeToken tokens por segundo: qué significa la métrica

Los tokens por segundo de FreeToken describen el rendimiento de decodificación: la velocidad a la que un modelo de lenguaje servido localmente genera texto después de procesar el prompt. Es diferente del tiempo hasta el primer token, la velocidad de procesamiento del prompt y el tiempo total de respuesta. En un chat interactivo, el rendimiento de decodificación es la cifra que los usuarios suelen notar mientras aparece una respuesta.

FreeToken es un sistema de serving nativo del edge para modelos grandes de mezcla de expertos. Su diseño mantiene el conjunto completo de expertos en la memoria del host y utiliza la memoria disponible de la GPU como una caché de expertos elástica. Como resultado, el rendimiento depende de toda la máquina, no solo de la tarjeta gráfica.

Aspectos destacados del video:

  • Una configuración con una sola RTX 3090 produjo aproximadamente 10–11 tokens de decodificación por segundo.
  • El cliente de escritorio informó aproximadamente 8,8 tokens por segundo durante una prueba posterior.
  • La capacidad y el ancho de banda de la RAM del sistema se identificaron como factores de rendimiento importantes.
  • Las aplicaciones en segundo plano pueden reducir la VRAM disponible y afectar el rendimiento.
MétricaSignificadoPor qué importa
Tokens de decodificación por segundoVelocidad de generación de textoIndica la capacidad de respuesta de la conversación
Velocidad de procesamiento del promptVelocidad de procesamiento de los tokens de entradaAfecta al retraso inicial de los prompts largos
Tiempo hasta el primer tokenRetraso antes de que comience la salidaImportante para agentes y contextos grandes
Tiempo total de respuestaDuración completa de la solicitudCombina los costes del prompt y la decodificación

El artículo de investigación de FreeToken explica que el sistema adapta la ejecución al ancho de banda medido de la memoria del host y de PCIe. Por eso, dos ordenadores con la misma GPU pueden producir resultados notablemente diferentes.

Cómo interpretar la cifra

Considera los tokens por segundo como una medición de la carga de trabajo y no como una especificación fija del producto. Si cambias el modelo, la longitud del contexto, el modo de razonamiento o las condiciones de memoria, el resultado puede cambiar sustancialmente.

Rendimiento observado de FreeToken según la configuración

Las pruebas disponibles muestran una diferencia práctica entre las mediciones del servidor y las del cliente de escritorio. En una sola RTX 3090, DeepSeek V4 Flash se mantuvo cerca de los 10–11 tokens por segundo durante prompts de chat normales. Otra prueba con el cliente de escritorio informó de 8,8 tokens por segundo. Estas cifras son referencias útiles, pero no son valores universales.

La diferencia puede deberse a la sobrecarga del cliente, el comportamiento del sistema operativo, la configuración del modelo, los procesos en segundo plano o la variación de las mediciones. El modo de razonamiento también cambia la carga de trabajo. Una respuesta generada con el máximo razonamiento puede tener una velocidad de salida visible más baja y un proceso de finalización más largo que una respuesta breve y directa.

ConfiguraciónModelo o modoTasa de decodificación informadaInterpretación práctica
Una sola RTX 3090DeepSeek V4 Flash, servidor localAproximadamente 10–11 tok/sAdecuado para chat interactivo
Cliente de escritorioDeepSeek V4 Flash, razonamiento activadoAproximadamente 8,8 tok/sConfiguración sencilla, resultado algo más lento
Comparación con una sola RTX 4090DeepSeek V4 FlashNo se proporcionó un resultado fijoUsar como referencia para comparar hardware
Nivel de investigación RTX PRO 6000GLM-5.2 NVFP414,9 tok/sDemostración a escala de modelos de frontera
Nivel de investigación RTX 5090DeepSeek V4 Flash22–25 tok/sBenchmark de investigación, no una expectativa para una 3090

La evaluación de investigación informa de resultados superiores en hardware más reciente porque utiliza un runtime de serving optimizado, una planificación del ancho de banda medida y condiciones de benchmark específicas. Estas cifras no deben trasladarse directamente a una estimación para un ordenador de escritorio de consumo.

Chat interactivo

Alrededor de 8–11 tok/s puede sentirse fluido para conversaciones locales normales, según el prompt y el comportamiento del modelo.

Cargas de trabajo de agentes

Las llamadas a herramientas y los prompts largos repetidos hacen que el tiempo hasta el primer token sea más importante que la tasa de decodificación por sí sola.

Modo de razonamiento

El razonamiento prolongado puede reducir la velocidad visible y aumentar el tiempo total de finalización, incluso cuando el hardware no cambia.

Un método útil de comparación consiste en probar el mismo modelo, estilo de prompt, tamaño de contexto y configuración de generación en cada equipo. Registra varias respuestas en lugar de depender de una sola finalización. El enrutamiento de MoE cambia de un token a otro, por lo que los resultados individuales pueden fluctuar.

No mezcles las condiciones del benchmark

Un resultado del cliente de escritorio, una medición del servidor y un benchmark de investigación pueden utilizar runtimes y configuraciones diferentes. Compáralos de forma orientativa, a menos que todas las condiciones de prueba coincidan.

Factores de hardware que cambian el rendimiento

FreeToken desplaza gran parte del debate sobre el rendimiento del cálculo bruto de la GPU al movimiento de datos en memoria. Los modelos de mezcla de expertos activan solo una parte de sus parámetros para cada token, pero es posible que el conjunto completo de expertos deba permanecer disponible en la memoria del sistema. Cuando un experto no está almacenado en la caché de la GPU, el runtime puede transferirlo mediante PCIe o ejecutarlo directamente en la CPU.

Por eso, la capacidad de la memoria del sistema es esencial. Las pruebas indican que 32 GB pueden ser un punto de partida para algunas configuraciones locales, mientras que 64 GB ofrecen un margen más cómodo. Los modelos más grandes pueden requerir mucho más. El material de investigación describe implementaciones que necesitan cientos de gigabytes de memoria del host, especialmente para modelos a escala de frontera.

Factor de hardwareEfecto en FreeTokenInterpretación recomendada
VRAM de la GPUDetermina la capacidad de la caché de expertosMás VRAM puede reducir los fallos de caché
Capacidad de la RAM del sistemaAloja los expertos residentes en el hostUna RAM utilizable insuficiente impide la carga
Ancho de banda de la RAMAlimenta la ejecución de la CPU y las transferenciasUna memoria más rápida puede mejorar el rendimiento de decodificación
Ancho del enlace PCIeControla la velocidad de transferencia de expertosx16 generalmente ofrece más margen que x8
Uso de la GPU en segundo planoReduce la VRAM disponibleLos navegadores, las herramientas de grabación y los juegos pueden interferir
Velocidad de almacenamientoInfluye en el inicio y la carga del modeloEl almacenamiento NVMe puede reducir el retraso inicial de carga

El artículo de investigación informa de diferencias aproximadas a nivel de plataforma para la transferencia de expertos: los sistemas de clase RTX 4090 y RTX 3090 que utilizan PCIe 4.0 x16 pueden tardar varios segundos en mover conjuntos grandes de expertos durante el prellenado, mientras que los enlaces más estrechos de los portátiles pueden tardar más. El comportamiento de la decodificación es diferente porque la caché y la coejecución con la CPU pueden ocultar parte del coste de transferencia.

Prioridad de actualización recomendada

Para un sistema FreeToken con una sola GPU, prioriza primero la capacidad de RAM utilizable y después el ancho de banda de memoria y las condiciones de PCIe. Aumentar únicamente la capacidad de cálculo de la GPU puede no eliminar un cuello de botella en la memoria del host.

Un entorno de pruebas limpio también es importante. Cierra el software innecesario que utilice mucho la GPU, evita ejecutar varios servicios de modelos al mismo tiempo y deja suficiente RAM para el sistema operativo. Si el runtime informa de que no hay suficiente RAM o VRAM, reducir las expectativas sobre los tokens por segundo no resolverá el problema de carga; primero, la configuración del modelo debe caber en la memoria disponible.

Configuración paso a paso de un benchmark de FreeToken

Utiliza este proceso para medir una línea base local fiable. El objetivo no es perseguir una cifra excepcionalmente alta, sino crear una prueba repetible que ayude a explicar los cambios.

1

Registra el equipo

Anota el modelo de GPU, la VRAM, la RAM del sistema, la generación y velocidad de la RAM, el sistema operativo, el enlace PCIe y el tipo de almacenamiento. Estos detalles explican muchas diferencias entre los resultados.

2

Elige un modelo

Comienza con el mismo modelo compatible para todas las comparaciones. DeepSeek V4 Flash es la referencia más clara en las pruebas disponibles con una sola GPU, mientras que los modelos densos pueden comportarse de forma diferente.

3

Prepara una sesión limpia

Cierra las cargas de trabajo que compitan por la GPU y los servicios de inferencia en segundo plano. Mantén constantes el modelo, el tamaño de contexto, la temperatura, el modo de razonamiento y la configuración de muestreo.

4

Calienta el runtime

Envía un prompt corto antes de registrar los resultados. La primera respuesta puede incluir los costes de carga y calentamiento de la caché, que no representan la velocidad de decodificación en régimen estable.

5

Promedia varias ejecuciones

Ejecuta al menos tres prompts comparables y registra la tasa de decodificación mostrada, la tasa de procesamiento del prompt y el tiempo hasta el primer token. Utiliza la mediana o el promedio en lugar del resultado más alto.

Variable de pruebaMantener constanteEjemplo de registro
ModeloMismo checkpoint y cuantizaciónDeepSeek V4 Flash
PromptLongitud y tarea similaresPregunta factual breve
GeneraciónMismo modo de razonamiento y muestreoRazonamiento activado o desactivado
RuntimeMisma ruta de cliente o servidorCliente de escritorio o servidor API
ResultadoRegistrar varias ejecuciones10,5; 10,1; 10,8 tok/s

Al comparar el cliente de escritorio con una interfaz conectada a un servidor, pruébalos por separado. Los resultados disponibles sugieren que la ruta de escritorio puede ser cómoda, aunque produzca una tasa medida más baja. Eso no significa automáticamente que el modelo sea más lento en todas las cargas de trabajo; significa que deben documentarse la interfaz y la ruta del runtime.

Consejo para el benchmark

Registra tanto la tasa mostrada como las condiciones de respuesta. Una cifra sin detalles sobre el modelo, el contexto, el runtime y el modo de razonamiento es difícil de reproducir o comparar.

Lista de optimización y limitaciones habituales

La principal ventaja de FreeToken proviene de coordinar la memoria de la GPU, la memoria del host, la ejecución de la CPU y las transferencias PCIe. Por ello, el enfoque práctico de ajuste consiste en eliminar las interferencias evitables antes de cambiar de modelo o esperar una mayor tasa de salida.

Lista de rendimiento:

  • Confirma que el modelo cabe en la RAM y la VRAM utilizables del sistema
  • Utiliza la configuración de RAM estable más rápida disponible en el equipo
  • Cierra las aplicaciones innecesarias que consuman mucha GPU antes del benchmark
  • Mantén constantes el modelo, la longitud del prompt y la configuración de razonamiento
  • Ejecuta varias pruebas en caliente y registra la mediana de tokens por segundo
SíntomaCausa probablePrimera acción
El modelo no se iniciaNo hay suficiente RAM o VRAM utilizableElige un modelo más pequeño o añade memoria
La tasa varía muchoEnrutamiento de expertos y fallos de cachéPromedia varias ejecuciones
El resultado del escritorio es más bajoSobrecarga del cliente o del runtimeCompara con la ruta del servidor
Retraso inicial prolongadoCoste del prellenado o de la carga de expertosMide por separado el tiempo hasta el primer token
Otras aplicaciones ralentizan la inferenciaRecursos de GPU o memoria compartidosCierra las cargas de trabajo en segundo plano

Las pruebas disponibles también señalan la madurez del software como un factor que debe tenerse en cuenta. FreeToken se describe como software beta, y una configuración densa de Qwen se cerró inesperadamente durante las pruebas. Un fallo al iniciar un modelo debe tratarse como un problema de compatibilidad o de recursos, no como un resultado de tokens por segundo.

Para solucionar problemas, revisa los registros, verifica el formato compatible con el modelo, confirma la memoria disponible después de tener en cuenta el sistema operativo y las demás aplicaciones, y repite la prueba tras reiniciar el runtime. Evita interpretar un único fallo de inicio como una prueba de que todas las configuraciones del modelo son incompatibles.

Límite de compatibilidad

Un modelo que encaja en teoría puede seguir fallando debido al formato de precisión, la compatibilidad del runtime, el registro de memoria o los recursos disponibles del host. Confirma la compatibilidad antes de comparar la velocidad.

Q: ¿Cuál es un buen resultado de tokens por segundo de FreeToken en una RTX 3090?

Las pruebas disponibles con una sola GPU alcanzaron aproximadamente entre 10 y 11 tokens de decodificación por segundo con DeepSeek V4 Flash. Tómalo como una referencia práctica, no como un valor garantizado.

Q: ¿Por qué el cliente de escritorio informó de unos 8,8 tokens por segundo?

El cliente de escritorio puede incluir un comportamiento diferente del runtime, sobrecarga de la interfaz, condiciones de memoria o configuraciones distintas. El resultado es coherente en términos generales con la inferencia local interactiva, pero debe compararse bajo condiciones equivalentes.

Q: ¿Tener más RAM del sistema siempre aumenta los tokens por segundo?

Una mayor cantidad de RAM determina principalmente si el modelo puede cargarse y cuánto espacio de caché queda disponible. Una vez que la capacidad es suficiente, el ancho de banda de la RAM y el comportamiento de PCIe pueden ser más importantes para el rendimiento.

Q: ¿Por qué dos ordenadores con la misma GPU pueden rendir de forma diferente?

FreeToken utiliza la memoria del host y transferencias PCIe cuando los expertos no residen en la VRAM. El ancho de banda de la RAM, el ancho del enlace PCIe, las aplicaciones en segundo plano, el comportamiento del sistema operativo y la elección del runtime pueden cambiar el resultado.