- Los tokens por segundo de FreeToken dependen de los aciertos de caché de la GPU, la memoria del sistema y el ancho de banda PCIe.
- Las pruebas con una RTX 3090 alcanzaron aproximadamente entre 10 y 11 tokens de decodificación por segundo en una configuración local.
- Los resultados del cliente de escritorio midieron aproximadamente 8,8 tokens por segundo en pruebas comparables.
- La elección del modelo es importante porque los modelos MoE y los modelos densos generan demandas de memoria muy diferentes.
- La mejor mejora suele provenir de una memoria más rápida, más RAM utilizable y una menor carga en segundo plano.
FreeToken tokens por segundo: qué significa la métrica
Los tokens por segundo de FreeToken describen el rendimiento de decodificación: la velocidad a la que un modelo de lenguaje servido localmente genera texto después de procesar el prompt. Es diferente del tiempo hasta el primer token, la velocidad de procesamiento del prompt y el tiempo total de respuesta. En un chat interactivo, el rendimiento de decodificación es la cifra que los usuarios suelen notar mientras aparece una respuesta.
FreeToken es un sistema de serving nativo del edge para modelos grandes de mezcla de expertos. Su diseño mantiene el conjunto completo de expertos en la memoria del host y utiliza la memoria disponible de la GPU como una caché de expertos elástica. Como resultado, el rendimiento depende de toda la máquina, no solo de la tarjeta gráfica.
Aspectos destacados del video:
- Una configuración con una sola RTX 3090 produjo aproximadamente 10–11 tokens de decodificación por segundo.
- El cliente de escritorio informó aproximadamente 8,8 tokens por segundo durante una prueba posterior.
- La capacidad y el ancho de banda de la RAM del sistema se identificaron como factores de rendimiento importantes.
- Las aplicaciones en segundo plano pueden reducir la VRAM disponible y afectar el rendimiento.
| Métrica | Significado | Por qué importa |
|---|---|---|
| Tokens de decodificación por segundo | Velocidad de generación de texto | Indica la capacidad de respuesta de la conversación |
| Velocidad de procesamiento del prompt | Velocidad de procesamiento de los tokens de entrada | Afecta al retraso inicial de los prompts largos |
| Tiempo hasta el primer token | Retraso antes de que comience la salida | Importante para agentes y contextos grandes |
| Tiempo total de respuesta | Duración completa de la solicitud | Combina los costes del prompt y la decodificación |
El artículo de investigación de FreeToken explica que el sistema adapta la ejecución al ancho de banda medido de la memoria del host y de PCIe. Por eso, dos ordenadores con la misma GPU pueden producir resultados notablemente diferentes.
Considera los tokens por segundo como una medición de la carga de trabajo y no como una especificación fija del producto. Si cambias el modelo, la longitud del contexto, el modo de razonamiento o las condiciones de memoria, el resultado puede cambiar sustancialmente.
Rendimiento observado de FreeToken según la configuración
Las pruebas disponibles muestran una diferencia práctica entre las mediciones del servidor y las del cliente de escritorio. En una sola RTX 3090, DeepSeek V4 Flash se mantuvo cerca de los 10–11 tokens por segundo durante prompts de chat normales. Otra prueba con el cliente de escritorio informó de 8,8 tokens por segundo. Estas cifras son referencias útiles, pero no son valores universales.
La diferencia puede deberse a la sobrecarga del cliente, el comportamiento del sistema operativo, la configuración del modelo, los procesos en segundo plano o la variación de las mediciones. El modo de razonamiento también cambia la carga de trabajo. Una respuesta generada con el máximo razonamiento puede tener una velocidad de salida visible más baja y un proceso de finalización más largo que una respuesta breve y directa.
| Configuración | Modelo o modo | Tasa de decodificación informada | Interpretación práctica |
|---|---|---|---|
| Una sola RTX 3090 | DeepSeek V4 Flash, servidor local | Aproximadamente 10–11 tok/s | Adecuado para chat interactivo |
| Cliente de escritorio | DeepSeek V4 Flash, razonamiento activado | Aproximadamente 8,8 tok/s | Configuración sencilla, resultado algo más lento |
| Comparación con una sola RTX 4090 | DeepSeek V4 Flash | No se proporcionó un resultado fijo | Usar como referencia para comparar hardware |
| Nivel de investigación RTX PRO 6000 | GLM-5.2 NVFP4 | 14,9 tok/s | Demostración a escala de modelos de frontera |
| Nivel de investigación RTX 5090 | DeepSeek V4 Flash | 22–25 tok/s | Benchmark de investigación, no una expectativa para una 3090 |
La evaluación de investigación informa de resultados superiores en hardware más reciente porque utiliza un runtime de serving optimizado, una planificación del ancho de banda medida y condiciones de benchmark específicas. Estas cifras no deben trasladarse directamente a una estimación para un ordenador de escritorio de consumo.
Chat interactivo
Alrededor de 8–11 tok/s puede sentirse fluido para conversaciones locales normales, según el prompt y el comportamiento del modelo.
Cargas de trabajo de agentes
Las llamadas a herramientas y los prompts largos repetidos hacen que el tiempo hasta el primer token sea más importante que la tasa de decodificación por sí sola.
Modo de razonamiento
El razonamiento prolongado puede reducir la velocidad visible y aumentar el tiempo total de finalización, incluso cuando el hardware no cambia.
Un método útil de comparación consiste en probar el mismo modelo, estilo de prompt, tamaño de contexto y configuración de generación en cada equipo. Registra varias respuestas en lugar de depender de una sola finalización. El enrutamiento de MoE cambia de un token a otro, por lo que los resultados individuales pueden fluctuar.
Un resultado del cliente de escritorio, una medición del servidor y un benchmark de investigación pueden utilizar runtimes y configuraciones diferentes. Compáralos de forma orientativa, a menos que todas las condiciones de prueba coincidan.
Factores de hardware que cambian el rendimiento
FreeToken desplaza gran parte del debate sobre el rendimiento del cálculo bruto de la GPU al movimiento de datos en memoria. Los modelos de mezcla de expertos activan solo una parte de sus parámetros para cada token, pero es posible que el conjunto completo de expertos deba permanecer disponible en la memoria del sistema. Cuando un experto no está almacenado en la caché de la GPU, el runtime puede transferirlo mediante PCIe o ejecutarlo directamente en la CPU.
Por eso, la capacidad de la memoria del sistema es esencial. Las pruebas indican que 32 GB pueden ser un punto de partida para algunas configuraciones locales, mientras que 64 GB ofrecen un margen más cómodo. Los modelos más grandes pueden requerir mucho más. El material de investigación describe implementaciones que necesitan cientos de gigabytes de memoria del host, especialmente para modelos a escala de frontera.
| Factor de hardware | Efecto en FreeToken | Interpretación recomendada |
|---|---|---|
| VRAM de la GPU | Determina la capacidad de la caché de expertos | Más VRAM puede reducir los fallos de caché |
| Capacidad de la RAM del sistema | Aloja los expertos residentes en el host | Una RAM utilizable insuficiente impide la carga |
| Ancho de banda de la RAM | Alimenta la ejecución de la CPU y las transferencias | Una memoria más rápida puede mejorar el rendimiento de decodificación |
| Ancho del enlace PCIe | Controla la velocidad de transferencia de expertos | x16 generalmente ofrece más margen que x8 |
| Uso de la GPU en segundo plano | Reduce la VRAM disponible | Los navegadores, las herramientas de grabación y los juegos pueden interferir |
| Velocidad de almacenamiento | Influye en el inicio y la carga del modelo | El almacenamiento NVMe puede reducir el retraso inicial de carga |
El artículo de investigación informa de diferencias aproximadas a nivel de plataforma para la transferencia de expertos: los sistemas de clase RTX 4090 y RTX 3090 que utilizan PCIe 4.0 x16 pueden tardar varios segundos en mover conjuntos grandes de expertos durante el prellenado, mientras que los enlaces más estrechos de los portátiles pueden tardar más. El comportamiento de la decodificación es diferente porque la caché y la coejecución con la CPU pueden ocultar parte del coste de transferencia.
Para un sistema FreeToken con una sola GPU, prioriza primero la capacidad de RAM utilizable y después el ancho de banda de memoria y las condiciones de PCIe. Aumentar únicamente la capacidad de cálculo de la GPU puede no eliminar un cuello de botella en la memoria del host.
Un entorno de pruebas limpio también es importante. Cierra el software innecesario que utilice mucho la GPU, evita ejecutar varios servicios de modelos al mismo tiempo y deja suficiente RAM para el sistema operativo. Si el runtime informa de que no hay suficiente RAM o VRAM, reducir las expectativas sobre los tokens por segundo no resolverá el problema de carga; primero, la configuración del modelo debe caber en la memoria disponible.
Configuración paso a paso de un benchmark de FreeToken
Utiliza este proceso para medir una línea base local fiable. El objetivo no es perseguir una cifra excepcionalmente alta, sino crear una prueba repetible que ayude a explicar los cambios.
Registra el equipo
Anota el modelo de GPU, la VRAM, la RAM del sistema, la generación y velocidad de la RAM, el sistema operativo, el enlace PCIe y el tipo de almacenamiento. Estos detalles explican muchas diferencias entre los resultados.
Elige un modelo
Comienza con el mismo modelo compatible para todas las comparaciones. DeepSeek V4 Flash es la referencia más clara en las pruebas disponibles con una sola GPU, mientras que los modelos densos pueden comportarse de forma diferente.
Prepara una sesión limpia
Cierra las cargas de trabajo que compitan por la GPU y los servicios de inferencia en segundo plano. Mantén constantes el modelo, el tamaño de contexto, la temperatura, el modo de razonamiento y la configuración de muestreo.
Calienta el runtime
Envía un prompt corto antes de registrar los resultados. La primera respuesta puede incluir los costes de carga y calentamiento de la caché, que no representan la velocidad de decodificación en régimen estable.
Promedia varias ejecuciones
Ejecuta al menos tres prompts comparables y registra la tasa de decodificación mostrada, la tasa de procesamiento del prompt y el tiempo hasta el primer token. Utiliza la mediana o el promedio en lugar del resultado más alto.
| Variable de prueba | Mantener constante | Ejemplo de registro |
|---|---|---|
| Modelo | Mismo checkpoint y cuantización | DeepSeek V4 Flash |
| Prompt | Longitud y tarea similares | Pregunta factual breve |
| Generación | Mismo modo de razonamiento y muestreo | Razonamiento activado o desactivado |
| Runtime | Misma ruta de cliente o servidor | Cliente de escritorio o servidor API |
| Resultado | Registrar varias ejecuciones | 10,5; 10,1; 10,8 tok/s |
Al comparar el cliente de escritorio con una interfaz conectada a un servidor, pruébalos por separado. Los resultados disponibles sugieren que la ruta de escritorio puede ser cómoda, aunque produzca una tasa medida más baja. Eso no significa automáticamente que el modelo sea más lento en todas las cargas de trabajo; significa que deben documentarse la interfaz y la ruta del runtime.
Registra tanto la tasa mostrada como las condiciones de respuesta. Una cifra sin detalles sobre el modelo, el contexto, el runtime y el modo de razonamiento es difícil de reproducir o comparar.
Lista de optimización y limitaciones habituales
La principal ventaja de FreeToken proviene de coordinar la memoria de la GPU, la memoria del host, la ejecución de la CPU y las transferencias PCIe. Por ello, el enfoque práctico de ajuste consiste en eliminar las interferencias evitables antes de cambiar de modelo o esperar una mayor tasa de salida.
Lista de rendimiento:
- Confirma que el modelo cabe en la RAM y la VRAM utilizables del sistema
- Utiliza la configuración de RAM estable más rápida disponible en el equipo
- Cierra las aplicaciones innecesarias que consuman mucha GPU antes del benchmark
- Mantén constantes el modelo, la longitud del prompt y la configuración de razonamiento
- Ejecuta varias pruebas en caliente y registra la mediana de tokens por segundo
| Síntoma | Causa probable | Primera acción |
|---|---|---|
| El modelo no se inicia | No hay suficiente RAM o VRAM utilizable | Elige un modelo más pequeño o añade memoria |
| La tasa varía mucho | Enrutamiento de expertos y fallos de caché | Promedia varias ejecuciones |
| El resultado del escritorio es más bajo | Sobrecarga del cliente o del runtime | Compara con la ruta del servidor |
| Retraso inicial prolongado | Coste del prellenado o de la carga de expertos | Mide por separado el tiempo hasta el primer token |
| Otras aplicaciones ralentizan la inferencia | Recursos de GPU o memoria compartidos | Cierra las cargas de trabajo en segundo plano |
Las pruebas disponibles también señalan la madurez del software como un factor que debe tenerse en cuenta. FreeToken se describe como software beta, y una configuración densa de Qwen se cerró inesperadamente durante las pruebas. Un fallo al iniciar un modelo debe tratarse como un problema de compatibilidad o de recursos, no como un resultado de tokens por segundo.
Para solucionar problemas, revisa los registros, verifica el formato compatible con el modelo, confirma la memoria disponible después de tener en cuenta el sistema operativo y las demás aplicaciones, y repite la prueba tras reiniciar el runtime. Evita interpretar un único fallo de inicio como una prueba de que todas las configuraciones del modelo son incompatibles.
Un modelo que encaja en teoría puede seguir fallando debido al formato de precisión, la compatibilidad del runtime, el registro de memoria o los recursos disponibles del host. Confirma la compatibilidad antes de comparar la velocidad.
Q: ¿Cuál es un buen resultado de tokens por segundo de FreeToken en una RTX 3090?
Las pruebas disponibles con una sola GPU alcanzaron aproximadamente entre 10 y 11 tokens de decodificación por segundo con DeepSeek V4 Flash. Tómalo como una referencia práctica, no como un valor garantizado.
Q: ¿Por qué el cliente de escritorio informó de unos 8,8 tokens por segundo?
El cliente de escritorio puede incluir un comportamiento diferente del runtime, sobrecarga de la interfaz, condiciones de memoria o configuraciones distintas. El resultado es coherente en términos generales con la inferencia local interactiva, pero debe compararse bajo condiciones equivalentes.
Q: ¿Tener más RAM del sistema siempre aumenta los tokens por segundo?
Una mayor cantidad de RAM determina principalmente si el modelo puede cargarse y cuánto espacio de caché queda disponible. Una vez que la capacidad es suficiente, el ancho de banda de la RAM y el comportamiento de PCIe pueden ser más importantes para el rendimiento.
Q: ¿Por qué dos ordenadores con la misma GPU pueden rendir de forma diferente?
FreeToken utiliza la memoria del host y transferencias PCIe cuando los expertos no residen en la VRAM. El ancho de banda de la RAM, el ancho del enlace PCIe, las aplicaciones en segundo plano, el comportamiento del sistema operativo y la elección del runtime pueden cambiar el resultado.