- Las pruebas de FreeToken rtx 5090 se centran en modelos MoE grandes que superan la VRAM disponible.
- Mejor caso de uso: cargas de trabajo de agentes locales con contextos largos y llamadas repetidas a herramientas.
- Ventaja principal: el almacenamiento en caché adaptativo de expertos coordina la GPU, la CPU, la RAM y el ancho de banda PCIe.
- Velocidad registrada: Qwen3.6 alcanza aproximadamente entre 77 y 83 tokens por segundo en las cargas de trabajo probadas.
- Limitación principal: actualmente se priorizan Linux, el hardware NVIDIA, CUDA 13 y una cantidad considerable de RAM del sistema.
FreeToken rtx 5090: Qué hace el runtime
FreeToken es un runtime de inferencia nativo del edge, no un modelo de IA nuevo. En una RTX 5090, su objetivo principal es servir modelos grandes de mezcla de expertos cuyos conjuntos completos de expertos no caben en la memoria de la GPU. El runtime mantiene el modelo completo en la memoria del host y utiliza la GPU como una caché de trabajo adaptativa.
Este enfoque es importante porque los modelos MoE activan solo una fracción de sus parámetros totales para cada token. DeepSeek-V4-Flash, por ejemplo, aparece con 284 mil millones de parámetros totales y aproximadamente 13 mil millones de parámetros activos. El cálculo activo puede caber en la capacidad de memoria práctica de una GPU de gama alta, pero el checkpoint completo todavía requiere mucho más almacenamiento en otro lugar.
Aspectos destacados del vídeo:
- FreeToken está diseñado para modelos MoE sobredimensionados, no para todas las cargas de trabajo de modelos locales.
- Según los informes, una sola RTX 5090 superó los 20 tokens por segundo con DeepSeek-V4-Flash.
- El runtime combina el almacenamiento en caché de expertos, las transferencias superpuestas y la ejecución en CPU.
- Las sesiones largas de agentes de programación revelan diferencias mayores que los prompts sintéticos breves.
Caché de expertos en la GPU
Los expertos utilizados con frecuencia permanecen en la VRAM mediante una caché LRU compartida, lo que reduce las transferencias repetidas durante la decodificación.
Ejecución adaptada al ancho de banda
Los fallos de caché pueden transferirse a la GPU o ejecutarse directamente en la CPU, según el ancho de banda de hardware medido.
Reutilización consciente de los agentes
Los checkpoints semánticos conservan prefijos útiles entre bloques de razonamiento, llamadas a herramientas y ediciones de contexto de varios turnos.
FreeToken resulta especialmente atractivo cuando el checkpoint MoE seleccionado es más grande que la VRAM. Si el modelo cabe por completo en la RTX 5090, un runtime generalista consolidado puede seguir siendo igual de práctico.
| Característica del runtime | FreeToken | Runtime híbrido estático habitual |
|---|---|---|
| Ubicación de expertos | Caché LRU dinámica | Ubicación fija o basada en el prefilling |
| Gestión de fallos de caché | Transferencia a la GPU o ejecución en CPU | Generalmente predeterminada |
| Reutilización del contexto del agente | Checkpoints semánticos | Depende del runtime |
| Respuesta a los recursos | Se ajusta al ancho de banda medido | A menudo requiere ajustes específicos del hardware |
| Enfoque principal | Servir modelos MoE grandes | Compatibilidad amplia con inferencia local |
Requisitos de configuración de la RTX 5090
La ruta acelerada de FreeToken se centra actualmente en Linux, sistemas x86-64, GPU NVIDIA, CUDA 13 y un controlador reciente. El proyecto destaca el hardware de las series RTX 30, 40 y 50, situando la RTX 5090 dentro de su principal rango objetivo.
La GPU es solo una parte de la configuración. El conjunto completo de expertos debe residir en la memoria del sistema cuando supera la VRAM. Una RTX 5090 no reduce el requisito total de memoria del modelo; mejora la coordinación de los recursos disponibles de GPU, CPU, RAM y PCIe.
La configuración de investigación también distingue entre el ancho de banda PCIe y el ancho de banda de procesamiento de expertos en el host. Estos valores deben medirse en el ordenador real, en lugar de inferirse únicamente a partir de las especificaciones del producto.
Confirma la plataforma
Utiliza una instalación de Linux x86-64 con una GPU NVIDIA compatible, CUDA 13 y un controlador actualizado. El proyecto también anuncia compatibilidad de escritorio con Windows y Linux, pero el flujo de trabajo acelerado documentado sigue estando fuertemente orientado a Linux.
Prepara la memoria del sistema
Reserva suficiente RAM para el conjunto completo de expertos residente en el host, el sistema operativo y otras aplicaciones. Los checkpoints grandes, como DeepSeek-V4-Flash, requieren bastante más memoria de lo que sugiere el recuento de parámetros activos.
Selecciona un checkpoint compatible
Comienza con un checkpoint compatible de Hugging Face o con una versión oficial de baja precisión. Qwen3.6-35B-A3B y DeepSeek-V4-Flash son ejemplos centrales de la evaluación de 2026.
Mide el equipo
Permite que el runtime cree un perfil del ancho de banda de procesamiento del host y del ancho de banda de transferencia PCIe. Estas mediciones orientan el equilibrio entre cargar elementos en la caché de la GPU y ejecutar expertos directamente en la CPU.
Conecta tu cliente
Inicia el servidor local mediante su API compatible con OpenAI o Anthropic y, después, conecta un cliente compatible de programación o de llamadas a herramientas.
La RAM del sistema debe contener la parte del checkpoint que no cabe en la VRAM. Reducir el uso de memoria de la GPU no elimina el requisito de almacenamiento del modelo completo.
| Requisito | Orientación para RTX 5090 | Por qué es importante |
|---|---|---|
| GPU | Hardware de clase NVIDIA RTX 5090 | Proporciona VRAM de gran ancho de banda para el cálculo activo y el almacenamiento en caché de expertos |
| Sistema operativo | Linux es la prioridad documentada | La ruta acelerada de línea de comandos se centra en Linux |
| CUDA | CUDA 13 | Requerido por la ruta de configuración documentada |
| RAM del sistema | Dimensionada para el checkpoint completo | La memoria del host almacena los pesos de los expertos residentes |
| Interconexión | PCIe 5.0 x16 es ventajoso | Las transferencias más rápidas reducen la latencia visible de los fallos de caché y del prefilling |
| Capa de API | Compatible con OpenAI o Anthropic | Permite que los clientes y agentes locales reutilicen flujos de trabajo conocidos |
Pruebas de rendimiento y cargas de trabajo reales en la RTX 5090
La evaluación de 2026 mide el rendimiento de decodificación y el tiempo hasta el primer token en cargas de trabajo de matemáticas, agentes de programación, protocolos nativos y correo/calendario. Esto es importante porque un agente cambia repetidamente su contexto, llama a herramientas y envía nuevas solicitudes. Un prompt breve de una sola interacción no muestra el mismo comportamiento de prefilling y caché.
En una RTX 5090, FreeToken mantuvo aproximadamente entre 77 y 83 tokens por segundo con Qwen3.6-35B-A3B y entre 22 y 25 tokens por segundo con DeepSeek-V4-Flash en las cargas de trabajo probadas. La ventaja registrada frente a las alternativas compatibles más competitivas osciló aproximadamente entre 1,5x y 2,3x, según el modelo y el escenario.
| Modelo | Parámetros totales | Parámetros activos | Resultado en RTX 5090 |
|---|---|---|---|
| Qwen3.6-35B-A3B | 35B | 3B | Aproximadamente 77–83 tok/s |
| DeepSeek-V4-Flash | 284B | Aproximadamente 13B | Aproximadamente 22–25 tok/s |
| GLM-5.2 | 753B | 40B | Probado en una RTX PRO 6000, no en una RTX 5090 |
| Versión portátil de Qwen3.6 | 35B | 3B | Resultado en RTX 4060: 39,3 tok/s |
Los resultados de la RTX 5090 son más sólidos cuando el modelo es más grande que la VRAM disponible de la GPU. La caché LRU compartida de FreeToken sigue la localidad de enrutamiento entre tokens, mientras que su política de ancho de banda decide cómo servir a los expertos que no están en la caché.
La evaluación informa de que la caché de FreeToken falló aproximadamente en el 16 % de las lecturas de expertos de Qwen3.6 y el 39 % de las lecturas de DeepSeek-V4-Flash con la capacidad de servicio probada en la RTX 5090. Los enfoques de ubicación comparables mostraron tasas de fallos superiores en las mismas trazas reproducidas.
Para los agentes de ejecución prolongada, una generación estable y esperas máximas más cortas pueden ser más importantes que una tasa máxima de tokens en una sola interacción. El turno más lento registrado por FreeToken se mantuvo por debajo de 44 segundos en las celdas probadas con RTX 5090.
| Carga de trabajo | Qué prueba | Por qué importan los resultados de la RTX 5090 |
|---|---|---|
| Razonamiento matemático | Decodificación larga con uso limitado de herramientas | Mide la generación sostenida de tokens |
| Agente de programación | Acceso al repositorio y llamadas repetidas a herramientas | Prueba la reutilización del contexto y la estabilidad de la caché |
| Programación con protocolo nativo | Subagentes y sesiones de 56k–65k tokens | Expone el comportamiento del prefilling con contextos largos |
| Agente de correo/calendario | Trece turnos de usuario predeterminados | Prueba el servicio repetido de varios turnos |
Cómo utiliza FreeToken la RTX 5090
FreeToken organiza la memoria en una jerarquía. El conjunto de expertos residente en el host almacena los pesos completos de los expertos enrutados, mientras que los pesos que no pertenecen a expertos permanecen en la GPU. La VRAM restante se convierte en una caché de expertos compartida que puede dividirse de distintas formas a medida que cambia la sesión.
Durante el prefilling, el runtime utiliza doble búfer de capas completas cuando la memoria lo permite. Mientras la GPU procesa una capa, los expertos de la siguiente pueden transferirse mediante PCIe. Esto oculta parte del coste de transferencia detrás del cálculo activo. Durante la decodificación, el runtime utiliza una caché LRU compartida para realizar un seguimiento de los expertos seleccionados por las decisiones de enrutamiento recientes.
Un fallo de caché no se trata como una única operación fija. FreeToken calcula una división entre:
- Cargas en la caché de la GPU, que transfieren los expertos ausentes mediante PCIe y los conservan para reutilizarlos.
- Ejecución directa en la CPU, que procesa los expertos allí donde ya residen sus pesos.
- Ejecución simultánea, que permite que ambas rutas contribuyan al token actual.
Esta división depende del ancho de banda medido del host y del ancho de banda PCIe. Un equipo de escritorio con una conectividad PCIe sólida puede favorecer más cargas en la caché de la GPU, mientras que un sistema con mayor ancho de banda de memoria del host puede realizar más trabajo directamente en la CPU.
Antes de probar FreeToken:
- Verifica la compatibilidad con Linux, x86-64, NVIDIA, CUDA 13 y un controlador reciente
- Calcula las necesidades de RAM del sistema para el checkpoint completo residente en el host
- Elige un modelo MoE compatible y un formato oficial de baja precisión
- Deja margen de VRAM para el crecimiento del contexto y otras aplicaciones
- Registra los tokens por segundo, el tiempo hasta el primer token, el modelo, la cuantización y el hardware
Registra el formato del modelo, la RAM del sistema, el enlace PCIe, la longitud del contexto, el cliente y la carga de trabajo. Un resultado es más fácil de interpretar cuando estas variables están documentadas.
| Optimización | Etapa | Efecto práctico |
|---|---|---|
| Doble búfer de capas completas | Prefilling | Superpone las transferencias de expertos con el cálculo de la GPU |
| Caché LRU compartida de expertos | Decodificación | Realiza un seguimiento de los expertos enrutados recientemente en la VRAM |
| División adaptada al ancho de banda | Decodificación | Divide los fallos entre las rutas PCIe y CPU |
| Checkpoints semánticos | Turnos del agente | Reutiliza los prefijos de contexto que no han cambiado |
| Redimensionamiento elástico de la caché | Runtime | Ajusta la asignación de VRAM sin reiniciar el motor |
El runtime también admite la reconfiguración dinámica en puntos seguros del planificador. Como la memoria del host sigue siendo la fuente de verdad, cambiar la capacidad de la caché de la GPU afecta al rendimiento, pero no a la corrección del modelo. Esto resulta útil en ordenadores personales donde los navegadores, las aplicaciones de escritorio y otras cargas de trabajo de GPU pueden modificar el presupuesto de VRAM disponible.
FreeToken frente a otros runtimes locales
FreeToken no es un sustituto universal de llama.cpp, Ollama o KTransformers. Su fortaleza proviene de la especialización. El proyecto se centra en checkpoints MoE grandes, aceleración NVIDIA, expertos residentes en el host y servicio orientado a agentes.
Llama.cpp ofrece una compatibilidad más amplia con hardware y sistemas operativos, incluidas rutas para CPU, NVIDIA, AMD y Apple Silicon. También cuenta con un amplio ecosistema GGUF y una madurez considerable. Ollama pone el énfasis en una gestión accesible de modelos locales, mientras que KTransformers se orienta a la ejecución híbrida CPU-GPU para familias de modelos compatibles.
La mejor opción depende de si tu modelo cabe en la VRAM y de si tu carga de trabajo es interactiva o está orientada a agentes.
Elige FreeToken
Tienes una GPU NVIDIA, suficiente RAM del sistema y un modelo MoE grande que supera la VRAM.
Elige llama.cpp
Necesitas una amplia compatibilidad de hardware, un ecosistema maduro o un modelo que quepa cómodamente en la VRAM.
Elige Ollama
Priorizas un flujo de trabajo local sencillo y una gestión compatible de modelos por encima de una planificación MoE especializada.
Evalúa KTransformers
Tu modelo y hardware coinciden con su ruta de ejecución híbrida y quieres realizar una comparación directa.
Compara los runtimes utilizando el mismo checkpoint, cuantización, historial de prompts, cliente y longitud de contexto. Un modelo más pequeño que quepa por completo en la VRAM puede hacer que la comparación resulte engañosa.
| Escenario | Dirección recomendada | Motivo |
|---|---|---|
| El MoE grande supera la VRAM | FreeToken | Diseñado para servir expertos de forma adaptativa |
| El modelo cabe por completo en la VRAM | Cualquier runtime GPU maduro | El movimiento del host a la GPU es menos importante |
| Sistema Apple Silicon | Considera otro runtime | No se destaca una ruta comparable de FreeToken |
| Amplia compatibilidad con CPU o AMD | llama.cpp u otro runtime amplio | La ruta acelerada de FreeToken está centrada en NVIDIA |
| Sesiones largas de agentes de programación | Vale la pena evaluar FreeToken | La reutilización de prefijos y la localidad de la caché adquieren importancia |
Para obtener información técnica, consulta el artículo de investigación de FreeToken en arXiv y la versión del proyecto mencionada por los autores en flashml.ai. Estos enlaces ofrecen la base más sólida para comprobar los modelos compatibles, los cambios de implementación y las indicaciones de despliegue a medida que el proyecto evoluciona.
Preguntas frecuentes sobre FreeToken rtx 5090
Q: ¿Qué es FreeToken en una RTX 5090?
FreeToken es un runtime de inferencia local que sirve modelos grandes de mezcla de expertos coordinando la VRAM de la RTX 5090, la RAM del sistema, la ejecución en CPU y las transferencias PCIe. Es software para ejecutar modelos, no un modelo en sí mismo.
Q: ¿Qué velocidad alcanza FreeToken con una RTX 5090?
La evaluación de 2026 informa de aproximadamente entre 77 y 83 tokens por segundo para Qwen3.6-35B-A3B y entre 22 y 25 tokens por segundo para DeepSeek-V4-Flash en las cargas de trabajo probadas. Los resultados dependen del formato del modelo, el contexto, la memoria del host y la carga de trabajo.
Q: ¿Una RTX 5090 contiene el modelo completo de DeepSeek-V4-Flash?
No. El cálculo activo puede ejecutarse de forma práctica en la GPU, pero el conjunto completo de expertos sigue siendo mucho mayor que la VRAM. FreeToken almacena el resto en la memoria del sistema y mueve o ejecuta los expertos según sea necesario.
Q: ¿Es FreeToken mejor que llama.cpp para cualquier configuración?
No. FreeToken está especializado en modelos MoE grandes que superan la VRAM, especialmente agentes de ejecución prolongada. Llama.cpp sigue siendo más amplio y maduro, y se adapta mejor a muchos tipos de hardware y modelos que caben por completo en la memoria de la GPU.
Realiza pruebas con tu propio modelo y flujo de trabajo del agente antes de cambiar de runtime. La ventaja de la RTX 5090 depende de la carga de trabajo, y la RAM del sistema junto con el comportamiento de PCIe pueden cambiar sustancialmente el resultado.