FreeToken rtx 5090: Guía de configuración, resultados y consejos - Hardware

FreeToken rtx 5090: Guía de configuración, resultados y consejos

Descubre cómo FreeToken utiliza una RTX 5090 para modelos MoE grandes, incluidos los requisitos de configuración, los resultados de las pruebas de rendimiento, el almacenamiento en caché y consejos prácticos sobre hardware.

2026-08-25
Equipo de FreeToken
Guía rápida
  • Las pruebas de FreeToken rtx 5090 se centran en modelos MoE grandes que superan la VRAM disponible.
  • Mejor caso de uso: cargas de trabajo de agentes locales con contextos largos y llamadas repetidas a herramientas.
  • Ventaja principal: el almacenamiento en caché adaptativo de expertos coordina la GPU, la CPU, la RAM y el ancho de banda PCIe.
  • Velocidad registrada: Qwen3.6 alcanza aproximadamente entre 77 y 83 tokens por segundo en las cargas de trabajo probadas.
  • Limitación principal: actualmente se priorizan Linux, el hardware NVIDIA, CUDA 13 y una cantidad considerable de RAM del sistema.

FreeToken rtx 5090: Qué hace el runtime

FreeToken es un runtime de inferencia nativo del edge, no un modelo de IA nuevo. En una RTX 5090, su objetivo principal es servir modelos grandes de mezcla de expertos cuyos conjuntos completos de expertos no caben en la memoria de la GPU. El runtime mantiene el modelo completo en la memoria del host y utiliza la GPU como una caché de trabajo adaptativa.

Este enfoque es importante porque los modelos MoE activan solo una fracción de sus parámetros totales para cada token. DeepSeek-V4-Flash, por ejemplo, aparece con 284 mil millones de parámetros totales y aproximadamente 13 mil millones de parámetros activos. El cálculo activo puede caber en la capacidad de memoria práctica de una GPU de gama alta, pero el checkpoint completo todavía requiere mucho más almacenamiento en otro lugar.

Aspectos destacados del vídeo:

  • FreeToken está diseñado para modelos MoE sobredimensionados, no para todas las cargas de trabajo de modelos locales.
  • Según los informes, una sola RTX 5090 superó los 20 tokens por segundo con DeepSeek-V4-Flash.
  • El runtime combina el almacenamiento en caché de expertos, las transferencias superpuestas y la ejecución en CPU.
  • Las sesiones largas de agentes de programación revelan diferencias mayores que los prompts sintéticos breves.

Caché de expertos en la GPU

Los expertos utilizados con frecuencia permanecen en la VRAM mediante una caché LRU compartida, lo que reduce las transferencias repetidas durante la decodificación.

Ejecución adaptada al ancho de banda

Los fallos de caché pueden transferirse a la GPU o ejecutarse directamente en la CPU, según el ancho de banda de hardware medido.

Reutilización consciente de los agentes

Los checkpoints semánticos conservan prefijos útiles entre bloques de razonamiento, llamadas a herramientas y ediciones de contexto de varios turnos.

Consejo del editor

FreeToken resulta especialmente atractivo cuando el checkpoint MoE seleccionado es más grande que la VRAM. Si el modelo cabe por completo en la RTX 5090, un runtime generalista consolidado puede seguir siendo igual de práctico.

Característica del runtimeFreeTokenRuntime híbrido estático habitual
Ubicación de expertosCaché LRU dinámicaUbicación fija o basada en el prefilling
Gestión de fallos de cachéTransferencia a la GPU o ejecución en CPUGeneralmente predeterminada
Reutilización del contexto del agenteCheckpoints semánticosDepende del runtime
Respuesta a los recursosSe ajusta al ancho de banda medidoA menudo requiere ajustes específicos del hardware
Enfoque principalServir modelos MoE grandesCompatibilidad amplia con inferencia local

Requisitos de configuración de la RTX 5090

La ruta acelerada de FreeToken se centra actualmente en Linux, sistemas x86-64, GPU NVIDIA, CUDA 13 y un controlador reciente. El proyecto destaca el hardware de las series RTX 30, 40 y 50, situando la RTX 5090 dentro de su principal rango objetivo.

La GPU es solo una parte de la configuración. El conjunto completo de expertos debe residir en la memoria del sistema cuando supera la VRAM. Una RTX 5090 no reduce el requisito total de memoria del modelo; mejora la coordinación de los recursos disponibles de GPU, CPU, RAM y PCIe.

La configuración de investigación también distingue entre el ancho de banda PCIe y el ancho de banda de procesamiento de expertos en el host. Estos valores deben medirse en el ordenador real, en lugar de inferirse únicamente a partir de las especificaciones del producto.

1

Confirma la plataforma

Utiliza una instalación de Linux x86-64 con una GPU NVIDIA compatible, CUDA 13 y un controlador actualizado. El proyecto también anuncia compatibilidad de escritorio con Windows y Linux, pero el flujo de trabajo acelerado documentado sigue estando fuertemente orientado a Linux.

2

Prepara la memoria del sistema

Reserva suficiente RAM para el conjunto completo de expertos residente en el host, el sistema operativo y otras aplicaciones. Los checkpoints grandes, como DeepSeek-V4-Flash, requieren bastante más memoria de lo que sugiere el recuento de parámetros activos.

3

Selecciona un checkpoint compatible

Comienza con un checkpoint compatible de Hugging Face o con una versión oficial de baja precisión. Qwen3.6-35B-A3B y DeepSeek-V4-Flash son ejemplos centrales de la evaluación de 2026.

4

Mide el equipo

Permite que el runtime cree un perfil del ancho de banda de procesamiento del host y del ancho de banda de transferencia PCIe. Estas mediciones orientan el equilibrio entre cargar elementos en la caché de la GPU y ejecutar expertos directamente en la CPU.

5

Conecta tu cliente

Inicia el servidor local mediante su API compatible con OpenAI o Anthropic y, después, conecta un cliente compatible de programación o de llamadas a herramientas.

Advertencia sobre la memoria

La RAM del sistema debe contener la parte del checkpoint que no cabe en la VRAM. Reducir el uso de memoria de la GPU no elimina el requisito de almacenamiento del modelo completo.

RequisitoOrientación para RTX 5090Por qué es importante
GPUHardware de clase NVIDIA RTX 5090Proporciona VRAM de gran ancho de banda para el cálculo activo y el almacenamiento en caché de expertos
Sistema operativoLinux es la prioridad documentadaLa ruta acelerada de línea de comandos se centra en Linux
CUDACUDA 13Requerido por la ruta de configuración documentada
RAM del sistemaDimensionada para el checkpoint completoLa memoria del host almacena los pesos de los expertos residentes
InterconexiónPCIe 5.0 x16 es ventajosoLas transferencias más rápidas reducen la latencia visible de los fallos de caché y del prefilling
Capa de APICompatible con OpenAI o AnthropicPermite que los clientes y agentes locales reutilicen flujos de trabajo conocidos

Pruebas de rendimiento y cargas de trabajo reales en la RTX 5090

La evaluación de 2026 mide el rendimiento de decodificación y el tiempo hasta el primer token en cargas de trabajo de matemáticas, agentes de programación, protocolos nativos y correo/calendario. Esto es importante porque un agente cambia repetidamente su contexto, llama a herramientas y envía nuevas solicitudes. Un prompt breve de una sola interacción no muestra el mismo comportamiento de prefilling y caché.

En una RTX 5090, FreeToken mantuvo aproximadamente entre 77 y 83 tokens por segundo con Qwen3.6-35B-A3B y entre 22 y 25 tokens por segundo con DeepSeek-V4-Flash en las cargas de trabajo probadas. La ventaja registrada frente a las alternativas compatibles más competitivas osciló aproximadamente entre 1,5x y 2,3x, según el modelo y el escenario.

ModeloParámetros totalesParámetros activosResultado en RTX 5090
Qwen3.6-35B-A3B35B3BAproximadamente 77–83 tok/s
DeepSeek-V4-Flash284BAproximadamente 13BAproximadamente 22–25 tok/s
GLM-5.2753B40BProbado en una RTX PRO 6000, no en una RTX 5090
Versión portátil de Qwen3.635B3BResultado en RTX 4060: 39,3 tok/s

Los resultados de la RTX 5090 son más sólidos cuando el modelo es más grande que la VRAM disponible de la GPU. La caché LRU compartida de FreeToken sigue la localidad de enrutamiento entre tokens, mientras que su política de ancho de banda decide cómo servir a los expertos que no están en la caché.

La evaluación informa de que la caché de FreeToken falló aproximadamente en el 16 % de las lecturas de expertos de Qwen3.6 y el 39 % de las lecturas de DeepSeek-V4-Flash con la capacidad de servicio probada en la RTX 5090. Los enfoques de ubicación comparables mostraron tasas de fallos superiores en las mismas trazas reproducidas.

Conclusión sobre el rendimiento

Para los agentes de ejecución prolongada, una generación estable y esperas máximas más cortas pueden ser más importantes que una tasa máxima de tokens en una sola interacción. El turno más lento registrado por FreeToken se mantuvo por debajo de 44 segundos en las celdas probadas con RTX 5090.

Carga de trabajoQué pruebaPor qué importan los resultados de la RTX 5090
Razonamiento matemáticoDecodificación larga con uso limitado de herramientasMide la generación sostenida de tokens
Agente de programaciónAcceso al repositorio y llamadas repetidas a herramientasPrueba la reutilización del contexto y la estabilidad de la caché
Programación con protocolo nativoSubagentes y sesiones de 56k–65k tokensExpone el comportamiento del prefilling con contextos largos
Agente de correo/calendarioTrece turnos de usuario predeterminadosPrueba el servicio repetido de varios turnos

Cómo utiliza FreeToken la RTX 5090

FreeToken organiza la memoria en una jerarquía. El conjunto de expertos residente en el host almacena los pesos completos de los expertos enrutados, mientras que los pesos que no pertenecen a expertos permanecen en la GPU. La VRAM restante se convierte en una caché de expertos compartida que puede dividirse de distintas formas a medida que cambia la sesión.

Durante el prefilling, el runtime utiliza doble búfer de capas completas cuando la memoria lo permite. Mientras la GPU procesa una capa, los expertos de la siguiente pueden transferirse mediante PCIe. Esto oculta parte del coste de transferencia detrás del cálculo activo. Durante la decodificación, el runtime utiliza una caché LRU compartida para realizar un seguimiento de los expertos seleccionados por las decisiones de enrutamiento recientes.

Un fallo de caché no se trata como una única operación fija. FreeToken calcula una división entre:

  • Cargas en la caché de la GPU, que transfieren los expertos ausentes mediante PCIe y los conservan para reutilizarlos.
  • Ejecución directa en la CPU, que procesa los expertos allí donde ya residen sus pesos.
  • Ejecución simultánea, que permite que ambas rutas contribuyan al token actual.

Esta división depende del ancho de banda medido del host y del ancho de banda PCIe. Un equipo de escritorio con una conectividad PCIe sólida puede favorecer más cargas en la caché de la GPU, mientras que un sistema con mayor ancho de banda de memoria del host puede realizar más trabajo directamente en la CPU.

Antes de probar FreeToken:

  • Verifica la compatibilidad con Linux, x86-64, NVIDIA, CUDA 13 y un controlador reciente
  • Calcula las necesidades de RAM del sistema para el checkpoint completo residente en el host
  • Elige un modelo MoE compatible y un formato oficial de baja precisión
  • Deja margen de VRAM para el crecimiento del contexto y otras aplicaciones
  • Registra los tokens por segundo, el tiempo hasta el primer token, el modelo, la cuantización y el hardware
Consejos para las pruebas

Registra el formato del modelo, la RAM del sistema, el enlace PCIe, la longitud del contexto, el cliente y la carga de trabajo. Un resultado es más fácil de interpretar cuando estas variables están documentadas.

OptimizaciónEtapaEfecto práctico
Doble búfer de capas completasPrefillingSuperpone las transferencias de expertos con el cálculo de la GPU
Caché LRU compartida de expertosDecodificaciónRealiza un seguimiento de los expertos enrutados recientemente en la VRAM
División adaptada al ancho de bandaDecodificaciónDivide los fallos entre las rutas PCIe y CPU
Checkpoints semánticosTurnos del agenteReutiliza los prefijos de contexto que no han cambiado
Redimensionamiento elástico de la cachéRuntimeAjusta la asignación de VRAM sin reiniciar el motor

El runtime también admite la reconfiguración dinámica en puntos seguros del planificador. Como la memoria del host sigue siendo la fuente de verdad, cambiar la capacidad de la caché de la GPU afecta al rendimiento, pero no a la corrección del modelo. Esto resulta útil en ordenadores personales donde los navegadores, las aplicaciones de escritorio y otras cargas de trabajo de GPU pueden modificar el presupuesto de VRAM disponible.

FreeToken frente a otros runtimes locales

FreeToken no es un sustituto universal de llama.cpp, Ollama o KTransformers. Su fortaleza proviene de la especialización. El proyecto se centra en checkpoints MoE grandes, aceleración NVIDIA, expertos residentes en el host y servicio orientado a agentes.

Llama.cpp ofrece una compatibilidad más amplia con hardware y sistemas operativos, incluidas rutas para CPU, NVIDIA, AMD y Apple Silicon. También cuenta con un amplio ecosistema GGUF y una madurez considerable. Ollama pone el énfasis en una gestión accesible de modelos locales, mientras que KTransformers se orienta a la ejecución híbrida CPU-GPU para familias de modelos compatibles.

La mejor opción depende de si tu modelo cabe en la VRAM y de si tu carga de trabajo es interactiva o está orientada a agentes.

Elige FreeToken

Tienes una GPU NVIDIA, suficiente RAM del sistema y un modelo MoE grande que supera la VRAM.

Elige llama.cpp

Necesitas una amplia compatibilidad de hardware, un ecosistema maduro o un modelo que quepa cómodamente en la VRAM.

Elige Ollama

Priorizas un flujo de trabajo local sencillo y una gestión compatible de modelos por encima de una planificación MoE especializada.

Evalúa KTransformers

Tu modelo y hardware coinciden con su ruta de ejecución híbrida y quieres realizar una comparación directa.

Consejo para la comparación

Compara los runtimes utilizando el mismo checkpoint, cuantización, historial de prompts, cliente y longitud de contexto. Un modelo más pequeño que quepa por completo en la VRAM puede hacer que la comparación resulte engañosa.

EscenarioDirección recomendadaMotivo
El MoE grande supera la VRAMFreeTokenDiseñado para servir expertos de forma adaptativa
El modelo cabe por completo en la VRAMCualquier runtime GPU maduroEl movimiento del host a la GPU es menos importante
Sistema Apple SiliconConsidera otro runtimeNo se destaca una ruta comparable de FreeToken
Amplia compatibilidad con CPU o AMDllama.cpp u otro runtime amplioLa ruta acelerada de FreeToken está centrada en NVIDIA
Sesiones largas de agentes de programaciónVale la pena evaluar FreeTokenLa reutilización de prefijos y la localidad de la caché adquieren importancia

Para obtener información técnica, consulta el artículo de investigación de FreeToken en arXiv y la versión del proyecto mencionada por los autores en flashml.ai. Estos enlaces ofrecen la base más sólida para comprobar los modelos compatibles, los cambios de implementación y las indicaciones de despliegue a medida que el proyecto evoluciona.

Preguntas frecuentes sobre FreeToken rtx 5090

Q: ¿Qué es FreeToken en una RTX 5090?

FreeToken es un runtime de inferencia local que sirve modelos grandes de mezcla de expertos coordinando la VRAM de la RTX 5090, la RAM del sistema, la ejecución en CPU y las transferencias PCIe. Es software para ejecutar modelos, no un modelo en sí mismo.

Q: ¿Qué velocidad alcanza FreeToken con una RTX 5090?

La evaluación de 2026 informa de aproximadamente entre 77 y 83 tokens por segundo para Qwen3.6-35B-A3B y entre 22 y 25 tokens por segundo para DeepSeek-V4-Flash en las cargas de trabajo probadas. Los resultados dependen del formato del modelo, el contexto, la memoria del host y la carga de trabajo.

Q: ¿Una RTX 5090 contiene el modelo completo de DeepSeek-V4-Flash?

No. El cálculo activo puede ejecutarse de forma práctica en la GPU, pero el conjunto completo de expertos sigue siendo mucho mayor que la VRAM. FreeToken almacena el resto en la memoria del sistema y mueve o ejecuta los expertos según sea necesario.

Q: ¿Es FreeToken mejor que llama.cpp para cualquier configuración?

No. FreeToken está especializado en modelos MoE grandes que superan la VRAM, especialmente agentes de ejecución prolongada. Llama.cpp sigue siendo más amplio y maduro, y se adapta mejor a muchos tipos de hardware y modelos que caben por completo en la memoria de la GPU.

Recordatorio final

Realiza pruebas con tu propio modelo y flujo de trabajo del agente antes de cambiar de runtime. La ventaja de la RTX 5090 depende de la carga de trabajo, y la RAM del sistema junto con el comportamiento de PCIe pueden cambiar sustancialmente el resultado.