- Enfoque de FreeToken rtx 4090: Comprende cómo el servicio MoE nativo del edge utiliza conjuntamente la GPU, la CPU, la memoria y el ancho de banda PCIe.
- Ventaja principal: Una caché LRU de expertos compartida sigue el enrutamiento de tokens en lugar de depender de una ubicación fija de los expertos.
- Mejor caso de uso: Ordenadores de sobremesa NVIDIA recientes con abundante memoria del sistema y cargas de trabajo MoE sostenidas.
- Limitación importante: La versión de 2026 está orientada a la beta y se dirige principalmente a Linux con NVIDIA CUDA.
- Lección de los benchmarks: Compara la latencia de cola y los métodos de medición, no solo la cifra principal de tokens por segundo.
Descripción general de FreeToken rtx 4090
Las conversaciones sobre FreeToken rtx 4090 se centran en una pregunta técnica: ¿cómo puede un ordenador de sobremesa de consumo servir modelos de mezcla de expertos cuyos pesos completos superan la memoria GPU disponible? FreeToken trata la estación de trabajo como una plataforma de inferencia unificada, en lugar de considerar la VRAM como el único recurso útil. El entorno de ejecución mantiene el conjunto completo de expertos en la memoria del sistema, coloca los pesos que no pertenecen a expertos en la GPU y utiliza la VRAM restante como una caché elástica.
El enfoque está diseñado para el servicio local de IA, especialmente para cargas de trabajo agénticas que editan repetidamente el contexto y generan respuestas extensas. No es un juego, un sistema de personajes ni una plataforma de códigos de canje. Su vocabulario relevante incluye inferencia MoE, caché de expertos, prefill, decode, transferencia PCIe y latencia de cola.
Aspectos destacados del vídeo:
- La caché consciente del enrutamiento de FreeToken se compara con estrategias de ubicación estática.
- La explicación muestra por qué el cálculo disperso no elimina las necesidades de memoria del modelo completo.
- Los ordenadores de sobremesa de clase RTX se presentan como objetivos prácticos para servir modelos locales de vanguardia.
- La interpretación de los benchmarks incluye tanto el rendimiento como el tiempo de respuesta en el peor caso.
| Componente | Enfoque de FreeToken | Por qué es importante |
|---|---|---|
| Memoria de la GPU | Caché elástica de expertos | Mantiene cerca de la GPU los expertos enrutados recientemente |
| Memoria del sistema | Conjunto completo de expertos | Permite modelos más grandes que la VRAM disponible |
| CPU | Ejecución directa de los fallos seleccionados | Utiliza el ancho de banda restante del sistema durante el decode |
| Enlace PCIe | Ruta de transferencia medida | Mueve únicamente los fallos seleccionados para su ejecución en la GPU |
| Política del entorno de ejecución | Adaptativa y consciente del dispositivo | Se ajusta a la máquina implementada en lugar de usar una distribución fija |
El ordenador de sobremesa de clase RTX 4090 es relevante porque su conexión PCIe 4.0 x16 es considerablemente más lenta que el propio subsistema de memoria de la tarjeta. Por ello, el diseño de FreeToken intenta evitar que cada fallo de caché se convierta en una transferencia serializada. Cuando un experto enrutado no está presente en la VRAM, el planificador puede llenar la caché y ejecutar ese experto en la GPU, o ejecutarlo directamente desde el conjunto residente en la CPU.
Considera FreeToken como un entorno de ejecución de inferencia, no como un modelo. El checkpoint del modelo, el formato de cuantización, la capacidad de memoria del sistema, el entorno CUDA y la carga de servicio afectan al resultado.
Cómo funciona la jerarquía de memoria MoE
Un modelo de mezcla de expertos contiene muchas redes expertas, pero cada token activa solo un pequeño subconjunto. El diseño de referencia describe DeepSeek-V4-Flash con 284 mil millones de parámetros totales y 13 mil millones de parámetros activos, con seis de los 256 expertos enrutados seleccionados por capa. Esta dispersión reduce el cálculo, pero el conjunto completo de expertos aún debe permanecer accesible porque el siguiente token podría elegir expertos diferentes.
FreeToken separa el modelo en dos niveles prácticos:
- El conjunto de expertos residente en la CPU contiene los pesos de origen.
- La GPU almacena los pesos que no pertenecen a expertos, además de una caché compartida de entradas completas de capa y experto.
Una entrada de caché representa un par lógico de capa y experto. Esto es importante porque FreeToken no gestiona fragmentos de tensores aislados como objetos sin relación. Puede identificar, conservar, reemplazar y ejecutar un experto completo mediante la misma asignación lógica tanto en la CPU como en la GPU.
| Fase del servicio | Principal cuello de botella | Mecanismo de FreeToken | Beneficio esperado |
|---|---|---|---|
| Prefill | Movimiento de grandes cantidades de expertos y trabajo repetido sobre el contexto | Doble búfer de capa completa y checkpoints semánticos | Oculta las transferencias y evita recomputaciones innecesarias |
| Decode | Fallos de la caché de expertos | Caché LRU compartida más ejecución adaptativa en CPU/GPU | Sigue la localidad actual del enrutamiento |
| Sesiones largas | Creciente demanda de caché KV | Reconfiguración de memoria en tiempo de ejecución | Cambia el presupuesto de caché sin un reinicio completo |
| Inicio | Carga elevada de memoria del sistema | Carga directa en la disposición final del sistema | Reduce la sobrecarga de preparación |
Durante el prefill, el entorno de ejecución carga los expertos de la siguiente capa mientras la GPU calcula la capa actual. Esto es diferente de esperar a cada experto individual únicamente después de que se haya producido el enrutamiento. El prefill activa una amplia parte del conjunto de expertos, por lo que la transmisión de la capa completa permite que la ruta de transferencia realice trabajo útil antes de que comience la siguiente capa.
Durante el decode, el enrutamiento es mucho más disperso. FreeToken utiliza una caché LRU de expertos compartida para conservar los expertos seleccionados recientemente entre capas y tokens. La caché no queda congelada durante el inicio. Cambia a medida que cambia el patrón de enrutamiento de la carga de trabajo, lo que la hace más adecuada para agentes de varios turnos que una ubicación fija seleccionada al cargar el modelo.
El diseño también reconoce los límites semánticos del contexto de un agente. Los segmentos de razonamiento, las llamadas a herramientas, sus resultados y los turnos de conversación suelen editarse como bloques completos. Los checkpoints colocados en esos límites pueden conservar prefijos útiles, permitiendo que el entorno de ejecución recalcule únicamente el nuevo sufijo después de una edición.
La activación dispersa no significa que el modelo completo desaparezca de la memoria. Un checkpoint MoE grande sigue necesitando una ruta fiable hacia la memoria del sistema, y una memoria insuficiente puede impedir una implementación práctica incluso cuando el número de parámetros activos parece manejable.
Flujo de configuración y ajuste de RTX 4090
El material de 2026 proporcionado presenta FreeToken como un entorno de ejecución orientado a la beta, con NVIDIA CUDA y compatibilidad con POSIX/Linux. Por tanto, una configuración práctica para RTX 4090 debe comenzar con comprobaciones de compatibilidad, no con expectativas de benchmark. Confirma el entorno operativo, la capacidad de memoria, el formato del modelo y la carga de trabajo prevista antes de intentar optimizar.
Confirma la plataforma
Utiliza un entorno NVIDIA CUDA compatible y verifica que el sistema operativo, la pila de controladores, el presupuesto de memoria de la GPU y la capacidad de memoria del sistema sean adecuados para el modelo seleccionado. Los clasificadores de la beta publicados hacen hincapié en POSIX/Linux y NVIDIA CUDA.
Selecciona un modelo MoE compatible
Comienza con un modelo y una representación de pesos documentados por el proyecto. La evaluación de FreeToken cubre modelos como Qwen3.6-35B-A3B, DeepSeek-V4-Flash y GLM-5.2, pero la compatibilidad depende de la disposición del checkpoint y de la cuantización.
Prepara el almacenamiento y la memoria del sistema
Reserva suficiente almacenamiento rápido para el checkpoint y suficiente memoria del sistema para el conjunto completo de expertos. El conjunto residente en el sistema sigue siendo la fuente de verdad, mientras que la memoria de la GPU se trata como un recurso de rendimiento.
Mide la máquina
Perfila el ancho de banda del procesamiento de expertos en el sistema y el ancho de banda de transferencia PCIe con memoria fijada. FreeToken utiliza estas mediciones para determinar cuántos fallos de caché deben moverse a la GPU y cuántos deben ejecutarse en la CPU.
Prueba cargas de trabajo reales
Evalúa la generación de un solo turno, las sesiones de agentes de varios turnos, los prompts largos y el comportamiento de llamadas a herramientas. Registra el rendimiento, el tiempo hasta el primer token, la latencia del peor turno y si el cliente alcanza el tiempo de espera.
En un sistema de clase RTX 4090, el ancho de banda PCIe y la memoria del sistema de doble o varios canales pueden influir en el equilibrio entre la ejecución en la CPU y el llenado de la caché de la GPU. La división óptima no puede deducirse de forma segura únicamente a partir de las especificaciones del producto. Debe medirse utilizando las formas de tensor implementadas y el kernel de expertos real de la CPU.
| Área de ajuste | Qué inspeccionar | Decisión práctica |
|---|---|---|
| Presupuesto de VRAM | Caché KV, pesos no expertos, capacidad libre | Deja espacio para una caché elástica de expertos |
| Ancho de banda del sistema | Tasa efectiva de procesamiento de expertos en la CPU | Evita enviar todos los fallos a la CPU |
| Ancho de banda PCIe | Tasa de transferencia con memoria fijada | Utiliza llenados de caché cuando la reutilización futura justifique el movimiento |
| Patrón del prompt | Contexto largo, ediciones de herramientas, prefijos repetidos | Favorece la reutilización de checkpoints semánticos |
| Comportamiento del cliente | Watchdogs y tiempos de espera de solicitudes | Prioriza la latencia de cola sobre la velocidad máxima |
Comienza con una prueba breve de un solo turno y después pasa a prompts largos y agentes de varios turnos. Una configuración que parece rápida en un decode aislado puede comportarse de forma diferente cuando el prefill y la edición del contexto dominan la sesión.
Benchmarks, comparaciones y compromisos
La evaluación publicada informa de que FreeToken mantiene entre 77 y 83 tokens por segundo en Qwen3.6-35B y entre 22 y 25 tokens por segundo en DeepSeek-V4-Flash en un sistema de prueba con RTX 5090. También informa de una ventaja de 1,3× sobre la línea base más sólida en un sistema RTX 4090 dentro de una comparación entre distintos tipos de hardware para agentes de programación. Estos resultados deben interpretarse como mediciones específicas del sistema, no como un rendimiento garantizado en RTX 4090.
La comparación más útil es el mecanismo que produce el resultado. Con la misma capacidad de caché, la configuración de servicio con RTX 5090 citada mostró que la LRU global de FreeToken fallaba en el 16 % de las lecturas de expertos de Qwen3.6, frente al 62 % de la división estática sin conocimiento del enrutamiento atribuida a llama.cpp. DeepSeek-V4-Flash mostró un orden similar, con un 39 % para FreeToken y un 89 % para llama.cpp en el análisis de reproducción citado.
| Motor o estrategia | Comportamiento de ubicación | Fortaleza | Compromiso |
|---|---|---|---|
| FreeToken | LRU compartida consciente del enrutamiento | Se adapta a la localidad a nivel de token | Requiere un entorno de ejecución compatible y una ruta CUDA |
| Modo híbrido de llama.cpp | Ubicación fija orientada por capas | Amplio ecosistema de hardware | La ubicación puede no seguir los cambios de enrutamiento |
| KTransformers | Ubicación de elementos activos actualizada durante el prefill | Kernels sólidos de expertos en la CPU | Menos dinámico que el comportamiento LRU por fallo |
| Ruta de expertos exclusiva de CPU | Ejecuta los fallos donde residen los pesos | Alternativa sencilla de implementación | El ancho de banda de la memoria del sistema limita el decode |
La latencia de cola merece especial atención. La evaluación informa de que el peor turno de FreeToken estuvo por debajo de 44 segundos en las celdas probadas, mientras que los valores atípicos de las líneas base alcanzaron 232 segundos para llama.cpp, 179 segundos para Ollama y 946 segundos para KTransformers. Una cola larga puede hacer que el cliente del agente termine una solicitud, por lo que el promedio de tokens por segundo por sí solo no describe la usabilidad.
La metodología del benchmark también debe examinarse con cuidado. La comparación principal utiliza una cifra de Codex en producción que incluye elementos de extremo a extremo, mientras que otra cifra utiliza la velocidad de decode pura. Esas mediciones no son intercambiables. Al comparar FreeToken con otro entorno de ejecución, iguala los pesos del modelo, la precisión, el prompt, el comportamiento por lotes, el tratamiento del prefill y la definición de la métrica.
Para conocer los detalles técnicos, consulta el artículo de investigación de FreeToken. La dirección de lanzamiento del proyecto también se describe en flashml.ai, el lugar adecuado para comprobar la disponibilidad actual en vez de depender de paquetes no oficiales.
Rendimiento
- El almacenamiento en caché consciente del enrutamiento puede reducir los fallos de expertos.
- La ejecución adaptativa en la CPU utiliza un ancho de banda que las rutas basadas únicamente en transferencias podrían dejar inactivo.
- La latencia de cola es una métrica clave de disponibilidad.
Compatibilidad
- NVIDIA CUDA es el objetivo principal publicado.
- Se destaca la compatibilidad orientada a Linux.
- El formato del modelo y la cuantización siguen siendo importantes.
Control local
- Los prompts y las salidas pueden permanecer en la máquina local.
- El uso no está sujeto a los límites de velocidad de las API alojadas.
- El operador controla el ciclo de vida del modelo.
Compromisos
- Los requisitos de memoria del sistema siguen siendo considerables.
- El inicio aún implica cargar un conjunto grande de expertos.
- La validación de terceros puede ser limitada en las primeras versiones.
No copies una cifra de tokens por segundo de otra GPU o modelo y la apliques a una RTX 4090. Reproduce la carga de trabajo e informa tanto del rendimiento medio como del turno significativo más lento.
Lista de preparación y preguntas frecuentes sobre RTX 4090
Utiliza esta lista antes de considerar un ordenador de sobremesa de clase RTX 4090 como un host fiable para FreeToken. El objetivo no es simplemente iniciar un modelo, sino mantener un comportamiento predecible con prompts largos y turnos repetidos de agentes.
Preparación para la implementación:
- Confirma la compatibilidad del entorno NVIDIA CUDA y del runtime orientado a Linux
- Reserva suficiente memoria del sistema para el conjunto completo de expertos
- Verifica el checkpoint seleccionado y el formato de cuantización
- Mide la transferencia PCIe y el ancho de banda de procesamiento de expertos en la CPU
- Prueba la latencia del peor turno frente al tiempo de espera del cliente
Q: ¿FreeToken es un juego o una herramienta RTX 4090 relacionada con juegos?
No. FreeToken es un sistema de servicio nativo del edge para la inferencia local de mezcla de expertos. La RTX 4090 es relevante como hardware de consumo para ejecutar cargas de trabajo de IA compatibles.
Q: ¿Puede una RTX 4090 ejecutar todos los modelos evaluados por FreeToken?
No. El tamaño del modelo, la cuantización, la capacidad de memoria del sistema, la disposición del checkpoint y la compatibilidad del entorno de ejecución determinan si una configuración resulta práctica. La evaluación publicada incluye varios niveles de GPU en lugar de un requisito universal de hardware.
Q: ¿Por qué FreeToken utiliza tanto la ejecución en la CPU como las transferencias PCIe?
Un experto ausente puede trasladarse a la caché de la GPU o ejecutarse directamente desde la memoria del sistema. FreeToken mide el ancho de banda y divide los fallos entre esas rutas para que la CPU y el enlace PCIe puedan contribuir de forma simultánea.
Q: ¿Qué debería comparar al probar FreeToken frente a otro motor?
Utiliza pesos y precisión idénticos, prompts y cargas de trabajo equivalentes, y métricas claramente definidas. Compara el rendimiento del decode, el tiempo hasta el primer token, los fallos de caché y la latencia del peor turno, en lugar de basarte únicamente en un promedio principal.
FreeToken resulta especialmente atractivo para usuarios con un ordenador de sobremesa NVIDIA reciente, abundante memoria del sistema, software Linux compatible y cargas de trabajo MoE o de agentes de programación sostenidas. Para obtener una compatibilidad de hardware más amplia, verifica el estado actual de la versión antes de cambiar de entorno de ejecución.