FreeToken con 4 GB de VRAM: guía de configuración y límites de hardware - Hardware

FreeToken con 4 GB de VRAM: guía de configuración y límites de hardware

Descubre cómo FreeToken gestiona la VRAM limitada, la descarga en la CPU, la caché de expertos y los requisitos de hardware realistas para servir MoE localmente.

2026-08-25
Equipo de FreeToken
Guía rápida
  • FreeToken con 4 GB de VRAM es una consulta sobre los límites del hardware, no una configuración compatible confirmada.
  • Función de la VRAM: la memoria de la GPU almacena pesos que no son de expertos, páginas de caché KV y una caché dinámica de expertos.
  • Alternativa mediante CPU: los grupos completos de expertos pueden permanecer en la memoria del sistema mientras los expertos ausentes se ejecutan en la CPU.
  • Referencia práctica: la evaluación documentada incluye una GPU de portátil con 8 GB, no un modelo de 4 GB.
  • Mejor enfoque: mide el ancho de banda, reduce la presión de memoria y considera los 4 GB como un nivel experimental.

FreeToken con 4 GB de VRAM: qué significa la cuestión del hardware

FreeToken es un sistema de investigación para servir modelos grandes de mezcla de expertos en hardware personal. No es un juego, una guía de builds de personajes ni un tema relacionado con códigos de descarga. La pregunta central detrás de FreeToken con 4 GB de VRAM es si un presupuesto muy reducido de memoria de GPU puede participar en la inferencia mientras el grupo completo de expertos permanece en otro lugar.

El sistema separa los datos del modelo en dos grandes grupos. Los pesos que no son de expertos permanecen en la GPU, mientras que los pesos de los expertos seleccionados se almacenan en un grupo residente en la CPU. La VRAM restante se convierte en una caché elástica para entradas completas de capa–experto. Este diseño permite que el modelo funcione incluso cuando el grupo completo de expertos supera la capacidad de la GPU, pero una menor cantidad de VRAM normalmente implica más fallos de caché y una mayor dependencia de las transferencias mediante PCIe o de la ejecución en la CPU.

El artículo fuente documenta una evaluación con distintos tipos de hardware, desde una GPU de portátil con 8 GB hasta hardware de clase workstation. No confirma una configuración probada de 4 GB. Por lo tanto, una configuración de 4 GB debe considerarse un experimento limitado, no un objetivo de implementación garantizado.

Nivel de hardwareFunción documentadaPresión esperada
4 GB de VRAMNo confirmado en la evaluaciónEspacio muy limitado para el estado del tiempo de ejecución, la caché KV y las entradas de expertos
GPU de portátil con 8 GBNivel de evaluación documentado con Qwen3.6 NVFP4Presupuesto ajustado, pero con una ruta de servicio demostrada
Clase RTX 3090/4090/5090Sistemas principales de evaluación para consumidoresCaché más grande y mejor rendimiento de transferencia
Clase RTX PRO 6000Demostración a escala de fronteraAdmite configuraciones de modelos mucho más grandes

Presupuesto de VRAM

FreeToken utiliza la memoria disponible de la GPU para los pesos que no son de expertos, las páginas de caché KV y los expertos almacenados en caché. Un presupuesto de 4 GB deja poco espacio para los tres elementos.

Memoria del sistema

El grupo de expertos residente en la CPU sigue siendo la fuente principal de datos, por lo que la memoria de la GPU afecta más a la velocidad que a la corrección.

Ancho de banda

El ancho de banda de PCIe y de la memoria del sistema determina la eficiencia con la que los expertos ausentes pueden transferirse o ejecutarse desde la CPU.

No consideres los 4 GB como soporte confirmado

La evaluación publicada identifica una configuración de portátil con 8 GB, pero no establece un requisito mínimo de 4 GB ni un resultado probado con 4 GB. Evita presentar la compatibilidad con 4 GB como una afirmación oficial.

Cómo utiliza FreeToken la memoria limitada de la GPU

FreeToken utiliza una jerarquía de memoria de expertos de dos niveles. El sistema anfitrión conserva el grupo completo de expertos seleccionados, mientras que la GPU mantiene una caché LRU compartida. Cada espacio de la caché almacena los tensores necesarios para evaluar un par capa–experto. Esta organización lógica permite que la caché siga el comportamiento del enrutamiento en lugar de depender de una ubicación fija de expertos elegida durante el inicio.

Durante la decodificación, el enrutador identifica los expertos activos. Los expertos almacenados en caché se ejecutan directamente en la GPU. Los expertos ausentes se dividen en dos grupos: algunos se transfieren a los espacios de la caché de la GPU, mientras que otros se ejecutan directamente desde el grupo residente en la CPU. La división se basa en el ancho de banda medido, no en una especificación de hardware universal.

El artículo define la proporción de llenado aproximada de la siguiente manera:

q* ≈ m × BP / BH

Aquí, m es el número de expertos ausentes, BP es el ancho de banda de transferencia fijada medido y BH es el ancho de banda medido del procesamiento de expertos en la CPU. El significado práctico es sencillo: una transferencia PCIe más rápida favorece un mayor número de llenados de caché, mientras que un ancho de banda de memoria de CPU más alto hace que la ejecución directa en la CPU sea más útil.

Componente del tiempo de ejecuciónUbicaciónFunción
Pesos que no son de expertosMemoria de la GPUPermanecen residentes para el cálculo normal del modelo
Grupo completo de expertosMemoria del sistemaContiene la copia de origen de los expertos seleccionados
Caché de expertosMemoria de la GPUConserva las entradas de capa–experto utilizadas recientemente
Caché KVMemoria de la GPUConserva el estado de atención entre los tokens generados y los turnos
Metadatos de enrutamientoGPU y búferes del tiempo de ejecuciónIdentifica los expertos activos, almacenados en caché y ausentes
1

Mide el equipo

Perfila el ancho de banda práctico de transferencia PCIe y el ancho de banda del procesamiento de expertos en la CPU del sistema objetivo. Estos valores son más importantes que las especificaciones teóricas porque ambas rutas utilizan el mismo subsistema de memoria del sistema.

2

Reserva el presupuesto del tiempo de ejecución

Ten en cuenta los pesos que no son de expertos, las asignaciones de CUDA o del tiempo de ejecución, el crecimiento de la caché KV y la caché de expertos antes de decidir cuánta VRAM queda disponible para los expertos almacenados en caché.

3

Comienza con una caché fría

FreeToken está diseñado para atender la primera solicitud sin una fase de calentamiento independiente. Los fallos iniciales pueden gestionarse mediante las rutas normales de transferencia y ejecución en la CPU.

4

Observa el comportamiento de la caché

Supervisa si la carga de trabajo enruta repetidamente hacia expertos cercanos. Una fuerte localidad permite que la caché LRU resulte útil; un conjunto de trabajo cambiante aumenta la presión por fallos.

Piensa en ancho de banda, no en cantidad de núcleos

En lotes de decodificación pequeños, la ejecución de expertos suele estar limitada por la memoria. Añadir núcleos de CPU no resuelve automáticamente un cuello de botella de ancho de banda, así que mide la ruta de memoria efectiva que utilizan los kernels implementados.

Qué puede esperarse de forma realista con una configuración de 4 GB

Una GPU de 4 GB tiene un área de trabajo mucho menor que el nivel documentado de portátil con 8 GB. Esa diferencia afecta a algo más que al número de expertos que pueden almacenarse en caché. El mismo presupuesto de memoria también debe alojar los componentes del modelo residentes en la GPU y el estado relacionado con el contexto. A medida que crecen las conversaciones o las sesiones de agentes, la demanda de caché KV puede aumentar, mientras que resulta más difícil conservar capacidad para la caché de expertos.

Con menos espacio de caché, FreeToken puede encontrarse con más fallos en frío, cambios constantes del conjunto de trabajo y movimiento de datos entre el sistema anfitrión y el dispositivo. La ruta de ejecución en la CPU puede ayudar a absorber algunos fallos, pero no elimina el coste de leer los pesos de los expertos desde la memoria del sistema. Por lo tanto, el rendimiento dependerá del formato del modelo, la longitud del prompt, el ancho de banda de la CPU, el enlace PCIe, el comportamiento de la memoria del sistema operativo y las aplicaciones concurrentes.

RestricciónEfecto en 4 GB de VRAMRespuesta recomendada
Caché de expertos pequeñaMás expertos seleccionados no estarán en la caché de la GPUUtiliza, cuando sea posible, cargas de trabajo con una localidad de enrutamiento estable
Caché KV crecienteQueda menos memoria para las entradas de expertosSupervisa el crecimiento del contexto
GPU de escritorio compartidaLa VRAM disponible puede fluctuarCierra las aplicaciones que consuman mucha memoria antes de servir modelos
Enlace PCIe limitadoEl movimiento de expertos tarda másPrefiere una conexión directa y de alto ancho de banda cuando esté disponible
Presión sobre la memoria del sistemaLa ejecución y las transferencias de la CPU compiten por el ancho de bandaDeja suficiente RAM del sistema y evita cargas en segundo plano innecesarias

La fuente informa de que una configuración de portátil con 8 GB sirvió Qwen3.6 utilizando una versión oficial NVFP4 y mantuvo un rendimiento de decodificación medible. Ese resultado es útil como punto de referencia, pero no debe extrapolarse directamente a 4 GB. Una GPU más pequeña puede necesitar una división más agresiva entre la caché KV y la caché de expertos, y algunas configuraciones del modelo quizá no dejen suficiente espacio para un tiempo de ejecución práctico.

Una secuencia de evaluación útil consiste en comenzar con una solicitud breve de un solo turno. Después, prueba un prompt más largo, seguido de varios turnos que cambien el contexto. Esto separa el comportamiento del inicio en frío del comportamiento de decodificación sostenida y revela si la caché de la GPU sigue siendo eficaz a medida que cambia la demanda de memoria.

Mejor estrategia experimental

Considera los 4 GB como un nivel de perfilado. Comienza con un contexto pequeño, registra la latencia del primer token y el rendimiento de decodificación, y después aumenta gradualmente la longitud del contexto en lugar de asumir que un inicio exitoso demuestra una usabilidad sostenida.

Lista de comprobación de memoria y rendimiento de FreeToken

El paso de preparación más importante es identificar qué recurso está limitando la ejecución. FreeToken está diseñado para adaptar su caché de expertos en puntos seguros del planificador sin reiniciar el motor ni volver a cargar el grupo residente en el sistema anfitrión. Esta flexibilidad es especialmente relevante en ordenadores personales, donde los navegadores, los compositores del escritorio y otras aplicaciones pueden cambiar la VRAM disponible.

El grupo del lado del sistema anfitrión también se beneficia de una disposición optimizada. El artículo describe el formato FreeToken Weight, que almacena los pesos de los expertos en una organización de bancos adecuada para el tiempo de ejecución. Las lecturas directas en la disposición final del sistema anfitrión pueden reducir el trabajo de inicio, mientras que la fijación de memoria retrasada evita activar páginas vacías solo para sobrescribirlas.

ComprobaciónPor qué importaCondición de aprobación
Memoria de la GPUDetermina el margen para la caché y la caché KVLa asignación del tiempo de ejecución deja espacio operativo
RAM del sistemaAloja el grupo completo de expertos y los procesos activosLa asignación del grupo no provoca un intercambio de memoria grave
Ruta PCIeControla la velocidad de transferencia para llenar la cachéEl ancho de banda medido permanece estable bajo carga
Ancho de banda de la CPUDetermina la capacidad de gestionar fallos directamente en la CPULos kernels de expertos mantienen un rendimiento repetible
Crecimiento del contextoReduce el espacio disponible para los expertosLa demanda de KV se mantiene dentro del presupuesto previsto

Lista de comprobación de perfilado de 4 GB:

  • Registra la VRAM disponible antes de iniciar el tiempo de ejecución
  • Cierra las aplicaciones que compitan por la memoria de la GPU
  • Mide el ancho de banda práctico de PCIe y de la CPU
  • Prueba prompts cortos antes de aumentar la longitud del contexto
  • Compara el comportamiento con caché fría y la decodificación sostenida
Consulta el artículo de investigación para los detalles técnicos

Para consultar la arquitectura, las ecuaciones, la configuración de evaluación y los niveles de hardware indicados, revisa directamente el artículo FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution.

Límites, compromisos y conclusiones seguras

El diseño de FreeToken cambia el significado de “caber” para un modelo MoE. Un modelo no necesita necesariamente tener todos sus expertos residentes en la VRAM al mismo tiempo, ya que los expertos inactivos pueden permanecer en la memoria del sistema. Sin embargo, hacer que el modelo quepa en una jerarquía de memoria direccionable es distinto de servirlo a una velocidad interactiva. Cada fallo de caché genera una decisión de planificación y un coste de ancho de banda de memoria.

El sistema combina varios mecanismos para reducir ese coste:

  • Doble búfer de capa completa solapa las transferencias de prellenado con el cálculo de la GPU.
  • Caché de estado con conciencia semántica conserva estados recurrentes y prefijos alrededor de los límites de edición agéntica.
  • Caché LRU de expertos compartida sigue la localidad de enrutamiento reciente entre los pasos de decodificación.
  • Ejecución adaptada al ancho de banda divide los fallos entre los llenados de la caché de la GPU y la ejecución en la CPU.
  • Gestión elástica de memoria ajusta la división entre la caché de expertos y la caché KV a medida que cambian las condiciones.
AfirmaciónInterpretación respaldada
“El modelo supera la VRAM”FreeToken está diseñado para esta condición de servicio en el borde
“El modelo funciona con 4 GB”No está confirmado por la evaluación documentada
“La descarga en la CPU elimina toda la latencia”Incorrecto; las transferencias y las lecturas de la CPU siguen consumiendo ancho de banda
“Más VRAM siempre resuelve el servicio”Una mayor capacidad de caché ayuda, pero el ancho de banda del sistema anfitrión y de PCIe sigue siendo importante
“Un resultado de benchmark se aplica en todas partes”Los resultados varían según el formato del modelo, la carga de trabajo, el hardware y el comportamiento del contexto

Para un sistema de 4 GB, la conclusión más segura es condicional: la arquitectura de FreeToken ofrece una vía para experimentar con memoria de GPU limitada, pero la fuente disponible no establece los 4 GB como un objetivo oficial o generalmente práctico. Si el tiempo de ejecución no puede reservar suficiente memoria para los componentes necesarios de la GPU, o si la rotación de la caché hace que la latencia sea inaceptable, la limitación es arquitectónica y específica del hardware, no un simple error de configuración.

Evita las afirmaciones de hardware no respaldadas

No anuncies un modelo específico, una cifra de rendimiento ni un requisito mínimo de VRAM para 4 GB a menos que un nuevo benchmark o una versión oficial documente esa configuración exacta.

Preguntas frecuentes sobre FreeToken con 4 GB de VRAM

Q: ¿FreeToken admite oficialmente 4 GB de VRAM?

El artículo de 2026 disponible no confirma una configuración de 4 GB. Su evaluación documentada en un portátil utiliza una GPU de 8 GB, por lo que los 4 GB deben considerarse un nivel de hardware experimental.

Q: ¿Por qué FreeToken puede servir modelos más grandes que la VRAM disponible?

FreeToken mantiene el grupo completo de expertos en la memoria del sistema y utiliza la memoria de la GPU para los pesos que no son de expertos, el estado KV y una caché de expertos compartida. Los expertos ausentes pueden transferirse a la GPU o ejecutarse directamente en la CPU.

Q: ¿Qué importa más además de la VRAM?

El ancho de banda medido de transferencia PCIe, el ancho de banda de memoria de la CPU, la RAM del sistema, la representación del modelo, la longitud del contexto y las aplicaciones que compiten por los recursos influyen en el resultado.

Q: ¿Puede una GPU de 4 GB lograr los mismos resultados que el portátil documentado con 8 GB?

La fuente no establece ningún resultado equivalente. Una caché más pequeña puede provocar más fallos y un mayor tráfico de memoria del sistema, por lo que el rendimiento e incluso la viabilidad práctica de la implementación deben probarse por separado.

Conclusión final

Utiliza el artículo de FreeToken como referencia arquitectónica, no como prueba de que cualquier equipo con poca VRAM ofrecerá la misma experiencia de servicio.