FreeToken vram: Guía de configuración para inferencia MoE local - Hardware

FreeToken vram: Guía de configuración para inferencia MoE local

Aprende cómo FreeToken utiliza la VRAM, la RAM del sistema, el ancho de banda PCIe y la caché adaptativa de expertos para servir modelos MoE localmente.

2026-08-25
Equipo de FreeToken
Guía rápida
  • La vram de FreeToken funciona como una caché elástica de expertos, no como la única memoria del modelo.
  • La RAM del sistema almacena el conjunto completo de expertos cuando un modelo supera la VRAM disponible.
  • El ancho de banda PCIe afecta considerablemente a las transferencias de expertos durante el prellenado y la decodificación.
  • 32 GB de RAM pueden ser suficientes para pruebas pequeñas, mientras que 64 GB o más ofrecen mayor flexibilidad.
  • La caché adaptativa modifica la permanencia en la GPU a medida que cambian la memoria disponible y los patrones de enrutamiento.

Explicación de la vram de FreeToken

La vram de FreeToken se entiende mejor como parte de un sistema unificado de inferencia local. FreeToken sirve modelos de mezcla de expertos combinando la memoria de la GPU, la RAM del sistema, el procesamiento de la CPU y el enlace PCIe entre ellos. El conjunto completo de expertos enrutados puede permanecer en la memoria del sistema, mientras que la VRAM disponible almacena pesos que no son de expertos, el estado de ejecución, las páginas de la caché KV y los expertos utilizados recientemente.

Este diseño es importante porque un modelo MoE puede tener un número total de parámetros muy elevado, pero activar solo un subconjunto menor para cada token. DeepSeek-V4-Flash se describe como un modelo de 284B parámetros, con aproximadamente 13B parámetros activos por token. Esto hace que el servicio local sea más práctico, pero no elimina la necesidad de mantener el conjunto más amplio de expertos en algún lugar.

Aspectos destacados del video:

  • Las pruebas con una sola GPU demuestran el servicio local de FreeToken con una RTX 3090.
  • DeepSeek-V4-Flash alcanza aproximadamente entre 10 y 11 tokens por segundo en una configuración de servidor.
  • El cliente de escritorio es más fácil de iniciar, pero puede ofrecer un rendimiento menor que la ruta del servidor.
  • La capacidad y el ancho de banda de la RAM del sistema influyen directamente en el rendimiento práctico.
Área de memoriaFunción en FreeTokenLimitación principal
VRAMCaché de expertos, pesos que no son de expertos, caché KV y activacionesCapacidad limitada y compartida con otras aplicaciones
RAM del sistemaConjunto completo de expertos residente en el sistemaEl ancho de banda de doble canal puede limitar la velocidad de decodificación
Caché y núcleos de la CPUEjecutan determinadas pérdidas de caché cuando resulta útilEl rendimiento depende del ancho de banda medido del sistema
Almacenamiento NVMeCarga el conjunto de expertos durante el inicioLa velocidad del disco afecta al tiempo de arranque en frío
Enlace PCIeTransfiere expertos de la RAM a la VRAMEl ancho y la generación del enlace afectan a la latencia de transferencia

La conclusión práctica es sencilla: más VRAM ayuda, pero la VRAM por sí sola no define el rango de modelos compatibles. Un sistema con una GPU potente y memoria del sistema insuficiente aún puede no cargar un modelo de escala punta. Por el contrario, un sistema con suficiente RAM puede ejecutar un modelo con un comportamiento de descarga más flexible, aunque la velocidad de respuesta depende en gran medida del ancho de banda.

Principio fundamental

Considera la VRAM como un presupuesto de rendimiento. FreeToken puede utilizar la RAM del sistema como fuente principal, pero una VRAM más grande y rápida generalmente mejora las tasas de aciertos de la caché y reduce las transferencias repetidas.

Requisitos de vram y RAM del sistema de FreeToken

Los requisitos de memoria de FreeToken varían según el modelo, el formato de cuantización, la longitud del contexto y la cantidad de VRAM reservada para la caché de expertos. Las referencias disponibles describen 32 GB de RAM del sistema como un punto de partida práctico para una configuración con una sola GPU, mientras que 64 GB ofrecen un margen operativo más cómodo. Los modelos más grandes pueden requerir bastante más.

La huella completa del modelo no debe confundirse con los parámetros activos. La activación dispersa reduce el cálculo necesario para cada token, mientras que los expertos inactivos aún deben permanecer en la memoria del sistema o en otro nivel de almacenamiento. Por eso, un modelo puede ser viable desde el punto de vista computacional y aun así fallar porque el presupuesto combinado de VRAM y RAM utilizable sea demasiado pequeño.

ConfiguraciónPosición prácticaUso esperado
8 GB de VRAM más 32 GB de RAMConfiguración de prueba de entradaModelos MoE más pequeños o servicio local muy limitado
12–24 GB de VRAM más 64 GB de RAMConfiguración equilibrada para consumidoresCaché de expertos más flexible y sesiones más largas
24 GB de VRAM más 96–128 GB de RAMRango sólido para una sola GPUExperimentos con modelos MoE grandes y mayor margen de memoria del sistema
32 GB de VRAM más 128 GB o más de RAMNivel local de alta capacidadConjuntos de expertos más grandes y más espacio para ampliar el contexto
48–96 GB de VRAM más varios cientos de GB de RAMNivel de estación de trabajoDemostraciones de escala punta, como modelos NVFP4 muy grandes

Un contexto más largo también cambia el equilibrio de memoria. A medida que crece una sesión de agente, la demanda de la caché KV puede aumentar, mientras que el conjunto de trabajo de expertos permanece relativamente estable. Por lo tanto, FreeToken debe ajustar la división entre las páginas de la caché KV y los espacios de la caché de expertos, en lugar de tratar la asignación inicial del inicio como permanente.

El artículo FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution, publicado en 2026, describe este enfoque de memoria elástica. La caché de expertos de la GPU puede reconstruirse en puntos seguros del planificador sin reiniciar el motor ni volver a cargar el conjunto completo de expertos residente en la CPU.

Capacidad de VRAM

  • Almacena datos de expertos activos y el estado de ejecución
  • Una mayor capacidad mejora la permanencia de los expertos
  • Deja espacio para las aplicaciones de escritorio

Capacidad de RAM

  • Contiene el conjunto completo de expertos
  • Determina qué modelos pueden cargarse
  • El margen adicional ayuda durante las sesiones largas

Ancho de banda de memoria

  • Controla el procesamiento de expertos en la CPU
  • Afecta a la competencia por las transferencias PCIe
  • La memoria DDR5 puede mejorar la ruta del sistema
Advertencia de memoria

No evalúes la compatibilidad basándote únicamente en la capacidad de VRAM. FreeToken puede indicar que la memoria utilizable es insuficiente cuando el modelo, el entorno de ejecución, la caché KV y los expertos residentes en el sistema no caben juntos.

Pasos de configuración de la vram de FreeToken

Sigue estos pasos para preparar una implementación local de FreeToken. La interfaz exacta y la lista de modelos compatibles pueden cambiar, ya que el material de pruebas disponible describe la aplicación de escritorio como software beta.

1

Mide la memoria disponible

Cierra las aplicaciones innecesarias de la GPU y comprueba la VRAM y la RAM del sistema utilizables antes de iniciar un modelo. Los navegadores, el software de grabación, los juegos, las máquinas virtuales y los compositores de escritorio pueden reducir la memoria disponible para FreeToken.

2

Elige un modelo compatible

Comienza con un modelo MoE que se ajuste a tu presupuesto de memoria combinado. DeepSeek-V4-Flash es un caso de prueba relevante porque la activación dispersa permite que un modelo grande utilice una sola GPU de consumo con descarga a la memoria del sistema.

3

Instala la compilación adecuada

Selecciona el paquete correspondiente a tu sistema operativo. El material disponible hace referencia a Windows, Ubuntu AppImage, Arch Linux y una ruta de aplicación de escritorio. Mantén el controlador gráfico y el entorno CUDA compatibles con la compilación seleccionada.

4

Inicia el servidor API

Carga el modelo y espera hasta que la interfaz indique que el servidor API está listo. Esto indica que el entorno de ejecución ha completado su configuración inicial y puede aceptar solicitudes mediante un cliente compatible.

5

Conecta un cliente de chat

Utiliza una interfaz como Open WebUI u otro endpoint compatible. Primero haz una prueba con un prompt corto y, después, supervisa la velocidad de los tokens, el uso de memoria y la estabilidad antes de aumentar la longitud del contexto o activar los ajustes máximos de razonamiento.

Comprobación de configuraciónAcción recomendadaPor qué es importante
VRAM utilizableCierra las aplicaciones que compiten por la GPUConserva espacio para la caché de expertos y el estado KV
RAM del sistemaSe recomienda usar 64 GB o más para mayor flexibilidadReduce los fallos por memoria insuficiente
Velocidad de la RAMUtiliza la memoria compatible estable más rápidaEl ancho de banda del sistema afecta a la ejecución de la CPU y las transferencias
Conexión PCIeConfirma la generación y el ancho del enlaceLos enlaces x8 de portátiles pueden ser más lentos que los enlaces x16 de equipos de escritorio
Conexión del clienteVerifica que la API esté lista antes de realizar pruebasEvita errores confusos de carga del modelo y del endpoint

El primer inicio debe considerarse una prueba de referencia, no un resultado de rendimiento definitivo. Registra el uso de memoria, el tiempo de procesamiento del prompt, la velocidad de decodificación y si el modelo permanece estable durante varias solicitudes.

Orden de prueba recomendado

Comienza con un prompt corto, confirma la conexión de la API, mide varias respuestas y solo después aumenta la longitud del contexto o activa un razonamiento intensivo.

Factores de rendimiento y comportamiento de la caché

El rendimiento de FreeToken depende de la eficacia con la que mantiene en la VRAM los expertos utilizados con frecuencia y de cómo gestiona los fallos de caché. Durante la decodificación, los expertos enrutados pueden encontrarse ya en la VRAM o necesitar trasladarse desde la memoria del sistema. FreeToken utiliza una caché de expertos compartida de estilo LRU, por lo que el comportamiento reciente del enrutamiento puede influir en la permanencia futura.

El entorno de ejecución también divide los fallos de caché entre transferencias a la GPU y ejecución directa en la CPU. Esta división se basa en el ancho de banda medido del procesamiento en el sistema y en el ancho de banda de transferencia con memoria fijada, en lugar de seguir una única regla fija. Este enfoque es útil porque un equipo de escritorio con un rendimiento PCIe sólido y un portátil con un enlace estrecho pueden beneficiarse de asignaciones diferentes.

Factor de rendimientoEfecto en FreeTokenOptimización
Tamaño de la caché de VRAMMás expertos residentes pueden reducir los fallosReserva suficiente memoria de GPU
Ancho de banda PCIeControla el movimiento de expertos del sistema a la GPUPrefiere un enlace x16 a máxima velocidad cuando esté disponible
Ancho de banda del sistemaLimita la ejecución de la CPU y el uso compartido de las transferenciasUtiliza memoria de doble canal más rápida o de mayor ancho de banda
Localidad de la cachéDetermina con qué frecuencia los expertos enrutados están disponiblesMantén calientes las sesiones relacionadas cuando sea posible
Aplicaciones simultáneasReduce el presupuesto de memoria del entorno de ejecuciónCierra las cargas de trabajo exigentes de GPU y RAM

El prellenado y la decodificación se comportan de forma diferente. El prellenado procesa un prompt grande y puede requerir el movimiento de una gran parte del conjunto de expertos. FreeToken utiliza doble búfer de capa completa para solapar las transferencias de expertos con el cálculo de la GPU cuando el presupuesto de memoria disponible lo permite. La decodificación es más incremental, pero los fallos de caché repetidos aún pueden reducir la capacidad de respuesta.

Las pruebas del material proporcionado encontraron que una configuración con una sola RTX 3090 produjo aproximadamente 10,5 tokens por segundo en un escenario de servidor. Una prueba con el cliente de escritorio alcanzó unos 8,8 tokens por segundo en una configuración diferente. Estas cifras dependen de la configuración y no son benchmarks universales, así que utilízalas como puntos de referencia, no como garantías.

Antes de iniciar una sesión larga:

  • Comprueba la VRAM y la RAM del sistema utilizables
  • Cierra las aplicaciones que compiten por la memoria de la GPU
  • Confirma que el modelo seleccionado cabe en el presupuesto de memoria del sistema
  • Verifica que el servidor API alcance el estado de listo
  • Registra la velocidad de tokens y el uso de memoria de referencia
Consejo para las pruebas de rendimiento

Compara varios prompts en lugar de basarte en una sola respuesta. El enrutamiento de expertos cambia de una solicitud a otra, y la velocidad de los tokens puede variar según los expertos activos, la longitud del contexto y la sobrecarga del cliente.

Compatibilidad de modelos y resolución de problemas

No todos los modelos funcionarán igual de bien en FreeToken. Las pruebas citadas descubrieron que una configuración densa Qwen 3.8 27B BF16 no pudo iniciarse en un entorno, lo que produjo una salida inesperada del motor. Esto demuestra por qué la compatibilidad del modelo, el formato de cuantización y la compatibilidad del entorno de ejecución son tan importantes como la capacidad de memoria.

Los modelos grandes también pueden fallar por una razón sencilla: RAM utilizable insuficiente. Una prueba indicó que una configuración GLM-5.2 NVFP4 necesitaba cientos de gigabytes adicionales de memoria del sistema por encima del presupuesto disponible. Para un modelo de este tipo puede ser necesaria una configuración de estación de trabajo más potente.

SíntomaCausa probableOrientación para resolverlo
El modelo se niega a cargarLa VRAM y la RAM combinadas son insuficientesElige un modelo más pequeño o añade memoria al sistema
La API nunca está listaProblema de compatibilidad del controlador, el paquete o el modeloComprueba los registros y confirma que la compilación sea compatible
La velocidad de decodificación es inesperadamente bajaAncho de banda del sistema insuficiente o fallos de caché frecuentesReduce las cargas de trabajo en competencia y prueba el ancho de banda de la memoria
El cliente de escritorio es más lentoSobrecarga del cliente o ruta de ejecución diferenteCompáralo con la configuración del servidor o de la API
El modelo se cierra inesperadamenteLimitación de la versión beta o formato no compatiblePrueba otro checkpoint y revisa los registros del entorno de ejecución
El rendimiento cae después de abrir aplicacionesSe ha reducido el presupuesto de VRAMCierra las aplicaciones que consumen mucha GPU y reinicia si es necesario

Utiliza una secuencia de resolución de problemas controlada:

  • Prueba el mismo modelo con un prompt corto.
  • Confirma si el fallo ocurre durante la carga o durante la generación.
  • Comprueba si el modelo utiliza un formato de cuantización compatible.
  • Compara la memoria utilizable antes y después de cerrar otras aplicaciones.
  • Guarda los registros del servidor cuando informes de un error reproducible del motor.

La estrategia más fiable es cambiar una variable cada vez. Cambiar simultáneamente el modelo, el cliente, el paquete del sistema operativo, la asignación de memoria y el modo de razonamiento dificulta identificar la causa real.

Regla para resolver problemas

Si un modelo falla, separa primero los problemas de capacidad de los problemas de compatibilidad del software. Un presupuesto mayor de VRAM o RAM no puede solucionar un formato de modelo no compatible ni un defecto del entorno de ejecución.

Preguntas frecuentes sobre la vram de FreeToken

Q: ¿Qué función cumple la vram de FreeToken?

FreeToken utiliza la VRAM disponible como una caché elástica para los expertos, el estado de ejecución, los pesos que no son de expertos y los datos de la caché KV. El conjunto completo de expertos puede permanecer en la RAM del sistema cuando el modelo supera la capacidad de la GPU.

Q: ¿Cuánta RAM del sistema debo utilizar con FreeToken?

Las pruebas disponibles sugieren 32 GB como punto de partida para algunos experimentos con una sola GPU y 64 GB como objetivo más cómodo. Los modelos más grandes pueden requerir 96 GB, 128 GB o varios cientos de gigabytes.

Q: ¿Puede una sola RTX 3090 ejecutar un modelo MoE grande?

Una sola RTX 3090 puede servir determinadas configuraciones MoE grandes con descarga a la memoria del sistema, pero la velocidad depende del modelo, la cuantización, el ancho de banda del sistema, la conexión PCIe y el comportamiento de la caché.

Q: ¿Por qué el rendimiento de mi FreeToken es inferior al de un benchmark?

La velocidad de los tokens varía según el enrutamiento de expertos, la permanencia en la caché, la longitud del prompt, el ancho de banda de la memoria, la sobrecarga del cliente y otras aplicaciones que utilizan los recursos del sistema. Compara hardware y cargas de trabajo equivalentes antes de sacar conclusiones.

Conclusión

FreeToken hace más accesible el servicio local de modelos MoE al coordinar la VRAM, la RAM del sistema, la ejecución de la CPU y las transferencias PCIe. Planifica el presupuesto de memoria completo y, después, optimiza el comportamiento de la caché y el ancho de banda.