- La vram de FreeToken funciona como una caché elástica de expertos, no como la única memoria del modelo.
- La RAM del sistema almacena el conjunto completo de expertos cuando un modelo supera la VRAM disponible.
- El ancho de banda PCIe afecta considerablemente a las transferencias de expertos durante el prellenado y la decodificación.
- 32 GB de RAM pueden ser suficientes para pruebas pequeñas, mientras que 64 GB o más ofrecen mayor flexibilidad.
- La caché adaptativa modifica la permanencia en la GPU a medida que cambian la memoria disponible y los patrones de enrutamiento.
Explicación de la vram de FreeToken
La vram de FreeToken se entiende mejor como parte de un sistema unificado de inferencia local. FreeToken sirve modelos de mezcla de expertos combinando la memoria de la GPU, la RAM del sistema, el procesamiento de la CPU y el enlace PCIe entre ellos. El conjunto completo de expertos enrutados puede permanecer en la memoria del sistema, mientras que la VRAM disponible almacena pesos que no son de expertos, el estado de ejecución, las páginas de la caché KV y los expertos utilizados recientemente.
Este diseño es importante porque un modelo MoE puede tener un número total de parámetros muy elevado, pero activar solo un subconjunto menor para cada token. DeepSeek-V4-Flash se describe como un modelo de 284B parámetros, con aproximadamente 13B parámetros activos por token. Esto hace que el servicio local sea más práctico, pero no elimina la necesidad de mantener el conjunto más amplio de expertos en algún lugar.
Aspectos destacados del video:
- Las pruebas con una sola GPU demuestran el servicio local de FreeToken con una RTX 3090.
- DeepSeek-V4-Flash alcanza aproximadamente entre 10 y 11 tokens por segundo en una configuración de servidor.
- El cliente de escritorio es más fácil de iniciar, pero puede ofrecer un rendimiento menor que la ruta del servidor.
- La capacidad y el ancho de banda de la RAM del sistema influyen directamente en el rendimiento práctico.
| Área de memoria | Función en FreeToken | Limitación principal |
|---|---|---|
| VRAM | Caché de expertos, pesos que no son de expertos, caché KV y activaciones | Capacidad limitada y compartida con otras aplicaciones |
| RAM del sistema | Conjunto completo de expertos residente en el sistema | El ancho de banda de doble canal puede limitar la velocidad de decodificación |
| Caché y núcleos de la CPU | Ejecutan determinadas pérdidas de caché cuando resulta útil | El rendimiento depende del ancho de banda medido del sistema |
| Almacenamiento NVMe | Carga el conjunto de expertos durante el inicio | La velocidad del disco afecta al tiempo de arranque en frío |
| Enlace PCIe | Transfiere expertos de la RAM a la VRAM | El ancho y la generación del enlace afectan a la latencia de transferencia |
La conclusión práctica es sencilla: más VRAM ayuda, pero la VRAM por sí sola no define el rango de modelos compatibles. Un sistema con una GPU potente y memoria del sistema insuficiente aún puede no cargar un modelo de escala punta. Por el contrario, un sistema con suficiente RAM puede ejecutar un modelo con un comportamiento de descarga más flexible, aunque la velocidad de respuesta depende en gran medida del ancho de banda.
Considera la VRAM como un presupuesto de rendimiento. FreeToken puede utilizar la RAM del sistema como fuente principal, pero una VRAM más grande y rápida generalmente mejora las tasas de aciertos de la caché y reduce las transferencias repetidas.
Requisitos de vram y RAM del sistema de FreeToken
Los requisitos de memoria de FreeToken varían según el modelo, el formato de cuantización, la longitud del contexto y la cantidad de VRAM reservada para la caché de expertos. Las referencias disponibles describen 32 GB de RAM del sistema como un punto de partida práctico para una configuración con una sola GPU, mientras que 64 GB ofrecen un margen operativo más cómodo. Los modelos más grandes pueden requerir bastante más.
La huella completa del modelo no debe confundirse con los parámetros activos. La activación dispersa reduce el cálculo necesario para cada token, mientras que los expertos inactivos aún deben permanecer en la memoria del sistema o en otro nivel de almacenamiento. Por eso, un modelo puede ser viable desde el punto de vista computacional y aun así fallar porque el presupuesto combinado de VRAM y RAM utilizable sea demasiado pequeño.
| Configuración | Posición práctica | Uso esperado |
|---|---|---|
| 8 GB de VRAM más 32 GB de RAM | Configuración de prueba de entrada | Modelos MoE más pequeños o servicio local muy limitado |
| 12–24 GB de VRAM más 64 GB de RAM | Configuración equilibrada para consumidores | Caché de expertos más flexible y sesiones más largas |
| 24 GB de VRAM más 96–128 GB de RAM | Rango sólido para una sola GPU | Experimentos con modelos MoE grandes y mayor margen de memoria del sistema |
| 32 GB de VRAM más 128 GB o más de RAM | Nivel local de alta capacidad | Conjuntos de expertos más grandes y más espacio para ampliar el contexto |
| 48–96 GB de VRAM más varios cientos de GB de RAM | Nivel de estación de trabajo | Demostraciones de escala punta, como modelos NVFP4 muy grandes |
Un contexto más largo también cambia el equilibrio de memoria. A medida que crece una sesión de agente, la demanda de la caché KV puede aumentar, mientras que el conjunto de trabajo de expertos permanece relativamente estable. Por lo tanto, FreeToken debe ajustar la división entre las páginas de la caché KV y los espacios de la caché de expertos, en lugar de tratar la asignación inicial del inicio como permanente.
El artículo FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution, publicado en 2026, describe este enfoque de memoria elástica. La caché de expertos de la GPU puede reconstruirse en puntos seguros del planificador sin reiniciar el motor ni volver a cargar el conjunto completo de expertos residente en la CPU.
Capacidad de VRAM
- Almacena datos de expertos activos y el estado de ejecución
- Una mayor capacidad mejora la permanencia de los expertos
- Deja espacio para las aplicaciones de escritorio
Capacidad de RAM
- Contiene el conjunto completo de expertos
- Determina qué modelos pueden cargarse
- El margen adicional ayuda durante las sesiones largas
Ancho de banda de memoria
- Controla el procesamiento de expertos en la CPU
- Afecta a la competencia por las transferencias PCIe
- La memoria DDR5 puede mejorar la ruta del sistema
No evalúes la compatibilidad basándote únicamente en la capacidad de VRAM. FreeToken puede indicar que la memoria utilizable es insuficiente cuando el modelo, el entorno de ejecución, la caché KV y los expertos residentes en el sistema no caben juntos.
Pasos de configuración de la vram de FreeToken
Sigue estos pasos para preparar una implementación local de FreeToken. La interfaz exacta y la lista de modelos compatibles pueden cambiar, ya que el material de pruebas disponible describe la aplicación de escritorio como software beta.
Mide la memoria disponible
Cierra las aplicaciones innecesarias de la GPU y comprueba la VRAM y la RAM del sistema utilizables antes de iniciar un modelo. Los navegadores, el software de grabación, los juegos, las máquinas virtuales y los compositores de escritorio pueden reducir la memoria disponible para FreeToken.
Elige un modelo compatible
Comienza con un modelo MoE que se ajuste a tu presupuesto de memoria combinado. DeepSeek-V4-Flash es un caso de prueba relevante porque la activación dispersa permite que un modelo grande utilice una sola GPU de consumo con descarga a la memoria del sistema.
Instala la compilación adecuada
Selecciona el paquete correspondiente a tu sistema operativo. El material disponible hace referencia a Windows, Ubuntu AppImage, Arch Linux y una ruta de aplicación de escritorio. Mantén el controlador gráfico y el entorno CUDA compatibles con la compilación seleccionada.
Inicia el servidor API
Carga el modelo y espera hasta que la interfaz indique que el servidor API está listo. Esto indica que el entorno de ejecución ha completado su configuración inicial y puede aceptar solicitudes mediante un cliente compatible.
Conecta un cliente de chat
Utiliza una interfaz como Open WebUI u otro endpoint compatible. Primero haz una prueba con un prompt corto y, después, supervisa la velocidad de los tokens, el uso de memoria y la estabilidad antes de aumentar la longitud del contexto o activar los ajustes máximos de razonamiento.
| Comprobación de configuración | Acción recomendada | Por qué es importante |
|---|---|---|
| VRAM utilizable | Cierra las aplicaciones que compiten por la GPU | Conserva espacio para la caché de expertos y el estado KV |
| RAM del sistema | Se recomienda usar 64 GB o más para mayor flexibilidad | Reduce los fallos por memoria insuficiente |
| Velocidad de la RAM | Utiliza la memoria compatible estable más rápida | El ancho de banda del sistema afecta a la ejecución de la CPU y las transferencias |
| Conexión PCIe | Confirma la generación y el ancho del enlace | Los enlaces x8 de portátiles pueden ser más lentos que los enlaces x16 de equipos de escritorio |
| Conexión del cliente | Verifica que la API esté lista antes de realizar pruebas | Evita errores confusos de carga del modelo y del endpoint |
El primer inicio debe considerarse una prueba de referencia, no un resultado de rendimiento definitivo. Registra el uso de memoria, el tiempo de procesamiento del prompt, la velocidad de decodificación y si el modelo permanece estable durante varias solicitudes.
Comienza con un prompt corto, confirma la conexión de la API, mide varias respuestas y solo después aumenta la longitud del contexto o activa un razonamiento intensivo.
Factores de rendimiento y comportamiento de la caché
El rendimiento de FreeToken depende de la eficacia con la que mantiene en la VRAM los expertos utilizados con frecuencia y de cómo gestiona los fallos de caché. Durante la decodificación, los expertos enrutados pueden encontrarse ya en la VRAM o necesitar trasladarse desde la memoria del sistema. FreeToken utiliza una caché de expertos compartida de estilo LRU, por lo que el comportamiento reciente del enrutamiento puede influir en la permanencia futura.
El entorno de ejecución también divide los fallos de caché entre transferencias a la GPU y ejecución directa en la CPU. Esta división se basa en el ancho de banda medido del procesamiento en el sistema y en el ancho de banda de transferencia con memoria fijada, en lugar de seguir una única regla fija. Este enfoque es útil porque un equipo de escritorio con un rendimiento PCIe sólido y un portátil con un enlace estrecho pueden beneficiarse de asignaciones diferentes.
| Factor de rendimiento | Efecto en FreeToken | Optimización |
|---|---|---|
| Tamaño de la caché de VRAM | Más expertos residentes pueden reducir los fallos | Reserva suficiente memoria de GPU |
| Ancho de banda PCIe | Controla el movimiento de expertos del sistema a la GPU | Prefiere un enlace x16 a máxima velocidad cuando esté disponible |
| Ancho de banda del sistema | Limita la ejecución de la CPU y el uso compartido de las transferencias | Utiliza memoria de doble canal más rápida o de mayor ancho de banda |
| Localidad de la caché | Determina con qué frecuencia los expertos enrutados están disponibles | Mantén calientes las sesiones relacionadas cuando sea posible |
| Aplicaciones simultáneas | Reduce el presupuesto de memoria del entorno de ejecución | Cierra las cargas de trabajo exigentes de GPU y RAM |
El prellenado y la decodificación se comportan de forma diferente. El prellenado procesa un prompt grande y puede requerir el movimiento de una gran parte del conjunto de expertos. FreeToken utiliza doble búfer de capa completa para solapar las transferencias de expertos con el cálculo de la GPU cuando el presupuesto de memoria disponible lo permite. La decodificación es más incremental, pero los fallos de caché repetidos aún pueden reducir la capacidad de respuesta.
Las pruebas del material proporcionado encontraron que una configuración con una sola RTX 3090 produjo aproximadamente 10,5 tokens por segundo en un escenario de servidor. Una prueba con el cliente de escritorio alcanzó unos 8,8 tokens por segundo en una configuración diferente. Estas cifras dependen de la configuración y no son benchmarks universales, así que utilízalas como puntos de referencia, no como garantías.
Antes de iniciar una sesión larga:
- Comprueba la VRAM y la RAM del sistema utilizables
- Cierra las aplicaciones que compiten por la memoria de la GPU
- Confirma que el modelo seleccionado cabe en el presupuesto de memoria del sistema
- Verifica que el servidor API alcance el estado de listo
- Registra la velocidad de tokens y el uso de memoria de referencia
Compara varios prompts en lugar de basarte en una sola respuesta. El enrutamiento de expertos cambia de una solicitud a otra, y la velocidad de los tokens puede variar según los expertos activos, la longitud del contexto y la sobrecarga del cliente.
Compatibilidad de modelos y resolución de problemas
No todos los modelos funcionarán igual de bien en FreeToken. Las pruebas citadas descubrieron que una configuración densa Qwen 3.8 27B BF16 no pudo iniciarse en un entorno, lo que produjo una salida inesperada del motor. Esto demuestra por qué la compatibilidad del modelo, el formato de cuantización y la compatibilidad del entorno de ejecución son tan importantes como la capacidad de memoria.
Los modelos grandes también pueden fallar por una razón sencilla: RAM utilizable insuficiente. Una prueba indicó que una configuración GLM-5.2 NVFP4 necesitaba cientos de gigabytes adicionales de memoria del sistema por encima del presupuesto disponible. Para un modelo de este tipo puede ser necesaria una configuración de estación de trabajo más potente.
| Síntoma | Causa probable | Orientación para resolverlo |
|---|---|---|
| El modelo se niega a cargar | La VRAM y la RAM combinadas son insuficientes | Elige un modelo más pequeño o añade memoria al sistema |
| La API nunca está lista | Problema de compatibilidad del controlador, el paquete o el modelo | Comprueba los registros y confirma que la compilación sea compatible |
| La velocidad de decodificación es inesperadamente baja | Ancho de banda del sistema insuficiente o fallos de caché frecuentes | Reduce las cargas de trabajo en competencia y prueba el ancho de banda de la memoria |
| El cliente de escritorio es más lento | Sobrecarga del cliente o ruta de ejecución diferente | Compáralo con la configuración del servidor o de la API |
| El modelo se cierra inesperadamente | Limitación de la versión beta o formato no compatible | Prueba otro checkpoint y revisa los registros del entorno de ejecución |
| El rendimiento cae después de abrir aplicaciones | Se ha reducido el presupuesto de VRAM | Cierra las aplicaciones que consumen mucha GPU y reinicia si es necesario |
Utiliza una secuencia de resolución de problemas controlada:
- Prueba el mismo modelo con un prompt corto.
- Confirma si el fallo ocurre durante la carga o durante la generación.
- Comprueba si el modelo utiliza un formato de cuantización compatible.
- Compara la memoria utilizable antes y después de cerrar otras aplicaciones.
- Guarda los registros del servidor cuando informes de un error reproducible del motor.
La estrategia más fiable es cambiar una variable cada vez. Cambiar simultáneamente el modelo, el cliente, el paquete del sistema operativo, la asignación de memoria y el modo de razonamiento dificulta identificar la causa real.
Si un modelo falla, separa primero los problemas de capacidad de los problemas de compatibilidad del software. Un presupuesto mayor de VRAM o RAM no puede solucionar un formato de modelo no compatible ni un defecto del entorno de ejecución.
Preguntas frecuentes sobre la vram de FreeToken
Q: ¿Qué función cumple la vram de FreeToken?
FreeToken utiliza la VRAM disponible como una caché elástica para los expertos, el estado de ejecución, los pesos que no son de expertos y los datos de la caché KV. El conjunto completo de expertos puede permanecer en la RAM del sistema cuando el modelo supera la capacidad de la GPU.
Q: ¿Cuánta RAM del sistema debo utilizar con FreeToken?
Las pruebas disponibles sugieren 32 GB como punto de partida para algunos experimentos con una sola GPU y 64 GB como objetivo más cómodo. Los modelos más grandes pueden requerir 96 GB, 128 GB o varios cientos de gigabytes.
Q: ¿Puede una sola RTX 3090 ejecutar un modelo MoE grande?
Una sola RTX 3090 puede servir determinadas configuraciones MoE grandes con descarga a la memoria del sistema, pero la velocidad depende del modelo, la cuantización, el ancho de banda del sistema, la conexión PCIe y el comportamiento de la caché.
Q: ¿Por qué el rendimiento de mi FreeToken es inferior al de un benchmark?
La velocidad de los tokens varía según el enrutamiento de expertos, la permanencia en la caché, la longitud del prompt, el ancho de banda de la memoria, la sobrecarga del cliente y otras aplicaciones que utilizan los recursos del sistema. Compara hardware y cargas de trabajo equivalentes antes de sacar conclusiones.
FreeToken hace más accesible el servicio local de modelos MoE al coordinar la VRAM, la RAM del sistema, la ejecución de la CPU y las transferencias PCIe. Planifica el presupuesto de memoria completo y, después, optimiza el comportamiento de la caché y el ancho de banda.