- Las configuraciones de FreeToken rtx 3090 pueden ejecutar grandes modelos MoE mediante la descarga de trabajo a la GPU y a la memoria del sistema.
- La memoria del sistema es importante porque la RTX 3090 no puede contener todo el conjunto de expertos de los modelos más avanzados.
- Punto de partida recomendado: utiliza al menos 32 GB de RAM; 64 GB ofrecen un margen más práctico.
- Velocidad esperada: DeepSeek V4 Flash alcanzó aproximadamente entre 10 y 11 tokens por segundo en una prueba del servidor.
- Buena práctica: cierra las aplicaciones que consumen mucha memoria antes de cargar un modelo y supervisa la RAM, la VRAM y la velocidad de generación de tokens.
FreeToken rtx 3090: Qué puede hacer esta configuración
FreeToken es un sistema local de servicio de IA, no un juego ni un título de entretenimiento. Su objetivo es hacer más prácticos los grandes modelos de mezcla de expertos con pesos abiertos en hardware de consumo, combinando la memoria de la GPU, la RAM del sistema, la ejecución en la CPU y las transferencias mediante PCIe.
Una RTX 3090 proporciona 24 GB de VRAM. Esto es suficiente para muchos modelos locales más pequeños, pero no basta para almacenar el conjunto completo de expertos de modelos como DeepSeek V4 Flash. FreeToken aborda esta limitación manteniendo todos los pesos de los expertos en la memoria del host y utilizando la GPU como una caché elástica para los expertos a los que se enruta con mayor frecuencia.
El resultado es un flujo de trabajo híbrido:
- Los pesos del modelo que no pertenecen a expertos permanecen en la GPU.
- El conjunto completo de expertos reside en la memoria del sistema.
- Los expertos utilizados con frecuencia se almacenan en la VRAM.
- Los expertos que no están disponibles pueden transferirse a la GPU o procesarse en la CPU.
- El entorno de ejecución ajusta su comportamiento según el ancho de banda medido de PCIe y de la memoria del host.
Este diseño hace que la combinación de FreeToken rtx 3090 sea útil para experimentar con modelos que, de otro modo, requerirían una GPU mucho más grande o una API alojada.
Referencia: El artículo de investigación de FreeToken describe el modelo de ejecución adaptado al ancho de banda, la caché elástica de expertos y el diseño de servicio orientado a dispositivos periféricos.
Aspectos destacados del vídeo:
- Una sola RTX 3090 ejecuta DeepSeek V4 Flash con descarga a la memoria del sistema.
- Las pruebas del servidor alcanzaron aproximadamente entre 10 y 11 tokens por segundo.
- El cliente de escritorio midió aproximadamente 8,8 tokens por segundo en una prueba comparable.
- La configuración utilizó una interfaz de chat basada en navegador a través de Open WebUI.
- La capacidad y el ancho de banda de la memoria tuvieron un efecto importante en la experiencia.
| Componente | Función práctica | Consideración clave |
|---|---|---|
| RTX 3090 | Ejecución en la GPU y caché de expertos | Los 24 GB de VRAM limitan la permanencia del modelo completo |
| RAM del sistema | Almacena los pesos de los expertos residentes en el host | Una mayor capacidad mejora la compatibilidad con los modelos |
| CPU | Procesa los expertos faltantes seleccionados | El ancho de banda de la memoria puede limitar la velocidad de decodificación |
| Enlace PCIe | Mueve los expertos entre la RAM y la VRAM | Los enlaces de clase PCIe 4.0 son funcionales, pero no instantáneos |
| Almacenamiento NVMe | Carga los datos del modelo durante el inicio | Un almacenamiento más rápido reduce el tiempo de carga inicial |
FreeToken no hace que un modelo de 284B parámetros quepa por completo dentro de una RTX 3090 de 24 GB. Hace que la ejecución selectiva y el movimiento de memoria sean lo bastante prácticos para realizar pruebas locales.
Requisitos de hardware y planificación de la memoria
La RTX 3090 es solo una parte del sistema. La capacidad de los modelos en FreeToken depende en gran medida de la RAM utilizable del sistema, el ancho de banda de la memoria del host, la velocidad del almacenamiento y la cantidad de VRAM disponible después de que otras aplicaciones ocupen recursos.
Un punto de partida práctico es 32 GB de memoria del sistema, aunque 64 GB son un objetivo más cómodo para experimentos MoE de mayor tamaño. Las pruebas de referencia también analizaron sistemas con una cantidad de RAM considerablemente mayor para modelos que requieren un conjunto de expertos residente en el host mucho más grande. Un modelo puede informar de memoria insuficiente incluso cuando la GPU parece estar infrautilizada, porque FreeToken evalúa conjuntamente la RAM y la VRAM disponibles.
| Nivel de memoria | Uso adecuado | Notas de planificación |
|---|---|---|
| 32 GB de RAM | Pruebas MoE de nivel inicial | Un punto de partida viable para determinados modelos |
| 64 GB de RAM | Servicio local más cómodo | Ofrece más espacio para el modelo, el sistema operativo y las aplicaciones |
| 96–128 GB de RAM | Experimentos con modelos más grandes | Mejora la flexibilidad para configuraciones con mucha memoria |
| 168 GB o más | Modelos muy grandes descargados al host | Útil cuando los requisitos del modelo superan la capacidad de un equipo de escritorio normal |
| 512 GB de RAM | Experimentos a escala de frontera | Relevante para modelos con conjuntos de expertos extremadamente grandes |
El ancho de banda de la memoria también es importante. El material de referencia compara sistemas DDR4 y DDR5 de doble canal; DDR5 suele ofrecer un mayor ancho de banda para el host. Sin embargo, las especificaciones por sí solas no determinan el rendimiento, ya que FreeToken mide el comportamiento real de las transferencias y del procesamiento de la CPU en la máquina desplegada.
Antes de iniciar un modelo, comprueba lo siguiente:
- La RAM del sistema disponible después de tener en cuenta el sistema operativo y las aplicaciones en segundo plano.
- La VRAM libre de la RTX 3090.
- El ancho y la generación del enlace PCIe.
- La configuración de los canales de RAM y la velocidad efectiva de la memoria.
- La capacidad NVMe para los archivos del modelo y los pesos convertidos.
- Los límites térmicos y de potencia de la CPU durante la inferencia sostenida.
Margen de la GPU
Mantén varios gigabytes de VRAM disponibles para los pesos que no pertenecen a expertos, el estado del entorno de ejecución, la caché KV y las aplicaciones de escritorio.
Capacidad de RAM
La memoria del host almacena el conjunto completo de expertos, por lo que la capacidad puede convertirse en el principal límite de compatibilidad.
Equilibrio del ancho de banda
La velocidad de transferencia de PCIe y el ancho de banda de la memoria del lado de la CPU determinan cómo FreeToken divide el trabajo entre la GPU y la CPU.
No evalúes la compatibilidad basándote únicamente en la VRAM. Un modelo puede caber en la parte de la GPU del entorno de ejecución y aun así fallar porque la RAM utilizable del sistema es insuficiente.
Configuración paso a paso de FreeToken en una RTX 3090
Utiliza este flujo de trabajo para preparar una primera prueba limpia. El paquete y la interfaz disponibles pueden variar a medida que el proyecto avance, así que verifica las instrucciones de la versión actual antes de instalarlo.
Prepara el sistema
Actualiza el controlador de NVIDIA y confirma que la RTX 3090 se detecta correctamente. Cierra los juegos, las pestañas del navegador, las herramientas de grabación y otras aplicaciones que consuman muchos recursos de la GPU. Estos programas pueden reducir la VRAM disponible o modificar el presupuesto de memoria durante el servicio.
Instala la compilación adecuada
Elige el paquete que corresponda a tu sistema operativo. Los formatos disponibles descritos en el material de referencia incluyen una distribución para Windows, un paquete para Ubuntu, un AppImage y un paquete para Arch Linux. Utiliza el canal de versiones actual del proyecto para consultar el comando de instalación exacto.
Selecciona un modelo compatible
Comienza con un modelo que tenga requisitos combinados realistas de RAM y VRAM. DeepSeek V4 Flash es un objetivo MoE representativo, mientras que los modelos densos BF16 con un mayor número de parámetros pueden superar los límites prácticos de un sistema con una sola RTX 3090.
Espera al servidor API
Inicia el entorno de ejecución y supervisa el uso de la memoria mientras se carga el conjunto de expertos. Cuando la interfaz indique que el servidor API está listo, conecta un cliente compatible como Open WebUI u otra interfaz de chat compatible.
Realiza una prueba controlada
Empieza con un prompt corto y registra la velocidad de los tokens, el uso de memoria y la estabilidad de las respuestas. Repite la prueba con varios prompts, ya que el enrutamiento MoE puede cambiar los expertos activos y producir resultados diferentes.
| Etapa de configuración | Qué verificar | Buena práctica |
|---|---|---|
| Comprobación del controlador | La RTX 3090 aparece y funciona de forma estable | Realiza una prueba con un comando básico de supervisión de la GPU |
| Instalación | El paquete coincide con el sistema operativo | Prefiere la versión actual del proyecto |
| Carga del modelo | La RAM y la VRAM siguen disponibles | Evita realizar varias tareas durante la primera carga |
| Disponibilidad de la API | El servidor informa de que está listo | Conecta el cliente solo después de la inicialización |
| Evaluación comparativa | Tokens por segundo y uso de memoria | Utiliza varios prompts en lugar de una sola muestra |
Una primera ejecución limpia es más útil que una ejecución sobrecargada. No empieces con un modelo que ya se acerque a los límites de tu presupuesto de memoria, porque un fallo inicial puede deberse a la presión de asignación y no a un defecto del software.
Utiliza un modelo, un cliente y un prompt corto. Cuando el servidor sea estable, añade contextos más largos o aplicaciones más exigentes cambiando una sola variable cada vez.
Expectativas de rendimiento de la RTX 3090
El rendimiento depende de la arquitectura del modelo, la cuantización, la longitud del prompt, los expertos activos, la velocidad de la RAM, el comportamiento de PCIe y de si el entorno de ejecución funciona como servidor o como aplicación de escritorio. Por lo tanto, los resultados disponibles de las pruebas con la RTX 3090 deben considerarse puntos de referencia prácticos, no especificaciones garantizadas.
En una prueba del servidor, DeepSeek V4 Flash generó aproximadamente entre 10 y 11 tokens por segundo en una sola RTX 3090. El cliente de escritorio midió aproximadamente 8,8 tokens por segundo en una configuración comparable. Esta diferencia sugiere que la interfaz y la ruta del entorno de ejecución pueden afectar al rendimiento, aunque el resultado exacto variará según el sistema operativo y la configuración del sistema.
| Condición de la prueba | Resultado registrado | Interpretación |
|---|---|---|
| Ejecución del servidor con RTX 3090 | Aproximadamente 10–11 tok/s | Fue posible alcanzar una velocidad interactiva para uso de chat |
| Ejecución del cliente de escritorio | Aproximadamente 8,8 tok/s | Configuración sencilla, con un rendimiento observado algo menor |
| Uso de memoria del cliente de escritorio | Aproximadamente 20,38 GB | Ilustra la considerable demanda de memoria del entorno de ejecución |
| Transferencia de prellenado de clase RTX 3090 | Aproximadamente 5 segundos para un conjunto de expertos de 140 GB | La latencia de transferencia depende del ancho de banda de PCIe |
| Enlace de clase RTX 4090/3090 | Alrededor de PCIe 4.0 x16 en el estudio | El movimiento del host al dispositivo sigue siendo un factor importante |
El diseño descrito en el artículo explica por qué la velocidad de decodificación puede seguir siendo utilizable aunque el modelo supere la VRAM. FreeToken mantiene una caché LRU de expertos compartida, lo que permite que los expertos a los que se ha enrutado recientemente permanezcan en la GPU. Cuando se producen fallos de caché, el entorno de ejecución calcula una división entre las cargas de caché mediante PCIe y la ejecución directa en la CPU basándose en el ancho de banda medido.
Varios factores pueden reducir los resultados:
- OBS u otras cargas de codificación en la GPU pueden afectar a la memoria disponible.
- Las pestañas del navegador y las aplicaciones de escritorio pueden consumir VRAM.
- Una RAM lenta o de un solo canal puede limitar el procesamiento de expertos en el lado de la CPU.
- Los prompts más largos aumentan el trabajo de prellenado y los costes de gestión del contexto.
- Los modelos densos pueden comportarse de forma distinta a los modelos MoE dispersos.
- Los problemas del software beta pueden provocar fallos de inicio o del motor específicos de cada modelo.
La velocidad de los tokens no es una puntuación universal. Compara modelos, prompts, formatos de cuantización, longitudes de contexto y rutas de cliente idénticos antes de sacar conclusiones.
Lista de comprobación para solucionar problemas y optimizar
El diseño híbrido de FreeToken introduce más variables que un modelo local que solo utiliza la GPU. La solución de problemas debe comenzar con comprobaciones de memoria y del entorno antes de modificar los ajustes avanzados del entorno de ejecución.
Antes de cada evaluación:
- Confirma que el controlador de la RTX 3090 y el entorno CUDA se detectan correctamente
- Cierra los juegos, las herramientas de grabación, los navegadores y otras aplicaciones que utilicen intensivamente la GPU
- Comprueba la RAM utilizable del sistema en lugar de considerar únicamente la RAM instalada
- Registra el ancho del enlace PCIe, la configuración de la RAM, el formato del modelo y la longitud del contexto
- Ejecuta varios prompts y compara rangos estables de velocidad de tokens
Si un modelo no se inicia, reduce primero el uso de memoria de las aplicaciones que compiten por los recursos. Un error del motor específico de un modelo no significa necesariamente que la RTX 3090 esté defectuosa. Las pruebas de referencia descubrieron que un modelo denso BF16 podía fallar mientras otro modelo MoE se cargaba correctamente con la misma configuración general.
Si la generación es más lenta de lo esperado, inspecciona el ancho de banda de la memoria del host y la actividad de la CPU. FreeToken puede necesitar procesar más fallos en la CPU cuando la caché de la GPU es pequeña o cambia el patrón de enrutamiento. Aumentar la capacidad de RAM mejora la compatibilidad, mientras que una memoria más rápida y una plataforma más potente pueden mejorar la velocidad a la que se procesan los expertos residentes en el host.
| Síntoma | Causa probable | Primera respuesta |
|---|---|---|
| Mensaje de memoria insuficiente | El presupuesto combinado de RAM y VRAM es demasiado pequeño | Utiliza un modelo más pequeño o añade RAM utilizable al sistema |
| El motor se cierra inesperadamente | Problema de compatibilidad con el formato del modelo o con la versión beta | Comprueba los registros y prueba otro modelo compatible |
| Baja velocidad de tokens | Ancho de banda del host, fallos de caché o ruta de la CPU | Cierra las aplicaciones en segundo plano e inspecciona el rendimiento de la RAM |
| Inicio lento | Conjunto de expertos grande y lecturas desde el almacenamiento | Utiliza almacenamiento NVMe rápido y permite que termine la carga inicial |
| Rendimiento variable | El enrutamiento MoE cambia entre prompts | Evalúa varios prompts y comunica un rango |
La descripción del proyecto y el artículo de FreeToken identifican el sistema como software orientado a la investigación, distribuido a través del canal oficial del proyecto. Consulta la página actual del proyecto en flashml.ai para obtener información sobre versiones, modelos compatibles y actualizaciones de las plataformas.
Mejora el sistema en este orden: memoria disponible, carga de trabajo en segundo plano, ancho de banda de la RAM, velocidad del almacenamiento y, solo después, ajustes avanzados del modelo o del cliente.
Preguntas frecuentes sobre FreeToken y la RTX 3090
Q: ¿Puede FreeToken ejecutar un modelo MoE grande en una sola RTX 3090?
Sí. Las pruebas de referencia ejecutaron DeepSeek V4 Flash en una sola RTX 3090 utilizando la memoria del sistema para el conjunto de expertos más grande. El modelo completo no reside enteramente en los 24 GB de VRAM de la GPU, por lo que la memoria total del sistema y el ancho de banda son esenciales.
Q: ¿Cuánta RAM debería tener un sistema FreeToken con RTX 3090?
Al menos 32 GB es un punto de partida razonable para determinados modelos, mientras que 64 GB ofrecen un margen más práctico. Los modelos más grandes pueden requerir 96 GB, 128 GB, 168 GB o considerablemente más, según el formato del modelo y los requisitos del entorno de ejecución.
Q: ¿Qué velocidad de tokens puedo esperar de FreeToken en una RTX 3090?
Una prueba del servidor registró aproximadamente entre 10 y 11 tokens por segundo con DeepSeek V4 Flash. Una prueba con el cliente de escritorio midió alrededor de 8,8 tokens por segundo. Tu resultado puede variar debido al ancho de banda de la RAM, la configuración de PCIe, los prompts, el enrutamiento y las aplicaciones en segundo plano.
Q: ¿Por qué puede fallar un modelo aunque la RTX 3090 tenga VRAM libre?
FreeToken debe tener en cuenta el conjunto completo de expertos, la memoria del host, el estado del entorno de ejecución y la caché KV. La VRAM libre por sí sola no demuestra que el presupuesto de memoria combinado sea suficiente. La compatibilidad del formato del modelo y los problemas del software beta también pueden provocar fallos durante el inicio.