FreeToken rtx 3090: Guía de configuración y consejos de rendimiento - Hardware

FreeToken rtx 3090: Guía de configuración y consejos de rendimiento

Aprende a ejecutar FreeToken en una RTX 3090, preparar la memoria del sistema, configurar modelos locales y solucionar los límites de rendimiento.

2026-08-25
Equipo de FreeToken
Guía rápida
  • Las configuraciones de FreeToken rtx 3090 pueden ejecutar grandes modelos MoE mediante la descarga de trabajo a la GPU y a la memoria del sistema.
  • La memoria del sistema es importante porque la RTX 3090 no puede contener todo el conjunto de expertos de los modelos más avanzados.
  • Punto de partida recomendado: utiliza al menos 32 GB de RAM; 64 GB ofrecen un margen más práctico.
  • Velocidad esperada: DeepSeek V4 Flash alcanzó aproximadamente entre 10 y 11 tokens por segundo en una prueba del servidor.
  • Buena práctica: cierra las aplicaciones que consumen mucha memoria antes de cargar un modelo y supervisa la RAM, la VRAM y la velocidad de generación de tokens.

FreeToken rtx 3090: Qué puede hacer esta configuración

FreeToken es un sistema local de servicio de IA, no un juego ni un título de entretenimiento. Su objetivo es hacer más prácticos los grandes modelos de mezcla de expertos con pesos abiertos en hardware de consumo, combinando la memoria de la GPU, la RAM del sistema, la ejecución en la CPU y las transferencias mediante PCIe.

Una RTX 3090 proporciona 24 GB de VRAM. Esto es suficiente para muchos modelos locales más pequeños, pero no basta para almacenar el conjunto completo de expertos de modelos como DeepSeek V4 Flash. FreeToken aborda esta limitación manteniendo todos los pesos de los expertos en la memoria del host y utilizando la GPU como una caché elástica para los expertos a los que se enruta con mayor frecuencia.

El resultado es un flujo de trabajo híbrido:

  • Los pesos del modelo que no pertenecen a expertos permanecen en la GPU.
  • El conjunto completo de expertos reside en la memoria del sistema.
  • Los expertos utilizados con frecuencia se almacenan en la VRAM.
  • Los expertos que no están disponibles pueden transferirse a la GPU o procesarse en la CPU.
  • El entorno de ejecución ajusta su comportamiento según el ancho de banda medido de PCIe y de la memoria del host.

Este diseño hace que la combinación de FreeToken rtx 3090 sea útil para experimentar con modelos que, de otro modo, requerirían una GPU mucho más grande o una API alojada.

Referencia: El artículo de investigación de FreeToken describe el modelo de ejecución adaptado al ancho de banda, la caché elástica de expertos y el diseño de servicio orientado a dispositivos periféricos.

Aspectos destacados del vídeo:

  • Una sola RTX 3090 ejecuta DeepSeek V4 Flash con descarga a la memoria del sistema.
  • Las pruebas del servidor alcanzaron aproximadamente entre 10 y 11 tokens por segundo.
  • El cliente de escritorio midió aproximadamente 8,8 tokens por segundo en una prueba comparable.
  • La configuración utilizó una interfaz de chat basada en navegador a través de Open WebUI.
  • La capacidad y el ancho de banda de la memoria tuvieron un efecto importante en la experiencia.
ComponenteFunción prácticaConsideración clave
RTX 3090Ejecución en la GPU y caché de expertosLos 24 GB de VRAM limitan la permanencia del modelo completo
RAM del sistemaAlmacena los pesos de los expertos residentes en el hostUna mayor capacidad mejora la compatibilidad con los modelos
CPUProcesa los expertos faltantes seleccionadosEl ancho de banda de la memoria puede limitar la velocidad de decodificación
Enlace PCIeMueve los expertos entre la RAM y la VRAMLos enlaces de clase PCIe 4.0 son funcionales, pero no instantáneos
Almacenamiento NVMeCarga los datos del modelo durante el inicioUn almacenamiento más rápido reduce el tiempo de carga inicial
Concepto clave

FreeToken no hace que un modelo de 284B parámetros quepa por completo dentro de una RTX 3090 de 24 GB. Hace que la ejecución selectiva y el movimiento de memoria sean lo bastante prácticos para realizar pruebas locales.

Requisitos de hardware y planificación de la memoria

La RTX 3090 es solo una parte del sistema. La capacidad de los modelos en FreeToken depende en gran medida de la RAM utilizable del sistema, el ancho de banda de la memoria del host, la velocidad del almacenamiento y la cantidad de VRAM disponible después de que otras aplicaciones ocupen recursos.

Un punto de partida práctico es 32 GB de memoria del sistema, aunque 64 GB son un objetivo más cómodo para experimentos MoE de mayor tamaño. Las pruebas de referencia también analizaron sistemas con una cantidad de RAM considerablemente mayor para modelos que requieren un conjunto de expertos residente en el host mucho más grande. Un modelo puede informar de memoria insuficiente incluso cuando la GPU parece estar infrautilizada, porque FreeToken evalúa conjuntamente la RAM y la VRAM disponibles.

Nivel de memoriaUso adecuadoNotas de planificación
32 GB de RAMPruebas MoE de nivel inicialUn punto de partida viable para determinados modelos
64 GB de RAMServicio local más cómodoOfrece más espacio para el modelo, el sistema operativo y las aplicaciones
96–128 GB de RAMExperimentos con modelos más grandesMejora la flexibilidad para configuraciones con mucha memoria
168 GB o másModelos muy grandes descargados al hostÚtil cuando los requisitos del modelo superan la capacidad de un equipo de escritorio normal
512 GB de RAMExperimentos a escala de fronteraRelevante para modelos con conjuntos de expertos extremadamente grandes

El ancho de banda de la memoria también es importante. El material de referencia compara sistemas DDR4 y DDR5 de doble canal; DDR5 suele ofrecer un mayor ancho de banda para el host. Sin embargo, las especificaciones por sí solas no determinan el rendimiento, ya que FreeToken mide el comportamiento real de las transferencias y del procesamiento de la CPU en la máquina desplegada.

Antes de iniciar un modelo, comprueba lo siguiente:

  • La RAM del sistema disponible después de tener en cuenta el sistema operativo y las aplicaciones en segundo plano.
  • La VRAM libre de la RTX 3090.
  • El ancho y la generación del enlace PCIe.
  • La configuración de los canales de RAM y la velocidad efectiva de la memoria.
  • La capacidad NVMe para los archivos del modelo y los pesos convertidos.
  • Los límites térmicos y de potencia de la CPU durante la inferencia sostenida.

Margen de la GPU

Mantén varios gigabytes de VRAM disponibles para los pesos que no pertenecen a expertos, el estado del entorno de ejecución, la caché KV y las aplicaciones de escritorio.

Capacidad de RAM

La memoria del host almacena el conjunto completo de expertos, por lo que la capacidad puede convertirse en el principal límite de compatibilidad.

Equilibrio del ancho de banda

La velocidad de transferencia de PCIe y el ancho de banda de la memoria del lado de la CPU determinan cómo FreeToken divide el trabajo entre la GPU y la CPU.

Advertencia sobre la memoria

No evalúes la compatibilidad basándote únicamente en la VRAM. Un modelo puede caber en la parte de la GPU del entorno de ejecución y aun así fallar porque la RAM utilizable del sistema es insuficiente.

Configuración paso a paso de FreeToken en una RTX 3090

Utiliza este flujo de trabajo para preparar una primera prueba limpia. El paquete y la interfaz disponibles pueden variar a medida que el proyecto avance, así que verifica las instrucciones de la versión actual antes de instalarlo.

1

Prepara el sistema

Actualiza el controlador de NVIDIA y confirma que la RTX 3090 se detecta correctamente. Cierra los juegos, las pestañas del navegador, las herramientas de grabación y otras aplicaciones que consuman muchos recursos de la GPU. Estos programas pueden reducir la VRAM disponible o modificar el presupuesto de memoria durante el servicio.

2

Instala la compilación adecuada

Elige el paquete que corresponda a tu sistema operativo. Los formatos disponibles descritos en el material de referencia incluyen una distribución para Windows, un paquete para Ubuntu, un AppImage y un paquete para Arch Linux. Utiliza el canal de versiones actual del proyecto para consultar el comando de instalación exacto.

3

Selecciona un modelo compatible

Comienza con un modelo que tenga requisitos combinados realistas de RAM y VRAM. DeepSeek V4 Flash es un objetivo MoE representativo, mientras que los modelos densos BF16 con un mayor número de parámetros pueden superar los límites prácticos de un sistema con una sola RTX 3090.

4

Espera al servidor API

Inicia el entorno de ejecución y supervisa el uso de la memoria mientras se carga el conjunto de expertos. Cuando la interfaz indique que el servidor API está listo, conecta un cliente compatible como Open WebUI u otra interfaz de chat compatible.

5

Realiza una prueba controlada

Empieza con un prompt corto y registra la velocidad de los tokens, el uso de memoria y la estabilidad de las respuestas. Repite la prueba con varios prompts, ya que el enrutamiento MoE puede cambiar los expertos activos y producir resultados diferentes.

Etapa de configuraciónQué verificarBuena práctica
Comprobación del controladorLa RTX 3090 aparece y funciona de forma estableRealiza una prueba con un comando básico de supervisión de la GPU
InstalaciónEl paquete coincide con el sistema operativoPrefiere la versión actual del proyecto
Carga del modeloLa RAM y la VRAM siguen disponiblesEvita realizar varias tareas durante la primera carga
Disponibilidad de la APIEl servidor informa de que está listoConecta el cliente solo después de la inicialización
Evaluación comparativaTokens por segundo y uso de memoriaUtiliza varios prompts en lugar de una sola muestra

Una primera ejecución limpia es más útil que una ejecución sobrecargada. No empieces con un modelo que ya se acerque a los límites de tu presupuesto de memoria, porque un fallo inicial puede deberse a la presión de asignación y no a un defecto del software.

Primera prueba recomendada

Utiliza un modelo, un cliente y un prompt corto. Cuando el servidor sea estable, añade contextos más largos o aplicaciones más exigentes cambiando una sola variable cada vez.

Expectativas de rendimiento de la RTX 3090

El rendimiento depende de la arquitectura del modelo, la cuantización, la longitud del prompt, los expertos activos, la velocidad de la RAM, el comportamiento de PCIe y de si el entorno de ejecución funciona como servidor o como aplicación de escritorio. Por lo tanto, los resultados disponibles de las pruebas con la RTX 3090 deben considerarse puntos de referencia prácticos, no especificaciones garantizadas.

En una prueba del servidor, DeepSeek V4 Flash generó aproximadamente entre 10 y 11 tokens por segundo en una sola RTX 3090. El cliente de escritorio midió aproximadamente 8,8 tokens por segundo en una configuración comparable. Esta diferencia sugiere que la interfaz y la ruta del entorno de ejecución pueden afectar al rendimiento, aunque el resultado exacto variará según el sistema operativo y la configuración del sistema.

Condición de la pruebaResultado registradoInterpretación
Ejecución del servidor con RTX 3090Aproximadamente 10–11 tok/sFue posible alcanzar una velocidad interactiva para uso de chat
Ejecución del cliente de escritorioAproximadamente 8,8 tok/sConfiguración sencilla, con un rendimiento observado algo menor
Uso de memoria del cliente de escritorioAproximadamente 20,38 GBIlustra la considerable demanda de memoria del entorno de ejecución
Transferencia de prellenado de clase RTX 3090Aproximadamente 5 segundos para un conjunto de expertos de 140 GBLa latencia de transferencia depende del ancho de banda de PCIe
Enlace de clase RTX 4090/3090Alrededor de PCIe 4.0 x16 en el estudioEl movimiento del host al dispositivo sigue siendo un factor importante

El diseño descrito en el artículo explica por qué la velocidad de decodificación puede seguir siendo utilizable aunque el modelo supere la VRAM. FreeToken mantiene una caché LRU de expertos compartida, lo que permite que los expertos a los que se ha enrutado recientemente permanezcan en la GPU. Cuando se producen fallos de caché, el entorno de ejecución calcula una división entre las cargas de caché mediante PCIe y la ejecución directa en la CPU basándose en el ancho de banda medido.

Varios factores pueden reducir los resultados:

  • OBS u otras cargas de codificación en la GPU pueden afectar a la memoria disponible.
  • Las pestañas del navegador y las aplicaciones de escritorio pueden consumir VRAM.
  • Una RAM lenta o de un solo canal puede limitar el procesamiento de expertos en el lado de la CPU.
  • Los prompts más largos aumentan el trabajo de prellenado y los costes de gestión del contexto.
  • Los modelos densos pueden comportarse de forma distinta a los modelos MoE dispersos.
  • Los problemas del software beta pueden provocar fallos de inicio o del motor específicos de cada modelo.
Cómo interpretar la velocidad de los tokens

La velocidad de los tokens no es una puntuación universal. Compara modelos, prompts, formatos de cuantización, longitudes de contexto y rutas de cliente idénticos antes de sacar conclusiones.

Lista de comprobación para solucionar problemas y optimizar

El diseño híbrido de FreeToken introduce más variables que un modelo local que solo utiliza la GPU. La solución de problemas debe comenzar con comprobaciones de memoria y del entorno antes de modificar los ajustes avanzados del entorno de ejecución.

Antes de cada evaluación:

  • Confirma que el controlador de la RTX 3090 y el entorno CUDA se detectan correctamente
  • Cierra los juegos, las herramientas de grabación, los navegadores y otras aplicaciones que utilicen intensivamente la GPU
  • Comprueba la RAM utilizable del sistema en lugar de considerar únicamente la RAM instalada
  • Registra el ancho del enlace PCIe, la configuración de la RAM, el formato del modelo y la longitud del contexto
  • Ejecuta varios prompts y compara rangos estables de velocidad de tokens

Si un modelo no se inicia, reduce primero el uso de memoria de las aplicaciones que compiten por los recursos. Un error del motor específico de un modelo no significa necesariamente que la RTX 3090 esté defectuosa. Las pruebas de referencia descubrieron que un modelo denso BF16 podía fallar mientras otro modelo MoE se cargaba correctamente con la misma configuración general.

Si la generación es más lenta de lo esperado, inspecciona el ancho de banda de la memoria del host y la actividad de la CPU. FreeToken puede necesitar procesar más fallos en la CPU cuando la caché de la GPU es pequeña o cambia el patrón de enrutamiento. Aumentar la capacidad de RAM mejora la compatibilidad, mientras que una memoria más rápida y una plataforma más potente pueden mejorar la velocidad a la que se procesan los expertos residentes en el host.

SíntomaCausa probablePrimera respuesta
Mensaje de memoria insuficienteEl presupuesto combinado de RAM y VRAM es demasiado pequeñoUtiliza un modelo más pequeño o añade RAM utilizable al sistema
El motor se cierra inesperadamenteProblema de compatibilidad con el formato del modelo o con la versión betaComprueba los registros y prueba otro modelo compatible
Baja velocidad de tokensAncho de banda del host, fallos de caché o ruta de la CPUCierra las aplicaciones en segundo plano e inspecciona el rendimiento de la RAM
Inicio lentoConjunto de expertos grande y lecturas desde el almacenamientoUtiliza almacenamiento NVMe rápido y permite que termine la carga inicial
Rendimiento variableEl enrutamiento MoE cambia entre promptsEvalúa varios prompts y comunica un rango

La descripción del proyecto y el artículo de FreeToken identifican el sistema como software orientado a la investigación, distribuido a través del canal oficial del proyecto. Consulta la página actual del proyecto en flashml.ai para obtener información sobre versiones, modelos compatibles y actualizaciones de las plataformas.

Prioridad de optimización

Mejora el sistema en este orden: memoria disponible, carga de trabajo en segundo plano, ancho de banda de la RAM, velocidad del almacenamiento y, solo después, ajustes avanzados del modelo o del cliente.

Preguntas frecuentes sobre FreeToken y la RTX 3090

Q: ¿Puede FreeToken ejecutar un modelo MoE grande en una sola RTX 3090?

Sí. Las pruebas de referencia ejecutaron DeepSeek V4 Flash en una sola RTX 3090 utilizando la memoria del sistema para el conjunto de expertos más grande. El modelo completo no reside enteramente en los 24 GB de VRAM de la GPU, por lo que la memoria total del sistema y el ancho de banda son esenciales.

Q: ¿Cuánta RAM debería tener un sistema FreeToken con RTX 3090?

Al menos 32 GB es un punto de partida razonable para determinados modelos, mientras que 64 GB ofrecen un margen más práctico. Los modelos más grandes pueden requerir 96 GB, 128 GB, 168 GB o considerablemente más, según el formato del modelo y los requisitos del entorno de ejecución.

Q: ¿Qué velocidad de tokens puedo esperar de FreeToken en una RTX 3090?

Una prueba del servidor registró aproximadamente entre 10 y 11 tokens por segundo con DeepSeek V4 Flash. Una prueba con el cliente de escritorio midió alrededor de 8,8 tokens por segundo. Tu resultado puede variar debido al ancho de banda de la RAM, la configuración de PCIe, los prompts, el enrutamiento y las aplicaciones en segundo plano.

Q: ¿Por qué puede fallar un modelo aunque la RTX 3090 tenga VRAM libre?

FreeToken debe tener en cuenta el conjunto completo de expertos, la memoria del host, el estado del entorno de ejecución y la caché KV. La VRAM libre por sí sola no demuestra que el presupuesto de memoria combinado sea suficiente. La compatibilidad del formato del modelo y los problemas del software beta también pueden provocar fallos durante el inicio.