FreeToken con una sola GPU: Guía de configuración de IA local - Benchmarks

FreeToken con una sola GPU: Guía de configuración de IA local

Descubre cómo FreeToken utiliza una GPU, la RAM del sistema y la ejecución MoE adaptativa para ejecutar grandes modelos de IA localmente.

2026-08-25
Equipo de FreeToken
Guía rápida
  • Las configuraciones de FreeToken con una sola GPU combinan VRAM, RAM del sistema y ancho de banda para la inferencia local.
  • Mejor punto de partida: utiliza una GPU NVIDIA compatible con al menos 32 GB de memoria del sistema.
  • Objetivo recomendado: 64 GB o más ofrecen un margen superior para modelos MoE grandes.
  • Factor de rendimiento: el ancho de banda de la memoria y el rendimiento de PCIe afectan considerablemente a la generación de tokens.
  • Estado del software: FreeToken es software Apache-2.0 con opciones de implementación para escritorio y línea de comandos.

Descripción general de FreeToken con una sola GPU

FreeToken es un motor de servicio de modelos nativo para el edge, no un juego ni una utilidad de escritorio tradicional. Su objetivo principal es hacer más prácticos los modelos grandes de mezcla de expertos, o MoE, en estaciones de trabajo personales. Una configuración de FreeToken con una sola GPU no coloca el modelo completo dentro de la VRAM. En su lugar, trata la GPU, la CPU, la memoria del sistema, el almacenamiento y la interconexión como una única plataforma de inferencia elástica.

Este diseño es importante porque los modelos modernos de pesos abiertos pueden tener recuentos totales de parámetros muy elevados, aunque activen únicamente un grupo más pequeño de expertos para cada token. Por ejemplo, DeepSeek-V4-Flash se describe como un modelo MoE de 284B parámetros, con 13B parámetros activos por token. El conjunto completo de expertos en baja precisión todavía puede requerir aproximadamente 140 GB, por lo que la memoria del sistema sigue siendo una parte fundamental de la configuración.

Aspectos destacados del vídeo:

  • Pruebas con una sola GPU usando FreeToken y una GeForce RTX 3090
  • Ejecución de DeepSeek-V4-Flash mediante la RAM del sistema y la descarga de trabajo a la GPU
  • Ejemplos de implementación en escritorio y Linux con observaciones en tiempo real de la velocidad de generación
  • Advertencias prácticas sobre la capacidad de memoria, el ancho de banda y el comportamiento del software beta
ComponenteFunción en una configuración con una sola GPUPor qué es importante
VRAM de la GPUContiene los pesos activos, los datos de caché y los tensores de trabajoUna mayor VRAM reduce las transferencias desde el sistema anfitrión
RAM del sistemaAlmacena el conjunto de expertos más grande y el estado descargadoLa capacidad puede determinar si un modelo se carga
CPUCalcula el trabajo de los expertos seleccionados cuando resulta útilEl ancho de banda de la CPU afecta a la velocidad de decodificación
Enlace PCIeMueve expertos y tensores entre el sistema anfitrión y la GPUUn mayor rendimiento reduce los retrasos de transferencia
AlmacenamientoProporciona los archivos del modelo y las disposiciones del sistema anfitriónUn almacenamiento rápido mejora los tiempos de carga y recarga
Principio fundamental

Trata la memoria del sistema como parte del diseño de inferencia. Una sola GPU puede proporcionar una aceleración considerable, pero una RAM insuficiente puede impedir que se cargue un modelo o provocar un comportamiento inestable.

Requisitos de hardware y planificación de la memoria

El requisito más importante de FreeToken no es simplemente el recuento de parámetros activos del modelo. Los modelos MoE siguen necesitando acceso al conjunto completo de expertos, aunque solo una parte participe en cada token. FreeToken gestiona ese conjunto dinámicamente, pero la estación de trabajo todavía debe proporcionar suficiente RAM utilizable, VRAM y ancho de banda.

Un punto de partida práctico es contar con 32 GB de memoria del sistema, aunque 64 GB constituyen una base más cómoda para modelos grandes. El material de pruebas indica que las capacidades de 96 GB, 128 GB o superiores amplían las posibilidades, mientras que ciertas configuraciones grandes pueden requerir bastante más. Un modelo puede informar de memoria insuficiente incluso cuando la propia GPU tiene VRAM disponible, ya que FreeToken evalúa conjuntamente la memoria utilizable del sistema y la VRAM.

Perfil de la estación de trabajoCaso de uso razonableOrientación para la planificación
GPU de 8 GB, 32 GB de RAMModelos locales pequeños y experimentaciónPunto de entrada adecuado, con margen limitado para modelos
GPU de 12–16 GB, 64 GB de RAMModelos MoE medianos y cargas de trabajo de asistentesConfiguración inicial equilibrada
GPU de 24 GB, 96–128 GB de RAMPruebas con modelos MoE locales grandesMayor capacidad para expertos residentes en el sistema anfitrión
GPU de 24 GB, 192 GB de RAMExperimentos más exigentes con modelos fronteraÚtil cuando los archivos del modelo superan la capacidad habitual de un equipo de escritorio
GPU de estación de trabajo, 512 GB de RAMModelos muy grandes, como las variantes de GLM-5.2Diseñado para sistemas especializados de inferencia local

La velocidad de la memoria también afecta al rendimiento. El material de pruebas compara velocidades DDR4 y señala que una memoria más lenta puede reducir el ancho de banda disponible. DDR5 puede ofrecer una ventaja considerable en sistemas adecuados, pero la mejora exacta depende de la CPU, la configuración de memoria, la generación de PCIe, la GPU y la carga de trabajo.

Capacidad

La capacidad de RAM determina si el conjunto completo de modelos del lado del sistema anfitrión puede asignarse y servirse. Comprueba la memoria utilizable, no solo la memoria instalada.

Ancho de banda

El ancho de banda de la memoria influye en la rapidez con la que pueden ejecutarse durante la decodificación el trabajo de los expertos en la CPU y las transferencias a la GPU.

VRAM

La capacidad de VRAM controla el tamaño de la caché activa de la GPU y puede reducir los movimientos repetidos a través de PCIe.

Evita las suposiciones sobre la capacidad

No des por hecho que un modelo funcionará solo porque su recuento de parámetros activos parezca reducido. El conjunto total de expertos, el formato de cuantización, la sobrecarga del entorno de ejecución, la longitud del contexto y el presupuesto de caché afectan a la demanda real de memoria.

Configuración de FreeToken paso a paso

FreeToken puede implementarse mediante una aplicación de escritorio o un flujo de trabajo de línea de comandos en Linux. El material de referencia disponible describe distribuciones de escritorio para Windows y Linux, un paquete para Arch Linux, un AppImage de Linux y una vía de instalación mediante PyPI. Los usuarios de Linux deben verificar los requisitos actuales de controladores y CUDA antes de comenzar.

La referencia web indica como objetivo para Linux con NVIDIA un controlador r580 o posterior y CUDA 13, mientras que la experiencia de escritorio está diseñada para simplificar la configuración inicial. Considera estos requisitos como orientación de implementación para el contexto de la versión de 2026 y verifica la compatibilidad con la compilación que selecciones.

1

Prepara la estación de trabajo

Instala el controlador NVIDIA requerido por la compilación de FreeToken seleccionada, confirma que la GPU se detecta y cierra las aplicaciones que consuman mucha memoria. La grabación de pantalla, los navegadores, las máquinas virtuales y otras cargas de trabajo de GPU pueden reducir el presupuesto de caché disponible.

2

Instala FreeToken

Elige la aplicación de escritorio para disfrutar de un flujo guiado, o instala el paquete de Linux mediante el método documentado de Python o de la distribución. Cuando sea posible, mantén la ruta de instalación y el directorio de modelos en un almacenamiento rápido.

3

Evalúa el sistema

Mide el comportamiento de la memoria del sistema anfitrión y de PCIe antes de ajustar un modelo. La ejecución adaptada al ancho de banda de FreeToken depende de la relación entre el ancho de banda de la memoria de la CPU y el ancho de banda de transferencia de la GPU.

4

Selecciona un modelo compatible

Comienza con un modelo cuyos requisitos de RAM, VRAM y cuantización se ajusten a tu equipo. Los modelos MoE suelen ser objetivos especialmente interesantes porque solo algunos expertos están activos para cada token.

5

Inicia y prueba

Inicia el servidor de inferencia, espera al estado que indique que la API está lista y conéctate mediante una interfaz compatible, como Open WebUI o un cliente compatible con OpenAI. Prueba varias indicaciones antes de evaluar el rendimiento.

Ruta de configuraciónIdeal paraConsideración principal
Aplicación de escritorioUsuarios principiantes y pruebas rápidasConfiguración más sencilla, aunque pueden persistir limitaciones de la versión beta
Paquete de LinuxUsuarios que desean controlar el terminalRequiere prestar más atención a los controladores y las dependencias
Instalación mediante PyPIEntornos con scripts o reproduciblesConfirma los complementos del acelerador y la compatibilidad del entorno de ejecución
Servidor APIOpen WebUI, Claude Code, Codex u otros clientesConfigura correctamente el endpoint y el puerto

El flujo de trabajo documentado del servidor expone endpoints compatibles con OpenAI y Anthropic en el puerto 1919. Esto hace que FreeToken sea útil más allá de una ventana de chat independiente: puede proporcionar un backend local para asistentes de programación, herramientas de agentes e interfaces web.

Primera ejecución recomendada

Utiliza primero un modelo moderado, un contexto corto y una indicación sencilla. Confirma que la API responde correctamente antes de activar el razonamiento máximo o cargar un modelo considerablemente más grande.

Expectativas de rendimiento con una sola GPU

El rendimiento con una sola GPU varía considerablemente según el modelo, la cuantización, la distribución de la memoria y el diseño de la estación de trabajo. Los resultados publicados deben considerarse puntos de referencia, no garantías. Una prueba de servidor con una RTX 3090 produjo aproximadamente 10–11 tokens por segundo con DeepSeek-V4-Flash bajo una configuración concreta. Una prueba con un cliente de escritorio en hardware similar alcanzó aproximadamente 8,8 tokens por segundo, lo que demuestra que la interfaz y la ruta del entorno de ejecución pueden influir en los resultados.

Un informe independiente de 2026 midió 22–25 tokens por segundo para DeepSeek-V4-Flash en una configuración con RTX 5090. El mismo informe indicó 77–83 tokens por segundo para Qwen3.6-35B-A3B en una RTX 5090 y 39,3 tokens por segundo para una compilación NVFP4 de 35B en un portátil con RTX 4060 de 8 GB. Estas cifras corresponden a modelos y sistemas diferentes, por lo que no deben compararse como una clasificación universal.

Carga de trabajo publicadaConfiguración de GPUResultado observado
DeepSeek-V4-FlashPrueba con una sola RTX 3090Aproximadamente 10–11 tok/s
DeepSeek-V4-FlashPrueba con cliente de escritorioAproximadamente 8,8 tok/s
DeepSeek-V4-Flash MXFP4RTX 509022–25 tok/s
Qwen3.6-35B-A3B BF16RTX 509077–83 tok/s
GLM-5.2, 753B en total / 40B activosUna sola RTX PRO 600014,9 tok/s

El enfoque de FreeToken utiliza ejecución adaptada al ancho de banda, almacenamiento en caché con conocimiento semántico y gestión elástica de la memoria. El entorno de ejecución puede dividir el trabajo de los expertos entre las transferencias a la GPU y la ejecución en la CPU, en lugar de depender de una ubicación fija seleccionada únicamente durante el arranque. Una caché LRU compartida sigue el comportamiento de enrutamiento en las distintas capas MoE, mientras que la reconstrucción en puntos seguros permite cambiar la caché de la GPU sin reiniciar el motor.

Los objetivos de optimización más útiles son:

  • Aumentar el ancho de banda de la RAM: Una memoria más rápida y una configuración de canales correctamente poblada pueden mejorar el trabajo en el lado del sistema anfitrión.
  • Reducir las tareas que compiten por la GPU: La codificación, la grabación, el renderizado y otras cargas de trabajo pueden reducir la VRAM disponible.
  • Usar una cuantización adecuada: Las compilaciones de menor precisión pueden hacer viables modelos más grandes, pero la calidad y la compatibilidad varían.
  • Probar indicaciones realistas: Las indicaciones cortas pueden ocultar los costes de prellenado, mientras que los contextos largos exponen el comportamiento de las transferencias y la caché.
  • Comparar las rutas de servidor y escritorio: El mismo modelo puede producir resultados diferentes según el cliente y la capa del entorno de ejecución.
Interpreta las velocidades de tokens con cuidado

Las cifras de tokens por segundo dependen de la longitud de la indicación, el modo de razonamiento, el enrutamiento de expertos, la reutilización del contexto y el método de medición. Compara cargas de trabajo equivalentes en lugar de tratar un único benchmark como el límite universal de FreeToken.

Lista de comprobación para solucionar problemas y optimizar

El material de pruebas describe FreeToken como software beta, por lo que algunos fallos pueden deberse a la compatibilidad del modelo o a la integración del entorno de ejecución, no a un problema de hardware. Un intento observado con Qwen 3.8 27B BF16 terminó inesperadamente, lo que demuestra por qué la compatibilidad del modelo debe probarse de forma independiente del éxito general de la instalación.

Utiliza la siguiente lista de comprobación antes de cambiar el hardware:

Preparación para una sola GPU:

  • Confirma los requisitos del controlador NVIDIA y CUDA para la compilación seleccionada
  • Comprueba la RAM utilizable del sistema y la VRAM disponible de la GPU antes de cargar un modelo
  • Cierra OBS, los juegos, las máquinas virtuales y otras aplicaciones que consuman muchos recursos de la GPU
  • Evalúa el ancho de banda de la memoria del sistema anfitrión y de PCIe en la estación de trabajo objetivo
  • Prueba el modelo con una indicación corta antes de activar el razonamiento máximo
  • Guarda los registros del servidor cuando un modelo se cierre inesperadamente
SíntomaÁrea probable que se debe inspeccionarRespuesta práctica
El modelo se niega a cargarRAM, VRAM o formato no compatiblePrueba un modelo más pequeño o de menor precisión
Velocidad de decodificación muy bajaAncho de banda de la memoria o tráfico excesivo del sistema anfitriónReduce las cargas de trabajo que compiten por recursos y revisa la configuración de la caché
La ruta de escritorio es más lenta que el servidorSobrecarga del cliente o diferencias del entorno de ejecuciónCompara la misma indicación mediante la API
La API no está disponibleInicio del servidor o configuración del endpointEspera al estado de disponibilidad y verifica el puerto 1919
El modelo se cierra inesperadamenteProblema de compatibilidad beta o error del entorno de ejecuciónGuarda los registros, reinicia una vez y prueba otro modelo
El rendimiento cambia entre indicacionesEnrutamiento dinámico de expertosUtiliza varias indicaciones antes de sacar conclusiones

Para seguir una secuencia fiable de solución de problemas, cambia una variable cada vez. Primero confirma que el modelo funciona, después mide la velocidad y, por último, ajusta la longitud del contexto o la configuración del razonamiento. Cambiar simultáneamente el modelo, el cliente, la cuantización y la asignación de memoria dificulta la interpretación del resultado.

La descripción general de la implementación de FreeToken ofrece información adicional sobre la versión Apache-2.0 del motor, el paquete PyPI, los endpoints compatibles y los mecanismos MoE adaptativos.

La compatibilidad del modelo es lo primero

Un modelo grande que técnicamente cabe en la combinación de RAM y VRAM aún puede fallar debido a una arquitectura, cuantización o comportamiento del entorno de ejecución no compatibles. Mantén disponible un modelo alternativo más pequeño.

Mejores casos de uso y preguntas frecuentes

Una estación de trabajo con FreeToken y una sola GPU es especialmente adecuada para desarrolladores, investigadores y entusiastas que desean acceder localmente a modelos grandes de pesos abiertos sin construir un servidor con varias GPU. Resulta especialmente útil para asistencia privada en programación, experimentación local, flujos de trabajo con agentes y pruebas de estrategias de inferencia MoE.

Programación local

Conecta un cliente compatible con OpenAI o Anthropic a un endpoint local para generar código, refactorizarlo y consultar repositorios.

Investigación de modelos

Compara formatos de cuantización, comportamiento de la caché y cargas de trabajo de las indicaciones en un hardware más accesible que un clúster de servidores.

Agentes privados

Ejecuta herramientas de agentes compatibles en tu propia estación de trabajo, manteniendo las indicaciones y las respuestas dentro del entorno local.

Q: ¿Qué significa FreeToken con una sola GPU?

Describe la ejecución de FreeToken con una GPU principal mientras se utilizan la RAM del sistema y los recursos de la CPU para almacenar o procesar los componentes del modelo que no caben completamente en la VRAM.

Q: ¿Cuánta RAM del sistema debería planificar?

Treinta y dos gigabytes son un punto de partida práctico, mientras que 64 GB o más ofrecen una mayor flexibilidad. Los modelos MoE grandes pueden requerir 96 GB, 128 GB, 192 GB o bastante más, según el modelo y la cuantización.

Q: ¿Puede una RTX 3090 ejecutar DeepSeek-V4-Flash mediante FreeToken?

Una prueba publicada en 2026 alcanzó aproximadamente entre 10 y 11 tokens por segundo con una sola RTX 3090, utilizando la memoria del sistema junto con la GPU. Los resultados reales dependen de la estación de trabajo completa y de la ruta del entorno de ejecución.

Q: ¿Por qué puede fallar un modelo aunque la GPU tenga VRAM libre?

FreeToken debe tener en cuenta el conjunto completo de expertos, la memoria del sistema anfitrión, la sobrecarga del entorno de ejecución y los requisitos de la caché. La VRAM disponible por sí sola no demuestra que se pueda servir toda la carga de trabajo.

Recomendación final

Comienza con un modelo compatible y una configuración conservadora, mide la ruta del servidor y, después, ajusta el comportamiento de la memoria y la caché para tu carga de trabajo específica.