Ir al contenido principal

Cómo ejecutar Qwen3.8-27B en local con una NVIDIA RTX 5090

Aprende a ejecutar Qwen3.8-27B en local con NVFP4 nativo de Blackwell y decodificación especulativa MTP, alcanzando hasta 170 tokens por segundo con llama.cpp.
Actualizado 31 ago 2026  · 6 min leer

Explora con IA

ChatGPTClaudePerplexity

Qwen3.8-27B se está convirtiendo rápidamente en uno de los modelos más populares para IA local. A pesar de tener solo 27.000 millones de parámetros, ofrece un rendimiento que compite con modelos mucho más grandes en benchmarks de código, razonamiento, agentes y uso general. Incluso se acerca a modelos como GLM-5.2 en varias áreas, lo que lo ha hecho especialmente popular entre quienes experimentan con hardware potente en local.

La RTX 5090 encaja especialmente bien con Qwen3.8-27B porque su arquitectura Blackwell es compatible con NVFP4, lo que permite ejecutar el modelo a velocidades muy altas manteniendo una gran calidad de salida. Si lo combinas con decodificación especulativa mediante predicción multi-token (MTP), una versión optimizada de llama.cpp y el GGUF adecuado, Qwen3.8-27B puede superar con holgura los 100 tokens por segundo en una única RTX 5090.

En esta guía, configuraremos lo que, en mi opinión, es una de las formas más sencillas de lograr el mejor equilibrio entre velocidad, precisión y soporte de contexto largo en una RTX 5090 u otra GPU Blackwell. Compilaremos llama.cpp con soporte nativo para Blackwell, descargaremos el GGUF NVFP4-MTP de Qwen3.8-27B, lo ejecutaremos con aceleración por GPU y decodificación especulativa MTP, probaremos la API compatible con OpenAI y la interfaz web integrada y, por último, lo conectaremos a Pi para usar Qwen3.8-27B como un agente de código totalmente local.

También te recomiendo echar un vistazo a nuestra guía de Qwen3.8-Flash-Next, la versión preliminar más reciente de Qwen4, y al tutorial sobre cómo ejecutar Qwen3.8-Flash-Next en local.

Ingeniero Asociado de IA para Científicos de Datos

Entrena y afina los últimos modelos de IA para producción, incluidos los LLM como Llama 3. ¡Comienza hoy tu viaje para convertirte en Ingeniero de IA!
Explora La Pista

1. Configura llama.cpp para GPUs Blackwell

Primero, vamos a asegurarnos de que la GPU se detecta correctamente y comprobaremos la versión del driver de NVIDIA y de CUDA.

nvidia-smi

Resumen de la GPU RTX 5090

Deberías ver tu RTX 5090, la versión del driver, la versión de CUDA, la memoria de la GPU y el uso actual de la GPU.

Nota: Esta configuración es específica para GPUs NVIDIA Blackwell, como la RTX 5090. La compilación de abajo apunta a SM120, que es la arquitectura de cómputo que usa la RTX 5090.

A continuación, descargaremos y compilaremos la última versión de llama.cpp con soporte para CUDA.

cd /workspace

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_CUDA_ARCHITECTURES=120

cmake --build build --config Release -j$(nproc)

Compilando llama.cpp para la GPU RTX 5090

Lo importante aquí es -DCMAKE_CUDA_ARCHITECTURES=120. Esto le indica a llama.cpp que compile específicamente para la arquitectura Blackwell usada por la RTX 5090.

Cuando termine la compilación, haremos que llama-server esté disponible globalmente para poder ejecutarlo desde cualquier carpeta:

sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server

Ahora, comprueba que todo funciona:

llama-server --version

Deberías obtener una salida similar a:

version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64

Listo. Ya tenemos una compilación de llama.cpp con CUDA que puede aprovechar la RTX 5090 y su soporte NVFP4 nativo de Blackwell.

2. Descarga el modelo Qwen3.8-27B NVFP4-MTP

Ahora descargaremos el modelo Qwen3.8-27B.

Primero, instala la CLI de Hugging Face:

pip install -U huggingface_hub

Crea una carpeta donde guardaremos el modelo:

mkdir -p /workspace/models/qwen38

Luego descarga el GGUF NVFP4-MTP:

hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
  --local-dir /workspace/models/qwen38

Descargando Qwen3.8-27B-NVFP4-MTP-GGUF

Esta es la versión que queremos para esta configuración porque usa NVFP4 e incluye soporte MTP, que es de donde proviene gran parte de la mejora de velocidad en la RTX 5090.

3. Inicia el servidor de Qwen3.8-27B

Ahora viene la parte divertida. Serviremos Qwen3.8-27B íntegramente en la GPU con Flash Attention, una ventana de contexto de 131K y decodificación especulativa MTP para generar más rápido. 

Ejecuta:

cd /workspace/llama.cpp

llama-server \
  -m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
  --alias qwen3.8-27b \
  --host 0.0.0.0 \
  --port 8910 \
  --ctx-size 131072 \
  --n-gpu-layers all \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --parallel 1 \
  --spec-type draft-mtp \
  --spec-draft-n-max 4 \
  --spec-draft-p-min 0.75 \
  --spec-draft-ngl all \
  --spec-draft-type-k q8_0 \
  --spec-draft-type-v q8_0 \
  --reasoning-effort medium \
  --jinja

Aquí hay muchas opciones, pero la mayoría están para exprimir al máximo el 5090.

Las principales a tener en cuenta son:

  • --ctx-size 131072 nos da aproximadamente una ventana de contexto de 131K.

  • --n-gpu-layers all mantiene el modelo en la GPU.

  • --flash-attn on activa Flash Attention.

  • --cache-type-k q8_0 y --cache-type-v q8_0 ayudan a reducir el uso de memoria de la caché KV.

  • --spec-type draft-mtp activa la decodificación especulativa MTP de Qwen3.8.

  • --spec-draft-n-max 4 controla cuántos tokens especulativos puede generar MTP de una vez.

Para esta configuración usamos n-max 4 como punto de partida para una RTX 5090. Puedes probar con valores como 2 (que la ficha del modelo recomienda para este GGUF) o 3 más adelante, ya que el ajuste más rápido puede variar ligeramente según tu sistema.

Cuando llama-server termine de cargar el modelo, Qwen3.8 estará disponible en local en http://127.0.0.1:8910.

Sirviendo el Qwen3.8-27B-NVFP4-MTP-GGUF con llama.cpp

Ya tenemos Qwen3.8-27B funcionando en local. Ahora probaremos el modelo tanto a través de la API como de la interfaz web integrada.

4. Prueba la velocidad y el rendimiento en código de Qwen3.8-27B

Con el servidor en marcha, abre otra terminal y envía una solicitud de prueba a la API compatible con OpenAI:

curl http://127.0.0.1:8910/v1/chat/completions \
 -H "Content-Type: application/json" \
 -d '{
   "model": "qwen3.8-27b",
   "messages": [
     {
       "role": "user",
       "content": "Write a Python FastAPI application that monitors GPU usage."
     }
   ],
   "max_tokens": 2000
 }'

Probando Qwen3.8-27B-NVFP4-MTP-GGUF con el comando CURL

En esta prueba, Qwen3.8-27B generó 2.000 tokens a 122 tokens/seg con una impresionante tasa de aceptación MTP del 84,9%. 

llama.cpp también incluye una interfaz de navegador, para que puedas probar el modelo sin usar la API.

Abre http://127.0.0.1:8910 en tu navegador para ver la interfaz.

Probando Qwen3.8-27B-NVFP4-MTP-GGUF en la webui de llama.cpp

Para una prueba más compleja, usé este prompt:

Create a stunning single-file animated HTML website with a dark futuristic 
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

Probando Qwen3.8-27B-NVFP4-MTP-GGUF en la webui de llama.cpp con tarea de código

En mi RTX 5090, obtuve una media de ~142 tokens por segundo, con picos de generación de alrededor de 170 tokens por segundo, que es extremadamente rápido para un modelo de 27B ejecutándose en local. 

image4.png

Qwen3.8-27B generó un sitio web pulido y totalmente funcional que funcionó a la primera. Es una buena forma de probar rápidamente tanto la capacidad de programación del modelo como la velocidad de la configuración local. 

5. Usa Qwen3.8-27B con Pi

En esta sección, conectaremos Qwen3.8-27B a Pi y lo usaremos como un agente de código totalmente local.

Pi es un agente ligero para programar desde la terminal que puede ayudarte a crear, editar, probar y depurar proyectos directamente desde la línea de comandos.

Instala Pi con:

curl -fsSL https://pi.dev/install.sh | sh

El instalador requiere Node.js y npm. Instala Pi en el prefijo global de npm. Si aún no tienes Node, instálalo primero con nvm o con tu gestor de paquetes.

Cuando finalice la instalación, reinicia tu terminal.

Después, instala la extensión pi-llama y apunta Pi a nuestro servidor local de llama.cpp:

pi install git:github.com/huggingface/pi-llama

export LLAMA_BASE_URL=http://127.0.0.1:8910/v1

Crea un nuevo proyecto e inicia Pi:

mkdir new-project
cd new-project

Pi

Configurando qwen3.8-27b en el agente de código Pi

Dentro de Pi, ejecuta /model, busca llama-cpp y selecciona Qwen3.8-27B.

Para probarlo, le di este prompt:

Build a polished personal finance dashboard from scratch that imports CSV 
bank statements, categorizes spending, shows monthly trends and charts, and 
detects unusual expenses; also generate a realistic sample CSV, import it, 
test the full app end-to-end, and fix any errors automatically.

Probando el modelo qwen3.8-27b con el agente de código Pi

Construyó el proyecto completo en pocos minutos. 

Probando el modelo qwen3.8-27b con el agente de código Pi

Luego le pedí que iniciara el servidor y probara tanto el frontend como la lógica de la aplicación. Dedicó más tiempo a depurar y probar para asegurarse de que todo funcionaba correctamente.

panel web generado con el modelo qwen3.8-27b y el agente de código Pi

Cuando probé yo mismo el panel, la app funcionó bien, los gráficos se veían genial y la experiencia general fue fluida.

panel web generado con el modelo qwen3.8-27b y el agente de código Pi

La principal debilidad fue hacer cambios de UI muy precisos. Tras varios prompts de seguimiento, empezó a hacer cambios no relacionados en lugar de entender exactamente lo que quería, así que lo dejé ahí.

Reflexiones finales

Qwen3.8-27B sigue siendo muy reciente y la comunidad está afinando la mejor combinación de cuantización y decodificación especulativa. MTP funciona extremadamente bien, pero también se están probando enfoques más nuevos como DFlash 2 y DSpark, con algunos usuarios reportando velocidades aún mayores según el hardware y la carga de trabajo. 

Unsloth también acaba de publicar GGUF Dynamic v3.0 para Qwen3.8-27B, afirmando alrededor de un 10% más de precisión con el mismo tamaño de modelo en comparación con sus quants anteriores. Esto hace de Unsloth otra opción muy interesante si buscas más calidad manteniendo aproximadamente la misma configuración de inferencia local. 

Por ahora, creo que NVFP4 + MTP + llama.cpp es una de las configuraciones más sencillas y rápidas para una RTX 5090. Lograr en torno a 140 tokens por segundo con un modelo de 27B, manteniendo una ventana de contexto amplia y capacidad suficiente para ejecutar un agente de código real, es impresionante. Probablemente esta configuración será aún más rápida a medida que llama.cpp, Unsloth, DFlash 2 y DSpark sigan mejorando.

FAQs para ejecutar Qwen3.8-27B en local

¿Necesitas una RTX 5090 para ejecutar Qwen3.8-27B en local?

No. Las cuantizaciones GGUF estándar de 4 bits de Qwen3.8-27B caben en unos 16–19 GB de VRAM, así que una RTX 5080, una 4090 o un Mac de 24 GB ejecutarán el modelo. La RTX 5090 importa para esta configuración concreta porque NVFP4 necesita los núcleos tensoriales de Blackwell. En tarjetas más antiguas, los archivos NVFP4 se ejecutan pero solo te dan el ahorro de memoria, no el aumento de velocidad.

¿Cuánta VRAM usa realmente esta configuración?

El GGUF NVFP4-MTP ocupa unos 19 GB en disco, y la caché KV es lo que hace subir el total a medida que crece el contexto. Con cuantización K/V q8_0 a contextos muy largos, ejecuciones publicadas en RTX 5090 quedan en veintitantos GB, así que una tarjeta de 32 GB va sobrada. Con 24 GB tendrás que bajar --ctx-size bastante por debajo de 131072.

¿Qué hace la decodificación especulativa MTP y es sin pérdidas?

Qwen3.8 incluye capas de predicción multi-token integradas en el GGUF, que actúan como un modelo borrador incorporado, sin necesitar un segundo archivo. La cabeza borradora propone varios tokens a la vez y el modelo completo los verifica, así que los borradores aceptados cuestan una fracción de una pasada normal. La calidad de salida no cambia, porque cada token que acepta el modelo principal es uno que habría producido igualmente.

¿Deberías usar NVFP4 o una cuantización Q4_K_M normal?

Elige NVFP4 si tienes una GPU Blackwell y quieres la máxima velocidad; elige un GGUF estándar como Q4_K_M o el UD-Q4_K_XL de Unsloth si estás en Ampere o Ada, o si te importa más la calidad por gigabyte. El soporte NVFP4 en llama.cpp también es más reciente que la ruta K-quant, así que espera alguna arista en conversión y tooling.

¿Esta configuración puede manejar imágenes, dado que Qwen3.8-27B es un modelo de visión?

Qwen3.8-27B es un modelo nativo visión-lenguaje, pero las conversiones GGUF solo texto eliminan la torre de visión. Para usar imágenes, necesitas pasar un proyector multimodal junto al modelo con --mmproj, normalmente el archivo mmproj publicado en el mismo repositorio o en el repositorio de GGUF de Unsloth.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Soy un científico de datos certificado que disfruta creando aplicaciones de aprendizaje automático y escribiendo blogs sobre ciencia de datos. Actualmente me centro en la creación de contenidos, la edición y el trabajo con grandes modelos lingüísticos.

Temas
Inteligencia Artificial

¡Conviértete en AI Engineer con DataCamp!

Programa

Associate AI Engineer para desarrolladores

26 h
Aprende a integrar IA en aplicaciones de software usando APIs y bibliotecas de código abierto. ¡Empieza hoy tu camino para convertirte en AI Engineer!
Ver detallesRight Arrow
Empezar Curso
Ver másRight Arrow
Relacionado
An avian AI exits its cage

blog

12 alternativas de código abierto a GPT-4

Alternativas de código abierto a GPT-4 que pueden ofrecer un rendimiento similar y requieren menos recursos informáticos para funcionar. Estos proyectos vienen con instrucciones, fuentes de código, pesos del modelo, conjuntos de datos e IU de chatbot.
Abid Ali Awan's photo

Abid Ali Awan

9 min

Tutorial

Cómo ajustar GPT 3.5: Liberar todo el potencial de la IA

Explore GPT-3.5 Turbo y descubra el potencial transformador del ajuste fino. Aprenda a personalizar este modelo de lenguaje avanzado para aplicaciones especializadas, mejore su rendimiento y comprenda los costes asociados, la seguridad y las consideraciones de privacidad.
Moez Ali's photo

Moez Ali

11 min

Tutorial

Tutorial de DeepSeek-Coder-V2: Ejemplos, instalación, puntos de referencia

DeepSeek-Coder-V2 es un modelo de lenguaje de código de código abierto que rivaliza con el rendimiento de GPT-4, Gemini 1.5 Pro, Claude 3 Opus, Llama 3 70B o Codestral.
Dimitri Didmanidze's photo

Dimitri Didmanidze

8 min

Tutorial

Tutorial FLAN-T5: Guía y puesta a punto

Una guía completa para afinar un modelo FLAN-T5 para una tarea de respuesta a preguntas utilizando la biblioteca de transformadores, y ejecutando la inferencia optmizada en un escenario del mundo real.
Zoumana Keita 's photo

Zoumana Keita

15 min

Tutorial

Ajuste fino de GPT-3 mediante la API OpenAI y Python

Libere todo el potencial de GPT-3 mediante el ajuste fino. Aprenda a utilizar la API de OpenAI y Python para mejorar este modelo de red neuronal avanzado para su caso de uso específico.
Zoumana Keita 's photo

Zoumana Keita

12 min

Tutorial

Visión GPT-4: Guía completa para principiantes

Este tutorial le presentará todo lo que necesita saber sobre GPT-4 Vision, desde cómo acceder a él hasta ejemplos prácticos del mundo real y sus limitaciones.
Arunn Thevapalan's photo

Arunn Thevapalan

12 min

Ver MásVer Más