Ir al contenido principal

Cómo ejecutar Qwen3.8-27B en local con una NVIDIA RTX 5090

Aprende a ejecutar Qwen3.8-27B en local con NVFP4 nativo de Blackwell y decodificación especulativa MTP, alcanzando hasta 170 tokens por segundo con llama.cpp.
Actualizado 25 ago 2026  · 6 min leer

Explorar con IA

ChatGPTClaudePerplexity

Qwen3.8-27B se está convirtiendo rápidamente en uno de los modelos más populares para IA en local. A pesar de tener solo 27.000 millones de parámetros, ofrece un rendimiento que compite con modelos mucho más grandes en benchmarks de código, razonamiento, agentes y uso general. Incluso se acerca a modelos como GLM-5.2 en varias áreas, lo que lo ha hecho especialmente popular entre quienes experimentan con hardware potente en local.

La RTX 5090 encaja especialmente bien con Qwen3.8-27B porque su arquitectura Blackwell admite NVFP4, lo que permite ejecutar el modelo a velocidades muy altas manteniendo una gran calidad de salida. Combinado con decodificación especulativa mediante predicción multi-token (MTP), una build optimizada de llama.cpp y el GGUF adecuado, Qwen3.8-27B puede superar con creces los 100 tokens por segundo en una sola RTX 5090.

En esta guía vamos a configurar lo que, en mi opinión, es una de las formas más sencillas de lograr el mejor equilibrio entre velocidad, precisión y soporte de contexto largo en una RTX 5090 u otra GPU Blackwell. Compilaremos llama.cpp con soporte nativo para Blackwell, descargaremos el GGUF NVFP4-MTP de Qwen3.8-27B, lo ejecutaremos con aceleración por GPU y decodificación especulativa MTP, probaremos la API compatible con OpenAI y la interfaz web integrada, y por último lo conectaremos a Pi para poder usar Qwen3.8-27B como un agente de código totalmente local.

Ingeniero Asociado de IA para Científicos de Datos

Entrena y afina los últimos modelos de IA para producción, incluidos los LLM como Llama 3. ¡Comienza hoy tu viaje para convertirte en Ingeniero de IA!
Explora La Pista

1. Configura llama.cpp para GPUs Blackwell

Primero, vamos a asegurarnos de que la GPU se detecta correctamente y comprobaremos la versión del driver de NVIDIA y de CUDA.

nvidia-smi

Resumen de la GPU RTX 5090

Deberías ver tu RTX 5090, la versión del driver, la versión de CUDA, la memoria de la GPU y el uso actual de la GPU.

Nota: Esta configuración es específica para GPUs NVIDIA Blackwell, como la RTX 5090. La build de abajo apunta a SM120, que es la arquitectura de cómputo usada por la RTX 5090.

A continuación, descargaremos y compilaremos la última versión de llama.cpp con soporte para CUDA.

cd /workspace

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp

cmake -B build \
  -DGGML_CUDA=ON \
  -DCMAKE_CUDA_ARCHITECTURES=120

cmake --build build --config Release -j$(nproc)

Compilando llama.cpp para la GPU RTX 5090

La parte importante aquí es -DCMAKE_CUDA_ARCHITECTURES=120. Esto indica a llama.cpp que compile específicamente para la arquitectura Blackwell usada por la RTX 5090.

Cuando termine la compilación, haremos que llama-server esté disponible globalmente para poder ejecutarlo desde cualquier carpeta:

sudo ln -sf "$(realpath ./build/bin/llama-server)" /usr/local/bin/llama-server

Ahora, comprueba que todo funciona:

llama-server --version

Deberías obtener una salida similar a:

version: 0.1.1-dev (build 10479, commit 0021a77de)
built with GNU 13.3.0 for Linux x86_64

Listo. Ya tenemos una build de llama.cpp con CUDA que puede aprovechar la RTX 5090 y su soporte nativo NVFP4 de Blackwell.

2. Descarga el modelo Qwen3.8-27B NVFP4-MTP

Ahora descargaremos el modelo Qwen3.8-27B.

Primero, instala la CLI de Hugging Face:

pip install -U huggingface_hub

Crea una carpeta donde guardaremos el modelo:

mkdir -p /workspace/models/qwen38

Luego descarga el GGUF NVFP4-MTP:

hf download felippeburk/Qwen3.8-27B-NVFP4-MTP-GGUF \
  --local-dir /workspace/models/qwen38

Descargando Qwen3.8-27B-NVFP4-MTP-GGUF

Esta es la versión que queremos para esta configuración porque usa NVFP4 e incluye soporte MTP, de donde proviene gran parte de la mejora de velocidad en la RTX 5090.

3. Inicia el servidor de Qwen3.8-27B

Ahora viene la parte divertida. Serviremos Qwen3.8-27B completamente en la GPU con Flash Attention, una ventana de contexto de 131K y decodificación especulativa MTP para una generación más rápida. 

Ejecuta:

cd /workspace/llama.cpp

llama-server \
  -m /workspace/models/qwen38/qwen3.8-27b-text-nvfp4-mtp.gguf \
  --alias qwen3.8-27b \
  --host 0.0.0.0 \
  --port 8910 \
  --ctx-size 131072 \
  --n-gpu-layers all \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --parallel 1 \
  --spec-type draft-mtp \
  --spec-draft-n-max 4 \
  --spec-draft-p-min 0.75 \
  --spec-draft-ngl all \
  --spec-draft-type-k q8_0 \
  --spec-draft-type-v q8_0 \
  --reasoning-effort medium \
  --jinja

Aquí hay muchas opciones, pero la mayoría están para exprimir al máximo el 5090.

Las principales que debes conocer son:

  • --ctx-size 131072 nos da aproximadamente una ventana de contexto de 131K.

  • --n-gpu-layers all mantiene el modelo en la GPU.

  • --flash-attn on activa Flash Attention.

  • --cache-type-k q8_0 y --cache-type-v q8_0 ayudan a reducir el uso de memoria de la caché KV.

  • --spec-type draft-mtp habilita la decodificación especulativa MTP de Qwen3.8.

  • --spec-draft-n-max 4 controla cuántos tokens especulativos puede generar MTP a la vez.

Para esta configuración usamos n-max 4 como punto de partida en una RTX 5090. Puedes probar con valores como 2 (que la tarjeta del modelo recomienda para este GGUF) o 3 más adelante, ya que el ajuste más rápido puede variar según tu sistema.

Cuando llama-server termine de cargar el modelo, Qwen3.8 estará disponible en local en http://127.0.0.1:8910.

Sirviendo Qwen3.8-27B-NVFP4-MTP-GGUF con llama.cpp

Ya tenemos Qwen3.8-27B funcionando en local. A continuación, probaremos el modelo tanto por API como con la interfaz de navegador integrada.

4. Prueba la velocidad y el rendimiento en código de Qwen3.8-27B

Con el servidor en marcha, abre otra terminal y envía una solicitud de prueba a la API compatible con OpenAI:

curl http://127.0.0.1:8910/v1/chat/completions \
 -H "Content-Type: application/json" \
 -d '{
   "model": "qwen3.8-27b",
   "messages": [
     {
       "role": "user",
       "content": "Write a Python FastAPI application that monitors GPU usage."
     }
   ],
   "max_tokens": 2000
 }'

Probando Qwen3.8-27B-NVFP4-MTP-GGUF con el comando CURL

En esta prueba, Qwen3.8-27B generó 2.000 tokens a 122 tokens/s con una impresionante tasa de aceptación MTP del 84,9%. 

llama.cpp también incluye una interfaz de navegador, así que puedes probar el modelo sin usar la API.

Abre http://127.0.0.1:8910 en tu navegador para ver la interfaz.

Probando Qwen3.8-27B-NVFP4-MTP-GGUF en la webui de llama.cpp

Para una prueba más compleja, usé este prompt:

Create a stunning single-file animated HTML website with a dark futuristic 
theme, smooth scrolling, glowing gradients, floating particles, animated cards,
hover effects, and responsive design using only HTML, CSS, and JavaScript.

Probando Qwen3.8-27B-NVFP4-MTP-GGUF en la webui de llama.cpp con tarea de código

En mi RTX 5090, obtenía de media unos 142 tokens por segundo, con picos de generación alrededor de 170 tokens por segundo, lo cual es extremadamente rápido para un modelo de 27B ejecutándose en local. 

image4.png

Qwen3.8-27B generó un sitio web pulido y totalmente funcional que funcionó a la primera. Es una buena manera de comprobar rápidamente tanto la capacidad de programación del modelo como la velocidad de la configuración local. 

5. Usa Qwen3.8-27B con Pi

En esta sección, conectaremos Qwen3.8-27B a Pi y lo usaremos como un agente de código totalmente local.

Pi es un agente de código ligero basado en terminal que puede ayudarte a crear, editar, probar y depurar proyectos directamente desde la línea de comandos.

Instala Pi con:

curl -fsSL https://pi.dev/install.sh | sh

El instalador requiere Node.js y npm. Instala Pi en tu prefijo global de npm. Si aún no tienes Node, instálalo primero con nvm o con tu gestor de paquetes.

Cuando termine la instalación, reinicia la terminal.

A continuación, instala la extensión pi-llama y apunta Pi a nuestro servidor local de llama.cpp:

pi install git:github.com/huggingface/pi-llama

export LLAMA_BASE_URL=http://127.0.0.1:8910/v1

Crea un proyecto nuevo e inicia Pi:

mkdir new-project
cd new-project

Pi

Configurando qwen3.8-27b en el agente de código Pi

Dentro de Pi, ejecuta /model, busca llama-cpp y selecciona Qwen3.8-27B.

Para probar, le di este prompt:

Build a polished personal finance dashboard from scratch that imports CSV 
bank statements, categorizes spending, shows monthly trends and charts, and 
detects unusual expenses; also generate a realistic sample CSV, import it, 
test the full app end-to-end, and fix any errors automatically.

Probando el modelo qwen3.8-27b con el agente de código Pi

Construyó todo el proyecto en pocos minutos. 

Probando el modelo qwen3.8-27b con el agente de código Pi

Luego le pedí que iniciara el servidor y probara tanto el frontend como la lógica de la aplicación. Dedicó más tiempo a depurar y probar para asegurarse de que todo funcionaba correctamente.

panel web generado con qwen3.8-27b y el agente Pi

Cuando probé yo mismo el panel, la app funcionaba bien, los gráficos tenían muy buen aspecto y la experiencia general fue fluida.

panel web generado con qwen3.8-27b y el agente Pi

La principal debilidad fue realizar cambios precisos en la interfaz. Tras varios prompts de seguimiento, empezó a hacer cambios no relacionados en lugar de captar exactamente lo que quería, así que al final lo dejé ahí.

Conclusiones

Qwen3.8-27B todavía es muy nuevo y la comunidad está afinando la mejor combinación de cuantización y decodificación especulativa. MTP funciona muy bien, pero también se están probando enfoques más recientes como DFlash 2 y DSpark, con usuarios que informan de velocidades aún mayores según el hardware y la carga de trabajo. 

Unsloth también acaba de lanzar GGUF Dynamic v3.0 para Qwen3.8-27B, afirmando alrededor de un 10% más de precisión con el mismo tamaño de modelo en comparación con sus quants anteriores. Esto convierte a Unsloth en otra opción muy interesante si quieres mejor calidad manteniendo prácticamente la misma configuración de inferencia local. 

Por ahora, creo que NVFP4 + MTP + llama.cpp es una de las configuraciones más fáciles y rápidas para una RTX 5090. Conseguir alrededor de 140 tokens por segundo con un modelo de 27B y, a la vez, disponer de una ventana de contexto grande y suficiente capacidad para ejecutar un agente de código real es impresionante. Probablemente la configuración será aún más rápida a medida que llama.cpp, Unsloth, DFlash 2 y DSpark sigan mejorando.

Preguntas frecuentes sobre ejecutar Qwen3.8-27B en local

¿Necesitas una RTX 5090 para ejecutar Qwen3.8-27B en local?

No. Las cuantizaciones GGUF estándar de 4 bits de Qwen3.8-27B caben en unos 16–19 GB de VRAM, así que una RTX 5080, una 4090 o un Mac de 24 GB ejecutarán el modelo. La RTX 5090 es relevante para esta configuración concreta porque NVFP4 necesita los tensor cores de Blackwell. En tarjetas más antiguas, los archivos NVFP4 funcionan pero solo te aportan ahorro de memoria, no el aumento de velocidad.

¿Cuánta VRAM usa realmente esta configuración?

El GGUF NVFP4-MTP ocupa unos 19 GB en disco, y la caché KV es lo que hace que el total suba a medida que crece el contexto. Con cuantización K/V q8_0 y contexto muy largo, ejecuciones publicadas en RTX 5090 quedan sobre la franja de los 20 y pico GB, así que una tarjeta de 32 GB es cómoda. Con 24 GB necesitarás bajar --ctx-size bastante por debajo de 131072.

¿Qué hace la decodificación especulativa MTP y es sin pérdidas?

Qwen3.8 incorpora capas de predicción multi-token integradas en el GGUF, que actúan como un modelo de borrador sin necesitar un segundo archivo. La cabeza de borrador propone varios tokens a la vez y el modelo completo los verifica, así que los borradores aceptados cuestan una fracción de una pasada normal. La calidad de salida no cambia, porque cada token que acepta el modelo principal es uno que habría generado igualmente.

¿Deberías usar NVFP4 o una cuantización Q4_K_M normal?

Elige NVFP4 si tienes una GPU Blackwell y buscas máxima velocidad; elige un GGUF estándar como Q4_K_M o UD-Q4_K_XL de Unsloth si estás en Ampere o Ada, o si te importa más la calidad por gigabyte. El soporte NVFP4 en llama.cpp también es más reciente que la vía de K-quant, así que espera algún borde más rugoso en conversión y tooling.

¿Esta configuración puede manejar imágenes, dado que Qwen3.8-27B es un modelo de visión?

Qwen3.8-27B es un modelo nativo visión-lenguaje, pero las conversiones GGUF solo texto eliminan la torre de visión. Para usar imágenes, necesitas pasar un proyector multimodal junto al modelo con --mmproj, normalmente el archivo mmproj publicado en el mismo repo o en el repo de GGUF de Unsloth.


Abid Ali Awan's photo
Author
Abid Ali Awan
LinkedIn
Twitter

Soy un científico de datos certificado que disfruta creando aplicaciones de aprendizaje automático y escribiendo blogs sobre ciencia de datos. Actualmente me centro en la creación de contenidos, la edición y el trabajo con grandes modelos lingüísticos.

Temas

¡Conviértete en AI Engineer con DataCamp!

programa

Associate AI Engineer para desarrolladores

26 h
Aprende a integrar IA en aplicaciones de software usando APIs y bibliotecas de código abierto. ¡Empieza hoy tu camino para convertirte en AI Engineer!
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow