programa
La mayoría aún conoce el laboratorio detrás de Grok como xAI. SpaceXAI lanzó Grok 4.6 el 12 de agosto de 2026, poco más de un mes después de Grok 4.5, con foco en programación, trabajo visual en la web y tareas de agente de mayor duración.
Los datos del lanzamiento no respaldan un ranking único y simple. Grok lidera algunas de las pruebas elegidas por SpaceXAI, mientras que GPT-5.6 Sol y Claude Fable 5 lideran otras. Artificial Analysis sitúa Grok junto a Sol a un precio mixto más bajo, pero la actualización también empieza a responder más tarde y cuesta más por tarea medida que Grok 4.5.
Este artículo sigue ese equilibrio a través de las especificaciones del modelo, precios, acceso y comparativas directas con Sol y Claude. Nuestra cobertura de Grok 4.5 se centró en el bajo uso de tokens. Aquí, la pregunta es si una puntuación mayor cambia realmente la factura una vez que se cuentan la entrada en caché, los tokens de razonamiento y el extra de salida.
TL;DR: Grok 4.6
Mi conclusión corta: la ganancia de cinco puntos importa menos por sí sola de lo que sugiere la página de lanzamiento. El comportamiento de precios y el tipo de tarea deciden si cambia la elección de modelo.
-
Con esfuerzo
high, Grok 4.6 logra 61 en el Artificial Analysis Intelligence Index, igual que Sol enmaxy dos puntos por detrás de Opus 5 enmax. -
Las tarifas base de entrada y salida siguen en 2 $ y 6 $ por millón de tokens, pero la entrada en caché, el retardo del primer token y el coste por tarea medida suben respecto a Grok 4.5.
-
En AA-Briefcase, Grok usó menos turnos y tokens de entrada que Opus 5; Sol lidera las pruebas de terminal, mientras que Sonnet 5 ofrece el doble de contexto sin recargo por prompts largos.
Las comparativas de abajo separan las afirmaciones del proveedor de los resultados de Artificial Analysis. Importa porque un modelo puede cambiar de posición cuando cambia el nivel de esfuerzo o la configuración de la prueba.
¿Quieres iniciarte en la IA Generativa?
Aprende a trabajar con LLMs en Python directamente en tu navegador

¿Qué es Grok 4.6?
Grok 4.6 es el modelo de razonamiento propietario de SpaceXAI. La API y Cursor no exponen el mismo límite de contexto, y la tarifa superior para contexto largo empieza bastante antes del límite de la API. La tabla sitúa esas restricciones junto a los tipos de entrada, herramientas y el límite de conocimiento.
|
Especificación |
Grok 4.6 |
|
500.000 tokens (API); 256.000 tokens en Cursor |
|
|
Entrada / salida |
Texto e imágenes de entrada; texto de salida |
|
Esfuerzo de razonamiento |
Low, medium, high (por defecto), xhigh |
|
Límite de conocimiento |
1 de febrero de 2026 |
|
Herramientas |
Function calling, búsqueda web, búsqueda en X, ejecución de código, búsqueda en colecciones (RAG), MCP remoto |
|
Precios estándar |
2 $ / millón de tokens de entrada, 0,50 $ en caché, 6 $ / millón de salida |
|
Precios con contexto largo |
4 $ / 1 $ / 12 $ cuando un prompt alcanza 200.000 tokens, aplicado a toda la solicitud |
SpaceXAI sigue sin publicar el recuento de parámetros de ninguno de los modelos. La cifra de 1,5 billones que aparece en algunos informes no proviene de SpaceXAI, así que no es una especificación confirmada.
¿Qué hay de nuevo en Grok 4.6?
SpaceXAI afirma que no es un modelo nuevo entrenado desde cero. En su lugar, amplió el entrenamiento de Grok 4.5, con atención extra a tareas de agentes de IA. Los cambios reportados se agrupan en ejecuciones de agente más largas, construcción visual y postentrenamiento.
Tareas de agente más largas
SpaceXAI dice que Grok 4.6 se mantiene en el rumbo durante tareas largas con varios pasos, como investigación, trabajo sobre una base de código y creación de una aplicación. Supuestamente, el modelo comprueba su trabajo con más frecuencia en lugar de hacerlo todo en una sola pasada.
Esto encaja con un cambio más amplio en las pruebas de modelos. Una buena primera respuesta importa menos si el modelo olvida decisiones previas tras varias llamadas a herramientas. Las pruebas internas de GitHub también encontraron que Grok 4.6 mantuvo el razonamiento y el uso de herramientas durante tareas más largas.
La API incorpora funciones ligadas a esa afirmación. Grok 4.6 puede transmitir resúmenes de razonamiento, algo que Grok 4.5 no expone, y xAI recomienda compactación de contexto con una prompt_cache_key persistente para bucles largos de agente. La compactación acorta el historial previo en un único elemento, pero sigue usando tokens, y la solicitud debe caber en la ventana de contexto antes de compactar.
Desarrollo web visual e interactivo
SpaceXAI y Cursor informan de mejores primeros intentos en proyectos visuales. En una prueba externa, Grok 4.6 reconstruyó una antigua página del iPod Mini como un sitio 3D con rueda de color funcional y animación de scroll. La demo funcionó, pero una prueba no prueba la afirmación general.
Cómo se postentrenó Grok 4.6
Si solo te interesan los benchmarks y los precios, salta esta subsección. Explica la versión de SpaceXAI sobre el origen de la mejora.
SpaceXAI hizo más entrenamiento que con Grok 4.5. Usó ejemplos de razonamiento y de ingeniería generados por IA, eliminó ejemplos pobres con comprobaciones basadas en modelos y luego aplicó aprendizaje por refuerzo para tareas de código, oficina, desarrollo web, ajuste de kernel y diseño de ordenadores. SpaceXAI también afirma que Grok 4.5 creó nuevos ejemplos de entrenamiento con distintos ajustes de razonamiento y materias. La empresa atribuye la ganancia a más entrenamiento y a una selección de datos más estricta, no a una nueva arquitectura.
Equipos externos no pueden verificar esos detalles, y SpaceXAI no ha compartido información suficiente para repetir el entrenamiento. Es la versión de la empresa sobre lo que cambió, no un resultado contrastado por terceros.
Benchmarks de Grok 4.6: resultados oficiales e independientes
La tabla de lanzamiento de SpaceXAI muestra dónde suben las puntuaciones, pero las de competidores son «lo mejor de resultados autoinformados o públicos». Un mismo equipo no ejecutó todos los modelos bajo la misma configuración. Se incluye el esfuerzo de razonamiento porque afecta a la puntuación.
|
Benchmark |
Grok 4.6 (high) |
Grok 4.5 (high) |
GPT-5.6 Sol (max) |
Claude Fable 5 (max) |
|---|---|---|---|---|
|
AA Intelligence Index |
61 |
56 |
61 |
62 |
|
GDPVal-AA v2 (Elo) |
1.753 |
1.526 |
1.728 |
1.741 |
|
DeepSWE 1.1 |
65,9% |
54,0% |
73,0% |
70,0% |
|
Terminal-Bench 3.0 |
26,0% |
15,7% |
34,6% |
34,1% |
|
APEX-Agents |
57,5% |
47,1% |
56,7% |
59,2% |
|
CursorBench v3.2 |
69,9% |
66,7% |
67,2% |
70,5% |
Grok 4.6 mejora a Grok 4.5 en toda la tabla. Las mayores distancias con Sol aparecen en DeepSWE y Terminal-Bench, mientras que Fable lidera 3 filas. Ni siquiera la tabla de SpaceXAI señala a un único ganador.
Resultados de benchmarks independientes
Artificial Analysis ejecutó su propio Intelligence Index en seis modelos de esta comparativa. Sus resultados son cercanos a los de SpaceXAI, pero no idénticos.

Grok 4.6 frente a cinco rivales de frontera. Imagen del autor.
El gráfico sitúa a Grok al nivel de Sol en inteligencia, pero mucho más abajo en precio mixto. Artificial Analysis calcula ese precio con una mezcla 7:2:1 de entrada en caché, entrada sin caché y salida. El coste por tarea completada del índice muestra la misma brecha: 0,84 $ para Grok, 1,23 $ para Sol y 2,34 $ para Opus 5.
El tiempo hasta el primer token de respuesta subió de 14,62 segundos en Grok 4.5 a 40,44 segundos, mientras que el coste por tarea aumentó de 0,36 $ a 0,84 $. Grok 4.6 usó alrededor de un 20% más de tokens de salida en las mismas pruebas, por lo que un precio de lista sin cambios no implica un coste por tarea sin cambios. El coste por tarea terminada ofrece una visión mejor que las tarjetas de precios de la API porque incluye parte del razonamiento extra usado para terminar el trabajo.
En comparación con GPT-5.6 Sol y Claude Sonnet 5, Grok 4.6 envía su primer token de respuesta antes. Sol con esfuerzo máximo tarda 213,52 segundos, y Sonnet 5 tarda 184,48, frente a los 40,44 de Grok. Grok solo parece lento frente a modelos de baja latencia como Gemini 3.7 Flash.
¿Qué fiabilidad tienen estas comparativas de benchmarks?
Son útiles para detectar puntos fuertes relativos, pero no para un ranking transversal fiable. El esfuerzo de razonamiento cambia la puntuación y el tiempo de respuesta: GPT-5.6 Sol logró 57 con esfuerzo high y 61 con max. Además, los nombres de benchmarks pueden referirse a versiones distintas, de modo que Terminal-Bench 3.0 de xAI y Terminal-Bench 2.1 de Artificial Analysis no son comparables.
¿Qué cambió respecto a Grok 4.5?
Para quienes ya usan Grok 4.5, la decisión no es si 4.6 es «mejor» en abstracto. Es si la puntuación superior compensa un perfil distinto de latencia y uso de tokens. La tabla pone esos cambios en la misma base de comparación.
|
Medida |
Grok 4.5 (high) |
Grok 4.6 (high) |
|
AA Intelligence Index |
56 |
61 |
|
Coste por tarea del índice |
0,36 $ |
0,84 $ |
|
Tiempo hasta el primer token de respuesta |
14,62 s |
40,44 s |
|
Precio de entrada en caché |
0,30 $ / M |
0,50 $ / M |
|
Tokens de salida usados para ejecutar el índice |
60 M |
72 M |
|
Precio base de entrada / salida |
2 $ / 6 $ |
2 $ / 6 $ (sin cambios) |
Ahora bien, «mismo precio» solo describe la tarifa base de lista. Hay otro cambio que importa a quienes ya usan Grok 4.5: la entrada en caché subió un 67%, de 0,30 $ a 0,50 $ por millón de tokens. Esa tarifa de caché más alta amplía la brecha entre la tarjeta de precios y el coste de una tarea terminada.
Grok 4.6 frente a la competencia
Tras comparar con su predecesor, veamos cómo se mide Grok 4.6 con otros modelos de primera línea de OpenAI y Anthropic.
Grok 4.6 vs GPT-5.6 Sol
El empate en el índice oculta una división clara. Sol supera a Grok en 7,1 puntos en DeepSWE y 8,6 puntos en Terminal-Bench, lo que hace que la programación con mucho terminal sea su mejor caso. Grok puntúa más alto en las otras tres filas de tareas.
Las pruebas de OpenAI amplían ese resultado en terminal al navegador web y al uso del ordenador. Siguen siendo pruebas seleccionadas por el proveedor, no una comparación controlada, pero apuntan en la misma dirección: el punto fuerte de Sol es el trabajo que depende de un terminal, un navegador o llamadas repetidas a herramientas.
OpenAI también previsualizó un modo Ultrafast para Sol que, según dice, es hasta 14 veces más rápido. Aún no tiene precio publicado, así que no entra en la comparativa de costes.
Grok 4.6 parte de 2 $ de entrada y 6 $ de salida por millón de tokens. La tarifa estándar de Sol es 5 $ de entrada y 30 $ de salida, cinco veces el precio de salida de Grok. Por encima de 272.000 tokens, Sol duplica el precio de entrada y sube la salida a 45 $.
Eso no significa que toda tarea con Grok cueste cinco veces menos. El uso de tokens de razonamiento, los aciertos de caché y el número de turnos siguen cambiando la factura final. La ventaja de precio de Grok es más clara cuando el uso de tokens es predecible. Para trabajo intensivo en terminal, las puntuaciones más altas de Sol pueden pesar más que la brecha de precio de lista.
Grok 4.6 vs Claude Sonnet 5
Sonnet 5 y Grok 4.6 parten ambos de 2 $ por millón de tokens de entrada, lo que facilita comparar precios. Sonnet 5 tiene por defecto una ventana de contexto de 1 millón de tokens, el doble que los 500.000 de Grok, sin tarifa superior para prompts largos. La salida cuesta 10 $ por millón frente a 6 $ de Grok.
Dos días antes del lanzamiento de Grok 4.6, Anthropic hizo permanente el precio de 2 $/10 $ y canceló una subida prevista a 3 $/15 $. Esto importa al comparar con hojas de precios antiguas, incluida alguna nuestra.
En el índice de Artificial Analysis, Sonnet 5 puntúa 55 con esfuerzo máximo, seis puntos por debajo de Grok 4.6. Usó 300 millones de tokens de salida en las pruebas frente a 72 millones de Grok, situando su coste por tarea en 1,72 $. Su tokenizador genera alrededor de un 30% más de tokens que Sonnet 4.6 para el mismo texto. Eso complica comparar precios entre esas dos versiones de Sonnet. Además, Sonnet 5 no es el modelo tope de Anthropic.
Grok 4.6 vs Claude Opus 5 y Fable 5
Opus 5, a 5 $ de entrada y 25 $ de salida, encabeza el índice con 63. Fable 5, a 10 $ de entrada y 50 $ de salida, puntúa 62. La puntuación de Fable también requiere nota: Artificial Analysis registró respuestas de seguridad en algunos prompts difíciles, así que la puntuación refleja el modelo tal y como puede usarse, no una versión sin restricciones que Anthropic no ofrece.
En el benchmark AA-Briefcase de Artificial Analysis para tareas largas de agente, Grok 4.6 terminó en unos 53 turnos y usó 0,5 mil millones de tokens de entrada. Opus 5 necesitó unos 103 turnos y 2 mil millones de tokens. Esto no demuestra que Grok sea el modelo más fuerte en general. Muestra que Grok usó menos pasos y menos tokens de entrada en este conjunto de pruebas, mientras que Claude lideró en las otras pruebas tratadas arriba.
Precios de Grok 4.6
El umbral de 200.000 tokens en el prompt es lo que yo vigilaría: mueve todos los tokens de la solicitud al tramo superior. La tabla también incluye prioridad y cargos por herramientas.
|
Concepto |
Tarifa |
|
Tokens de entrada, con prompt < 200K |
2,00 $ / millón |
|
Entrada en caché, con prompt < 200K |
0,50 $ / millón |
|
Tokens de salida, con prompt < 200K |
6,00 $ / millón |
|
Entrada / caché / salida (prompt ≥ 200K) |
4,00 $ / 1,00 $ / 12,00 $ |
|
Procesamiento rápido o prioritario |
2× la tarifa estándar |
|
Búsqueda web, búsqueda en X, ejecución de código |
5 $ por 1.000 llamadas |
Los cargos por herramientas son independientes de los de tokens. Una solicitud que busque en la web y luego ejecute código puede incurrir en ambos antes de facturar el texto final. No existe un modelo aparte grok-4.6-fast. La API directa tiene una opción de prioridad que se factura al 2× cuando la respuesta confirma el uso prioritario. Cursor muestra una opción separada «Grok 4.6 (Fast)» con la misma tarifa 2×.

Grok 4.6 Fast seleccionado en Cursor. Imagen del autor.
¿Cómo puedo acceder a Grok 4.6?
Grok 4.6 está disponible de primera mano a través de:
- la API de SpaceXAI
- Cursor
- Grok Build
- Puertas de enlace de terceros (OpenRouter, Vercel, Cloudflare, Google Cloud Vertex AI)
- Otras herramientas de programación (GitHub Copilot, VS Code, JetBrains, Xcode y Eclipse)
El despliegue cubre los planes Pro, Pro+, Max, Business y Enterprise. En Business y Enterprise, las personas administradoras deben activar el modelo porque viene desactivado por defecto. Grok 4.6 no es compatible con la Batch API de SpaceXAI, así que no hay opción de lotes con descuento.
Un detalle empresarial queda fuera de la disponibilidad del modelo. Las respuestas son con estado por defecto, y SpaceXAI afirma que el historial se almacena durante 30 días. Con Zero Data Retention, los equipos no pueden usar cadenas de respuesta almacenadas ni completados diferidos; xAI señala en su lugar a razonamiento reproducible cifrado y WebSocket Responses. Cada respuesta incluye una cabecera que indica si ZDR estaba activo.
La semana de lanzamiento de Grok 4.6: modelos, Copilot y Cursor
Lo que más me llamó la atención esa semana fue lo rápido que se agruparon lanzamientos de modelos y acuerdos de distribución en torno a Grok 4.6.

La semana de lanzamiento de Grok 4.6, más allá de los benchmarks. Imagen del autor.
Grok Bot marcó el tono antes del lanzamiento del modelo. El agente en la nube en beta temprana se incluyó con SuperGrok Heavy por 300 $ al mes o con Cursor Ultra por 200 $ al mes en lugar de venderse por separado, vinculando el acceso a planes premium. Grok 4.6 llevó luego ese mismo enfoque en agentes a la API, Cursor y Grok Build.
El lanzamiento de Gemini 3.7 Flash de Google y la previsualización Ultrafast de GPT-5.6 Sol de OpenAI hicieron la semana más concurrida. A la vez, el despliegue de Copilot y la incorporación de Cursor a SpaceX ampliaron la distribución de Grok. Cursor remontó el proceso a su alianza con SpaceXAI a principios de ese año y enmarcó el movimiento en el acceso a las GPU de SpaceX más que en puntuaciones de modelos. Su publicación dice que ese acceso le ayudará a construir modelos a menor coste.
Mi lectura de esa semana es que SpaceXAI quiere Grok dentro de las herramientas que la gente ya usa. Grok 4.5 se entrenó conjuntamente con Cursor, y Grok 4.6 pasó a Copilot casi de inmediato. Eso convierte la distribución con partners en parte del lanzamiento, no en un añadido tardío.
¿Cuándo deberías usar Grok 4.6?
Grok 4.6 encaja en trabajos donde el precio de la API y las tareas largas de agente pesan más que la latencia del primer token. Encaja peor cuando las puntuaciones más altas de Sol en terminal o la ventana de contexto mayor de Sonnet 5 se ajustan mejor a la tarea.
Grok 4.6 es buena opción cuando:
- El precio de la API es la principal restricción. Mejora a Sol, Opus 5 y Fable 5 en precio de lista y coste por tarea
- El trabajo se ejecuta como tareas de agente largas y multietapa, donde su eficiencia por turnos (menos turnos y tokens de entrada que Opus 5 en AA-Briefcase) compensa
- La tarea es trabajo de conocimiento o razonamiento legal, donde lidera la tabla de benchmarks
- La latencia del primer token no importa. Un arranque lento es ruido en una ejecución larga, pero afecta a la experiencia en chat interactivo
Puede haber mejores alternativas cuando:
- El trabajo es programación intensiva en terminal → GPT-5.6 Sol (mejores puntuaciones en DeepSWE y Terminal-Bench)
- La tarea necesita una ventana de contexto grande → Claude Sonnet 5 (1M de contexto, sin recargo por prompt largo)
- Buscas la menor latencia para uso interactivo → Gemini 3.7 Flash
- Compras solo por inteligencia tope de gama → Opus 5 (63) o Fable 5 (62) encabezan el índice
Reflexiones finales sobre Grok 4.6
Grok 4.6 cae en un punto intermedio incómodo. Sube cinco puntos en el índice y se mantiene por debajo de Sol y Opus 5 en precios de lista, pero arranca más lento y cuesta más por tarea medida que Grok 4.5. «Mismo precio, mejor modelo» se deja fuera la mitad del lanzamiento.
Lo que aún quiero ver es una ejecución de varias horas donde la base de código, las herramientas y las instrucciones vayan cambiando. Cursor y GitHub Copilot ya ofrecen ese escenario. Si las tasas de corrección y fallo se mantienen bajas ahí, la afirmación de entrenamiento para agentes tendrá evidencia más allá de una prueba fija; si no, la ganancia de cinco puntos se queda en eso.
Para quienes crean sobre la API de xAI, nuestro tutorial de la API Grok 4 cubre el cliente de Python y el flujo de solicitudes.
Grok 4.6: preguntas frecuentes
¿Grok 4.6 sustituye a Grok 4.5?
No oficialmente. SpaceXAI no ha anunciado una fecha de retirada para Grok 4.5, y sigue listado tanto en la API como en Cursor. De momento no hay migración forzosa a 4.6.
¿Puedo autoalojar Grok 4.6?
No. Como se ha mencionado arriba, no hay pesos abiertos ni recuento de parámetros publicado, así que no hay nada que descargar y ejecutar en tu propio hardware. Todas las vías de acceso, incluida la API directa, pasan por la infraestructura de SpaceXAI o por un partner que la revende.
¿Cómo factura GitHub Copilot a Grok 4.6?
Copilot convierte el uso de Grok 4.6 en GitHub AI Credits al precio de lista del proveedor, con un céntimo igual a un crédito. Las autocompletaciones normales de código y las sugerencias del siguiente editado no se facturan en AI Credits. El uso del modelo en chat o tareas de agente sigue las normas de uso de Copilot.
¿Grok 4.6 está disponible en la UE?
Sí, pero procesado en EE. UU. Las personas usuarias de la UE pueden acceder a Grok 4.6 (la base compartida Grok 4.5 superó la Ley de IA de la UE y se abrió a la UE en julio, y 4.6 se distribuye en Cursor en toda la UE), pero no hay residencia de datos en la UE. La página del modelo de xAI solo lista us-east-1 y us-west-2, así que las solicitudes se ejecutan en EE. UU. Confírmalo por superficie (consola de la API, Cursor, gateways) antes de depender de ello.
¿Funciona Grok 4.6 con la residencia de datos en EE. UU. de Cursor?
Grok 4.6 ya está disponible en Cursor (tiene su propia página de modelo), pero la residencia de datos solo en EE. UU. es una función Enterprise que solo cubre modelos compatibles con algunas exclusiones. Así que confirma que 4.6 está en la lista actual de modelos compatibles de Cursor antes de depender de ello.
Soy ingeniero de datos y creador de comunidades. Trabajo con canalizaciones de datos, nube y herramientas de IA, al tiempo que escribo tutoriales prácticos y de gran impacto para DataCamp y programadores emergentes.



