Curso
TypeSafe salió del modo sigilo el 15 de septiembre de 2026 con Jev, un modelo que denomina de Sistema Uno: le envías el estado del programa y preguntas tipadas, y devuelve decisiones con probabilidades calibradas en lugar de texto. Doce días antes, OpenAI lanzó GPT-6 Astra, descrito como su modelo más inteligente y alineado, pensado para uso en ordenador, programación y trabajo profesional de extremo a extremo.
En este artículo, compararé Jev y GPT-6 Astra en fiabilidad del output, precisión de las decisiones, velocidad, alcance agentico y precios, y luego diré qué llamadas en una canalización de software corresponden a cada modelo.
Resumen
- Jev y Astra no compiten por la misma llamada: Jev es una función de decisión, Astra es un agente generalista.
- Jev devuelve respuestas garantizadas por esquema con puntuaciones de confianza, así que su output nunca necesita parseo ni validación.
- Astra lidera la mayoría de benchmarks publicados de razonamiento, código y uso del ordenador, y es la mitad de la respuesta de referencia con la que se evalúa Jev.
- Jev es dos órdenes de magnitud más barato y más rápido, a costa de unos puntos menos de precisión frente a los LLM de frontera.
- Elige Jev para clasificación de alto volumen, enrutado, scoring y pasos de guardarraíl.
- Elige Astra para tareas de varios pasos que terminan en texto, código o un documento finalizado.
- Jev sigue con lista de espera en el origen, con límites de tasa que TypeSafe dice que pueden cambiar sin previo aviso.
¿Qué es Jev?
Jev es un modelo de decisión alojado que TypeSafe AI lanzó en acceso anticipado en septiembre de 2026, el primero de lo que llama modelos de Sistema Uno.
Su propuesta de valor es que renuncia a generar texto: defines el espacio de respuesta por adelantado como preguntas de Choice, Score o Noul (sí/no), y devuelve valores tipados con probabilidades calibradas sobre las que el software puede ramificar directamente. Nuestra guía de Jev cubre el lanzamiento y las métricas de evaluación de TypeSafe.
¿Qué es GPT-6 Astra?
GPT-6 Astra es el buque insignia de OpenAI en la frontera, lanzado el 3 de septiembre de 2026 como sucesor de GPT-5.6 Sol.
Su posicionamiento es la ejecución autónoma: OpenAI lo presenta como el mejor modelo del mundo en uso de ordenador y el más alineado, entrenado para cumplimentar formularios, actualizar un CRM, crear y asegurar la calidad de un sitio web y producir documentos que sigan tus plantillas. Nuestra guía de GPT-6 Astra cubre el lanzamiento; nuestro tutorial del API de GPT-6 Astra crea un agente de comprobación de releases con herramientas asíncronas.
Jev vs GPT-6 Astra: comparación directa

Los dos modelos se sitúan en extremos opuestos de una misma compensación: Jev compra velocidad, precio y seguridad de tipos al negarse a generar texto, y Astra compra amplitud y profundidad generándolo todo. La mayoría de filas de abajo se derivan de esa única decisión de diseño.
| Función | Jev | GPT-6 Astra |
|---|---|---|
| Salida | Decisiones tipadas (Choice, Score, Noul) con probabilidades; sin texto | Texto generado; outputs estructurados y llamadas a funciones compatibles |
| Errores de tipo o de esquema | 0% por construcción | Posibles; 4,2% en el benchmark interno de alucinaciones de OpenAI |
| Entrada | Texto, objetos JSON, arrays; sin imágenes | Texto e imágenes |
| Ventana de contexto | No indicado en la documentación de TypeSafe; 32.000 tokens en los listados de OpenRouter y Vercel AI Gateway | 1.050.000 tokens; 128.000 de salida máxima |
| Latencia de extremo a extremo | 70 a 500 ms por llamada (según el proveedor) | Minutos en tareas de agente; unos 40 minutos por tarea de OSWorld 2.0 |
| Precisión de decisión | 67,8% de acuerdo con una referencia Astra + Fable 5.1 en la evaluación de 4 flujos de TypeSafe | Es la referencia; 96,0% en GPQA Diamond, 97,6% en FrontierMath Tier 4 |
| Agentes y herramientas | Ninguna; una decisión dentro de tu código | Uso de ordenador, shell alojado, búsqueda web, intérprete de código; 72,6% en OSWorld 2.0 |
| Confianza | Probabilidad calibrada en cada respuesta, más una puntuación de confianza derivada | No expuesta como campo |
| Precio por 1M de tokens | $0,042 entrada; salida gratis | $10 entrada; $50 salida |
| Disponibilidad | Acceso anticipado vía TypeSafe API, OpenRouter, Vercel AI Gateway | Niveles de pago de ChatGPT, OpenAI API, Azure, AWS Bedrock, GitHub Copilot, OpenRouter |
Contrato de salida: decisiones tipadas vs texto generado
Jev no puede producir un valor inválido, y Astra sí. Ese único hecho es la razón por la que acaban en capas distintas de un sistema en lugar de competir por el mismo hueco.
Una solicitud a Jev es un bloque de estado más un mapa de preguntas tipadas:
- Choice: devuelve la opción ganadora y una probabilidad para cada opción
- Score: devuelve un valor ponderado por probabilidad a través de tus niveles
- Noul: devuelve la probabilidad de que la respuesta sea sí.
El espacio de respuesta está fijado antes de la inferencia, así que la coincidencia de esquema está garantizada; TypeSafe sitúa su tasa de error en outputs estructurados y llamadas a herramientas en 0% y califica la cifra de no empírica.
Astra representa un LLM clásico y devuelve texto. Aunque admite outputs estructurados y llamadas a funciones, y reduce a aproximadamente un tercio la tasa de error de Sol en el benchmark interno de alucinaciones de OpenAI, la salida sigue teniendo que parsearse y validarse. El gráfico de TypeSafe sitúa el error de output estructurado de los LLM de frontera entre 0,58% y 45,5%; la cifra propia de Astra no está publicada, así que no asumiría que está en el extremo bajo.
El coste de la garantía de Jev es que no obtienes razonamiento, solo una probabilidad: perfecto para una capa de enrutado, no para una revisión de cumplimiento, así que planifica escalar los casos de baja confianza a un modelo que pueda escribir.
Dos advertencias sobre las cifras de fiabilidad:
- Las tasas de error de LLM de TypeSafe provienen de tráfico de OpenRouter, que puede enrutar consultas más difíciles a modelos más potentes.
- El benchmark de alucinación de OpenAI es interno y mide algo diferente a la validez de esquema.
Para outputs que deben parsear a la primera, gana el contrato de Jev; para cualquier cosa que vaya a leer una persona, solo Astra puede responder.
Precisión de decisión y profundidad de razonamiento
Astra es más preciso. En los cuatro flujos en producción de TypeSafe (respuesta a incidentes, observabilidad de trazas de agentes, procesamiento de facturas, atención al cliente), Jev coincide con la media de Astra y Claude Fable 5.1 el 67,8% de las veces, empatado con GPT-5.6 Terra y a 5 o 6 puntos de GPT-5.6 Sol y Claude Opus 5.
Astra es la referencia ahí, por lo que no tiene una puntuación de acuerdo propia. En sus propios benchmarks, satura FrontierMath Tier 4, GPQA Diamond y ARC-AGI-3, aunque el último depende de un arnés con estado. Jev no razona a través de turnos, no planifica ni explica, y evaluarlo por acuerdo con LLMs en lugar de contra verdad de terreno, como hace TypeSafe, corre el riesgo de heredar sesgos de los modelos de referencia.
Si necesitas la máxima precisión en una decisión de bajo volumen, el LLM sigue ganando.
Velocidad y latencia
Jev responde en 70 a 500 milisegundos de extremo a extremo, según las mediciones de TypeSafe, frente a 3 a 329 segundos para LLMs de frontera en el mismo tipo de consulta. Muestrea todas las respuestas en paralelo en lugar de token a token y admite hasta 255 opciones por Choice.
Astra es rápido para lo que es: alrededor de un 47% menos de tiempo por tarea de OSWorld 2.0 que Sol, y el modo Fast ofrece hasta 2 veces más velocidad a 2 veces el precio. Aun así, esas tareas tardan decenas de minutos. El bot de Doom de un ingeniero de TypeSafe ejecuta 10 consultas por segundo por unos $7 la hora, un presupuesto al que ningún LLM de frontera puede acercarse.
Para una ruta de decisión con un presupuesto de 100 ms, aquí el único candidato es Jev.
Alcance: agentes, herramientas y uso del ordenador
Astra hace todo lo que Jev no hace:
- Llega al 72,6% en OSWorld 2.0, 59,3% en Agents' Last Exam y 57,9% en Terminal-Bench 4.0.
- En la Responses API, puede ejecutar un shell alojado, buscar en la web, aplicar parches y operar un ordenador.
- En Codex, mantiene notas buscables entre ventanas de contexto, y su contexto largo logra un 96,3% en la prueba de recuperación MRCR de OpenAI en el rango 512K-1M.
Jev acepta texto, JSON o arrays de texto, no imágenes, y no invoca herramientas. Es el if difuso dentro de un flujo de trabajo que tu código controla: clasificar, enrutar, puntuar, extraer o verificar el output de otro modelo, incluido detectar jailbreaks en prompts de LLM.
Astra gana esta dimensión de forma clara porque Jev ni compite en ella.
Precios: lo que realmente pagas

Astra cuesta varios cientos de veces más que Jev en cualquier forma de carga, y la brecha se amplía cuanto más output genera la tarea, porque Jev no factura salida.
Tarifas por token, lado a lado
| Tarifa | Jev | GPT-6 Astra |
|---|---|---|
| Entrada, por 1M de tokens | $0,042 | $10,00 |
| Salida, por 1M de tokens | Gratis | $50,00 |
| Lectura de entrada en caché, por 1M | No publicado | $1,00 |
| Escritura en caché, por 1M | No publicado | $12,50 |
| Descuento por lotes | No publicado | 50% (Batch y Flex) |
| Recargo por contexto largo | No publicado | 2x en entrada y caché, 1,5x en salida, por encima de 272K tokens de entrada |
| Modo Fast | No aplicable | 2x las tarifas aplicables |
| Plan de consumo | No aplicable; solo API | ChatGPT Plus, Pro, Business, Enterprise (Astra Pro en Pro y superiores) |
La forma de la diferencia importa tanto como el tamaño. La tarifa de salida de Astra es 5 veces su tarifa de entrada, y sus tokens de razonamiento se facturan como salida, así que el trabajo con mucho pensamiento o muy prolijo es donde la factura crece más rápido. Jev solo factura la entrada, y una respuesta típica son unas decenas de tokens de salida, así que su coste depende de cuánto estado envías y nada más.
TypeSafe admite que no puede demostrar que el precio no esté subvencionado y espera que baje antes que suba.
Lo que cuesta una carga real
| Carga | Jev | GPT-6 Astra | Diferencia |
|---|---|---|---|
| Asistente equilibrado: 1M in / 250K out | $0,04 | $22,50 | $22,46; Jev un 99,8% más barato |
| Generación intensiva: 1M in / 4M out | $0,04 | $210 | $209,96; Jev un 99,98% más barato |
| Recuperación, bajo umbral: 10M in / 1M out | $0,42 | $150 | $149,58; Jev un 99,7% más barato |
La fórmula es (volumen ÷ 1M) × tarifa, sumada entre entrada y salida, a tarifas estándar. La fila de generación intensiva es la atípica porque la salida de Jev es gratis, aunque también es la menos realista para Jev: el modelo nunca emite 4M tokens de salida, así que léela como el efecto del premium de salida en Astra. La fila de recuperación es la que encaja con el uso real de Jev: mucho estado de entrada y un puñado de probabilidades de salida, y aun así hay 357x de diferencia.
No hay fila de recuperación sobre umbral porque la documentación de TypeSafe no indica recargo por contexto largo, y la ventana de contexto que listan los routers para Jev está muy por debajo del umbral de Astra, así que los multiplicadores de 2x en entrada y 1,5x en salida de Astra no tienen con qué compararse. Ningún proveedor ha publicado conteos de tokens para una carga compartida, y el tokenizador de Jev no está documentado, así que trata estos totales como una comparación de tarifas, no como una factura.
Cuándo elegir Jev vs GPT-6 Astra

La bifurcación no va de precisión o precio por sí solos, sino de si el paso termina en una decisión o en un artefacto. Una decisión pertenece a Jev; cualquier cosa que alguien vaya a leer, ejecutar o abrir pertenece a Astra.
Elige Jev si...
- Estás tomando la misma decisión acotada miles de veces al día. Enrutado de tickets, clasificación de facturas, moderación, detección de intención y lead scoring son las formas para las que TypeSafe lo diseñó, y el coste por caso es una fracción de céntimo.
- La llamada está en una ruta con presupuesto de latencia. Las respuestas sub-segundo te permiten meter una decisión de modelo dentro de la carga de una página o el bucle de un juego, donde incluso una llamada LLM rápida sería un cuello de botella.
- Necesitas que el modelo te diga cuando no lo sabe. Cada respuesta de Choice y Score lleva una puntuación de confianza, de modo que tu código puede actuar automáticamente por encima de un umbral, confirmar en la zona media y escalar por debajo, con un umbral más estricto para acciones destructivas que para las de solo lectura.
- Estás comprobando el trabajo de otro modelo. Puntuar, juzgar o poner guardarraíles a prompts y salidas de LLM es una decisión, no una generación, y la garantía de esquema de Jev significa que el verificador no puede romper la canalización.
Elige GPT-6 Astra si...
- La tarea es un trabajo de varios pasos, no un único juicio. Rellenar formularios, actualizar un CRM, investigar y redactar, o instalar y probar software son justo los objetivos del entrenamiento en uso de ordenador de Astra.
- La salida es texto, código o un documento. Jev no puede escribir una respuesta, un parche o una diapositiva; Astra es el mejor modelo de OpenAI para producir artefactos que sigan tus plantillas.
- Necesitas una justificación. Decisiones reguladas, explicaciones de cara al cliente y cualquier cosa que vaya a leer un auditor necesitan palabras, y Astra también puede ser el destino de escalado para los casos de baja confianza de Jev.
- Tu contexto es grande. La ventana de 1.050.000 tokens de Astra, con recuperación fiable cerca del tope, encaja con canalizaciones cargadas de documentos; los routers listan a Jev en 32.000 tokens.
Cómo empezar con Jev y GPT-6 Astra
El alcance es la dimensión más desequilibrada de este artículo: Astra está en todos los sitios habituales de los modelos de OpenAI, y Jev es una API con lista de espera cuyas únicas rutas sin invitación son los listados de OpenRouter y Vercel AI Gateway.
| Superficie | Jev | GPT-6 Astra |
|---|---|---|
| App de consumo | Ninguna; solo consola para desarrolladores | ChatGPT Plus, Pro, Business y Enterprise; desactivado por defecto para workspaces Enterprise en el lanzamiento |
| API de primera parte | TypeSafe API, acceso anticipado solo por lista de espera; sin alta autoservicio | OpenAI API (Responses y Chat Completions), despliegue progresivo tras el lanzamiento |
| Plataformas cloud | Ninguna | Microsoft Azure AI Foundry, AWS Bedrock (us.openai.gpt-6-astra) |
| Agentes de código | No aplicable; no produce texto ni llamadas a herramientas | Codex, GitHub Copilot; no aparece en la documentación de Cursor a 21 de septiembre de 2026 |
| Routers de terceros | OpenRouter (typesafe/jev-1.13, vía un endpoint systemone dedicado), Vercel AI Gateway (typesafe-ai/jev) |
OpenRouter (openai/gpt-6-astra) |
| ID de modelo en la API | jev-latest (alias de jev-1.13.0) |
gpt-6-astra |
Los IDs de modelo son jev-latest, que es el valor por defecto en los SDK de TypeSafe y que actualmente resuelve a jev-1.13.0, y gpt-6-astra. TypeSafe recomienda fijar la versión si tienes umbrales de confianza ajustados, porque el alias cambia cuando sale una nueva versión. Los límites de tasa de Jev son 250.000 tokens por segundo y 1.200 solicitudes por minuto, y TypeSafe indica que ambos pueden cambiar sin aviso mientras escala.
Hacer tu primera llamada a la API
No son intercambiables con una sola cadena. Astra recibe un prompt y devuelve texto a través de la Responses API; Jev recibe estado y un mapa de preguntas tipadas en un único endpoint y devuelve probabilidades. Los dos bloques de abajo hacen la misma solicitud de devoluciones a cada modelo para que veas la diferencia de forma.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-astra",
input="A bike-shop customer writes: 'The frame arrived scratched, I want this "
"sorted before my race on Sunday.' Resolve as refund, replacement, or repair.",
)
print(response.output_text) # free text you still have to parse
import requests
response = requests.post(
"https://api.typesafe.ai/v1/systemone",
headers={"Authorization": "Bearer YOUR_TYPESAFE_KEY"},
json={
"model": "jev-latest",
"state": "The frame arrived scratched, I want this sorted before my race on Sunday.",
"questions": {
"resolution": {
"type": "choice",
"instructions": "How should the shop resolve this return?",
"criteria": {"refund": "Customer wants money back",
"replacement": "Same item, undamaged, shipped fast",
"repair": "Cosmetic fix is acceptable"},
}
},
},
)
answer = response.json()["answers"]["resolution"]
print(answer["choice"], answer["confidence"]) # typed option plus 0-1 confidence
Para la configuración completa de Astra, incluidas herramientas asíncronas y control a mitad de turno, sigue nuestro tutorial del API de GPT-6 Astra; para JSON estructurado con modelos de OpenAI, consulta nuestro tutorial de outputs estructurados.
Reflexiones finales
Si el paso termina en una decisión sobre la que actúa tu código, usa Jev; si termina en algo que una persona lee o ejecuta, usa GPT-6 Astra. La arquitectura que sugiere este lanzamiento combina ambos: Jev como ruteador barato y calibrado delante, y Astra como especialista al que se escala cuando cae la confianza.
Lo más revelador para mí es que TypeSafe califique Jev contra las respuestas de Astra. OpenAI está diciendo que la frontera es la ejecución autónoma; TypeSafe apuesta a que la mayoría de lo que el software pregunta a un modelo es una pregunta acotada disfrazada. La incógnita para Jev es si un benchmark independiente confirma la paridad y si el precio sobrevive a la subvención.
Para construir la capa de decisión en la que se apoya cualquiera de los dos modelos, te recomiendo nuestro curso Developing AI Systems with the OpenAI API y nuestro itinerario AI Agent Fundamentals.
Preguntas frecuentes
¿Cuándo debería usar Jev en lugar de GPT-6 Astra?
Usa Jev cuando un paso termine en una decisión acotada sobre la que actúa tu código: clasificar, enrutar, puntuar, extraer o filtrar a volumen, especialmente en una ruta con presupuesto de latencia. Jev devuelve respuestas tipadas con probabilidades calibradas en 70 a 500 milisegundos y solo factura tokens de entrada. Usa GPT-6 Astra cuando el paso termine en texto, código, un documento o una tarea de varios pasos que necesite herramientas o uso del ordenador.
¿Puedo usar Jev y GPT-6 Astra juntos?
Sí, y ese es el patrón que señalan los materiales de ambos proveedores. Jev se coloca delante como capa de decisión barata y rápida, y cada respuesta de Choice y Score lleva una puntuación de confianza sobre la que tu código puede fijar umbrales. Los casos que queden por debajo del umbral, o que necesiten una justificación por escrito, escalan a GPT-6 Astra, que puede razonar, explicar y actuar con herramientas.
¿Cuánto cuestan Jev y GPT-6 Astra por millón de tokens?
Jev cuesta $0,042 por millón de tokens de entrada y los tokens de salida son gratis. GPT-6 Astra cuesta $10 por millón de tokens de entrada y $50 por millón de tokens de salida a tarifas estándar, con lectura de caché a $1, escrituras de caché a $12,50, un 50% de descuento en Batch y Flex, y tarifas de 2x en entrada y 1,5x en salida para solicitudes por encima de 272K tokens de entrada. En una carga mensual equilibrada de 1M de entrada y 250K de salida son unos $0,04 para Jev frente a $22,50 para Astra.
¿Cuáles son los IDs de modelo en la API para Jev y GPT-6 Astra?
Jev se invoca mediante POST https://api.typesafe.ai/v1/systemone con el alias de modelo jev-latest, que actualmente resuelve al ID versionado jev-1.13.0. GPT-6 Astra es gpt-6-astra en la OpenAI API, y también figura en OpenRouter como openai/gpt-6-astra y en AWS Bedrock como us.openai.gpt-6-astra.
¿Qué precisión tiene Jev frente a LLMs de frontera como GPT-6 Astra?
En la evaluación de cuatro flujos de TypeSafe, Jev coincide con la respuesta media de GPT-6 Astra y Claude Fable 5.1 el 67,8% de las veces, aproximadamente empatado con GPT-5.6 Terra y a 5-6 puntos de GPT-5.6 Sol y Claude Opus 5. Astra es la referencia en esa prueba, no un participante puntuado. No se había publicado ningún benchmark independiente de Jev en septiembre de 2026, así que trata las cifras como reportadas por el proveedor.
Editor de ciencia de datos en DataCamp | Me encanta hacer previsiones y crear con API.
