Courses
TypeSafe 于 2026 年 9 月 15 日正式发布 Jev,这是一款其称之为 System One 的模型:您向它发送程序状态和带类型的问题,它返回带有校准概率的决策而非文本。早于 12 天,OpenAI 推出了 GPT-6 Astra,被描述为其最智能、最对齐的模型,面向计算机使用、编码与端到端的专业工作。
本文将从输出可靠性、决策准确性、速度、智能体能力范围和定价等方面对 Jev 和 GPT-6 Astra 进行比较,并给出在软件流水线中各类调用应归属哪一模型。
要点速览
- Jev 与 Astra 不竞争同一调用场景:Jev 是决策函数,Astra 是通用型智能体。
- Jev 返回具备架构保证的答案与置信度,因此其输出无需解析或校验。
- Astra 在多数已公布的推理、编码与计算机使用基准上领先,且是 Jev 对比评分所用参考答案的一半来源。
- Jev 在价格与速度上快便两个数量级,代价是相较前沿 LLM 略损数个百分点的准确率。
- 高频分类、路由、打分与安全护栏步骤首选 Jev。
- 以文本、代码或成品文档收尾的多步任务首选 Astra。
- Jev 目前仍需等候名单,且 TypeSafe 表示速率限制可能随时调整。
什么是 Jev?
Jev 是 TypeSafe AI 于 2026 年 9 月以抢先体验发布的托管决策模型,也是其首个 System One 模型。
其卖点在于放弃文本生成:您预先将答案空间定义为 Choice、Score 或 Noul(是/否)问题,它返回可直接在软件中分支的带类型值与校准概率。我们的 Jev 指南涵盖了发布概况与 TypeSafe 的评测结论。
什么是 GPT-6 Astra?
GPT-6 Astra 是 OpenAI 的前沿旗舰,于 2026 年 9 月 3 日发布,是 GPT-5.6 Sol 的继任者。
其定位是自主执行:OpenAI 称其为全球最佳的计算机使用模型,也是其对齐度最高的模型,训练目标包括填写表单、更新 CRM、搭建与质检网站,以及按您的模板生成文档。我们的 GPT-6 Astra 指南介绍了发布内容;我们的 GPT-6 Astra API 教程用异步工具构建了一个发布检查智能体。
Jev vs GPT-6 Astra:正面对比

两者分处一项权衡的两端:Jev 通过拒绝生成文本来换取速度、价格与类型安全;Astra 通过生成一切来换取广度与深度。下方多数差异均源于这一单一设计选择。
| 特性 | Jev | GPT-6 Astra |
|---|---|---|
| 输出 | 带概率的带类型决策(Choice、Score、Noul);不生成文本 | 生成文本;支持结构化输出与函数调用 |
| 类型或架构错误 | 按构造为 0% | 可能发生;在 OpenAI 内部幻觉基准上为 4.2% |
| 输入 | 文本、JSON 对象、数组;不支持图像 | 文本与图像 |
| 上下文窗口 | TypeSafe 文档未说明;OpenRouter 与 Vercel AI Gateway 标注为 32,000 tokens | 1,050,000 tokens;最大输出 128,000 |
| 端到端时延 | 每次调用 70–500 毫秒(厂商报告) | 智能体任务为数分钟;每个 OSWorld 2.0 任务约 40 分钟 |
| 决策准确性 | 在 TypeSafe 的 4 流程评测上与 Astra + Fable 5.1 参考平均值一致率为 67.8% | 为参考本身;GPQA Diamond 96.0%,FrontierMath Tier 4 为 97.6% |
| 智能体与工具 | 无;作为您代码中的一个决策 | 计算机使用、托管 shell、网页搜索、代码解释器;OSWorld 2.0 得分 72.6% |
| 置信度 | 每个答案提供校准概率与派生置信分数 | 未作为字段暴露 |
| 每 100 万 tokens 价格 | $0.042 输入;输出免费 | $10 输入;$50 输出 |
| 可用性 | 通过 TypeSafe API、OpenRouter、Vercel AI Gateway 的抢先体验 | ChatGPT 付费层、OpenAI API、Azure、AWS Bedrock、GitHub Copilot、OpenRouter |
输出契约:带类型决策 vs 生成文本
Jev 不会产生无效值,而 Astra 可能。这一事实决定了两者更适合处于系统的不同层,而非同一位置互相替代。
一次 Jev 请求由一块状态加上一组带类型的问题构成:
- Choice:返回胜出选项,并为每个选项给出概率
- Score:在您的分档间返回加权概率得分
- Noul:返回答案为“是”的概率。
答案空间在推理前已固定,因而保证契合架构;TypeSafe 将其结构化输出与工具调用的错误率标为 0%,并称该数字为非实证。
Astra 是经典 LLM,返回文本。尽管其支持结构化输出与函数调用,并将 Sol 在 OpenAI 内部幻觉基准上的错误率降至约三分之一,但输出仍需解析与校验。TypeSafe 的图表显示前沿 LLM 的结构化输出错误率介于 0.58% 与 45.5% 之间;Astra 自身的数字未公开,因此不应假设其位于低端。
Jev 的保证代价是不给出理由,只有概率:这对路由层很好,但不适用于合规复核,因此应计划将低置信度案例上拨给能写作的模型。
关于可靠性数据有两点注意:
- TypeSafe 的 LLM 错误率来自 OpenRouter 流量,其可能会将更难的问题路由给更强的模型。
- OpenAI 的幻觉基准是内部指标,衡量的并非架构有效性。
对于必须一次解析成功的输出,Jev 的契约胜出;凡是供人阅读的内容,只有 Astra 能回答。
决策准确性与推理深度
Astra 更为准确。在 TypeSafe 的四个生产工作流(事件响应、智能体追踪可观测性、发票处理、客户服务)上,Jev 与 Astra 和 Claude Fable 5.1 的平均值一致率为 67.8%,与 GPT-5.6 Terra 持平,落后 GPT-5.6 Sol 与 Claude Opus 5 5–6 个百分点。
Astra 在该测试中为参考模型,因而没有自身一致率数据。在其自有基准上,它在 FrontierMath Tier 4、GPQA Diamond 与 ARC-AGI-3 上接近饱和,尽管最后一项依赖有状态的测试框架。Jev 不进行跨轮推理、规划或解释,且如 TypeSafe 所做,以与 LLM 的一致性而非与真值对比来评分,存在继承参考模型偏差的风险。
若您需要在低频决策上追求峰值准确率,仍应选择 LLM。
速度与时延
按 TypeSafe 的测量,Jev 端到端响应为 70–500 毫秒;对于同类查询,前沿 LLM 为 3–329 秒。它并行采样所有答案,而非逐 token 生成,并支持每次 Choice 最多 255 个选项。
Astra 在其定位中已算快速:每个 OSWorld 2.0 任务耗时比 Sol 少约 47%,Fast 模式可在价格翻倍的情况下将速度最高提升 2 倍。但这些任务仍需几十分钟。一位 TypeSafe 工程师的 Doom 机器人每秒可跑 10 次查询,约每小时 $7,前沿 LLM 难以匹配该预算。
对于 100 毫秒预算的决策请求路径,此处只有 Jev 合格。
能力范围:智能体、工具与计算机使用
Astra 覆盖了 Jev 不做的一切:
- 在 OSWorld 2.0 上达 72.6%,Agents' Last Exam 为 59.3%,Terminal-Bench 4.0 为 57.9%。
- 在 Responses API 中,可运行托管 shell、搜索网页、打补丁并操作计算机。
- 在 Codex 中,可在多个上下文窗口间保留可检索笔记;其长上下文在 512K–1M 区间的 OpenAI MRCR 检索测试中得分 96.3%。
Jev 接受文本、JSON 或文本数组,不支持图像,也不调用工具。它是您工作流中由代码掌控的模糊 if 语句:分类、路由、打分、抽取,或校验另一模型的输出,包括对 LLM 提示的越狱检测。
在此维度上 Astra 直接取胜,因为 Jev 并未参赛。
定价:您实际支付的费用

在任何工作负载形态下,Astra 的成本都比 Jev 高出数百倍,且任务输出越多差距越大,因为 Jev 不对输出计费。
Token 费率并列
| 费率 | Jev | GPT-6 Astra |
|---|---|---|
| 输入,每 100 万 tokens | $0.042 | $10.00 |
| 输出,每 100 万 tokens | 免费 | $50.00 |
| 缓存输入读取,每 100 万 tokens | 未公布 | $1.00 |
| 缓存写入,每 100 万 tokens | 未公布 | $12.50 |
| 批处理折扣 | 未公布 | 50%(Batch 与 Flex) |
| 长上下文附加费 | 未公布 | 输入与缓存 2 倍、输出 1.5 倍,适用于超过 272K 输入 tokens |
| 快速模式 | 不适用 | 适用费率的 2 倍 |
| 消费者层 | 不适用;仅 API | ChatGPT Plus、Pro、Business、Enterprise(Astra Pro 在 Pro 及以上开放) |
差异的形状与规模同等重要。Astra 的输出费率是输入的 5 倍,且推理 tokens 计入输出,因此思考密集或冗长的工作将最易推高账单。Jev 仅对输入计费,而其典型答案只有几十个输出 tokens,故成本仅与您传入的状态量相关。
TypeSafe 坦言无法证明其定价未被补贴,并预期价格将下降而非上升。
真实工作负载的成本
| 工作负载 | Jev | GPT-6 Astra | 差额 |
|---|---|---|---|
| 均衡助手:100 万入 / 25 万出 | $0.04 | $22.50 | $22.46,Jev 便宜 99.8% |
| 生成密集:100 万入 / 400 万出 | $0.04 | $210 | $209.96,Jev 便宜 99.98% |
| 检索,低于阈值:1000 万入 / 100 万出 | $0.42 | $150 | $149.58,Jev 便宜 99.7% |
计算公式为(体量 ÷ 100 万)× 费率,在标准费率下对输入与输出求和。生成密集一行是离群值,因为 Jev 输出免费,同时这对 Jev 也最不现实:该模型从不产出 400 万输出 tokens,因此可理解为仅输出溢价对 Astra 带来的影响。检索一行更贴近 Jev 的实际用法:大量状态输入与少量概率输出,差距仍达 357 倍。
没有超阈值检索一行,因为 TypeSafe 文档未说明长上下文附加费,而路由商为 Jev 标注的上下文窗口远低于 Astra 的阈值,因此 Astra 的输入 2 倍与输出 1.5 倍附加无法对比。两家厂商均未公布共享工作负载的 token 统计,且 Jev 的分词器未文档化,因此将上述总额视为费率对比而非实际账单。
何时选择 Jev 或 GPT-6 Astra

分野不在于各自能否独立做到“准”或“省”,而在于该步骤的终点是一个决策还是一个成果。以决策为终点的交给 Jev;凡是需要被阅读、运行或打开的成果,交给 Astra。
在以下情况下选择 Jev...
- 您每天要重复做同一个有边界的决策成千上万次。工单路由、发票分类、内容审核、意图检测与线索打分正是 TypeSafe 的目标场景,单次成本低至几分之一美分。
- 该调用位于有时延预算的请求路径上。亚秒级响应可将模型决策嵌入页面加载或游戏循环中,而即便快速的 LLM 调用也会成为瓶颈。
- 您需要模型在“不了解”时如实告知。每个 Choice 与 Score 答案都带置信分数,您的代码可在高于某阈值时自动执行、中间区间时确认、低于阈值时升级处理,并对破坏性操作设置更严格阈值、对只读操作设置相对宽松阈值。
- 您在检查另一模型的结果。对 LLM 提示与输出进行打分、评判或设防属于“决策”而非“生成”,且 Jev 的架构保证意味着检查器本身不会破坏流水线。
在以下情况下选择 GPT-6 Astra...
- 该任务是多步骤工作,而非单一判断。填写表单、更新 CRM、研究并起草、安装与测试软件,正是 Astra 的计算机使用训练所面向的任务。
- 输出是文本、代码或文档。Jev 无法撰写回复、补丁或幻灯片;Astra 是 OpenAI 最擅长按您模板产出成果的模型。
- 您需要理由说明。受监管的决策、面向客户的解释、以及供审计阅读的内容都需要文字;Astra 也可作为 Jev 低置信度案例的升级目标。
- 您的上下文很大。Astra 的 1,050,000-token 窗口并在高窗口段保持可靠检索,适用于文档密集型流水线;路由商为 Jev 标注为 32,000 tokens。
如何开始使用 Jev 与 GPT-6 Astra
覆盖面是本文最不对称的维度:Astra 几乎在 OpenAI 模型常见的所有渠道可用,而 Jev 是一个受等候名单限制的 API,未获邀请的唯一通路是 OpenRouter 与 Vercel AI Gateway 的上架。
| 渠道 | Jev | GPT-6 Astra |
|---|---|---|
| 消费者应用 | 无;仅开发者控制台 | ChatGPT Plus、Pro、Business 与 Enterprise;发布时对 Enterprise 工作区默认关闭 |
| 一方 API | TypeSafe API,需等候名单抢先体验;不支持自助注册 | OpenAI API(Responses 与 Chat Completions),发布后数日内逐步开放 |
| 云平台 | 无 | Microsoft Azure AI Foundry、AWS Bedrock(us.openai.gpt-6-astra) |
| 编码智能体 | 不适用;不产出文本或工具调用 | Codex、GitHub Copilot;截至 2026 年 9 月 21 日未在 Cursor 文档中列出 |
| 第三方路由 | OpenRouter(typesafe/jev-1.13,经专用 systemone 端点),Vercel AI Gateway(typesafe-ai/jev) |
OpenRouter(openai/gpt-6-astra) |
| API 模型 ID | jev-latest(jev-1.13.0 的别名) |
gpt-6-astra |
模型 ID 分别为 jev-latest(TypeSafe SDK 的默认值,目前解析到 jev-1.13.0)与 gpt-6-astra。若您对置信阈值进行了调优,TypeSafe 建议固定到带版本的 ID,因为别名会随新版本发布而更新。Jev 的速率限制为每秒 250,000 tokens、每分钟 1,200 次请求;TypeSafe 表示在扩容期间两者均可能不经通知而变更。
发起您的第一次 API 调用
这二者并非“一键替换”。Astra 通过 Responses API 接收提示并返回文本;Jev 通过单一端点接收状态与带类型的问题映射并返回概率。下方两段代码将相同的退货请求分别提交给两种模型,便于您比较其返回结构差异。
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-astra",
input="A bike-shop customer writes: 'The frame arrived scratched, I want this "
"sorted before my race on Sunday.' Resolve as refund, replacement, or repair.",
)
print(response.output_text) # free text you still have to parse
import requests
response = requests.post(
"https://api.typesafe.ai/v1/systemone",
headers={"Authorization": "Bearer YOUR_TYPESAFE_KEY"},
json={
"model": "jev-latest",
"state": "The frame arrived scratched, I want this sorted before my race on Sunday.",
"questions": {
"resolution": {
"type": "choice",
"instructions": "How should the shop resolve this return?",
"criteria": {"refund": "Customer wants money back",
"replacement": "Same item, undamaged, shipped fast",
"repair": "Cosmetic fix is acceptable"},
}
},
},
)
answer = response.json()["answers"]["resolution"]
print(answer["choice"], answer["confidence"]) # typed option plus 0-1 confidence
关于完整的 Astra 设置(含异步工具与中途引导),请参阅我们的 GPT-6 Astra API 教程;若需从 OpenAI 模型获取结构化 JSON,请参阅我们的 结构化输出教程。
结语
如果步骤以您的代码要据此行动的“决策”收尾,用 Jev;如果以供人阅读或运行的“成果”收尾,用 GPT-6 Astra。本次发布所提示的架构是二者兼用:前端用 Jev 作为廉价、校准的路由器,置信度下降时再将其升级给 Astra 这位专家。
最耐人寻味的是 TypeSafe 用 Astra 的答案来给 Jev 打分。OpenAI 在宣告前沿方向是自主执行;TypeSafe 则押注于多数软件向模型发问其实都是伪装的有边界问题。Jev 的开放问题在于,是否有独立基准能证实其对比表现,以及其定价能否在补贴退场后维持。
若要搭建承载两种模型的决策层,推荐我们的 Developing AI Systems with the OpenAI API 课程与 AI Agent Fundamentals 学习路径。
常见问题
我应何时使用 Jev 而不是 GPT-6 Astra?
当某一步以您的代码要据此行动的有边界“决策”收尾时使用 Jev:进行分类、路由、打分、抽取或大规模门控,尤其适用于有时延预算的请求路径。Jev 以 70–500 毫秒返回带类型答案与校准概率,且只按输入 tokens 计费。若该步骤以文本、代码、文档收尾,或是需要工具与计算机使用的多步任务,则使用 GPT-6 Astra。
我可以将 Jev 与 GPT-6 Astra 搭配使用吗?
可以,这也是两家厂商材料中共同推荐的模式。Jev 作为廉价、快速的前置决策层,每个 Choice 与 Score 答案都带置信分数,您的代码可据此设定阈值。低于阈值的案例,或需要书面理由的情况,再升级给 GPT-6 Astra,由其进行推理、解释并调用工具执行。
Jev 与 GPT-6 Astra 每百万 tokens 要多少钱?
Jev 的价格为每百万输入 tokens $0.042,输出免费。GPT-6 Astra 的标准价格为每百万输入 tokens $10、输出 tokens $50,并提供每百万 tokens 缓存读取 $1、缓存写入 $12.50、Batch 与 Flex 50% 折扣,以及对超过 272K 输入 tokens 的请求施加输入与缓存 2 倍、输出 1.5 倍的费率。对于每月 100 万入、25 万出且较为均衡的工作负载,Jev 约 $0.04,Astra 约 $22.50。
Jev 与 GPT-6 Astra 的 API 模型 ID 是什么?
Jev 通过 POST https://api.typesafe.ai/v1/systemone 调用,模型别名为 jev-latest,当前解析为版本化 ID jev-1.13.0。GPT-6 Astra 在 OpenAI API 中的 ID 为 gpt-6-astra,并在 OpenRouter 上列为 openai/gpt-6-astra,在 AWS Bedrock 上列为 us.openai.gpt-6-astra。
Jev 与 GPT-6 Astra 等前沿 LLM 相比有多准确?
在 TypeSafe 自身的四流程评测中,Jev 与 GPT-6 Astra 和 Claude Fable 5.1 的平均答案一致率为 67.8%,大致与 GPT-5.6 Terra 持平,落后 GPT-5.6 Sol 与 Claude Opus 5 5–6 个百分点。Astra 在该测试中为参考而非被评分对象。截至 2026 年 9 月,尚无 Jev 的独立基准发布,因此请将这些数字视为厂商提供的数据。