Codex 与用量 · 发布于 2026-09-04 · 更新于 2026-09-04

GPT-6 Astra 正式发布:Plus / Pro 谁能用,为什么还看不到?

GPT-6 Astra 已于 2026 年 9 月 3 日公布。OpenAI 当前写明:首批面向 Trusted Access 企业推出,API 以及 Plus、Pro、Business、Enterprise 的访问会在随后几天开放。因此,发布次日暂时看不到模型,首先应理解为分批推出,而不是直接判定账号或订阅故障。

先看结论

首批开放Trusted Access 企业其他入口在随后几天分批开放
Plus / Pro官方已确认将提供访问具体出现时间受灰度与产品入口影响
OpenAI API模型 ID:gpt-6-astraAPI 账单与 ChatGPT 会员分开
长上下文1,050,000 token输入超过 272K 后整次请求进入更高费率

先抓住 Astra 的 4 个核心变化

  1. 面向端到端复杂任务

    官方将 Astra 定位为处理复杂推理、编程、电脑操作、研究与文档创建的高能力模型。判断价值时,应看完整任务成功率、返工和人工介入,而不只看一道题的跑分。

  2. 异步工具调用

    应用执行一个工具时,模型可以继续推理、调用其他工具或回答互不依赖的部分;应用仍负责执行工具,并用原 call_id 返回结果。

  3. 任务执行中可以纠偏

    通过 WebSocket 使用 Responses API 时,可以在模型工作中补充限制或改变要求,保留已经完成的工作后继续,而不是从头重跑整个任务。

  4. 推理强度可以动态调整

    configuration_update 可以在同一对话里调整 reasoning effort,并尽量保留提示词缓存。Astra 支持 low、medium、high、xhigh、max,不支持 none。

为什么有人已经能用,有人模型列表里还没有

官方模型页的原文口径很明确:Astra 首先向 Trusted Access 企业推出,API 以及 Plus、Pro、Business、Enterprise 计划的访问将在随后几天开放。这里的关键字是“随后几天”,不是同一时刻向所有账号同步出现。

所以排查顺序应是:先确认自己使用的是 ChatGPT、Work、Codex 还是 API,再核对计划与工作区权限,最后等待灰度。满足计划条件但暂时看不到,并不能证明账号坏了;同样,购买 ChatGPT 会员也不会自动产生 API 余额。

  • 先确认产品入口:ChatGPT、Work、Codex 或 API。
  • 再确认计划:Plus、Pro、Business 或 Enterprise。
  • Business / Enterprise 还要检查管理员是否开放相关能力。
  • 官方公布后的几天内,模型列表出现时间不同属于可预期的灰度现象。

1.05M 上下文很大,但不等于无限记忆

Astra 的上下文窗口为 1,050,000 token,最大输出为 128,000 token,知识截止日期为 2026 年 4 月 30 日。它支持文本输入输出和图片输入,不支持原生音频、视频,也不支持微调。

上下文窗口只表示一次请求能够容纳多少内容。外部笔记、历史搜索、向量检索可以在需要时把旧资料找回来,但检索没有召回的内容不会自动进入本次推理。因此,“几乎无限上下文”更准确的解释是外部记忆加超长但仍有限的上下文。

  • 放得下不等于每个细节都能 100% 找回。
  • 外部记忆负责保存与召回,上下文负责本次实际推理。
  • 大型代码库仍应按任务加载相关文件,不必为追求窗口利用率一次塞满。

真正需要注意的是 272K 计费分界

Astra API 标准价为每百万 token:输入 10 美元、缓存输入 1 美元、缓存写入 12.5 美元、输出 50 美元。一次请求的输入超过 272,000 token 后,整次请求的输入与缓存费率按 2 倍、输出费率按 1.5 倍计算。

只计算未缓存文本时,250K 输入加 10K 输出约为 3 美元;300K 输入加 10K 输出约为 6.75 美元。输入只增加 20%,总价却因跨档明显上升。Batch 与 Flex 为适用标准费率的 50%,Fast 为适用费率的 2 倍。

def estimate_astra_cost(input_tokens, output_tokens, cached_input_tokens=0):
    long_context = input_tokens > 272_000
    input_rate = 20 if long_context else 10
    cached_rate = 2 if long_context else 1
    output_rate = 75 if long_context else 50
    fresh_input = input_tokens - cached_input_tokens
    return (fresh_input / 1_000_000 * input_rate
            + cached_input_tokens / 1_000_000 * cached_rate
            + output_tokens / 1_000_000 * output_rate)

API 迁移不能只替换模型名

Astra 支持 Chat Completions,但需要工具调用时应使用 Responses API。新的异步调用、中途纠偏和动态推理配置也围绕 Responses API 设计。原来使用 none 或 minimal 的任务,可以先从 low reasoning 做对照测试。

  • 模型名改为 gpt-6-astra。
  • 删除 temperature、top_p 和 top_logprobs。
  • Chat Completions 还要删除 logprobs。
  • 从 GPT-5.5 或更早版本迁移缓存时,将 prompt_cache_options.ttl 设为 30m。
  • 审计 AGENTS.md、skills 与仓库说明,清理过时或互相冲突的约束。
from openai import OpenAI

client = OpenAI()
response = client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "low"},
    input="审查这个项目的登录流程,先列风险,再给最小修改方案。",
)
print(response.output_text)

怎样判断 Astra 是否真的适合你的任务

不要直接把官方单项跑分当作生产结论。评测里的 system prompt、工具、推理档位和运行环境可能不同于普通 ChatGPT 或你的应用。更可靠的方法是固定同一份输入、权限、时间与预算,让新旧模型各重复运行至少 3 次。

  • 真实仓库修复:比较测试通过率、越界修改、回归与人工纠偏次数。
  • 长文档核对:比较引用定位、冲突识别、遗漏率与跨过 272K 后的成本。
  • 中途改变要求:观察模型能否保留已完成工作并从当前状态继续。
  • 最终比较成功率、人工介入、完成时间与单次成功成本。

安全与事实检查

  • 看不到模型时先核对产品入口、计划和灰度,不把延迟直接误判为账号故障。
  • 不把 Work / Codex 的任务用量写成普通 ChatGPT 聊天消息数。
  • 不把 1.05M 上下文宣传为无限记忆或 100% 召回。
  • 不把特定评测中的高分直接等同于 AGI。
  • 生产切换前记录成功率、人工介入、总耗时和单次成功成本。

常见问题

ChatGPT Plus 能用 GPT-6 Astra 吗?

OpenAI 模型页已经写明 Plus、Pro、Business 与 Enterprise 的 Astra 访问将在发布后的几天内开放。具体何时出现在你的产品入口,仍取决于灰度、工作区和账号状态。

为什么符合计划却暂时看不到 Astra?

Astra 正在分批推出,而且 ChatGPT、Work、Codex 与 API 不是同一个入口。先核对入口与工作区权限;在官方所说的随后几天内暂时看不到,不足以证明账号异常。

1.05M 上下文等于无限上下文吗?

不等于。1.05M 是单次推理的上下文容量;外部笔记或历史检索属于另一层记忆系统,召回失败的内容不会自动进入当前推理。

GPT-6 Astra API 多少钱?

标准价为每百万 token 输入 10 美元、缓存输入 1 美元、缓存写入 12.5 美元、输出 50 美元;输入超过 272K 后,整次请求会进入更高费率。

GPT-6 Astra 就是 AGI 吗?

没有被普遍接受、能由单一跑分直接判定 AGI 的标准。官方评测可以说明特定能力,不能单独证明已经实现 AGI。

应该立刻把所有 API 流量切到 Astra 吗?

不建议直接全量切换。先选择失败代价高、需要多工具或长程执行的任务做灰度,比较成功率、返工、耗时与真实账单后再决定。

官方参考

产品功能、方案名称、用量与地区可用性以 OpenAI 当前官方页面为准。