一句话总结: GPT-6 Astra 的重点不是“更会聊天”,而是能够在浏览器、代码环境和专业软件中持续执行多步骤任务;但实际入口、套餐、API价格和权限仍以 OpenAI 当前账户页、模型页和价目页为准。

这篇文章根据 X 帖子 2096866760901493154 的选题重写,并把帖子中的个人体验、演示案例和官方事实分开。帖子发布时间按 Snowflake 解码为 2026 年 9 月 7 日 15:42(北京时间)。

GPT-6 Astra 多步骤工作流

Astra 到底改变了什么

OpenAI 将 GPT-6 Astra 定位为面向复杂推理、软件工程、电脑操作、浏览、科学和专业工作的模型。它的实际价值不只在于生成一段答案,而在于能否围绕一个结果持续完成:

  1. 理解目标和约束;
  2. 制定执行步骤;
  3. 调用浏览器、代码环境或专业软件;
  4. 创建文件并运行检查;
  5. 根据错误或反馈继续修改;
  6. 交付可以打开、运行或审阅的成果。

这更接近 Agent 工作流,而不是普通问答。它仍可能误解目标、遗漏细节或在复杂任务中走偏,所以人的职责从“点击每个按钮”转向定义目标、设置权限和验收结果。

官方能力与公开评测怎么读

OpenAI 发布页展示了 Astra 在多类任务中的结果,包括电脑使用、软件工程、科学推理、数学、浏览和专业工作。公开表格中的部分数据如下:

评测GPT-6 AstraGPT-5.6 Sol说明
Terminal-Bench Science 0.164.6%22.4%科学软件与终端任务
FrontierMath Tier 497.6%83.0%研究级数学
AutomationBench41.4%18.1%专业自动化任务
BenchCAD95.9%83.3%CAD 类任务
BrowseComp91.5%90.4%浏览与信息处理
ExploitBench100.0%78.5%网络安全评测,不等于生产安全保证

基准测试只能说明特定数据集、工具配置和推理设置下的表现,不能直接换算成真实工作效率。尤其是 3D、CAD 和电脑操作任务,电脑环境、素材、权限、任务描述和人工验收都会影响结果。

因此,“Astra 全面碾压其他模型”不是稳妥结论。更合理的选型问题是:这项工作是否需要持续操作电脑、调用多个工具和交付文件?

现在从哪里使用

OpenAI 的帮助中心将 Astra 的开放范围分布在 ChatGPT Work、Codex 和 API 等不同产品中。滚动开放意味着同一套餐、不同账户或不同地区可能不在同一时间看到模型。

GPT-6 Astra 入口和成本检查

使用方式核对重点
ChatGPT Work查看账户内的模型选择器和当前额度
Codex用于代码、测试、文件生成和项目级工作;客户端版本要符合官方要求
OpenAI API模型 ID 为 gpt-6-astra,还要满足项目权限、余额和速率限制
云平台Azure、AWS Bedrock 等入口可能有独立的区域、配额和结算规则

截至本文核对时,OpenAI 帮助中心说明 Plus 用户会随着 rollout 在 ChatGPT Work 和 Codex 中获得 Astra;Pro、Business 和 Enterprise 的具体权限还受套餐、工作区管理员和账户状态影响。不要把“已发布”理解成每个账户的普通 Chat 界面都立即出现。

找不到模型时按这个顺序检查:

  1. 更新 ChatGPT、Codex CLI 或桌面客户端;
  2. 在 ChatGPT Work 或 Codex 中重新打开模型列表;
  3. 确认登录的是正确账户和工作区;
  4. Business 或 Enterprise 用户检查管理员的模型权限和支出控制;
  5. 对照官方帮助中心当前说明,而不是只看转发截图。

API价格与长上下文成本

OpenAI 当前模型页和相关价目资料显示,Astra 的标准 API 价格按每百万 Token 计算:

计费项标准价格
输入$10 / 100万 Token
缓存输入$1 / 100万 Token
缓存写入$12.50 / 100万 Token
输出$50 / 100万 Token

这只是模型 Token 价格,不包括可能产生的工具调用、网页搜索、计算机操作、云平台结算、失败重试和其他服务费用。API价格、上下文规则、区域价格和产品套餐都可能调整,生产接入前应重新查看官方价目页。

Astra 支持约 105 万 Token 上下文,但大窗口不等于低成本。单次输入超过约 272K Token 后,可能进入长上下文费率:输入和缓存按更高倍数计费,输出价格也会上调。具体倍率要以当前模型页和账单说明为准。

成本控制建议:

  • 先检索相关文件,不要把整个仓库无差别塞入上下文;
  • 把稳定的系统提示和工具定义放在可复用的缓存前缀;
  • 将动态日志、用户输入和实时结果放在后面;
  • 记录输入、缓存命中、输出、工具调用和重试次数;
  • 用一小批真实任务比较成功率、延迟和总账单,再决定是否扩大流量。

用 Codex 做 3D 或网页项目

帖子中的汽车 3D 案例属于个人演示,不应写成每次复制提示词都能复现的保证。想测试类似能力,建议从一个可回滚的小项目开始:

  1. 建立独立项目目录,不要直接在生产仓库操作;
  2. 给模型一份明确的结果定义,例如“生成可在浏览器打开的单页 3D 场景”;
  3. 明确允许创建和修改的目录;
  4. 要求模型先生成文件,再运行本地检查;
  5. 打开页面,检查控制台错误和交互行为;
  6. 逐条提出修改要求,并保留可用版本;
  7. 完成后人工审阅代码、依赖、资源来源和隐私内容。

验收至少包括:

  • 文件能否正常打开;
  • 页面是否能在目标浏览器运行;
  • 鼠标、键盘和触摸交互是否正常;
  • 控制台是否有报错;
  • 参考素材、字体和模型资源是否有合法来源;
  • 修改要求是否真的改变了结果,而不是只生成了漂亮截图。

电脑操作 Agent 的权限边界

电脑操作能力越强,权限设计越重要。不要因为模型能够连续执行更长任务,就把整个主目录、浏览器登录态、支付账户或生产环境直接交给它。

高风险动作应保留人工确认:

  • 删除文件或批量覆盖代码;
  • 发送邮件、消息或发布内容;
  • 付款、下单或提交不可撤销表单;
  • 修改生产环境、数据库或访问控制;
  • 处理身份证件、银行卡、Token 和客户数据;
  • 对外运行安全测试或访问未授权系统。

网络安全方面,OpenAI 将 Astra 描述为达到 Preparedness Framework 的 Critical 网络安全能力门槛。它可以帮助进行代码审查、漏洞修复、检测工程和防御分析,但这不代表可以对第三方系统进行未授权测试,也不代表所有高风险安全任务都会被允许执行。

Astra 是 AGI 吗

目前没有必要把 Astra 直接写成“AGI 已经完成”。AGI 没有统一的公开判定标准,而 OpenAI 的官方材料主要描述模型能力、评测结果、可用渠道和安全措施。

更准确的描述是:Astra 让 AI 更接近能够接收复杂目标、调用工具、持续执行并交付结果的工作系统。它是否达到某种 AGI 定义,需要另行讨论;对普通用户而言,更有用的问题是它能否在自己的环境里稳定完成任务。

FAQ

Plus 用户在哪里找 Astra?

优先查看 ChatGPT Work 和 Codex 中的模型选择器。滚动开放期间,不同账户看到模型的时间可能不同;以账户内实际显示和 OpenAI 帮助中心为准。

API 模型 ID 是什么?

公开模型页列出的模型 ID 是 gpt-6-astra。实际调用仍需要对应权限、余额、配额和正确的 API 配置。

Astra 适合所有任务吗?

不适合。普通聊天、改写、邮件和简单代码通常不需要高成本的长任务 Agent。需要电脑操作、多工具协作、复杂工程、3D/CAD 或文件交付时,才值得优先测试。

105 万 Token 上下文一定更省钱吗?

不一定。大上下文减少了切分工作,但可能触发更高费率,也会增加模型处理和重试成本。相关检索、分层摘要和稳定缓存通常更容易控制账单。

能否让 Astra 无人值守操作电脑?

不建议直接这么做。先在隔离项目中限制文件范围和工具权限,对删除、付款、发布、发送消息和生产变更设置人工审批。

这篇文章中的价格和开放状态会一直有效吗?

不会。价格、套餐、额度、客户端版本、API限制和 rollout 状态都可能变化。使用前应重新核对 OpenAI 官方模型页、帮助中心、价目页和账户页面。

核对来源: OpenAI GPT-6 Astra 发布说明 、Astra 安全路线说明 、ChatGPT Work 与 Codex 帮助中心 、GPT-6 Astra API 模型页 。