一句话总结: GPT-6 Astra 的重点不是“更会聊天”,而是能够在浏览器、代码环境和专业软件中持续执行多步骤任务;但实际入口、套餐、API价格和权限仍以 OpenAI 当前账户页、模型页和价目页为准。
这篇文章根据 X 帖子 2096866760901493154 的选题重写,并把帖子中的个人体验、演示案例和官方事实分开。帖子发布时间按 Snowflake 解码为 2026 年 9 月 7 日 15:42(北京时间)。
Astra 到底改变了什么
OpenAI 将 GPT-6 Astra 定位为面向复杂推理、软件工程、电脑操作、浏览、科学和专业工作的模型。它的实际价值不只在于生成一段答案,而在于能否围绕一个结果持续完成:
- 理解目标和约束;
- 制定执行步骤;
- 调用浏览器、代码环境或专业软件;
- 创建文件并运行检查;
- 根据错误或反馈继续修改;
- 交付可以打开、运行或审阅的成果。
这更接近 Agent 工作流,而不是普通问答。它仍可能误解目标、遗漏细节或在复杂任务中走偏,所以人的职责从“点击每个按钮”转向定义目标、设置权限和验收结果。
官方能力与公开评测怎么读
OpenAI 发布页展示了 Astra 在多类任务中的结果,包括电脑使用、软件工程、科学推理、数学、浏览和专业工作。公开表格中的部分数据如下:
| 评测 | GPT-6 Astra | GPT-5.6 Sol | 说明 |
|---|---|---|---|
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 科学软件与终端任务 |
| FrontierMath Tier 4 | 97.6% | 83.0% | 研究级数学 |
| AutomationBench | 41.4% | 18.1% | 专业自动化任务 |
| BenchCAD | 95.9% | 83.3% | CAD 类任务 |
| BrowseComp | 91.5% | 90.4% | 浏览与信息处理 |
| ExploitBench | 100.0% | 78.5% | 网络安全评测,不等于生产安全保证 |
基准测试只能说明特定数据集、工具配置和推理设置下的表现,不能直接换算成真实工作效率。尤其是 3D、CAD 和电脑操作任务,电脑环境、素材、权限、任务描述和人工验收都会影响结果。
因此,“Astra 全面碾压其他模型”不是稳妥结论。更合理的选型问题是:这项工作是否需要持续操作电脑、调用多个工具和交付文件?
现在从哪里使用
OpenAI 的帮助中心将 Astra 的开放范围分布在 ChatGPT Work、Codex 和 API 等不同产品中。滚动开放意味着同一套餐、不同账户或不同地区可能不在同一时间看到模型。
| 使用方式 | 核对重点 |
|---|---|
| ChatGPT Work | 查看账户内的模型选择器和当前额度 |
| Codex | 用于代码、测试、文件生成和项目级工作;客户端版本要符合官方要求 |
| OpenAI API | 模型 ID 为 gpt-6-astra,还要满足项目权限、余额和速率限制 |
| 云平台 | Azure、AWS Bedrock 等入口可能有独立的区域、配额和结算规则 |
截至本文核对时,OpenAI 帮助中心说明 Plus 用户会随着 rollout 在 ChatGPT Work 和 Codex 中获得 Astra;Pro、Business 和 Enterprise 的具体权限还受套餐、工作区管理员和账户状态影响。不要把“已发布”理解成每个账户的普通 Chat 界面都立即出现。
找不到模型时按这个顺序检查:
- 更新 ChatGPT、Codex CLI 或桌面客户端;
- 在 ChatGPT Work 或 Codex 中重新打开模型列表;
- 确认登录的是正确账户和工作区;
- Business 或 Enterprise 用户检查管理员的模型权限和支出控制;
- 对照官方帮助中心当前说明,而不是只看转发截图。
API价格与长上下文成本
OpenAI 当前模型页和相关价目资料显示,Astra 的标准 API 价格按每百万 Token 计算:
| 计费项 | 标准价格 |
|---|---|
| 输入 | $10 / 100万 Token |
| 缓存输入 | $1 / 100万 Token |
| 缓存写入 | $12.50 / 100万 Token |
| 输出 | $50 / 100万 Token |
这只是模型 Token 价格,不包括可能产生的工具调用、网页搜索、计算机操作、云平台结算、失败重试和其他服务费用。API价格、上下文规则、区域价格和产品套餐都可能调整,生产接入前应重新查看官方价目页。
Astra 支持约 105 万 Token 上下文,但大窗口不等于低成本。单次输入超过约 272K Token 后,可能进入长上下文费率:输入和缓存按更高倍数计费,输出价格也会上调。具体倍率要以当前模型页和账单说明为准。
成本控制建议:
- 先检索相关文件,不要把整个仓库无差别塞入上下文;
- 把稳定的系统提示和工具定义放在可复用的缓存前缀;
- 将动态日志、用户输入和实时结果放在后面;
- 记录输入、缓存命中、输出、工具调用和重试次数;
- 用一小批真实任务比较成功率、延迟和总账单,再决定是否扩大流量。
用 Codex 做 3D 或网页项目
帖子中的汽车 3D 案例属于个人演示,不应写成每次复制提示词都能复现的保证。想测试类似能力,建议从一个可回滚的小项目开始:
- 建立独立项目目录,不要直接在生产仓库操作;
- 给模型一份明确的结果定义,例如“生成可在浏览器打开的单页 3D 场景”;
- 明确允许创建和修改的目录;
- 要求模型先生成文件,再运行本地检查;
- 打开页面,检查控制台错误和交互行为;
- 逐条提出修改要求,并保留可用版本;
- 完成后人工审阅代码、依赖、资源来源和隐私内容。
验收至少包括:
- 文件能否正常打开;
- 页面是否能在目标浏览器运行;
- 鼠标、键盘和触摸交互是否正常;
- 控制台是否有报错;
- 参考素材、字体和模型资源是否有合法来源;
- 修改要求是否真的改变了结果,而不是只生成了漂亮截图。
电脑操作 Agent 的权限边界
电脑操作能力越强,权限设计越重要。不要因为模型能够连续执行更长任务,就把整个主目录、浏览器登录态、支付账户或生产环境直接交给它。
高风险动作应保留人工确认:
- 删除文件或批量覆盖代码;
- 发送邮件、消息或发布内容;
- 付款、下单或提交不可撤销表单;
- 修改生产环境、数据库或访问控制;
- 处理身份证件、银行卡、Token 和客户数据;
- 对外运行安全测试或访问未授权系统。
网络安全方面,OpenAI 将 Astra 描述为达到 Preparedness Framework 的 Critical 网络安全能力门槛。它可以帮助进行代码审查、漏洞修复、检测工程和防御分析,但这不代表可以对第三方系统进行未授权测试,也不代表所有高风险安全任务都会被允许执行。
Astra 是 AGI 吗
目前没有必要把 Astra 直接写成“AGI 已经完成”。AGI 没有统一的公开判定标准,而 OpenAI 的官方材料主要描述模型能力、评测结果、可用渠道和安全措施。
更准确的描述是:Astra 让 AI 更接近能够接收复杂目标、调用工具、持续执行并交付结果的工作系统。它是否达到某种 AGI 定义,需要另行讨论;对普通用户而言,更有用的问题是它能否在自己的环境里稳定完成任务。
FAQ
Plus 用户在哪里找 Astra?
优先查看 ChatGPT Work 和 Codex 中的模型选择器。滚动开放期间,不同账户看到模型的时间可能不同;以账户内实际显示和 OpenAI 帮助中心为准。
API 模型 ID 是什么?
公开模型页列出的模型 ID 是 gpt-6-astra。实际调用仍需要对应权限、余额、配额和正确的 API 配置。
Astra 适合所有任务吗?
不适合。普通聊天、改写、邮件和简单代码通常不需要高成本的长任务 Agent。需要电脑操作、多工具协作、复杂工程、3D/CAD 或文件交付时,才值得优先测试。
105 万 Token 上下文一定更省钱吗?
不一定。大上下文减少了切分工作,但可能触发更高费率,也会增加模型处理和重试成本。相关检索、分层摘要和稳定缓存通常更容易控制账单。
能否让 Astra 无人值守操作电脑?
不建议直接这么做。先在隔离项目中限制文件范围和工具权限,对删除、付款、发布、发送消息和生产变更设置人工审批。
这篇文章中的价格和开放状态会一直有效吗?
不会。价格、套餐、额度、客户端版本、API限制和 rollout 状态都可能变化。使用前应重新核对 OpenAI 官方模型页、帮助中心、价目页和账户页面。
核对来源: OpenAI GPT-6 Astra 发布说明 、Astra 安全路线说明 、ChatGPT Work 与 Codex 帮助中心 、GPT-6 Astra API 模型页 。