如果只看“GPT-6来了”,很容易把这次更新理解成模型编号从5升到6。真正值得关注的变化是:GPT-6 Astra不只想回答问题,而是要接手一段完整工作。 用户可以给它一个目标,它会阅读材料、操作网页或软件、调用工具、检查中间结果,再交付文档、表格、PPT、网站或代码成果。
这次升级并不是每项指标都碾压GPT-5.6 Sol。电脑操作、自动化和编程提升明显,但部分综合评测差距很小,少数任务甚至出现回落,API单价也提高到了原来的2.5倍。
发生了什么
OpenAI于当地时间2026年9月3日发布 GPT-6 Astra。截至9月4日,它正按账号和组织分阶段开放:首批为部分企业和组织,API以及ChatGPT Plus、Pro、Business、Enterprise用户随后陆续获得入口。
这意味着“GPT-6已经发布”和“我的账号已经能用”是两回事。普通用户要看ChatGPT模型选择器,开发者要看API组织实际返回的模型列表,不能只凭新闻截图或第三方平台的宣传判断。
正式名称是 GPT-6 Astra,OpenAI开发者模型页给出的API模型ID是 gpt-6-astra。“GPT-6”是便于搜索和讨论的简称,接入代码时不能把简称直接当作模型ID。
截至2026年9月4日,OpenAI开发者模型页只明确列出 gpt-6-astra,尚未给出独立的 gpt-6-astra-pro API模型ID。Astra Pro可能属于ChatGPT中的产品模式或后续开放版本;在官方模型列表更新前,开发者不要自行猜测模型名。
GPT-6 Astra与GPT-5.6有什么区别
一句话概括:GPT-5.6 Sol更像一个很强的回答者和工具调用者,GPT-6 Astra则进一步向“能看、能操作、能连续干活”的执行型模型推进。
下面是GPT-6 Astra与GPT-5.6 Sol的主要基准成绩和标准API价格。基准测试反映升级方向,实际效果仍会受到任务类型、工具权限和运行设置影响:
| 对比项目 | GPT-5.6 Sol | GPT-6 Astra | 怎么理解 |
|---|---|---|---|
| OSWorld 2.0电脑操作 | 65.7%,单项任务约75分钟 | 72.6%,单项任务约40分钟 | 不只是正确率提高,模拟环境中的任务时间缩短约47% |
| AutomationBench自动化 | 18.1% | 41.4% | 在更接近真实办公自动化的任务上提升明显 |
| Terminal-Bench 4.0编程 | 37.3% | 57.7%至57.9% | 不同测试设置和四舍五入口径略有差异,终端、安装、测试和故障排查能力提升明显 |
| BenchCAD工程设计 | 83.3% | 95.9% | 更能根据渲染图重建CAD对象并操作专业工作流 |
| BrowseComp网页检索 | 90.4% | 91.5% | 有提升,但差距不大,不是所有项目都跨代跃升 |
| ExploitBench网络安全 | 78.5% | 100% | 漏洞分析能力大幅上升,也带来更严格的安全限制 |
| 标准API价格 | 输入4美元、输出20美元/百万tokens | 输入10美元、输出50美元/百万tokens | 输入和输出单价均提高到2.5倍 |
ARC-AGI-3的99.9%结果使用了Responses API Harness和记忆管理设置,不能直接等同于裸模型表现,也不代表它在所有陌生任务上都能达到相同水平。
Artificial Analysis的独立评测显示,Astra的Intelligence Index为61.2,GPT-5.6 Sol为60.9,综合差距很小。Astra的输出tokens约减少10%,但受单价上涨影响,估算单任务成本反而高约75%;在GDPval-AA v2、部分银行和科学代码任务中也出现回落。因此,“升级”不能直接等同于“所有业务都应切换”。
GPT-6有哪些功能提升
1. 从调用工具变成直接操作电脑
Astra可以识别屏幕内容,用鼠标、键盘和浏览器完成连续操作。发布演示包括填写网页表单、更新CRM客户记录、整理日历、搜索资料并写入邮件或文档。更复杂时,它还能进入Power BI分析数据,在KiCad和FreeCAD中处理工程设计,安装软件、运行测试并根据屏幕报错继续排查。
这和过去“模型告诉你下一步点哪里”不同。用户交代目标和边界后,模型尝试自己完成中间步骤,人主要负责授权、检查和最终确认。
2. 不只生成文字,而是交付成品
GPT-6 Astra可以直接处理文档、电子表格和演示文稿。给它几页企业现有PPT,它会参考原来的布局、语气和视觉风格继续制作,而不是只输出一份等待人工排版的大纲。它还能继续完成网站、游戏原型、财务模型和专业报告等任务。
在法律科技公司Legora的测试中,Astra用几分钟审阅了41份财务文件,并找出4处预先埋入的问题。单个案例的提升接近40%,但全部Agent任务的平均提升约为3%,实际收益会随任务而变化。游戏公司Playco则用同一灰盒底稿生成3种主题的可玩原型,人工修补工作减少约一半。
3. 编程从写代码推进到完成长任务
Astra的重点不是多写几段代码,而是可以进入终端和开发工具,安装依赖、执行测试、观察错误、修改实现,再重新验证。对于持续很久的Codex任务,新的上下文机制可以保留工作笔记,并搜索早期消息和工具输出,减少多次压缩上下文后遗失需求、失败原因或测试记录的问题。
这对代码库重构、数据库迁移、前端质量检查和跨软件开发比单纯扩大上下文窗口更有意义,因为长任务真正容易丢失的是“为什么这么改”和“哪些办法已经失败”。
4. 进入科研和工程软件工作
过去模型更多是解释论文或给出分析建议,Astra强调把科学推理与电脑操作结合:打开专业软件、检查测序质量、分析遗传变异、运行模拟、拟合模型,再根据结果决定下一步调查什么。工程演示还包括PCB布局、Blender建模以及把模型导入Unreal Engine形成可行走场景。
这些演示说明它开始接近研究和工程流程,但不能替代实验复核、工程验收或专业人员签字。模型能操作软件,不代表输出自动满足行业规范。
5. 更会处理中途修改和信息缺口
OpenAI使用指南强调更强的指令遵循、对话中途调整和异步工具调用。缺少的信息会改变结果时,Astra更倾向于提出具体问题;不影响主方向时,它可以先做合理假设并继续其他步骤。用户中途补充要求后,它也会尽量保留原始目标,而不是把一句新消息误当成整项任务的替代品。
6. 能力边界和安全监控更严格
Astra是OpenAI首个达到其网络安全“Critical”能力阈值的模型。它在近期漏洞测试中发现了未知问题,但当前版本会拒绝更高级的攻击性任务。模型获得更多电脑权限后,风险也从“回答错了”扩展到“访问了什么、操作了什么、什么时候必须停下来”。企业接入时必须限制目录、账号、网络、工具权限和最终提交动作。
已确认事实
截至2026年9月4日,GPT-6 Astra的公开规格如下。模型ID、价格和接口支持可能继续更新,实际接入时以OpenAI控制台和官方文档为准:
| 项目 | GPT-6 Astra当前信息 | 实际含义 |
|---|---|---|
| 正式名称 | GPT-6 Astra | GPT-6是常用简称,接入时使用精确模型名 |
| API模型ID | gpt-6-astra |
不要自行猜测Astra Pro的API ID |
| 上下文窗口 | 1,050,000 tokens | 适合长文档、代码库和多轮材料,但输入越多不代表判断越准 |
| 最大输出 | 128,000 tokens | 能生成更长成果,实际仍建议分阶段输出和验收 |
| 输入输出 | 文本、图片输入,文本输出 | 音频和视频能力不能从该规格表自行推断 |
| API端点 | Chat Completions、Responses | 新工具和长工作流优先按Responses能力逐项验证 |
| 标准价格 | 输入10美元、缓存输入1美元、输出50美元/百万tokens | 单价明显提高,必须记录整项任务的实际消耗 |
| 工具支持 | web search、file search、computer use、code interpreter、MCP等 | 应用仍负责授权、执行、回传、审计和失败恢复 |
为什么重要
这次变化的核心不是“会不会聊天”,而是模型开始争夺一整段数字工作的执行权。过去完成“整理财务数据并做成汇报”通常要在搜索、表格、文档和PPT之间来回切换;Astra的目标是把这些步骤放进一次持续任务中。
但“每百万tokens单价”和“完成一项任务的总成本”必须分开看。OpenAI公布的BenchCAD、科学和编程任务中,Astra因为减少输出和返工,估算单任务成本可能低于GPT-5.6 Sol;Artificial Analysis的部分测试却显示单任务成本更高。两者并不矛盾,只说明结果高度依赖任务类型、运行框架、推理强度和验收方式。
“欢迎来到AGI时代”是OpenAI管理层在发布时的判断,不是行业已经达成的技术共识。对实际用户更有用的问题仍然是:它能否稳定完成你的任务、是否越权、结果能否复核,以及总成本是否合理。
谁受影响
普通ChatGPT用户
最容易感知的变化会出现在“帮我把一件事做完”,而不是普通问答。可以用一份不含敏感信息的材料测试旅行筛选、研究整理或多文件总结,但应检查模型是否真的完成操作,而不是只生成一段看似完成的说明。
内容与办公用户
重点观察PPT是否继承模板、表格公式是否正确、文档引用能否回查,以及模型有没有遗漏附件中的限制条件。上下文窗口再大,也不能替代页码、来源和人工校对。
开发者与API用户
先在模型列表中确认 gpt-6-astra,再分别验证结构化输出、流式响应、函数调用、MCP、超时和工具失败恢复。不要同时替换模型、提示词、重试次数和权限配置,否则无法判断效果变化来自哪里。
企业和安全团队
电脑操作能力越强,最小权限越重要。生产接入应默认限制可访问站点、文件目录和账号权限,对发送邮件、提交表单、执行代码、修改数据等动作增加审批与审计记录。
国内用户
“GPT-6国内版”不是OpenAI公开的官方产品名称。能否使用取决于地区、账号计划、组织权限、支付、网络和适用规则。第三方兼容平台可以提供自己的服务,但不能仅凭模型下拉框名称证明它调用的就是官方GPT-6 Astra。
实际测试
拿到入口后,可以用一项真实但可恢复的任务做A/B测试,而不是用两个随手问题下结论:
- 固定材料:准备同一份文档、代码仓库或表格副本,分别交给GPT-5.6 Sol和GPT-6 Astra。
- 固定权限:两边使用相同工具、网站访问范围、推理强度和最大输出,避免测试条件不同。
- 检查交付物:记录任务是否完成、事实错误、引用位置、工具失败、越权动作和人工返工时间。
- 记录总成本:同时记录输入输出tokens、缓存命中、工具次数、耗时、重试和人工处理时间。
- 保留回退:只有目标任务连续通过后再扩大流量,原模型和原配置保持可快速恢复。
仍需观察
- GPT-6 Astra Pro的正式产品定义、独立API模型ID、价格和开放范围。
- Plus、Pro、Business和Enterprise账号的实际推送时间、额度和文件限制。
- Fast模式的最终速度与费率尚未完全明确,实际使用时以控制台显示为准。
- ARC-AGI-3等高分在不同Harness、记忆设置和独立复现中的表现。
- Artificial Analysis综合评测中的有限领先、成本上升和部分任务回落能否在后续版本改善。
- 电脑操作、网络安全和长任务中断后的恢复能力,以及误拦截正常任务的概率。
建议怎么做
普通用户不必为了“首发”购买来源不明的共享账号。等模型出现在自己的账号里,再用非敏感任务比较完成质量。
办公和内容用户应优先测试能否交付可直接修改的文件,而不是只比较回答文风。开发者应先做小流量A/B测试,把2.5倍的token单价和可能减少的耗时、输出及返工一起计算。
一句话总结:GPT-6 Astra相对GPT-5.6 Sol最重要的提升,是从生成答案走向操作电脑并完成工作;它在多项Agent和专业任务评测中明显更强,但价格更高、部分第三方评测差距有限,是否值得升级必须按真实任务计算。
相关教程
- AI教程与ChatGPT使用指南:按论文、办公、图片和内容任务查找可核验的工作流。
- ChatGPT国内怎么用:官网入口与登录指南:区分官方入口、账号登录和第三方接入平台。
- API Key和Base URL基础:先理解凭证、地址、模型字段和请求协议,再做API切换。
资料来源
- OpenAI GPT-6 Astra模型文档
模型ID、上下文窗口、价格、API端点、工具及当前支持范围。
- OpenAI GPT-6 Astra使用指南
模型定位、Responses API接入方式、新能力和提示词行为说明。
- OpenAI GPT-6 Astra安全概览
模型安全评估、网络安全能力分级与防护措施。
- 澎湃新闻:目前智能水平最高模型,GPT-6来了
发布时间、电脑操作、专业工作、科学研究、网络安全、企业案例和开放节奏。
- 腾讯科技:欢迎来到AGI时代,OpenAI发布GPT-6 Astra
GPT-5.6 Sol价格与跑分对比、Artificial Analysis独立评测、成本差异和回落项目。
- 量子位:GPT-6正式发布
应用演示、Responses API Harness测试条件、Astra Pro信息和首批企业案例。
- 机器之心:GPT-6 Astra发布解读
专业办公、长任务上下文、科学研究、网络安全和成本数据;新浪科技转载。
FAQ
GPT-6什么时候发布,已经可以用了吗?
截至2026年9月4日,OpenAI官方文档写明GPT-6 Astra已开始向Trusted Access企业推出,API和Plus、Pro、Business、Enterprise计划将在随后几天逐步开放。是否能用要看当前账号或组织的实际入口,不能只看网上截图。
GPT-6和GPT-6 Astra是同一个模型吗?
目前OpenAI公开开发者文档使用的正式名称是GPT-6 Astra,API模型ID为gpt-6-astra。搜索时常见的“GPT-6”是简称,接入时应以控制台或官方模型文档中的精确ID为准。
GPT-6 Astra和GPT-5.6有什么区别?
核心区别是从“回答和调用工具”进一步走向“持续完成整项工作”。OpenAI发布材料显示,Astra在OSWorld 2.0、AutomationBench、Terminal-Bench 4.0和BenchCAD等电脑操作、自动化、编程与工程测试中超过GPT-5.6 Sol,并能直接操作网页和专业软件。但第三方综合评测中二者差距很小,部分任务还有回落,不能理解成所有场景都全面碾压。
GPT-6 Astra有哪些功能提升?
当前官方指南列出约105万tokens上下文窗口、最多12.8万tokens输出、文本和图片输入、Responses API工具调用、异步工具调用、对话中途调整推理强度,以及更强的指令遵循和澄清问题能力。不同计划和客户端是否开放这些能力,还要以实际入口和接口返回为准。
GPT-6 Astra Pro是独立版本吗?
截至2026年9月4日,OpenAI开发者模型页只明确给出gpt-6-astra,尚未列出独立的GPT-6 Astra Pro API模型ID。开发者不应自行填写gpt-6-astra-pro,也不能把ChatGPT中的产品模式或套餐名称直接等同于API模型。
GPT-6比GPT-5.6贵多少?
GPT-6 Astra的标准API价格为输入10美元、输出50美元/百万tokens;GPT-5.6 Sol为输入4美元、输出20美元/百万tokens,输入和输出单价都提高到2.5倍。但复杂任务的总成本还取决于输出tokens、完成时间、重试次数和人工返工,不能只比较单价。
GPT-6国内用户怎么用?
官方模型文档说明了企业计划、API和ChatGPT计划的开放节奏,但没有在该页面承诺某个地区的账号一定可用。国内用户应先检查当前登录账号的模型选择器或组织API模型列表,确认地区、账号、支付和网络条件后再做小范围测试;第三方页面的“GPT-6国内版”不能等同于OpenAI官方服务。
