北京时间2026年9月4日凌晨,OpenAI正式发布新一代旗舰模型 GPT-6 Astra 。Astra在拉丁语中意为“星辰、群星”。OpenAI总裁格雷格·布罗克曼(Greg Brockman)在发布会最后留下一句话:“欢迎来到AGI时代。”

这大概是OpenAI首次如此明确地将一款产品与AGI直接关联。
技术博客地址: https://openai.com/index/gpt-6-astra/
模型地址:Chatgpt官网 (海外网站需要科学上网)
一、核心定位:从“对话”到“干活”的范式转移
GPT-6 Astra最核心的变化,并非在某一项基准测试上多拿了几分,而是能力形态的根本转变——从“回答问题”向“直接完成工作”推进 。
与传统聊天机器人不同,用户可以直接向Astra给出一个目标,例如“帮我整理一份财务分析并做成演示文稿”或“开发一个游戏原型并测试它是否能正常运行”。模型需要自己拆解任务、调用不同工具、持续执行,再把最终结果交付出来。
OpenAI称Astra为“全球最佳的计算机使用模型”。它无需专门适配,便能直接操控浏览器、电子表格、桌面软件和网页,执行填表、更新CRM客户记录、排定日历、跑代码、做数据分析,甚至创建网站与演示文稿等多步骤流程。
官方演示中,Astra展示了在KiCad中完成印刷电路板布局、在Blender中建模房屋、填写美国1040税表等操作
在OSWorld 2.0测试中,Astra得分72.6%,高于GPT-5.6 Sol的65.7%。
更关键的是效率提升:在延迟模拟环境下,Astra完成一项任务平均约需40分钟,而GPT-5.6 Sol约需75分钟,时间缩短约47% 。40分钟的完成时间意味着AI操作电脑开始具备实际的生产效率。

二、基准测试:多项“刷榜”,ARC-AGI-3从7.8%飙至99.9%
Astra在多项关键基准上实现了代际式跃升:
| 基准测试 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| FrontierMath Tier 4 | 97.6% | 83% | 87.8% |
| ARC-AGI-3 | 99.9% | 7.8% | — |
| ExploitBench | 100% | 78.5% | — |
| Terminal-Bench 4.0 | 57.7% | 37.3% | 55.8% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% |
| Agents' Last Exam | 59.3% | 53.6% | 48.7% |
| OSWorld 2.0 | 72.6% | 65.7% | — |
其中三项成绩尤其突出:
- ARC-AGI-3(99.9%): 这项测试衡量模型在陌生环境中的抽象推理和学习能力——不给规则说明,直接把模型扔进从未见过的二维游戏里,让它边玩边摸索通关方法。今年3月刚公布时,最强AI成绩仅0.51%,GPT-5.6 Sol默认框架下也只有7.8%。Astra直接跃升至99.9%,接近满分。
- FrontierMath Tier 4(97.6%): 被称为“最难数学基准之一”的研究级数学测试。Astra得分97.6%,几乎将这套测试“打穿”。OpenAI表示,Astra已帮助解决了数学领域长期存在的开放性问题。
- ExploitBench(100%): 测试漏洞利用能力,Astra成为OpenAI首个达到内部“关键级”(Critical)网络安全能力门槛的模型。内部测试中,Astra还发现了两处此前未知的零日漏洞。
不过需要注意的是,ARC-AGI-3的99.9%成绩使用了OpenAI的Responses API Harness运行框架,包括记忆管理和Agent运行框架带来的增益,并非纯基础模型成绩。

三、安全与对齐:“越界”尝试从48%降至0%
OpenAI将Astra称为“最对齐的模型”。
在安全评估中,OpenAI构建了一个新的测试方法——受Hugging Face安全事件启发,评估模型在面对困难或不可能完成的任务时是否会超出授权范围。结果显示,GPT-5.6 Sol在没有生产环境安全措施的情况下,超出授权目标的比例为48%,而 GPT-6 Astra为0% 。
与此同时,Astra的网络安全能力也达到了新高度。OpenAI对其最先进的网络安全能力设置了更严格的访问限制。涉及最高级网络攻击能力的版本,仅面向网络防御机构提供。
四、定价:输入$10/百万token,输出$50/百万token
GPT-6 Astra的API定价为:每百万输入token 10美元 ,每百万输出token 50美元 。缓存输入为1美元/百万token。这大约是GPT-5.6 Sol当前促销价(输入4美元、输出20美元)的2.5倍,与Anthropic刚发布的Claude Fable 5.1定价持平。
- 长上下文溢价: 输入超过27.2万token后,整次请求的输入和缓存价格翻倍,输出价格升至1.5倍。
- 其他模式: 快速模式价格为标准版的2倍;批处理(Batch)和Flex模式为标准价的50%。
- 基本规格: 上下文窗口105万token,最大输出12.8万token,知识截止日期为2026年4月30日,支持五档推理强度调节(low/medium/high/xhigh/max)。
五、可用性与行业反响
GPT-6 Astra今日起率先向参与网络安全项目Daybreak的部分企业开放,未来数日内将向所有ChatGPT Plus、Pro、Business和Enterprise用户推出。开发者可通过OpenAI API和Amazon Bedrock调用。
企业落地案例方面,法律科技公司Legora使用Astra进行财务报表审阅,相关基准提升约40%,一次运行中用几分钟审阅41份文件并发现4处人为埋设的错误。游戏开发公司Playco使用Astra进行游戏原型开发,人工修复工作减少50%。
不过,独立评测也给出了更克制的视角。在Artificial Analysis的Intelligence Index v4.1.1通用智能测试中,Astra得分为61.2分,Claude Fable 5.1为65.7分。提前获得内测资格的开发者反馈也显示:Astra并非在智能上遥遥领先,但其环境理解和操作能力弥补了这一点。
GPT-6 Astra标志着大模型从“对话式AI”向“执行式AI”的关键转折。它不再只是回答问题,而是直接进入软件完成工作。ARC-AGI-3从7.8%到99.9%的跃升、ExploitBench的满分、OSWorld 2.0上47%的效率提升——这些数字背后,是AI能力形态的实质性变化。
当然,2.5倍于前代的价格、仅面向有限组织的首发策略,以及独立评测中并非全面领先的成绩,都说明“AGI时代”的宣告更多是方向性的判断,而非能力已臻完美。但方向本身,已经足够重要。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:










