GPT-6 Astra能力提升有多大?99.9%、47%提速和1.9倍背后的真实含义

原创概念图:旧式零散任务流程与新一代人工智能连贯完成工作的效率对比

GPT-6 Astra发布后,99.9%、约47%和1.9倍成为最受关注的三个数字。它们看起来都在说明能力大幅增强,但来自完全不同的测试:99.9%对应陌生规则推理,约47%对应完成电脑任务所用时间,1.9倍则是模型与更新后的Codex工作环境共同取得的速度变化。

99.9%代表的是陌生问题推理突破

与GPT-5.6 Sol的差距非常醒目

OpenAI公布的ARC-AGI-3数据中,GPT-6 Astra为99.9%,GPT-5.6 Sol为7.8%,Claude Opus 5为30.2%。该测试重点不是背诵已有知识,而是面对新的规则和环境后寻找解决办法。Astra在这一项目接近满分,是“能力代际变化”讨论的重要来源。

但这一成绩不等于现实世界中99.9%的任务都能完成。发布页说明,评测采用模型的最高推理设置,并使用特定运行环境。普通用户的提示方式、工具权限和任务材料不同,最终表现也会变化。它能证明一个测试上的显著突破,不能证明所有能力同步提高到同一程度。

约47%缩短时间说明AI开始重视做事效率

在OSWorld 2.0的时间模拟中,GPT-6 Astra得分72.6%,完成一项任务约用40分钟;GPT-5.6 Sol得分65.7%,约用75分钟。OpenAI据此表示,Astra在取得更高成绩的同时,每项任务所用时间减少约47%。

高分和更快同时出现才有实际意义

如果AI只是匆忙结束,速度快并没有价值。这组数据值得关注,是因为成绩和用时同时改善。对普通用户而言,它对应的可能是填写表格、整理客户记录、查找资料、处理文档和检查网页等任务,不再需要长时间等待多个重复步骤。

这仍是模拟环境结果,不代表每台电脑和每个网站都能缩短相同比例。网络速度、页面变化、账号权限和任务复杂度都会影响实际用时。

1.9倍速度是模型与工作环境共同取得的结果

OpenAI发布信息称,在Mind2Web测试中,Astra配合更新后的Codex工作环境,相比当时GPT-5.6 Sol体验实现了1.9倍的任务完成速度。这里的关键是“配合更新后的工作环境”,不能把1.9倍全部归因于模型本身。

这也反映出AI竞争的新方向。用户感受到的效率不仅由模型决定,还与软件能否保存进度、调用工具、处理等待和验证结果有关。未来评价AI,可能更像评价一套完整工作系统,而不是只看聊天窗口里谁回答得快。

专业任务完成率也出现明显增长

从53.6%提高到59.3%看似不大,实际难度更高

Agents’ Last Exam考察AI在真实软件中完成金融建模、工程和媒体制作等复杂工作。GPT-6 Astra取得59.3%,GPT-5.6 Sol为53.6%,Claude Opus 5为55.5%。发布页还称,在最高分设置下,Astra使用的输出内容比Claude Opus 5少约65%。

这组数据没有ARC-AGI-3那样夸张,却更接近日常工作的真实难度。复杂任务包含很多容易出错的小步骤,提升几个百分点可能意味着更多任务可以一次走到最后。与此同时,59.3%也说明仍有相当部分任务不能稳定完成,人工检查依旧必要。

能力到底提升了多少不能只给一个答案

如果看陌生环境推理,提升幅度十分突出;如果看专业软件任务,增长更接近渐进改善;如果看整体使用速度,又包含模型和工作环境的共同贡献。因此,把GPT-6 Astra概括为“统一提升多少倍”并不准确。

普通用户最值得观察的是三件事:长任务是否更少跑偏,修改要求后是否能继续推进,最终成果是否减少人工返工。只有这些指标在自己的任务中同步改善,发布会上的能力提升才真正转化为使用价值。

资料依据

本文信息核验于2026年9月9日,主要依据OpenAI的GPT-6 Astra发布材料、评测表和效率说明以及OpenAI官方模型指南。文中数字对应指定测试条件,不外推为所有实际任务的固定提升。配图为原创效率对比概念图。

FAQ

Q: GPT-6 Astra真的比GPT-5.6快1.9倍吗?

A: 1.9倍来自Mind2Web测试中Astra与更新后Codex工作环境的组合结果,不能理解为模型在所有任务中都固定快1.9倍。

Q: ARC-AGI-3取得99.9%是否代表日常任务几乎不会出错?

A: 不是。99.9%是特定抽象推理测试成绩,日常任务还会受到资料质量、提示方式、工具权限和外部页面变化等因素影响。