文 | AIX 财经,作者 | 雷晶,编辑 | 金玙璠
9 月 3 日凌晨,预热已久的 GPT-6 Astra 正式发布。
发布前半个月,OpenAI 一直在为这款模型的发布释放信号。8 月 18 日,在判断 Astra 可能达到 "Critical" 网络安全能力阈值后,公司放慢部分前沿模型训练,并暂停两周面向部署模型的强化学习训练,用来加强监控、对齐和研究环境安全。9 月 1 日,OpenAI 进一步披露 Astra 的安全评估情况。几轮信息提前放出之后,GPT-6 Astra 在正式发布前已经积累了不少关注。
但发布之后,大部分用户暂时还用不了。目前,GPT-6 Astra 只向少量机构开放,Plus、Pro、Business 等付费用户将在未来几天陆续获得访问权限,API 也会逐步开放。面对用户的等待,OpenAI 很快给出了一套补偿方案。Codex 负责人 Tibo 表示,付费用户每有一天无法使用 Astra,就会获得一次可以留到之后使用的额度重置。这也缓解了部分用户对延迟开放的不满。
回到模型本身,这次更新最值得关注的变化主要有两个:模型更能直接操作电脑,也更擅长完成复杂任务。OpenAI 称 GPT-6 Astra 是目前最智能的模型,相比 GPT-5.6 Sol,它在软件工程、科研、网络安全和专业工作等方向都有提升,计算机操作进步尤其明显。
API 的价格也提高了。GPT-6 Astra 的 API 价格为每百万 Token 输入 10 美元、输出 50 美元,是 GPT-5.6 Sol 的 2.5 倍,与 Anthropic 最新旗舰 Claude Fable 5.1 处在同一价格水平。OpenAI 还提供 Fast Mode,生成速度可以提高至约 2 倍,但价格也会翻倍。
OpenAI 对这次升级的定调也比以往更高。在发布前的媒体沟通会上,公司总裁 Greg Brockman 表示," 欢迎来到 AGI 时代 ",并认为几年后回头看,人们可能会把 GPT-6 Astra 视为 AGI 时代开始的一个节点。
关注度有了,能力也确实更强了。此外,OpenAI 与 Anthropic 也都进入了上市筹备阶段。GPT-6 Astra 足以支撑 OpenAI 口中的 AGI 时代了吗?又能不能帮 OpenAI 在新一轮竞争中占据主动?
01. 跑分接近上限,长任务进步更明显
先来看最直观的跑分成绩。我们主要关注两类,一类是成绩已经接近测试上限的,另一类是相比上一代提升明显的。

这三项测试考察的能力各不相同。ARC-AGI-3 考察模型能不能在陌生环境摸索出规则并迁移到更难的关卡,测的是对新环境的理解和适应;FrontierMath Tier 4 v2 考察高难度数学推理;ExploitBench 则要求模型针对已知漏洞,构造出可以运行的漏洞利用程序。
这说明,GPT-6 Astra 在研究级推理、陌生环境适应和复杂网络安全任务上已经表现出很强的能力。尤其是 ARC-AGI-3,今年 3 月刚推出时,前沿模型得分还不到 1%。GPT-6 Astra 如今接近满分,说明这类过去能够明显拉开前沿模型差距的陌生环境推理任务,已经很难再成为它的瓶颈。

不过,第三方综合测试给出的成绩没有这么突出。在 Artificial Analysis 最新智能指数中,GPT-6 Astra 最高推理档拿到 61 分,与 GPT-5.6 Sol 持平,排名第 5,低于 Claude Fable 5.1 最高档的 66 分。从综合成绩来看,GPT-6 Astra 并没有和上一代拉开明显差距,它的进步更多集中在部分能力上。
接下来,我们再看相比上一代提升明显的部分。
这主要集中在操作电脑、调用工具、连续执行步骤以及处理更长任务这些 Agent 能力上。其中,科研工作流测试 Terminal-Bench Science 0.1 的变化最大,GPT-6 Astra 从 GPT-5.6 Sol 的 22.4% 提高到 64.6%,接近上一代的三倍。其他长程 Agent 和自动化任务测试也普遍提高了 20 个百分点左右。
电脑操作的成绩也有明显的进步。ScreenSpot-Pro 从 76.9% 提高到 92.7%,意味着 GPT-6 Astra 在看懂界面、找准操作位置这件事上更加实用了。OSWorld 2.0 则达到 72.6%,分数只增加了 6.9 个百分点,但完成一项任务的模拟平均时间从约 75 分钟缩短到 40 分钟,耗时减少了接近一半。
这些变化,也能从第一批拿到 GPT-6 Astra 的用户实测中看到。
一位网友让 GPT-6 Astra 在 Unreal Engine(虚幻引擎,3D 创作工具)里搭建曼哈顿的虚拟场景,整个任务持续了一周。他提到,GPT-6 Astra 可以沿着街道逐步补充建筑和环境细节,持续运行多天后,仍能继续此前的进度完善场景。不过效率仍然有限,他提到,按照目前的速度,如果要把整个纽约做完仍需要数月。

另一位网友做了包括生成 3D 模型和动画、制作游戏等六组测试。他认为,这一代模型的能力提升比此前更明显,尤其是在长时间运行中表现稳定。实测期间,他同时运行了数百个 Agent,也没有遇到明显问题。

Codex 团队的 Thomas Ricouard 则重点测试了 GPT-6 Astra 的 3D 建模能力。他让模型根据一栋房屋的平面图完成 3D 场景的搭建,GPT-6 Astra 先在 Blender 中完成建模,再把场景转到 Unreal Engine,最终生成一个可以实时 " 行走 " 的 3D 空间。除了最开始几次提示词,后续的天空盒、电影化灯光、镜头角度等都由 GPT-6 Astra 完成。Ricouard 认为,GPT-6 Astra 非常擅长 3D 建模,它对材质、纹理和视觉效果的处理比较到位。

这些实测还只是早期样本,但它们和官方跑分呈现出的方向基本一致。GPT-6 Astra 明显的增量,集中在长时间执行、专业软件操作,以及把多种能力连续串进一项复杂任务。
02. 模型开始吃掉 Agent?
GPT-6 Astra 有两个变化值得单独展开。一个是 Computer Use(电脑操作能力),模型可以直接读取电脑界面,在软件里完成操作;另一个是 Judgment(判断力),模型会自己处理一些不影响方向的小问题,只在真正需要用户拍板时停下来询问。一个解决怎么动手,一个解决什么时候该自己做主。
先来看 Computer Use。简单来说,就是让模型像人一样看着屏幕干活。它通过截图理解当前界面,根据用户目标判断下一步该做什么,再把计划转成点击、输入等实际操作。执行完成后重新读取页面,继续下一步,形成一个循环。

它提供的是一条更通用的软件操作路径。很多 Agent 要接入外部系统,通常需要开发者提前接好 API、MCP 或者专用工具。Computer Use 则让模型直接操作原本为人设计的图形界面,在没有现成接口的情况下,也可以继续完成任务。
这项能力此前已有过尝试。2024 年,Anthropic 就已经在 Claude 上开放了 Computer Use,微软、OpenAI 也陆续跟进。2025 年,OpenAI 推出 Operator,背后的 Computer-Using Agent 同样可以通过截图理解网页,再用鼠标和键盘完成操作。之后,这类能力又被整合进 ChatGPT Agent 产品。
早期的 Computer Use 并不算好用。大模型研究员姚宇航告诉「AIX 财经」,OpenAI 此前推出的 AI 浏览器 Atlas 也是让模型直接控制网页,但延迟很长,效果并不理想。在他看来,这类能力未来一两年仍有很大提升空间。不过从这次官方展示的几组专业软件操作 Demo 来看,GPT-6 Astra 对图形化界面的理解和软件操作已经出现明显进步。
Computer Use 的价值,在于补上API、CLI和MCP覆盖不到的部分。有现成接口时,Agent 仍然可以选择更快、更稳定的方式;没有接口时,模型仍能通过 GUI 直接操作这些软件。
模型能够自己读网页并完成操作,也表明一部分原本由 Agent 承担的执行能力正在被底层模型接过去。姚宇航认为,未来 Agent 层会越来越薄。看屏幕、调用常见工具这些通用能力,会不断沉进基础模型。但 Agent 仍然有价值。进入金融、法律、医疗等专业场景后,还需要领域知识、业务流程、权限管理以及责任边界。垂直 Agent 可以依靠这些专业能力保留更高的附加价值。
GPT-6 Astra 另一个值得关注的变化,是 OpenAI 专门强调的 Judgment。
Judgment 解决的是协作问题。Agent 面对信息缺失时,经常需要在两个选择之间取舍。如果频繁停下来确认,自动化流程又会变成反复的人机沟通;如果完全自行决定,也可能直到任务后期才发现方向出了偏差。
GPT-6 Astra 的做法是先判断缺失信息的重要程度。不影响最终方向的小问题,依据上下文自己判断;可能改变结果的决策,再交给用户拍板。Judgment 降低的其实是使用 Agent 时的监督成本。用户需要确认的节点减少,Agent 才能真正接下更长、更复杂的任务。
03.OpenAI不想掉队
GPT-6 Astra 发布的时间点,正赶上前沿模型最密集的一轮更新。
9 月 1 日,Anthropic 发布 Claude Fable 5.1;9 月 2 日,Google 推出 Gemini 3.8 Flash,Meta 也在同一天更新 Muse Spark 1.3。几家公司挤在同一周更新模型,前沿能力的领先窗口期还在继续缩短。
但对 OpenAI 来说,这次发布的压力不只来自竞争对手。GPT-6 Astra 发布前,OpenAI 创始人 Sam Altman 在接受《时代》采访时复盘了 OpenAI 过去一年的表现。他承认,公司在产品方向和模型预训练上都没有达到预期。过去一年,OpenAI 同时铺开 Sora、Atlas 浏览器等多条产品线。今年以来,公司开始重新收缩,把更多资源拉回底层模型和 Codex 等核心项目。
OpenAI需要重新证明,它不仅能做出 " 最强 " 模型,也能把模型能力转化为收入。
消费端依然是 OpenAI 最明显的优势。截至 8 月底,ChatGPT 周活用户已经超过 10 亿,付费订阅用户超过 5000 万,用户规模远高于 Claude。
但在 B 端市场,这种优势就没那么明显了。Anthropic 更早抓住了 AI Coding 和 Agent 的商业化机会,Claude Code 逐渐成为企业高频使用的产品。
而眼下,B 端业务对 OpenAI 越来越重要。今年 4 月,OpenAI 披露企业业务收入占比超过 40%。7 月,企业收入已经首次超过消费者收入。此外,OpenAI 服务的企业和机构数量超过 200 万,是一年前的两倍。B 端市场从增量业务变成越来越重要的收入基本盘。
Anthropic 也给它带来了更大的压力。今年二季度,OpenAI 收入增长到 67 亿美元,环比增长 18%,但经营亏损扩大到 123 亿美元。Anthropic 同期收入则超过 115 亿美元,环比增长超过一倍,并实现小幅运营盈利,这也是 Anthropic 季度收入首次超过 OpenAI。
7 月底,Anthropic 披露的年化收入(run rate)已经超过 650 亿美元,OpenAI 约为 400 亿美元。需要说明的是,两家公司公布的年化收入数字统计方式存在差异,不能直接比较高低。但至少能够看出,Anthropic 带给 OpenAI 的压力从模型能力延伸到了企业增长和盈利效率。
两家公司已经先后秘密递交 IPO 申请,企业增长和盈利效率也会成为资本市场衡量两家公司商业化能力的重要指标。
OpenAI 也看到了企业客户使用习惯的变化。截至今年 6 月,在企业客户产生的 Codex 和 ChatGPT 输出 Token 中,Codex 已经占到 64%。这说明企业端的 AI 使用正在从问答转向更长、更复杂的 Agent 任务。放到这个背景下,GPT-6 Astra 这一轮的升级实际上都服务于扩大模型能够独立承接的工作范围。对于 OpenAI 来说,新模型的一项重要任务就是把更强的模型能力继续导向 Codex 和企业 Agent 场景。
价格拉平之后,两家在企业客户面前的竞争也更直接。GPT-6 Astra 的 API 价格已经与 Claude Fable 5.1 持平。OpenAI需要证明,更高的价格能够换来足够明显的任务完成率和使用价值。
OpenAI 还要承担越来越高的算力投入。今年 OpenAI 的计算支出预计约 500 亿美元,未来几年还要继续投入数据中心、芯片等基础设施。投入越大,公司就越需要让前沿模型能力转化成持续增长的企业收入。
拥有 10 亿级消费用户之后,OpenAI 下一阶段的任务是追上 Anthropic 已经领先的 B 端市场。