关于ZAKER Skills 合作
手机中国 6小时前

GPT-6 Astra 发布 “数字员工”离我们又近了一步

过去两年,我们已经习惯把工作丢进聊天框。

让 AI 写一封邮件、整理会议纪要、查找资料,或者给出一份方案。它的回答越来越像一名熟练员工,却始终隔着最后一步:AI 负责告诉你怎么做,剩下的操作仍然要由人来完成。

GPT-6 Astra 试图跨过这一步。

按照 OpenAI 的介绍,Astra 不仅能理解任务,还可以打开浏览器、操作桌面软件、填写表格、更新 CRM 里的客户资料,再把处理结果写进邮件和文档。在工程场景中,它还能安装软件、运行测试、制作网站,甚至打开 KiCad 完成电路板布局。

用户不再需要把一个任务拆成十几条指令,分别交给不同工具。只要告诉 Astra 想要什么,它便会自己寻找入口、切换页面,完成中间那些琐碎的操作。

这已经很接近人们想象中的 " 数字员工 "。

它不会坐在办公室里,也没有自己的工位,却能使用公司每天都在使用的软件,接手过去必须由员工逐项完成的工作。相比模型又学会了多少知识、基准成绩提高了几个百分点,这种变化更容易被企业感受到。

OpenAI 联合创始人格雷格 · 布罗克曼把 Astra 称为 AGI 时代的开端。但就在几天前,萨姆 · 奥尔特曼还说,AGI 已经成为一个定义混乱、甚至带有营销色彩的词。

Astra 是不是 AGI,可以留给研究人员继续争论。对普通用户和企业来说,一个更直接的变化已经发生:AI 开始从 " 会回答问题 ",走向 " 能把事情办完 "。

" 数字员工 " 还没有完全到来,但它离真实的工作环境,已经比过去近了不少。

这次升级,重点不在聊天

按照 OpenAI 的介绍,Astra 可以填写在线表格、更新 CRM 里的客户资料、整理日历、搜索网页、处理邮件和文档。

它还能安装软件、运行测试、排查电脑故障。在工程场景里,Astra 可以打开 KiCad 进行电路板布局,调用数据分析工具生成图表,也可以制作网站,再跑一遍前端质量检查。

现在的大模型已经很会说了。影响企业是否愿意继续花钱的,不是回答能不能再长一点,而是 AI 能不能离开聊天框,进入公司每天都在使用的系统。

Astra 在一些电脑操作测试中的进步很明显。在 Agents ’ Last Exam 上,它取得 59.3% 的成绩,高于 GPT-5.6 Sol 的 53.6% 和 Claude Opus 5 的 55.5%;完成同类任务时,输出 token 比 Claude Opus 5 少约 65%。

在 OSWorld 2.0 电脑操作测试中,Astra 取得 72.6% 的成绩,平均完成时间约为 40 分钟。GPT-5.6 Sol 的成绩是 65.7%,平均需要约 75 分钟。

但 Astra 也没有在所有测试中领先。在带工具的 Humanity ’ s Last Exam 上,它的 57.2% 低于 Claude Fable 5.1 的 65%;Artificial Analysis Intelligence Index 上,Astra 同样落后于两款 Claude 模型。

所以,OpenAI 所谓 " 全球最聪明的模型 ",仍然是发布会语言。测试工具、推理预算和任务类型稍有不同,排名就可能发生变化。

Astra 最突出的地方,不是每一道题都拿第一,而是把推理和操作接到了一起。以前,AI 可以告诉你如何制作一张表格、修改公司后台、部署一个网站,最后还得有人照着答案操作。Astra 试图把鼠标和键盘也接过去。

OpenAI 想要的不只是订阅费

GPT-6 Astra 首先向一部分机构开放,随后进入 ChatGPT Plus、Pro、Business 和 Enterprise,并通过 API 和 AWS 提供。

它的 API 价格并不便宜:每百万输入 token 10 美元,输出 token 50 美元,拥有 105 万 token 的上下文窗口,最多可以输出 12.8 万 token。

这里的 " 端到端 ",其实比 " 最强模型 " 更能说明 OpenAI 的打算。企业不会只计算一次对话用了多少 token。它们更关心一项工作需要多少时间、多少人工复核,以及失败以后要不要重做。

如果 Astra 能用几美元完成一项原本需要员工忙上几个小时的工作,即便单次调用价格更高,企业也可能愿意买单。模型之间的比较,也会从 " 每百万 token 多少钱 " 转向 " 完成一件合格的工作要多少钱 "。

Anthropic 已经依靠编程能力、长任务表现和企业客户建立了优势。OpenAI 拥有庞大的 ChatGPT 用户,但想进入企业的核心业务,仅靠聊天机器人还不够。

电脑操作能力给了 OpenAI 另一条路。

很多企业仍在使用老旧的财务软件、后台系统和内部网页。这些系统没有方便的 API,也不可能全部为 AI 重写。Astra 可以直接识别界面、点击按钮、填写字段,像一名员工那样使用它们。

企业围绕模型重新安排权限、审批和审计以后,更换模型就不再是改一个 API 地址那么简单。OpenAI 得到的也不只是一笔调用收入,还可能是整套工作流的入口。

更守规矩,却没有以前那么好读

Astra 在安全测试中更愿意遵守限制,它的思维过程却比前代模型更难监控。

OpenAI 表示,Astra 的思维链更短,也更少出现能够暴露异常行为的信息。在一些专门设计的对抗测试中,当研究人员要求它躲避监控时,它有时能够绕过只检查思维链的监控器。OpenAI 没有发现 Astra 在普通使用环境中主动隐藏意图的证据,情况还没有严重到 " 模型学会欺骗人类 "。

问题出在监督手段上。当前评测里的 Astra 更守规矩,研究人员却比以前更难从它的推理记录中提前发现问题。今天测出来的安全表现不错,不代表同一套监控方法能够一直跟上模型能力。

英国 AI 安全研究所还测试了模拟供应链攻击、虚假身份,以及诱导他人接受恶意代码等场景。测试没有接入真实网络和代码仓库,不能直接当成一次现实攻击,但已经足以提醒企业:部署智能体时,最难做的决定不是选哪个模型,而是给它开放哪些权限。

AI 正在从 " 会说 " 走向 " 会做 "

Astra 普及以后,网页和桌面软件可能迎来一轮新的改造。

过去的软件界面主要为人设计,今后还得考虑智能体能不能识别按钮、理解页面状态、发现操作失败。与此同时,网站也要区分正常的 AI 代理、批量自动化工具和恶意机器人。

身份验证、授权范围和操作记录,会成为智能体产品的基础设施。

网络安全行业面对的压力更加直接。AI 可以更快发现漏洞,也能更快制造攻击工具。安全竞争会从 " 谁先找到漏洞 ",慢慢变成 " 谁能更快修复、部署和验证 "。

对普通知识工作者来说,短期内先被压缩的可能不是整个岗位,而是工作中那些最琐碎的步骤:找资料、录数据、制作初稿、调整格式、在几个软件之间搬运信息。

人的位置会向前后两端移动。一端是决定 AI 应该做什么、能做到哪一步;另一端是检查结果、处理例外,并在出现问题以后找到责任人。

GPT-6 Astra 是不是 AGI,还可以继续争论。

更现实的情况是,AI 已经从一个提供建议的人,变成了一个准备亲自动手的人。

如果 Astra 成功,OpenAI 拿到的将是一个远大于聊天订阅的企业自动化市场。如果它犯错,留下的也不会只是一段不准确的回答,还可能是一条被修改的记录、一份部署错误的代码、一笔不该发出的交易,或者一个尚未公开的漏洞。

过去,大模型说错一句话,用户还可以直接划走。

当它拿起鼠标,错误就会留在现实世界里。

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容