关于ZAKER Skills GEO服务 合作
钛媒体 1小时前

爆火了的 Muse 和 Instinct 们不能做的,OS3 能?

文 | 字母 AI

小扎拿出 Muse Charm 之后,Rabbit r1 又被翻了出来。

不少人看到这款新设备时,都会幻视两年多前的橙色小方盒。在 X 上,有人将小扎拿着 Charm、吕骋拿着 r1 的照片放在一起玩梗,不少外媒在报道 Charm 时,也都提到了这款初代 AI 硬件。

一台可以随身携带的小设备,通过语音听懂用户的要求,再让 AI 替人办事。这幅画面,确实让人觉得熟悉。

让人感到熟悉的不只是硬件。

2024 年,Rabbit 在 r1 发布会上,用打车、订票、点外卖等场景,向大众解释 Personal Agent(个人智能体)到底能办什么事。此后,这几样任务反复出现在一代代 Agent 产品的演示里,逐渐凑成了一套观众熟悉的 " 标准套餐 "。评测网站 Assistant Benchmark 也把订机票、订餐厅、购物等列进了 Personal Agent 的测试维度。

这套题目受欢迎的原因不难理解:外卖有没有送达,票有没有订上,买东西有没有省钱,交付结果明确。比起解释模型又提升了多少分,这些场景更容易让人看懂,AI 究竟能替自己做什么。

但最容易演示、传播的任务,难道就是 Personal Agent 最有价值的用武之地吗?

大公司想让 AI 下单,也难

Muse 爆火以后,很快遇到了平台的阻力。

当地时间 9 月 20 日,亚马逊表示已阻止 Muse 代表用户在其网站购物。亚马逊称,Meta 未事先告知 Muse 会访问其网站,Muse 浏览时也未标明代理身份,并对其处理用户凭据的方式提出隐私和安全担忧。

从技术角度来看,采用云虚拟机的 Personal Agent 方案,已经有过很多被禁止访问的案例。吕骋在接受科技媒体 WIRED 的采访时也提到:" 这些,我们一年半以前就经历过了。"

AI 能否稳定完成操作、替人下单,和是否获准操作,是两个问题。有时即使 Agent 知道该怎么操作,平台也未必放行,商业准入及背后的利益分配同样可能卡住订单。

平台担心的,除了账户安全和交易责任,还有自己的生意。

过去,用户在平台上搜索、比较、看推荐,平台从中赚取广告费和交易佣金。如果这些过程都交给 AI,用户可能只记得自己的 Personal Agent,不再关心订单来自哪家平台。平台可能失去影响用户选择的机会,广告和佣金的议价能力也会受到挑战。

Muse 受到关注后,Airbnb、Booking、Expedia 等旅游公司股价承压,就反映了市场对这种变化的担忧:未来的交易入口,究竟掌握在平台手里,还是 Personal Agent 手里?

Muse 的解决方式,是借助大公司的资源和影响力,构建起一套 Agent 友好的商业生态。

在被亚马逊拒绝后,Muse 与美国买菜平台 Instacart 宣布合作。旅行技术公司 Duffel 也宣布,美国 Muse 用户已可查询实时机票库存和价格,处理预订、取消及后续行程。

在用户端,Muse 提供免费使用额度,吸引更多用户使用,先让用户体验 Personal Agent 的成果,再逐渐培养习惯。

让更多平台接受 Agent,需要处理商业准入、利益分配和交易责任,也需要持续投入。Meta 这样的大公司,有资源吸引用户,也有能力影响生态。Muse 火起来的意义也在这里:推动更多服务接入,让 Personal Agent 有更多可用的场景。如果这些合作能带来更广泛的开放,也会为其他团队创造机会。

但资源有限的创业团队,很难照搬大公司的投入方式。它们更需要靠技术和产品创新,争取生存和发展的空间。

创业公司的方案

吕骋曾在采访中提到,只有 15 人团队的 Rabbit,会通过 Action Model 的多次迭代来完善 Personal Agent 的能力。

2024 年 1 月,随着 r1 的发布,Rabbit 的第一代 LAM 上线,当时只能通过 r1 使用;10 月,Rabbit 单独推出了 LAM playground,可以在网页端使用,Agent 能根据用户要求浏览网页、查找信息和执行操作。

按照当时的技术说明,它会结合页面截图和网页结构,判断可以点击的位置,并随着页面变化调整下一步行动。遇到陌生网站,Agent 会自己找到入口,把目标拆成操作步骤实现——这也是目前大部分 Personal Agent 仍采用的技术路线。

2025 年 2 月,Rabbit 发布了 Android Agent 研究预览,将 AI 的操作范围扩展到安卓应用和设备的系统功能。几个月后,有 AI 手机沿用了这套技术路线,结果被各大 App 禁止访问了。

直到今年初,Rabbit 把 LAM 升级为 DLAM,让 Agent 接入用户自己的 Windows 和 Mac 电脑,在获得授权后操作浏览器和桌面软件。

这套方案的效果是,通过真实设备执行任务,能够有效减少云端代理访问时遇到的限制。执行环境也由云端虚拟机延伸到用户自己的电脑,原来安装的软件、保存的文件和进行中的项目,都可以由 Agent 直接使用和处理。

从这些发布时间看,Rabbit 在 Personal Agent 的探索一直在行业领先。到了 OS3,Rabbit 又开始整合这些能力,探索下一代 Personal Agent 还需要解决什么问题。

OS3 的新探索

就在 Muse Charm 亮相的前一天,Rabbit 发布了 OS3。

用户不必先买一台 r1。打开网页,连接自己选择的模型和电脑,就可以让 OS3 使用现有的文件、软件和工具处理任务。一个账户最多连接五台设备,用户也可以通过 iMessage、Telegram 或 r1 进行交互。

这次发布演示的一项重点,是让用户一次交代多项任务,看 Agent 能否接得住。

吕骋一口气提出了几个要求:找一本哲学书,制作阅读指南,通过 Slack 发给自己;研究利物浦足球俱乐部,生成交互网页;再做一份 Agent 竞品分析,顺便给 OS3 写一本使用手册。

说完,他让 OS3 拆分任务、开始执行,自己在同一个对话里接着提问。

一个直观的交互变化,是 OS3 的网页主界面采用持续对话。用户可以在同一个对话里交代多件事,多个任务能在同时后台执行,互不干扰,用户自己还能继续提问,或者补充、修改前面的要求。

用户少做的安排,成了系统需要解决的问题:哪句话是新任务,哪句话在修改旧要求," 刚才那份文件 " 指的是哪一个,需要调取哪些已有信息。持续对话的意义,在于把一部分任务组织和上下文管理交给系统。

Rabbit 押注的是:个人助理应该能接住随时出现、不断变化的交代,让用户少花时间整理提示词和管理会话。

这个方向也有其它产品正在探索。Claude Code 近期开始测试的新版 Projects,同样让用户在一个主对话中提出需求,由 AI 拆分并协调后台任务。

OS3 还把这种安排延伸到了用户连接的设备上。听懂要求、拆好任务之后,它还得判断:需要哪些文件和工具,应该去哪台设备干活。

这涉及到 Rabbit 的第二个技术下注:接入用户已有的工作环境,并智能协调多台设备。

云端虚拟机有一个很直接的好处,那就是让用户可以关上电脑,任务留在云端继续执行。但除了平台访问的限制,还有另一项体验成本:用户需要把自己的工作搬进这个新环境。为了让 Agent 开始干活,用户需要在虚拟机重新登录账户、上传材料、配置工具。

但在用户自己的电脑里,这些东西早已存在:做到一半的项目、安装好的软件、几轮修改过的文件,以及长期积累的资料。

接入用户已有的设备,可以让 Agent 用上现成的文件和软件,减少重新准备工作环境的成本。

不过,接入用户的电脑,也意味着任务会受到设备状态的限制:电脑休眠或断网,在这台电脑上执行的任务就会停止。

OS3 采取的解决方案是,它支持连接最多五台设备,包括本地电脑、办公室机器,以及用户自己的云虚拟机。

如果任务需要某台电脑上的软件,就在那里操作;需要长时间运行的任务,则可以安排在持续在线的设备上。用户可以指定执行位置,也可以由系统根据任务智能选择某台设备,或在多台开机的设备间接力完成任务。

例如,OS3 可以自动找到在 A 电脑上的视频,然后使用有专业编辑软件的 B 电脑完成剪辑,再到登录账号的 C 电脑完成上传。能在多台设备间分配任务、接力执行的能力,目前似乎还没有其他 Agent 实现。

在实际使用时,我们尝试让 OS3 完成一项资料收集任务:调研 Muse Charm 并整理成报告,完成后发消息到手机。约 15 分钟后,手机就收到了 OS3 通过 iMessage 发来的完成通知,消息中列出了调研内容和报告在 iCloud 中的保存位置。

Muse 由 Meta 自家的 Muse Spark 驱动,OS3 则支持接入不同的模型服务,也可以使用本地模型。模型更新很快,用户可能因为能力、速度或价格,决定换一家服务。

国内的几家模型也都支持接入,我们在测试时使用了阿里的 Qwen,表现非常好。

按照 Rabbit 的设计,更换模型后,此前积累的记忆、配置的技能和连接的设备可以保留。OS3 本身免费,使用云端模型需自备受支持服务的 API 密钥,并按用量付费。

Rabbit 希望 OS3 能承接这部分积累,底层模型可以更新,用户与 Personal Agent 之间已经建立的工作关系继续保留。一个 Personal Agent 逐渐知道你在做什么项目、习惯怎样处理文件、哪些事情此前已经讨论过,这些积累不应该随着模型更换而作废。

我们在 Rabbit 的 Community 里了解到,Rabbit OS3 上线三天内,新用户累计已成功完成超过 1 万个任务,用户使用自己的 API key 每天消耗总量近 10 亿 token,人均水平远高于大部分 Agent 类产品。

一个长期使用的 Personal Agent,还需要能核实任务结果,并把用户的反馈用到下一次工作中,让上次被纠正过的错误,下次能够避免。只有当用户越来越少地重复交代、检查和返工,Agent 才真正替人省下了时间。

模型进步能提升理解和执行能力,平台合作能带来更多可用的服务,而如何用好这些能力,仍需要产品不断探索。

下一代 Personal Agent,既需要生态为它打开更多可能,也需要一个个具体的创新,让它真正好用。

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容