关于ZAKER Skills 合作
钛媒体 36分钟前

大厂 AI 入口大战升级,谁是最能干活的桌面 Agent?

文 | 划重点 KeyPoints,作者|心怡,编辑|重点君

互联网大厂间的 AI 入口大战打到了桌面端。

先说一条刚出炉的消息。据《财经》7 月 21 日报道,阿里即将推出千问办公,把 QoderWork、悟空、MuleRun 三款 Agent 产品合并成,交给钉钉新任 CEO 陈宇森负责。

不止阿里,腾讯也正把资源集中到 WorkBuddy 上,字节内部讨论把飞书和豆包办公深度整合。

信号很明确,持续半年的大厂 Agent" 赛马 " 结束,C 端的入口大战刚歇,各家开始把资源集中到新战场:桌面 Agent 的入口大战升级了。

目前战况如何?数据显示,WorkBuddy 今年 7 月 DAU 已突破 1300 万,是国内用户活跃度最高的 Agent 办公产品。再看一组访问量数据,从六月桌面 AI 原生办公智能体的访问量看,腾讯 WorkBuddy、阿里 QoderWork 排在第一梯队。

四位选手各有来头。

WorkBuddy 产品底座沿用打磨两年多的 CodeBuddy 内核,马化腾在财报会上直接称它是 " 中国使用最广的效率智能体服务 "。

豆包专业版背靠字节自家的 Seedream、Seedance,是四家里多模态弹药比较足的一个,但只跑自家模型、生态也有些封闭。

百度搭子入局较晚但动作密集、持续升级,7 月刚甩出个人版升级、企业版和 " 搭子联盟 " 三个更新。

QoderWork 是阿里把 Agent 能力从代码搬到办公的产物,招牌是带下载量排行的技能市场和 15 套专家套件,即将要升格为 " 千问办公 " 的底座。

一线城市机场和地铁的广告位上,大家都说自己是六边形战士。但用户更多只关心一件事:今天要选一款 Agent,到底谁能真正干活?

这次,我们挑两个高频的真实工作场景,同一台 Mac、同样的提示词、注册即得的免费档,把四家放在到一起对比。

两个真实工作场景,看谁最能干活

两个场景各代表一类办公刚需,一个是重复操作型,考的是手勤不勤;一个是内容生产型,考的是脑子和手艺。

事情不难,但是人工做起来真的很费事,能偷的懒还是偷一偷。

因此,我们需要检查桌面 Agent 能不能自己 " 坐到电脑前 ",把鼠标键盘用起来,从头跑完流程,最后交给我们一份能直接用的本地文件,而不是像问答 AI 只给到一个 " 你可以这样做 " 的方法。

这样一来,权限申请顺不顺、过程看不看得见、耗时稳不稳,也都在观察范围内。

场景一

我们给四位选手同一条提示词:

不得不说,用工具和测工具难的不是任务本身,整个过程很像做实验,环境没理顺,出 bug 总让人心里堵、想放弃。

WorkBuddy 我们前几次就没测成功,细看发现它硬啃反爬、卡在无头浏览器安装上,Agent 直接放弃,任务黄了。

下面的成绩,都是环境理顺之后的正式记录。

WorkBuddy 老老实实地打开了 openai.com/news,最终页面只渲染出 9 条,命令行 curl 又被反爬挡下(403)。但这次它没一条道走到黑,转头找到官方 RSS 订阅源作为 " 最新更新 " 的权威口径,按时间倒序取满 10 条,在桌面生成了两张表:最近 10 条明细 +Agent 中文速览独立页,还自检了一遍链接可用。

全程花了约 4 分钟,但我好像被骗了。任务是 33 分启动、37 分才真正跑完,但界面上的 " 完成时间 " 始终停在 33 分,有一点掩耳盗铃的意味。

测下来,腾讯 WorkBuddy 任务执行先受阻,然后靠 RSS 兜底把活干完。

百度搭子在任务开始前一次性申请权限、显示开始时间,执行时直接跳到默认浏览器,你能亲眼看着它滚动翻页取数,全程约 4 分钟。产出 10 条,但摘要整列是英文、没做中文化,链接也被塞进摘要单元格,没独立成列。

测下来,百度搭子过程相对透明,速度也较快。

豆包的过程就比较偏黑箱,任务开始时不提示开始时间、网页滚动也不显示。最终产出 10 条,中文摘要的信息密度在四家里数一数二(带具体数字),也是唯一把 "Agent 中文速览 " 做进 Excel 独立页的一家。对照官方 RSS 时间序,它抓的这 10 条恰恰贴近字面的 " 最近 "。

测下来,豆包摘要比较扎实,抓得也算准。

QoderWork 选择走软件内置浏览器检索,约 12 分钟,四家里垫底。前期没有人工验证会一直空等;后期「真人验证」反复 5 次以上才过,交互比较磨人。产出结构还算规范,一共有 7 列、中英双标题、带分类与可点链接。比较糟糕的是把一条内容的日期认错成 7-15,连带漏掉了真正 7-15 的新闻。

测下来,QoderWork 结构规范,但慢、手动卡人机验证。

同一句提示,四家抓出的 " 最近 10 条 " 并不重合( = 命中)

有意思的是,这四家抓出的最近 10 条,只有四条对上了。

我们将四份产出并排一放,只有 4 条是四家共有的,其余各不相同。

分析原因发现不是谁抓错了,而在 openai.com/news 本身有两套顺序:默认卡片视图是编辑精选序,RSS 是纯时间倒序。豆包和 WorkBuddy 落在时间序阵营,贴近字面的 " 最近 ";百度搭子和 QoderWork 跟着页面卡片,贴近 " 人打开页面第一眼看到的 "。两边都不算错,但好的 Agent 应该主动告诉你,它用的是哪种口径。

Agent 能力测评,真正拉开差距的,不是谁点得漂亮,而是最后到底有没有把东西交出来。

百度搭子、豆包和 QoderWork 全程真机点击,自己一步步跑完;WorkBuddy 一条路走不通然后就退回 RSS 抄道。

但说到底,桌面 Agent 能不能甩给我们一份打开就能用的文件,比它中间走哪条路重要得多。卡住的时候,肯绕路的往往比硬顶的更管用。

场景二

换个身份代入一下。假设你是个做 AI 的自媒体博主,或者给博主打工的运营。7 月模型圈炸了锅,这波热度必须蹭。Agent 要先摸清楚这个月发生的时间,挑一个有爆款相的选题,一口气把公众号文章、小红书图文、数字人口播视频(还是很有难度的)这三件套全出齐。

这题评的是干活和交付的水准,模型新闻本身真假不核实。四家检索出来的核心事实高度一致,个别对不上的地方在点评里标出来了。

四款提示词一样:

四位选手,一个个上。

WorkBuddy 一上来先建了个任务追踪,把活拆成盘点「选题→三件套→配图」,全程 3 分 16 秒,四家里最快。选题定的是《全球最大开源模型诞生——中国开源联军改写 AI 游戏规则?》钩子还不错,自带开源 vs 闭源的冲突感。

最亮眼的是公众号直接给了能渲染的 HTML 成品,头图压着标题,还甩出金句 " 美国卖铲子,中国发铲子还包邮 ",全文约 900 字,符合字数要求;小红书、口播稿、分镜表一样不落,4 张配图风格还挺统一。唯一没跑完的是数字人成片(本机没渲染引擎),但它老实交代了,还主动给了个替补方案。

测下来,腾讯 WorkBuddy,快,省心,东西拿到手就能用。

百度搭子动手前先正经做了需求分析,交付前还查了字数、精简了两回。它检索的数据在四家里算细的,跑分、定价、股价波动,全都有出处。选题《七月 AI 大乱斗》,冲突和情绪拉满。公众号走的是深度分析路子,还多合成了一段 TTS 口播音频,下载途中代理挂了,它自己用 curl 绕了过去。

不过也做的差的地方,正文 1510 字,比 1500 的硬线多了 10 个字;成品是 .md,不是能直接渲染的 HTML。

测下来,流程一板一眼,检索真的有点实力。

比赛的四家里就豆包一个命中了专门的自媒体写作技能,下笔前先把公众号、小红书、短视频分镜这些平台规范挨个读了一遍,干活的路数也像个老练的新媒体编辑。

细看发现检索面也广,光国产阵营就盘进来 6 家以上。

真正拉开差距的是专业度,公众号约 1400 字,附 4 个备选标题,还逐条核对了来源做内容验真;小红书连置顶评论怎么写、怎么连发矩阵、怎么回评都给了。配图里那张标着真实模型名的阵营对比图,是四家里最贴题的,另外还有数字人形象图和 TTS 语音。交付方式也独一份:所有成品写进一份飞书在线文档,复制就能发。毛病是头图有点文字错乱,思考独白啰嗦了些。

测下来,豆包算是一个学好规矩再动笔的学生。

QoderWork 本次耗时约 10 分钟,属于比较慢的选手。选题 " 轮到闭源巨头睡不着了 ",钩子合格,公众号约 1480 字构挺整,小红书和口播稿也都有。真正栽跟头在多媒体:配图服务出故障,重试 6 次全败,图片生成失败,音频视频也没影。结尾反问了一句 " 需要我现在重试出图吗 ",已经忘记我们 " 一遍跑通 " 的要求。

测下来,这位选手属于是文字过关,配图有点糟糕。

图为:Agent 耗时相对速度

配图和多媒体,这才是这道题真正拉开距离的地方。

三家成功出图、风格统一、拿来就能用:WorkBuddy 出了 4 张,百度搭子 3 张配图外加一段 TTS 音频,豆包的图相对最对题、数字人形象也做得突出;QoderWork 呢,颗粒无收。

图为:各家生成配图与多媒体成果对比截图

文字这关,四家都不错。真正把高下分出来的,是谁能带着编辑规范和运营策略,把成品直接交到你手上,能做到这步,Agent 才算得上一个靠谱同事。

跑下来最深的一点感受是:东西能不能直接用,远比文字漂不漂亮值钱。飞书文档、能渲染的 HTML,拿到手就能发;换成只丢给你一堆文字加提示词的,乍看挺齐全,真要落地,剩下的活还得你自己干。

多媒体是道硬门槛,出了岔子能兜住才算有实力。任务遇阻卡住了但肯绕条路把活交付,比闷头硬扛强得多,毕竟谁喜欢不能干活给公司憋大雷的同事呢。

价格:这笔账得单独算

实测下来,好消息是大家都给了免费额度,多数情况下跑个一两个任务是够用的。

我原本也是这么打算的,不充值,就当个普通用户,拿免费额度老老实实跑一跑,这样也更贴合大家平时的真实用法。结果谁知道,跑到豆包这儿就提示余额不足了,我只能咬牙充了 68 块把第二个任务跑完……

所以话说回来,真打算重度用之前,还是建议先拿免费档把你天天要干的活跑一遍,看看积分烧得快不快,再决定这钱怎么掏。

谁会终结这场比赛?

两个场景跑完,没有全能冠军,但我们摸清了各位当下擅长什么。

四家广告打得正凶,真正的胜负手根本还没露面。

这场比赛的玩法,也正在悄悄改变。

上半年整个行业烧钱烧出一条教训,Agent 能生成,不等于活能交付。生成一快,复核、判断、担责这些得人来干的环节反倒成了堵点。

有研究说,自主编程 Agent 能把代码提交量拉高 120%,可真正上线的只剩三成。就好比后厨切菜快了三倍,餐厅一天还是卖那么多桌。

所以谁赢,现在下结论太早。对用户来说,想清楚最常干的那件事,拿免费额度把它跑通,再决定掏不掏钱。

我们测的时候,这几款产品几乎是一天一个样,功能天天在变,所以这回只挑了两个场景跑,不敢说测全了。

而且现在有个大趋势,各家 Agent 都在抢入口,Agent 正从电脑桌面往手机上挪。一个方向是手机端和桌面的联动,你人在外面,用手机就能给电脑上的 Agent 派活,回头它在电脑那头默默把事办了。另一个方向更有意思,是往微信这种 IM 里钻,你在微信或者飞书里随手一句话,活就交出去了,连 App 都不用专门打开。

这俩场景眼下都挺热,可惜这次没赶上测,我们留到下一轮再看。

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容