关于ZAKER Skills 合作
硅星人 19分钟前

第一时间实测千问 Agent:让 AI 链接服务有了初始态

AI 走到今天,模型够聪明了。你让它写代码、做分析、编段子,基本都能交活。但你让它帮你办一件真事,订个机票、看看持仓该不该调、找个靠谱的月嫂就卡住了。

问题不在于它不会理解你的需求,而在于它还很难真正进入现实世界的流程。

过去一年,很多人试图用一种 " 绕过去 " 的办法解决这个问题:让 AI 像人一样操作软件,但这大幅度依赖于技术实现,如今并不稳定。

所以另一个方向开始变得更重要:不是让 AI 去 " 模仿人 " 操作世界,而是让服务本身主动接入 AI。

8 月 10 日,千问开放平台正式上线,首批接入盈米基金、飞常准、天鹅到家等十几家生态伙伴,AI 有了更多直接调用真实世界服务的能力。

我们在第一时间进行了实测,发现相比让 AI 学会操作每一个 App,千问这次验证的是一条看起来更麻烦、但实际上更现实的路径。

Agent 从搜索走向办事,差的是什么?

在真实生活里,哪些需求是你明明存在,但现有互联网产品很难直接解决的?

第一类,是高度个性化的服务需求。

很多服务行业到今天还得靠人工客服一轮轮沟通,原因很简单:需求本身太难标准化。找月嫂就是典型场景。

你真正的需求,往往没法被一个搜索词概括。我把这个场景扔给了天鹅到家的 Agent:

我是头胎,预产期 10 月中旬,坐标北京。情况比较特殊:我婆婆很强势,一定要来 " 指导 " 月子,所以我需要一个性格有主见、能用专业知识说服老人的月嫂,不能是那种唯唯诺诺的。另外我有甲状腺问题在吃优甲乐,月子餐需要懂特殊体质的搭配。预算 2 万左右,通乳催乳可以另外付。帮我看看:1)这个预算在北京能找到符合条件的吗;2)一般什么时候预约不会被抢光;3)面试月嫂的时候我应该问哪些关键问题来判断她是不是真的有主见。

" 北京 月嫂 2 万 " 当然能搜出一堆结果,但 " 婆婆强势、雇主有甲状腺问题、用户需要的是一个既懂护理又能扛住家庭压力的人。这些细节,过去只能跟顾问在电话里聊三四轮。

千问里天鹅到家 Agent 没有直接甩给我一个月嫂列表。它先判断预算:2 万在北京大概卡在中高级月嫂区间,够用但不宽裕。然后提醒时间:8 月已经是锁定 10 月档期的最后窗口期,9 月再找就很可能只能捡漏。

更有意思的是,它针对 " 甲状腺 + 强势婆婆 " 这个组合,给了 5 道面试题。问题不是 " 你做了几年月嫂 " 这种套话,而是直接进入真实冲突:" 婆婆坚持不开窗、不洗澡、喝浓汤,你怎么处理?"" 产妇吃了和优甲乐间隔不够的十字花科蔬菜,你怎么办?"

一轮对话下来,预算判断、时间提醒、面试策略、具体推荐都给到了,至少节省了 3 通电话沟通的时间。

第二类,是需要个人化诊断的复杂决策,尤其是在用户自己并不完全弄懂的领域。

比如说理财顾问。在网上搜 " 我的基金组合怎么样 ",得到的大概率是 " 建议分散投资 "" 注意风险控制 " 这种正确但没用的话。真正帮你看持仓、指出问题、告诉你该怎么调的服务,以前更接近私人银行或投顾客户才能拿到的东西。

我用盈米基金的 " 且慢小顾 " 测了一个组合:

我的持仓:30% 天弘中证银行 ETF 连接 C,25% 嘉实中证 500ETF 连接 C,25% 国泰中证钢铁 ETF 连接 C,20% 财通中证香港红利等权 C。最近一个月总收益还没跑赢余额宝,我有点慌。帮我分析:1)这个组合的行业集中度是不是太高了;2)这几只之间相关性怎么样,会不会跌的时候一起跌;3)如果想降低波动但保持差不多的收益预期,具体怎么调——调哪只、换成什么、比例怎么分。

比较惊喜的是它第一步没有急着分析,而是先纠错。它发现组合里的 " 财通中证香港红利等权 C" 在 2023 年已经清算退市,于是直接提示这只基金不存在了。

然后它按剩下三只基金重新计算比例,联网取数,再给出诊断:银行和钢铁两个强周期行业合计占比接近 69%,相关性太高,市场下行时容易一起跌。最后的调仓建议也落到了操作层面:清掉钢铁,换入债券和宽基,降低组合波动。

最后还有我们最常见的一类,是实时信息分散但需要最终判断的场景。

比如说出行决策就是这种。延误率在一个 App 里,转机时间在另一个 App 里,航站楼动线要自己查,联程保护政策可能还得翻航司官网。信息不是没有,但散在五六个地方。最后 " 这个方案能不能走 "" 要不要改签 ",还是得你自己判断。

我用千问里的飞常准测了一个国庆转机方案:上海飞成都,再从成都转拉萨,中间只有 2 小时 15 分钟,时间是 10 月 3 日返程高峰。

它把几个原本分散的信息拉到了一起:成都天府机场两个航站楼之间转场大概要 30 到 45 分钟;如果是同票号,有联程保护,分开买则没有;国庆高峰期运行压力更大,延误风险更高。

最后它给出的结论很明确:这个方案容错太小,误机风险偏高,建议把第一程改到更早的航班,至少留出 3 到 4 小时缓冲。这一步很重要。它提供的不只是航班信息,而是一个明确的行动建议:这个方案最好改。

生态才是 AI 办事的入口

前面三个实测放在一起看,能看到一个变化:把现行服务生态搬到 AI 上,是有可能性的,而且已经具备初步可用性。

这也是千问开放平台真正值得看的地方。千问模型开源解决的是底层能力问题:AI 能不能更聪明,能不能被更多人用起来。开放平台解决的是另一层问题:聪明的 AI 怎么接上真实世界。

所以开放平台做的,不是再造一个聊天入口,而是让已有行业能力进入 AI。航旅、基金、家政这些原本分散在不同 App、客服、顾问和官网里的服务,被封装成 AI 可以调用的能力。

现在还只是第一步:用户主动找到某个 Agent,说出需求,由 Agent 完成响应。体验上,相当于从 " 在五六个 App 之间跳来跳去 ",变成 " 在一个 AI 入口里用自然语言办事 "。

下一步才更关键:AI 自己判断该调用哪个子 Agent。当用户提出 " 我下周去成都出差 ",它自动拆出航班、酒店、天气、日历、报销标准,再分发给不同 Agent 处理,最后串成一个方案。

但智能调度的前提,是生态先搭起来。真实世界本来就不是一个统一接口,它由一个个行业系统组成。千问这次验证的价值在于,它开始把这些系统接进 AI。

先让 AI 有手有脚,再让它学会什么时候该动手。这个顺序,可能才是 Agent 从搜索走向办事的现实路径。

最新评论

没有更多评论了
硅星人

硅星人

硅是创造未来的基础,欢迎登陆硅星球。

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容