关于ZAKER Skills GEO服务 合作
钛媒体 4小时前

易鑫解码“ Human-Centric Long Horizon Agent ”:企业级 Agent 最难的不是完成任务,是理解人

易鑫首席 AI 科学家、高级副总裁张磊

" 对 Agent 来说,完成一件事可能不是最难的,最难的是怎么理解人。" 说这话的是易鑫首席 AI 科学家、高级副总裁张磊。他所在的公司,做的正是这门 " 最难 " 的生意——汽车金融。

一笔汽车融资申请,要经过材料提交、审批决策、方案匹配、交付签约、资产管理五个大环节。仅材料就有 60 多种,审批决策涉及多达 15 个组织节点,路径组合上万种。而且这条链路不是线性走完的,任何一个节点,都可能回跳到前面任意一个节点。

这让大多数 Agent 在这里 " 过早收工 "。张磊举了个例子:一个用户第一天进来,第三天补充资料,第七天额度发生变化、走了审批;到第十天,所有方案都试过了,没有适合他的。常规 Agent 到这里就会说," 我的任务结束了 "。但真正的 Agent 会在第 80 天回头,那时公司接入了新的资方、有了新的产品,它会重新找到这个客户:" 你还有没有相应的需求?我现在有东西可以满足你。"

一笔业务的成败,就分在第十天和第八十天之间。

也正因此,张磊对眼下衡量 Agent 的主流标准并不买账。行业里判断一个 Agent 厉不厉害,常说的是它能不能无干扰地跑完 100 步,能不能写出复杂的软件,或者操作几十页的网页逻辑。" 但在企业应用里,更重要的是:给定一个业务目标之后,你能不能持续面对一个不断变化的人做交互,最终推动出一个业务结果。"

为此,易鑫提出了一套自己的范式—— Human-Centric Long-Horizon Agent,即 " 以人为中心的长程智能体 "。它由人的理解模型、垂直领域模型和 Harness 三部分组成,Harness 又分三层:数据的 Harness、Agent 的 Harness、人的 Harness。前两者解决 " 懂人 ",后者解决 " 能不能长期稳定地跑 "。在张磊看来,让 Agent 出结果并不难,难的是它怎么长期稳定运行,这才是 Harness 在企业的价值。张磊透露,这套 Harness 框架计划在年底开源。

不过,他并不认为 Agent 应该包办一切。在易鑫的框架里,人的位置被明确保留:合规熔断(模型幻觉触碰强监管规则)、重大权益(比如罚息减免)、特批这类意外场景,三类必须转人工。

目前这套系统在线上的运转情况是 45 个 Agent,日均处理任务约 23 万次,每天消耗约 3.6 亿 Token;AI 能独立跟进同一个用户超过 20 天,单个任务执行超过 16 小时,单次对话超过 81 轮,且横跨企业微信、微信等渠道。

以下是易鑫首席 AI 科学家、高级副总裁张磊的发言速记,略经笔者编辑:

各位嘉宾下午好!我是来自易鑫的张磊,今天分享的主题是 " 工具到原生,汽车金融全链路的 Agent 革命 "。

过去我们讲 Agent,更多讲的是它够不够智能、能不能更智能地调用工具、完成各式各样的任务。但在实际的行业应用里我们发现,对 Agent 来说最难的其实是理解人,因为它面对的是不断变化的人。所以怎么理解人、怎么影响人,以及最终怎么拿到业务结果,我认为这才是产业落地中更关键的能力。

接下来的分享主要是我们在这方面的思考。先简单介绍一下公司:易鑫是一家 AI 驱动的金融平台,有 12 年的行业积累,研发上也一直在大举投入。我们是整个汽车金融领域里第一家开源行业模型的公司,也是行业里第一家通过国家大模型备案的公司。同时我们跟开源社区有比较好的合作,近期把底层的 GPU 虚拟化工作也开源到社区了。在去年 " 直通乌镇 " 全球互联网大赛的开源赛道里,我们拿下了唯一的一等奖。

对汽车金融来说,为什么需要 Agent?核心本质上是因为汽车金融是一个长链路、决策复杂、动态决策、强合规,以及结果导向的业务。可以看到,当一个用户进来,他会流过大概五个大环节,材料提交、审批决策、方案匹配、交付签约,然后是资产管理。每个环节里都会有很多子流程,比如材料提交涉及 60 多种材料,还要根据不同的场景去做组合。

审批决策里有 15 个组织节点,整个决策路径的组合大概有上万种。而且整个链路不是从左到右线性顺序执行的,左边的任何一个节点,都有可能回跳到前面的任何一个节点。所以这个过程没办法像传统 Agent 那样,用流程自动化去解决。

所以在这样的场景下,就急需新型的 Agent 去解决这些问题。为此我们提出了一个新的 AI 范式,叫 Human-Centric Long-Horizon Agent。这个范式主要有三个部分,第一部分是人的理解模型,第二部分是垂直领域模型,最后一部分就是常说的 Harness,我们把它分成了三层,数据的 Harness、Agent 的 Harness 和人的 Harness。

为什么需要这三个组成部分?核心原因在于:当 Agent 具备工具能力的时候,它可以很好地完成任务;当它懂行业的时候,就能很好地完成业务任务。而当你以人为核心服务对象的时候,整个系统、整个 Agent 就应该更懂人。你要知道人在想什么,才有可能更好地服务用户。所以我们认为,接下来尤其在企业 Agent 领域,会逐步过渡:更好地理解人,才是提升 Agent 效果的关键。

对 Agent 来说,完成一件事可能不是最难的,最难的是怎么理解人。围绕人的整个过程中,传统系统更多是在记录已经过去、已经结束的事情。比如一个人提交了融资审批,他当下的状态是什么,传统系统更多是在记录这种完成的状态。

但实际上,如果你想很好地服务人,就必须知道这个人接下来的状态是什么:他是不是有购车意向,他是不是信任你。整个过程是在环境不断变化中同时交互,同时对这个人的状态和行为做预测。

所以我们基于这套想法做了一个模型出来。它本质上是一个随机过程,输入是整体的语言环境和行为信号,输出是人的行为接下来应该如何变化、他的状态是什么样。

相比传统的 Agent,它做的是管理建模,我们更多是在人的状态粒度上做建模。这意味着,人的状态不是一个静态的用户画像,而是一个随着交互和环境变化持续变化的状态建模,一种持续性的建模。

其实现在行业里谈 Long-Horizon,包括大家去判断一个 Agent 到底厉不厉害,经常会说它能不能无干扰地完成一个比如 100 步的任务,能不能写一些复杂的软件,或者操作几十页的网页逻辑。

但在企业应用里,我觉得可能更重要的是:给定一个业务目标之后,我们能不能持续面对一个不断变化的人去做交互,最终推动出一个业务结果。

这里以汽车金融为例,一个用户第一天进来,第三天他可能到了补充资料的阶段,第七天他的额度发生变化,走了审批决策;到第十天发现所有方案都尝试过了,但没有适合他的。这时候常规的 Agent 可能就会说," 我的任务结束了 "。但真正意义上的 Agent,会比如在到了第 80 天的时候,因为我们接入了新的资方、有了新的金融产品,反过来去找这个客户," 你还有没有相应的需求?我现在有东西可以满足你。"

另外,当用户到了第 480 天、合同快要结束的时候,AI 会主动去做这种访客营销。整个决策的过程中,每一个节点其实都是由 Agent 独立承担的,但所有 Agent 背后其实是同一套程序运行循环的机制在支撑:目标拆解、规划决策、执行、观察反馈、交互,以及持续推进,它会变成一个大的闭环。

同时,对 Agent model 来说,很重要的一个内化能力叫 Persuasion Policy,它能够动态决定我到底在什么时间去跟进这个用户、我应该说什么、不应该说什么、在什么渠道先跟他讲。所以整体它是以最大化长期转化为目标的。它的目标不是一次对话有多好,所谓最大化长期转化,对应的其实就是业务结果——我优化的是最终的业务结果。

举个例子,比如这里的预约率、到店率、成交率、渗透率等等。所以我们认为,这可能才是企业真正需要的 Long-Horizon。前面有了 model、有了 Agent,为什么还需要 Harness?我们的任务是说,企业里面真正要去运转 AI Agent 这件事,能不能出结果,我觉得是很容易的;但最难的是它怎么能够长期稳定地运行,这就是 Harness 在企业里的价值。跟传统的 Agent 相比,我们不太一样的地方在于,我们会基于用户的关系去做建模,这里面包括五大板块。

第一个板块是管理,它回答的主要是 " 发生了什么 "。举个例子,我在 9 月份提交了 30 万的融资申请。第二部分是 " 正在发生什么 ",这个用户中间还差一份资料没有补齐。第三部分是 Agent 怎么看待这个用户、这个客户,这块的上下文主要由 model 提供。比如客户购车意图的概率大概是 70%,但他对月供的敏感度概率是 90%。这就是这一块要做的事。

第四是目标管理。其实每一个子阶段都会有一个相应的目标,我要去推动这个目标往前走。还以刚才的客户为例,这个阶段的目标可能就是完成 " 进店提报 "。最后一个板块是,知道所有信息之后,我接下来要怎么办?同样以刚才的客户为例,接下来的动作应该是打消用户对月供的疑虑。

同时,在企业落地的过程中,逻辑上并不是所有角色都能交给 AI 去做,这里面有三个典型的场景。

第一个场景是合规熔断。比如大模型因为幻觉,出现了一些触碰强监管规则的内容,或者跟用户对话的过程中,用户产生了一些触碰规则的事件,这个时候就要迅速转人工。

第二种是涉及重大权益的,比如某一个单子需要做罚息减免,这个时候可能就要转到人去做判断;再比如一些意外的场景,比如特批流程,也需要转到人。

所以在 Harness 框架下面,其实是融合了 Agent 自己以及人本身。同时我们也会有相应的 RSI 这一套逻辑机制。在这个管理过程中,我们会形成相应的、用于训练模型的数据轨迹,这个轨迹未来会有一个小循环或者大循环去做优化,小循环主要是 skill 粒度的优化,大循环主要是基于 model 去做优化。

我们认为 Harness 框架本质上就是一个持续运行、持续反馈、持续优化的过程。我们计划在年底的时候,把这套框架开源出来。

综合以上讲的内容,我大概做一个总结,对比一下到底有什么区别。前者主要是在优化任务的执行,以及执行过程中怎么做规划和推理、怎么做工具的编排、怎么去完成它的一个 flow,最终成没成功,这件事取决于任务是否完成,完成了就代表成功。

后者主要是在优化人的决策过程。除了要持久化用户的记忆,还需要对用户做信任和意图的建模,需要去做关系的管理。最终你成没成功,其实在于你有没有产生收益、有没有转化成功。所以本质上我们认为,未来 AI Agent 在企业的应用,会从任务的执行过渡到 Harness。

这个是我们实际运转中的应用效果。目前在线上一共有 45 个 Agent 在跑,日均处理任务大概 23 万次,每天大概消耗 3.6 亿 Token。因为我们整个集团有自己的训推一体化平台,所以整个 model 都是在这个平台上跑的。

Agent 的自主交付率现在达到 90%,整体的运营提效大概是 45.4%,线索从接触到成交平均大概 3 天。AI 现在可以独立地跟进同一个用户超过 20 天,单个任务的执行时长超过 16 个小时,单次对话超过 81 轮——这些对话可能发生在企业微信,也可能发生在微信,是一个跨渠道的逻辑,全程的信息交互大概超过了 400 条。同时我们也有商业化的产品,是一站式的 AI 智能服务解决方案。

目前有三个大的核心板块,一个是做智能硬件,鑫灵盾是做风控的决策系统,鑫智管是做资管的服务系统。然后底层 Model 是我们自己的一套新的推理模型,以及整个新系列不同尺寸的 Model。

在整个应用的规模上,产品应用上大概累计有 1.44 亿次的使用,覆盖了智能呼叫(每天 10 万通)、智能辨识、智能审批、客服、资管、质检等,基本上覆盖了整个行业的所有场景。

除了提供技术方案之外,我们也有生态合作伙伴,这里面包括 80 家以上的互联网企业、100 多家主机厂、100 多家金融机构,以及 4 万多家经销商。

最后我想分享一下今天的核心观点。我们认为,未来企业 Agent 的 AI 进化会逐步过渡,整个模式可能不只是适用于汽车金融这个行业,也适用于所有类似的、需要交付业务结果的场景。谢谢大家!(本文首发钛媒体 APP,文 | 智客 Zhiker,作者|郭虹妘,编辑|杨林)

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容