文|AI 大模型工场,作者|冰拿铁,编辑|星奈
2026 年过一半,全球 AI 行业本该见证属于 Coding 赛道的高光时刻。
Kimi K3 的发布被寄予厚望,国产大模型在代码能力上对 Claude 的追赶,似乎只差 " 临门一脚 "。
然而,这 " 临门一脚 " 不仅没能踢开胜利的大门,反而一脚踢崩了资本市场:
发布次日,智谱股价暴跌 28.49%,MiniMax 暴跌 15.62%,大洋彼岸同样寒意逼人。美国 AI 板块随之集体下挫,即便是一度被视为独立模型公司天花板的 Anthropic,其二级市场估值预期也面临显著回调。
这就很反差,你可能很好奇,明明技术取得了突破,为何资本市场反手就是一巴掌?
原因并不复杂,Coding 赛道正在陷入残酷的 " 马太效应 " 内卷中。
Claude 依然牢牢攥住全球超六成的 Coding 请求,而国产头部模型即便在内部测试中已宣称接近 Claude 的水平,实际对比下仍存差距。这看似一步之遥的距离,恰恰是其估值逻辑的 " 阿喀琉斯之踵 "。
随着 Coding 场景下的同质化竞争全面提速,各家模型在主流 Benchmark 上咬得越来越紧,用户切换 API 的迁移成本却无限趋近于零,如今,Coding API 也开始卷起 Token 价格战时,资本终于忍不住追问一个本质问题:
这个赛道的护城河,到底在哪里?
值得注意的是,就在 " 语言大模型 " 贴身肉搏时,另一条赛道却跑出了发展加速度,有一家视觉生成赛道的公司悄悄拿到了 15 亿元融资。

社保基金、工银资本、华策影视…… " 国家队 " 和产业资本领衔的多元资本,正在用真金白银悄悄押注一家叫智象未来的公司。
这让行业感慨,众里寻他千百度,暮然回首,风口却在灯火阑珊处:
大模型公司的下一个主战场,可能不在代码里,视觉多模态,正在成为大模型公司下一个兵家必争之地。
多模态视觉赛道,坡长雪厚
把目光从代码的红海上移开,你会看到另一片蓬勃生长的绿洲。
如果说 Coding 赛道是 " 存量博弈 ",那么视觉生成赛道就是 " 增量爆发 "。
近两年,视频生成和图像生成早已不是实验室里的 " 玩具 ",而是展现出高确定性和高成长性的商业赛道。更重要的是,在多模态视觉领域,中国企业展现出了引领全球的底气和优势。
而在这条赛道上,智象未来的崛起速度令人侧目。

其最新完成的 C 轮融资,金额达 15 亿元,由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视等多家机构跟投,老股东合肥产投、东方富海、金浦投资、金华金投、中哲创、财鑫资本持续加注。
拆解这份投资方名单,你会发现它的 " 含金量 " 远不止于金额本身。
这是一个极为稀缺的 " 复合型资本结构 ":国家队耐心资本、金融国家队、影视产业国家队、头部产业资本、顶级市场化 VC。
朋友们,在一个多模态模型赛道上同时获得五类投资方认可的公司,屈指可数啊,难度不亚于集齐七颗龙珠。
这些投资者抢占的是啥?
答案是 " 视觉生成作为下一代世界模型入口 " 的战略高地。不止于此,视觉赛道与 Coding 赛道的主流叙事截然不同,行业竞争已从 " 单一模型参数竞赛 " 升级为综合竞争,头部厂商也更具护城河。
什么是综合竞争?就是说,模型能力只是入场券,数据稀缺性、产品化能力、工程效率、行业 Know-how 和工作流深度绑定,才是真正的胜负手。单纯依赖单一大模型服务,越来越容易陷入价格战与性能追赶的双重压力。
视觉模型的逻辑完全不同。它的底层模型、数据壁垒更高,要有高质量图像、视频、影视素材涉及版权、IP 和品牌规范;工程壁垒更高,又有需要处理空间、时间、运动、光影、物理规律和多主体交互;
评价体系更复杂,审美、镜头语言、风格一致性、可控性和业务转化效果缺一不可;工作流绑定更深,一旦嵌入影视制作、广告营销、电商内容的生产流程,迁移成本极高。
下面,我们就以 " 国家队 " 重仓的智象未来为例,拆解一下这个赛道的护城河。
视觉赛道的 SOTA 级产品,长什么样
如果你还停留在 "AI 视频就是 Sora 那个样子 " 的认知里,那你已经落后了两个时代。
Sora 们长什么样,一个输入框,一个生成按钮。你敲一段 prompt,等几十秒,出来一段几秒钟的视频。不满意,再敲一段 prompt,重新 " 开盒 "。
每次生成都是孤立的,角色不连续、风格不稳定、镜头之间没有逻辑关系。它不记得上次做了什么,也不理解你真正想要一个什么样的作品。这种模式,对生成一段 15 秒的 " 整活 " 画面够用,但对 " 做一个完整的视频项目 " 来说,远远不够。
AI 视频生成从来不是一锤子买卖,TA 是一个反复修改、持续迭代的创作过程。
智象未来在今年 WAIC 上发布的全球首个无限时长内容创作智能体 vivago R1,彻底改写了 Sora 们的逻辑。

中间是专家层,编剧、导演、设计师、剪辑师等专家 Agent 各自拥有独立记忆,负责各自专业环节。最下面是执行层,负责分段并发生成,每个执行子 Agent 只处理一段任务,用完即走;某一段失败,只重试该段,不影响整体。

基于此,vivago R1 的产品形态已经接近 "AI 原生内容生产工作流 ",而非单纯的视频生成工具。我自己第一次接触的时候,就很惊艳,它像一个 " 永不喊累的制片 " 加一个 " 全能的后期团队 " 的合体。
我实测了一下,告诉它 " 创作一段 1 分钟连续叙事生活短片,主题是普通人平凡的一日。从清晨起床、早餐、通勤、午后工作、傍晚散步完整流程。"
系统不会简单地生成一段视频,而是调用多镜头叙事流程,把完整故事拆分为多个场景,启动多 Agent 分工:一个 Agent 构思故事线、一个写分镜脚本、一个生成核心画面、一个串联成片……

来看结果,展现出极佳的角色一致性。无论在自然光、室内冷光还是夜晚路灯下,男子的面部特征、发型和体态始终保持高度统一,没有发生常见的 " 换脸 " 或形变。


最关键的是一条过,我打 90 分!
数据也佐证了我的体感:
他们把内容有效可用成功率提升至 85% 左右,朋友们,85% 是商业规模化交付的门槛啊,你生成 100 条素材,85 条能直接用,这个比例才让企业有意愿把 AI 纳入生产线。
如今,vivago 海外版已覆盖 5000 万用户、100 多个国家和地区,今年 5 月灰度版登顶 Product Hunt 日榜第一,拥有百万级付费用户。
这些数据说明一个事实:
多模态智能体,正在光速进入真实的内容生产场景,创造真金白银的价值。
从 " 生成视频 " 到 " 构造世界 ":智象未来的棋盘比你想的更大
如果你觉得已经很厉害了,那我要告诉你,智象未来的想象空间不止于此。
问你一个问题,视频生成的终局是什么?
如果你以为是 " 更长更惊艳的视频 ",那可能只看到了冰山一角。真正的终局,叫做 " 世界模型 "。
世界模型是让 AI 不仅能 " 看见 " 世界,还能理解物理规律、推演因果关系、预测动作后果,最终重塑真实世界的认知内核。它的重要性在于,它是 AI 从 " 理解世界 " 走向 " 改变世界 " 的唯一桥梁。
目前,全球通向世界模型主要有几条技术路线在并行探索:
一类是 3D 原生模型路线,从三维空间和几何结构出发,优势是空间一致性强,但文本理解和泛化仍有提升空间。一类是多模态视频模型,通过视频生成推动世界模拟,成熟度最高,也是当前视觉生成赛道的主攻方向;
一类是具身智能路线,从 VLA 向 WAM 架构迁移,强调动作规划与物理交互。
还有一类是视觉模型路线,以智象未来的 UiT 架构为代表,从底层统一建模文本、图像、视频、空间、动作等信号,也是其中最具产业落地确定性的一条代表性路线。
没有世界模型,AI 永远停留在 " 生成内容 " 的阶段:
它给你一张图、一段视频,但它不知道这张图背后的物理规则是什么,不知道这段视频里的因果关系是否成立。有了世界模型,AI 才能真正感知物理世界、推演因果、预测后果,然后指导具身智能去执行真实世界的任务。
那么,在厂商纷纷押注的当下,什么是真正的世界模型?智象未来创始人梅涛对这个问题有一个清晰的界定:一个真正的世界模型必须同时具备三个能力,表达世界、推演世界、构造世界。
" 我们经常说 model the world,但我觉得真正的世界模型更应该是 mold the world,它不仅要理解世界,还要能构造、重塑世界。你如果不能创造这个世界,你也不能真正理解这个世界。"
真正的世界模型怎么搭建呢,智象未来的选择很明确:不走 " 多模态拼接 " 的捷径,而是做 " 原生全模态 " 的硬骨头。
其最新发布的 HiDream-O1-Image 系列模型,开始采用自研的全新原生全模态 UiT 架构,摒弃了传统路径中的 VAE 图像压缩和独立文本编码器,将图像像素、文本 Token、视频体素以及音频、动作、空间关系等原始信号映射进同一个共享 Token 空间,直接与同一套 UiT,像素级统一的 Unified Transformer 进行交互,在统一表征系统中完成理解、生成和推理。


这条路更难,但更有可能走向学术定义上的 " 世界模型 "。
因为真实世界本来就不是单模态的。一张图像,定格了某一时刻的世界状态;视频记录了时间变化;空间带来立体结构;动作带来交互;语言则承载知识、意图和抽象推理。如果这些模态只是被不同模型分别处理、再在外层简单拼接,系统永远无法真正理解世界内部的时空关系和因果规律。
这条难而正确的路,也正在成为行业共识。
2026 年初,谷歌发布 Gemini Embedding 2,将文本、图像、音视频乃至 PDF 文档融合进统一向量空间,实现跨越五大模态的直接检索。与此同时,英伟达推出 Nemotron 3 Nano Omni,将全模态感知、理解、推理整合为单一模型闭环。
英雄所见略同。全球科技巨头正在用行动证明,原生全模态更有可能是通往世界模型的必经之路。
所以你看,放眼 AGI 未来,从图像到视频,从视频到空间,从空间到动作,再到反馈闭环,AI 正在从 " 模拟世界 " 走向 " 预测世界 ",最终走向 " 重构世界 "。
这,也是为什么 " 国家队 " 愿意用真金白银,为智象未来 " 像素里的未来 " 投票。
历史总是惊人的相似,所有人挤在同一条赛道里贴身肉搏时,总有人选择抬头看路,然后把目光投向更辽阔的疆域。