" 最终,这个世界可能只剩下一个产业:创造世界、体验世界。"
创业 3 年,即使经历过大模型赛道从萌芽到狂奔的全过程,VAST 创始人兼 CEO 宋亚宸依旧觉得最近发展速度 " 超出预期 " ——对世界模型、UGC 交互内容平台的共识形成得极其迅速。在他原来的设想里," 可能还要再讲十年,(3D)技术才能成熟,大家才能慢慢理解这是什么 "。
近期,他创办的人工智能公司 VAST 完成了 B 轮和 B+ 轮融资,金额合计约 30 亿元,由经纬创投领投。
其余投资方包括:完美世界、蓝色光标、芯动能投资、延趣游戏、中科创达、广电投资、三七互娱等一线产业资本,鼎晖 VGC、中金资本、CMC 资本、洪泰基金、三正健康投资、中平资本、福建产投基金、福创投、卓源亚洲、江西金控等一线财投。
与此同时,老股东达晨财智、春华资本、四三九九、慕华科创、绿洲资本、渶策资本、华控基金持续超额追投
不到半年,VAST 累计融资约 50 亿人民币,刷新了 AI 3D 领域的融资额纪录。
迅猛的融资节奏背后,值得关注的一点是,最近几个月以来,VAST 投资方的背景变得更加多元——来自汽车、电商、游戏、消费电子、XR、影视、告、旅等多个产业方资本,纷纷加注这个赛道。
正如 Salesforce 投资 Anthropic 并接入 Claude,BMW 加注 Figure AI 并将机器人引入生产线,下游产业资本的加注,往往意味着技术发展进入新的阶段:从 " 可用 ",变得 " 好用 ";技术带来的巨大商业回报,也从 BP 上的数字,变成产业方肉眼可见的效益。
产业资本首先看好的是 VAST 的技术能力。
8 月,VAST 刚刚推出最新一代 AI 3D 基础模型 Tripo P2.0 Preview,这是全球先一步能在数秒内生成高质量四边面网格的 3D 大模型。
和上一个版本 P1.0 对比,P2.0 的生成精度、面数范围等能力都有了质的飞跃——单面数上限由 2 万三角面提升至 5 万三角面,同时还新增了原生四边面拓扑模式,最高支持 2.5 万四边面。

产业方真金白银押注的另一面,则源于 VAST 突出的落地和商业化成绩。
当下,VAST 是为数不多同时拥有自研的基础模型,又在垂直领域中拿到商业化结果的 AI 创业公司。其核心产品 Tripo Studio 目前已经服务了全球数千万用户,3D 原生基础模型 Tripo,则已经接入网易、腾讯、字节、微软等国内外公司的工作流。
"3D 是世界的原生表征。" 宋亚宸曾表示。VAST 如今的备受追逐,也源于它恰好站在当下投资人们的相信上:大模型的下一阶段跃迁,将发生在对物理世界的理解、模拟与交互。
要持续领跑每个阶段,模型和应用必须要一起抓——基模决定着落地场景的边界,而平台将承接应用与商业化。
不过,VAST 无意为自己描绘一个爽文式的剧本。此前,宋亚宸数次在公开场合承认:公司刚成立时,一上来就想做 UGC 交互内容平台,但很快发现 3D 领域的 " 手机摄像头 " 还没被发明出来——在一个赛道技术、产品都远未成熟的时期,单凭一家公司的力量,也难让 3D UGC 内容走到商业闭环。
想明白这点后,宋亚宸带着团队完成了从模型到平台的 " 两步走 ":第一步,解决基础模型和新生产力的问题,让每个人都可以零门槛、零成本、实时地创作;第二步,建立平台,把内容和体验分发给终端消费者,并完成商业化。
宋亚宸相信,AI 3D 会带来新的平台级机会,其潜在市场规模会比我们如今熟悉的内容平台大得多。
" 让 AI 适应人类工业标准,而不是反过来 "
" 如果有人告诉你一天能生成 10 万个资产,你会做什么?" 这是 VAST 首席科学家曹炎培,过去一段时间常常思考的问题。
这样的假设在半年前听上去还像天方夜谭。
在传统 3D 工业管线中,极花时间的重拓扑和绑定,艺术创意成分很少,本质上是繁杂的人工劳动——手工重拓扑单个资产要数小时到数天,是整条生产管线最大的人力瓶颈。一旦卡在拓扑和绑定上,整体的制作节奏都会被拖慢。
要让 AI 生成的 3D 资产更直接地进入生产管线,需要实现原生 mesh 生成,即直接在 mesh 表示上生成具备合理面数、规整结构和恰当拆分的 3D 资产。
大模型时代来临之后,并不是没有人尝试解决这个问题。
时间拨回 2024 年,AI 3D 赛道上尤为火热的技术共识其实是自回归(Auto-Regressive)。
自回归范式在大语言模型上取得的巨大成功,让 3D 领域深受影响。不少研究者试图将 3D 表示序列化——原本不存在天然线性顺序的 mesh(网格),被编码成一个个排好序的 token,再像生成句子一样逐个预测。
两三年来,自回归路线的确让行业尝到了 " 甜头 ",MeshGPT、MeshAnything 等项目实践证明,基于自回归路线,3D 模型可以生成低面数、结构紧凑、具有一定生产价值的原生 mesh。
不过,VAST 很早就意识到,自回归为原生 mesh 生成带来的,是一种 " 虚假繁荣 "。强行将 mesh 塞进序列化的表征,会造成信息的折损,一旦追求更高的上限,误差积累等问题便会集中暴露。
" 这其实是在原始数据和最终想要的资产之间,绕了很远的路径。"VAST 首席科学家曹炎培表示。
这一领跑于行业的判断,源于 VAST 自成立以来坚持的原则:" 生成即可用 "。用曹炎培的话说," 要让 AI 适应人类的工业标准,而不是反过来 "。
" 要在秒级内生成高质量网格,不可能走自回归路线——以现在的算力和范式,要生成几万个面,不可能在一秒内生成几万个 token。" 曹炎培说。
这迫使 VAST 走上一条难度更高的端到端路线:直接在 3D 模型最原始的网格数据上训练,一次性整体生成——这也是 VAST 如今基座模型 Nexus 的核心训练思想。
为了达到这个目标,VAST 重构了整个模型和数据管线,包括全球规模庞大的 3D 原生数据资产库,以及自研的训练与推理基础设施。同时,团队还同步构建将研究原型推进到鲁棒高效线上服务的工程体系,这意味着,实验室中的技术,最后能够落地为用户可以稳定使用的产品。
模型能力迭代的拐点,始于 VAST 对自研算法框架 Nexus 的探索。
相较于线形生成的自回归路线,Nexus 把顶点与拓扑的生成解耦,用分层扩散由粗到细全局生成顶点,再通过 " 时空区间 " 编码任意拓扑——简单理解,先生成整体,再补充细节。
基于这一路径,Nexus 首次基于扩散模型实现完全无需排序的原生网格生成。相关论文被国际图像学顶级会议 SIGGRAPH 收录。
在扩散路线上的先发优势、敏锐的 know-how,以及训练资源的持续投入,让 VAST 在 AI 3D 领域稳居算法全球 SOTA —— Tripo P1.0 是全球先一步能在数秒内输出生产级网格的 3D 大模型,较市面其他方案提速百倍;P 系列自今年 3 月上线至今,行业尚无达到同等效果的模型产品。
Nexus 带来的底层算法优势,很快又在今年 8 月上线的 P2.0 Preview 上得到验证。
长期以来,四边面网格一直是游戏、影视等行业生产的工业标准。但多条传统的重拓扑路线,都无法兼顾四边面的生成速度和质量。
在 Nexus 框架下,不同面类型(面的阶数)的生成,成了模型自带的能力;同时,不需要经过先生成高模、再转换的漫长流程,多边面网格可以在一次生成中直接产出——这让 Tripo P2.0 成为全球先一步实现原生四边面拓扑的 3D 原生基础模型,生成的 3D 资产,可以直接满足工业生产标准。
这是非共识的胜利,也是第一性原理的胜利。

模型能力的边界,创造世界的边界
在曹炎培看来,过去三年模型能力的进展,本质上都是在解决模型侧的 3D 资产供给问题。和以前需要半个月才能获得一个主角资产相比," 一旦内容产量提上去了,内容消费者们会做很不一样的选择 ",这会为内容领域带来制作范式和思路上的质变。
在 C 端,模型厂商在视频创作、Vibe Coding 上的实践证明:模型能力,决定需求边界。这一定律同样在 AI 3D 领域得到验证。
Tripo P 系列上线以来,全球越来越多的开发者,开始基于模型的 Coding 能力," 口喷式 " 开发包含 3D 交互内容的网页、游戏等产品。
比如,海外独立开发者 @thebuggeddev 已基于 Tripo,以及 Claude Code、Codex 等 Coding 模型,创作出多款精美的 3D 互动网页。从 3D 资产生成、网页搭建,到 Three.js 代码编写与渲染,整个创作流程无需依赖 Blender 等传统专业工具,开发者仅通过自然语言与代码即可完成从模型到可交互网页的搭建。
近期,他在 X 上发布的 3D 人体解剖交互应用,被 OpenAI 总裁 Greg Brockman 转发,原帖收获超万赞。而这个精美网页的制作过程并不复杂:先用 GPT Image 2.0 画出设计图,逐个生成器官图片,再用 Tripo 把它们一一变成 3D 模型,最后,交给 Codex 写代码组装。

在不少 C 端创作者看来,Tripo P 系列模型,尤其是最新发布的 P2.0,生成迅速、拓扑干净、分件贴合语义结构,恰恰满足了 Agent 理解、编辑 3D 资产的要求——这也让 Tripo P2.0,成为迄今尤为适合 Vibe Coding 的 3D 原生基座模型。
更摧枯拉朽的质变,发生在位于下游的千行百业中。
当下,Tripo P 系列的能力跃升,让 AI 生成的 3D 资产第一次可以不经人工返工,直接被各个行业的生产管线接住。即使是小白用户," 言出法随 " 也真正成为可能:无需学习复杂的建模和渲染,一句话就能获得高精度的、可以用于下一阶段加工的白模。
帮助下游内容行业提效,是 VAST 落地的第一步。
游戏是 AI 3D 极早落地、也吃得极深的行业。如今,AI 已经同时进入了两条通路:大厂的美术生产管线,和玩家自己的创作工具箱。
在 B 端管线,Tripo Studio 已经进入网易、腾讯、微软等团队的美术生产流程,用于概念生成、场景资产快速搭建、关卡原型验证和多方案比较。曾经有游戏公司平均用 2.5 个人加上 2 周时间,完成了原本需要数月的大空间场景搭建。
在玩家侧,网易《蛋仔派对》2025 年就与 VAST 达成战略合作。2026 年 7 月,蛋仔工坊再度与 Tripo 联手,上线了 3D 模型拆分功能—— AI 生成的模型可以从一个整体拆成多个可编辑、可组合的部件。

进一步,随着 3D AI 生成的实时交互性进一步提升,它会成为游戏玩法本身。
在网易《燕云十六声》基于 Tripo API 上线 " 万物太极 " 后,玩家上传一张照片,系统就可以实时生成对应的 3D 拟真模型。玩家真正可以做到 " 遇河造桥、遇敌造树 ",生成的 3D 内容会直接改变地形和互动方式,成为游戏开放世界的一部分。
同样的逻辑,正在游戏之外的行业里重复上演。在 Tripo 的实践中,AI 3D 已经能够在多个行业的核心工作流里,补上 " 从想法到可用的 3D 模型 " 这段极其难走的路。
3D 打印是一个典型例子。
如果说硬件突破、价格下探,点燃了 3D 市场第一波大增长——市场研究机构 CONTEXT 数据显示,2026 年第一季度,全球 3D 打印设备收入同比增长了 32%。但要支撑这场爆发持续下去,内容侧必须有 3D 生成模型的支撑。
如今,Tripo 已覆盖拓竹、黑格、纵维立方、创想三维、爱乐酷等几乎所有头部 3D 打印硬件厂商。Tripo H 系列模型面向高保真 3D 打印场景,生成水密性模型无需修复即可直接切片打印。2024 年底,作为最早接入拓竹 MakerWorld 的 AI 3D 大模型,自 H2.5 系列到最近的 H3.1 Ultra,Tripo 帮助 3D 打印用户实现 " 上传图片—生成 3D 模型—切片打印 " 的全流程闭环,原型制作速度提升约 90%。

在影视领域,近期,由苹果、皮克斯成员创立的海外创意平台 Intangible AI、国内视频生成平台 TapNow 等多个视频创作平台的 "3D 导演台 ",都接入了 Tripo ——影视行业对 3D 原生基础模型的需求,源于精准控片的刚需。如今 Tripo P2.0 能在几秒内产出白模和预可视化资产,影视团队可以先在 3D 场景里规划镜头、机位和调度,再进入正式拍摄,省去了此前大量的前置建模投入,实现精确控片。
XR 为人、物理世界、虚拟世界的交互提供了硬件入口,VAST 则为其提供更为丰富体验和交互形式。
近期,VAST 已开发出适配新一代 XR 设备的原生 AI 3D 生成应用,无需手柄或专业软件,语言描述即可生成 3D 内容,再通过眼动与手势操作。与此同时,VAST 算法团队还与香港大学、PICO 机构开源了双目世界模型 StereoWorld,既消除了单目模型在用户移动时的空间漂移,也能把现有单目视频转换为双目立体内容,为 AI 3D 在 XR 行业的落地打好了地基。
资本往往会沿着生产力变革的方向流动。
VAST 本轮融资汇聚了来自游戏、XR、影视、广告、文旅等不同产业的资本,这些产业方同时也是 3D 内容的生产者与使用者。资本、技术与真实场景开始在同一条链路上汇合,也意味着 Tripo 正从 " 生成工具 ",成为千行百业的 AI 3D 基础设施。
帮助产业降本增效只是起点。VAST 更希望用 AI 创造消费级的增量——" 我们希望用智能让每个人都能享有可交互的极致体验,最终实现让 3D 成为每个人表达自我、构建世界的本能。"宋亚宸曾提到。
这一目标的最终图景,是让普通人不仅能够基于 AI 模型 " 造物 ",还能 " 造世界 "。
今年 6 月,VAST 推出了世界模型研究项目 Project Eden(伊甸园计划)。基于 Eden 生成的 " 世界 " 支持多玩家并发、具备原生持久性,还能像真实世界一样持续演化。
目前,Project Eden 已展示了 " 文本到可交互仿真场景 " 的生成流程,生成资产自带碰撞体、关节与物理属性。随着能力持续迭代,Eden 将作为下一代交互式内容的底层引擎,让每个人都能直接生成并进入一个长程持久、可交互、具备物理规则的世界——一个代表性的进展是:SIGGRAPH 2026 上,项目演化出的生成式渲染器(generative rendering),演示了其在具身智能仿真场景下的应用。

这也许才是真正接近 VAST 创始人宋亚宸终极想象的时刻。" 如果机器人替代第一产业、第二产业,人工智能替代第三产业,生物医药让人活得更久,那么最终,这个世界可能只剩下一个产业——创造世界、体验世界。" 他说。