
作者丨张璐
编辑丨岑峰
大模型在文本与 2D 图像上的狂飙,归功于互联网上近乎无穷的干净数据。但当 AI 试图跨越屏幕、理解真实的 3D 物理世界时,这套经验法则瞬间失效。
真实扫描数据充斥着噪点与死角,物理遮挡造成的几何缺失既非随机发生,更无法用简单的去噪算法抹平。面对这一死结,多数团队选择用人工合成数据去 " 硬碰硬 ",却始终难以跨越虚实结合的鸿沟。
在 ECCV 现场,慕尼黑工业大学(TUM)Angela Dai 教授展示了一套逆转行业思路的解法:不必强行克服数据的 " 不完整 ",把真实的物理遮挡机制,直接变成算法的结构先验。

第一,将物理遮挡转化为逆向自监督(SG-NN)。团队先是将传感器的视野拆解为已知空域、已观测表面与未知盲区的三状态编码。团队摒弃对盲区的盲目强行预测,通过故意扣除观测帧构建训练对,用掩码损失(Mask Loss)让物理遮挡本身成为最天然的自监督标靶。
第二,用 " 几何骨架 + 2D 渲染 " 破解均值模糊(Seen2Scene)。面对大面积盲区带来的严重歧义,引入可见性引导的流匹配(Seen2Scene)与 3D 高斯溅射(WorldMesh)。由稳定几何提供不漂移、不坍塌的 " 骨架 ",再借由 2D 图像先验反哺高保真 " 皮肉 ",首次将连贯生成的尺度拉伸到了七八个房间的环境级空间。
第三,从生成反哺重构,走向机器人的 " 主动感知 "(GenRecon):将合成场景学到的结构先验反向注入真实重构(GenRecon),更顺理成章地将物理可见性推演至具身智能领域。让 AI 不再是被动接收残缺图像的画师,而是能够预判未观测空间、自主规划最佳探路路径的空间智能体。

01
数据天然 " 残缺 ":为什么 2D 扩散范式
在 3D 空间彻底失效?
文本和图像生成的爆发,本质上建立在互联网海量公开数据的红利之上。无论是能侃侃而谈的大语言模型,还是瞬间绘图的生成算法,背后都有庞大的文本文献、艺术作品和照片库作为支撑。

现实环境不仅杂乱且充斥着传感器噪声,更难以克服的是物体相互遮挡带来的视角盲区。


在最新的研讨会分享中,她给出了一个兼具工程美感与物理直觉的解法:不再强行克服数据的 " 不完整 ",而是直接引入空间本身的物理原则,让 AI 学会利用已知的空无与遮挡关系,主动在残缺的观测中推演完整的现实。
02
把遮挡变先验:
用 " 已知空无 " 推演未知的物理结构
要打破 3D 数据采集的天然缺陷,首要突破在于将物理相机的观测机制转化为算法能理解的几何先验。
当深度传感器观测一个场景时,它不仅捕捉到了物体的表面,还隐性地界定出了三类空间状态:在传感器与表面之间,是确定的已知空域;表面本身是已观测几何;而被表面遮挡的后方,则是状态未知的未观测区域。

Angela 教授团队提出了一套逆向自监督公式,从多帧融合的场景扫描中故意移除部分观测帧,构建出 " 更残缺的输入 " 与 " 相对完整的标靶 " 组成的训练对。






03
别长距离漂移:
基于几何骨架与 3DGS 的全景长图渲染
为了解决大面积几何缺失带来的歧义,生成式扩散模型被引入到了 3D 场景重建中。


模型将已知表面、已知空域和未知体素分别映射为潜在编码,并允许引入场景布局、文本提示乃至由大语言模型生成的边界框作为先验条件。





算法先生成基础几何,随后借助图像模型跨视角采样并合成具有丰富纹理的图像,再将这些像素反向提取回网格。最终,整个场景由 3D 高斯(3DGS)技术进行全局优化,并利用基础网格进行几何正则化,从而在稀疏视角的输入下依然能保持极高的画面质量与视角一致性。

借助这一框架,模型甚至可以跨越七到八个房间的连贯空间,无论是充满现实细节的大型室内环境,还是富有奇幻色彩的抽象场景,都能实现长距离、高一致性的稳定渲染。

终局形态:从原生 3D 统一大模型
到机器人的 " 主动感知 "
除了在真实数据上利用掩码进行自监督学习,另一种互补的思路是逆向利用合成数据的结构优势。
通过在 SAGE 这种干净且完整的合成场景数据集上训练生成模型,算法能够先一步学会在局部输入下生成完整结构的通用几何先验,随后再将这种先验反向迁移应用至现实世界。


当前行业普遍将这三者割裂处理,甚至只是把 2D 视觉模型的语义特征简单叠加到 3D 表达之上。
真正高效的范式应当是建立原生的 3D 统一大模型,因为在明确知道要生成一张椅子时,几何结构的构建本身就会变得更加容易。
不仅如此,物理可见性原则还将推演至机器人的主动探索领域。
当 AI 不再是被动接收人类拍到的残缺图像,而是能够主动预测未观测区域的面貌时,它就能自主决定下一个最佳观测位置,从而以最优路径完成复杂空间内的感知与任务交接。

现场 Q&A:技术边界与落地现实
在 Q&A 环节中,Angela 教授明确指出了当前 3D 生成落地的两大现实边界:一是扩散生成模型繁复采样带来的高延迟问题,二是复杂场景下精度与速度的平衡。这预示着轻量化稀疏体素与局部包围盒(Bounding Box)优化将是工业级部署的关键。
▎ Q:三平面(Triplane)表达机制是否存在无法生成高保真 3D 的天然缺陷?
A: 模型难以生成极细粒度结构的核心瓶颈在于分辨率上限,而非三平面生成先验本身的逻辑缺陷。在室内合成数据集上训练的三平面生成器拥有足够大的数据吞吐量,能够处理绝大多数场景物件。只要训练数据与目标环境分布保持相似,且相机位姿处于合理精度范围内,从合成空间迁移到真实环境完全可行。
▎ Q:这套生成与重建框架在实际运行时的速度表现如何?能否做到实时生成?
A: 目前展示的模型未经专门的速度优化,需要根据具体应用场景在精度与速度之间做出权衡。基于稀疏体素的回归模型在前向传播时计算极快,足以满足绝大多数实时性需求;但具备高拟真度的扩散生成模型由于采样过程繁复,目前尚难以做到实时运行。尽管通过将庞大场景切分为局部小盒(Local Bounding Box)能够有效控制计算负载,但要想在数秒内即时重构出超大范围的复杂真实空间,仍有待在扩散采样与渲染架构上实现进一步的工程加速。
为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群!进群你会解锁这些「福利」?
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
? 进群传送门: 扫码进群或添加微信 Qvv0909777,备注:ECCV + 单位 / 学校 + 姓名 + 方向。
搞科研 / 搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲 PPT
大会报告全文
热门论文解读
学术新星访谈
扫描上方二维码
或点击「阅读原文」关注专区。