来源:新浪科技
新浪科技讯 8 月 29 日下午消息,阿里巴巴集团旗下高德正式发布首个无长程依赖的万帧级流式 3D 重建模型 ABot-Recon。该模型无需长程记忆,仅凭连续 12 帧局部画面,即可实时稳定重建上万帧的 3D 场景,实现 " 边拍边建 "。
伴随自动驾驶、具身智能等技术走向开放环境,物理 AI 需要的不再只是 " 看见 ",而是在移动中持续理解空间:我在哪、周围有什么、下一步怎么走。尤其在定位信号弱、变化快的商场、园区、仓库等私域场景,系统难以依赖一次性建图或事后重建。
目前,主流的解决方案是通过流式 3D 重建技术实现三维场景的实时重建,但是该技术会受到误差累积和显存过大等一系列问题的影响。ABot-Recon 选择了一条全新的技术路径—— " 局部位姿预测 + 残差优化 ",以应对长序列对精度、速度和显存的挑战。与同类方法不同,ABot-Recon 摒弃了采用长程记忆锚点的方式来进行记忆对齐,模型只以最近的 12 帧连续画面作为局部上下文窗口,每次只预测当前相机坐标系下的局部点云和相邻两帧之间的相对位姿,使计算复杂度保持恒定且保证了轨迹平滑,再通过在线组合逐步拼出完整的全局轨迹与三维场景。面对局部预测中的误差累积问题,ABot-Recon 在预测和训练端分别设计了纠偏和误差约束机制,实时校准轨迹误差。凭借开创性的模型设计,ABot-Recon 在多个公开长序列基准测试中超越现有方法。
精度上,在 Oxford Spires 长序列基准测试中,ABot-Recon 的平均轨迹误差较行业代表方法 LingBot-Map 降低 40.6%;速度上,在 KITTI-02 测试中,ABot-Recon 实现 24.45FPS 的实时重建,推理速度达到行业代表方法的 1.24 倍。显存方面,ABot-Recon 峰值显存占用仅约 6.71GB,约为同类模型的三分之一,。
值得一提的是,ABot-Recon 仅需单目 RGB 视频输入,无需额外深度传感器或已知相机参数,就能实现万帧级的实时三维重建。这使它既能服务测绘行业的私域建图与底图更新,也能广泛应用于具身智能、自动驾驶和 3D 内容生产等场景。目前,ABot-Recon 已在 GitHub 开源了推理及评测代码和权重,并在魔搭社区上线了体验专区,方便开发者直接体验。