北京,2026 年 8 月 28 日– 阿里巴巴旗下基于位置的服务平台爱普生今天发布了 ABot-Recon,这是一款流媒体 3D 重建模型,只需 12 个连续帧即可实时重建跨越 10.000 多帧的场景,无需长期内存。

该模型在多个公开基准测试(包括 KITTI、Oxford Spires 和 VBR)上实现了最先进的精度,同时将峰值内存使用量降低到同类方法的大约三分之一,使得在消费级硬件上进行实时 3D 重建成为可能。
随着自动驾驶和具身人工智能系统进入开放环境,它们需要在运动过程中持续感知空间——了解自身位置、周围环境以及下一步的行进方向。传统的流式三维重建系统会维护记忆锚点,用于存储和融合历史信息以保持全局一致性。然而,随着输入序列长度的增加,这类系统会变得越来越慢、精度越来越低,并且内存占用也越来越高。
ABot-Recon采用了一种截然不同的方法。它不维护长程记忆锚点,而是在一个固定的12帧局部上下文窗口内运行,仅预测局部点云和相邻帧之间的相对姿态。然后,通过在线合成机制逐步构建完整的全局轨迹,从而保持计算复杂度不变,不受序列长度的影响。
为了解决局部预测中固有的漂移问题,ABot-Recon 在预测和训练阶段都加入了专门的校正和约束机制,实时校准轨迹误差。
在牛津Spires长序列基准测试中,ABot-Recon与之前领先的方法相比,平均轨迹误差降低了40.6%,相对旋转误差(RPE-R)达到0.12度,比之前的最佳方法低约40%。在KITTI-02数据集上,该模型实现了24.45 FPS的实时重建速度,是现有方法的1.24倍,峰值内存占用约为6.71 GB,这意味着消费级GTX 1080 Ti显卡足以运行整个流程。
该模型仅需单目RGB视频作为输入,无需深度传感器或预先校准的相机参数。这使得ABot-Recon能够应用于私人区域测绘、具身AI训练、自动驾驶和3D内容制作等领域——在这些场景中,预先构建的地图不可用,而实时重建至关重要。
(逆传播海外发稿团队专注海外媒体发稿服务,10万海外媒体资源,72个语种220个国家地区,向世界传播您的品牌!)
Copyright © 深圳智汇蓝媒科技有限公司-逆传播海外发稿newswires-All Rights Reserved 粤ICP备18027777号