
2026-07-27 13:51:21
(来源:计算机视觉研究院)
计算机视觉研究院

公众号ID|计算机视觉研究院
学习群|扫码在主页获取加入方式
https://pmc.ncbi.nlm.nih.gov/articles/PMC13119775/pdf/sensors-26-02453.pdf
计算机视觉研究院专栏
Column of Computer Vision Institute
本文提出了一套背景参考式的 3D 重建对齐流水线,不用连续跟踪、不用运动先验,只靠前后两天各两张照片,就能精准算出物体的位姿变化,把虚拟模型重新对齐到真实物体上。
PART/1
痛点
混合现实的核心体验,建立在真实物体和虚拟模型位姿精准对齐的基础上。一旦跟踪系统进入休眠(比如夜间停机、设备断电),期间物体发生任何未被记录的移动、旋转,系统里存储的历史位姿数据就会彻底失效。
【问题概念示意图,上排为真实场景参考日与当日对比,下排为对应虚拟环境位姿错位效果】直接用 MASt3R 这类主流重建网络解决不了这个问题:它的训练数据全是静态场景,当物体发生位移后,跨天图像里的物体像素对应关系会完全错乱,根本无法输出可靠的匹配结果。
【物体静态与移动后的匹配效果对比,静态时对应关系准确,移动后匹配出现明显偏差】而传统的 SLAM、跟踪类方案,又强依赖连续的传感器数据和时间连续性,一旦跟踪中断就无从下手。

PART/2
方法
团队提出的核心思路很巧妙:物体可能会动,但房间墙面、桌面这些背景大概率是不动的。既然物体匹配不上,那就先对齐背景,再用背景的变换关系把物体坐标统一到同一个坐标系里,最后算出物体本身的位姿变化。
【方法整体流程示意图,包含初始重建、背景配准、坐标转换、位姿计算、虚拟更新 5 个步骤】整套流程分为 5 个核心步骤:
:在参考状态下,用两个不同视角拍摄真实场景,输入 MASt3R 生成带尺度的 3D 点云;再用分割网络把目标物体从背景里抠出来,得到参考坐标系下的物体 3D 点云。
:分别对参考日和当日的图像做 3D 重建,提取背景区域的点云;通过点云配准算法,计算出从当日相机坐标系到参考日坐标系的仿射变换,包含尺度、旋转和平移参数。
:对当日的双视角图像做重建和分割,得到当日相机坐标系下,移动后的物体点云。
:用背景变换参数,把当日的物体点云转换到参考日的坐标系下。这一步后背景完全重合,物体的位移就清晰体现在同一坐标系里。
:在统一坐标系下,计算原始物体和移动物体之间的位姿变换,把变换应用到虚拟环境的模型上,完成虚实重新对齐。
和传统 ICP 算法不同,这套方法用 MASt3R 直接输出密集的像素对应关系,不用每次迭代都重新找最近点,对初始值不敏感,也不容易陷入局部最优,配准稳定性更高。
PART/3
实验
团队在 10 组真实场景数据上做了测试,用 3D 包围盒的交并比(IoU)和主方向角度差两个指标衡量对齐效果。
【10 组测试图像的朝向误差与 IoU 数据对比,包含对齐前、对齐后两组数值】从数据可以看到:
对齐前,物体朝向误差普遍在 30°~70°,对齐后全部降到 12° 以内,多数在 5°~8°;
对齐前 IoU 大多在 0.1~0.5 区间,对齐后普遍提升到 0.9 左右,最高可达 0.994。
可视化效果更直观:背景先对齐重合,再单独对齐物体,最终两个时点的物体点云几乎完全重叠,3D 包围盒也精准贴合。
【3D 点云对齐过程可视化,从初始错位到背景对齐,再到最终物体完全重合】团队还验证了视角和光照的鲁棒性:
视角平移 1.5 米、角度差 30° 的情况下,尺度估计的相对误差只有 2% 左右;
明暗光照变化下,尺度一致性同样很高,对最终位姿计算影响很小。
PART/4
局限与未来方向
当然这套方案也有前提和局限: 第一,它依赖前景背景的分割精度,分割出错会带偏后续配准; 第二,默认背景是静止的,如果背景本身也有变化,需要额外加入动态背景过滤模块; 第三,多物体场景下,需要解决跨天的物体身份关联问题,相同物体还需要额外的实例特征匹配。
接下来团队会继续优化多运动物体的处理、集成更鲁棒的分割算法,同时推进流水线的实时化,让它能更顺畅地落地到长期部署的 MR 数字孪生、工业巡检系统里。
总的来说,这套 “背景锚定 + 3D 重建” 的思路,给间歇跟踪场景下的 MR 位姿对齐提供了非常实用的解法 —— 不用 24 小时开着传感器,不用额外硬件标记,拍两张照片就能完成校准,大大降低了混合现实系统长期运维的成本。
有相关需求的你可以联系我们!