官方网站-首页官方网站-首页

科技有限公司
商店{联系电话}400-86503662搜索本站
关机一夜就失灵?背景参考 3D 重建,搞定 MR 混合现实物体位姿错位
关机一夜就失灵?背景参考 3D 重建,搞定 MR 混合现实物体位姿错位
2026-07-27 15:01:56
摘要:
  (来源:计算机视觉研究院)  计算机视觉研究院  公众号ID|计算机视觉研究院  学习群|扫码在主页获取加入方式  https://pmc.ncbi.nlm.nih.gov/articles/PMC13119775/pdf/sensors-26-02453.pdf  计算机视觉研究院专栏  Column of Computer Vision Institute  本文提出了一套背景参考...

  (来源:计算机视觉研究院)

  计算机视觉研究院

  公众号ID计算机视觉研究院

  学习群扫码在主页获取加入方式

  https://pmc.ncbi.nlm.nih.gov/articles/PMC13119775/pdf/sensors-26-02453.pdf

  计算机视觉研究院专栏

  Column of Computer Vision Institute

  文提出了一套背景参考式的 3D 重建对齐流水线,不用连续跟踪、不用运动先验,只靠前后两天各两张照片,就能精准算出物体的位姿变化,把虚拟模型重新对齐到真实物体上。

  PART/1

  痛点   

  混合现实的核心体验,建立在真实物体和虚拟模型位姿精准对齐的基础上。一旦跟踪系统进入休眠(比如夜间停机、设备断电),期间物体发生任何未被记录的移动、旋转,系统里存储的历史位姿数据就会彻底失效。

【问题概念示意图,上排为真实场景参考日与当日对比,下排为对应虚拟环境位姿错位效果】

  直接用 MASt3R 这类主流重建网络解决不了这个问题:它的训练数据全是静态场景,当物体发生位移后,跨天图像里的物体像素对应关系会完全错乱,根本无法输出可靠的匹配结果。

【物体静态与移动后的匹配效果对比,静态时对应关系准确,移动后匹配出现明显偏差】

  而传统的 SLAM、跟踪类方案,又强依赖连续的传感器数据和时间连续性,一旦跟踪中断就无从下手。

  PART/2

  方法   

  团队提出的核心思路很巧妙:物体可能会动,但房间墙面、桌面这些背景大概率是不动的。既然物体匹配不上,那就先对齐背景,再用背景的变换关系把物体坐标统一到同一个坐标系里,最后算出物体本身的位姿变化。

【方法整体流程示意图,包含初始重建、背景配准、坐标转换、位姿计算、虚拟更新 5 个步骤】

  整套流程分为 5 个核心步骤:

  :在参考状态下,用两个不同视角拍摄真实场景,输入 MASt3R 生成带尺度的 3D 点云;再用分割网络把目标物体从背景里抠出来,得到参考坐标系下的物体 3D 点云。

  :分别对参考日和当日的图像做 3D 重建,提取背景区域的点云;通过点云配准算法,计算出从当日相机坐标系到参考日坐标系的仿射变换,包含尺度、旋转和平移参数。

  :对当日的双视角图像做重建和分割,得到当日相机坐标系下,移动后的物体点云。

  :用背景变换参数,把当日的物体点云转换到参考日的坐标系下。这一步后背景完全重合,物体的位移就清晰体现在同一坐标系里。

  :在统一坐标系下,计算原始物体和移动物体之间的位姿变换,把变换应用到虚拟环境的模型上,完成虚实重新对齐。

  和传统 ICP 算法不同,这套方法用 MASt3R 直接输出密集的像素对应关系,不用每次迭代都重新找最近点,对初始值不敏感,也不容易陷入局部最优,配准稳定性更高。

  PART/3

  实验    

  团队在 10 组真实场景数据上做了测试,用 3D 包围盒的交并比(IoU)和主方向角度差两个指标衡量对齐效果。

【10 组测试图像的朝向误差与 IoU 数据对比,包含对齐前、对齐后两组数值】

  从数据可以看到:

  •   对齐前,物体朝向误差普遍在 30°~70°,对齐后全部降到 12° 以内,多数在 5°~8°;

  •   对齐前 IoU 大多在 0.1~0.5 区间,对齐后普遍提升到 0.9 左右,最高可达 0.994。

  可视化效果更直观:背景先对齐重合,再单独对齐物体,最终两个时点的物体点云几乎完全重叠,3D 包围盒也精准贴合。

【3D 点云对齐过程可视化,从初始错位到背景对齐,再到最终物体完全重合】

  团队还验证了视角和光照的鲁棒性:

  •   视角平移 1.5 米、角度差 30° 的情况下,尺度估计的相对误差只有 2% 左右;

  •   明暗光照变化下,尺度一致性同样很高,对最终位姿计算影响很小。

  PART/4

  局限与未来方向   

  当然这套方案也有前提和局限: 第一,它依赖前景背景的分割精度,分割出错会带偏后续配准; 第二,默认背景是静止的,如果背景本身也有变化,需要额外加入动态背景过滤模块; 第三,多物体场景下,需要解决跨天的物体身份关联问题,相同物体还需要额外的实例特征匹配。

  接下来团队会继续优化多运动物体的处理、集成更鲁棒的分割算法,同时推进流水线的实时化,让它能更顺畅地落地到长期部署的 MR 数字孪生、工业巡检系统里。

  总的来说,这套 “背景锚定 + 3D 重建” 的思路,给间歇跟踪场景下的 MR 位姿对齐提供了非常实用的解法 —— 不用 24 小时开着传感器,不用额外硬件标记,拍两张照片就能完成校准,大大降低了混合现实系统长期运维的成本。

  有相关需求的你可以联系我们!

特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。