官方网站-首页官方网站-首页

科技有限公司
商店{联系电话}400-86503662搜索本站
mAP@50 暴涨 5.6%!因果推理去偏,破解红外无人机小目标检测难题
mAP@50 暴涨 5.6%!因果推理去偏,破解红外无人机小目标检测难题
2026-07-17 12:14:18
摘要:
  (来源:计算机视觉研究院)  计算机视觉研究院  公众号ID|计算机视觉研究院  学习群|扫码在主页获取加入方式  https://pmc.ncbi.nlm.nih.gov/articles/PMC13030525/pdf/sensors-26-01941.pdf  计算机视觉研究院专栏  Column of Computer Vision Institute  本文提出了一套全新方案...

  (来源:计算机视觉研究院)

  计算机视觉研究院

  公众号ID计算机视觉研究院

  学习群扫码在主页获取加入方式

  https://pmc.ncbi.nlm.nih.gov/articles/PMC13030525/pdf/sensors-26-01941.pdf

  计算机视觉研究院专栏

  Column of Computer Vision Institute

  提出了一套全新方案:三路径因果干预增强框架 CSFPR-RTDETR-CR,从特征根源上去除偏差,在公开数据集上实现了 mAP@50 提升 5.6% 的显著效果,给红外小目标检测打开了新思路。

  PART/1

  痛点   

  红外无人机图像的天然属性,决定了这是个硬核难题:

  :红外成像对比度低、纹理信息少、噪声大,目标特征本身就很微弱;

  :无人机高空拍摄视角多变,地面背景复杂多样,极小尺寸的目标很容易淹没在场景里;

  :主流深度学习模型靠统计关联学习,很容易把 “特定地形、光照” 和 “目标” 绑定,训练集表现好,一到真实场景背景一变,性能直接跳水。

  说白了,模型学会的是 “目标旁边常出现什么背景”,而不是 “目标本身的本质特征”。而因果推理的核心价值,就是把真正决定目标的因果特征(比如形状、轮廓)和干扰判断的非因果特征(比如背景、光照)彻底拆开,让模型抓本质、抗干扰。

  PART/2

  核心解法

  三路径联动,全流程实现特征去偏

  这套框架以性能优异的 CSFPR-RTDETR 检测器为基线,沿着 “图像输入→骨干网络→编码器” 的完整处理链路,设计了三条因果干预路径,实现端到端的特征去偏。

【CSFPR-RTDETR-CR 模型整体结构示意图】

  在设计模块之前,团队首先搭建了结构因果模型(SCM),从理论层面明确定义了红外检测任务中的因果特征与非因果特征,理清了图像、目标、特征、检测结果之间的因果关系,为后续的去偏设计打下了严谨的理论基础。

【结构因果模型 (SCM) 示意图】

  1. 因果数据增强(CDA):输入端就打乱非因果特征

  在图像频域中,中频分量大多是跨场景稳定的因果特征,而极高频和极低频分量则包含大量与场景相关的非因果特征。基于这个规律,CDA 模块的操作逻辑很清晰:

  •   用离散余弦变换(DCT)把输入图像映射到频域;

  •   通过带通滤波器提取非因果频率分量,对这部分做高斯分布的随机缩放扰动;

  •   把扰动后的非因果频谱和保留的因果频谱重新拼接,逆变换回增强后的图像。

  整个过程只打乱背景相关的非因果特征,完全保留目标本身的因果特征,相当于在训练时给模型 “换背景刷题”,逼它不能靠背景蒙答案。

【CDA 模块输入输出样本对比图(左为原图,右为增强后图像)】

  2. 反事实推理模块(CCR):骨干网络强化因果特征

  注意力跑偏是检测偏差的重要原因 —— 模型把太多注意力放在了背景上,反而忽略了目标本身。反事实推理的思路非常巧妙:通过对比正常注意力反事实注意力对最终预测的影响,提取出注意力对特征提取的 “纯因果效应”。

  •   正常注意力:模型原本学习到的注意力分布;

  •   反事实注意力:通过随机扰动生成的、不聚焦目标的注意力分布。

  计算两者提取的特征差异,就能得到真正和目标相关的因果特征,引导模型强化这部分特征,减少对背景等虚假关联的依赖。

【反事实推理因果结构示意图】

  整个 CCR 模块嵌入在骨干网络中,经过 “生成注意力图→构造反事实注意力→对比提取因果特征向量→空间结构重建→残差融合” 六步,输出增强后的特征图。

【CCR 模块结构示意图】

  3. 因果注意力机制(CAM):编码器精准过滤非因果特征

  Transformer 的自注意力机制本质是统计相关性加权 —— 和目标同现频率越高的特征,权重越大,很容易被高频出现的背景带偏。CAM 模块对自注意力做了因果化改造:通过一对互补的 Softmax 函数,并行计算出 “因果注意力权重” 和 “非因果注意力权重”,显式地把特征拆分为因果、非因果两部分,引导模型只对真正的因果特征分配高权重。相当于给注意力加了一层 “因果过滤器”,自动屏蔽背景干扰,只聚焦目标本身的核心特征。

【CAM 模块结构示意图】

  PART/3

  实验    

  团队在公开的 HIT-UAV 高空红外无人机数据集上完成了全部实验,数据严谨,结果亮眼。

  先看数据集特点:类别分布不均衡、目标集中在画面中央、小目标占比极高,完全贴合真实低空监测的业务场景。

【HIT-UAV 数据集类别分布图】
【目标维度分布联合可视化图】

  1. 横向对比:参数量更低,精度更高

  和 DETR、Deformable-DETR 等经典检测模型相比,CSFPR-RTDETR-CR 优势非常明显:

  •   参数量仅 15.2M,不到 DETR 的 40%,计算量也远低于主流大模型;

  •   mAP@50 达到 81.2%,比 DETR 高出 20 个百分点,比基线模型提升 5.6%;

  •   推理速度保持 9.6ms,和基线模型持平,完全满足实时检测需求。

【不同目标检测模型对比实验结果】

  2. 消融实验:三个模块协同增效

  单独测试每个模块的贡献,三者叠加实现了 1+1+1>3 的效果:

  •   仅加入 CCR 模块,mAP@50 提升 2.9%,对整体精度提升贡献最大;

  •   仅加入 CAM 模块,mAP@50:95 提升 1.5%,显著优化了定位精度;

  •   三个模块全部集成后,mAP@50 累计提升 5.6%,mAP@50:95 提升 1.8%,推理速度几乎不受影响。

【模块消融实验结果】

  3. 可视化实锤:特征更聚焦,检测更准确

  通过热力图可以直观看到优化效果:加入 CCR 模块后,模型对目标区域的注意力覆盖更全面、重点更突出;加入 CAM 模块后,注意力精准落在每个独立目标上,无关区域的冗余注意力大幅减少。

【基线模型与加入 CCR 模块的注意力热力图对比】
【基线模型与加入 CAM 模块的注意力热力图对比】

  频域特征对比也验证了效果:优化后的模型在低、中、高三个频率通道上,目标响应都更集中、边界更清晰,特征辨识度显著增强。

【基线模型与本文模型频域特征响应对比图】

  最终的检测结果对比更直观:同一测试画面中,车辆、行人的检测置信度均有明显提升,低置信度的误检减少,整体检测完整性和可靠性更强。

【检测结果可视化对比图】

  除此之外,混淆矩阵、F1 曲线、PR 曲线、训练损失曲线等多项指标也都验证了模型收敛稳定、无明显过拟合,主流类别表现优异。

【此处插入原文图 9:混淆矩阵图】
【F1 - 置信度曲线图】
【精确率 - 置信度、召回率 - 置信度、PR 曲线图】
【损失函数与评价指标训练曲线图】

  PART/4

  总结与展望

  这套三路径因果干预框架,为红外无人机小目标检测的 “特征偏置” 痛点提供了一套完整的端到端解决方案,核心贡献有三点:

  :搭建了面向红外无人机小目标检测的结构因果模型,明确定义了因果与非因果特征,为特征去偏提供了理论依据;

  :从数据输入、骨干网络、编码器三个环节设计差异化的因果干预模块,实现了全链路的特征去偏;

  :在公开数据集上实现了显著的精度提升,同时保持了实时推理速度,具备落地应用潜力。

  团队也明确了后续的优化方向:一是通过结构剪枝、知识蒸馏等技术做模型轻量化,适配无人机端的嵌入式设备部署;二是在更多红外数据集上开展测试,进一步验证和提升模型的跨域泛化能力。

  从靠统计关联 “碰运气”,到靠因果本质 “做判断”,因果推理正在成为计算机视觉突破性能瓶颈的关键方向。在红外检测、遥感影像这类背景复杂、目标弱小的场景里,因果去偏的价值会越来越凸显。

  有相关需求的你可以联系我们!

特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。