官方网站-首页官方网站-首页

科技有限公司
商店{联系电话}400-86503662搜索本站
十几像素也能精准识别!航拍小目标检测新网络 CEIFNet,精度暴涨 10.5%
十几像素也能精准识别!航拍小目标检测新网络 CEIFNet,精度暴涨 10.5%
2026-07-19 16:38:49
摘要:
  (来源:计算机视觉研究院)  计算机视觉研究院  公众号ID|计算机视觉研究院  学习群|扫码在主页获取加入方式  https://pmc.ncbi.nlm.nih.gov/articles/PMC12936272/pdf/41598_2026_Article_36251.pdf  计算机视觉研究院专栏  Column of Computer Vision Institute  本文提...

  (来源:计算机视觉研究院)

  计算机视觉研究院

  公众号ID计算机视觉研究院

  学习群扫码在主页获取加入方式

  https://pmc.ncbi.nlm.nih.gov/articles/PMC12936272/pdf/41598_2026_Article_36251.pdf

  计算机视觉研究院专栏

  Column of Computer Vision Institute

  文提出了跨阶段边缘信息融合网络 CEIFNet,专门为航拍小目标检测深度优化,在两大权威数据集上实现了精度的大幅跃升。

  PART/1

  痛点   

  和普通自然场景的目标检测相比,航拍检测的难度是指数级上升的,核心有三大痛点:

  • 目标体积极小

      :高空拍摄视角下,大量目标仅占十几甚至几个像素,特征信息极其稀疏,经过网络多次下采样后很容易彻底丢失;

  • 尺度波动剧烈

      :同一类目标会因为拍摄高度、距离、角度不同,出现极大的尺寸差异,常规的预设锚框机制很难适配;

  • 背景干扰极强

      :航拍画面包含大量建筑、道路、植被纹理,复杂背景很容易让模型误判,也会掩盖小目标的特征信号。

  目前工业界主流的 YOLO 系列算法,虽然在速度和通用精度上表现优秀,但在航拍小目标场景短板明显:连续下采样会严重削弱小目标特征,预设锚框也和航拍目标的尺寸分布匹配度不高。

  PART/2

  创新

  CEIFNet 以 YOLO11 为基础框架进行定制化优化,核心围绕 “保留细节特征、强化边缘信息、适配多尺度目标” 三大方向,打造了四大核心模块,整体架构如下图所示:

【CEIFNet 整体架构图】

  完整的网络层级参数配置可参考下表:

【CEIFNet 逐层详细架构表】

  1. CST Block:CNN+Transformer 混合特征提取

  骨干网络采用全新设计的跨阶段 Transformer 模块(CST Block)作为基础提取单元,结构如下图:

【CST Block 结构图】

  它采用通道拆分的双分支非对称设计:

  •   大部分通道分配给 CNN 分支,通过经典 Bottleneck 结构高效提取局部细节特征,搭配残差连接保留原始信息,确保小目标的空间细节不会在深层网络中丢失;

  •   小部分通道分配给 Transformer 分支,先通过多头自注意力建立全局长距离依赖,再用 3 种不同感受野的深度可分离卷积(3×3/5×5/7×7)同时提取多尺度空间特征,最终通过 Sigmoid 门控自适应筛选最优特征组合。

  这种混合架构既保留了 CNN 低参数量、低计算量的优势,又具备 Transformer 的全局建模能力,最终实现了参数量不增反降、特征表达能力更强的效果。

  2. GEII 模块:全局边缘信息跨阶段交互

  小目标的边界轮廓是定位和识别的关键线索,但传统网络在逐层下采样的过程中,会丢失大量浅层的边缘细节。为此团队专门设计了全局边缘信息交互(GEII)结构,如下图所示:

【GEII 模块结构图】

  它分为两大核心部分:

  • 多尺度边缘信息生成器(MEIG)

      :先用 Sobel 算子从浅层 P2 特征中提取边缘信息,再通过层级下采样生成不同分辨率的边缘特征,和后续特征金字塔的不同层级一一对应;

  • 跨通道特征融合(CFF)

      :通过 “1×1 卷积 + 3×3 卷积 + 1×1 卷积” 的三级结构,把边缘信息和对应阶段的卷积特征做跨通道融合,让深层网络也能获取到清晰的边界几何线索。

  3. 新增 P2 层输出:守住细粒度空间细节

  在特征金字塔部分,网络在常规的 P3/P4/P5 输出之外,额外增加了 P2 层高分辨率特征输出,保留更浅层的细粒度空间信息,为像素级极小目标的检测提供充足的细节支撑。

  4. DyHead 动态检测头:自适应适配多尺度目标

  检测头采用动态头(DyHead)结构,如下图:

【DyHead 结构图】

  它集成了尺度感知、空间感知、通道感知三重动态注意力机制,能根据输入的特征内容自适应调整检测参数,自动聚焦不同尺度的目标特征,在复杂背景下也能精准区分目标和干扰噪声。

  PART/3

  实验    

  团队在 VisDrone2019 和 HIT-UAV 两大权威航拍数据集上完成了全面实验,充分验证 CEIFNet 的性能优势。

  1. 消融实验:每个模块都有实打实的提升

  团队采用逐步叠加模块的方式,量化每个组件的性能贡献,结果如下表:

【CEIFNet 组件消融实验结果表】

  在 VisDrone2019 数据集上:

  •   仅加入 CST Block,mAP@50 提升 2.2%,验证了混合架构的特征提取优势;

  •   加入 GEII 边缘模块后,mAP@50 再提升 3.4%,是所有模块中贡献最大的,直接证明了边缘信息对小目标检测的核心价值;

  •   新增 P2 层输出,mAP@50 提升 2.8%,细粒度细节的作用显著;

  •   最后加入 DyHead 检测头,mAP@50 再提升 2.1%。

  最终相比基线 YOLO11-n,CEIFNet 的 mAP@50 从 32.6% 提升至 43.1%,整体涨幅达到 10.5 个百分点。

  2. 横向对比:性能超越一众主流算法

  在 VisDrone2019 数据集上,CEIFNet 的 mAP@50 达到 43.1%,mAP@50-95 达到 26.2%,在所有对比模型中排名第一,详细对比如下表:

【VisDrone2019 数据集各模型性能对比表】

  和性能最接近的 DDSC-YOLO 相比,CEIFNet 的 mAP@50 领先 0.9%,mAP@50-95 更是大幅领先 3.7%,精准定位的优势十分明显。推理速度上,CEIFNet 单张推理仅需 3.16ms,快于 YOLOv8-s、RT-DETR 等多数同精度模型,兼顾了精度和实时性。

  在红外航拍的 HIT-UAV 数据集上,CEIFNet 同样保持领先:

【HIT-UAV 数据集各模型性能对比表】

  mAP@50 达到 95.0%,mAP@50-95 达到 62.7%,位列所有对比模型第一;即使面对红外弱小目标场景,依然保持了稳定的高精度,推理速度仅 3.08ms。

  3. 可视化效果:漏检误检大幅减少

  直观的检测效果对比更能体现性能差异,下图是 VisDrone2019 数据集上的效果对比:

【VisDrone2019 数据集检测效果可视化对比图】

  无论是复杂城市场景、高空俯瞰视角还是夜间低光环境,CEIFNet 都能检测到更多基线模型漏检的小目标,置信度普遍更高,同时没有明显的背景误检。

  在红外数据集上的效果对比如下:

【HIT-UAV 数据集检测效果可视化对比图】

  CEIFNet 不仅能检出更多小目标,还能有效避免把路灯等物体误判为行人,精准度提升显著。

  PART/4

  总结与展望

  CEIFNet 精准命中了航拍小目标检测的核心痛点,通过 CNN-Transformer 混合特征提取、边缘信息跨阶段融合、多尺度细节保留、动态检测头四大优化方向,实现了检测精度的大幅跃升,同时保持了具备实用价值的推理速度,非常适合无人机实时检测场景。

  这项工作也还有继续拓展的空间:未来团队将进一步优化模块的计算效率,开发适合边缘设备部署的轻量化版本,同时也会探索把边缘信息融合策略推广到更多计算机视觉任务中。

  有相关需求的你可以联系我们!

特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。