
2026-07-19 16:38:49
(来源:计算机视觉研究院)
计算机视觉研究院

公众号ID|计算机视觉研究院
学习群|扫码在主页获取加入方式
https://pmc.ncbi.nlm.nih.gov/articles/PMC12936272/pdf/41598_2026_Article_36251.pdf
计算机视觉研究院专栏
Column of Computer Vision Institute
本文提出了跨阶段边缘信息融合网络 CEIFNet,专门为航拍小目标检测深度优化,在两大权威数据集上实现了精度的大幅跃升。
PART/1
痛点
和普通自然场景的目标检测相比,航拍检测的难度是指数级上升的,核心有三大痛点:
:高空拍摄视角下,大量目标仅占十几甚至几个像素,特征信息极其稀疏,经过网络多次下采样后很容易彻底丢失;
:同一类目标会因为拍摄高度、距离、角度不同,出现极大的尺寸差异,常规的预设锚框机制很难适配;
:航拍画面包含大量建筑、道路、植被纹理,复杂背景很容易让模型误判,也会掩盖小目标的特征信号。
目前工业界主流的 YOLO 系列算法,虽然在速度和通用精度上表现优秀,但在航拍小目标场景短板明显:连续下采样会严重削弱小目标特征,预设锚框也和航拍目标的尺寸分布匹配度不高。
PART/2
创新
CEIFNet 以 YOLO11 为基础框架进行定制化优化,核心围绕 “保留细节特征、强化边缘信息、适配多尺度目标” 三大方向,打造了四大核心模块,整体架构如下图所示:
【CEIFNet 整体架构图】完整的网络层级参数配置可参考下表:
【CEIFNet 逐层详细架构表】1. CST Block:CNN+Transformer 混合特征提取
骨干网络采用全新设计的跨阶段 Transformer 模块(CST Block)作为基础提取单元,结构如下图:
【CST Block 结构图】它采用通道拆分的双分支非对称设计:
大部分通道分配给 CNN 分支,通过经典 Bottleneck 结构高效提取局部细节特征,搭配残差连接保留原始信息,确保小目标的空间细节不会在深层网络中丢失;
小部分通道分配给 Transformer 分支,先通过多头自注意力建立全局长距离依赖,再用 3 种不同感受野的深度可分离卷积(3×3/5×5/7×7)同时提取多尺度空间特征,最终通过 Sigmoid 门控自适应筛选最优特征组合。
这种混合架构既保留了 CNN 低参数量、低计算量的优势,又具备 Transformer 的全局建模能力,最终实现了参数量不增反降、特征表达能力更强的效果。
2. GEII 模块:全局边缘信息跨阶段交互
小目标的边界轮廓是定位和识别的关键线索,但传统网络在逐层下采样的过程中,会丢失大量浅层的边缘细节。为此团队专门设计了全局边缘信息交互(GEII)结构,如下图所示:
【GEII 模块结构图】它分为两大核心部分:
:先用 Sobel 算子从浅层 P2 特征中提取边缘信息,再通过层级下采样生成不同分辨率的边缘特征,和后续特征金字塔的不同层级一一对应;
:通过 “1×1 卷积 + 3×3 卷积 + 1×1 卷积” 的三级结构,把边缘信息和对应阶段的卷积特征做跨通道融合,让深层网络也能获取到清晰的边界几何线索。
3. 新增 P2 层输出:守住细粒度空间细节
在特征金字塔部分,网络在常规的 P3/P4/P5 输出之外,额外增加了 P2 层高分辨率特征输出,保留更浅层的细粒度空间信息,为像素级极小目标的检测提供充足的细节支撑。
4. DyHead 动态检测头:自适应适配多尺度目标
检测头采用动态头(DyHead)结构,如下图:
【DyHead 结构图】它集成了尺度感知、空间感知、通道感知三重动态注意力机制,能根据输入的特征内容自适应调整检测参数,自动聚焦不同尺度的目标特征,在复杂背景下也能精准区分目标和干扰噪声。
PART/3
实验
团队在 VisDrone2019 和 HIT-UAV 两大权威航拍数据集上完成了全面实验,充分验证 CEIFNet 的性能优势。
1. 消融实验:每个模块都有实打实的提升
团队采用逐步叠加模块的方式,量化每个组件的性能贡献,结果如下表:
【CEIFNet 组件消融实验结果表】在 VisDrone2019 数据集上:
仅加入 CST Block,mAP@50 提升 2.2%,验证了混合架构的特征提取优势;
加入 GEII 边缘模块后,mAP@50 再提升 3.4%,是所有模块中贡献最大的,直接证明了边缘信息对小目标检测的核心价值;
新增 P2 层输出,mAP@50 提升 2.8%,细粒度细节的作用显著;
最后加入 DyHead 检测头,mAP@50 再提升 2.1%。
最终相比基线 YOLO11-n,CEIFNet 的 mAP@50 从 32.6% 提升至 43.1%,整体涨幅达到 10.5 个百分点。
2. 横向对比:性能超越一众主流算法
在 VisDrone2019 数据集上,CEIFNet 的 mAP@50 达到 43.1%,mAP@50-95 达到 26.2%,在所有对比模型中排名第一,详细对比如下表:
【VisDrone2019 数据集各模型性能对比表】和性能最接近的 DDSC-YOLO 相比,CEIFNet 的 mAP@50 领先 0.9%,mAP@50-95 更是大幅领先 3.7%,精准定位的优势十分明显。推理速度上,CEIFNet 单张推理仅需 3.16ms,快于 YOLOv8-s、RT-DETR 等多数同精度模型,兼顾了精度和实时性。
在红外航拍的 HIT-UAV 数据集上,CEIFNet 同样保持领先:
【HIT-UAV 数据集各模型性能对比表】mAP@50 达到 95.0%,mAP@50-95 达到 62.7%,位列所有对比模型第一;即使面对红外弱小目标场景,依然保持了稳定的高精度,推理速度仅 3.08ms。
3. 可视化效果:漏检误检大幅减少
直观的检测效果对比更能体现性能差异,下图是 VisDrone2019 数据集上的效果对比:
【VisDrone2019 数据集检测效果可视化对比图】无论是复杂城市场景、高空俯瞰视角还是夜间低光环境,CEIFNet 都能检测到更多基线模型漏检的小目标,置信度普遍更高,同时没有明显的背景误检。
在红外数据集上的效果对比如下:
【HIT-UAV 数据集检测效果可视化对比图】CEIFNet 不仅能检出更多小目标,还能有效避免把路灯等物体误判为行人,精准度提升显著。
PART/4
总结与展望
CEIFNet 精准命中了航拍小目标检测的核心痛点,通过 CNN-Transformer 混合特征提取、边缘信息跨阶段融合、多尺度细节保留、动态检测头四大优化方向,实现了检测精度的大幅跃升,同时保持了具备实用价值的推理速度,非常适合无人机实时检测场景。
这项工作也还有继续拓展的空间:未来团队将进一步优化模块的计算效率,开发适合边缘设备部署的轻量化版本,同时也会探索把边缘信息融合策略推广到更多计算机视觉任务中。
有相关需求的你可以联系我们!