
2026-07-18 15:13:10
(来源:计算机视觉研究院)
计算机视觉研究院

公众号ID|计算机视觉研究院
学习群|扫码在主页获取加入方式
https://pmc.ncbi.nlm.nih.gov/articles/PMC13183979/pdf/41598_2026_Article_42591.pdf
计算机视觉研究院专栏
Column of Computer Vision Institute
本文提出了融合 CNN 与 Transformer 编码器的 YOLOv12 检测模型,在珊瑚形态检测任务上实现了精度与效率的双重突破。
PART/1
痛点
珊瑚形态(枝状、块状、板状等)直接反映了礁体结构复杂度、物种丰富度与生态韧性,是珊瑚礁健康评估的核心指标。但要让 AI 自动识别,面临三重核心挑战:
:水体对光线的吸收、散射作用强,图像对比度低、色彩失真,悬浮物与遮挡普遍存在;
:不同类别珊瑚的视觉特征相似度高,尤其是枝状珊瑚结构细碎,容易和背景、其他类别混淆;
:实际监测多搭载于水下机器人等边缘设备,要求模型兼顾高精度与实时推理速度。
过往的 YOLOv7、YOLOv11 等主流模型,要么抗水下畸变能力不足,要么全局特征建模能力偏弱,难以同时满足精度与效率要求。
PART/2
方法
研究团队在 YOLOv12 的基础上,在网络颈部加入CNN+Transformer 双分支编码融合模块,同时发挥 CNN 的局部细节提取能力与 Transformer 的全局上下文建模能力,针对性解决水下场景的痛点。
1. 整体架构
模型分为四大模块:预处理→YOLOv12 骨干网络→颈部特征融合→检测头。
:图像统一缩放至 640×640,加入几何变换 + 光度调整,搭配 Mosaic、MixUp 等 YOLO 专属增强策略,提升模型泛化性;
:沿用 YOLOv12 的 C3k2、A2C2f 模块,提取多尺度层级视觉特征;
:核心创新点,双分支并行编码后做深度特征融合;
:解耦分类与回归分支,输出多尺度检测结果,经非极大值抑制去重后,输出珊瑚的边界框、形态类别与置信度。
【模型整体架构总览图】
【YOLOv12 详细网络结构图】2. 双分支特征编码
:基于改进 ResNet-50 架构,专注提取局部纹理、边缘、水螅体结构等细粒度空间特征,捕捉珊瑚形态的细节差异;
:采用 Swin Transformer 块,以骨干输出的高分辨率特征图为输入,建模长距离空间依赖,将珊瑚个体与周围礁体环境关联,强化全局语义理解。
3. 自适应特征融合
两路特征输出后,通过专属融合模块做深度结合:
先做特征拼接,再通过SE 通道注意力 + 空间注意力筛选关键特征;
引入可学习参数Self.gamma,自适应调整 Transformer 特征与 CNN 特征的贡献权重;
融合后特征送入 YOLOv12 颈部做上采样、拼接与多尺度聚合,输出小、中、大三类尺度特征图,适配不同尺寸的珊瑚群落。
这种设计既保留了 YOLO 系列的高效检测能力,又通过双分支互补,解决了水下场景细节丢失、语义模糊的核心问题。
PART/3
实验
研究基于 Roboflow-100 基准中的珊瑚数据集开展实验,涵盖枝状、块状、板状三类典型珊瑚形态,按 7:2:1 划分训练 / 验证 / 测试集,在 NVIDIA A100 GPU 上完成训练。
1. 训练与检测效果
模型训练过程收敛平稳,定位、分类、置信度三类损失持续下降,无剧烈波动,证明融合架构的训练稳定性。
【训练与验证损失曲线】实际检测中,模型可准确识别无珊瑚的背景区域,大幅降低误检;对低对比度、部分遮挡的珊瑚也能精准定位与分类,其中板状珊瑚识别置信度最高,枝状珊瑚因结构细碎置信度略低。
【多场景珊瑚检测结果示例】
【单张珊瑚图像放大检测效果对比】2. 核心性能指标
最终模型在测试集上取得了全面领先的成绩:
精确率 91.4%,召回率 90.1%
mAP@0.5 94.2%,mAP@0.5:0.95 58.5%
三类珊瑚的 PR 曲线 AUC 分别为:枝状 0.88、块状 0.90、板状 0.91,板状珊瑚因形态特征突出,识别效果最优。
【Precision/Recall/mAP 等指标训练曲线】
【三类珊瑚精确率 - 召回率(PR)曲线】从混淆矩阵来看,三类珊瑚的分类准确率分别达到 93%、94%、96%,错分主要集中在枝状与块状之间,源于水下遮挡与形态视觉相似性,整体区分度优异。
【归一化混淆矩阵】
【t-SNE 特征空间可视化,三类珊瑚特征聚类边界清晰】3. 横向对比:全面超越主流模型
和 Faster R-CNN、RetinaNet、YOLOv8、YOLOv10、SwiftFormer、RT-DETR 以及原生 YOLOv12 相比,所提模型在所有检测指标上均位列第一。
【各模型单类别 mAP@50 对比柱状图】
【各模型检测性能与计算效率综合对比】效率方面,模型单图推理仅需 16ms,参数量 25.6M,计算量 42G FLOPs—— 虽比原生 YOLOv12 略有提升,但远低于纯 Transformer 架构,完全满足实时监测的部署要求。
4. 消融实验:验证模块价值
研究通过消融实验验证了每个模块的增益:
仅加入 CNN 细化分支:mAP@0.5 从 87.6% 提升至 89.9%;
仅加入 Transformer 编码器:mAP@0.5 提升至 91.8%;
两者融合(最终方案):mAP@0.5 达 94.2%,证明局部 + 全局特征存在显著协同增益。
同时验证了颈部中间融合的效果最优,优于骨干早期融合与检测头晚期融合,平衡了空间细节与语义信息。
【各模块消融实验结果】
【融合位置消融实验结果】PART/4
总结与展望
1. 实际应用价值
这套方案为珊瑚礁自动化监测提供了高精度、可落地的技术路径,可搭载于自主水下机器人(AUV)实现大规模、常态化礁体巡检,辅助保护区规划、珊瑚修复评估、渔业生产力测算等工作,推动海洋生态管理从 “人工抽样” 走向 “数据驱动”。
2. 局限性与未来方向
目前研究仍存在一定局限:数据集覆盖的水下场景有限,极端浑浊、不同水深的泛化性有待验证;模型参数量略有增加,面向低功耗嵌入式设备还需轻量化优化。
未来研究将围绕四个方向推进:
加入视频时序信息,优化遮挡场景的检测稳定性;
融合声呐、高光谱等多模态数据,进一步区分形态相似的珊瑚物种;
轻量化模型改造,适配边缘设备部署;
拓展三维珊瑚结构检测,提升生态评估的维度与精度。
珊瑚礁的退化正在加速,而 AI 技术正在成为海洋保护的新利器。这套 YOLOv12 融合架构不仅刷新了水下珊瑚形态检测的精度纪录,也为复杂水下场景的目标检测提供了可复用的技术思路。
有相关需求的你可以联系我们!