官方网站-首页官方网站-首页

科技有限公司
商店{联系电话}400-86503662搜索本站
准确率 94.2%!YOLOv12 融合 CNN 与 Transformer,搞定水下珊瑚形态检测
准确率 94.2%!YOLOv12 融合 CNN 与 Transformer,搞定水下珊瑚形态检测
2026-07-18 15:13:10
摘要:
  (来源:计算机视觉研究院)  计算机视觉研究院  公众号ID|计算机视觉研究院  学习群|扫码在主页获取加入方式  https://pmc.ncbi.nlm.nih.gov/articles/PMC13183979/pdf/41598_2026_Article_42591.pdf  计算机视觉研究院专栏  Column of Computer Vision Institute  本文提...

  (来源:计算机视觉研究院)

  计算机视觉研究院

  公众号ID计算机视觉研究院

  学习群扫码在主页获取加入方式

  https://pmc.ncbi.nlm.nih.gov/articles/PMC13183979/pdf/41598_2026_Article_42591.pdf

  计算机视觉研究院专栏

  Column of Computer Vision Institute

  文提出了融合 CNN 与 Transformer 编码器的 YOLOv12 检测模型,在珊瑚形态检测任务上实现了精度与效率的双重突破。

  PART/1

  痛点   

  珊瑚形态(枝状、块状、板状等)直接反映了礁体结构复杂度、物种丰富度与生态韧性,是珊瑚礁健康评估的核心指标。但要让 AI 自动识别,面临三重核心挑战:

  :水体对光线的吸收、散射作用强,图像对比度低、色彩失真,悬浮物与遮挡普遍存在;

  :不同类别珊瑚的视觉特征相似度高,尤其是枝状珊瑚结构细碎,容易和背景、其他类别混淆;

  :实际监测多搭载于水下机器人等边缘设备,要求模型兼顾高精度与实时推理速度。

  过往的 YOLOv7、YOLOv11 等主流模型,要么抗水下畸变能力不足,要么全局特征建模能力偏弱,难以同时满足精度与效率要求。

  PART/2

  方法

  研究团队在 YOLOv12 的基础上,在网络颈部加入CNN+Transformer 双分支编码融合模块,同时发挥 CNN 的局部细节提取能力与 Transformer 的全局上下文建模能力,针对性解决水下场景的痛点。

  1. 整体架构

  模型分为四大模块:预处理→YOLOv12 骨干网络→颈部特征融合→检测头。

  • 预处理

      :图像统一缩放至 640×640,加入几何变换 + 光度调整,搭配 Mosaic、MixUp 等 YOLO 专属增强策略,提升模型泛化性;

  • 骨干网络

      :沿用 YOLOv12 的 C3k2、A2C2f 模块,提取多尺度层级视觉特征;

  • 颈部融合

      :核心创新点,双分支并行编码后做深度特征融合;

  • 检测头

      :解耦分类与回归分支,输出多尺度检测结果,经非极大值抑制去重后,输出珊瑚的边界框、形态类别与置信度。

【模型整体架构总览图】
【YOLOv12 详细网络结构图】

  2. 双分支特征编码

  • CNN 分支

      :基于改进 ResNet-50 架构,专注提取局部纹理、边缘、水螅体结构等细粒度空间特征,捕捉珊瑚形态的细节差异;

  • Transformer 分支

      :采用 Swin Transformer 块,以骨干输出的高分辨率特征图为输入,建模长距离空间依赖,将珊瑚个体与周围礁体环境关联,强化全局语义理解。

  3. 自适应特征融合

  两路特征输出后,通过专属融合模块做深度结合:

  •   先做特征拼接,再通过SE 通道注意力 + 空间注意力筛选关键特征;

  •   引入可学习参数Self.gamma,自适应调整 Transformer 特征与 CNN 特征的贡献权重;

  •   融合后特征送入 YOLOv12 颈部做上采样、拼接与多尺度聚合,输出小、中、大三类尺度特征图,适配不同尺寸的珊瑚群落。

  这种设计既保留了 YOLO 系列的高效检测能力,又通过双分支互补,解决了水下场景细节丢失、语义模糊的核心问题。

  PART/3

  实验    

  研究基于 Roboflow-100 基准中的珊瑚数据集开展实验,涵盖枝状、块状、板状三类典型珊瑚形态,按 7:2:1 划分训练 / 验证 / 测试集,在 NVIDIA A100 GPU 上完成训练。

  1. 训练与检测效果

  模型训练过程收敛平稳,定位、分类、置信度三类损失持续下降,无剧烈波动,证明融合架构的训练稳定性。

【训练与验证损失曲线】

  实际检测中,模型可准确识别无珊瑚的背景区域,大幅降低误检;对低对比度、部分遮挡的珊瑚也能精准定位与分类,其中板状珊瑚识别置信度最高,枝状珊瑚因结构细碎置信度略低。

【多场景珊瑚检测结果示例】
【单张珊瑚图像放大检测效果对比】

  2. 核心性能指标

  最终模型在测试集上取得了全面领先的成绩:

  •   精确率 91.4%,召回率 90.1%

  •   mAP@0.5 94.2%,mAP@0.5:0.95 58.5%

  三类珊瑚的 PR 曲线 AUC 分别为:枝状 0.88、块状 0.90、板状 0.91,板状珊瑚因形态特征突出,识别效果最优。

【Precision/Recall/mAP 等指标训练曲线】
【三类珊瑚精确率 - 召回率(PR)曲线】

  从混淆矩阵来看,三类珊瑚的分类准确率分别达到 93%、94%、96%,错分主要集中在枝状与块状之间,源于水下遮挡与形态视觉相似性,整体区分度优异。

【归一化混淆矩阵】
【t-SNE 特征空间可视化,三类珊瑚特征聚类边界清晰】

  3. 横向对比:全面超越主流模型

  和 Faster R-CNN、RetinaNet、YOLOv8、YOLOv10、SwiftFormer、RT-DETR 以及原生 YOLOv12 相比,所提模型在所有检测指标上均位列第一。

【各模型单类别 mAP@50 对比柱状图】
【各模型检测性能与计算效率综合对比】

  效率方面,模型单图推理仅需 16ms,参数量 25.6M,计算量 42G FLOPs—— 虽比原生 YOLOv12 略有提升,但远低于纯 Transformer 架构,完全满足实时监测的部署要求。

  4. 消融实验:验证模块价值

  研究通过消融实验验证了每个模块的增益:

  •   仅加入 CNN 细化分支:mAP@0.5 从 87.6% 提升至 89.9%;

  •   仅加入 Transformer 编码器:mAP@0.5 提升至 91.8%;

  •   两者融合(最终方案):mAP@0.5 达 94.2%,证明局部 + 全局特征存在显著协同增益。

  同时验证了颈部中间融合的效果最优,优于骨干早期融合与检测头晚期融合,平衡了空间细节与语义信息。

【各模块消融实验结果】
【融合位置消融实验结果】

  PART/4

  总结与展望

  1. 实际应用价值

  这套方案为珊瑚礁自动化监测提供了高精度、可落地的技术路径,可搭载于自主水下机器人(AUV)实现大规模、常态化礁体巡检,辅助保护区规划、珊瑚修复评估、渔业生产力测算等工作,推动海洋生态管理从 “人工抽样” 走向 “数据驱动”。

  2. 局限性与未来方向

  目前研究仍存在一定局限:数据集覆盖的水下场景有限,极端浑浊、不同水深的泛化性有待验证;模型参数量略有增加,面向低功耗嵌入式设备还需轻量化优化。

  未来研究将围绕四个方向推进:

  •   加入视频时序信息,优化遮挡场景的检测稳定性;

  •   融合声呐、高光谱等多模态数据,进一步区分形态相似的珊瑚物种;

  •   轻量化模型改造,适配边缘设备部署;

  •   拓展三维珊瑚结构检测,提升生态评估的维度与精度。

  珊瑚礁的退化正在加速,而 AI 技术正在成为海洋保护的新利器。这套 YOLOv12 融合架构不仅刷新了水下珊瑚形态检测的精度纪录,也为复杂水下场景的目标检测提供了可复用的技术思路。

  有相关需求的你可以联系我们!

特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。