官方网站-首页官方网站-首页

科技有限公司
商店{联系电话}400-86503662搜索本站
暗光也不翻车!这套 YOLOv26 方案,搞定智能货柜小商品检测
暗光也不翻车!这套 YOLOv26 方案,搞定智能货柜小商品检测
2026-07-19 16:38:51
摘要:
  (来源:计算机视觉研究院)  计算机视觉研究院  公众号ID|计算机视觉研究院  学习群|扫码在主页获取加入方式  https://pmc.ncbi.nlm.nih.gov/articles/PMC13210943/pdf/sensors-26-03264.pdf  计算机视觉研究院专栏  Column of Computer Vision Institute  本文提出一款专为无人机...

  (来源:计算机视觉研究院)

  计算机视觉研究院

  公众号ID计算机视觉研究院

  学习群扫码在主页获取加入方式

  https://pmc.ncbi.nlm.nih.gov/articles/PMC13210943/pdf/sensors-26-03264.pdf

  计算机视觉研究院专栏

  Column of Computer Vision Institute

  文提出一款专为无人机荔枝园监测打造的实例分割模型 ——MFD-YOLO,用两个核心创新设计完美破解了 “高精度” 与 “低算力” 的矛盾,在复杂果园场景里实现了精度、效率的双重突破。

  PART/1

  痛点   

  视觉方案是无人零售的主流趋势,相比 RFID、重力感应方案,它成本更低、商品替换更灵活,但落地中始终绕不开三大痛点:

  :柜内光线不均、夜间低光场景下,商品纹理、logo 特征模糊,检测精度大幅跳水;

  :从小袋装零食到大瓶饮料,商品尺寸跨度大,小体积商品极易被背景淹没,出现漏检;

  :零售柜多搭载嵌入式设备,算力有限,大模型难以实现实时检测。

  传统通用检测算法大多针对公开数据集设计,缺少对零售柜场景的针对性优化,始终在精度和速度之间难以平衡。

  PART/2

  创新

  研究团队以轻量型 YOLOv26 为基线,从特征提取、上采样融合、注意力增强三个维度针对性改造,打造零售场景专用检测模型。

【整体算法流程图】

  ▲ 改进后 YOLOv26 整体架构,分为骨干网络、特征融合颈部、检测头三部分

  1. C3k2 增强模块:多尺度捕捉商品特征

  原始 C3k2 模块感受野单一,难以应对商品遮挡、尺度变化大的问题。团队引入多膨胀率空洞卷积,在不显著增加参数量的前提下扩大感受野,同时捕捉不同尺度的上下文信息,强化小商品的特征表达。配合深度可分离卷积保证特征图分辨率一致,为后续多尺度融合打好基础。

【增强型 C3k2 模块拓扑图】

  2. CARAFE 上采样:内容感知还原细节

  传统双线性插值上采样容易造成特征模糊、边缘细节丢失,团队替换为 CARAFE 内容感知特征重组模块。它能根据当前特征图的内容动态生成采样核,自适应地重组局部特征,大幅提升上采样后的空间细节还原度,尤其能减少小商品、遮挡商品的特征损耗。

  3. EMA 注意力 + 检测头优化:聚焦关键信息

  在检测头中融入高效多尺度注意力(EMA)机制,通过分组通道、跨空间学习的轻量化设计,让模型自动聚焦商品的 logo、包装纹理等核心特征,抑制背景噪声,在低光环境下也能精准捕捉有效信息。同时采用卷积下采样优化结构,进一步提升特征融合效率,降低计算开销。

  PART/3

  实验    

  团队在自建零售数据集、RPC 公开数据集等多个基准上完成测试,全方位验证方案效果。

  1. 基准性能:召回率显著提升

  在包含 20 类商品、共 6467 张图像的自建数据集上,方案在推理速度保持 1.5ms 不变的前提下,Recall 从 0.945 提升至 0.962,低光、遮挡场景的漏检率明显下降。

【自建数据集各模型性能对比表】

  2. 消融实验:模块协同增益明显

  通过逐项叠加模块验证,三大组件形成了明确的互补效应:

  •   单独使用 CARAFE 上采样反而会小幅掉点,必须配合更强的特征提取能力才能发挥价值;

  •   C3k2 增强 + CARAFE 组合,mAP@50 从 0.974 提升至 0.976,Recall 升至 0.952;

  •   三大模块全量叠加后,Recall 进一步提升至 0.954,达到整体最优效果。

【多模块消融实验对比表】

  3. 注意力对比:轻量又高效

  和 CBAM、CA、ECA、SENet 等主流注意力机制相比,EMA 模块实现了 “精度涨、算力不涨”:mAP@50 达到最高的 0.976,同时计算量最低、推理速度最快,完美适配边缘部署场景。

【注意力机制对比实验表】

  4. 低光场景:效果肉眼可见

  在亮度逐级降低的测试中,基线模型在极端低光下置信度从 0.78 暴跌至 0.51,检测框也出现偏移;而改进后的模型依然能保持精准定位,置信度维持在 0.83 的高位。在多商品密集、反光、噪声、局部阴影等复杂场景下,也能有效区分相邻商品,减少误检和漏检。

【不同光照下检测效果对比图】
【复杂退化场景检测效果对比图】

  热力图可视化也印证了优化效果:改进后的模型注意力更集中在商品主体上,背景干扰更少,即使是被遮挡的小商品,也能保持稳定的高响应。

【注意力模型热力图可视化对比】

  PART/4

  总结与展望

  这套方案不仅精度达标,还专门针对边缘设备做了适配,真正具备落地能力。

  1. 云边协同部署架构

  团队采用 “端侧采集 + 云端推理” 的云边协同方案:前端用 Jetson Nano B01 完成图像采集、结果展示,通过 WiFi 上传到云端服务器完成推理,检测记录同步存入后台数据库,兼顾实时性和远程运维能力。

【云边协同检测系统架构图】

  2. 边缘端实时性能

  最终模型的计算量仅 6.3 GFLOPs,导出 ONNX 格式并转换为 TensorRT 引擎后,在 Jetson Nano 平台上可达25FPS,完全满足智能零售柜的实时检测需求,实现了精度和部署效率的平衡。

【实际检测界面演示图】

  小结

  这套面向低光智能货柜的 YOLOv26 改进方案,精准命中了零售场景 “低光、小商品、边缘部署” 三大核心痛点,通过定向的结构优化,在不大幅增加算力的前提下实现了检测性能的全面提升。未来团队还将进一步轻量化模型结构、优化低光预处理流程,推动方案在更低算力的设备上落地,助力无人零售视觉方案的普及。

  有相关需求的你可以联系我们!

特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。