Improved YOLOv8-SST for accurate detection of small floating objects in complex water environments
《Improved YOLOv8-SST》主要研究内容是针对复杂水域环境下的小尺寸漂浮物检测难题提出了一种基于YOLOv8n的改进算法YOLOv8-SST并通过多项实验验证了其有效性。以下是全文的核心内容总结1. 研究背景与问题应用需求水面漂浮垃圾塑料瓶、塑料袋等严重污染水质、破坏生态、危害健康亟需利用无人艇USV和计算机视觉进行高效自动检测。核心挑战水面目标小、特征不明显光照变化、水面反射、波纹干扰严重现有YOLOv8等模型在复杂水域场景中易出现漏检和误检。2. 提出的方法YOLOv8-SST的三大改进改进点具体措施目的特征提取引入C2fBFC2f-BiFormer模块基于BiFormer的双层路由注意力机制在主干网络下采样时保留细粒度上下文信息减少噪声干扰增强长程依赖建模损失函数使用Inner-CIoU损失替代原CIoU损失借助辅助边界框灵活调整尺度提升小目标定位精度和收敛效果优化器将Adam优化器替换为Sophia优化器二阶轻量级优化器提高模型泛化能力避免陷入尖锐局部极小值稳定训练过程3. 数据集与实验设置数据集来源整合FloW-Img、WSODD及自采数据共4,964张图像分为Bottle和Garbage两类。划分比例训练:验证:测试 6:2:2。评估指标mAP0.5、mAP0.5:0.95、GFLOPs、FPS。硬件平台NVIDIA RTX 4090PyTorch 2.0.1。4. 主要实验结果对比项结果与YOLOv8n基线比较mAP0.5 提升3.1%达91.2%mAP0.5:0.95 提升5.0%达60.3%消融实验三个改进模块C2fBF、Inner-CIoU、Sophia均有正向贡献组合使用效果最佳与主流模型对比优于Faster R-CNN、SSD、YOLOv5s、YOLOv7-tiny、Gold-YOLO-S等在精度和速度间取得良好平衡推理速度FPS为86 f/s虽略低于YOLOv8n108 f/s但仍满足实时检测需求可视化分析在反光、相似背景、密集小目标等场景下误检和漏检明显减少但对极端光照仍存在局限性5. 结论与展望结论YOLOv8-SST在复杂水域小目标检测上具有明显的精度优势和良好的鲁棒性三大改进注意力机制、损失函数、优化器均有效组合效果最优。不足与未来工作计算复杂度略有增加GFLOPs从8.2升至12.9在极端光照和强反射条件下仍有漏检下一步将优化网络结构、扩展多类别数据集如7类漂浮物并增强模型对动态水面的适应性。6. 论文贡献总结一句话本文通过融合双层路由注意力、改进损失函数和二阶优化器显著提升了YOLOv8n在水面小目标漂浮物检测任务中的精度与泛化能力为水域智能监控和无人艇自主清理提供了有效技术方案。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要为响应水环境保护的迫切需求本研究提出了一种改进的水面漂浮物检测算法YOLOv8-小水面目标You Only Look Once version 8 - Small Surface Targets, YOLOv8-SST。该算法旨在解决光照变化和水面畸变对漂浮物检测的影响以及复杂水域场景中小目标检测的漏检和误检问题。首先为减轻复杂水域环境中主干网络下采样过程中引入的噪声干扰开发了一个基于BiFormer双层路由注意力机制的C2fBFC2f-BiFormer模块。该模块在特征提取过程中能有效保留细粒度的上下文特征信息。其次将传统的损失函数替换为在辅助边界框下更有效的Inner-Complete Intersection over Union (Inner-CIoU)损失使模型在检测过程中能更灵活地调整辅助框的尺寸从而提高检测精度。最后将原始算法中的自适应矩估计Adam优化器替换为二阶裁剪随机优化Sophia优化器以提高模型的泛化能力。在整合了Flow-Img、WSODD和我们自采集数据的组合数据集上YOLOv8-SST的性能优于基线YOLOv8n平均精度均值mAP0.5提高了3.1%mAP0.5:0.95提高了5.0%。这些结果证明了所提方法在具有挑战性的自然水域环境中进行小目标检测的有效性和鲁棒性。引言当前湖泊、河流和城市水体中漂浮垃圾的日益增多正在加剧全球水污染危机。水面垃圾带来的危害可总结如下1塑料垃圾长期浸泡在水中会释放有害化学物质降低水质。2漂浮物阻碍光线穿透破坏现有的生态平衡。3塑料垃圾逐渐分解为微塑料可被水生生物摄入并进入人类食物链构成重大健康风险。4堆积的垃圾严重阻碍船舶航行。因此有效管理水面垃圾已引起全球范围的广泛关注[1]。研究表明中国是世界上河网最密集的国家之一流域总面积达509.8万平方公里占国土面积的53.1%[2]。因此管理内陆水体中的垃圾已成为一个关键问题使得水资源保护成为当务之急。随着无人技术和计算机视觉的进步传统的人工水域巡查正越来越多地被智能系统取代。无人水面艇USV是一种无需人工控制的自主船只可以通过传感器技术根据预设任务在水面航行在执行危险和耗时任务方面展现出更强的能力[3]。USV现已广泛应用于港口巡检、渔业监测和海事管理等各个领域包括目标检测和环境监测等任务[4, 5]。使用USV检测水面漂浮垃圾是一种非常有效的方法。目标检测技术的评估对于最大化USV的识别性能至关重要而基于深度学习的目标检测算法因其较高的目标识别精度而备受关注。近年来涌现出许多旨在提高水面漂浮物识别能力的检测模型。李夏黎等人[6]旨在通过将YOLOv3的检测尺度从三个简化为两个来提高水面小漂浮物的实时检测性能。此外为确保对小目标的检测精度重新聚类了训练数据集中的锚框以替换原始YOLOv3中部分不适用于该数据集的先验锚框。徐嘉盛等人[7]旨在提高复杂环境下近岸漂浮物检测的精度和计算效率。基于YOLOv3他们引入了一种与卷积算子集成的Efficient Channel Attention Network (ECANet)机制以优先处理关键区域从而提高检测精度。此外融入空间金字塔池化SPP模块促进了不同感受野特征的融合使模型能有效捕获跨尺度信息。实验结果表明平均精度均值mAP达到了93.73%提高了6.87%而帧率FPS达到了35.78比原始模型提高了2.21 FPS。张丽丽等人[8]提出了一种单阶段目标检测模型EYOLOv3该模型采用多尺度特征提取与融合模块来增强网络的特征表示能力。此外使用更有效的聚类算法分析漂浮物的尺寸特征以设计锚框提高了目标检测效率。同时引入Focal Loss损失函数有效解决了样本不平衡的问题。唐伟等人[9]针对小漂浮物检测的挑战以及现有检测算法计算量大、难以在嵌入式设备上实时运行的问题提出了一种基于改进YOLOv4的检测方法。他们首先将YOLOv4的主干网络替换为MobileNetV3。此外引入了负反馈机制利用训练过程中小目标损失占总损失的比例作为选择性数据增强的反馈从而提高小目标的检测精度。实验结果表明与原始YOLOv4相比所提模型参数减少了82.4%检测速度提高了52%。张晓红等人[10]提出了一种混合注意力机制该机制支持通道间的远程交互同时保持每个通道与其权重之间的直接对应关系。基于此注意力机制开发了一个自适应特征提取模块即使在因下采样导致特征丢失的情况下也能捕获目标特征。此外引入了一个专门针对小目标的检测层以增强小漂浮物的检测性能。李赫等人[11]提出了一种基于改进YOLOv5s的新方法。他们设计了一种针对小目标的新型数据增强策略并在特征提取网络的不同层级应用了不同的坐标注意力池化方法以增强小目标的有效特征表示从而提高检测精度。与原始YOLOv5相比所提方法的精度提高了15.7%小目标任务的误检率降低了83%边缘测试精度达到92.01%帧率达到33 FPS。陈福勋[12]在YOLOv5模型中融入了一个浅层小目标检测头整合了空间和语义特征以最大程度地保留小水面漂浮物的关键特征。此外将CIoU损失替换为考虑真实框与预测框之间方向的SIoU从而提高对小水面目标的检测效果。所提出的改进通过更好地融合浅层和深层特征有效解决了漏检问题。与原始YOLOv5相比增强模型在平均精度AP和召回率R方面均有显著提升分别提高了5%和6.1%。杨兴帅等人[13]提出了一种名为YOLOv5_CBS的新型检测模型。首先将非压缩坐标注意力CA机制融入C3模块以构建C3-CA-Uncompress Bottleneck (CCUB)模块扩大了感受野并增强了对关键特征的关注。其次用双向特征金字塔网络BiFPN替换了原始路径聚合网络PAN以改进多尺度特征融合和信息挖掘能力。最后采用SCYLLA-IoU (SIoU)损失函数替代CIoU损失加速收敛并提高回归精度。这些修改共同显著增强了模型的特征提取和检测性能。李宁[14]提出了一种基于YOLOv6的细节增强噪声抑制YOLOv6检测算法DENS-YOLOv6。首先为了更好地捕获小目标的细节特征设计了基于空洞卷积的细节信息增强模块DIEM。其次开发了自适应噪声抑制模块ANSM以抑制影响小目标的噪声干扰。最后采用基于归一化Wasserstein距离NWD的回归损失函数来提高训练稳定性和收敛速度。在Pascal VOC2007数据集上的实验表明mAP值分别达到40.6%和11.4%。蒋占军[15]提出了一种基于APM-YOLOv7一种集成了ACanny、PConv-ELAN和MGA注意力的改进YOLOv7的小目标检测方法。首先设计了自适应Canny算法ACanny来提取河流轮廓减少背景干扰并增强小目标特征提取。其次引入轻量级部分卷积PConv构建高效层聚合模块PConv-ELAN改进对形态各异漂浮物的特征捕获。最后提出了一种多尺度门控自适应权重分配机制MGA以强调小目标特征并减少漏检。实验表明与YOLOv7相比该方法将平均精度均值mAP提高了7.02%。栾庆磊等人[16]开发了PAW-YOLOv7。首先添加了小目标检测层并引入了自注意力和卷积混合模块ACmix以增强特征表示。其次颈部网络采用全维动态卷积ODConv替代标准卷积以减少背景干扰并改善全局上下文建模。第三将部分卷积PConv集成到主干网络中以降低计算成本并采用WIoU损失替代CIoU以优化回归精度。在FloW-Img数据集上PAW-YOLOv7的检测精度达到了89.7%比原始YOLOv7提高了9.8%。王鸿儒等人[17]提出了一种基于改进YOLOv8的模型。首先通过整合高分辨率检测头和剪枝冗余网络层构建了重塑的网络结构。引入FasterNet的主干网络来优化C2f模块从而减少不必要的计算。一个融合的全局坐标注意力FGCA模块被嵌入到路径聚合网络PAN中一个无参数平均注意力模块PfAAM被集成到特征金字塔网络FPN中形成了一个创新的颈部融合网络GPAN PFPN能够以最小的计算负担处理恶劣场景中的复杂特征。宋丽丽等人[18]提出了一种基于YOLOv8n的改进YOLOv8-HSH算法。对HorBlock模块进行了增强以促进多梯度和多尺度特征融合强化关键的漂浮物特征。应用优化的CBAM注意力机制来减少背景噪声干扰显著提高了检测精度。此外增加了一个二次目标识别层以增强模型在不同环境中检测不同尺寸漂浮物的能力。实验结果显示mAP0.5和mAP0.5:0.95分别显著提高了11.7%和12.4%。陶洪峰[19]提出了一种新颖的网络架构CDFF-YOLO通过将多分支注意力模块嵌入CDFF模块来解决小目标检测中细粒度信息丢失的问题从而增强全局和局部特征之间的交互。此外设计了一个改进的网络来应对光照不均和遮挡等挑战。DFF模块对通过空间到深度卷积提取的小目标特征在频域和空域进行变换和融合提高了网络在双域重构和整合特征的能力。在TT100K数据集上的实验结果表明改进算法在mAP50和mAP50:95上分别提升了3.7%和4.8%小目标的平均精度和召回率分别提高了4.5%和3.7%同时保持了157 FPS的高帧率。葛泉波等人[20]解决了小目标在提取过程中特征丢失的问题他们基于小目标特征改进了注意力机制提出了一种多注意力模块并将其集成到特征提取过程中。此外引入了一个自适应重参数化广义特征金字塔网络Adaptive_RepGFPN。在自建数据集上与基线网络相比所提方法在mAP0.5和mAP0.5:0.95上分别实现了9.1%和3.5%的提升。参考文献[21, 22]分别采用了Faster R-CNN和Mask R-CNN。与YOLO等单阶段检测器相比这些方法计算复杂度更高检测速度相对较慢不太适合实时应用。尽管现有的目标检测算法在精度和推理速度上都取得了显著提升但检测水面上细小且不显眼的漂浮物仍然是一个相当大的挑战。主要原因如下1当前的检测算法由于缺乏针对小目标的专门设计对小目标的精度相对较低而水面垃圾数据集中小目标占比很高导致检测效果不佳2漂浮物受到光照变化、水纹和反射等噪声因素的严重影响进一步降低了检测精度。YOLOv8是YOLO系列中的基础模型之一。与传统的基于锚点的检测方法相比其无锚点方法提供了更高的检测精度和更快的推理速度。然而在复杂的水域环境中由于小目标特征复杂和背景多样使用YOLOv8检测小漂浮物仍然具有挑战性导致定位误差和目标感知不足。为解决这些问题本研究提出了一种基于改进YOLOv8的算法称为YOLOv8-SST。首先为减轻复杂水域环境中主干网络下采样过程中引入的噪声干扰开发了一个基于BiFormer双层路由注意力机制的C2fBFC2f-BiFormer模块该模块在特征提取过程中保留了细粒度的上下文特征信息。其次将传统的损失函数替换为在辅助边界框下更有效的Inner-Complete Intersection over Union (Inner-CIoU)损失使模型在检测过程中能更灵活地调整辅助框尺寸从而提高检测精度。最后将模型中原本使用的Adam优化器替换为Sophia优化器增强了模型的泛化能力。本文的其余部分组织如下。第2节回顾了YOLOv8模型并介绍了本研究中使用的数据集和评估指标。第3节介绍了所提出的YOLOv8-SST算法。第4节报告了实验结果和讨论。最后第5节概述了未来的研究方向并对研究进行了总结。相关工作YOLOv8 网络模型YOLOv8在YOLOv5[23]的精度基础上进行了显著改进在网络结构、损失函数和样本分配策略等多个方面进行了增强。主要改进如下(1) 网络结构YOLOv8的主干网络保留了YOLOv5的架构但将原始的C3模块替换为C2f模块。C2f模块的设计借鉴了C3模块和YOLOv7[24]中的ELAN概念在保证轻量化的同时实现了更丰富的梯度流。在颈部网络部分YOLOv8继续沿用YOLOv5的结构C3模块也同样被C2f模块替换。此外PAN-FPN中上采样操作之前的卷积模块被移除使得来自主干网络不同阶段的特征图可以直接输入到上采样层。YOLOv8的网络架构如图1所示。图 1. YOLOv8 网络模型。(2) 损失函数YOLOv5的损失函数包含三个部分分类损失cls_loss、回归损失box_loss和置信度损失obj_loss。相比之下YOLOv8仅使用Varifocal Loss[25]进行分类。Varifocal Loss的主要进步在于引入了非对称加权有效解决了正负样本数量不平衡的问题。(3) 样本分配策略YOLOv5使用静态分配策略。考虑到动态分配策略的优势YOLOv8采用Task-Aligned Assigner[26]进行正负样本匹配实现了无锚点方法而不是基于IoU匹配或基于锚点方法的单边比例分配方案。Task-Aligned Assignment方法的匹配策略根据分类和回归指标加权的得分来选择正样本。数据集构建本研究使用的数据集主要来源于内陆漂浮垃圾数据集FloW[27]、水面目标检测数据集WSODD[28]以及我们自行采集的常见水面漂浮物。FloW数据集是首个从无人水面艇视角开发的漂浮垃圾检测数据集旨在关注内陆水域漂浮垃圾的清理工作同时也为水面小目标检测研究提供参考。其子集FloW-Img包含2,000张图像和5,271个标注对象尺寸各异。此外FloW数据集还提供了200个未标注的水面视频序列为目标检测算法研究提供了更多素材。WSODD由Zhou等人开发是为自主水面驾驶提出的一个大规模、高质量的基准数据集它包含7,467张水面图像涵盖14个类别和21,911个标注实例。在本研究中我们从WSODD中手动挑选了564张图像并将其纳入FloW-Img子集。考虑到FloW数据集和WSODD中包含的漂浮垃圾类型相对单一我们自行拍摄了2,400张漂浮物图像最终得到总计4,964张水面漂浮物图像。数据集包括1,600张正常水面图像和3,364张漂浮物图像分类如下1,950张瓶类垃圾图像172张草类垃圾图像395张树枝类垃圾图像190张牛奶盒类垃圾图像155张塑料袋类垃圾图像252张树叶类垃圾图像100张球类垃圾图像以及150张塑料垃圾类图像。考虑到瓶类垃圾占比很大而其他类型占比相对较小数据集被分为两类Bottle和Garbage。使用LabelImg工具所有4,964张图像均被重新标注为YOLO格式并分为两类Garbage和Bottle。为满足实验要求数据集按6:2:2的比例划分为训练集、验证集和测试集。评价指标本研究通过mAP、模型计算成本千兆浮点运算次数GFLOPS和每秒帧数FPS来评估测试模型的性能。mAP用于评估模型的准确性其计算公式如下方法论在本研究中由于YOLOv8n参数少、检测速度快适合所提算法因此被选为基线模型。在YOLOv8框架的基础上提出了YOLOv8-SST算法。与原始YOLOv8相比YOLOv8-SST算法引入了以下改进1基于BiFormer双层路由注意力机制的C2fBFC2f-BiFormer模块在特征提取过程中保留细粒度上下文特征信息2在辅助边界框下使用更有效的Inner-Complete Intersection over Union (Inner-CIoU)损失替换原始损失函数3用Sophia优化器替换Adam优化器增强模型的泛化能力。对主干网络的改进在复杂的水域环境中图像容易受到天气条件、光照变化和水面反射等各种干扰因素的影响产生多种类型的噪声。具体而言强光会导致水面产生强烈反射如图2(a)所示图像采集时环境光照不足会导致模糊和失真如图2(b)所示密集分布的漂浮物会导致物体间相互遮挡如图2(c)所示。在利用卷积神经网络CNN从这类场景图像中提取特征的过程中通常会引入大量噪声。这些噪声会破坏特征图中像素间的长程依赖关系从而削弱模型检测和识别水面目标的能力最终可能导致误检或漏检。为减轻噪声对模型性能的不利影响本研究引入了一种能够捕获长程依赖关系的机制以增强水面场景中的目标检测和识别能力。BiFormer作为Transformer的一种变体采用双层路由注意力机制能够实现更灵活的计算分配和内容感知处理。这种设计允许动态的注意力计算从而更准确地提取关键特征。图 2. 水面干扰因素。图 3. 双层注意力机制。图 4. BiFormerBlockC2fBF。损失函数的改进Inner-CIoU 损失函数整合了 Inner-IoU [29] 和 Complete IoU (CIoU) [30] 的概念旨在提升小目标的检测性能以及整体检测精度。具体而言Inner-IoU 损失在传统 IoU 的基础上引入了一个针对小目标的惩罚项。该损失函数在处理小目标或部分重叠的边界框时其敏感性和鲁棒性更为突出具有多重优势。传统的 IoU 在边界框仅部分重叠时优化过程中可能会产生过高的损失值而 Inner-IoU 则专注于边界框内的重叠区域。这种设计确保了即使边界框之间存在微小误差损失函数也能保持高敏感性。此外Inner-IoU 利用一个称为比例ratio的缩放因子来生成不同尺度的辅助边界框用于损失计算。通过调整 ratio 参数可以使惩罚项适应不同检测任务的需求。Complete IoU (CIoU) 是传统 IoU 损失函数的扩展它引入了额外的几何因素以实现预测框与真实边界框之间更精确的几何对齐同时加速收敛过程。具体而言CIoU 引入了一个基于两框中心点距离的惩罚项从而确保预测边界框在空间位置上与真实框更精确地对齐。因此Inner-CIoU 损失函数整合了两种损失函数的改进不仅提升了对大目标的检测性能也显著优化了小目标的检测同时在一定程度上加速了模型收敛。该损失函数的表达式如下Sophia 优化器Adam算法[31]是一种基于自适应矩估计的优化方法。它计算模型梯度的一阶和二阶矩估计为不同的模型参数设计独立的自适应学习率。这使得每个参数都能保持自己的学习率从而提升模型参数的性能[32]。然而Adam优化器倾向于收敛到具有大曲率的尖锐极小值这可能导致较差的泛化性能。因此虽然Adam收敛速度快但其泛化性能并非最优。本文引入了一种新的优化器Sophia[33]以加速模型的收敛速度和精度。Sophia是一种轻量级的二阶优化器它使用Hessian矩阵对角线的廉价随机估计作为预处理器并通过裁剪机制控制最坏情况下的更新幅度。Hessian矩阵是二阶偏导数矩阵描述了函数在给定点的局部曲率。对于函数其对应的Hessian矩阵H的元素由公式(7)给出图5展示了包括 signSGD [34]、Adam、梯度下降GD、牛顿梯度下降和 Sophia 在内的几种优化算法在二维损失函数上的行为。signSGD 的轨迹表现出明显的振荡表明其在搜索最优解过程中波动较大收敛速度相对较慢。尽管 Adam 表现出更平滑的轨迹和更快的收敛速度但其过度的平滑性可能导致算法陷入局部最优而非全局最小值。GD 算法收敛非常缓慢而牛顿法倾向于收敛到鞍点。相比之下Sophia 在两个维度上都能快速前进并且能在短短几步内收敛到最小值。通过更新模型优化器漂浮物检测模型能够更好地适应复杂的水面环境从而提高漂浮物检测过程的效率。改进后的优化器显著降低了检测容易被遮挡的复杂目标时引入的置信度损失。Sophia 优化器带来的更新使得各种检测目标的精度曲线更加稳定使其更适合检测水面上的复杂目标。通过更新模型优化器漂浮目标检测模型能够更好地适应复杂的水面环境从而提高水面目标检测的效率。实验评估采用 Precision-Confidence 和 Recall-Confidence 曲线作为指标。优化器更新前后的实验结果对比见图6。通过观察两组曲线可以发现优化器的改进显著降低了检测具有挑战性和易遮挡目标时的置信度损失。Sophia 优化器引入的更新使得各种检测目标的精度曲线更加稳定使其更适合复杂的水面检测场景。实验结果与分析改进方法的效果比较为探究所提改进算法的实际效果我们进行了实验分析了加权损失函数和优化器对最终模型性能的影响。通过比较公式(6)中的 Inner-CIoU 与 DIoU [30]、GIoU [35]、EIoU [36] 和 CIoU从表1可以看出使用 Inner-CIoU 损失函数的 YOLOv8 在 mAP 方面表现最佳。与原始基于 CIoU 的算法相比其 mAP0.5 提高了 0.6%mAP0.5:0.95 提高了 0.3%。由于对优化器的改进不影响 GFLOPs 和 FPS 参数所提出的 Sophia 优化器显著优于原始 Adam 优化器在 mAP0.5 和 mAP0.5:0.95 指标上分别提高了 1.1% 和 0.5%。与其他常用优化器如带权重的 Adam (AdamW) [37]、RAdam [38]、Nadam [39]、Adamax [31] 和均方根传播 (RMSProp)相比Sophia 表现最佳。具体结果如表2所示。消融实验如表3所示引入 SPPF-LSKA 模块后检测精度有所提高mAP0.5 和 mAP0.5:0.95 分别提升了 1.0% 和 1.3%。加入 NWD 回归损失函数也增强了模型对小目标的检测性能mAP0.5 和 mAP0.5:0.95 分别提高了 0.6% 和 1.1%。当同时使用 SPPF-LSKA 模块和 NWD 回归损失函数时mAP0.5 和 mAP0.5:0.95 分别提升了 1.3% 和 4.3%。最后用 Sophia 替换 Adam 优化器显著提升了整体模型性能mAP0.5 和 mAP0.5:0.95 分别增加了 1.1% 和 1.8%。图7显示了改进模型与原始模型 mAP 之间的变化。尽管检测速度FPS有所下降但仍保持在 86 f/s 的高速率。不同模型的检测实验对比为验证所提出的 YOLOv8-SST 算法在水面漂浮物检测方面的优越性我们将其与主流目标检测算法包括 Faster R-CNNSSD表 2. 应用改进优化器后测试模型的比较。表 3. 消融实验结果。图 7. YOLOv8-SST 与 YOLOv8n 的 mAP 比较。YOLO 系列即 YOLOv5、YOLOv7 和 Gold-YOLO-S [39]以及结合了广义特征金字塔网络GFPN[40] 的 YOLOv8 模型和使用部分卷积Pconv[41] 的 YOLOv8 模型在相同数据集和实验条件下进行比较。所有实验均在使用 NVIDIA RTX 4090 GPU24 GB 显存、Intel Core i9-13900K CPU 和 64 GB RAM 的工作站上进行。所提出的 YOLOv8-SST 模型使用 PyTorch 2.0.1 实现并利用 CUDA 11.8 加速。训练时输入图像调整为 640×640 像素。初始学习率设为 0.001批次大小为 16并使用 Sophia 优化器配置动量为 0.937权重衰减为 0.0005。为确保可重复性和公平比较本研究中比较的所有基线模型均在相同的条件下包括超参数设置进行训练。表4显示所提算法在 mAP0.5 值上分别提高了 5.0%、2.7%、3.1% 和 3.7%。同样mAP0.5:0.95 值分别提高了 7.6%、4.6%、5.0% 和 7.2%。与 YOLOv5s 和 YOLOv7-tiny 相比所提算法在降低计算复杂度的同时实现了检测速度的提升分别提高了 3 f/s 和 14 f/s。尽管所提算法的检测速度低于 YOLOv8n但仍能满足实际检测需求。此外所提算法相比 Gold-YOLO-S 也表现出更好的计算效率。YOLOv8-PConv 在处理缺失或不完整的输入信息方面特别有效因为它能自适应地忽略无效区域以避免错误的特征提取结果。此外YOLOv8-GFPN 有效整合了不同尺度的特征这对于检测多尺度目标至关重要并能提供更高的检测精度。然而这两种模型的轻量级特性在实时检测场景中并未提供显著优势。总之改进后的 YOLOv8-SST 算法显著降低了计算复杂度同时在检测速度和平均精度方面相比 Faster R-CNN 和 SSD 网络取得了显著提升。因此改进后的 YOLOv8-SST 算法不仅显著提高了检测精度而且保持了较高的检测速率优于当前主流的检测算法和其他改进算法。图8显示了各种 YOLO 系列算法包括 YOLOv5s、Gold-YOLO-S、YOLOv7-tiny、YOLOv8n、YOLOv8-PConv、YOLOv8-GFPN 以及所提出的 YOLOv8-SST 算法的 mAP 变化。经过 200 轮迭代训练后YOLOv8-SST 获得了最佳的 mAP 性能并且是唯一能够稳定保持在 90% 以上的算法。可视化分析为验证所提改进算法在实际水面上检测漂浮物的有效性从实验测试集中选取了漂浮物进行评估。这包括不同尺寸的漂浮物、不同背景下的漂浮物以及不同光照条件下的漂浮物检测结果如图9和图10所示。图9(a)显示所提算法在大目标检测方面表现良好。图9(b)显示该算法准确检测了大量小目标无明显误检或漏检表明其具有良好的鲁棒性和泛化能力因此我们的方法能有效满足现实场景的检测需求。表 4. 不同模型的性能比较。图 9. 不同尺寸目标的水面目标检测可视化。图10显示了所提算法在不同背景下对水面目标的检测性能。图10(a)显示在普通水面背景下该算法能准确检测几乎所有目标。图10(b)显示在近岸复杂背景下该算法仍能保持良好的检测性能仅有少量漏检。图10(c)显示当目标与背景颜色相似时检测置信度会有所下降。然而整体而言所提算法对背景变化表现出良好的鲁棒性并且相比原始YOLOv8n其在检测置信度上有显著提升。为了更直观地展示改进效果我们比较了原始YOLOv8n算法与本文改进算法在三种典型场景下的检测结果如图11所示。图11(a)显示了当存在反光干扰时YOLOv8n将水面的镜面高光误检为目标物体而YOLOv8-SST成功避免了这种误检。图11(b)显示了当面对与背景颜色极为相似的目标时YOLOv8n出现了漏检而YOLOv8-SST则能准确定位目标。图11(c)显示了在面对多个小目标时YOLOv8n存在漏检而YOLOv8-SST则能成功检测出更多目标。图11(d)显示了在密集背景下原始算法未能完全检测出所有目标。总体而言改进算法在小目标检测和各种背景下均优于基线算法。图12展示了模型在六种不同光照条件下的检测性能。模型在图12(a)、(b)、(c)中成功识别了漂浮物。然而图12(d)、(e)、(f)显示了不同程度的漏检包括完全未能检测到目标。尽管模型整体获得了较高的mAP分数但它在复杂水域环境中的鲁棒性仍然不足。此局限性主要归因于水面独特的光学特性——如强反射、高眩光区域、能见度降低——以及漂浮物受波浪引起运动影响的动态行为。这些失败案例突显了当前模型的固有弱点并为未来的改进提供了有价值的见解。具体来说它们强调了开发更具光照不变性和抗反射性的网络架构的必要性以及采用更全面、更真实的数据增强策略来捕捉水域环境中极端光照变化的必要性。结论本研究提出了一种基于改进YOLOv8n的算法YOLOv8-SST用于检测水面漂浮物重点在于减轻复杂水域环境引起的噪声干扰并显著提升小目标的检测性能和精度。主要改进如下首先引入了基于BiFormer双层路由注意力机制构建的C2fBFC2f-BiFormer模块在特征提取过程中保留细粒度上下文信息有效减少了复杂水域场景采样过程中产生的噪声。其次将传统的损失函数替换为更有效的 Inner-Complete Intersection over Union (Inner-CIoU) 损失使模型在检测过程中能灵活调整辅助边界框从而提高检测精度。第三采用 Sophia 优化器替代 Adam进一步增强了模型在不同场景下的泛化能力和适应性。与原始 YOLOv8n 算法相比YOLOv8-SST 的计算复杂度有所增加未来的工作将侧重于优化网络结构以提高效率。此外扩大输入数据集——特别是针对水生植物、树枝、牛奶盒、塑料袋、塑料碎片、球类和树叶等七类漂浮物——可以进一步提升算法在多类漂浮物检测任务中的性能。除了技术贡献外所提出的漂浮物检测算法与水体污染监测直接相关。通过准确识别漂浮物及其他污染物该模型可支持实际环境应用例如无人水面艇的自主清理、污染累积的早期预警系统以及大规模水质监测。这些能力可以提高河流、湖泊和沿海地区污染管理的效率和及时性。同时实际部署也面临挑战包括对极端光照、强反射和高动态水面的敏感性。未来的工作将侧重于增强在这些条件下的鲁棒性扩大数据集的多样性以涵盖更多真实世界场景并整合时间信息以确保在复杂水域环境中的稳定性能。此外所提出的 YOLOv8-SST 算法可以轻松扩展到其他涉及自然环境下小目标检测的任务。其强大的特征提取和注意力机制能够准确检测小尺寸和视觉上具有挑战性的目标使其适用于野生动物监测、空中监视和环境观测等应用在这些应用中小尺度目标通常出现在复杂和动态的条件下。