登录社区云,与社区用户共同成长
邀请您加入社区
本文介绍了一个专注于跌倒行为检测的YOLO格式数据集,包含5200张高质量标注图像,覆盖居家、病房等多种真实场景。该数据集具有以下特点:1) 多样化的跌倒姿态和场景条件;2) 精准人工标注;3) 适用于各类目标检测算法。数据集支持智慧养老、病房监护等应用场景,可用于跌倒预警系统的开发和算法研究。采用标准YOLO目录结构,包含训练集、验证集和测试集,可直接用于模型训练。该资源为跌倒检测领域提供了高质
给模型一张图、一句话,让它把目标区域的像素精确圈出来——听起来简单直接,但一旦目标描述含糊、被遮挡、或者需要推理才能定位,一次性猜出正确掩码就变得相当困难。传统图像分割模型就像闭着眼睛猜答案,猜对了算运气,猜错了没人告诉它错在哪。2026年,这个局面正在被彻底改写。从ICML 2026到CVPR 2026,从Meta的SAM 3到复旦的RSAgent,多模态AI Agent正在将图像分割从“单次猜
本文通过类比学生做题的过程,系统介绍了监督学习的核心概念和训练机制。主要内容包括: 监督学习本质:模型通过"做题(预测)-对答案(标签)-改参数(优化)"的循环过程逐步学习。 关键概念解析: 数据集划分:训练集(练习册)、验证集(模拟考)、测试集(期末考试) 标签:监督学习的标准答案 Loss:预测错误的量化指标 学习率:参数更新的调整幅度 训练流程:详细拆解了从输入样本到参数更新的6个关键步骤,
本文详细介绍了基于YOLOv5的反光衣检测全流程。首先安装必要依赖并准备已标注的数据集(2043张训练图,510张验证图),包含"反光衣"和"其他衣服"两个类别。通过配置data.yaml文件定义数据集路径和类别信息,使用YOLOv5s预训练模型进行训练,设置图像尺寸640、batch16、训练50轮次。训练完成后评估模型性能,并提供了完整的推理代码实现单图预测,包含图像预处理、模型推理和结果可视
本文介绍了一个基于YOLOv8的番茄成熟度检测系统开发方案。该系统使用包含800张专业拍摄的番茄图像数据集(包含大番茄和小番茄的红、黄、绿6个类别),通过YOLO格式的精准标注进行模型训练。开发流程包括:1)数据准备,组织图像和标注文件;2)环境配置,安装必要依赖库;3)YOLOv8模型训练与评估;4)PyQt5 GUI界面开发,实现图像/视频加载和实时检测功能。系统可准确识别不同品种番茄的成熟度
本文介绍了一种基于YOLOv8深度学习框架的输电塔杆绝缘子红外图像检测方法。使用包含约800张VOC格式标注的红外测温图像数据集,详细说明了从数据预处理到模型训练的全流程。关键技术点包括:1)VOC格式转换为YOLO格式的数据处理脚本;2)数据集划分方法;3)YOLOv8模型配置文件编写;4)环境配置与训练步骤。该方法为电力设备红外检测提供了有效的自动化解决方案,可用于绝缘子缺陷识别等实际应用场景
VSCode 实现codex的插件使用,AI编程
🏆 本文收录于专栏 《YOLOv11实战:从入门到深度优化》。本专栏围绕 YOLOv11 的改进、训练、部署与工程优化 展开,系统梳理并复现当前主流的 YOLOv11 实战案例与优化方案,内容目前已覆盖 分类、检测、分割、追踪、关键点、OBB 检测 等多个方向。
我们的方法将栅格化的户型图图像转换为矢量化格式,同时重建其结构和语义。我们在保留的 CubiCasa5K 测试样本(左)上展示了结果。颜色表示独特的语义类别(例如,室外、卧室、浴室和入口)。此外,我们突出了我们的模型在来自 WAFFLE 的复杂真实世界户型图图像(右)上的泛化能力。3D 可视化是通过将 2D 边界垂直延伸构建的。从栅格化户型图图像重建结构化的矢量图形表示,通常是涉及户型图的计算任务
视频自监督学习是视觉表征学习的核心研究方向,依托掩码自编码器范式的VideoMAE、V-JEPA等模型,已成为视频特征学习的主流方案。但现有视频模型普遍存在设计缺陷,多采用对称掩码与全局时空注意力机制,忽略视频时序的因果性与方向性,无法适配在线流式推理场景,且长序列处理时计算成本高昂、特征稳定性差。与此同时,现有视觉模型存在明显能力割裂:以DINOv2为代表的图像模型擅长挖掘空间几何、像素级精细特
本文介绍了一种基于多层次特征融合模块(SDI)和加权双向特征金字塔网络(ASF-YOLO)的全新Neck网络结构。该模型结合空间和尺度特征,显著提升了细胞图像分割的精度和速度,在实验中达到了0.91的boxmAP和47.3FPS的推理速度。文章详细讲解了ASF-YOLO和SDI模块的核心代码实现,并提供了两种可选的yaml配置文件版本(分别使用Add和attention_model机制),帮助读者
本文提出了一种改进的YOLOv26目标检测模型,通过结合TPAMI 2024最新机制FreqFusion与BiFPN进行二次创新。FreqFusion是一种频率感知特征融合方法,通过自适应低通/高通滤波器解决密集预测任务中的类别内不一致性和边界位移问题。该方法在作者的多类别数据集上实现了性能提升,同时具有轻量化优势。文章详细介绍了核心代码实现(包括FreqFusion模块和LocalSimGuid
本文介绍了ASF-YOLO模型在细胞实例分割和目标检测中的应用改进。该模型通过集成空间与尺度特征,显著提升了处理细胞图像的精度和速度,在实验中达到0.91 boxmAP、0.887 maskmAP和47.3 FPS的性能。文章详细解析了ASF-YOLO的核心模块:尺度序列特征融合(SSFF)、三重特征编码器(TFE)和通道位置注意力机制(CPAM),并提供了代码实现和模型添加教程。同时推荐了包含多
本文深入解析了U-Net在遥感语义分割领域的核心优势与应用策略。主要内容包括: U-Net的四大遥感优势: 小样本友好,解决标注稀缺问题 跳跃连接保留地物边界细节 轻量化架构适配普通显卡 高可改造性衍生多种变体 核心架构解析: 编码器(下采样)提取深层语义特征 解码器(上采样)还原像素级分割 跳跃连接解决边界模糊问题 应用场景选择: 原生U-Net适合通用分类 Attention UNet优化植被
文章摘要 本文探讨了算法工程师在技术面试中面临的挑战,指出传统刷题方式已无法满足2026年AI岗位的考核需求。作者提出了一种基于目标检测(YOLOv12/YOLOv13)和RAG架构的"AI面试官"解决方案,能够理解图片、检索相关知识并进行多轮追问。文章详细分析了YOLO系列的技术演进,阐述了RAG技术的优化方向,并提供了可复现的系统架构设计和实现方案。这一方案突破了传统面试工具的局限,为技术面试
数据集包含14个不同的特征,例如气温,大气压力和湿度。从2003年开始,每10分钟收集一次。为了提高效率,本文仅使用2009年至2016年之间收集的数据。** 加载数据集**如上所示,每10分钟记录一次观测值,一个小时内有6个观测值,一天有144(6x24)个观测值。给定一个特定的时间,假设要预测未来6小时的温度。为了做出此预测,选择使用5天的观察时间。因此,创建一个包含最后720(5x144)个
本文介绍了10个YOLOv11目标检测专用数据集,涵盖工业安全、农业养殖、医疗影像、无人机监测、宠物识别等多个领域。数据集包括护目镜检测(83张)、鸡只健康状态识别(1843张)、手部骨骼异常检测(458张)、无人机检测(201张)、猫狗识别(76张)、行李箱旋转检测(354张)、兔子识别(50张)、摩托车检测(100张)、犬类识别(491张)和工具检测(377张)。每个数据集均提供训练集/验证集
本文介绍 YOLO26 如何配置环境(Python 3.8、PyTorch、Ultralytics)并下载预训练模型,重点演示使用自定义数据集训练分类模型。
本工具由微智启软件工作室原创,无需单独安装python环境即可训练yolo26数据集模型。
本文介绍了BiFPN(双向特征金字塔网络)及其在YOLOv11模型中的应用。BiFPN通过双向特征融合和加权融合机制优化了多尺度特征融合效果,提升了目标检测的精度和效率。文章详细讲解了BiFPN的原理、结构优化方法,并提供了代码实现和修改步骤,帮助读者在YOLOv11中集成该结构。作者还推荐了包含多种改进机制的YOLOv26专栏,支持目标检测、分割、姿态估计等任务,并提供了训练配置文件和代码示例。
本文介绍了D-Net的动态特征融合(DFF)模块在医学图像分割中的应用,提出了二次创新的C3k2机制,能够有效解决多尺度特征融合时的信息丢失问题。DFF模块通过自适应融合不同尺度的局部特征图,增强全局信息利用并保留细节。文章详细说明了D-Net的核心模块(动态大卷积核DLK、DFF和显著性层)及其在层次化ViT架构中的集成方法,并通过实验验证了其优越性能。此外,提供了YOLOv26的改进方案,包括
本文介绍了一种高效上采样模块EUCB(Efficient Up-Convolution Block),适用于目标检测和分割网络。该模块通过逐步上采样特征图,增强不同层级间的信息融合,尤其适合计算资源受限的场景。EUCB包含上采样、深度卷积、批归一化和ReLU激活等步骤,最后通过1x1卷积调整通道数。文章详细展示了核心代码实现,并提供了YOLOv11中集成EUCB的修改教程,包括文件结构、代码导入和
本文介绍了一种改进卷积神经网络特征图上采样的方法CARAFE(Content-Aware ReAssembly of FEatures),可替代传统上采样操作(如Upsample)。CARAFE通过利用输入特征内容自适应预测重组核,实现更精准高效的特征重建,适用于图像超分辨率、语义分割等任务。文章详细解析了CARAFE的原理框架,包含核预测和内容感知重组两个核心模块,并通过图示展示其在FPN中的应
其核心价值在于能够及时发现光伏板潜在的热缺陷,为维护人员提供准确的检修依据,有效提升光伏电站的运行效率和安全性。训练集覆盖了多样化的光伏板场景,验证集用于模型性能监控,测试集则独立评估模型泛化能力,整体分布合理且具有代表性,能够充分满足深度学习模型的训练需求。通过实时监测光伏板的热点区域,系统能够快速定位故障点,指导维护人员进行针对性检修,从而延长光伏设备使用寿命,降低运维成本,助力清洁能源行业的
YOLOv11夜间城市道路目标检测数据集摘要 本数据集专为夜间城市道路场景设计,包含4132张图像(训练集2475张,验证集833张,测试集824张),标注三类目标:自行车、汽车和行人。数据集特点包括: 场景特性:专注于夜间城市道路环境,覆盖多种照明条件 高质量标注:采用精确的矩形框标注,边界框绘制精细 应用价值:适用于夜间智能安防、自动驾驶辅助系统等场景 技术支持:提供完整的YOLO格式数据集和
本文介绍了目标检测中的QualityFocalLoss(QFL)损失函数改进机制。QFL通过将定位质量(如IoU得分)与分类得分融合,形成联合表示,解决了传统目标检测中分类与定位任务不一致的问题。其核心优势包括:1)支持连续标签(0-1范围),更好反映定位质量;2)动态调整对困难样本的关注度;3)保持训练与推理阶段的一致性。文章详细解析了QFL的原理,并提供了在YOLO框架中的实现代码和使用方法。
本文介绍了目标检测中的新型边界框回归损失函数Unified-IoU(UIoU),其通过动态调整模型对不同质量预测框的关注,优化检测精度。UIoU结合FocalBox方法和退火策略,在训练过程中逐步将注意力从低质量框转移到高质量框,并可与现有损失函数(如ShapeIoU)结合形成二次创新。文章详细提供了7处代码修改位置及多种组合方式(UioU、FocalUIoU等)的实现方法,并附带检验使用成功的调
NVIDIA 最新推出的 LocateAnything-3B 模型通过创新的 ParallelBoxDecoding 技术实现了视觉语言定位的效率突破。该技术采用并行预测替代传统逐 token 坐标生成,处理速度达到 12.7 框/秒,较自回归方法提升 10 倍,在开放目标检测、OCR、GUI 元素识别等场景中表现优异。模型支持图像/视频全域定位及自然语言指代,显著改善定位精度与效率。
本文介绍了YOLOv25的最新改进——InnerIoU损失函数及其变体(InnerSIoU、InnerWIoU等)。InnerIoU通过引入多尺度辅助边界框计算损失,特别提升了小目标检测性能,同时在各类尺度检测任务中均表现优异。文章详细解析了InnerIoU结合7种主流损失函数(SIoU、WIoU、GIoU等)的原理,并提供了完整的代码实现和模型集成方法。实验表明,这些改进能显著提高检测精度、收敛
本项目基于YOLOv8和FasterR-CNN开发了一套完整的红外图像行人检测系统,针对低照度、夜间监控等复杂场景进行优化。系统包含数据标注转换、模型训练评估、PyQt5图形界面三大模块,支持图片/视频/摄像头输入,具备目标框选、置信度显示、数量统计、坐标记录及声音报警功能。通过对比实验,YOLOv8在速度和精度平衡性上表现更优,被选为主力模型。项目亮点在于实现了从数据到应用的全流程闭环,特别适合
一个成熟的AI文件归档管理系统,功能可以按。目前这个赛道可以清晰地划分为。也值得一提——虽然它本质是。
本文介绍了使用YOLOv5目标检测框架训练手语手势数据集的完整流程。数据集包含35个手语类别,共2300+张标注图像,采用YOLO格式存储。文章详细说明了数据准备步骤,包括目录结构组织和data.yaml配置文件编写。随后给出了环境配置、模型训练、性能评估和结果可视化的具体代码实现,涵盖从数据加载到预测输出的完整流程。通过调整超参数和利用预训练权重,可以有效地训练手语识别模型并评估其性能指标。
文章摘要: 本文介绍了一种基于YOLOv5的电动车入梯检测系统,通过深度学习技术实现电梯内电动车的实时识别与预警。系统开发流程包括:1)使用LabelImg标注电动车数据集;2)基于YOLOv5s模型训练目标检测算法;3)采用PyQt5构建可视化界面,集成摄像头/视频输入、实时检测及报警功能;4)通过MySQL数据库存储检测记录。实验表明,该系统能有效识别电梯中的电动车,并通过UI界面展示检测结果
文章摘要: 本文详细介绍了一个基于YOLOv8的焊接焊缝缺陷检测系统的实现方案。系统针对5类焊接缺陷(相邻缺陷、完整性缺陷、几何缺陷、处理后缺陷和未焊接好缺陷)进行检测,使用1400张已标注的YOLO格式图像数据集。实现步骤包括:1) 数据准备与YAML配置文件创建;2) 使用Ultralytics库训练YOLOv8模型;3) 模型性能评估;4) 开发PyQt5图形界面用于实时检测。文中提供了完整
本文介绍了一个基于YOLOv8深度学习框架的草莓成熟度检测系统。该系统使用包含1049张草莓图片的数据集,包含未成熟(low)、欠成熟(medium)和成熟(high)三个类别。数据集按7:2:1的比例划分为训练集(734张)、验证集(210张)和测试集(105张)。文章详细说明了从数据准备、环境配置到模型训练与评估的完整流程,包括YOLO格式标签文件的处理、YOLOv8的训练命令以及模型性能评估
本文提出了一种改进的YOLO26目标检测模型YOLO26-LSNetBackbone,创新性地融合了CVPR 2025 LSNet网络的"See Large, Focus Small"思想。该方法通过替换原YOLO26主干中的C3k2阶段为LSNetStage模块,构建大核深度卷积和小核深度卷积的双分支结构:大核分支负责扩大感受野以获取全局上下文信息,小核分支专注于保留局部细节特征。这种设计既解决
本项目开发了一套基于YOLOv8深度学习模型的医学影像骨折识别系统,实现了从数据标注、模型训练到桌面端应用的全流程闭环。系统采用PyQt5构建交互界面,支持图片、视频、摄像头及批量检测,能直观显示骨折位置、置信度等检测结果并支持保存。项目亮点包括:明确的单类别检测任务、完整的工程化实现(训练可视化+系统界面)、多种输入方式支持、结构化结果输出以及良好的扩展性。技术栈整合了YOLOv8目标检测、Op
无人机河道航拍语义分割数据集 | 水利巡检、水体识别、洪涝监测、水资源AI分析数据集10330期
本文介绍了YOLOv11交通标志多类别目标检测数据集,该数据集包含47类交通标志,总计4300张图像(训练集3440张,验证集860张)。数据集涵盖限速、方向指示、警告标志等多种常见交通标志,适用于自动驾驶和智能交通系统开发。文章详细说明了数据集目录结构、YOLO标注格式和data.yaml配置文件要求,并提供了YOLOv11的5种预训练模型选择建议。最后给出了基于Python API的训练代码示
本文介绍了10个YOLOv11目标检测数据集,涵盖工业、机器人、食品、安防等多个场景。包括硬币检测(66张)、机器人检测(55张)、橙子检测(169张)、牛奶检测(313张)、城市香烟检测(236张)、高空安全帽检测(392张)、鸟类宠物检测(143张)、螺丝刀检测(594张)、火灾烟雾检测(1542张)和夜间火焰检测(123张)。每个数据集均提供详细配置文件和标注示例图,适用于不同领域的AI视觉
本数据集含17000张夜间野生动物图像,覆盖17类动物(如东北虎、黑熊、赤狐等),采用YOLO标准标注格式,专为YOLOv5-v10等模型训练优化,适用于生态监测、AI科研与教学。
智慧林业航拍图像数据集 | 树木目标检测、病虫害识别、AI林业监测数据集10282期
本文提出了一种基于LinOSS/D-LinOSS振荡状态空间模型的YOLO26改进方法,通过引入可学习的阻尼机制,使模型能够在多时间尺度上自适应调控特征能量的耗散。该创新将目标检测中的特征图视为具有频率、速度和稳定性的振荡动力系统,在保留YOLO26原有架构优势的同时,有效解决了复杂场景下的小目标检测、多尺度特征融合和长程依赖建模等关键问题。改进后的模型通过振荡状态更新机制实现了更灵活的特征表达,
本文提出了一种基于YOLO目标检测和OpenCV图像处理的瓶装液位检测系统。系统采用两阶段检测流程:首先通过bottle.pt模型检测瓶体并跟踪,然后使用roi_level.pt模型在瓶体区域内定位液位区域。核心算法通过分析图像灰度梯度检测液位,利用液面处亮度变化剧烈的特性确定液位线位置。系统支持实时可视化显示检测结果,包括瓶体框、液位线、目标液位线和统计信息,并具备合格/不合格自动判定功能。
本文介绍了YOLO在医学影像(肺部CT结节检测)中的应用实践。作者分享了从DICOM格式转换、数据预处理(窗宽窗位调整)、专业标注到YOLOv8-Seg模型训练部署的全流程。重点强调了医学影像的特殊性(单通道、高动态范围)及处理要点:需专业标注、谨慎数据增强、模型选择以稳定为先。文章提供了完整代码示例,包括DICOM转PNG、训练配置和结果可视化,并针对医学场景常见问题(小样本学习、假阳性等)给出
本文总结了YOLO模型导出ONNX及C#部署中的常见坑与解决方案。关键点包括:1) 必须严格锁定版本组合,推荐使用验证过的稳定版本;2) ONNX导出参数要规范,特别是fixed尺寸、simplify=True和opset=17;3) C#部署常见问题集中在颜色空间、维度匹配和内存管理;4) 推荐使用Netron和onnxsim等工具排查问题。核心建议:保持Python和C#环境一致,预处理/后处