登录社区云,与社区用户共同成长
邀请您加入社区
的核心定位是一个。
↓Eigen:矩阵、向量、坐标变换↓ROS/ROS2:节点、话题、tf、rviz↓OpenCV 或 PCL:图像或点云处理↓小项目:图像节点 / 点云节点 / 标定 / 配准↓SLAM 基础:里程计、地图、状态估计↓↓阅读 ORB-SLAM、VINS、LIO-SAM、FAST-LIO 等项目方向优先学习视觉 SLAM激光 SLAM多传感器融合自动驾驶感知OpenCV、PCL、ROS、深度学习部署移
1.在网上下载一些开源库时经常需要自己使用Cmake进行源代码的工程搭建此处给出曾经遇到的坑。出现错误:CMake Error at CMakeLists.txt:11 (project): No CMAKE_C_COMPILER could be found.这提示的是没有找到C编译器,原因有两种:a.没装C编译器,一般电脑装有VS后都会有C编译器的;b.装的VS...
使用rect把对象圈起来后 选择标签打标签完成后点左上角的Actions ->Export Annotations最后选择A zipYOLO格式。步骤与前面一样打标的时候使用多边形导出的时候选 COCO JSON 格式这个格式 YOLO不能使用 需要进行单独的转换。上传图片后选左边对象检测 然后点 + 号添加标签标签添加完后点按钮start project。图像检测的打标只需要选一个标签导出的时候
本文介绍了一个基于MediaPipe Tasks的手势识别工具,通过摄像头识别手势数字(1-5)自动打开电脑下载文件夹中对应的最新PNG图片。主要技术点包括: 使用MediaPipe HandLandmarker模型识别21个手部关键点,采用LIVE_STREAM异步模式处理摄像头流数据; 提出一种鲁棒的手指计数算法:通过比较指尖与手腕的距离和指节与手腕的距离来判断手指是否伸直; 采用稳定窗口和状
本文详细介绍了在Windows环境下通过Ubuntu虚拟机交叉编译YOLOv3-tiny模型并移植到imx6ull开发板的过程。主要内容包括:1) 环境准备(虚拟机安装、CMake配置);2) OpenCV 4.2的交叉编译与安装;3) 获取YOLO预训练权重和配置文件;4) ncnn框架的交叉编译;5) 使用darknet2ncnn工具转换模型;6) 编写并编译YOLO推理demo程序;7) 最
在计算机视觉领域,OpenCV 是最常用的开源库之一。轮廓检测与近似模板匹配以及argparse 命令行参数解析。每个案例都配有完整代码和逐行解释,适合初学者快速上手。目录前言1. 案例一:轮廓检测与轮廓近似1.1 功能说明1.2 完整代码1.3 关键函数详解1.4 效果说明2. 案例二:模板匹配2.1 功能说明2.2 完整代码2.3 匹配方法对比2.4 注意事项3. 案例三:argparse 命
本文探讨了U-Net和SegNet两种深度学习模型在服装疵点检测中的应用。针对服装制造中多样化的疵点类型(污渍、破洞等)、复杂背景干扰和数据稀缺等挑战,这两种模型展现出独特优势。U-Net通过跳跃连接结构保留低层特征信息,提高了边界定位精度,适合小样本学习;SegNet则采用编码器-解码器结构和池化索引技术,实现更高效的特征重建。文章详细分析了两种模型的网络架构、实现原理,并提供了污渍检测的代码实
您可能需要在初始化时添加 self.opt_timeout = timeout 或者直接使用默认值。# 注意:此处使用了 self.opt_timeout,但在 __init__ 中未定义该变量,raise Exception("光斑窗口初始化失败")raise Exception("文件加载失败")# 代码在此处截断,通常后面还有 Critic 的定义。
做网页自动化这几年,踩过的坑比写的代码还多。去年帮公司做一个财务对账系统,每天登录内部系统、识别发票图片、汇总 Excel,本以为 Selenium + OCR 就能搞定,结果交付时客户问"能不能打包成双击就能用的软件"。后来调研了一圈国产工具,发现蓝印 rpa这类产品把网页自动化、AI 识别、打包分发整合得挺完整,走的是本地离线路线。不过本文先不聊工具,我们从 Python 源码层面把 RPA
本文提出了一种基于YOLO目标检测和OpenCV图像处理的瓶装液位检测系统。系统采用两阶段检测流程:首先通过bottle.pt模型检测瓶体并跟踪,然后使用roi_level.pt模型在瓶体区域内定位液位区域。核心算法通过分析图像灰度梯度检测液位,利用液面处亮度变化剧烈的特性确定液位线位置。系统支持实时可视化显示检测结果,包括瓶体框、液位线、目标液位线和统计信息,并具备合格/不合格自动判定功能。
对AI说"帮我做个PPT",回你一大段文字,再加一句"您可以将以上内容复制到PowerPoint中"。复制粘贴我自己不会吗。遇到过不止一次。想要的它帮你把事情干完,给的是"教你怎么做"——跟那种"你怎么不自己百度一下"的同事一模一样。不是偷懒。真的没办法帮你打开PowerPoint、建幻灯片、把文字填进去、再调好格式。因为AI大模型它没手(智能体Agent)。
本文方案已应用于清华柔性电子实验室的**可拉伸ecg电极阵列形变补偿8项目,使信号信噪比提升12.7 dB。8柔性电子的终极价值不在材料本身,而在于将物理形变转化为可计算、可决策、可闭环的数字资产8*。下一步我们将开源硬件PcB设计(含IMU+柔性电极接口),欢迎在GitHub仓库提交pr。✅ 8*完整代码仓库包含**:. -(自动网格间距标定)(树莓派编译脚本). -(应变-疲劳寿命转换模型)h
摘要:图像轮廓检测技术解析与Android实现 本文系统介绍了图像轮廓检测技术及其在Android平台的实现方案。主要内容包括: 技术原理:轮廓是由连续边缘点构成的闭合曲线,检测基于二值图像处理,核心算法采用边界跟踪方法(如OpenCV的findContours函数),支持多种轮廓层次结构处理(RETR_EXTERNAL/RETR_TREE等)和近似方法(CHAIN_APPROX_SIMPLE等)
MaixCAM视觉开发实战指南摘要 本文是MaixCAM视觉开发的快速入门指南,重点介绍如何从OpenMV/K230/OpenCV迁移到MaixCAM平台。主要内容包括: 平台对比:MaixCAM采用SG2000芯片,支持MicroPython和OpenCV混合编程,API与OpenMV高度兼容,迁移成本低。 开发环境:提供三种代码部署方式,推荐使用MaixVision图形化IDE,也支持ADB和
Unable to connect to Anthropic servicesFailed to connect to api.anthropic.com: ERR_BAD_REQUEST
Jetson Orin Nano 部署 PaddleOCR 优化方案 核心方法: 将 PP-OCRv5 Mobile 模型转换为 ONNX 格式 使用 OpenCV DNN 配合 CUDA 加速推理 在 Jetson Orin Nano (8GB) 上实现 6 倍性能提升 关键优势: 推理速度从 5.5 秒/图降至 1 秒以内 避免 PaddlePaddle 在 JetPack 6 上的兼容性问题
OpenCode是一个轻量级的开源代码托管平台,提供代码仓库、问题跟踪、CI/CD和文档托管等一体化功能。用户可通过官网注册账号,安装命令行工具进行本地操作。核心功能包括创建仓库、克隆项目、提交代码、管理Issues和PR。进阶功能支持CI/CD流水线配置和静态网站部署。最佳实践建议包括编写清晰README、使用分支策略、代码审查等。相比GitHub,OpenCode更轻量且对个人开发者更友好,支
这张图片是用labelimg进行标记要注意模型要用yolo模型,在图片中createML那个位置改点击进行更替,改完之后要记得点save,右键点第一个就可以进行标注标注完后就可进行下一张点next image。这个是视频抽帧的程序其中cv2.VideoCapture 是用cv2来对视频进行抓取后面的地址需要视频的准确地址,除非在当前目录下。save_folder:这个变量需要给出希望视频抽帧后图片
双目立体视觉是一种典型的三维重建方法,其基本思想是利用两个相机从不同视角观察同一场景,通过左右图像中同名点的位置差异计算视差,再根据三角测量原理恢复物体的深度信息和三维坐标。本文从双目视觉的基本原理出发,系统讲解相机成像模型、双目标定、极线约束、极线校正、立体匹配、视差计算、深度恢复和点云生成等核心流程,并结合 OpenCV C++ 给出完整实现代码,适合用于学习双目三维重建的整体流程。双目立体视
Python 2不再支持,必须使用Python 3.6及以上版本模块重构对Python基本透明,所有函数仍然通过cv2.<函数名>()访问,不需要改importDNN中,ONNX模型的readNetFromONNX()用法不变;Caffe和Darknet加载接口被删除,需先转ONNX1D数组语义变化:传入InputArray的np.array现在映射为1D Mat,如果代码假设它是列向量,需要调整
在基于 RK3568 + HM-TM32 红外摄像头的火情监测项目中,设备录制生成了大量.avi与.mp4格式视频。后续需要对视频进行批量逐帧 / 间隔抽帧,用于数据集制作、画面分析与模型迭代,但使用传统 OpenCV 读取视频时,出现的问题。经过排查,该类红外视频采用特殊编码格式,OpenCV 内置解码器以及CAP_DSHOW模式均无法正常解码,直接导致视频读取流程中断。针对该兼容性难题,本文提
如果你正在为模型部署发愁,不妨立刻试试OpenCV 5.0。在AI部署这条路上,这是开发者能遇到的最好的礼物之一。
文档用途:七天学会plc 加机器视觉 教学教案,可直接全选复制使用;整体流程:Anaconda 新建 Python3.8 虚拟环境→安装图像标注工具 LabelImg→安装 OpenCV-Python→安装 YOLO(Ultralytics YOLO)→OpenCV 读写图片实操→数据集标注规范→YOLO 数据集配置→YOLO 模型训练→模型三种格式 (.pt/.onnx/.engine) 导出说
柔性电子器件在可穿戴健康监测、软体机器人触觉反馈、曲面人机交互等前沿场景中正加速落地。。传统做法依赖高精度机械夹具约束形变或离线标定查表,难以满足动态贴肤场景下的毫秒级响应需求。本文提出一种轻量级、端侧可部署的,融合材料本构模型与数字图像处理,实现对PDMS/SU-8基底上银纳米线(AgNWs)图案在0–35%单轴应变下的像素级形变补偿。核心不依赖GPU,纯CPU即可达。
详细解析了 OpenCV 中常见的 `Assertion failed (s >= 0) in cv::setSize` 错误。当更换 ONNX 模型后出现此错误,通常是由于模型输出数值分布变化导致后处理计算出负的宽高坐标。
yamlnc: 2 #你的物体类别总数,比如猫狗=2names: ['cat','dog'] #对应类别名称。
摘要: 本文介绍了一个包含12类车辆(如大巴、卡车、汽车等)的深度学习检测数据集,共4058张图像,采用YOLO格式标注,适用于智能交通和自动驾驶场景。数据集按8:1:1划分为训练集、验证集和测试集,支持YOLOv8模型直接训练。文中详细提供了环境配置(CUDA、PyTorch、YOLOv8)、数据集结构说明及data.yaml配置示例,并推荐使用YOLOv8m/l模型进行训练,包含参数设置建议(
本文介绍了一个基于OpenCV和dlib库的疲劳驾驶检测系统。该系统通过GUI界面获取人脸视频,利用dlib的68点人脸关键点检测模型定位面部特征,计算眼睛长宽比(EAR)和嘴部长宽比(MAR)来判断疲劳状态。当检测到眨眼(EAR<0.2)或打哈欠(MAR>0.5)时,系统会在界面显示预警信息。该系统实现了人脸检测、关键点定位、疲劳特征提取和实时预警功能,代码示例展示了核心的疲劳检测逻辑和GUI界
图像读取、显示、保存及窗口操作色彩空间转换(BGR↔GRAY/HSV)以及利用inRange进行颜色提取和背景替换Mat对象的深/浅拷贝、创建空白图像像素级读写(灰度与彩色)与通道分离合并图像归一化(convertTo/255或normalize几何变换(缩放、翻转、旋转)视频摄像头读取与保存图像卷积(均值模糊)与高斯模糊基于 DNN 模块的人脸检测(加载模型、解析输出、绘制结果)常见编译/运行错
为了获得更精确的感受野响应,引入显著支撑区域搜索算法:从像素点开始向外扩张,直到扩张区域的对比度增益小于阈值,将最终扩张区域作为该像素的有效支撑区,代替固定窗口。为此建立一个矢量模型,将每个像素的颜色向量与其在图像中所有其他像素的颜色向量的加权欧氏距离之和作为显著度,权重由像素之间的空间距离决定。在ECSSD数据集上,该模型的平均绝对误差MAE为0.09,F-measure达到0.82,相比于原始
OpenCV是计算机视觉领域最老牌的开源库之一,GitHub Star数达87K+。它提供2500+优化算法,覆盖图像处理、特征检测、目标跟踪、DNN推理等方向。凭借C++内核和多语言绑定,能在各种平台高效运行。传统算法是其核心优势,DNN推理定位为轻量级部署工具。尽管存在API风格不统一等问题,但凭借成熟生态和活跃社区,OpenCV仍是学术研究、工业检测等领域的首选工具库,是计算机视觉领域不可或
《大模型命名指南:从参数到量化一网打尽》 摘要:本文系统解析了大语言模型命名规则,帮助用户快速理解模型特性。模型名称通常包含四大要素:1)家族名(如Qwen/Gemma);2)参数量(7B=70亿参数);3)技术标记(MTP=多token预测,MoE=混合专家);4)量化信息(Q4_K_M=4bit量化)。特别提醒:MoE模型需区分总参数和活跃参数(如35B-A3B表示总参350亿/活跃30亿)。
摘要: GrabCut是OpenCV中基于图割算法的交互式前景提取工具,通过用户标记(矩形框或掩码)实现精准抠图。其核心原理包括颜色建模(高斯混合模型)、图割优化和迭代更新,通过最小化能量函数分割前景。OpenCV提供grabCut()函数,支持矩形框或掩码初始化,输出前景掩码。Android实现需结合JNI调用C++底层算法,完成图像加载、GrabCut处理及结果显示。项目包含布局文件、Kotl
2026年AI玄学排盘软件横评:精选11款紫微、八字、占星应用。紫微AI凭借专业算法与水墨UI设计位居榜首;天府Agent以多体系交叉验证见长;讯飞星火适合玄学入门者;问小白专注八字测算;AI Fortune Teller操作极简;参天AI可动态优化预测;FateMaster.AI擅长关系匹配。文章强调AI工具应作为参考辅助,推荐榜首的紫微AI体验现代派推演,同时提醒用户保持理性态度。
摘要:深度学习推理中数据搬运成为性能瓶颈,算子融合技术通过合并多个算子减少内存访问次数。昇腾CANN的graph-autofusion引擎自动识别可融合模式(如Conv+BN+ReLU),在编译阶段生成融合核函数,使ResNet-50和BERT推理分别加速30%和25%。实测显示融合后算子数量减少37%,计算密度提升3倍,典型模型加速30-40%。该技术无需修改代码,通过ATC编译自动完成,适用于
计算机视觉训练的预处理流水线,CPU是瓶颈。一张224×224的图,用OpenCV做Resize+Normalize要0.8ms,训练时batch_size=64,预处理就要51ms。而NPU推理只要10ms——CPU预处理比NPU计算还慢5倍。更麻烦的是数据搬运:CPU预处理完,要从内存搬到NPU显存,PCIe带宽32GB/s,64张图约8MB,搬运要0.25ms。虽然单次不多,但每轮训练都要搬
在人工智能与计算机视觉飞速发展的当下,图像处理、目标检测、特征匹配等技术已经广泛落地于安防监控、自动驾驶、医疗影像、智能零售等诸多领域。而是目前计算机视觉开发中最主流、最易用的技术组合。OpenCV 作为一款开源跨平台计算机视觉库,封装了海量成熟的图像处理算法,搭配 Python 简洁的语法,能够大幅降低视觉项目的开发门槛。对于视觉开发者而言,系统梳理 OpenCV 常用函数、掌握底层原理、熟悉实
本文介绍了如何利用OpenCV的Stitcher模块实现高效全景图像拼接。文章首先分析了图像拼接的核心痛点,指出开源方案在成本控制和灵活性上的优势。随后详细讲解了Stitcher模块的环境搭建、参数配置和基础拼接流程,包括多图批量处理的方法。针对拼接效果优化,提出了边缘融合和裁剪技巧,并分析了常见报错的解决方案。最后讨论了大规模数据处理的性能调优策略,为开发者提供了一套完整的开源全景图生成方案,既
在计算机视觉领域,OpenCV 是最经典、最常用的开源图像处理库,无论是基础的图像变换、噪声处理,还是进阶的目标检测、图像分割,都离不开 OpenCV 的核心操作。本次案例全覆盖图像阈值处理、图片打码 / 组合 / 缩放、椒盐噪声生成与平滑滤波、图像像素运算四大核心模块,搭配逐行代码解析 + 原理详解 + 效果说明,流程清晰、零基础可学,非常适合作为 OpenCV 图像处理的入门实战教程。如果对计
cv::waitKey 是 OpenCV 中等待用户按键的函数,主要用于:让窗口保持显示,否则窗口会一闪而过。获取用户按下的键盘按键(用于交互控制)。函数原型参数 delay:等待时间,单位毫秒。返回值:int 类型,表示按下的键的 ASCII 码。如果没有按键(超时),返回 -1。我们看一个例子我们必须先将键盘焦点给到这个图像窗口,而不是控制台基于这个现象,我们可以来做一个测试我们按下a我们按下
本文深入解析了Text VAE(变分自编码器)在文本与隐空间之间的双向映射机制。文章首先回顾了经典VAE的基本原理,包括编码器-解码器结构和ELBO训练目标。重点分析了Cola Text VAE的特殊实现,这是一个基于Transformer的VAE架构,详细介绍了其编码器如何通过Conv1d patchify和Transformer blocks将离散token序列转换为连续隐向量,以及解码器的逆
去年接了一个工业质检项目,模型用PyTorch写的,预处理用OpenCV跑在CPU上,推理跑在昇腾NPU上。结果预处理比推理还慢——图像缩放+色彩转换+归一化,CPU上跑8ms/张,NPU推理只要3ms/张。整个流水线的瓶颈卡在CPU预处理上,NPU闲着等数据。后来把预处理搬到ops-cv上跑,同样的流水线在NPU上只要0.4ms/张,整体吞吐翻了6倍。这个差距让我重新审视了一个问题:ops-cv
之前做过一个小目标检测的项目,模型精度和推理速度都调得差不多了,最后发现瓶颈居然在图像预处理上。resize、normalize、augmentation 这些操作每帧都要跑,累积起来的时间比 inference 还多。NV 的 DALI 可以用,但那是 GPU 专用。昇腾上有 VIC(Vision Image Compute)引擎专门解决这个问题,这篇文章把 CV 预处理的所有门道一次性讲清楚。
DeepSeek 是一家创新型科技公司,长久以来专注于开发先进的大语言模型(LLM)和相关技术。该公司推出了比较出名的模型有 DeepSeek-V3 和 DeekSeek-R1。本案例通过本地部署 DeepSeek 搭建 Agent 智能体,进行智能助手的设立。与普通的对话系统不同,案例中通过提示词来设立Agent 的角色和行为模式,Agent 不仅仅是一个简单的问答工具,而是一个具有特定角色身份