登录社区云,与社区用户共同成长
邀请您加入社区
本篇文章讲一讲机器学习和深度学习模型算法常用的交叉熵损失,它的变形,以及常见应用场景和pytorch的代码适配情况(部分),很多都是自己做实践做项目和学习过程中的心得总结与经验分享,希望大家认真阅读。
B站视频下载神器Bili23-Downloader支持全平台(Windows/macOS/Linux),可下载UP主投稿、番剧等所有B站内容。软件提供32线程高速下载,支持自定义画质/音质/编码格式,可批量下载并获取封面、弹幕等附加文件。操作简便:复制视频链接→解析→选择画质→下载,实测下载速度可达30MB/s以上。软件持续更新维护,采用官方API接口,推荐扫码登录,适合需要收藏B站内容的用户使用
本文介绍 YOLO26 如何配置环境(Python 3.8、PyTorch、Ultralytics)并下载预训练模型,重点演示使用自定义数据集训练分类模型。
甜椒作为重要的经济作物,其病害防治对保障产量与品质具有关键作用。针对传统人工识别效率低、主观性强等问题,本文构建一套基于深度学习的甜椒叶片病害智能识别系统,整合PlantVillage等公开数据集并补充实地采集图像,构建了包含13类病害、9778张图像的甜椒叶片病害数据集,涵盖细菌性斑点病、炭疽病、叶斑病等主要病害类型,设计一种融合CBAM注意力机制的改进ResNet-50模型,通过引入通道与空间
在AI赋能各行各业的当下,无论是自媒体创作、电商运营,还是设计建模、视频制作,一款趁手的AI工具总能帮我们省去大量重复劳动,实现效率翻倍。干什么:主打AI生图(1K/2K/4K)、AI短视频生成、图片编辑、素材批量处理;剧本生成、分镜设计、AI视频生成、剪辑、配乐;一键抠图(发丝级)、去水印、图片修复、无损放大、证件照换底、批量处理;支持Web/APP/桌面。自媒体/小红书/抖音创作者:快速出封面
读取刚才生成的 Duke 对抗 query,计算 Rank@1 / mAP--query_data_dir adv_duke_query_data。去处理 Duke 的 query 图片,给 Duke 的 query 图片加扰动--test_dir Duke/pytorch。生成 Duke 的对抗 query并保存到相应位置--adv_query adv_duke_query_data。用 Mar
2026年光电信息、通信与人工智能国际学术会议(OICAI 2026)将于2026年7月20-22日在中国·南京举行。本次会议旨在汇聚全球光电信息、通信工程与人工智能领域的专家学者、科研人员及产业先锋,搭建一个高端、前沿、国际化的学术交流平台。会议将通过大会主旨报告、特邀学术报告、口头报告、海报展示及技术论坛等多种形式,为与会者提供深度的交流机会。我们诚挚邀请海内外同仁踊跃投稿参会,共同分享最新研
本文提出一种相位引导的跨频率集成网络(PGCFINet)用于ISAR与光学图像融合。针对现有方法依赖手工融合规则、空间域感受野有限等问题,创新性地利用频域全局建模能力,设计了相位引导跨频率集成模块(PGCFIM),通过深度傅里叶变换建立全图感受野,并显式聚合相位分量引导跨模态互补特征学习。该方法构建了包含16种航天器模型的IODataset作为评估基准。实验表明,PGCFINet在定性和定量指标上
文章摘要:作者分享使用AI视觉工具VidpexAI的体验,解决独立开发者面临的视觉内容制作瓶颈。该工具集成文生图/视频、图生视频等功能,显著降低从构思到产出(如产品演示、社媒配图)的时间成本。优势在于低门槛、多模型集成和快速迭代,适合个人创作者和小团队快速产出初稿;但对精细控制和品牌规范仍需专业工具辅助。核心价值在于减少"想法到画面"的摩擦,尤其适合技术博主和独立开发者补充视觉
Upscayl是一款基于AI技术的无损图片放大工具,支持JPG/PNG/BMP等格式,兼容Windows/Mac/Linux系统。该软件通过智能算法增强图像细节,提供标准/轻量/高保真等6种AI模型,用户只需三步操作(选图-选模型-保存)即可完成图片高清修复。实测显示修复后图像的锐度和细节显著提升,尤其适合老照片修复。软件界面简洁无广告,采用绿色版设计,其中轻量版模型处理速度快且通用性强。
本次会议旨在汇聚全球该领域的专家、学者、研究人员及相关从业者,分享最新研究成果,探讨前沿热点问题,交流创新经验与技术。◆ 投稿前可通过CrossCheck, Turnitin、iThenticate任一查重系统进行查重,否则由文章重复率引起的被拒搞将由作者自行承担责任,涉嫌抄袭的论文将不被出版;协办单位:西安科技大学电气与控制工程学院、西安科技大学通信与信息工程学院、科学网。4、听众参会:不投稿仅
✅全局阈值:最简分割,ITI > TIT为前景,适合受控场景✅Otsu 算法:最优化问题——最大化类间方差,自动确定TTT,无需调参✅自适应阈值:逐像素计算局部均值作为阈值,处理光照不均✅分水岭算法:把梯度图视为地形,注水模型找分割边界;标记分水岭通过距离变换自动生成前景标记,控制过分割至此,边缘检测+形态学+分割三组共五篇(14–17)构成了完整的图像结构分析体系。下一章进入程序化纹理生成,从分
《滑滑相册清理:游戏化照片整理工具》摘要 这款创新相册清理应用通过游戏化交互提升整理体验:左滑删除/右滑保留/上滑待定,配合粒子动画、音效反馈和删除礼花特效,让枯燥的整理变得有趣。针对选择困难症用户,内置5秒倒计时提醒和AI智能标签辅助决策,并提供双重删除确认机制保障数据安全。应用完全离线运行,无广告不收集隐私,采用买断制,目前正在Google Play上架筹备中。通过拟人化交互设计和即时反馈机制
第二届电气工程、自动化与信息科学国际学术会议(EEAIS 2026)将于2026年7月17-19日在中国兰州召开。大会围绕电气工程、自动化与信息科学领域最新的研究热点、核心技术与发展态势,以及行业热点进行探讨,旨在为研究人员与学者提供一个交流和展示研究成果的高端学术交流平台,通过主题演讲、口头汇报和海报展示等形式,传递最前沿科技进展和成果,促进技术的交流和思想的碰撞,推动学科领域的创新与融合发展。
本文记录了一个字符分割问题的解决过程。原Halcon脚本的分割功能在移植到.NET后失效,筛选后区域数量为0。通过逐层排查发现二值化和形态学处理生成了横向噪声而非有效字符区域。对比Halcon脚本后,改用find_text算子重构分割流程:创建文本模型并设置字符参数,简化预处理步骤,直接定位字符区域。最终C#实现通过初始化文本模型并调整识别参数,解决了分割失败问题。这种方法比手动分割更稳健,减少了
本文深入解析了三种经典自适应空间域滤波算法:Lee滤波、Frost滤波和Kuan滤波,用于处理合成孔径雷达和医学超声图像中的乘性相干斑噪声。Lee滤波基于最小均方误差准则,通过局部统计量动态调整滤波强度;Frost滤波采用指数衰减卷积核,利用局部变异系数控制平滑程度;Kuan滤波则改进了Lee滤波的数学模型,在低信噪比区域表现更稳定。三种算法均能有效平衡去噪与边缘保持,其中Lee计算简单,Fros
「米牛照片批量转素描线条工具」三大艺术引擎,让平凡照片涅槃重生!米牛照片批量转素描线条铅笔画工具,批量照片转素描线条铅笔画艺术风格,支持三大智能模型:仿真动漫艺术风格、轮廓艺术风格、草图线条风格。一键批量导入照片,批量一键转换素描铅笔画工具,支持批量导入照片,批量一键快速转素描并导出素描图片、细节清晰细腻。
合合信息在CVPR 2026的"SIRR in the Wild"赛道夺冠,其AI技术方案有效解决了自然场景图像反光去除难题。该技术具备高保真、强可控性、速度快等优势,可应用于智能文档处理、工业质检等领域。这项突破展现了合合信息在计算机视觉领域的技术实力,为复杂场景图像处理提供了创新解决方案,未来将持续推动AI技术的产业应用落地。
🎨 基于千里云+ComfyUI 的 AI 图像生成实战:文生图 / LoRA / ControlNet 完整工作流记录博主前言:这是 AI 图像生成工作流实验(实验3)的完整记录,使用千里云算力平台(NVIDIA A100 80GB)+ ComfyUI 框架,分别完成了文生图、LoRA 推理和 ControlNet 控制生成三种工作流。文章详细记录每一步操作,适合同样在跑 ComfyUI 实验的
本文介绍了ICCV 2025长视频理解工作LVAgent,旨在解决多模态大语言模型(MLLM)在长视频理解中的局限性。传统方法依赖单个MLLM处理长视频时存在计算冗余和部分理解的问题,而LVAgent通过多智能体动态协作实现了更全面高效的长视频分析。该框架包含四个核心步骤:智能体预选(Selection)组建最优团队,三阶段感知(Perception)检索关键片段,智能体协作行动(Action)生
摘要: ADP(智能体文档处理)专为企业财务报销设计,通过大语言模型实现多语言发票与差旅单的自动化处理。其核心能力包括零样本跨单据比对、合规校验及置信度分流,支持100+种语言,海外发票抽取准确率达93.2%,三单匹配准确率96%。相比传统IDP,ADP无需模板标注,处理效率提升10倍以上,人力节省60%-80%。案例显示,某制造业应用后,订单处理时间从5-10分钟缩短至30秒,自动化率显著提高。
原文链接:https://www.adiuvoengineering.com/post/microzed-chronicles-creating-image-processing-with-simulink。本项目基于 ALINX VD100 Versal AI Edge 开发平台搭建,实现了从摄像头采集、图像处理到显示输出的完整视频处理链路。为了在 FPGA 实现之前验证算法效果,可以先在 Si
几乎所有将大型语言模型接入知识库的团队,都会掉进同一个陷阱——把 PDF 粗暴地转成纯文本,再按固定字数切片。这种“标准操作”看似能跑通检索增强生成(RAG)流程,实际上却把文档的骨骼和脉络彻底打断,最终导致回答张冠李戴、无法溯源,更无力处理表格、图表和扫描件。直接转纯文本加固定字数切片,是用放弃结构换来的虚假便捷,在需要精确溯源、理解图表、处理混合版式的严肃场景中注定失败。
—用户看不见它的运算过程,但它直接决定最终图像是色彩鲜艳还是发灰暗淡、是细节清晰还是面部崩坏。简单理解:VAE 是图像生成流程中的**“翻译官”**——生成前把文字指令翻译成模型能理解的潜空间噪声,生成后再把潜空间数据翻译回人类可见的图像。VAE(Variational Autoencoder,变分自编码器)是 Checkpoint 大模型中的。很多高质量 Checkpoint 会推荐搭配特定外置
本文介绍了一种利用AI插件(如StartAI)快速精修电商美妆塑料瓶产品图的实用方法。传统Photoshop修图耗时长,而AI通过“局部重绘+细节图参考”功能,能秒级生成建模级效果。操作分为三步:框选区域、输入结构化提示词(明确材质、光影等参数)、上传细节图优化生成。关键技巧包括使用白底细节图保持品牌一致性,以及通过提示词精准控制变量。文章还解答了常见问题,如变形、材质替换和文字模糊的解决方法,强
本文介绍了Zhang-Wu方向性LMMSE图像去马赛克算法,这是一种高效的RAW图像转RGB方法。该算法通过方向估计和线性最小均方误差(LMMSE)融合,显著改善了纹理密集区域的处理效果。核心步骤包括:1)利用拉普拉斯插值建立通道色差表;2)采用高斯滤波器对差值信号进行滤波;3)基于LMMSE理论最优融合水平和垂直方向估计值;4)分情况恢复红蓝通道。相比于简单的梯度自适应插值法,该算法充分利用了自
2026年大模型与智能体技术国际学术会议(LMIAT 2026)将于2026年7月17日至19日在中国杭州举行。本次会议将聚焦两大核心方向,系统探讨相关理论与技术,并推动其在多元场景下的深度融合与应用。一方面,会议将深入探讨大模型与智能体的核心理论与关键技术。这包括但不限于大模型的高效训练、多模态融合、安全对齐与强化学习,以及智能体的认知架构、任务规划、多智能体协作与自适应学习等前沿议题。
跨境电商语言障碍成为卖家出海的主要挑战,70%以上卖家认为多语言内容制作耗时费力。跨马翻译作为AI翻译工具,提供图片批量翻译、视频字幕翻译和智能抠图三大核心功能,支持100多种语言互译。相比通用翻译工具,其电商场景适配性更强,能保持原图排版并实现批量处理,显著提升效率。但AI翻译仍需人工审校关键信息,且小语种翻译质量可能不足。建议卖家根据实际需求试用后选择合适工具,将其作为辅助手段配合人工优化,以
MPMF-Net是2025年发表在AAAI上的一种图像修复网络,专门用于(如雨、雾、雪等)。它在单一模型中处理多种天气类型,核心思路是解决两个问题:如何高效提取多样化特征,以及如何在特征内部实现精准的信息融合。它的创新主要包含三个技术层面,以下逐一拆解其原理与效果。
本项目基于YOLOv8目标检测算法开发了一套苹果成熟度自动检测系统,能够准确识别并分类苹果的五个成熟度等级:100%成熟度('100-_ripeness')、20%成熟度('20-_ripeness')、50%成熟度('50-_ripeness')、75%成熟度('75-_ripeness')以及腐烂苹果('rotten_apple')。系统采用大规模专业数据集进行训练,包含训练集2144张图像、
摘要:RGB、HSV和Lab是三种不同的颜色空间,分别适用于不同场景。RGB是相机记录颜色的方式,但三个通道耦合度高,调整颜色不直观;HSV通过色相(H)、饱和度(S)和明度(V)解耦颜色属性,更符合人类直觉;而Lab则基于感知均匀性设计,能更准确地反映人眼对颜色差异的感知。RGB到HSV的转换通过六扇区模型实现,而Lab需经过线性化、XYZ转换等复杂步骤。理解这些颜色空间的特性有助于在图像处理中
图像降噪是 ISP Pipeline 中最复杂、调参工作量最大的模块之一。降噪本质是一个病态逆问题(Ill-posed Inverse Problem)—— 在去除噪声的同时必须尽可能保留真实信号(细节、纹理、边缘)。一个好的降噪模块是在噪声、细节、伪影三者之间找到最优平衡。特性描述异方差性噪声方差随信号强度变化(亮区噪声更大)色度噪声低光下颜色通道的噪声更明显(由于 AWB 增益放大)相关性经过
摘要: MonkeyCode是一款由长亭科技开发的安全开源AI全栈开发平台,整合前端、后端、数据库全流程,解决传统开发中的环境配置、联调繁琐等问题。其特点包括: 免费开源,基于大厂安全团队背景,内置代码漏洞自动检测; 云端一体化,提供预置环境,支持多模型灵活调用(如GPT、Claude等); 全流程托管,从需求描述到生成可运行工程,覆盖Git协作、移动端同步及私有化部署; 学习友好,适合新手快速上
本文基于 Nerfstudio 实现了对单目视频的三维重建流程,主要使用 nerfacto 模型实现 NeRF 场景重建,并完成 COLMAP 到训练到可视化的完整 pipeline 验证
(计算机视觉、传感器检测技术和电机驱动技术、信号和图像处理、人机交互、追踪与监视、生物识别、生物医学图像分析、活动/行为识别、场景分析、模式识别、视觉学习、自然语言处理与识别、物体检测、跟踪和识别、模式识别原理、机器人和深度学习、模型表示和选择、图像处理与分析、文件处理和识别、数据挖掘和大数据、生物识别、模式识别与信号处理、自动化、迁移学习、人工神经网络、人机交互、机器人学和智能系统)2026年7
ShareX是一款功能强大的Windows开源截图工具,支持截图、录屏、OCR识别、滚动截图等丰富功能。软件提供高度自定义设置,可配置快捷键和自动任务(如截图后自动编辑)。其特色包括高品质压缩技术、无损音质录制、媲美付费软件的专业体验,以及便捷的图片标注和分享功能,特别适合教程制作和内容创作者使用。安装简单,界面虽复杂但核心功能明确,涵盖截图、上传和工具三大模块。
医用超声图像模拟系统正在成为医学影像领域的重要工具,它打破了真实数据获取的壁垒,为AI研发、医学教育和设备创新提供了新的可能性。随着计算能力的提升和算法的进步,模拟系统的真实性和实用性将不断提高,最终实现"以假乱真"的模拟效果,推动超声医学的数字化、智能化发展。未来,我们期待看到更加智能、交互、个性化的超声模拟系统,不仅能够模拟常规器官的标准图像,还能模拟复杂病理、介入操作和治疗效果预测,真正成为
OpenISP是一个开源图像信号处理器(ISP)项目,支持RAW、RGB、YUV等色彩空间的转换和处理。文章首先介绍了常见的图像色彩空间,包括Bayer阵列(如RGGB)、RGB和YUV,并解释了它们之间的转换原理(如Demosaic去马赛克、色度下采样等)。随后详细解析了OpenISP的处理流程(Pipeline),涵盖从RAW域预处理(DPC、BLC)、RGB域处理(CCM、Gamma校正)到
维度一句话定位开源最强文字渲染图像生成模型笔记本最强统一多模态理解模型核心创新单流DiT + Qwen3-VL + JSON标注无编码器统一架构 + 原生音频最佳场景海报/Logo/包装/品牌设计Agent/对话/代码/本地多模态商用许可非商业(需另购)Apache 2.0(完全可商用)推荐硬件24GB显存(NF4: 10GB)16GB显存(Q4: 8GB)API价格$0.03-0.09/张免费本
⚠️ 基础 URL 只填 https://apihub.agnes-ai.com/v1,不要加 /chat/completions,否则会报错。💡 “model” 字段设置默认模型,格式为 provider_id/model_id,这里默认使用 agnes-2.0-flash。▲ 填写模型 ID(agnes-2.0-flash)和显示名称(Agnes 2.0 Flash)▲ 填写提供商 ID(a
✅ 全栈应用开发(React/Vue + SpringBoot/Python/Node + MySQL) ✅ API 自动生成 + 接口联调 ✅ 数据库设计 + SQL 自动生成 ✅ 安全漏洞扫描 + 自动修复建议 ✅ 毕业设计 / 课程设计一键生成 ✅ 技术调研 + 示例项目手把手教学 ✅ 小游戏、工具站、管理后台一句话生成。想学全栈,前端、后端、数据库、API、部署。光是环境搭完就心态爆炸。前
扩散模型实战与前沿摘要 本文是扩散模型系列收官之作,聚焦实用技术与前沿进展。主要内容包括: 微调技术: LoRA低秩适配(仅微调3M参数,1小时内完成训练) DreamBooth个性化生成(3-30张图定制特定人物/物体) Textual Inversion概念嵌入(仅调整文本token) 前沿模型: FLUX架构革新(2024年最强开源文生图模型) 一致性模型(Consistency Model
本文解析了扩散模型中的条件生成技术,重点介绍了文本引导图像生成的完整链路。文章首先对比了三种条件注入方式(拼接、自适应归一化和交叉注意力),指出交叉注意力是文本条件的标准方法。随后详细讲解了CLIP和T5两种文本编码器的特点与应用场景,强调CLIP的图文对齐优势和T5的语言理解能力。核心部分深入剖析了Classifier-Free Guidance(CFG)技术,解释了其数学原理和实现方式,并指出
这款工具本身就是专门做科研领域AI文生图的,不像通用文生图那样瞎画,它本身就适配所有科研场景——你想要实验示意图、概念模型图、技术路线图,直接简单说清楚就行,还能调符合学术标准的比例、分辨率,不会出现风格和论文不搭的情况,甚至不会写提示词也没关系,它自带提示词生成功能,还有AI助手帮你打磨需求。碰到期刊要求矢量图,直接就卡壳了。MedPeer这个图片创作工具,从AI生成到人工转换的整套服务,零学习
AI伪造内容泛滥给社会秩序带来挑战,合合信息研发多模态可信鉴伪系统应对这一难题。该系统能识别文本图像、AI生成图像和视频的伪造痕迹,尤其针对传播链中因压缩、编辑导致的伪造信息损失问题优化检测能力。技术已应用于金融、保险、电商等30多个场景,如在某银行使人脸伪造拦截率提升8倍。合合信息通过算法创新、工程化落地和标准建设推动AI鉴伪技术发展,未来将持续守护数字内容真实性。
安装完成后,打开 Codex++ 管理工具,进入左侧菜单,点击"供应商配置",然后点击"添加供应商",按照下面内容填写。点击左上角苹果图标,选择"关于本机"查看。如果页面上显示"使用"、"使用中"、"切换到此供应商"或类似按钮,请点击以启用 Agnes 供应商。💡 配置完成后,无需登录 GPT 账号,直接使用 Agnes 2.0 模型即可。启用成功后,Agnes 会成为当前使用中的供应商,状态显
本文基于实际项目经验,演示如何在同一套代码逻辑下同时接入图像生成和视频生成模型,重点解决异步任务轮询、Webhook 回调配置、文件统一存储三大工程难题,附完整可运行 Python 代码,适合正在做 AI 应用开发的中级工程师参考。
AI精准匹配期刊,衔接快速预审 | AiScholar 快速预审期刊AI匹配系统,正式上线!
AASIP 2026所有的投稿都必须经过2-3位组委会专家审稿,经过严格的审稿之后,最终所录用的论文将被。出版,出版后由出版社提交EI Compendex, Scopus数据库。主办单位:中国教育发展战略学会教育大数据专业委员会。“查重+AI检测” 特惠底价,拒绝套路,一年内可用。2026年7月6-8日 | 中国·贵阳·贵州大学。模糊逻辑在信号处理的应用。截稿时间:见官网(早投稿,早录用)