登录社区云,与社区用户共同成长
邀请您加入社区
在你的环境中,你可以使用conda或pip来安装所需的包。conda create --name 环境名 python=3.10。conda remove --name 环境名 requests。conda env remove --name 环境名。在conda 命令窗口中输入命令创建永久源。conda activate 环境名。如果实在安装不上,则可以离线安装,在。仅删除环境里的request
本文基于RFM模型对电商用户进行价值分层分析,通过订单数据计算用户最近消费时间(R)、消费频次(F)和消费金额(M)三个核心指标,将用户划分为8类群体:重要价值客户、重要流失客户、重要挽留客户、重要唤回客户、一般活跃客户、一般流失客户、一般挽留客户和低价值客户。分析结果显示不同分层用户在消费特征上存在显著差异,并针对每类用户提出了差异化运营策略,如为核心价值客户提供专属权益、对高价值流失用户进行定
本文介绍了PyTorch中DataParallel的使用方法和原理,帮助用户在多GPU上加速模型训练。主要内容包括: 核心概念 DataParallel适用于多GPU训练,自动拆分输入数据并合并结果 工作原理:将batch数据均匀分配到各GPU,并行计算后合并 使用步骤 检测GPU数量 用nn.DataParallel包装模型 将模型和数据移至GPU设备 正常训练流程 注意事项 batch_siz
Blaze是一个Python库(GitHub 3.2k星),允许开发者用熟悉的Pandas/Numpy语法直接查询多种数据库系统(如PostgreSQL、Spark、MongoDB等),无需将数据加载到内存。它作为翻译层,将Python操作转换为对应后端的查询语言(如SQL),解决了数据分析中跨存储系统查询的重复编码问题。支持主流数据库和文件格式,统一接口可降低多数据源场景的切换成本,适合习惯Pa
IntelliHealth 药物禁忌分析多说明书检索 + 段落打分的技术说明。规则分类:从英文中识别 contraindicated / avoid / dose_adjustment 等(OpenFDA的监管用语)规则定不了 → LLM 从枚举中选 typeLLM 写:Prompt 中带入已确定的 type,要求摘要与风险等级一致这样英文提取与风险类型分工明确。OpenFDA 链路是长尾药对的补
D-Tale是一款开源工具,可将Pandas DataFrame转换为交互式网页表格,获得GitHub 5,157星。它通过Flask后端和React前端实现,支持在浏览器中直接进行排序、筛选、缺失值分析等操作,无需反复编写代码。相比Jupyter的静态输出,D-Tale提供动态GUI操作,支持多种图表生成和数据编辑,并能导出对应Python代码。安装简单,适用于数据分析师和教育场景,帮助用户快速
【150字摘要】这篇零基础Python量化交易教程,通过"数据获取→策略设计→回测验证"完整流程,带初学者用代码征服金融市场。文章特色:①使用yfinance获取真实股票数据;②包含布朗运动模拟、索普概率优势等经典案例;③提供可运行代码及详细注释。作者强调量化思维本质是"寻找统计规律,而非预测涨跌",并演示了2%概率优势+凯利公式如何实现稳定盈利。教程已在G
PyGWalker:将Pandas数据转换为交互式可视化工具 PyGWalker是一个开源的Python库,可将Pandas DataFrame快速转化为类似Tableau的交互式可视化界面。通过简单的两行代码调用,用户可在Jupyter等环境中拖拽字段生成多种图表(柱状图、散点图等),并支持数据筛选、聚合计算及自然语言查询。其特点包括: 高效处理:支持DuckDB引擎,可本地处理100GB数据
本文主要讲解了python数据分析中numpy,dataframe和matplotlib的使用。
title: Ai大模型技术之NumPy与Pandas 完整笔记date: 2026-06-05categories:版本:V0.9.1Anaconda官网地址:https://www.anaconda.com/简单来说,Anaconda = Python + 包和环境管理器(Conda)+ 常用库 + 集成工具。它适合那些需要快速搭建数据科学或机器学习开发环境的用户。Anaconda和Pytho
在真实的数据挖掘项目中,原始数据往往并不完美——缺失值是最常见的问题之一。如果直接使用含有缺失值的数据训练模型,可能会导致:模型无法计算(很多算法不支持缺失值)统计偏差(缺失并非随机)信息浪费(直接删除行会丢失有用信息)因此,在建模之前,我们需要对缺失值进行合理的填充或删除。即数据预处理。小样本数据:优先考虑中位数或均值填充,避免删除后样本不足。数据量充足且缺失少:直接删除法最简单可靠。下一篇文章
本文梳理了一个文本分类项目的全流程,从一开始的随机森林到最后的bert,模型蒸馏,准确率提升了十几个点,且包含能直接运行的代码,欢迎阅读!
Series:一维带标签数组;DataFrame:二维表格,类似 Excel。数据读取read_csvread_excelread_json,注意编码和参数。数据清洗dropnafillna处理缺失值;去重;条件过滤处理异常值。筛选loc(标签/条件)、iloc(位置)、布尔索引(df[条件]分组聚合groupby()agg()或,可自定义函数。合并concat拼接(行/列);merge按键连接(
决策树(Decision Tree)是一种非参数、有监督的机器学习模型,通过对特征的逐层二分/多分分裂,将样本从根节点划分至叶子节点,最终输出分类/回归结果。可解释性拉满:树形结构等价于人类可读懂的业务规则(如「在网月数<12且本月话费>80→客户流失」),可直接用于业务决策;无需数据预处理:不要求特征标准化、归一化,可直接处理离散+连续特征;拟合非线性关系:无需假设数据分布,能自动学习特征间的交
AI:用计算机模拟人脑,让计算机能够像人类一样理性的思考和行动ML:基于经验找规律;先训练(根据训练集找规律,找公式),再预测,最后评估DL:基于自己构建出来的知识库AI:给出一张图片,判断是否为西瓜ML:结合大量有关西瓜的资料(图片,音频,文本等等),总结出规律,如何挑选一个好西瓜DL:基于西瓜的各种资料(价格,产地,口感),搭建自己的知识库。
把原始数据转换成有意义的输入变量(特征),让机器学习模型表现更好——这就是 feature engineering。Feature engineering 是机器学习项目能否成立的基石。干净、变换过、有意义的特征,往往胜过用劣质数据训练的复杂算法。上面把这些步骤都做扎实,模型的准确率和稳健性都会上一个台阶。在真实的机器学习项目里,feature engineering 往往比挑哪个模型更决定胜负。
质谱蛋白质组学可生成表征生物样品中肽段/蛋白质组分的复杂数据,各类机器学习是串联质谱肽段鉴定及数据分析全流程的核心计算方法。随着深度学习成为数据建模与解析的强力机器学习手段,蛋白质组学计算研究者利用海量公开数据集训练机器学习模型,用于预测肽段碎裂谱与液相色谱保留时间。ProteomicsML等资源为这类学习任务提供了详尽的演示教程,缩小了蛋白质组学与机器学习领域的隔阂。但现有深度学习教学材料普遍缺
RK3568是瑞芯微电子(Rockchip)推出的四核64位Cortex-A55处理器芯片,CAN接口在使用时需要结合自身具体应用,由应用层主动参与总线故障管理,才能确保CAN接口稳定工作。本文将对比测试CAN接口官方驱动和mainline驱动的性能,以及应用程序如何检测总线故障,并提供故障自动恢复的参考建议。
参考文章:https://blog.csdn.net/qq_42415326/article/details/896788331:Pandas 看作是 Python 版的 excel2: 分类Series:一维数组DataFrame:二维的表格型数据结构3:安装。
本文针对蒙西电网次日实时电价预测与储能套利问题,构建了基于 LightGBM 与 GradientBoostingRegressor(GBR)的预测模型,并结合特征工程与超参数优化提升模型效果。实验发现,储能收益相比传统预测误差,更依赖于电价波动的相对排序与振幅,因此提出了动态振幅增强方法以扩大套利空间。最终模型在保持预测稳定性的同时,显著提升了储能收益与比赛成绩。
药物相互作用是影响患者安全的重要因素。传统的表格数据难以直观展示药物间复杂的网状关系。为了更智能地识别药物禁忌,我们需要构建一个药物相互作用知识图谱。而在构建图谱之前,则需要获取高质量准确的数据集。本次清洗采用规则+LLM的模式,规则引擎负责高速剔除显性噪声,LLM模型负责语义精洗,兼顾了效率与成本,实现了工程上的最佳平衡。在日后的数据处理中,亦可以使用此方法。高质量的清洗是构建可信医疗知识图谱的
基于某在线零售平台全年交易数据,本研究运用RFM模型与K‑means聚类对客户进行分层分析。首先构建R、F、M指标,通过均值阈值初步划分客户类型,再经肘部法则确定K=3,将客户分为重要价值客户(簇2)、潜在价值客户(簇0)和一般挽留客户(簇1)。进一步拓展国家市场分析,利用气泡图与四象限法识别出潜力市场、现金牛市场及问题市场。退货行为分析显示,重要价值客户个体退货频率高,一般挽留客户退货金额占比最
本文介绍了pandas中loc方法在二维表数据定位中的核心用法。通过5个典型场景演示了loc的核心功能:1)单条件单列修改(如标记不及格学生);2)多条件多列操作(如优秀学生加分);3)结合isin()筛选特定行;4)多条件复合筛选与赋值;5)多列同时赋不同值。关键要点包括:条件必须加括号、使用&|逻辑符、多列需用列表包裹。loc方法支持精确的"矩形区域"操作,是Dat
本文是一份AI开发者的极简学习指南,重点介绍了从Python基础到模型部署的完整工具链。主要内容包括: Python核心语法速成:变量、控制流、函数等必备知识,特别针对AI开发场景优化讲解 NumPy入门:数值计算基础,涵盖数组运算、矩阵操作和广播机制等AI核心概念 Pandas入门:数据处理利器,包括数据清洗、特征工程等实际项目必备技能 FastAPI简介:模型部署工具,讲解如何将AI能力封装为
本文介绍了使用Pandas进行数据分析的基本操作流程。主要内容包括:1)加载天气数据集并查看基本信息;2)数据查看方法如head()、tail()和列数据提取;3)分组聚合计算,包括按月统计温度平均值和天气频数;4)使用plot()进行基本数据可视化;5)常用统计值获取方法;6)数据排序和去重操作;7)以员工数据集为例的简单分析案例,包括查找薪资极值、部门员工统计等。文章通过代码示例展示了Pand
摘要:DataFrame是Pandas中的核心二维表格数据结构,类似SQL表,由有序的列组成,支持多种数据类型。可通过字典创建,具有行/列索引。常用属性包括index、columns、values等;方法涵盖数据统计(head/tail)、筛选(loc/iloc)、运算、排序等操作。支持布尔索引、与标量/DataFrame运算,以及行/列索引修改。数据可导入导出多种格式(CSV/Excel/JSO
Gradio是一款面向机器学习初学者的Python开源库,能快速构建交互式Web应用界面。其优势在于极简设计,只需几行代码即可实现功能完整的界面,支持文本、图像等多种数据类型输入输出。文章从安装方法开始,通过一个简单的文本处理示例演示基础用法,逐步讲解核心组件Interface类的使用。进阶部分介绍了多输入输出功能,并提供了图像分类器的实际案例。Gradio还支持一键分享和部署,解决端口冲突等常见
本研究基于日本樱花景点的地理坐标和气象数据,构建了2024年樱花开花预测模型。通过数据分析和可视化发现,纬度与开花日期呈显著正相关(r=0.857),2月平均温度与开花日期呈负相关(r=-0.395)。采用梯度提升回归算法建立的预测模型表现优异,平均绝对误差仅2.85天,3天内预测准确率达82.3%。研究揭示了日本樱花"南部早开、北部晚开"的空间分布规律,为旅游规划和气候变化研
基于注意力模块及1D-CNN的滚动轴承故障诊断故障诊断代码 复现针对传统的卷积神经网络对特征的辨识性差的问题,提出一种将注意力模块与一维卷积神经网络相结合的滚动轴承故障诊断模型首先以加入噪声的振动信号作为输入,利用“卷积+池化”单元提取信号的多维特征,然后通过注意力模块对特征赋予不同的权重,利用双池化层取代传统卷积神经网络中的全连接层进行特征的再次提取及特征信息整合,最后通过 Softmax层完成
本文介绍了一个基于Python的交互式数据科学教学平台开发项目。该平台采用Streamlit框架构建,整合了代码展示、在线编辑运行、智能问答等功能模块。创新性地通过Dify平台实现了双模式AI助手:代码专属助手能自动感知当前代码内容并提供解释,通用Python问答则支持自由咨询。平台采用章节化内容组织方式,支持代码在线编辑运行和可视化结果展示,实现"学习-实践-纠错"闭环。
《用乐高积木理解聚类分析》摘要(149字) 聚类分析就像整理乐高积木:电脑自动把数据按特征分类,如同把积木按颜色分组。它属于无监督学习,不需要预先标注,而是自主发现规律。以电商用户分层为例,通过RFM模型(最近消费时间、频率、金额)进行聚类,用K-Means算法找到最佳分组。但要注意数据标准化和处理异常值,且需预先设定分组数量。这种方法能有效区分用户价值,实现精准营销,但对非结构化数据效果有限。
武汉沙淘金信息技术有限公司推出全国标准化数据批量转换解决方案,覆盖32个省会城市,解决企业数据格式兼容与效率痛点。其自研平台支持100+种数据格式转换,采用AI算法和分布式架构,处理效率提升90%,准确率达99.8%。方案严格遵循国家标准,具备全流程可追溯性和安全合规保障,已服务120余家跨行业企业,助力企业打通数字化转型"最后一公里",释放数据价值。
pandas基础练习,pd.read_csv,df.tail(5),df.shape,df.shape,图形详解
NumPy是Python中用于科学计算的基础库,提供多维数组对象ndarray及各种数组操作方法。ndarray具有高效存储和运算能力,支持数学、统计、线性代数等操作。创建数组的方式包括zeros()、ones()、arange()等函数,并可指定数据类型如int32、float64等。数组支持切片索引操作,与Python列表类似。NumPy还提供随机数生成、矩阵运算等功能,但ndarray要求元
本文是Pandas数据分析库的入门教程第一章,主要内容包括: Pandas简介:介绍Pandas作为Python开源数据分析库的核心功能(数据清洗、转换、分析等)及其优势。 环境准备: 导入Pandas库(约定别名为pd) 版本检查方法 配合NumPy使用 核心数据结构: Series:一维带标签数组,可通过列表/字典创建,支持自定义索引 DataFrame:二维表格结构,由多个Series组成
本文介绍了基于微信小程序的场地预约管理系统的设计与实现。系统采用Java语言开发,使用MySQL数据库,采用B/S架构和微信开发者工具。主要功能包括管理员权限模块(系统登录、个人中心管理、场地公告管理)和用户功能模块(场地浏览、预约、支付等)。系统实现了跨平台运行,具有操作简便、响应快速等特点。通过技术、经济和操作可行性分析,验证了系统的实用价值。系统设计注重用户体验,界面简洁直观,数据响应控制在
当需要对不同部分做差异化替换时,用 ** 正则子组(圆括号)** 提取内容,再传入自定义函数处理。group(k):代表匹配到的第k个子组(圆括号包裹的内容)示例:中文地址转英文'上海市黄浦区方浜中路249号','上海市宝山区密山路5号','北京市昌平区北农路2号'])# 正则子组:(市名)(区名)(路名)(编号)pat = '(\w+市)(\w+区)(\w+路)(\d+号)'# 映射字典city
cst仿真设计 反射透射性线圆转换,线线转换 案例与录屏打开CST刚打开模板栏是不是总盯着默认的几个空模板发呆?今天咱们整点新手入门但能快速装逼朋友圈或者中期报告材料的活——反射+透射都能玩的偏振转换超表面(Metasurface),连扫频率扫入射角度的动图我连怎么调录屏参数都揉进去说。先不说太玄的理论基底,直接抓仿真流程+最常用的开源极化分解代码片段来玩。先定个今天的模拟目标吧:太赫兹0.1TH
本文介绍了Pandas中核心组件Index对象的功能特性与应用场景。Index作为Series/DataFrame的行标签序列,具有不可变性、数据对齐、高效选择等核心功能,支持RangeIndex、DatetimeIndex等多种类型。通过代码示例展示了Index的创建、数据对齐机制及其在计算中的自动匹配特性。文章还包含作者的技术专栏介绍(涵盖C语言、Linux、Python等主题)及服务器购买推
本文全面介绍了Pandas中的Index对象,包括其核心特性、常用类型和操作方法。Index作为Pandas的核心数据结构,具有不可变性、有序性和高效查找等特点,支持多种类型如整数、字符串和时间戳索引。文章详细讲解了集合操作、索引重排与重置、分层索引(MultiIndex)等实用功能,并提供了最佳实践建议,如利用索引唯一性提高性能、使用有意义标签等。最后强调索引不可变性,建议必要时创建新索引,避免
摘要:本文提供了一份全面的Pandas数组/标量/数据类型参考手册,涵盖核心数组类型、标量类型、数据类型、核心数据结构及实用技巧。手册详细介绍了Pandas的ExtensionArray特性、空值处理、内存优化方法,并包含版本兼容性注意事项和官方资源链接。内容从基础到进阶,适合作为日常开发的速查指南,帮助用户高效使用Pandas进行数据处理。手册最后还提供了升级到Pandas3.0.0的建议,以获
本文介绍了Pandas库的核心功能分类及常用函数速查指南。主要内容包括:1)数据读取与写入函数;2)数据查看与信息获取方法;3)数据清洗技巧;4)数据选择与过滤操作;5)数据处理与统计函数;6)数据合并与连接技术。文章系统梳理了Pandas从数据导入到分析输出的完整工作流程,涵盖read_csv()、groupby()、merge()等关键函数的使用说明。这些核心函数组合构成了结构化数据处理的基础
《Pandas数据可视化完整指南》摘要:本文详细介绍了Pandas数据可视化方法,包含10种核心图表类型(折线图、柱状图、散点图等)的实现代码与适用场景,并分享图表样式定制技巧、时间序列可视化方法以及高级可视化技巧(双Y轴图表、交互式可视化等)。文章还提供了可视化最佳实践建议和完整模板,帮助用户快速创建专业的数据可视化图表。适用于数据分析师和Python开发者,可作为日常数据可视化工作的实用参考手
【摘要】本文提供了一份全面的Pandas数据清洗指南,涵盖核心步骤和实用技巧。主要内容包括:数据清洗的7个核心流程(加载数据→诊断问题→处理缺失值→去重→格式标准化→异常值处理→验证);6种常用清洗方法(缺失值处理、重复值处理、数据类型转换、异常值处理等);完整清洗示例函数;千万级数据优化技巧(dtype优化、分块处理等);以及清洗质量验证方法和最佳实践建议。文章采用代码示例与文字说明相结合的方式
案例一(RFM模型)展示了从数据模拟、分组聚合、指标计算到用户分层与可视化的完整流程,是用户行为分析的经典范式。案例二(多维透视)重点演练了groupby多级聚合与数据透视,适用于制作多维业务报表。案例三(时间序列)体现了Pandas强大的时间序列处理能力,包括重采样、滚动计算与金融指标分析。案例四(数据整合)聚焦于多表合并(merge)的实战,涵盖了数据清洗、连接与异常值处理的关键步骤。案例五(
通过掌握这些 Pandas Excel 操作技巧,您可以高效地处理各种 Excel 数据处理任务。记住关键原则:读取时尽量精确,处理时注意性能,写入时保持格式清晰。
本文介绍了使用Pandas处理JSON数据的核心方法:1)通过read_json()读取JSON文件或字符串;2)使用to_json()将数据写入JSON文件;3)用json_normalize()处理嵌套JSON结构。文章提供了完整的实战示例,包括数据读取、写入和转换操作,并针对常见问题如中文乱码、日期格式等给出了解决方案。同时介绍了相关参数设置和不同orient格式的差异,帮助用户高效处理JS
《》《
Simulink模型自动化转换为PDF模型描述文件全套脚本,模型中的doc备注可以直接转换为PDF文档中的说明,同时还可将excel表格中记录的模型标定量,测量量直接转换为PDF表格,除此之外,还能将模型分模块分层打印成图片,记录在PDF文件中,免去在手动写模型的说明文档时,手动截图,手动写模型说明的烦恼!自动化生成文档的相关源码全部提供,结构清晰,文件标题结构与模型层次结构一致。所有模型的文件格