Uniplore实验报告——学生用户画像-考勤主题扩展标签构建、可视化
第一部分:实验背景
1.1 实验目的
本实验分为两个核心部分,整体目的是掌握基于助睿数智(Uniplore)平台的学生考勤数据聚类建模、标签扩展、数据可视化及画像分析的全流程技能,具体任务与技能要求如下:
-
掌握使用助睿AI Studio平台进行K-Means聚类建模的操作,能够完成数据加载、聚类参数配置、结果输出与保存;
-
掌握助睿ETL平台的基本操作,能够通过SQL脚本新增表字段、通过转换流完成聚类结果与原始考勤表的关联更新,实现考勤主题扩展标签的构建;
-
掌握助睿BI平台的数据源连接、数据集构建、工作表制作及仪表盘搭建技能,能够通过可视化图表分析数据特征;
-
完成学生考勤群体的自动分群,生成自律模范型、轻微波动型、纪律高危型三类考勤画像标签,并对纪律高危型群体进行专项画像分析,为校园考勤精细化管理提供数据支撑;
-
能够验证实验结果的有效性,排查实验过程中的常见问题,形成完整的实验操作与分析思路。
1.2 实验环境
-
实验平台:助睿数智(Uniplore)在线实验平台,登录地址:https://lab.guilan.cn/,平台涵盖数据集成平台(助睿ETL)、人工智能平台(助睿AI)、助睿BI数据可视化探索平台三大核心功能模块,支持零代码拖拽式操作,实现数据接入、建模、可视化全链路处理;
-
数据库:MySQL数据库(团队私有数据库,用于存储实验所需数据表及实验输出结果);
-
实验数据:前置数据为student_attendance_stats学生考勤主题标签表,包含学生基础信息(学号、姓名、班级、年级、性别等)与考勤次数统计(迟到、早退、请假、没穿校服次数等);实验过程中生成student_cluster聚类结果表,最终更新后的student_attendance_stats表(新增cluster聚类簇编号、attendance_group考勤群体分类字段);
-
实验设备:计算机(支持浏览器运行助睿平台,具备团队私有数据库连接权限)。
1.3 实验处理流程
本实验分为两个连贯部分,整体处理流程遵循“数据准备—聚类建模—标签扩展—可视化分析—画像总结”的逻辑,具体如下:
-
第一部分(考勤主题扩展标签构建):基于student_attendance_stats表,通过助睿AI Studio加载数据、配置K-Means聚类算法(簇数量为3),生成student_cluster聚类结果表;利用助睿BI平台可视化分析聚类簇特征,为聚类簇赋予业务含义(三类考勤群体);通过助睿ETL平台新增表字段、配置转换流,将聚类标签(簇编号、群体分类)更新至student_attendance_stats表,完成扩展标签构建。
-
第二部分(考勤主题可视化与高危群体画像):基于更新后的student_attendance_stats表,利用助睿BI平台连接数据源、构建数据集,制作指标卡、饼图、柱状图、水平条图等工作表,分析纪律高危型群体的性别、年级、校区、班级特征;搭建综合仪表盘整合所有分析图表与结论,完成高危群体画像分析;验证实验结果有效性,排查实验问题。
第二部分:实验步骤
2.1 第一部分:考勤主题扩展标签构建
2.1.1 步骤1:进入助睿AI Studio,新建工作流


配置要点:1. 登录助睿实验平台后,点击左侧菜单“人工智能”,进入AI Studio用户空间;2. 点击页面左上角“+”,选择“新建工作流”,无需修改默认配置,直接进入工作流构建页面(包含菜单栏、控件列表、画布三大模块)。
2.1.2 步骤2:数据导入(加载student_attendance_stats表)
关键操作说明:使用“数据库加载”控件,从团队私有数据库中加载student_attendance_stats表数据,并筛选建模所需字段。





配置要点:1. 在控件列表中搜索“数据库加载”,拖拽至画布;2. 双击该控件,输入团队私有数据库连接信息,点击“连接”,在弹出窗口中选择student_attendance_stats表;3. 筛选保留student_id、class_id、late_count、early_leave_count、leave_count、uniform_violate_count字段,其他字段设为“skip”;4. 配置字段属性类型(student_id、class_id为categorical,4个考勤次数字段为numeric);5. 右键点击该控件,选择“运行该控件”,运行成功后右键“查看输出结果”,确认数据加载正确。
2.1.3 步骤3:K-Means聚类建模
关键操作说明:拖拽“K-Means”组件,配置聚类参数,运行聚类算法,生成聚类结果(为每个学生分配簇编号C1/C2/C3)。



配置要点:1. 拖拽“K-Means”组件至画布,创建“数据库加载”组件到“K-Means”组件的连线;2. 双击“K-Means”组件,簇数量选择“固定3个”,其他参数保持默认;3. 右键运行该控件,运行成功后查看输出结果,确认每个学生均已标记对应的聚类簇编号。
2.1.4 步骤4:聚类结果输出与保存(生成student_cluster表)
关键操作说明:使用“数据入库”控件,将聚类结果保存至团队私有数据库,新建student_cluster表存储结果。



配置要点:1. 拖拽“数据入库”组件至画布,创建“K-Means”组件到“数据入库”组件的连线;2. 双击该控件,输入团队私有数据库连接信息,点击“获取表信息”;3. 选择“新建数据表”,表名称修改为“student_cluster”,点击“确定”;4. 运行整个工作流,确认所有控件运行成功,聚类结果已保存至student_cluster表。
2.1.5 步骤5:助睿BI连接数据源,构建聚类分析数据集
关键操作说明:进入助睿BI平台,连接团队私有数据库,创建数据集(基于student_cluster表),为后续聚类簇分析做准备。











配置要点:1. 点击实验平台左侧菜单“助睿BI”,进入BI平台首页;2. 点击左侧“数据源”,选择“+”→“新建连接”→“MySQL”,输入数据库连接信息,点击“测试连接”,成功后点击“确认”;3. 点击左侧“数据集”,选择“+”→“新建数据集”,输入数据集名称、所属分组及备注,点击“确认”;4. 在数据集配置页面,选择已新建的数据源和“labs”目录,将student_cluster表拖拽至画布;5. 将表中字段备注修改为中文(参考:student_id=学生ID、class_id=班级ID等),点击“保存”并“保存并发布”数据集。
2.1.6 步骤6:制作聚类簇分析工作表,解读聚类画像
关键操作说明:在助睿BI中新建分组及工作表,使用探索器图表,两两分析4个考勤指标的聚类簇分布,为聚类簇赋予业务含义。



















配置要点:1. 点击左侧“工作表”,新建分组(用于存放聚类分析相关工作表);2. 右键分组,选择“新建工作表”,输入名称(如“迟到早退次数的聚类簇分析”),选择数据集为“聚类簇编号数据集”;3. 图表类型选择“探索器”,将两个考勤指标分别拖拽至X轴、Y轴,颜色选择“Cluster(聚类簇编号)”,信息添加“student_id”并设为维度,将数据限额设为100%;4. 重复上述操作,依次制作迟到与请假、迟到与没穿校服、早退与请假、早退与没穿校服、请假与没穿校服的聚类簇分析工作表,保存并发布所有工作表。
2.1.7 步骤7:搭建聚类簇分析仪表盘,确定群体分类
关键操作说明:在助睿BI中新建仪表盘,将6个聚类分析工作表拖拽至画布,调整布局,解读聚类簇特征,确定三类考勤群体的业务名称。




配置要点:1. 点击左侧“仪表盘”,选择“+”→“新建仪表盘”,输入名称“聚类簇分析”及备注,点击“确认”;2. 拖拽“文本组件”至画布,输入“聚类簇分析”,设置字体格式(加粗、居中)并固定位置;3. 切换至“工作表”,将6个聚类分析工作表拖拽至画布,调整大小与布局;4. 结合散点图分布,确定聚类簇业务含义:C1=自律模范型、C2=轻微波动型、C3=纪律高危型,记录群体分类映射关系。
2.1.8 步骤8:助睿ETL新增字段,更新扩展标签
关键操作说明:进入助睿ETL平台,新建转换流,通过SQL脚本为student_attendance_stats表新增聚类相关字段,再通过转换流将聚类结果更新至该表。




















配置要点:1. 进入上一实验创建的ETL项目,新建转换流“增加考勤主题扩展标签字段”,拖拽“执行一个SQL脚本”组件,输入SQL(新增cluster、attendance_group字段),选择团队私有数据库,运行转换流;2. 新建转换流“增加考勤群体分类标签”,拖拽“表输入”组件,获取student_cluster表数据;3. 拖拽“字段选择”组件,保留student_id、Cluster字段,修改字段类型为Integer;4. 拖拽“值映射”组件,将Cluster字段映射为attendance_group(C1=轻微波动型、C2=自律模范型、C3=纪律高危型);5. 拖拽“更新”组件,选择student_attendance_stats表,设置查询关键字为student_id,更新字段为cluster、attendance_group;6. 运行转换流,查看数据探查结果,确认标签更新成功。
2.2 第二部分:考勤主题可视化与高危群体画像
2.2.1 步骤1:进入助睿BI,构建学生考勤主题数据集
关键操作说明:复用已有的团队私有数据库连接,新建数据集(基于更新后的student_attendance_stats表),用于后续高危群体分析。





配置要点:1. 进入助睿BI平台,点击左侧“数据集”,选择“+”→“新建数据集”,输入名称(如“学生考勤主题数据集”)、所属分组及备注;2. 选择已有的团队私有数据库数据源和“labs”目录,将student_attendance_stats表拖拽至画布;3. 确认字段备注已为中文,无需额外设置,点击“保存”并“保存并发布”数据集。
2.2.2 步骤2:制作整体概况指标卡(高危群体人数统计)
关键操作说明:新建工作表,制作指标卡,统计纪律高危型学生总人数、男生人数、女生人数、未知性别人数,直观呈现高危群体整体规模。



、



















配置要点:1. 新建工作表分组(如“学生考勤主题分析”),右键新建工作表(如“纪律高危型总人数”),选择数据集为“学生考勤主题数据集”;2. 图表类型选择“指标卡”,将student_id拖拽至“值”,聚合类型设为“去重计数”;3. 添加过滤器,选择attendance_group,设置为“包含纪律高危型”;4. 调整样式(边距16、标题红色16号、值红色30号粗体),保存并发布;5. 重复上述操作,分别制作高危型男生、女生、未知性别人数指标卡,新增gender字段过滤器(分别包含男、女、未知)。
2.2.3 步骤3:制作性别特征分析工作表(饼图)
关键操作说明:制作两个饼图工作表,分别分析纪律高危型学生男女人数占比、全校学生男女人数占比,排除基数干扰,分析性别倾向。






配置要点:1. 新建工作表“纪律高危型学生男女人数占比”,数据集不变,图表类型选择“饼图”;2. student_id拖拽至“值”(去重计数),gender拖拽至“分类”;3. 添加过滤器,排除gender=未知、包含attendance_group=纪律高危型;4. 样式设置中,勾选“百分比”标签,调整内环大小、扇形圆角、主题色,保存并发布;5. 新建工作表“全校学生男女人数占比”,参考上述步骤,仅排除gender=未知,不设置attendance_group过滤器,保存并发布。
2.2.4 步骤4:制作年级特征分析工作表(柱状图)
关键操作说明:制作柱状图,分析纪律高危型学生在各年级的分布情况,明确年级特征。

配置要点:1. 新建工作表“纪律高危型学生年级特征分析”,图表类型选择“柱状图”;2. grade拖拽至X轴,student_id拖拽至Y轴(去重计数);3. 添加过滤器,包含attendance_group=纪律高危型;4. 样式设置中,选择与饼图一致的主题色,取消边框色,保存并发布。
2.2.5 步骤5:制作校区+年级交叉特征分析工作表(堆叠柱状图)
关键操作说明:制作堆叠柱状图,分析不同校区、不同年级的高危学生分布,定位高发区域;同时制作全校校区+年级学生人数堆叠柱状图,排除基数干扰。


配置要点:1. 新建工作表“纪律高危型学生校区类型与年级交叉特征分析”,图表类型为柱状图,参考年级特征分析步骤配置grade、student_id;2. 将campus_type拖拽至“分组”,形成堆叠效果;3. 添加attendance_group=纪律高危型过滤器,调整样式,保存并发布;4. 新建工作表“不同校区类型各年级学生人数”,参考上述步骤,不添加任何过滤器,制作全校校区+年级学生人数堆叠柱状图,保存并发布。
2.2.6 步骤6:制作班级特征分析工作表(水平条图)
关键操作说明:制作水平条图,分析纪律高危型学生的班级分布,定位高危学生集中的班级。

配置要点:1. 新建工作表“纪律高危型学生班级特征分析”,图表类型选择“水平条图”;2. class_name拖拽至Y轴,student_id拖拽至X轴(去重计数);3. 添加attendance_group=纪律高危型过滤器;4. 将student_id按降序排序,调整主题色与饼图、柱状图一致,保存并发布。
2.2.7 步骤7:搭建综合仪表盘,整合分析结果
关键操作说明:新建仪表盘,将所有工作表(指标卡、饼图、柱状图、水平条图)拖拽至画布,添加分析文本,调整布局,发布并分享仪表盘。




配置要点:1. 新建仪表盘“纪律高危型学生用户画像分析”,添加文本组件,输入标题并设置格式;2. 将所有制作的工作表拖拽至画布,调整大小与布局,确保美观有序;3. 添加文本组件,填写各部分分析结论,关闭“超出隐藏”开关实现换行;4. 点击“发布”,保存并发布仪表盘;5. 点击“分享”,复制分享链接,完成仪表盘分享。
第三部分:实验结果
3.1 实验输出文件与数据结果
3.1.1 第一部分输出结果
-
聚类结果表:student_cluster表(存储学生ID、班级ID、4个考勤次数字段、聚类簇编号Cluster、轮廓系数Silhouette),共包含所有参与聚类的学生数据,每个学生对应唯一簇编号C1/C2/C3;
-
更新后的考勤主题标签表:student_attendance_stats表(新增cluster、attendance_group两个字段),所有学生均已标记聚类簇编号及对应的考勤群体分类(自律模范型、轻微波动型、纪律高危型);
-
助睿BI数据集:聚类簇编号数据集(基于student_cluster表);
-
助睿BI工作表:6个聚类簇分析工作表(探索器散点图);
-
助睿BI仪表盘:聚类簇分析仪表盘(整合6个散点图,呈现聚类分布特征);
-
聚类群体分类映射表: 聚类簇编号颜色群体分类名称核心特征C1蓝色自律模范型全维度异常次数均极低,出勤表现稳定,纪律意识强C2青色轻微波动型迟到早退次数低,偶发校服违规或请假,整体纪律可控C3黄色纪律高危型全维度异常次数均偏高,高频违纪行为叠加,存在极端离群记录
3.1.2 第二部分输出结果
5.2 实验反思与展望
本次实验虽然顺利完成,但仍存在一些不足:一是对K-Means聚类算法的参数优化(如簇数量的确定)掌握不够深入,仅使用固定簇数量,未进行参数调优;二是对原始数据的预处理不够细致,部分字段存在缺失值,影响了聚类结果的完整性;三是仪表盘的布局与样式设计不够美观,分析文本的逻辑性可进一步提升。
后续可进一步学习聚类算法的参数调优方法,提升建模效果;加强数据预处理技能,学习空值、异常值的处理方法,保证数据质量;优化仪表盘的设计,提升可视化效果与可读性,同时将实验方法应用于更多校园管理场景,如学生成绩分析、行为习惯画像等,充分发挥数据的价值。
-
助睿BI数据集:学生考勤主题数据集(基于更新后的student_attendance_stats表);
-
助睿BI工作表:8个工作表(4个指标卡、2个饼图、2个柱状图、1个水平条图);
-
助睿BI仪表盘:纪律高危型学生用户画像分析仪表盘(整合所有工作表及分析文本,可通过分享链接查看);
-
核心统计数据:纪律高危型学生总人数421人,其中男生45人、女生38人、未知性别338人;全校男生占比53.03%、女生占比46.97%;高危型男生占比54.22%、女生占比45.78%;老校区高三高危学生261人(高发区),高三09班高危学生38人(最集中班级)。
-
3.2 结果分析与验证
3.2.1 第一部分结果分析与验证
1. 聚类结果验证:通过助睿BI探索器散点图可见,三类聚类簇分布清晰,无明显交叉重叠,轮廓系数正常,说明聚类效果良好,能够有效区分不同考勤行为的学生群体;
2. 标签更新验证:通过数据探查查看student_attendance_stats表,所有学生均已成功添加cluster和attendance_group字段,簇编号与群体分类一一对应,无缺失、错误数据,说明标签扩展构建成功;
3. 聚类画像合理性:自律模范型、轻微波动型、纪律高危型的分类符合校园考勤管理的业务逻辑,能够精准对应不同纪律表现的学生群体,为后续专项分析提供了可靠的标签支撑。
3.2.2 第二部分结果分析与验证
1. 整体概况分析:纪律高危型学生共421人,未知性别学生占比极高(338人),主要因原始数据中性别字段缺失,不影响核心特征分析;男生人数多于女生,说明男生考勤违纪风险更高;
2. 性别特征验证:排除未知性别后,高危型男生占比(54.22%)高于全校男生基数占比(53.03%),女生占比则相反,验证了男生是高危群体的主要构成对象,与业务认知一致;
3. 年级与校区特征验证:高三老校区是高危行为高发区,结合全校校区+年级人数分布,排除基数干扰后,确认老校区管理、通勤条件等因素对考勤的影响,新校区整体风险可控;
4. 班级特征验证:高危学生集中在少数班级(如高三09班38人),说明班级管理强度、班风对学生考勤行为影响显著,验证了班级聚集性特征;
5. 仪表盘验证:综合仪表盘整合了所有分析图表与结论,布局合理、数据清晰,能够直观呈现高危群体的核心特征,分享功能正常,可实现数据共享。
第四部分:问题与解决
4.1 问题1:数据库加载控件运行失败,无法加载student_attendance_stats表
问题现象:在助睿AI Studio中,双击“数据库加载”控件,输入数据库连接信息后点击“连接”,提示连接失败,无法加载目标数据表,控件运行报错。
问题原因:1. 数据库连接信息填写错误(如主机地址、端口号、用户名、密码输入有误);2. 团队私有数据库未开启访问权限,导致平台无法连接;3. 数据表名称输入错误,与数据库中实际表名不一致。
解决方法:1. 核对团队私有数据库的连接信息,逐字检查主机地址、端口号、用户名、密码,修正输入错误;2. 联系团队管理员,确认数据库已开启外部访问权限,确保助睿平台能够正常访问;3. 登录数据库,确认数据表名称为student_attendance_stats,无拼写错误,在控件中重新选择数据表,再次运行控件,成功加载数据。
4.2 问题2:K-Means聚类后,部分学生未分配簇编号,结果缺失
问题现象:运行K-Means控件后,查看输出结果,发现部分学生的Cluster字段为空,未分配C1/C2/C3中的任何一个簇编号,聚类结果不完整。
问题原因:数据加载时,部分学生的考勤次数字段(late_count等)存在空值,K-Means算法无法处理空值数据,导致该部分学生无法参与聚类,未生成簇编号。
解决方法:1. 回到“数据库加载”控件,重新配置字段选择,检查考勤次数字段是否存在空值;2. 在数据库中执行SQL语句,对空值进行处理(如用0填充空值),确保所有参与聚类的字段无空值;3. 重新运行“数据库加载”控件和K-Means控件,查看输出结果,确认所有学生均已成功分配簇编号。
4.3 问题3:助睿BI制作饼图时,无法显示百分比标签
问题现象:在制作性别占比饼图时,图表仅显示扇形区域,未显示各部分的百分比标签,无法直观查看占比情况。
问题原因:助睿BI平台默认的饼图设置中,“标签显示形式”未勾选“百分比”,导致百分比标签不显示,仅显示默认的分类标签。
解决方法:1. 点击饼图的“样式设置”,展开“图表元素设置”;2. 找到“标签显示形式”选项,勾选“百分比”,取消不必要的标签选项;3. 点击画布空白处,保存设置,饼图即可显示各部分的百分比标签,完成设置。
4.4 问题4:ETL更新组件运行失败,无法将聚类标签更新至student_attendance_stats表
问题现象:配置ETL更新组件后,运行转换流,提示“更新失败”,日志显示“字段类型不匹配”,无法将Cluster、attendance_group字段更新至目标表。
问题原因:1. 字段选择组件中,student_id、class_id的字段类型未修改为Integer,与student_attendance_stats表中对应字段的类型不一致;2. 值映射组件中,目标字段attendance_group的字段类型未与目标表匹配;3. 更新组件中,表字段选择错误,将Cluster字段映射至错误的目标字段。
解决方法:1. 双击“字段选择”组件,进入“元数据”选项,将student_id、class_id的字段类型修改为Integer,点击确认;2. 检查值映射组件,确保目标字段attendance_group的类型为文本型,与目标表一致;3. 双击“更新”组件,核对表字段选择,确保Cluster映射至cluster字段、attendance_group映射至attendance_group字段,重新运行转换流,更新成功。
4.5 问题5:助睿BI仪表盘拖拽工作表后,部分图表无法显示数据
问题现象:将制作好的工作表拖拽至仪表盘后,部分图表显示“无数据”,但单独打开工作表时数据正常显示。
问题原因:1. 仪表盘选择的数据集与工作表的数据集不一致,导致数据无法加载;2. 工作表未成功发布,仪表盘无法引用未发布的工作表;3. 图表数据限额设置过低,导致部分数据无法显示。
解决方法:1. 检查仪表盘的数据集设置,确保与所有工作表的数据集一致(均为学生考勤主题数据集);2. 回到工作表模块,确认所有工作表均已“保存并发布”,未发布的工作表重新发布;3. 打开对应工作表,将数据限额设置为100%,保存后重新拖拽至仪表盘,图表正常显示数据。
第五部分:实验总结
5.1 实验收获
通过本次实验(两部分连贯操作),我系统掌握了基于助睿数智(Uniplore)平台的学生考勤数据聚类建模、标签扩展、可视化分析及画像构建的全流程技能,具体收获如下:
-
技能层面:熟练掌握了助睿AI Studio平台的使用,能够完成数据加载、K-Means聚类参数配置、聚类结果输出与保存;掌握了助睿ETL平台的核心操作,能够通过SQL脚本新增表字段、通过转换流完成数据映射与更新,实现扩展标签构建;熟练运用助睿BI平台,完成数据源连接、数据集构建、各类工作表(指标卡、饼图、柱状图等)的制作,以及仪表盘的搭建、发布与分享。
-
知识层面:理解了K-Means聚类算法的基本原理及在学生考勤分群中的应用,掌握了聚类结果的可视化解读方法,能够为聚类簇赋予合理的业务含义;学会了如何通过多维度可视化分析(性别、年级、校区、班级),构建学生考勤画像,尤其是纪律高危型群体的特征分析方法;理解了数据预处理、数据验证在实验中的重要性,掌握了常见数据问题的排查与解决思路。
-
应用层面:能够将所学技能应用于校园考勤精细化管理场景,通过聚类建模实现学生考勤群体的自动划分,通过可视化分析精准定位高危群体及高发区域,为制定针对性的考勤管理措施提供数据支撑;培养了数据思维,学会了从数据中挖掘规律、分析问题,提升了数据处理与分析的实践能力。
-
问题解决层面:在实验过程中,遇到了数据库连接、聚类结果缺失、图表显示异常、ETL更新失败等问题,通过排查原因、查阅操作指引、反复调试,成功解决了所有问题,提升了问题排查与解决能力,也认识到实验操作的严谨性,细节失误可能导致实验失败,需注重每一步的配置与验证。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)