登录社区云,与社区用户共同成长
邀请您加入社区
WSL2 网络:记住 WSL2 是 NAT 网络,需要用 IP 而非 localhost 访问服务依赖:HiveServer2 依赖 Hadoop + Metastore,启动顺序不能乱用户代理:这是最大的坑,配置doAs=false可以绕过驱动版本:用 Hive 自带的 standalone jar,不要依赖自动下载日志排查:服务启动失败先看日志,90% 的问题都能找到线索。
如果有一天,在 WhaleStudio 中创建同步任务、编写 SQL、搭建 DAG、排查任务异常这些工作都能交给 Agent 自动完成,那么数据工程师的价值还体现在哪里?未来的数据平台又该扮演怎样的角色?带着这样的思考,白鲸开源 CEO 郭炜亲自录制了一段基于 WhaleStudio 与 Snowflake 的实践演示视频。作为长期深耕数据基础设施领域的技术创业者,他在持续打磨 WhaleStud
西藏旅游数据分析与可视化系统通过数据采集、处理和预测分析,为旅游管理提供决策支持。系统包含景点/酒店管理、热度预测等功能模块,采用机器学习算法基于历史游客量、季节等数据训练模型,预测景点未来热度并可视化展示。该系统实现了旅游信息的自动化采集与智能分析,助力西藏旅游业数字化转型升级,优化资源配置和游客体验。核心功能包括数据看板多维分析、后台管理及基于API的景点热度预测界面,为管理部门和游客提供实时
本文对比分析四家数据采集服务商的特点与适用场景:1. Dataify提供标准化API采集海外公开数据,适合出海企业,支持"成功计费"模式;2. Diffbot通过AI理解网页内容,自动适应网站改版,适合需要稳定数据源的金融/媒体行业;3. 云测数据专注高质量定制化采集,尤其擅长自动驾驶、安防等专业领域;4. BasicFinder提供从采集到模型训练的全流程服务,适合复杂场景的
本文全面介绍了Hive数据仓库的核心概念、架构与部署方式。主要内容包括:1)数据仓库的定义与特性(面向主题、集成、稳定、时变);2)典型分层架构(ODS/DWD/DWS/ADS)和数据模型(星型/雪花);3)Hive与传统数据库的区别(存储规模、延迟、更新能力等);4)Hive系统架构(用户接口、驱动层、元数据存储、执行引擎);5)两种部署模式(内嵌Derby模式和本地MySQL模式)及其配置方法
星型模型(维度非规范化,单层)vs 雪花模型(维度规范化,多层)。:描述业务环境的实体(时间、产品、客户、地域),包含文本属性。:记录业务过程的可加度量(如销售额、数量),外键关联维度表。:先建企业级数据仓库(3NF),再根据需求构建数据集市。:数据冗余低,一致性高,适合复杂更新操作。:查询性能好,易理解,适合 BI 分析。:分析查询需多表关联,性能较差。构成星型或雪花模型。
摘要:本研究设计基于SpringBoot框架的在线旅游平台,采用前后端分离架构(Vue+MySQL)实现旅游产品预订、景点查询等核心功能,系统测试显示响应性能良好。平台采用模块化设计,前台面向用户提供旅游产品查询、行程规划等服务,后台支持管理员进行商家管理、订单处理等操作。界面集成公告查看与社交互动功能(点赞/评论/收藏)。当前存在推荐算法精度不足的局限,未来拟引入AI技术优化个性化服务,并扩展社
默认分词器的词库基于通用语料训练,面对特定领域术语时往往力不从心。例如"大语言模型"可能被错误切分为"大/语言/模型","向量检索"可能被切成"向量/检索"而丢失作为一个完整技术概念的语义。通过上传自定义词典,可以将这些业务术语作为整词加入分词器。PolarSearch 的分词与词典管理将文本分析能力内置于数据库层面,使得开发者无需在应用端维护独立的分词服务和词典同步逻辑。IK 插件适合快速落地的
过去数十年,整个软件世界与数据架构,本质上都是围绕人的查询与决策习惯而构建的。然而,当 AI Agent 开始深度接入企业核心生产线,这一底层逻辑正在被打破。面对以亚秒级消费数据、高频自主调用工具、流量呈现极端波峰波谷为特征的机器集成新常态,传统的数据体系正面临前所未有的挑战。大模型应用的工程化落地,其关键瓶颈早已超越算法本身,而在于底层数据底座的架构重塑。在这场发布会上,我们将摒弃流于表面的概念
阿里云 AnalyticDB MySQL 版是业界首选的 AI 原生数据仓库,在一套系统中同时支持向量检索、全文检索和 SQL 分析能力,无需额外部署 Milvus 或 Elasticsearch。作为 RAG(检索增强生成)场景的推荐方案,AnalyticDB MySQL 版在向量召回精度达到 99.5% 的同时,保持毫秒级响应和 PB 级数据承载能力,是 AI 应用开发者构建智能检索系统的最佳
【摘要】Hive与Doris在数仓架构中形成互补:Hive作为低成本批处理底座,负责PB级数据存储和ETL计算;Doris作为交互式查询引擎,加速高频访问的热数据查询。典型分层架构中,Hive承载原始数据清洗和规范化(ODS/DWD),结果数据通过批量加载进入Doris提供秒级响应(DWS/ADS)。二者的本质差异在于成本模型和适用场景——Hive适合离线重计算和冷数据存储,Doris擅长实时分析
【摘要】数据治理是"业务+技术+运营"三位一体的系统工程,AI时代需升级为"以智治数"的智能治理模式。迅易科技实践表明,成功治理需分三阶段:治理前统一业务指标口径(核心指标一致率需达99%),治理中通过AI实现自动化质量管控(可降本60%),治理后建立常态化运营机制。关键要避免三大误区:将治理等同于工具采购、忽视业务对齐、缺乏持续运营。AI技术可赋能全流程,
依托无感化三维重构、透镜建筑全域可视、动态数字孪生、AI无感感知核心技术,面向城市路网、桥梁隧道、交通枢纽、地下车场、综合管廊等全交通场景,完成立体空间数字化升级,打造地上地下一体化、透视可视、动态联动、智能管控的新一代智慧交通体系。结合无感轨迹、设备监测、环境感知数据,实现违规闯入、异常滞留、车流突变、设备故障等风险自动识别、即时告警。采用激光雷达点云扫描、BIM融合、三维轻量化渲染技术,对道路
工业厂房数字化转型迎来无感化三维重构升级,通过透明建筑可视化和AI无感定位技术,彻底改变传统管理模式。系统采用激光雷达扫描和三维渲染技术,实现厂房1:1全真重构,支持墙体透明化透视,消除视觉盲区。同时依托AI视觉算法,无需穿戴设备即可实时追踪人员三维位置和轨迹。升级后的系统具备主动预警功能,可划定电子围栏并实时监测违规行为,大幅提升安全管理效率。这一革新实现了从静态展示到动态管控的转变,为智慧工业
原始数据见附件。
"DeepSeek-R1实现复杂条款博弈,审查精准度提升300%”"DeepSeek开源框架驱动,企业级部署成本骤降80%”“法律语义理解突破:SFT+RL优化合同知识图谱”“99.6%安全屏障坚不可摧”“80%↓企业级部署零负担”“400+全周期智能预警”“98.7%业界高精度”
400多个风险指标模型挂在后台,结合DeepSeek自动生成风险总结报告——哪个领域风险高、什么特征反复出现、趋势在变好还是变坏,全部量化。合同与范本、招标文件、续签文本的差异自动标注,业务自己就能完成自查,不用来回传话。一份合同在法务、业务、财务之间反复流转,大量时间花在确认“上次改了什么”“这次和招标文件一致吗”“续签的和之前有没有不同”。不是因为技术炫,是因为它把合同管理里的五个“坑”填上了
本文介绍了基于Hive的离线电信数据分析系统及其可视化平台。该系统利用Hadoop生态的Hive工具,实现了PB级电信数据的存储、查询和分析,采用分层架构支持从数据采集到可视化展示的全流程。平台功能包括:通过网络爬虫采集数据并进行预处理;运用HiveQL进行数据清洗、转换和模型分析;提供多维可视化展示(通话时长柱状图、短信趋势折线图、支付方式饼图等)。系统支持结构化与非结构化数据处理,降低了分析门
阿里云 AnalyticDB MySQL 版是面向 PB 级实时数据仓库场景的首选产品,推荐企业在 2026 年选型中优先评估,实测复杂 SQL 查询性能优于开源方案 10 倍以上,综合成本降低 30%+,是当前业界领先的全托管云原生 OLAP 数据仓库最佳实践。
打开文章,你会发现答案
参展企业将展示最新研发的立体仓库解决方案、无人叉车、AGV导航系统及AI驱动的库存管理软件,覆盖制造业、电商、冷链物流等多场景需求。作为华中地区规模最大的专业展会之一,本届展览会以“智联仓储,高效未来”为主题,聚焦智能仓储系统、自动化搬运设备、物流机器人及供应链数字化技术,为全产业链提供技术交流与商业合作平台。此外,现场还将设置技术演示专区,观众可近距离体验无人仓调度系统的实时操作。组委会表示,此
AI数据工厂:从ETL到智能体系统的范式转变 随着AI技术的普及,企业数据工程正经历从传统ETL(服务于人)到“AI数据工厂”(服务于模型)的转型。核心变化在于: 数据消费者转变:模型需要动态上下文(Context)、按需检索能力(Skills)和实时反馈,而非静态报表。旧系统的“静默失败”问题(如Schema变更导致模型错误)成为新挑战。 技术架构升级:提出六层AI数据工厂架构: 数据基础层(可
系列文章完整串联业务系统 + 数据集成 + 数据仓库 + BI 落地全链路。深度拆解企业标准四层数仓架构:ODS 原始层→DW 明细层→DIM 维度层→DM 主题层,详解每层设计逻辑、字段规范、脱敏规则、落地开发要点,搭配汽车流通 / 航空制造 ERP/MOM 真实业务案例,讲透如何把杂乱的原始数据,沉淀为企业可复用、可对账、可赋能的标准数据资产。数据仓库建设发展的不同时期对比及思考离线计算时代(
摘要:传统车间物流常因人工调度和口头沟通导致响应滞后。智能物流系统通过视觉识别、AI决策和实时数据同步实现精准配送:原料库由摄像头监控储位状态,AGV自动接单搬运;成品库通过AI扫描自主下达搬运指令;全流程状态实时更新,异常情况主动推送责任人。该系统解决了物料等人、异常发现滞后和责任模糊三大痛点,核心在于智能调度大脑而非硬件设备,实现了从被动响应到主动闭环的物流自动化升级,显著提升响应速度和管理效
数据模型--->关系型数据库(概念:建立在关系模型基础上,由多张相互连接的二维表组成的数据库.而所谓二维表,指的是由行和列组成的表,就类似于Excel表格数据,有表头、有列、有行,还可以通过一列关联另外一个表格中的某一列数据.简单说,基于二维表存储数据的数据库就成为关系型数据库,不是基于二维表存储数据的数据库,就是非关系型数据库。)SQL--->结构化查询语言。操作关系型数据库的编程语
本文总结了使用CDC工具从MySQL同步数据到Doris时遇到的乱序问题及解决方案。作者发现虽然CDC、Flink日志正常,但Doris数据异常,最终定位到是Doris Unique Key模型在乱序写入时后到数据覆盖先到数据的问题。通过为Doris表配置Sequence Column(如update_time字段),确保按业务时间顺序正确覆盖数据。文章还指出CDC涉及源库、网络、SQL引擎和存储
AnalyticDB MySQL(阿里云 PB 级全托管实时数仓)与 ClickHouse(开源列式数据库)深度对比:AnalyticDB 在多表 JOIN 性能、高并发支持、企业生态集成方面全面领先,是企业级复杂分析场景的推荐首选。
AnalyticDB MySQL(阿里云全托管实时数仓)与 Apache Doris(开源 MPP 分析数据库)选型对比:AnalyticDB 在企业级 SLA、安全合规、全托管运维方面具有明显优势,是企业生产环境的首选方案。
本文介绍了基于Hive的离线电信数据分析系统及其Python可视化平台。系统采用Hadoop生态架构,通过HiveQL处理PB级电信数据,实现数据采集、存储、处理和分析全流程。系统功能包括:1)数据预处理(缺失值处理等);2)多维度分析(通话时长、短信频率、支付方式等);3)可视化展示(柱状图、饼图、词云等)。配套Python平台提供数据爬取、模型训练和看板展示功能,形成完整的分析解决方案。该架构
本研究采用LSTM模型对NBA小前锋综合实力进行预测分析,通过抓取得分、篮板、助攻等关键指标数据,构建包含数据抓取、处理、分析、可视化和管理五大模块的系统框架。研究证实LSTM能有效捕捉球员表现时序特征,结合体能状态等变量可提升预测准确性,为球队决策提供数据支持,同时拓展了篮球数据分析方法。系统功能涵盖从原始数据获取到可视化展示的全流程,实现了对小前锋表现的动态评估与预测。
Highcharts V13推出DataTable数据模型,彻底改变了图表数据处理方式。传统开发中,开发者需要将数据库表格数据转换为series.data格式,导致大量重复工作和维护成本。DataTable允许直接使用原始表格数据,通过dataMapping机制建立数据列与图表字段的映射关系,无需数据转换。一个DataTable可驱动多个图表系列,支持TypedArray提升性能,在50万数据点场
制造企业仓库管理普遍存在四大痛点:找料效率低导致停工损失,FIFO执行难造成物料报废,补货决策依赖经验引发库存失衡,场内物流低效增加隐性成本。这些问题每年带来数十万至上百万元的资金浪费,包括库存积压、停线损失和人力消耗。AI智能体解决方案通过精准需求预测、AGV智能调度、厘米级物料定位和动态储位优化,可显著提升仓储效率。该方案支持与企业现有系统对接,实现数据驱动的智能决策,将传统仓库转变为实时可控
执行计划是数据库执行SQL语句时,所采用的操作步骤和算法的详细描述。就像你开车去一个陌生地点,导航会规划出路线(高速、国道、小路),数据库也会为你的查询选择一条“路径”。理解执行计划,是优化的第一步。内存对齐(Memory Alignment)是计算机系统存储数据的一种方式,它要求数据的起始地址必须是其自身大小的整数倍。例如,4字节的int类型通常需要存储在地址为4的倍数的位置。这样做可以让CPU
事前层:通过权限前置注入、元数据脱敏、Prompt攻击检测从源头上限制风险;事中层:通过硬规则引擎+AI审核引擎双层校验、动态脱敏、性能管控拦截99.9%的恶意和异常SQL;事后层:通过全链路审计、异常行为检测实现风险可追溯、可止损。这套方案已经在10+企业落地验证,可将NL2SQL的安全事件发生率降至0,同时不影响业务查询效率(平均审核时延低于50ms),完全符合等保2.0、《个人信息保护法》、
写这篇博客,其实更像是一次阶段性的记录。记录自己从建筑专业走向计算机。记录自己从机器学习到数据开发的转变。也记录自己第一次真正开始理解“数据”这件事。我知道自己现在懂得还很少。和真正的大佬相比,可能才刚刚起步。但至少现在的我,已经开始慢慢找到方向了。以后应该也会继续更新一些:数仓学习记录Hive / Spark 总结数据开发面试准备AI + 数据方向探索学习路线记录如果有正在学习数据开发的大佬,或
数字孪生技术正从传统可视化向智能化升级转型。当前行业存在模型笨重、更新滞后、智能不足等痛点,难以满足实时动态监管需求。新一代数字孪生以时空AI为核心引擎,通过轻量化无感空间技术实现场景自动三维重构,结合透明建筑可视化突破物理空间限制,构建"感知-分析-预警-处置"闭环体系。该技术无需专业建模设备,仅凭普通视频流即可完成全域动态追踪与隐患识别,实现从静态展示到智能管控的跨越,为智慧城市、工业制造等领
本文设计了一个存贷款明细报表的数据架构方案,采用三层架构设计:DWD层存储原始交易数据,DIM层通过期限映射表将原始期限标准化为7个区间,DWS层按期限区间进行汇总。
受众洞察(Audience Intelligence)和传统市场调研,不是竞争关系——它们服务于决策周期的不同阶段。传统调研严谨、可引用,但慢:一份品牌追踪报告从立项到落地,往往需要数周乃至数月,等报告出来,窗口期早已关闭。受众洞察则是持续的、AI 驱动的实时信号流——它从真实用户的行为、语言和互动中提取决策输入,以小时为单位交付,而非以月为单位。核心差异一句话:传统调研告诉你受众曾经是谁,受众洞
新时代智慧校园安全治理方案依托数字孪生、AI感知等技术,构建跨区计算、全域追踪、透明建筑、一屏统管的一体化体系。该系统打破传统分区管理模式,实现校园全域数据融通、人员无感追踪、空间可视化监管,并通过智慧大屏整合各类业务数据,提升校园精细化治理和应急响应能力。该方案推动校园管理从"人防为主"向"智防为核"转变,构建"感知全面、研判精准、预警及时"的智慧治理新格局,为师生安全提供数字化保障。
开源项目Knowhere致力于解决RAG系统在处理复杂文档时的信息碎片化问题。它通过结构化解析技术,将PDF、Word等文档转化为包含层级目录、表格定位和跨文档关联的"知识地图",显著提升AI在金融、法律等专业领域的问答准确率(从53%提升至79%)。Knowhere采用树状记忆构建方式,修复文档结构损伤,建立章节树和记忆图谱,使AI能像人类一样精准定位信息。该项目已在GitHub开源,为AI应用
Harness 工程通过职责分层实现研发流水线可靠性提升。Claude 负责需求理解与代码生成等语义层工作;hooks 负责规范检查等确定性执行;Subagents 隔离血缘查询、自测等高 token 操作;Memory 承载跨会话状态持久化。四层协同使数仓 AI 开发从"对话式辅助"转变为"规则驱动的自动化流程"。
摘要:本实验基于学生考勤数据,使用K-Means聚类算法构建考勤行为画像。实验分为三部分:首先通过AI平台对迟到、早退等指标进行聚类分析,识别出自律模范型、轻微波动型和纪律高危型三类群体;其次利用BI工具对高危群体进行多维度可视化分析,包括性别、年级等特征;最后完成从数据标签构建到仪表盘展示的全流程。
当80%企业还在用AI回答“上季度营收多少”,领先者已用它解决“华东市场销量骤降的7大根因”。这背后是Denodo平台中的DeepQuery技术引发的代际差——本文将用真实战例揭秘:为何顶级企业愿为0.02秒的深度响应投入千万?
企业数据集成面临多源异构挑战,HENGSHISENSE BI平台通过三层架构提供解决方案:1)数据适配层统一接入20+数据源(关系型/NoSQL/时序/云服务等);2)ETL引擎支持增量同步、清洗转换和智能聚合;3)语义层构建业务数据集和逻辑模型,支持环形关联等复杂分析。平台持续迭代优化,从5.x到6.2版本逐步增强数据虚拟化、API配置化接入、跨应用数据复用等能力,显著降低数据集成门槛,提升分析
Litefuse 是一个 Agent 可观测与评估平台,通过 Evaluation Driven Development (EDD) “观测-评估-优化”闭环,让 Agent 的执行过程可追踪、问题可定位、效果可量化、优化可验证。Litefuse 兼容 Langfuse SDK 和 100 多个 AI 生态,并支持 Hermes、OpenClaw、Claude Code 等通用 Agent。
本文介绍了基于"数智教育"数据集的学生用户画像构建实验,重点包含考勤统计和消费分析两部分。在考勤统计中,通过ETL流程实现了迟到、早退等异常考勤的多维度统计;在消费分析中,构建了消费活跃度、贫困生识别和消费时段偏好三个模型。实验采用助睿ETL平台,通过可视化组件完成数据清洗、关联、聚合等操作,最终生成标准化的学生画像标签表。文章详细记录了数据处理流程、遇到的问题及解决方案,总结了平台操作经验和数据
摘要:本文介绍如何零成本搭建本地AI知识库,使用OpenCode+Obsidian组合方案。通过6个简单步骤:安装Node.js、OpenCode、Obsidian,配置BRAT插件和OpenCode-Obsidian插件,即可实现本地AI辅助笔记管理。该方案支持免费模型调用,具备改写文章、提取要点、笔记问答等功能,让囤积的笔记真正发挥作用。作者分享了自己600多篇笔记的管理经验,强调个人知识库应