登录社区云,与社区用户共同成长
邀请您加入社区
Word2Vec 是Google 2013年推出的一个NLP工具,它的特点是将所有的词向量化,这样词与词之间就可以定量地度量它们之间的关系,挖掘词之间的联系。论文链接: https://pan.baidu.com/s/1JegdOm2V20v9leTroxnZzQ 提取码: dykp数据读取处理文本主题提取:基于TF-IDF博文中 详细介绍了对Ag-news数据集的读取、清洗等操作步骤
专门存储(词向量 / 文本 / 图像 / 音频向量)、内置检索引擎相似检索,是 RAG、大模型外挂知识库、跨模态搜索底层底座。关联前文:你训练的 Word2Vec/BGE 静态词向量、BERT 向量,最终入库就是存在向量数据库。768/1024 维高维向量亿级数据暴力全量余弦计算耗时分钟级,完全不可用;向量 DB 用专用索引规避。
plaintext[0.52, 0.13, -0.61](苹果)三个数 = 3维语义空间的(x,y,z)坐标正数:在该语义维度偏向正向特征负数:在该语义维度偏向反向特征绝对值大小:该词语在这个语义特征上强弱程度。
原始非数值信息(文字 / 图片 / 声波 / 电信号)特征工程 / 模型提取特征标准化 n 维数值向量(稀疏 / 稠密)模型输入:矩阵运算、梯度下降、相似度计算、分类预测。
OneHot:单词→稀疏 n 维特征,仅区分词语,无词义;BoW:文本→稀疏 n 维特征,仅统计词频,无整句语义;Word2Vec:单词→稠密 n 维特征,特征携带词语语义;BGE:文本→稠密 n 维特征,特征携带全文整体语义。迭代本质:从只能标记 “有无” 的无效特征,逐步进化为能表达内在含义的语义特征。n 维向量 = 用 n 个数字化特征去具象化现实信息,是现实世界和人工智能数学计算的中间桥梁
大模型内部的 Embedding 层本质也是词向量,和 Word2Vec 逻辑同源;而 BGE 这类句向量常作为。,先向量匹配召回相关文档,再送入大模型做生成,是大模型落地必不可少的前置特征。
自然语言处理是人工智能的重要分支,核心目标是让计算机能够理解、解释和生成人类日常使用的自然语言(如中文、英文),最终实现人与机器之间的自然语言交流。如果用一句话概括其意义:NLP就是教机器“读懂人话”。如果一个人连“读懂人话”都做不到,何谈更复杂的任务呢?在NLP中,模型的输入不是“你好世界”这样的字符串,而是一串离散的“token”。分词就是将连续的自然语言文本切分为最小语义单元——token。
基于高频方波电压注入零低速IPMSM无感控制算法simulink仿真模型①在估计的d轴注入高频方波电压来估计转子位置,具有较高的稳态精度和动态性能。该仿真调试效果不错,曾应用到实际电机中去。②阐述了 IPMSM 的 MTPA 控制原理,并在此基础上研究了 IPMSM 基于 高频方波电压信号注入法的无位置传感器控制算法。仿真结果表明基于高频方波 电压信号注入的无位置传感器控制方法具有不错的动静态性能
在AI绘画的世界里,Midjourney就像一把强大的魔法杖,但很多人用起来感觉像是在“抽卡”——输入几个简单的词,然后祈祷出图效果。我刚上手时也这样,生成的图时好时坏,完全看运气。精准出图的关键,在于构建一个结构化的“咒语库”。今天,我就把自己踩坑总结出的这套进阶咒语秘籍分享给你,让你从“抽卡玩家”变成“精准导演”。构建个人Midjourney进阶咒语库,本质上是将模糊的审美感觉,翻译成AI能精
优点说明维度可控自定义 N 维(如300),远小于词库 V语义学习从语料自动学习词语相似性与类比关系效率高使用查表(Embedding)代替矩阵乘法上下文感知同时利用前后 C 个词的信息预测中间词迁移能力强训练好的词向量可迁移到各种 NLP 任务CBOW 模型:输入:上下文 C 个词的 One-Hot → 嵌入层(查表)处理:C 个向量求平均 → 隐藏层(ReLU)→ 输出层(Softmax)输出
定义:把一个词映射到一个d 维的实数向量(d 远小于词汇表大小),这个向量是通过训练自动学习出来的。苹果 →香蕉 →(相近)汽车 →(较远)
本文记录了作者与AI导师一天的学习对话,系统梳理了语言模型的发展历程。从基础的N-gram模型及其缺陷讲起,到神经网络语言模型中的词嵌入和RNN/LSTM,最终深入解析Transformer架构的核心机制。重点阐述了自注意力原理、QKV向量、多头注意力等概念,并对比了Encoder-Decoder与Decoder-Only架构的区别。文章以对话形式呈现,循序渐进地展示了语言模型从统计方法到深度学习
CBOW(连续词袋模型):CBOW(Continuous Bag of Words,连续词袋模型)与Skip-Gram相反,CBOW模型通过给定的上下文单词来预测中心词。具体来说,对于文本中的每一个中心词,CBOW模型会将其周围一定窗口大小内的其他单词(即上下文单词)作为输入,并尝试预测该中心词。CBOW模型类似于一个高级的完型填空游戏,其中上下文中的词汇(已知选项)被用来“填空”预测出缺失的中心
two novel model architectures for computing continuous vector representations of words from very large data sets计算词的连续向量表示的两种新模型架构large improvements in accuracy at much lower computational cost算力需求降低,
电-气-热综合能源系统优化调度代码,旨在构建一个多能源网络协同优化的调度模型,实现电网、气网与热网的耦合调度,达成系统整体运行的经济性与稳定性目标。该系统以MATLAB为开发环境,整合MATPOWER工具包进行电力系统计算,采用CPLEX/Gurobi求解器处理混合整数线性规划(MILP)问题,适用于综合能源系统规划、运行调度等场景,可为能源系统运营商提供科学的调度决策支持。MATLAB代码:电-
本文探讨了Word2Vec模型在时尚行业模特特质描述中的应用。通过构建包含60条男模描述的小型语料库,训练了Skip-gram架构的词向量模型。实验结果显示,模型能有效捕捉"温柔"与"温和"的语义相似性(相似度0.82),并区分"温柔"与"高冷"(相似度0.16)的对立关系。该技术可用于模特智能检索、营销文案生成等场景
cst仿真设计 反射透射性线圆转换,线线转换 案例与录屏打开CST刚打开模板栏是不是总盯着默认的几个空模板发呆?今天咱们整点新手入门但能快速装逼朋友圈或者中期报告材料的活——反射+透射都能玩的偏振转换超表面(Metasurface),连扫频率扫入射角度的动图我连怎么调录屏参数都揉进去说。先不说太玄的理论基底,直接抓仿真流程+最常用的开源极化分解代码片段来玩。先定个今天的模拟目标吧:太赫兹0.1TH
在深度学习与自然语言处理(NLP)中,是一切任务的起点。传统方法依赖 One‑Hot 编码,极易造成维度灾难与语义缺失;而凭借低维、稠密、可表达语义的优势,成为现代 NLP 的标配基础技术。Google 在 2013 年提出的,是训练词向量最经典、最高效的算法,包含与两种核心模型。本篇博客将严格按照课堂 PPT 知识点,从讲起,深入 CBOW 模型结构与训练流程,最后使用,实现词向量训练、预测、提
本文详细拆解了工业级CBOW词向量模型的完整实现流程。基于PyTorch框架,从文本预处理、词汇表构建到模型训练与推理,严格遵循深度学习规范。文章重点介绍了CBOW模型的核心逻辑、代码实现细节(包括词嵌入层、词向量求和等关键操作)以及训练收敛验证。同时提供了词向量提取保存方法和常见问题解决方案,确保代码开箱即用。通过上下文预测中心词的任务验证,模型成功学习到有效的语义信息。所有实现均规避了新手常见
技术适用场景优缺点关键点面试/工作出现频率One-Hot玩具级演示维度灾难、无语义★★BoW简单分类、Baseline快、丢失词序★★★TF-IDF关键词提取、搜索、传统ML区分度高、仍丢失语义★★★★★(高频)N-gram语言模型、小数据场景捕捉词序,但稀疏★★★★序号化+Embedding所有现代NLP/LLM项目端到端、可迁移★★★★★(核心)生产中常用组合Baseline语义增强:Word
摘要: Word2Vec是2013年提出的里程碑式NLP模型,通过上下文学习词义并生成静态词向量(每个词对应固定向量)。其核心基于分布式假设,认为词义由周围词决定,提供CBOW(用上下文预测中心词)和Skip-gram(用中心词预测上下文)两种训练模式。模型展现词向量线性关系(如“King - Man + Woman ≈ Queen”),但无法处理多义词(静态向量缺陷)。尽管被BERT等动态模型超
摘要: 图神经网络(GNN)在2015-2025年间从学术概念发展为结构化智能的通用底座,经历四次范式跃迁:启蒙期(2015-2017)奠定理论基础,工程突破期(2018-2020)实现工业落地,爆发期(2021-2023)与大模型融合提升推理能力,普惠期(2024-2025)推动全行业低门槛应用。GNN核心技术国产化率从不足5%提升至75%,覆盖金融、医疗、工业等场景,未来将聚焦AGI融合、因果
当然不是,你得根据实际设备协议改数据解析部分。比如设备返回的数据可能是十六进制,那就要用来转。分层架构:解耦UI和业务逻辑,换硬件不用改Form异常处理try-catch和状态检查,程序不容易崩界面美化:用第三方库+合理布局,至少不像“计算器界面”了如果有同学想扩展,比如加个数据存到Excel的功能,直接写个类,继承接口,在MainForm里调用就行,扩展性拉满~上位机C#机框架源码,详细清晰可见
本文全面讲解向量表征(Embedding)核心知识,从基础定义、本质逻辑、技术演进,到文本向量生成、相似度计算方法层层拆解,覆盖 NLP、RAG、推荐系统等主流应用场景;搭配 Ollama 实战可视化代码,直观呈现文本向量空间分布规律,帮读者快速掌握 AI 语义检索底层技术,打通理论到实操的全流程认知。
摘要: 向量嵌入(Vector Embedding)是AI领域的基础技术,通过将文本、图像等内容转化为机器可计算的数字坐标,实现语义理解与知识检索。文章解析了向量嵌入的技术演进(从Word2Vec到多模态统一空间)、主流模型对比及RAG应用链路,并指出其产业化趋势:向量数据库市场预计2032年达110亿美元。核心价值在于从“字面匹配”升级为“意义匹配”,赋能电商搜索、推荐系统、企业知识库等场景。作
无刷直流电机(BLDC)的转速控制总让人感觉像在驯服一匹带电的野马——既要保证动态响应,又要避免失步炸MOS管。今天咱们抛开教科书式的理论堆砌,直接上手玩点有意思的:用人工神经网络(ANN)搞转速控制,顺便和传统PI控制掰掰手腕。实测效果惊艳:突加负载时转速跌落从200rpm降到80rpm,恢复时间缩短到120ms,而且没有PI那种反复振荡的毛病。实测发现空载到满载切换时,传统PI需要200ms才
基于V2G技术的电动汽车实时调度策略摘要:代码主要做的是基于V2G技术的电动汽车实时调度策略,请注意是实时调度策略而非日前调度策略,首先以降低充电成本和网损成本为目标,建立电动汽车调度模型。然后通过构建网损灵敏度指标分析电网节点性能,基于电网负荷制定分时电价,通过潮流计算和凸优化算法实时求解得到电动汽车充放电策略。最后以 IEEE 33 节点配电网为例验证了所提策略可以有效降低充电成本与网损成本。
定义拉索实常数的时候,要依据前面了解到的拉索规格来设置。通过特定的命令流来完成这个操作。假设这里定义的是拉索的实常数,0.01可能是某种与拉索相关的参数值,1500是另一个关键参数,具体含义根据实际模型确定分析:这段代码使用“R”命令来定义拉索的实常数,后面跟着具体的参数值。这些参数是根据拉索的实际特性和建模需求来设定的,确保拉索在模型中的力学行为符合实际情况。
摘要:Serde是Rust生态中实现零成本抽象的典范,通过编译期代码生成和trait系统设计,在保持高性能的同时提供类型安全的序列化功能。其核心采用Serialize/Serializer和Deserialize/Deserializer双trait设计,使数据结构与格式完全解耦。实践表明,Serde生成的代码性能与手写代码相当,甚至通过SIMD优化更优。文章深入解析了Serde的编译期魔法、内存