登录社区云,与社区用户共同成长
邀请您加入社区
的本质是一个适配器模式——它将"Agent 多轮交互"(业务关注点)与"RL 训练数据生产"(基础设施关注点)完全解耦。这条解耦线画在了generate()函数上。线以上是 Agent 开发者的世界——OpenAI API、工具调用、业务逻辑。线以下是 RL 基础设施的世界——Session Server、TITO、token 对齐、loss mask、异常降级。Agent 开发者不需要知道线以下
从更宏观的视角来看,NWM的成功反映了当前AI研究的一个重要趋势:扩散模型正在从单纯的生成工具演变为通用的世界模型引擎。与GAIA-1(用于自动驾驶的世界模型)、Genie(用于游戏环境生成的世界模型)和UniSim(统一场景模拟)等工作相比,NWM的独特之处在于其专注于第一人称导航场景,并在规划实用性方面做出了深入探索。能量函数E的设计是导航规划的关键。该工作不仅展示了扩散模型在导航场景中的强大
Karpathy 个人博客。
这相当于过去 10 年 SaaS 行业最大的"内部工程文档泄露集合"。IMG_PLACEHOLDER:01-leaked-prompts | 图1:32 个 AI 编程工具的 system prompt 被逆向整理到一个仓库的概念图 | 类型:概念图。
摘要: 残差连接和层归一化是Transformer架构成功的关键“配方”,解决了深度网络的梯度消失、表示退化及训练不稳定等问题。残差连接通过“输入+变换输出”的结构保留原始信息,提供梯度传播捷径;层归一化则稳定每层输入的分布,加速收敛并适应变长序列。现代Transformer普遍采用Pre-LN(先归一化再残差)以提升深层训练的稳定性。二者协同作用,使Transformer可扩展至数百层,成为大语
本文系统梳理了大语言模型(LLM)的技术演进与Transformer架构的核心突破。文章首先指出LLM的崛起是计算系统的质变飞跃,随后分四个阶段解析语言模型发展历程:从早期统计模型到千亿参数规模的现代LLM。重点剖析了Transformer的核心创新——自注意力机制,其模块化设计(自注意力层、前馈网络和层归一化)实现了对长程语义的全局捕捉。文章还探讨了Transformer向多模态(如CLIP模型
Meta发布Segment Anything(SAM):图像分割领域的革命性突破 2023年4月,MetaAI团队推出的**Segment Anything Model(SAM)**彻底改变了图像分割领域,被誉为该领域的“GPT-3时刻”。SAM通过三大创新颠覆传统范式: 基础模型架构:统一交互式分割、语义分割等十多种任务,支持点、框、文本等多模态提示,实现零样本泛化。 超大规模数据:构建SA-1
本文系统介绍了Transformer模型的起源、定义、架构及工作原理。最后深入探讨了大语言模型的推理机制,包括注意力机制、两阶段生成过程及采样策略,并分析了实际部署中的性能优化挑战。
本文系统分析了大模型推理中注意力机制的技术演进路线,聚焦KVCache显存瓶颈问题。从标准多头注意力(MHA)到多查询注意力(MQA)、分组查询注意力(GQA)和最新的多头潜在注意力(MLA),四种方案在模型质量、显存占用和推理速度三个维度呈现不同权衡:MHA保持无损质量但资源效率最低;MQA实现极致压缩但质量损失明显;GQA在8分组时找到平衡点;MLA通过低秩联合压缩在长序列场景展现出压倒性优势
Cursor (MCP, Model Context Protocol) => chrome-devtools-mcp server (npx) => Chrome Devtools Protocol (CDP) => 浏览器chrome-devtools-mcp 是一个 MCP Server,通过 Chrome DevTools Protocol (CDP) 桥接 AI Agent 与 Chro
原题完整复现:从数学原理层面证明状态空间模型与Transformer模型的等价性或不足;基于理论给出状态空间模型与Transformer等价的补偿方法(记忆模块、激活方式、架构改造等),并证明补偿后模型计算复杂度低于原模型;通过实验验证新状态空间模型在典型大模型任务上精度不低于同规模Transformer,且总计算量降低50%以上。
Transformer是一种革命性的神经网络架构,它通过自注意力机制让所有词同时交互,解决了RNN的三大痛点。其核心在于:1)词嵌入和位置编码将文字转化为包含位置信息的数字向量;2)多头自注意力机制能并行捕捉多种语义关系;3)残差连接和层归一化确保深层网络稳定训练。现代大模型通过RoPE、GQA、FlashAttention等优化进一步提升性能,使Transformer成为处理从短文本到超长上下文
原创文章,不支持转载注意力机制本身没有任何语序信息,如果在输入时不人为加入位置信息,Attention 机制在处理序列时是置换不变的。这意味着,你把输入序列的词序任意打乱,模型计算出来的注意力权重和输出的向量结果完全是一模一样的。位置编码就是为了把顺序信息注入进去外推能力(Extrapolation Capability) 是指模型在处理比训练时更长的序列时,依然能够保持性能稳定、不崩溃且能正确理
ResNet 核心为残差结构 + 短路连接,解决了深层网络梯度消失与网络退化问题,让超深网络得以训练。版本选型建议:追求速度选 ResNet18,工业落地首选 ResNet34/ResNet50,高精度场景使用 ResNet101/152。工程落地核心思路:预训练迁移学习 + 数据增强 + 正则化,实际项目几乎不会从零开始训练。拓展应用:ResNet 是计算机视觉通用骨干网络,可嵌入 YOLO、S
CopilotKit 是一个专为 Agent 应用设计的前端框架,它整合了界面交互、状态管理、工具调用和审批流程,简化了 Agent 应用的开发。通过 AG-UI 协议,CopilotKit 实现了前端与 Agent 的无缝连接,支持流式事件处理和前端工具调用,使 Agent 应用更加安全、高效。
上篇我们学 Transformer 时,它的输入是「一个句子 = 一串单词」,每个词对应一个向量。这个套路对文本天然适用。但图像怎么办?图像是一个三维矩阵(宽 × 高 × 通道),没法直接喂给 Transformer。怎么把一张图片变成 Transformer 能消化的「一串向量」?把图切成小方块,每个方块当成一个“单词”。这就是 ViT 的核心思想。听起来简单,但 2020 年 Google 提
DeepSeek 的技术核心,是对 Transformer 架构的深度重构与优化:通过 MoE 实现大参数小激活,通过稀疏注意力实现长文本低成本,通过混合并行突破算力瓶颈,通过 RLHF 实现安全对齐。这些创新不仅让 DeepSeek 成为全球性能最强、效率最高的大模型之一,更为国产大模型的发展提供了宝贵经验。未来,DeepSeek 将继续深耕高效架构、多模态融合、推理优化、安全对齐等领域,不断突
之前的文章我们讲过 RAG、微调、长上下文怎么做技术选型,今天进一步讲个 RAG 面试里最容易被追问的一道工程题:文档分块(Chunking)。
流式3D重建新突破:蚂蚁集团提出几何上下文注意力机制实现长序列实时推理 蚂蚁集团灵波科技团队最新提出的LingBot-Map模型创新性地将传统SLAM的三层空间记忆机制转化为端到端可学习的几何上下文注意力(GCA),解决了流式3D重建中的长序列处理难题。该模型通过仅保留6个摘要token的极致压缩策略,实现73倍的token压缩率,支持万帧级长序列实时推理。关键技术包括:解耦旋转和平移的cam2w
输入文本│▼[词嵌入 + 位置编码] ← 把文字变成向量,并告诉模型词的顺序│▼│ Transformer Block │ ← 这个方块重复N次(比如GPT-3重复了96次)│ │ Multi-Head │ │ ← 从多个角度理解词与词的关系│ + 残差连接 │ ← 抄近道,防止信息丢失│ │ Feed-Forward │ │ ← 对每个词做进一步加工│ + 残差连接 ││▼输出(下一个词的概率分
很多人问:“AI现在是不是泡沫?会不会过两年就凉了?我的回答是:AI不是泡沫,而是像电力一样的基础设施。未来不会有专门的"AI行业",因为所有行业都会变成AI行业。就像20年前的互联网,10年前的移动互联网,刚开始的时候大家都觉得是泡沫,但最后改变了每一个行业。现在的AI就处在这个阶段:技术已经成熟,落地刚刚开始,人才缺口巨大,薪资还在上涨。这不是属于少数人的机会,而是属于每一个愿意学习新东西的普
本文解析了Transformer架构如何通过注意力机制解决传统RNN的长程遗忘和串行处理问题,使AI能像人类一样聚焦关键信息。Transformer的核心包括自注意力机制(全局关联分析)、位置编码(保留词序)、多头注意力(多角度理解)和层叠结构(逐步深化语义)。2017年提出后,Transformer统一了AI领域,支撑了GPT、BERT等主流模型。大模型的训练依赖数据(教材)、参数(规律)和两阶
CVPR 2026工作VDE:无需训练的Rectified Flow模型加速方法 华南理工大学团队提出的VDE方法通过速度场分解与估计,实现了Rectified Flow生成模型的推理加速。该方法将速度场分解为平行和正交于输入的分量,利用几何结构特性估计后续速度,减少模型前向计算次数。实验表明,VDE在FLUX、Qwen-Image等模型上可实现2-3倍加速,同时保持生成质量(SSIM提升19.5
本文对比分析了Hermes和OpenClaw两款AI Agent的核心架构与实现差异。虽然两者都基于ReAct循环,但技术栈选择(Python vs TypeScript)导致了执行模型的根本不同:Hermes采用同步线程模型,而OpenClaw基于异步事件流。文章通过代码仓库数据、架构层次和时序图揭示了二者在并发处理、LLM调用等方面的技术差异,并指出它们实质上是继承扩展关系——Hermes旨在
是一个预训练的语言表征模型。它强调了不再像以往一样采用传统的单向语言模型或者把两个单向语言模型进行浅层拼接的方法进行预训练,而是采用新的masked language model(MLM),以致能生成深度的双向语言表征。BERT论文发表时提及在11个NLP(Natural Language Processing,自然语言处理)任务中获得了新的state-of-the-art的结果推荐链接:其实说白
很久没读英文文本了,原作第二章读了有俩小时……总体来说还是非常简单的,主要就是为 llm training 做一些文本预处理的工作。ch02。
本文深入解析Transformer架构的核心原理,结合PyTorch源码API,详细阐述编码器、解码器的设计思路及实现细节。重点解析位置编码的原理及其在模型中的作用,并通过源码实例展示Transformer的构建过程。适合想要学习大模型基础知识的小白和程序员,助你快速入门并掌握Transformer的核心技术。当我们谈论大模型时,Transformer架构无疑是最重要的里程碑之一。它不仅是当前大模
本文提出SAM引导的多层级协同Transformer网络(SpTFuse)用于红外与可见光图像融合。创新性地利用SAM模型的零样本分割能力提供语义先验,通过三级渐进式交互结构(包含模态间融合块和模态内交互块)实现视觉与语义特征的深度平衡。设计语义补偿块解决解码过程中的信息丢失问题,并构建多维度损失函数优化网络性能。实验表明该方法在多个数据集上显著提升了融合图像在下游任务中的兼容性。核心创新在于SA
text-to-image (T2I)generation图像生成领域中表现最好的是商业闭源proprietary方案,如Nano Banana Pro 和Seedream 4.0,在开源方案中,如Qwen-Image, Hunyuan-Image-3.0 ,FLUX.2,参数也要20B~80B,而z-image只需要6B参数,显存VRAM也只需要16GB。效果可以达到照片级生成和双语渲染phot
在 Transformer 中,它是 Attention 机制的“灵魂”——没有 Softmax,注意力分数就只是无意义的数值,无法变成可解释的“权重”总结:Linear 是深度学习中的“万能齿轮”——它本身只做最简单的线性投影,但通过不同的组合方式,构成了注意力机制的记忆检索、前馈网络的知识存储、以及整个大模型的智能基座。总结:Softmax 是连接“原始数值”与“概率语义”的桥梁——它把 At
曾自诩"熟练使用AI工具",直到看到大厂招聘要求才意识到对AI原理一知半解。经历三个阶段成长:初期沉迷工具效率,遇到定制化需求时发现缺乏底层知识;中期系统补课神经网络、Transformer等基础,通过手算Attention机制理解核心原理;后期通过RAG系统、本地模型部署等实战项目检验能力。最终选择NVIDIA NCA认证作为阶段性验收,认为其聚焦AI技术本质且契合行业需求。文章建议开发者从复现
上篇我们聊了个人如何用 Markdown + Git 搭一套自主可控的"第二大脑";这篇把视角切到企业端,聊一个更系统的话题——企业知识管理这件事,在 AI 时代到底该怎么重新想。
文章摘要 本文回顾了Transformer的核心架构与设计要点,包括Encoder-Decoder结构、位置编码和多头注意力机制。Encoder包含多头注意力层和前馈网络层,而Decoder额外增加了掩码自注意力层。主流LLM如GPT采用Decoder-Only架构,适合文本生成;而Encoder-Decoder架构(如T5)更适用于seq2seq任务。位置编码部分介绍了绝对位置编码、相对位置编码
本文深入解析Transformer架构的发展与演变,重点比较了Encoder-Decoder、Encoder-only和Decoder-only三种主流架构变体。文章指出,2026年Decoder-only架构已成为主导范式(如GPT、LLaMA等),因其具备缩放效率高、生成即理解、统一任务接口和工程友好等优势。原始Transformer的Encoder-Decoder设计虽然开创性,但逐渐被更简
本文系统介绍了AI大模型的14个核心概念,从基础架构到前沿应用。主要内容包括: 基础架构:重点讲解Transformer的自注意力机制、Token分词方法、嵌入模型和混合专家模型(MoE)的工作原理。 训练方法:详细解析预训练过程的扩展定律、微调技术(全参数/适配器/低秩分解)以及模型对齐的关键技术RLHF(包括监督微调、奖励模型训练和强化学习优化)。 应用挑战:探讨大模型在智能涌现、幻觉问题和价
本文根据 Jay Alammar 的 The Illustrated Transformer 整理。图片来自原文正文,文字部分改写为中文教程,目标是让没有编程和机器学习背景的读者也能一步步理解 Transformer 的核心原理,并在关键地方补上必要的数学解释。先约定几个最基础的符号。一个句子可以看成一串词,比如 。模型不能直接处理文字,所以会把每个词变成一串数字,这串数字叫向量。很多个词的向量排
本文全面解析了传统Vision Transformer(ViT)模型,该模型由Google团队2020年提出,首次将纯Transformer架构应用于计算机视觉任务,打破了CNN在视觉领域十余年的统治地位。文章从背景、原理到实现详细介绍了ViT的创新设计:通过图像分块(Patch Embedding)、添加分类令牌(Class Token)和可学习位置编码,将二维图像适配Transformer的序
【因果推断与多目标优化交叉研究新方向】该领域通过融合因果结构解决传统多目标优化忽略变量因果关系的痛点,具有显著学术价值与工业应用潜力。核心优势: 突破性:IEEETKDE论文UpCM首次将因果结构学习转化为多目标优化问题,采用MOEA/D框架平衡数据与先验知识,提出PDAG最小非一致扩展策略处理先验冲突 创新应用:CAPO框架利用因果推断解耦预测不确定性,通过多目标优化实现扩散模型的自适应偏好对齐
Mamba架构挑战Transformer的十年统治地位,通过状态空间模型(SSM)实现序列建模革命。Transformer的自注意力机制存在二次方计算复杂度问题,而Mamba采用选择性状态空间(S6)技术,动态压缩历史信息至固定维度状态向量,显著降低推理内存占用。2021年S4模型奠定基础,2023年Mamba引入输入相关参数实现动态语境处理,2026年Mamba-3开源,专为推理优化。研究表明M
【摘要】近期AI研究正从"更大模型"转向"更聪明的外部技能机制",Skill进化成为提升Agent能力的新方向。三个代表性研究展示了技能全生命周期的创新:1)SkillEvolver通过元技能自动生成可复用技能,在83个任务上反超人工技能13.3%;2)EmbodiSkill区分执行失败与技能缺陷,通过四层反思机制提升具身任务成功率至93.28%;3)达尔文
*Qt 界面 + LibTorch 推理 + Transformer 结构 OCR**(CRNN + Transformer 优化版,比传统 OCR 准确率高 30%+),专门针对**文档、票据、表单、书本**等**印刷体**做极致优化,支持批量识别、结果导出、区域框选、多行文本有序输出。// OCR 标准尺寸。1. **模型**:**Transformer-OCR**(Encoder-Decod
大模型应用开发RAGAgentAI CodingLLM 工程化大模型微调算法 / NLP / 推荐等相关岗位(这里主要是介绍自己的项目,这里就不给出标准答案了)项目背景:为什么要做这个项目技术方案:用了 RAG、Agent、微调还是纯 prompt技术链路:数据怎么进来,模型怎么处理,结果怎么出去核心难点:不要说“工作量大”,要说技术难点指标结果:准确率、召回率、延迟、成本、人工节省等个人贡献:明
本文介绍了一个结合TCN-Transformer-BiGRU深度学习模型与SHAP可解释性分析和NSGAII多目标优化的工艺参数优化框架。该模型支持多输入多输出回归预测,通过SHAP方法量化特征贡献度,提升模型可解释性;并利用NSGAII算法进行多目标优化,寻找最优工艺参数解集。代码提供完整MATLAB实现,包含数据预处理、模型训练、结果可视化和优化模块,支持直接替换Excel数据集使用。系统可输