登录社区云,与社区用户共同成长
邀请您加入社区
本文提出了一种基于随机几何的下行卫星网络覆盖概率分析方法。作者将卫星和用户分别建模为同心球面上的泊松点过程,通过球面几何推导典型用户可见卫星区域(球冠)内的距离分布和干扰特性。在考虑Nakagami-m衰落信道条件下,建立了覆盖概率的解析表达式,并分析了卫星密度、高度等参数对网络性能的影响。研究结果表明,增加卫星密度并不总是提高覆盖概率,存在最优密度平衡信号增强与干扰增加。该方法避免了传统星座仿真
Ant Group(蚂蚁集团):2026 年 5 月(arXiv:2605.27286):首个针对的基础模型,通过与,解决异变量语义对齐与复杂交互建模难题,支持零样本结构迁移。
《CellFlow:基于流匹配的生成式单细胞表型建模》摘要 这篇预印本论文提出CellFlow模型,利用最优传输与流匹配技术预测单细胞RNA测序数据中的复杂扰动响应。模型通过多头注意力机制融合基因表达、药物指纹和蛋白质嵌入等多模态数据,创新性地采用Sinkhorn算法构建训练样本对,并在斑马鱼胚胎、癌细胞系、神经元分化等6类生物学场景中验证了性能。实验显示CellFlow在基因敲除(能量距离降低5
摘要: 加州大学伯克利分校等机构提出的LIVR(Latent Implicit Visual Reasoning)框架,通过隐式视觉推理提升多模态大模型的视觉任务性能。该框架创新性地结合可学习潜在Token与视觉瓶颈注意力机制,无需显式监督即可自主提取关键视觉特征。潜在Token作为独立视觉表征空间,通过注意力掩码约束强制模型通过其传递视觉信息,弱化文本偏置。实验表明,LIVR在计数、拼图、空间定
本周研读论文《DOCPRUNE: Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning》。该论文针对文档问答任务 Token 冗余、算力开销大的问题,提出无训练渐进式 Token 剪枝框架 DOCPRUNE。框架包含 BTP、QTP、CTP 三大模块
该论文提出了一种特征引导的掩码自编码器(FG-MAE),通过用方向梯度直方图(HOG)与归一化差异指数(NDI)等遥感领域的光谱和空间特征替代原始像素作为重建目标,解决了传统MAE在遥感图像中过度关注像素细节、对噪声敏感且语义理解能力不足的问题,在多光谱与SAR图像的下游任务上实现了性能提升,尤其在EuroSAT-SAR数据集上较MAE提升高达5%,同时验证了该方法的良好可扩展性,并发布了首套面向
DINOv2 论文笔记 摘要:Meta AI 提出的 DINOv2 是一种纯视觉自监督学习模型,通过大规模高质量数据训练(LVD-142M),实现了媲美弱监督方法(如 CLIP)的通用视觉特征。基于 ViT 架构,采用教师-学生框架和 DINO/iBOT 损失函数,支持图像级和像素级任务双重能力。关键创新包括自动数据清洗流程、SwiGLU 激活函数、高分辨率微调等。实验表明,其冻结特征在下游任务中
DP-VLPA:长尾多标签识别的双阶段视觉语言预训练和适应这篇论文主要做的是。也就是一张图里可能同时存在多个类别,但不同类别的数据量差异很大:常见类样本很多,尾部类样本很少,模型往往容易识别“person、car”这类头部类别,却忽略“handbag、stop sign”等尾部类别。期刊:The Fortieth AAAI Conference on Artificial Intelligence
本文开发了ASCAL工具,整合SeekSpace和Stereo-seq两种单细胞空间转录组技术,构建小鼠全眼高精度细胞图谱。通过SeekSpace实现单细胞分辨率定位,结合Stereo-seq的高组织覆盖率优势,精确绘制了视网膜各层及非视网膜区域的细胞类型分布。该方法克服了传统空间转录组技术的细胞边界识别、多细胞转录本错误捕获等局限性。研究进一步应用于视网膜动脉阻塞(RAO)模型,揭示了神经节细胞
本文提出了一种自动化修复歧义性自然语言需求的方法SPECFIX,旨在提升大语言模型(LLM)代码生成的准确性。研究指出,自然语言描述的歧义会导致LLM生成偏离意图的代码,而现有方法依赖人工澄清,效率较低。SPECFIX通过分析描述诱导的程序分布,结合输入输出样例,自动修复歧义描述。具体贡献包括:1)首个针对LLM代码生成的自然语言描述修复方法;2)提出样例一致性(EC)指标,衡量生成程序与样例的匹
摘要: 本文提出 AutoCO 框架,利用大型语言模型(LLM)解决约束优化问题(COPs)。传统方法在处理硬约束时易陷入局部最优或无法找到可行解,而 AutoCO 通过 约束松弛策略 动态调整可行域,结合 三元表示(松弛策略、算法思想、代码)和 双向协同演化(EA局部优化 + MCTS全局搜索),实现更高效的求解。实验表明,AutoCO 在三个基准测试中平均降低 24.7% 的最优性差距,显著优
每天通勤 25 分钟,怎么把书读进去?我试了书尖AI 三周,把方法分享给你。## 一、痛点上班族最缺的就是整块时间。书尖AI 把一本书浓缩成 30 分钟精华讲解。## 二、实测三周从每月 0.5 本提到 8 本。(此处为适配器调试用测试正文)## 三、总结碎片时间也能高效读书,关键是工具选对。
这篇论文提出了一种多物理场耦合模型,用于预测NMC811圆柱电池模组的热失控传播。该模型结合了P2D电化学模型、Arrhenius热失控动力学模型和集总热模型,在GT-SUITE平台上实现了紧密耦合。研究通过4组不同边界条件的实验验证了模型精度,结果显示预测触发时间误差在±6秒以内,峰值温度误差在±8℃以内。参数敏感性分析表明,电芯间距和初始温度对热传播有显著影响:间距从1mm增至4mm可使相邻电
本文摘要(136字): GCAgent是一种针对长视频理解的创新智能体框架,通过结合图式与叙事情节记忆解决MLLMs在长期依赖建模上的局限性。该框架包含记忆管理智能体和推理智能体:前者构建结构化全局上下文(事件抽象、因果/时间关系),后者基于记忆和检索片段进行多模态推理。实验表明,在Video-MME Long基准上,GCAgent相比基线模型最高提升23.5%准确率,7B规模下达到73.4%的S
这篇文章为计算机科研新手提供了系统性的论文查找与方向指引,主要解决三个核心问题:如何按方向查找顶会论文、常用论文入口资源以及近年热门研究方向推荐。文章首先列举了OpenReview、PMLR、ACL Anthology等10个高频使用的论文检索平台,覆盖AI、CV、NLP、系统、安全等方向。随后按研究方向分类整理了主流顶会信息,包括: AI/ML领域:NeurIPS、ICML、ICLR等机器学习核
摘要: 本文提出了一种名为 Unveiler 的模块化框架,用于解决密集杂乱环境中的机器人顺序操作任务,重点针对目标物体被遮挡的场景。该方法将高层 空间关系推理 与低层 动作执行 解耦,通过轻量级 Transformer 编码器(SRE)识别最优障碍物移除顺序,再由旋转不变动作解码器执行具体操作。实验表明,该框架在仿真环境中部分遮挡场景下成功率高达 97.6%,且参数量(83M)和推理延迟显著低于
本文介绍了ICCV 2025长视频理解工作LVAgent,旨在解决多模态大语言模型(MLLM)在长视频理解中的局限性。传统方法依赖单个MLLM处理长视频时存在计算冗余和部分理解的问题,而LVAgent通过多智能体动态协作实现了更全面高效的长视频分析。该框架包含四个核心步骤:智能体预选(Selection)组建最优团队,三阶段感知(Perception)检索关键片段,智能体协作行动(Action)生
SVDQuant:一篇读懂 4-bit 扩散模型量化的真正难点
给 AI 做论文问答、文献综述或科研 Agent,第一步不是选大模型,而是选数据源。本文按“是否免费可访问、是否有 API、是否适合 RAG/Agent、是否能追溯证据”四个维度,盘点 arXiv、PubMed、OpenAlex、Semantic Scholar、Crossref、DOAJ 和 Sciverse,并给出一个可复用的数据源组合方案。
接着,盗贼把剩下的方法输入保险箱,军师根据保险箱的反应强弱打分,只留下表现最好的几种思路带入下一轮测试(第二阶段剪枝),直到保险箱被彻底打开。该论文通过高效的自动化红队测试,用更低的成本揭示了闭源黑盒大模型在对抗性攻击面前的脆弱性,对未来提升大模型的安全对齐机制具有极其重要的学术与现实意义。该论文深入探讨了大模型的对齐安全限制,针对黑盒大模型提出了一种全新的全自动、可解释的越狱攻击方法。第二,相较
它关注的问题不是“视频是否看起来真实”,而是“视频中的碰撞过程是否符合物理规律”。随着视频生成模型和 world model 的发展,自动驾驶领域开始希望利用生成模型来模拟真实交通场景,尤其是一些现实中很少见但非常重要的安全关键场景,例如车辆碰撞、突然变道、交叉路口冲突等。CrashTwin 通过“视频 → 3D 碰撞轨迹重建 → 物理一致性评估”的方式,评估 world model 是否真的能生
一个比较可惜的点是,论文没有系统展示不同 perceptual challenges 下的模型性能,例如 occlusion、camera motion、homogeneity、symbolic decoding 等场景下模型分别下降多少。现有多模态大模型已经可以处理视频输入,并在很多视频理解任务上表现不错,例如视频问答、动作识别、长视频理解等。然而,人类理解视频时,并不是只看离散帧,而是会持续追
02引言首先指出,fMRI可通过BOLD信号刻画脑区之间的功能连接,是寻找AD、PD、ASD等脑疾病影像标志物的重要工具。现有脑网络学习方法多将ROI视为节点、功能连接视为边,GNN和Transformer等模型主要学习两两连接或全局两两依赖;超图模型虽然试图表达群组关系,但常依赖k近邻或k跳邻域构造,未必等价于真实的同时群体共波动,解释性也较弱。持久同调方法能提取拓扑结构,但多数工作集中在连通分
本文发布了一个名为 EmbodiedScan 的超大规模室内3D场景数据集,并基于此提出了一个名为 Embodied Perceptron 的基准模型,旨在解决具身智能体在第一人称视角下对3D环境进行全方位感知和理解的问题。
这篇论文就是后面经典的Vision Transformer,核心思想很直接:将一张图片切成一系列固定大小的patch,把一个 patch 当作NLP任务中的一个token,然后送入标准 Transformer Encoder 做图像分类。它证明了在足够大规模数据预训练的条件下,纯架构可以在图像识别任多上达到基至超过CNN。打破了 cv 和 nlp 在模型上的壁垒。paper code网站上 Ima
通过把评测标准从“光看视频像不像”升级到“多模态感知+真动手干活+现实世界测试”,逼出真正能用的具身世界模型。
📚 电子与电气工程(eess.*) 本周精选聚焦机器人柔性生长技术(藤蔓机器人摩擦优化设计)、多语言语音识别泛化能力(语码混合ASR迁移)、通用音频编码器(USAD 2.0十亿参数模型)及复杂环境定位(GNSS/INS内河航道基准测试)。亮点包括开源机器人设计框架、病理语音的个性化适配(FiLM调制)及跨模态音频表征蒸馏,推动感知与控制领域创新。 🔬 生物信息学(q-bio.*) 研究涵盖AI
摘要: CVPR 2025的LSNet提出了一种新颖的轻量视觉模型设计范式,其核心LS Convolution通过将空间建模拆分为“See Large”(广域感知)和“Focus Small”(局部聚合)两个分工明确的阶段,解决了轻量网络中空间范围与局部精度的矛盾。与传统混合职责的模块不同,LS Convolution先以大尺度捕捉上下文结构,再以小尺度精细化聚合,形成更高效的空间混合闭环。该设计
Bernini:一篇读懂视频扩散里的“潜在语义规划”
这篇论文无疑是数据诊断与可解释性领域的一座里程碑。它用高级的最优化技巧(Dinkelbach 方法),优雅地降维打击了一个看似无解的组合优化难题。谁应该继续读原论文?如果你的工作涉及到设计新的机器学习可解释性工具、数据资产定价,或者正在写计量经济学实证论文、苦于无法证明数据结论的 Robustness,强烈建议精读此文并直接去 GitHub 克隆作者开源的 R/Python 代码进行实战应用。谁看
从源头规避虚假文献引用风险,AiScholar 参考文献真实性检测正式上线!
VChain 是一篇比较有启发性的工作。它关注的是视频生成中一个很重要的问题:模型能不能生成符合因果、物理和常识的视频状态演化过程?未来的视频生成模型不应该只追求画质和流畅度,还应该具备对视觉状态变化、物理规律和因果关系的理解能力。
斯坦福和字节跳动团队共同提出了一种免训练的扩散模型加速方法Spectrum,通过将去噪网络的特征通道视为随时间演变的曲线,利用切比雪夫多项式进行全局拟合,预测未来多步特征以减少网络前向计算。该方法在FLUX.1和Wan2.1-14B模型上分别实现4.79×和4.67×加速,仅需14次网络评估即可达到3.5倍提速且画质无损,显著优于现有缓存类方法。算法通过在线岭回归动态更新拟合系数,结合最后一层缓存
当前方法中,要么是针对每个视图提取特征,要么是对所有视图用统一的特征。本文提出一种专家混合框架。引入了一个门控网络,该网络可以动态地为每个数据样本选择多个专家来进行处理,从而从不同视图中捕获多样且互补的信息。为了保持专家的多样性,还加入了一个均衡损失,防止依赖一个专家。——如何让视图之间协作,又保留视图自己的特定信息,本文采用多个专家网络来实现。专家混合模型作为深度多视角聚类的表征学习。——失策了
本周针对多模态大模型中视觉 Token 剪枝在复杂视觉推理任务上失效的问题展开研究。研究发现 ** 相关视觉信息偏移 (RVIS)** 是该问题的核心成因,并提出无需训练、可即插即用的 DSTP 框架。该框架通过偏移检测与上下文感知 Token 交换两大模块,在解码阶段动态调整视觉 Token,有效适配推理过程中变化的视觉信息需求。大量实验证明,DSTP 能显著修复剪枝带来的性能损失,在各类任务与
本文提出了一种高效的单幅图像去雾方法gUNet,通过系统性的消融实验揭示了影响去雾性能的关键因素。gUNet采用7级U-Net架构,核心创新包括:(1)门控卷积块(gConvBlock)替代传统激活函数,实现空间自适应的特征处理;(2)动态特征融合(SKFusion)机制优化skip-connection;(3)深度可分离卷积等轻量化设计。实验表明,在RESIDE等基准数据集上,gUNet以仅10
该论文不再使用固定的被攻击模型,而是让环境动起来。具体而言,该论文会定期使用已收集到的攻击提示词对被攻击的 LLM 进行安全微调,这就降低了原本易受攻击区域的奖励,逼迫攻击 LLM 走出舒适区,去寻找未被发现的新漏洞。以往的自动化红蓝对抗方法在发现某些高奖励的攻击模式后,往往会陷入单一模式的泥潭,难以发现更深层次、更多样化的模型漏洞。该论文通过自适应动态防御的视角,成功构建起一种由易到难的漏洞探索
这篇文章记录的是一次比较完整的近两年论文复现实践。目标论文是 `Analysis of Frequency Domain Features for the Classification of Evoked Emotions Using EEG Signals`,数据集使用 `EEG Emotion Recognition Dataset_GU`。论文主线不是端到端深度学习,而是 `EEG 预处理
可以再分别去看看相关的研究。设定一个池化因子p,往上每一层的窗口大小就是下面一层窗口大小*P,窗口不会重叠,窗口框住下面一层的元素,做平均池化,算平均值,作为这一层的窗口的Q、K、V(重新进行了计算,所以每个窗口框住的不管是原始序列的几个元素,算出来都是一个节点,一个QKV)。知道了原来多头注意力不是随便对矩阵做分块的,是直接训练多个W映射,将输入映射到多个低纬度的QKV,所以虽然是低纬度的QKV
本文提出RoboSimGS框架,通过3D高斯泼溅(3DGS)与网格模型结合的混合表示方法,将真实世界多视角图像转化为高保真、可物理交互的仿真环境。该框架利用多模态大语言模型(MLLM)自动推断物体物理属性(如密度、刚度)和运动学结构(如铰链、滑轨),构建动态可交互的数字资产。实验表明,仅使用RoboSimGS生成数据训练的机器人策略,能在多种真实操作任务中实现零样本迁移,并显著提升现有方法的性能与
本文提出了OpenRCA,一个用于评估大语言模型(LLM)在软件系统故障根因分析(RCA)任务中性能的公开基准测试。OpenRCA包含来自电信、银行和在线市场三个真实系统的335个故障案例,总计超过68GB的异构遥测数据(包括指标、日志和调用链)。研究指出真实RCA任务面临四大挑战:数据量巨大、数据类型异构、故障传播现象以及任务目标不统一。论文将RCA任务定义为基于用户查询定位根因要素(时间、组件
现有 RL 框架(verl、OpenRLHF 等)本质上还是面向具体的策略模型做优化,工作流编排被当作环境搭建的一部分,使得每个多智能体系统都需要手工编排,训练难度较大,不同系统也难以做公平比较。UnityMAS-O 实现了一套真正面向多智能体工作流的训练流程,支持自定义的角色设置、模型拓扑结构,在多种任务和实验设置下都拿到了显著提升
这篇文章记录的是一次 `Fashion-MNIST + ViT` 的无源码论文复现实践。目标论文是 `Enhancing Fashion Classification with Vision Transformer (ViT) and Developing Recommendation Fashion Systems Using DINOv2`,但当前只聚焦其中的分类分支。和上一条 `MCNN15
3. 仿真的参数以及性能评价的标准,并学习文章作者的对数据的分析部分。1. 本文所提的算法解决了什么问题?算法的网络模型及主要idea?4. 通过仔细的阅读说明该算法的优缺点,最好拟提出如何解决缺点?5. 对该问题的展望是什么,包括可以开展的工作等。2. 算法所采用关键技术(用自己的话来解释)?
GSWorld: 闭环照片级真实感机器人操作仿真套件 摘要: GSWorld 是一个结合 3D 高斯泼溅(3DGS) 和 物理引擎 的仿真器,旨在为机器人操作任务提供 闭环、照片级真实感 的仿真环境。其核心创新在于提出 GSDF(Gaussian Scene Description File),一种新的资产格式,将高斯渲染与物理仿真无缝集成,支持 sim2real 训练和 零样本迁移。 关键贡献: