登录社区云,与社区用户共同成长
邀请您加入社区
术语简明定义Copilot人机协同模式的AI辅助工具,核心能力是上下文补全、生成建议,人类全程掌握控制权,人在回路中AI Agent具备自主感知、决策、执行能力的AI系统,核心是可以不依赖人类指令自主完成目标任务半自主Agent介于Copilot和Autopilot之间的过渡形态,核心是可以自主完成大部分流程,仅在关键节点需要人类确认Autopilot完全自主级AI Agent,核心是人类只需要给
模型文件是最值钱的资产,也是保护最薄弱的环节——先锁模型,再锁代码单一手段防不住——模型加密+代码混淆+License授权,三层缺一不可HSM是信任根——没有硬件级密钥保护,软件层面的防护都是纸老虎以安当的ASP(应用安全加固)+ SLA(软件License授权)+ HSM产品组合为例,ASP负责代码混淆和反逆向,SLA负责设备绑定和授权管控,HSM负责密钥安全存储——三者联动,才能构成完整的算法
一家小型AI公司用9个月时间构建了"判断力引擎"的全栈技术体系:1. 提出"生成论"哲学基础,认为世界本质是事件而非实体;2. 发现"降U动力学"智能法则,将不确定到确定的过程数学化;3. 开发事件关系网络(语法)和六十四卦态势空间(字典)作为判断框架;4. 实现可运行的判断力引擎软件(已开源部分代码);5. 设计认知芯片物理架构(已申请专利)。该技术从哲学理论到硬件实现形成完整闭环,旨在赋予AI
自动驾驶场景下的AI Agent是具备的闭环智能实体,区别于传统的端到端AI模型,其核心属性是目标导向的自主交互能力:可在动态复杂的交通环境中,自主感知环境变化,调用历史经验做出符合交通规则与安全约束的决策,同时能从每次驾驶行为中迭代优化自身能力。
26年4月来自南方科大和港科大的论文“ProDrive: Proactive Planning for Autonomous Driving via Ego-Environment Co-Evolution”。端到端自动驾驶规划器通常仅根据当前观测生成轨迹。然而,现实世界的驾驶环境高度动态,这种基于即时反应的规划方式无法预判未来场景的演变,往往导致决策短视及危及安全的故障。为此,ProDrive,
26年4月来自小鹏汽车的论文“X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference”。实时世界模拟正成为自动驾驶系统可扩展评估与在线强化学习的关键基础设施。近期基于自回归视频扩散技术的驾驶世界模型虽能实现高保真且可控的多视角(多相机)图像生成,但其推理成本仍是交互式部署的瓶颈。现有
本文会从本质上拆解Copilot和Autopilot的核心差异,然后逐一拆解从Copilot升级到Autopilot需要跨越的7个核心能力门槛,每个门槛都会覆盖核心要求、落地难点、技术方案、可运行代码示例、避坑指南,最后会给出一套可直接复用的升级评估框架和行业落地路线图。我们可以用自动化程度AAAASaiStotal×100AStotalSai×100%其中SaiS_{ai}Sai是AI自
本文系统分析了大模型推理中注意力机制的技术演进路线,聚焦KVCache显存瓶颈问题。从标准多头注意力(MHA)到多查询注意力(MQA)、分组查询注意力(GQA)和最新的多头潜在注意力(MLA),四种方案在模型质量、显存占用和推理速度三个维度呈现不同权衡:MHA保持无损质量但资源效率最低;MQA实现极致压缩但质量损失明显;GQA在8分组时找到平衡点;MLA通过低秩联合压缩在长序列场景展现出压倒性优势
想象一下,你坐在一辆新车的驾驶座上,方向盘上有两个按钮:一个标着"Copilot",另一个标着"Autopilot"。你会先按哪个?几年前,当特斯拉首次推出Autopilot功能时,这个问题引发了全球范围内的讨论。一些车主满怀信心地将双手从方向盘上移开,相信技术能完全接管驾驶;另一些人则紧握方向盘,随时准备干预,将其视为一种高级辅助功能。类似的场景正在各个领域上演:从代码编辑器中的GitHub C
课堂不再只是工作室里的造型训练,也不只是实验室里的技术演示,而是逐渐转向一种以作品为驱动、以场景为实验室、以公众反馈为研究材料的教学方式:从“做一个作品”转向“建构一个系统”,再转向“组织一次可被观看、可被理解、可被讨论的公共事件”。在陈抱阳看来,未来AI艺术的重要方向,不仅是创造更复杂的系统,更是创造更有公共沟通能力的系统。在这个意义上,陈抱阳的探索所指向的,并非“AI替代艺术”,而是一个更具挑
在北京大学,一眸情智分析系统入驻北京大学未来课堂试验场展厅,核心服务于相关学科的教学授课辅助与对外学术交流研讨两大核心场景,深度融入北大师生日常教学与科研实践。在教学授课环节,系统成为教师辅助教学、学生开展科研的重要工具——凭借单目RGB摄像头无感采集、多维度实时分析的核心能力,教师可借助系统开展AI技术教学,引导学生学习如何将情智分析技术与自身专业深度结合,运用系统采集的情绪状态、注意力分配与心
一眸科技,依托北京大学ACIR实验室,在首席科学家王韬研究员的指导下,将前沿的情感与认知智能技术转化为专业工具,提供无接触式的、自然交互状态下的视觉检测心率、精细表情识别、人格分析、注意力和注意对象识别、痛苦及焦虑识别等AI技术,轻松获取来访者的生理与情绪数据,为心理咨询师开启了一扇科学洞察来访者内在状态的窗,成为咨询师可信赖的“数字化协作者”,让评测与疗愈更精准、更深入、更有效。一眸科技表示愿以
摘要: 道枢四链智驾系统是一种面向限定区域(如园区、港口)的自动驾驶解决方案,基于目标链、需求链、方法链与学习链四层架构实现。系统通过场景层感知环境(道路、车辆、信号等),分解为导航、安全等目标链,转化为具体需求链(如避障、跟车),再调用方法链(感知、规划、控制等)执行,最终由执行层控制车辆。安全监督层实时检查运行边界与风险,学习层积累经验优化模型。系统强调运行边界(ODD)定义,优先保障安全与合
本文系统介绍了扩散模型(Diffusion Models)和流匹配(Flow Matching)的数学原理及其在视觉-语言-动作(VLA)生成中的应用。扩散模型通过前向加噪和反向去噪过程学习数据分布,训练目标是去噪评分匹配,采样可通过DDPM或DDIM实现。流匹配则通过常微分方程直接学习从噪声到数据的概率路径,具有采样步数少、理论简洁的优势。在VLA任务中,这两种方法能有效建模连续多模态的动作空间
26年6月来自Nvidia的论文“NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation”。随着自动驾驶(AV)技术的进步,在长尾场景下安全评估驾驶策略仍是一个关键瓶颈。在闭环仿真中,驾驶策略模型与环境进行主动交互:其采取的动作会动态更新仿真器状态,并直接影响
26年6月来自Nvidia和香港大学的论文“Planning-aligned Token Compression for Long-Context Autonomous Driving”。一体视觉-动作模型(Monolithic vision-action models)代表自动驾驶领域的一种新兴范式。然而,当该架构在处理复杂交互场景并编码长时序上下文信息时,生成的Token序列往往会迅速超出实时
这篇论文提出了——面向雷达3D目标检测的跨模态知识蒸馏框架,核心目标是将激光雷达(LiDAR)的特征知识迁移到雷达模型中,解决雷达数据固有的稀疏、噪声大、分辨率低的问题。图1. 提出的RadarDistill方法示意图。我们的RadarDistill方法能够实现从LiDAR特征向雷达特征的知识迁移,从而提升用于鸟瞰图(BEV)目标检测的雷达特征质量。
本文探讨了利用Waymo Open Dataset(Perception 1.4版本)进行自动驾驶相关任务的方法。该数据集包含丰富的传感器数据(相机图像、激光雷达点云)和标注信息(2D/3D边界框、语义分割标签等),适用于目标检测、多目标跟踪和轨迹预测任务。文章首先介绍了数据集的下载和解析方法,展示了如何加载和可视化数据。接着详细说明了目标检测与跟踪的实现流程,包括模型训练和跟踪算法应用。最后重点
用 Qwen2.5-VL-3B + QLoRA微调做一个驾驶场景结构化理解系统,从环境搭建、Baseline评估到三轮训练踩坑全记录。覆盖训练 prompt 对齐、模板句陷阱、pseudo-label 补全标注、4bit 模型重复循环调参等核心问题,最终完成 Gradio Web Demo 展示。
从计算机科学的角度,AI Agent(以下简称Agent)的经典定义由Russell和Norvig在《人工智能:一种现代方法》(Agent是能够通过传感器感知环境,通过执行器作用于环境的自主实体。其核心特征是自主性、感知性、认知性、决策性、行动性、适应性(反思性)。在汽车与出行场景下,Agent的定义需要进行场景化约束与功能化强化。
具身智能的本质不只是机器人技术的延伸,而是认知智能向物理空间的拓展,从而使人工智能实现从数字空间认知到物理世界行动的跨越。在世界模型的支持下,具身智能系统能够在采取行动之前预判行为的结果,通过在潜在空间进行生成式预测,理解包括重力和摩擦在内的物理规律,对动作的适应性和后果进行判断,极大提升了机器人在非结构化环境中的自适应能力。世界模型解决了“知”的深度问题,而具身智能则使机器具备了主动认知和预测能
A-LOAM采用五层架构实现激光SLAM:**数据输入层**转换雷达数据为ROS点云;**特征提取层**按曲率分区提取角点与平面点,复用intensity字段存储时间与线束ID;**优化模型层**定义点到线/点到面残差;**前端里程计**通过scan-to-scan匹配和运动补偿输出高频位姿;**后端优化**基于scan-to-map匹配和局部地图抑制累积误差。分层解耦兼顾了实时性与精度。
时隔三周,从奥兰多到北京,SAP 用两场大会完成了一次完整的战略闭环。5 月 13 日,SAP 全球 CEO 柯睿安在奥兰多蓝宝石大会上首次提出"自主运营企业"(Autonomous Enterprise)愿景;6 月 3 日,SAP 大中华地区总裁原欣在北京中国峰会上,将同一战略注入了中国企业的落地语境。。基于 ERP 领域超过 50 年的积累,SAP 已经在财务、供应链、采购、人力资源和客户体
文章摘要:飞轮科技创始人马如悦探讨了AgenticAnalytics(智能分析代理)的落地挑战与解决方案。他指出,下一代分析体验不仅需要强大的AI模型,更依赖底层数据基座的三项核心能力:实时交互式分析性能、跨源数据统一访问和可被AI理解的业务语义层。基于ApacheDoris的SelectDB通过实时分析引擎、湖仓一体联邦查询、语义建模和MCP接口等技术,为AI代理提供快速、全面且语义明确的数据访
其中,云端提供强大的知识和模型能力,边缘提供更低时延、更高效率的服务,而终端和汽车则最贴近用户、最贴近场景,也最能够在真实世界中感知、理解并作出响应。”孟樸表示,面向AI智能体时代,高通拥有构建跨层级系统的能力,并将车端验证的平台能力扩展至机器人等更广泛的具身智能形态,推动物理AI从车端进一步走向规模化应用。孟樸表示,汽车智能化越往前走,就越需要芯片、软件、算法、整车、系统集成、云服务以及应用生态
提出判断力是继Token和Transformer之后AI的第三块基石,并揭示六十四卦作为2⁶=64的完备态势空间,为判断力提供数学底座。当前AI缺乏态势感知、确定度评估和安全边界等判断力核心要素,而六十四卦的六维二元结构(根基、行动、信息、资源、主导权、环境)可跨领域编码情境,实现趋利避害的通用认知语法。六十四卦从占卜工具转化为AI判断力引擎,解决物理世界中AI的安全与可靠性问题。这是中华文明对认
智能系统的本质是从高不确定状态(高U)向低不确定状态(低U)的自发收敛。核心观点包括:(1)认知基本单元是动态事件而非静态实体;(2)智能行为源于系统内在的降U驱动力;(3)安全关键情境需强制锁定确定性判断。文章通过64维态势空间和U值量化模型,系统阐释了Transformer、GAN、强化学习等技术的成功机制,并指出当前AI的幻觉、安全脆弱等缺陷源于"盲目降U"。作者团队基于该理论开发了"判断力
摘要: 传统GIS面临矢量、栅格、TIN、点云四大数据模型互转导致的信息损失难题,以及坐标系碎片化、精度难溯源、时间维度缺失等结构性局限。2024-2026年,五大技术(3D高斯点云建模、地理空间基础模型、DGGS全球格网、车载LiDAR众包、LLM语义标注)的突破性进展指向了下一代时空统一数据模型——SuperPoint。它以带语义、精度和时间标签的空间点为基本单元,融合绝对坐标(x,y,z,t
26年6月来自小米EV的论文“Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning”。自动驾驶需要推理自身行为如何塑造周围环境的演变。然而,大多数端到端方法依赖于从状态到动作的直接映射,仅捕捉相关性,而未显式建模受动作影响的动态特性。相比之下,基于连续潜空间的“世界模型”往往缺乏针对
PLUTO框架摘要:该研究提出了一种创新的自动驾驶规划框架PLUTO,通过三个关键创新将基于模仿学习的规划性能推向新高度:(1) 采用纵向-横向感知的查询式模型架构,实现灵活多样的驾驶行为;(2) 提出基于可微分插值的高效批量计算方法,适用于广泛的辅助损失计算;(3) 引入对比模仿学习(CIL)训练框架,结合新型数据增强方法,增强对交互的理解和行为规范化。在nuPlan数据集上的测试表明,PLUT
专门的技能进一步把工作流延伸到移动和操作领域。NVIDIA在CVPR上发布了一套Physical AI Agent Skills,把从数据生成、仿真、策略训练到评估的整条链路串了起来,Cosmos 3大模型做底座,Agent Skills做抓手,三大方向同时推进,研究者的工作流从碎片拼凑变成一键串联。视频数据量一大,人工看不过来,模型微调又需要反复试验,这些技能把搜索、摘要、增强、微调串在一起,研
【摘要】PPP-RTK作为下一代高精度定位技术,融合了PPP(精密单点定位)的全球覆盖与RTK(实时动态差分)的快速收敛优势,实现1-5cm精度、30秒-5分钟快速定位,无需本地基站支持。其核心原理通过全球参考站网络反推卫星轨道偏差和钟差,结合区域大气模型实现快速解算。国际主流服务商(如u-blox PointPerfect、Trimble RTX)通过L波段卫星/互联网双通道下发修正数据,特别适
本文总结了Horizon模型转换与部署中的关键参数和方案选择,涉及input_shape、input_batch、separate_batch三个核心参数的作用与限制。文章详细介绍了两种模型导出形态(静态多Batch和动态多Batch)以及三种部署方案(静态多Batch+Featuremap输入、动态多Batch+Featuremap输入、NV12图像输入+separate_batch),并提供了
摘要: AgenticBI是BI行业的新范式,由衡石科技率先落地,其核心是让AI Agent具备全链路BI操作能力(如创建数据集、生成仪表盘等),而非仅提供建议。技术层面依托CLI执行层(赋予Agent操作能力)、指标语义层(确保数据理解准确)和多Agent协作(分工处理复杂任务)。产品实现上,衡石通过HENGSHI CLI与DataAgent实现自动化工程执行,并以HENGSHI BOX保障安全
但长期以来,干线物流行业存在显著发展痛点,面临货车司机短缺、人力运营成本居高不下、超载运营、疲劳驾驶引发安全事故频发等问题,行业整体呈现“小、散、乱、弱”的格局,通过无人化技术实现降本、提效、增安,已成为行业刚需,市场替代需求极为迫切。技术端自动驾驶、AI大模型、算力硬件持续迭代成熟。干线物流自动驾驶赛道,是公司“技术产品+生态运营”全新发展模式的核心落地载体,也是依托自身多年智慧交通、AIoT技
根据规划,科创中心研发的首批物理AI技术成果,将率先应用至天瞳威视的高阶智驾系统。
摘要:Elastic推出的性能分析衍生指标技术通过OpenTelemetry eBPF性能分析器,将原始堆栈跟踪转换为时间序列关键指标,解决了传统性能分析的四大障碍:高存储成本、查询复杂、AI不友好和用户体验差。该技术在边缘侧完成数据分类聚合,显著降低存储开销,支持标准可视化分析,并实现跨信号关联。通过预置内核/运行时分类规则和自定义指标功能,用户无需处理原始堆栈即可获得CPU消耗明细。这项技术为
如 CLIP、bge-visual,同时编码文字 + 图片,适合图纸、说明书、教材类文档。用户 Query 同样用同一个模型向量化,才能匹配召回。Retriever 底层自动调用这两个方法做相似度比对。国产云端嵌入,适配中文,国内企业内网云场景。,中文 SOTA,LangChain 通过。
MultiQueryRetriever(问题扩写)、EnsembleRetriever(向量 + BM25 混合召回)、ContextualCompressionRetriever(结果过滤精简);:向量库独立 MCP-Server,Agent 远程调用 RAG(分布式知识库)向量 + 文档元数据持久化存入 Chroma 向量数据库(本地文件型向量库):PDF/Word/TXT/ 网页 / 数据库
千方科技作为 AI + 交通上市龙头企业,2015 年启动自动驾驶产业布局,2025 年设立千曙科技子公司,正式落地干线物流自动驾驶业务,核心聚焦 L4 级自动驾驶重卡运力服务。业务落地层面,公司深度整合车、路、运、能四大生态资源,一边深耕底层大模型研发、参与超 35 项智能网联行业标准编制,一边联动主机厂、省级交通平台、头部物流企业落地实地试点。本篇依托企业官方文档、权威媒体稿件与公众号披露信息
自己造 Agent 决策链路,无现成 Agent 对象;LangGraph:手动定义节点 + 路由,抛弃 BaseAgent 体系,工业复杂 Agent 主流方案。返回值 =各类 Agent 实例对象;实例必须塞入才能运行;不想用内置 Agent 种类 → LCEL 手写 / LangGraph 自定义替代。
该表格参照,从人机分工维度划分 AI 智能化等级,完整覆盖从工具软件到通用自主智能的演进路径,结合 LangChain 技术落地场景做分层拆解:表格L1 ToolL2 Chatbot(对话咨询顾问级)人主导工作流程,仅向 AI 问询资讯、L3 Copilot(副驾驶人类定目标,AI 产出初稿,人终审修改确认,AI 无法自主完成闭环调用外部工具!!!L4 Agent(自主智能体级)
判断力引擎通过四个维度为AI系统降本增效:1)省算力,轻量级CPU判断替代大模型推理,年省数百万算力成本;2)省人力,内生安全机制无需人工编写规则,减少团队开支;3)省时间,确定性测试加速产品上市周期;4)省心,架构级安全约束避免事故风险,潜在损失减少数千万至数亿。综合测算,判断力引擎的年费远低于传统方案成本及事故风险,成为高性价比的“确定性保险”。
自动驾驶是物理AI和世界模型投入最大的领域,也是判断力缺失最致命的地方。自动驾驶已经能做到99.9%的识别准确率。但剩下的0.1%,是“不确定”——传感器数据冲突、长尾场景、对抗性输入。这些不是识别问题,是判断力问题。红灯亮了,摄像头拍到了,但激光雷达没有。两个传感器数据冲突。传统系统怎么处理?按预设规则选一个,或者按统计模型猜一个。选了摄像头,追尾了。选了激光雷达,闯红灯了。这就是为什么Waym
这篇论文提出了一种名为Sensor2Sensor(S2S)的创新生成式模型,能够将单目行车记录仪视频转换为目标自动驾驶车辆的多视角视频和高精度LiDAR点云数据。该研究解决了自动驾驶领域的两大难题:数据长尾效应和硬件不兼容问题。通过4D高斯泼溅技术生成合成训练数据,并设计跨模态扩散网络实现传感器数据转换。实验表明,生成的数据可直接用于现有感知模型,显著提升了数据利用效率。这项技术为自动驾驶系统提供
文章摘要:自动驾驶技术正从科幻走向现实,国际SAE标准将其分为6个等级(L0-L5),当前主流车型处于L2级,部分企业已实现L3并测试L4技术。自动驾驶的训练始于虚拟环境,通过构建数字孪生城市和物理AI仿真系统(如NVIDIA Omniverse、51WORLD平台),让AI在模拟世界中学习真实驾驶场景。虽然高阶自动驾驶能提升道路安全,但它无法取代人类驾驶的乐趣,技术发展的本质应是改善而非完全替代
文章摘要:数据开发领域长期面临两大痛点——AI驱动的数据产品难以落地生产环境,传统工具虽强大却仍需人工操作。云器DataAgent通过三层垂直化适配(底层语法、产品操作、业务知识)构建企业级能力底座,实现数据开发的"自动驾驶"。它能理解用户意图并自动执行复杂任务,如业务分析、数据质量排查和运维诊断,将传统需多步操作的工作简化为自然语言交互。这一方案突破了"工具需要人操