登录社区云,与社区用户共同成长
邀请您加入社区
1. 从Trace拉取出错run,发现Agent在第3步选错了工具2. Counterfactual分析显示,如果第3步选择"query_balance"而非"query_history",结果会正确3. 查看Router的Prompt,发现"账户余额"和"账户历史"的Few-shot示例太相似4. 修改Prompt,增加对比明显的示例5. 用50个历史出错case做回归测试,修复后通过率从62%
【摘要】大模型评测体系包含五大维度:1.核心能力指标(准确率、流畅度、事实一致性等基础能力);2.专项能力指标(推理能力、可控性等关键能力);3.领域专属指标(金融合规、法律匹配、医疗诊断等垂直场景要求);4.生产环境指标(性能、安全、用户体验等落地要素);5.评测工具推荐(OpenCompass2.0等开源方案)。该体系覆盖从基础能力验证到产业落地的全链条评估,为不同领域提供模块化、标准化的评测
APEX-Agents是首个评估AI代理在专业服务领域长期工作能力的基准测试,由Mercor于2026年推出。该基准模拟投资银行、法律和企业咨询等高价值场景,通过480个真实任务测试AI代理在跨应用、多工具环境中的表现。最新结果显示,顶级模型Claude Opus 4.6仅完成29.8%的任务,远低于专业工作要求。评测揭示AI代理在上下文保留、文件导航和模糊性处理等方面存在显著不足,表明当前技术尚
站在2026年年中回望,AIGC与多模态技术正在经历一场深刻的范式转型。从GLM-Image证明国产全栈算力的可行性,到Seedance 2.0将视频生成推向工业级应用;从Emu3登上《Nature》确立自回归统一路线,到Gemma 4实现端侧多模态推理——AI正在从一个辅助创作的工具,“进化”为一个理解物理规律、具备视听通感并能主动规划任务的“世界模拟器”。图像生成:优先关注GLM-Image等
摘要 大模型基准测试领域正面临“跑分通胀”与真实应用脱节的困境。2026年三大核心评测指标显示:MMLU测试中顶级模型(如GPT-5 92.5%、Gemini 2.0 Ultra 95.8%)已逼近人类专家水平(89.8%),但2%的分数差异已落入测量误差范围;HumanEval代码生成榜单被MiniCPM-SALA以95.1%刷新,但增强版HumanEval+使模型性能骤降8-32个百分点;GS
先泼一盆冷水:市面上 80% 声称需要微调的项目,用 RAG 甚至更好的 Prompt 就能解决。根据 2026 年 3 月的一项社区调查,2026 年的基础模型已经强到“恐怖”的程度——Qwen3、Llama 4、Gemma 3 等模型开箱即用就能完成 18 个月前还需要专门微调才能搞定的任务。微调是核武器,威力巨大但代价高昂,绝大多数场景用提示工程或 RAG 就够了。那么,到底什么时候该用微调
摘要:2026年AI Agent术语辨析与选型指南 随着AI技术的快速发展,"Agent"相关术语正面临严重的概念混淆问题。本文从架构设计角度清晰界定了Agent、AI Agent和Agentic AI三个关键概念: Agent:最基础的软件实体,具备感知-决策-行动能力,但定义过于宽泛(如简单的if-else逻辑也可称为Agent) AI Agent:基于AI模型驱动的智能执行单元,专注于单一任
AI Agent技术解析与框架选型指南(2026) 本文系统剖析了AI智能体的核心架构与技术趋势。通过超市购物比喻,揭示了AI Agent与传统大模型的本质区别:前者具备"规划-执行-交付"的完整闭环能力,后者仅能提供信息咨询。文章拆解了AI Agent四大技术支柱(规划、记忆、工具使用、协同)及其工作流,并深入分析了2026年主流技术模式:反思机制确保输出质量,MCP协议成为工具调用标准,任务规
绝大多数“会用”AI 的人,其实并不真正理解它为什么能“听懂人话”。语言模型不是“会思考的机器”,而是一个超大规模的概率预测器。它不关心“真理”,只关心“下一个最可能出现的词是什么”。理解这个,就抓住了 LLM 的命门。🔬核心原理:Transformer、注意力机制、MoE架构究竟是什么?📊主流模型深度对比:GPT-5.5、Gemini 3.5、DeepSeek-V3、Llama 4 谁强谁弱
2026年AI模型技术全景解析(摘要版) 本文系统梳理2026年AI模型技术演进,从四大维度为开发者提供认知框架: 架构设计:MoE架构成为主流,通过专家路由机制实现万亿参数规模下仅激活3-5%参数。混合注意力机制突破长文本处理瓶颈,KV缓存内存占用降低90%。 部署方案:形成Ollama(个人测试)、vLLM(生产级)、SGLang(边缘计算)三级工具链。7B模型单卡部署,70B模型需4卡NVL
CSDN「AI数字营销-内容创作」工具实测:热点选题表现优于自定义 该工具提供热点与自定义两种创作模式。测试发现,热点选题(如"豆包在抖音生态")生成内容精准贴合场景,逻辑清晰;而自定义选题(如"前端开发必看书籍")易出现方向偏离,需使用更具体关键词。工具优势在于热点追踪、SEO优化及辅助功能(代码补充/标题优化),但存在技术深度不足、大纲不可控等问题。建议
摘要: 在微服务契约测试中,提供者端测试常因数据准备不当失败,而非契约本身问题。常见陷阱包括硬编码数据冲突、状态泄漏、外部依赖缺失等。解决方案需遵循隔离性、幂等性和自动化原则:通过BaseClass统一管理数据工厂,结合@Sql脚本精准控制;使用Testcontainers实现数据库隔离;或通过契约标记动态生成数据。排查时需关注404或响应体不匹配等典型数据问题。本文基于Spring Cloud
多模态大语言模型(MLLM)已在多个行业实现规模化落地应用。招商银行、得物、美团等企业通过Qwen2-VL、LLaVA-1.6等模型,在金融、电商、工业等领域取得显著成效:1)招商银行智测平台年节省1.4万工时;2)得物VisionTest实现前端重构自动适配;3)美团UIGuard发现43处多端UI不一致问题;4)西门子MotionEdit技术对动态工业HMI识别准确率达98.7%。这些案例证明
未来的 NOC 并不取决于墙上有多少 dashboard,而取决于团队从告警到恢复服务的速度有多快。Elastic 技术栈通过统一的遥测数据接入、实时 ML 异常检测、AI Assistant 以及可扩展的 Knowledge Base,让今天的 NOC 团队已经具备了实现这一跃迁的能力。本文中的 Cisco ISE 用例只是其中一个例子。
语音客服体验优化方案摘要 当前语音客服系统存在四大痛点:IVR分流率低、人工坐席超负荷、方言识别差、体验测评单一。解决方案聚焦三大业务场景: 智能语音客服:提升复杂意图解析能力,避免多轮对话失效; IVR导航:简化菜单层级,支持混合交互,减少用户认知负担; 人工客服:优化AI与人工交接,避免信息重复提交。 通过三维指标量化改进效果: 效率:IVR直达率、自助闭环率; 质量:多轮容错率、关键信息提取
本文探讨了灰盒测试在系统测试中的关键作用。灰盒测试介于黑盒与白盒之间,通过利用有限的系统内部知识(如架构、接口、数据结构)设计更精准的测试用例。文章详细分析了灰盒测试的核心理念、技术方法(模型测试、接口契约测试、数据库断言等),并与黑盒、白盒测试进行了多维对比。通过电商购物车系统的实例,展示了灰盒测试如何发现纯黑盒难以暴露的缺陷。作者指出,灰盒测试在缺陷发现效率与投入成本间取得了最佳平衡,是系统测
标准名称:Standard Test Methods for Vibration Testing of Shipping Containers(运输集装箱振动测试标准方法)归口机构:ASTM D10 包装委员会 → D10.21 运输集装箱与系统子委员会发布 / 复审:2008 年制定,2015 年复审确认ASTM D999-08 (2015) 是运输集装箱振动测试的经典标准,通过往复冲击和共振测
使用 adb shell am start -W com.tpshop.malls/com.tpshop.malls.SPMainActivity 启动应用时报错当测试页面不是在里声明的时,有可能会报出安全异常。这是因为启动的Activity设置了外部启动权限,在AndroidManifest声明该Activity处增加配置即可。
本次测试采用TSBS标准时序数据集与查询负载,对与开展写入性能、单机查询性能(1 Worker/8 Worker)对比验证。所有数据库进程以Docker容器化方式部署,硬件配置、资源限制、测试数据集与时间窗口完全一致,确保对比公平可复现。写入侧KaiwuDB吞吐高、稳定性强;IoTDB吞吐低,高压力场景导入失败。查询侧轻量级、小规模、简单分组查询:IoTDB存在优势。中大规模数据、复杂聚合、高并发
Elastic推出创新MCPApps技术,将AI对话与交互式UI深度整合。该技术突破性地实现了:1)在对话中直接嵌入可操作仪表板,无需切换应用;2)支持安全、搜索和可观测性三大场景,提供告警分诊、攻击发现、服务依赖分析等专业功能;3)采用沙箱化架构保障安全,同时保持数据双向流动。例如安全分析师可直接在聊天界面处理告警、创建案件,而SRE工程师能实时查看系统拓扑和异常检测。这一技术重构了人机协作模式
本文总结了AI心理绘画游戏开发中房间管理功能的联调过程。通过设计创建、加入、退出等测试场景,采用先API后WebSocket的联调策略,重点解决了玩家列表实时更新、房间码唯一性、状态同步等关键问题。开发团队使用内存状态管理提升性能,最终实现了支持2-4人实时互动的房间系统,为后续AI识别模块对接打下基础。该过程涉及前后端协同调试、边界问题处理等技术难点,体现了多人实时游戏开发的复杂性。
本文提出了一种针对金融系统UAT测试的混合架构模型(Docker+VM+Baseline/Target),解决了多轮迭代中的核心痛点。该模型通过VM提供安全隔离,Docker管理运行环境,建立Baseline稳定版本作为参照系,同时支持Target版本灵活迭代。其核心价值在于:实现多版本并行对比验证、确保测试环境可复现、支持快速问题定位与修复。特别针对金融系统常见的版本混乱、配置漂移、数据污染等问
最近因为一些业务需要,一直在研究国产时序数据库,刚好顺便出一些测评。第一轮选中了 TDengine 和 KaiwuDB 先试试。确实知名度比较高,开源生态成熟,在时序数据库中还是比较有代表性的;我也是才知道不久。24年才正式开源的国产新生代力量,在墨天轮时序库榜单上升势头极快,且去年在 benchANT 性能榜单评测中拿下第一,性能表现看上去也算是在第一梯队了。
Hermes系列8:代码质量评估-Hermes 生成测试代码 Review 指南》—— AI 生成代码的质量评估,测试人最关心的问题。[Playwright CI/CD 指南](https://playwright.dev/docs/ci-intro)[Hermes 官方文档](https://hermes-agent.nousresearch.com/docs/)前 6 篇我们解决了:本地跑通、
摘要:自主IT平台正通过整合可观测性数据与AI技术,实现从被动监控向预测性、自愈系统的转变。这类平台结合日志、指标、追踪和事件数据,利用机器学习减少噪音、检测异常并快速定位根因,支持闭环自动化运维。Constellation Research评选的14家领先供应商展现了关键能力:统一遥测关联、AI辅助分析、服务依赖映射和高基数扩展性。随着分布式系统复杂度激增,这类平台成为实现韧性运维的核心,能显著
AI时代自动化测试面临新挑战:测试能跑但不可信。文章指出"可审计性"成为核心指标,即测试需具备业务语义、可追溯、可解释和可复用四大特征。传统脚本模式缺乏语义表达,AI生成测试代码更让问题恶化。解决方案是转向"模型驱动",用结构化模型约束AI生成,将测试转化为可解释的知识体系。这在金融等高风险行业尤为重要,因为自动化测试的本质是提供可信的发布依据,而非单纯提高
摘要:Apache JMeter是一款开源的性能测试工具,支持HTTP、WebSocket等多种协议测试。本文介绍了JMeter 5.6.3的安装配置、基础脚本创建(包括线程组设置、HTTP请求添加和结果监听),并详细讲解了命令行压测模式。此外还涵盖高级功能如参数化测试、断言机制、关联技术和分布式压测等。通过本文,读者可快速掌握JMeter从基础到进阶的使用技巧,实现接口测试和性能压测需求。
Green-Ampt入渗模型是最经典的降雨入渗模型之一。我们使用COMSOL这个强大的数值模拟软件,以Lima试验为基础来分析其入渗率变化、最大入渗能力变化以及土壤不同深度的压力水头变化。Green–Ampt入渗模型与Richards非饱和渗流,适用于各类型的均质土体入渗,包括且不限于边坡降雨入渗等[1]模型简介:使用数值模拟软件COMSOL,以Lima试验分析使用Green-Ampt入渗模型的入
本文记录了 OpenClaw 2026.3.28 版本在 Windows 10/11 原生环境下的完整部署实战。重点分析了系统在检测到非推荐环境(WSL2)时的兼容性处理、安全边界设定逻辑、以及通过 Ollama 集成云/本地混合模型的配置流程。本次实战展示了如何将一个“白板”AI 通过交互式引导(TUI)孵化为具备个性化特征的数字代理。
GDPval-AA代表了AI能力评估的重要演进。通过其经济上有价值的任务、盲比较Elo评分和动态更新机制,它提供了比传统静态基准更准确、更相关的模型能力相对排名。Elo系统提供动态相对排名,优于静态绝对分数盲评估防止偏差,确保公平比较冻结评分确保稳定性,避免频繁重新评估Claude Sonnet 4.6的显著改进(1633 Elo)显示推理效率提升经济价值焦点区分GDPval与学术基准经济上有价值
自动化测试的核心问题,从来不是“如何写脚本”,而是“如何正确表达测试”。传统脚本模式将业务逻辑强绑定在界面结构和执行流程中,一旦系统变化,测试即失效。而AI的引入,并没有解决这一问题,反而放大了脚本的混乱,使自动化系统变得不可维护、不可审计。真正可持续的方向,是从脚本驱动转向模型驱动,将对象、行为、数据和场景进行解耦与结构化表达。在此基础上,AI才能发挥价值,提升效率而不是放大风险。未来自动化测试
本文系统介绍了软件测试的核心知识体系。首先阐述了接口的两大类型:程序内部接口(模块间协作)和系统对外接口(跨系统交互),重点讲解了HTTP API等常见接口形式。其次剖析了软件测试的商业价值链:测试保障质量→提升用户体验→促进企业盈利,并以《羊了个羊》为例说明测试的必要性。然后区分了测试与调试的本质差异,以及测试工程师与测试开发工程师的岗位分工。最后解析了V模型这一经典测试流程的优缺点,指出其适合
没错,最近直接扒了STM32F103移植的那个github上2.4k星的FX3U开源仿真库,自己啃了底层脉冲发生器、软轴寄存器映射的部分,把三轴真正能同时跑的PLSR(带独立加减速斜坡、实时暂停急停脉冲补全那种!哦还有个小彩蛋——我把TIM中断的优先级调了一下:TIM1最高,TIM2次之,TIM3最低,这样三个轴同时跑的时候不会出现丢脉冲的情况,哪怕是100kHz的脉冲串。slope0里的增量是线
摘要:90%的自动化测试项目失败的根本原因在于错误的实现方式,而非技术工具问题。主要误区包括:1)将测试等同于编写脆弱的UI操作代码;2)将业务逻辑与界面结构强耦合;3)采用静态脚本应对动态系统。AI辅助测试反而加剧了不可控性。正确的解决方案应转向模型化思维,将测试拆解为对象、操作、数据和场景四个维度,实现语义化而非结构化的测试表达。随着AI加速开发进程,测试正成为软件发布的瓶颈,采用正确的自动化
一维光子晶体超窄带滤波器光学仿真,出模型文件,matlab代码以及说明文档在光学领域,一维光子晶体超窄带滤波器一直是个有趣的研究方向。它能够在特定的频率范围内实现极高的透射率,同时在其他频率呈现极低的透射,从而实现超窄带滤波效果。今天咱们就来聊聊如何通过光学仿真得到其模型文件,并用Matlab代码实现相关功能,还会附上说明文档要点。
举个接地气的例子,把配电网潮流方程里的非凸约束写成旋转二阶锥形式,就像把乱糟糟的毛线团绕成规整的线球。传统 的启发式算法 在全局最优 解和求解 速度上均 无法满足主动配电网运行要求 ,而基于线性化的最优潮流方法在高阻抗的配电网中适用性也较 弱。传统 的启发式算法 在全局最优 解和求解 速度上均 无法满足主动配电网运行要求 ,而基于线性化的最优潮流方法在高阻抗的配电网中适用性也较 弱。基于此 ,文章
MATLAB代码:基于改进粒子群算法的含电动汽车参与园区综合能源优化调度关键词:电动汽车 改进粒子群 综合能源 优化调度 园区参考文档:《含电动汽车的区域综合能源系统优化调度研究》第3章:复现仿真平台:MATLAB主要内容:代码主要做的是一个含有系统能源运营商、分布式光伏用户、电动汽车充电代理商的园区综合能源系统,分析了三种市场交易主体的属性以及市场交易机制,建立了三方市场主体各自的综合能量管理优
MATLAB代码:基于二阶锥优化及OLTC档位选择的配电网优化调度关键词:OLTC档位选择 二阶锥优化 动态优化 最优潮流参考文档:《主动配电网最优潮流研究及其应用实例》仅参考部分模型,非完全复现《主动配电网多源协同运行优化研究_乔珊》仅参考部分模型,非完全复现仿真平台:MATLAB YALMIP+CPLEX优势:代码注释详实,适合参考学习,全程有讲解!,全程有讲解!程序非常精品!
四轮独立驱动电动汽车转矩分配控制CarSim与Simulink联合三自由度车辆模型(纵向、横向、横摆)控制方法为离散LQR(包括连续系统的离散方法和求解方法)带有完整详细的控制器、二自由度稳定性控制目标推导文档,不带MATLAB版本为2018b CarSim版本为2018在电动汽车领域,四轮独立驱动技术为车辆操控性能的提升带来了新的可能性,其中转矩分配控制是关键一环。