登录社区云,与社区用户共同成长
邀请您加入社区
Understand-Anything 是一个 AI 代码理解工具,通过静态分析 + 大语言模型,将代码库转换成交互式知识图谱,帮助团队成员快速理解代码结构、分析变更影响。场景价值接手陌生项目快速定位核心模块,梳理业务流程代码变更分析评估影响范围,精准回归测试补充测试场景AI 辅助发现遗漏的分支和边界条件。
- 良率=好Die/总Die,但选错模型可能差17个百分点- Poisson模型过于悲观,Murphy居中,**Negative Binomial才是业界标配**- 关键不是良率数字,是**跟踪聚类因子α的变化**——它能早几周预警工艺漂移- Chiplet时代,10颗90%良率的Die封在一起,整体良率只有35%
在这个人工智能技术飞速发展的今天,AI Agent(人工智能代理)已经不再是科幻小说里的概念,而是实实在在地走进了我们的生活。从智能客服到自动驾驶,从推荐系统到游戏AI,AI Agent正在改变着我们的世界。但是,就像我们需要确保玩具汽车需要定期保养和维护一样,AI Agent也需要经过严格的测试,才能确保它们能够安全、可靠、高效地为我们服务。
首先,什么是AI Agent?在人工智能领域,Agent通常指的是能够感知环境、做出决策并采取行动的自主实体。感知模块:负责从环境中获取信息推理/决策模块:处理信息并决定下一步行动行动模块:执行决策,影响环境学习模块:根据经验改进性能自主性:AI Agent能够在没有持续人工干预的情况下运行反应性:能够感知环境变化并及时做出反应主动性:不仅能对环境做出反应,还能主动追求目标社交能力:能够与其他Ag
本书立足软件工程3.0时代,系统讲解大模型在软件测试全生命周期的创新应用,兼具理论深度与实战价值,为测试人员指明职业升级路径,是行业智能化转型的必备参考,获阿里巴巴、南京大学、华为、南方科技大学、中科院软件所等多位权威专家联袂推荐!LLM驱动测试需求分析:探讨如何利用LLM理解产品需求、分解测试需求、界定测试范围、挖掘测试风险,同时介绍如何生成测试项、验收标准和测试计划,提高需求分析的效率和质量。
当 AI 开始替我们写代码,测试还像以前那样做就行了吗?
本文介绍了如何为全栈TypeScript项目建立测试体系,通过测试金字塔模型(单元测试70%、集成测试适量、少量E2E测试)分层实施。以ChatCrystal项目为例,使用Node.js内置的node:test模块实现零依赖测试方案,涵盖纯函数单元测试(如正则清洗、文本分块、路径解析)、集成测试(sql.js内存数据库与Fastify路由测试)以及CI自动化。文章强调单元测试应快速验证函数输入输出
集成测试:将多个模块、服务、组件组合在一起进行的测试,验证各个部分之间的交互是否符合预期,核心是多步骤、跨系统、全链路。多步骤Agent:具备自主规划多步执行路径、调用工具、根据执行结果调整策略的大语言模型应用,核心组件包括规划器、执行器、记忆模块、反思器、工具集五个部分。测试记忆库:存储接口文档、历史测试用例、错误解决方案等知识的向量数据库,为Agent的规划、反思提供依据,减少大模型幻觉。本文
摘要:本文揭示了Spring Boot并行测试中常见的资源竞争问题,包括端口冲突、数据库主键冲突和共享状态污染。针对端口冲突,建议严格使用RANDOM_PORT并避免硬编码端口;对于数据库竞争,推荐生成唯一测试数据或采用Testcontainers隔离方案;文件系统冲突可通过JUnit临时目录解决。这些方案能有效消除并行测试中的随机失败,确保测试稳定性和执行效率。
Testcontainers 网络配置是集成测试常见痛点,本文系统梳理了容器连接问题的解决方案。单容器场景中,Spring Boot 3.1+推荐使用@ServiceConnection替代手动属性注入,避免localhost和随机端口配置错误。多容器通信需创建自定义Docker网络,通过容器名或别名互联,同时注意宿主机JVM测试与容器内应用的网络差异。Kafka等特殊服务需额外处理广播地址,Te
在 ISO 26262 功能安全认证过程中,结构覆盖率 (Structural Coverage)是衡量软件单元测试充分性的核心指标。根据不同的 ASIL 等级,标准要求或建议达到不同的覆盖率目标。MathWorks 提供了和等工具,用于在基于模型的设计 (MBD) 流程中收集模型和代码的覆盖率数据。然而,ISO 26262 的标准术语与 MATLAB/Simulink 工具中显示的指标名称存在一
MIPI 技术背景在 5G、AI、车载电子、高端影像与工业检测飞速发展的今天,高分辨率、高帧率、低延迟、高稳定的图像数据传输与采集,成为产品研发、测试与量产的核心瓶颈。MIPI CSI-2 接口凭借低功耗、高带宽、抗干扰强等优势,已成为手机、车载、安防、工业相机的主流互联方案,而C-PHY 与 D-PHY作为物理层核心,支撑着从高清到 8K、从 30fps 到 120fps + 的海量数据传输。思
摘要: 构建有效的AI评测集需确保数据与线上场景一致,避免自嗨式测试。数据来源有三:1)真实用户日志(贴近业务但成本高);2)业务场景还原(依赖PRD/工单,需业务协同);3)合成生成(低成本但易偏离真实分布)。开源数据集(如SWE-bench、ToolBench)可辅助横向对比或单测,但需警惕场景错位、数据泄露和过拟合风险,不宜直接作为业务标准。核心原则:优先真实数据,开源集作补充,定期审计覆盖
听完一整节课,小陈不仅理清了部署全流程,还学会了如何分析一个开源项目是否适合自己二次开发。而老师没有止步于此:“我也帮你问问我之前的老同事,他们在公司用的是另一套开源的,用得还不错。回头把名字发给你,你可以对比一下,哪套更适合你的场景。💬 这就是私教的价值——不只是解决当下一个问题,而是给出一条可持续的学习和解决问题路径。从“中间件不了解”“前端没部署过”到“太好理解了”“了解”,仅仅用了一个小
Harness(测试支架)是一套独立于Agent业务逻辑的辅助测试系统,通过埋点探针、模拟桩、链路追踪、断言引擎等能力,为Agent提供可观测、可控制、可验证的测试环境。Harness Engineering就是围绕这套支架的设计、开发、落地的整套工程实践。和传统软件的白盒测试类似,AI Agent的白盒测试是指在明确Agent内部组件结构、交互逻辑、决策规则的前提下,对每个组件的内部逻辑、组件之
腾讯CodeBuddy智能IDE与优测自动化测试平台对接,通过AI智能体实现规范驱动的测试自动化。该方案利用Skills分层机制和CLI工具,支持在IDE中直接生成测试用例、执行流量录制回放及测试任务,大幅提升测试效率。典型案例显示,某社交APP后台服务团队使用后,用例生成效率提升16倍,Token消耗减少80%,覆盖率提升至95%。这种AI赋能的测试方式实现了从代码解析到报告输出的全链路智能化,
【摘要】一位测试工程师在模拟面试中暴露出简历亮点挖掘不足的问题。面试官指出其大模型测试和算法平台经历是简历中最值钱的部分,但学员却轻描淡写带过。专家建议:1)将项目经历转化为有背景、痛点、动作、结果的故事;2)适度包装开发经验作为加分项;3)重点准备LeetCode简单题。核心观点:面试不是被动答题,而是主动展示解决问题的能力,需要提前构建"故事武器库"。(149字)
数据质量评估的六个关键维度:准确性(正确性)、完整性(必填字段缺失率)、一致性(数据自洽程度)、时效性(数据新鲜度)、代表性(样本分布匹配度)和合规性(数据合法性)。文章通过金融AI案例说明各维度测量方法及权重,指出代表性最难测量(需KL散度计算),合规性具有一票否决权。提供Python代码实现六维度量化评估,强调应关注最低维度分数而非综合评分。修复优先级建议:合规性>准确性>一致性>代表性>完整
《AI功能测试的黄金数据集构建指南》摘要 本文系统介绍了构建黄金数据集的方法论,重点解决AI测试中质量评估标准缺失的问题。通过实际案例说明,传统测试用例与黄金数据集的核心差异在于前者验证功能正确性,后者定义质量标尺。文章提出五步构建法:用例收集、人工标注、基线测试、自动化集成和定期维护,并推荐150-500条精选用例的合理规模。关键点包括: 黄金数据集应包含多维评判标准(准确性、相关性等)而非单一
Robot Framework 是一个基于Python的开源自动化测试框架,其核心魅力在于关键字驱动和表格式语法。它通过将复杂的底层操作封装成易于理解的“关键字”,并配合丰富的第三方库(如SeleniumLibrary),实现了无需编码即可高效编写和维护自动化测试用例的目标。其核心特点包括:直观的用例结构、极强的可扩展性、人性化的HTML报告,以及与各类测试场景的良好兼容性,使其成为验收测试和RP
本文介绍了AI测试系统中的Skill引擎设计,该系统采用声明式配置和插件式架构解决传统测试系统的痛点。核心内容包括: 设计理念 通过Markdown+YAML声明式配置定义测试技能,无需修改代码 插件式架构支持快速扩展新测试能力 自动验证输入参数,提供执行日志和错误追踪 关键技术实现 YAML Frontmatter解析:使用正则表达式提取Markdown中的配置 动态执行器加载:通过驼峰转蛇形命
我们将为一家中型电商平台构建销量预测系统:1.3 技术选型组件选型理由语言Python 3.10生态丰富,数据科学首选数据处理Pandas + Polars + Spark批处理用 Spark,实时用 Polars特征存储Redis + PostgreSQLRedis 存在线特征,PG 存历史模型训练LightGBM + XGBoost工业级,兼顾性能和可解释性模型服务Triton Inferen
数据漂移(Data Drift)是指生产环境中的数据分布与训练数据分布发生显著变化的现象。它会导致模型性能逐渐下降,但这个过程往往是渐进的,不易被察觉。Evidently是一个开源的ML监控框架,专门用于检测数据漂移和模型性能退化。它支持多种漂移检测算法,输出美观的HTML报告,与Prometheus/Grafana完美集成。│ 生产ML监控体系 ││ 基础设施层 ││ ├── Kubernete
本文探讨了CrewAI框架中Agent角色设计的关键方法论。通过对比实验发现,专业角色定义(包含明确经验级别、专业领域和英文对照)比模糊角色的输出质量高10倍以上。文章提出角色设计三要素:role(身份证)、goal(KPI)、backstory(简历),并给出5个测试角色(经理、设计师、工程师、分析师、报告专员)的完整模板。同时总结了8个常见错误及排障方法,强调角色定义需要迭代优化,建议花80%
MSI,机场主系统商,机场集成商,民航系统,主系统集成,AODB
摘要 本文深入探讨了5个AI模型(豆包、文心一言、通义千问、智谱清言和DeepSeek)的协作技术细节。通过特性分析与明确分工(创意生成、内容撰写、技术审核等),构建了高效协作流程。关键技术实现包括:标准化的JSON数据传递格式、状态机管理、带重试机制的模型调用。同时介绍了成本优化策略(token监控、免费资源最大化、缓存机制)和质量保证体系(自动化测试、评分标准)。该架构实现了模型优势互补,在保
《10 分钟搭建 CrewAI 环境》 - 详细安装步骤(Windows/macOS/Linux) - API Key 获取与配置 - 验证安装是否成功。:14 年测试生涯,我见证了从手工测试到 AI 测试。- ✅ 生成 5 份专业报告(测试计划/用例/结果/分析/最终报告)- 生成 5 份专业报告(测试计划/用例/结果/分析/最终报告):配置复杂,文档分散,适合快速原型但不适合生产。:适合测试流
负载箱故障模式与技术局限分析 摘要:本文系统分析了负载箱在功率回路、冷却系统、测量控制等关键子系统的典型故障模式。功率回路中接触器触点粘连、电阻退化、接线端子过热等问题主要由电弧侵蚀、材料老化和接触电阻增大引起;冷却系统故障多表现为风机异常、管路泄漏和冷却液变质;测量控制系统存在传感器漂移、PLC死机和精度超差等隐患。文章还揭示了负载箱在模拟真实负载方面的固有局限,包括纯阻性负载无法模拟无功功率、
本文围绕单元测试、集成测试、系统测试三层模型,厘清边界、对比差异,并给出 2026 年云原生 + AI 时代的高效落地方法,解决团队测试混乱、效率低、质量不可控的问题。
负载箱热设计是一项多约束优化工程,核心在于将电能转化的热能高效排出系统。文章系统分析了热传导、对流和辐射三大传热路径,重点阐述了风冷系统的风量计算、风机选型与风道优化,以及液冷系统的冷板换热、流量匹配与流阻权衡。针对瞬态工况,探讨了突加/突卸负载的热管理策略。文章还强调环境因素修正(海拔、温度、空间)和热测试验证的重要性,并展望了液冷普及化、相变储热、AI温控等前沿技术方向。热设计需要在传热效率、
在人工智能技术快速发展的今天,多步骤Agent工作流已经成为构建复杂智能系统的核心架构。本文将深入探讨如何对这类系统进行有效的集成测试,从基础概念到实际实现,全方位解析这个复杂但至关重要的主题。我们将通过生动的比喻、详细的代码示例和实用的测试策略,帮助读者理解和掌握集成测试多步骤Agent工作流的方法和技巧。无论你是AI系统开发者、测试工程师还是架构师,这篇文章都将为你提供宝贵的知识和实践指导。A
上周排查一个生产环境问题,用户上传文件偶尔会超时,日志里没有任何异常堆栈。最初怀疑是Nginx配置问题,折腾半天无果。后来在本地用curl循环测试了上百次,终于复现了一次——服务端日志显示请求进来了,但业务逻辑根本没执行。问题出在依赖注入的一个异步函数里,某个条件分支下忘了写await。这种问题在开发时很难发现,因为大多数测试用例都走了正常流程。这件事让我重新审视了测试策略:光有单元测试不够,集成
本文系统讲解Java测试体系,涵盖测试金字塔模型、单元测试(FIRST原则、JUnit5/Mockito/AssertJ实战)、集成测试(TestContainers真实环境)、TDD红-绿-重构实践,以及覆盖率认知、CI/CD集成等落地准则,助力开发者构建高质可维护代码。
自动化测试的核心问题,从来不是“如何写脚本”,而是“如何正确表达测试”。传统脚本模式将业务逻辑强绑定在界面结构和执行流程中,一旦系统变化,测试即失效。而AI的引入,并没有解决这一问题,反而放大了脚本的混乱,使自动化系统变得不可维护、不可审计。真正可持续的方向,是从脚本驱动转向模型驱动,将对象、行为、数据和场景进行解耦与结构化表达。在此基础上,AI才能发挥价值,提升效率而不是放大风险。未来自动化测试
索尼Altair半导体公司通过引入Qoitech的Otii工具套件,成功解决了蜂窝物联网芯片组开发中的能效验证难题。作为全球领先的蜂窝物联网和图像感知AI供应商,Altair面临着测试设备昂贵、验证流程低效等挑战。Otii工具实现了三大突破:1)使每位工程师都能独立进行高精度功耗测量;2)大幅缩短产品验证周期;3)建立了与客户统一的测试标准,使现场问题复现率显著降低。这一创新不仅优化了ALT135
LSTM(长短期记忆神经网络)LSTM 是一种特殊的循环神经网络(RNN),它擅长处理时间序列数据,能够解决传统 RNN 中的梯度消失和梯度爆炸问题。它通过门控机制(输入门、遗忘门和输出门)来控制信息的流动,从而有效地记住长期依赖的信息。注意力机制(Attention)注意力机制就像是人的注意力一样,在处理数据时,它能让模型更加关注输入数据中对当前输出更重要的部分。结合 LSTM 使用,可以显著提
Browser-use 是一个开源的 Python 库,旨在通过集成大型语言模型(LLM)实现智能浏览器自动化。它允许开发者使用自然语言描述任务,让 AI 代理自主完成复杂的网页交互操作。核心定位:GitHub 数据(截至 2025年):Browser-use 采用三层架构模型:外部服务Browser 层 - 浏览器交互Controller 层 - 动作执行Agent 层 - 决策中心用户层发送上
一个前后端分离的个人博客系统,采用云服务器部署,包含登录、列表、详情和编辑四个主要页面。系统实现了基础功能如登录验证、博客发布、删除和用户注销。文章重点描述了自动化测试方案:使用Selenium4+JUnit5框架,通过分页测试类、参数化用例、隐式等待等技术实现功能验证,并采用Allure生成可视化报告。测试过程强调执行顺序控制、异常场景覆盖和性能优化,同时指出了系统在高并发下的稳定性问题。项目源
基于自抗扰控制器ADRC的永磁同步电机FOC1.转速环采用ADRC,和传统PI进行对比来分析ADRC控制性能的优越性。对ADRC中的ESO进行改进,进一步提高了ADRC性能。2.提供算法对应的参考文献和仿真模型仿真模型纯手工搭建,不是从网络上复制得到。仿真模型仅供学习参考在永磁同步电机(PMSM)的控制领域,FOC(磁场定向控制)技术已然成为主流。而在转速环控制中,传统的PI控制器虽然应用广泛,但
摘要:AI技术正在革新自动化测试领域,通过5大核心能力显著提升测试效率:智能用例生成可提升300%设计效率;视觉语义定位解决元素定位痛点;智能执行优化异常处理;缺陷检测实现分钟级根因定位;用例库智能维护保持测试有效性。落地路径建议分4阶段实施:工具选型、用例开发、CI/CD集成和持续优化。主流工具如Playwright+Stagehand、Testim.io等各具优势。最佳实践强调人工评审、小范围
通过上面的代码,我们用SVC解决了鸢尾花数据集的多分类问题,并且使用SHAP对模型的预测进行了解释分析。这样我们不仅能得到模型的分类结果,还能知道模型是根据哪些特征做出的决策。这在实际应用中非常有用,比如在医疗诊断、金融风险评估等领域,我们需要知道模型为什么会给出某个结果,以便更好地做出决策。希望这篇文章能帮助你理解SVC - SHAP在多分类问题中的应用,赶紧动手试试吧!
传统的分类问题可能只依赖单一特征,但现实世界的数据往往包含多个维度的信息。多特征输入模型正是为了更好地利用这些丰富的数据,从而提升分类预测的准确性。比如在预测客户是否会购买某产品时,我们可以考虑客户的年龄、购买历史、浏览习惯等多个特征,以此构建一个更全面的预测模型。
JCR1区算法改进]SCNGO-CNN-LSTM-Attention数据分类预测程序。改进算法,融合正余弦和折射反向学习的北方苍鹰优化算法,目前应该没有文献这样做,创新性极高程序平台:无Attention适用于MATLAB 2020版及以上版本;融合Attention要求Matlab2023版以上代码说明:基于融合正余弦和折射反向学习的北方苍鹰优化算法(SCNGO)、卷积神经网络(CNN)和长短期
自动耐电流测试仪对高端集成电路的应用