AI Agent与传统RPA的融合:自动化办公的新纪元
AI Agent与传统RPA的融合:自动化办公的新纪元
摘要/引言
开门见山:办公室自动化的“最后一公里”困局
2024年全球疫情常态化管理的第四个年头,企业数字化转型早已从“可选项”变成了“生存刚需”,据Gartner《2024年全球CIO议程报告》显示,89%的受访CIO将“业务流程端到端自动化”列为2024-2026年的Top3战略投资方向——但现实却是残酷的:IDC同期发布的《亚太区(不含日本)RPA市场趋势与预测》指出,超过62%的企业已部署的RPA机器人仍停留在“规则明确、结构化数据、单一场景操作”的第一阶段,仅能覆盖全流程办公的30%-50%环节,剩下的“非结构化文档处理(如手写发票、邮件附件决策建议)、复杂业务逻辑推断(如客户投诉分类后的个性化安抚话术选择、跨部门审批流程的临时异常处理)、动态环境交互(如网页弹窗的非固定识别、移动端应用的版本适配)”等办公环节,依然是依赖人工的“半自动化孤岛”,这成了企业数字化提速、降本、提效的“最后一公里”甚至是“隐形天花板”。
举个大家感同身受的互联网大厂实习生转正审批例子:传统RPA机器人最多能做到“自动抓取人力资源管理系统(HRMS)里的实习生实习时长、KPI达成率数据,检查是否满足实习转正的硬性门槛(比如时长≥180天、季度KPI≥90分、无考勤严重违规),如果满足就自动把审批模板填好上传到OA系统发起第一级审批”——但接下来的环节呢?比如如果实习生实习时长只有175天但有3个重点项目的超额贡献证明(证明是非结构化的Word、PPT、项目群截图)、或者OA系统第二级审批卡在部门总监的“私人定制流程”(需要总监助理先把实习生的所有材料整理成一份可视化的简报再手动同步给总监的微信,总监审批通过后再截图回传给助理,助理再手动点击OA确认)、或者OA系统弹出了临时的“实习生实习期间安全培训补录提醒”弹窗但RPA机器人没训练过识别这个“动态UI变化”的非固定规则,这些环节RPA机器人就直接“罢工”了,最后整个流程的效率反而不如全手动,甚至还会出现“RPA漏填硬性门槛旁边的备注字段导致审批打回浪费2天、实习生超额贡献证明RPA识别错位置导致重点项目信息丢失影响转正”等问题——这就是传统RPA的“硬伤”。
问题陈述:为什么传统RPA走不出“第一阶段困境”?
那为什么传统RPA会有这些“硬伤”呢?我们得先从传统RPA的核心定义和技术架构说起(这个会在正文第一章详细展开,但这里可以先简单点出核心矛盾):
- 规则驱动的局限性:传统RPA本质上是一种“模拟人类鼠标键盘操作的规则脚本机器人”——它的每一个动作(比如“点击登录按钮、输入用户名密码、向下滚动3行、选中第2列的Excel数据复制粘贴到第3个输入框”)都必须由开发者提前用硬编码的规则(比如If…Then…Else、Loop Until)明确写死,没有规则它就“不知道该做什么”——但现实中的办公业务流程,规则往往是“80%明确、20%隐含、还有5%临时随机”的,比如上述的“实习生转正临时补录安全培训”就是临时随机规则,“助理整理简报同步总监微信再截图确认”就是部门总监的隐含私人定制规则,开发者根本不可能提前把所有这些隐含、随机的规则都写死;
- 结构化数据的局限性:传统RPA虽然也集成了一些基础的OCR(光学字符识别)工具,但只能识别“标准格式、清晰字体、固定位置”的结构化或半结构化数据(比如增值税专用发票的抬头、税号、金额等固定字段、标准PDF表格、打印清晰的英文合同条款)——对于非结构化数据(比如手写汉字发票、邮件正文的大段自然语言决策建议、项目群里的语音转文字+聊天截图组合、PPT里的图表说明文字),传统RPA的识别准确率极低(手写汉字OCR识别准确率在70%-85%之间,大段自然语言意图识别准确率几乎为0),根本无法提取有效信息;
- 动态环境的局限性:传统RPA通常是基于静态UI元素识别技术(比如通过元素的ID、XPath、CSS Selector、图片像素匹配)来定位目标的——但现实中的办公软件环境,UI元素经常会发生变化:比如网页更新了版本导致XPath/CSS Selector完全失效、OA系统弹出了临时的广告弹窗或系统升级弹窗、移动端应用换了主题或图标导致图片像素匹配失败——这些动态UI变化都会让传统RPA机器人“找不到目标”,从而停止运行;
- 无自主决策能力的局限性:传统RPA机器人本质上是一种“工具型机器人”——它只能“执行人类写好的规则命令”,没有任何自主学习、自主思考、自主决策、自主规划路径、自主解决突发问题的能力——比如上述的“实习生实习时长175天但有3个重点项目超额贡献”,传统RPA机器人只会“检查硬性门槛,不满足就终止流程”,根本不会“先判断超额贡献证明的真实性和重要性,再自主决定是发起特殊审批申请,还是先给实习生发一封邮件提醒补全剩余5天的考勤补录”。
核心价值:AI Agent+传统RPA=下一代“端到端智能自动化”
那有没有一种技术能解决传统RPA的这些“硬伤”呢?答案是AI Agent(人工智能智能体)!AI Agent是近年来大语言模型(LLM)技术爆发后诞生的一种“自主型机器人”——它能“感知环境、理解意图、自主规划路径、自主执行动作、自主学习经验、自主解决突发问题、自主与人交互协作”(这个也会在正文第一章详细展开)——如果我们把传统RPA的“规则驱动、结构化数据处理、精准静态操作”能力和AI Agent的“感知能力、自然语言理解能力、自主决策能力、自主规划能力、动态环境适应能力、非结构化数据处理能力”能力结合起来,就能创造出一种全新的“端到端智能自动化机器人”——它不仅能覆盖传统RPA能覆盖的“规则明确、结构化数据、单一场景操作”环节,还能覆盖剩下的“非结构化文档处理、复杂业务逻辑推断、动态环境交互、跨部门跨系统跨终端协作、自主解决突发问题”等环节,真正实现“从用户输入一句自然语言(比如‘帮我把这个月所有符合条件的供应商增值税专用发票报销了,注意李总上个月说过优先报销和我们合作超过5年的供应商的发票,金额超过10万的需要先把发票的真伪信息打印出来发给我确认一下真伪再报销’),到机器人自动完成所有操作(比如自动登录企业邮箱下载所有邮件附件的发票、用AI Agent+增强版OCR识别所有发票的结构化和非结构化信息、用AI Agent的自主决策能力筛选出符合条件的发票、用RPA机器人登录发票查验平台查验真伪、用AI Agent生成查验报告、用AI Agent的自主规划能力选择优先报销的供应商顺序、用RPA机器人登录财务系统填写报销单、用AI Agent生成李总确认金额超过10万发票真伪的邮件、自动同步给李总、李总回复确认后自动点击报销发起审批、审批通过后自动生成银行转账凭证、自动登录网银发起转账、转账完成后自动给供应商和财务人员发通知邮件、自动整理所有报销材料归档到企业云盘)”的“真正的无人值守全流程自动化”——这就是我们今天要讲的**“自动化办公的新纪元:AI Agent与传统RPA的融合”**!
据麦肯锡《2024年全球人工智能研究报告》预测,到2030年,AI Agent与传统RPA融合的“端到端智能自动化机器人”将能覆盖全流程办公的80%-90%环节,为全球企业节省超过10万亿美元的人工成本,同时将办公效率提升3-5倍——这个市场规模和增长潜力是非常巨大的,目前全球已经有很多科技巨头(比如微软的Power Platform Copilot+Power Automate RPA、Google的Duet AI for Workspace+AppSheet RPA、IBM的watsonx Orchestrate+IBM Robotic Process Automation、UiPath的UiPath AI Center+UiPath Orchestrator+UiPath Robots)和初创公司(比如Adept、Automation Anywhere的Automation 360、Workday的Workday Intelligent Automation)推出了相关的产品和解决方案,并且已经在金融、保险、医疗、零售、制造、互联网等多个行业得到了成功的应用。
文章概述:本文要讲什么?
为了让大家全面、深入地理解“AI Agent与传统RPA的融合”这一主题,本文将按照以下结构展开:
- 第一章:基础概念扫盲——什么是传统RPA?什么是AI Agent? 本章将先详细介绍传统RPA的核心定义、技术架构、核心优势、核心劣势、发展历史;然后详细介绍AI Agent的核心定义、技术架构(包括感知模块、大语言模型大脑、规划模块、执行模块、记忆模块、反思模块、交互模块)、核心能力、分类方法、发展历史;最后通过一个详细的概念核心属性维度对比markdown表格和一个概念联系的ER实体关系mermaid架构图和一个传统RPA与AI Agent的交互关系mermaid架构图,来帮助大家清晰地理解这两个概念之间的区别和联系;
- 第二章:融合的底层逻辑——为什么AI Agent和传统RPA能融合? 本章将先详细介绍融合的理论基础(包括互补性理论、协同效应理论、系统论);然后详细介绍融合的技术基础(包括增强版OCR技术、大语言模型微调技术、提示工程(Prompt Engineering)技术、检索增强生成(RAG)技术、LangChain/LlamaIndex等AI Agent开发框架、API接口技术、UI自动化技术的升级);最后详细介绍融合的数学模型(包括马尔可夫决策过程(MDP)模型、强化学习(RL)模型、多智能体协作(MAS)模型),并用Latex公式进行描述;
- 第三章:融合的架构与实现——如何构建一个AI Agent+传统RPA的融合系统? 本章将先详细介绍融合系统的通用五层架构(包括用户交互层、AI Agent核心层、RPA核心层、数据与知识层、基础设施层),并用mermaid架构图进行展示;然后详细介绍融合系统的核心实现步骤(包括第一步:业务流程拆解与优化、第二步:非结构化数据处理模块的构建、第三步:AI Agent的构建与训练、第四步:RPA机器人的构建与优化、第五步:AI Agent与RPA机器人的对接与集成、第六步:融合系统的测试与上线、第七步:融合系统的监控与迭代),并用mermaid流程图进行展示;然后详细介绍融合系统的核心功能设计(包括自然语言交互功能、非结构化数据处理功能、复杂业务逻辑推理功能、动态环境适应功能、跨部门跨系统跨终端协作功能、自主解决突发问题功能、自主学习与迭代功能);最后通过一个实际的互联网大厂实习生转正审批融合系统的案例,详细介绍融合系统的项目背景、环境安装、系统功能设计、系统架构设计、系统接口设计、系统核心实现源代码(Python+LangChain+UiPath Orchestrator API+OCR API)、最佳实践tips;
- 第四章:融合的边界与外延——AI Agent+传统RPA融合系统能做什么?不能做什么?未来会发展成什么样? 本章将先详细介绍融合系统的核心应用场景(包括金融行业的客户服务、贷款审批、合规审计、反洗钱;保险行业的客户投保、理赔处理、保单管理;医疗行业的病历录入、预约挂号、医保结算、药品采购;零售行业的订单处理、库存管理、客户分析、营销推广;制造行业的生产计划排程、设备维护、供应链管理;互联网行业的实习生转正审批、员工考勤管理、财务报销、项目管理);然后详细介绍融合系统的边界与局限性(包括成本高昂、对数据质量要求高、对大语言模型的依赖度高、安全性与隐私性问题、伦理问题、监管问题);然后详细介绍融合系统的最佳实践tips(包括“先小后大,先易后难”的试点原则、“业务流程拆解与优化先行”的原则、“数据治理与知识管理并行”的原则、“安全性与隐私性优先”的原则、“持续监控与迭代更新”的原则);然后详细介绍融合系统的行业发展与未来趋势,并用一个问题演变发展历史的markdown表格展示从“传统手工办公”到“传统RPA自动化办公”到“RPA+AI工具(比如OCR、NLP)的半智能自动化办公”到“AI Agent+传统RPA的端到端智能自动化办公”的整个演变过程;最后详细介绍融合系统的未来发展方向(包括多模态AI Agent+传统RPA的融合、多智能体协作(MAS)+传统RPA的融合、元宇宙/AR/VR+AI Agent+传统RPA的融合、联邦学习+AI Agent+传统RPA的融合、自主进化型AI Agent+传统RPA的融合);
- 第五章:本章小结与行动号召 本章将简要回顾文章的主要内容;再次强调读者从本文中学到的知识的重要性;提出一个开放性问题以引发讨论;邀请读者在评论区分享他们的想法或问题;最后展望一下该领域的未来发展。
第一章:基础概念扫盲——什么是传统RPA?什么是AI Agent?
核心概念1:传统RPA(Robotic Process Automation,机器人流程自动化)
1.1.1 核心定义
关于传统RPA的定义,目前全球主流的研究机构和科技公司都有自己的表述,但核心内容是一致的:
- Gartner(高德纳)的定义:传统RPA是一种“软件工具或平台,它允许开发者通过模拟人类与计算机系统的交互(比如鼠标点击、键盘输入、屏幕滚动、数据复制粘贴)来自动化执行重复性、规则明确、结构化数据的业务流程”——RPA机器人不会修改现有的软件系统或基础设施,它只是“坐在现有系统的‘顶层’,像人类员工一样操作这些系统”,因此也被称为“无侵入式的自动化技术”;
- UiPath(全球最大的RPA厂商之一)的定义:传统RPA是一种“数字劳动力(Digital Workforce),它可以替代人类员工执行‘三高三低’(高重复、高规则、高标准化、低价值、低技能、低创造性)的业务流程,从而释放人类员工的时间和精力去做更有价值、更有创造性的工作”;
- IDC(国际数据公司)的定义:传统RPA是一种“业务流程自动化(BPA)技术的子集,它使用结构化的自动化脚本和软件机器人来模拟人类与数字系统的交互,执行重复、可预测的任务”。
综合以上三个主流定义,我们可以将传统RPA的核心定义简化为:
传统RPA(Robotic Process Automation)是一种无侵入式的、规则驱动的、工具型的软件机器人技术,它通过模拟人类与计算机系统的鼠标键盘操作,来自动化执行重复性、规则明确、结构化数据的“三高三低”业务流程。
1.1.2 问题背景
传统RPA的诞生并不是偶然的,它是企业数字化转型的必然产物——在传统RPA诞生之前,企业的业务流程自动化主要依赖两种技术:
- 定制化软件开发(Custom Software Development):企业可以根据自己的业务流程需求,找软件公司定制开发一套专门的自动化软件系统——这种技术的优点是“功能强大、完全符合企业的业务流程需求”,但缺点也非常明显:“开发周期长(通常需要3-12个月)、开发成本高(通常需要几十万元到几百万元)、维护成本高(需要专门的技术团队维护)、灵活性差(如果业务流程发生了一点变化,就需要重新修改代码,修改周期也很长)”——这种技术只适合那些“业务流程非常稳定、长期不变、预算充足”的大型企业;
- 脚本自动化(Script Automation):企业的IT人员可以使用Python、VBA、Shell等脚本语言,自己编写一些简单的自动化脚本来执行重复性的任务——这种技术的优点是“开发周期短(通常需要1-7天)、开发成本低(几乎不需要额外的预算)、灵活性相对较高(如果业务流程发生了一点变化,IT人员可以快速修改脚本)”,但缺点也非常明显:“功能有限(只能执行一些非常简单的任务,比如Excel数据的复制粘贴、文件的批量重命名)、可读性差(IT人员离职后,新的IT人员很难理解和修改之前的脚本)、可维护性差(如果软件系统的UI发生了一点变化,脚本就会失效)、可扩展性差(很难实现跨系统、跨终端的协作)、安全性差(如果脚本编写不当,可能会损坏软件系统或数据)”——这种技术只适合那些“任务非常简单、IT人员技术水平较高、业务流程变化不大”的中小型企业。
正是因为这两种传统的业务流程自动化技术都有明显的局限性,无法满足企业“快速、低成本、高灵活、无侵入式”的自动化需求,所以传统RPA技术才在2010年左右应运而生。
1.1.3 问题描述
在传统RPA诞生之前,企业面临的主要业务流程自动化问题就是我们在摘要里提到的:
- “三高三低”业务流程耗费了大量的人工成本和时间成本:据Gartner统计,全球企业每年在“三高三低”业务流程上耗费的人工成本超过5万亿美元,耗费的时间成本占人类员工总工作时间的30%-50%——这些“三高三低”业务流程不仅让人类员工感到枯燥乏味、工作积极性下降,还容易出现人为错误(据研究,人类员工在执行重复性任务时的错误率在0.5%-5%之间);
- 传统的定制化软件开发和脚本自动化技术无法满足企业的自动化需求:正如我们刚才所说的,这两种技术要么“开发周期长、成本高、灵活性差”,要么“功能有限、可维护性差、可扩展性差”;
- 企业的软件系统越来越多,跨系统、跨终端的协作越来越困难:随着企业数字化转型的深入,企业通常会部署几十套甚至上百套不同的软件系统(比如HRMS、OA、CRM、ERP、财务系统、发票查验平台、网银系统),这些软件系统通常是由不同的软件公司开发的,使用不同的技术栈,没有统一的API接口,跨系统、跨终端的数据传输和协作只能依赖人工手动操作——这不仅效率低下,还容易出现人为错误。
1.1.4 问题解决
传统RPA技术的出现,很好地解决了上述问题:
- 替代人类员工执行“三高三低”业务流程,节省人工成本和时间成本,降低人为错误率:传统RPA机器人可以“24小时×7天×365天不间断工作”,不需要休息、不需要加班、不需要支付工资和福利,错误率几乎为0(只要规则写得正确),工作效率是人类员工的3-10倍——据UiPath统计,一个传统RPA机器人一年可以为企业节省10-50万元的人工成本;
- 无侵入式的自动化技术,不需要修改现有的软件系统或基础设施:传统RPA机器人只是“坐在现有系统的‘顶层’,像人类员工一样操作这些系统”,不需要修改现有系统的代码,不需要与现有系统的开发商合作,部署周期短(通常需要1-4周)、部署成本低(通常需要几万元到几十万元)、灵活性高(如果业务流程发生了一点变化,只需要修改RPA机器人的规则脚本,修改周期通常需要1-3天);
- 支持跨系统、跨终端的协作:传统RPA机器人通常支持多种操作系统(比如Windows、MacOS、Linux)、多种终端(比如PC端、移动端、平板端)、多种软件系统(比如Web应用、桌面应用、Citrix虚拟桌面应用、SAP ERP应用)——通过RPA平台的编排功能(比如UiPath Orchestrator、Automation Anywhere Control Room),可以实现多个RPA机器人之间的协作,也可以实现RPA机器人与人类员工之间的协作(比如RPA机器人完成大部分操作后,给人类员工发一个通知,让人类员工完成最后的确认或决策)。
1.1.5 概念结构与核心要素组成
传统RPA的概念结构通常可以分为三层:
- RPA开发工具层(Designer/Studio):这是开发者用来构建RPA机器人规则脚本的工具——开发者通常不需要掌握复杂的编程语言(比如Python、Java),只需要通过“拖拽式可视化编程”的方式,把预定义的“活动(Activity)”(比如“点击登录按钮”、“输入用户名密码”、“向下滚动3行”、“选中第2列的Excel数据复制粘贴到第3个输入框”)拖拽到画布上,然后配置相应的参数(比如用户名密码、XPath/CSS Selector、Excel文件路径),就可以构建出一个RPA机器人的规则脚本;
- RPA机器人层(Robot/Bot):这是执行RPA机器人规则脚本的“数字劳动力”——RPA机器人通常可以分为两种类型:
- 有人值守型RPA机器人(Attended RPA Robot):也称为“辅助型RPA机器人”,它需要和人类员工一起工作,部署在人类员工的PC端上,当人类员工触发某个操作(比如点击一个按钮、打开一个文件)时,它就会自动执行相应的规则脚本——这种类型的RPA机器人适合那些“需要人类员工进行确认或决策、业务流程不完全规则化”的场景;
- 无人值守型RPA机器人(Unattended RPA Robot):也称为“自主型RPA机器人”,它不需要和人类员工一起工作,部署在专门的服务器或虚拟机上,按照预设的时间(比如每天早上9点)或触发条件(比如收到一封特定主题的邮件)自动执行相应的规则脚本——这种类型的RPA机器人适合那些“完全规则化、不需要人类员工干预”的场景;
- RPA编排管理层(Orchestrator/Control Room):这是管理和监控所有RPA机器人的中央平台——它的主要功能包括:
- 机器人调度与管理:按照预设的时间或触发条件,调度无人值守型RPA机器人执行规则脚本;管理所有RPA机器人的状态(比如在线、离线、运行中、暂停中、出错中);
- 规则脚本的存储与版本控制:存储所有RPA机器人的规则脚本;对规则脚本进行版本控制(比如可以回滚到之前的版本);
- 监控与告警:实时监控所有RPA机器人的运行状态和执行结果;如果RPA机器人出错,就会自动给管理员发一个告警通知(比如邮件、短信、微信);
- 日志与审计:记录所有RPA机器人的运行日志和执行结果;生成审计报告,满足企业的合规审计需求;
- 权限管理:管理不同用户(比如管理员、开发者、业务用户)对RPA平台的访问权限。
除了这三层核心概念结构之外,传统RPA的核心要素组成还包括:
- UI元素识别技术:这是传统RPA机器人的“眼睛”——它帮助RPA机器人定位目标UI元素(比如登录按钮、输入框、Excel单元格)——常用的UI元素识别技术包括:
- 静态属性识别技术:通过UI元素的ID、XPath、CSS Selector、Name、Class等静态属性来定位目标UI元素——这种技术的优点是“定位速度快、准确率高”,但缺点是“如果UI元素的静态属性发生了变化,就会定位失败”;
- 图像像素匹配技术:通过UI元素的图像像素来定位目标UI元素——这种技术的优点是“不需要UI元素的静态属性,适合定位那些没有静态属性的UI元素(比如Citrix虚拟桌面应用里的UI元素)”,但缺点是“定位速度慢、准确率低、如果UI元素的图像发生了变化(比如换了主题或图标),就会定位失败”;
- 文本识别技术(OCR):通过UI元素上的文本内容来定位目标UI元素——这种技术的优点是“不需要UI元素的静态属性,适合定位那些有文本内容的UI元素”,但缺点是“定位速度慢、准确率低、如果UI元素上的文本内容发生了变化,就会定位失败”;
- 数据处理技术:这是传统RPA机器人的“大脑辅助工具”——它帮助RPA机器人处理结构化或半结构化数据——常用的数据处理技术包括:
- Excel/CSV数据处理技术:帮助RPA机器人读取、写入、修改Excel/CSV文件里的数据;
- 数据库数据处理技术:帮助RPA机器人连接、查询、插入、更新、删除数据库里的数据;
- 基础OCR技术:帮助RPA机器人识别“标准格式、清晰字体、固定位置”的结构化或半结构化数据;
- API接口技术:这是传统RPA机器人与其他软件系统或工具进行交互的“桥梁”——如果其他软件系统或工具有统一的API接口,传统RPA机器人就可以通过API接口直接与它们进行交互,而不需要通过模拟鼠标键盘操作——这种方式的优点是“交互速度快、准确率高、稳定性好、不需要依赖UI元素”,但缺点是“需要其他软件系统或工具有统一的API接口”。
1.1.6 核心优势与核心劣势
1.1.6.1 核心优势
传统RPA的核心优势主要包括以下几点:
- 无侵入式:不需要修改现有的软件系统或基础设施,部署风险低;
- 规则驱动,精准执行:只要规则写得正确,错误率几乎为0,工作效率是人类员工的3-10倍;
- 24小时×7天×365天不间断工作:不需要休息、不需要加班、不需要支付工资和福利,节省大量的人工成本和时间成本;
- 拖拽式可视化编程:开发者通常不需要掌握复杂的编程语言,学习门槛低,开发周期短(通常需要1-4周);
- 支持跨系统、跨终端的协作:支持多种操作系统、多种终端、多种软件系统;
- 可监控、可审计、可追溯:通过RPA编排管理层,可以实时监控所有RPA机器人的运行状态和执行结果,生成审计报告,满足企业的合规审计需求;
- 灵活性高:如果业务流程发生了一点变化,只需要修改RPA机器人的规则脚本,修改周期通常需要1-3天。
1.1.6.2 核心劣势
传统RPA的核心劣势也正是我们在摘要里提到的那些“硬伤”:
- 规则驱动的局限性:只能执行人类提前写好的规则命令,没有任何自主学习、自主思考、自主决策、自主规划路径、自主解决突发问题的能力;
- 结构化数据的局限性:虽然也集成了一些基础的OCR工具,但只能识别“标准格式、清晰字体、固定位置”的结构化或半结构化数据,对于非结构化数据的识别准确率极低;
- 动态环境的局限性:通常是基于静态UI元素识别技术来定位目标的,如果UI元素发生了变化,就会定位失败,从而停止运行;
- 无自然语言交互能力:无法理解人类的自然语言输入,只能通过预设的触发条件(比如时间、特定主题的邮件)或人类员工的手动操作来触发运行;
- 单一场景的局限性:通常只能执行单一场景的操作,很难实现跨场景、跨部门的复杂业务流程协作;
- 可扩展性差:虽然支持跨系统、跨终端的协作,但如果需要实现更复杂的功能(比如复杂业务逻辑推理、非结构化数据处理、动态环境适应),就需要与其他AI工具(比如OCR、NLP、ML)集成,集成难度大,开发周期长。
1.1.7 发展历史
传统RPA的发展历史可以分为以下四个阶段:
- 萌芽期(1990s-2010年):在这个阶段,虽然还没有“RPA”这个正式的术语,但已经出现了一些类似RPA的技术和工具——比如1990s出现的“屏幕抓取(Screen Scraping)”技术(可以抓取屏幕上的文本内容)、2000年左右出现的“业务流程管理(BPM)”工具(可以对业务流程进行建模、分析、优化)、2005年左右出现的“桌面自动化(Desktop Automation)”工具(比如AutoHotkey、Macro Recorder,可以通过模拟鼠标键盘操作来执行重复性的任务)——这些技术和工具为传统RPA的诞生奠定了基础;
- 诞生期(2010-2015年):在这个阶段,“RPA”这个正式的术语开始出现,全球第一家专门的RPA厂商也诞生了——2010年,Blue Prism(全球第一家专门的RPA厂商)在英国成立,推出了全球第一款专门的RPA平台“Blue Prism Robotic Process Automation”;2012年,UiPath(全球最大的RPA厂商之一)在罗马尼亚成立,推出了自己的RPA平台;2013年,Automation Anywhere(全球最大的RPA厂商之一)在美国成立,推出了自己的RPA平台——这三家厂商被称为“RPA三巨头”,它们的成立标志着传统RPA技术的正式诞生;
- 快速发展期(2015-2020年):在这个阶段,传统RPA技术得到了快速的发展和广泛的应用——全球越来越多的科技巨头(比如微软、Google、IBM、SAP)开始进入RPA市场,推出了自己的RPA平台;全球越来越多的企业(尤其是金融、保险、医疗、零售等行业的大型企业)开始部署RPA机器人,以节省人工成本和时间成本;Gartner、IDC等主流研究机构也开始发布关于RPA市场的研究报告,预测RPA市场的未来发展前景——据Gartner统计,2019年全球RPA市场规模达到了130亿美元,同比增长了63%;
- 融合转型期(2020年至今):在这个阶段,随着大语言模型(LLM)技术的爆发(比如2020年OpenAI推出GPT-3、2022年OpenAI推出ChatGPT、2023年OpenAI推出GPT-4、2024年OpenAI推出GPT-4o),传统RPA技术开始进入“融合转型期”——全球越来越多的RPA厂商和科技巨头开始将传统RPA技术与AI Agent技术(基于LLM)、增强版OCR技术、NLP技术、ML技术、RAG技术等AI技术融合起来,推出了“端到端智能自动化机器人”——这就是我们今天要讲的主题。
为了让大家更清晰地理解传统RPA的发展历史,我们可以用一个markdown表格来展示:
| 发展阶段 | 时间范围 | 核心事件与技术 | 市场规模与应用情况 |
|---|---|---|---|
| 萌芽期 | 1990s-2010年 | 屏幕抓取(Screen Scraping)技术、业务流程管理(BPM)工具、桌面自动化(Desktop Automation)工具(比如AutoHotkey、Macro Recorder)诞生 | 市场规模很小,只有少数IT人员在使用桌面自动化工具执行简单的重复性任务 |
| 诞生期 | 2010-2015年 | “RPA”正式术语出现;RPA三巨头(Blue Prism、UiPath、Automation Anywhere)成立并推出专门的RPA平台 | 市场规模开始增长,只有少数金融、保险等行业的大型企业在试点部署RPA机器人 |
| 快速发展期 | 2015-2020年 | 科技巨头(微软、Google、IBM、SAP)进入RPA市场;传统RPA技术开始与基础AI工具(OCR、NLP)集成;Gartner、IDC等主流研究机构发布RPA市场研究报告 | 市场规模快速增长,2019年达到130亿美元,同比增长63%;全球越来越多的行业和企业开始部署RPA机器人 |
| 融合转型期 | 2020年至今 | 大语言模型(LLM)技术爆发(GPT-3、ChatGPT、GPT-4、GPT-4o);传统RPA技术开始与AI Agent技术(基于LLM)、增强版OCR技术、NLP技术、ML技术、RAG技术等深度融合;推出“端到端智能自动化机器人” | 市场规模继续增长,据Gartner预测,2024年全球RPA+AI市场规模将达到300亿美元;全球越来越多的企业开始部署“端到端智能自动化机器人” |
核心概念2:AI Agent(人工智能智能体)
1.2.1 核心定义
关于AI Agent的定义,目前全球主流的研究机构、科技公司和学术机构都有自己的表述,但核心内容也是一致的:
- 斯坦福大学HAI(Human-Centered AI Institute)的定义:AI Agent是一种“自主的计算机系统,它可以感知环境、理解意图、自主规划路径、自主执行动作、自主学习经验、自主解决突发问题、自主与人或其他智能体交互协作,以实现用户给定的目标”;
- OpenAI的定义:AI Agent是一种“使用大语言模型(LLM)作为核心大脑的自主系统,它可以通过API接口与其他工具(比如Web浏览器、计算器、数据库、RPA机器人)交互,以实现更复杂的功能”;
- 微软的定义:AI Agent是一种“数字助手,它可以理解用户的自然语言输入,自主规划和执行一系列任务,以满足用户的需求”;
- 学术领域经典的定义(来自Russell & Norvig的《人工智能:一种现代的方法》):AI Agent是一种“可以通过传感器感知环境、通过执行器作用于环境的实体”——这个定义是AI Agent最原始、最经典的定义,后来所有的AI Agent定义都是在这个定义的基础上发展而来的。
综合以上四个主流定义,我们可以将基于大语言模型(LLM)的现代AI Agent的核心定义简化为:
基于大语言模型(LLM)的现代AI Agent是一种自主的、感知-决策-执行循环的、工具集成型的智能系统,它以大语言模型(LLM)为核心大脑,通过传感器感知环境(包括物理环境和数字环境),理解用户的自然语言意图,自主规划实现目标的路径,自主选择和使用各种工具(比如Web浏览器、计算器、数据库、RPA机器人、OCR工具)执行动作,自主从执行结果中学习经验,自主解决突发问题,自主与人或其他智能体交互协作,以实现用户给定的目标。
这里需要特别强调的是:我们今天讲的AI Agent,主要是指“基于大语言模型(LLM)的现代AI Agent”——因为在大语言模型(LLM)技术爆发之前,也有一些AI Agent(比如基于规则的AI Agent、基于强化学习的AI Agent),但它们的能力非常有限,只能执行一些非常简单的任务,无法应用到实际的办公场景中——直到大语言模型(LLM)技术爆发之后,AI Agent才获得了“理解自然语言、自主规划路径、自主选择和使用工具、自主学习经验”的能力,才真正具备了应用到实际办公场景中的潜力。
1.2.2 问题背景
基于大语言模型(LLM)的现代AI Agent的诞生,也是企业数字化转型和大语言模型技术爆发的必然产物——在基于大语言模型(LLM)的现代AI Agent诞生之前,企业的“半智能自动化”主要依赖两种技术:
- 传统RPA+基础AI工具(比如OCR、NLP):正如我们刚才所说的,这种技术虽然可以比传统RPA多处理一些半结构化数据,但仍然存在“规则驱动的局限性、非结构化数据处理的局限性、动态环境的局限性、无自主决策能力的局限性”等问题;
- 大语言模型(LLM)本身:大语言模型(LLM)本身的能力非常强大(比如理解自然语言、生成自然语言、翻译、编程、推理、创作),但它也有明显的局限性:
- 无实时信息获取能力:大语言模型(LLM)的训练数据通常是截止到某个时间点的(比如GPT-4的训练数据截止到2023年10月),无法获取实时信息(比如今天的天气、今天的股票价格、最新的新闻);
- 无精确计算能力:大语言模型(LLM)的计算能力非常有限,无法执行精确的数学计算(比如复杂的财务报表计算、复杂的科学计算);
- 无结构化数据处理能力:大语言模型(LLM)虽然可以理解自然语言,但很难处理大量的结构化数据(比如Excel文件里的10000行数据、数据库里的100000条记录);
- 无数字环境操作能力:大语言模型(LLM)无法直接操作数字环境(比如无法直接点击登录按钮、无法直接填写输入框、无法直接上传文件);
- 无长期记忆能力:大语言模型(LLM)的上下文窗口(Context Window)通常是有限的(比如GPT-3.5的上下文窗口是4K Token,GPT-4的上下文窗口是8K Token,GPT-4 Turbo的上下文窗口是128K Token,GPT-4o的上下文窗口是128K Token),无法记住长期的对话历史和执行经验;
- 无自主规划和工具使用能力:虽然有些大语言模型(比如GPT-4、Claude 3)支持“函数调用(Function Calling)”功能,但它只是“被动地调用用户提前定义好的函数”,没有任何“自主规划实现目标的路径、自主选择和使用合适的工具”的能力。
正是因为这两种“半智能自动化”技术都有明显的局限性,无法满足企业“端到端智能自动化”的需求,所以基于大语言模型(LLM)的现代AI Agent技术才在2022年ChatGPT推出之后应运而生。
1.2.3 问题描述
在基于大语言模型(LLM)的现代AI Agent诞生之前,企业面临的主要“端到端智能自动化”问题就是我们在摘要里提到的:
- 非结构化数据处理困难:无法高效、准确地处理手写汉字发票、邮件正文的大段自然语言决策建议、项目群里的语音转文字+聊天截图组合、PPT里的图表说明文字等非结构化数据;
- 复杂业务逻辑推断困难:无法高效、准确地进行客户投诉分类后的个性化安抚话术选择、跨部门审批流程的临时异常处理、实习生转正的特殊审批判断等复杂业务逻辑推断;
- 动态环境适应困难:无法适应网页更新版本、OA系统弹出临时弹窗、移动端应用换主题或图标等动态UI变化;
- 无自然语言交互能力:无法理解用户的自然语言输入,只能通过预设的触发条件或手动操作来触发运行;
- 无自主规划和工具使用能力:无法自主规划实现目标的路径,无法自主选择和使用合适的工具;
- 无长期记忆和自主学习能力:无法记住长期的对话历史和执行经验,无法从执行结果中自主学习经验,优化自己的行为。
1.2.4 问题解决
基于大语言模型(LLM)的现代AI Agent技术的出现,很好地解决了上述问题:
- 高效、准确地处理非结构化数据:通过与增强版OCR工具(比如Azure Computer Vision、Google Cloud Vision、Baidu OCR、Tesseract OCR+LLM微调)、语音识别工具(比如Azure Speech to Text、Google Cloud Speech to Text、OpenAI Whisper)、多模态大语言模型(比如GPT-4o、Claude 3 Opus、Gemini 1.5 Pro)集成,AI Agent可以高效、准确地处理手写汉字发票、邮件正文的大段自然语言决策建议、项目群里的语音转文字+聊天截图组合、PPT里的图表说明文字等各种类型的非结构化数据;
- 高效、准确地进行复杂业务逻辑推断:以大语言模型(LLM)为核心大脑,通过检索增强生成(RAG)技术加载企业的业务规则知识库、历史案例知识库,AI Agent可以高效、准确地进行客户投诉分类后的个性化安抚话术选择、跨部门审批流程的临时异常处理、实习生转正的特殊审批判断等复杂业务逻辑推断;
- 适应动态环境变化:通过与多模态大语言模型(比如GPT-4o、Claude 3 Opus、Gemini 1.5 Pro)集成,AI Agent可以通过“视觉感知+自然语言理解”的方式来定位目标UI元素,不需要依赖静态属性或图像像素,即使UI元素发生了变化,也能快速适应;
- 支持自然语言交互:以大语言模型(LLM)为核心大脑,AI Agent可以理解用户的自然语言输入(比如“帮我把这个月所有符合条件的供应商增值税专用发票报销了”),可以用自然语言回复用户(比如“好的,我已经开始处理了,请问你需要优先报销和我们合作超过5年的供应商的发票吗?”),可以用自然语言向用户询问必要的信息(比如“请问你需要报销的发票在哪个邮箱的哪个文件夹里?”);
- 自主规划实现目标的路径,自主选择和使用合适的工具:以大语言模型(LLM)为核心大脑,通过提示工程(Prompt Engineering)技术或强化学习(RL)技术,AI Agent可以自主规划实现目标的路径(比如“第一步:登录企业邮箱下载所有发票;第二步:识别所有发票的信息;第三步:筛选符合条件的发票;第四步:查验发票真伪;第五步:填写报销单;第六步:发起审批;第七步:归档材料”),可以自主选择和使用合适的工具(比如“登录企业邮箱用Outlook API,识别发票用Azure Computer Vision+GPT-4o,筛选符合条件的发票用Python代码,查验发票真伪用国家税务总局发票查验平台的RPA机器人,填写报销单用财务系统的RPA机器人,发起审批用OA系统的API,归档材料用企业云盘的API”);
- 长期记忆和自主学习能力:通过记忆模块(比如向量数据库、关系型数据库),AI Agent可以记住长期的对话历史和执行经验;通过反思模块(基于LLM),AI Agent可以从执行结果中自主反思自己的行为,总结经验教训,优化自己的提示词或规则脚本,从而提高自己的执行效率和准确率。
1.2.5 概念结构与核心要素组成
基于大语言模型(LLM)的现代AI Agent的概念结构通常可以分为七层(这也是目前全球主流的AI Agent开发框架(比如LangChain、LlamaIndex、AutoGPT、BabyAGI、Microsoft AutoGen)采用的通用架构):
- 感知模块(Perception Module):这是AI Agent的“眼睛、耳朵、鼻子、皮肤”——它帮助AI Agent感知环境(包括物理环境和数字环境)——常用的感知工具包括:
- 多模态大语言模型(比如GPT-4o、Claude 3 Opus、Gemini 1.5 Pro):可以感知图像、视频、音频、文本等多种类型的信息;
- **增强版OCR工具
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)