云端智能体最难的地方不是模型

云端智能体最难的地方不是模型
你以为云端智能体拼的是模型能力,结果 Cursor 那篇复盘把桌子一掀。
真正难的,是给它一间能干活的屋子。
这句话听起来有点普通,但越想越扎心。因为很多人聊 Agent,还是停在提示词、规划能力、工具调用这些词上。可一旦任务从本地跑到云端,问题立刻变成另一种东西。
它不再像聊天。
它更像雇了一个远程工程师。
远程工程师要能打开仓库,要能跑测试,要能看日志,要能知道上一次做到哪儿,还要在你睡觉的时候别把环境搞炸。
Cursor 的经验里,最关键的一点是完整开发环境决定输出质量。他们后来发现,云端智能体不是把本地 Agent 搬到服务器就完事了。你得重建一整套基础设施,让它拥有接近真人开发者的上下文。
我一开始看到这儿的时候,第一反应是,有点反直觉。
因为我们平时总会盯着模型本身看。哪个模型更会写代码,哪个模型更懂架构,哪个模型工具调用更稳。可到了长任务场景,模型只是里面的一块。真正拖后腿的,经常是环境。
比如依赖装不上。
比如测试跑不起来。
比如分支状态和对话状态纠缠在一起。
比如机器已经变了,但 Agent 还以为世界停在上一轮。
这些东西听起来不性感,可它们决定了 Agent 到底是在认真工作,还是在一个假舞台上表演工作。
从会回答到会交付,中间隔着一套脏活
云端智能体最诱人的地方,是它可以并行、无人值守、处理长任务。
你丢给它一个需求,它自己开环境,自己改代码,自己跑验证,交给你一个 PR。这个画面太美了,几乎所有开发工具都会往这个方向讲故事。
但 Cursor 的复盘里有个很现实的数字。他们把可靠性迁到 Temporal 之后,才把可靠性拉到 99.9% 以上。
这个数字背后不是一句口号。
它说明 Agent 产品到了云端以后,很多问题已经不是模型推理问题,而是分布式系统问题。任务会中断,机器会失联,依赖会漂移,状态会不一致,用户会在中途追加要求。
说真的,这才是最容易被低估的地方。
大家看到的是 Agent 终于能自己写代码了。真正难的是,它写到一半崩了,还能不能回来继续写。它并行跑了三条线,事后能不能知道哪条线是有效的。它改完代码,能不能留下足够清楚的证据,让人敢合进去。
这就像你不是在造一个更聪明的搜索框。
你是在造一个能扛事故的工位。
状态分离这件事,越看越重要
Cursor 提到一个很关键的设计,把智能体循环、机器状态和对话状态解耦。
这句话可能有点工程味,但它挺要命的。
智能体循环关心的是下一步做什么。机器状态关心的是环境里真实发生了什么。对话状态关心的是用户和 Agent 之间已经说了什么。
如果这三件事混在一起,短任务可能还能糊过去。长任务就会开始出怪问题。Agent 可能因为对话里一句旧话,坚持走一条已经失效的路。也可能因为机器状态变化,误以为用户意图变了。
我自己的感受是,未来很多 Agent 产品的差距,不会体现在界面上。
会体现在这些看不见的边界里。
边界清楚,系统就有韧性。边界含糊,演示的时候很惊艳,真实工作流里就容易碎。
这也是为什么我越来越觉得,Agent 工程有点像早期云计算。刚开始大家兴奋的是把东西放到云上,后来才发现,调度、隔离、观测、回滚、权限,才是真正撑起规模化的东西。
AI 这轮也是一样。
能跑一次 demo 不难。
难的是每天跑,跑很多次,跑坏了还能恢复。
另一个信号,Agent 正在从副驾驶变成异步同事
今天的新闻里还有 Codex 的更新。它已经可以在 Mac 锁屏的时候,通过手机安全使用你 Mac 上的应用。还有 Appshots,把应用窗口上下文带进 Codex 线程。
这两个点放在一起看,很有意思。
一个是云端 Agent 要有完整开发环境。另一个是本地电脑也开始变成 Agent 可以安全进入的工作现场。
过去 Copilot 的隐喻是副驾驶。你坐在驾驶位,它在旁边补全和建议。
现在这个隐喻开始变了。
它更像一个异步同事。你不一定盯着它,它也不一定只在编辑器里。它可能在云端跑一条任务线,也可能从你的本地应用里拿上下文,还可能在你锁屏之后继续处理一些低风险操作。
当然,这里面的安全问题会越来越大。
谁能访问什么应用,什么时候可以访问,访问后留下什么审计记录,失败了谁负责。只要 Agent 真正进入工作现场,这些问题就绕不开。
但方向已经很清楚了。
Agent 不再只是回答问题的东西。
它开始占用环境,消耗资源,产生副作用。
这也是为什么基础设施会变得这么重要。因为一旦有副作用,你就不能只问它聪不聪明了。你还要问它稳不稳,可不可控,出了问题能不能查。
真正的护城河可能很土
很多人会以为 Agent 产品的护城河是模型调用、提示词模板、漂亮交互。
我现在反而觉得,真正的护城河可能很土。
环境复现能力。
任务恢复能力。
权限和审计。
并行任务调度。
对代码库、测试、依赖、运行时的长期理解。
这些东西不适合做发布会大字报,但它们会决定一个团队敢不敢把真实工作交给 Agent。
这话听着有点刺耳但,如果一个 Agent 只能在干净 demo 里表现很好,它就还是玩具。如果它能在乱七八糟的项目里跑完任务,留下清楚记录,失败也能说清楚自己卡在哪儿,它才开始像工具。
甚至更进一步,像同事。
当然,我也不觉得这事马上就会顺滑。云端智能体会踩很多坑,权限会吓人,成本会波动,错误会很隐蔽。把一个会写代码的模型放进真实工程系统里,本来就不是轻松活。
可 Cursor 这篇复盘让我确认了一件事。
下一阶段的 Agent 竞争,表面上看是模型大战,背后其实是工作现场大战。
谁能把那间屋子搭好,谁就更接近交付。
开头说,真正难的是给智能体一间能干活的屋子。
现在看,这间屋子可能就是云端 Agent 的全部秘密。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐




所有评论(0)