未来具身智能生态猜想
上一篇(传送门)我聊了一个观点:为什么未来的主流机器人形态,很可能仍然绕不开“人形”,尤其是双足人形。
简单说,如果机器人只是为了干活,人形并不一定高效;但如果机器人要自然进入人类社会,成为服务、陪伴、交互、情绪价值的一部分,那么人形就是最容易被人理解和接受的形态。
这一篇,我想继续往后推一步。
如果未来真的会出现大量标准范式的人形机器人,那么下一个问题就是:
这些机器人的能力,到底由谁来开发?
是某一家机器人公司从硬件、本体、系统、基础模型、咖啡制作、养老护理、酒店服务、家庭收纳、儿童陪伴全部自己做完吗?
我认为不会。
甚至可以说,如果具身智能真的繁荣起来,它一定不会长期停留在“一家公司从头做到尾”的阶段,而会走向类似智能手机一样的分层生态。
一、早期行业总是大而全,成熟后一定会分层
很多新技术刚出现时,往往都是一家企业什么都做。
早期手机时代,硬件厂商不仅要做手机本体,还要做系统、基础软件、应用功能,甚至连用户能用什么功能,都要自己规划。
但这个状态不会长期存在。
随着硬件逐渐标准化、操作系统逐渐稳定、开发工具逐渐成熟,生态就会开始分层。
手机厂商不可能自己开发所有 App。
它可以做硬件、做系统、做应用商店、做基础能力,但它不可能同时成为最懂短视频、最懂外卖、最懂网约车、最懂游戏、最懂社交、最懂办公、最懂金融的公司。
因为真实场景太复杂了。
真正理解一个垂直场景的人,往往不是平台公司,而是长期浸泡在那个场景里的开发者、创业团队、行业专家和用户本身。
机器人行业也一样。
早期机器人公司可能必须什么都做:本体、关节、控制、感知、导航、交互、模型、应用、数据闭环,全部自己扛起来。
这是没办法的事情。行业太早期,没有现成生态,想让机器人跑起来,只能先自己造一整条路。
但这只是过渡阶段。
当人形机器人本体越来越标准化,接口越来越清晰,基础运动能力越来越稳定,未来一定会出现分层。
我认为未来机器人生态大概率会分成三层:硬件层、基座层、模型层。
二、第一层:硬件层,解决机器人有没有一个可靠的身体
硬件层,就是机器人的身体。
它包括关节模组、骨架结构、灵巧手、传感器、电池、散热、外壳、线束、材料、维护结构,也包括最基础的运动能力边界。
这一层解决的是最朴素的问题:
机器人能不能站得住?
能不能走得稳?
能不能拿得起?
能不能用得久?
坏了能不能修?
成本能不能降下来?
很多人讨论机器人时喜欢直接聊模型,但其实身体本身远不是一个插线板。机器人不是把一个大模型接到一个铁壳子上,就突然能进现实世界了。
一个人形机器人要在社会场景中稳定存在,它首先必须是一个足够成熟的工程产品。
它不能动不动摔倒,不能一天充八次电,不能每次出问题都要博士团队现场调试,不能在真实环境里只会表演三分钟。
硬件层的核心价值,是提供一个稳定、标准、可维护、可规模化的具身载体。
就像手机硬件要提供屏幕、摄像头、传感器、芯片、电池一样,人形机器人硬件层要提供身体、双臂、双足、感知器官和安全边界。
但硬件不是全部。
手机真正的繁荣,不是因为每个手机厂商都自己写完所有 App。
机器人也一样。
三、第二层:基座层,解决机器人如何成为一个“正常人”
第二层,我称之为基座层。
它包含基础 OS、基础认知模型,也包含最重要的基础运控能力。它的作用不是让机器人立刻成为咖啡师、护士或管家,而是先让机器人像一个“健康正常人”一样,能够自然控制自己的身体。
它应该会走路、转身、避障、伸手、拿东西、递东西、开门、上下台阶,理解桌子、杯子、门、抽屉、垃圾桶这些基础物体。即使没有安装任何专业模型,它也能完成一些简单任务,比如拿杯水、捡起地上的纸、把东西放到指定位置。
但基座层更重要的意义,是技术解耦。
对于模型层来说,它不需要重新教机器人怎么走路、怎么保持平衡、怎么伸手拿东西。专业模型可以默认这个本体已经是一个“身体健康、行动正常的人”。除非某些模型对步态、姿态或动作风格有特殊要求,比如舞蹈、礼仪、康复训练,否则它只需要专注于专业知识本身。
咖啡模型只需要关心咖啡机、豆子、萃取、奶泡和拉花;
康养模型只需要关心老人状态、护理流程、情绪陪伴和安全风险;
基础行动能力,由基座层解决。
同样,对于硬件层来说,它也不应该长期深陷运控细节,不应该每换一次结构就从头纠结步态策略、PD 参数和动作规划。硬件层更应该专注于把身体本身做好:外形、皮肤、结构强度、供应链、产品稳定性、能源管理、散热、维护和量产成本。
所以,基座层是连接硬件层和模型层的“中间翻译器”。
它向下屏蔽硬件复杂性,向上提供稳定的身体能力。
有了它,硬件层才能安心打磨产品,模型层才能安心打磨职业技能,机器人生态也才有可能真正分工。
四、第三层:模型层,才是真正决定体验上限的地方
第三层,是模型层。
也就是各种垂直场景模型。
比如咖啡大师模型、康养护理模型、酒店管家模型、服装导购模型、儿童陪伴模型、家庭收纳模型、健身私教模型、展厅讲解模型、调酒师模型、宠物照护模型。
这些模型不是简单地“会聊天”,也不是背几段行业百科就够了。
它们必须真的懂场景里的物品、动作、流程、禁忌、风险、审美和人的细微需求。
咖啡大师模型要认识各种咖啡机、磨豆机、滤杯、粉锤、奶缸、豆种、杯型,还要理解水温、研磨粗细、萃取时间、奶泡状态、拉花手法、客人口味、门店高峰期动线。
康养模型要理解老人身体状态、慢病管理、跌倒风险、用药提醒、情绪波动、认知障碍、护理边界,还要知道什么时候该陪聊,什么时候该安静,什么时候必须通知真人护理人员。
家庭收纳模型要知道哪些东西能碰,哪些东西不能碰;哪些看起来像垃圾,其实是主人随手放的重要小票;哪些衣服可以叠,哪些材质不能乱塞;哪些物品应该问主人,而不是自作聪明。
服装导购模型要懂身材比例、穿搭风格、场合判断、顾客心理、品牌调性,还要避免真人导购那种让人不舒服的压迫感。
这些事情不是一个通用模型随便泛化一下就能做到的。
通用模型能打底,但垂直模型决定体验上限。
五、具身模型和聊天模型最大的不同:失败成本极高
这里有一个必须强调的问题。
很多人现在习惯了聊天类 AI,于是会自然地把这种容错思维带到机器人上。
聊天模型答错一句话,大不了重新问。
写错一段文案,大不了改一改。
生成一张图不好看,大不了再来一张。
失败成本很低,所以用户会接受“差不多能用”。
但具身模型不一样。
机器人一旦失败,代价可能是真实世界里的物理损失。
咖啡模型失败,不只是回答错一个问题,它可能打翻热水、烫到顾客、摔碎杯子、污染食材、堵住门店。
康养模型失败,不只是说错一句话,它可能错过老人跌倒风险,误判情绪状态,递错东西,甚至在错误时间做出危险动作。
家庭收纳模型失败,可能把重要文件当垃圾,把隐私物品暴露出来,把易碎物放错位置。
儿童陪伴模型失败,可能在语言、动作、情绪引导上产生真实影响。
所以具身模型不能只是“95% 成功率也还行”。
在很多物理场景里,95% 可能远远不够。
因为那 5% 不是网页刷新失败,不是文案不够优美,而是现实世界里的摔倒、碰撞、误伤、损坏、投诉和信任崩塌。
这也是为什么未来优质模型会极其重要。
机器人模型不是“能用就行”,而是要极致可靠、极致专业、极致懂场景。
越靠近真实身体,越不能容忍马虎。
聊天模型可以胡说八道一两句,用户顶多翻个白眼。
具身模型胡来一下,可能就要上新闻。
所以未来机器人生态里,真正有价值的不会是大量粗糙模型,而是那些经过真实场景数据反复训练、验证、迭代,成功率接近极致,并且有清晰安全边界的高质量模型。
六、未来最强的模型,未必来自最大的机器人公司
我认为未来大量高质量机器人模型,可能会来自中小团队,甚至个人开发者。
听起来有点夸张,但看看今天的手机生态,其实一点也不奇怪。
最好的修图 App 不一定来自手机厂商。
最好的外卖软件不一定来自操作系统公司。
最好的游戏、健身、记账、剪辑、音乐软件,也不一定来自硬件公司。
平台提供硬件、系统、接口、分发和基础能力,真正丰富生态的,是千千万万开发者。
未来机器人也会如此。
一家公司可以做出标准化的人形本体,可以提供稳定的基础 OS,可以提供中央基座模型。
但它不可能成为每一个行业里最懂业务的人。
最懂咖啡的,可能是一群咖啡师和工程师组成的小团队。
最懂养老的,可能是一家深耕护理机构十年的团队。
最懂服装搭配的,可能是时尚行业从业者和 AI 开发者结合出来的新公司。
最懂儿童陪伴的,可能是教育心理学背景的人和机器人开发者共同训练出来的模型。
这些团队不一定有能力造机器人本体,但他们可能非常有能力训练一个垂直模型。
只要未来存在足够标准的人形机器人平台,他们就可以把自己的能力装进机器人身体里。
这就像 App 装进手机。
七、一个机器人身上,会同时存在大量模型
未来机器人最有意思的地方,不是它安装了某一个模型,而是它会同时安装很多模型。
它不是“买回来以后只能当咖啡师”。
也不是“买回来以后只能当导购”。
而是同一个身体,可以在不同时间扮演不同角色。
早上,主人说:“给我做一杯拿铁。”
它调度咖啡大师模型。
上午,家里老人出来散步,它切换到康养陪伴模型。
中午,孩子放学回来,它切换到儿童陪伴和学习辅导模型。
下午,主人让它整理客厅,它切换到家庭收纳模型。
晚上有朋友来做客,它可能切换到礼宾和简单餐饮服务模型。
它的身体没有变,但它的能力一直在变。
从用户视角看,机器人像是一个越来越全能的生活角色。
但从技术视角看,它不是一个模型在硬撑,而是中央基座模型在不断识别任务、调度模型、切换状态、管理风险。
这个过程可能会非常频繁,甚至是连续发生的。
它可能上一秒还在用康养模型和老人交流,下一秒发现厨房水壶响了,就切换到家庭安全模型;再下一秒接到主人指令,又切换到咖啡模型。
未来机器人的智能,不只是“会做什么”,而是“什么时候该切换成谁”。
八、标准人形本体,是生态繁荣的前提
这里又要回到上一篇的判断:为什么未来绕不开人形。
因为如果每个机器人形态都完全不同,模型生态就很难繁荣。
一个咖啡模型在 A 机器人的身体上会做咖啡,到了 B 机器人那里,手臂长度不同、关节数量不同、灵巧手结构不同、视角不同、移动方式不同,就可能完全失效。
这就像如果每台手机的屏幕比例、触控方式、系统接口、传感器调用方式都完全不同,App 生态根本不可能发展起来。
生态繁荣的前提,是载体的相对标准化。
未来不一定所有人形机器人都长得一模一样,但它们可能会形成某种标准范式:
大致相似的人形比例;
大致相似的双臂双足结构;
大致相似的传感器组合;
大致相似的运动能力边界;
大致统一的任务接口、动作接口、感知接口和安全接口。
只有这样,一个垂直模型才有可能跨本体迁移,才有可能真正形成生态。
否则每一个模型都要为每一个机器人重新适配,那开发者生态很难起飞。
九、数据会成为优质模型的燃料
不过,机器人生态和手机生态还有一个巨大不同。
手机 App 主要处理的是数字世界的信息。
而机器人模型要处理的是物理世界。
物理世界太麻烦了。
同样是杯子,有高的、矮的、软的、滑的、透明的、带把手的、不带把手的。
同样是老人,有的人耳背,有的人行动慢,有的人脾气急,有的人不愿意承认自己需要帮助。
同样是咖啡店,不同门店的设备、台面高度、杯子摆放、客流节奏、员工习惯都不一样。
这意味着,高质量机器人模型一定离不开场景数据。
谁拥有高质量数据,谁就能把模型训练得更懂场景。
但这些数据也不可能完全由机器人本体公司独占。
咖啡店的数据在咖啡店。
养老院的数据在养老院。
酒店的数据在酒店。
服装店的数据在服装店。
家庭数据更涉及隐私和授权。
所以未来很可能出现新的生态关系:场景方、模型开发者、机器人平台共同参与数据闭环。
模型不是一次性卖出去,而是在真实环境中持续学习、持续优化、持续适配。
这也是为什么垂直模型公司会有机会。
它们越懂一个行业,越能获取和处理该行业数据,就越能训练出比通用模型更专业、更可靠、更接近极致成功率的机器人能力。
十、我的判断:未来不是一个万能机器人,而是一个身体承载无数专业模型
很多人幻想未来会出现一个万能机器人。
它会做饭、会打扫、会护理、会调酒、会讲课、会健身、会带娃、会陪聊、会修东西、会管理家庭。
这种机器人当然有吸引力。
但从产业逻辑上看,我更相信另一个未来:
不是一个模型解决所有问题,而是一个身体承载无数专业模型。
硬件层是身体。
基座层是中央大脑和调度系统。
模型层是无数专业技能。
当用户发出一句自然语言指令时,中央基座模型理解意图,判断风险,选择模型,切换能力,调用身体完成任务。
“去做咖啡”,它切换成咖啡师。
“陪老人聊聊天”,它切换成康养助手。
“整理一下客厅”,它切换成收纳师。
“帮我接待客人”,它切换成礼宾。
“教孩子练口语”,它切换成语言陪练。
表面上看,是一个机器人越来越像一个完整的社会角色。
但背后其实是一个生态在运转。
未来具身智能真正迷人的地方,不是某家公司造出了一个无所不能的电子人类。
而是整个社会共同为机器人开发能力。
有人做身体。
有人做基座。
有人做模型。
有人提供数据。
有人定义场景。
有人把某一个垂直任务打磨到极致。
最后,这些能力共同汇聚到一个人形机器人身上,让它能够在不同场景里自然切换,持续进化。
这才是我认为未来机器人生态最可能出现的样子。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)