上一篇(传送门)我聊了一个观点:为什么未来的主流机器人形态,很可能仍然绕不开“人形”,尤其是双足人形。

简单说,如果机器人只是为了干活,人形并不一定高效;但如果机器人要自然进入人类社会,成为服务、陪伴、交互、情绪价值的一部分,那么人形就是最容易被人理解和接受的形态。

这一篇,我想继续往后推一步。

如果未来真的会出现大量标准范式的人形机器人,那么下一个问题就是:

这些机器人的能力,到底由谁来开发?

是某一家机器人公司从硬件、本体、系统、基础模型、咖啡制作、养老护理、酒店服务、家庭收纳、儿童陪伴全部自己做完吗?

我认为不会。

甚至可以说,如果具身智能真的繁荣起来,它一定不会长期停留在“一家公司从头做到尾”的阶段,而会走向类似智能手机一样的分层生态。

一、早期行业总是大而全,成熟后一定会分层

很多新技术刚出现时,往往都是一家企业什么都做。

早期手机时代,硬件厂商不仅要做手机本体,还要做系统、基础软件、应用功能,甚至连用户能用什么功能,都要自己规划。

但这个状态不会长期存在。

随着硬件逐渐标准化、操作系统逐渐稳定、开发工具逐渐成熟,生态就会开始分层。

手机厂商不可能自己开发所有 App。

它可以做硬件、做系统、做应用商店、做基础能力,但它不可能同时成为最懂短视频、最懂外卖、最懂网约车、最懂游戏、最懂社交、最懂办公、最懂金融的公司。

因为真实场景太复杂了。

真正理解一个垂直场景的人,往往不是平台公司,而是长期浸泡在那个场景里的开发者、创业团队、行业专家和用户本身。

机器人行业也一样。

早期机器人公司可能必须什么都做:本体、关节、控制、感知、导航、交互、模型、应用、数据闭环,全部自己扛起来。

这是没办法的事情。行业太早期,没有现成生态,想让机器人跑起来,只能先自己造一整条路。

但这只是过渡阶段。

当人形机器人本体越来越标准化,接口越来越清晰,基础运动能力越来越稳定,未来一定会出现分层。

我认为未来机器人生态大概率会分成三层:硬件层、基座层、模型层
在这里插入图片描述

二、第一层:硬件层,解决机器人有没有一个可靠的身体

硬件层,就是机器人的身体。

它包括关节模组、骨架结构、灵巧手、传感器、电池、散热、外壳、线束、材料、维护结构,也包括最基础的运动能力边界。

这一层解决的是最朴素的问题:

机器人能不能站得住?

能不能走得稳?

能不能拿得起?

能不能用得久?

坏了能不能修?

成本能不能降下来?

很多人讨论机器人时喜欢直接聊模型,但其实身体本身远不是一个插线板。机器人不是把一个大模型接到一个铁壳子上,就突然能进现实世界了。

一个人形机器人要在社会场景中稳定存在,它首先必须是一个足够成熟的工程产品。

它不能动不动摔倒,不能一天充八次电,不能每次出问题都要博士团队现场调试,不能在真实环境里只会表演三分钟。

硬件层的核心价值,是提供一个稳定、标准、可维护、可规模化的具身载体。

就像手机硬件要提供屏幕、摄像头、传感器、芯片、电池一样,人形机器人硬件层要提供身体、双臂、双足、感知器官和安全边界。

但硬件不是全部。

手机真正的繁荣,不是因为每个手机厂商都自己写完所有 App。

机器人也一样。

三、第二层:基座层,解决机器人如何成为一个“正常人”

第二层,我称之为基座层。

它包含基础 OS、基础认知模型,也包含最重要的基础运控能力。它的作用不是让机器人立刻成为咖啡师、护士或管家,而是先让机器人像一个“健康正常人”一样,能够自然控制自己的身体。

它应该会走路、转身、避障、伸手、拿东西、递东西、开门、上下台阶,理解桌子、杯子、门、抽屉、垃圾桶这些基础物体。即使没有安装任何专业模型,它也能完成一些简单任务,比如拿杯水、捡起地上的纸、把东西放到指定位置。

但基座层更重要的意义,是技术解耦

对于模型层来说,它不需要重新教机器人怎么走路、怎么保持平衡、怎么伸手拿东西。专业模型可以默认这个本体已经是一个“身体健康、行动正常的人”。除非某些模型对步态、姿态或动作风格有特殊要求,比如舞蹈、礼仪、康复训练,否则它只需要专注于专业知识本身。

咖啡模型只需要关心咖啡机、豆子、萃取、奶泡和拉花;

康养模型只需要关心老人状态、护理流程、情绪陪伴和安全风险;

基础行动能力,由基座层解决。

同样,对于硬件层来说,它也不应该长期深陷运控细节,不应该每换一次结构就从头纠结步态策略、PD 参数和动作规划。硬件层更应该专注于把身体本身做好:外形、皮肤、结构强度、供应链、产品稳定性、能源管理、散热、维护和量产成本。

所以,基座层是连接硬件层和模型层的“中间翻译器”。

它向下屏蔽硬件复杂性,向上提供稳定的身体能力。

有了它,硬件层才能安心打磨产品,模型层才能安心打磨职业技能,机器人生态也才有可能真正分工。

四、第三层:模型层,才是真正决定体验上限的地方

第三层,是模型层。

也就是各种垂直场景模型。

比如咖啡大师模型、康养护理模型、酒店管家模型、服装导购模型、儿童陪伴模型、家庭收纳模型、健身私教模型、展厅讲解模型、调酒师模型、宠物照护模型。

这些模型不是简单地“会聊天”,也不是背几段行业百科就够了。

它们必须真的懂场景里的物品、动作、流程、禁忌、风险、审美和人的细微需求。

咖啡大师模型要认识各种咖啡机、磨豆机、滤杯、粉锤、奶缸、豆种、杯型,还要理解水温、研磨粗细、萃取时间、奶泡状态、拉花手法、客人口味、门店高峰期动线。

康养模型要理解老人身体状态、慢病管理、跌倒风险、用药提醒、情绪波动、认知障碍、护理边界,还要知道什么时候该陪聊,什么时候该安静,什么时候必须通知真人护理人员。

家庭收纳模型要知道哪些东西能碰,哪些东西不能碰;哪些看起来像垃圾,其实是主人随手放的重要小票;哪些衣服可以叠,哪些材质不能乱塞;哪些物品应该问主人,而不是自作聪明。

服装导购模型要懂身材比例、穿搭风格、场合判断、顾客心理、品牌调性,还要避免真人导购那种让人不舒服的压迫感。

这些事情不是一个通用模型随便泛化一下就能做到的。

通用模型能打底,但垂直模型决定体验上限。

五、具身模型和聊天模型最大的不同:失败成本极高

这里有一个必须强调的问题。

很多人现在习惯了聊天类 AI,于是会自然地把这种容错思维带到机器人上。

聊天模型答错一句话,大不了重新问。

写错一段文案,大不了改一改。

生成一张图不好看,大不了再来一张。

失败成本很低,所以用户会接受“差不多能用”。

但具身模型不一样。

机器人一旦失败,代价可能是真实世界里的物理损失。

咖啡模型失败,不只是回答错一个问题,它可能打翻热水、烫到顾客、摔碎杯子、污染食材、堵住门店。

康养模型失败,不只是说错一句话,它可能错过老人跌倒风险,误判情绪状态,递错东西,甚至在错误时间做出危险动作。

家庭收纳模型失败,可能把重要文件当垃圾,把隐私物品暴露出来,把易碎物放错位置。

儿童陪伴模型失败,可能在语言、动作、情绪引导上产生真实影响。

所以具身模型不能只是“95% 成功率也还行”。

在很多物理场景里,95% 可能远远不够。

因为那 5% 不是网页刷新失败,不是文案不够优美,而是现实世界里的摔倒、碰撞、误伤、损坏、投诉和信任崩塌。

这也是为什么未来优质模型会极其重要。

机器人模型不是“能用就行”,而是要极致可靠、极致专业、极致懂场景。

越靠近真实身体,越不能容忍马虎。

聊天模型可以胡说八道一两句,用户顶多翻个白眼。

具身模型胡来一下,可能就要上新闻。

所以未来机器人生态里,真正有价值的不会是大量粗糙模型,而是那些经过真实场景数据反复训练、验证、迭代,成功率接近极致,并且有清晰安全边界的高质量模型。

六、未来最强的模型,未必来自最大的机器人公司

我认为未来大量高质量机器人模型,可能会来自中小团队,甚至个人开发者。

听起来有点夸张,但看看今天的手机生态,其实一点也不奇怪。

最好的修图 App 不一定来自手机厂商。

最好的外卖软件不一定来自操作系统公司。

最好的游戏、健身、记账、剪辑、音乐软件,也不一定来自硬件公司。

平台提供硬件、系统、接口、分发和基础能力,真正丰富生态的,是千千万万开发者。

未来机器人也会如此。

一家公司可以做出标准化的人形本体,可以提供稳定的基础 OS,可以提供中央基座模型。

但它不可能成为每一个行业里最懂业务的人。

最懂咖啡的,可能是一群咖啡师和工程师组成的小团队。

最懂养老的,可能是一家深耕护理机构十年的团队。

最懂服装搭配的,可能是时尚行业从业者和 AI 开发者结合出来的新公司。

最懂儿童陪伴的,可能是教育心理学背景的人和机器人开发者共同训练出来的模型。

这些团队不一定有能力造机器人本体,但他们可能非常有能力训练一个垂直模型。

只要未来存在足够标准的人形机器人平台,他们就可以把自己的能力装进机器人身体里。

这就像 App 装进手机。

七、一个机器人身上,会同时存在大量模型

未来机器人最有意思的地方,不是它安装了某一个模型,而是它会同时安装很多模型。

它不是“买回来以后只能当咖啡师”。

也不是“买回来以后只能当导购”。

而是同一个身体,可以在不同时间扮演不同角色。
在这里插入图片描述

早上,主人说:“给我做一杯拿铁。”

它调度咖啡大师模型。

上午,家里老人出来散步,它切换到康养陪伴模型。

中午,孩子放学回来,它切换到儿童陪伴和学习辅导模型。

下午,主人让它整理客厅,它切换到家庭收纳模型。

晚上有朋友来做客,它可能切换到礼宾和简单餐饮服务模型。

它的身体没有变,但它的能力一直在变。

从用户视角看,机器人像是一个越来越全能的生活角色。

但从技术视角看,它不是一个模型在硬撑,而是中央基座模型在不断识别任务、调度模型、切换状态、管理风险。

这个过程可能会非常频繁,甚至是连续发生的。

它可能上一秒还在用康养模型和老人交流,下一秒发现厨房水壶响了,就切换到家庭安全模型;再下一秒接到主人指令,又切换到咖啡模型。

未来机器人的智能,不只是“会做什么”,而是“什么时候该切换成谁”。

八、标准人形本体,是生态繁荣的前提

这里又要回到上一篇的判断:为什么未来绕不开人形。

因为如果每个机器人形态都完全不同,模型生态就很难繁荣。

一个咖啡模型在 A 机器人的身体上会做咖啡,到了 B 机器人那里,手臂长度不同、关节数量不同、灵巧手结构不同、视角不同、移动方式不同,就可能完全失效。

这就像如果每台手机的屏幕比例、触控方式、系统接口、传感器调用方式都完全不同,App 生态根本不可能发展起来。

生态繁荣的前提,是载体的相对标准化。

未来不一定所有人形机器人都长得一模一样,但它们可能会形成某种标准范式:

大致相似的人形比例;

大致相似的双臂双足结构;

大致相似的传感器组合;

大致相似的运动能力边界;

大致统一的任务接口、动作接口、感知接口和安全接口。

只有这样,一个垂直模型才有可能跨本体迁移,才有可能真正形成生态。

否则每一个模型都要为每一个机器人重新适配,那开发者生态很难起飞。

九、数据会成为优质模型的燃料

不过,机器人生态和手机生态还有一个巨大不同。

手机 App 主要处理的是数字世界的信息。

而机器人模型要处理的是物理世界。

物理世界太麻烦了。

同样是杯子,有高的、矮的、软的、滑的、透明的、带把手的、不带把手的。

同样是老人,有的人耳背,有的人行动慢,有的人脾气急,有的人不愿意承认自己需要帮助。

同样是咖啡店,不同门店的设备、台面高度、杯子摆放、客流节奏、员工习惯都不一样。

这意味着,高质量机器人模型一定离不开场景数据。

谁拥有高质量数据,谁就能把模型训练得更懂场景。

但这些数据也不可能完全由机器人本体公司独占。

咖啡店的数据在咖啡店。

养老院的数据在养老院。

酒店的数据在酒店。

服装店的数据在服装店。

家庭数据更涉及隐私和授权。

所以未来很可能出现新的生态关系:场景方、模型开发者、机器人平台共同参与数据闭环。

模型不是一次性卖出去,而是在真实环境中持续学习、持续优化、持续适配。

这也是为什么垂直模型公司会有机会。

它们越懂一个行业,越能获取和处理该行业数据,就越能训练出比通用模型更专业、更可靠、更接近极致成功率的机器人能力。

十、我的判断:未来不是一个万能机器人,而是一个身体承载无数专业模型

很多人幻想未来会出现一个万能机器人。

它会做饭、会打扫、会护理、会调酒、会讲课、会健身、会带娃、会陪聊、会修东西、会管理家庭。

这种机器人当然有吸引力。

但从产业逻辑上看,我更相信另一个未来:

不是一个模型解决所有问题,而是一个身体承载无数专业模型。

硬件层是身体。

基座层是中央大脑和调度系统。

模型层是无数专业技能。

当用户发出一句自然语言指令时,中央基座模型理解意图,判断风险,选择模型,切换能力,调用身体完成任务。

“去做咖啡”,它切换成咖啡师。

“陪老人聊聊天”,它切换成康养助手。

“整理一下客厅”,它切换成收纳师。

“帮我接待客人”,它切换成礼宾。

“教孩子练口语”,它切换成语言陪练。

表面上看,是一个机器人越来越像一个完整的社会角色。

但背后其实是一个生态在运转。

未来具身智能真正迷人的地方,不是某家公司造出了一个无所不能的电子人类。

而是整个社会共同为机器人开发能力。

有人做身体。

有人做基座。

有人做模型。

有人提供数据。

有人定义场景。

有人把某一个垂直任务打磨到极致。

最后,这些能力共同汇聚到一个人形机器人身上,让它能够在不同场景里自然切换,持续进化。

这才是我认为未来机器人生态最可能出现的样子。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐