具身智能(Embodied AI)是人工智能的一个发展领域,指一种智能系统或机器能够通过感知和交互与环境进行实时互动的能力。可以简单理解为各种不同形态的机器人,让它们在真实的物理环境下执行各种各样的任务,来完成人工智能的进化过程

具身智能机器人是“具身智能”的实体形态,有望成为AI的最终载体。其整体架构由感知层、交互层、运动层组成。“具身智能”最大的特质就是能够以主人公的视角去自主感知物理世界,用拟人化的思维路径去学习,从而做出人类期待的行为反馈,而不是被动的等待数据投喂。

人形机器人提供了各种基于人类行为的学习和反馈系统,为实现更复杂行为语义提供了迭代的基础和试验场。因此,人形机器人的逐步完善也为具身智能的落地提供了方向,是具身智能的重要应用场景,也将为具身智能的迭代优化提供方向和空间。

诞生背景

在达特茅斯会议之后的一段时期内,对人工智能的研究主要限于符号处理范式(符号主义)。符号主义的局限性很快在实际应用中暴露出来,并催动了联接主义的发展,形成了包括多层感知机、前向神经网络、循环神经网络,直至今日风靡学术界与产业界的深度神经网络等多种方法。这种用人工神经网络模拟认知过程的方法在适应、泛化与学习方面的确取得了很大的进展,但并未真正解决智能体与真实物理世界交互的难题针对以上问题,“具身智能”(Embodied AI)概念应运而生。

发展历史

1950年,在图灵论文《Computing Machinery and Intelligence》中具身智能被首次提出。

1986年,布鲁克斯从控制论角度出发,强调智能是具身化(Embodied)和情境化 (Contextlized)的,传统以表征为核心的经典AI进化路径是错误的,而清除表征的方式就是制造基于行为的机器人。《How the Body Shapes the Way We Think》中通过分析“身体是如何影响智能的”对“智能的具身化”做了清晰的描述,这些工作为人工智能的第三个流派——以具身智能为代表的行为主义方法奠定了基础。

2023年,2023半导体大会上,英伟达创始人黄仁勋表示具身智能(Embodied AI)是能理解、推理、并与物理世界互动的智能系统,是人工智能的下一个浪潮。

2024年3月17日,OpenAI与人形机器人初创公司Figure合作推出了Figure 01机器人。一段长达2分35秒的视频展示了Figure 01惊人的理解、判断、行动和自我评估能力。

2024年3月23日,2024全球开发者先锋大会开幕式上,上海市副市长陈杰表示,将加强核心技术的突破,推动智能芯片关键技术和应用适配,打造更多元开放的智能计算生态,支持通用大模型和垂直大模型的研发,积极推进大模型和具身智能的融合发展。

理论支持

根据具身智能的技术实现逻辑,“知”是建立在“行”之上的,只有通过“具身”才能理解某个场景。甲骨文等古老汉字,绝大多数就是通过行为的表征来刻画一个概念,比如“争”的古老写法中,代表两个人的手拔一根绳子,因此,理解行为才是理解概念及场景的关键。

具身的概念是可检验、可测量的。人所理解的世界概念,其中既包括人类独有的责任心、荣誉、感情、欲望等非具身的概念,也包括了杯子、车等实体以及相应行为的具身概念。

 “知行合一”是具身智能的科学立场。根据具身智能的技术实现逻辑,“知”是建立在“行”之上的,也就是说只有通过“具身”才能理解某个场景。 

特征特点

具身智能首先要具备可供性。可供性意味着要让机器知道物体和场景能够提供的是什么,比如整个身体、部件怎么和场景进行有效拟合。

具身智能还要具有功能性。具身智能在把物体作为工具使用的过程中,要能够以任务执行为导向去理解功能。

具身智能需要实现因果链。就以上提到的“铲土”例子,智能体能否顺利铲起土来是有因果关系的,例如控制挥动锤子的方式、动量、冲量等指标的改变程度和改变过程,需要用数学和物理的因果链来控制。

发展困境

智能体学习如何使用工具涉及到多个认知和智能过程,这个过程即使对人类来说也并不容易。让机器人掌握工具使用所涵盖的所有技能是一项有挑战性的难题。

这项工作包括三个层面:其一是底层的运动控制。很多研究基于阻抗控制(Impedance control)来跟踪工具使用的运动轨迹,或在不同阶段改变力和运动约束,或使用基于学习的方法来控制机器人运动轨迹。在底层控制中,鲁棒地执行运动轨迹是关注的核心。

其二是中间层表征。各种利于下游任务的中间表征被提出,以便更好地理解工具的使用。尽管引入这些表征有利于学习更多不同的工具使用技能,但它们目前仍然局限于工具的形状和任务之间的几何关联。

其三是理解在工具使用中的涉及的高层概念,比如物体的功能性(Functionality)和可供性(Affordance),以及工具使用中涉及的因果关系与常识,从而实现更好的泛化能力。

发展趋势

人工智能的技术前沿将朝着四个方向发展。第三个前沿方向为具身智能。具身智能指有身体并支持与物理世界进行交互的智能体,如机器人、无人车等,通过多模态大模型处理多种传感数据输入,由大模型生成运动指令对智能体进行驱动,替代传统基于规则或者数学公式的运动驱动方式,实现虚拟和现实的深度融合。因此,具有具身智能的机器人,可以聚集人工智能的三大流派:以神经网络为代表的连接主义,以知识工程为代表的符号主义和控制论相关的行为主义,三大流派可以同时作用在一个智能体,这预期会带来新的技术突破。

转自:具身智能_百度百科 

Logo

更多推荐