中国人工智能系列白皮书—具身智能(2026版)

具身智能作为人工智能领域的一个重要研究方向,专注于智能体通过物理本体与外界环境的互动来实现智能的理论与技术研究,涵盖环境感知、记忆推理、对话交互、自主学习、决策规划、动作执行等综合性技术,从而在真实物理世界中展示出类人的智能行为。相比于静态、离身的人工智能,具身智能具有涉身性、情境性、主动性和交互性等特点。具身智能兼具多技术融合与多学科交叉特性,与计算机科学、机器人学、神经科学、认知科学等不同领域都紧密相关,其研究范畴、研究范式,内涵外延也在不断发展中。具身智能近年来得到了学术界、产业界的大量关注,被认为是人工智能的下一个爆发点,是人工智能走向物理世界的核心关键,在国计民生等各方面都有重大潜在应用价值。

具身智能的演进历程可追溯至 20 世纪 50 年代,其理论源自英国杰出的计算机科学家阿兰·图灵(Alan Turing)的深刻洞见。1950 年,图灵在其具有划时代意义的论文《计算机器与智能》(Computing Machinery and Intelligence)中,首次构想了一种能够与环境进行动态交互、具备自我学习能力的智能实体。该智能体被设想为能够像人类一样感知外界环境、自主规划行动路径、做出决策,并具备高效执行任务的能力,这一构想被视为具身智能(Embodied Intelligence)的初步理论框架。

步入 20 世纪 80 年代,随着人工智能研究的不断深入,行为主义 AI 学派开始崭露头角,其中罗德尼·布鲁克斯(Rodney Brooks)等学者的研究尤为突出。他们强调通过感知与动作的紧密协同,设计能够与环境进行有效交互的智能机器。这一时期的“具身”机器人实验主要聚焦于利用逻辑规则算法与机器人硬件的结合,以实现特定的应用功能。尽管这些实验尚处于初步探索阶段,但它们为具身智能的发展奠定了重要基础。

随着技术的不断积累与创新,具身智能迎来了快速发展的黄金时期。深度学习(Deep Learning)、强化学习(Reinforcement Learning)等先进算法模型的涌现,为具身智能提供了强大的技术支持。这些算法模型使机器人能够更好地理解和处理复杂的环境信息,从而实现更加智能和灵活的行为。同时,传感器与执行器等硬件技术的不断进步,也显著提升了机器人的感知敏锐度和行动精准度。在这一阶段,“具身”机器人技术取得了显著进展,不仅在仿生机器人研发方面取得了重要突破,还在“人工智能 + 机器人”的智能化融合上迈出了决定性步伐。例如,特斯拉的人形机器人Optimus 通过先进的视觉-语言-动作模型以及精确的电机控制技术,实现了智能、拟人的交互,展示了具身智能在机器人领域的巨大潜力。

近年来,随着大语言模型(Large Language Models,LLMs)的兴起,具身智能的发展迎来了新的高潮。大模型凭借其深厚的通用知识库和智能涌现能力,为机器人提供了更高层次的智能感知、自主决策和拟人化交互能力。谷歌 DeepMind 推出的 RT系列机器人,尤其是 RT-H 版本,通过创新的任务分解与语言指令转化策略,实现了任务执行的高精度与高效率,进一步推动了具身智能在复杂任务处理方面的能力。

此外,Meta AI 发布的 CortexBench 视觉评估基准以及专为具身智能设计的 VC-1视觉模型,为具身智能的标准化评估与模型优化提供了重要工具。英伟达(NVIDIA)作为 GPU 和 AI 计算领域的领导者,在具身智能领域同样做出了显著贡献。他们推出了 GR00T 人形机器人基础模型及 Jetson Thor 新款人形机器人计算机,并对 Isaac 机器人开发平台进行了全面升级,为机器人技术的持续创新提供了有力支撑。

请使用手机浏览器、微信、百度网盘扫一扫获取网盘文件