前言:具身智能的时代来临

  • 1.1 人工智能范式的根本性转变:从"离身"到"具身"
  • 1.2 具身图灵测试:2025年评估标准与最新进展
  • 1.3 2025年具身智能发展现状与产业图景
  • 1.4 本书结构与深度学习指南
  • 1.5 中国具身智能战略地位:从政府工作报告到"十五五"规划

第一部分:基础理论篇

第1章 具身智能概述

  • 1.1 具身智能的定义与核心特征(基于2025年最新共识)
  • 1.2 历史演进:从1950年图灵设想至2025年技术爆发
    • 1.2.1 诞生前夜:符号主义局限与连接主义兴起
    • 1.2.2 20世纪80-90年代:布鲁克斯行为式机器人革命
    • 1.2.3 21世纪初:认知科学与具身认知理论的融合
    • 1.2.4 2010年代:深度学习驱动的感知能力突破
    • 1.2.5 2020年代至今:大模型赋能的具身智能革命
  • 1.3 具身智能在人工智能体系中的地位与价值
  • 1.4 符号接地问题与具身认知的哲学基础
  • 1.5 具身智能与传统AI系统的本质区别:感知-行动闭环

第2章 具身智能的技术架构

  • 2.1 "感知-决策-行动-反馈"闭环系统详解
  • 2.2 多模态感知融合框架:从单一传感器到全息环境理解
  • 2.3 分层决策架构与端到端模型的深度比较
    • 2.3.1 分层架构:"大脑-小脑"范式的最新演进
    • 2.3.2 端到端架构:VLA模型的突破与局限
    • 2.3.3 混合架构:2025年最优实践路径
  • 2.4 具身智能的评估指标与基准测试体系
    • 2.4.1 BEHAVIOR-1K基准测试详解
    • 2.4.2 具身智能的"三重能力"评估框架
    • 2.4.3 中国具身智能白皮书评估标准
  • 2.5 具身智能技术路线全景图:2025年最新分类

第3章 相关技术基础

  • 3.1 计算机视觉在具身智能中的前沿应用
    • 3.1.1 3D高斯点云渲染(3D Gaussian Splatting)技术
    • 3.1.2 实时语义场景重建:中汽创智突破性进展
    • 3.1.3 开放词汇目标检测:TaPA算法详解
  • 3.2 自然语言处理与具身理解的深度融合
    • 3.2.1 大型语言模型(LLM)在具身决策中的角色
    • 3.2.2 多模态大语言模型(MLLM)的最新架构
    • 3.2.3 Grounded Decoding技术:动态校验可行性
  • 3.3 强化学习与具身决策的最新突破
    • 3.3.1 Hi-Core分层强化学习框架
    • 3.3.2 模型预测控制(MPC)与强化学习的融合
    • 3.3.3 2025年强化学习新范式:环境反馈驱动学习
  • 3.4 世界模型(World Model)的构建与应用
    • 3.4.1 世界模型的理论基础与最新进展
    • 3.4.2 MLLM-WM协同架构:清华大学最新研究成果
    • 3.4.3 世界模型在复杂环境预测中的应用
  • 3.5 具身学习的数据瓶颈与解决方案
    • 3.5.1 合成大数据赋能:王鹤团队GraspVLA与Uni-NaVid
    • 3.5.2 Sim2Real迁移技术的最新突破
    • 3.5.3 数据高效学习:小样本具身学习方法

第二部分:核心技术篇

第4章 具身感知算法

  • 4.1 多模态传感器融合技术
    • 4.1.1 视觉-听觉-触觉-力觉-本体觉融合框架
    • 4.1.2 力反馈传感器在灵巧操作中的应用
    • 4.1.3 帕西尼感知科技VTLA具身智能模型解析
  • 4.2 实时增量建图与定位(SLAM)算法
    • 4.2.1 IPM图像基础的多楼层停车场实时增量建图
    • 4.2.2 中汽创智"抗退化定位"算法详解(IROS 2025入选)
    • 4.2.3 退化感知与语义融合技术的实现路径
  • 4.3 语义场景重建技术
    • 4.3.1 从几何重建到语义理解的跨越
    • 4.3.2 实时语义场景重建的算法优化
    • 4.3.3 语义信息在任务执行中的应用案例
  • 4.4 视觉-语言-动作(VLA)感知框架
    • 4.4.1 VLA模型的token化与表示方法
    • 4.4.2 多模态信息融合的Transformer架构
    • 4.4.3 动作解token化的离散与连续方法比较
  • 4.5 空间智能与环境理解
    • 4.5.1 空间智能的定义与技术内涵
    • 4.5.2 从空间理解到空间推理的跃迁
    • 4.5.3 空间智能在复杂环境中的应用

第5章 具身决策算法

  • 5.1 分层决策模型:"大脑-小脑"架构的最新演进
    • 5.1.1 高层语义决策与低层动作规划的协同
    • 5.1.2 "Fast-in-Slow"推理范式的实践应用
    • 5.1.3 分层架构中的信息流优化
  • 5.2 结构化语言规划:LLM作规划器或生成PDDL
    • 5.2.1 LLV方法:引入外部验证器提升自动化
    • 5.2.2 LLM+P方法:PDDL生成与语法错误处理
    • 5.2.3 结构化提示工程在规划中的应用
  • 5.3 自然语言规划:LLM分解任务与可行性校验
    • 5.3.1 SayCAN框架:LLM+RL评估动作价值
    • 5.3.2 Text2Motion:几何校验技术
    • 5.3.3 Grounded Decoding:动态校验可行性技术
    • 5.3.4 Inner Monologue:多模态输入转语言推理
  • 5.4 编程语言规划:指令转可执行代码
    • 5.4.1 CaP方法:生成Python函数库
    • 5.4.2 Instruct2Act:多模态模型+代码生成
    • 5.4.3 ProgPrompt:结构化提示减少无效代码
    • 5.4.4 编程语言规划在开放任务中的应用
  • 5.5 Nav-R1:推理与导航的统一框架
    • 5.5.1 Nav-R1架构设计与实现
    • 5.5.2 空中视觉语言导航(Aerial VLN)应用
    • 5.5.3 OpenFly平台在导航中的实践
  • 5.6 多模态大语言模型(MLLM)与世界模型(WM)协同
    • 5.6.1 MLLM-WM联合驱动架构详解
    • 5.6.2 语义推理能力与物理感知预测的融合
    • 5.6.3 协同架构在动态环境中的适应性优势

第6章 具身行动算法

  • 6.1 运动规划与控制基础
    • 6.1.1 传统控制算法:PID、LQR、MPC的最新应用
    • 6.1.2 实时路径规划与避障技术
    • 6.1.3 复杂环境中的运动稳定性保障
  • 6.2 机器人操作技能学习
    • 6.2.1 灵巧操作的挑战与解决方案
    • 6.2.2 李翔团队层次化灵巧操作框架
    • 6.2.3 运动-接触联合建模技术
  • 6.3 ReKep:基于关系关键点约束的机器人操作
    • 6.3.1 ReKep算法原理与实现
    • 6.3.2 关系关键点约束在复杂操作中的应用
    • 6.3.3 ReKep与传统操作方法的比较
  • 6.4 WB-VIMA:全身视动模仿学习算法
    • 6.4.1 WB-VIMA架构设计
    • 6.4.2 全身动作的模仿学习技术
    • 6.4.3 在复杂人形机器人任务中的应用
  • 6.5 柔顺控制与交互安全策略
    • 6.5.1 力控精度优化:5牛米级控制技术
    • 6.5.2 领益智造柔性关节技术解析
    • 6.5.3 人机协作中的安全交互保障
  • 6.6 多关节机器人协调控制
    • 6.6.1 复杂机械系统的协调控制算法
    • 6.6.2 埃斯顿Codroid02机器人的技术解析
    • 6.6.3 多自由度系统的稳定性保障

第7章 反馈与学习算法

  • 7.1 闭环学习机制的设计与实现
    • 7.1.1 反馈闭环的构建方法
    • 7.1.2 反馈延迟与系统稳定性的平衡
    • 7.1.3 闭环学习的收敛性保障
  • 7.2 大模型自反思技术
    • 7.2.1 Re-Prompting:基于错误反馈调整提示
    • 7.2.2 内省机制:自主评估优化技术
    • 7.2.3 DEPS框架:描述-解释-规划-选择
    • 7.2.4 Self-Refine与Reflexion:多轮自反馈技术
  • 7.3 人类反馈学习(Human-in-the-loop)
    • 7.3.1 KNOWONO:识别知识缺口求助人类
    • 7.3.2 EmbodiedGPT:控制失败时请求人类输入
    • 7.3.3 YAY Robot:实时语言修正技术
    • 7.3.4 人机协作中的反馈效率优化
  • 7.4 环境反馈与动态调整
    • 7.4.1 TaPA:开放词汇目标检测技术
    • 7.4.2 DoReMi:检测计划-执行差异
    • 7.4.3 环境动态变化下的适应性策略
  • 7.5 模仿学习与强化学习的融合
    • 7.5.1 模仿学习的最新进展:7B LLM规划与模仿学习
    • 7.5.2 强化学习在具身决策中的应用优化
    • 7.5.3 Hi-Core:分层强化学习框架详解
  • 7.6 仿真到现实(Sim2Real)的迁移学习
    • 7.6.1 2025年Sim2Real最新技术突破
    • 7.6.2 虚实差异的量化评估方法
    • 7.6.3 智元机器人数字孪生训练案例

第三部分:前沿研究篇

第8章 具身大模型

  • 8.1 具身大模型的定义与架构演进
    • 8.1.1 从离身大模型到具身大模型的转变
    • 8.1.2 具身大模型的技术内涵与评估标准
    • 8.1.3 具身大模型与通用人工智能(AGI)的关系
  • 8.2 MLLM与世界模型的协同集成
    • 8.2.1 协同架构的设计原则
    • 8.2.2 语义理解与物理预测的平衡
    • 8.2.3 协同架构在复杂任务中的优势
  • 8.3 智元机器人的具身大模型案例分析
    • 8.3.1 模型架构与训练方法
    • 8.3.2 数字孪生工厂训练流程
    • 8.3.3 真实场景中的性能表现
  • 8.4 具身大模型的训练与优化
    • 8.4.1 大规模具身数据集构建方法
    • 8.4.2 合成数据与真实数据的平衡
    • 8.4.3 训练效率优化技术
  • 8.5 具身大模型的局限性与突破方向
    • 8.5.1 当前技术瓶颈分析
    • 8.5.2 能效优化与计算资源挑战
    • 8.5.3 未来研究方向预测

第9章 空中具身智能

  • 9.1 空中视觉语言导航(Aerial VLN)概述
    • 9.1.1 无人机具身智能的特殊挑战
    • 9.1.2 3D环境理解与导航的难点
    • 9.1.3 空中具身智能的应用场景
  • 9.2 OpenFly平台详解
    • 9.2.1 OpenFly架构设计
    • 9.2.2 关键帧感知(Keyframe-aware)导航算法
    • 9.2.3 3D高斯点云渲染在导航中的应用
  • 9.3 空中具身智能的感知技术
    • 9.3.1 无人机多模态感知系统
    • 9.3.2 动态环境中的实时定位
    • 9.3.3 空中具身智能的能源效率优化
  • 9.4 空中具身智能的决策算法
    • 9.4.1 三维空间中的路径规划
    • 9.4.2 动态障碍物规避技术
    • 9.4.3 与地面具身智能的协同
  • 9.5 无人机具身智能的应用前景
    • 9.5.1 智慧城市巡检
    • 9.5.2 紧急救援场景应用
    • 9.5.3 未来发展趋势预测

第10章 具身智能的最新突破

  • 10.1 IROS 2025入选论文深度解析
    • 10.1.1 《Real-Time Incremental Mapping and Degeneration-Awared Localization for Multi-Floor Parking Lots Based on IPM Image》技术详解
    • 10.1.2 语义场景重建技术的创新点
    • 10.1.3 抗退化定位算法的实现路径
  • 10.2 BEHAVIOR Robot Suite:家庭任务全身操作框架
    • 10.2.1 BEHAVIOR-1K基准测试详解
    • 10.2.2 家庭场景中的具身挑战
    • 10.2.3 全身操作的技术突破
  • 10.3 ReKep:关系关键点约束的机器人操作
    • 10.3.1 算法原理与实现细节
    • 10.3.2 与传统操作方法的对比
    • 10.3.3 在复杂任务中的应用效果
  • 10.4 生成扩散模型在具身智能网络中的应用
    • 10.4.1 扩散模型的基本原理
    • 10.4.2 在动作生成中的应用
    • 10.4.3 与传统方法的性能对比
  • 10.5 2025年具身智能顶会亮点综述
    • 10.5.1 第二届中国具身智能大会(CEAI2025)关键成果
    • 10.5.2 第二届中国具身智能与系统大会(CEAIS2025)技术亮点
    • 10.5.3 全球具身智能研究趋势分析

第四部分:应用实践篇

第11章 工业场景应用

  • 11.1 智能制造中的具身机器人
    • 11.1.1 消费电子组装场景应用
    • 11.1.2 精密制造中的合格率提升
    • 11.1.3 人机协作的安全保障
  • 11.2 龙旗科技平板生产车间案例分析
    • 11.2.1 生产线具身智能系统架构
    • 11.2.2 关键技术突破与性能指标
    • 11.2.3 经济效益与投资回报分析
  • 11.3 工业质检与装配的具身智能解决方案
    • 11.3.1 视觉检测系统的具身化升级
    • 11.3.2 复杂装配任务的具身决策
    • 11.3.3 质量控制的闭环优化
  • 11.4 智慧园区巡检系统实现
    • 11.4.1 多机器人协同巡检架构
    • 11.4.2 异常检测与自主决策流程
    • 11.4.3 实际应用效果与改进方向

第12章 服务场景应用

  • 12.1 养老院具身机器人应用
    • 12.1.1 老年人需求分析与任务设计
    • 12.1.2 安全交互与情感陪伴技术
    • 12.1.3 实际部署中的挑战与解决方案
  • 12.2 家庭服务机器人:BEHAVIOR-1K基准与实现
    • 12.2.1 家庭环境的特殊挑战
    • 12.2.2 BEHAVIOR-1K基准测试详解
    • 12.2.3 家庭服务机器人的商业化路径
  • 12.3 智能车库系统与停车场导航
    • 12.3.1 基于IPM图像的停车场建图技术
    • 12.3.2 多楼层停车场导航系统实现
    • 12.3.3 中汽创智技术在车库场景的应用
  • 12.4 医疗健康领域的具身智能应用
    • 12.4.1 手术辅助机器人的技术要求
    • 12.4.2 康复训练机器人的具身决策
    • 12.4.3 医疗场景中的安全与伦理考量

第13章 开发实践指南

  • 13.1 具身智能系统开发环境搭建
    • 13.1.1 硬件平台选型指南
    • 13.1.2 软件框架与工具链配置
    • 13.1.3 仿真环境与测试平台搭建
  • 13.2 Nav-R1开源项目实战
    • 13.2.1 项目结构与核心组件
    • 13.2.2 导航算法实现与优化
    • 13.2.3 性能调优与问题排查
  • 13.3 OpenFly平台使用指南
    • 13.3.1 平台架构与功能模块
    • 13.3.2 关键帧感知导航算法实现
    • 13.3.3 无人机具身智能开发流程
  • 13.4 具身智能算法性能评估方法
    • 13.4.1 评估指标体系构建
    • 13.4.2 BEHAVIOR-1K测试套件使用
    • 13.4.3 性能瓶颈分析与优化
  • 13.5 常见问题与调试技巧
    • 13.5.1 感知模块常见问题与解决方案
    • 13.5.2 决策模块调试技巧
    • 13.5.3 行动模块故障排查指南

第五部分:未来展望篇

第14章 技术挑战与突破方向

  • 14.1 泛化性问题:从特定任务到通用能力
    • 14.1.1 跨本体、跨场景、跨任务挑战
    • 14.1.2 通用技能抽象与迁移学习
    • 14.1.3 2025-2030年突破路径预测
  • 14.2 实时性与计算效率的平衡
    • 14.2.1 边缘计算与具身智能
    • 14.2.2 模型压缩与加速技术
    • 14.2.3 能效优化的最新进展
  • 14.3 模块化与端到端架构的选择
    • 14.3.1 两种架构的适用场景分析
    • 14.3.2 混合架构的设计原则
    • 14.3.3 2025年行业实践趋势
  • 14.4 数据稀缺与Sim2Real迁移挑战
    • 14.4.1 合成数据质量提升技术
    • 14.4.2 虚实差异的量化评估方法
    • 14.4.3 2025年Sim2Real最新突破
  • 14.5 跨场景适应能力提升
    • 14.5.1 环境动态变化的适应策略
    • 14.5.2 多模态反馈机制优化
    • 14.5.3 持续学习与在线适应技术

第15章 产业趋势与商业价值

  • 15.1 2025-2030年具身智能市场预测
    • 15.1.1 中国具身智能市场规模分析(2024年4800亿元,2031年万亿元)
    • 15.1.2 细分领域市场机会评估
    • 15.1.3 投资热点与风险分析
  • 15.2 产业链分析与投资机会
    • 15.2.1 上游:传感器与执行器
    • 15.2.2 中游:算法与系统集成
    • 15.2.3 下游:应用与服务
  • 15.3 具身智能与智慧城市建设
    • 15.3.1 智慧交通中的具身应用
    • 15.3.2 城市巡检与应急响应
    • 15.3.3 未来城市服务场景展望
  • 15.4 具身智能在智能交通领域的应用前景
    • 15.4.1 车载具身智能系统
    • 15.4.2 智能停车场解决方案
    • 15.4.3 交通管理中的具身机器人
  • 15.5 伦理与安全考量
    • 15.5.1 数据安全与隐私保护
    • 15.5.2 人机协作中的安全标准
    • 15.5.3 具身智能伦理框架构建

第16章 研究方向展望

  • 16.1 跨学科融合:认知科学、神经科学与具身智能
    • 16.1.1 人类认知机制对具身智能的启示
    • 16.1.2 神经科学与具身学习的结合
    • 16.1.3 未来研究方向预测
  • 16.2 具身智能与通用人工智能(AGI)的关系
    • 16.2.1 具身智能作为AGI的必要条件
    • 16.2.2 具身智能与AGI的技术路线比较
    • 16.2.3 2030年前AGI实现路径分析
  • 16.3 "机器人之脑"的构建路径
    • 16.3.1 空间智能的核心地位
    • 16.3.2 让机器人具备人类级空间理解力
    • 16.3.3 中汽创智等中国团队的贡献
  • 16.4 空间智能与具身理解的深化
    • 16.4.1 空间智能的技术内涵与评估标准
    • 16.4.2 从空间理解到空间推理的跃迁
    • 16.4.3 2025-2030年技术突破预测
  • 16.5 2025-2030年关键技术突破预测
    • 16.5.1 2025-2027年:技术成熟期
    • 16.5.2 2027-2029年:产业落地期
    • 16.5.3 2029-2030年:生态形成期

附录

  • A. 重要具身智能开源项目与资源(2025年更新)
  • B. 2025年具身智能领域主要会议与期刊
  • C. 常用数据集与评估基准(含BEHAVIOR-1K等)
  • D. 术语表与缩写解释(含最新术语)
  • E. 中国具身智能十五大重点方向详解
Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐