摘要:本文提出 LEARN 轻量级强化学习框架,适配资源受限纳米无人机(Crazyflie),仅依赖 ToF 传感器与 168MHz 单核嵌入式控制器,零样本迁移至真实场景;仿真 / 实测表明,该框架成功率超现有规划器 10%,可支持 6 台真机 / 24 台仿真无人机在复杂环境中导航。

一、引言

无人机(UAV)在监控、搜救、行星探测等领域应用广泛,但纳米级无人机受尺寸、重量、功耗(SWaP)约束,现有导航方法依赖高分辨率视觉、大算力规划器,无法适配这类资源受限平台。

现有多无人机导航方法存在关键局限:假设理想定位 / 通信、依赖高性能硬件 / 外部系统(如动捕),而资源受限无人机仅能使用单核低频处理器(<1GHz)、<1MB 内存、<10MHz 通信带宽,传统方法难以落地。

南加州大学团队研究的轻量级两阶段安全引导强化学习框架LEARN 框架《LEARN: Learning End-to-End Aerial Resource-Constrained Multi-Robot Navigation》:(如图 1)专为资源受限多无人机设计:仅依赖低分辨率飞行时间(ToF)传感器,全流程在嵌入式控制器上运行,零样本迁移至真实场景,仿真中成功率超现有方法 10%,真机可支持 6 台 Crazyflie 无人机在 2m/s 速度下穿越 0.2m 间隙。

d4740-image.png

图 1 LEARN 框架整体架构:基于两阶段安全引导强化学习,感知、定位、通信、规划、控制全在 168MHz 单核控制器(192KB RAM)上运行;策略在仿真中训练后部署至所有无人机,通过 ToF 传感器感知障碍物、无线电获取邻居状态,直接输出转子推力指令,零样本迁移至真实场景。

二、相关工作

2.1 多无人机避障与导航

现有方法可分为五类(表 1),核心局限是依赖外部系统 / 高性能硬件:

w7488-image.png

  • 第一类:依赖动捕 / 地面站定位、建图,需高算力硬件;

  • 第二类:移除地面站通信,但仍依赖外部定位 / 高算力;

  • 第三类:算力适配资源受限平台,但仍依赖动捕;

  • 第四类:全机载感知 / 计算,但需 NVIDIA Xavier NX 等高性能硬件;

  • 第五类(SGBA):适配资源受限平台,但仅支持简单避障,无法完成目标导航。

图 2 展示了主流多无人机导航算法的性能对比,箭头表示前者在实验中优于后者,其中控制类方法(圆形)与规划类方法(方形)各有优劣,但均未适配极致资源约束。

G3172-image.png

图 2 多无人机导航算法性能对比:有向边表示源算法在实验中优于目标算法;圆形为控制类方法,方形为规划类方法;SGBA 因仅聚焦避障未纳入对比。

2.2 安全控制与强化学习结合

现有 “安全学习” 方法分四类:

  • 学习策略 + 安全滤波器(如 CBF),但滤波器保守且算力开销大;

  • 学习安全滤波器,减少保守性;

  • 价值网络预测状态安全性,触发备份策略;

  • 仅在训练中用安全滤波器塑造奖励(LEARN 所属类别)。

2.3 资源受限机器人

现有全机载方案仅支持稀疏环境的简单导航,LEARN 是首个适配密集复杂环境的资源受限多无人机全机载导航框架。

三、核心设计

3.1 硬件选型(图 3)

采用 Crazyflie 2.1 纳米无人机(47g,9.2cm 尺寸),核心硬件:

  • 控制器:STM32F405(168MHz 单核,192KB RAM,1MB Flash);

  • 感知:4 个 VL53L5CX ToF 传感器(4×4/8×8 深度图,45° 视场);

  • 定位:光流模块 + 扩展卡尔曼滤波融合速度 / 高度;

  • 通信:nRF51822 无线电(2Mbps),仅传输邻居位置 / 速度。

c7319-image.png

图 3 硬件系统:(a) 真机 / 仿真平台;(b) 4 个 ToF 传感器的 8×8 深度图;(c) 硬件组件;(d) 算力开销拆解,整体仅占用控制器 30% 算力。

3.2 算法框架(图 4)

LEARN 整合轨迹规划与安全控制,核心流程:

1)轨迹生成:采用最小快照轨迹规划,生成无避障的朴素轨迹,每步输出中间目标点;

2)强化学习策略:

  • 观测空间:自身状态(位置 / 速度 / 姿态)、邻居状态(最近 2 个邻居的相对位置 / 速度)、障碍物(ToF 传感器的 4×8 压缩深度数据);

  • 动作空间:4 个转子的归一化推力;

  • 奖励函数:轨迹跟踪(位置 / 姿态误差)+ 安全(避障 / 避邻居)+ 效率(控制量最小化);

3)两阶段安全奖励:正常阶段平衡多目标,安全滤波器触发后屏蔽效率奖励,优先恢复安全。

A1779-image.png

图 4 LEARN 算法框架:训练时融入两阶段安全奖励,采用异步演员 - 评论家架构;评论家引入符号距离场(SDF)特权信息,演员仅用机载传感器数据;绿色为真机部署模块,灰色仅用于训练。

四、实验验证

4.1 消融实验(表 3)

f5566-image.png

验证核心模块的作用:

  • 移除安全屏障函数(SBC):障碍物碰撞率大幅上升,整体成功率从 48% 降至 14%;

  • 移除评论家 RNN:整体成功率从 48% 降至 34%,说明记忆辅助导航但非核心;

  • 基础版策略(无 SBC + 无 RNN):仅在直线路径任务中有效,复杂换目标任务失效;

  • 增大模型规模(隐藏层 64→32):性能下降,证明训练策略比参数量更重要。

4.2 仿真实验

对比 Ego-Swarm2(ES2)、HDSM 两款主流规划器,核心结果(表 4、图 6-9):

w3287-image.png

  • 直线路径任务:LEARN 整体成功率 88%(ES2 78%,HDSM 30%),飞行更平滑(抖动最小),路径长度最短;

  • 换目标任务:LEARN 整体成功率 48%(ES2 44%,HDSM 34%),无人机间碰撞率更低;

  • 可扩展性:支持 24 台仿真无人机,成功率虽下降但碰撞率可控;ES2/HDSM 在 16 台以上无人机时规划失效;

  • 通信鲁棒性:通信频率从 50Hz 降至 5Hz,成功率仍保持 85% 以上,适配低带宽场景。

d3680-image.png

图 6 轨迹对比:LEARN 轨迹更贴近朴素规划路径,无人机间保持安全距离;ES2 偏保守,HDSM 绕行幅度大,路径更长。

c7527-image.png

图 7 可通行性分析:可通行性越低(环境越复杂),LEARN 成功率下降更平缓,鲁棒性优于 ES2/HDSM。

k7446-image.png

图 8 扩展性实验:LEARN 在 24 台无人机时仍保持一定成功率,ES2/HDSM 成功率骤降,且未完成率显著更高。

4.3 真机实验(图 11-15)

6 台 Crazyflie 无人机在室内 / 室外环境测试:

  • 间隙穿越:可稳定穿越 0.2m 间隙(约 2 倍机身直径),轨迹贴合规划路径;

  • 多机导航:在随机障碍物布局中,无人机间 / 与障碍物碰撞率接近 0,可完成换目标、对角换位置等高冲突任务;

  • 高冲突场景:无人机可自主避让、等待,无需集中控制 / 预建图,仅依赖机载感知 / 通信。

t4510-image.png

图 11 间隙测试:LEARN 可稳定穿越 0.2m 间隙,训练仅覆盖 0.15m 以上间隙,零样本迁移至更窄间隙仍有效。

u1069-image.png

图 12 真机部署:(a)-(e) 不同复杂度的障碍物布局,(f) 适配不同尺寸障碍物,(g)-(h) 复杂布局下的实际轨迹,贴合规划路径且无碰撞。

五、局限性与结论

5.1 局限性

  • 依赖局部感知,长视野场景(如死胡同)可能次优;

  • 假设环境静态,动态障碍物 / 强风下鲁棒性待提升;

  • 未整合长视野规划,仅依赖反应式调整。

5.2 结论

LEARN 是首个适配资源受限纳米无人机的端到端学习导航框架,全流程机载运行,零样本迁移至真实场景;仿真 / 真机验证表明,其成功率超现有规划器,可支持多无人机在复杂环境中避障、换目标、高冲突协商,为资源受限多机器人导航提供新方向。

END

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐