• 作者: Artem Lykov, Valerii Serpiva, Muhammad Haris Khan, Oleg Sautenkov, Artyom Myshlyaev, Grik Tadevosyan, Yasheerah Yaqoot, and Dzmitry Tsetserukou

  • 单位:斯科尔科沃科学技术研究院数字工程中心智能空间机器人实验室

  • 论文标题:CognitiveDrone: A VLA Model and Evaluation Benchmark for Real-Time Cognitive Task Solving and Reasoning in UAVs

  • 论文链接:https://arxiv.org/pdf/2503.01378

  • 代码链接:https://cognitivedrone.github.io/

主要贡献

  • 提出 CognitiveDrone 模型:专为无人机(UAVs)设计的视觉-语言-动作(VLA)模型,能够在复杂任务中实时生成 4D 动作指令,帮助无人机基于第一人称视觉输入和文本指令执行任务。

  • 开发了 CognitiveDrone-R1:在 CognitiveDrone 的基础上,增加了额外的视觉-语言模型(VLM)推理模块,用于简化任务指令,提升复杂场景下的性能。

  • 创建了 CognitiveDroneBench 基准测试:这是第一个针对无人机认知任务的开源评估基准,基于 Gazebo 物理仿真环境构建,包含认知检查点的无人机竞速赛道,用于全面评估无人机的认知能力。

  • 开源了完整的资源:包括数据集、基准测试环境、模型权重以及训练/推理代码,为后续研究和开发提供了便利。

研究背景

  • 随着机器人技术和人工智能的快速发展,赋予机器人在动态变化环境中执行复杂任务的能力成为关键挑战。

  • 认知机器人不仅需要精确的控制能力,还需具备高水平的推理和决策能力,以适应不可预测的真实场景。

  • 在无人机(UAVs)领域,现有的评估框架大多局限于竞速或基础导航任务,缺乏标准化的开源基准和数据集来评估无人机的认知功能,如推理、人类识别和符号理解等。

系统架构

CognitiveDrone 系统架构

  • 总体目标:CognitiveDrone 系统旨在根据第一人称视觉输入和用户指令,为无人机生成平滑的 4D 动作指令。

  • 核心组件:
    • VLA 模型:基于开源的 OpenVLA 模型,包含 70 亿参数,经过超过 8000 个模拟飞行轨迹的训练,专注于无人机飞行物理,能够以 10Hz 的频率生成高频控制指令,实现平滑连续的轨迹。

    • 推理模块(CognitiveDrone-R1):为了提升复杂任务的性能,系统增加了一个基于 VLM 的推理模块。该模块处理任务指令和视觉输入,消除歧义并简化指令,将其转化为明确的动作供 VLA 模型执行。推理模块的频率较低(约 2Hz),但能够显著提升任务理解能力。

  • 内存与性能:由于增加了推理模块,系统总内存需求从单个 VLA 模型的 10GB 增加到 20GB。推理模块和 VLA 模型协同工作,分别负责任务理解和实时控制。

CognitiveDroneBench 仿真架构

  • 仿真环境:基于 Gazebo 和 ArduPilot 构建,能够准确模拟真实世界无人机的动力学。仿真中使用速度设定点控制无人机,与运行 ArduPilot 固件的真实无人机保持一致。

  • 任务定义:任务通过 JSON 文件定义,包括任务提示、选项、正确答案以及门的参数(如大小、形状和颜色)。ROS-Gazebo 插件通过 Python 脚本动态生成任务对象。

  • 数据收集:在数据收集过程中,无人机从初始位置沿着样条曲线轨迹移动到目标门的中心,记录 256x256 像素的图像和动作数据。所有数据通过 ROS 主题收集。

数据集收集与训练流程

数据集收集

  • 任务类别:数据集包含 8062 个连续轨迹样本,分为以下三个类别:
    • 人类识别:根据文本提示中指定的外部特征识别个体,并导航至与之相关的门。

    • 符号理解:区分各种符号,包括字母数字字符、公司标志和动物图像等。

    • 推理:执行需要逻辑推理的任务,例如根据数学问题的答案导航至对应的门,或将对象与特定属性关联。

  • 数据记录:在每个飞行过程中,记录无人机的速度和姿态(Vx, Vy, Vz, omega),生成 4D 动作指令。数据集分为训练集和测试集,用于模型训练和性能评估。

模型训练

  • 训练数据格式:数据集按照强化学习数据集(RLDS)格式组织,支持模仿学习和特定任务的动作预测。

  • 训练方法:
    • 模型架构:基于 OpenVLA-7b 模型,采用低秩适配(LoRA)方法进行微调,使用 rank-32 适配器优化内存使用,仅调整少量可训练权重。

    • 训练配置:批量大小为 64,学习率为 5×10⁻⁴,训练步数为 4000 步,禁用图像增强。

    • 训练硬件:在四块 NVIDIA A100 GPU 上进行训练,确保大规模优化的同时保持实时部署能力。

  • 训练监控:每 500 步保存一次检查点并评估模型性能,训练过程通过学习曲线进行监控。

评估

CognitiveDroneBench 评估基准

  • 评估环境:CognitiveDroneBench 是一个开源的仿真基准测试,用于评估无人机在认知任务中的表现。该基准测试基于高保真物理仿真环境构建,能够准确模拟无人机的飞行动力学。

  • 任务设计:在 CognitiveDroneBench 中,无人机需要沿着一个由多个顺序门组成的赛道飞行。每个阶段,无人机都会收到一个第一人称视角(FPV)图像和一个任务特定的文本指令。无人机的核心目标是通过解决嵌入的认知任务来选择正确的门,并生成一个 4D 动作指令来控制其运动。

  • 任务类型:任务分为以下三类:
    • 人类识别(Human Recognition):根据文本提示识别特定人物,并导航至与之相关的门。

    • 符号理解(Symbol Understanding):区分各种符号,包括字母数字字符、公司标志和动物图像等。

    • 推理(Reasoning):执行需要逻辑推理的任务,例如根据数学问题的答案导航至对应的门,或将对象与特定属性关联。

  • 评估方法:任务性能通过自动验证来确定。如果无人机通过正确的门,则获得 1 分。最终分数是通过将累积分数归一化到最大可能分数来获得的。这种方法为在现实无人机操作条件下评估 VLA 模型的认知性能提供了一个客观的衡量标准。

评估方法与基准测试结果

  • 评估模型:在 CognitiveDroneBench 上对以下三种模型进行了全面评估:
    • RaceVLA:主要针对无人机竞速任务优化的模型。

    • CognitiveDrone:本文提出的针对认知任务优化的基础模型。

    • CognitiveDrone-R1:在 CognitiveDrone 的基础上增加了推理模块的增强版模型。

  • 评估指标:评估结果包括每个任务类别的分数以及所有样本上的整体平均成功率。

  • 分析:
    • RaceVLA 在导航物理赛道方面表现出色,但在执行认知任务方面表现较差,尤其是在推理和人类识别任务中,其决策几乎接近随机选择。

    • CognitiveDrone 在认知任务中的表现显著优于 RaceVLA,尤其是在推理任务中,其能够更好地处理复杂的任务指令。

    • CognitiveDrone-R1 在推理模块的加持下,性能大幅提升。与 CognitiveDrone 相比,推理任务的成功率提高了约 6%,人类识别任务提高了约 31%,符号理解任务提高了约 21%。这表明推理模块在处理复杂任务指令时发挥了重要作用,显著提升了无人机的认知能力。

评估总结

  • 性能提升:从 RaceVLA 到 CognitiveDrone,再到 CognitiveDrone-R1,模型在认知任务中的表现逐步提升。CognitiveDrone-R1 的整体平均成功率比 RaceVLA 高出约 46%,比 CognitiveDrone 高出约 17.6%。

  • 推理模块的重要性:推理模块的加入显著提升了无人机在复杂认知任务中的表现,尤其是在人类识别和符号理解任务中。这表明在 VLA 模型中整合高级推理能力对于提升无人机的认知能力至关重要。

  • 基准测试的价值:CognitiveDroneBench 提供了一个客观的评估平台,能够全面评估无人机在认知任务中的表现。通过该基准测试,可以直观地比较不同模型在复杂任务中的性能差异。

总结

  • CognitiveDrone 系统,尤其是增强版 CognitiveDrone-R1,在认知任务中表现出色,显著优于主要针对竞速任务优化的 RaceVLA 模型。

  • 这表明在无人机的 VLA 模型中整合高级推理能力对于提升复杂任务的性能至关重要。

  • 此外,CognitiveDroneBench 为无人机应用中的 VLA 模型提供了一个客观评估认知能力的专用开源平台。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐