IROS 2025 前沿解码:从单体到集群,学习与控制如何重塑无人机智能
1. 从“单打独斗”到“群策群力”:无人机智能的进化之路
不知道你有没有过这样的经历,小时候玩遥控飞机,最怕的就是一阵风吹过来,或者不小心撞到东西,飞机立马就失控坠毁了。那时候的无人机,或者说航模,基本就是个“睁眼瞎”,全靠操作者的经验和反应。现在,我们看到的无人机已经能在狂风里稳定悬停,能在复杂的工厂车间里自主穿梭,甚至能一群无人机像鸟群一样协同完成复杂的任务。这背后,到底发生了什么?
IROS 2025,这个机器人领域的顶级盛会,就像一场年度大考,集中展示了全球最顶尖的实验室在过去一年里,如何“调教”这些空中精灵。我仔细梳理了今年的论文,发现了一条非常清晰的脉络:无人机智能正在经历一场从“单体”到“集群”的深刻变革。这不仅仅是数量上的叠加,更是智能层次的一次跃迁。过去,我们研究一个无人机怎么飞得更稳、更准,这属于“个体智能”的范畴。现在,我们开始研究一群无人机怎么像一支训练有素的军队,分工合作、互相配合,这就是“群体智能”的崛起。
为什么这个转变如此重要?因为现实世界从来不是为单个机器人设计的。想象一下森林火灾救援,单个无人机视野有限,续航也短;但一群无人机可以分工协作,有的负责侦察火情边界,有的负责为救援人员投送物资,有的负责构建临时通信中继。再比如未来的城市物流,成千上万的送货无人机需要在复杂的楼宇间穿梭,它们必须能互相“沟通”,避免碰撞,还能动态规划最优路径。这些场景,靠一个超级聪明的单体无人机是搞不定的,必须依赖群体涌现出的协同智慧。
所以,IROS 2025上的研究,本质上是在回答两个核心问题:第一,如何让单个无人机在充满不确定性的环境中变得更“聪明”、更“皮实”?第二,如何让一群无人机在协同工作时,产生“1+1>2”的群体效应?而贯穿这两个问题的核心技术武器,就是“学习”与“控制”的深度融合。学习,让无人机能从数据中汲取经验,适应未知;控制,则确保这些经验能安全、可靠地转化为实际行动。接下来,我们就一起拆解这条技术升级路径上的关键里程碑。
2. 单体智能精进:让无人机成为“环境适应大师”
要让无人机从“玩具”升级为可靠的“工具”,第一步就是解决它自身的生存问题。传统控制方法依赖于精确的数学模型,但现实世界充满了“意外”:突如其来的阵风、自身电机或旋翼的突发故障、环境中无法预知的动态障碍物……任何一个意外都可能导致任务失败甚至坠机。IROS 2025上的研究告诉我们,解决之道在于赋予无人机“学习”的能力,让它能像生物一样,在试错和观察中适应环境。
2.1 学会“感知风”:物理信息与数据驱动的融合建模
风,是无人机飞行中最常见也最头疼的干扰。传统方法要么把风当作一个固定参数来补偿,要么需要昂贵的风速仪实时测量,效果都不理想。国防科技大学牛轶峰老师团队的工作《PI-WAN: A Physics-Informed Wind-Adaptive Network for Quadrotor Dynamics Prediction in Unknown Environments》提供了一种新思路。
他们搞了个“物理信息风自适应网络”。这个名字听起来有点唬人,其实原理很巧妙。你可以把它想象成教一个孩子学骑车。纯数据驱动的方法,就像只给孩子看一万个别人骑车的视频,然后让他自己摸索,结果可能一上车就摔,因为视频里没教他物理规律(比如平衡原理)。而纯物理模型的方法,就像只给他讲牛顿力学公式,他可能懂了原理,但一上车还是不会控制肌肉。PI-WAN的做法是,既给他看视频(数据),又给他讲物理公式(物理约束),让他在学习时,脑子里始终绷着一根“物理规律”的弦。
具体到技术上,他们把描述无人机飞行的基本物理方程(比如牛顿第二定律、欧拉角运动方程)作为“约束条件”,直接嵌入到神经网络的训练过程中。同时,他们用了时序卷积网络(TCN)来捕捉风扰的动态变化特征。这样训练出来的模型,就像一个既懂理论又有丰富经验的“老司机”,即使飞到从未去过、风况未知的空域,也能根据当前感受到的“颠簸”(状态数据),准确预测接下来飞机会怎么动。然后,把这个预测模型集成到模型预测控制器(MPC)里,控制器就能提前计算最优的控制指令来对抗风的影响。
我见过他们的实验视频,在实验室里用大风扇制造强乱流,搭载了他们算法的无人机,依然能稳稳地画出一个圆。这背后的“裁判”就是高精度的动作捕捉系统,它能以毫米级的精度实时给出无人机的位置和姿态真值,没有这个“尺子”,你根本没法量化算法到底将跟踪精度提升了多少。这种“物理规律指导下的学习”,是让AI模型在现实世界中可靠工作的关键一步,避免了纯黑箱模型在陌生环境下的“翻车”风险。
2.2 学会“玩特技”:扩散模型生成复杂环境飞行动作
如果说抗风是基本功,那在复杂狭窄空间里做特技飞行,就是炫技了。这要求无人机不仅能飞,还得飞得“有想法”。浙江大学高飞老师团队的《Automatic Generation of Aerobatic Flight in Complex Environments via Diffusion Models》就把当下火热的扩散模型用在了无人机轨迹生成上。
传统规划方法在工厂、仓库这种管道纵横、货架林立的复杂环境里,很容易“卡壳”,要么规划不出路径,要么规划出的路径像机器人一样僵硬,无法执行快速滚转、翻越等动态动作。高飞老师团队的思路很“艺术”,他们把复杂的特技飞行动作,拆解成一个个像乐高积木一样的“运动基元”,比如一个急转弯、一个翻滚。然后,用扩散模型这个“AI画家”来创作。
扩散模型的工作方式很有趣,它先学会把一张清晰的图片一步步加噪声变成完全随机的噪点(扩散过程),然后再学会从噪点中一步步还原出图片(去噪过程)。在这里,研究人员把“清晰的图片”换成“一条优美、动态可行的特技轨迹”,把“噪点”换成“随机乱飞的轨迹”。在去噪生成轨迹时,他们加入了多重“引导”:一是历史轨迹的先验,保证新生成的动作和之前能连贯起来,不会突然抽搐;二是障碍物信息的分类器引导,确保生成的轨迹绝不会撞上东西;三是动力学约束的分层优化,保证生成的每一个动作,无人机的电机和结构都能承受得了。
最终的效果非常惊艳。在模拟的复杂工业环境里,避障成功率超过99%,而且能生成长时间、多样化的炫酷飞行动作。更厉害的是,这些由AI“想象”出来的轨迹,真的能直接下载到实体无人机上飞出来。这背后同样离不开动作捕捉系统的支持。在真实的杂乱空间里飞行,GPS信号弱甚至没有,视觉和激光雷达也可能受干扰,只有高精度的动作捕捉能提供稳定、全局的位姿反馈,让无人机知道自己有没有严格按AI生成的“剧本”在表演,从而完成从虚拟仿真到真机验证的闭环。
2.3 学会“自适应”:从策略优化到参数自整定的智能控制
有了聪明的“大脑”(模型和规划器),还需要灵巧的“小脑”(控制器)来精准执行。IROS 2025上,控制器层面的学习进化主要体现在三个方向:更安全、更容错、更自动。
安全强化学习让避障更可靠。四川大学和北航团队提出的“安全调整策略优化(SAPO)”算法,核心思想是给强化学习这个“冒险家”套上缰绳。强化学习智能体通常通过试错、根据奖励信号学习,但它可能会为了高奖励去冒险,比如擦着障碍物飞。SAPO设计了一个双策略框架:一个“奖励策略”负责追求任务目标(比如最快到达终点),一个“成本策略”专门负责评估风险(比如离障碍物太近)。成本策略会根据当前状态动态调整奖励策略的输出,就像副驾驶在危险路段提醒主驾驶“慢一点,靠右点”。通过这种方式,无人机在学会高效飞行的同时,绝对保证了安全距离,实现了“零碰撞”约束下的高性能。
被动容错控制让飞行更皮实。哈工大(深圳)楼云江老师团队的研究直面一个飞行员的噩梦:空中突然一个电机停转。传统的容错控制需要检测到故障,然后切换备份控制器,这中间存在延迟。他们提出的基于学习的被动容错控制方法,设计了一个巧妙的“选择器-控制器”网络。这个网络在训练时见过各种正常和故障状态,就像一个经验丰富的飞行员,感觉飞机姿态稍有异常(无需明确知道是哪个电机坏了),手上就能下意识地做出正确的操控修正,保持飞机稳定。实验里,即使一个旋翼完全失效,无人机也能安全降落。这其中的验证,极度依赖动作捕捉系统提供的高精度姿态真值,来确认算法在真实失稳状态下,是否真的做出了快速且正确的补偿。
贝叶斯优化让调参更智能。PID控制器是工业界的常青树,但给无人机调PID参数是个技术活,费时费力。重庆大学等机构的研究用“异方差贝叶斯优化”来搞定这件事。简单说,它把调参过程当成一个黑盒优化问题:输入一组PID参数,飞一下,看跟踪误差(输出)。贝叶斯优化会构建一个概率模型来预测:哪些区域的参数可能性能更好?然后主动去尝试那些最有潜力的参数。“异方差”的意思是,它还能智能地认识到,在不同的飞行状态(比如高速 vs 悬停)下,测量误差的波动大小是不一样的,从而更精细地指导搜索。实测下来,这种方法自动整定出的参数,比人工调的和传统方法调的,跟踪精度提升了24%到78%不等。这相当于给无人机配备了一个自动适应不同飞行状态的“自适应底盘”,大大降低了部署门槛。
3. 群体智能涌现:从“我”到“我们”的协同革命
当单个无人机变得足够聪明和健壮后,把它们组织起来,就能解决更宏大的问题。但多智能体系统远不是简单复制粘贴几个单体,其核心挑战在于“协调”。每个个体都有自己的感知、决策和执行单元,如何让它们在信息不完全、通信可能受限的情况下,为了共同目标而行动,并避免相互冲突?IROS 2025上的研究展示了如何用学习的方法,让协作行为从智能体的互动中“涌现”出来。
3.1 多智能体强化学习:在博弈与协作中进化策略
多智能体强化学习(MARL)是训练集群协同的主流方法,可以理解为让一群AI在虚拟环境里自己打游戏,从成功和失败中学习配合。今年的研究在提升学习效率和策略智能性上有了新突破。
国防科技大学周晗老师团队研究的是经典的“追逃游戏”:几个无人机(追击者)要在复杂障碍环境中合作抓住一个逃跑的无人机(逃避者)。如果只给每个追击者设定“靠近逃避者”的个体奖励,它们很容易挤成一团,互相挡路。团队提出的“知识增强多智能体深度强化学习(KE-MATD3)”,引入了一个关键的外部知识——改进的人工势场。这个势场就像在环境中画了一张无形的“引力-斥力”地图:逃避者位置产生“引力”,障碍物和其他追击者产生“斥力”。算法在训练初期会参考这个势场来塑造团队的整体奖励,引导智能体们初步学会分散包抄、围堵等基础协作模式。随着训练进行,智能体们会逐渐超越这个初始引导,演化出更精妙的合作策略,比如有的佯攻驱赶,有的埋伏拦截。这种方法大大加快了学习收敛的速度,并且在实物测试中,真的观察到了无人机集群涌现出的精妙配合。
另一个典型场景是异构协同。四川大学和华中科大的工作关注无人机(UAV)和无人车(UGV)的混合编队。让天上的和地上的机器人一起跟踪一个目标,难点在于如何让无人机高效地飞到能“看”到目标的最佳视角,同时还要避免无人机之间、无人机与地面车辆之间相撞。他们设计了一个分层框架:上层用优化方法解决“特征匹配”问题,即分配哪架无人机去跟踪目标的哪个特征点,以最小化总飞行距离;中层用一个无模型的强化学习控制器来生成跟踪指令;下层则是一个基于控制屏障函数(CBF)的安全过滤器,像一道防火墙,实时修正中层的指令,确保任何情况下都不会发生碰撞。这个框架把复杂的协同问题分解,并用学习的方法解决了其中模型不确定的部分,实现了安全前提下的高效实时跟踪。
3.2 模仿学习与语言模型:向专家和人类知识要效率
强化学习虽然强大,但需要海量的试错,训练成本高。模仿学习提供了一条捷径:让智能体直接学习专家示范。北航吴文峻老师团队的工作《Symmetry-Guided Multi-Agent Inverse Reinforcement Learning》更进一步,他们研究多智能体逆向强化学习(MIRL),即从专家演示中反推出其内在的奖励函数。这个奖励函数代表了专家行为的“意图”,一旦学会,智能体就能举一反三。
他们的关键洞察是发现了多智能体系统中的“对称性”。比如,在车队编队中,领头车和跟随车的角色是对称可互换的;在包围任务中,每个智能体的位置也是对称的。利用这种对称性先验,他们提出的框架能更高效、更准确地从有限的专家演示中反推出奖励函数。这就好比学下棋,如果你理解了“控制棋盘中心”这个对称的、普适的奖励原则,比你死记硬背几个开局定式要有效得多。实验证明,这种方法能大幅提升样本效率,让智能体用更少的演示数据就学到接近专家的协作策略。
如果说模仿学习是“学徒制”,那么大语言模型(LLM)的引入,则让无人机集群有了理解人类高级指令的可能。北航团队的另一项杰出工作TALKER系统,就是这方面的典范。他们用大语言模型作为集群的“任务规划大脑”。当你对集群说“去检查那座大楼的东侧和西侧,并报告异常”时,LLM能理解这个语义,并将其分解为具体的、可执行的子任务:派遣A组无人机去东侧,B组去西侧,规划各自的覆盖路径,并定义什么是“异常”以及如何“报告”。然后,底层的无人机控制器再去执行这些子任务。
TALKER的创新在于“任务激活”和“知识扩展”机制。它不是一个静态的规划器,而是一个能通过与环境交互、与人类反馈交互而持续进化的系统。在多达90架无人机的模拟实验中,它展现出了超越传统多智能体强化学习方法的高任务成功率和可扩展性。将这样的系统部署到现实世界,最大的挑战之一就是为庞大的集群提供全局、精确的定位,这正是高精度动作捕捉系统的用武之地,它确保了虚拟世界中的完美计划,能在物理世界中被精准地执行和验证。
4. 高精度动捕:连接虚拟学习与物理验证的“桥梁”
聊了这么多前沿算法,不知道你有没有发现一个贯穿始终的关键词:真实实验验证。无论是单体抗风、特技飞行,还是集群协同,论文里几乎都提到了在真实无人机平台上进行了测试,并取得了比仿真更好的结果。这背后,有一个不可或缺的“幕后英雄”——高精度动作捕捉系统。
你可以把它理解为机器人研究领域的“高速摄影机”加“精密尺子”。它通过在实验场地布置多个高速红外相机,捕捉无人机上反光标记点的位置,从而以亚毫米级精度、高达每秒数百帧的速度,实时计算出每一架无人机在三维空间中的位置和姿态(六自由度位姿)。这个数据,就是所谓的“真值”。
为什么这个“真值”如此重要?主要体现在三个环节,构成了一个完整的技术闭环:
第一,它是算法性能的“裁判”。在单体无人机研究中,比如评估轨迹跟踪精度,你说你的新控制器性能提升了30%,这30%是怎么算出来的?就是靠动作捕捉系统提供的真实轨迹,与期望轨迹做对比得出的。没有这个客观的、高精度的测量标准,所有的性能提升都只是仿真里的数字,缺乏说服力。
第二,它是强化学习与自适应控制的“感官”。无论是强化学习算法还是自适应控制器,都需要实时获取环境状态(在这里就是无人机自身的精确位姿)来做出决策。动作捕捉系统提供的低延迟、高精度位姿数据,是这些算法在现实世界中能够“跑起来”的基础输入。没有可靠的状态反馈,再聪明的算法也是“瞎子摸象”。
第三,它是“仿真到现实”迁移的“校准器”。几乎所有学习算法都在仿真环境中进行初步训练,但仿真模型和真实物理世界总有差距(这被称为“现实鸿沟”)。动作捕捉系统提供的真实数据,一方面可以用来校正仿真模型,使其更贴近现实;另一方面,在真机实验时,它提供的数据可以作为一个独立的验证源,确认算法在现实中的表现是否和仿真一致,从而建立起从虚拟训练到物理部署的可靠桥梁。
在多智能体集群研究中,它的作用更是被放大。它不仅要提供单个个体的真值,还要构建一个全局的、统一的坐标系。在这个坐标系下,集群中每个成员都能精确知道自己和同伴的位置,这是实现精确协同、避免碰撞的前提。可以说,动作捕捉系统为无人机集群研究提供了一个可控、可测、高精度的“数字孪生”物理实验场。
从我过去接触的项目经验来看,很多实验室在算法仿真阶段效果惊人,但一到真机调试就问题百出,很大一部分原因就是状态估计不准,或者缺乏一个可靠的全局定位基准。引入一套像NOKOV这样的高精度动作捕捉系统,虽然初期有投入,但它极大地加速了研发迭代周期,让研究人员能快速定位问题是出在算法逻辑上,还是出在物理实现上,把时间花在刀刃上。这也就是为什么越来越多的顶尖机器人实验室,都将其视为关键的基础设施。
5. 未来展望:挑战与迈向更广阔的天空
看完了IROS 2025上这些精彩的工作,我们大致能描绘出无人机智能发展的未来图景。学习与控制技术的融合,正让无人机从执行固定航线的自动化工具,进化为能理解环境、应对意外、协同作业的自主智能体。这条从单体到集群的路径,不仅仅是技术的叠加,更是问题复杂度和智能维度的指数级增长。
不过,前路依然充满挑战。对于单体智能,如何让学习到的模型和策略具备更强的可解释性和安全性,是走向大规模应用必须跨过的门槛。我们需要的不仅是性能好的“黑箱”,更是值得信赖的“伙伴”。对于集群智能,当智能体数量从几十增加到成百上千时,现有的集中式或完全分布式学习方法都会面临通信、计算和可扩展性的巨大压力。如何设计轻量、高效、鲁棒的分布式学习与决策架构,是下一个研究热点。
此外,大语言模型等基础AI能力的注入,为无人机集群带来了自然交互和高级任务理解的新可能。未来的无人机集群或许能像《星际迷航》里的博格集合体一样,接收人类用自然语言下达的模糊指令(如“疏散这个区域的人群”),并自主分解任务、协商策略、协同执行。但这要求底层控制必须足够鲁棒,高层规划必须足够可靠,中间还需要一套贯通语义到动作的可靠接口。
最后,所有这些前沿研究的落地,都离不开像高精度动作捕捉系统这样的“使能技术”的持续进步。我们需要更高精度、更大范围、更低成本的感知定位方案,来支持更复杂、更大规模的室外乃至城市环境实验。仿真技术也需要与真实数据更紧密地结合,构建更高保真的数字孪生环境,让算法在“出生”前就在无限接近现实的世界里历练。
我个人的体会是,这个领域正处在一个激动人心的融合期。控制理论提供了稳定性的骨架,机器学习赋予了适应性的血肉,而强大的计算和感知能力则为其注入了灵魂。作为研究者或工程师,我们既要深入钻研某个具体的技术点,比如如何改进一个网络结构,也要时常跳出来,从系统整合的角度思考,如何将这些技术模块有机地组合起来,解决一个真正的实际问题。无人机智能的终极目标,从来不是炫技,而是让这些空中机器人安全、可靠、高效地服务于人类社会的方方面面,从物流配送到农业植保,从基础设施巡检到应急救援。这条路很长,但每一步都踏在坚实的理论与实验基础上,方向也愈发清晰。
更多推荐
所有评论(0)