解析小米ICLR 2026研究:从多模态推理效率到端到端自动驾驶的工程突破
·
小米团队在2026年国际学习表征会议(ICLR)上有多篇论文入选,研究方向覆盖多模态推理、强化学习、GUI智能体、端到端自动驾驶及音频生成等领域。这些工作体现了产业界在AI工程化落地中解决具体瓶颈的务实思路。
在提升多模态大模型(MLLM)的强化学习(RL)训练效率方面,论文《Shuffle-R1》指出了现有RL训练中“优势坍缩”和“轨迹沉默”导致梯度信号不足的痛点。其提出的解决方案是一个数据中心的动态重组框架,通过“成对轨迹采样”和“基于优势的批次重排序”两项核心设计,筛选高价值训练数据,从而在增加极少计算开销的前提下,提升训练稳定性和最终效果。这为资源敏感的大模型调优提供了新思路。
在移动端GUI智能体(Mobile GUI Agent)领域,论文《MobileIPL》旨在解决高质量“思考过程”轨迹稀缺和中间步骤监督成本高的难题。该框架创新性地提出“思考层偏好学习”(T-DPO),通过基于规则的结果评分反向归因,自动构建对中间推理步骤的偏好数据对,从而实现对智能体决策过程的细粒度优化,无需高昂的人工标注。这在AITW等基准测试上取得了领先效果。
对于端到端自动驾驶,《ReCogDrive》论文则探讨了如何融合视觉语言模型(VLM)的认知能力和强化学习的决策优化。该方法将VLM的世界知识作为高层指导,结合扩散模型生成多样化的轨迹候选,最后通过RL在仿真环境中学习安全、高效的驾驶策略,尝试统一驾驶的理解与规划模块。
这些研究共同表明,当前AI前沿正从追求模型规模,转向针对具体应用场景(如移动交互、自动驾驶)的算法框架创新和效率优化,强调在仿真环境或可控数据闭环中解决真实世界的复杂任务。
更多推荐
所有评论(0)