NUS:训练大模型合成多模态数据

📖标题:Genixer: Empowering Multimodal Large Language Model as a Powerful Data Generator
🌐来源:arXiv, 2312.06731, ECCV2024
摘要
🔸多模态大型语言模型(MLLM)表现出卓越的解决问题的能力,但很少有研究旨在衡量生成视觉指令调整数据的能力。本文建议探索授权MLLM独立生成数据而不依赖GPT-4的潜力。
🔸我们介绍了Genixer,这是一个全面的数据生成管道,由四个关键步骤组成:(i)指令数据收集,(ii)指令模板设计,(iii)优化MLLM,以及(iv)数据生成和过滤。此外,我们还概述了两种数据生成模式:任务无关和任务特定,实现可控输出。
🔸我们证明,用LLaVA1.5训练的合成VQA类数据集可以提高12个多模态基准中的10个的性能。此外,当使用类似REC的合成数据集进行训练时,基础MLLM Shikra在8个REC数据集中的7个上显示出改进。通过实验和综合数据分析,我们的发现是:(1)当前的MLLM可以在没有GPT-4V辅助的情况下作为稳健的数据生成器;(2) 用任务特定数据集训练的MLLM在生成复杂指令调优数据方面可以超过GPT-4V;(3) 合成数据集增强了各种多模态基准的性能,并有助于减轻模型幻觉。数据、代码和模型可以在以下网址找到https://github.com/zhaohengyuan1/Genixer.
🛎️文章简介
🔸研究问题:如何利用多模态大语言模型(MLLM)生成多模态数据,以减少对人工标注和高成本商业模型的依赖?
🔸主要贡献:论文提出了一个名为Genixer的数据生成管道,能够利用现有的MLLM生成高质量的视觉指令调优数据,并贡献了两个开源数据生成模型以及两个高质量的多模态数据集。
📝重点思路
🔺相关工作
🔸最近的MLLM表明视觉教学数据对于多模态学习至关重要,数据来源主要是 ①改写现有数据 ②专业模型合成。
🔸改写现有数据受到图像多样性的限制,因为它们大多数源自COCO数据集,可能限制模型的泛化能力。
🔸专业模型合成的财务成本较高,并在一些复杂任务上的性能较差。
🔺论文方案
Genixer的数据生成管道包含四个关键步骤
🔸指令数据收集:于收集流行且有代表性的视觉语言(VL)任务作为数据生成的来源。
🔸指令模板设计:设计用于生成指令的两级模板,以实现针对特定任务和与任务无关的受控数据生成。
🔸赋能MLLM:选择基础MLLM(如LLaVA1.5和Shikra)作为骨干模型,给定通用和特定指令、一个图像,训练目标是使基础MLLM生成问题和相应的答案,得到Genixer L和Genixer S。
🔸数据生成和过滤:生成数据并通过过滤框架(如Fuyudriven和CLIP-driven)确保数据质量,得到Genixer-915K和Genixer-350K。
🔎分析总结
🔸Genixer成功生成了一些具有挑战性任务的长而富有意义的答案,如多轮对话、点QA和指称对话。
🔸使用Genixer数据集训练的模型,在多个基准测试中表现提升。
🔸通过人类研究和数据集分析,证明了生成的指令调优数据的多样性和有效性。
💡个人观点
论文的核心是训练MLLM生成高质量视觉指令调优数据,并展示了有效性。
附录





更多推荐
所有评论(0)