TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding

论文信息

paper:CVPR 2024
code:https://github.com/RenShuhuai-Andy/TimeChat
Video LLM时序感知新探索:TimeChat和VTimeLLM
在这里插入图片描述

论文概要

  1. 主要创新:提出一种时间感知的视频多模态大模型,具体来说模型可以根据输入的时间戳来对对应的时间进行描述,也可以根据用户的输入,输出时间戳以及对应的描述。
  2. 主要技术:1)时间戳感知的帧特征提取器,在常规的Q-Former基础上融合了视频时间戳信息;2)划窗Q-Former,利用Q-Former技术融合相邻几帧的帧间信息,并输出指定数量的tokens,本文的划窗步长是固定的,也就是说不同长度的视频最终产生的tokens的数量也是不同的,作者解释说这样的设计可以保留长视频更多的信息。
  3. 核心数据:标注了6个任务带有时间戳的125k实例数据

摘要翻译

本工作提出了TimeChat,一个专为长视频理解而设计的时间感知型多模态大型语言模型。我们的模型结合了两个关键的架构创新:(1) 一个时间戳感知的帧编码器,它将每个帧的视觉内容与时间戳绑定;(2) 一个滑动视频Q-Former,它产生不同长度的视频标记序列以适应不同时长的视频。此外,我们构建了一个包含6个任务和总共125K实例的指令调整数据集,以进一步提升TimeChat的指令跟随性能。实验结果在各种视频理解任务上,如密集字幕生成、时间定位和亮点检测,证明了TimeChat强大的零样本时间和推理能力。例如,在YouCook2上,它实现了+9.2的F1分数和+2.8的CIDEr,在QVHighlights上实现了+5.8的HIT@1,在Charades-STA上实现了+27.5的R@1(IoU=0.5),与现有的视频大型语言模型相比,有显著的性能提升。TimeChat有潜力作为一个多才多艺的视频助手,用于长视频理解任务,并满足现实世界用户的需求。

引言翻译

从教育教程到故事片,长视频已经成为我们日常生活中不可或缺的媒介。然而,对个人来说,浏览冗长的视频既耗时又令人沮丧。相反,人类的注意力总是被吸引到有意义的或突出的视觉片段上,比如烹饪教程中的关键步骤或体育赛事中的美妙时刻。长期以来,研究社区一直在追求一种智能的时间敏感型视频助手,用于分析长视频,包括时间定位、时间戳检测和关键时刻总结。随着大型语言模型(LLMs)的出现以及它们执行人类指令的惊人能力,自然产生了一个问题,即是否可能开发一个基于LLM的助手用于长视频理解任务以满足现实世界用户的需求?

已经有人初步尝试将视频编码器与LLMs集成,以实现基本的视频理解,包括详细的字幕和问题回答。然而,现有的视频LLMs(VidLLMs)只能捕获短视频片段的全局视觉语义,并且无法将重要的视频内容与准确的时间戳关联起来。例如,VideoLLaMA和VideoChat在定位和描述未修剪视频中的有意义事件方面存在困难,如表2所示,导致准确度低。两个主要的障碍阻碍了现有VidLLMs的性能。首先,它们将视频标记压缩为固定数量(例如32),这不适合长视频输入,忽略了视频的持续时间,并在处理来自长视频的大量帧时导致严重的时空语义退化。其次,它们分别处理视频和时间戳信息,而没有考虑明确的时间-视觉关联,因此无法准确定位时间戳。

在本文中,我们提出了TimeChat,一个用于长视频理解和准确时间定位的时间感知型多模态大型语言模型。为了处理长视频输入,我们提出了一个滑动视频Q-Former,以适应在提取和压缩视频特征时的自适应视频标记长度。具体来说,视频Q-Former将滑动窗口内的帧压缩成视频标记。通过移动窗口,我们可以动态地创建不同长度的视频标记序列,以适应不同时长的视频。它保留了长视频的重要视觉语义,并导致更具表现力和可扩展性的视频表示。此外,为了增强视觉-时间戳关联,我们提出了一个时间感知的帧编码器,它显式地将视觉上下文与每帧的时间戳描述绑定在一起。

为了激发TimeChat的内在时间戳定位能力并增强其遵循指令的能力,我们构建了一个新颖的指令调整数据集TimeIT,涉及各种与时间戳相关的用户指令。该数据集从平均视频长度为190.8秒的各种与时间戳关联的长视频数据集中编译而成。它由6个不同任务、12个广泛使用的学术基准测试和总共125K实例组成。我们按照对话风格重新格式化原始学术数据集,并手动编写高质量的指令。据我们所知,TimeIT是第一个为指令调整而设计的、以视频为中心的、对时间敏感的数据集,旨在促进视频LLMs的发展。

利用TimeIT数据集,我们在TimeChat上执行指令调整,然后评估其在包括密集视频字幕生成、时间视频定位和视频亮点检测在内的各种下游任务中的性能。实验结果表明,在零样本设置下,我们的模型在各项指标上都显著优于以前的视频大型语言模型(VidLLMs),在YouCook2上F1分数提高了+9.2,CIDEr提高了+2.8,在QVHighlights上HIT@1提高了+5.8,在Charades-STA 上R@1(IoU=0.5)提高了+27.5。此外,在电影和第一人称视频等新领域的定性结果表明,TimeChat具有成为一个多功能且实用的视频助手的泛化能力。

技术细节

在这里插入图片描述

时间戳感知的帧特征提取器(Timestamp-aware Frame Encoder)

采用InstructBLIP中的ViT来对视频帧提取特征,即视觉tokens。然后采用Q-Former的方式对视觉tokens进行压缩,输出跟Queries数量一致的tokens。与常规的Q-Former不一样的是,本文还额外输入了时间戳信息作为一种条件融入到视觉tokens里面去。
原文是这样说的:Importantly, during visual token extraction, we add the frame’s timestamp, e.g., “This frame is sampled at 2s.”, as a condition to the Q-Former to fuse the visual and timestamp information.

基于划窗的视频Q-Former(Sliding Video Q-Former)

由于每帧视频帧都是单独编码,这导致提取的tokens缺少了帧间信息,因此提出划窗Q-Former来融合帧间信息。(To this end, we incorporate a sliding video Q-Former to enhance the feature fusion in the temporal dimension.)
之前的工作不管输入视频的长度如何,统一规定输出的tokens数量为一个固定值,这会导致长视频的语义信息丢失。(previous work usually set a fixed number of video tokens, such as 32, which can result in severe visual semantics degradation when the number of input frames is large.)
本文采用固定的步长来保证长视频不会被过度压缩,即最终送入LLM的tokens数量会根据视频的长度变化而变化。
在送入LLM之前还会经过一个线性映射层来使tokens的特征维度符合LLM的输入特征维度需求。

大语言模型(Large Language Model)

VidLLM的训练通常采用两阶段训练框架。第一阶段使用大规模图像/视频-文本对进行预训练,以实现视觉-语言对齐。第二阶段使用指令数据对模型进行微调,以实现指令跟随。考虑到计算效率,我们在第一阶段训练后重用现有开源模型的检查点(checkpoints),仅进行指令调整。
采用LoRA微调的方式来对LLM模型进行微调。

数据构造

在这里插入图片描述
TimeIT包含了6个长期存在的与时间戳相关的视频任务,即:(1) 密集视频字幕生成,(2) 时间视频定位,(3) 步骤定位和字幕生成,(4) 视频摘要,(5) 视频亮点检测,以及 (6) 转录语音生成。它还整合了来自不同领域的12个特定数据集。我们的数据集适应了在现实世界应用中与AI助手交互时涉及视频时间戳的普遍用户请求。
指令构造:先通过人工进行构造,然后利用GPT-4进行扩写来产生更多样化的表达,最后通过人工检查和refine来形成最终的版本。对于每个task会产生6个高质量的指令(instructions)。
答案模板:根据编写的指令,我们进一步将任务输出重新构思为用户友好的自然语言响应范式。考虑到所涉及的视频数据集是人工收集的,TimeIT数据的整体质量得到了保证。
在这里插入图片描述

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐