Paper: Visual Instruction Tuning (LLaVA)


一句话概括

LLaVA通过将视觉编码器与大语言模型连接并进行视觉指令微调,开创了高效的多模态大模型训练范式。

核心思想

LLaVA的架构极其简洁:一个预训练的CLIP视觉编码器提取图像特征,通过一个简单的线性投影层映射到LLM的输入空间,然后与文本token一起送入LLaMA进行处理。训练分两阶段:先在图文对上预训练投影层实现模态对齐,再用GPT-4生成的视觉指令数据进行端到端微调。

关键创新

核心创新在于数据构建和训练策略:(1)使用GPT-4(纯文本版)基于图像标注生成高质量视觉对话和推理数据——用语言模型的能力来引导多模态模型的训练;(2)极简的架构设计——仅一个线性层就能有效连接视觉和语言模态;(3)两阶段训练流程高效且可复现。

深远影响

LLaVA证明了构建强大的多模态模型不需要从头训练巨大模型,而可以高效地桥接已有的视觉和语言基座模型。这一范式被后续的LLaVA-1.5、InternVL、Qwen-VL等广泛采用,极大推动了开源多模态模型的发展。

启发与思考

LLaVA的成功说明:(1)模态之间的对齐可能比想象中简单——一个线性层就够了;(2)高质量训练数据比复杂架构更重要;(3)大语言模型本身就具备很强的多模态理解潜力,只需适当的接口就能被激活。