Interview: 多模态模型训练中数据配比与训练顺序的影响


题目解析

多模态大模型需要同时处理文本和视觉信息,训练策略直接影响模型的跨模态理解能力。数据配比和训练顺序的选择涉及模态对齐、灾难性遗忘和训练稳定性等核心问题,是多模态模型训练中最关键的设计决策之一,直接决定了模型最终的多模态理解深度。

解答思路

典型训练范式分三个阶段:1)预对齐阶段:冻结LLM和Vision Encoder,只训练连接模块(如线性投影层或MLP),使用大量图文对数据学习基础的模态对齐映射;2)联合预训练:解冻部分参数,用混合数据(文本:图文约7:3)继续训练,逐步融合多模态理解能力;3)指令微调:用高质量多模态指令数据做SFT,提升指令遵循和复杂推理能力。文本数据占比高是为了防止已有语言能力退化。

关键要点

训练顺序很重要:先做模态对齐再做联合训练,否则随机初始化的连接模块会给LLM引入大量噪声梯度导致灾难性遗忘。数据配比需要动态调整:早期多用简单的对齐数据建立基础映射,后期逐步增加复杂的交错图文数据提升深层跨模态理解。视觉分辨率的选择也影响训练效率和最终效果。

加分回答

讨论动态分辨率训练策略(如LLaVA-NeXT的AnyRes),视觉token数量与训练效率的权衡分析,以及视频理解场景下时序信息融入的技术方案。提到近期研究发现数据质量比数量更重要的实验结论。

常见踩坑

一开始就全参数联合训练导致训练不稳定甚至崩溃;图文数据比例过高导致语言能力严重退化;忽略了不同分辨率图像对Vision Encoder的影响和适配需求。