Interview: Fine-tuned模型训练与生产效果差异的排查思路
题目解析
Fine-tuned模型在训练集表现好但生产效果差是极其常见的问题,几乎每个做过模型落地的团队都会遇到。本题考察候选人的系统性排查能力,需要从数据、模型、推理配置和评估方法等多个维度分析可能的原因,并给出高效的排查路径和修复方案。
解答思路
按优先级排查四个层面:1)数据分布偏移:对比训练数据和生产数据的分布差异,包括输入长度、领域分布、语言风格、用户表达习惯等,这是最常见的原因;2)评估方法不一致:检查训练时的评估指标是否与生产环境的衡量标准匹配,线下评估场景是否过于简化;3)推理配置差异:检查temperature、top_p、max_tokens等生成参数是否一致,prompt模板是否严格匹配;4)过拟合:检查训练集和验证集的loss曲线是否分叉。
关键要点
最常见的原因是训练数据未能覆盖生产环境的真实分布。建议从生产环境采样badcase,系统分析其与训练数据的分布差异。同时务必检查prompt模板是否在训练和推理间保持严格一致,即使微小的格式差异(如多一个换行符)就可能导致显著性能下降。
加分回答
提到构建持续监控体系实时跟踪模型在生产环境的表现漂移,建立自动化的回归测试集确保每次更新不引入退化,以及通过数据飞轮机制持续收集生产反馈改进训练数据分布。讨论shadow mode做新旧模型线上对比评估。
常见踩坑
只看整体指标不看分场景表现,掩盖了特定场景的严重退化;训练时用了teacher forcing但推理时是auto-regressive导致exposure bias;忽略了system prompt在训练和推理间格式不一致的问题。