Interview: 从零训练行业垂直大模型的技术路线图
题目解析
本题考察候选人对大模型全生命周期训练流程的理解,以金融领域为例,需要从数据、模型、训练、评估到部署制定完整的技术方案。核心挑战在于如何将领域知识有效注入模型,同时保持通用能力不退化。这是一个涉及多个技术环节的端到端系统工程问题。
解答思路
技术路线分为五个阶段:1)数据工程:收集金融语料(研报、财报、新闻、法规),构建高质量清洗pipeline,包括去重、质量过滤和敏感信息脱敏;2)继续预训练(CPT):在通用基座模型上用领域语料继续预训练,扩展金融词表;3)领域SFT:构建金融场景指令数据,覆盖风控、投研、合规等任务;4)对齐训练:通过RLHF/DPO确保输出准确性和合规性;5)评估与迭代:建立领域benchmark持续衡量效果。
关键要点
基座选型至关重要:选7B-13B规模在成本和效果间取得平衡。CPT阶段需要控制领域数据与通用数据的配比(通常3:7到5:5),防止灾难性遗忘。金融领域特别需要关注数值精确性和时效性。SFT数据质量远比数量重要,建议人工审核每条指令数据。
加分回答
讨论MoE架构在垂直模型中的应用潜力,提到数据飞轮机制(模型上线后持续收集反馈数据迭代),以及与知识图谱结合增强金融推理能力的技术方案。还可以探讨多任务联合训练提升模型的通用金融理解能力。
常见踩坑
高估CPT的效果而低估高质量SFT数据的重要性;忽略金融合规对模型输出的严格要求;未考虑数据时效性导致模型知识滞后;词表扩展时未充分预热新增token的embedding导致初期训练不稳定。