Synthetic Data合成数据
一句话总结
合成数据利用AI模型生成训练数据,解决高质量标注数据稀缺的问题,已成为现代LLM训练的关键技术。
核心概念
合成数据的主要方法包括:用强模型生成弱模型的训练数据(蒸馏)、Self-Instruct(模型自生成指令-回答对)、Evol-Instruct(进化式复杂化指令)、拒绝采样(生成多个回答取最优)。应用场景涵盖指令微调数据、推理链数据、对齐偏好数据。质量控制是关键,需要过滤低质量样本和去重。代表性数据集如Alpaca、OpenHermes、UltraChat。
为什么重要
高质量人工标注数据昂贵且难以规模化。合成数据让中小团队也能构建高质量的训练集。在数学推理、代码生成等领域,合成数据已被证明与人工数据同样有效。
实践要点
合成数据的质量上限取决于生成模型的能力。需要严格的质量过滤流程。注意数据多样性,避免模式单一。结合少量真实数据可以显著提升效果。标注生成数据的来源,便于追溯和审计。
常见误区
认为合成数据可以完全替代真实数据。忽视合成数据中可能继承的偏见和错误。用同一模型生成数据再训练同一模型会导致”模型坍缩”。不做去重和质量过滤直接使用。