Paper: A Survey on Evaluation of Large Language Models
一句话概括
全面综述大语言模型的评估体系,涵盖评估什么、如何评估、以及当前评估面临的挑战。
核心思想
LLM的能力评估远比传统NLP模型复杂——它们不再是单任务模型,而是通用智能系统。综述从三个维度梳理评估体系:(1)评估内容——知识、推理、语言理解、数学、编程、创造力等多维能力;(2)评估基准——MMLU、GSM8K、HumanEval、BIG-Bench等主流测试集;(3)评估方法——自动评估、人工评估、模型评估(LLM-as-Judge)。
关键创新
系统化的评估分类体系:将LLM能力划分为自然语言处理、推理、自然科学、社会科学、智能体、伦理等大类。深入分析了各类评估方法的优缺点:自动指标缺乏开放式评估能力,人工评估成本高且主观,LLM-as-Judge高效但存在偏好偏差。提出了动态评估和对抗评估等前沿方向。
深远影响
评估体系直接影响了LLM的研发方向——研究者倾向于优化被评估的能力。综述揭示的评估缺陷(如数据污染、评估饱和等)推动了更科学的评估基准设计,如LiveBench等动态更新的基准。
启发与思考
当前的评估体系可能存在根本性不足:我们用静态的题目测试一个需要动态交互的智能系统。未来的评估应更多关注实际任务完成能力而非考试成绩,从做题转向做事。