Paper: A Survey on Evaluation of Large Language Models


一句话概括

全面综述大语言模型的评估体系,涵盖评估什么、如何评估、以及当前评估面临的挑战。

核心思想

LLM的能力评估远比传统NLP模型复杂——它们不再是单任务模型,而是通用智能系统。综述从三个维度梳理评估体系:(1)评估内容——知识、推理、语言理解、数学、编程、创造力等多维能力;(2)评估基准——MMLU、GSM8K、HumanEval、BIG-Bench等主流测试集;(3)评估方法——自动评估、人工评估、模型评估(LLM-as-Judge)。

关键创新

系统化的评估分类体系:将LLM能力划分为自然语言处理、推理、自然科学、社会科学、智能体、伦理等大类。深入分析了各类评估方法的优缺点:自动指标缺乏开放式评估能力,人工评估成本高且主观,LLM-as-Judge高效但存在偏好偏差。提出了动态评估和对抗评估等前沿方向。

深远影响

评估体系直接影响了LLM的研发方向——研究者倾向于优化被评估的能力。综述揭示的评估缺陷(如数据污染、评估饱和等)推动了更科学的评估基准设计,如LiveBench等动态更新的基准。

启发与思考

当前的评估体系可能存在根本性不足:我们用静态的题目测试一个需要动态交互的智能系统。未来的评估应更多关注实际任务完成能力而非考试成绩,从做题转向做事。