Paper: Can Large Language Models Generate Novel Research Ideas?


一句话概括

首次大规模实证研究LLM生成研究想法的能力,发现LLM产生的想法在新颖性上可能超过人类研究者。

核心思想

这项工作通过严格的实验设计来回答一个根本性问题:LLM能否产生有价值的新研究想法?研究招募了100多位NLP领域的专家研究者,分别由人类和LLM生成研究想法,然后由不知来源的评审专家进行盲审评分。评估维度包括新颖性、可行性、有效性等。

关键创新

核心发现:(1)LLM生成的想法在新颖性评分上显著高于人类专家——但可行性评分略低;(2)人类评审无法可靠地区分LLM和人类生成的想法;(3)LLM的想法多样性不足,不同提示下倾向于生成相似的想法。实验设计本身也是创新——这是首次对AI科研能力进行大规模受控实验。

深远影响

这项研究引发了科研界关于AI辅助研究的广泛讨论。如果LLM确实能产生新颖的研究想法,那科研工作流程将发生根本性变革。同时也引发了关于学术诚信、创新归属、以及研究多样性(如果所有人都用同一个AI)的深层思考。

启发与思考

LLM的新颖性可能来自其能够快速组合海量文献中的想法——这是人类受限于阅读量而难以做到的。但可行性不足说明LLM缺乏对研究实践的深度理解。未来AI辅助科研可能采用AI生成想法+人类评估筛选+AI辅助执行的协作模式。