Paper: World Models综述: 从Ha & Schmidhuber到Genie
一句话概括
世界模型旨在构建环境的内部表示和预测模型,使智能体能通过想象来规划行动,而非完全依赖真实交互。
核心思想
Ha & Schmidhuber(2018)提出经典的世界模型框架:用VAE编码观测、RNN预测未来状态、在梦境中训练策略。核心思想是智能体维护一个可以预测环境动态的内部模型,基于这个模型进行规划和决策。这一理念在大模型时代获得了新的生命力——视频生成模型和大语言模型都被视为某种形式的世界模型。
关键创新
关键发展:(1)经典阶段——World Models(VAE+RNN)、DreamerV1/V2/V3(基于潜在空间的模型预测控制);(2)大模型阶段——GAIA-1(用Transformer建模驾驶世界)、UniSim(通用世界模拟器);(3)生成式世界模型——Genie(从视频学习可交互的虚拟环境)、Sora(视频生成即世界模拟)。
深远影响
世界模型连接了生成式AI与具身智能两大方向。如果能构建出足够精确的世界模型,机器人可以先在模拟中学习再部署到真实世界,自动驾驶可以生成无限训练场景,游戏AI可以创建无限内容。
启发与思考
大语言模型在某种意义上已经是语言世界的世界模型——它们能预测接下来会发生什么。将这种能力从语言扩展到物理世界,可能是通向AGI的重要路径之一。关键问题是:预测能力等于理解能力吗?