Paper: WebArena: A Realistic Web Environment for Building Autonomous Agents


一句话概括

WebArena构建了一个高度真实的网页交互环境,包含多个功能完备的网站,用于评估自主Agent完成复杂网页任务的能力。

核心思想

之前的网页Agent评测多使用简化的或静态的环境。WebArena部署了4个功能完备的真实网站(电商、论坛、代码仓库、内容管理系统),包含真实数据和完整功能。Agent需要理解自然语言指令,在这些网站上完成实际任务。任务需要跨页面导航、信息提取、表单填写等复杂操作。评测使用功能正确性而非轨迹匹配来判断任务完成度。

关键创新

1) 高保真的网页环境,支持完整的交互功能;2) 812个多样化的人工标注任务;3) 基于功能正确性的评估方法;4) 暴露了当前最强模型在真实网页任务上的巨大差距——GPT-4也仅完成约14%的任务。

深远影响

WebArena成为评估网页Agent的标杆基准,推动了自主网页Agent的快速发展。它所揭示的巨大提升空间也吸引了大量研究投入。

启发与思考

WebArena的低通过率提醒我们:在真实复杂环境中,AI Agent离人类水平还很远。真正的挑战不在于单个操作,而在于长序列决策中的规划、错误恢复和状态理解。这是Agent研究最需要突破的方向。