Interview: Agent在真实环境中的观察空间过大问题与信息提取策略


题目解析

真实环境(网页、代码库、数据库)的信息量远超LLM上下文窗口容量。如何从海量观察中提取关键信息是Agent实用化的核心挑战。

解答思路

信息提取策略分为三个层次:(1)预过滤——在信息进入Agent之前就做筛选,如只抓取网页的主要内容区域忽略导航栏广告,只返回代码搜索的前N个最相关结果;(2)动态摘要——用独立的摘要模型将长文本压缩为关键信息,保留与当前任务相关的部分;(3)渐进式探索——Agent不一次性获取全部信息,而是通过多轮交互逐步深入——先看目录结构再看具体文件,先搜索再定位再阅读。

关键要点

核心设计原则是”按需获取,最小信息量”。具体技术:(1)为每种工具设计合适的输出格式和截断策略——搜索结果只返回标题和摘要,文件阅读支持行号范围;(2)维护任务相关的”注意力焦点”——根据当前目标动态调整信息过滤的条件;(3)引入分层表示——如代码Agent先看类/函数签名,需要时再看具体实现。这直接影响Agent的效率和成功率。

加分回答

可以讨论WebArena等基准中Agent如何处理复杂网页的观察空间问题,以及Accessibility Tree作为网页简化表示的方案。还可以提到SWE-Agent的ACI设计中如何通过限制显示行数和提供搜索命令来管理代码观察空间。

常见踩坑

最常见的错误是将完整观察塞入上下文——导致关键信息被淹没和token浪费。另一个坑是过度压缩导致信息丢失——Agent因为缺少关键细节而做出错误决策。找到压缩率和信息保留的平衡点需要大量实验调参。