Interview: Agent系统可靠性评估:成功率之外的关键指标


题目解析

Agent系统的评估远比传统NLP任务复杂。成功率是最直观的指标但远远不够,面试官希望你能从多个维度全面分析Agent的质量。

解答思路

除成功率外,关键指标包括:(1)效率指标——平均步骤数、token消耗量、总耗时、工具调用次数,衡量Agent是否在”绕弯路”;(2)鲁棒性指标——相同任务多次执行的一致性(方差)、面对输入扰动的稳定性;(3)安全性指标——是否执行了危险操作、是否泄露了敏感信息、是否遵守了权限边界;(4)可恢复性——遇到错误后能否自我修正并最终完成任务;(5)成本效益比——完成单个任务的实际成本(API调用费+工具费用)。

关键要点

特别重要但常被忽略的指标是”有害失败率”——Agent不仅没完成任务还造成了负面影响(如误删文件、发送错误邮件)。这比简单失败严重得多。另外要关注”拒绝率”——Agent应该知道什么时候不做,能正确拒绝超出能力范围的任务也是可靠性的体现。

加分回答

可以引用AgentBench、SWE-bench、WebArena等主流Agent评估基准,说明它们各自覆盖了哪些评估维度。还可以提出评估应区分”过程正确性”和”结果正确性”——一个通过错误方式得到正确结果的Agent不应被视为可靠。

常见踩坑

最大的陷阱是只关注benchmark得分而忽略真实场景中的边缘案例。另外容易忽视评估的统计显著性——Agent行为的高方差意味着少量样本的评估结果可能非常不可靠。