Skip to main content
本指南将带你完成从 Agent 配置到评估结果的完整流程。

概览

  1. 选择 Agent
  2. 配置 Agent
  3. 选择 Benchmark
  4. 运行任务
  5. 评估结果
  6. 查看输出

1. 选择 Agent

browseruse-bench 支持多个 Agent,可按需求选择:

2. 配置 Agent

所有 Agent 的运行时配置都写在根目录 config.yamlagents.<agent-name> 下,这是推荐方式。 复制示例配置并填入你的凭证:
然后编辑 config.yamlagents 部分:
运行时可通过 --model 切换模型,无需修改配置文件:

3. 选择 Benchmark

根据评估需求选择 Benchmark:

LexBench-Browser

  • 评估方式:视觉评估(截图序列)
  • 评分:0-100,默认阈值 60
  • 适用场景:视觉理解、多步推理

Online-Mind2Web

  • 评估方式:WebJudge 多轮评估
  • 评分:3 分制,默认阈值 3
  • 适用场景:网页导航与任务完成

BrowseComp

  • 评估方式:文本答案正确性
  • 评分:二值(正确/错误)
  • 适用场景:事实检索与信息抽取

4. 运行任务

基本命令

所有参数

输出结构

结果会保存到:

进度查看

日志位于 output/logs/run/

5. 评估结果

执行评估

脚本会自动在 --agent / --model-id 对应的输出目录下选择最新的运行结果。

评估参数

输出文件

评估结果保存在 tasks_eval_result/
  • 详细结果*_eval_results.json
  • 统计汇总*_summary.json

查看结果


完整示例


常见问题

超时错误

问题:任务超出配置的超时时间 解决:在 config.yamlagents.<agent>.defaults.timeout 中调大超时时间,或在命令行传入 --timeout

缺少截图(LexBench-Browser)

问题:评估因缺少截图而失败 解决:确认 tasks/<task_id>/trajectory/ 下有截图,并查看运行日志定位失败原因。

模型 API 报错

问题:LLM API 调用失败 解决:检查 config.yaml 中的 API Key(推荐使用 $ENV_VAR 引用,将实际值写入 .env);评估阶段同样请确认 .env

下一步

  • 自定义 Benchmark:学习如何创建自定义基准测试(指南
  • 排行榜:提交结果到排行榜(详情
  • 高级配置:了解更多 Agent 参数(文档