概览
- 选择 Agent
- 配置 Agent
- 选择 Benchmark
- 运行任务
- 评估结果
- 查看输出
1. 选择 Agent
browseruse-bench 支持多个 Agent,可按需求选择:2. 配置 Agent
所有 Agent 的运行时配置都写在根目录config.yaml 的 agents.<agent-name> 下,这是推荐方式。
复制示例配置并填入你的凭证:
config.yaml 的 agents 部分:
--model 切换模型,无需修改配置文件:
3. 选择 Benchmark
根据评估需求选择 Benchmark:LexBench-Browser
- 评估方式:视觉评估(截图序列)
- 评分:0-100,默认阈值 60
- 适用场景:视觉理解、多步推理
Online-Mind2Web
- 评估方式:WebJudge 多轮评估
- 评分:3 分制,默认阈值 3
- 适用场景:网页导航与任务完成
BrowseComp
- 评估方式:文本答案正确性
- 评分:二值(正确/错误)
- 适用场景:事实检索与信息抽取
4. 运行任务
基本命令
所有参数
输出结构
结果会保存到:进度查看
日志位于output/logs/run/:
5. 评估结果
执行评估
--agent / --model-id 对应的输出目录下选择最新的运行结果。
评估参数
输出文件
评估结果保存在tasks_eval_result/:
- 详细结果:
*_eval_results.json - 统计汇总:
*_summary.json
查看结果
完整示例
常见问题
超时错误
问题:任务超出配置的超时时间 解决:在config.yaml 的 agents.<agent>.defaults.timeout 中调大超时时间,或在命令行传入 --timeout。
缺少截图(LexBench-Browser)
问题:评估因缺少截图而失败 解决:确认tasks/<task_id>/trajectory/ 下有截图,并查看运行日志定位失败原因。
模型 API 报错
问题:LLM API 调用失败 解决:检查config.yaml 中的 API Key(推荐使用 $ENV_VAR 引用,将实际值写入 .env);评估阶段同样请确认 .env。