Skip to main content

前置要求

  • Python 3.11+
  • Node.js 18+(仅 Agent-TARS 需要)
  • uv(推荐的 Python 包管理器)

安装

1

克隆仓库

2

安装 Python 依赖

激活 venv,确保 bubench 可用:
Windows PowerShell:
bubench run 会在首次运行时创建 config.yaml 中指定的 venv(内置默认: .venvs/browser_use.venvs/skyvern.venvs/agent_tars),并自动安装对应 Agent 的依赖。 Agent 的 venv 必须显式配置(不会回退到 .venv)。 如果未安装 uv,创建/安装会退回到 python -m venvpip
3

配置环境变量 (.env)

编辑 .env——以 .env.example 为准,下列是常用项。 config.yaml 中的 $VAR 占位符会在运行时从该文件解析。
Lexmount 凭据:到 browser.lexmount.cn(国内)或 browser.lexmount.com(国外)申请 LEXMOUNT_API_KEYLEXMOUNT_PROJECT_ID。完整配置步骤参见 Lexmount 云浏览器
4

配置 config.yaml

根目录 config.yaml 是项目的运行时主配置,$VAR 占位符会在运行时从 .env 解析。 需要配置三部分:1. Agent 模型 — 在 agents.<agent> 下指定默认使用的模型:
运行时可通过 --model <name> 覆盖 active_model,无需改文件。
2. 浏览器后端 — 在 agents.<agent>.browser 下选择一个 browser_id, 只保留对应后端所需的参数,其它注释掉:
详细后端选项参见 本地 Chromium 浏览器Lexmount 云浏览器 及各 Agent 的文档页。重要:本地 Chromium 不会继承系统 / clash / v2ray 代理——若需访问裸连不可达的站点(如 bloomberg.comarchive.org),请配 local_proxy_server3. Eval 评估模型 — 供 bubench eval 作为 LLM-as-judge 评判使用:
5

安装 Agent-TARS CLI(可选)

6

安装技能包(可选)

快速运行

运行你的第一个 Benchmark

快速自检(推荐)

加上 --dry-run 可校验配置加载与任务筛选,不会真的执行任务:
--dry-run 只校验 config.yaml / .env 能否正常解析、--data / --split / --mode 能否匹配到至少一个任务; 不会创建 Agent venv、调用模型 API、也不会启动浏览器——这些都只在真实运行时发生。

评估结果

--model-id 决定 eval 读取哪个输出子目录(experiments/<benchmark>/<split>/<agent>/<model_id>/)。 不传时会回退到 config.yamlagents.<agent>.active_model 对应的 model_id,与 bubench run 默认写入的路径一致。
日志: 脚本执行日志保存在 output/logs/ 目录下。
  • run.py: output/logs/run/
  • eval.py: output/logs/eval/
  • leaderboard: output/logs/leaderboard/

生成排行榜

运行模式

注意: --task-ids 需要以空格分隔多个 ID。

常用参数

其他常用参数:
  • --data-source: localhuggingface
  • --force-download: HuggingFace 模式下强制重新下载。
  • --agent-config: 可选的备用 root-config YAML 路径(与 config.yaml 同结构)。默认读取仓库根 config.yaml
  • --timestamp: 指定运行/恢复的目录(格式 YYYYMMDD_HHmmss)。
--timeout 会覆盖 Agent 配置中的 TIMEOUT

断点续跑

如果运行中途中断,可用 --timestamp 指向原输出目录,并加 --skip-completed 跳过已完成的任务:
提示: 在 experiments/{benchmark}/{split}/{agent}/ 下可查看已有的 timestamp 目录名。

并行运行多个 Agents

bubench run 使用 config.yaml 中为 agent 指定的 venv,并在首次运行时自动创建/安装依赖。 内置 agent 默认使用独立 venv:
  • browser-use -> .venvs/browser_use
  • skyvern -> .venvs/skyvern
  • Agent-TARS -> .venvs/agent_tars
如果某个 agent 条目未配置 venvbubench run 会直接报错,不会回退到 .venv 如果需要同时运行互斥的 Agent,可以在两个终端中分别运行各自的 Agent,确保使用不同的 venv。

并行执行任务(按 Task ID 分片)

对于大型 benchmark,可将任务按 ID 拆分到多个终端并行运行:
两个终端使用相同的 --timestamp,可将结果写入同一个输出目录。

Node.js Agents(无冲突)

Agent-TARS 通过 Node.js CLI 运行,不与 Python 依赖冲突。 安装 CLI 后可在任意终端运行:

下一步

支持的 Agents

了解可用的浏览器代理

Benchmarks 详解

深入了解各个基准测试

云浏览器配置

使用 Lexmount 云浏览器

查看排行榜

对比不同 Agent 的性能