browseruse_bench.utils.eval_utils
评估相关的工具函数和类。导入
EvaluationModel
用于任务评估的 OpenAI 模型封装类。str
默认值:"gpt-4o"
模型名称
str
默认值:"None"
API Key,默认从环境变量读取
str
默认值:"None"
API Base URL,默认从环境变量读取
generate
生成评估响应,带自动重试。load_evaluation_model
加载评估模型,支持环境变量回退。配置
评估模型在根目录config.yaml 的 eval: 段配置:
api_key 与 base_url 支持 $VAR 占位符,会在运行时从 .env 解析。
encode_image
将 PIL 图像转换为 base64 字符串。PIL.Image
必填
PIL Image 对象
float
默认值:"1.0"
图像缩放比例(0.0 到 1.0 之间),例如 0.5 表示缩放到原尺寸的 50%
extract_score_from_response
从评估响应中提取数值分数。str
必填
评估响应文本
int
提取出的分数(未找到时返回 0)
calculate_success
根据分数阈值判断任务是否成功。int
必填
任务分数
int
默认值:"60"
成功阈值
bool
分数达到或超过阈值时返回 True
normalized_results_file
上下文管理器,返回一个保证为 JSONL 格式的路径。Path
必填
结果文件路径