Skip to main content

browseruse_bench.utils.eval_utils

评估相关的工具函数和类。

导入


EvaluationModel

用于任务评估的 OpenAI 模型封装类。
str
默认值:"gpt-4o"
模型名称
str
默认值:"None"
API Key,默认从环境变量读取
str
默认值:"None"
API Base URL,默认从环境变量读取

generate

生成评估响应,带自动重试。

load_evaluation_model

加载评估模型,支持环境变量回退。

配置

评估模型在根目录 config.yamleval: 段配置:
api_keybase_url 支持 $VAR 占位符,会在运行时从 .env 解析。

encode_image

将 PIL 图像转换为 base64 字符串。
PIL.Image
必填
PIL Image 对象
float
默认值:"1.0"
图像缩放比例(0.0 到 1.0 之间),例如 0.5 表示缩放到原尺寸的 50%

extract_score_from_response

从评估响应中提取数值分数。
str
必填
评估响应文本
int
提取出的分数(未找到时返回 0)

calculate_success

根据分数阈值判断任务是否成功。
int
必填
任务分数
int
默认值:"60"
成功阈值
bool
分数达到或超过阈值时返回 True

normalized_results_file

上下文管理器,返回一个保证为 JSONL 格式的路径。
Path
必填
结果文件路径

使用示例