Skip to main content
Judge 适合规则难以写成精确 Match 的开放式质量判断。先用一条最小评估确认模型、密钥和端点都能真实判分,再把 Judge 加进正式题目。

配置模型和凭据来源

niceeval.config.ts
密钥只放进进程环境:
配置文件只保存环境变量名,不保存密钥值。项目需要比较 Judge 模型时,在不同 Experiment 中覆盖 judge.model,不要添加单次 recipe model 参数。

写一条最小真实判分

evals/judge-smoke.eval.ts
judge: true 声明这条评估需要 Judge,并从 Experiment 与项目配置继承字段。.gate(0.8) 把 measurement 变成通过制要求;低于阈值时 Attempt 为 failed

只运行这条验证评估

先确保一个现有 Experiment 的 evals 选择范围包含 judge-smoke,再用第二个位置参数只选择这条评估。下面以 Experiment ID local 为例:
pnpm exec niceeval exp list 查实际 Experiment ID;不要把评估用例 ID 同时当成 Experiment ID。模型和密钥都存在时,Runner 会在派发前预检 Judge 端点。预检失败属于 setup error,不会生成伪造的 Judge 分数。

查看判分结果

从完成反馈复制 Run ID:
结果应包含 Judge measurement、threshold、condition、理由和裁剪后的材料。重点区分三类失败: 正式题目应先用代表性结果校准 rubric 和阈值。比较两个 Judge 模型时,让两个 Experiment 选择同一批评估用例,并用不同 labels 标出 Judge 条件;完整矩阵写法见实验矩阵