配置模型和凭据来源
niceeval.config.ts
judge.model,不要添加单次 recipe model 参数。
写一条最小真实判分
evals/judge-smoke.eval.ts
judge: true 声明这条评估需要 Judge,并从 Experiment 与项目配置继承字段。.gate(0.8) 把 measurement 变成通过制要求;低于阈值时 Attempt 为 failed。
只运行这条验证评估
先确保一个现有 Experiment 的evals 选择范围包含 judge-smoke,再用第二个位置参数只选择这条评估。下面以 Experiment ID local 为例:
pnpm exec niceeval exp list 查实际 Experiment ID;不要把评估用例 ID 同时当成 Experiment ID。模型和密钥都存在时,Runner 会在派发前预检 Judge 端点。预检失败属于 setup error,不会生成伪造的 Judge 分数。
查看判分结果
从完成反馈复制 Run ID:
正式题目应先用代表性结果校准 rubric 和阈值。比较两个 Judge 模型时,让两个 Experiment 选择同一批评估用例,并用不同
labels 标出 Judge 条件;完整矩阵写法见实验矩阵。