niceeval exp 结束时,终端的 NEXT 面板都会列出这次新建的 Run ID,把基线和候选的 ID 记下来。
在浏览器里并排看
让脚本和 CI 读比较结果
自动化流程需要结构化的比较结果时,用runs.compare 请求:
mode 决定怎样对齐两边:
比较结果会如实给出两边各自的分母,以及没配上对的题、被排除的题和缺失的结果。缺失不会被当成零分或失败。条件不满足时,你会得到一个说明原因的具名错误,而不是一个看起来正常的数字。
先用
query explain 检查请求是否合法,再正式运行:
比较结果靠得住的前提
- 两边跑的是同一批评估用例,每条跑的次数也相近。
- 两边只差你想比较的那一个变量,写法见编写实验。
- 看通过率的同时看成本和耗时。通过率高一点、成本却翻倍,不一定值得换。