NiceEval

更适合 Agent 的评估。

文档

阅读文档,在 10 分钟内为你的 Agent 构建评估

你的项目/
  • agents/web-agent.ts适配器
  • evals/
  • weather-tool.eval.ts
  • image-understanding.eval.ts
  • experiments/compare-models/
  • niceeval.config.ts配置
$ niceeval
weather通过
fixtures/button91.7%
compare-models
  • gpt-5.4100%
  • deepseek-v4-pro60%
1

接入

通过适配器与o11y,接入你的 Agent 或者 CC/Codex

2

定义

像写单元测试一样写评估与实验

3

评估

并行评估

Eval 示例

Eval 对话、工具调用与 Coding Agent

每张卡都是一个可直接运行的 defineEval 文件。点击高亮行,展开助手回复和断言说明。

多模态多轮看图问答
通过
1import { defineEval } from "niceeval";
2
3export default defineEval({
4 description: "评估 agent 在多轮对话中多模态的能力",
5
6 async test(t) {
13
14 await t.group("后续追问能联系图片上下文", () => {
16 });
17
18 t.judge.autoevals
19 .closedQA("助手是否在三轮对话中始终基于第一轮发送的图片内容作答,而不是凭空发挥?")
21 },
22});

Agent 也是用户

把评估变成循环

NiceEval 的 CLI 把 Agent 也当成用户来设计——它不只是评估工具,而是构建评估、执行评估、优化 Agent 系统的循环框架。每个输出都有给 agent 读的一面,coding agent 靠 bash 就能跑完整个循环。

评估exp local诊断show @id归因show --source优化claude
终端niceeval exp local --output agent --force
$ niceeval exp local --output agent --force
NICEEVAL RESULT failed
summary: 14 passed, 1 failed, 0 errored
failures:
  - @1k2m9qtr weather/brooklyn [local]
      gate: tool was never called
next:
  niceeval show @1k2m9qtr
  niceeval show @1k2m9qtr --execution