Skip to main content
这一页带你对自己的应用跑通第一条评估用例。你会写三个文件:
  • Adapter:告诉 NiceEval 怎样调用你的应用。
  • Experiment:说明对着哪个 Adapter、用哪个模型跑。
  • 评估用例:说明发什么消息、怎样算做对。
有两种走法。让 Coding Agent 帮你写最快;自己动手写能更清楚每个文件管什么。

让 Coding Agent 帮你接入

1

把指令发给 Agent

在当前项目里打开你正在用的 Coding Agent,例如 Claude Code 或 Codex,发送下面这段话:
Agent 会先探索你的项目,确认要测哪个接口,再写出三个文件并跑一次。
2

自己再跑一次

用 Agent 最后列出的 Experiment ID 运行。它没有列出时,先用 pnpm exec niceeval exp list 查看有哪些 Experiment:
3

看结果

终端里会列出每条评估用例的结果,失败的排在前面。结果怎么读,见下文读懂结果。

自己动手接入

准备被测应用

先把你的应用启动起来,并确认它有一个能调用的接口。下面的示例假设:
  • 接口是 POST http://localhost:3000/chat;
  • 请求体是 { "message": "...", "model": "..." };
  • 响应体是 { "reply": "..." }。
你的接口不一样也没关系,只需要改 Adapter 里的地址、请求体和读取回复的那一行。手边还没有能启动的应用时,先从 Examples 挑一个可运行项目。

安装

init 会创建 niceeval.config.ts。它还会在 AGENTS.md 或 CLAUDE.md 里写一段说明,让你的 Coding Agent 读取和安装版本匹配的文档。

写 Adapter

Adapter 负责一件事:把评估用例里的消息发给你的应用,再把回复交回给 NiceEval。
events 是 NiceEval 读懂回复的方式。这里只交回一条助手消息,后面可以再加工具调用、用量等事件。

写 Experiment

文件名就是 Experiment ID,这里是 my-agent。以后想对比另一个模型,复制一份改 model 就行,评估用例不用动。

写评估用例

模型每次的措辞都会变,所以这里用正则匹配“30 天”或“一个月”,而不是要求一字不差。

运行

运行过程中终端会显示进度。结束后你会看到类似这样的输出:
到这里,第一条评估用例已经跑通。

读懂结果

标题告诉你这次运行的结论: 失败的 Attempt 下面都有一行 details: niceeval show @<locator>,复制它就能在终端里看到这一次运行的对话和断言。看整次运行,复制 NEXT 面板里的 show: 命令;想在浏览器里翻对话、看耗时,复制 view: 那一行。 更多查看方式见查看运行结果。

接下来

这个最小 Adapter 只支持单轮对话,第二轮不会带上第一轮的历史,也看不到工具调用。按你的下一步需要选:
  • 要测多轮对话、工具调用或用量:按编写 Send扩展 Adapter,已有评估用例不用改。
  • 要写更多、更有区分度的评估用例:读编写评估用例。
  • 要比较两个模型或两版 prompt:读编写实验。
  • 要在 PR 上自动跑:读 CI 集成。