- Adapter:告诉 NiceEval 怎样调用你的应用。
- Experiment:说明对着哪个 Adapter、用哪个模型跑。
- 评估用例:说明发什么消息、怎样算做对。
让 Coding Agent 帮你接入
1
把指令发给 Agent
在当前项目里打开你正在用的 Coding Agent,例如 Claude Code 或 Codex,发送下面这段话:Agent 会先探索你的项目,确认要测哪个接口,再写出三个文件并跑一次。
2
自己再跑一次
用 Agent 最后列出的 Experiment ID 运行。它没有列出时,先用
pnpm exec niceeval exp list 查看有哪些 Experiment:3
看结果
自己动手接入
准备被测应用
先把你的应用启动起来,并确认它有一个能调用的接口。下面的示例假设:- 接口是
POST http://localhost:3000/chat; - 请求体是
{ "message": "...", "model": "..." }; - 响应体是
{ "reply": "..." }。
安装
init 会创建 niceeval.config.ts。它还会在 AGENTS.md 或 CLAUDE.md 里写一段说明,让你的 Coding Agent 读取和安装版本匹配的文档。
写 Adapter
Adapter 负责一件事:把评估用例里的消息发给你的应用,再把回复交回给 NiceEval。events 是 NiceEval 读懂回复的方式。这里只交回一条助手消息,后面可以再加工具调用、用量等事件。
写 Experiment
my-agent。以后想对比另一个模型,复制一份改 model 就行,评估用例不用动。
写评估用例
运行
读懂结果
标题告诉你这次运行的结论:
失败的 Attempt 下面都有一行
details: niceeval show @<locator>,复制它就能在终端里看到这一次运行的对话和断言。看整次运行,复制 NEXT 面板里的 show: 命令;想在浏览器里翻对话、看耗时,复制 view: 那一行。
更多查看方式见查看运行结果。