构建评估用例
为什么有了 DeepEval、LangFuse、BrainTrust 还需要 NiceEval
NiceEval 是一个 Agent-Native 的评估工具。Dataset / golden 那一套「构建 Input 与 Expected Output」的模式,并不适合真实的 Agent 评估。现在的 Agent 要在多轮对话、多 agent 协作、工具调用、Skill 加载等细粒度场景下被检查,NiceEval 就是为这类场景设计的:断言直接落在工具调用、消息内容、结构化输出和用量上,而不是要求你先手工准备一份 golden 测试集。 像 LangFuse、BrainTrust 这类工具更偏 tracing 和监控,对「写评估用例、跑评估用例、看结果」这条路径来说太重。NiceEval 从一开始就针对这条路径做了友好的开发体验。两者也不冲突:NiceEval 能与 LangFuse、BrainTrust 共存——可以用它们做 tracing,或者把评估结果上传到两者。你可以评什么
Coding Agent
把 Claude Code、Codex、bub 放进 Sandbox,给它任务,再用真实测试和文件断言验证结果。
你自己的 AI Agent 应用
直连你的应用接口,断言回复、工具调用和结构化输出。通过 Flag 切换测试不同版本的 Prompt
两种接入模式
- Sandbox mode
- Direct mode
适合 Codex、Claude Code 这类必须在真实文件系统中改代码、跑命令的 coding agent。
核心概念一览
完整术语表见架构概览。
从你的场景开始
接入 Agent
连接你的 Agent,写一个 Adapter,把消息、工具调用和结构化输出翻译成标准事件流。
评估 Coding Agent 扩展
用真实 Workspace 和对照实验衡量 Skill、提示词与 Plugin Benchmark 的效果。
学习如何写评估用例与实验
了解如何写评估用例、断言、实验配置和报告。