Skip to main content
NiceEval 是一个 Agent 评估工具,帮助团队衡量、评估并改进生产环境中的 AI。借助 NiceEval,团队可以比较模型、迭代 Agent、发现回归问题,并利用真实用户数据持续改进 AI 应用。 NiceEval 以本地优先为核心:你的评估在你自己的环境中运行。当团队需要分享评估结果、做回归跟踪时,可以通过 Report 上报到 BrainTrust 等平台,或者自定义报告导出。 它既能评估用于 Claude Code / Codex 的 Plugins、Hook 和 Skill,也能直接评你自己的 AI Agent 应用。无论你的 Agent 基于 AI SDK、LangGraph、Pi 还是自研 Agent SDK,都可以通过 Adapter 接入同一套评估体系。

构建评估用例

为什么有了 DeepEval、LangFuse、BrainTrust 还需要 NiceEval

NiceEval 是一个 Agent-Native 的评估工具。Dataset / golden 那一套「构建 Input 与 Expected Output」的模式,并不适合真实的 Agent 评估。现在的 Agent 要在多轮对话、多 agent 协作、工具调用、Skill 加载等细粒度场景下被检查,NiceEval 就是为这类场景设计的:断言直接落在工具调用、消息内容、结构化输出和用量上,而不是要求你先手工准备一份 golden 测试集。 像 LangFuse、BrainTrust 这类工具更偏 tracing 和监控,对「写评估用例、跑评估用例、看结果」这条路径来说太重。NiceEval 从一开始就针对这条路径做了友好的开发体验。两者也不冲突:NiceEval 能与 LangFuse、BrainTrust 共存——可以用它们做 tracing,或者把评估结果上传到两者。

你可以评什么

Coding Agent

把 Claude Code、Codex、bub 放进 Sandbox,给它任务,再用真实测试和文件断言验证结果。

你自己的 AI Agent 应用

直连你的应用接口,断言回复、工具调用和结构化输出。通过 Flag 切换测试不同版本的 Prompt

两种接入模式

适合 Codex、Claude Code 这类必须在真实文件系统中改代码、跑命令的 coding agent。

核心概念一览

完整术语表见架构概览

从你的场景开始

接入 Agent

连接你的 Agent,写一个 Adapter,把消息、工具调用和结构化输出翻译成标准事件流。

评估 Coding Agent 扩展

用真实 Workspace 和对照实验衡量 Skill、提示词与 Plugin Benchmark 的效果。

学习如何写评估用例与实验

了解如何写评估用例、断言、实验配置和报告。

接下来读什么

快速开始 会带你安装 NiceEval、构建评估用例、得到评估报告。