Skip to main content
这里的每个示例都有真实可运行源码。先按被测对象选择,不必从头依次阅读。 如果你还没有跑通过第一条评估用例,先读 Quickstart。已经明确任务时,直接进入对应的 Tutorials 页面。

接入已有 Agent Framework

下面五组示例都保留接入前的普通应用和接入 NiceEval 后的完整项目。页面中的代码 diff 从这两份源码生成。 每组源码都位于 examples/zh/origin/examples/zh/tier1/。需要 OTel 或 Experiment Flags 时,再沿相同项目进入 tier2/tier3/。每次运行的结果从项目本机的 niceeval showqueryview 审阅。

完整评测项目

自写 Adapter 评估 AI Agent 应用

一个 AI SDK v6 Web Agent,覆盖工具调用、图片理解、多轮会话、模型对比和双路可观测。

评估 Coding Agent 扩展

用真实 Workspace 和对照实验衡量 Skill、提示词与 Plugin Benchmark 对任务结果的影响。

真实项目

Coding Agent Memory Evals

coding-agent-memory-evals 用同一批开发任务和同一个模型,对比 Coding Agent 是否带持久记忆时的任务成功率、成本、耗时和行为差异。

Terminal-Bench

terminal-bench 用 NiceEval 跑经过审核的 Harbor Terminal-Bench 题包,判分仍走原版 run-tests.sh,并把各 coding agent 与模型并排比较。

Examples 的收录边界

  • 单段 API 用法放进任务教程或 Reference。
  • 没有可运行源码的伪项目不收录。
  • Roadmap 和计划中的接入不收录。
  • 同一个项目不为 Skill、Plugin、Hook 等相邻叫法复制多张案例页。