跳转到主要内容
这里的每个示例都有真实可运行源码。先按被测对象选择,不必从头依次阅读。 如果你还没有跑通过第一条评估用例,先读 Quickstart。已经明确任务时,直接进入对应的 Tutorials 页面。

接入已有 Agent Framework

下面五组示例都保留接入前的普通应用和接入 NiceEval 后的完整项目。页面中的代码 diff 从这两份源码生成。 每组源码都位于 examples/zh/origin/examples/zh/tier1/。需要 OTel 或 Experiment Flags 时,再沿相同项目进入 tier2/tier3/

完整评测项目

自写 Adapter 评估 AI Agent 应用

一个 AI SDK v6 Web Agent,覆盖工具调用、图片理解、多轮会话、模型对比和双路可观测。

评估 Coding Agent 扩展

用真实 Workspace 和对照实验衡量 Skill、提示词与 Plugin Benchmark 对任务结果的影响。

真实项目

Coding Agent Memory Evals

coding-agent-memory-evals 用同一批开发任务和同一个模型,对比 Coding Agent 是否带持久记忆时的任务成功率、成本、耗时和行为差异。

Examples 的收录边界

  • 单段 API 用法放进任务教程或 Reference。
  • 没有可运行源码的伪项目不收录。
  • Roadmap 和尚未实现的接入不收录。
  • 同一个项目不为 Skill、Plugin、Hook 等相邻叫法复制多张案例页。