接入已有 Agent Framework
下面五组示例都保留接入前的普通应用和接入 NiceEval 后的完整项目。页面中的代码 diff 从这两份源码生成。
每组源码都位于
examples/zh/origin/ 和 examples/zh/tier1/。需要 OTel 或 Experiment Flags 时,再沿相同项目进入 tier2/ 和 tier3/。每次运行的结果从项目本机的 niceeval show、query 或 view 审阅。
完整评测项目
自写 Adapter 评估 AI Agent 应用
一个 AI SDK v6 Web Agent,覆盖工具调用、图片理解、多轮会话、模型对比和双路可观测。
评估 Coding Agent 扩展
用真实 Workspace 和对照实验衡量 Skill、提示词与 Plugin Benchmark 对任务结果的影响。
真实项目
Coding Agent Memory Evals
coding-agent-memory-evals 用同一批开发任务和同一个模型,对比 Coding Agent 是否带持久记忆时的任务成功率、成本、耗时和行为差异。Terminal-Bench
terminal-bench 用 NiceEval 跑经过审核的 Harbor Terminal-Bench 题包,判分仍走原版run-tests.sh,并把各 coding agent 与模型并排比较。
Examples 的收录边界
- 单段 API 用法放进任务教程或 Reference。
- 没有可运行源码的伪项目不收录。
- Roadmap 和计划中的接入不收录。
- 同一个项目不为 Skill、Plugin、Hook 等相邻叫法复制多张案例页。