两组实验
Ponytail 这一组迁移自第三方 Plugin 的 Agentic Benchmark,但这个仓库实际比较的是注入给 Agent 的内容与提示。它不用于证明某个原生 Plugin 包装或安装协议是否正确。原生 Skill / Plugin 的安装配置见 官方适配器。
实验设计
每个 Arm 固定相同的模型、Sandbox、任务集、Runs 和预算,只改变注入内容。评估用例不读取“当前是哪个 Arm”,也不为某个对照配置降低验收标准。跑起来
从这个案例复用什么
- 用 Experiment 表达有扩展和无扩展的对照,不让评估用例知道实验条件。
- Prompt 不泄露答案;验证阶段再检查测试、源码、Diff 和行为证据。
- 把任务成功率作为主指标,把 Token、成本、耗时和行为作为解释指标。
- 评分指南 负责选择 Gate、Soft 和 Judge;本页不复制评分 API。