跳转到主要内容
这个案例把扩展内容作为 Experiment 变量,让同一个 Coding Agent 在同一批真实开发任务上运行,再比较任务成功率、成本、耗时和行为差异。

两组实验

Ponytail 这一组迁移自第三方 Plugin 的 Agentic Benchmark,但这个仓库实际比较的是注入给 Agent 的内容与提示。它不用于证明某个原生 Plugin 包装或安装协议是否正确。原生 Skill / Plugin 的安装配置见 官方适配器

实验设计

每个 Arm 固定相同的模型、Sandbox、任务集、Runs 和预算,只改变注入内容。评估用例不读取“当前是哪个 Arm”,也不为某个对照配置降低验收标准。
验证优先看最终产物:项目测试、隐藏探针、源码和 Diff。只有事件稳定且完整时,才把 Skill Load 或工具调用作为 Gate。

跑起来

从这个案例复用什么

  • 用 Experiment 表达有扩展和无扩展的对照,不让评估用例知道实验条件。
  • Prompt 不泄露答案;验证阶段再检查测试、源码、Diff 和行为证据。
  • 把任务成功率作为主指标,把 Token、成本、耗时和行为作为解释指标。
  • 评分指南 负责选择 Gate、Soft 和 Judge;本页不复制评分 API。