Anthropic 官方对于 Claude Code Skills 的测试定义了金字塔架构:触发、功能、性能比较

一、触发测试(Trigger Tests):把控 Skill 的“入口”,该响的时候响,不该响的时候闭嘴

写完 Skill 最怕两件事:该用的时候没触发,不该用的时候瞎凑热闹。

准备 10-20 个测试问题跑一遍,看自动加载的成功率。目标是:相关任务命中率 > 90%,无关任务误触率 < 5%

几个实操要点:

  • 测试用例要说人话。 别用“格式化数据”这种干巴巴的词,用“老板发了张 xlsx 过来,让我加一列利润率”——带上下文,才接近真实使用场景。
  • 故意挖坑。 准备一批“看起来像但其实不是”的问题,关键词撞了但意图不同,专门检验模型会不会被表面词汇带跑。
  • 调优方向很直接。 漏触发了?在 description 里补关键词。老误触发?收窄适用范围,或者加负向描述把边界划清楚。

二、功能测试(Functional Tests):验证“执行质量”, 加载进来了,活儿干得怎么样

Skill 被触发了只是第一步,关键看执行质量。检查几个方面:

  • 输出对不对。 格式符不符合预期,该覆盖的检查项有没有漏,边界情况处理得怎么样。
  • 提前定好“什么算好”。 能客观验证的任务(比如代码生成、数据提取),在跑之前就写好验收标准——比如“不能编造用户没说过的经历”、“必须保留原始观点”。
  • 工具调用别出岔子。 文件路径对不对、权限够不够、有没有 API 报错——理想状态是零失败调用。
  • 跑 3-5 次看一致性。 同一个请求多跑几遍,比较输出结构和质量,确认每次都能一次走完流程、不用用户中途纠偏。

三、性能对比(Performance Comparison):量化“Skill 的价值”, 加了 Skill 到底值不值

同一个任务,分别在“有 Skill”和“没 Skill”两种状态下各跑 5 次,拿数据说话。

重点看几个指标:

  • Token 消耗。 有 Skill 之后是更省了还是更费了?来回消息和重试次数有没有明显减少?
  • 用户操不操心。 好的 Skill 应该让你不用中途指挥“下一步该干嘛”,新手第一次用也能顺顺当当走完。
  • 手感也很重要。 Anthropic 自己也承认,不是所有东西都能量化。如果加了 Skill 之后整体感觉顺手多了、错误少了,这本身就是有效的信号——别因为说不清数字就忽略它。

一句话总结: 触发准、活儿干好、比没加的时候确实更省事——三条都站得住,这个 Skill 才算写到位了。