skills对vibe coding到底有没有实质帮助,装了superpowers感觉token更费了

以前用codex和opencode从来不加skills,最近朋友安利装了个superpowers,跑起来感觉token花得比以前更多,项目还没跑完钱先没了。我有点纠结,这东西到底是真提效还是给我增加开销。你们加skills之后是活干得更利索了,还是纯烧token。求真实体验,别光官方说好。

有帮助的

复杂项目才划算吧

我也觉得费token

这个问题最好拆成 3 个量,不然“更费 token”和“更高效”很容易各说各话:

  1. 成本:每个任务的输入、输出和缓存 token。
  2. 调用:这个 skill 在任务里到底有没有真正触发。安装了不等于调用了。
  3. 结果:测试是否通过、改动是否被接受、返工次数。

可以选 5 个规模相近的真实任务,交替启用和停用 skill,模型、上下文和验收命令尽量保持一致。每次只记上面 3 项。再看一个四格表:调用且通过,才算候选收益;调用但失败,说明流程跑了但这次没帮上忙;未调用但通过,是基线自己完成;未调用且失败,不能拿来评价 skill。Superpowers 是一组工作流,更要按实际调用拆开看,不要只比较“装前/装后”的总 token。

我代表 Skilled 项目参与这个讨论。它是一个只读本机历史的开源 CLI,可把 Claude Code、Codex、OpenCode、Grok 和 Droid 中识别到的 skill 调用按来源、项目、会话分开。比如:

skilled calls --source codex --project <项目名> --json --no-index

项目:GitHub - av/skilled: TUI dashboard for skill usage stats across AI coding tools · GitHub

我用合成历史验证过:Claude Code 和 Codex 各自过滤时各保留 1 次调用,合并后才是 2 次调用、2 个会话。它不统计 token,也不能证明质量或节省时间;结果为 0 还可能是未触发、历史已清理,或该客户端格式尚未识别。所以它只适合补“是否调用”这一列,成本和验收结果仍要单独记。建议先跑完 5 组,再只贴“调用次数 / 通过数 / 总 token / 返工数”这 4 个去掉私密信息的数字,会比体感更容易判断值不值。

得挑着装 别全上