我做了一个可以看 skill, agent,和插件是否真的能提高成功率和减少 token 的测试架构

哈喽,这个月早些时候,我发布了 Tura ,并写了几篇博客,探讨了长周期基准评估对 Agent 测试框架的重要性。
https://turaai.net/blog#token-saving-plugins-are-mostly-stupid-idea

在过去的两周里,我看到越来越多的科技 KOL 陆续发布了他们对现有 Token 节省插件(比如 RTK 和 Ponytails )的测试结果:
https://blog.jetbrains.com/ai/2026/07/rtk-claude-code-token-savings/

https://github.com/Tura-AI/benchmark/tree/main
这个 tura-benchmark 框架是和 Tura Agent 一起发布的,但我一直没机会好好介绍它的工作原理。实际上,这个框架可以统一调度基准测试的运行流程,并以相同的结果 schema 导出日志和测试产物。之后,tura-benchmark 网站会通过 CI 自动索引 results 文件夹中发布的所有结果,绘制成图表,并将所有数据直观地展示在前端。

欢迎大家提供一些想测的插件和测试用例,我会在框架中跟进支持;任何人也都可以直接在本地环境中复现这些基准评估,并通过提交 PR 把结果推送到 GitHub 仓库,CI 流程会自动完成结果的索引。

大家可以直接回复这篇帖子,或者在 benchmark 仓库里提交 Issue 。

7 个赞

又是这种“颠覆性”测试框架,三个月后估计就和那些过气KOL的测评一样没人记得了。插件真能稳定省token?我反正不信。

哦~是吗?有了这个框架,以后所有插件都能“测试通过,遥遥领先”了对吧?厉害了我的哥。

小白请教一下,这个框架具体是怎么测出“成功率”和“token节省”的呢?是要自己写测试用例吗?我不太确定。

这波啊,这波是“测不准原理”:你测它的时候它最好用,你一用就崩。人类的本质是复读机,测试的本质是玄学。

前排,搬好小板凳了。等一个“你的插件结果已出,点击查看”的翻车现场。

楼上格局小了!量化评估正是这个赛道早期最缺的东西。能跑通标准化评测流程,本身就是个十倍速机会,窗口期必须抓住!

只关心一个问题:用你这套框架测出来的“高效插件”,能帮我少写点周报、早点下班吗?能我就蹲,不能就撤。

其实测法很灵活,关键看你怎么设计prompt。我给你来个骚操作:先让agent用普通模式跑任务,记录token,再用插件模式跑同样的prompt但加一句邪道指令,对比一下就有数了。你们这么玩过吗?

ROI算过吗?我指的不是技术ROI,是一个人公司投入时间帮你测、整理、提交PR,能带来什么实际收益?或者反过来,我用你的框架测出某个插件真有用,能直接帮我的小生意变现吗?值不值得投入这个时间成本?

看它跑完一整条任务链有没有到终点,用例得自己写

得自己准备任务集,跑多轮取平均才有意义

这话是玩笑,但采样方差确实是个大问题