personal_asset

给AI装的技能包,不是越多越聪明

两组第三方评测把我这盆冷水浇醒:给AI装的技能包不是越多越聪明,版本不对时token开销还会暴涨4倍多。

给AI装的技能包,不是越多越聪明

本月照例整理一遍自己给AI配的说明文件,把目录拉出来数了一遍:大大小小快三十个,一多半点开都想不起当初为什么写。这些东西专业叫法是Skill,写的时候图省事,总觉得"多总比没有强",从没回头算过这笔账。

这次算账,是因为翻到两组第三方评测数据,越看越觉得脸有点发烫。

Skill到底是什么?我平时用Claude Code和Codex这两个AI编程助手写代码、跑脚本,它们能力很强,但完全不知道我电脑上文件放在哪个目录、我账号下有哪套固定流程、上次踩过什么坑该怎么绕开。Skill就是把这些它自己猜不出来的东西写成一份文档喂给它——本机路径、真实的接口协议、确定性的操作步骤,写清楚一次,它下次就不用重新试错。

会有这东西,是因为AI用顺手之后,重复的活越来越多:同一个目录结构要交代好几遍,同一条部署命令每次都要现教。写一份Skill,等于把这些交代一次性焊死。第一次这么干确实省了不少来回。

于是就上瘾了。碰到新场景就想着"要不要也给它写一份",写着写着,Skill目录就跟很多人手机里的APP一样,装的时候图省事,很少往外删,越攒越多。

真正让我脸发烫的是两组评测。第一组叫SkillsBench,结论是好的:精选出来的一小组Skill,能把AI任务的平均通过率从33.9%拉到50.5%,差不多提了一半,说明Skill这东西确实有用,不是玄学。

第二组叫SWE-Skills-Bench,测的是49个真实的Skill,结果没那么体面:39个压根没带来提升,剩下的平均增益只有1.2%——相当于一大半是白装的,装了跟没装区别不大。更扎心的是里面3个版本对不上号的Skill:不仅没帮上忙,反而让成绩最多倒退10%,每次调用的token开销最高涨到451%,四倍半的账单,买回来一个更笨的AI。往更大的池子看,从3.4万个真实Skill里做自动检索,收益同样是递减的,不筛不炼,装得越多噪音越大。

数字不会骗人:Skill这东西不是攒得越多越保险,装错了、装老了,是在实打实地拖累它。

看完这两组数据,我把自己那快三十个Skill又过了一遍:本机路径对得上、能稳定复现的留着;说了等于没说的、好久没跑过的,先关掉不急着删——万一哪个项目专属的还在悄悄被用着,删了没地方后悔去。这跟很多人给ChatGPT塞满插件、给Cursor挂一串MCP服务器是同一个毛病:装的时候图省事,觉得多总比少强,没人回头算过账单和成绩单。

下次做这轮整理,我要盯的是同一份清单会不会又不知不觉长回三十个。

来源