
字节笔记本
2026年10月10日 · 约 5 分钟读完
技能包被整包拷走,源头修了副本不跟
技能包被整包拷走,源头修了副本不跟
把一份 SKILL.md 丢进编码智能体,看起来像装了一个可复用的工序。公开图把这件事拆开以后,更常见的路径是:某个仓先攒出一批技能,后面的仓按整包拷走,副本几乎不再跟着源头改。

复制链比星数更会说话
Skill Constellations 建立在 GitSkills 快照上,只收默认分支、非 fork、带合法 front matter、且不早于 2025 年 10 月 1 日首次提交的 SKILL.md。同一段内容算一种技能;某个仓第一次拿到一种谱系,记一次采纳。论文摘要按这份图统计到 2193119 次采纳;配套表按 2026 年 7 月 20 日快照给出 2139851 条采纳、1434748 条谱系、18282 次复制事件、644626 条传播边,历史改动表有 16222844 行。
GitSkills 本身还给出另一组规模:大约十个月内,这种格式出现在 259596 个仓,独立技能 1612846 种,并且一半 SKILL.md 是逐字拷贝。新图要回答的不是“有多少文件”,而是“一次拷贝从哪个已经拿过该谱系的仓传出去”。

判定复制事件的门槛很硬:一次提交至少新加 10 个 SKILL.md,并且当时已有某个更早的采纳者持有这批谱系的一半以上,那个仓才被记成来源。不到 100 个文件叫捆,超过 100 个叫批量。作者把源指标写成“分发位置”,不写成“谁原创”,因为安装器记录对得上日期,却常常对不上被算法点名的那个来源仓。
对 1534 个安装目录回放后,重构日期落在 7 天内的占 94.6%,记录来源此前已经持有该技能的占 99.1%,但算法点名那个记录来源的只有 26.7%。它更常把功劳记到当时持有更多谱系的目录仓上。
源头改了,副本多半还停着
64.2% 的仓不和其他仓共享任何技能,其余仓聚成至少 100 个仓规模的 50 个主题社区。传播是过散的:负二项离散度 k 等于 0.086,多数采纳者不会再传下去。静态出度最高的 20 个仓里,只有 7 个在“只给自己先拿到的技能记功”之后还留在前 20。按 2026 年 4 月 1 日之前的数据排序,当前复制出度找到的后续传播是按星数排序的 4.0 倍。
风险标记看的是能力,不是恶意:捆绑可执行文件、预批准工具,或教智能体做高风险动作。在 200 条分层标注上,严口径精确率 98.3%,召回 80.9%。被标记的技能出现在 28.6% 的仓里,低于均匀重排的 41.1%。更刺眼的是更新:每周克隆组里,全体持有者一起改到下一版的只占 11.1%;全谱系曾锁步变更的只有 4.0%。同一所有者会把锁步变更的几率乘上 3.32。技能拷贝里,只有 20.9% 会跟着源头的后续编辑走,低于代码文件复用文献里常见的 47% 到 84%;如果只看一张快照,跟随率还会被低估 3.3 倍。
抽查的 56 个跨平台拷贝,仍然点名只属于 Claude Code 的工具。大约三分之一的跨目录拷贝会跳到另一种智能体平台。新技能要几周,而不是几小时,才到达后来的大多数采纳者。web-design-guidelines 这一条在 12 代复制里传到了 972 个采纳者。

审仓别先看星数
用 2026 年 4 月 1 日切一刀:只根据切分前的信息排序,再看后面拦住了多少高风险采纳。源选择模型排出的前 100 个仓能拦住 14.9%,星数最高的 100 个仓只拦住 0.5%。大约四分之一被拦住的案例来自间接复制。事后最优名单也只能拦住大约四分之一,因为后面大约一半高风险摄入是新技能。3 月 1 日和 5 月 1 日的切分,以及宽松标记,排序结论不变。
论文给平台的建议很具体:发版本化引用,不要发文件拷贝;评审按当前复制出度排队,不要按星数;干预窗口在头几周。用户得自己刷新副本。公开仓 Skill-Constellations 代码是 MIT,交互图和数据表是 CC BY 4.0,恶意谱系已剔除,表里不存作者名、邮箱和提交说明。仓库星数现在是 0,热度在数据和论文,不在星标本身。
参考:论文 2610.11169、项目页、数据卡。



