AI 编程的下一个战场不是模型,是「技能层」
Agent 时代的真实痛点:模型能力够了,但它「不懂你团队的规矩」。本文梳理 GitHub 上正在成型的 Agent Skills 生态——从标准到方法论再到宿主,一层一层看这套新基础设施是怎么长出来的。
用 AI 写代码半年以上的人,大概都有过这种体验:模型的智商不是瓶颈,对齐才是。你说「重构这个模块」,它哗啦一下把接口签名、调用方、测试全改了;你说「先别动」,它说好的,然后顺手格式化了半个仓库。
2026 年的 GitHub 上,一批高星项目正在集体回答同一个问题:**怎么让 AI 编码代理像一个守规矩的工程师,而不是一个热心但莽撞的实习生?**答案收敛到了一个词:Skills(技能)。
一个标准的诞生:SKILL.md
故事的起点是 Anthropic 的 Agent Skills 规范(anthropics/skills,163K Star)。它的设计简单到惊人:
- 每个技能就是一个文件夹;
- 里面一个
SKILL.md,带 YAML frontmatter,必填字段只有两个:name和description; - 代理启动时扫描技能目录,根据 description 判断当前任务该激活哪个技能。
就这么点东西,但它解决了一个关键问题:**方法论从此可以像代码一样分发。**以前「怎么做代码审查」「怎么写好需求」这些经验锁在人脑里,现在它变成了可版本化、可安装、可共享的文件。仓库里 docx/pdf/pptx/xlsx 四个文档技能是官方示范——注意它们是「源码可见」而非完全开源,且明确声明仅供演示、生产需自测,这个边界划得很诚实。
标准立住之后,生态开始分层。我把它分成三层来看:
方法论层:三种「驯服 Agent」的思路
这一层是生态里最有意思的部分。三个头部项目,代表三种完全不同的思路。
思路一:流程化——obra/superpowers(260K Star)
它的哲学是「流程化而非随意发挥」,把软件开发拆成一套自动触发的工作流技能:brainstorming(苏格拉底式追问需求)、writing-plans(拆成 2-5 分钟的小任务)、subagent-driven-development(派子代理干活 + 两阶段评审)、test-driven-development(强制红绿重构)、requesting-code-review……
注意「自动触发」这个设计:技能在会话启动时注入,干到对应环节自动生效,不用你手动喊「现在请用 TDD 技能」。跨宿主适配也是亮点——Claude Code、Codex、Cursor、Gemini CLI、OpenCode 等十几个宿主都能装。背后的方法论全是老东西:TDD、YAGNI、DRY、证据优先。它没有发明新工程方法,只是把老规矩做成了代理能执行的格式。
思路二:阶段化——addyosmani/agent-skills
Chrome 团队那位 Addy Osmani 的版本,24 个技能模块,核心是把开发流程切成六段:DEFINE→PLAN→BUILD→VERIFY→REVIEW→SHIP,每段对应斜杠命令(/spec、/plan、/build、/test、/review、/ship)。技能按当前操作自动激活——你在设计 API,api-and-interface-design 技能就亮了。
最激进的是 /build auto:一次批准后自主执行所有任务,每个任务测试驱动、单独提交,失败或高风险步骤自动暂停。这是「自主性」和「可控性」之间找的一个实用平衡点——放权,但保留刹车。
思路三:对齐优先——mattpocock/skills(184K Star)
Matt Pocock(TypeScript 教育圈名人)的切入点最犀利。他把 AI 编码的失败归纳为三种模式,各给一个解法:
| 失败模式 | 症状 | 解法 |
|---|---|---|
| 对齐问题 | 代理没做你想要的 | /grill-me「盘问会话」:动手前先被代理审需求 |
| 语言问题 | 代理太啰嗦、解释费劲 | CONTEXT.md 共享语言 + ADR 记录决策 |
| 质量问题 | 代码跑不通 | 配套工程技能(TDD 等) |
我特别想展开「共享语言」这个点,因为它被严重低估了。当代理和你共用一套领域术语(写进 CONTEXT.md),三个好处同时发生:代理表达变简洁(省 token)、代码命名变一致(变量/函数/文件名全对齐领域词汇,代码库可导航性暴涨)、难解释的决策沉淀成 ADR。这其实就是《领域驱动设计》里的统一语言(Ubiquitous Language)——几十年前给人类团队开的药方,原样治好了 AI 团队的病。
三种思路不冲突:superpowers 管「怎么干」,agent-skills 管「按什么节奏干」,mattpocock 管「先想清楚干什么」。成熟的团队配置很可能是三者叠着用。
宿主层与配置层:生态的另一半
方法论要有地方跑。宿主层同样热闹:
- anomalyco/opencode(189K Star):开源自托管编码代理,亮点是权限分级——build 代理全权限干活,plan 代理只读(探索陌生代码库、做变更规划时用,默认拒绝编辑、跑 bash 前先问你)。把「探索」和「执行」分成两个权限模型,这个设计非常工程化。
- NousResearch/hermes-agent(219K Star):走「个人助理」路线——多平台接入(Telegram/Discord/Slack 等)、代理自管理记忆、任务后自动创建新技能、FTS5 全文检索做跨会话回忆。注意「自动创建技能」这一环:代理自己给自己写技能,学习闭环成了产品功能。缺点是功能庞杂、上手成本高。
- bytedance/deer-flow:多智能体编排框架,LangGraph 打底,沙箱执行、MCP 集成、IM 通道接入。坑要记住:2.0 与 1.x 不兼容,部署建议 8C/16G 起步,Gateway 单 Worker 扩展受限。
还有个容易被忽视但极实用的层——farion1231/cc-switch:Claude Code/Codex/Gemini CLI 等 8 款工具的统一配置管理器,50+ 提供商预设一键切换、MCP/Skills 跨工具双向同步。工具一多,「配置」本身就成了问题,于是长出了专门解决配置的工具——生态自我繁殖的典型信号。
这对我们意味着什么
站在工程师视角,我从这波生态里读出三件事:
**1. 提示词的時代正在让位给技能文件。**临时 prompt 是一次性的、不可审计的;SKILL.md 是可版本化、可评审、可回滚的。当团队开始给技能文件提 PR、做 code review,AI 工程才算真正进入了工程化管理。
**2. 老工程方法论正在「复活」。**TDD、ADR、统一语言、任务拆解、两阶段评审——这些人类工程实践没有被 AI 淘汰,反而成了驯服 AI 的最有效工具。原因也不难想:AI 缺的不是智力,是纪律,而纪律恰恰是方法论提供的内容。
**3. 标准决定生态形状。**SKILL.md 只有两个必填字段,这种克制是它能跨宿主流行的根本原因。对比 MCP(工具接入标准)和 Agent Skills(方法论标准),AI 基础设施正在按「接入」和「方法」两条线同时标准化。
上手建议
如果你还没让自己的编码代理「守规矩」,我的建议路径:
- 先装一个方法论技能包试水:superpowers 或 agent-skills 选一个,跑一周,观察代理行为变化;
- 给项目写 CONTEXT.md:把领域术语、命名约定、架构红线写进去,这一步投入产出比最高;
- 重要决策开始写 ADR:让代理参与记录,半年后你会感谢这个习惯;
- 权限分级:探索代码库用只读模式,执行变更用受限模式,别让一个全权限代理裸奔。
模型的能力是租来的,**技能的沉淀才是自己的资产。**这大概是我研究这批项目后最想说的一句话。