AI 编程的下一个战场不是模型,是「技能层」

Agent 时代的真实痛点:模型能力够了,但它「不懂你团队的规矩」。本文梳理 GitHub 上正在成型的 Agent Skills 生态——从标准到方法论再到宿主,一层一层看这套新基础设施是怎么长出来的。

用 AI 写代码半年以上的人,大概都有过这种体验:模型的智商不是瓶颈,对齐才是。你说「重构这个模块」,它哗啦一下把接口签名、调用方、测试全改了;你说「先别动」,它说好的,然后顺手格式化了半个仓库。

2026 年的 GitHub 上,一批高星项目正在集体回答同一个问题:**怎么让 AI 编码代理像一个守规矩的工程师,而不是一个热心但莽撞的实习生?**答案收敛到了一个词:Skills(技能)。

一个标准的诞生:SKILL.md

故事的起点是 Anthropic 的 Agent Skills 规范(anthropics/skills,163K Star)。它的设计简单到惊人:

  • 每个技能就是一个文件夹;
  • 里面一个 SKILL.md,带 YAML frontmatter,必填字段只有两个:namedescription
  • 代理启动时扫描技能目录,根据 description 判断当前任务该激活哪个技能

就这么点东西,但它解决了一个关键问题:**方法论从此可以像代码一样分发。**以前「怎么做代码审查」「怎么写好需求」这些经验锁在人脑里,现在它变成了可版本化、可安装、可共享的文件。仓库里 docx/pdf/pptx/xlsx 四个文档技能是官方示范——注意它们是「源码可见」而非完全开源,且明确声明仅供演示、生产需自测,这个边界划得很诚实。

标准立住之后,生态开始分层。我把它分成三层来看:

graph TD A[标准层<br/>SKILL.md 规范] --> B[方法论层<br/>superpowers / agent-skills / mattpocock] B --> C[宿主层<br/>Claude Code / opencode / deer-flow / hermes] D[配置层 cc-switch] --> C

方法论层:三种「驯服 Agent」的思路

这一层是生态里最有意思的部分。三个头部项目,代表三种完全不同的思路。

思路一:流程化——obra/superpowers(260K Star)

它的哲学是「流程化而非随意发挥」,把软件开发拆成一套自动触发的工作流技能:brainstorming(苏格拉底式追问需求)、writing-plans(拆成 2-5 分钟的小任务)、subagent-driven-development(派子代理干活 + 两阶段评审)、test-driven-development(强制红绿重构)、requesting-code-review……

注意「自动触发」这个设计:技能在会话启动时注入,干到对应环节自动生效,不用你手动喊「现在请用 TDD 技能」。跨宿主适配也是亮点——Claude Code、Codex、Cursor、Gemini CLI、OpenCode 等十几个宿主都能装。背后的方法论全是老东西:TDD、YAGNI、DRY、证据优先。它没有发明新工程方法,只是把老规矩做成了代理能执行的格式。

思路二:阶段化——addyosmani/agent-skills

Chrome 团队那位 Addy Osmani 的版本,24 个技能模块,核心是把开发流程切成六段:DEFINE→PLAN→BUILD→VERIFY→REVIEW→SHIP,每段对应斜杠命令(/spec、/plan、/build、/test、/review、/ship)。技能按当前操作自动激活——你在设计 API,api-and-interface-design 技能就亮了。

最激进的是 /build auto:一次批准后自主执行所有任务,每个任务测试驱动、单独提交,失败或高风险步骤自动暂停。这是「自主性」和「可控性」之间找的一个实用平衡点——放权,但保留刹车。

思路三:对齐优先——mattpocock/skills(184K Star)

Matt Pocock(TypeScript 教育圈名人)的切入点最犀利。他把 AI 编码的失败归纳为三种模式,各给一个解法:

失败模式症状解法
对齐问题代理没做你想要的/grill-me「盘问会话」:动手前先被代理审需求
语言问题代理太啰嗦、解释费劲CONTEXT.md 共享语言 + ADR 记录决策
质量问题代码跑不通配套工程技能(TDD 等)

我特别想展开「共享语言」这个点,因为它被严重低估了。当代理和你共用一套领域术语(写进 CONTEXT.md),三个好处同时发生:代理表达变简洁(省 token)、代码命名变一致(变量/函数/文件名全对齐领域词汇,代码库可导航性暴涨)、难解释的决策沉淀成 ADR。这其实就是《领域驱动设计》里的统一语言(Ubiquitous Language)——几十年前给人类团队开的药方,原样治好了 AI 团队的病。

三种思路不冲突:superpowers 管「怎么干」,agent-skills 管「按什么节奏干」,mattpocock 管「先想清楚干什么」。成熟的团队配置很可能是三者叠着用。

宿主层与配置层:生态的另一半

方法论要有地方跑。宿主层同样热闹:

  • anomalyco/opencode(189K Star):开源自托管编码代理,亮点是权限分级——build 代理全权限干活,plan 代理只读(探索陌生代码库、做变更规划时用,默认拒绝编辑、跑 bash 前先问你)。把「探索」和「执行」分成两个权限模型,这个设计非常工程化。
  • NousResearch/hermes-agent(219K Star):走「个人助理」路线——多平台接入(Telegram/Discord/Slack 等)、代理自管理记忆、任务后自动创建新技能、FTS5 全文检索做跨会话回忆。注意「自动创建技能」这一环:代理自己给自己写技能,学习闭环成了产品功能。缺点是功能庞杂、上手成本高。
  • bytedance/deer-flow:多智能体编排框架,LangGraph 打底,沙箱执行、MCP 集成、IM 通道接入。坑要记住:2.0 与 1.x 不兼容,部署建议 8C/16G 起步,Gateway 单 Worker 扩展受限。

还有个容易被忽视但极实用的层——farion1231/cc-switch:Claude Code/Codex/Gemini CLI 等 8 款工具的统一配置管理器,50+ 提供商预设一键切换、MCP/Skills 跨工具双向同步。工具一多,「配置」本身就成了问题,于是长出了专门解决配置的工具——生态自我繁殖的典型信号。

这对我们意味着什么

站在工程师视角,我从这波生态里读出三件事:

**1. 提示词的時代正在让位给技能文件。**临时 prompt 是一次性的、不可审计的;SKILL.md 是可版本化、可评审、可回滚的。当团队开始给技能文件提 PR、做 code review,AI 工程才算真正进入了工程化管理。

**2. 老工程方法论正在「复活」。**TDD、ADR、统一语言、任务拆解、两阶段评审——这些人类工程实践没有被 AI 淘汰,反而成了驯服 AI 的最有效工具。原因也不难想:AI 缺的不是智力,是纪律,而纪律恰恰是方法论提供的内容。

**3. 标准决定生态形状。**SKILL.md 只有两个必填字段,这种克制是它能跨宿主流行的根本原因。对比 MCP(工具接入标准)和 Agent Skills(方法论标准),AI 基础设施正在按「接入」和「方法」两条线同时标准化。

上手建议

如果你还没让自己的编码代理「守规矩」,我的建议路径:

  1. 先装一个方法论技能包试水:superpowers 或 agent-skills 选一个,跑一周,观察代理行为变化;
  2. 给项目写 CONTEXT.md:把领域术语、命名约定、架构红线写进去,这一步投入产出比最高;
  3. 重要决策开始写 ADR:让代理参与记录,半年后你会感谢这个习惯;
  4. 权限分级:探索代码库用只读模式,执行变更用受限模式,别让一个全权限代理裸奔。

模型的能力是租来的,**技能的沉淀才是自己的资产。**这大概是我研究这批项目后最想说的一句话。