从 n8n 到 AutoGPT:自动化工具的两次进化,和还没解决的问题

2023 年之前,自动化 = 「如果 A 就 B」的规则流;2023 年之后,自动化 = 「给个目标,自己想办法」。这两代工具在 GitHub 上同时繁荣,本文拆解它们的架构差异、演进路径,以及「自主性」这道至今没满分的题。

先讲个对比场景。需求:「每天早上把昨天的客户投诉整理成摘要发到 Slack。」

用 n8n 做:拖出定时触发器 → Gmail 节点拉邮件 → 过滤节点筛投诉 → LLM 节点生成摘要 → Slack 节点发送。每一步是什么、失败了走哪条边,画布上一目了然。

用 AutoGPT 做:告诉 Agent「每天整理客户投诉摘要发 Slack」,它自己决定怎么连 Gmail、怎么判断什么是投诉、怎么调 LLM。

两种做法都能完成任务,但信任模型完全不同——前者你信任的是自己画的流程,后者你信任的是模型的判断。这就是两代自动化工具的分水岭。

第一代:n8n——「可视化优先,代码兜底」

n8n(197K Star)从传统工作流自动化起家,现在是「AI 原生自动化平台」的标杆。它的架构是教科书级的分层:

  • 节点(Node)为基本单元的 DAG 引擎:前端可视化画布,后端 Node.js 执行引擎处理触发器、分支、工具调用;
  • AI 层集成 LangChain:Agent 编排、模型切换、工具使用都是现成节点;
  • 数据持久化:SQLite(单机起步)到 PostgreSQL(生产)。

最值得学的是它的两条设计原则:

**1. 可视化优先,代码兜底。**画布覆盖 80% 场景,剩下 20% 用 Code 节点写 JS/Python,甚至引 npm 包。这个比例拿捏是关键——纯低代码平台必然在复杂场景碰壁(「做到 90% 就上不去了」),留一个代码逃生舱,天花板就没了。

2. 1500+ 集成节点 + 9000+ 模板市场。节点有标准化开发模式,社区贡献机制成熟;模板市场让用户从「别人的成品」起步而不是从零拖起。平台类项目的增长飞轮,本质是让贡献者和使用者都占到便宜

商业模式也值得一书:fair-code(Sustainable Use License)——源码开放、可自托管、无执行次数限制,但禁止拿它做竞争性托管服务。这是开源商业化里少见走得通的路线:对比 Zapier(贵、不可自托管)和 Airflow(面向数据工程师太硬核),n8n 卡住了「业务团队也能自托管的自动化」这个空档。

第二代:AutoGPT 们的「目标驱动」

AutoGPT(185K Star)是 2023 年自主代理狂潮的起点,如今演进成「人人可用的 AI 平台」。四个界面:AutoPilot(自然语言造代理)、Agents(管理运行与成本)、Marketplace(社区代理库)、Build(可视化画布精细控制每一步)。连接 45+ 平台(Gmail、GitHub、Slack、Notion、Jira、Salesforce……)。

注意一个耐人寻味的现象:AutoGPT 转了一圈,又把可视化画布加回来了(Build 界面)。纯「给目标自由发挥」在真实业务里翻车太多——不可控、成本失控、结果不可复现——所以第二代工具开始向第一代借「确定性」。

同代的还有几个样本:

  • bytedance/deer-flow:LangGraph 打底的多智能体编排框架,子代理编排、长期记忆、沙箱代码执行(本地/Docker/K8s)、IM 通道接入。定位「编排框架」而非成品——你要自己搭。坑:2.0 与 1.x 不兼容、推荐 8C/16G、Gateway 单 Worker 扩展受限。
  • NousResearch/hermes-agent:走「随身助理」路线——Telegram/Discord/Slack 多平台一个 gateway 接入,代理自管理记忆、任务后自动创建技能、FTS5 跨会话回忆。它把「学习闭环」做成了功能:代理干完复杂任务会自己沉淀技能,下次更聪明。
  • openclaw:「个人 AI 助手操作系统」——本地 Gateway 守护进程管理会话/渠道/工具,25+ 通讯渠道统一抽象,一套 agent 逻辑触达所有平台;本地优先、模型无锁定、配对码+沙箱的安全默认值。相比 LangChain/CrewAI 这些开发库,它是完整的运行时产品。

两代工具的真正分界:确定性 vs 自主性

把它们放在一根轴上看就清楚了:

维度n8n(规则驱动)AutoGPT/deer-flow(目标驱动)
输入明确的触发条件模糊的目标描述
执行路径画布上画死的 DAG模型实时决策
可复现性同样输入同样输出每次可能不同
失败模式节点报错,定位精确跑偏、绕圈、烧钱,定位靠日志
擅长高频、重复、结构化的流程探索性、开放式、难预定义的任务
审计天然可审计需要额外追踪(LangSmith/Langfuse)

结论不是谁取代谁,而是任务按「可预定义程度」分流:能画出流程图的用 n8n,画不出来的交给 Agent——然后在 Agent 跑顺了之后,把稳定下来的路径再固化回工作流。这就是「探索用 Agent,生产用工作流」的现实循环。

还没解决的问题

研究完这批项目,我认为自主自动化还有三道坎:

**1. 成本不可预测。**工作流的成本是「执行次数 × 单价」,Agent 的成本是「模型想绕多少圈」。hermes-agent 用 serverless 后端(空闲近零成本)缓解,AutoGPT 在界面里直接展示每个代理的成本——大家都在想办法,但「Agent 账单惊吓」仍是普遍痛点。

**2. 失败的责任边界。**工作流失败是「哪一步报错」,Agent 失败是「它为什么这么干」。没有好的可观测性(deer-flow 集成 LangSmith/Langfuse 是对的方向),生产环境没人敢放权。

**3. 许可证的暗礁。**AutoGPT 核心平台是 Polyform Shield(禁止作为竞争性托管服务出售),n8n 是 Sustainable Use License——都不是 OSI 认证的开源。自托管用没问题,但想基于它们做商业服务,先读许可证再写代码

写在最后

自动化这两代演进,本质是同一个问题的两次回答:「多少控制权交给机器?」

n8n 说:机器执行,人类画图。AutoGPT 说:人类定目标,机器想办法。而现实的答案是混合的——用 Agent 探索未知,用工作流固化已知,用可观测性守住底线。

工具会越来越自主,但「在哪个环节保留人工刹车」这个决策,短期内还是人类的活儿。