我把信息摄入、追踪、研究拼成了一条流水线:五个 GitHub 项目的组合拳

单个 AI 工具解决单点问题,但信息工作的真实形态是一条链:格式转换 → 聚合 → 追踪 → 研究 → 沉淀。本文拆解五个各管一段的开源项目,以及它们怎么拼成一条个人信息流水线。

先描述一个典型的信息工作日:早上要看行业新闻,盘中要盯持仓股票的异动,临时要调研一家公司近况,周末还要整理读书笔记。如果每件事都靠「打开 N 个网站 + 手动复制粘贴」,一天下来真正思考的时间所剩无几。

我在 GitHub 上找到的解法不是一个全能工具,而是五个各管一段的项目。它们串起来的逻辑是:数据先变成 LLM 能吃的格式,再被聚合和追踪,最后由 AI 加工成结论。

graph LR A[原始文档<br/>PDF/Office/网页] -->|markitdown| B[Markdown] B --> C[open-notebook<br/>沉淀与问答] D[各平台热榜] -->|newsnow| E[聚合看板/MCP] F[社交平台噪音] -->|last30days-skill| G[社交相关性简报] E --> H[AI Agent 消费] G --> H C --> H

入口段:markitdown——一切格式转 Markdown

微软的 MarkItDown 解决的是流水线最脏最累的第一环:把任意文档变成 LLM 友好的文本。

PDF、Word、Excel、PPT、图片、音频、HTML、CSV,甚至 zip 包和网页 URL,一行命令转成结构清晰的 Markdown。它和普通文本提取工具的关键区别:保留标题层级、表格结构和列表语义,而不是把文档拍平成一坨纯文本——下游模型能不能理解文档结构,差距就在这。

架构是「转换器注册表」:核心类维护 MIME 类型到 Converter 的映射,每种格式一个转换器(pdfminer 管 PDF、python-docx/pptx/openpyxl 管 Office 三件套),可选挂 OCR、Whisper 转写、LLM 图片描述。已经有 AutoGen 和 LangChain 的官方集成。

实战定位要说清楚:它是「够用且极简」的入口,不是解析上限——扫描件、多栏排版、数学公式堆的 PDF,质量明显依赖底层库,专业场景还得专用方案。但对 RAG 摄入、Agent 文件工具、知识库预处理这些 80% 的场景,三行代码搞定,这就是卡位价值。

聚合段:newsnow——热榜聚合 + MCP 出口

ourongxing/newsnow 是个简洁的实时热点聚合器:多平台热榜统一展示、30 分钟缓存、自适应抓取间隔防封 IP、可部署到 Cloudflare Pages(免费额度够用)。

技术上值得学的是它的扩展设计:TypeScript 全栈(Vite + React + Nitro),数据层用 db0 抽象(推荐 Cloudflare D1),来源扩展靠完善的类型定义引导——想加一个新热榜源,类型系统会告诉你该实现哪几个方法。还有两个亮点:

  • MCP Server:把热榜数据暴露给 AI 工具,Agent 可以直接问「现在什么在刷屏」。这让一个小工具从「给人看的页面」升级成「AI 的数据源」。
  • PWA 支持:装到手机桌面就是原生 App 体验。

坑:目前只支持中文,项目处于新旧版本过渡期不再接受贡献。用现成的没问题,想深度定制要看分支状态。

研究段:last30days-skill——搜人群,不搜编辑

这是我最近发现的最有意思的项目。它要解决的问题:搜索引擎被 SEO 污染了,你搜到的不是真实讨论,是营销内容。

它的解法是「搜索人群而非搜索编辑」:并行抓取十几个平台的真实用户讨论——Reddit 评论、X 热帖、YouTube 字幕、TikTok 互动、Hacker News 讨论、GitHub PR/Star、Polymarket 赔率等——然后按真实参与度(社交相关性)而非 SEO 权重交叉评分,合成一份简报。

几个设计决策值得品味:

  • BYO keys + 浏览器会话打通围墙花园:不用养爬虫集群,你自己的登录态就是通行证。
  • 输出是自包含 HTML 简报:内联 CSS、无 JS、离线可用、可打印,直接丢进 Slack/邮件/Notion。输出的形态设计也是产品力。
  • 30 秒设置向导解锁 X/YouTube/TikTok,把配置摩擦压到最低。

适用场景非常实在:会前调研某人/某公司近 30 天动态、工具选型看真实口碑、旅行前查社区实况。它本质上是一个「反 SEO 偏差」的研究工具,对需要一手社区信号的人价值极高。

追踪段:daily_stock_analysis——零服务器的定时 AI 研报

ZhuLinsen/daily_stock_analysis 展示了另一种巧思:不自己架服务器,用 GitHub Actions 当免费 cron。

它是一站式 AI 股票研究平台:AI 决策报告(结论、评分、买卖点位、风险警报)、多市场数据聚合(行情、K 线、资金流、新闻、公告)、15 种分析策略(均线、缠论、波浪、趋势、热点……)、Web/桌面工作台。

但最妙的是部署方式:Fork 仓库 → 配置 Secrets → GitHub Actions 每日定时跑 → 报告推送到企业微信/飞书/Telegram。五分钟搭好,零服务器成本。对个人投资者这种「每天只要一份报告」的场景,这比自托管优雅得多——能用别人的基础设施,就不要自己运维。

对 A 股用户特别友好:新闻源对中文内容做了优化。

沉淀段:open-notebook——私有的 NotebookLM

最后一段是沉淀。open-notebook 是 NotebookLM 的开源替代:多笔记本、全格式摄入(PDF/视频/音频/网页/Office)、18+ AI 提供商(含本地)、1-4 人播客生成、全文+向量搜索、引用溯源、REST API。

放在流水线的末端,它的角色是长期记忆:markitdown 转出来的文档、newsnow 和 last30days 产出的简报,最终都进笔记本变成可检索、可问答的私有知识库。数据主权在手里——敏感资料可以全程走本地模型。

拼起来的三条经验

把这条流水线跑起来之后,我的体会:

  1. **选「有标准接口」的组件。**markitdown 输出 Markdown、newsnow 有 MCP、open-notebook 有 REST API——接口标准化,组件才能换、才能拼。选工具时先看接口,再看功能。
  2. **让 AI Agent 当胶水。**这些项目单独用都有价值,但真正起飞是把它们挂到 Agent 上:Agent 调 newsnow 的 MCP 查热点、调 last30days 做调研、把结果喂进 open-notebook。工具是器官,Agent 是神经系统。
  3. **每个环节都留了「人工出口」。**简报是给人看的 HTML、报告推送到聊天工具、笔记本支持手动浏览——自动化流水线的终点永远是人,不是另一个系统。

信息焦虑的反面不是信息更少,是信息有管道。这五个项目加起来没一个超过 5 万 Star,但拼起来就是一条属于你自己的情报流水线。