我把信息摄入、追踪、研究拼成了一条流水线:五个 GitHub 项目的组合拳
我把信息摄入、追踪、研究拼成了一条流水线:五个 GitHub 项目的组合拳 单个 AI 工具解决单点问题,但信息工作的真实形态是一条链:格式转换 → 聚合 → 追踪 → 研究 → 沉淀。本文拆解五个各管一段的开源项目,以及它们怎么拼成一条个人信息流水线。 先描述一个典型的信息工作日:早上要看行业新闻,盘中要盯持仓股票的异动,临时要调研一家公司近况,周末还要整理读书笔记。如果每件事都靠「打开 N 个网站 + 手动复制粘贴」,一天下来真正思考的时间所剩无几。 我在 GitHub 上找到的解法不是一个全能工具,而是五个各管一段的项目。它们串起来的逻辑是:数据先变成 LLM 能吃的格式,再被聚合和追踪,最后由 AI 加工成结论。 graph LR A[原始文档<br/>PDF/Office/网页] -->|markitdown| B[Markdown] B --> C[open-notebook<br/>沉淀与问答] D[各平台热榜] -->|newsnow| E[聚合看板/MCP] F[社交平台噪音] -->|last30days-skill| G[社交相关性简报] E --> H[AI Agent 消费] G --> H C --> H 入口段:markitdown——一切格式转 Markdown 微软的 MarkItDown 解决的是流水线最脏最累的第一环:把任意文档变成 LLM 友好的文本。 PDF、Word、Excel、PPT、图片、音频、HTML、CSV,甚至 zip 包和网页 URL,一行命令转成结构清晰的 Markdown。它和普通文本提取工具的关键区别:保留标题层级、表格结构和列表语义,而不是把文档拍平成一坨纯文本——下游模型能不能理解文档结构,差距就在这。 架构是「转换器注册表」:核心类维护 MIME 类型到 Converter 的映射,每种格式一个转换器(pdfminer 管 PDF、python-docx/pptx/openpyxl 管 Office 三件套),可选挂 OCR、Whisper 转写、LLM 图片描述。已经有 AutoGen 和 LangChain 的官方集成。 ...