<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>AI工具 on FXIO 技术博客</title><link>https://fxio.site/tags/ai%E5%B7%A5%E5%85%B7/</link><description>Recent content in AI工具 on FXIO 技术博客</description><generator>Hugo -- 0.157.0</generator><language>zh-cn</language><lastBuildDate>Tue, 04 Aug 2026 12:01:09 +0800</lastBuildDate><atom:link href="https://fxio.site/tags/ai%E5%B7%A5%E5%85%B7/index.xml" rel="self" type="application/rss+xml"/><item><title>我把信息摄入、追踪、研究拼成了一条流水线：五个 GitHub 项目的组合拳</title><link>https://fxio.site/posts/ai/2026-08-04-personal-info-pipeline/</link><pubDate>Tue, 04 Aug 2026 12:01:09 +0800</pubDate><guid>https://fxio.site/posts/ai/2026-08-04-personal-info-pipeline/</guid><description>&lt;h1 id="我把信息摄入追踪研究拼成了一条流水线五个-github-项目的组合拳"&gt;我把信息摄入、追踪、研究拼成了一条流水线：五个 GitHub 项目的组合拳&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;单个 AI 工具解决单点问题，但信息工作的真实形态是一条链：格式转换 → 聚合 → 追踪 → 研究 → 沉淀。本文拆解五个各管一段的开源项目，以及它们怎么拼成一条个人信息流水线。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;先描述一个典型的信息工作日：早上要看行业新闻，盘中要盯持仓股票的异动，临时要调研一家公司近况，周末还要整理读书笔记。如果每件事都靠「打开 N 个网站 + 手动复制粘贴」，一天下来真正思考的时间所剩无几。&lt;/p&gt;
&lt;p&gt;我在 GitHub 上找到的解法不是一个全能工具，而是五个各管一段的项目。它们串起来的逻辑是：&lt;strong&gt;数据先变成 LLM 能吃的格式，再被聚合和追踪，最后由 AI 加工成结论。&lt;/strong&gt;&lt;/p&gt;
&lt;div class="mermaid"&gt;
graph LR
A[原始文档&amp;lt;br/&amp;gt;PDF/Office/网页] --&amp;gt;|markitdown| B[Markdown]
B --&amp;gt; C[open-notebook&amp;lt;br/&amp;gt;沉淀与问答]
D[各平台热榜] --&amp;gt;|newsnow| E[聚合看板/MCP]
F[社交平台噪音] --&amp;gt;|last30days-skill| G[社交相关性简报]
E --&amp;gt; H[AI Agent 消费]
G --&amp;gt; H
C --&amp;gt; H
&lt;/div&gt;
&lt;h2 id="入口段markitdown一切格式转-markdown"&gt;入口段：markitdown——一切格式转 Markdown&lt;/h2&gt;
&lt;p&gt;微软的 MarkItDown 解决的是流水线最脏最累的第一环：&lt;strong&gt;把任意文档变成 LLM 友好的文本。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;PDF、Word、Excel、PPT、图片、音频、HTML、CSV，甚至 zip 包和网页 URL，一行命令转成结构清晰的 Markdown。它和普通文本提取工具的关键区别：&lt;strong&gt;保留标题层级、表格结构和列表语义&lt;/strong&gt;，而不是把文档拍平成一坨纯文本——下游模型能不能理解文档结构，差距就在这。&lt;/p&gt;
&lt;p&gt;架构是「转换器注册表」：核心类维护 MIME 类型到 Converter 的映射，每种格式一个转换器（pdfminer 管 PDF、python-docx/pptx/openpyxl 管 Office 三件套），可选挂 OCR、Whisper 转写、LLM 图片描述。已经有 AutoGen 和 LangChain 的官方集成。&lt;/p&gt;</description></item></channel></rss>