前天看 Kimi K3 官博的时候发现,我的 AI Pulse 项目没有收录它的内容。再仔细看,Kimi 官博有自己的格式,需要单独写网页解析器才能正确抓取内容。

这些 AI 厂的博客大多如此。OpenAI,Anthropic 的技术博客不仅不提供官方的 rss 订阅链接,而且有时会改版。想要定期关注官博更新很麻烦。说来也可笑,都是做 AI 的公司,自己的网页内容对 AI 反而不友好。

之前我追踪这些官方博客的方法是通过 rsshub 自定义的 rss 链接,有人维护就不用自己动手。但这次我想完善一下,不能把希望都寄托在他人维护的开源项目上。

有 AI 在手,写个解析器并不复杂。这是网页爬虫的基本逻辑。爬虫人人都需要,人人都讨厌,最重要的原因是爬虫需要不定期维护。一旦目标网站改版,爬虫就要重写。

对于每天需要追踪大量网站内容的需求来说,单个来源坏掉可能完全无感知。等你发现错过重要消息,再修理就晚了。

网上有很多针对 AI Agent 的爬虫项目,面向任意网站,比如 FireCrawl,Crawl4AI。这些项目对我来说都太大了,抓完之后还要再做数据清洗,接入工作量并不小。

我关注的技术类博客,更新频率低,内容格式相对可控,只需针对性写个解析器即可将各 AI 厂的技术博客纳入囊中。

所以我的目标很简单,针对此类有日期的内容站做个小工具,只为垂直需求服务。从 Kimi 开始。

接着,在给 Kimi 官博写爬虫的时候我又想,既然用 AI 写爬虫,为什么不能让 AI 自动修复坏掉的爬虫?

和 Claude 讨论后,形成三层产品思路: L0 确定性解析——CSS 选择器 + jsdom,零成本、毫秒级,不依赖 LLM; L1 限时 LLM 兜底——L0 解析失败时,当轮内容不断供,绝对 deadline 内直接从 HTML 抽; L2 异步自愈——L0 规则失效后,离线跑一次「LLM 提议规则 → 验证闸全过才发布」,修复 L0,下一轮恢复免费路径。

这个小工具不做全,不做广,点到即止。想要抓取任意网站,可以移步上面的全能爬虫,想要直接获取 rss 链接,可以用这个工具做二次开发或者干脆用现成的 rsshub。

确定好定位之后,用 Claude Fable 5 做开发,花了几个小时排错,测试,完善文档,上传到 github。 

项目地址:https://github.com/naplesblue/autoheal-parser

我给它起名做 autoheal-parser,能自愈的解析器。

工具本身不复杂,内置了几个大厂的博客支持,短期内开箱可用。后端调试 llm 缺省使用 deepseek v4,填入 api key 即可。我自己在工作流里用的是 doubao-seed-2.0-lite,9.9 元一个月,很值。

目前支持的博客:

• anthropic-news
• anthropic-engineering
• huggingface-blog
• manus-blog
• groq-news

后期我应该不会再投入精力去优化这个独立工具。嵌入 AI Pulse 工作流的功能模块会继续迭代。

这件事给我的启发是,以前很多做不到的事,需要人工介入的任务,现在完全可以交给 AI。AI 赋能一切。

AI 负责写代码,AI 运行代码,AI 监测代码健康度,AI 擦屁股。自动化任务的最后一环终于闭合了。人,可以不在场。

那么人的角色放哪里?

我在 autoheal-parser 中定义了消息通知机制。我的工作流里如果出现问题,不管是解析失败还是自愈,工具都会给我发消息。我的角色从放羊娃升级到牧场主。

这就是最近火爆的 loop 概念的意义,让 AI 自主完成任务,形成闭环。

AI 趋势的核心是人的注意力正在成为稀缺资源。现代人需要处理的信息太多了,生活中充满无效噪声。我们不仅需要处理噪声,还要留出休息,享受的空间。

对用户来说,AI 不应成为新的注意力黑洞,而应该成为承担信息过滤,缓解焦虑和压力的工具。