痛点:看到好内容,存了等于没存?

你是不是也这样?

逛论坛刷到一篇好帖子、看到一份官方公告、读到一篇技术文档——收藏=吃灰,保存=再也没打开过

就算手动复制粘贴到笔记里,也只是一段无结构的文字堆在一起。想找的时候翻半天,想关联的时候发现是孤岛。

能不能有一个工具,把任何网页内容,一键自动抓取、自动分章节、自动按知识类型归类、自动建立关联,直接喂进自己的知识库里?

今天分享一个自己写的小脚本,做到了这件事。


效果先看:3秒,网页变知识库

以 TRAE AI 创造力大赛的官方公告为例,这篇帖子包含赛事规则、赛道、奖励、参赛流程、常见问题等丰富信息。

运行脚本后,自动创建了专题「TRAE AI 创造力大赛」,并自动生成了 8 张结构化卡片:

卡片类型 标题 说明
🟦 事实 赛事总览:一句话看懂大赛 核心规则
🟩 解释 赛程安排:从创意到作品 时间线
🟦 事实 参赛赛道:4通用+1附加 赛道说明
🟦 事实 奖励设置:113万奖池 奖金详情
🟨 风险 参赛作品通用要求 注意事项
🟩 解释 运营支持:全程陪跑 配套服务
🟦 事实 常用链接汇总 直达链接
🟥 行动 下一步:三篇置顶指南 行动建议

所有卡片自动建立了双向链接,打开知识图谱就能看到卡片之间的网状关系,而不是孤零零的散点。


技术实现:核心代码拆解

整个流程只有两步:

1. 爬取页面内容

import requests

url = "https://forum.trae.cn/t/topic/22547"
resp = requests.get(url)
# 解析内容,按章节结构化为卡片数据

2. 通过API写入知识库

API_BASE = "http://127.0.0.1:8000/api/research"

# 创建专题
project = requests.post(f"{API_BASE}/projects", json={
    "name": "TRAE AI 创造力大赛",
    "description": "113万现金奖池开赛!",
    "color": "green",
    "icon": "🏆"
}).json()

project_id = project["id"]

# 创建卡片(自动关联到专题)
cards = [
    {"card_type": "blue", "category": "事实", "title": "...", "content": "..."},
    {"card_type": "green", "category": "解释", "title": "...", "content": "..."},
]
for card in cards:
    requests.post(f"{API_BASE}/projects/{project_id}/cards", json=card)

创建卡片时,系统会自动为同专题卡片建立双向链接,在知识图谱中形成网状关联。


为什么用四色卡片分类?

这套系统基于 Antinet 知识管理法(卢曼卡片盒的改良),用四种颜色区分知识类型:

颜色 类型 适用场景
🟦 蓝 事实 客观信息、数据、规则
🟩 绿 解释 概念说明、原理分析
🟨 黄 风险 注意事项、潜在问题
🟥 红 行动 待办事项、下一步行动

这样分类的好处是:一眼就能看出知识的性质,在看知识图谱时尤其直观。


更多应用场景

不只是论坛帖子,这个脚本可以扩展到:

  • 📄 技术文档 → 拆成概念 + API + 最佳实践
  • 📰 行业资讯 → 拆成事实 + 趋势分析 + 行动建议
  • 📚 书籍章节 → 拆成知识点 + 解释 + 反思
  • 📝 会议纪要 → 拆成决策 + 待办 + 风险

总结

这个脚本虽然才几十行,但解决了知识管理中的一个核心问题:从「收藏即吃灰」到「入库即可用」

核心价值:

  1. ✅ 自动化 — 不用手工复制粘贴、逐条录入
  2. ✅ 结构化 — 自动按章节拆分为四色卡片
  3. ✅ 关联化 — 同专题卡片自动双向链接,知识不孤立
  4. ✅ 可视化 — 知识图谱一目了然

技能代码已开源并斩获1800STARS,https://github.com/anbeime/skill

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐