用 Understand-Anything 理解 Transformer:论文 wiki 最佳实践
这篇不是再讲一遍 Transformer 公式,而是记录一个具体用法:把《Attention Is All You Need》整理成 Karpathy-style wiki,再用 Understand-Anything 生成可探索知识图谱。目标不是再画一张好看的 Canvas,而是让人和 AI 围绕同一份结构化图谱理解架构。
| 维度 | Obsidian Canvas | Understand-Anything | | --- | --- | --- | | 图的来源 | 人手动整理 | AI + 结构解析自动生成 | | 节点 | 卡片、文件、图片 | 文件、文章、实体、主题、论断 | | 边 | 手动连接 | wikilink、依赖、包含、语义关系 | | 主要价值 | 表达个人理解 | 可查询、可教学、可问答的图谱 | | 更适合 | 主观整理 | 复杂系统、论文结构化、onboarding |
所以它不是 Canvas 替代品。更准确的定位是:笔记库沉淀原文与个人理解,Understand-Anything 把材料转成 AI 可用的 知识图谱工件。
- 自动抽结构:wiki 抽文章、主题、wikilink、实体和 claim;代码库抽文件、函数、import、calls、架构层。
- 图不是装饰:Dashboard 支持搜索、解释、guided tour、diff impact。
- 理解可复用:
.understand-anything/knowledge-graph.json可提交、可共享,不必每次重读。 - 适合复杂系统学习:先看图,再追问节点,再沿依赖关系深入。
这比单纯的 Transformer 可视化 更偏「学习系统」:图是索引,不是终点。
1knowledge/transformer-wiki/2index.md3log.md4AGENTS.md5raw/6attention-is-all-you-need.md7Transformer Architecture.md8Self-Attention.md9Multi-Head Attention.md10Encoder.md11Decoder.md12...
规则很简单:
- 一个概念一篇 note
- 第一段写清「它解决什么问题」
- 用
[[wikilink]]明确依赖 index.md用二级标题定义知识分类- 原文摘要放
raw/ - 重要判断写成 claim 段落,方便后续抽取
index.md 示例:
1# Transformer Wiki23## Architecture45- [[Transformer Architecture]]6- [[Encoder]]7- [[Decoder]]89## Attention Mechanisms1011- [[Self-Attention]]12- [[Multi-Head Attention]]
在支持 Understand-Anything skill 的 agent 中:
1/understand-knowledge /path/to/transformer-wiki2/understand-dashboard /path/to/transformer-wiki
会生成:
1.understand-anything/knowledge-graph.json
Dashboard 里优先回答四个问题:
- 最小闭环是什么?
Token Embedding → Positional Encoding → Self-Attention → Feed Forward → Residual → Layer Norm - Encoder / Decoder 差在哪?
Encoder 只有 self-attention;Decoder 多了 Masked Self-Attention 与 Encoder-Decoder Attention - Multi-Head 为什么必要?
单头只给一个关系视角;多头把表示空间拆成多个子空间 - 为什么它取代 RNN?
任意两个 token 的路径长度变成常数,并行度更高;代价是注意力矩阵 (O(n^2))
这些读图问题,也是 model explainer 产品常见的教学路径:先闭环,再差异,再机制,再 trade-off。
不要把整篇论文只写成一个长 note。推荐拆:
1Transformer Architecture2Self-Attention3Scaled Dot-Product Attention4Multi-Head Attention5Encoder6Decoder7Masked Self-Attention8Encoder-Decoder Attention9Token Embedding10Positional Encoding11Residual Connection12Layer Normalization13Feed Forward Network14Training and Results15Limitations
每篇 note 建议结构:
1# Concept Name23一句话定义。45## Role in Transformer67它在 Transformer 中负责什么。89## Why it matters1011为什么重要。1213## Related concepts1415- [[Concept A]]16- [[Concept B]]
推荐阅读顺序:
- Transformer Architecture
- Self-Attention
- Multi-Head Attention
- Encoder / Decoder
- Training and Results / Limitations
- 文件名、H1、
index.md中的 wikilink 保持一致,否则 unresolved link 会爆 - 先分 Architecture / Attention / Representation / Evidence 四层,再补细节
- 生成图谱后对照补缺失概念,而不是一次写完美
- 把最终 learning path 写回笔记库,形成闭环
本地验证时,一份拆好的 Transformer wiki 大约可得到:十几篇 article、若干 topic、上百条 wikilink、几十个节点与边。数字会随拆分粒度变化;关键是图是否可教学。
用 Understand-Anything 学 Transformer,重点不是「自动生成一张漂亮图」,而是先把论文拆成可连接的概念节点,再让图谱成为人和 AI 共享的学习界面。图清楚了,解释才站得住;解释站得住,后续做交互式 explainer 才有证据基础。
- Attention Is All You Need
- Understand-Anything 详细使用教程
- Polo Club Transformer Explainer