用 Understand-Anything 理解 Transformer:论文 wiki 最佳实践

这篇不是再讲一遍 Transformer 公式,而是记录一个具体用法:把《Attention Is All You Need》整理成 Karpathy-style wiki,再用 Understand-Anything 生成可探索知识图谱。目标不是再画一张好看的 Canvas,而是让人和 AI 围绕同一份结构化图谱理解架构。

核心判断

| 维度 | Obsidian Canvas | Understand-Anything | | --- | --- | --- | | 图的来源 | 人手动整理 | AI + 结构解析自动生成 | | 节点 | 卡片、文件、图片 | 文件、文章、实体、主题、论断 | | 边 | 手动连接 | wikilink、依赖、包含、语义关系 | | 主要价值 | 表达个人理解 | 可查询、可教学、可问答的图谱 | | 更适合 | 主观整理 | 复杂系统、论文结构化、onboarding |

所以它不是 Canvas 替代品。更准确的定位是:笔记库沉淀原文与个人理解,Understand-Anything 把材料转成 AI 可用的 知识图谱工件

为什么值得用

  1. 自动抽结构:wiki 抽文章、主题、wikilink、实体和 claim;代码库抽文件、函数、import、calls、架构层。
  2. 图不是装饰:Dashboard 支持搜索、解释、guided tour、diff impact。
  3. 理解可复用.understand-anything/knowledge-graph.json 可提交、可共享,不必每次重读。
  4. 适合复杂系统学习:先看图,再追问节点,再沿依赖关系深入。

这比单纯的 Transformer 可视化 更偏「学习系统」:图是索引,不是终点。

推荐 wiki 结构

1
knowledge/transformer-wiki/
2
index.md
3
log.md
4
AGENTS.md
5
raw/
6
attention-is-all-you-need.md
7
Transformer Architecture.md
8
Self-Attention.md
9
Multi-Head Attention.md
10
Encoder.md
11
Decoder.md
12
...

规则很简单:

  • 一个概念一篇 note
  • 第一段写清「它解决什么问题」
  • [[wikilink]] 明确依赖
  • index.md 用二级标题定义知识分类
  • 原文摘要放 raw/
  • 重要判断写成 claim 段落,方便后续抽取

index.md 示例:

1
# Transformer Wiki
2
3
## Architecture
4
5
- [[Transformer Architecture]]
6
- [[Encoder]]
7
- [[Decoder]]
8
9
## Attention Mechanisms
10
11
- [[Self-Attention]]
12
- [[Multi-Head Attention]]

运行与读图

在支持 Understand-Anything skill 的 agent 中:

1
/understand-knowledge /path/to/transformer-wiki
2
/understand-dashboard /path/to/transformer-wiki

会生成:

1
.understand-anything/knowledge-graph.json

Dashboard 里优先回答四个问题:

  1. 最小闭环是什么?
    Token Embedding → Positional Encoding → Self-Attention → Feed Forward → Residual → Layer Norm
  2. Encoder / Decoder 差在哪?
    Encoder 只有 self-attention;Decoder 多了 Masked Self-Attention 与 Encoder-Decoder Attention
  3. Multi-Head 为什么必要?
    单头只给一个关系视角;多头把表示空间拆成多个子空间
  4. 为什么它取代 RNN?
    任意两个 token 的路径长度变成常数,并行度更高;代价是注意力矩阵 (O(n^2))

这些读图问题,也是 model explainer 产品常见的教学路径:先闭环,再差异,再机制,再 trade-off。

概念拆分清单

不要把整篇论文只写成一个长 note。推荐拆:

1
Transformer Architecture
2
Self-Attention
3
Scaled Dot-Product Attention
4
Multi-Head Attention
5
Encoder
6
Decoder
7
Masked Self-Attention
8
Encoder-Decoder Attention
9
Token Embedding
10
Positional Encoding
11
Residual Connection
12
Layer Normalization
13
Feed Forward Network
14
Training and Results
15
Limitations

每篇 note 建议结构:

1
# Concept Name
2
3
一句话定义。
4
5
## Role in Transformer
6
7
它在 Transformer 中负责什么。
8
9
## Why it matters
10
11
为什么重要。
12
13
## Related concepts
14
15
- [[Concept A]]
16
- [[Concept B]]

推荐阅读顺序:

  1. Transformer Architecture
  2. Self-Attention
  3. Multi-Head Attention
  4. Encoder / Decoder
  5. Training and Results / Limitations

最佳实践与坑

  • 文件名、H1、index.md 中的 wikilink 保持一致,否则 unresolved link 会爆
  • 先分 Architecture / Attention / Representation / Evidence 四层,再补细节
  • 生成图谱后对照补缺失概念,而不是一次写完美
  • 把最终 learning path 写回笔记库,形成闭环

本地验证时,一份拆好的 Transformer wiki 大约可得到:十几篇 article、若干 topic、上百条 wikilink、几十个节点与边。数字会随拆分粒度变化;关键是图是否可教学

一句话结论

用 Understand-Anything 学 Transformer,重点不是「自动生成一张漂亮图」,而是先把论文拆成可连接的概念节点,再让图谱成为人和 AI 共享的学习界面。图清楚了,解释才站得住;解释站得住,后续做交互式 explainer 才有证据基础。

延伸阅读

  • Attention Is All You Need
  • Understand-Anything 详细使用教程
  • Polo Club Transformer Explainer

Liked this note? Share it on Twitter / X, or browse more writing from the home page. Feedback and pointers welcome via @qianyuhe.

Thanks for reading.

– 千羽鹤