Polo Club 风格模型解释器选题清单

最值得优先做的不是「万能模型解释器」,而是沿着 Polo Club of Data Science 的方式,做一组模型家族解释器:每个家族有固定证据、固定视图、固定交互语法;自然语言只负责选择任务、组织解释和引导用户,不负责自由生成 UI。

总判断

推荐路线:

  1. decoder-only Transformer 解释器:直接继承 transformer-explainer,最适合先做
  2. BERT / encoder-only 分类解释器:结构清楚,适合第二家族
  3. RAG / 检索增强解释器:应用价值高
  4. Diffusion / LoRA / Prompt Editing:展示型强,后续做
  5. Embedding / 向量检索解释器:承接 WizMap 空间探索范式

核心原则:

  • 不让 LLM 自由编 UI
  • 不让 LLM 自由解释内部机制
  • 先定义 schema / intent / view family
  • 所有解释绑定真实模型证据
  • 复杂模型通过 adapter 接入,不破坏前端视图契约

这正是可落地的 model explainer 产品方法:约束优先于聪明。

总表

| 优先级 | 方向 | 解释目标 | 浏览器端可行性 | 推荐判断 | | --- | --- | --- | --- | --- | | P0 | Decoder-only Transformer | next-token、attention、MLP、logit lens | 高(小模型 / ONNX) | 最先做 | | P0 | BERT / Encoder-only | 分类贡献、token attribution | 高 | 第二家族 | | P0 | RAG | 检索链路、citation trace | 中高 | 应用价值最高 | | P1 | Diffusion / LoRA | prompt 如何影响生成 | 中 | 展示强 | | P1 | Embedding / Vector Search | 相似性、聚类、语义空间 | 高 | 可继承 WizMap | | P1 | ViT | patch / class token | 中高 | 接上 Transformer 叙事 | | P2 | CNN | feature map / CAM | 高 | 已有 CNN Explainer | | P2 | Tabular / Tree | SHAP / decision path | 高 | 实用但视觉新意弱 | | P2 | Multimodal / CLIP / VLM | 图文对齐 | 中 | 后期 | | P3 | GNN | 子图归因 | 中 | 门槛高 |

P0:最值得优先做

1. Decoder-only Transformer

代表:GPT-2 / DistilGPT2、小尺寸 Qwen / Phi / Gemma。

解释目标:

  • token 如何影响 next-token
  • attention head 在看什么
  • residual / MLP 如何改表示
  • logit lens 的中间层预测变化
  • KV cache 与 sampling 如何改输出

可视化信号:token 序列、attention matrix、residual stream、layer-wise logits、top-k、sampling path。

MVP:

  1. 固化 GPT-2 explanation schema
  2. custom GPT-2-like model 接入文档
  3. DistilGPT2 / tiny GPT-2 adapter
  4. 自然语言 planner:把「解释第 3 层 attention」映射到固定 view

风险:hidden size / layer / tokenizer / ONNX 输出命名不一致。没有 adapter,前端会被模型细节污染。

2. BERT / Encoder-only 分类解释器

代表:DistilBERT、RoBERTa、MiniLM。

解释目标:

  • 为什么输出某个类别
  • 哪些 token 推高 / 压低分数
  • [CLS] 如何聚合信息
  • attention 与 attribution 是否一致
  • token 删除后预测如何变化

MVP:

  1. DistilBERT sentiment classifier
  2. 输出类别概率
  3. mask / delete perturbation 算贡献
  4. heatmap + bar chart
  5. 自然语言只基于贡献排序生成

注意:attention ≠ 解释。文档必须写清边界。初版可用 occlusion,不必先上完整梯度。

3. RAG / 检索增强解释器

解释目标:

  • 答案来自哪些文档
  • 检索为何选中这些 chunk
  • rerank 如何重排
  • 句子与 source span 对齐
  • 哪些内容是推断、哪些有证据

MVP:

  1. 固定小文档集
  2. 展示 top-k、相似度、rerank 前后变化
  3. 回答每句绑定 source span
  4. 高亮 unsupported / weakly supported claims

这是最贴近 证据优先可视分析 的方向:解释的是链路,不是玄学。

P1:第二阶段

Diffusion / LoRA / Prompt Editing

解释 prompt token 如何影响图像区域、denoising 逐步形成图像、guidance / negative prompt / LoRA 的差分效果。

浏览器端策略:不建议初版完整跑 SDXL。更适合服务端预计算 + 前端交互,或固定 prompt / seed / timestep 的可解释 demo。Polo Club 已有 Diffusion Explainer,可学习其三段式:text representation → image refinement → decode。

解释相似性、聚类、语义偏移与检索路径。可视化信号:2D projection、nearest neighbors、cluster density、query trajectory。

MVP:小文本数据集 + 预计算 embeddings + projection/neighbor 交互 + 受约束自然语言总结。必须提醒:降维会扭曲距离。

ViT / Vision Transformer

解释 patch tokens、class token 聚合、patch 对分类的贡献。MVP 可用小型 ViT + 固定示例图 + layer/head 选择。

P2 / P3:先学,不必先做

  • CNN:Polo Club 已有 CNN Explainer,可学范式,不建议重复造轮子
  • Tabular / Tree:实用,但视觉叙事弱于 RAG / Diffusion
  • Multimodal / VLM:边界容易虚,没有 open-weight 中间状态就只能做弱解释
  • GNN:研究味强,数据与工程门槛高

通用护栏

无论做哪个家族:

  1. 先定义 evidence schema
  2. 再定义 intent 列表
  3. 再定义 view family
  4. 自然语言层只能选任务与组织解释
  5. adapter 隔离模型细节
  6. 文档明确「不能解释什么」

这套纪律也适用于 agent skillstool use:开放输入,封闭工具面,证据绑定输出。

一句话结论

Polo Club 风格的核心不是「更炫的图」,而是每个模型家族一套可玩、可验证、可教学的解释语法。自然语言是入口,不是任意生成器;真实证据才是解释权的来源。

延伸阅读

Liked this note? Share it on Twitter / X, or browse more writing from the home page. Feedback and pointers welcome via @qianyuhe.

Thanks for reading.

– 千羽鹤