Polo Club 风格模型解释器选题清单
最值得优先做的不是「万能模型解释器」,而是沿着 Polo Club of Data Science 的方式,做一组模型家族解释器:每个家族有固定证据、固定视图、固定交互语法;自然语言只负责选择任务、组织解释和引导用户,不负责自由生成 UI。
推荐路线:
- decoder-only Transformer 解释器:直接继承 transformer-explainer,最适合先做
- BERT / encoder-only 分类解释器:结构清楚,适合第二家族
- RAG / 检索增强解释器:应用价值高
- Diffusion / LoRA / Prompt Editing:展示型强,后续做
- Embedding / 向量检索解释器:承接 WizMap 空间探索范式
核心原则:
- 不让 LLM 自由编 UI
- 不让 LLM 自由解释内部机制
- 先定义 schema / intent / view family
- 所有解释绑定真实模型证据
- 复杂模型通过 adapter 接入,不破坏前端视图契约
这正是可落地的 model explainer 产品方法:约束优先于聪明。
| 优先级 | 方向 | 解释目标 | 浏览器端可行性 | 推荐判断 | | --- | --- | --- | --- | --- | | P0 | Decoder-only Transformer | next-token、attention、MLP、logit lens | 高(小模型 / ONNX) | 最先做 | | P0 | BERT / Encoder-only | 分类贡献、token attribution | 高 | 第二家族 | | P0 | RAG | 检索链路、citation trace | 中高 | 应用价值最高 | | P1 | Diffusion / LoRA | prompt 如何影响生成 | 中 | 展示强 | | P1 | Embedding / Vector Search | 相似性、聚类、语义空间 | 高 | 可继承 WizMap | | P1 | ViT | patch / class token | 中高 | 接上 Transformer 叙事 | | P2 | CNN | feature map / CAM | 高 | 已有 CNN Explainer | | P2 | Tabular / Tree | SHAP / decision path | 高 | 实用但视觉新意弱 | | P2 | Multimodal / CLIP / VLM | 图文对齐 | 中 | 后期 | | P3 | GNN | 子图归因 | 中 | 门槛高 |
1. Decoder-only Transformer
代表:GPT-2 / DistilGPT2、小尺寸 Qwen / Phi / Gemma。
解释目标:
- token 如何影响 next-token
- attention head 在看什么
- residual / MLP 如何改表示
- logit lens 的中间层预测变化
- KV cache 与 sampling 如何改输出
可视化信号:token 序列、attention matrix、residual stream、layer-wise logits、top-k、sampling path。
MVP:
- 固化 GPT-2 explanation schema
- custom GPT-2-like model 接入文档
- DistilGPT2 / tiny GPT-2 adapter
- 自然语言 planner:把「解释第 3 层 attention」映射到固定 view
风险:hidden size / layer / tokenizer / ONNX 输出命名不一致。没有 adapter,前端会被模型细节污染。
2. BERT / Encoder-only 分类解释器
代表:DistilBERT、RoBERTa、MiniLM。
解释目标:
- 为什么输出某个类别
- 哪些 token 推高 / 压低分数
[CLS]如何聚合信息- attention 与 attribution 是否一致
- token 删除后预测如何变化
MVP:
- DistilBERT sentiment classifier
- 输出类别概率
- mask / delete perturbation 算贡献
- heatmap + bar chart
- 自然语言只基于贡献排序生成
注意:attention ≠ 解释。文档必须写清边界。初版可用 occlusion,不必先上完整梯度。
3. RAG / 检索增强解释器
解释目标:
- 答案来自哪些文档
- 检索为何选中这些 chunk
- rerank 如何重排
- 句子与 source span 对齐
- 哪些内容是推断、哪些有证据
MVP:
- 固定小文档集
- 展示 top-k、相似度、rerank 前后变化
- 回答每句绑定 source span
- 高亮 unsupported / weakly supported claims
Diffusion / LoRA / Prompt Editing
解释 prompt token 如何影响图像区域、denoising 逐步形成图像、guidance / negative prompt / LoRA 的差分效果。
浏览器端策略:不建议初版完整跑 SDXL。更适合服务端预计算 + 前端交互,或固定 prompt / seed / timestep 的可解释 demo。Polo Club 已有 Diffusion Explainer,可学习其三段式:text representation → image refinement → decode。
Embedding / Vector Search
解释相似性、聚类、语义偏移与检索路径。可视化信号:2D projection、nearest neighbors、cluster density、query trajectory。
MVP:小文本数据集 + 预计算 embeddings + projection/neighbor 交互 + 受约束自然语言总结。必须提醒:降维会扭曲距离。
ViT / Vision Transformer
解释 patch tokens、class token 聚合、patch 对分类的贡献。MVP 可用小型 ViT + 固定示例图 + layer/head 选择。
- CNN:Polo Club 已有 CNN Explainer,可学范式,不建议重复造轮子
- Tabular / Tree:实用,但视觉叙事弱于 RAG / Diffusion
- Multimodal / VLM:边界容易虚,没有 open-weight 中间状态就只能做弱解释
- GNN:研究味强,数据与工程门槛高
无论做哪个家族:
- 先定义 evidence schema
- 再定义 intent 列表
- 再定义 view family
- 自然语言层只能选任务与组织解释
- adapter 隔离模型细节
- 文档明确「不能解释什么」
这套纪律也适用于 agent skills 与 tool use:开放输入,封闭工具面,证据绑定输出。
Polo Club 风格的核心不是「更炫的图」,而是每个模型家族一套可玩、可验证、可教学的解释语法。自然语言是入口,不是任意生成器;真实证据才是解释权的来源。
- 自然语言驱动的 Transformer 可视化解释器设计文档