最后一次技术面试:导读
源文:The Last Technical Interview(Steve Yegge)。本文是导读,不镜像 35 年故事全文。
Yegge 的核心判断很粗暴:
传统技术面试试图回答“这人能不能做这份工作”,但用几小时模拟,根本给不出可靠信号。
支撑点来自他在 Amazon Bar Raiser、Google Hiring Committee 的长期经验:
- 面试官之间几乎不共识:同一人可被 strong hire 与 flat no 同时判。
- 面试分与入职表现几乎无关:明星员工可能挂掉四五次面试才进来。
- 所有 band-aid 都围着“一天 4–6 场”转:Bar Raiser / AA / 招聘委员会只是承认流程不可信,并试图加监护人。
- Google 内部统计长期令人沮丧:结果很少公开发表,因为质疑面试有效性像“教堂里放屁”。
最著名的校准故事:招聘委员会被拿去审“匿名包”,否决约 2/3——结果那些包就是他们自己当年的面试材料。
Yegge 把人才评估看成信号问题:
| 信号源 | 强度 | 问题 | | --- | --- | --- | | 简历 | 很弱 | 营销文案 | | 证书 / 刷题 / OSS | 弱到中 | 看不到真实协作 | | 现场面试 | 中 | 不像真实工作 | | 实习 / co-op / 合同转正 | 强 | 需要时间与组织成本 | | 与候选人一起做真工作 | 最强 | 历史上供需双方都难接受 |
结论:金标准不是白板,而是 provisional employment——在真实环境里一起干活足够久,再决定是否绑定雇佣关系。
旧流程能撑几十年,是因为它“勉强够用 + 惯性极大”。Yegge 认为当前有两股力在撕开裂缝:
- 作弊与身份欺诈:AI 代答、离线评估被污染、甚至更恶劣的远程替身问题。
- 岗位形状变化太快:知识工作角色的技能边界被 agent / AI 工具快速改写,固定题库与固定胜任力模型跟不上。
当“工作本身”在变形,用昨天的面试题预测明天的表现,只会更糟。这也解释了为什么 coding agent 时代的评估,必须把 tool use 与真实交付 算进信号,而不是假装候选人只会空手写算法。
Yegge 描述的新 meta(尤其在 SF 创业圈)是:
来跟我们干几天。带薪,真代码库,真 ticket,真团队。
他把更系统的版本叫 campfire:
- 公司从“工作山”上切下真实可交付块。
- 候选人在真实环境中完成它,公司获得高信号评估 + 真实产出。
- 无论录用与否,给候选人可带走的“印章 / 记录”——让付出双倍计数。
- 印章的价值取决于诚实:乱发金星就退化成 LinkedIn 背书。
关键设计不是“免费试用劳动力”,而是:
- 对候选人公平:失败也不空手离开
- 对公司划算:面试从纯成本中心变成有产出的协作
- 可迁移:避免每次都 reinvention 一套私有试用协议
即使你不买 campfire 全套叙事,也有几条可立刻用的迁移:
- 减少模拟,增加工作样本:带真实仓库约束的小任务,比纯算法题更接近岗位。
- 评估协作与 harness 使用:会不会用 agent harness、会不会验证、会不会写可审查交付,正在变成核心能力。
- 看长期信号:开源 PR 维护、连续交付记录、带证据的项目叙事,比单场临场发挥更稳。
- 把 AI 当成默认环境:禁止 AI 的考试正在失真;更该看的是人如何指挥、约束、验收 agent。
这与 智能体对话归档 的精神一致:真正有价值的是可验证工作痕迹,不是一次表演。
- “几天试用”对有家庭与签证约束的候选人并不总是可行。
- 印章体系若无跨公司信誉基础设施,会退化为又一个封闭简历格式。
- 大厂合规、隐私、数据访问边界,会让“直接进真代码库”比创业公司难一个数量级。
所以更务实的落地可能是:
- 付费 work trial
- 限权沙盒仓库
- 有时间盒的真实 bug / 文档 / 测试任务
- 明确评分表 + 可带走的公开贡献记录
传统技术面试不是“还需要优化题库”,而是信号带宽不足。
替代物的方向是:更长时间的真实协作 + 对候选人公平的双计分产出。
在 agent 普及后,这个方向只会更自然——因为工作本身已经越来越像“人 + 工具链”的联合交付,而不是空手白板。
源文: