1 · 阶段自我认知
2026 中期,superun 处于 pre-PMF / 早期阶段。团队小、每个成员必须能独立把一块从想法到上线。
不是"招齐分工",是"招齐能独立 solo 的人"。阶段决定配比:这个阶段要的是 prototyper + builder + cleaner,不是 grower + maintainer。
2 · 五轴人物卡
评分卡是一张人物卡,不是一个数字。五个维度都独立、都不改动 0-100 能力分。
| 维度 | 数据列 | 取值 | 作用 |
|---|
| 能力分 | ai_score | 0-100 | 该候选人对该岗位的能力匹配 |
| 证据可信度 | ai_trust_score | 0-100 | 本次评分背后的证据扎不扎实(baseline 50 + 规则 + AI 风险) |
| 工作模式 | ai_archetypes | 5 选 1-2 + 置信度 | '是哪种人'—— prototyper/builder/cleaner/grower/maintainer |
| 招牌特征 | ai_signature.tag | 2-20 字 | '最让人记住的一句话' |
| 证据厚度 | ai_signature.density | rich / moderate / sparse | '本次评分证据多厚',sparse → 面试前先补 |
例:同一 88 分候选人,trust 90 + rich → 直接安排面试;trust 55 + sparse → 面试前先补 GitHub / 作品 / 学历核实。
3 · 工作模式(archetype 5 类)
| slug | 中文 | 一句话 | 早期是否要 |
|---|
| prototyper | 原型设计师 | 快速出想法、快速试做 | ✅ 核心 |
| builder | 构建者 | 把想法做成能上线的东西 | ✅ 核心 |
| cleaner | 清理者 | 简化系统、删掉冗余 | ✅ 防杂物堆积 |
| grower | 成长者 | 接手已有产品做增长 | ⏸ 阶段不匹配 |
| maintainer | 维护者 | 让成熟系统规模化稳定 | ⏸ 阶段不匹配 |
4 · Agent 研究品味 7 信号(研究/Agent 岗专用)
| 码 | 信号 | 类型 | 解释 |
|---|
| A | 研究品味 | MUST | 从长长的 arXiv 列表里挑出真正推动范式的几篇,能说清为什么 |
| B | Eval 能力 | MUST | 会写自己的 eval,理解 benchmark 偏见与失效模式 |
| C | 模型体感 | MUST | 用过 3+ 个前沿模型,知道每个的脾气与边界 |
| D | 生产 reliability | MUST | 知道怎么把 demo 变成能 handle 边缘 case 的生产系统 |
| E | 范式判断 | MUST | 能说清这一波技术的形与破 |
| F | 公开发声 | 加分 | blog / 推特 / arXiv / GitHub 上有可追踪的思考轨迹 |
| G | 独立复现 | 加分 | 曾把某前沿论文独立复现或改进过 |
A-E 有一项弱不代表拒;全部都薄 = 无法 solo,不适合早期 superun。
5 · 硬评分红线(backend 强制)
以下 6 条是 AI 评分卡不可突破的分数上限。触发即 clamp 到该值,AI 不能自行放宽。详见 ai_resume_evaluation_rules.md。
| 触发场景 | 上限 | 说明 |
|---|
| 应届生 | ≤ 90 | 仅 2026 毕业,backend 用毕业年份强制注入 |
| 包装型简历 | ≤ 65 | 抽象形容词多、缺项目名/公司名/量化 |
| 稳定但不亮眼 | ≤ 80 | 多年产出线性、无跨越性成果 |
| 年限通胀者 | ≤ 82 | 简历自报年限明显 > 从毕业年份计算的实际 |
| 无作品输出 | ≤ 82 | 只简历,无 GitHub / blog / 作品可验证 |
| 框架调用者 | ≤ 85 | 只调 GPT / LangChain 等 SDK,未做底层判断 |
6 · 评分卡的品味原则
6.1 宁漏不错
AI 风险扣项只在硬证据下触发。"不确定" / "信息不全" / "似乎有点问题" 一律不是触发理由。宁可漏判一个真跳槽者,也不错杀一个稳定候选人。
6.2 系统权威 > AI 自由发挥
关键 marker 由 backend 用毕业年份强制注入 prompt(🔒 工作时长 / 🎓 应届生 / ⚠️ 跨度警告), AI 不能自己算年限、不能复述简历自报值、不能触发未被系统注入的规则。
AI 是审判员,不是律师;数据是证据,不是被告的自述。
6.3 证据必须可复述
每条 AI 风险的 evidence 都必须能被复述:"几段工作 / 哪年跳槽 / 哪个项目"。"有点问题"、"不够明确" 这种描述不算证据,直接拒收。
6.4 评分是记录不是判决
一次 AI 评分不决定生死;它是"给 HR / 面试官的一张信息卡",最终判断权在人。
7 · 外部锚点
| 来源 | 核心观点 | 用途 |
|---|
| Notion / Ivan Zhao | We want to be a jazz band, not a marching band. | 解释为什么早期 superun 只要能 solo 的人 |
| Anthropic 1680 人剖析(2026-06) | PhD 仅 13.7%,<3 年经验的仅 50 人(约 3%),中位工业经验 12.2 年;最大人才源 Google 大厂 infra 不是 AI Lab | 印证"反 PhD / 反应届 / 反纯 AI lab 崇拜"方向对,但别抄他们的配比 |
| Boris Cherny(Anthropic / Claude Code) | 5 类工作模式分类(prototyper / builder / cleaner / grower / maintainer) | superun 采纳作为独立观察维度,不当评分依据 |
| superun Coding Agent 命题(2026-05-15) | 挖掘模型 coding 能力 + 用工程系统补"模型不知道自己写的代码是否符合用户需求"的缺陷 | 给面试官一句话说清 superun 是什么;也是评 A 研究品味的锚点 |
8 · 明确不做的事(负面清单)
- 不做纯 AI 黑盒 trust 分——规则透明 + AI 扣分是 mvp choice
- 不把 archetype / signature / trust 混进 0-100 能力分
- 不用一次评分决定生死(评分是记录不是判决)
- 不追 PhD / 不追 AI lab 出身 / 不追应届
- 不把"不确定"当"风险"(trust 宁漏不错)
- 不放弃对"框架调用者" / "包装型简历" / "年限通胀"的硬拒
- 不做"太多风险项 → 分低" 这种迎合分数的启发式
9 · 面试官使用建议
- 面试前:打开候选人详情卡,重点看五轴人物卡 —— 尤其 trust 与 signature。低 trust 意味着"证据薄",要在面试里主动补齐。
- 面试中:不要复述 AI 评分给候选人。评分是给你的工具、不是给候选人的评价。
- 面试后:把观察写进 talent_interviews 里,用具体证据描述——AI 会读这些反馈进下轮评分。
- 对 AI 评分有异议:直接反馈到
hiring_taste.md 或 ai_resume_evaluation_rules.md,附上具体候选人 case,迭代 prompt 规则。
10 · 知识 / 技能 / 元认知:面试的三层辨识
常见踩坑:候选人「面得很好、用起来不行」,本质是面试问到的是知识(能背、能讲得漂亮), 但入职后要用的是技能甚至元认知。三层要在面试短窗口里主动区分开。
| 层 | 名称 | 定义 | 从哪来 | 面试里怎么显形 |
|---|
| L1 | 知识 | 概念 / 术语 / 方法论 | 教程、面经、LLM 都能给 | 能背;追问一层「为什么」就卡 |
| L2 | 技能 | 真做过、能复现 | 简历项目 / GitHub / 作品,需交叉印证 | 能讲怎么做的;复盘只到「哪步做错」 |
| L3 | 元认知 | 对自己思考过程的观察和修正 | 多次挑战 / 失败复盘 / 主动补盲区的沉淀 | 能说清「为什么选 A 不选 B」、复盘能到「当时的判断模型缺什么信号」、能自评回答质量 |
4 个把候选人从 L1 逼到 L3 观测点的问法
- 1. 追一层「为什么」——每个知识点后面接一句「你为什么这么选 / 这么判断?」。CAP 你能背,那什么业务下你会反过来选、判断依据是什么?—— 纯 L1 的人这里就卡;L2 能给出「我们业务是 X 所以选 Y」;L3 会补一句「当时其实还纠结过 Z,最后没选是因为…」。
- 2. 让他复盘一次失败——不问「举个成就」,问「你上一个搞砸的事、事后你怎么复盘的」。L2 只能到「哪一步做错了」;L3 能到「我当时的判断模型缺了什么信号、下次我会怎么校准」。
- 3. 中途挑战他的答案——回一句「我不太同意刚才说的」或抛一个反例。L1 会僵、L2 会辩、L3 会真的想一下,然后要么用新证据说服你,要么当场修正自己。
- 4. 让他自评刚才的回答——「这个 case 你自己觉得答得怎么样?10 分给几分?」元认知强的人能给出结构化自评(哪里满意、哪里不满、可以怎么更好),弱的人只会「还行吧」或「我尽力了」。
L1 / L2 / L3 不是拒收标准(很多岗位需要的就是 L2),而是“你现在识别到的是哪一层”的辨认工具。 真正的红线是:只有 L1、没有 L2——那就是被知识骗了。
11 · 更新纪律
本文档是 superun 招聘品味的 canonical 视图。出现新的招聘决策 / 外部锚点 / 硬规则调整时, 先更新 memory/hiring_taste.md,再更新细节文件。
© superun · 2026-06 · v1 内部版本
本文档仅限 superun 团队内部使用。对外精简版见 /why-superun。