没人正经教过你做研究。于是大多数人对着论文反向工程,练成的是"看起来像研究员"。可真正的能力,是一摞能被刻意训练的小技能——连那个你以为是命运的"品味",也不例外。
vivek(@itsreallyvivek,Anthropic 研究员)与 Claude 合写的《how to be good at research》,把笼统的"天赋叙事"拆成 6 项可练的子技能。其中最反直觉的一项,是被所有人当作命运、当作出生时一手牌的"研究品味"。
你拿到一张桌子、一个别人替你挑好的问题,和一句含糊的指令:做出点新东西来。没人告诉你具体该怎么做。于是你做了任何聪明人都会做的事——观察那些看起来已经成功的人,然后反向工程他们。
可你能看见的,只有论文、技术帖和发布公告。于是你学会的,是怎么看起来像一个研究员,而不是怎么成为一个。引对参考文献、用对黑话、把实验图画得很专业——这些都是研究的外观,不是研究本身。绝大多数人,就停在了这一层。
vivek 的第一性判断很冷:真正的研究能力,不是一种你有或没有的天赋,而是一摞更小的技能堆起来的——而这些小技能,几乎每一项都能被刻意训练。能力的天花板,因此不是你被分到多少天赋,而是你愿不愿意把它们一项项拆开来练。
把研究当成可训练的手艺,不是 2026 年的新发明。它有一条至少七十年的谱系——只是大多数人没把它当回事。
如果研究能力是天赋,这篇文章就没有存在的必要——你只能认命。但如果它是一摞可训练的技能,那么"我没天分"就从一个判决,降级成了一句借口。vivek 赌的是后者;而这篇方法论本身由一个人和一个模型合写完成,某种程度上,已经替他作了证。
六项子技能里,有一项被单独供奉着,几乎没人敢说它能练——研究品味:挑对问题、押对方向、在数据出来之前就闻到哪条路是死的。我们默认它是命运,是你出生时被发或没被发的一手牌。
vivek 把这件唯一被当作天赋的东西,直接重新归类:品味的行为方式更像一块肌肉,而不是一份天赋。训练方法具体到近乎机械——每跑一个实验前,先预测它的结果;读论文时盖住结果部分,只凭方法去猜数据;记下哪些工作两年后还重要。一次预测、一次修正,重复几百遍——这,正是任何一个好模型被训练出来的方式。
另一半冲突,发生在更前面的地方:问题从哪来。vivek 的观察很扎人——我们很少"选"问题,我们"吸收"问题:从导师、从组会公告、从 arXiv 热榜接手。代价是,你只拿到了结论,却没拿到那段推导过程。OpenAI 的 John Schulman 给出过两种截然不同的模式:
| 维度 | 模式一 · 改进式 | 模式二 · 反推式 |
|---|---|---|
| 起点 | 一篇现有论文 | 一个你真心希望存在的结果 |
| 动作 | 读文献,找一处能改进的地方 | 倒推:需要哪些实验才能让它成立 |
| 你拿到的 | 结论,但没有推导 | 一个会拽着你走的真实目标 |
| 产出 | 增量,且容易和所有人撞车 | 原创——它会把你拖进任何综述都没覆盖的角落 |
"我们把研究里最关键的那件事,供成了天赋——
然后用'我没天分',给自己判了无期徒刑。"
就算品味可练、问题可选,大多数人仍然平庸。为什么?vivek 指出两条几乎人人都会踩进去的暗沟:输入趋同,和自欺。第一条,决定了你能想出什么;第二条,决定了你敢不敢承认自己错了。
共享的阅读清单,长出共享的想法。当你的输入只剩 arXiv 趋势页和能挤过群聊过滤的内容,你必然和所有人得出同样的结论。而这个领域总是带着延迟在重复自己的过去——专家混合(MoE)可以追到 1991 年,LSTM 到 1997 年,反向传播在 1986 年才成为主流。读旧材料不是怀旧,是套利。
具体到动作:读论文本身,别读总结它的帖子。附录,才是关键细节真正的藏身处;而 limitations 章节,通常是整篇文档里最诚实的部分。知识的广度和深度同样重要——可解释性大方地借用神经科学;评估设计不过是穿了实验服的机制设计;只要你真懂 GPU 是怎么搬运显存的,你能在 benchmark 出结果之前,就看出哪些架构论文注定失败。
第二条沟更隐蔽。一个想法在你脑子里总显得已经成形,直到你试着把它写成文字。(Paul Graham)写在纸上,会暴露大脑替你盖住的漏洞:没验证的假设、不连贯的步骤、自相矛盾的主张。费曼说得更狠:你必须避免欺骗的第一个人就是你自己——因为你是最好骗的那个。而写作,是有史以来最便宜的防御。达尔文把它做成了铁律:任何与他理论相悖的事实,他都立刻写下来——因为他发现,记忆删除不利证据的速度,远快于删除有利证据。
一条向下的 loss 曲线不是分析,只是一种安慰。你的实验释放的信息,远多于你消费的:记录、失败案例、分布里诡异的长尾——大部分都没人读,死在 log 文件夹里。盯着曲线下降,是研究里最舒服、也最危险的一种自欺。
如果说前面是"想得对",这一节是"转得快"。所有关于 Alec Radford 的故事,最后都收敛到一个词:数量。每天更多的实验、每周丢掉更多的错误想法、一个比任何人都更新得快的现实模型。这才是真正的游戏。研究的速度,主要取决于你多快能发现自己的错误。
| 反馈环原语 | 标准 | 为什么是研究,而不是杂活 |
|---|---|---|
| 启动一次实验 | 一条命令 | 摩擦每多一秒,你一天就少试一个想法 |
| 画出结果 | 再一条命令 | 看不到的结果,等于没产生的结果 |
| 复现任意实验 | 仅凭它的配置文件 | 不可复现的结果,等于没有结果 |
| 比较两次运行 | 几秒钟 | 比较的成本,决定你敢不敢多比——而多比,就是品味的训练量 |
Karpathy 的除虫戏法近乎作弊:在大规模训练之前,先在单一一批数据上过拟合。30 秒之内,你一半的 bug 会自己消失。把一切缩小到便宜为止,把每件事都弄对,然后再去烧算力。一个推论是:别再把工程当成这里的次要角色。在最前沿,工程和研究已经合并——能搭出测试框架、评估机制和数据管线的研究者,才是那些假设真能被检验的人。
"研究的速度,主要取决于你多快能发现自己的错误。大多数 ML 的 bug 在数据里,而且静默失败——什么都不会崩,你只是得到一个平庸的模型,和一个错误的理论。" — vivek × Claude,《how to be good at research》
最后一项关于路径。你的第一个子领域,只是时间上的一次偶然,接受这件事。在决定专精方向之前,花真功夫去理解可解释性、评估、RL 和系统这几个方向。因为所有子领域都会饱和——通常就发生在它们于推特上达到顶峰之后。能在转场期里继续产出的人,是早就熟悉相邻领域的人。三种姿态,通往三种命运:
趋势追逐者永远在追 arXiv 热榜与推特高峰。
过早专精者一头扎进唯一的角落,押满。
有目的的漫游者先在几个地方交够学费,再定专精。
先给每个想法跑一个一次性版本,让大多数早早死掉。把基线调到极其严格。
假设、设置、预期、结果、更新后的认知,逐条记录。
在几个不同的地方付够学费,再去找属于你的角落。
选你自己的问题 · 升级你的输入 · 把一切写下来 · 拧紧反馈环 · 盯住输出 · 有目的地漫游。六项里,没有一项需要天赋——每一项都是一次预测加一次修正,重复几百遍。这就是把"看起来像研究员"换成"是研究员"的全部工序。
把这篇文章倒过来读,它其实只说了一件事:我们一直把研究里最关键的能力——品味、选题、判断——当成出生时发的牌。vivek 的反驳不是鸡汤,而是一套工序:每一项"天赋",都能被拆成预测与修正的循环,然后像训练模型一样训练它。
它甚至自带证据。这篇关于"如何做好研究"的方法论,是一个人和一个模型(Claude)合写的——如果研究品味真是人类与生俱来的神秘禀赋,这件事本不该发生。一旦你接受品味是肌肉,整个游戏就变了。
Q1 答案:它不是被"教会"的,是被"练会"的——研究是一摞小技能的堆叠,你逐项拆开、刻意训练,而非整体地"有没有天分"。
Q2 答案:不会出局。品味是行为意义上的肌肉:跑实验前先预测、盖住结果猜数据、记录两年后还重要的工作——预测一次修正一次,几百遍之后它自己长出来。
Q3 答案:因为共享的阅读清单长出共享的想法。热榜只喂你结论,真正拉开差距的东西在旧论文、附录和 limitations 里——那里几乎没人读。
Q4 答案:把"改进一篇现有论文"换成 Schulman 的模式二:先定一个你真心希望存在的结果,再倒推需要哪些实验。真在乎的目标,会把你拖到综述没覆盖的地方。
Q5 答案:因为你最容易骗的人是你自己,而写作是把脑中"看似成形"的想法摊开验伪的最便宜手段;记录还会在两年后狠狠羞辱你,并顺手成为无法伪造的履历。
Q6 答案:两者已经合并。研究速度 = 你发现错误的速度;能把"一条命令启动、单批先过拟合、几秒钟比较两次运行"做出来的人,才是假设真能被检验的人。
你最大的风险是"吸收"而非"选择"问题,然后用五年,把别人的结论又重新验证了一遍。
今天就做:盖住你下一篇要读的论文的结果区,先写下你的预测——这是开始练品味的第 0 天。
你以为自己缺的是数学天赋,其实你手里攥着别人没有的牌:你真的懂系统、懂数据管线、懂 GPU 怎么搬显存。
今天就做:把工程当一等公民——先搭一个"一条命令启动 + 几秒钟比较"的实验台,你的假设会比同行更快被检验。
你可能正卡在一个刚于推特上见顶、即将饱和的子领域里,深度反而成了困住自己的墙。
今天就做:花一个季度去隔壁领域交学费(可解释性 / 评估 / RL / 系统,挑一个),广度是你对抗饱和的唯一对冲。
| # | 动作 | 它在训练哪块"肌肉" |
|---|---|---|
| 1 | 跑实验前先写下预测,事后逐条对照 | 研究品味 |
| 2 | 读论文盖住结果区,只凭方法去猜数据 | 研究品味 |
| 3 | 记一张清单:哪些工作两年后还重要 | 长期判断 |
| 4 | 这周读一篇 1986–1997 的老论文(backprop / LSTM / MoE) | 输入去趋同 |
| 5 | 只读论文本体,先跳过解读帖;直奔附录与 limitations | 输入质量 |
| 6 | 每个实验记录:假设 / 设置 / 预期 / 结果 / 更新后的认知 | 防自欺 |
| 7 | 任何与你假设相悖的结果,立刻写下来(达尔文铁律) | 防自欺 |
| 8 | 把实验台改造成"一条命令启动、一条命令出图" | 反馈环 |
| 9 | 大规模训练前,先在单批数据上过拟合 30 秒 | 反馈环 |
| 10 | 挑 100 个失败案例全部看完、归类、专攻最大类 | 盯输出 |
"研究,没人教你。
但几乎每一块,都能练。"
· vivek (@itsreallyvivek)《how to be good at research》· X 原帖(2026.06.10)· x.com
· vivek · "taste is a muscle, not a gift" 作者补充帖 · x.com
· 林俊旸推荐 ·《Anthropic 研究员的自白:如何成为优秀研究员?》中文综述 · 36kr.com
· Richard Hamming《You and Your Research》(Bellcore, 1986)· paulgraham.com
· Rich Sutton《The Bitter Lesson》(2019)· incompleteideas.net
· Chris Olah & Shan Carter《Research Debt》(Distill, 2017)· distill.pub