KOS TECH BRIEF · Vol.1 No.08 2026.06.26
品味是肌肉
研究方法论 · vivek (@itsreallyvivek) × Claude · 深度拆解

品味不是天赋,
是一块肌肉

没人正经教过你做研究。于是大多数人对着论文反向工程,练成的是"看起来像研究员"。可真正的能力,是一摞能被刻意训练的小技能——连那个你以为是命运的"品味",也不例外。

系列 / KOS Tech Brief · 深度拆解 受众 / 研究者 · 工程师 · 想做点原创的人 关键词 / 研究品味 · 刻意训练 · 反向工程 · Hamming
把"研究"拆开,它是一摞小技能——几乎每一项,都能被刻意训练。

vivek(@itsreallyvivek,Anthropic 研究员)与 Claude 合写的《how to be good at research》,把笼统的"天赋叙事"拆成 6 项可练的子技能。其中最反直觉的一项,是被所有人当作命运、当作出生时一手牌的"研究品味"。

可刻意训练的子技能
6 项
几乎全部能练
品味的真实物理属性
肌肉
不是天赋
Karpathy:单批过拟合后
30 秒
≈ 一半 bug 蒸发
这篇方法论的作者
人 + Claude
品味非人类专利
Q1没人教研究,那它到底是怎么"学会"的?
Q2我没有天生的研究"品味"——是不是就出局了?
Q3每天追最新的论文和热帖,为什么反而把我喂得越来越平庸?
Q4"自己选问题"——可我连什么是好问题都判断不了,从哪儿下手?
Q5为什么说"把一切写下来"是有史以来最便宜的护城河?
Q6实验慢、迭代慢,这是工程问题,还是研究问题?
ACT I · 起源 Nobody really teaches you this

01没人教你做研究

你拿到一张桌子、一个别人替你挑好的问题,和一句含糊的指令:做出点新东西来。没人告诉你具体该怎么做。于是你做了任何聪明人都会做的事——观察那些看起来已经成功的人,然后反向工程他们。

可你能看见的,只有论文、技术帖和发布公告。于是你学会的,是怎么看起来像一个研究员,而不是怎么成为一个。引对参考文献、用对黑话、把实验图画得很专业——这些都是研究的外观,不是研究本身。绝大多数人,就停在了这一层。

vivek 的第一性判断很冷:真正的研究能力,不是一种你有或没有的天赋,而是一摞更小的技能堆起来的——而这些小技能,几乎每一项都能被刻意训练。能力的天花板,因此不是你被分到多少天赋,而是你愿不愿意把它们一项项拆开来练。

这条"研究是手艺"的暗线,比深度学习老得多

把研究当成可训练的手艺,不是 2026 年的新发明。它有一条至少七十年的谱系——只是大多数人没把它当回事。

1952
Shannon ·《Creative Thinking》把问题缩到几乎平凡的程度,先解这个最小化的版本,再一点点把难度加回来。
1986
Hamming · 贝尔实验室的午餐桌他逼问邻座:"你们领域最重要的问题是什么?你为什么不做它?"——问到大家纷纷换桌坐。这正是截图里那段"made him unpopular at lunch"。
2019
Sutton ·《The Bitter Lesson》一千字,却比十倍长的综述更准地预言了整个领域的走向。
2026
vivek × Claude ·《how to be good at research》把这条暗线收束成 6 条可以逐项训练的子技能——并且,由一个人和一个模型合写完成。
为什么这件事值得拆

如果研究能力是天赋,这篇文章就没有存在的必要——你只能认命。但如果它是一摞可训练的技能,那么"我没天分"就从一个判决,降级成了一句借口。vivek 赌的是后者;而这篇方法论本身由一个人和一个模型合写完成,某种程度上,已经替他作了证。

ACT II · 冲突 Taste is a muscle, not a gift

02你以为的天赋,其实是肌肉

六项子技能里,有一项被单独供奉着,几乎没人敢说它能练——研究品味:挑对问题、押对方向、在数据出来之前就闻到哪条路是死的。我们默认它是命运,是你出生时被发或没被发的一手牌。

vivek 把这件唯一被当作天赋的东西,直接重新归类:品味的行为方式更像一块肌肉,而不是一份天赋。训练方法具体到近乎机械——每跑一个实验前,先预测它的结果;读论文时盖住结果部分,只凭方法去猜数据;记下哪些工作两年后还重要。一次预测、一次修正,重复几百遍——这,正是任何一个好模型被训练出来的方式。

是你先选问题,还是问题先选中你

另一半冲突,发生在更前面的地方:问题从哪来。vivek 的观察很扎人——我们很少"选"问题,我们"吸收"问题:从导师、从组会公告、从 arXiv 热榜接手。代价是,你只拿到了结论,却没拿到那段推导过程。OpenAI 的 John Schulman 给出过两种截然不同的模式:

维度模式一 · 改进式模式二 · 反推式
起点一篇现有论文一个你真心希望存在的结果
动作读文献,找一处能改进的地方倒推:需要哪些实验才能让它成立
你拿到的结论,但没有推导一个会拽着你走的真实目标
产出增量,且容易和所有人撞车原创——它会把你拖进任何综述都没覆盖的角落

"我们把研究里最关键的那件事,供成了天赋——
然后用'我没天分',给自己判了无期徒刑。"

ACT III · 现状 Shared inputs, shared ideas

03同一份阅读清单,喂出同一批想法

就算品味可练、问题可选,大多数人仍然平庸。为什么?vivek 指出两条几乎人人都会踩进去的暗沟:输入趋同,和自欺。第一条,决定了你能想出什么;第二条,决定了你敢不敢承认自己错了。

注意力都喂给了哪里 · 趋同的代价

arXiv 热榜 / 趋势页
≈60%
群聊筛过的二手解读
≈28%
旧论文 · 附录 · limitations
≈12%
趋同区:人人都在读的新东西 差异区:几乎没人读、却真正拉开差距的地方 示意 · 非实测,描述注意力分配的形状

暗沟一:你读什么,决定了你想得出什么

共享的阅读清单,长出共享的想法。当你的输入只剩 arXiv 趋势页和能挤过群聊过滤的内容,你必然和所有人得出同样的结论。而这个领域总是带着延迟在重复自己的过去——专家混合(MoE)可以追到 1991 年,LSTM 到 1997 年,反向传播在 1986 年才成为主流。读旧材料不是怀旧,是套利。

具体到动作:读论文本身,别读总结它的帖子。附录,才是关键细节真正的藏身处;而 limitations 章节,通常是整篇文档里最诚实的部分。知识的广度和深度同样重要——可解释性大方地借用神经科学;评估设计不过是穿了实验服的机制设计;只要你真懂 GPU 是怎么搬运显存的,你能在 benchmark 出结果之前,就看出哪些架构论文注定失败。

暗沟二:你最容易骗的人,是你自己

第二条沟更隐蔽。一个想法在你脑子里总显得已经成形,直到你试着把它写成文字。(Paul Graham)写在纸上,会暴露大脑替你盖住的漏洞:没验证的假设、不连贯的步骤、自相矛盾的主张。费曼说得更狠:你必须避免欺骗的第一个人就是你自己——因为你是最好骗的那个。而写作,是有史以来最便宜的防御。达尔文把它做成了铁律:任何与他理论相悖的事实,他都立刻写下来——因为他发现,记忆删除不利证据的速度,远快于删除有利证据。

一条会骗你一整年的曲线

一条向下的 loss 曲线不是分析,只是一种安慰。你的实验释放的信息,远多于你消费的:记录、失败案例、分布里诡异的长尾——大部分都没人读,死在 log 文件夹里。盯着曲线下降,是研究里最舒服、也最危险的一种自欺。

ACT IV · 机制 Speed is how fast you find your mistakes

04研究的速度,等于你发现错误的速度

如果说前面是"想得对",这一节是"转得快"。所有关于 Alec Radford 的故事,最后都收敛到一个词:数量。每天更多的实验、每周丢掉更多的错误想法、一个比任何人都更新得快的现实模型。这才是真正的游戏。研究的速度,主要取决于你多快能发现自己的错误。

反馈环原语标准为什么是研究,而不是杂活
启动一次实验一条命令摩擦每多一秒,你一天就少试一个想法
画出结果再一条命令看不到的结果,等于没产生的结果
复现任意实验仅凭它的配置文件不可复现的结果,等于没有结果
比较两次运行几秒钟比较的成本,决定你敢不敢多比——而多比,就是品味的训练量

30 秒,能蒸发掉一半的 bug

Karpathy 的除虫戏法近乎作弊:在大规模训练之前,先在单一一批数据上过拟合。30 秒之内,你一半的 bug 会自己消失。把一切缩小到便宜为止,把每件事都弄对,然后再去烧算力。一个推论是:别再把工程当成这里的次要角色。在最前沿,工程和研究已经合并——能搭出测试框架、评估机制和数据管线的研究者,才是那些假设真能被检验的人。

盯住输出:四个署名手艺

Karpathy
亲手翻原始数据他会花几个小时手动处理原始数据。大多数 ML 的 bug 藏在数据里,而且是静默失败——什么都不会崩,你只会得到一个平庸的模型和一个错误的理论。
Andrew Ng
一百个失败案例挑出一百个失败案例,全部看完,归类,然后专攻最大的那一类。对模型和评估机制都管用。
任何人
读 benchmark 的逐条记录如果你从没读过一次 benchmark 的记录文本,你就不算真懂这个 benchmark。一段真正诡异行为的记录,比多一位小数的准确率教给你的多得多。
消融到底
找出到底是哪个组件在起作用一直做消融实验,直到你弄清是哪个组件真正带来了结果。通常只有一个组件在起作用——而且往往不是标题里的那个。
"研究的速度,主要取决于你多快能发现自己的错误。大多数 ML 的 bug 在数据里,而且静默失败——什么都不会崩,你只是得到一个平庸的模型,和一个错误的理论。" — vivek × Claude,《how to be good at research》
ACT V · 判断 Roam with a purpose

05在一个会饱和的领域里,怎么下注

最后一项关于路径。你的第一个子领域,只是时间上的一次偶然,接受这件事。在决定专精方向之前,花真功夫去理解可解释性、评估、RL 和系统这几个方向。因为所有子领域都会饱和——通常就发生在它们于推特上达到顶峰之后。能在转场期里继续产出的人,是早就熟悉相邻领域的人。三种姿态,通往三种命运:

姿态一
撞车
增量 → 归零

趋势追逐者永远在追 arXiv 热榜与推特高峰。

  • 输入与所有人趋同,想法天然撞车
  • 领域一饱和就失速,无处可去
姿态二
被困
深 → 但脆

过早专精者一头扎进唯一的角落,押满。

  • 领域见顶,深度反成困住自己的墙
  • 相邻领域全是陌生人,转不过去
姿态三
复利
广 × 深

有目的的漫游者先在几个地方交够学费,再定专精。

  • 怪癖在某个角落变成不公平的优势
  • 转场期仍能产出,广度即对冲

三个篮子,三条纪律

① 杀死你的宠儿(严苛基线)

先给每个想法跑一个一次性版本,让大多数早早死掉。把基线调到极其严格。

ML 的坟场,堆满了在一个被认真调过的基线面前蒸发的结果。
默认:杀死,而非供养

② 把一切写下来(最便宜的护城河)

假设、设置、预期、结果、更新后的认知,逐条记录。

重读上个月的记录,会比任何审稿人都更让你谦卑。
公开其中一部分——那是一份无法伪造的、关于你思考方式的样本。
写作 = 防自欺 + 履历

③ 有目的地漫游(广度即保险)

在几个不同的地方付够学费,再去找属于你的角落。

领域里的某个角落,你的怪癖会变成不公平的优势。
广度,是对抗饱和的对冲
把六项收成一句话

选你自己的问题 · 升级你的输入 · 把一切写下来 · 拧紧反馈环 · 盯住输出 · 有目的地漫游。六项里,没有一项需要天赋——每一项都是一次预测加一次修正,重复几百遍。这就是把"看起来像研究员"换成"是研究员"的全部工序。

底色判断 — 没人在等你变得有天赋

把这篇文章倒过来读,它其实只说了一件事:我们一直把研究里最关键的能力——品味、选题、判断——当成出生时发的牌。vivek 的反驳不是鸡汤,而是一套工序:每一项"天赋",都能被拆成预测与修正的循环,然后像训练模型一样训练它。

它甚至自带证据。这篇关于"如何做好研究"的方法论,是一个人和一个模型(Claude)合写的——如果研究品味真是人类与生俱来的神秘禀赋,这件事本不该发生。一旦你接受品味是肌肉,整个游戏就变了。

"品味是一块肌肉,不是一份天赋。如果这是真的,整个游戏就变了——没有人,还需要等着自己有天分。"

Q1 答案:它不是被"教会"的,是被"练会"的——研究是一摞小技能的堆叠,你逐项拆开、刻意训练,而非整体地"有没有天分"。

Q2 答案:不会出局。品味是行为意义上的肌肉:跑实验前先预测、盖住结果猜数据、记录两年后还重要的工作——预测一次修正一次,几百遍之后它自己长出来。

Q3 答案:因为共享的阅读清单长出共享的想法。热榜只喂你结论,真正拉开差距的东西在旧论文、附录和 limitations 里——那里几乎没人读。

Q4 答案:把"改进一篇现有论文"换成 Schulman 的模式二:先定一个你真心希望存在的结果,再倒推需要哪些实验。真在乎的目标,会把你拖到综述没覆盖的地方。

Q5 答案:因为你最容易骗的人是你自己,而写作是把脑中"看似成形"的想法摊开验伪的最便宜手段;记录还会在两年后狠狠羞辱你,并顺手成为无法伪造的履历。

Q6 答案:两者已经合并。研究速度 = 你发现错误的速度;能把"一条命令启动、单批先过拟合、几秒钟比较两次运行"做出来的人,才是假设真能被检验的人。

06三类人,三种下一步

① 在读博士 / 刚进实验室的人

你最大的风险是"吸收"而非"选择"问题,然后用五年,把别人的结论又重新验证了一遍。

今天就做:盖住你下一篇要读的论文的结果区,先写下你的预测——这是开始练品味的第 0 天。

② 转行 / 自学的工程师

你以为自己缺的是数学天赋,其实你手里攥着别人没有的牌:你真的懂系统、懂数据管线、懂 GPU 怎么搬显存。

今天就做:把工程当一等公民——先搭一个"一条命令启动 + 几秒钟比较"的实验台,你的假设会比同行更快被检验。

③ 已在领域里、但感觉撞墙的研究者

你可能正卡在一个刚于推特上见顶、即将饱和的子领域里,深度反而成了困住自己的墙。

今天就做:花一个季度去隔壁领域交学费(可解释性 / 评估 / RL / 系统,挑一个),广度是你对抗饱和的唯一对冲。

0710 个可以今天就开练的动作

#动作它在训练哪块"肌肉"
1跑实验前先写下预测,事后逐条对照研究品味
2读论文盖住结果区,只凭方法去猜数据研究品味
3记一张清单:哪些工作两年后还重要长期判断
4这周读一篇 1986–1997 的老论文(backprop / LSTM / MoE)输入去趋同
5只读论文本体,先跳过解读帖;直奔附录与 limitations输入质量
6每个实验记录:假设 / 设置 / 预期 / 结果 / 更新后的认知防自欺
7任何与你假设相悖的结果,立刻写下来(达尔文铁律)防自欺
8把实验台改造成"一条命令启动、一条命令出图"反馈环
9大规模训练前,先在单批数据上过拟合 30 秒反馈环
10挑 100 个失败案例全部看完、归类、专攻最大类盯输出

"研究,没人教你。
但几乎每一块,都能练。"

主要来源 / Sources

· vivek (@itsreallyvivek)《how to be good at research》· X 原帖(2026.06.10)· x.com

· vivek · "taste is a muscle, not a gift" 作者补充帖 · x.com

· 林俊旸推荐 ·《Anthropic 研究员的自白:如何成为优秀研究员?》中文综述 · 36kr.com

· Richard Hamming《You and Your Research》(Bellcore, 1986)· paulgraham.com

· Rich Sutton《The Bitter Lesson》(2019)· incompleteideas.net

· Chris Olah & Shan Carter《Research Debt》(Distill, 2017)· distill.pub

KOS Tech Brief · Vol.1 No.08 · 2026.06.26
数字是结论,叙事是支撑 · 出处 vivek (@itsreallyvivek) × Claude《how to be good at research》