Ethan Mollick 把一句反直觉的观察推到尽头:当模型能在真实专家工作上追平 72%,稀缺的早已不是"会做",而是"说得清你到底要什么"。
宾大高管 MBA 的非技术学员,用 4 天搭出的创业原型,比 AI 出现之前一整个学期还要远一个数量级。同一篇文章里,OpenAI 的 GDPval 显示 GPT-5.2 在真实专家工作上追平或胜出约 72%。两件事指向同一个结论:模型不再是瓶颈——你才是。
四天。在宾夕法尼亚大学高管 MBA 的创业挑战赛上,一群医生、经理和高管——几乎没人会写代码——交出的产品原型,比 AI 出现之前学生花一整个学期做出来的还要远一个数量级。
Mollick 让学员用 Claude Code、Google Antigravity、ChatGPT、Claude 和 Gemini 一起上手。成果不是玩具:Ticket Passport(票务整合)、Revenue Resilience(营收韧性诊断)、一个育儿陪伴助手,还有 Invive——一个预测血糖的应用。没有一个团队是靠"代码写得更好"赢的,他们里面本来就没几个会写代码。
反常识就在这里:如果 AI 把"写代码"这件事变便宜了,按理说最受益的应该是程序员。但 Mollick 在教室里看到的恰恰相反——赢家是那些最懂怎么把事情说清楚的人。他们知道如何拆解问题、定义交付物,并且能一眼看出 AI 的产出"跑偏了"。
这些学员手里的,是在课堂和工作里磨了多年的硬框架:怎么界定一个问题的范围、怎么描述"满意的结果"、怎么在中途发现方向不对。过去这些被归进"管理"和"领域专长",现在它们直接变成了提示词。Mollick 的原话是:那些训练,原来是在不知不觉中,为这一刻做准备。
同一批工具,发到所有人手上。决定原型走多远的,不是谁更懂技术,而是谁更懂"我到底要什么、好长什么样"。会写代码不再是入场券,会下定义才是。
这一切始于 Ethan Mollick 的一条推文。他写道:有(早期)证据显示,管理者用 Claude Code 写代码的成功率最高。配图来自他刚发布的长文《管理,正在成为 AI 超能力》。一句话点燃了工程师圈:凭什么?
直觉是这样算的:AI 把"写代码"的边际成本压到接近零,那存量里还值钱的,应该是会写代码。但实测把这个等式倒了过来。当模型能独立把活干到 72% 的及格线,真正值钱的不再是"会做",而是"会判断做得对不对""会说清楚要做什么"——这恰好是管理者日复一日在练的事。
但话要说准。Mollick 自己用的词是 "some (early) evidence"——早期的、观察性的证据,来自他课堂上的一手观察,而不是随机对照实验。它当然会有幸存者偏差。值得认真对待的原因不在它本身,而在于:它和 GDPval 的硬数据,指向了同一个方向。
| 维度 | 程序员的直觉 | 实际决定成败的 |
|---|---|---|
| 最稀缺的资源 | 写代码的能力 | 说清楚要什么 |
| AI 扮演的角色 | 更快的打字员 | 需要被管理的"廉价天才" |
| 谁最受益 | 资深工程师 | 最会委派的人 |
| 典型失败模式 | 代码写错了 | 需求没界定 / 没发现跑偏 |
"被嫌弃为'软'的那些技能,
原来才是最硬的那部分。"
Mollick 给了一个可以真正拿来算的心智模型——他称之为"agentic work 的方程"。要不要把一个任务委派给 AI,取决于三个变量的博弈。先看一眼底层数据为什么逼着我们去算这笔账:
任务本身的"人类基线工时"。它越长,委派的潜在收益越大;反过来,一件你 5 分钟就能搞定的事,不值得为它付出来回沟通的开销——亲自做完反而更快。
第二个变量是"单次成功率"(Probability of Success)——AI 一次就产出达到你标准的东西的概率。第三个是"AI 处理时间"(AI Process Time)——你提出要求、等待、再评估一次产出,所花的时间。Mollick 的心智模型是:你在用"亲自做完整件事"(基线工时)去对赌"反复支付沟通开销"(处理时间),可能要赌好几轮,直到拿到能用的东西。
模型替你干掉了 72% 的"做"。但剩下的 28%——判断这次有没有踩中、产出哪里不达标、要不要再来一轮——没人替你扛。会用 AI 的人,本质上是能又便宜又快地识别并修复那 28% 的人。这件事,就叫"管理"。
推文是观察,GDPval 是标尺。OpenAI 的 GDPval 把顶尖人类专家和 AI 放在同一批真实职业任务上对垒——横跨 44 类职业,从财务、医疗到政府事务,由专家评委盲评。结果是这样的:
| 指标 | 数值 | 含义 |
|---|---|---|
| 专家平均工时 | 7 小时 | 一项任务的人类基线 |
| GPT-5.2 Thinking 追平 / 胜出 | 70.9% | 专家评委盲评 |
| GPT-5.2 Pro 追平 / 胜出 | 74.1% | 更大更贵的版本 |
| Mollick 文中口径 | ≈72% | 取整后引用 |
| 产出速度(相对专家) | >11× | 快十一倍以上 |
| 产出成本(相对专家) | <1% | 不到百分之一 |
| 人工评审耗时 | ≈1 小时 | 无法省去 |
| 7 小时任务净省 | ≈3 小时 | 扣除评审后 |
把这张表读两遍。第一遍你看到的是"AI 好强"。第二遍你该看到的是:速度快十一倍、成本不到百分之一,但那 1 小时的人工评审省不掉,那 28% 还得人来兜底。AI 把"产能"变成了近乎免费的商品,却把"判断力"的价格顶了上去。
"管理一直假设稀缺:你委派,是因为你没法事事亲为,也因为人才有限且昂贵。AI 改变了这个等式——现在'人才'廉价且充裕,稀缺的是知道该要什么。" — Ethan Mollick《Management as an AI superpower》
如果稀缺的是"知道要什么",那问题就变成两个:谁手里已经握着这种能力,以及——它能不能练出来。先说命运。
把价值绑死在"亲手产出"上、拒绝管理 AI 的人。
愿意把技能翻译成清晰规格、并扛起评审的人。
既有领域判断、又能讲清标准的专家或管理者。
Mollick 把"好委派"拆成了六个问题——它们既是给下属的,也是给 AI 的。下次写提示词卡住时,照着过一遍:
| # | 下指令前,先回答这六个问题 |
|---|---|
| 1 | 我们到底要达成什么,为什么? |
| 2 | 被授权的边界在哪里? |
| 3 | "完成"长什么样? |
| 4 | 我具体需要哪些产出? |
| 5 | 我需要哪些中间产物来跟进进度? |
| 6 | 你在说"做完了"之前,该自己检查什么? |
软件工程用来把一个产品讲清楚的文档。
电影开拍前,把每个镜头逐一定下来。
海军陆战队下达任务的标准结构。
好消息是:这不是天赋,是手艺。它就是几十年来被正经训练过、却被科技业当作"软技能"打了折的那套东西——拆解目标、定义"完成"、界定边界、设计验收。练它的唯一方法,就是每次给 AI 下指令时,把它当成一次真正的委派来认真对待。
把三件事叠在一起:宾大教室里非技术学员的胜出、GDPval 上 72% 的追平率、以及 AI 实验室里工程师集体转岗做管理——它们讲的是同一个故事。AI 把"做"变成了近乎免费、近乎无限的商品。当产能不再稀缺,瓶颈就上移到了"判断"与"表达":你知不知道自己要什么,以及你能不能说清到连一台机器都能交付。
这不是说代码能力不再重要——最难的那 28% 仍然需要它。但它确实意味着,决定你能从 AI 身上榨出多少价值的,不是你打字多快,而是你委派得多清楚。同一个 7 小时的任务,会委派的人净省 3 小时;不会的人,省下的时间全赔在反复返工和"它怎么又没懂"上。
Q1 答案:早期、观察性的证据,确实有幸存者偏差;但它与 GDPval 的硬数据同向,值得当真——别当定论。
Q2 答案:因为瓶颈已从"会写"移到"会说清要写什么、并判断写得对不对",这正是管理者的日常训练。
Q3 答案:拆解目标、界定授权边界、定义"完成"、指定交付物与中间产物、设计自检——六件事,全是委派能力。
Q4 答案:有。比"人类基线工时"和"AI 处理时间 × 可能的重试轮数";基线越长、单次成功率越高、来回开销越小,越该交给 AI。
Q5 答案:证明了 AI 在真实专家工作上能追平/胜出约 72%、快 11 倍、成本不到 1%;但没证明那 1 小时评审和 28% 兜底能省掉——那部分仍归你。
Q6 答案:能练。它就是被低估的"软技能"。最简单的练法:把每一次给 AI 的提示,当成一次正式委派,照那六个问题走。
你的稀缺性正在从"产出"迁移到"判断与规格"。最难的 28% 仍是你的护城河,但别把全部身份押在手速上。
下一步:刻意练习把模糊需求写成 PRD 级别的提示词,并为 AI 的产出做 code review,而不是抢过来替它重写。
你以为自己缺的是技术,其实你手里握着最稀缺的东西——知道要什么、知道"好"长什么样。
下一步:直接上手 Claude Code 这类 agent 工具,用你已有的委派框架当提示词,别等"先学会编程"。
你的领域判断,正是 AI 暂时给不出的那 28%。把它显性化、结构化,就是最高杠杆的提示词。
下一步:把脑子里的"验收标准"写下来——那些你一眼能看出对错、却从没明说过的规则。
| # | 信号 | 触发判断 / 动作 |
|---|---|---|
| 1 | 提示词长度 vs 返工次数 | 返工多 → 规格不清,回到"完成长什么样" |
| 2 | 花在评审 AI 产出上的时间占比 | 占比升高是正常的——这就是新工作本身 |
| 3 | 招聘 JD 里"会管理 AI / 会写规格"的权重 | 一旦出现,即"能力被重新定价"的信号 |
| 4 | GDPval / 同类基准的下一次刷新 | 看 72% 往哪走、哪些任务仍是人类专属 |
| 5 | "自己做要多久"——动手前先估一下 | 短任务别委派,长任务别手做 |
| 6 | AI 一次成功率(你的体感) | 低于一半的任务,先改规格再重试 |
| 7 | 最难的那 28% 落在哪 | 那里就是你不可替代性的所在 |
| 8 | 你能不能把"好"写成清单 | 写不出,就是还没真正想透这件事 |
| 9 | 有没有要中间产物 / checkpoint | 别只看终稿,进度可见才好纠偏 |
| 10 | 把每次提示当委派的习惯 | 养成了,这项"超能力"就内化了 |
"AI 让'做'变得免费。
于是'知道要什么',成了唯一的护城河。"
· Ethan Mollick《Management as an AI superpower》· 2026-01-27 · oneusefulthing.org
· Ethan Mollick · 原推(@emollick)· x.com/emollick
· OpenAI《Introducing GPT-5.2》· GDPval 得分 · openai.com
· Fortune · OpenAI GDPval 基准(44 类职业)· 2025-09-30 · fortune.com
· AINews · GPT-5.2:74.1% on GDPval(Pro)· news.smol.ai