KOS TECH BRIEF · Vol.1 No.07 2026.06.23
能力重定价
AI 协作 · 管理学 · Ethan Mollick 拆解

用 Claude Code,成功率最高的
是管理者,不是程序员

Ethan Mollick 把一句反直觉的观察推到尽头:当模型能在真实专家工作上追平 72%,稀缺的早已不是"会做",而是"说得清你到底要什么"。

系列 / KOS Tech Brief · 深度拆解 受众 / 工程师 · 管理者 · 一切要和 AI 协作的人 关键词 / 委派 · 规格 · GDPval · 管理即超能力
被科技业嫌弃了十年的"软技能",成了 AI 时代最硬的瓶颈。

宾大高管 MBA 的非技术学员,用 4 天搭出的创业原型,比 AI 出现之前一整个学期还要远一个数量级。同一篇文章里,OpenAI 的 GDPval 显示 GPT-5.2 在真实专家工作上追平或胜出约 72%。两件事指向同一个结论:模型不再是瓶颈——你才是。

GPT-5.2 追平/击败专家
≈72%
GDPval · 44 类职业
专家完成一项任务
7 小时
人类基线工时
委派 AI 后净省 / 任务
≈3 小时
扣除 1 小时评审
学员原型进度 vs 学期
10×
一个数量级
Q1"管理者成功率最高"——这是硬证据,还是又一个幸存者偏差的好故事?
Q2不会写代码的人,凭什么比工程师更会用 AI 写代码?
Q3"管理是 AI 超能力"——到底指哪几种具体能力?
Q4一个任务,我到底该不该交给 AI?有没有能算的判断标准?
Q5GDPval 的 72% 证明了什么,又恰恰没证明什么?
Q6如果"知道要什么"才稀缺,这东西能练吗?怎么练?
ACT I · 教室里的反常识 What the non-coders saw

01不会写代码的人,赢了

四天。在宾夕法尼亚大学高管 MBA 的创业挑战赛上,一群医生、经理和高管——几乎没人会写代码——交出的产品原型,比 AI 出现之前学生花一整个学期做出来的还要远一个数量级。

Mollick 让学员用 Claude Code、Google Antigravity、ChatGPT、Claude 和 Gemini 一起上手。成果不是玩具:Ticket Passport(票务整合)、Revenue Resilience(营收韧性诊断)、一个育儿陪伴助手,还有 Invive——一个预测血糖的应用。没有一个团队是靠"代码写得更好"赢的,他们里面本来就没几个会写代码。

反常识就在这里:如果 AI 把"写代码"这件事变便宜了,按理说最受益的应该是程序员。但 Mollick 在教室里看到的恰恰相反——赢家是那些最懂怎么把事情说清楚的人。他们知道如何拆解问题、定义交付物,并且能一眼看出 AI 的产出"跑偏了"。

他们的旧技能,恰好是新刚需

这些学员手里的,是在课堂和工作里磨了多年的硬框架:怎么界定一个问题的范围、怎么描述"满意的结果"、怎么在中途发现方向不对。过去这些被归进"管理"和"领域专长",现在它们直接变成了提示词。Mollick 的原话是:那些训练,原来是在不知不觉中,为这一刻做准备。

教室里的第一手观察

同一批工具,发到所有人手上。决定原型走多远的,不是谁更懂技术,而是谁更懂"我到底要什么、好长什么样"。会写代码不再是入场券,会下定义才是。

ACT II · 一条推文的张力 The soft skills were the hard ones

02成功率最高的,为什么是管理者?

这一切始于 Ethan Mollick 的一条推文。他写道:有(早期)证据显示,管理者用 Claude Code 写代码的成功率最高。配图来自他刚发布的长文《管理,正在成为 AI 超能力》。一句话点燃了工程师圈:凭什么?

直觉是这样算的:AI 把"写代码"的边际成本压到接近零,那存量里还值钱的,应该是会写代码。但实测把这个等式倒了过来。当模型能独立把活干到 72% 的及格线,真正值钱的不再是"会做",而是"会判断做得对不对""会说清楚要做什么"——这恰好是管理者日复一日在练的事。

但话要说准。Mollick 自己用的词是 "some (early) evidence"——早期的、观察性的证据,来自他课堂上的一手观察,而不是随机对照实验。它当然会有幸存者偏差。值得认真对待的原因不在它本身,而在于:它和 GDPval 的硬数据,指向了同一个方向。

把"软技能"重新定价

维度程序员的直觉实际决定成败的
最稀缺的资源写代码的能力说清楚要什么
AI 扮演的角色更快的打字员需要被管理的"廉价天才"
谁最受益资深工程师最会委派的人
典型失败模式代码写错了需求没界定 / 没发现跑偏

"被嫌弃为'软'的那些技能,
原来才是最硬的那部分。"

ACT III · 委派的方程 The equation of agentic work

03该不该把这件事交给 AI?

Mollick 给了一个可以真正拿来算的心智模型——他称之为"agentic work 的方程"。要不要把一个任务委派给 AI,取决于三个变量的博弈。先看一眼底层数据为什么逼着我们去算这笔账:

GDPVAL · GPT-5.2 在专家盲评下的结果

追平或击败人类专家
72%
仍需人来兜底
28%
AI 一次产出即达标或更优 需要人来判断、修正、重来

变量一 · 你自己做要多久(Human Baseline Time)

任务本身的"人类基线工时"。它越长,委派的潜在收益越大;反过来,一件你 5 分钟就能搞定的事,不值得为它付出来回沟通的开销——亲自做完反而更快。

变量二 × 变量三 · 一次成功的概率 × 来回的开销

第二个变量是"单次成功率"(Probability of Success)——AI 一次就产出达到你标准的东西的概率。第三个是"AI 处理时间"(AI Process Time)——你提出要求、等待、再评估一次产出,所花的时间。Mollick 的心智模型是:你在用"亲自做完整件事"(基线工时)去对赌"反复支付沟通开销"(处理时间),可能要赌好几轮,直到拿到能用的东西。

那 28% 才是你的工作

模型替你干掉了 72% 的"做"。但剩下的 28%——判断这次有没有踩中、产出哪里不达标、要不要再来一轮——没人替你扛。会用 AI 的人,本质上是能又便宜又快地识别并修复那 28% 的人。这件事,就叫"管理"。

ACT IV · 数据与现场 What the benchmark and the labs both show

0472% 证明了什么

推文是观察,GDPval 是标尺。OpenAI 的 GDPval 把顶尖人类专家和 AI 放在同一批真实职业任务上对垒——横跨 44 类职业,从财务、医疗到政府事务,由专家评委盲评。结果是这样的:

指标数值含义
专家平均工时7 小时一项任务的人类基线
GPT-5.2 Thinking 追平 / 胜出70.9%专家评委盲评
GPT-5.2 Pro 追平 / 胜出74.1%更大更贵的版本
Mollick 文中口径≈72%取整后引用
产出速度(相对专家)>11×快十一倍以上
产出成本(相对专家)<1%不到百分之一
人工评审耗时≈1 小时无法省去
7 小时任务净省≈3 小时扣除评审后

把这张表读两遍。第一遍你看到的是"AI 好强"。第二遍你该看到的是:速度快十一倍、成本不到百分之一,但那 1 小时的人工评审省不掉,那 28% 还得人来兜底。AI 把"产能"变成了近乎免费的商品,却把"判断力"的价格顶了上去。

AI 实验室自己,正在变成管理岗

几十年来
"委派文档"早被各行各业发明过了软件业有产品需求文档(PRD),电影业有分镜表(shot list),建筑师有设计意图书,海军陆战队有"五段式命令"(情况·任务·执行·行政·指挥)。
共同点
它们解决的是同一个问题用 Mollick 的话说:把一个人脑子里的东西,变成另一个人(或另一个 agent)的行动。这正是一条好提示词在做的事
2026
顶尖开发者的工作正在质变一些 AI 大厂里最知名的工程师都说,自己的工作正从"主要在编程",变成"主要在管理 AI agent"。
"管理一直假设稀缺:你委派,是因为你没法事事亲为,也因为人才有限且昂贵。AI 改变了这个等式——现在'人才'廉价且充裕,稀缺的是知道该要什么。" — Ethan Mollick《Management as an AI superpower》
ACT V · 三种命运,与可练的能力 Who thrives, and how

05知道"好"长什么样

如果稀缺的是"知道要什么",那问题就变成两个:谁手里已经握着这种能力,以及——它能不能练出来。先说命运。

① 只想写代码
被压缩
护城河蒸发

把价值绑死在"亲手产出"上、拒绝管理 AI 的人。

  • AI 产能越便宜,"手速"越不值钱
  • 仍能写最难的 28%,但份额在缩小
② 学会下规格
≈3h
每任务净省

愿意把技能翻译成清晰规格、并扛起评审的人。

  • 每个 7 小时的任务净省约 3 小时
  • 代价:必须为那 28% 的兜底负责
③ 能定义"好"
10×
越强越值钱

既有领域判断、又能讲清标准的专家或管理者。

  • AI 越强,他们的杠杆越大
  • 稀缺的"知道要什么"恰好握在手里

好的委派长什么样:六个问题

Mollick 把"好委派"拆成了六个问题——它们既是给下属的,也是给 AI 的。下次写提示词卡住时,照着过一遍:

#下指令前,先回答这六个问题
1我们到底要达成什么,为什么?
2被授权的边界在哪里?
3"完成"长什么样?
4我具体需要哪些产出?
5我需要哪些中间产物来跟进进度?
6你在说"做完了"之前,该自己检查什么?

三套早就存在的"提示词"

① 产品需求文档 / PRD

软件工程用来把一个产品讲清楚的文档。

诞生地 · 软件工程
回答 · 要什么功能、给谁用、何为"完成"
规格 = 提示词

② 分镜表 / Shot List

电影开拍前,把每个镜头逐一定下来。

诞生地 · 电影制作
回答 · 每个镜头拍什么、怎么拍
画面在开拍前就说清

③ 五段式命令 / Five Paragraph Order

海军陆战队下达任务的标准结构。

诞生地 · 海军陆战队
结构 · 情况·任务·执行·行政·指挥
把意图压进可执行的结构
能力是可练的

好消息是:这不是天赋,是手艺。它就是几十年来被正经训练过、却被科技业当作"软技能"打了折的那套东西——拆解目标、定义"完成"、界定边界、设计验收。练它的唯一方法,就是每次给 AI 下指令时,把它当成一次真正的委派来认真对待。

底色判断 — 模型不再是瓶颈,你才是

把三件事叠在一起:宾大教室里非技术学员的胜出、GDPval 上 72% 的追平率、以及 AI 实验室里工程师集体转岗做管理——它们讲的是同一个故事。AI 把"做"变成了近乎免费、近乎无限的商品。当产能不再稀缺,瓶颈就上移到了"判断"与"表达":你知不知道自己要什么,以及你能不能说清到连一台机器都能交付。

这不是说代码能力不再重要——最难的那 28% 仍然需要它。但它确实意味着,决定你能从 AI 身上榨出多少价值的,不是你打字多快,而是你委派得多清楚。同一个 7 小时的任务,会委派的人净省 3 小时;不会的人,省下的时间全赔在反复返工和"它怎么又没懂"上。

"未来胜出的人,是那些知道'好'长什么样、并且能讲清楚到连 AI 都能交付的人。"

Q1 答案:早期、观察性的证据,确实有幸存者偏差;但它与 GDPval 的硬数据同向,值得当真——别当定论。

Q2 答案:因为瓶颈已从"会写"移到"会说清要写什么、并判断写得对不对",这正是管理者的日常训练。

Q3 答案:拆解目标、界定授权边界、定义"完成"、指定交付物与中间产物、设计自检——六件事,全是委派能力。

Q4 答案:有。比"人类基线工时"和"AI 处理时间 × 可能的重试轮数";基线越长、单次成功率越高、来回开销越小,越该交给 AI。

Q5 答案:证明了 AI 在真实专家工作上能追平/胜出约 72%、快 11 倍、成本不到 1%;但没证明那 1 小时评审和 28% 兜底能省掉——那部分仍归你。

Q6 答案:能练。它就是被低估的"软技能"。最简单的练法:把每一次给 AI 的提示,当成一次正式委派,照那六个问题走。

06三类人,三种下一步

① 工程师 / "我代码写得很好"

你的稀缺性正在从"产出"迁移到"判断与规格"。最难的 28% 仍是你的护城河,但别把全部身份押在手速上。

下一步:刻意练习把模糊需求写成 PRD 级别的提示词,并为 AI 的产出做 code review,而不是抢过来替它重写。

② 管理者 / 非技术背景

你以为自己缺的是技术,其实你手里握着最稀缺的东西——知道要什么、知道"好"长什么样。

下一步:直接上手 Claude Code 这类 agent 工具,用你已有的委派框架当提示词,别等"先学会编程"。

③ 领域专家 / 医生·律师·分析师

你的领域判断,正是 AI 暂时给不出的那 28%。把它显性化、结构化,就是最高杠杆的提示词。

下一步:把脑子里的"验收标准"写下来——那些你一眼能看出对错、却从没明说过的规则。

07十个监测信号

#信号触发判断 / 动作
1提示词长度 vs 返工次数返工多 → 规格不清,回到"完成长什么样"
2花在评审 AI 产出上的时间占比占比升高是正常的——这就是新工作本身
3招聘 JD 里"会管理 AI / 会写规格"的权重一旦出现,即"能力被重新定价"的信号
4GDPval / 同类基准的下一次刷新看 72% 往哪走、哪些任务仍是人类专属
5"自己做要多久"——动手前先估一下短任务别委派,长任务别手做
6AI 一次成功率(你的体感)低于一半的任务,先改规格再重试
7最难的那 28% 落在哪那里就是你不可替代性的所在
8你能不能把"好"写成清单写不出,就是还没真正想透这件事
9有没有要中间产物 / checkpoint别只看终稿,进度可见才好纠偏
10把每次提示当委派的习惯养成了,这项"超能力"就内化了

"AI 让'做'变得免费。
于是'知道要什么',成了唯一的护城河。"

主要数据来源 / Data Sources

· Ethan Mollick《Management as an AI superpower》· 2026-01-27 · oneusefulthing.org

· Ethan Mollick · 原推(@emollick)· x.com/emollick

· OpenAI《Introducing GPT-5.2》· GDPval 得分 · openai.com

· Fortune · OpenAI GDPval 基准(44 类职业)· 2025-09-30 · fortune.com

· AINews · GPT-5.2:74.1% on GDPval(Pro)· news.smol.ai

KOS Tech Brief · Vol.1 No.07 · 2026.06.23
数字是结论,叙事是支撑 · 出处 Ethan Mollick《Management as an AI superpower》