跳转到主要内容

大模型奖励专家,谁来培养下一代?

大模型似乎在放大领域专业知识,但这带来一个训练难题:团队可能在提升今日产出的同时,削弱了培养明日判断力的学习闭环。

Sean Goedecke5 分钟阅读
分享:
AI 驱动

AI 驱动 · 每小时限 20 次请求

Mark 在温暖的车间里从大量 AI 生成的候选零件中挑选精确的机械部件
机器能产出更多选项,但只有专业知识才能把选项变成真正值得留下的成果。

Sean Goedecke 在《大模型奖励专业知识》一文中提出了一个尖锐观点:真正好用的提示技巧不是一堆神奇话术,而是对某个领域懂得足够多,能看出哪里不对、指出更好的方向,不被模型看似合理的跑偏带偏。

我认同。但这里藏着一个容易被忽略的问题:AI 让老手更高效,却让新手绕过了积累经验的必经之路——团队今天的产出上去了,明天的判断力却在悄悄变弱。

答案快照

问题我的理解
核心观点是什么?领域专家能从同一模型中获得更多价值,因为他们能框定问题、引导方向并验证结果。
有何依据?Anthropic 2026 年对约 40 万次 Claude Code 会话的分析发现,随着任务专业度提升,成功率和每次指令触发的智能体操作数明显增加。
未证明什么?并非每位专家都会变得更快,也未证明会话层面的成功能转化为持久的生产价值。
我的论点专业知识正变得更有价值而非更少。团队现在需要保护培养专业知识的学习闭环。

专业知识就是方向盘

Goedecke 以陶哲轩与 ChatGPT 关于雅可比猜想的对话为例。引人注目的是,他没有用任何秘密提示模板,而是问一些简短具体的问题,拒绝看起来没用的方向,自己提供数学上的关键跳跃。单纯模仿他的句子长度,无法复制这些判断背后的功力。

写代码也一样。对代码库心里有数的人能直接告诉智能体:“这里应该复用现有路径”,或者一眼看出某个方案违反了隐含约束。新人呢?可能第一个看起来通顺的补丁就接受了,因为他们只能看到“通顺”这一个信号。

Anthropic 2026 年 6 月的 Claude Code 研究在大规模观察数据中验证了这一点。他们分析了 2025 年 10 月到 2026 年 4 月间约 23.5 万人的 40 万次交互会话。新手会话达到最严格的“验证成功”标准的比例只有 15%,中级及以上则达到 28% 到 33%。专家会话每次提示平均触发约 12 次智能体操作,新手会话只有 5 次左右。

Mark 引导一台强大机器避开迷宫般车间路径中的错误路线
有人认出路后,速度才有意义。没有这种判断力,更快的机器只会更快地到达错误转弯处。

奖励不等于提速

我不会把这些数字简化成一句漂亮的生产力口号。Anthropic 让 Claude 从会话记录里推断专业度,依据是精确的指令、验证请求、修正行为这些信号。成功指标也来自会话记录和测试、提交这类辅助数据。研究人员明确说,他们没法看到生成的代码后来是被用了、扔了,还是真的产生了经济价值。

一项更小规模的研究得出了相反的生产力结论。METR 的随机对照研究将 246 个大型开源项目的真实问题分配给 16 名资深维护者,允许或不允许使用 2025 年初的 AI 工具。结果显示,使用 AI 时开发者耗时增加了 19%,尽管他们事后认为效率提升了 20%。

这个结果并没有反驳 Goedecke。METR 研究的是维护者在熟悉的代码库里处理平均两小时左右的任务,用的模型和工具现在也已经变了。但它把两个常被混在一起的东西分开了:专业知识能提升引导质量,但提示、等待、审查的成本可能把省下的时间又吃回去。

专业知识传承管道才是风险所在

这带来一个团队建设的现实问题:明天的专家从哪来?专业知识是在反复犯错、反复修正中长出来的——你读一段不熟悉的代码,做了一个错误假设,顺着失败一路排查,然后修正自己的心智模型。智能体恰好能消除这些摩擦。有时这正是我们想要的。但消除太多,初级工程师就能把工单关掉,却不知道补丁为什么能跑通。

Anthropic 另一项随机试验测试了 52 名主要为初级工程师的学习者,让他们学习一个不熟悉的 Python 库。AI 组完成任务略快,但差异不具统计显著性。在随后的测验中,AI 组平均得分 50%,而手写代码组为 67%。用 AI 来追问概念、检验自己理解的参与者,表现明显好于直接把编码任务甩给 AI 的人。

这项研究规模不大,测的也是即时掌握程度,不是职业发展。但它的警示跟整体图景是一致的:如果专家判断力是让智能体真正有用的稀缺资源,那把学习时间当浪费就是在做亏本买卖。

Mark 指导两名年轻合作者在快速自动化生产线旁检查机械装置
团队可以利用今日的专业知识,同时为必须培养明日判断力的人保留真实工作。

我会在团队中做出哪些改变

我不会再把“提示工程”当成一门独立手艺来教。真正有用的能力更接近有监督的委派:说清楚你要什么结果、摆出相关约束、要求看到证据,还要知道什么时候答案“感觉不对”。这些习惯来自领域知识,也来自你对后果的切身承担。

换句话说,验证成本低的场景,专家尽管放手用智能体;但不能因为自己干得快,就把所有难题都揽过来。有些工作得留给学习者去做,让他们能看懂、能上手。初级工程师需要有机会在问模型之前先自己想方案,合并之前先讲清楚生成的代码在干什么,出 bug 时先自己排查而不是马上甩给 AI,还要亲眼看到自己的决策在生产环境里产生了什么后果。

IBM 研究人员在2025 年的企业案例研究中也发现了类似问题:感知到的效率提升分布不均,生成的代码还引发了归属权和责任归属的争议。对我来说,"谁兜底"是最实用的检验标准。重点不是把手动编码当成仪式来保留,而是保留足够的理解力——确保有人能质疑机器的输出,也扛得住最终结果。

我的结论

大模型确实奖励专业知识。这里说的“专业知识”是对具体问题的实际把握,不是头衔、资历或花哨的提示词——证据在这种语境下最有力。一个真正懂行的人能挖出更多有用产出,能从错误中拉回来,也能一眼识破那些包装精致的废话。

但这种优势是有代价的。如果公司用 AI 把更多工作堆到已经懂系统的人身上,短期可能见效,人才梯队却会越来越薄。我会同时看两件事:智能体帮忙交付了什么,以及交付过程中谁变得更能打了。否则,我们就是在把专业知识当成取之不尽的资源来消耗。

许可

新闻文本 © 2026 Mark Huang。 新闻文本可在非商业场景下分享或翻译,但需署名并链接到 https://markhuang.ai/zh/news/llms-reward-experts-who-trains-next.

建议署名: 基于「大模型奖励专家,谁来培养下一代?」(作者:Mark Huang),原文发布于 https://markhuang.ai/zh/news/llms-reward-experts-who-trains-next。