# 大模型奖励专家，谁来培养下一代？

**Summary:** 大模型似乎在放大领域专业知识，但这带来一个训练难题：团队可能在提升今日产出的同时，削弱了培养明日判断力的学习闭环。

- Canonical: https://markhuang.ai/zh/news/llms-reward-experts-who-trains-next
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-08-03
- Section: News
- Tags: AI, 大语言模型, 软件工程
- Source: [Sean Goedecke](https://www.seangoedecke.com/llms-reward-expertise/)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![Mark 在温暖的车间里从大量 AI 生成的候选零件中挑选精确的机械部件](https://cdn.markhuang.ai/news/llms-reward-experts-who-trains-next/hero.webp)

*机器能产出更多选项，但只有专业知识才能把选项变成真正值得留下的成果。*

Sean Goedecke 在[《大模型奖励专业知识》](https://www.seangoedecke.com/llms-reward-expertise/)一文中提出了一个尖锐观点：真正好用的提示技巧不是一堆神奇话术，而是对某个领域懂得足够多，能看出哪里不对、指出更好的方向，不被模型看似合理的跑偏带偏。

我认同。但这里藏着一个容易被忽略的问题：AI 让老手更高效，却让新手绕过了积累经验的必经之路——团队今天的产出上去了，明天的判断力却在悄悄变弱。

## 答案快照

| 问题       | 我的理解                                                                          |
| -------- | ----------------------------------------------------------------------------- |
| 核心观点是什么？ | 领域专家能从同一模型中获得更多价值，因为他们能框定问题、引导方向并验证结果。                                        |
| 有何依据？    | Anthropic 2026 年对约 40 万次 Claude Code 会话的分析发现，随着任务专业度提升，成功率和每次指令触发的智能体操作数明显增加。 |
| 未证明什么？   | 并非每位专家都会变得更快，也未证明会话层面的成功能转化为持久的生产价值。                                          |
| 我的论点     | 专业知识正变得更有价值而非更少。团队现在需要保护培养专业知识的学习闭环。                                          |

## 专业知识就是方向盘

Goedecke 以陶哲轩与 ChatGPT 关于雅可比猜想的[对话](https://chatgpt.com/share/6a5fdc7a-d6f8-83e8-bbea-8deb42cfed56)为例。引人注目的是，他没有用任何秘密提示模板，而是问一些简短具体的问题，拒绝看起来没用的方向，自己提供数学上的关键跳跃。单纯模仿他的句子长度，无法复制这些判断背后的功力。

写代码也一样。对代码库心里有数的人能直接告诉智能体：“这里应该复用现有路径”，或者一眼看出某个方案违反了隐含约束。新人呢？可能第一个看起来通顺的补丁就接受了，因为他们只能看到“通顺”这一个信号。

[Anthropic 2026 年 6 月的 Claude Code 研究](https://www.anthropic.com/research/claude-code-expertise)在大规模观察数据中验证了这一点。他们分析了 2025 年 10 月到 2026 年 4 月间约 23.5 万人的 40 万次交互会话。新手会话达到最严格的“验证成功”标准的比例只有 15%，中级及以上则达到 28% 到 33%。专家会话每次提示平均触发约 12 次智能体操作，新手会话只有 5 次左右。

![Mark 引导一台强大机器避开迷宫般车间路径中的错误路线](https://cdn.markhuang.ai/news/llms-reward-experts-who-trains-next/expert-steering.webp)

*有人认出路后，速度才有意义。没有这种判断力，更快的机器只会更快地到达错误转弯处。*

## 奖励不等于提速

我不会把这些数字简化成一句漂亮的生产力口号。Anthropic 让 Claude 从会话记录里推断专业度，依据是精确的指令、验证请求、修正行为这些信号。成功指标也来自会话记录和测试、提交这类辅助数据。研究人员明确说，他们没法看到生成的代码后来是被用了、扔了，还是真的产生了经济价值。

一项更小规模的研究得出了相反的生产力结论。[METR 的随机对照研究](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)将 246 个大型开源项目的真实问题分配给 16 名资深维护者，允许或不允许使用 2025 年初的 AI 工具。结果显示，使用 AI 时开发者耗时增加了 19%，尽管他们事后认为效率提升了 20%。

这个结果并没有反驳 Goedecke。METR 研究的是维护者在熟悉的代码库里处理平均两小时左右的任务，用的模型和工具现在也已经变了。但它把两个常被混在一起的东西分开了：专业知识能提升引导质量，但提示、等待、审查的成本可能把省下的时间又吃回去。

> **Info:**
>
> 我真正关心的不是“专家是否产出了更多”，而是“专家最终拿出的东西是否经得起审视，以及团队里有没有人学到了足以独立接手下一个任务的本事”。

## 专业知识传承管道才是风险所在

这带来一个团队建设的现实问题：明天的专家从哪来？专业知识是在反复犯错、反复修正中长出来的——你读一段不熟悉的代码，做了一个错误假设，顺着失败一路排查，然后修正自己的心智模型。智能体恰好能消除这些摩擦。有时这正是我们想要的。但消除太多，初级工程师就能把工单关掉，却不知道补丁为什么能跑通。

[Anthropic 另一项随机试验](https://www.anthropic.com/research/AI-assistance-coding-skills)测试了 52 名主要为初级工程师的学习者，让他们学习一个不熟悉的 Python 库。AI 组完成任务略快，但差异不具统计显著性。在随后的测验中，AI 组平均得分 50%，而手写代码组为 67%。用 AI 来追问概念、检验自己理解的参与者，表现明显好于直接把编码任务甩给 AI 的人。

这项研究规模不大，测的也是即时掌握程度，不是职业发展。但它的警示跟整体图景是一致的：如果专家判断力是让智能体真正有用的稀缺资源，那把学习时间当浪费就是在做亏本买卖。

![Mark 指导两名年轻合作者在快速自动化生产线旁检查机械装置](https://cdn.markhuang.ai/news/llms-reward-experts-who-trains-next/expertise-pipeline.webp)

*团队可以利用今日的专业知识，同时为必须培养明日判断力的人保留真实工作。*

## 我会在团队中做出哪些改变

我不会再把“提示工程”当成一门独立手艺来教。真正有用的能力更接近有监督的委派：说清楚你要什么结果、摆出相关约束、要求看到证据，还要知道什么时候答案“感觉不对”。这些习惯来自领域知识，也来自你对后果的切身承担。

换句话说，验证成本低的场景，专家尽管放手用智能体；但不能因为自己干得快，就把所有难题都揽过来。有些工作得留给学习者去做，让他们能看懂、能上手。初级工程师需要有机会在问模型之前先自己想方案，合并之前先讲清楚生成的代码在干什么，出 bug 时先自己排查而不是马上甩给 AI，还要亲眼看到自己的决策在生产环境里产生了什么后果。

IBM 研究人员在[2025 年的企业案例研究](https://research.ibm.com/publications/examining-the-use-and-impact-of-an-ai-code-assistant-on-developer-productivity-and-experience-in-the-enterprise)中也发现了类似问题：感知到的效率提升分布不均，生成的代码还引发了归属权和责任归属的争议。对我来说，"谁兜底"是最实用的检验标准。重点不是把手动编码当成仪式来保留，而是保留足够的理解力——确保有人能质疑机器的输出，也扛得住最终结果。

## 我的结论

大模型确实奖励专业知识。这里说的“专业知识”是对具体问题的实际把握，不是头衔、资历或花哨的提示词——证据在这种语境下最有力。一个真正懂行的人能挖出更多有用产出，能从错误中拉回来，也能一眼识破那些包装精致的废话。

但这种优势是有代价的。如果公司用 AI 把更多工作堆到已经懂系统的人身上，短期可能见效，人才梯队却会越来越薄。我会同时看两件事：智能体帮忙交付了什么，以及交付过程中谁变得更能打了。否则，我们就是在把专业知识当成取之不尽的资源来消耗。
