# LLM 让产出变廉价，信任却成了最贵的部分

**Summary:** Jeremy Theocharis 一边认同 LLM 批评者的观点，一边大手笔使用这些工具；在我看来，模型能规模化生成内容，但人类的判断力、审核能力和可追责的作者身份却无法随之扩展。

- Canonical: https://markhuang.ai/zh/news/llm-output-cheap-trust-expensive
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-07-16
- Section: News
- Tags: AI, 大语言模型, 软件工程, 开源, 开发者工具, 代码审查
- Source: [Jeremy Theocharis](https://www.theocharis.dev/blog/llm-critics-are-right-i-use-llms-anyway/)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![一位卡通工程师手持钥匙，站在一扇信任之门旁，门的一侧是有用的 AI 制造部件，另一侧是汹涌而来的机器输出洪流](https://cdn.markhuang.ai/news/llm-output-cheap-trust-expensive/hero.webp)

*产出充裕之后，真正稀缺的是人的判断力——由它来决定什么值得放行。*

[Jeremy Theocharis 的文章](https://www.theocharis.dev/blog/llm-critics-are-right-i-use-llms-anyway/)之所以引人深思，是因为他拒绝站队。他承认外界对 LLM 的批评都有道理：产出质量低、加重开源维护负担、削弱学习能力、形成依赖、扭曲思维。但他同时也坦言，自己在 2026 年 6 月花费了近 1 万美元购买 Token，并依然相信这些工具能帮助他产出更少但更好的成果。

我不认为这是虚伪，反而觉得这精准描述了瓶颈的转移。模型让看似合理的产出变得廉价，却没有让注意力、品味、责任感和信任变得同样廉价。模型生成的内容越多，后面这几样就越值钱。

## 要点速览

| 问题             | 我的解读                                                               |
| -------------- | ------------------------------------------------------------------ |
| 这篇文章的核心论点是什么？  | LLM 能放大一个人的思考和手艺，但也会放大敷衍和草率；判断力没法外包给别人。                            |
| 它揭示了什么问题？      | 读者和维护者再也没法从漂亮的产出里推断作者到底花了多少心思、理解有多深，审核能力和对贡献者的信任反而成了瓶颈。            |
| 如果这种方法奏效，谁会受益？ | 能定义清楚问题、能检验结果、能拿模型迭代但不交出主导权的老手。                                    |
| 最实用的观点是什么？     | 先让人把问题和边界说清楚，再让模型来质疑、挑刺、测试这些决策。                                    |
| 哪里言过其实了？       | 把 LLM 说成纯粹的“放大器”太干净了：模型还会夹带自己的默认倾向、错误，以及听起来很有道理的废话，而用户现有的判断力未必抓得住。 |
| 我的核心观点         | LLM 写得流畅不代表人用了心。信任得靠小范围交付、可验证的检查、和可追责的作者身份来挣。                      |

## 矛盾之处恰恰最有价值

Theocharis 以柏林 Local-First Conf 大会的一个场景开篇。他说与会者一边为批评 LLM 的演讲鼓掌，一边开着 AI 编程助手。他还提到自己曾问 Armin Ronacher，Pi 背后的团队如何应对海量贡献；据 Theocharis 转述，Ronacher 表示他们几乎自动关闭所有拉取请求和议题，但仍鼓励人们不要气馁。

这种张力之所以尖锐，是因为 Ronacher 创立的公司 Earendil 本身就在开发 AI 工具，而其[宗旨声明](https://earendil.com/purpose/)却强调人才是最好的 agent，人应该驾驭工具，而不是被工具牵着走。我喜欢这个说法，因为它把人的主动性当成一条硬性约束，而不是一句客套的赞美。

一些开源社区的公共政策则展现了另一面。[Zig 的官方社区规则](https://ziglang.org/code-of-conduct/)禁止使用 LLM 生成代码和文字，包括编辑、翻译以及将头脑风暴结果分享回其管理空间。同样，[Gentoo 维基的贡献要求](https://wiki.gentoo.org/wiki/Gentoo_Wiki%3AContribution_requirements)也禁止使用基于 NLP 的 AI 辅助生成内容。

我理解维护者为何要划出明确界限。过去，一份精致的提交至少暗示了作者投入了一定精力。如今，批量生成看似合理的提交的成本，可能低于认真审核其中一份的成本。即使全面禁令难以验证，这项政策本身也证明了审核过载和来源追溯并非无端担忧。

![一位卡通开源维护者正在检查一个机器零件，而旁边的传送带正源源不断地涌出大量光鲜亮丽的组件](https://cdn.markhuang.ai/news/llm-output-cheap-trust-expensive/maintainer-bottleneck.webp)

*生成速度远超维护者的注意力。这种错配使得审核成为了真正的容量瓶颈。*

## 放大效应虽有价值，却非中立

Theocharis 的正面论点不是说模型里藏了一个专家，而是模型能打磨人已经提供的素材：头脑风暴替代方案、检查语法、试读一句话、充当橡皮鸭、或者站在对立面反驳。他区分了“造更多东西”和“花更多算力把更少的东西做好”，这是全文最有说服力的部分。

但我想在这里把说法收紧一点。“放大”这个词容易让人觉得模型只是把干净信号调大了音量。实际上它会夹带自己的默认倾向——用“常见答案”填补还没想清楚的决策，把不确定性抹平成自信，甚至让一个错误的前提看起来已经想通了。Theocharis 也注意到了这一点：他提到模型天生爱附和，并警告说，只有当用户自己知道什么是“好”的时候，这些工具才能真正派上用场。

对我来说，这改变了评估的重心。我不想问产出是否写得漂亮，或者代码能不能一次编译通过。我想问的是：哪些决策是人做的？有什么证据检验了结果？一个藏起来的错误代价会有多大？

![一位卡通创作者将粗糙的想法草图送入一台小型 AI 机器，并亲自挑选出一个经过打磨的结果](https://cdn.markhuang.ai/news/llm-output-cheap-trust-expensive/amplify-thinking.webp)

*模型可以倍增并优化选项，但人类仍需判断哪个选项值得成为最终作品。*

## 生产力证据解释了为何双方都觉得自己有理

公开证据并不支持对所有开发者和任务都适用的单一结论。METR 的[2025 年初随机研究](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)发现，16 名经验丰富的开源开发者在允许使用 AI 工具的情况下，完成 246 项任务的时间反而延长了 19%，尽管参与者相信工具让他们更快了。这是一个关于勿轻信主观速度感的有力警告。

但这并非永恒定论。METR 现在已将该结果标记为过时。在[2026 年 2 月的更新](https://metr.org/blog/2026-02-24-uplift-update/)中，研究人员表示新工具很可能带来了更多提速，但他们的下一次实验无法可靠地衡量提速幅度。最看重 AI 的开发者更不愿意参与或提交可能被分配到无 AI 条件下的任务，而并行代理也让时间核算变得更加困难。

这种测量难题与 Theocharis 的认知失调如出一辙。一个人可能在某些工作上更快，在熟悉代码上更慢，更愿意尝试被忽视的任务，并且做起来更愉快。单一的“生产力”数字压缩了这些效应，也忽略了当更快的作者给维护者带来更多审核工作时所产生的外部成本。

> **Info:**
>
> 我的实用法则：在正确性易于测试且失败后果可控的领域，最激进地使用模型。随着任务变得主观、陌生、不可逆或对他人维护成本高昂，逐步增加人工审核。

## Theocharis 的最佳模式让思考变得更小

文章中的工作流示例之所以有效，是因为它们抵制了无限产出。Theocharis 描述了一种“质问我”（grill me）提示，一次只问一个问题，直到问题被充分理解。在编码方面，他借鉴了 Basecamp 的提案结构，写下简短的问题描述、将要交付的内容以及不会交付的内容。他还会用全新的代理来挑一个方案的刺，直到它们再也找不到真正的缺陷为止。

我不会盲目照搬这套机制。多个代理可能会重复相同的假设，而对抗性提示也可能像顺从性提示制造赞美一样，流畅地捏造反对意见。但其底层逻辑是可靠的：

- 在生成开始前，让人类先承诺一个微小的问题陈述。
- 将决策与系统可检验的事实分离开来。
- 保持审核范围足够小，确保人类真的会去阅读。
- 要求一个可观察的检查点：测试、截图、解码输出，或其他任务特定的验收条件。
- 当证据支持结果时就停止，而不是等到文字听起来自信满满才停。

这听起来没有"AI 自主写软件"那么酷，但更接近一个我能信任的工作流。模型负责扩大搜索范围，人负责收窄结论。

![一位卡通工程师正在对一座外观精美的 AI 建造的桥梁模型进行压力测试，并发现了隐藏的脆弱节点，而一个机器人助手在一旁等待](https://cdn.markhuang.ai/news/llm-output-cheap-trust-expensive/verification-bill.webp)

*一份精致的结果只是一个候选方案，而非最终结论。验证才是让信心变得名副其实的关键环节。*

## 信任无法按需生成

Theocharis 为写作提出了一个个人测试标准：他是否愿意在观众面前大声朗读这些文字，而不用解释自己真正想表达的意思？我喜欢这一点，因为它让写作者重新承担了代价。标准不是检测器能不能识别出某种文体特征，而是一个有名有姓的人愿不愿意为每一句话负责。

对于开源项目，所有权需要更可见的证据：一个范围明确的变更、清晰的问题陈述、测试、必要时的截图、对审核的积极响应，以及一位能够解释权衡取舍的贡献者。这些都无法证明没有使用模型，但确实能让维护者更容易在真正需要的维度上评估贡献。

正如 Theocharis 所言，本地模型或许能减少对供应商的依赖，却无法解决这一社会层面的问题。开源权重无法告诉维护者提交者是否理解了补丁。廉价的 Token 也无法让读者在意。更多的对抗性代理也无法赋予作者尚未培养的品味。

## 我的最终结论

我同意 Theocharis 的观点，批评与重度使用可以共存。事实上，正是批评让严肃的使用成为可能。正确的姿态既非投降，也非禁欲，而是将生成视为充裕之物，将判断视为稀缺资源。

最大的错误是在有人支付验证账单之前，就把产出当作进展。模型可以帮助我探索更多选项、更清晰地表达想法，或完成一个范围明确的任务。但它无法借给我可信度。可信度依然只能通过缓慢积累获得：通过我理解的工作、他人可检验的检查，以及我愿意做出的修正。

LLM 让产出变得廉价。胜出的工作流将是那个拒绝让信任也随之廉价化的工作流。
