# 大模型展示推理过程，为何仍藏不住答案变化的真相？

**Summary:** 可见的思维链有助于监控，却未必忠实解释答案。当产品能保留可被他人审计的证据、备选方案和状态变更时，我才更愿意信任其推理能力。

- Canonical: https://markhuang.ai/zh/news/llm-shows-work-hides-answer-cause
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-10-02
- Section: News
- Tags: 大模型推理, 思维链, AI可靠性, AlphaGo, AI审计
- Source: [MIT Technology Review](https://www.technologyreview.com/2026/10/02/1145639/dont-be-fooled-llms-dont-reason/)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![围棋棋盘连接一串类似 token 的方块，通向一个透明的备选方案评估树](https://cdn.markhuang.ai/news/llm-shows-work-hides-answer-cause/hero.webp)

*流畅的输出看着像深思熟虑。但真正可审计的系统，还会留下答案背后的备选方案、证据和修改痕迹。*

在[《麻省理工科技评论》的一篇评论文章](https://www.technologyreview.com/2026/10/02/1145639/dont-be-fooled-llms-dont-reason/)中，前 DeepMind 研究员 Thore Graepel 指出，如今的大语言模型并不像 AlphaGo 那样进行推理。他的区分很具体：大语言模型始终在预测下一个 token，哪怕生成的思维链很长；而 AlphaGo 把神经网络和显式的搜索过程绑在一起，能评估各种可能的未来局面。

Graepel 以 AlphaGo 2016 年对阵李世石的比赛为例。第二局的第 37 手棋看起来极不可能，AlphaGo 的策略网络认为人类专家下出这步的概率大约只有万分之一。但搜索改变了决定。AlphaGo 探索了超出直觉范围的分支，下出了第 37 手，并最终以 4:1 赢得五局比赛。

我的看法没有标题那么绝对。在决定是否信任一个基于大模型的产品前，我不必先解决“大模型是否真的会推理”这个问题。我需要知道的是：系统是否保留了改变答案的关键因素、它拒绝了哪些备选方案，以及有什么证据可以证明结果是错的。流畅的解释很有用，但它不是审计轨迹。

## 缺的是可检查的工作状态

Graepel 指出了三个问题。现在的聊天机器人通常没有持久、可检查的记录来追踪它们的假设和不确定性。存储的知识和处理这些知识的过程混在一起，分不清楚。写出来的思维链甚至可能是事后编的解释，而不是答案生成过程的真实记录。

最后一个问题有直接的实验证据支持。在[Anthropic 2025 年的思维链研究](https://www.anthropic.com/research/reasoning-models-dont-say-think)中，研究人员在问题中插入提示，然后检查 Claude 3.7 Sonnet 和 DeepSeek R1 是否披露使用了这些提示。在测试的各类提示中，Claude 有 25% 的几率提及提示，R1 有 39% 的几率提及，即便研究人员已确认这些提示确实影响了答案。该研究使用了人工设计的多项选择题环境，Anthropic 也明确说明了这一点。但它仍然揭示了一种产品设计者无法忽视的失效模式：展示工作过程并不保证展示原因。

OpenAI 后续的[可监控性研究](https://openai.com/index/evaluating-chain-of-thought-monitorability/)提供了重要的平衡视角。在 13 项评估和 24 种环境中，监控思维链的表现优于仅监控动作和最终输出。更长的推理轨迹通常更容易监控。OpenAI 也警告说，随着训练方法、数据和规模的变化，这种可见性可能很脆弱。

所以我会保留推理轨迹，但不会把它当成唯一可信来源。它只是众多信号中的一个——信号不需要完整，也能告诉你有用的东西。

## AlphaGo 的对比让产品测试标准更清楚了

最初的[《自然》杂志 AlphaGo 论文](https://www.nature.com/articles/nature16961)描述了选择走法的策略网络、评估局面的价值网络，以及将这些网络与蒙特卡洛模拟结合的搜索算法。搜索树让程序有了可以具体操作的东西——一个分支可以被探索、比较，然后放弃。

开放世界的工作更混乱。医学问题、工程事故或研究假设没有完整的棋盘，也没有固定的合法走法列表。Graepel 承认这一点。他提议建立一个明确的认知状态，记录系统将哪些信息视为已确定、存疑、已排除或仍开放，并由一个独立组件检查每次更新是否减少了不确定性且有证据支持。

我喜欢这个提议，因为它把关于机器心智的争论转化成了产品需求。一个系统不是靠打印更长的独白来赢得信任。当它能展示持久状态、引用变更背后的证据、运行外部检查，并保留足够历史供他人复现决策时，它才配拥有更大的决策边界。

> **Info:**
>
> 如果是重大决策，我希望系统交出四样东西：答案本身、用到的证据、过程中发生过的状态变更，以及尝试证伪它的检验。

## “推理”仍是一个有争议的标签

对 Graepel 标题最有力的反驳是：他在用自己偏好的架构来定义"推理"。如果一个模型能整合事实、解决新问题、纠正中间错误、选出有用的行动，一部分研究者和开发者就会管这叫推理——不管底层机制是不是像 AlphaGo 的树搜索。

这种定义分歧在[Hacker News 关于大模型推理的讨论](https://news.ycombinator.com/item?id=41421591)里一目了然。一方要求形式化操作和显式搜索，另一方反问：系统行为明明通过了任务测试，凭什么说它不会推理？聊着聊着就跑偏到猫、人脑、一阶逻辑，以及同一个词到底该怎么定义。

我觉得行为层面的反驳有道理。单凭架构不能抹杀已经展示出来的能力，但跑通了 benchmark 也不等于出了问题能查清楚。“模型进行了推理”——这算什么事故报告？它没告诉我哪些证据进了系统，工具返回的结果有没有改变结论，被否掉的假设为什么一直没能翻案。

## 提高赌注之前，我会要求什么

我不会等待一个哲学上纯粹的推理机器。我会围绕现有模型构建缺失的审计层。

- 将来源和工具输出与模型生成的文本分开记录，并附上时间戳和出处。
- 将开放问题和竞争性假设表示为运行后仍可检查的状态。
- 对具有确定性测试的声明（如计算、代码执行、数据库约束或策略规则）要求外部检查。
- 记录系统改变路线的原因，然后通过可观察的行为验证该解释，而不是仅凭解释本身就相信它。
- 当错误答案代价高昂或难以逆转时，保留人工审批点和回滚路径。

这延续了我之前关于[把 AI 目标转向所有权](https://markhuang.ai/news/ai-goalpost-is-ownership)的观点。拍板的人需要的不是一段打磨好的说辞，而是能撑过模型会话的证据——会话结束后还能拿出来看的那种，外加一个允许你提出质疑的系统。

## 我会优先考虑可审计性，而非形而上学

Graepel 说得对：单纯扩大 token 预测器并让它多说话，并不会自动产生 AlphaGo 那样的显式搜索树。他也说得对：医学、工程和科学需要的不只是令人信服的叙述。但“大模型完全不会推理”这一说法更难证明，因为“推理”在这些争论中并没有统一的操作定义。

这种不确定性并不妨碍决策。我会把思维链当作有用的遥测数据，而不是逐字逐句的实录。系统如果能留下可检查的证据、备选方案和判断变化的痕迹，我会更信任它。厂商想管自己的模型叫"推理引擎"，随便。但请告诉我，是什么改变了它的答案。
