# 多 AI 论

**Summary:** LLM 会在超过 90% 的情况下确认自己的答案，对自身错误还有 64.5% 的盲区率。跨模型家族的多 AI 流水线，让 Claude 评审 GPT、GPT 评审 Qwen，能打破自我评审的天花板。本文讨论研究、成本和真正有效的做法。

- Canonical: https://markhuang.ai/zh/blog/the-multi-ai-thesis
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-03-01
- Section: AI 与 LLM
- Tags: 多 AI, AI 模型, 代码质量, 群体智能, AI 编码
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

每个 AI 模型都有盲区。2025 年有个 benchmark 给出了具体数字：LLM 平均盲点率高达 64.5%。它们几乎没法纠正自己输出里的错误——但同样的错误如果换个马甲，伪装成"别人写的"，反而能一眼看出来。GPT-4 在 chain-of-thought trace 里只能定位 52.9% 的推理错误，哪怕是特别直白的错误也会漏掉。

这个问题不是下个版本发个 patch 就能解决的，它是结构性的。你用一个 AI 写代码，再让同一个 AI 来 review，你的 review 流程说白了就是在走过场。

![多 AI 论](https://cdn.markhuang.ai/blog/the-multi-ai-thesis/hero.webp)

*多 AI 论*

## Self-Review 的困境

2025 年一项覆盖 14 个开源模型的研究发现，LLM 没法可靠地发现自己输出里的错误，但如果同样的内容被包装成"别人写的"，它就能发现。研究者把原因追溯到 training data：普通 instruction dataset 里，self-correction 标记大约每 100 句才出现一次；而 reasoning model 的 dataset 里则有 30 到 170 次。模型见过的"纠正自己"的例子实在太少了。

还有一个问题是 self-preference bias。模型对自己生成的输出会给出更低的 perplexity（也就是更高的熟悉度），并且系统性地给出更高评分。RLHF 训练更是火上浇油——它奖励的是自信的回答，而不是准确的回答。但有意思的是，如果把同样的内容放到一个全新的 context 里，让模型不知道这是自己生成的，错误检测能力会显著提升。研究者把这个现象叫做"clean room 效应"。

来自*同一个*模型的 second opinion，根本算不上真正的 second opinion。模型认得出自己的 pattern，然后选择确认它们。

## 同一家族不算 Multi-AI

这里我得把边界划清楚：让 Claude Sonnet 和 Claude Opus 处理同一个任务，并不构成我说的 multi-AI review。它们共享 training data、architectural assumptions，当然也共享 blind spots。

echo chamber 研究支持这个判断。2025 年一项 multi-agent debate 研究发现，当 agent 共享同一个 model 和 training data 时，debate 不是纠错，而是"把对错误答案的信心越推越高"。论文给这个现象起了个名字叫"belief entrenchment"——agent 们互相强化共同的错误，而不是抓住错误。这种从众倾向是 training 里自带的。当一个 Claude 实例说某件事是对的，另一个 Claude 实例天然就倾向于同意，因为它们从同样的数据里学到的东西。

![同家族回音室](https://cdn.markhuang.ai/blog/the-multi-ai-thesis/echo-chamber.zh-CN.webp)

*同家族回音室*

另一项 multi-agent system 研究找到了两个根本原因：相同 training data 带来的 biased static initial beliefs，以及 homogenized debate dynamics——不管多数派对不对，都会把它的声音越放越大。

所以我说 multi-AI 的时候，特指的是*跨 series*。Claude review GPT，GPT review Qwen。不同的 training corpus，不同的 architectural assumptions，blind spots 重叠的概率就小得多了。

## 研究证明了什么，我又在推断什么

现有研究已经非常有力地说明，multi-agent system 在很多场景下优于 single agent。但它还没有直接证明跨 series review 一定比同 series 多 agent 搭建更强。后半句是我的推断——不过 echo chamber 研究让这个推断相当有底气。

Blueprint2Code（2025）搭了一个四 agent 代码生成 pipeline（Previewing、Blueprint、Coding、Debugging），在 HumanEval 上跑出了 96.3% 的 pass\@1。单 model 直接生成是 84.7%。去掉任何一个 agent，性能都会掉 14.8% 到 28.9%。其中 Debugging Agent 最关键：拿掉它，准确率直接从 93.5% 崩到 64.6%。

Anthropic 自己的 multi-agent 研究系统（Opus 4 主导、Sonnet 4 做 sub-agent，注意这是同 family）比 single-agent Opus 4 高出 90.2%。token 使用量解释了 80% 的性能差异。同 family 的 multi-agent 已经碾压 single agent 了。我的论点是跨 series 应该还能更进一步，因为你干掉了同 family 搭建里依然存在的共享 blind spots。

Model Swarms（ICML 2025）把 particle swarm optimization 用到 LLM 专家上，发现 56.9% 的最佳最终 model 来自初始池的*后半段*。换句话说，那些看起来弱的 model 有隐藏能力，只有在协作搜索中才会浮出水面。人工评审 70.8% 的时间更偏好 swarm 输出而不是单个专家输出。

![多 AI 流水线示意图](https://cdn.markhuang.ai/blog/the-multi-ai-thesis/pipeline.zh-CN.webp)

*多 AI 流水线示意图*

安全方面同样不乐观：Veracode 2025 测了 100 多个 LLM，发现 45% 的 AI 生成代码包含安全缺陷。AI 代码的 XSS 漏洞是人类代码的 2.74 倍，insecure object reference 是 1.91 倍。RepoAudit 这种 multi-agent 审计系统在真实项目里检测 defect 的 precision 达到 78.43%。

## 成本是实打实的

Multi-AI 不是免费午餐。

Multi-agent system 消耗的 token 大约是单次 chat 交互的 15 倍。算上 agent 之间的通信、retrieval 开销和 logging，实际成本乘数大概在 3 到 4 倍。有家电商公司上了 multi-agent workflow 之后，月度 LLM 成本从 1,200 美元直接飙到 4,800 美元。Single agent 没有协调开销，响应速度也要快 30% 到 50%。

行业调查显示大家对 multi-agent system 兴趣很大，但要从 pilot 推到 production 是另一回事。tool calling 准确率、coordination 复杂度、state synchronization——生产环境里的问题都是硬骨头。大多数尝试 multi-agent workflow 的组织，很难迈过试点这个阶段。

Gartner 报告说，从 2024 Q1 到 2025 Q2，关于 multi-agent system 的咨询量暴涨了 1,445%。需求是在那儿的。能不能 scale 起来跑，就是另一码事了。

## 什么时候 Single AI 才是正确选择

对于窄领域、定义清晰、training data 覆盖充分的任务，single-model workflow 往往更合适。快速原型也是一样：你要的是速度而不是完美。成本敏感的项目如果扛不住 3 到 4 倍的 token 乘数，也不该硬上 multi-AI。

Microsoft 的 decision framework 建议：当领域很窄、time-to-market 优先、或者 architecture 选型还不明朗的时候，先从 single agent 开始。用一个 model 做原型，等任务的风险等级到了值得花这个钱的时候，再引入跨 series review。

2025 年 5 月有篇论文说了句大实话："随着 LLM 能力提升，multi-agent system 相对 single-agent system 的收益会递减。"单个 model 越强，两者的差距就越小。他们提出的 hybrid 方案先用 single agent，只在必要时才 cascade 到 multi-agent——对比 pure single-agent 或 pure multi-agent，带来 1.1% 到 12% 的准确率提升，同时最多降低 20% 成本。

## 我自己怎么做的

实操层面，任何重要的任务我都会用跨 series review。[Dev Buddy](https://github.com/Z-M-Huang/vcp) 是我做的一个 Claude Code 插件，它让代码跑过多阶段 pipeline，不同阶段可以用不同的 provider。Claude 负责实现，Codex 做最终的 review gate，MiniMax 或 Qwen 提供独立视角。task dependency 让 pipeline 不可能跳过任何阶段，所以 review 步骤不会被悄悄省掉。

我在做的 [OpenHive](https://github.com/Z-M-Huang/openhive.wiki/wiki) 走得更远：不同 provider 的 AI agent 组成 hierarchical team，每个 agent 跑在隔离容器里。team lead 负责拆解任务并 route 给 specialist。你可以在同一个 team 里混用 Claude、GPT、Qwen。

## 核心论点

Single-AI workflow 是有天花板的。model 会确认自己的 assumption，漏掉自己的 blind spot，还会因为对自己的 pattern 太熟悉而高估自己的输出。

跨 series multi-AI 把这个天花板往上抬了。不同的 training data 意味着不同的 assumption，不同的 architecture 意味着不同的 failure mode。一个 model 漏掉的东西，另一个 model 更有可能抓住。

它更贵，编排也更难。但只要 correctness 重要，这笔投入就值。59% 的开发者已经在并行使用三个或更多 AI 工具了。行业正在往这个方向走，不管我们有没有一套完整的理论来解释它。

> **Tip:**
>
> 这篇文章是*跨 Series Multi-AI：一种新的思考方式*系列的基础论点。这个六章系列会把它展开成一个完整框架。可以从 [第 1 章：为什么一个 AI 永远不够](/blog/cross-family-multi-ai-why-one-ai-is-never-enough) 开始读起。

> **Info:**
>
> 本文引用的研究来源：[Self-Correction Bench (arXiv:2507.02778)](https://arxiv.org/abs/2507.02778), [LLMs Cannot Find Reasoning Errors (ACL 2024)](https://arxiv.org/abs/2311.08516), [RepoAudit (arXiv:2501.18160)](https://arxiv.org/abs/2501.18160), [Blueprint2Code (Frontiers in AI)](https://www.frontiersin.org/journals/artificial-intelligence/articles/10.3389/frai.2025.1660912/full), [Anthropic Multi-Agent Research](https://www.anthropic.com/engineering/multi-agent-research-system), [Model Swarms (ICML 2025)](https://arxiv.org/abs/2410.11163), [Belief Entrenchment in MAD (arXiv:2503.16814)](https://arxiv.org/abs/2503.16814), [FREE-MAD (arXiv:2509.11035)](https://arxiv.org/abs/2509.11035), [CodeRabbit AI vs Human Code Report](https://www.coderabbit.ai/blog/state-of-ai-vs-human-code-generation-report), [Veracode 2025 GenAI Code Security Report](https://www.veracode.com/resources/analyst-reports/2025-genai-code-security-report/), [Qodo State of AI Code Quality](https://www.qodo.ai/reports/state-of-ai-code-quality/), [Gartner Multiagent Systems](https://www.gartner.com/en/articles/multiagent-systems), [MAS vs SAS (arXiv:2505.18286)](https://arxiv.org/abs/2505.18286).
