多 AI 论
LLM 会在超过 90% 的情况下确认自己的答案,对自身错误还有 64.5% 的盲区率。跨模型家族的多 AI 流水线,让 Claude 评审 GPT、GPT 评审 Qwen,能打破自我评审的天花板。本文讨论研究、成本和真正有效的做法。
AI 驱动 · 每小时限 20 次请求
每个 AI 模型都有盲区。2025 年有个 benchmark 给出了具体数字:LLM 平均盲点率高达 64.5%。它们几乎没法纠正自己输出里的错误——但同样的错误如果换个马甲,伪装成"别人写的",反而能一眼看出来。GPT-4 在 chain-of-thought trace 里只能定位 52.9% 的推理错误,哪怕是特别直白的错误也会漏掉。
这个问题不是下个版本发个 patch 就能解决的,它是结构性的。你用一个 AI 写代码,再让同一个 AI 来 review,你的 review 流程说白了就是在走过场。

Self-Review 的困境
2025 年一项覆盖 14 个开源模型的研究发现,LLM 没法可靠地发现自己输出里的错误,但如果同样的内容被包装成"别人写的",它就能发现。研究者把原因追溯到 training data:普通 instruction dataset 里,self-correction 标记大约每 100 句才出现一次;而 reasoning model 的 dataset 里则有 30 到 170 次。模型见过的"纠正自己"的例子实在太少了。
还有一个问题是 self-preference bias。模型对自己生成的输出会给出更低的 perplexity(也就是更高的熟悉度),并且系统性地给出更高评分。RLHF 训练更是火上浇油——它奖励的是自信的回答,而不是准确的回答。但有意思的是,如果把同样的内容放到一个全新的 context 里,让模型不知道这是自己生成的,错误检测能力会显著提升。研究者把这个现象叫做"clean room 效应"。
来自同一个模型的 second opinion,根本算不上真正的 second opinion。模型认得出自己的 pattern,然后选择确认它们。
同一家族不算 Multi-AI
这里我得把边界划清楚:让 Claude Sonnet 和 Claude Opus 处理同一个任务,并不构成我说的 multi-AI review。它们共享 training data、architectural assumptions,当然也共享 blind spots。
echo chamber 研究支持这个判断。2025 年一项 multi-agent debate 研究发现,当 agent 共享同一个 model 和 training data 时,debate 不是纠错,而是"把对错误答案的信心越推越高"。论文给这个现象起了个名字叫"belief entrenchment"——agent 们互相强化共同的错误,而不是抓住错误。这种从众倾向是 training 里自带的。当一个 Claude 实例说某件事是对的,另一个 Claude 实例天然就倾向于同意,因为它们从同样的数据里学到的东西。

另一项 multi-agent system 研究找到了两个根本原因:相同 training data 带来的 biased static initial beliefs,以及 homogenized debate dynamics——不管多数派对不对,都会把它的声音越放越大。
所以我说 multi-AI 的时候,特指的是跨 series。Claude review GPT,GPT review Qwen。不同的 training corpus,不同的 architectural assumptions,blind spots 重叠的概率就小得多了。
研究证明了什么,我又在推断什么
现有研究已经非常有力地说明,multi-agent system 在很多场景下优于 single agent。但它还没有直接证明跨 series review 一定比同 series 多 agent 搭建更强。后半句是我的推断——不过 echo chamber 研究让这个推断相当有底气。
Blueprint2Code(2025)搭了一个四 agent 代码生成 pipeline(Previewing、Blueprint、Coding、Debugging),在 HumanEval 上跑出了 96.3% 的 pass@1。单 model 直接生成是 84.7%。去掉任何一个 agent,性能都会掉 14.8% 到 28.9%。其中 Debugging Agent 最关键:拿掉它,准确率直接从 93.5% 崩到 64.6%。
Anthropic 自己的 multi-agent 研究系统(Opus 4 主导、Sonnet 4 做 sub-agent,注意这是同 family)比 single-agent Opus 4 高出 90.2%。token 使用量解释了 80% 的性能差异。同 family 的 multi-agent 已经碾压 single agent 了。我的论点是跨 series 应该还能更进一步,因为你干掉了同 family 搭建里依然存在的共享 blind spots。
Model Swarms(ICML 2025)把 particle swarm optimization 用到 LLM 专家上,发现 56.9% 的最佳最终 model 来自初始池的后半段。换句话说,那些看起来弱的 model 有隐藏能力,只有在协作搜索中才会浮出水面。人工评审 70.8% 的时间更偏好 swarm 输出而不是单个专家输出。

安全方面同样不乐观:Veracode 2025 测了 100 多个 LLM,发现 45% 的 AI 生成代码包含安全缺陷。AI 代码的 XSS 漏洞是人类代码的 2.74 倍,insecure object reference 是 1.91 倍。RepoAudit 这种 multi-agent 审计系统在真实项目里检测 defect 的 precision 达到 78.43%。
成本是实打实的
Multi-AI 不是免费午餐。
Multi-agent system 消耗的 token 大约是单次 chat 交互的 15 倍。算上 agent 之间的通信、retrieval 开销和 logging,实际成本乘数大概在 3 到 4 倍。有家电商公司上了 multi-agent workflow 之后,月度 LLM 成本从 1,200 美元直接飙到 4,800 美元。Single agent 没有协调开销,响应速度也要快 30% 到 50%。
行业调查显示大家对 multi-agent system 兴趣很大,但要从 pilot 推到 production 是另一回事。tool calling 准确率、coordination 复杂度、state synchronization——生产环境里的问题都是硬骨头。大多数尝试 multi-agent workflow 的组织,很难迈过试点这个阶段。
Gartner 报告说,从 2024 Q1 到 2025 Q2,关于 multi-agent system 的咨询量暴涨了 1,445%。需求是在那儿的。能不能 scale 起来跑,就是另一码事了。
什么时候 Single AI 才是正确选择
对于窄领域、定义清晰、training data 覆盖充分的任务,single-model workflow 往往更合适。快速原型也是一样:你要的是速度而不是完美。成本敏感的项目如果扛不住 3 到 4 倍的 token 乘数,也不该硬上 multi-AI。
Microsoft 的 decision framework 建议:当领域很窄、time-to-market 优先、或者 architecture 选型还不明朗的时候,先从 single agent 开始。用一个 model 做原型,等任务的风险等级到了值得花这个钱的时候,再引入跨 series review。
2025 年 5 月有篇论文说了句大实话:"随着 LLM 能力提升,multi-agent system 相对 single-agent system 的收益会递减。"单个 model 越强,两者的差距就越小。他们提出的 hybrid 方案先用 single agent,只在必要时才 cascade 到 multi-agent——对比 pure single-agent 或 pure multi-agent,带来 1.1% 到 12% 的准确率提升,同时最多降低 20% 成本。
我自己怎么做的
实操层面,任何重要的任务我都会用跨 series review。Dev Buddy 是我做的一个 Claude Code 插件,它让代码跑过多阶段 pipeline,不同阶段可以用不同的 provider。Claude 负责实现,Codex 做最终的 review gate,MiniMax 或 Qwen 提供独立视角。task dependency 让 pipeline 不可能跳过任何阶段,所以 review 步骤不会被悄悄省掉。
我在做的 OpenHive 走得更远:不同 provider 的 AI agent 组成 hierarchical team,每个 agent 跑在隔离容器里。team lead 负责拆解任务并 route 给 specialist。你可以在同一个 team 里混用 Claude、GPT、Qwen。
核心论点
Single-AI workflow 是有天花板的。model 会确认自己的 assumption,漏掉自己的 blind spot,还会因为对自己的 pattern 太熟悉而高估自己的输出。
跨 series multi-AI 把这个天花板往上抬了。不同的 training data 意味着不同的 assumption,不同的 architecture 意味着不同的 failure mode。一个 model 漏掉的东西,另一个 model 更有可能抓住。
它更贵,编排也更难。但只要 correctness 重要,这笔投入就值。59% 的开发者已经在并行使用三个或更多 AI 工具了。行业正在往这个方向走,不管我们有没有一套完整的理论来解释它。
许可
Article text © 2026 Mark Huang. Licensed under Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0) unless otherwise noted. 文章文本可在非商业场景下分享或翻译,但需标注原文 URL。商业使用需事先取得书面许可,并清楚引用原始来源。
代码片段、截图、第三方素材和网站源码可能适用单独条款。
建议署名: Based on "多 AI 论" by Mark Huang, originally published at https://markhuang.ai/zh/blog/the-multi-ai-thesis.
相关文章

你不觉得你的 AI 太乐观了吗?
RLHF 可能奖励迎合而不是准确,把 AI 变成裹着糖衣的子弹:看似认可,实则隐藏失败模式。本文讨论持续的对抗性规则如何把默认行为从奉承改成诚实质疑。
阅读文章
为什么一个 AI 永远不够
医学、法律、科学和金融等高风险行业都要求独立复核,AI 却常常跳过这一步。37% 的企业已经使用 5 个以上模型,但多数仍是临时拼接。跨模型家族多 AI 系列第一章。
阅读文章
集成智能背后的科学
群体智慧遇上 AI:多样化 LLM 集成超过 67% 的单一模型,F1 分数从 0.55 提升到 0.80 以上,而 56.9% 的最佳方案来自最弱模型。跨模型家族多 AI 系列第二章。
阅读文章