# 集成智能背后的科学

**Summary:** 群体智慧遇上 AI：多样化 LLM 集成超过 67% 的单一模型，F1 分数从 0.55 提升到 0.80 以上，而 56.9% 的最佳方案来自最弱模型。跨模型家族多 AI 系列第二章。

- Canonical: https://markhuang.ai/zh/blog/cross-family-multi-ai-science-of-ensemble-intelligence
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-03-04
- Section: AI 与 LLM
- Tags: 多 AI, 集成学习, 跨模型家族, AI 研究, 群体智能
- License: https://creativecommons.org/licenses/by-nc-sa/4.0/

---

> **Tip:**
>
> 这是*跨家族多 AI：一种全新的思维方式*系列的**第二章**。上一篇：[第一章：为什么一个 AI 永远不够用](/blog/cross-family-multi-ai-why-one-ai-is-never-enough)。下一篇：[第三章：来自行业的证据](/blog/cross-family-multi-ai-industry-evidence)。

> **Info:**
>
> **系列目录：** [总论](/blog/the-multi-ai-thesis) · [第一章：为什么一个 AI 永远不够用](/blog/cross-family-multi-ai-why-one-ai-is-never-enough) · **第二章：Ensemble Intelligence 背后的科学** · [第三章：来自行业的证据](/blog/cross-family-multi-ai-industry-evidence) · [第四章：单一化风险](/blog/cross-family-multi-ai-monoculture-risk) · [第五章：成本这笔账](/blog/cross-family-multi-ai-cost-analysis) · [第六章：接下来的路](/blog/cross-family-multi-ai-road-ahead)

"三个臭皮匠，顶个诸葛亮"——这话一点都不新鲜。群体决策优于个人决策，这是决策科学里最古老的结论之一。真正新鲜的是：这个规律放到 AI 模型身上同样成立，而起作用的关键因素跟几千年前一模一样——多样性。

## 群体智慧

2004 年，James Surowiecki 写了 *The Wisdom of Crowds*，把集体判断能发挥作用的三个条件讲得很清楚：意见要多样、判断要独立、决策要分散。只要满足这三个条件，群体的表现就能稳定地超过单个专家——甚至超过群体里最强的那个专家。

这个结论在预测市场、群体估算、集体决策等大量研究中被反复验证。背后的数学其实很简单：对多样化的独立估计取平均，个体误差会互相抵消。误差之间越不相关，抵消得越彻底。这套逻辑比 AI 早，比计算机早，本质上就是统计学。

重点在于"不相关"这三个字。如果一群人的偏差都朝同一个方向走，群体智慧就直接失效。所有估计都往一边偏的话，取平均只会给你一个"信心满满但错得离谱"的答案。独立性和多样性不是 ensemble 的锦上添花，而是它真正起作用的机制。

这对 AI 的启示是什么？"多个模型到底有没有用"根本不是正确的问题。该问的是："在什么条件下有用，什么条件下反而帮倒忙？"

## 硅基群体的智慧

2024 年有一篇论文叫 "The Wisdom of the Silicon Crowd"，专门验证了 Surowiecki 的条件在 LLM 上是否成立。研究者用中位数聚合多个 LLM 的确定性输出，结果发现集体答案超过了 67% 的单个模型。如果给模型提供相关上下文，这个数字能到 75%。

![单模型与 ensemble 的 F1 分数对比](https://cdn.markhuang.ai/blog/cross-family-multi-ai-science-of-ensemble-intelligence/single-vs-ensemble.zh-CN.webp)

*单模型 vs. ensemble 的 F1 分数*

最关键的发现是：模型的多样性比模型本身的质量更重要。一群"中等生"组队，能打赢一个"尖子生"。这跟 Surowiecki 提出的条件完美对应。

2025 年一项内容分类研究把差距量化得更直观：最好的单模型 F1 只有 0.55，两个模型组 ensemble 就到了 0.73——只多加了一个模型，提升 33%。5 到 10 个模型的 ensemble 能打到 0.80 到 0.90。收益确实递减，但前两三个 diverse model 带来的提升非常可观。

这里要说一句：这些 F1 数字来自行业和 preprint 的内容分类研究，不是 peer-reviewed 期刊论文。方向性结论——ensemble 稳定碾压单模型——是站得住的，但具体数字更适合当作模式参考，而不是权威 benchmark。

医学 QA 领域也是同样的结论。LLM ensemble 在 MedMCQA 医学入学考试数据集上用加权投票和动态模型选择，比最佳单模型高了 5.98%。在医学场景里，85% 和 91% 的准确率差距，可能就是"诊断正确"和"漏诊"之间的距离。

## 为什么跨家族多样性最关键

同家族模型组 ensemble 确实比单模型好，数据很清楚。但它会撞天花板，而跨家族 ensemble 理论上能突破这个天花板。

[多 AI 总论](/blog/the-multi-ai-thesis)里提到过"回音室"研究，原因就出在这里。2025 年一项 multi-agent debate 研究发现，当 agent 共享同一个模型和训练数据时，辩论不是在纠正错误，而是在"放大对错误答案的信心"。研究者管这叫"belief entrenchment"——信念固化。另一项研究挖出了两个根因：一是共享训练数据导致的有偏静态初始信念，二是同质化的辩论动态会无脑放大多数派观点，不管它对不对。

![不同模型家族之间的盲点](https://cdn.markhuang.ai/blog/cross-family-multi-ai-science-of-ensemble-intelligence/blind-spot-venn.zh-CN.webp)

*不同模型家族之间的盲点*

说到这里，我要坦诚：我的论证从已有证据过渡到了推论。回音室研究已经证明同家族 ensemble 会共享盲点。跨家族多样性能够*缓解*这个问题，是一个逻辑上的自然延伸——不同的训练语料应该产生不同的系统性错误，不同的 architecture 应该产生不同的处理策略——但目前没有 head-to-head 的对比实验直接验证过这一点。我认为这个推论是强的，但它终究还是推论。

2025 年一篇研究从信息论角度也支撑了这个思路：不要无脑选分数最高的模型。最优的 ensemble 选择取决于互补性，而不是单模型排名。两个犯不同错误的模型，比两个各自分数更高但犯同样错误的模型，放在一起更有价值。

Blueprint2Code（2025）搭了一个四 agent 的代码生成 pipeline（预览、蓝图、编码、调试），在 HumanEval 上跑到 96.3% pass\@1。单模型直接生成只有 84.7%。拿掉任何一个 agent，性能下降 14.8% 到 28.9%。其中调试 agent 最关键：去掉它，准确率从 93.5% 直接掉到 64.6%。即便是同家族的多 agent pipeline，也已经大幅碾压单 agent 了。

Anthropic 自己的 multi-agent 研究系统，用 Opus 4 做主导、Sonnet 4 做子 agent（注意，这是同家族的），比单 agent Opus 4 高出 90.2%。Token 用量解释了 80% 的性能方差。同家族 multi-agent 已经赢了单 agent 一大截。我的论点是：跨家族应该还能更进一步，因为它干掉了同家族方案里那些共享的盲点。

## Model Swarms：弱模型也有春天

Model Swarms 发在 ICML 2025 的 PMLR 论文集里，把粒子群优化（PSO）用到了 LLM ensemble 上，发现了一个很反直觉的结果。

![最佳解来自哪里](https://cdn.markhuang.ai/blog/cross-family-multi-ai-science-of-ensemble-intelligence/model-swarms.zh-CN.webp)

*最佳解来自哪里*

56.9% 的最终最优解，来自初始池里排名*后一半*的模型。不是那些 top performer，而是看起来比较弱的模型。它们有 latent capability，单独跑 benchmark 的时候看不出来，只有通过协作优化才能被激发出来。人工评估中，swarm 的输出有 70.8% 的概率被偏好于单个专家的输出。

所以你不一定要挑"最强"的模型，而是要挑最互补的组合。一个单独跑分平平的模型，可能恰好能提供某种视角，去抓住那些 top model 系统性忽略的错误。

这跟我自己做 [Dev Buddy](https://github.com/Z-M-Huang/vcp) 的体验完全一致。MiniMax、Qwen 这些我不会拿来当主力的模型，有时候反而能抓到 Claude 和 GPT 都漏掉的问题。它们在通用 benchmark 上的"弱"，到了 code review 场景里变成了优势——因为不同的训练产生了不同的失败模式。

## 人机混合集体

PNAS 上有一篇关于人机混合集体的研究，结论很有意思：医生搭配多个 LLM 做鉴别诊断，表现超过了纯人类团队、纯 AI 团队、以及任何单个专家。

这不是说用一堆 AI 来取代人类。重点是构建正确的集体：多样化的模型加上人类的判断力。人类提供的是上下文理解和伦理推理，模型提供的是模式识别的广度和输出的一致性。合在一起，比任何一方单干都强。

![不同方案的准确率对比](https://cdn.markhuang.ai/blog/cross-family-multi-ai-science-of-ensemble-intelligence/accuracy-matrix.zh-CN.webp)

*不同方案的准确率对比*

最优配置不是"模型越多越好"，也不是"模型越强越好"，而是针对具体问题，找到人类和 AI 之间最合适的多样视角组合。Surowiecki 的条件在这里同样成立。一旦你违反了这些条件——比如只用同一家族的模型，或者让一个模型的输出压制其他模型——你得到的就不是群体智慧，而是 belief entrenchment。

## Ensemble 科学告诉了我们什么

研究指向一个一致的结论：多样化、独立的视角，比单个专家更能产出好结果。背后的机制是 error decorrelation——让错误互不相关，从而互相抵消。这个规律适用于人类群体、AI 模型 ensemble，也适用于人机混合集体。

跨家族多 AI 的思路，就是把训练数据和 architecture 差异最大的模型组合在一起，让多样性最大化。研究已经证明了 ensemble 能打败个体，也证明了多样性是 ensemble 起作用的核心。至于跨家族多样性是否真的优于同家族多样性，目前还是推论，还没有被直接测量。但它从已知机制中自然推导出来。

这套逻辑在真实行业、真实风险下能不能站住脚？这是[第三章](/blog/cross-family-multi-ai-industry-evidence)要回答的问题。

> **Info:**
>
> 研究来源：[The Wisdom of the Silicon Crowd (2024)](https://arxiv.org/abs/2402.19379), [Blueprint2Code (Frontiers in AI)](https://www.frontiersin.org/journals/artificial-intelligence/articles/10.3389/frai.2025.1660912/full), [Anthropic Multi-Agent Research](https://www.anthropic.com/engineering/multi-agent-research-system), [Model Swarms (ICML 2025)](https://arxiv.org/abs/2410.11163), [Belief Entrenchment in MAD (arXiv:2503.16814)](https://arxiv.org/abs/2503.16814), [FREE-MAD (arXiv:2509.11035)](https://arxiv.org/abs/2509.11035), [LLM Ensemble Medical QA (PMC)](https://pmc.ncbi.nlm.nih.gov/articles/PMC10775333/), [Content Categorization Ensembles (arXiv:2511.15714)](https://arxiv.org/abs/2511.15714), [PNAS Human-AI Hybrid Collectives](https://doi.org/10.1073/pnas.2408414122).

> **Tip:**
>
> **系列导航：** [← 第一章：为什么一个 AI 永远不够用](/blog/cross-family-multi-ai-why-one-ai-is-never-enough) | **第二章** | [第三章：来自行业的证据 →](/blog/cross-family-multi-ai-industry-evidence)

> **Info:**
>
> Mark Huang 创作的*跨家族多 AI*采用 [CC BY-NC-SA 4.0](https://creativecommons.org/licenses/by-nc-sa/4.0/) 许可。
