集成智能背后的科学
群体智慧遇上 AI:多样化 LLM 集成超过 67% 的单一模型,F1 分数从 0.55 提升到 0.80 以上,而 56.9% 的最佳方案来自最弱模型。跨模型家族多 AI 系列第二章。
AI 驱动 · 每小时限 20 次请求
"三个臭皮匠,顶个诸葛亮"——这话一点都不新鲜。群体决策优于个人决策,这是决策科学里最古老的结论之一。真正新鲜的是:这个规律放到 AI 模型身上同样成立,而起作用的关键因素跟几千年前一模一样——多样性。
群体智慧
2004 年,James Surowiecki 写了 The Wisdom of Crowds,把集体判断能发挥作用的三个条件讲得很清楚:意见要多样、判断要独立、决策要分散。只要满足这三个条件,群体的表现就能稳定地超过单个专家——甚至超过群体里最强的那个专家。
这个结论在预测市场、群体估算、集体决策等大量研究中被反复验证。背后的数学其实很简单:对多样化的独立估计取平均,个体误差会互相抵消。误差之间越不相关,抵消得越彻底。这套逻辑比 AI 早,比计算机早,本质上就是统计学。
重点在于"不相关"这三个字。如果一群人的偏差都朝同一个方向走,群体智慧就直接失效。所有估计都往一边偏的话,取平均只会给你一个"信心满满但错得离谱"的答案。独立性和多样性不是 ensemble 的锦上添花,而是它真正起作用的机制。
这对 AI 的启示是什么?"多个模型到底有没有用"根本不是正确的问题。该问的是:"在什么条件下有用,什么条件下反而帮倒忙?"
硅基群体的智慧
2024 年有一篇论文叫 "The Wisdom of the Silicon Crowd",专门验证了 Surowiecki 的条件在 LLM 上是否成立。研究者用中位数聚合多个 LLM 的确定性输出,结果发现集体答案超过了 67% 的单个模型。如果给模型提供相关上下文,这个数字能到 75%。

最关键的发现是:模型的多样性比模型本身的质量更重要。一群"中等生"组队,能打赢一个"尖子生"。这跟 Surowiecki 提出的条件完美对应。
2025 年一项内容分类研究把差距量化得更直观:最好的单模型 F1 只有 0.55,两个模型组 ensemble 就到了 0.73——只多加了一个模型,提升 33%。5 到 10 个模型的 ensemble 能打到 0.80 到 0.90。收益确实递减,但前两三个 diverse model 带来的提升非常可观。
这里要说一句:这些 F1 数字来自行业和 preprint 的内容分类研究,不是 peer-reviewed 期刊论文。方向性结论——ensemble 稳定碾压单模型——是站得住的,但具体数字更适合当作模式参考,而不是权威 benchmark。
医学 QA 领域也是同样的结论。LLM ensemble 在 MedMCQA 医学入学考试数据集上用加权投票和动态模型选择,比最佳单模型高了 5.98%。在医学场景里,85% 和 91% 的准确率差距,可能就是"诊断正确"和"漏诊"之间的距离。
为什么跨家族多样性最关键
同家族模型组 ensemble 确实比单模型好,数据很清楚。但它会撞天花板,而跨家族 ensemble 理论上能突破这个天花板。
多 AI 总论里提到过"回音室"研究,原因就出在这里。2025 年一项 multi-agent debate 研究发现,当 agent 共享同一个模型和训练数据时,辩论不是在纠正错误,而是在"放大对错误答案的信心"。研究者管这叫"belief entrenchment"——信念固化。另一项研究挖出了两个根因:一是共享训练数据导致的有偏静态初始信念,二是同质化的辩论动态会无脑放大多数派观点,不管它对不对。

说到这里,我要坦诚:我的论证从已有证据过渡到了推论。回音室研究已经证明同家族 ensemble 会共享盲点。跨家族多样性能够缓解这个问题,是一个逻辑上的自然延伸——不同的训练语料应该产生不同的系统性错误,不同的 architecture 应该产生不同的处理策略——但目前没有 head-to-head 的对比实验直接验证过这一点。我认为这个推论是强的,但它终究还是推论。
2025 年一篇研究从信息论角度也支撑了这个思路:不要无脑选分数最高的模型。最优的 ensemble 选择取决于互补性,而不是单模型排名。两个犯不同错误的模型,比两个各自分数更高但犯同样错误的模型,放在一起更有价值。
Blueprint2Code(2025)搭了一个四 agent 的代码生成 pipeline(预览、蓝图、编码、调试),在 HumanEval 上跑到 96.3% pass@1。单模型直接生成只有 84.7%。拿掉任何一个 agent,性能下降 14.8% 到 28.9%。其中调试 agent 最关键:去掉它,准确率从 93.5% 直接掉到 64.6%。即便是同家族的多 agent pipeline,也已经大幅碾压单 agent 了。
Anthropic 自己的 multi-agent 研究系统,用 Opus 4 做主导、Sonnet 4 做子 agent(注意,这是同家族的),比单 agent Opus 4 高出 90.2%。Token 用量解释了 80% 的性能方差。同家族 multi-agent 已经赢了单 agent 一大截。我的论点是:跨家族应该还能更进一步,因为它干掉了同家族方案里那些共享的盲点。
Model Swarms:弱模型也有春天
Model Swarms 发在 ICML 2025 的 PMLR 论文集里,把粒子群优化(PSO)用到了 LLM ensemble 上,发现了一个很反直觉的结果。

56.9% 的最终最优解,来自初始池里排名后一半的模型。不是那些 top performer,而是看起来比较弱的模型。它们有 latent capability,单独跑 benchmark 的时候看不出来,只有通过协作优化才能被激发出来。人工评估中,swarm 的输出有 70.8% 的概率被偏好于单个专家的输出。
所以你不一定要挑"最强"的模型,而是要挑最互补的组合。一个单独跑分平平的模型,可能恰好能提供某种视角,去抓住那些 top model 系统性忽略的错误。
这跟我自己做 Dev Buddy 的体验完全一致。MiniMax、Qwen 这些我不会拿来当主力的模型,有时候反而能抓到 Claude 和 GPT 都漏掉的问题。它们在通用 benchmark 上的"弱",到了 code review 场景里变成了优势——因为不同的训练产生了不同的失败模式。
人机混合集体
PNAS 上有一篇关于人机混合集体的研究,结论很有意思:医生搭配多个 LLM 做鉴别诊断,表现超过了纯人类团队、纯 AI 团队、以及任何单个专家。
这不是说用一堆 AI 来取代人类。重点是构建正确的集体:多样化的模型加上人类的判断力。人类提供的是上下文理解和伦理推理,模型提供的是模式识别的广度和输出的一致性。合在一起,比任何一方单干都强。

最优配置不是"模型越多越好",也不是"模型越强越好",而是针对具体问题,找到人类和 AI 之间最合适的多样视角组合。Surowiecki 的条件在这里同样成立。一旦你违反了这些条件——比如只用同一家族的模型,或者让一个模型的输出压制其他模型——你得到的就不是群体智慧,而是 belief entrenchment。
Ensemble 科学告诉了我们什么
研究指向一个一致的结论:多样化、独立的视角,比单个专家更能产出好结果。背后的机制是 error decorrelation——让错误互不相关,从而互相抵消。这个规律适用于人类群体、AI 模型 ensemble,也适用于人机混合集体。
跨家族多 AI 的思路,就是把训练数据和 architecture 差异最大的模型组合在一起,让多样性最大化。研究已经证明了 ensemble 能打败个体,也证明了多样性是 ensemble 起作用的核心。至于跨家族多样性是否真的优于同家族多样性,目前还是推论,还没有被直接测量。但它从已知机制中自然推导出来。
这套逻辑在真实行业、真实风险下能不能站住脚?这是第三章要回答的问题。
许可
Article text © 2026 Mark Huang. Licensed under Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0) unless otherwise noted. 文章文本可在非商业场景下分享或翻译,但需标注原文 URL。商业使用需事先取得书面许可,并清楚引用原始来源。
代码片段、截图、第三方素材和网站源码可能适用单独条款。
建议署名: Based on "集成智能背后的科学" by Mark Huang, originally published at https://markhuang.ai/zh/blog/cross-family-multi-ai-science-of-ensemble-intelligence.
相关文章

为什么一个 AI 永远不够
医学、法律、科学和金融等高风险行业都要求独立复核,AI 却常常跳过这一步。37% 的企业已经使用 5 个以上模型,但多数仍是临时拼接。跨模型家族多 AI 系列第一章。
阅读文章
行业证据:医疗、金融、法律以及更多场景
多模型 AI 已经进入医疗诊断、金融风险管理、法律分析和内容审核的主流实践。本文整理四个行业的证据,以及它们对跨模型家族 AI 采用的意义。跨模型家族多 AI 系列第三章。
阅读文章
模型单一化风险:当所有 AI 都同意同一个错误答案
依赖单一 AI 的危险不只是宕机,而是相关性错误:答案错了,却没有任何系统反驳。当每个团队使用同一个模型家族,同样的盲点会安静地扩散。跨模型家族多 AI 系列第四章。
阅读文章