# 为什么一个 AI 永远不够

**Summary:** 医学、法律、科学和金融等高风险行业都要求独立复核，AI 却常常跳过这一步。37% 的企业已经使用 5 个以上模型，但多数仍是临时拼接。跨模型家族多 AI 系列第一章。

- Canonical: https://markhuang.ai/zh/blog/cross-family-multi-ai-why-one-ai-is-never-enough
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-03-04
- Section: AI 与 LLM
- Tags: 多 AI, AI 模型, 跨模型家族, 集成 AI, AI 策略
- License: https://creativecommons.org/licenses/by-nc-sa/4.0/

---

> **Tip:**
>
> 这是*跨家族多 AI：一种新的思考方式*的**第 1 章**。建议先从 [多 AI 论点](/blog/the-multi-ai-thesis)读起，了解整个系列的核心主张。下一篇：[第 2 章：群体智能的科学](/blog/cross-family-multi-ai-science-of-ensemble-intelligence)。

> **Info:**
>
> **系列目录：** [总论](/blog/the-multi-ai-thesis) · **第 1 章：为什么一个 AI 永远不够** · [第 2 章：群体智能的科学](/blog/cross-family-multi-ai-science-of-ensemble-intelligence) · [第 3 章：行业证据](/blog/cross-family-multi-ai-industry-evidence) · [第 4 章：单一化风险](/blog/cross-family-multi-ai-monoculture-risk) · [第 5 章：成本这笔账](/blog/cross-family-multi-ai-cost-analysis) · [第 6 章：接下来的路](/blog/cross-family-multi-ai-road-ahead)

凡是高风险行业，早就想明白了这件事。

动大手术前要 second opinion。整个对抗式法律体系的底层逻辑，就是"一个视角靠不住"。学术论文必须经过独立研究者的同行评审。做投资要分散组合——把鸡蛋放一个篮子里，谁都知道危险。

偏偏到了 AI 这儿，很多人把这道工序省了。

![为什么一个 AI 永远不够](https://cdn.markhuang.ai/blog/cross-family-multi-ai-why-one-ai-is-never-enough/hero.zh-CN.webp)

*为什么一个 AI 永远不够*

## 第二意见原则

一个模型写代码，同一个模型来 review。一个模型出合同分析，同一个模型来检查自己的产出。我们几百年来都清楚，高风险场景下自我评审靠不住——但到了 AI 这里，大家好像默认它是个例外。

它不是。[多 AI 论点](/blog/the-multi-ai-thesis)里摆过数据：LLM 对自身错误的平均盲区率高达 64.5%。GPT-4 在 chain-of-thought 推理链中只能抓到 52.9% 的错误。这不是极端 case，这是基线。

自我评审的问题是结构性的，不是发个 patch 就能修好的。模型会给自己生成的内容打更低的 perplexity——说白了，就是觉得自己的东西"更顺眼"。RLHF 训练还在火上浇油，因为它奖励的是表达上的自信，不是事实上的准确。同一个模型给出的"第二意见"，甚至同一个家族里另一个型号的意见，算不上真正的第二意见，那叫回声。

其实这个道理不是 AI 时代才有的。外科医生不会自己复核自己的病理切片。律师不会自己审自己的案子。科学家不会 peer review 自己的论文。来自不同视角的独立验证，能抓住自我评审天然漏掉的东西。这个思路比计算机的历史还长。

## 市场已经用脚投票了

企业端的数据已经把答案写得很清楚。根据 a16z 2025 年企业 AI 调研，37% 的企业已经在生产环境跑着 5 个以上的 AI 模型，只有大约 20% 还在押注单一模型。市场已经在往多模型走了——但大多数组织是东拼西凑，没有框架，也说不清为什么选了这几个模型来搭配。

![2025 年企业 AI 模型使用情况](https://cdn.markhuang.ai/blog/cross-family-multi-ai-why-one-ai-is-never-enough/enterprise-ai-usage.zh-CN.webp)

*2025 年企业 AI 模型使用情况*

Perplexity 的企业数据讲了类似的故事。他们内部的使用数据显示模型分布高度碎片化，没有任何单一模型占据主导。这是公司自报的数据，没经过独立审计，但企业已经在用 API key 投票了。

有意思的是，很多组织是自然而然走到多模型的，并非刻意规划。开发觉得 Claude 写代码顺手，产品经理喜欢 GPT 写文档，数据团队为了控成本上了开源模型。行为走在认知前面——大家已经在做多 AI 了，只是没人给它起个名字。

但他们还没做到*有意为之*。没有根据互补盲区来选模型，没有把跨家族 review 嵌进工作流，只是哪个好用哪个。这在我[第 6 章](/blog/cross-family-multi-ai-road-ahead)的成熟度模型里只是 Level 1。是个起点，但大部分价值还没被挖出来。

## 认知锁定：真正的锁定

Parallels 2026 年调研显示，94% 的 IT 负责人担心 AI 供应商锁定。这个样本偏终端用户计算领域，范围不算大，但情绪是真实的。只不过大多数人想到的是合同条款和议价能力。真正深层的锁定，是认知层面的。

当整个团队只用一个 AI 家族，那个模型的假设就悄悄变成了团队的假设。它的盲区变得不可见——不是因为盲区小，而是你的工作流里没有任何东西去挑战它。一个从头到尾用 Claude 的开发者，思维方式会不自觉地被 Claude 的模式塑造。一个用 GPT 做所有合同审核的法务团队，会系统性地漏掉 GPT 看不到的东西。

这跟供应商合同没关系。这是一个模型的视角变成了团队默认的"世界观"之后，会发生什么。[第 4 章](/blog/cross-family-multi-ai-monoculture-risk)会展开讲，为什么这件事比多数人以为的要危险得多。

## 先把"跨家族"说清楚

继续往下之前，我得把"跨家族"这个概念定义清楚，因为这个区分贯穿整个系列。

**同一家族**，指同一个提供商出品、共享训练数据、架构血统和开发方法论的模型。Claude Sonnet 和 Claude Opus 是同一家族。GPT-4 和 GPT-4o 也是。它们可能大小不同、速度不同，但对世界的基础假设有大量重叠。

**跨家族**，指来自不同提供商、大概率拥有不同训练语料和不同架构的模型。Claude、GPT、Qwen——这三个是跨家族。不同公司造的，不同数据喂出来的，设计优先级也不一样。

**跨提供商但同底座**，这是灰色地带。两家不同公司各自微调的 LLaMA，技术上算跨提供商，但共享架构基础，训练数据也可能有重叠。比同家族强，但不如完全独立的家族组合那么正交。

这里要加一个前提：对于 Claude、GPT、Gemini 这类闭源模型，我们没法直接验证训练数据和架构细节。所以"跨家族"这个假设本质上是概率性的——不同公司独立训练，*大概率*会产生不同的盲区，但拿不到训练数据就没法完全坐实。开源模型的情况就明朗得多。

![不同领域的独立评审](https://cdn.markhuang.ai/blog/cross-family-multi-ai-why-one-ai-is-never-enough/independent-review.zh-CN.webp)

*不同领域的独立评审*

价值来自训练数据的多样性和架构的多样性，不是 API key 上贴个不同的牌子。三个 Claude 模型轮着用，不叫跨家族。Claude + GPT + Qwen，才叫跨家族。

## 这个系列要聊什么

这个系列是在为"跨家族多 AI"这种思维方式做论证，不是产品推荐。每一章可以独立看，但整体是层层递进的：

- [第 2 章：群体智能的科学](/blog/cross-family-multi-ai-science-of-ensemble-intelligence)——用 ensemble learning 研究和信息论来解释，为什么多样化的视角能产出更好的结果。
- [第 3 章：行业证据](/blog/cross-family-multi-ai-industry-evidence)——看医疗、金融、法律和内容审核领域的实际情况。
- [第 4 章：单一化风险](/blog/cross-family-multi-ai-monoculture-risk)——绑定单一供应商 AI 会出什么问题。
- [第 5 章：成本这笔账](/blog/cross-family-multi-ai-cost-analysis)——多 AI 什么时候划算，什么时候不划算。
- [第 6 章：接下来的路](/blog/cross-family-multi-ai-road-ahead)——怎么落地。

最硬的量化证据不少来自软件工程场景，但这个论点适用于任何 AI 输出有分量的地方。来自不同源的独立验证，能抓住自我评审漏掉的东西——这就是整个系列的核心主张。

> **Info:**
>
> 研究来源：[Self-Correction Bench (arXiv:2507.02778)](https://arxiv.org/abs/2507.02778)、[LLMs Cannot Find Reasoning Errors (ACL 2024)](https://arxiv.org/abs/2311.08516)、[a16z 2025 Enterprise AI Survey](https://a16z.com/ai-enterprise-survey-2025/)、[Parallels 2026 State of Cloud Computing Survey](https://www.globenewswire.com/news-release/2026/02/17/3239335/0/en/94-of-IT-Leaders-Fear-Vendor-Lock-In-as-AI-Reality-Check-Forces-EUC-Strategy-Reset-Parallels-Survey-Finds.html)、[Flexera 2025 State of the Cloud](https://www.flexera.com/blog/cloud/cloud-computing-trends/)、[Veracode 2025 GenAI Security Report](https://www.veracode.com/resources/analyst-reports/2025-genai-code-security-report/)。

> **Tip:**
>
> **系列导航：** [多 AI 论点](/blog/the-multi-ai-thesis) | **第 1 章** | [第 2 章：群体智能的科学 →](/blog/cross-family-multi-ai-science-of-ensemble-intelligence)

> **Info:**
>
> *跨家族多 AI* by Mark Huang，采用 [CC BY-NC-SA 4.0](https://creativecommons.org/licenses/by-nc-sa/4.0/) 许可。
