为什么一个 AI 永远不够
医学、法律、科学和金融等高风险行业都要求独立复核,AI 却常常跳过这一步。37% 的企业已经使用 5 个以上模型,但多数仍是临时拼接。跨模型家族多 AI 系列第一章。
AI 驱动 · 每小时限 20 次请求
凡是高风险行业,早就想明白了这件事。
动大手术前要 second opinion。整个对抗式法律体系的底层逻辑,就是"一个视角靠不住"。学术论文必须经过独立研究者的同行评审。做投资要分散组合——把鸡蛋放一个篮子里,谁都知道危险。
偏偏到了 AI 这儿,很多人把这道工序省了。

第二意见原则
一个模型写代码,同一个模型来 review。一个模型出合同分析,同一个模型来检查自己的产出。我们几百年来都清楚,高风险场景下自我评审靠不住——但到了 AI 这里,大家好像默认它是个例外。
它不是。多 AI 论点里摆过数据:LLM 对自身错误的平均盲区率高达 64.5%。GPT-4 在 chain-of-thought 推理链中只能抓到 52.9% 的错误。这不是极端 case,这是基线。
自我评审的问题是结构性的,不是发个 patch 就能修好的。模型会给自己生成的内容打更低的 perplexity——说白了,就是觉得自己的东西"更顺眼"。RLHF 训练还在火上浇油,因为它奖励的是表达上的自信,不是事实上的准确。同一个模型给出的"第二意见",甚至同一个家族里另一个型号的意见,算不上真正的第二意见,那叫回声。
其实这个道理不是 AI 时代才有的。外科医生不会自己复核自己的病理切片。律师不会自己审自己的案子。科学家不会 peer review 自己的论文。来自不同视角的独立验证,能抓住自我评审天然漏掉的东西。这个思路比计算机的历史还长。
市场已经用脚投票了
企业端的数据已经把答案写得很清楚。根据 a16z 2025 年企业 AI 调研,37% 的企业已经在生产环境跑着 5 个以上的 AI 模型,只有大约 20% 还在押注单一模型。市场已经在往多模型走了——但大多数组织是东拼西凑,没有框架,也说不清为什么选了这几个模型来搭配。

Perplexity 的企业数据讲了类似的故事。他们内部的使用数据显示模型分布高度碎片化,没有任何单一模型占据主导。这是公司自报的数据,没经过独立审计,但企业已经在用 API key 投票了。
有意思的是,很多组织是自然而然走到多模型的,并非刻意规划。开发觉得 Claude 写代码顺手,产品经理喜欢 GPT 写文档,数据团队为了控成本上了开源模型。行为走在认知前面——大家已经在做多 AI 了,只是没人给它起个名字。
但他们还没做到有意为之。没有根据互补盲区来选模型,没有把跨家族 review 嵌进工作流,只是哪个好用哪个。这在我第 6 章的成熟度模型里只是 Level 1。是个起点,但大部分价值还没被挖出来。
认知锁定:真正的锁定
Parallels 2026 年调研显示,94% 的 IT 负责人担心 AI 供应商锁定。这个样本偏终端用户计算领域,范围不算大,但情绪是真实的。只不过大多数人想到的是合同条款和议价能力。真正深层的锁定,是认知层面的。
当整个团队只用一个 AI 家族,那个模型的假设就悄悄变成了团队的假设。它的盲区变得不可见——不是因为盲区小,而是你的工作流里没有任何东西去挑战它。一个从头到尾用 Claude 的开发者,思维方式会不自觉地被 Claude 的模式塑造。一个用 GPT 做所有合同审核的法务团队,会系统性地漏掉 GPT 看不到的东西。
这跟供应商合同没关系。这是一个模型的视角变成了团队默认的"世界观"之后,会发生什么。第 4 章会展开讲,为什么这件事比多数人以为的要危险得多。
先把"跨家族"说清楚
继续往下之前,我得把"跨家族"这个概念定义清楚,因为这个区分贯穿整个系列。
同一家族,指同一个提供商出品、共享训练数据、架构血统和开发方法论的模型。Claude Sonnet 和 Claude Opus 是同一家族。GPT-4 和 GPT-4o 也是。它们可能大小不同、速度不同,但对世界的基础假设有大量重叠。
跨家族,指来自不同提供商、大概率拥有不同训练语料和不同架构的模型。Claude、GPT、Qwen——这三个是跨家族。不同公司造的,不同数据喂出来的,设计优先级也不一样。
跨提供商但同底座,这是灰色地带。两家不同公司各自微调的 LLaMA,技术上算跨提供商,但共享架构基础,训练数据也可能有重叠。比同家族强,但不如完全独立的家族组合那么正交。
这里要加一个前提:对于 Claude、GPT、Gemini 这类闭源模型,我们没法直接验证训练数据和架构细节。所以"跨家族"这个假设本质上是概率性的——不同公司独立训练,大概率会产生不同的盲区,但拿不到训练数据就没法完全坐实。开源模型的情况就明朗得多。

价值来自训练数据的多样性和架构的多样性,不是 API key 上贴个不同的牌子。三个 Claude 模型轮着用,不叫跨家族。Claude + GPT + Qwen,才叫跨家族。
这个系列要聊什么
这个系列是在为"跨家族多 AI"这种思维方式做论证,不是产品推荐。每一章可以独立看,但整体是层层递进的:
- 第 2 章:群体智能的科学——用 ensemble learning 研究和信息论来解释,为什么多样化的视角能产出更好的结果。
- 第 3 章:行业证据——看医疗、金融、法律和内容审核领域的实际情况。
- 第 4 章:单一化风险——绑定单一供应商 AI 会出什么问题。
- 第 5 章:成本这笔账——多 AI 什么时候划算,什么时候不划算。
- 第 6 章:接下来的路——怎么落地。
最硬的量化证据不少来自软件工程场景,但这个论点适用于任何 AI 输出有分量的地方。来自不同源的独立验证,能抓住自我评审漏掉的东西——这就是整个系列的核心主张。
许可
Article text © 2026 Mark Huang. Licensed under Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0) unless otherwise noted. 文章文本可在非商业场景下分享或翻译,但需标注原文 URL。商业使用需事先取得书面许可,并清楚引用原始来源。
代码片段、截图、第三方素材和网站源码可能适用单独条款。
建议署名: Based on "为什么一个 AI 永远不够" by Mark Huang, originally published at https://markhuang.ai/zh/blog/cross-family-multi-ai-why-one-ai-is-never-enough.
相关文章

成本问题:什么时候多 AI 能收回成本
多 AI 的 token 成本可能高出 3 到 4 倍,但组织会把 40% 的 AI 生产力收益浪费在返工上。本文讨论执行顺序、按任务缩放,以及成熟与不成熟 AI 实践之间 21 倍 ROI 差距。跨模型家族多 AI 系列第五章。
阅读文章
下一段路:建立跨模型家族的 AI 实践
从单一模型到自优化的五级成熟度模型,面向个人、团队和企业的可执行下一步,以及对仍需补齐的证据缺口的坦诚整理。跨模型家族多 AI 系列第六章。
阅读文章
集成智能背后的科学
群体智慧遇上 AI:多样化 LLM 集成超过 67% 的单一模型,F1 分数从 0.55 提升到 0.80 以上,而 56.9% 的最佳方案来自最弱模型。跨模型家族多 AI 系列第二章。
阅读文章