跳转到主要内容

为什么一个 AI 永远不够

医学、法律、科学和金融等高风险行业都要求独立复核,AI 却常常跳过这一步。37% 的企业已经使用 5 个以上模型,但多数仍是临时拼接。跨模型家族多 AI 系列第一章。

10 分钟阅读
分享:
AI 驱动

AI 驱动 · 每小时限 20 次请求

凡是高风险行业,早就想明白了这件事。

动大手术前要 second opinion。整个对抗式法律体系的底层逻辑,就是"一个视角靠不住"。学术论文必须经过独立研究者的同行评审。做投资要分散组合——把鸡蛋放一个篮子里,谁都知道危险。

偏偏到了 AI 这儿,很多人把这道工序省了。

为什么一个 AI 永远不够
为什么一个 AI 永远不够

第二意见原则

一个模型写代码,同一个模型来 review。一个模型出合同分析,同一个模型来检查自己的产出。我们几百年来都清楚,高风险场景下自我评审靠不住——但到了 AI 这里,大家好像默认它是个例外。

它不是。多 AI 论点里摆过数据:LLM 对自身错误的平均盲区率高达 64.5%。GPT-4 在 chain-of-thought 推理链中只能抓到 52.9% 的错误。这不是极端 case,这是基线。

自我评审的问题是结构性的,不是发个 patch 就能修好的。模型会给自己生成的内容打更低的 perplexity——说白了,就是觉得自己的东西"更顺眼"。RLHF 训练还在火上浇油,因为它奖励的是表达上的自信,不是事实上的准确。同一个模型给出的"第二意见",甚至同一个家族里另一个型号的意见,算不上真正的第二意见,那叫回声。

其实这个道理不是 AI 时代才有的。外科医生不会自己复核自己的病理切片。律师不会自己审自己的案子。科学家不会 peer review 自己的论文。来自不同视角的独立验证,能抓住自我评审天然漏掉的东西。这个思路比计算机的历史还长。

市场已经用脚投票了

企业端的数据已经把答案写得很清楚。根据 a16z 2025 年企业 AI 调研,37% 的企业已经在生产环境跑着 5 个以上的 AI 模型,只有大约 20% 还在押注单一模型。市场已经在往多模型走了——但大多数组织是东拼西凑,没有框架,也说不清为什么选了这几个模型来搭配。

2025 年企业 AI 模型使用情况
2025 年企业 AI 模型使用情况

Perplexity 的企业数据讲了类似的故事。他们内部的使用数据显示模型分布高度碎片化,没有任何单一模型占据主导。这是公司自报的数据,没经过独立审计,但企业已经在用 API key 投票了。

有意思的是,很多组织是自然而然走到多模型的,并非刻意规划。开发觉得 Claude 写代码顺手,产品经理喜欢 GPT 写文档,数据团队为了控成本上了开源模型。行为走在认知前面——大家已经在做多 AI 了,只是没人给它起个名字。

但他们还没做到有意为之。没有根据互补盲区来选模型,没有把跨家族 review 嵌进工作流,只是哪个好用哪个。这在我第 6 章的成熟度模型里只是 Level 1。是个起点,但大部分价值还没被挖出来。

认知锁定:真正的锁定

Parallels 2026 年调研显示,94% 的 IT 负责人担心 AI 供应商锁定。这个样本偏终端用户计算领域,范围不算大,但情绪是真实的。只不过大多数人想到的是合同条款和议价能力。真正深层的锁定,是认知层面的。

当整个团队只用一个 AI 家族,那个模型的假设就悄悄变成了团队的假设。它的盲区变得不可见——不是因为盲区小,而是你的工作流里没有任何东西去挑战它。一个从头到尾用 Claude 的开发者,思维方式会不自觉地被 Claude 的模式塑造。一个用 GPT 做所有合同审核的法务团队,会系统性地漏掉 GPT 看不到的东西。

这跟供应商合同没关系。这是一个模型的视角变成了团队默认的"世界观"之后,会发生什么。第 4 章会展开讲,为什么这件事比多数人以为的要危险得多。

先把"跨家族"说清楚

继续往下之前,我得把"跨家族"这个概念定义清楚,因为这个区分贯穿整个系列。

同一家族,指同一个提供商出品、共享训练数据、架构血统和开发方法论的模型。Claude Sonnet 和 Claude Opus 是同一家族。GPT-4 和 GPT-4o 也是。它们可能大小不同、速度不同,但对世界的基础假设有大量重叠。

跨家族,指来自不同提供商、大概率拥有不同训练语料和不同架构的模型。Claude、GPT、Qwen——这三个是跨家族。不同公司造的,不同数据喂出来的,设计优先级也不一样。

跨提供商但同底座,这是灰色地带。两家不同公司各自微调的 LLaMA,技术上算跨提供商,但共享架构基础,训练数据也可能有重叠。比同家族强,但不如完全独立的家族组合那么正交。

这里要加一个前提:对于 Claude、GPT、Gemini 这类闭源模型,我们没法直接验证训练数据和架构细节。所以"跨家族"这个假设本质上是概率性的——不同公司独立训练,大概率会产生不同的盲区,但拿不到训练数据就没法完全坐实。开源模型的情况就明朗得多。

不同领域的独立评审
不同领域的独立评审

价值来自训练数据的多样性和架构的多样性,不是 API key 上贴个不同的牌子。三个 Claude 模型轮着用,不叫跨家族。Claude + GPT + Qwen,才叫跨家族。

这个系列要聊什么

这个系列是在为"跨家族多 AI"这种思维方式做论证,不是产品推荐。每一章可以独立看,但整体是层层递进的:

最硬的量化证据不少来自软件工程场景,但这个论点适用于任何 AI 输出有分量的地方。来自不同源的独立验证,能抓住自我评审漏掉的东西——这就是整个系列的核心主张。

许可

Article text © 2026 Mark Huang. Licensed under Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0) unless otherwise noted. 文章文本可在非商业场景下分享或翻译,但需标注原文 URL。商业使用需事先取得书面许可,并清楚引用原始来源。

代码片段、截图、第三方素材和网站源码可能适用单独条款。

建议署名: Based on "为什么一个 AI 永远不够" by Mark Huang, originally published at https://markhuang.ai/zh/blog/cross-family-multi-ai-why-one-ai-is-never-enough.