# 成本问题：什么时候多 AI 能收回成本

**Summary:** 多 AI 的 token 成本可能高出 3 到 4 倍，但组织会把 40% 的 AI 生产力收益浪费在返工上。本文讨论执行顺序、按任务缩放，以及成熟与不成熟 AI 实践之间 21 倍 ROI 差距。跨模型家族多 AI 系列第五章。

- Canonical: https://markhuang.ai/zh/blog/cross-family-multi-ai-cost-analysis
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-03-04
- Section: AI 与 LLM
- Tags: 多 AI, AI 成本, ROI, 跨模型家族, AI 策略
- License: https://creativecommons.org/licenses/by-nc-sa/4.0/

---

> **Tip:**
>
> 这是 *跨家族多 AI：一种全新的思维方式* 的**第 5 章**。上一篇：[第 4 章：单一化风险](/blog/cross-family-multi-ai-monoculture-risk)。下一篇：[第 6 章：前方的路](/blog/cross-family-multi-ai-road-ahead)。

> **Info:**
>
> **系列目录：** [总论](/blog/the-multi-ai-thesis) · [第 1 章：为什么一个 AI 永远不够](/blog/cross-family-multi-ai-why-one-ai-is-never-enough) · [第 2 章：集成智能背后的科学](/blog/cross-family-multi-ai-science-of-ensemble-intelligence) · [第 3 章：行业证据](/blog/cross-family-multi-ai-industry-evidence) · [第 4 章：单一化风险](/blog/cross-family-multi-ai-monoculture-risk) · **第 5 章：成本这笔账** · [第 6 章：前方的路](/blog/cross-family-multi-ai-road-ahead)

多 AI 更贵——这是我听到最多的质疑，而且说得没毛病。前期成本确实会上涨，但最终能不能拉低 TCO，得看具体场景。

## 前期成本是实打实的

多 agent 系统消耗的 token 量大约是单次对话的 15 倍。扣除 agent 间通信、检索开销和日志记录，实际成本倍率大概在 3 到 4 倍。有一家电商公司上线多 agent 工作流之后，月度 LLM 账单直接从 1,200 美元飙到 4,800 美元。

这个数字不该被轻描淡写地糊弄过去。AI 开支涨了三四倍，你得拿出理由来。"值得"不能靠感觉，得靠数据。

![TCO 对比](https://cdn.markhuang.ai/blog/cross-family-multi-ai-cost-analysis/tco-comparison.zh-CN.webp)

*TCO 对比*

后面我会论证一件事：把账算全了，多 AI 往往比单 AI 还省钱。但我得先把话说明白——标价确实更高。你要是对成本问题避而不谈，管预算的人根本不会听你往下说。

## 便宜 AI 的返工税

前期投入不等于总成本。Workday 2026 年的调研显示，企业大约 40% 的 AI 生产力收益被消耗在修复低质量产出上。AI 帮你省了 10 个小时，差不多有 4 个小时又花在纠错、澄清和重写上。

这跟我实际观察到的完全吻合。GitClear 对 AI 辅助代码的分析发现，代码克隆增长了大约 4 倍——代码写得飞快，但留下一堆技术债等着后人来擦屁股。Stanford 的研究更有意思：用 AI 代码助手的开发者，写出的代码安全性更差，但他们自己反而觉得更安全。AI 给了他们一种虚假的安全感，而那些被引入的漏洞，最后还得靠资深工程师花时间去排查和修补。

规律很清晰：便宜快速的 AI 输出，会催生一笔隐性的下游税负，而这笔账不会出现在 token 单价里。高级工程师拿着高级工程师的时薪，去审查、纠正、重写 AI 生成的代码。按 100 到 200 美元一小时的人力成本来算，如果你省下来的时间有 40% 都花在修 output 上，那用单个便宜模型每月省下的 3,600 美元根本经不起算。

跨家族 review 这一步，能在问题到达人之前就把大部分坑填掉。不同家族的 review model 能发现生成模型系统性地遗漏的东西——重复模式、安全漏洞、逻辑错误。多调一次 AI 的成本，比资深工程师 debug 的时间便宜好几个数量级。

## 给任务配对合适的 model

多 AI 不是无脑堆模型就行，第一条成本优化原则就是把 model 的能力和任务需求对齐。拿三个纯文本 model 去做图像识别，效果不如用一个原生支持 vision 的 model，花费还更高。组合方式比数量更重要。

说白了就是别浪费。要分析图片，就用原生处理图片的 model，别逼着文本 model 靠描述去猜。要生成代码，就用代码能力突出的 model，别凑合用一个"也能写代码"的通用 model。model 选错了，token 烧出来的是平庸的 output，回头还得重新生成或者修修补补。

其实企业用户已经在凭直觉这么干了。Perplexity 的内部数据显示，在他们平台上，编程类查询用得最多的是 Claude，而其他任务类型各有各的领先 model。基于任务的自然路由已经在发生了——开发者会根据 model 的口碑强项来选择，哪怕还没有正式的路由基础设施。

成本上的启示很简单：在加第二个、第三个 model 做 review 之前，先确认你的主任务用的是对的 model。一个能力够强的 model 把初稿做好，output 质量上去了，后面 review 的工作量自然就下来了。[第 6 章](/blog/cross-family-multi-ai-road-ahead)会更系统地聊 model 家族的强项和配对策略。

## 执行顺序

这部分是我用 [Dev Buddy](https://github.com/Z-M-Huang/vcp) 搭多 AI pipeline 时的实战观察，不是什么同行评审的结论。但逻辑链条很清晰，我觉得值得做一组对照实验来验证。

![执行顺序对比](https://cdn.markhuang.ai/blog/cross-family-multi-ai-cost-analysis/execution-order.zh-CN.webp)

*执行顺序对比*

**路径 A（推荐）：**&#x4E00;个能力强、价格贵的 model 负责主要生成，另一个不同家族的便宜 model 负责 review。总共：1 次贵调用 + 1 次便宜调用。强 model 第一把就能输出高质量结果，便宜 model 不需要从头生成，只需要抓跨家族的盲点。review 比 generation 简单，所以便宜 model 完全 hold 得住。

**路径 B（常见但烧钱）：**&#x4FBF;宜 model 负责主要生成。贵 model review 后发现问题。便宜 model 修。贵 model 再 review。总共：1 次便宜调用 + N 次贵的 review 调用。一开始省的那点钱，全被好几轮昂贵的 review 和迭代吃掉了。

以我的经验，路径 A 花钱更少，产出也更好。生成和 review 是两种不同的任务，对能力的要求也不一样。生成需要深厚的领域知识，需要从零开始产出高质量结果的能力。review 需要的是在已有 output 里揪出错误和盲点——这件事便宜 model 经常做得不错，尤其是当它带来不同训练视角的时候。

话说回来，这只是我观察到的 pattern，不是受控实验的结论。这个假设——执行顺序会显著影响多 AI pipeline 的成本和质量——值得用同一组任务做严格的 benchmark，把总成本连同人工修正的时间一起算进去。

## 按任务风险弹性伸缩

不是所有事情都需要多 AI。如果便宜 model 就能搞定——比如总结一篇简单文档、回答一个事实性问题、生成一段 boilerplate 代码——那就别把贵 model 拉进来。多 AI 是用在正确性很关键、盲点代价很高的场景里的。

![什么时候用单 AI，什么时候用多 AI](https://cdn.markhuang.ai/blog/cross-family-multi-ai-cost-analysis/decision-matrix.zh-CN.webp)

*什么时候用单 AI，什么时候用多 AI*

Microsoft 在 2025 年 5 月的一篇论文里提出了 cascade 方案，思路很具体：先从单 agent 起步，只有任务确实需要时才升级到多 agent。他们的混合方案实现了 1.1% 到 12% 的准确率提升，同时比纯单 agent 或纯多 agent 方案节省高达 20% 的成本。省在哪？省在不给不需要多 agent 的任务白白付那笔开销。

决策框架可以这样拆：

- 简单任务、低风险：单 model。快、便宜、够用。一封模板邮件没必要让三个 model 来审。
- 简单任务、高风险：单 model + 一次跨家族 review。医疗信息类的回答可能很简单，但出了错后果很严重。
- 复杂任务、低风险：单 model + 抽查。反正后面有多人 review 的内部草稿，不需要跑一整条 pipeline。
- 复杂任务、高风险：完整多 AI pipeline。金融分析、法律合同审查、生产环境代码部署——这些场景值得付出开销。

最常见的错误就是把多 AI 当成非黑即白。真正划算的做法是分级：任务风险多大，就配多少 model。

## ROI 的鸿沟

更大范围来看，AI 成熟度的 ROI 数据能说明为什么成本问题不能只看 token 单价。这些数据衡量的是 AI 落地的整体成熟度，并不是专门针对跨家族多 AI 的，但它们能让我们看到"把 AI 做好"和"把 AI 做糙"之间有多大差距。

![成熟与不成熟 AI 实践之间的 ROI 鸿沟](https://cdn.markhuang.ai/blog/cross-family-multi-ai-cost-analysis/roi-gap.zh-CN.webp)

*成熟与不成熟 AI 实践之间的 ROI 鸿沟*

在成熟 AI 实践上投入的公司——有质量保证、有系统化评估、有结构化工作流——每投 1 美元能拿回 3.70 到 10.30 美元。而成熟度不够的团队呢？每投 1 美元大概只能拿回 0.20 美元。经验丰富的组织平均 ROI 是 4.3%，1.2 年回本；成熟度低的组织只有 0.2% ROI，1.6 年才能回本。差距是 21 倍。

这些是 IDC 和 Microsoft 的通用 AI 成熟度指标，不是专门针对多 AI 的测量。但跨家族多 AI 本身就是成熟度差距的一部分。愿意在质量上投入的组织——跨家族 review、系统化评估、结构化工作流——回报远远好于那些只盯着最低 token 单价来优化的组织。

最便宜的 AI 不等于最划算的 AI。最划算的 AI，是产出结果让你不用返工的 AI。

> **Info:**
>
> 研究来源：[Workday 2026 AI Productivity Report](https://newsroom.workday.com/2026-01-14-New-Workday-Research-Companies-Are-Leaving-AI-Gains-on-the-Table), [GitClear 2025 Code Quality Analysis](https://www.gitclear.com/ai_assistant_code_quality_2025_research), [Stanford AI Code Security Study](https://arxiv.org/abs/2211.03622), [MAS vs SAS (arXiv:2505.18286)](https://arxiv.org/abs/2505.18286), [IDC/Microsoft AI ROI Research](https://news.microsoft.com/en-xm/2025/01/14/generative-ai-delivering-substantial-roi-to-businesses-integrating-the-technology-across-operations-microsoft-sponsored-idc-report/).

> **Tip:**
>
> **系列导航：** [← 第 4 章：单一化风险](/blog/cross-family-multi-ai-monoculture-risk) | **第 5 章** | [第 6 章：前方的路 →](/blog/cross-family-multi-ai-road-ahead)

> **Info:**
>
> Mark Huang 创作的 *跨家族多 AI* 采用 [CC BY-NC-SA 4.0](https://creativecommons.org/licenses/by-nc-sa/4.0/) 许可。
