成本问题:什么时候多 AI 能收回成本
多 AI 的 token 成本可能高出 3 到 4 倍,但组织会把 40% 的 AI 生产力收益浪费在返工上。本文讨论执行顺序、按任务缩放,以及成熟与不成熟 AI 实践之间 21 倍 ROI 差距。跨模型家族多 AI 系列第五章。
AI 驱动 · 每小时限 20 次请求
多 AI 更贵——这是我听到最多的质疑,而且说得没毛病。前期成本确实会上涨,但最终能不能拉低 TCO,得看具体场景。
前期成本是实打实的
多 agent 系统消耗的 token 量大约是单次对话的 15 倍。扣除 agent 间通信、检索开销和日志记录,实际成本倍率大概在 3 到 4 倍。有一家电商公司上线多 agent 工作流之后,月度 LLM 账单直接从 1,200 美元飙到 4,800 美元。
这个数字不该被轻描淡写地糊弄过去。AI 开支涨了三四倍,你得拿出理由来。"值得"不能靠感觉,得靠数据。

后面我会论证一件事:把账算全了,多 AI 往往比单 AI 还省钱。但我得先把话说明白——标价确实更高。你要是对成本问题避而不谈,管预算的人根本不会听你往下说。
便宜 AI 的返工税
前期投入不等于总成本。Workday 2026 年的调研显示,企业大约 40% 的 AI 生产力收益被消耗在修复低质量产出上。AI 帮你省了 10 个小时,差不多有 4 个小时又花在纠错、澄清和重写上。
这跟我实际观察到的完全吻合。GitClear 对 AI 辅助代码的分析发现,代码克隆增长了大约 4 倍——代码写得飞快,但留下一堆技术债等着后人来擦屁股。Stanford 的研究更有意思:用 AI 代码助手的开发者,写出的代码安全性更差,但他们自己反而觉得更安全。AI 给了他们一种虚假的安全感,而那些被引入的漏洞,最后还得靠资深工程师花时间去排查和修补。
规律很清晰:便宜快速的 AI 输出,会催生一笔隐性的下游税负,而这笔账不会出现在 token 单价里。高级工程师拿着高级工程师的时薪,去审查、纠正、重写 AI 生成的代码。按 100 到 200 美元一小时的人力成本来算,如果你省下来的时间有 40% 都花在修 output 上,那用单个便宜模型每月省下的 3,600 美元根本经不起算。
跨家族 review 这一步,能在问题到达人之前就把大部分坑填掉。不同家族的 review model 能发现生成模型系统性地遗漏的东西——重复模式、安全漏洞、逻辑错误。多调一次 AI 的成本,比资深工程师 debug 的时间便宜好几个数量级。
给任务配对合适的 model
多 AI 不是无脑堆模型就行,第一条成本优化原则就是把 model 的能力和任务需求对齐。拿三个纯文本 model 去做图像识别,效果不如用一个原生支持 vision 的 model,花费还更高。组合方式比数量更重要。
说白了就是别浪费。要分析图片,就用原生处理图片的 model,别逼着文本 model 靠描述去猜。要生成代码,就用代码能力突出的 model,别凑合用一个"也能写代码"的通用 model。model 选错了,token 烧出来的是平庸的 output,回头还得重新生成或者修修补补。
其实企业用户已经在凭直觉这么干了。Perplexity 的内部数据显示,在他们平台上,编程类查询用得最多的是 Claude,而其他任务类型各有各的领先 model。基于任务的自然路由已经在发生了——开发者会根据 model 的口碑强项来选择,哪怕还没有正式的路由基础设施。
成本上的启示很简单:在加第二个、第三个 model 做 review 之前,先确认你的主任务用的是对的 model。一个能力够强的 model 把初稿做好,output 质量上去了,后面 review 的工作量自然就下来了。第 6 章会更系统地聊 model 家族的强项和配对策略。
执行顺序
这部分是我用 Dev Buddy 搭多 AI pipeline 时的实战观察,不是什么同行评审的结论。但逻辑链条很清晰,我觉得值得做一组对照实验来验证。

路径 A(推荐):一个能力强、价格贵的 model 负责主要生成,另一个不同家族的便宜 model 负责 review。总共:1 次贵调用 + 1 次便宜调用。强 model 第一把就能输出高质量结果,便宜 model 不需要从头生成,只需要抓跨家族的盲点。review 比 generation 简单,所以便宜 model 完全 hold 得住。
路径 B(常见但烧钱):便宜 model 负责主要生成。贵 model review 后发现问题。便宜 model 修。贵 model 再 review。总共:1 次便宜调用 + N 次贵的 review 调用。一开始省的那点钱,全被好几轮昂贵的 review 和迭代吃掉了。
以我的经验,路径 A 花钱更少,产出也更好。生成和 review 是两种不同的任务,对能力的要求也不一样。生成需要深厚的领域知识,需要从零开始产出高质量结果的能力。review 需要的是在已有 output 里揪出错误和盲点——这件事便宜 model 经常做得不错,尤其是当它带来不同训练视角的时候。
话说回来,这只是我观察到的 pattern,不是受控实验的结论。这个假设——执行顺序会显著影响多 AI pipeline 的成本和质量——值得用同一组任务做严格的 benchmark,把总成本连同人工修正的时间一起算进去。
按任务风险弹性伸缩
不是所有事情都需要多 AI。如果便宜 model 就能搞定——比如总结一篇简单文档、回答一个事实性问题、生成一段 boilerplate 代码——那就别把贵 model 拉进来。多 AI 是用在正确性很关键、盲点代价很高的场景里的。

Microsoft 在 2025 年 5 月的一篇论文里提出了 cascade 方案,思路很具体:先从单 agent 起步,只有任务确实需要时才升级到多 agent。他们的混合方案实现了 1.1% 到 12% 的准确率提升,同时比纯单 agent 或纯多 agent 方案节省高达 20% 的成本。省在哪?省在不给不需要多 agent 的任务白白付那笔开销。
决策框架可以这样拆:
- 简单任务、低风险:单 model。快、便宜、够用。一封模板邮件没必要让三个 model 来审。
- 简单任务、高风险:单 model + 一次跨家族 review。医疗信息类的回答可能很简单,但出了错后果很严重。
- 复杂任务、低风险:单 model + 抽查。反正后面有多人 review 的内部草稿,不需要跑一整条 pipeline。
- 复杂任务、高风险:完整多 AI pipeline。金融分析、法律合同审查、生产环境代码部署——这些场景值得付出开销。
最常见的错误就是把多 AI 当成非黑即白。真正划算的做法是分级:任务风险多大,就配多少 model。
ROI 的鸿沟
更大范围来看,AI 成熟度的 ROI 数据能说明为什么成本问题不能只看 token 单价。这些数据衡量的是 AI 落地的整体成熟度,并不是专门针对跨家族多 AI 的,但它们能让我们看到"把 AI 做好"和"把 AI 做糙"之间有多大差距。

在成熟 AI 实践上投入的公司——有质量保证、有系统化评估、有结构化工作流——每投 1 美元能拿回 3.70 到 10.30 美元。而成熟度不够的团队呢?每投 1 美元大概只能拿回 0.20 美元。经验丰富的组织平均 ROI 是 4.3%,1.2 年回本;成熟度低的组织只有 0.2% ROI,1.6 年才能回本。差距是 21 倍。
这些是 IDC 和 Microsoft 的通用 AI 成熟度指标,不是专门针对多 AI 的测量。但跨家族多 AI 本身就是成熟度差距的一部分。愿意在质量上投入的组织——跨家族 review、系统化评估、结构化工作流——回报远远好于那些只盯着最低 token 单价来优化的组织。
最便宜的 AI 不等于最划算的 AI。最划算的 AI,是产出结果让你不用返工的 AI。
许可
Article text © 2026 Mark Huang. Licensed under Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0) unless otherwise noted. 文章文本可在非商业场景下分享或翻译,但需标注原文 URL。商业使用需事先取得书面许可,并清楚引用原始来源。
代码片段、截图、第三方素材和网站源码可能适用单独条款。
建议署名: Based on "成本问题:什么时候多 AI 能收回成本" by Mark Huang, originally published at https://markhuang.ai/zh/blog/cross-family-multi-ai-cost-analysis.
相关文章

为什么一个 AI 永远不够
医学、法律、科学和金融等高风险行业都要求独立复核,AI 却常常跳过这一步。37% 的企业已经使用 5 个以上模型,但多数仍是临时拼接。跨模型家族多 AI 系列第一章。
阅读文章
下一段路:建立跨模型家族的 AI 实践
从单一模型到自优化的五级成熟度模型,面向个人、团队和企业的可执行下一步,以及对仍需补齐的证据缺口的坦诚整理。跨模型家族多 AI 系列第六章。
阅读文章
集成智能背后的科学
群体智慧遇上 AI:多样化 LLM 集成超过 67% 的单一模型,F1 分数从 0.55 提升到 0.80 以上,而 56.9% 的最佳方案来自最弱模型。跨模型家族多 AI 系列第二章。
阅读文章