跳转到主要内容

成本问题:什么时候多 AI 能收回成本

多 AI 的 token 成本可能高出 3 到 4 倍,但组织会把 40% 的 AI 生产力收益浪费在返工上。本文讨论执行顺序、按任务缩放,以及成熟与不成熟 AI 实践之间 21 倍 ROI 差距。跨模型家族多 AI 系列第五章。

12 分钟阅读
分享:
AI 驱动

AI 驱动 · 每小时限 20 次请求

多 AI 更贵——这是我听到最多的质疑,而且说得没毛病。前期成本确实会上涨,但最终能不能拉低 TCO,得看具体场景。

前期成本是实打实的

多 agent 系统消耗的 token 量大约是单次对话的 15 倍。扣除 agent 间通信、检索开销和日志记录,实际成本倍率大概在 3 到 4 倍。有一家电商公司上线多 agent 工作流之后,月度 LLM 账单直接从 1,200 美元飙到 4,800 美元。

这个数字不该被轻描淡写地糊弄过去。AI 开支涨了三四倍,你得拿出理由来。"值得"不能靠感觉,得靠数据。

TCO 对比
TCO 对比

后面我会论证一件事:把账算全了,多 AI 往往比单 AI 还省钱。但我得先把话说明白——标价确实更高。你要是对成本问题避而不谈,管预算的人根本不会听你往下说。

便宜 AI 的返工税

前期投入不等于总成本。Workday 2026 年的调研显示,企业大约 40% 的 AI 生产力收益被消耗在修复低质量产出上。AI 帮你省了 10 个小时,差不多有 4 个小时又花在纠错、澄清和重写上。

这跟我实际观察到的完全吻合。GitClear 对 AI 辅助代码的分析发现,代码克隆增长了大约 4 倍——代码写得飞快,但留下一堆技术债等着后人来擦屁股。Stanford 的研究更有意思:用 AI 代码助手的开发者,写出的代码安全性更差,但他们自己反而觉得更安全。AI 给了他们一种虚假的安全感,而那些被引入的漏洞,最后还得靠资深工程师花时间去排查和修补。

规律很清晰:便宜快速的 AI 输出,会催生一笔隐性的下游税负,而这笔账不会出现在 token 单价里。高级工程师拿着高级工程师的时薪,去审查、纠正、重写 AI 生成的代码。按 100 到 200 美元一小时的人力成本来算,如果你省下来的时间有 40% 都花在修 output 上,那用单个便宜模型每月省下的 3,600 美元根本经不起算。

跨家族 review 这一步,能在问题到达人之前就把大部分坑填掉。不同家族的 review model 能发现生成模型系统性地遗漏的东西——重复模式、安全漏洞、逻辑错误。多调一次 AI 的成本,比资深工程师 debug 的时间便宜好几个数量级。

给任务配对合适的 model

多 AI 不是无脑堆模型就行,第一条成本优化原则就是把 model 的能力和任务需求对齐。拿三个纯文本 model 去做图像识别,效果不如用一个原生支持 vision 的 model,花费还更高。组合方式比数量更重要。

说白了就是别浪费。要分析图片,就用原生处理图片的 model,别逼着文本 model 靠描述去猜。要生成代码,就用代码能力突出的 model,别凑合用一个"也能写代码"的通用 model。model 选错了,token 烧出来的是平庸的 output,回头还得重新生成或者修修补补。

其实企业用户已经在凭直觉这么干了。Perplexity 的内部数据显示,在他们平台上,编程类查询用得最多的是 Claude,而其他任务类型各有各的领先 model。基于任务的自然路由已经在发生了——开发者会根据 model 的口碑强项来选择,哪怕还没有正式的路由基础设施。

成本上的启示很简单:在加第二个、第三个 model 做 review 之前,先确认你的主任务用的是对的 model。一个能力够强的 model 把初稿做好,output 质量上去了,后面 review 的工作量自然就下来了。第 6 章会更系统地聊 model 家族的强项和配对策略。

执行顺序

这部分是我用 Dev Buddy 搭多 AI pipeline 时的实战观察,不是什么同行评审的结论。但逻辑链条很清晰,我觉得值得做一组对照实验来验证。

执行顺序对比
执行顺序对比

路径 A(推荐):一个能力强、价格贵的 model 负责主要生成,另一个不同家族的便宜 model 负责 review。总共:1 次贵调用 + 1 次便宜调用。强 model 第一把就能输出高质量结果,便宜 model 不需要从头生成,只需要抓跨家族的盲点。review 比 generation 简单,所以便宜 model 完全 hold 得住。

路径 B(常见但烧钱):便宜 model 负责主要生成。贵 model review 后发现问题。便宜 model 修。贵 model 再 review。总共:1 次便宜调用 + N 次贵的 review 调用。一开始省的那点钱,全被好几轮昂贵的 review 和迭代吃掉了。

以我的经验,路径 A 花钱更少,产出也更好。生成和 review 是两种不同的任务,对能力的要求也不一样。生成需要深厚的领域知识,需要从零开始产出高质量结果的能力。review 需要的是在已有 output 里揪出错误和盲点——这件事便宜 model 经常做得不错,尤其是当它带来不同训练视角的时候。

话说回来,这只是我观察到的 pattern,不是受控实验的结论。这个假设——执行顺序会显著影响多 AI pipeline 的成本和质量——值得用同一组任务做严格的 benchmark,把总成本连同人工修正的时间一起算进去。

按任务风险弹性伸缩

不是所有事情都需要多 AI。如果便宜 model 就能搞定——比如总结一篇简单文档、回答一个事实性问题、生成一段 boilerplate 代码——那就别把贵 model 拉进来。多 AI 是用在正确性很关键、盲点代价很高的场景里的。

什么时候用单 AI,什么时候用多 AI
什么时候用单 AI,什么时候用多 AI

Microsoft 在 2025 年 5 月的一篇论文里提出了 cascade 方案,思路很具体:先从单 agent 起步,只有任务确实需要时才升级到多 agent。他们的混合方案实现了 1.1% 到 12% 的准确率提升,同时比纯单 agent 或纯多 agent 方案节省高达 20% 的成本。省在哪?省在不给不需要多 agent 的任务白白付那笔开销。

决策框架可以这样拆:

  • 简单任务、低风险:单 model。快、便宜、够用。一封模板邮件没必要让三个 model 来审。
  • 简单任务、高风险:单 model + 一次跨家族 review。医疗信息类的回答可能很简单,但出了错后果很严重。
  • 复杂任务、低风险:单 model + 抽查。反正后面有多人 review 的内部草稿,不需要跑一整条 pipeline。
  • 复杂任务、高风险:完整多 AI pipeline。金融分析、法律合同审查、生产环境代码部署——这些场景值得付出开销。

最常见的错误就是把多 AI 当成非黑即白。真正划算的做法是分级:任务风险多大,就配多少 model。

ROI 的鸿沟

更大范围来看,AI 成熟度的 ROI 数据能说明为什么成本问题不能只看 token 单价。这些数据衡量的是 AI 落地的整体成熟度,并不是专门针对跨家族多 AI 的,但它们能让我们看到"把 AI 做好"和"把 AI 做糙"之间有多大差距。

成熟与不成熟 AI 实践之间的 ROI 鸿沟
成熟与不成熟 AI 实践之间的 ROI 鸿沟

在成熟 AI 实践上投入的公司——有质量保证、有系统化评估、有结构化工作流——每投 1 美元能拿回 3.70 到 10.30 美元。而成熟度不够的团队呢?每投 1 美元大概只能拿回 0.20 美元。经验丰富的组织平均 ROI 是 4.3%,1.2 年回本;成熟度低的组织只有 0.2% ROI,1.6 年才能回本。差距是 21 倍。

这些是 IDC 和 Microsoft 的通用 AI 成熟度指标,不是专门针对多 AI 的测量。但跨家族多 AI 本身就是成熟度差距的一部分。愿意在质量上投入的组织——跨家族 review、系统化评估、结构化工作流——回报远远好于那些只盯着最低 token 单价来优化的组织。

最便宜的 AI 不等于最划算的 AI。最划算的 AI,是产出结果让你不用返工的 AI。

许可

Article text © 2026 Mark Huang. Licensed under Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0) unless otherwise noted. 文章文本可在非商业场景下分享或翻译,但需标注原文 URL。商业使用需事先取得书面许可,并清楚引用原始来源。

代码片段、截图、第三方素材和网站源码可能适用单独条款。

建议署名: Based on "成本问题:什么时候多 AI 能收回成本" by Mark Huang, originally published at https://markhuang.ai/zh/blog/cross-family-multi-ai-cost-analysis.