📅 2026年7月1日

从"堆 token"到抠成本:OpenAI 和 Anthropic 面对的 AI 效率新现实(2026)

2026 年 6 月,CNBC 报道企业 AI 支出从"tokenmaxxing 堆 token"转向抠成本、要 ROI。本文解析这件事是什么、影响谁、中小团队怎么应对。

从"堆 token"到抠成本:OpenAI 和 Anthropic 面对的 AI 效率新现实(2026)

2026 年 6 月 26 日,CNBC 发出一篇刷屏的报道:OpenAI 和 Anthropic 正在面对一个全新的 AI 效率现实——企业不再无脑「堆 token」,而是开始盯 AI token 成本、要 ROI、找更便宜的替代方案。这场从「tokenmaxxing」到「抠成本」的转向,对两大 AI 巨头、对每一个在用 AI 的团队都影响巨大。本文帮你把这件事讲清楚:它到底是什么、发生了什么、又该怎么应对。

什么是 tokenmaxxing?为什么现在企业不玩了

tokenmaxxing 指的是过去两年里那种「能用多少 AI 就用多少」的风气——公司鼓励开发者往模型里灌尽可能多的 token,用「用得多」来证明「在干活」,而不太管实际产出。据 CNBC 的报道,过去很长一段时间里,企业 AI 支出遵循的是「先花钱、后优化」的逻辑。

问题在于,用量涨得比价值快。当账单越来越吓人、ROI 却讲不清楚时,曾经拼命推大家多用前沿模型的公司,现在反过来要更清晰的回报、更紧的管控和更低价的替代品。tokenmaxxing 的时代,正在结束。

发生了什么:Uber、Lindy 的真实案例

这不是空谈,已经有实打实的动作。CNBC 报道,Uber 对部分 AI 工具设了支出分级,基础档为每月 1,500 美元,员工要用更高额度得单独申请。换句话说,token 不再是随便花的。

更极端的是 AI 创业公司 Lindy:其 CEO 直接把公司 100% 的流量从 Anthropic 的 Claude 切到了 DeepSeek,并表示成本曲线因此大幅下降。一家公司愿意整体迁移模型,说明「省钱」已经压过了「用最强的」。

对 OpenAI 和 Anthropic 意味着什么

短期看,两家依然在高速增长——但增速的天花板可能就在眼前。CNBC 引述投行 D.A. Davidson 分析师的话,OpenAI 和 Anthropic 当前的增长率很可能是它们此生最快的一段,风险在于大型企业客户开始给失控的 token 支出设限。

这件事的时机也很微妙。就在本月初,两家先后递交了 IPO 材料:Anthropic 于 6 月 1 日保密提交草拟 S-1OpenAI 一周后的 6 月 8 日跟进。也就是说,两家正一边冲刺上市、一边直面「客户要开始抠成本」的叙事,投资人会怎么给这个故事定价,值得盯着看。

前沿旗舰 vs 低价替代:钱花在哪

在「抠成本」的语境下,理解模型的分层很关键(下表为公开信息下的相对定位,非精确报价):

模型层级 代表 适合场景 成本相对
前沿旗舰 Claude Opus、GPT 顶配、Gemini Pro 最难的推理、长上下文、高价值任务 最高
中端主力 Claude Sonnet、Gemini Flash 日常编码、客服、内容生成
低价 / 开源 DeepSeek、智谱 GLM 等 大批量、可容错、成本敏感 最低

关键不是「哪个最强」,而是「哪个任务配哪一层」。

Marco 观点:中小团队现在该怎么做

我的判断是:这轮转向对中小团队是利好,不是坏消息。过去你可能觉得「不上最贵的模型就落后」,现在行业自己承认——大部分活儿根本用不到旗舰。真正该做的是「分层」:把 80% 的日常任务放到中端或开源模型上,只在最难、最值钱的环节请出旗舰。

但也别为了省钱盲目全切。Lindy 敢 100% 迁到 DeepSeek,是因为它的场景容错高;如果你的业务对准确率、稳定性、数据合规要求很高,贸然全迁可能省了 token 却赔上返工成本。对中文用户,我的取舍建议是:先量化,再切换——没有账单和质量数据支撑的迁移都是赌博。

现在怎么上手抠成本?可复现步骤

  1. 先看账单结构:在你用的平台(OpenAI / Anthropic Console 等)导出近 30 天用量,按「哪个功能烧了最多 token」排序,找出前三名。
  2. 给任务分层:把这前三名逐个问自己「这真的需要旗舰模型吗」,把可降级的换成中端或开源模型。
  3. 设预算护栏:学 Uber 的做法,给团队或项目设月度额度上限,超了要申请,避免失控。
  4. 小流量 A/B:迁移前先拿 5%–10% 流量在低价模型上跑,对比质量和成本,达标再放量。
  5. 固化到工作流:把「默认用便宜模型、必要时升级」写进团队规范或 AI 网关配置,让省钱变成默认项而不是靠自觉。

常见问题 FAQ

Q:tokenmaxxing 是什么意思? A:指过去企业鼓励员工尽可能多地使用 AI、往模型里灌大量 token,以「用量」代替「产出」的做法,如今正被「要 ROI、控成本」取代。

Q:企业为什么突然开始砍 AI 预算? A:不是砍需求,而是要效率。用量增长快过实际价值、账单变高却讲不清回报,于是转向更严的管控和更低价的替代模型。

Q:换成 DeepSeek、GLM 这类低价模型靠谱吗? A:要看场景。容错高、批量大的任务性价比很高;但对准确率、稳定性、合规要求高的核心业务,建议先小流量对比验证再迁移。

Q:这对 AI 巨头是利空吗? A:短期两家仍在高速增长,但分析师提醒当前增速可能是峰值,客户设限是主要风险,叠加两家正在冲刺 IPO,市场定价会更谨慎。

延伸阅读

写在最后

从「堆 token」到「抠成本」,AI 行业正在从跑马圈地进入精打细算。对巨头是挑战,对普通团队反而是解放:你终于可以理直气壮地问一句「这个任务真的需要最贵的模型吗」。学会给任务分层、给预算设护栏,你的 AI 成本能降下来,效果还不打折。

觉得有用就关注 Marco聊科技,订阅我们的免费 AI 资源——我会持续拆解 AI 工具的省钱玩法和实战工作流,帮你把每一分 token 都花在刀刃上。

Marco聊科技 — AI 工具 · 教程 · 自动化

Marco 分享最新的 AI 工具评测、Claude / ChatGPT / Gemini 深度教程,以及 AI 自动化与效率提升技巧,帮助你在 AI 时代保持领先。以下是最新发布的文章:

查看全部文章 →