从"堆 token"到抠成本:OpenAI 和 Anthropic 面对的 AI 效率新现实(2026)
2026 年 6 月,CNBC 报道企业 AI 支出从"tokenmaxxing 堆 token"转向抠成本、要 ROI。本文解析这件事是什么、影响谁、中小团队怎么应对。
2026 年 6 月 26 日,CNBC 发出一篇刷屏的报道:OpenAI 和 Anthropic 正在面对一个全新的 AI 效率现实——企业不再无脑「堆 token」,而是开始盯 AI token 成本、要 ROI、找更便宜的替代方案。这场从「tokenmaxxing」到「抠成本」的转向,对两大 AI 巨头、对每一个在用 AI 的团队都影响巨大。本文帮你把这件事讲清楚:它到底是什么、发生了什么、又该怎么应对。
什么是 tokenmaxxing?为什么现在企业不玩了
tokenmaxxing 指的是过去两年里那种「能用多少 AI 就用多少」的风气——公司鼓励开发者往模型里灌尽可能多的 token,用「用得多」来证明「在干活」,而不太管实际产出。据 CNBC 的报道,过去很长一段时间里,企业 AI 支出遵循的是「先花钱、后优化」的逻辑。
问题在于,用量涨得比价值快。当账单越来越吓人、ROI 却讲不清楚时,曾经拼命推大家多用前沿模型的公司,现在反过来要更清晰的回报、更紧的管控和更低价的替代品。tokenmaxxing 的时代,正在结束。
发生了什么:Uber、Lindy 的真实案例
这不是空谈,已经有实打实的动作。CNBC 报道,Uber 对部分 AI 工具设了支出分级,基础档为每月 1,500 美元,员工要用更高额度得单独申请。换句话说,token 不再是随便花的。
更极端的是 AI 创业公司 Lindy:其 CEO 直接把公司 100% 的流量从 Anthropic 的 Claude 切到了 DeepSeek,并表示成本曲线因此大幅下降。一家公司愿意整体迁移模型,说明「省钱」已经压过了「用最强的」。
对 OpenAI 和 Anthropic 意味着什么
短期看,两家依然在高速增长——但增速的天花板可能就在眼前。CNBC 引述投行 D.A. Davidson 分析师的话,OpenAI 和 Anthropic 当前的增长率很可能是它们此生最快的一段,风险在于大型企业客户开始给失控的 token 支出设限。
这件事的时机也很微妙。就在本月初,两家先后递交了 IPO 材料:Anthropic 于 6 月 1 日保密提交草拟 S-1,OpenAI 一周后的 6 月 8 日跟进。也就是说,两家正一边冲刺上市、一边直面「客户要开始抠成本」的叙事,投资人会怎么给这个故事定价,值得盯着看。
前沿旗舰 vs 低价替代:钱花在哪
在「抠成本」的语境下,理解模型的分层很关键(下表为公开信息下的相对定位,非精确报价):
| 模型层级 | 代表 | 适合场景 | 成本相对 |
|---|---|---|---|
| 前沿旗舰 | Claude Opus、GPT 顶配、Gemini Pro | 最难的推理、长上下文、高价值任务 | 最高 |
| 中端主力 | Claude Sonnet、Gemini Flash | 日常编码、客服、内容生成 | 中 |
| 低价 / 开源 | DeepSeek、智谱 GLM 等 | 大批量、可容错、成本敏感 | 最低 |
关键不是「哪个最强」,而是「哪个任务配哪一层」。
Marco 观点:中小团队现在该怎么做
我的判断是:这轮转向对中小团队是利好,不是坏消息。过去你可能觉得「不上最贵的模型就落后」,现在行业自己承认——大部分活儿根本用不到旗舰。真正该做的是「分层」:把 80% 的日常任务放到中端或开源模型上,只在最难、最值钱的环节请出旗舰。
但也别为了省钱盲目全切。Lindy 敢 100% 迁到 DeepSeek,是因为它的场景容错高;如果你的业务对准确率、稳定性、数据合规要求很高,贸然全迁可能省了 token 却赔上返工成本。对中文用户,我的取舍建议是:先量化,再切换——没有账单和质量数据支撑的迁移都是赌博。
现在怎么上手抠成本?可复现步骤
- 先看账单结构:在你用的平台(OpenAI / Anthropic Console 等)导出近 30 天用量,按「哪个功能烧了最多 token」排序,找出前三名。
- 给任务分层:把这前三名逐个问自己「这真的需要旗舰模型吗」,把可降级的换成中端或开源模型。
- 设预算护栏:学 Uber 的做法,给团队或项目设月度额度上限,超了要申请,避免失控。
- 小流量 A/B:迁移前先拿 5%–10% 流量在低价模型上跑,对比质量和成本,达标再放量。
- 固化到工作流:把「默认用便宜模型、必要时升级」写进团队规范或 AI 网关配置,让省钱变成默认项而不是靠自觉。
常见问题 FAQ
Q:tokenmaxxing 是什么意思? A:指过去企业鼓励员工尽可能多地使用 AI、往模型里灌大量 token,以「用量」代替「产出」的做法,如今正被「要 ROI、控成本」取代。
Q:企业为什么突然开始砍 AI 预算? A:不是砍需求,而是要效率。用量增长快过实际价值、账单变高却讲不清回报,于是转向更严的管控和更低价的替代模型。
Q:换成 DeepSeek、GLM 这类低价模型靠谱吗? A:要看场景。容错高、批量大的任务性价比很高;但对准确率、稳定性、合规要求高的核心业务,建议先小流量对比验证再迁移。
Q:这对 AI 巨头是利空吗? A:短期两家仍在高速增长,但分析师提醒当前增速可能是峰值,客户设限是主要风险,叠加两家正在冲刺 IPO,市场定价会更谨慎。
延伸阅读
- Claude Code 是什么?新手安装教程 + 第一个项目实操(2026完整指南)
- GLM-5.2 智谱开源模型解析:能力、价格与怎么用(2026)
- Google Gemini 3.5 Pro 是什么?200 万 token 上下文 + Deep Think 全解析(2026)
写在最后
从「堆 token」到「抠成本」,AI 行业正在从跑马圈地进入精打细算。对巨头是挑战,对普通团队反而是解放:你终于可以理直气壮地问一句「这个任务真的需要最贵的模型吗」。学会给任务分层、给预算设护栏,你的 AI 成本能降下来,效果还不打折。
觉得有用就关注 Marco聊科技,订阅我们的免费 AI 资源——我会持续拆解 AI 工具的省钱玩法和实战工作流,帮你把每一分 token 都花在刀刃上。