AI不能拖欠工资:Uber四个月烧光全年AI预算,Agent成本黑洞有多深
2026年技术圈流传着一个新段子:公司裁掉程序员用AI写代码,Token账单爆炸之后,又悄悄把程序员招了回来。
段子听起来荒诞,数据更荒诞。Uber,一家市值1460亿美元的科技巨头,2026年全年AI预算在四个月内全部烧光。CTO本人两小时演示烧掉1200美元。COO在全员会上说"这是一个让人头爆炸的时刻",因为公司找不到AI使用量和产品体验提升之间的因果关系。
这是《AI下半场:Agent淘金热》系列的第一篇。上一个系列《AI代码冲击波》12篇讲的是"AI来了怎么办",这个系列讲的是"AI时代怎么赢"。从"怎么活下来"到"怎么赢",中间横亘着一条裂缝,裂缝的名字叫成本。
Agent的账单,正在成为2026年企业技术支出中增长最快、最不可预测、也最令人恐慌的条目。这篇文章把能找到的真实数据摊开,看看Agent的成本黑洞到底有多深,以及那些没被黑洞吞掉的企业做对了什么。
一、"AI不能拖欠工资"的真相:Uber预算爆炸全复盘
1.1 四个月烧光全年预算
2025年12月,Uber向5000名工程师全面部署Claude Code,配套上线了一个内部排行榜,按团队AI工具使用量排名。激励机制立竿见影。到2026年2月,32%的工程师在使用AI编程工具;3月这个数字冲到84%;到春季达到95%。约70%的已提交代码来自AI辅助生成。
然后预算崩了。
2026年4月,Uber CTO Praveen Neppalli Naga在一次内部会议上宣布:公司2026年全年的AI预算已经全部用完。主要流向两个产品,Anthropic的Claude Code和Cursor。
Naga本人在一次两小时的个人Claude Code演示中,烧掉了1200美元。按这个速率推算,单个重度用户的月消耗在500到2000美元之间。5000名工程师乘以这个数字,预算模型瞬间崩塌。
Uber随即出台规定:每名员工每个AI工具的月度使用额度封顶1500美元。这个限额按工具分别计算,Cursor的花销不影响Claude Code的额度。公司同时部署了内部仪表盘,让员工实时追踪AI活动和成本,并建立了正式的审批流程,工程师需要申请才能突破标准限额。
Uber股价在预算消息披露当天下跌3.1%。
| 指标 | 数值 | 来源 |
|---|---|---|
| Uber全年AI预算耗尽时间 | 4个月(2026年1-4月) | The Information |
| CTO两小时Claude Code费用 | 1200美元 | saassentinel.com |
| 单工程师月度AI消耗 | 500-2000美元 | Forbes |
| 新规月度限额 | 1500美元/人/工具 | Uber CTO公开声明 |
| 工程师AI工具使用率 | 32%(2月)→84%(3月)→95%(春季) | Forbes/a16z报告 |
| AI辅助生成代码占比 | 约70%已提交代码 | Forbes |
| AI编写后端代码更新占比 | 约11% | saassentinel.com |
| Uber市值 | 约1464亿美元 | saassentinel.com |
1.2 COO的"头爆炸时刻"
预算爆炸本身是一个技术问题。更深层的问题出在ROI上。
2026年5月26日,Uber总裁兼COO Andrew Macdonald在《Rapid Response》播客上公开表示:“也许确实有更多东西在交付,但你很难从那些AI使用数据里画出一条线,连到’OK,我们现在真的多产出了25%有用的消费者功能’。”
这句话的杀伤力远超预算数字。Uber是硅谷最"AI-forward"的公司之一,AI已经深度嵌入定价、匹配、ETA预测等核心业务。但即便如此,当AI工具从"辅助"变成"基础设施",COO说不清这笔钱到底换回了什么。
Uber部署了内部仪表盘追踪实时AI活动和成本。但仪表盘能追踪的是花费,追踪不了价值。这正是整个行业面临的困境:Token消耗量不等于生产力提升。
1.3 Uber不是个例
Uber的预算爆炸在2026年引发连锁反应。
Microsoft在公司范围内撤回了Claude Code许可证,原因同样是每位工程师月度账单攀升到500至2000美元。一家咨询公司在一个月内仅在Claude上的花费就达到5亿美元。Gartner分析显示,Agentic AI模型每项任务所需的Token数量是标准聊天机器人的5到30倍。
微软CEO Satya Nadella在DeepSeek发布低成本模型时引用了一句经济学名言:"Jevons Paradox strikes again。"这句话准确概括了2026年AI成本的核心矛盾。
二、杰文斯悖论:Token越便宜,账单越重
2.1 一个160年前的经济学预言
1865年,英国经济学家William Stanley Jevons发现了一个反直觉现象:蒸汽机效率提升后,煤炭总消耗量反而飙升。原因很简单,效率提升降低了单位成本,降低了成本使更多应用场景变得经济可行,新增需求超过了单位消耗的减少。
160年后,这个悖论在AI领域完美复现。
| 时间维度 | Token价格变化 | 企业AI总支出变化 |
|---|---|---|
| GPT-3时代(2022年末) | 20美元/百万Token | 企业AI预算约120万美元/年 |
| 2024年 | 价格大幅下降 | 企业AI预算增长启动 |
| 2026年 | 约0.40美元/百万Token(降98%) | 企业AI预算约700万美元/年 |
| 价格下降倍数 | 约1000倍 | 总支出增长约6倍 |
Token价格降了接近1000倍。企业总支出涨了数倍。这组数据本身就是Jevons悖论的最佳注脚。
2.2 为什么单价降了,总账单反而涨了
根源在于使用范式的迁移。
过去两年的企业AI使用以对话为主。用户输入一段文字,模型返回一段回答,一次会话消耗约5000 Token,成本几美分。
Agent来了之后,范式彻底变了。Agent会规划、调用工具、循环推理、执行多步任务,不需要人盯着就能24小时运行。一名员工背后可能挂着10个Agent,用量可达纯人工交互的数十倍。
Microsoft Research在2026年给出一个关键数据:Agentic工作负载的Token消耗量约为标准聊天交互的1000倍。同一个任务,作为一次性聊天查询花费几美分,重构成Agent则花费数美元。
更具体的数据来自EY的测算:2023年一次简单聊天机器人交互成本约0.04美元,2026年一次编排型Agent交互成本约1.20美元,接近30倍。同期Token单价持续下降,但Agent每项任务消耗的Token数量远超聊天机器人,总账单反而上涨。
CGI的独立分析发现,模型账单只占AI总成本的不到30%,超过70%的成本藏在编排、检索、重试、可观测性和应用架构中。企业盯着Token单价做预算,漏掉了真正的成本大头。
2.3 Token放大效应
Biggo Finance的研究描述了一种"Token Amplification Effect"。因为大语言模型缺乏真正的记忆和认知,对话中每一次追问都会重新加载并处理整个聊天历史。当AI Agent执行多阶段任务时,比如查询报告、拉取CRM数据、进行网络搜索、生成报告,它可能在后台默默消耗数百万Token。
一个看似简单的查询,在需要反复重试和复杂推理的条件下,单次成本可以从1美元膨胀到10美元。如果企业将这个任务设置为每15分钟刷新一次,月度成本从2880美元飙升到28800美元。
2026年3月,全球单周Token调用量达到20.4万亿。中国日均调用量突破140万亿,较2024年初增长超过千倍。Anthropic的年化收入从2025年底的90亿美元增长到2026年5月的440亿美元以上。
Satya Nadella说"Jevons Paradox strikes again"的时候,他知道自己在说什么。
三、Agent为什么这么烧钱
3.1 从一次API调用到多步推理链
聊天机器人的成本模型很简单,一次API调用,几百到几千Token,几美分到几毛钱。
Agent的成本模型完全不同。一个典型的Agent任务包含以下步骤,每一步都在烧Token:
- 系统提示加载(包含工具描述、角色定义、约束规则)
- 上下文加载(检索相关文档、加载历史对话)
- 规划推理(拆解任务、制定执行计划)
- 工具调用(调用外部API,每次调用都消耗Token描述工具和解析结果)
- 结果验证(检查工具返回值,判断是否需要重试)
- 重试循环(失败后重新规划、重新调用)
- 上下文重载(每一步推理都可能重新发送完整上下文)
- 子Agent生成(复杂任务会生成子Agent,各自消耗Token)
The Modern Data Company的分析指出,工具描述开销是Agent成本中的隐形杀手。每个工具必须在系统提示中描述清楚,让模型知道何时以及如何使用它。Anthropic自己的研究表明,Agent在工具数量超过15个时准确率显著下降,超过50个时直接崩溃,而Token成本随工具数量线性增长。
结果是,系统提示本身就可能在用户输入第一个字之前消耗数万Token。每个添加到Agent中的工具都是一笔在每次调用时都要付出的成本,无论该工具是否被使用。
3.2 Agent成本是O(n²)的
上一系列《AI代码冲击波》第03篇拆解过删库事故的成本结构,这里的核心结论同样适用:Agent成本不是线性的,是平方级的。
一个5步循环的Agent任务,成本约为单次调用的155倍。原因是每一步都可能触发重试,每次重试都带完整上下文,上下文越长越贵。如果一个Agent有5个工具、每步推理3轮、每轮带10000 Token上下文,一次完整任务可能消耗15万Token以上。
极端案例更触目惊心。上一系列记录过几个标志性翻车:一个$47K的LangChain循环,4个Agent通过A2A协议进行了11天264小时的无限对话循环;一个Claude Code递归,5小时消耗16.7亿Token,产生253个usage limit错误仍未终止,账单在16K到50K美元之间。
3.3 七种烧钱模式
根据多份企业部署复盘报告,Agent的Token浪费主要集中在七种模式:
递归循环。Agent无限自我调用,像while(true)但没有break。一次循环可能持续数小时甚至数天,直到预算熔断或人工介入。
上下文膨胀。每次重试都带上全部历史,上下文越滚越长。一个本该消耗5000 Token的任务,在3轮重试后可能膨胀到50000 Token。
工具链爆炸。一个任务调用20个以上MCP工具,每个工具的描述和结果解析都要消耗Token。系统提示本身可能就占去一半上下文。
幻觉重试。Agent给了错误答案,用户追问补充,Agent再犯错,循环往复。每一次交互都是一次完整的上下文重载。
多Agent通信税。A2A协议下Agent间对话的Token消耗不亚于API调用。4个Agent协作的Token量可能是单Agent的4倍以上。
未优化的系统提示。冗长的系统提示在每次对话中都重新发送。一个5000 Token的系统提示,在100次交互中就多消耗50万Token。
缓存未命中。同样的上下文被反复重新计算。Anthropic的Prompt Caching可以在命中时提供50%到90%的折扣,但很多企业根本没开启。
3.4 结构性矛盾:越自主越贵
这七种烧钱模式指向同一个结构性矛盾:Agent越自主,调用链越长,成本越高。这是一个正反馈循环。Agent能力提升,企业部署更多Agent,使用量增加,成本上升。能力越强,越想让它自主,越自主调用越多,账单越贵。
Gartner数据显示,全球AI Agent软件支出在2026年达到2065亿美元,同比增长139%,是企业技术史上增长最快的软件品类。同期的Gartner预测更加刺眼:到2027年底,超过40%的Agentic AI项目将被取消,原因前三名是成本失控、商业价值不明确、风险管控不足。
四、谁在为Agent买单
4.1 成本光谱:从免费到天价
Agent的成本不是均匀分布的。根据企业规模和使用模式,差距可以从几个数量级。
个人开发者。Cursor Pro月费20美元,无限使用。重度使用Claude Code的账单在200到500美元之间,取决于使用强度。本地部署Ollama加Qwen模型,成本为零(已有GPU的前提下),体验略逊但免费。
创业公司。Deloitte报告显示,Agent项目的年运营成本轻松突破40万美元。基本实施费用在1.5万到4万美元之间,中端部署4万到12万美元,高级部署超过50万美元且没有上限。
中型企业。API账单每月5万到20万美元,财务部门正在恐慌。Glean的企业部署成本分析给出了这个区间。很多企业的预算批准基于Demo经济模型,即受控场景下的Token成本,但生产环境的边缘案例处理、检索层、编排层全部在运行后,成本在上线约六个月后开始失控。
大厂。Uber/Meta/Google有自建推理基础设施的优势,但即便如此,Uber的预算模型也在四个月内崩塌。大厂的优势是可以自建,劣势是自建也需要花钱,只是花的钱从API变成了GPU。
| 主体 | 典型月度成本 | 成本特征 | 来源 |
|---|---|---|---|
| 个人开发者(Cursor Pro) | 20美元 | 固定月费,无限使用 | Cursor官方定价 |
| 个人开发者(Claude Code重度) | 200-500美元 | 按量计费,重度使用 | 多家报道 |
| 个人开发者(本地部署) | 0美元 | 已有GPU前提下 | Ollama社区 |
| 创业公司(Agent项目年成本) | 400K+美元/年 | 基础实施15-40K,高级50K+ | Deloitte/Glean |
| 中型企业(API月账单) | 50K-200K | 不可预测,六个月后失控 | Glean分析 |
| 大厂(Uber案例) | 全年预算四个月烧光 | 自建基础设施也扛不住 | The Information |
4.2 价值错位:钱花了,ROI在哪
Uber COO的困惑不是孤例。MIT的 landmark研究分析了300个部署、150位高管访谈、350份员工调研后发现,95%的生成式AI试点没有产生任何可量化的损益影响,尽管投入了300到400亿美元。
S&P Global发现42%的公司在2025年放弃了大部分AI项目。88%的组织在使用AI,但只有6%是捕获到有意义EBIT价值的高绩效者。
Bain在2026年6月对951家公司的调查发现了一个值得注意的数据:90%因AI成本节约不达预期而未达标的公司,反而在增加AI预算。市场已经认定价值是真实的,但还没建好支撑这个信念的成本架构。
这个矛盾是整个2026年AI成本讨论的核心:企业不是在"该不该用AI"上犹豫,是在"怎么把AI用出正回报"上挣扎。
4.3 73%的Token去了最贵的模型
The Modern Data Company引用的企业数据显示,2025年初,约73%的企业Token量被路由到最贵的两个模型层级。一个本可以用每百万Token 0.04美元的模型处理的FAQ回复,跑在每百万Token 180美元的推理引擎上,成本乘以4500倍,输出质量完全相同。
这是模型路由治理的缺失。很多企业的默认策略是所有任务都用最强模型,因为"反正也用不了多少"。当Agent的使用量从每天几十次飙升到每天数万次时,这个默认策略的代价就暴露了。
五、成本控制实战:五个杠杆
5.1 杠杆一:模型分层路由
最立竿见影的降本手段。80%的常规任务用小模型,20%的核心任务用大模型,成本可降60%以上。
具体做法:简单FAQ和格式转换走7B级别的模型,中等复杂度的代码生成和文档分析走14B到70B级别的模型,深度推理和复杂规划走Claude Opus或GPT-5级别的前沿模型。
关键在于路由策略。可以按任务类型静态路由,也可以用一个小模型先判断任务复杂度再动态路由。LiteLLM是一个常用的模型网关,统一管理所有模型提供商,支持自动降级:前沿模型超时或超额时自动切换到备用模型。
招商银行的落地数据显示,大模型投入成本收入比稳定在20%,即每投入20元Token相关成本,可直接产出100元业务增量收益。这个比例的前提是模型路由策略到位。
5.2 杠杆二:Prompt Caching与KV Cache
Anthropic的Prompt Caching在命中时提供50%到90%的折扣。原理很简单,相同的上下文不需要重复计算,缓存直接返回。
典型场景:一个5000 Token的系统提示,如果100次交互都带上它,不缓存就要计算50万Token。开启缓存后,只需要计算一次,后续99次走缓存折扣。
上下文分层压缩技术平均可减少30%到60%的无效Token消耗。多级缓存机制在高频场景下可降低70%以上的重复消耗。这些不是实验室数据,是Anthropic、有道、中国移动等企业已规模落地的实测效果。
5.3 杠杆三:Token预算与熔断机制
Uber的事后措施之一是给每个员工设定1500美元的月度限额。这个思路应该从员工级别延伸到Agent级别。
具体做法:为每个Agent任务设定Token预算上限,超限自动熔断。限制Agent最大步数,N步后强制人工介入。设置工具白名单,不让Agent调用不必要的工具减少链长度。
阿里云在2026年7月WAIC上发布的Agent Native Cloud提供了另一种思路:AgentRun/AgentTeams/AgentLoop的架构下,15个Agent可以7乘24小时处理85%的答疑,运营时长降90%,版本迭代周期从周缩短到天。成本控制的关键不是少用Agent,是让Agent在受控的预算范围内高效运转。
5.4 杠杆四:消耗可视化
Uber部署的内部仪表盘是事后补救。正确的做法是在第一天就建立Token消耗的实时可视化。
艾瑞咨询提出的方案是建立跨平台、跨部门的六维标签体系:部门、项目、岗位、任务类型、模型类型、调用时间。先把"钱花在哪、谁在花、花多少"彻底看清楚,没这一步,后续所有工程优化和配额管控都是盲人摸象。
89%的组织部署了Agent可观测性工具。但可观测性不只是看仪表盘,是要把Token消耗和业务产出关联起来,建立"Cost per Task"指标,追踪每次调用的模型和成本。
5.5 杠杆五:从"省单价"转向"省任务"
腾讯研究院在2026年年中的分析中给出了一个关键判断:行业最终发现,需要优化的不是价目表,是任务本身。
这意味着成本控制的思路从"怎么让每次调用更便宜"升级到"怎么让每个任务用更少的调用完成"。任务拆解、结果验证、流程接入能力的公司,用同样的模型和用量,产出效率显著更高。
Anthropic、Microsoft和OpenAI在2026年4月集体转向按量计费模式,同时收紧固定费率计划内的Token消耗限额。补贴模式退潮,留给企业的窗口期不多了。能率先建立"FinOps for Agents"能力的企业,就是2026年最值钱的那批。
六、辩证看待:成本危机的另一面
6.1 危机是真实的,趋势也是真实的
Agent成本失控是2026年企业IT支出的头号事故。Uber四个月烧光预算、Microsoft撤回Claude Code许可证、一家咨询公司单月5亿美元的Claude账单,这些都是真实发生的事。
另一面同样真实。Token单价两年降了接近1000倍。Gartner预测推理成本在2025到2030年间将再降约90%。开源模型的推理成本已经降到闭源旗舰的38%。这些趋势意味着Agent的绝对成本在持续下降。
矛盾在于,成本下降的速度跟不上使用量爆炸的速度。Jevons悖论不是说效率提升没用,是说效率提升释放的需求超过了效率本身的节约。这对企业意味着:光等模型降价不够,必须建立自己的成本治理能力。
6.2 问题不是"AI太贵"
把Uber的预算爆炸归结为"AI太贵"是一个偷懒的判断。Uber真正的失误有三个。
第一,把"多用AI"当成管理目标。内部排行榜按AI工具使用量排名,把Token消耗量纳入正向激励。这制造了"公地悲剧",每个员工单次调用只消耗几美分,没人觉得需要省,累计总量在几个月内失控。
第二,预算模型基于Demo经济。批准预算时用的是受控场景下的Token成本,不是生产环境带边缘案例处理、检索层、编排层全部运行后的真实成本。六个月后发现Delta的时候,预算已经烧完了。
第三,缺少价值归因。Token消耗量和业务产出之间没有建立可追溯的关联。COO说"找不出AI使用和产品体验之间的因果线",这才是最致命的。成本不可怕,花了钱不知道换回了什么才可怕。
6.3 类比云计算的早期阵痛
2006年AWS上线时,计算成本比传统IDC贵得多。很多企业第一个月的AWS账单让CFO差点从椅子上摔下来。当时也有人质疑云计算的经济性。
后来的故事我们都知道了。云计算催生了FinOps这门新学科,企业学会了给计算资源做预算、做监控、做成本归因。现在没人回去自建机房。
Agent正在走同一条路。CGI把Agent成本管理称为"下一个FinOps"。核心转变是从"AI多少钱"到"怎么治理一种日益不可见的消费形式"。
先行者承担探索成本,后来者享受基础设施红利。关键问题是:你的组织是先行者还是后来者。如果是先行者,Jevons悖论会咬你一口,但咬完之后你建立的成本治理能力就是护城河。如果是后来者,等基础设施成熟了再上车,成本更低,但窗口期也在关闭。
6.4 谁能控制Agent成本,谁就最值钱
2026年最稀缺的工程师,不是最懂模型架构的,不是最会写Prompt的,是能控制Agent成本的那批人。
这个判断的依据很简单。Gartner说40%的Agent项目因成本取消,88%的试点永不到生产环境,成本是前三名原因。MIT说95%的AI试点零回报。这些失败项目的共同特征是有人会建Agent,没人会管Agent的账。
"Token经济学家"是一个今天还不存在但明年会很热的岗位。能同时理解模型能力、成本结构、业务价值的交叉人才,比单方向专家稀缺一个数量级。本系列第10到12篇会专门拆解这个职业路径,这里先记住结论:成本治理能力是2026年AI工程师的核心竞争力之一。
本系列导航
本文是《AI下半场:Agent淘金热》系列第01篇,成本黑洞篇第一篇。
| 篇号 | 标题 | Phase | 状态 |
|---|---|---|---|
| 01 | AI不能拖欠工资:Uber四个月烧光全年AI预算 | 成本黑洞 | 本文 |
| 02 | 一次Agent任务烧掉1200美元:最贵AI编程翻车账单全曝光 | 成本黑洞 | 待发 |
| 03 | Token单价跌99%,企业账单涨100倍:Agent经济学真相 | 成本黑洞 | 待发 |
| 04 | 45%流量转向中国开源模型:K3超越Claude | 开源逆袭 | 待发 |
| 05 | 从OpenAI到DeepSeek到本地Llama:模型选型完全指南 | 开源逆袭 | 待发 |
| 06 | 79%用开源但51%上生产:开源AI最后一公里 | 开源逆袭 | 待发 |
| 07 | 90%Agent试点活不到生产:活下来的10%做对了什么 | 工程落地 | 待发 |
| 08 | 多Agent一上线就打架:20个Agent协同的工程噩梦 | 工程落地 | 待发 |
| 09 | 从Prompt到Shell:AI Agent安全攻防2026实战手册 | 工程落地 | 待发 |
| 10 | AI Engineer年入35万:增长最快职业在做什么 | 黄金时代 | 待发 |
| 11 | 只会写代码被淘汰,只会写Prompt也快被淘汰 | 黄金时代 | 待发 |
| 12 | 2027年AI行业预测:5个确定性布局机会 | 黄金时代 | 待发 |
前作推荐:
- 《AI代码冲击波》第03篇"删库事故全复盘":Agent成本O(n²)的详细拆解
- 《AI代码冲击波》第06篇"70%墙":AI代码生产率与成本的权衡
- 《AI代码冲击波》第11篇"保命清单":8项不可替代能力中的成本治理
数据来源
本文数据来源于以下英文信源:
- saassentinel.com:Uber AI预算封顶1500美元/月报道,2026年6月
- The Information:Uber CTO预算披露原始报道,2026年4月
- Forbes:Uber AI工具采用率与成本数据,2026年5月
- vexp.dev:Uber Claude Code预算爆炸分析
- bosio.digital:AI Token成本管理指南,2026年7月
- cgi.com:AI Token经济与隐性成本分析
- themoderndatacompany.com:Jevons悖论与Token经济深度分析
- engineering.zooz.com:Token价格下降与企业AI账单增长
- finance.biggo.com:AI经济悖论与Token放大效应
- readsignal.io:企业AI Agent失败分析,2026年
- beri.net:2060亿美元AI Agent投入与40%失败率
- ai2.work:企业AI Agent试点为什么到不了生产
- botsandpeople.com:2026年企业AI Agent生产部署
- ecorpit.com:Agent治理与成本控制
- Gartner:40% Agentic AI项目取消预测,2025年6月
- EY:聊天机器人与Agent交互成本对比,2026年
- MIT NANDA:State of AI in Business 2025,95%试点零回报
- Menlo Ventures:2025年企业生成式AI支出370亿美元
- Bain:2026年6月951家公司AI预算调查
- Goldman Sachs Research:2030年Agent Token消费预测
- Anthropic:Agent工具数量与准确率研究
- 腾讯研究院:AI商业模式悖论,2026年7月
标签:AI人工智能AIGCAI AgentAgent成本Token算力AI预算