2026年2月6日,此后六个月,AI代理在算力消耗上反超人类用户。
据The Decoder报道,OpenRouter分析师Peter Walker披露数据:截至2026年8月10日的七日均值,该平台AI代理token消耗量达7.3万亿,较2月6日的0.51万亿增长约14倍;同期人类用户消耗量从约0.5万亿增至1.4万亿,增幅2.8倍。代理总消耗量已是人类的五倍以上。
为什么是"14倍"而不是"5倍"
代理消耗增速快于绝对比例,源于单次请求的结构性差异。OpenRouter平台数据显示,一次典型代理任务消耗token量约为人类对话的13至15倍。其工作负载需携带工具定义、MCP网关配置、技能前置说明及多轮推理上下文,一次自主编程或研究任务的token量可抵数百次普通问答。
推理模型普及放大了这一效应。OpenRouter数据指出,推理模型存在"超额思考"现象,即便面对无需深度推理的请求,模型也会在回答前花费大量token进行内部推演。
成本通胀被缓存部分稀释,但结构性压力仍在
在代理产生的7.3万亿token中,约70%至85%来自缓存命中。缓存命中按优惠价计费,实际费用增幅低于原始token数字。代理工作流重复使用系统提示、工具定义和历史上下文,形成天然缓存友好结构。
即便打折后,7倍于人类的消耗体量仍是推理提供商收入结构的重要变量。随着代理任务复杂度上升,无法缓存覆盖的净新增输出token将更快累积账单。
中国模型在代理市场的份额变化
OpenRouter官方博客显示,DeepSeek在该平台token份额从2026年1月的9%升至6月的18%,中国模型整体token消耗量已超过美国模型。DeepSeek V4于2026年4月24日发布后,至5月底,其轻量版V4-Flash占据DeepSeek代理token流量的70%。
DeepSeek V4 Flash报价为每百万token输入$0.09、输出$0.18,GPT-5.5定价为输入$5、输出$30,价差约55倍。人类用户同期仍使用DeepSeek V3.2,代理流量则切换至V4-Flash,显示代理与人类对模型偏好已分化。
基础设施商业模式的变迁
OpenRouter联合创始人兼COO Chris Clark在SaaStr访谈中表示,该平台预计单周处理约28万亿token,约占全球推理量的1%,总量超过Salesforce公司整个生命周期处理量。
代理流量带来更可预测的批次负载,而非人类随机峰值,对算力调度和定价策略产生影响。代理对服务质量容错性更低,一次工具调用解析错误可能导致整条自动化链路崩溃。同一开源模型在不同提供商处的实际表现差异来自中间层软件,而非模型权重。
企业端预算模型已不适用
Blockonomi数据显示,企业用户群体中,前10%"前沿型企业"每位活跃用户输出token量是普通企业的8.3倍,今年1月时该差距仅为2.6倍。法律行业代理工具企业周活用户数自今年2月以来增长108倍,任务包括合同审查、尽职调查、法规比对等长上下文场景。
这一转变的影响
2026年2月6日基准线标志推理市场核心买家从人类转向程序。OpenRouter在开源模型领域覆盖偏向明显,闭源API代理使用情况尚无公开数据。当代理单次任务成本是人类对话15倍、中国模型凭借55倍价格优势占据代理流量时,AI基础设施行业的定价逻辑、容量规划和竞争壁垒需重新计算。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接