AI代理Token用量达人类5倍,缓存提示占主导

a16z数据显示,AI代理Token用量达人类5倍。85%消耗源于缓存提示,自2月以来代理用量激增14倍,远超人类的2.8倍增长。这一趋势推高内存需求,凸显智能体规模化应用带来的基础设施压力。

AI代理Token消耗量达人类5倍,缓存提示成主要推手

未来集团(The Future Group)首席执行官丹尼尔·纽曼(Daniel Newman)近日撰文指出,当前人工智能代理(AI Agents)的Token使用量已达到人类用户直接交互量的5倍。这一数据来源于风险投资公司安德里森·霍罗维茨(a16z)基于OpenRouter平台数据的分析图表。

超85%代理Token消耗来自缓存

数据显示,截至8月份,AI代理的使用量首次超越人类用户,达到7.3万亿Token。a16z援引OpenRouter的数据进一步说明,超过85%的代理Token消耗来自缓存提示(cached prompts)。纽曼在文章中预测,随着技术迭代,这一比例将持续攀升,未来可能加速增长至10倍甚至更高。

“目前,AI 的使用量是人类使用量的 5 倍。这一数字将加速增长至 10 倍,并持续攀升。”

“在评估投资回报率(ROI)时,我们往往关注人类的采用情况,但实际利用率和规模呈指数级扩大,远超人类层面。”

OpenRouter数据揭示增长趋势差异

OpenRouter作为领先的人工智能模型网关和路由平台,其洞察负责人Peter Walker发布的图表展示了按类型划分的7天平均Token使用量。自今年2月出现交叉点以来,代理使用的Token数量增加了14倍,而人类用户的使用量仅增加了2.8倍。a16z引用的图表与OpenRouter的数据保持一致。

(图片来源:OpenRouter)

OpenRouter通过包含工具调用率、转数、间隔时间等在内的7个信号加权复合得分,将每个API密钥分类为代理(Agent)、混合(Mixed)或人类(Human)三个类别。根据计算,涵盖部分代理和部分人类行为的“混合”类别在同一时期增长了4.7倍。尽管具体流量分裂方式会影响代理对人类的领先幅度,但整体趋势显示代理用量显著高于人类。

值得注意的是,这些数据衡量的是Token数量而非支出金额。虽然单一平台的数据可能存在波动(如4月和7月出现的下跌),但行业其他地方也显示出类似趋势。麦肯锡2026年人工智能现状调查显示,40%的大型组织受访者报告正在扩展人工智能代理,而一年前这一比例为27%。

缓存机制加剧内存需求压力

a16z指出,缓存Token几乎占据了Token使用量相对增长的主要部分。虽然处理缓存提示的成本远低于从头开始处理新提示,但这些数据仍需存储在内存中。OpenRouter的投资方a16z将此现象与高带宽内存(HBM)需求的增加联系起来。模型将存储的上下文保存在所谓的KV缓存中。

在一个呼叫中心日志案例中,同样的模式再次显现:在租用的Nvidia H200 GPU上测试DeepSeek模型时,96%的输入都是重读旧对话。结合OpenRouter的数据来看,这表明虽然Token数量的激增可能在账单上有所体现,但内存硬件的实际成本依然高昂且真实存在。

目前,这种用于存储上下文的内存资源已变得稀缺。微软预计,2027年和2028年内存和存储短缺情况将进一步恶化,客户支付的费用将高于今年水平。与此同时,内存制造商正优先满足人工智能数据中心对HBM的需求。如果纽曼关于5倍用量将演变为10倍、20倍乃至30倍的预测成真,内存供应链的压力将持续增大。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读