AI代币成本骤降,大模型将成基础设施

AI代币成本正以每年数个数量级的速度骤降,大模型预计一至两年内将整合进计算各层面成为基础设施。GPU能效约每两年翻一番,叠加推理引擎优化,同等质量下任务成本大幅降低,瓶颈转向质量与访问权限。

代币成本骤降:AI 基础设施化的临界点

机器学习智能的价格正以每年数个数量级的速度下降,且未见减速迹象。预计在未来一至两年内,大语言模型(LLM)将不再仅仅作为独立产品存在,而是作为基础设施整合进计算的各个层面。未来三到六年内,当前前沿质量的 LLM 有望在商品化硬件上运行。届时,限制 AI 使用的瓶颈将从纯粹的代币数量转向质量与访问权限。

MoE架构参数量可缩小7倍

基于大量数据证据分析,这一趋势由多个层面的技术改进共同驱动。人工智能模型可分为专有类(如 GPT-6 Astra)和开放权重类(如 GLM-5.3-flash)。开放权重模型既可通过 Z.ai 等平台托管,也可本地部署。通常,本地运行的模型规模较小,例如 Muse Glimmer 或 Qwen3 Coder。值得注意的是,单一维度的进步并不必然带动其他维度的同步提升。

影响所有 AI 领域的通用改进

GPU 能效跃升

每一代 GPU 都在显著提升能效。下图展示了 GPU 功率效率随时间的变化(Y 轴数值越大代表效率越高):

该对数图表显示,GPU 效率呈指数级增长,具体表现为大约每两年翻一番(对数为 1.3)。这种增长速度是自 1960 年代摩尔定律以来所未见的。

模型任务成本下降

虽然前沿模型的单代币价格未必持续下跌,但完成特定任务的总成本正在急剧降低。较小的模型虽单价较低,但因需更多推理步骤或修正初稿,往往消耗更多代币。以下帕累托边界图展示了不同模型在“质量”与“成本”之间的最佳权衡:

  • Y 轴:模型质量(基于基准测试)
  • X 轴:完成任务的成本(对数比例,数值越小越好)

在 2026 年的格局中,Claude Fable-5.1 位于右上方(高成本、高智能),而 GPT-5.6 Luna 则位于左下方(低成本、相对较低智能)。虚线以下的模型基本不具备竞争力。

对比 2025 年初、中期及末期的边界变化:

数据显示,2025 年期间,模型在同等成本下能完成更复杂的任务,或在同等质量下成本大幅降低。与 2026 年相比,2025 年的模型在智能水平上差异不大,但在成本维度上便宜了约两倍。

推理引擎优化

推理引擎负责在 GPU 上执行训练好的模型。目前该领域尚处早期阶段,但改进迅速,部分引擎每年可实现 10%-50% 的效率提升。主要评估指标分为“离线批量处理”和“在线服务”。鉴于实际应用场景,以下数据均针对服务工作负载。

vLLM 进展

vLLM 的效率随版本迭代持续提升。下图展示了不同软件版本(蓝/红线)在不同批量大小下的焦耳/代币消耗(Y 轴数值越小越高效):

vLLM 0.11.1 于 2025 年 12 月发布,相较于 2024 年 9 月发布的 vLLM 0.5.4,在 15 个月内实现了约 40% 的效率提升。性能增长与能效改善大致成比例。

NVIDIA 与 Intel 的基准表现

除第三方软件外,硬件厂商也在推动标准演进。NVIDIA 在其 MLPerf 堆栈中,从 2.0 到 2.1 版本展示了高达 50% 的效率改善:

Intel 近期在 MLPerf 6.0 至 6.1 版本的更新中,仅通过软件优化便实现了 2.4 倍的吞吐量增加。尽管硬件固定,但软件层面的优化显著提升了整体效率。

影响托管 AI 的架构创新

混合专家模型(MoE)

现代 LLM 架构比早期稠密模型更高效。传统稠密模型在处理每个输入时激活全部参数,而 MoE 架构仅在需要时激活特定的“专家”层。这直接降低了相同输出质量下的算力需求。

图示表明,模型参数量可缩小 7 倍(从 6B 降至 0.8B),同时在基准测试中保持同等性能。这意味着托管服务的成本和内存占用将持续下降。虽然每焦耳代币的效率提升有限,但每焦耳的质量产出效率正在迅速上升。

对于本地运行而言,MoE 的优势在于减少计算量,但仍需足够的显存来加载专家权重。像 mlx-flash 这样的项目通过按需切换内存中的层来缓解这一问题。

影响本地 AI 的技术突破

Mamba 架构与内存优化

本地运行 LLM 的主要瓶颈是巨大的 RAM 需求。最新架构已将所需内存减少了 5 倍以上。

传统的 Transformer 架构需保留完整的上下文缓存,可能占用数百 KB 甚至更多空间。相比之下,Mamba 架构采用状态空间模型,仅存储输入的压缩摘要,类似于编码代理中的“紧缩”机制,但嵌入在模型内部从而更高效。

纯 Mamba 架构并非万能(例如难以精确回忆 URL 等细节),但 Mamba-Transformer 混合体显著降低了单位代币所需的 RAM。在 3 到 4 位量化下,Nemotron-H-47B 可在 32GB VRAM 中容纳超过 100 万个代币;而同质量的 Llama-3.1 60B 模型则需要近 120GB 显存才能处理相同数量的代币。

特殊用例的成本革命

Jev 与 Laya:分类任务的极致低价

若仅需 AI 进行“是/否”判断或概率预测,成本可降低两个数量级。本周推出的 Jev 旗舰产品不同于生成式 LLM,它不输出文本,仅在预设选项间进行选择并给出概率值(0-100%)。例如,询问某 Shell 命令是否违反系统提示,Jev 会返回一个置信度分数。

Jev 的定价策略极具冲击力:

现有 LLMs:输入代币 $0.20-$10 / MTok;输出代币通常是输入的 5 倍。
Jev:输入代币 $0.042 / MTok(即每 10 亿代币 42 美元);输出代币免费(因计量过于便宜)。

换算下来,阅读 5 本书(约 40 万单词,对应约 60 万代币)的成本仅为 3 美分。读取人类历史书籍总量的万分之一仅需 42 美元。这种成本低于电费,使得开发者开始构建直接调用 Jev 的工具。

例如 jgrep 工具允许用户运行如下查询:

$ jgrep -o "announces or releases a new AI model" titles.txt | sort -rn | head -3
0.980	PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet
0.970	Alibaba Releases Qwen3.8-Omni-Flash
0.940	Google announces new experimental "CC" AI agent for families

jgrep 声称能以千分之一的成本在 200ms 内返回概率结果。根据对 994 个 Hacker News 标题的测试,其耗时 4.6 秒,成本 0.012 美元。此外,它还可用于按优先级排序开放的 Pull Request,通过分析评论内容而非标签来确定优先级。

Laya 则是开源方案,支持本地运行。经过微调后,它在速度和准确性上可能超越 Jev,但其本质是一个代码库而非成品服务。使用 Laya 需要自行配置环境,具备深厚的机器学习知识以进行调优,且受限于 512 字节的上下文窗口,无法处理大型输入。

综合效应:代币成本低于工具调用

结合上述因素,过去一年中代币成本下降了约 2.5 个数量级:

  • 模型的任务性价比提升约 100 倍。
  • 硬件的每代币能效提升约 1.3 倍。
  • 推理引擎的每代币能效提升约 1.4 倍。

若关注其他基准,新架构使同等 RAM 下可容纳的代币数量增加 5 倍以上,而专用模型(如 Jev/Laya)进一步将成本降低 1-2 个数量级。这些技术仍处于早期阶段,远未触及收益递减极限。

当模型成本低于传统工具调用时,将 AI 嵌入基础设施变得极具吸引力。以 GPT-5.6 Luna 为例,其成本约为 30 美分/百万代币。假设每次工具调用消耗 10k 代币,单次决策成本约为 0.3 美分。对比常见操作能耗:

工具功率 (W)时长 (s)电价成本 (¢)比 Luna 单次调用便宜的数量级
grep100.10.0000074.5
解析 HTML1010.000073.5
cargo build30300.006251.5

这表明,未来可能出现利用机器学习优化的自适应构建调度器等基础设施组件。目前此类应用虽可行但门槛极高,随着通用模型成本降低,将其嵌入常规计算流程将变得更加容易。

供给侧杰文斯悖论与投资回报

随着运行成本下降,企业倾向于增加算力投入,因为单位投资的回报率提高。这种现象被称为“杰文斯悖论”:效率提升导致总体消耗增加。这也引发了“诱导需求”,类似交通网络中道路拓宽后车流反而增加的现象。

若代币便宜到无需计量,LLM 提供商如何盈利?首先,低单价并不意味着推理业务无利可图。其次,OpenAI 和 Anthropic 等头部实验室在质量上仍领先多数竞争对手。未来格局可能是:高难度任务购买前沿实验室的高价算力,而常规任务则使用开放权重或折扣计划。

开放权重模型能否追平闭源巨头尚不明朗。若能实现,将对投资者和美国经济产生连锁反应。但这不会改变技术基本面:NVIDIA 仍将受益,企业将继续使用 AI,且成本更低。

需求侧变革与软件的未来

当算力足够廉价,人们将如何利用它?以下是一些可能的趋势:

  • 网络安全集中化:由于攻击自动化程度提高,企业将被迫依赖 Cloudflare Access 或内部 AWS/Azure 服务等托管解决方案,否则面临高风险。
  • 原始算力优势扩大:Oxide Computer Company、AWS、Cloudflare 等超大规模云服务商将受益。专门针对推理优化的 GPU 租赁服务(如 runpod)将增多,取代通用 EC2 实例。
  • 软件开发重心转移:算法不再是难点,产品需求定义、测试和用户界面设计成为核心。QA 和 UI/UX 岗位需求可能回升,就业市场结构将发生剧烈变化。
  • 软件租赁稀缺性增加:代码本身不再是护城河,运维和安全成为价值驱动因素。类似 Amazon Managed Streaming for Apache Kafka 的服务将增多,而 JetBrains IDE 或 Blackboard 等传统软件模式将减少。

此外,用户在选择软件时新增了第四个选项:让 LLM 现场构建。尽管输出质量参差不齐,但这种“可塑性软件”为个人定制提供了前所未有的便利。在受监管行业,现有企业的合规优势将更加明显。

我们正迈向一个不仅计算资源廉价,而且“智能”也日益廉价的世界。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读