AI 成本优化:超越模型路由,重构计算逻辑
几个月前,“托肯马克斯”(Tokenmaxxing)这一概念曾引发全球关注,科技公司通过追踪和 gamification 机制鼓励员工成为 AI 的“重度用户”。然而,风向已发生逆转。随着 AI 智能体从实验阶段迈向大规模部署,其带来的算力成本急剧上升。据观察,部分组织在短短四个月内便耗尽了 2026 年的全年 AI 预算。

面对高昂的支出,业界开始探索模型路由和利用开源模型来优化成本。例如,Kimi K3 等新型中国模型提供了低价的近端能力,引发了市场兴奋。虽然针对特定任务选择合适模型是合法的优化手段,但仅聚焦于此存在局限性。缺乏自律的组织往往忽视了何时使用大语言模型(LLM)以及在哪里运行数据处理更为合理,导致不必要的代币消耗和成本膨胀。真正的成本优化机会,不仅仅在于降低单次调用的代币价格。
将 LLM 作为分析引擎的低效陷阱
尽管人们乐于使用 LLM 解决文件协调、业务规则应用、合规性检查及源文件解释等问题,但其成本效益往往较低。原因在于,独立的 LLM 在处理这些问题时,需要不断重建上下文。它们未能有效利用组织已有的知识储备,而是依赖模型自身的推理能力,通过消耗大量代币去重新推导满足个体业务定义、政策和背景的最终答案。
此外,许多由 LLM 处理的问题具有高度重复性。跨越不同用户对话和时间段,相同的问题被反复提出,却每次都要求模型从头启动进行推理。这种对模型选择的狭隘关注忽略了更深层的效率问题:无论使用何种模型,要求其在每个角落重新发现已经存在于内部收入计算、保证金管理和合规知识库中的信息,本身就是一种浪费。因此,限制不必要的代币使用必须成为成本方程的核心部分。
最便宜的代币是你从未生成的代币
当前 AI 系统的一个关键瓶颈在于与业务逻辑脱节。许多系统缺乏一个专门的商业逻辑层,该层本应包含用于可重复任务的分析工作流程、组织特定的规则和定义,以及应用于分析输出的合规防护栏。
当 LLM 与业务逻辑层集成时,其回答特定类型用户查询的能力将显著提升。以员工询问团队当前利率表现为例:独立模型可能需要从广泛的相关来源获取数据,在此过程中扩大巨大的上下文窗口,导致高成本。相反,商业逻辑层可以提供预先构建的工作流程模型,每天自动计算核心利率变量,LLM 只需基于这些现成结果进行交互。
基于已有分析工作流程和业务环境的可重复工作流有助于优化 AI 成本。业务逻辑层还能促进云数据平台与 LLM 的集成,避免计算成本的重复。例如,密集的计算发生在云数据平台中,结果转化为分析工作流程供 LLM 借鉴,从而限制了需要高强度 LLM 计算来处理原始数据的场景。
准确性与确定性的关键需求
将强大的商业逻辑注入 AI 输入和输出,对于长期的成本效益至关重要。缺乏商业逻辑会削弱用户对 AI 工具的信心,进而延缓投资回报率的实现。
在税收、合规和金融等商业领域,查询往往需要确定性的答案。只有结合商业逻辑和既定规则,才能提供可靠的关键答案。随着智能体在企业中的部署加速,其影响日益显著。智能体行动迅速,但若缺乏正确的规则与逻辑支撑,极易偏离方向。在企业环境中,若数千名员工配备的智能体对同一问题给出千差万别的答案,将无法发挥积极作用。通过建立统一的商业事实来源,可有效管控此类风险。
优化成本的新视角
单纯依靠模型选择来优化 AI 成本是有限的,因为它无法从根本上遏制不必要的代币消费。组织若能结合可信的工作流程、治理良好的业务逻辑以及有针对性的用例,将从技术中获得最佳回报。特别是在 AI 代理推广起飞的当下,这种综合优化的策略显得尤为重要。





