- Cache-to-Cache (C2C) 技术允许独立的 AI 模型在不生成文本的情况下直接交换内部信息
- 通过“Fuser”组件,将一个模型的内部数据转换并适配至另一个模型
- C2C 利用选择性网关机制,精确控制哪些层接收传入信息
清华大学研究团队发表了一篇关于 Cache-to-Cache (C2C) 技术的论文。该方法已被 ICLR 2026 会议接收,且开发者已获取相关开源代码。

该技术主要应用于多种语言模型在共享管道中协同工作的场景。
跳过文本生成环节
在传统协作模式中,当两个人工智能模型配合工作时,其中一个模型必须先将内部思维转化为文字输出。这一过程不仅消耗计算时间,还会丢失原始推理过程中的细节信息。
每个人工智能模型都保留着处理任务时的工作记忆,技术上称为缓存(Cache)。C2C 方法的核心在于让一个模型将工作内存直接传输至第二个模型的内存库,从而完全绕过文本生成步骤。
在此过程中,一个名为“Fuser”的辅助程序负责处理数据传输,对信息进行重塑和旋转以适配目标模型。
由于不同的人工智能模型在存储记忆的布局、大小及结构上存在显著差异,直接将原始记忆注入另一模型是不可行的。为此,C2C 引入了智能过滤器机制。
该机制使得部分内部层能够立即接收新信息,而其他层则保持独立推理状态,不受外界干预。
研究人员指出,这种设置使人工智能模型在共享协作任务中的运行速度提升了 100% 到 150%,相比传统的文本往返通信速度快了两倍半以上。
数据显示,当模型协同工作时,准确度提高了 14.2%;与仍通过文本通信的传统设置相比,精度提升幅度为 3.1% 至 5.4%。
技术局限性分析
目前,C2C 方法仅适用于开放权重模型,因为该技术需要直接访问模型的内部缓存及层结构。
大多数面向普通用户的流行人工智能工具(如常见的聊天机器人)完全隐藏了这些内部细节,因此无法使用此快捷方式。
目前尚不清楚是否有其他公司在内部采用类似的技术方案。
研究团队认为,强制机器像人类一样通过文本进行思考会降低效率。鉴于构建系统的团队同时也进行了所有测试,该结论仍需依赖后续的外部独立验证来确认其实际加速效果。





