清华开源 C2C:多智能体跳过文本直连 KV-Cache

AYi · @AYi_AInotes · X·2026-09-18 20:29·26分钟前
AI 导读

清华大学与无问芯穹等团队开源 C2C(Cache-to-Cache)技术,让多智能体不再通过文本交流,而是用轻量级 Neural Fuser 将模型 A 的 KV-Cache 投影融合进模型 B 的 KV-Cache,并配可学习门控动态选择吸收层。

AYi@AYi_AInotes
49AI 编辑部评分,满分 100

清华开源 C2C:多智能体跳过文本直连 KV-Cache

2026-09-18 20:29· 26分钟前
AI 导读

清华大学与无问芯穹等团队开源 C2C(Cache-to-Cache)技术,让多智能体不再通过文本交流,而是用轻量级 Neural Fuser 将模型 A 的 KV-Cache 投影融合进模型 B 的 KV-Cache,并配可学习门控动态选择吸收层。

清华大学和无问芯穹等团队刚刚开源了一篇注定载入史册的重磅论文(已收录于 ICLR 2026,代码已开源): 他们彻底打破了所有多智能体(Multi-Agent)系统的底层范式—— 大型语言模型之间,从今天起可以彻底不通过人类文字进行直接交流了!

这项被称为 C2C(Cache-to-Cache,缓存到缓存)的技术, 开篇就指出了全网 Agent 协同里最愚蠢、也最昂贵的一个死穴: 为什么两个跑在同一台服务器里的超级 AI,交流时非要像人类一样, 把脑子里极其丰富的高维思考,硬生生压缩成一个个英文或中文单词打给对方看?

现有多 Agent 协同的痛苦,做过工程的人都懂: 模型 A 思考完,必须经历极其漫长、吃显存带宽的逐字解码(Decode),慢吞吞吐出一大堆文字; 模型 B 拿到这堆文字,再重新过一遍分词和前缀计算。 这一来一回,不仅丢失了海量微观的语义细节,更造成了毁灭级的延迟和 Token 账单!

清华团队这次做了一件极其惊艳的体系化反叛——C2C 脑电波直连:

1️⃣ 彻底消灭中间文本,直接做“思维投影”: 模型 A 算完后,根本不生成任何文字, 系统直接用一个轻量级神经网络(Neural Fuser),把模型 A 的注意力记忆(KV-Cache)通过高维空间旋转和对齐,直接嫁接、融进模型 B 的 KV-Cache 脑内! 这相当于人类交流跳过了声带和耳朵,直接把我的记忆切片瞬间印进你的大脑; 2️⃣ 可学习的智能门控(Gate 机制): 不同模型的网络层数和结构各不相同,直接硬灌肯定会神经错乱。 论文设计了一套精妙的可学习门控: 大模型会自己动态感知,精确挑选哪些关键层吸收外部缓存的增益最高,哪一层该保持独立思考,毫秒级自适应配平; 3️⃣ 极其残暴的工业基准成绩: • 彻底消灭中间所有的文本解码等待,推理速度直接飙升 2.0 到 2.5 倍; • 综合问答准确率比单模型最高暴涨 14.2%; • 最狠的是:它的表现比传统用文字互相聊天的 Agent 团队,还要高出整整 5%! 因为在直接的语义融合下,原本会被文字丢弃的逻辑细微特征,全部被完整保真保留了。

这篇论文最刺痛人的一层哲学启示在于: 人类一直自豪地以为,自然语言是这个星球上传递智慧最完美的介质; 但在机器与机器的交互世界里,人类语言不过是一道充满歧义、极其拥挤的低速单行道。

当两个模型不再需要通过文字向对方妥协, 它们正在绕过人类的喉咙, 在冰冷的显存带宽之间,编织出一座全人类根本听不见、却快得不可思议的超高速无声神经网络。

来源:AYi· x.com