该来源未收录可展示正文,站内仅提供摘要。
阅读原文(在新标签页打开)Cache-to-Cache:让 LLM 之间直接进行语义通信
AI 导读
研究者提出 Cache-to-Cache(C2C),一种让 LLM 绕过文本、直接通过 KV-cache 进行语义通信的新范式,用神经网络将源模型的 KV-cache 投影并融合到目标模型中,并用可学习门控机制选择受益的目标层。实验显示 C2C 平均准确率比单个模型高 6.4-14.2%,比文本通信范式高约 3.1-5.4%,延迟平均加速 2.5 倍。代码已开源。
Hacker News:AI 热帖
47
AI 编辑部评分,满分 100Cache-to-Cache:让 LLM 之间直接进行语义通信
研究者提出 Cache-to-Cache(C2C),一种让 LLM 绕过文本、直接通过 KV-cache 进行语义通信的新范式,用神经网络将源模型的 KV-cache 投影并融合到目标模型中,并用可学习门控机制选择受益的目标层。实验显示 C2C 平均准确率比单个模型高 6.4-14.2%,比文本通信范式高约 3.1-5.4%,延迟平均加速 2.5 倍。代码已开源。
来源:Hacker News:AI 热帖· arxiv.org