# StreamMA：多智能体推理中的流式通信

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-06-03 08:00
- AIHOT 分数：73
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.news/items/cmpyw41ob03vqsli352ld24b0
- 原文链接：https://arxiv.org/abs/2606.05158

## 精选理由

让多 Agent 一边想一边传，不仅快了一倍还更准，这种流式思路要改写 pipeline 设计了，做多智能体的该认真读读。

## AI 摘要

StreamMA 采用“流式通信”范式，每个推理步骤生成后立即流式传输给下游智能体，通过流水线相邻智能体降低端到端延迟。该方法还提升了效果，因为早期步骤更可靠，可避免错误后期步骤误导下游智能体。在数学、科学和代码八项推理基准上，使用 Claude Opus 4.6 和 GPT-5.4 两种大语言模型，及 Chain、Tree、Graph 三种拓扑，StreamMA 平均优于基线 +7.3 个百分点，在 HMMT 2026 上最高达 +22.4 个百分点。研究还发现“步骤级缩放定律”：增加每智能体步骤数可同时提升效果与效率。

## 正文

多智能体推理系统采用“先生成再传输”的范式，这迫使端到端延迟随流水线深度线性增长。我们提出了 StreamMA，一种多智能体推理系统，它会在每个推理步骤生成后立即将其流式传输给下游智能体，从而将相邻智能体流水线化并降低延迟。

令人惊讶的是，这种流水线化还提升了有效性：因为多步推理的质量并非均匀分布，早期步骤比后期步骤更可靠，所以使用这些可靠的早期步骤而非完整链条，可以防止容易出错的后期步骤误导下游智能体。我们通过首个针对流式、串行和单协议协议的封闭形式联合分析，将这两种优势形式化，推导出了有效性排序、加速上限和成本比率。

在涵盖数学、科学和代码的八个推理基准测试、两个前沿大语言模型（Claude Opus 4.6 和 GPT-5.4）以及三种拓扑结构（链式、树状、图状）中，StreamMA 均优于两个基线（在 HMMT 2026 上平均提升 7.3 个百分点，最高提升 22.4 个百分点；使用 Claude Opus 4.6-high）。

除了这些贡献之外，我们还发现了一个“步骤级缩放定律”：增加每个智能体的步骤数会持续提升有效性和效率，这是一个与智能体数量缩放正交且可组合的新缩放维度。
