跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分33

REALM:面向具身反应式聆听的由粗到细生成框架

REALM: A Coarse-to-Fine Generative Framework for Embodied Reactive Listening

AI 导读

REALM(Reactive Embodied Audio-driven Listening Model)是一个由粗到细的音频驱动反应式聆听框架,通过 Reactive Gated Speaker-Listener Fusion 模块结合聆听者动作历史与说话人音频,并用粗解码器预测基础动作轨迹、在表情子空间叠加音频条件随机残差。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org