HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分33
REALM:面向具身反应式聆听的由粗到细生成框架
REALM: A Coarse-to-Fine Generative Framework for Embodied Reactive Listening
AI 导读
REALM(Reactive Embodied Audio-driven Listening Model)是一个由粗到细的音频驱动反应式聆听框架,通过 Reactive Gated Speaker-Listener Fusion 模块结合聆听者动作历史与说话人音频,并用粗解码器预测基础动作轨迹、在表情子空间叠加音频条件随机残差。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org