HuggingFace Daily Papers(社区热门论文)·· 4 天前AI 评分39
VoxMem:面向大型音频语言模型的多模态记忆基准
VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models
AI 导读
VoxMem 是面向大型音频语言模型(LALM)的多模态记忆基准,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org