HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分37
PlaylistEval:视频语言模型做评判者,在日级长视频上还可靠吗?
PlaylistEval: Can Video-Language Judges Be Trusted at Day Scale and Beyond?
AI 导读
PlaylistEval 是一个无需人工标注的智能体框架,可在超过 100 小时的播放列表视频集合上构建视频语言评判基准,自动生成差异由因果退化控制、必须跨集合检索才能作答的问答对。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org