跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2 天前AI 评分37

PlaylistEval:视频语言模型做评判者,在日级长视频上还可靠吗?

PlaylistEval: Can Video-Language Judges Be Trusted at Day Scale and Beyond?

AI 导读

PlaylistEval 是一个无需人工标注的智能体框架,可在超过 100 小时的播放列表视频集合上构建视频语言评判基准,自动生成差异由因果退化控制、必须跨集合检索才能作答的问答对。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org