HuggingFace Daily Papers·· 1 天前AI 评分42
VTR-Bench:评估视频生成中视觉文本渲染的系统性基准
VTR-Bench: A Systematic Benchmark for Evaluating Visual Text Rendering in Video Generation
AI 导读
VTR-Bench 是用于评估视频生成模型视觉文本渲染能力的系统性基准,包含覆盖广告、科学视频等五类场景的 300 条提示词,并配套自动化评估流程。在 11 个 SOTA 模型上的实验显示,场景文本渲染普遍存在困难,表现最好的模型整体词错误率(WER)为 0.250。
来源:HuggingFace Daily Papers · arxiv.org