Topic · 主题全部主题 →

AI 视频

AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。

2,076条收录
136条精选

精选归档 · 第 4 页

6180 条 · 共 136

6月17日6月17日周三

星期三 · 3 条
21:07
IT之家(RSS)精选
AI 评分 74/100
阿里云发布HappyOyster 1.0:一句话生成可实时交互的数字世界

6月17日,阿里云发布开放式世界模型HappyOyster 1.0(快乐生蚝)。该产品基于原生多模态架构,支持多模态输入与音视频联合生成,可在生成过程中持续接收用户指令并实时响应画面。它深度学习物理世界状态转移规律,保持人物和环境长程一致性。官网开放“实时导演”与“世界探索”两种玩法:前者可随时叫停改写故事、与虚拟男友实时互动等;后者支持自由漫游、滑板冲刺、翼装滑翔、骑马奔驰、攻击打怪等交互。该产品已于今年4月16日开放内测,即日起至7月17日官网不定期掉落体验积分。


推荐理由:阿里把世界模型做成了可玩的交互产品,一句话生成能探索能互动的数字世界,实时导演模式直接替代了一部分短剧和互动内容创作,虽然还像噱头但至少是能玩的尝试。
17:50
公众号:火山引擎精选
AI 评分 63/100
Kickart 3.0发布,让广告视频创作更精准高效

火山引擎一站式营销创作平台Kickart 3.0(原“创作Agent”)正式上线,升级为对话式视频生成模式,用户可通过多轮对话调整商品图、故事板等,用自然语言生成营销视频。新增“爆款裂变”能力,上传视频链接后自动拆解爆款逻辑并重构至新商品视频,支持抖音电商内容合规与质量预审核。平台开放SaaS、API及Skill等多种交付方式,并已接入Seedance 2.0 mini,助力降低广告营销成本。


推荐理由:火山引擎为营销人带来的视频生成工具体验不错,对话式调整和爆款裂变能降低创作门槛,但对于关注AI技术进展的读者,这更像一次垂直行业产品迭代,亮点有限。
12:05
xAI:News(网页)精选
AI 评分 73/100
xAI 发布 Grok Imagine Video 1.5

xAI 将 Grok Imagine Video 1.5 从预览转为全面可用,在 Imagine API 上提供 grok-imagine-video-1.5,并在 grok.com/imagine 及 iOS/Android 应用上推出 Video 1.5 Fast 版。相比前代,模型在音频与语音(更清晰、嘴型同步更好)、运动与物理(更连贯、重量感更真实)、生成速度(6 秒 720p 视频约 25 秒,此前超 40 秒)上全面提升。同时逐步推出 Projects、Multiple agents(并行运行多个生成任务)、Search 等新功能,以优化创作流程。

另有 1 家信源报道X:阿易 AI Notes (@AYi_AInotes)
推荐理由:Grok Imagine 1.5 把视频生成速度砍半,音效同步和项目功能让创作者工作流更顺畅,xAI 在视频方向上站住了脚。

6月16日6月16日周二

星期二 · 1 条
10:00
IT之家(RSS)精选
AI 评分 70/100
成本砍半,字节跳动推出 Seedance 2.0 Mini 视频生成模型

字节跳动火山引擎旗下火山方舟体验中心于 6 月 15 日上线 Seedance 2.0 Mini 视频生成模型,计划近期开放 API。该模型比 Seedance 2.0 Fast 快 2 倍,输出质量相当。图生视频定价 0.023 元/千 tokens,视频生视频 0.014 元/千 tokens,720P 规格下单秒生成成本约 0.5 元,较 Seedance 2.0 标准版降低约一半。模型面向电商内容生产、营销素材批量生成、UGC 创作及特效玩法等高频率、大规模视频生成场景。


推荐理由:Seedance 2.0 Mini 把视频生成成本压到 0.5 元/秒,比标准版便宜一半,对做大批量电商素材和 UGC 的团队是个实际信号,值得等 API 开放后看实测。

6月12日6月12日周五

星期五 · 2 条
17:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
HYDRA-X: 原生统一多模态模型与整体视觉分词器

HYDRA-X 是首个在单个 Vision Transformer (ViT) 中统一图像与视频 tokenization 的统一多模态模型。通过帧级因果时间注意力实现视觉重建,并采用层级时间压缩替代单步压缩。轻量级解压器在联合图像-视频教师监督下上采样时间压缩特征。编辑管线中,源-目标交互在分词器内部潜在层面而非 LLM 语义层面进行,提升编辑一致性与收敛速度。7B 密集模型在图像与视频理解及生成任务上表现强劲。


推荐理由:HYDRA-X 第一次把图像和视频标记塞进同一个 ViT,光看设计了帧级时序注意力和分层压缩这两个小 tricks 就值回票价,做多模态模型的该读读。
01:20
Logan Kilpatrick@OfficialLoganK精选
AI 评分 81/100
Gemini Omni Flash 视频任务达 SOTAGemini Omni Flash is SOTA at image to video, text to video, and video editing : )Excited to get this to developers in the API soon!Gemini Omni Flash 在图像到视频、文本到视频和视频编辑方面达到了 SATA : ) 很高兴很快能将这一能力通过 API 提供给开发者!

推荐理由:视频生成正式进入全模态一体时代,Gemini Omni Flash 把图生视频、文生视频和剪辑整合在一个模型里,API 很快上线,做视频工具的可以提前琢磨对手在哪了。

6月11日6月11日周四

星期四 · 2 条
19:58
公众号:龙猫LongCat(美团)精选
AI 评分 65/100
美团 LongCat 提出 WBench:首个交互式视频世界模型多轮评测基准

美团 LongCat 团队提出 WBench,这是首个面向交互式视频世界模型的系统性多轮评测基准,包含 289 个测试案例和 1058 个交互轮次,覆盖导航、主体动作、事件编辑和视角切换四种交互方式。


推荐理由:将导航能力独立归因于空间状态表示,揭示连续交互位姿误差累积是迭代生成范式的结构性缺陷,为评估与改进交互式世界模型提供了新框架。

6月10日6月10日周三

星期三 · 4 条
16:56
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
快手开源 Kwai Keye-VL-2.0-30B-A3B:面向长视频理解与智能体智能的 MoE 多模态模型

快手开源 Kwai Keye-VL-2.0-30B-A3B,一个 MoE 多模态基础模型,激活仅 3B 参数,专为长视频理解和智能体智能设计。模型首次将 DeepSeek Sparse Attention (DSA) 适配到 GQA 多模态架构,实现无损 256K 上下文处理,并通过可扩展视频 I/O、异构 ViT-LM 并行及自定义 DSA 内核优化吞吐与计算开销。引入跨模态多教师在策略蒸馏(MOPD)结合 Context-RL 和 Video-RL,缓解多任务对齐中的灾难性遗忘,原生支持代码、工具、搜索场景下的多智能体协作与多模态自纠正。在 TimeLens、Video-MME-v2、LongVideoBench 等多个基准上达到同类规模 SOTA,模型权重已开源。


推荐理由:Keye-VL-2.0 把长视频理解推到 256K 上下文,还用了 DeepSeek 的稀疏注意力,这是目前我能找到的对长短视频最兼顾的多模态模型,做视频 agent 的该看看。
12:56
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
Flow-DPPO: 面向流匹配模型的散度近端策略优化

针对流匹配模型中在线强化学习比率裁剪策略约束不当的问题,Flow-DPPO 提出用散度近端约束替代。关键洞察是流模型每步策略为高斯分布,可精确计算新旧策略间的 KL 散度。Flow-DPPO 采用非对称散度掩码,仅在梯度更新偏离信任区域且超阈值时阻止更新。实验表明,Flow-DPPO 获得更高奖励,KL 近端效率更优,缓解了灾难性遗忘,促进多目标均衡,并能在比率裁剪失效时支持稳定的多轮训练。代码已开源。


推荐理由:用 KL 散度代替比值裁剪来解决流匹配 RL 训练的不稳定,理论简洁,代码已开源,做图像/视频生成优化的同学可以跑一下。
12:40
公众号:火山引擎精选
AI 评分 68/100
火山方舟版权商业化平台上线,周星驰比高集团三大电影IP首批入驻

火山引擎今日上线火山方舟版权商业化平台,推出行业首个覆盖“授权—保护—审核—分发—变现”全链路的版权合作机制。平台搭载视频生成模型Seedance 2.0及版权治理体系,已获周星驰旗下比高集团《喜剧之王》《食神》《长江七号》三部影片在AI视频创作场景下的版权使用权,并基于Seedance 2.0打造经典桥段AI创作模板。模板已在火山方舟体验中心、火山引擎Kickart上线,同步开放给LibTV、筷子科技丽帧引擎等工具合作伙伴。平台面向UGC和商业广告场景提供分润制、项目制等变现路径,未来还将提供版权管理后台,实现授权可见、使用可查、收入透明。


推荐理由:这是AI视频领域第一次有平台把版权授权、审核、变现全链路跑通,而且首批入驻的是周星驰的《喜剧之王》《食神》这种真金IP,做AI视频的人终于不用在侵权边缘试探了。

6月9日6月9日周二

星期二 · 2 条

6月8日6月8日周一

星期一 · 1 条
17:32
公众号:生数科技(Vidu·视频)精选
AI 评分 65/100
生数科技与华策影视达成战略合作,共建AI视听创制中心

6月7日,生数科技与华策影视签署战略合作协议,共同推动AI与影视产业融合。双方将以华策影视科技产教示范区为载体、生数科技Vidu视频生成大模型为技术底座,设立“AI视听创制中心”,探索AI虚拟制作与实拍结合。同时在浙江华策影视学校设立“华策&生数AI影视创制专业”,课程覆盖传统编导剪与AI视频制作技术。内容生产层面推广“实拍+AI”融合方案并优先在华策项目中试点,创作者生态层面引导Vidu社区超级创作者到产教基地注册。


推荐理由:AI 视频不再只是跑 demo,Vidu 和华策的合作把生成模型拉进了真实生产流程,做影视的人该开始关注落地速度了。

6月5日6月5日周五

星期五 · 1 条

6月4日6月4日周四

星期四 · 4 条
22:46
10:42
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 79/100
Echo-Infinity:学习演化记忆实现实时无限视频生成

Echo-Infinity 是一个自回归(AR)框架,用于实时无限视频生成。它用可学习的演化记忆替代人工缓存策略,通过注意力机制和门控更新 Memory Query,与视频扩散 Transformer(DiTs)端到端优化,支持任意压缩比且计算量不随视频长度增加。同时引入 Unified Relative RoPE Recipe,锚定 sink 帧从 id 0 开始、最新帧 id 不超过预训练最大时间 RoPE id,解除有限 RoPE 约束并缩小外推差距。在长/短视频生成中达到 SOTA,首次实现 24 小时(超 130 万帧)实时滚动生成。


推荐理由:论文把长视频生成的记忆机制从手动压缩换成了可学习的动态演化,首次做到24小时实时无限生成,这对视频生成走出‘短视频玩具’阶段是个决定性的信号。
09:28
xAI:News(网页)精选
AI 评分 75/100
xAI 发布 Grok Imagine 1.5 预览版(图像转视频模型)

xAI 通过 API 发布了图像转视频模型 grok-imagine-video-1.5-preview(Grok Imagine 1.5 预览版)。该模型能将单张静态图片转为流畅的电影感视频,用户提供起始帧和描述运动的提示词后,模型可生成包含相机移动、氛围和物理效果的动画,并保持对源图像的忠实。支持生成 720p 片段,可使用自然语言指令控制镜头、节奏和音效,并支持逐帧拼接成长场景。模型目前通过 xAI API 提供预览使用。

另有 2 家信源报道X:cb_doge (@cb_doge)X:Elon Musk (@elonmusk, xAI)
推荐理由:xAI的新视频模型从单张图像生成电影级短片,支持自然语言控制运镜和氛围,对视频创作者和开发者是个值得一试的工具。
09:06
Elon Musk@elonmusk精选
AI 评分 72/100
Grok Imagine视频生成上线VercelGrok Imagine on VercelVercel 的 AI Gateway 上现已推出 Grok Imagine Video 1.5。该服务支持图生视频并同步音频,一次性完成。示例代码: await generateVideo({ model: 'xai/grok-imagine-video-1.5-preview', prompt: 'a rabbit sprinting through nyc' });

Vercel Developers: Grok Imagine Video 1.5 on AI Gateway. Image-to-video generation with synced audio in one pass. 𝚊𝚠𝚊𝚒𝚝 𝚐𝚎𝚗𝚎𝚛𝚊𝚝...

另有 2 家信源报道X:cb_doge (@cb_doge)X:Elon Musk (@elonmusk, xAI)
推荐理由:Grok Imagine Video 1.5 把同步音频塞进了图生视频,一条 prompt 直接出带声短片,做短视频和创意的可以换上这条流水线了。