Topic · 主题全部主题 →

AI 视频

AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。

2,076条收录
136条精选

精选归档 · 第 6 页

101120 条 · 共 136

5月20日5月20日周三

星期三 · 1 条
01:48
Google DeepMind:Blog(RSS)精选
AI 评分 83/100
推出Gemini Omni多模态AI模型

谷歌推出原生多模态AI模型Gemini Omni,能够整合视频、图像、音频和文本等多种输入,生成高质量视频内容。其核心能力是通过自然语言对话进行视频编辑,并能保持角色一致性、物理规律与场景连贯性。首个模型Gemini Omni Flash已上线,未来将支持图像和音频输出。Gemini Omni结合了对物理世界的直觉理解与丰富的知识库,支持从写实到叙事的创意生成,并可通过多轮对话持续编辑视频,而不丢失原始场景上下文。

另有 18 家信源报道X:Ethan Mollick (@emollick)X:Google AI for Developers (@googleaidevs)X:Gemini (@GeminiApp)Google DeepMind:Blog(RSS)X:Jeff Dean (@JeffDean)X:Logan Kilpatrick (@OfficialLoganK)X:Google AI (@GoogleAI)Google Blog:AI(RSS)Google Developers Blog(RSS)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:Google DeepMind (@GoogleDeepMind)X:阿易 AI Notes (@AYi_AInotes)X:Sundar Pichai (@sundarpichai)The Decoder:AI News(RSS)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)The Verge:AI(RSS)
推荐理由:Gemini Omni 把视频生成从画面堆砌推到了物理世界叙事,多轮自然语言编辑和世界知识融合是真正的代际升级,做视频内容的该重新理解工具的定义了。

5月19日5月19日周二

星期二 · 1 条
00:52
Hugging Face:Blog(RSS)精选
AI 评分 67/100
NVIDIA Cosmos Predict 2.5 微调:使用 LoRA/DoRA 生成机器人视频

NVIDIA Cosmos Predict 2.5 是一个 2B 参数的世界模型,可根据文本、图像或视频片段生成物理合理的视频。通过 LoRA 或 DoRA 在 DiT 的注意力层(to_q, to_k, to_v, to_out.0)和前馈层注入可训练适配器,冻结全部基座权重,在单个 80GB GPU 上即可完成参数高效微调,避免了全量微调的高成本与灾难性遗忘。该流程使用 diffusers 和 accelerate 库,利用 92 个机器人操作视频训练集与 50 个 (prompt, image) 测试对进行微调,并展示如何用微调模型生成合成机器人轨迹以支持下游机器人学习任务。支持单 GPU 与多 GPU 训练,切换不同领域适配器无需重训。


推荐理由:这篇教程把微调Cosmos Predict 2.5的方法从头到尾讲清楚了,做机器人合成数据的同行可以直接抄作业,LoRA/DoRA切换也很方便,值得收藏。

5月16日5月16日周六

星期六 · 2 条
23:31
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 73/100
SANA-WM:一个用于生成1分钟720p视频的26亿级开源世界模型

NVIDIA研究团队发布了SANA-WM,这是一个参数规模达26亿的开源世界模型,专门用于生成长达1分钟、分辨率为720p的视频。该模型已在GitHub页面开源,旨在推动高质量长视频生成的研发。其在Hacker News社区获得了107点热度,显示出业界对该技术进展的关注。


推荐理由:开源且能跑 1 分钟 720p,NVIDIA 这个 2.6B 世界模型在物理一致性上跨了一大步,做视频生成和物理仿真的同行该坐不住了。

5月15日5月15日周五

星期五 · 2 条
08:10
Runway:News(网页)精选
AI 评分 67/100
Runway正式进军日本市场,在东京设立总部并投入4000万美元

生成式AI公司Runway宣布在日本东京设立总部,正式进军日本市场,并计划投入4000万美元初始资金拓展业务。日本已成为Runway增长最快的市场之一,是其全球企业及自助客户的第三大市场。过去一年,日本企业客户数量增长300%,贡献了Runway亚洲总销售额的三分之一。软银、雅马哈等企业已在营销与创意流程中使用其服务。公司此次扩张旨在贴近日本领先的创意、机器人及制造行业客户,并已开始招募日本市场负责人以组建本地团队。


推荐理由:Runway 在日本已有 300% 企业增长,这次砸 4000 万美元设东京办公室,对关注亚洲市场的人来说是个信号,AI 视频工具的全球化布局正在加速。

5月14日5月14日周四

星期四 · 1 条
11:53
CMU:Machine Learning Blog精选
AI 评分 63/100
教视觉-语言模型说"电影语言"

研究团队与百余名专业创作者历时一年,构建了一个视频描述生成流程,其核心在于扩展精细化的人类-AI协同监督,而非单纯扩大模型规模。该研究(入选CVPR 2026亮点论文)指出,当前主流视频生成模型在理解和生成具有电影感的专业运镜(如希区柯克式滑动变焦、精确的焦点转移或荷兰角镜头)时存在明显不足,常产出通用或焦点错误的画面。这项工作揭示了一条通过提升监督质量来增强模型“电影语言”表达能力的新路径。


推荐理由:这篇CVPR 2026 Highlight的博客版很有意思,它用100多个专业电影人来标注视频,教VLM学会推拉摇移的镜头语言,不是又多一个数据集,而是提醒我们:高质量的人工标注可能比堆模型更重要。

5月12日5月12日周二

星期二 · 1 条
12:44
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
WorldReasonBench:面向未来世界状态预测的视频生成器人类对齐压力测试

研究团队发布WorldReasonBench基准,旨在直接评估视频生成模型作为“世界模拟器”的推理能力。该基准包含436个测试案例,涵盖物理、社会、逻辑和信息四大维度及22个子类,要求模型根据初始状态与动作生成状态演化一致的未来视频。评估采用人类对齐的双部分方法:过程感知推理验证通过结构化问答检测时序与因果错误;多维质量评估则对推理质量、时序一致性和视觉美学进行评分。测试发现,当前先进模型在视觉合理性与世界推理能力间存在显著差距,生成的视频可能看似逼真却违反动态、因果或信息守恒规律。相关资源已开源。


推荐理由:视频生成越来越像真的,但逻辑和因果一塌糊涂,这个基准把问题量化了,想做世界模拟器的团队可以拿来测测自己的模型到底懂不懂世界。

5月11日5月11日周一

星期一 · 1 条
08:00
Thinking Machines Lab:官方博客(RSS)精选
AI 评分 59/100
Thinking Machines Lab发布Interaction Models研究预览

Thinking Machines Lab发布interaction models研究预览。该模型从零训练,原生处理音频、视频和文本,采用多流微回合设计实现实时响应,无需外部脚手架。研究预览展示了全新的交互能力,并在智能性与响应性上取得综合SOTA表现。


推荐理由:Thinking Machines 把实时交互训进了模型本身,不再是外挂脚手架,微轮次架构和 benchmark 数据很硬,做语音/视频助手的可以认真看看,虽然还是研究预览,但方向值得盯着。

5月7日5月7日周四

星期四 · 1 条
16:16
IT之家(RSS)精选
AI 评分 70/100
全国首例 AI 短剧侵权刑事案一审宣判:盗录超 1700 部牟利获刑,构成侵犯著作权罪

全国首例AI短剧侵权刑事案一审宣判。被告人盗录某公司AI工具生成的短剧超过1700部,并在二手平台以66.66元打包出售牟利,构成侵犯著作权罪。法院认定,这些短剧由用户输入原创剧本、情节等提示词生成,体现了独创性表达,属于受著作权法保护的作品。被告人被判处有期徒刑八个月,缓刑一年两个月,并处罚金人民币六千元。涉案公司平台已累计生成超7000部AI短剧,单价数元至十几元,热门剧销量可达上千份。


推荐理由:AI短剧首例刑事案落槌,法院认定了提示词创作的独创性,以后靠盗录AI赚快钱的路子要被堵死,做内容生意的都得认真看。

5月5日5月5日周二

星期二 · 3 条
17:32
Runway:News(网页)精选
AI 评分 80/100
从单张图像构建实时视频智能体:Runway Characters技术解析

Runway公司推出“Characters”实时视频智能体,它能将任意单张参考图像(如真人、卡通或幻想生物照片)实时转化为具有自然对话表现力的视频角色。该技术基于其通用世界模型GWM-1,无需微调即可生成每秒24帧的高清视频,并同步口型、表情和头部运动。其核心突破在于通过自回归逐帧生成、流程优化与并行化,实现了每帧仅37毫秒的模型处理时间,以及从用户停止说话到角色开始响应仅1.75秒的服务器端延迟,从而满足了实时交互对话的严苛要求。


推荐理由:把单张图变成实时对话角色这件事,Runway 做到了 24fps 且 1.75 秒响应。不是预录,是真实时,还带了知识库和工具调用,做虚拟角色产品的可以直接拿来集成。
10:14
阿绎 AYi@AYi_AInotes精选
AI 评分 74/100
分享一个免费下载任何 YouTube 视频的GitHub开源项目,非常实用🔥分享一个免费下载任何 YouTube 视频的GitHub开源项目,非常实用🔥能做的事,放在一起看有点夸张,输入:任意 YouTube 链接↓ 自动下载视频 ↓ 人声分离(干净去除背景音) ↓ 语音转文字 ↓ 翻译成 100+ 种语言 ↓ 克隆原始声线 ↓ 自动配音合成输出:完整配音视频全程:< 2 分钟以前这条流水线要什么,先用yt-dlp 下载,再用Audacity 分离人声,然后用Whisper 转录,再用DeepL 翻译,接着用ElevenLabs 克隆声线,最后再手动合成,光订阅费加起来就不便宜,Voice-Pro 把这六步压成一个本地工具,100% 跑在自己机器上,数据不出门,免费,我觉得对做多语言内容的创作者来说,这个工作流改变挺明显的,老规矩GitHub地址评论区自取👇开源项目Voice-Pro将多语言视频创作流程大幅简化。用户输入YouTube链接后,该工具可在本地自动完成视频下载、人声分离、语音转文字、翻译、声线克隆及配音合成,全程不到两分钟。它将原本需要多个付费工具协作的复杂流程,整合为一个免费、本地化的高效解决方案,显著提升了创作者的工作效率。

推荐理由:一个开源工具把 yt-dlp + Whisper + 翻译 + 声线克隆六步压缩成一条本地流水线,之前每月烧几百刀订阅费的事现在免费跑在自己机器上,做多语言视频的人可以直接换掉整套工具链。

5月4日5月4日周一

星期一 · 1 条
16:14
阿绎 AYi@AYi_AInotes精选
AI 评分 77/100
Claude通过第三方平台补足视频分析能力,开启AI应用新生态Claude终于补上了自己最大的短板,现在能真正看懂视频了。不用等Anthropic官方慢吞吞的更新,现在通过Algrow的MCP平台,你只要扔一个YouTube、TikTok或者Instagram的链接,Claude就能完整看完整个视频,分析画面、音频、节奏、文字叠加,甚至给你出一份可落地的深度分析报告。演示效果直接颠覆认知, 输入一个YouTube Shorts频道的URL,Claude会自动调用视频分析工具,批量拉取该频道所有短视频,生成包含标题、播放量、点赞率的完整数据表格。 接着它会做病毒化深度拆解,告诉你为什么有的视频爆了,有的却石沉大海。 它能精准识别出所有视频共用的模板、配音和动画风格,然后一针见血地指出:决定性差异从来不是后期特效,而是前2秒的hook概念冲击力。 最狠的是帧级留存分析,它会画出每一秒的观众流失曲线,标出哪些时间段是“死亡区”,观众会在这一秒毫不犹豫划走。以前你要花三天时间,手动刷几十条视频、记满一本笔记、做无数个表格才能得出的结论。 现在一句话,30秒搞定。Algrow的后端会自动完成视频下载、关键帧提取、音频转写,再把多模态数据完整喂给Claude。 通过MCP工具链,它能一口气跑完“看视频→抓数据→交叉对比→输出报告”的全流程,中间不需要你任何干预。目前这个功能正处于免费无限试用的推广期。 正式上线后定价也非常亲民,1个积分可分析约8分钟视频,最低25美元/月的订阅就包含12小时以上的分析额度。为什么这件事意义重大?1. 大模型的战争已经彻底转向生态 Claude的文本推理能力一直是行业顶尖,但原生视频能力长期落后于Gemini。这次第三方开发者用MCP的方式,一夜之间就把Claude拉到了同一水平线,甚至因为工具链式调用能力变得更强。这证明未来的胜负手从来不是参数,而是谁的生态能长出更多杀手级应用。2. 内容创作者迎来核武器级生产力工具 以后再也不用熬夜刷竞品了。让Claude帮你把同赛道所有爆款和扑街视频全看一遍,直接提炼出可复制的hook公式、转场节奏和内容结构。谁先用上这套工具,谁就能在流量战里领先别人一个身位。3. 视频研究Agent的时代正式开启 视频是互联网上体量最大、最难处理的数据类型。一旦Claude能看懂视频,再结合MCP的工具链能力,很快就能诞生能自动监控全网流量趋势、生成完整内容策略、甚至迭代创意的AI Agent。内容分析这个曾经的人力密集型工作,正在被彻底重构。当然它也有局限,对小众文化梗和细腻情绪的理解仍有误差,敏感内容不要随意投喂,免费期结束后算力成本可能会传导到价格上。 但这些都不重要,潘多拉的盒子已经打开了。借助Algrow的MCP平台,Claude现已能直接分析YouTube等平台的视频内容,自动生成包含数据表格、爆款拆解与留存曲线的深度报告。这标志着大模型竞争重点转向生态建设,第三方开发者通过工具链迅速弥补了Claude的原生视频短板。该功能为内容创作者提供了高效分析竞品、提炼爆款公式的生产力工具,并预示视频研究Agent时代的开启。目前处于免费试用阶段,未来订阅定价亲民。

推荐理由:第三方MCP插件让Claude终于能分析视频,做视频的一键生成爆款拆解和帧级留存分析,比手动刷三天视频强多了。

4月29日4月29日周三

星期三 · 2 条
14:49
Alibaba Cloud@alibaba_cloud精选
AI 评分 64/100
HappyHorse 1.0 在 fal 平台上线HappyHorse 1.0 is now live on @fal. Go build.HappyHorse 1.0 现已在 @fal 上线。去构建吧。 【引用 @fal】:Happy Horse 1.0 is live on fal, day 0 🐎 🎬 一流的运动质量 🎧 原生1080p,音频同步一步完成 🔗 音视频联合生成,非拼接 🔓 限制更少,商业用途更广 ⚡ 为生产规模而构建

fal: Happy Horse 1.0 is live on fal, day 0 🐎 🎬 Best-in-class motion quality 🎧 Native 1080p with synced audio in one pass �...


推荐理由:阿里云不声不响丢了个跟 Sora 对标的视频生成模型,音画同步一镜出片,直播带货团队可以立刻试试。

4月16日4月16日周四

星期四 · 1 条
10:47
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 71/100
Seedance 2.0:推进面向复杂世界的视频生成

Seedance 2.0于2026年2月初在国内发布,作为原生多模态音视频生成模型,采用统一高效架构支持文本、图像、音频、视频四种输入。可生成4-15秒、480p/720p音视频,开放平台支持3视频+9图像+3音频的多模态参考,并提供Fast加速版本。相比前代全面提升基础生成与多模态性能,专家评估显示其已达行业领先水平。

另有 1 家信源报道X:Artificial Analysis (@ArtificialAnlys)
推荐理由:Seedance 2.0 把音视频联合生成真正推到了可用级别,支持多片段、多图片、多音频参考输入,对做视频的创作者是直接的生产力提升。

4月15日4月15日周三

星期三 · 1 条
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 57/100
宣布推出视频生成功能

OpenRouter平台现已上线视频生成服务。用户可通过单一API接口,直接调用顶级的视频生成模型。这一集成简化了开发流程,使开发者无需分别对接不同厂商,即可便捷地访问和使用当前领先的视频AI模型能力。


推荐理由:OpenRouter 把视频生成塞进统一 API,对已经在用它做多模型路由的开发者来说是零成本扩展,但对大多数人只是又一个聚合入口,不算必须关注的节点。

4月9日4月9日周四

星期四 · 1 条
08:00
Hugging Face:Blog(RSS)精选
AI 评分 60/100
Waypoint-1.5:为消费级GPU打造的高保真交互世界模型

Wayve发布Waypoint-1.5模型,用于生成高保真可交互虚拟世界。该模型经优化后能在消费级GPU(如RTX 4090)上高效运行,降低硬件门槛,支持实时交互与动态场景生成,适用于自动驾驶模拟、游戏开发等领域,推动AI技术民主化。


推荐理由:Waypoint 1.5 把实时生成世界从 demo 变成了消费级 GPU 上能跑的东西,360p 版的兼容性让游戏本也能玩。高保真不是重点,实时响应和本地运行才是,做互动内容的值得关注。