Topic · 主题全部主题 →

AI 视频

AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。

2,076条收录
136条精选

精选归档 · 第 2 页

2140 条 · 共 136

8月3日8月3日周一

星期一 · 1 条
10:44
公众号:MiniMax(稀宇科技)精选
AI 评分 75/100
MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声

MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。

另有 3 家信源报道X:MiniMax (@MiniMax_AI)X:Kim (@kimmonismus)The Decoder:AI News(RSS)
推荐理由:与多数开源视频模型不同,H3 原生支持同步生成立体声音频,且通过上下文再生成实现 2K 分辨率,为音视频生成应用提供了更完整的开源基座。

8月2日8月2日周日

星期日 · 2 条
21:26
公众号:卡尔的AI沃茨精选
AI 评分 72/100
实测MiniMax H3做后期和动效:视频届的审美王来了

MiniMax H3视频模型实测覆盖广告TVC、短剧、创意片头、动态海报、UI动效和游戏实机六类场景,可生成5-15秒视频、原生双声道、直出2K,一次最多放9张图、3段视频和3段音频,提示语最高支持7000字符。


推荐理由:多个场景测试显示 H3 在动态文字稳定性和动效克制上表现突出,提供的提示语结构可直接用于 UI、游戏宣传片等需要文字控制的视频生成。
14:31
Elon Musk@elonmusk精选
AI 评分 72/100
Grok 支持分析任意视频Grok can analyze any video https://grok.com/share/bGVnYWN5_8013f7a3-f604-4351-8cd7-acecf3ef165bGrok 可以分析任何视频 https://grok.com/share/bGVnYWN5_8013f7a3-f604-4351-8cd7-acecf3ef165b
推荐理由:Grok 的视频分析功能将多模态交互扩展到动态内容,对快速理解视频素材有直接帮助,不过演示链接未展示长视频或复杂场景下的表现,实际适用范围待验证。

8月1日8月1日周六

星期六 · 1 条
00:59
AYi@AYi_AInotes精选
AI 评分 75/100
animated-voiceover 开源:一人干翻动画工作室这个Skill真的让我看到了一个人干翻一个动画工作室的可能性,我用它做了个DeepSeek V4-Flash的视频,一个人,一条指令,40块钱,2分钟电影感动画科普视频。不是那种一眼AI的垃圾。是角色不崩、声音一致、镜头有语言、旁白有节奏的正经片子。这东西叫animated-voiceover,刚开源,MIT协议。作者是前字节产品经理@s1dashu,他自己已经用这套东西在小红书起号了。它不是软件,不是App,是一套喂给Codex/Claude Code的完整制片流程。你就跟它说一句:"用animated-voiceover做一条两分钟关于确认偏误的动画科普",剩下的Agent按流程给你跑:先研究,写完整旁白, 锁视觉风格参考图,锁角色参考图。 每15秒拆成5个镜头,每个镜头写清主体、变化、镜头运动。先生成第1段,把人声提出来,48kHz立体声WAV锁死。后面所有片段全部挂这同一个人声参考——声音飘的问题,工程化解决了。逐段QC,旁白完整性、角色一致性、构图、运动,不合格重来。 最后拼成片,做封面。最狠的是它解决问题的方式,全是工程思维,不是玄学。AI视频最大的痛点是什么?声音每段都不一样,角色脸走着走着就变了,镜头之间没有逻辑。他怎么干的?先做第一段,把人声锚定,后面全挂这个参考。一张风格图贯穿全片,每个角色独立参考图+角色表管理。旁白写完再切,中文卡到每15秒60个字,多一个少一个都不行,信息密度均匀,不机械。这不是"帮我生成个视频",这是把一个专业动画导演脑子里的制片流程,变成了Agent可以执行的Skill。一条2分钟的片子,LibTV跑下来大概40块钱。一个人,一个下午,从选题到成片。以前这活儿得一个团队干一周。作者反复强调一句话:90%自动化,但那10%人的判断决定上限。你定选题、定风格、卡审批,剩下重复的、容易出错的、熬人的,全交给Agent。这才是Agent Skill该有的样子,不是跟你聊天,不是帮你写个Prompt,是把一整条专业生产管线——从研究到脚本到分镜到渲染到QC到成片——封装成一个你随时可以调用的能力。知识博主、超级个体、想做深度内容但不会动画的人,这个东西的价值怎么强调都不过分。B站、小红书那些电影感科普号,以前得团队作战,现在一个人就能干。GitHub搜s1dashu/animated-voiceover,SKILL.md和references目录里全是干货,旁白怎么写、分镜怎么拆、声音怎么锁、Seedance的提示词怎么用,全给你摊开了。别再问AI能不能替代内容创作者了,会用这种工具的创作者,正在替代不会用的。前字节产品经理 @s1dashu 开源 animated-voiceover,一套喂给 Codex/Claude Code 的完整动画科普视频制片流程,MIT 协议,可实现 90% 自动化。

sida: 最近我在用 Codex 配合 LibTV CLI 制作动画科普视频(Animated Voiceover Video),同时运营一个小红书账号。目前小红书账号正在稳步起步,数据看起来相当健康。 现在我把这个 Skill 开源出来了: htt...


推荐理由:这个 Skill 把专业动画导演的制片流程封装成了 Agent 可执行的管道,首段锚定人声、风格图贯穿全片,工程化地解决了角色崩和声音飘的问题,个人创作者 40 块钱就能产出 2 分钟电影感科普视频,值得马上动手试。

7月31日7月31日周五

星期五 · 4 条
22:59
AYi@AYi_AInotes精选
AI 评分 75/100
字节 Seedance 2.5 发布:30 秒一镜到底视频damn,seedance 2.5这回真的要杀疯了!!!这个日本雨中街道的第一人称视频,我看了三遍才敢信是AI生成的🤯。。。第一人称视角,撑着伞走在日本的雨里,雨滴打在伞面上,积水里映着路灯和电线杆的倒影。穿校服的学生骑着自行车从身边过去,黄雨衣的小孩在前面跑。铁路道口的栏杆缓缓放下,警报声响,一列电车轰鸣着驶过。栏杆抬起,继续走。手持镜头的呼吸感,对焦的轻微漂移,雨打在镜头上的水渍。整整30秒,一镜到底。你告诉我这是AI生成的????!!这就是Seedance 2.5,字节Seed团队今天刚放出来的东西。上一代还在比谁生成的15秒片段更像真的,这一代直接干到30秒原生,还能多轮延长做成几分钟连贯内容。不是剪碎了硬拼,是真的有叙事、有节奏、有起承转合。50个参考素材同时喂进去——30张图、10段视频、10段音频,角色、场景、风格、镜头语言全给你锁住。3D白模、绿幕都能当参考,哪里不满意改哪里,不用整段重新渲。音画是一起生成的,雨声、脚步声、电车轰鸣、唇形对白,原生同步,不用后期对。最恐怖的是那个"一眼AI"的门槛,终于被迈过去了啊啊啊啊啊!!!之前的AI视频,你总觉得哪里不对——手是糊的,物理是崩的,人走着走着脸变了,镜头一切逻辑就断了。Seedance 2.5这个30秒POV放出来,多少人第一反应是"这不是实拍吗"。这肯定已经不是量变了!这是从"AI生成了一段好看的动画"到"AI拍了一段片子"的区别。之前所有AI视频工具的定位都是"玩具"——好玩、惊艳,但你没法真的拿它干活。30秒连贯叙事、精确参考控制、局部编辑、原生音画同步,这些东西凑到一起,意味着它从玩具变成了生产工具。独立创作者、短视频团队、广告公司,现在真的可以用它出活了。即梦AI、豆包专业版已经上了,Dreamina和CapCut国际版在推,API马上开。AI视频这场战争,Kling、Runway、Luma、Hailuo杀得正凶,字节今天直接把SOTA的旗子又往前面插了一大截。几小时就30万播放,我猜是因为所有人看完都意识到同一件事 AI视频这回真的能用了!!!! https://x.com/seiiiiiiiiiiru/status/2083119055972835400/video/1字节跳动 Seed 团队发布 Seedance 2.5,支持 30 秒原生一镜到底视频生成,并可通过多轮延长形成几分钟连贯内容。该模型支持 50 个参考素材(30 图、10 视频、10 音频)锁定角色与风格,音画原生同步,并支持局部编辑。即梦 AI、豆包专业版已上线,Dreamina 和 CapCut 国际版在推,API 即将开放。
另有 1 家信源报道Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:这是AI视频从玩具到生产工具的分水岭,30秒一镜到底加原生音画同步,独立创作者终于能拿它出活了,字节直接把SOTA往前推了一大截。
21:42
公众号:百度智能云(文心)精选
AI 评分 66/100
百度搭子一镜Skill:一句话生成数字人口播视频

百度搭子内置的一镜Skill支持仅凭一句话或一个主题,自动完成脚本生成、声音、数字人形象、口型驱动和视频渲染,生成可直接播放的数字人口播视频,全程无需拍摄、剪辑和露脸。该功能适用于旅游攻略、产品种草、知识科普、临时活动宣传、企业内部培训及个人IP起步等场景,大幅降低视频制作门槛。


推荐理由:拆解了从想法到成品视频的全链路,非专业用户能直观理解脚本生成、数字人驱动等环节如何协作,有助于判断这类工具能否嵌入现有创作流程。
12:06
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 80/100
字节发布 Seedance 2.5:单次生成 30 秒视频,支持多模态参考与精准编辑

字节跳动今日正式发布新一代视频创作模型 Seedance 2.5,单次视频生成时长从 15 秒提升至 30 秒,并支持多轮延长,可产出数分钟连贯内容。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,并升级白模参考、运动参考及绿幕编辑、时间戳精准编辑等能力。Seedance 2.5 已陆续上线即梦 AI、豆包专业版等平台,API 服务近期将上线火山方舟。

另有 6 家信源报道X:Rohan Paul (@rohanpaul_ai)公众号:火山引擎X:Testing Catalog (@testingcatalog)The Decoder:AI News(RSS)IT之家(RSS)X:Deedy Das (@deedydas)
推荐理由:Seedance 2.5 把单次生成拉到 30 秒,加上多模态参考和精准编辑,让视频创作从片段拼凑变成完整叙事。对国内创作者来说,这是即梦和豆包里能马上用到的最强视频模型。
10:21
公众号:数字生命卡兹克精选
AI 评分 69/100
MiniMax H3 发布并将开源,主打视觉包装与后期特效

MiniMax 发布 AI 视频模型 H3,并宣布开源。该模型主打视觉包装与后期特效,可生成动态 MV、动态海报、Vlog、电影片头、游戏 UI 等,语义遵循能力极强,在广告与动效领域表现优于 Seedance 2.0,但影视级张力镜头稍逊。H3 开源后预计将出现大量垂直领域特化版本。

另有 4 家信源报道IT之家(RSS)X:MiniMax (@MiniMax_AI)MarkTechPost(RSS)The Decoder:AI News(RSS)
推荐理由:在 Seedance 统治的前期创作之外,H3 用语义强控制补上了视觉包装与后期特效这块拼图,广告和社媒短片的后期流程可能因此从剪辑软件迁移到提示词。

7月24日7月24日周五

星期五 · 3 条
19:50
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 77/100
SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成

SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。


推荐理由:SANA-Video 2.0 视频生成模型把单 GPU 的 720p 生成压到 13 秒,比 Wan 2.2 快 120 倍,做视频应用的开发者该重新评估成本模型了。
14:50
IT之家(RSS)精选
AI 评分 73/100
Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频

Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于 Self-Flow 学习框架扩展,可在单次生成中输出最长 20 秒视频并附带原生音频,支持文生视频、图生视频、多镜头串联等任务。

另有 5 家信源报道Hacker News 热门(buzzing.cc 中文翻译)X:Deedy Das (@deedydas)X:Emad Mostaque (@EMostaque)The Decoder:AI News(RSS)MarkTechPost(RSS)
推荐理由:FLUX 3 把图像、视频、音频塞进同一个架构,单次能出 20 秒带声视频,对比 Grok Video 胜率 69%,视频生成赛道的竞争又升温了。

7月21日7月21日周二

星期二 · 1 条
01:49
The Decoder:AI News(RSS)精选
AI 评分 76/100
《第九区》导演Neill Blomkamp发布首部完全由AI生成的短片《Nightborne》

Neill Blomkamp发布了13分钟科幻恐怖短片《Nightborne》,完全使用Seedance 2.0视频生成模型通过文本提示逐帧创作。影片采用纪录片风格,使用了32位真实人物的面部和声音(已获授权),人类艺术家负责概念艺术。Blomkamp表示计划以相同格式拍摄一部长片,并已创立AI电影工作室Barley Studios。


推荐理由:《第九区》导演用AI拍了一部13分钟的叙事短片,不是实验片段,还顺势成立了AI电影工作室——这可能是长片AI制作的分水岭。

7月20日7月20日周一

星期一 · 1 条
22:00
公众号:昆仑万维(天工)精选
AI 评分 64/100
昆仑万维发布并开源可交互世界模型 Matrix-Game 3.5

昆仑万维在 WAIC 2026 发布并开源新一代可交互世界模型 Matrix-Game 3.5。该模型通过 Patch Memory 与 Warped PRoPE 实现长期记忆与几何一致性建模,可在单张 GPU 上以 720P 分辨率、约 20FPS 实时生成流式视频。


推荐理由:昆仑万维这次开源的Matrix-Game 3.5在记忆和几何一致性上给出了一套可插拔的方案,不是纯炫技,全球开发者能直接复用到自己的视频基座上,做游戏和仿真的该关注一下。

7月17日7月17日周五

星期五 · 3 条
15:20
公众号:通义实验室(千问)精选
AI 评分 69/100
通义实验室发布 Wan-Streamer v0.2,端到端响应延迟仅 550ms

通义实验室发布 Wan-Streamer v0.2,这是一款将“听、看、说、演”统一进单个 Transformer 的端到端全模态模型。其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。


推荐理由:通义实验室把实时视频交互延迟压到550ms,同时提升了分辨率,不是刷榜而是解决实际问题,对做数字人和实时助手的团队是个值得跟进的信号。
15:14
公众号:通义实验室(千问)精选
AI 评分 76/100
Wan-Streamer v0.2 发布:端到端响应延迟仅 550ms,支持 640×368 实时视频对话

通义实验室发布 Wan-Streamer v0.2,端到端响应延迟 550ms(200ms 模型延迟 + 350ms 网络延迟),输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS。


推荐理由:550ms端到端延迟把实时视频对话从拼接流水线推入单模型交互循环,原先因响应太慢而无法沉浸的口语陪练与面试模拟,开始具备自然对话的交互基础。
00:32
Google Blog:AI(RSS)精选
AI 评分 60/100
Google Vids 上线 Gemini Omni 与个人数字分身功能

Google Vids 推出两项更新:Gemini Omni 支持用户通过自然语言提示词和图片参考生成、逐步编辑高质量视频片段;个人数字分身功能允许用户上传自拍和语音录制后,输入文字即可让数字分身出镜。两项功能面向 Google AI Pro 和 Ultra 订阅者及 Google Workspace 商业客户开放,所有生成内容均含不可见的 SynthID 数字水印。


推荐理由:如果你已经在用 Google Workspace,这两个更新让 Vids 的可用性提升了一档,但对于外部的 AI 视频生成,没带来新变量。

7月16日7月16日周四

星期四 · 2 条
10:10
公众号:昆仑万维(天工)精选
AI 评分 68/100
天工短剧工作台发布"Agent智能分镜+无限画布"双轨创作模式

天工短剧工作台推出双轨创作模式,通过导演Agent自动解析剧本、规划站位与机位,并支持多视细节图生成,解决AI短剧角色变脸和站位漂移问题。该工具内置影视级提示词模板、720°全景图及3D导演台,实现可控生产。已有三部作品上线DramaWave 7天实现百万美元级营收。


推荐理由:天工短剧工作台把导演思维实打实地做进了产品,站位置图和3D导演台专门根治角色乱变脸的痼疾,是短剧工具从随机抽卡迈向可控生产的关键一步,创作者值得细看。
10:00
公众号:昆仑万维(天工)精选
AI 评分 66/100
天工短剧工作台推出"Agent智能分镜+无限画布"双轨创作模式,告别AI短剧"随机抽卡"

天工短剧工作台(SkyProduction)推出“Agent智能分镜+无限画布”双轨创作模式,将导演思维拆解为六个可干预环节,通过站位图锁定和多视细节图生成解决角色漂移、变脸问题。该工作台支持720°全景图、3D导演台、多账号分级管理及数据中心,并原生支持英文短剧全流程处理。其三部精品短剧上线DramaWave仅7天,均实现百万美元级营收。


推荐理由:天工短剧工作台把导演思维拆解成可干预的站位、光影和调度环节,降低了从单镜头到连续叙事的落差,适合需要稳定产出精品短剧的团队。

7月14日7月14日周二

星期二 · 1 条
17:10
公众号:卡尔的AI沃茨精选
AI 评分 75/100
实测LibTV Agent:100个AI视频工作流重组为Skill,实现创意自由

LibTV推出Agent功能并内置Skill Hub,提供100多个覆盖武侠电影、皮克斯动画广告、电商口播等类型的视频Skill。用户输入想法后,Agent会分析需求并询问方向,自动生成视频分镜并串联成完整节点工作流,每个节点可查看和修改提示语。生成后LibTV会启动自查机制,自动检测并返修有问题的镜头。故事板视图提供图片与视频资产总览,支持在成片中直接打开剪辑时间线进行精细调整。用户还可自行创建Skill,上传三个文件即可,无需编程。实测中,Agent能输出剧情连贯、带粤语配音的成片,并支持双语字幕生成。


推荐理由:LibTV把成熟的视频流程做成可复用的Skill,并开放自定义上传,让创作者无需从节点开始,直接输出接近成片的作品,对于想缩短想法到成片距离的人,这是一个值得上手的效率工具。