Topic · 主题全部主题 →

AI 视频

AI 视频生成与理解:文生视频模型、视频编辑工具与影视创作变革的追踪。

2,076条收录
136条精选

精选归档 · 第 3 页

4160 条 · 共 136

7月14日7月14日周二

星期二 · 1 条
08:03
TechCrunch:AI(RSS)精选
AI 评分 70/100
视频生成创企 PixVerse 完成 4.39 亿美元 C 轮扩展融资,估值超 20 亿美元

新加坡视频生成初创公司 PixVerse 完成 C 轮扩展融资,共筹集 4.39 亿美元,估值突破 20 亿美元。公司提供 V 系列(消费者及 API)、C 系列(专业影视)及今年初发布的 R 系列世界模型(游戏开发)。用户可生成最高 4k 分辨率并自带音频的视频,消费端注册用户超 1.5 亿,月活超 1500 万,图生视频每分钟 4.80 美元。本轮投资者包括阿里巴巴等。公司计划今年推出新 V 系列模型及新版世界模型,并全球拓展企业客户。

另有 1 家信源报道The Decoder:AI News(RSS)
推荐理由:4.39亿美元让视频生成赛道又添一把火,PixVerse押注的字节系数据标注经验,比模型参数更值得产品人关注,虽然市场挤,但估值翻倍是真实信心。

7月12日7月12日周日

星期日 · 1 条
00:53
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
Ghost Font:一种人类能读懂但AI无法识别的反AI字体

Ghost Font 是一种利用运动、视频、噪点和诱饵来隐藏文字的反AI字体。用户输入文字后可生成并下载视频片段,视频中的字母由与背景完全相同的点组成,单帧截图无法显示任何信息。该字体生成的视频被传递给Claude Fable和GPT Sol 5.6 Ultra等前沿模型时,这些模型即使具备编程能力也无法解码移动信息,直到被提示具体技术。视频中还包含一条诱饵信息,使模型误以为找到真实内容。项目灵感来自2013年Sang Mun设计的ZXX字体,但现代AI已能轻松读取ZXX。Ghost Font目前为本地原型,数据不发送至任何服务器。作者计划未来将视频生成代码开源,并探索将其用于CAPTCHA系统或AI视觉感知基准测试。


推荐理由:这个项目用视频中运动的光点传递文字,还加了假消息陷阱,让顶级视觉模型集体失败。对抗AI感知的探索很少这么直观,做CAPTCHA和对抗样本的值得看。

7月8日7月8日周三

星期三 · 2 条
10:18
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
AlayaWorld:长程可玩视频世界生成

AlayaWorld 是一个全栈开源框架,用于构建交互式生成世界。该框架支持开放式实时交互,用户可自由导航并执行战斗、施法、召唤怪物等多种动作。AlayaWorld 将数据准备、模型架构、训练、推理加速和部署统一在模块化可扩展的架构中,并发布了可复现流程、参考实现、评估工具和完整文档,为生成世界模型的未来研究与实时应用奠定基础。


推荐理由:AlayaWorld 把生成世界从 demo 变成了可交互的全栈开源框架,放出了完整 pipeline,对做游戏和具身智能的团队来说是一套可以立刻跑起来的工具链,值得落地尝试。
03:58
AI at Meta@AIatMeta精选
AI 评分 75/100
Meta Superintelligence Labs 推出 Muse Image 和 Muse VideoIntroducing Muse Image and Muse Video, the first media generation models developed by Meta Superintelligence Labs.Muse Image is our most advanced image generation model yet. It follows instructions faithfully, edits with precision, composes from multiple references, and draws on Instagram for social context. It also brings agentic tool use capabilities to image generation and integrates with Muse Spark.You can try Muse Image in the Meta AI app and web, as well as in Instagram Stories and WhatsApp – starting in limited countries with more locations on the way.Today we’re also previewing Muse Video, which is built upon the same pretraining base as Muse Image to deliver exceptional visual fidelity with native audio support.Learn more about both models: https://go.meta.me/7f4427Meta Superintelligence Labs 发布首个媒体生成模型 Muse Image 和 Muse Video。Muse Image 是目前最先进的图像生成模型,能精确遵循指令、精准编辑、多参考构图,并利用 Instagram 社交上下文。它还具备智能体工具使用能力并集成 Muse Spark。用户可通过 Meta AI 应用、网页、Instagram Stories 和 WhatsApp 试用,初始限于部分国家。Muse Video 基于相同预训练基础,实现高视觉保真度并原生支持音频。
另有 6 家信源报道X:AI at Meta (@AIatMeta)The Decoder:AI News(RSS)X:Testing Catalog (@testingcatalog)The Verge:AI(RSS)IT之家(RSS)TechCrunch:AI(RSS)
推荐理由:Meta 超级智能实验室的首个媒体生成模型,把图像生成跟 Instagram 社交语境结合听起来很实用,但细节还少,期待后续实测。

7月7日7月7日周二

星期二 · 2 条
14:50
Elon Musk@elonmusk精选
AI 评分 72/100
Grok Imagine 更新:支持 15 秒视频Grok Imagine updateGrok Imagine 更新。请更新你的 Grok 应用!15 秒 Imagine 视频现已可用,质量令人难以置信。

tetsuo: 更新你的 Grok 应用!15 秒的 Imagine 视频现已可用,而且画质令人难以置信。


推荐理由:Grok Imagine 加入视频生成,xAI 在多模态上再进一步。15 秒视频质量据说惊艳,但推文缺细节,想试的可直接更新 App。
12:50
Ethan Mollick@emollick精选
AI 评分 75/100
MIRA:可玩多人世界模型,20 FPS实时生成"火箭联盟的梦"I have been playing these world models/games since the first diffusion DOOM, and multiplayer at 20 FPS is pretty neat. "A dream of rocket league," indeed.MIRA是一个可玩、多人的世界模型,被形容为"火箭联盟的梦"。它基于10k小时公开机器人收集的数据训练,学习四玩家游戏动态,根据按键实时生成画面,帧率达20 FPS。模型由General Intuition与Kyutai Labs联合构建,Epic Games提供协作。Ethan Mollick称从最早的扩散DOOM玩过来,多人20 FPS效果出色。演示、技术报告及开源代码已公开,在ICML Booth 111现场展示。

General Intuition: 推出 MIRA。 一个可玩的、多玩家世界模型。 一场《火箭联盟》的梦境。 MIRA 基于公开可用的机器人收集的 1 万小时数据进行训练,学习了一个四人游戏的动态机制。该模型根据你和其他玩家按下的按键,以每秒 20 帧的速度实时运行。 由 G...


推荐理由:世界模型终于跑通了实时多人游戏,20 FPS 的 Rocket League 梦境能直接上手玩,代码和报告都开源,做游戏和交互的值得试试。

7月3日7月3日周五

星期五 · 4 条
23:46
公众号:生数科技(Vidu·视频)精选
AI 评分 70/100
生数科技发布 Vidu S1,推动视频生成迈向"实时交互"新时代

7月3日,生数科技在2026全球数字经济大会上发布Vidu S1实时交互模型,支持实时视频通话和语音控制视频走向,实现无限时长连续互动。模型采用自回归扩散路线,基于已生成画面和语音指令持续预测后续内容;无需传统建模,一张图片即可创建角色并自定义音色。Vidu S1在540P分辨率下实现25FPS(最高42FPS)实时生成,通过TurboDiffusion等技术降低计算成本,已开启内测。

另有 1 家信源报道HuggingFace Daily Papers(社区热门论文)
推荐理由:Vidu S1 把视频生成从离线拉到了实时通话级交互,语音控制无限时长是质变,但只有540P,内测阶段实际延迟和稳定性待看,做虚拟陪伴和直播的可以跟。
01:08
Apple Machine Learning Research(RSS)精选
AI 评分 56/100
VideoFlexTok:可变长度粗到细视频分词

VideoFlexTok提出一种可变长度token序列的视频表示方法,采用粗到细结构——首个token捕捉语义和运动等抽象信息,后续token添加精细细节,生成流解码器支持任意token数量的视频重建。相比传统3D网格分词,该结构允许根据下游需求调整token数,在相同预算下编码更长视频。在类别和文本到视频生成任务中,VideoFlexTok以1.1B参数(5.2B的1/5)达到可比生成质量(gFVD和ViCLIP Score)。训练一个处理10秒81帧视频的文本到视频模型仅需672个token,比同等3D网格分词器少8倍。


推荐理由:把视频 tokenization 从固定网格改成变长 coarse-to-fine,训练效率提升明显,还能做更长的视频。研究角度挺漂亮,但离产品落地还有距离,做视频生成的可以追一下。
00:06
IT之家(RSS)精选
AI 评分 71/100
快手可灵AI获初始投资者20.28亿美元注资,投后估值180亿美元

快手在港交所公告,21名初始投资者同意以138.24亿元人民币(20.28亿美元)现金注资北京可灵,后者将持有可灵AI相关资产。同日15名额外投资者追加出资52.235亿元人民币(7.6639亿美元),认购总上限为204.471亿元(30亿美元),对应北京可灵扩大后注册资本的16.67%。投后估值180亿美元。快手预计未来12个月内启动可灵AI赴港上市,募资用于扩充算力、建设数据中心及人才引进。


推荐理由:可灵AI这轮180亿美元估值融资,是AI视频赛道迄今最重量级的资本动作之一,也是中国AI公司分拆上市的标杆事件,值得关注后续上市进程。

7月2日7月2日周四

星期四 · 1 条
21:38
公众号:可灵AI(快手·视频)精选
AI 评分 71/100
戛纳金狮首设AI子赛道:可灵制作斩获1银2铜,它们为何打动评委?

戛纳国际创意节今年首次设立AI Craft子赛道,两部使用可灵AI生成的广告作品获奖:《L'Ultimo Uomo Reale》拿下Classic单元Film银奖及Craft单元Film Craft铜奖,《Lorem Ipsum》获得Classic单元Film铜奖。


推荐理由:《L’Ultimo Uomo Reale》和《Lorem Ipsum》用可灵完成从人物表演到视觉奇观的全部画面,戛纳金狮的认可使AI视频生成进入商业交付级评价体系,广告公司的「技术已就绪」主张因此有了第三方权威参考。

7月1日7月1日周三

星期三 · 1 条
03:55
NotebookLM@NotebookLM精选
AI 评分 68/100
NotebookLM Short Video Overviews 全量上线 Web 英文版There seems to be a *lot* of discourse about our new Short Video Overviews. Want to join in on the fun?Short VOs have officially rolled out to ALL users on Web in English. Share your examples below!Here's one of our faves about this year's World Cup ⚽️:NotebookLM 正式向 Web 英文用户全量推出 Short Video Overviews(短视频概览)功能。该功能可将复杂资料自动转化为 60 秒竖屏视频,深入讲解任意概念。此前,这一功能已面向 Google AI Ultra 和 Pro 订阅者(移动端及 Web)推出,免费用户即将可用。

NotebookLM: 刷短视频也能涨知识了 🤓 NotebookLM 推出短视频概览功能!把你最复杂的资料变成 60 秒的竖屏视频,深入讲解任意概念。 现已面向 Google AI Ultra 和 Pro 订阅用户在移动端和网页端逐步推送(免费用户即将上线!)

另有 1 家信源报道X:NotebookLM (@NotebookLM)
推荐理由:NotebookLM 把资料源变成 60 秒竖屏视频,想法不新但落地很实用,学生和内容创作者可能会高频用上,只是颠覆性谈不上。

6月26日6月26日周五

星期五 · 1 条
02:41
Runway:News(网页)精选
AI 评分 65/100
Runway发布Agent 2.0

Runway发布Agent 2.0,帮助营销人员创建、测试和优化广告、视频及营销活动。品牌营销人员可在对话中开发活动概念、生成变体并自动本地化;绩效营销人员可上传创意并导入Meta、YouTube、TikTok或Google广告数据,由Agent分析后生成下一轮待测广告。社交媒体营销人员可一次性生成一周内容,自动裁切为9:16、16:9、1:1等格式;产品营销人员可借助Agent确定定位角度并构建活动资产。Agent 2.0面向所有用户开放。


推荐理由:Runway的Agent 2.0不只是生成视频,它试图打通从广告数据分析到全平台素材生成的闭环,做增长和社交内容的团队可以观望一下。

6月25日6月25日周四

星期四 · 1 条
11:12
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
Causal-rCM:自回归视频扩散蒸馏的统一教师强制与自强制开源方案

Causal-rCM将扩散蒸馏框架rCM扩展至自回归视频扩散,提出教师强制(TF)与自强制(SF)互补训练范式,并发布统一开源算法与基础设施。通过自定义掩码FlashAttention-2 JVP内核,首次实现基于教师强制的连续时间一致性模型(sCM/MeanFlow)用于自回归视频扩散,收敛速度比离散时间版本快10倍。蒸馏后的2步因果Wan2.1-1.3B模型在仅1或2步采样下取得VBench-T2V分数84.63,仅使用合成数据即达到帧级和块级流式视频生成SOTA。该方法还应用于Cosmos 3全模态世界基础模型,实现动作条件生成的交互式世界模型。


推荐理由:把自回归视频扩散蒸馏到1-2步采样,VBench冲到84.63,这个配方让实时视频生成和交互世界模型从论文走进了工程落地,做视频产品的该看。

6月24日6月24日周三

星期三 · 2 条

6月23日6月23日周二

星期二 · 2 条
07:18
Runway:News(网页)精选
AI 评分 59/100
Aleph 2.0 现已集成到 Figma Weave

Aleph 2.0 是 Runway 的旗舰视频编辑模型,现已在 Figma Weave 中上线。它是一个基于上下文的视频编辑模型,通过关键帧工作:从视频中提取一帧,重新设计风格并附上时间戳连接回 Aleph 2.0 节点,即可将该编辑传递到主体出现的每一帧,同时保持其他内容不变。支持最长 30 秒、1080p 的片段,可跨多镜头序列应用编辑,无需逐镜头处理。


推荐理由:Runway 把旗舰视频编辑模型直接接入了 Figma 的创意画布,对设计师和视频团队来说,这意味着帧级编辑不用切换工具,协作流程可能大幅简化。
03:05
TechCrunch:AI(RSS)精选
AI 评分 70/100
Google DeepMind 7500 万美元投资 A24,合作开发电影 AI 工具

Google DeepMind 宣布向独立电影制片厂 A24 投资 7500 万美元(据《华尔街日报》),双方将合作开发电影制作 AI 工具。A24 出品过《万事俱备》《后室》等影片。Google DeepMind CEO Demis Hassabis 称,希望通过与艺术家直接合作,打造支持创意表达的 AI 功能。此举是好莱坞最新一次科技公司与电影 AI 联手,此前 Netflix 已收购 Ben Affleck 的 AI 工具公司 Interpositive,亚马逊 MGM 工作室也在去年设立了影视 AI 部门。


推荐理由:Google DeepMind 首次在影视内容创作上投入 7500 万美元,与 A24 合作开发 AI 工具,这标志着顶尖 AI 实验室开始直接渗透好莱坞核心创意流程,做文娱 AI 工具的人和关注产业交叉点的人应该留意。

6月22日6月22日周一

星期一 · 1 条
17:05
IT之家(RSS)精选
AI 评分 71/100
让大模型从"一问一答"走向"边看边说",京东开源实时视频视觉语言交互模型 JoyAI-VL-Interaction

京东官方宣布开源实时视频视觉语言交互模型 JoyAI-VL-Interaction,这是全球首个全栈开源的 interaction 模型和系统,获 vLLM-Omni day-0 原生支持。该模型具备三重突破:主动判断(持续观察视频流自主决定何时说话)、实时响应(面向正在发生的视频流即时响应)、适时智能体委托(复杂任务转交后台模型,前台继续观察)。支持摄像头、直播流、监控流等视频输入,以及语音输入输出、可视化界面、长期记忆和 vLLM 部署。在 58 个真人盲评案例中,对比豆包视频通话助手总体胜率 77.6%,对比 Gemini 视频通话助手总体胜率 87.9%。

另有 1 家信源报道公众号:京东JoyAI
推荐理由:京东开源了首个全栈实时视频交互模型,让大模型能持续观察并主动响应,开发者可以直接用代码搭建安防、导购等实时AI助手,实用性很强。

6月19日6月19日周五

星期五 · 1 条