精选归档 · 第 4 页

6180 条 · 共 442

8月3日8月3日周一

星期一 · 1 条
10:10
Qwen:Blog Retrieval(API)精选
AI 评分 89/100
Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数

Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。


推荐理由:首次将 Max 级模型权重开源,为开源社区提供比肩闭源旗舰的能力,但实际效果需待下周权重放出后由社区验证。

8月2日8月2日周日

星期日 · 1 条
14:31
Elon Musk@elonmusk精选
AI 评分 72/100
Grok 支持分析任意视频Grok can analyze any video https://grok.com/share/bGVnYWN5_8013f7a3-f604-4351-8cd7-acecf3ef165bGrok 可以分析任何视频 https://grok.com/share/bGVnYWN5_8013f7a3-f604-4351-8cd7-acecf3ef165b
推荐理由:Grok 的视频分析功能将多模态交互扩展到动态内容,对快速理解视频素材有直接帮助,不过演示链接未展示长视频或复杂场景下的表现,实际适用范围待验证。

7月31日7月31日周五

星期五 · 7 条
22:59
AYi@AYi_AInotes精选
AI 评分 75/100
字节 Seedance 2.5 发布:30 秒一镜到底视频damn,seedance 2.5这回真的要杀疯了!!!这个日本雨中街道的第一人称视频,我看了三遍才敢信是AI生成的🤯。。。第一人称视角,撑着伞走在日本的雨里,雨滴打在伞面上,积水里映着路灯和电线杆的倒影。穿校服的学生骑着自行车从身边过去,黄雨衣的小孩在前面跑。铁路道口的栏杆缓缓放下,警报声响,一列电车轰鸣着驶过。栏杆抬起,继续走。手持镜头的呼吸感,对焦的轻微漂移,雨打在镜头上的水渍。整整30秒,一镜到底。你告诉我这是AI生成的????!!这就是Seedance 2.5,字节Seed团队今天刚放出来的东西。上一代还在比谁生成的15秒片段更像真的,这一代直接干到30秒原生,还能多轮延长做成几分钟连贯内容。不是剪碎了硬拼,是真的有叙事、有节奏、有起承转合。50个参考素材同时喂进去——30张图、10段视频、10段音频,角色、场景、风格、镜头语言全给你锁住。3D白模、绿幕都能当参考,哪里不满意改哪里,不用整段重新渲。音画是一起生成的,雨声、脚步声、电车轰鸣、唇形对白,原生同步,不用后期对。最恐怖的是那个"一眼AI"的门槛,终于被迈过去了啊啊啊啊啊!!!之前的AI视频,你总觉得哪里不对——手是糊的,物理是崩的,人走着走着脸变了,镜头一切逻辑就断了。Seedance 2.5这个30秒POV放出来,多少人第一反应是"这不是实拍吗"。这肯定已经不是量变了!这是从"AI生成了一段好看的动画"到"AI拍了一段片子"的区别。之前所有AI视频工具的定位都是"玩具"——好玩、惊艳,但你没法真的拿它干活。30秒连贯叙事、精确参考控制、局部编辑、原生音画同步,这些东西凑到一起,意味着它从玩具变成了生产工具。独立创作者、短视频团队、广告公司,现在真的可以用它出活了。即梦AI、豆包专业版已经上了,Dreamina和CapCut国际版在推,API马上开。AI视频这场战争,Kling、Runway、Luma、Hailuo杀得正凶,字节今天直接把SOTA的旗子又往前面插了一大截。几小时就30万播放,我猜是因为所有人看完都意识到同一件事 AI视频这回真的能用了!!!! https://x.com/seiiiiiiiiiiru/status/2083119055972835400/video/1字节跳动 Seed 团队发布 Seedance 2.5,支持 30 秒原生一镜到底视频生成,并可通过多轮延长形成几分钟连贯内容。该模型支持 50 个参考素材(30 图、10 视频、10 音频)锁定角色与风格,音画原生同步,并支持局部编辑。即梦 AI、豆包专业版已上线,Dreamina 和 CapCut 国际版在推,API 即将开放。

推荐理由:这是AI视频从玩具到生产工具的分水岭,30秒一镜到底加原生音画同步,独立创作者终于能拿它出活了,字节直接把SOTA往前推了一大截。
21:42
公众号:百度智能云(文心)精选
AI 评分 66/100
百度搭子一镜Skill:一句话生成数字人口播视频

百度搭子内置的一镜Skill支持仅凭一句话或一个主题,自动完成脚本生成、声音、数字人形象、口型驱动和视频渲染,生成可直接播放的数字人口播视频,全程无需拍摄、剪辑和露脸。该功能适用于旅游攻略、产品种草、知识科普、临时活动宣传、企业内部培训及个人IP起步等场景,大幅降低视频制作门槛。


推荐理由:拆解了从想法到成品视频的全链路,非专业用户能直观理解脚本生成、数字人驱动等环节如何协作,有助于判断这类工具能否嵌入现有创作流程。
17:59
MiniMax:Blog(网页)精选
AI 评分 78/100
MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频

MiniMax 正式推出全能多模态生成模型 H3,可联合理解文本、图像、视频和音频,生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出,2K 下每秒价格低于主流模型三分之一,768p 下低于主流 720p 价格一半。官方计划近日开源模型权重,以支持开源社区并加速硬件兼容。


推荐理由:MiniMax H3 把全模态生成打到了 2K 分辨率且价格不到主流三分之一,还计划开源权重,这对闭源视频模型是实打实的压力,开发者可以重点关注。
12:06
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 80/100
字节发布 Seedance 2.5:单次生成 30 秒视频,支持多模态参考与精准编辑

字节跳动今日正式发布新一代视频创作模型 Seedance 2.5,单次视频生成时长从 15 秒提升至 30 秒,并支持多轮延长,可产出数分钟连贯内容。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,并升级白模参考、运动参考及绿幕编辑、时间戳精准编辑等能力。Seedance 2.5 已陆续上线即梦 AI、豆包专业版等平台,API 服务近期将上线火山方舟。


推荐理由:Seedance 2.5 把单次生成拉到 30 秒,加上多模态参考和精准编辑,让视频创作从片段拼凑变成完整叙事。对国内创作者来说,这是即梦和豆包里能马上用到的最强视频模型。
10:21
公众号:数字生命卡兹克精选
AI 评分 69/100
MiniMax H3 发布并将开源,主打视觉包装与后期特效

MiniMax 发布 AI 视频模型 H3,并宣布开源。该模型主打视觉包装与后期特效,可生成动态 MV、动态海报、Vlog、电影片头、游戏 UI 等,语义遵循能力极强,在广告与动效领域表现优于 Seedance 2.0,但影视级张力镜头稍逊。H3 开源后预计将出现大量垂直领域特化版本。


推荐理由:在 Seedance 统治的前期创作之外,H3 用语义强控制补上了视觉包装与后期特效这块拼图,广告和社媒短片的后期流程可能因此从剪辑软件迁移到提示词。

7月30日7月30日周四

星期四 · 2 条
23:27
Google DeepMind:Blog(RSS)精选
AI 评分 60/100
Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人

Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。


推荐理由:DeepMind 把 Gemini 带到机器人领域,视频理解、任务编排和多机协作的叙事很宏大,但全是愿景,没有实测数据,是不是真正的 step change 得等细节。做机器人的可以先建个追踪。
00:26
Google DeepMind:Blog(RSS)精选
AI 评分 63/100
Google DeepMind 在 Flow Music 中推出 Lyria 3.5,提升音乐性、歌词、人声与创作控制

Google DeepMind 今日在 Google Flow Music 中发布新一代音乐生成模型 Lyria 3.5,带来音乐性、歌词质量、人声表现力与创作控制的多项提升。新模型能生成更自然复杂的旋律结构,歌词对提示词的遵循度和结构意识更强,人声更逼真且富有情感,同时支持更便捷地控制输出节奏与时长。


推荐理由:Lyria 3.5 把音乐生成从玩具级推到了可用创作工具级别,歌词和情感人声的提升对内容创作者是实实在在的福音。

7月29日7月29日周三

星期三 · 1 条
23:56
TechCrunch:AI(RSS)精选
AI 评分 73/100
Martha Stewart 联合创办 AI 初创公司 Hint,为房主提供家居管理 AI 助手

Hint 今日上线,利用 AI 技术帮助房主管理维护计划、能耗、土壤与空气质量、保险理赔等事务,并支持存储和查询房屋相关合同与文件。该应用基于公开数据为每栋房屋建立档案,通过 AI 聊天机器人回答个性化问题,并提供主动维护提醒与“房屋评分”。Hint 目前免费提供 iOS 版,无订阅或广告,未来计划推出付费高级功能。


推荐理由:Martha Stewart 以联合创始人身份加入 Hint 绝非挂名,她亲自打磨体验,这个 AI 家居助手整合了图像识别和文档查询,让房主终于有了一个可用的家庭管理中枢,是 AI 从聊天走向实用的一次有趣尝试。

7月27日7月27日周一

星期一 · 3 条
23:35
公众号:月之暗面(Kimi)精选
AI 评分 81/100
Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放

Kimi 发布 K3 模型权重与技术报告,并开源 MoonEP、FlashKDA 和 AgentEnv 三项关键 Infra 技术。K3 是 2.8 万亿参数的 MoE 模型,支持原生视觉与 100 万 token 上下文,参数规模约为 K2.5 的 3 倍,规模化效率提升 2.5 倍。


推荐理由:权重开源伴随技术报告公开训练细节,为研究机构直接复现和改造千亿级MoE模型提供了完整路径,也降低企业自部署门槛。
23:31
公众号:月之暗面(Kimi)精选
AI 评分 85/100
Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放

月之暗面发布 2.8 万亿参数的混合专家模型 Kimi K3,支持原生视觉理解和 100 万 token 上下文窗口。其规模化效率较 Kimi K2.5 提升 2.5 倍,并同步开源模型权重、技术报告及 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。


推荐理由:Kimi K3 的完全开放是一个明确信号,月之暗面把最核心的模型权重和技术细节全部公开,国内开发者从此有了媲美国际顶尖开源的底座。虽然部署门槛不低,但开放本身推动了生态发展。

7月24日7月24日周五

星期五 · 2 条
14:50
IT之家(RSS)精选
AI 评分 73/100
Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频

Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于 Self-Flow 学习框架扩展,可在单次生成中输出最长 20 秒视频并附带原生音频,支持文生视频、图生视频、多镜头串联等任务。


推荐理由:FLUX 3 把图像、视频、音频塞进同一个架构,单次能出 20 秒带声视频,对比 Grok Video 胜率 69%,视频生成赛道的竞争又升温了。
03:53
Claude:Blog(网页)精选
AI 评分 75/100
Claude 语音模式现已支持 Opus、Sonnet 及连接工具与多语言

即日起,Claude 语音模式在 Opus、Sonnet 和 Haiku 上运行,并支持连接 Gmail、Slack 等工具及更多语言。用户可在对话中切换模型,语音模式默认沿用上次文本聊天使用的模型。该功能面向所有用户开放 beta 测试,免费版可使用 Haiku 及一个连接工具,付费版可访问更多模型和全部连接工具。


推荐理由:Claude 语音模式终于能调用最强模型了,深度思考不再受限于轻量版,加上工具集成和多语言,移动端从随口问答升级为实时脑力伙伴,值得立即上手。

7月23日7月23日周四

星期四 · 2 条
19:58
公众号:龙猫LongCat(美团)精选
AI 评分 62/100
MineExplorer:美团 LongCat 评测揭示顶级多模态大模型在动态开放世界中的能力断层

美团 LongCat 团队构建 MineExplorer,这是首个在开放世界中做到分钟级长程任务的评测基准,含 813 个人工验证实例(1-hop 到 4-hop)及规则化里程碑自动评测框架。


推荐理由:感知强于推理、导航失败占比近60%,把具身智能的瓶颈清晰地拉回到规划能力,而非感官或资源。
19:58
公众号:龙猫LongCat(美团)精选
AI 评分 68/100
MineExplorer:首个《我的世界》分钟级长程任务评测基准发布

美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。


推荐理由:18 个顶级多模态模型在 Minecraft 里全翻车,每多一层隐藏前置条件成功率就砍半,搞具身智能的该看看感知和行动之间还隔着什么。