精选归档 · 第 5 页

81100 条 · 共 140

5月28日5月28日周四

星期四 · 2 条
23:36
SenseTime@SenseTime_AI精选
AI 评分 68/100
商汤发布信息图生成模型升级,增强多项核心能力𝗛𝗼𝘄 𝗼𝘂𝗿 𝘂𝗽𝗴𝗿𝗮𝗱𝗲𝗱 𝗶𝗻𝗳𝗼𝗴𝗿𝗮𝗽𝗵𝗶𝗰 𝗴𝗲𝗻𝗲𝗿𝗮𝘁𝗶𝗼𝗻 𝗺𝗼𝗱𝗲𝗹 — 𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮-𝗨𝟭-𝟴𝗕-𝗠𝗼𝗧-𝗜𝗻𝗳𝗼𝗴𝗿𝗮𝗽𝗵𝗶𝗰 — 𝗱𝗲𝗹𝗶𝘃𝗲𝗿𝘀 𝗲𝘃𝗲𝗻 𝘀𝘁𝗿𝗼𝗻𝗴𝗲𝗿 𝗰𝗮𝗽𝗮𝗯𝗶𝗹𝗶𝘁𝗶𝗲𝘀 💪• 𝗧𝗲𝘅𝘁 𝗮𝗰𝗰𝘂𝗿𝗮𝗰𝘆 & 𝗿𝗲𝗮𝗱𝗮𝗯𝗶𝗹𝗶𝘁𝘆 enhanced — reduced repetition, avoided unnatural enlargement, and stronger support for small fonts • 𝗟𝗮𝘆𝗼𝘂𝘁 𝗰𝗼𝗻𝘀𝗶𝘀𝘁𝗲𝗻𝗰𝘆 & 𝗿𝗮𝘁𝗶𝗼𝗻𝗮𝗹𝗶𝘁𝘆 improved, with more stable backgrounds • 𝗖𝗵𝗮𝗿𝘁 & 𝗱𝗶𝗮𝗴𝗿𝗮𝗺 𝗾𝘂𝗮𝗹𝗶𝘁𝘆 elevated • 𝗔𝗰𝗮𝗱𝗲𝗺𝗶𝗰 𝗿𝗲𝗻𝗱𝗲𝗿𝗶𝗻𝗴 supportedTry it out: 🥰 https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-Infographic 🖼 Showcases: https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1_infographic_showcases.md 👾 Discord: https://discord.gg/BuTXPHmQub@huggingface @github商汤科技介绍了其升级后的信息图生成模型 SenseNova-U1-8B-MoT-Infographic。该模型参数为8B,在四个关键维度进行了优化:文本准确性与可读性增强,减少了重复和不当放大;布局的一致性与合理性提升,背景更稳定;图表与示意图的质量提高;并新增了学术内容的渲染支持。推文提供了在 Hugging Face 上的模型页面链接及能力展示页面。
另有 1 家信源报道X:商汤 SenseTime (@SenseTime_AI)
推荐理由:信息图生成赛道又出新货,商汤这次把文本渲染和布局稳定性真正做好了,做学术图表或运营配图的人可以直接去HuggingFace试用,效果肉眼可见的提升。
04:05
Krea@krea_ai精选
AI 评分 73/100
Krea 2图像模型现已登陆ComfyUIKrea 2 available in Comfy!Krea 2现已登陆Comfy! KREA的首个基础图像模型--从零训练--具备可调节的创造力、风格参考和情绪板条件控制。

ComfyUI: KREA 2 Image is now a Partner Node in ComfyUI KREA's first foundation image model — trained from scratch — with tunable ...

另有 1 家信源报道X:Krea AI (@krea_ai)
推荐理由:Krea 终于掏出自己的基础图像模型,不再只是包装别人模型。ComfyUI 原生节点让工作流玩家可以立刻上手折腾,自研模型的风格控制是个新鲜变量。

5月27日5月27日周三

星期三 · 1 条
11:19
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
MRT:用于大规模分层图像生成与编辑的掩码区域Transformer

MRT是一个20B参数的掩码区域扩散模型,专为多层透明图像生成与编辑设计。它在超过1000万个多语言设计样本上训练,统一了文本到图层、图像到图层和图层到图层三项任务。模型通过选择性token掩码实现灵活的图层生成与编辑,并引入溢出感知画布图层以处理边界不一致问题,支持半透明背景合成。此外,应用扩散蒸馏实现了8步实时生成。实验表明,MRT在所有任务上显著优于先前先进方法与商业系统。用户研究显示,其图像到图层质量优于同期Qwen-Image-Layered模型,推理速度快10-100倍,GPU内存消耗降低50-90%。


推荐理由:首次把分层图像生成统一到 20B 遮罩扩散框架,溢出画布层的设计挺巧,让图层可以超出边界编辑,蒸馏后能实时跑,做设计工具的团队该仔细读读。

5月26日5月26日周二

星期二 · 1 条
14:18
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 75/100
通过奖励倾斜分布匹配强化少步生成器

本文提出奖励倾斜分布匹配蒸馏(RTDMD),这是一个将分布匹配蒸馏与奖励引导强化学习统一应用于少步流生成器的两阶段框架。该方法通过最小化到奖励倾斜教师分布的KL散度,自然分解为分布匹配项与奖励最大化项。第一阶段引入环境一致分布匹配蒸馏(AC-DMD),在子区间进行分布匹配,并通过一致性正则化辅助分数模型追踪生成器分布。第二阶段联合优化两项,并推导混合策略梯度及步子集GRPO(SubGRPO)以降低方差。在SD3、SD3.5和FLUX.2上的实验表明,RTDMD仅用4步推理即可在偏好、美学和组合指标上达到新的 state-of-the-art。


推荐理由:这篇直接把分布匹配蒸馏和奖励建模拧在一起,在 SD3/3.5/FLUX.2 上用 4 步推理就压了之前所有文生图对齐方法,做图像生成训练和偏好对齐的该看。

5月22日5月22日周五

星期五 · 5 条
23:14
Google DeepMind@GoogleDeepMind精选
AI 评分 67/100
Project Genie与谷歌街景合作推出交互式世界Project Genie 🤝 @GoogleMaps Street ViewYou can now take real U.S. places and transform them into new, interactive worlds. 🌍Project Genie 🤝 @GoogleMaps Street View 你现在可以将真实的美国地点转化为全新的交互式世界。🌍

推荐理由:Project Genie这次不是纸上谈兵了,直接吃进真实街景吐出来可玩世界,虽然暂时只限美国,但这是生成式游戏从能做走向普通人可玩的关键一步。
15:44
Elon Musk@elonmusk精选
AI 评分 73/100
Grok推出智能体模式,提升角色一致性Grok progressGrok 进展 Grok Imagine Agent Mode 现已在 Grok iOS 应用上推出。 借助 Agent Mode,你可以生成: • 跨代际一致的角色 • 同一角色的多场景画面 • 不同的镜头角度和环境 • 更具电影感和连贯性的叙事视觉效果 这是角色一致性和 AI 生成叙事方面的一次重大升级。 现在就在 Grok iOS 应用中尝试吧。

X Freeze: Grok Imagine Agent Mode is now available on Grok iOS app With Agent Mode, you can generate: • Consistent characters acro...


推荐理由:Grok Imagine Agent Mode把角色一致性从「抽卡」变成可控流程,做故事板、漫画创作的可以立刻上手,虽然目前仅限iOS,但这一步方向很对。
09:13
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
RiT:在表示空间中使用原生扩散变换器已足够

本研究探讨预训练表示空间在流匹配学习中的优势。比较像素、SD-VAE与DINOv2特征后发现,尽管像素与DINOv2的内在维度相近,但DINOv2在几何统计特性(如有效秩、协方差条件等)上表现更优,使回归过程更稳定。基于此,我们提出了表示图像变换器(RiT),它使用冻结的DINOv2特征,通过x-prediction目标训练一个原生扩散变换器。在ImageNet 256×256生成任务上,RiT性能优于参数量更多的DiT^DH-XL模型,且生成的常微分方程仅需少量步骤即可高效求解。


推荐理由:这篇论文没发明新架构,但通过剖析DINOv2特征的统计属性,证明简单结构在表示空间也能做出SOTA,对做图像生成的人来说是个省钱省参数的好思路。
00:07
美团 LongCat:HuggingFace 新模型精选
AI 评分 73/100
LongCat-Video-Avatar-1.5:升级版音频驱动数字人视频生成框架

美团LongCat团队发布了LongCat-Video-Avatar-1.5,一个专注于音频驱动数字人视频生成的开源框架。其核心升级在于采用Whisper-Large音频编码器,显著优化了唇部动态的流畅度与自然度。该版本实现了精准的唇形同步、全身时序稳定性以及长视频中的身份一致性,并能泛化应用于动漫、动物及多人交互等复杂场景。通过基于DMD2的步蒸馏技术,模型仅需8步即可高效推理。团队还构建了一个涵盖多场景、多语言的人工评估基准,通过大规模主观评分与专家分析,验证了其在多项关键维度上的优异性能。

另有 1 家信源报道IT之家(RSS)
推荐理由:美团把数字人模型升级到1.5版,换了Whisper做音频编码,唇形同步比之前自然不少,而且开源了训练代码,做电商直播和虚拟博主的朋友可以直接拿过来跟商业方案掰手腕。

5月21日5月21日周四

星期四 · 4 条
16:07
AYi@AYi_AInotes精选
AI 评分 79/100
游戏开发门槛被AI大幅降低holy shit,游戏开发的门槛,刚刚被 Grok 一脚踹飞了🤯一句提示词出角色图→图片变动画→视频自动拼成 spritesheet→直接丢进 Unity 跑起来,全程 4 步,几分钟, 以前这活要美术+动画师干好几天, 以后做游戏真的只要张嘴就行了是吧🤣具体拆一下 Grok 这次演示的管线:1️⃣ 生成角色图 跟 Grok 说一句提示词,比如"特斯拉 Optimus 机器人,白背景,全身居中",几秒出高清图。2️⃣ 图转视频让角色动起来 用 Grok 的图片转视频功能,走路、挥手、跳跃随便选,几秒出动画。3️⃣ 视频自动拼 spritesheet 后台有个叫 Asset Forge 的插件帮你把视频逐帧拆好拼成一张大图,不用手动抠。4️⃣ 丢进引擎直接用 spritesheet 导入 Unity 或 Godot,角色立刻就能跑能跳。 视频里那个橙色卡通 Optimus 就是现场聊着天做出来的。最狠的是迭代速度, 传统做法改个动作:重新渲染、重新导入,动辄几小时。 现在:在聊天框里说"加个跑步动画""改成赛博朋克风",AI 秒改,实时预览。 反馈循环从"天"变成"秒"。而且这还不是AI 画个图让你导出用那么简单,它是让AI 直接进入游戏引擎工作流,实时生成可运行的资产。这意味着以后 solo 开发者一个人真能顶一个团队了, 周末花几个小时搞出一个可玩的游戏原型不再是梦了。想试试的朋友直接 @Grok,用提示词"特斯拉 Optimus 风格的卡通机器人,全身,白背景"起步就行🤖Grok展示了AI深度介入游戏开发的全新工作流。通过"提示词生成角色图→图片转动画视频→自动拼接成Spritesheet→导入引擎"四步流程,将传统需要美术与动画师耗时数天的工作,在几分钟内完成。这标志着AI不再仅生成静态内容,而是能实时生成可直接导入Unity或Godot等游戏引擎的可运行资产。该技术极大压缩了游戏原型的迭代周期,将反馈循环从"天"缩短至"秒",使得独立开发者也能快速实现创意,显著降低了游戏创作的门槛。

Grok: Prototyping game assets directly with Grok @imagine


推荐理由:Grok 这波不是画张图那么简单,它把 AI 直接嵌进游戏引擎工作流,实时生成可运行的资产,solo 开发者周末搞个原型出来真的可行了。
00:14
Google AI@GoogleAI精选
AI 评分 69/100
谷歌发布多款AI创意工具新功能We partnered with artists, designers, and builders to create new AI tools that solve real problems in their creative workflows.Here’s what’s new: — Introducing Google Pics in @GoogleWorkspace: A brand-new image creation & editing tool. Move and resize objects, add text, and translate just by hovering and clicking— Big updates to @GoogleFlow: 1) You can now create with Gemini Omni Flash in Google Flow 2) Google Flow Agent is a multi-step creative partner that reasons and plans complex tasks with you. 3) Google Flow tools are custom tools you can “vibe code” for animations, video effects, text layering & more— Design live with @StitchbyGoogle: Now, you can use text or voice prompts to edit layouts in real time then export those designs straight to code— More creative control in @GoogleFlowMusic: Edit songs section by section, remix the style of full songs, and create music videos with our new Gemini Omni Flash model谷歌与创作者合作推出系列AI工具更新。Google Workspace新增图像创作编辑工具Pics;Google Flow支持Gemini Omni Flash模型,并推出Flow Agent作为多步骤创作伙伴;设计工具StitchbyGoogle支持实时文字或语音编辑布局并导出代码;音乐工具Google FlowMusic增加分段编辑、风格混音及视频生成功能。
另有 1 家信源报道X:Google AI for Developers (@googleaidevs)
推荐理由:Google这次更新的不是单点工具,而是把AI能力像乐高一样嵌入到创意工作流的每一步,Flow Agent的多步骤推理尤其值得做设计的人试试看。

5月20日5月20日周三

星期三 · 2 条
01:27
Krea@krea_ai精选
AI 评分 73/100
Krea 2深度解析与使用指南Krea 2 deep dive.learn how to use style references, moodboards, and how to prompt with Krea 2.Krea 2深度解析。 学习如何使用风格参考、情绪板,以及如何用Krea 2进行提示。

Krea: today, Krea 2 goes live to everyone. to celebrate, we're offering unlimited Krea 2 generations to all our subscribers fo...


推荐理由:Krea 2 正式全量发布,这个 deep dive 把风格参考和情绪板玩法讲得很透,做视觉内容的朋友今天就能用上。

5月19日5月19日周二

星期二 · 1 条
03:50

5月18日5月18日周一

星期一 · 2 条
11:19

5月17日5月17日周日

星期日 · 1 条
15:47

5月16日5月16日周六

星期六 · 1 条
04:05