精选归档 · 第 17 页

321340 条 · 共 721

6月12日6月12日周五

星期五 · 3 条
08:00
Zyphra Research(网页)精选
AI 评分 71/100
Zyphra 发布开源实时语音克隆模型 ZONOS2

Zyphra 发布 Apache 2.0 许可的实时 TTS 模型 ZONOS2,采用 8B 总参数、900M 激活参数的 MoE 架构,主打高保真零样本语音克隆,权重已上线 Hugging Face。


推荐理由:原文给出架构、训练数据和评测细节,读者可以了解这个开源实时 TTS 模型在音色保真与生成稳定性之间的取舍。
01:20
Logan Kilpatrick@OfficialLoganK精选
AI 评分 81/100
Gemini Omni Flash 视频任务达 SOTAGemini Omni Flash is SOTA at image to video, text to video, and video editing : )Excited to get this to developers in the API soon!Gemini Omni Flash 在图像到视频、文本到视频和视频编辑方面达到了 SATA : ) 很高兴很快能将这一能力通过 API 提供给开发者!

推荐理由:视频生成正式进入全模态一体时代,Gemini Omni Flash 把图生视频、文生视频和剪辑整合在一个模型里,API 很快上线,做视频工具的可以提前琢磨对手在哪了。
01:17
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 72/100
DeepSeek-R1 的开源实现

DeepSeek-R1 的开源复现项目已在 GitHub 发布,在 Hacker News 上获得 101 个积分。该项目旨在以开源方式复现 DeepSeek-R1 模型。


推荐理由:Hugging Face 把 DeepSeek-R1 的完整训练管线拆解得清清楚楚,从数据蒸馏到 GRPO 强化学习都开源了,还放出了复现的模型和数据集。想理解或自己训练推理模型的开发者,这大概是目前最实用的路线图。

6月11日6月11日周四

星期四 · 3 条
12:10
Midjourney:Updates(RSS)精选
AI 评分 64/100
Midjourney V8.1 已成为默认模型

Midjourney 已将默认模型从 V7 升级为 V8.1。V8.1 在智能性、连贯性、对详细提示的遵循度以及文本渲染效果上均有提升,HD 模式也已支持。

另有 1 家信源报道X:Midjourney (@midjourney)
推荐理由:虽然V8.1不是大版本,但设为默认后所有用户自动升级,尤其是文本和复杂提示词的理解增强,做设计的朋友值得重新测试一下关键词。
02:48
xAI@xai精选
AI 评分 74/100
Grok Voice性能出色价格低廉Grok Voice offers state-of-the-art performance with human-like timing, tone, and warmth. And it's a fraction the price of competitors.Check it out: http://x.ai/api/voiceGrok Voice 提供最先进的性能,具有类人的时机、语调和温暖感。而且价格仅为竞争对手的一小部分。 查看详情:http://x.ai/api/voice

ServiceNow AI Research: 🚀 Grok Voice Think Fast 1.0 (@xAI) lands on the Pareto frontier on EVA-Bench — no system in the eval beats it on accura...

另有 2 家信源报道xAI:News(网页)X:SpaceXAI (@SpaceXAI)
推荐理由:语音AI的SOTA这次不是OpenAI了,Grok Voice在EVA-Bench上无死角领先,价格还打到对手十分之一,做语音产品的可以认真看看这个帕累托前沿选手。
00:40
Google DeepMind:Blog(RSS)精选
AI 评分 72/100
DiffusionGemma:文本生成速度提升4倍的开源扩散模型

Google DeepMind 发布开源实验模型 DiffusionGemma,采用文本扩散技术,突破自回归逐 token 生成方式,每次前向并行生成 256 个 token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存消费级 GPU。在 H100 上达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,速度提升 4 倍。具备双向注意力和自我修正能力,面向内联编辑、代码填充等本地交互工作流,以 Apache 2.0 许可证开放。

另有 6 家信源报道Google Developers Blog(RSS)MarkTechPost(RSS)X:Google DeepMind (@GoogleDeepMind)X:Google AI for Developers (@googleaidevs)X:Demis Hassabis (@demishassabis)X:Testing Catalog (@testingcatalog)
推荐理由:DiffusionGemma 虽为实验性质,但它把文本生成从“串行打字机”变成了“并行印刷机”,本地推理速度 4 倍提升,对需要实时交互的开发者是个值得关注的方向。

6月10日6月10日周三

星期三 · 6 条
16:28
IT之家(RSS)精选
AI 评分 72/100
摩尔线程开源 MusaCoder 代码大模型,9B/27B 参数基于国产 GPU 全链路训练

摩尔线程发布并开源 MusaCoder 代码大模型,含 9B 和 27B 两个参数规模,是业内首个基于国产 GPU 算力底座完成全链路训练与验证的开源模型。后训练流程在基于 MTT S5000 的夸娥智算集群上完成,支持从 PyTorch 标准算子自动生成高性能 CUDA/MUSA 原生 Kernel 代码。在 KernelBench 评测中,MusaCoder-27B-RL 以 Overall Pass@8 93.2%、Avg.@8 88.60% 超越 Claude Opus、DeepSeek-V4 Pro、GLM-5.1、Kimi K2.6 等主流 SOTA 代码模型。


推荐理由:摩尔线程这个模型直接瞄准GPU底层算子,KernelBench分数压过了不少主流大模型,虽然场景窄,但在国产硬件自建软件生态的路上,迈出了挺关键一步。
08:00
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 78/100
JoyAI-VL-Interaction:实时视觉-语言交互智能

JoyAI-VL-Interaction是一个8B参数的视觉优先交互模型,能像人一样持续观察实时画面,自主决定每秒钟保持沉默、回应或将复杂问题委托给后台模型。模型擅长视觉触发响应和时间感知,并涌现出引导用户切换屏幕、根据幻灯片即兴讲解等未专门训练的能力。配合完整可部署系统,支持实时视频流输入、可插拔ASR/TTS模块、记忆、可视化UI及可连接任意API或智能体的后台大脑。在六个真实场景中,人类评估者更偏好该模型而非豆包和Gemini的应用内视频通话助手。这是首个开源且附带训练配方、数据和完整部署系统的视觉驱动交互模型。


推荐理由:这是首次把视觉主动交互能力做成开源模型和完整系统,模型不再等问题才回答,而是自己决定何时开口或保持沉默,对做实时助手和直播产品的团队有直接参考价值。
04:55
Hugging Face:Blog(RSS)精选
AI 评分 73/100
Cohere发布North Mini Code:面向开发者的开源编码模型

Cohere发布North Mini Code,一款30B参数MoE模型(3B活跃参数),Apache 2.0开源。在Artificial Analysis Coding Index上得分33.4,超越Qwen3.5、Gemma 4等同类模型。后训练采用两阶段SFT和RLVR,在SWE-Bench Verified上pass@10达80.2%,Terminal-Bench v2上达55.1%。支持64K/128K上下文长度,专为智能体编码任务优化。


推荐理由:Cohere的新编码模型North Mini Code以30B参数MoE架构,在SWE-bench pass@1达到61%,Apache 2.0开源,是小模型在agent coding领域真正可用的信号。
01:51
Jeff Dean@JeffDean精选
AI 评分 81/100
Gemini 3.5 Live Translate 支持70+语言翻译Speech translation has been one of the longest-running ML efforts at Google, and we’ve come a long way. Gemini 3.5 Live Translate is our latest speech-to-speech model, supporting 70+ languages. It enables more natural conversations across languages in everyday products and apps.Here’s an example of how partners at @InsideGrab are helping connect travelers with drivers. 🚗Rolling out in Google Translate and via the Live API in @GoogleAIStudio.语音翻译一直是Google历时最久的机器学习项目之一,我们已经取得了长足进展。Gemini 3.5 Live Translate是我们最新的语音到语音模型,支持70多种语言。它能让日常产品和应用中跨语言的对话更加自然。 以下是一个示例,展示@InsideGrab的合作伙伴如何帮助旅客与司机建立联系。🚗 已在Google Translate和@GoogleAIStudio的Live API中推出。
另有 14 家信源报道Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)The Decoder:AI News(RSS)Google Blog:AI(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Google DeepMind (@GoogleDeepMind)X:Ethan Mollick (@emollick)X:Gemini (@GeminiApp)X:Google AI (@GoogleAI)X:Google AI for Developers (@googleaidevs)X:Kim (@kimmonismus)X:Logan Kilpatrick (@OfficialLoganK)X:Rohan Paul (@rohanpaul_ai)X:Sundar Pichai (@sundarpichai)
推荐理由:Google把语音翻译做到70+语言,Gemini 3.5 Live Translate直接塞进Google Translate和API,普通人下载App就能用,做跨国生意的这下有福了。
01:04
Anthropic:Newsroom(网页)精选
AI 评分 90/100
Claude Fable 5 和 Claude Mythos 5

Anthropic 今日推出 Claude Fable 5(通用安全版)和 Claude Mythos 5(受限安全版)。Fable 5 在软件工程、知识工作、视觉、科研等几乎所有测试基准上达到 SOTA,Stripe 称其将数月工程压缩至数天,FrontierCode 评分居前沿模型之首,可仅凭截图重建网页应用源码。Mythos 5 在药物设计中实现约 10 倍加速,其分子生物学假说盲测获科学家偏好的概率约 80%。两模型售价均为 $10/百万输入 tokens、$50/百万输出 tokens,较 Claude Mythos Preview 降价过半。Fable 5 在部分敏感主题上回退至 Claude Opus 4.8,安全触发率低于 5% 的会话。Mythos 5 通过 Project Glasswing 向网络安全防御者开放。


推荐理由:Anthropic把最危险的模型安全地放出来了,Fable 5在编码、科研上不是小数点级别的提升,价格还砍半,95%的请求直接跑满血版,必读。

6月9日6月9日周二

星期二 · 8 条
23:35
Google DeepMind@GoogleDeepMind精选
AI 评分 69/100
Gemini 3.5 Live Translate 发布Say hello, hola, 你好 to Gemini 3.5 Live Translate: our latest audio model built for fast, cross-language communication. 🌐说 hello, hola, 你好--欢迎 Gemini 3.5 Live Translate:我们最新的音频模型,专为快速跨语言交流而构建。🌐
另有 14 家信源报道Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)The Decoder:AI News(RSS)Google Blog:AI(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Google DeepMind (@GoogleDeepMind)X:Ethan Mollick (@emollick)X:Gemini (@GeminiApp)X:Google AI (@GoogleAI)X:Google AI for Developers (@googleaidevs)X:Kim (@kimmonismus)X:Logan Kilpatrick (@OfficialLoganK)X:Rohan Paul (@rohanpaul_ai)X:Sundar Pichai (@sundarpichai)
推荐理由:Google 这个实时翻译模型把语音+翻译+大模型拧成了一股绳,虽然具体怎么用还不清楚,但做跨境、做语音助手的同学可以把它当个方向标。
23:05
Chubby♨️@kimmonismus精选
AI 评分 77/100
Claude Mythos 即将发布,Fable 精简版同日登场Confirmed, Claude Mythos will be unveiled in the next few hours确认,Claude Mythos 将在接下来几小时内揭晓。 【引用 @steph_palazzolo】: 独家:一个名为 Claude Fable 的精简版 Mythos 今天推出。它价格昂贵--是 Opus 的两倍--但或许不像人们从最初 Mythos 定价(Opus 的 5 倍)所想的那样昂贵。 更多内容及 Apple WWDC 见 AI Agenda: https://www.theinformation.com/newsletters/ai-agenda/anthropics-mythos-coming-today-apple-pursues-modest-goals-siri-revamp

Stephanie Palazzolo: Scoop: A neutered version of Mythos called Claude Fable is coming today. It's expensive—2x the price of Opus—but perhaps...

另有 18 家信源报道公众号:卡尔的AI沃茨公众号:数字生命卡兹克Claude Code:GitHub Releases(RSS)IT之家(RSS)The Decoder:AI News(RSS)The Verge:AI(RSS)Tomer Tunguz 博客(VC 分析)X:Boris Cherny (@bcherny)X:Claude (@claudeai)X:Claude Devs (@ClaudeDevs)X:Dario Amodei (@DarioAmodei)X:Elvis Saravia (@omarsar0, DAIR.AI)X:Eric Zakariasson (@ericzakariasson)X:Andrej Karpathy (@karpathy)X:Kim (@kimmonismus)X:OpenRouter (@OpenRouter)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)
推荐理由:Mythos 终于来了,但首发的是阉割版 Claude Fable,价格是 Opus 的两倍。虽然不算便宜,但比起原版 Mythos 定价已经温柔很多,应该能让很多观望的人先尝尝鲜。
11:40
公众号:小米 MiMo精选
AI 评分 80/100
小米 MiMo 与 TileRT 联合发布 UltraSpeed 模式,1T 模型输出突破 1000 tokens/s

小米 MiMo 与 TileRT 联合发布 MiMo-V2.5-Pro-UltraSpeed 模式,使 1T 参数旗舰模型输出速度首次突破 1000 tokens/s。模型侧采用 FP4 混合量化(仅量化 MoE Expert)与 DFlash 块级 masked 并行推测解码(coding 场景平均接受长度 6.30 tokens);系统侧 TileRT 引入常驻内核引擎与异构流水线协作。API 限时开放(2026 年 6 月 9 日至 23 日),定价为 MiMo-V2.5-Pro 的 3 倍,速度提升约 10 倍。FP4 权重与 DFlash 模型 checkpoint 已开源至 HuggingFace。

另有 2 家信源报道IT之家(RSS)X:小米 MiMo (@XiaomiMiMo)
推荐理由:万亿模型首次在通用GPU上突破1000 tokens/s,不是专用硬件的胜利而是模型与系统Codesign的胜利,做实时AI应用的都应该盯紧这一套方案。
11:32
公众号:小米 MiMo精选
AI 评分 84/100
Xiaomi MiMo-V2.5-Pro 携手 TileRT:1T 模型首次突破 1000 tokens/s 输出速度

Xiaomi MiMo-V2.5-Pro 的 UltraSpeed 模式与 TileRT 联合发布,让 1T 参数旗舰模型输出速度首次突破 1000 tokens/s,仅用一个标准 8 卡通用 GPU 节点实现。


推荐理由:万亿模型在通用 GPU 上跑出 1000 tps,把实时金融风控、量化交易和医疗影像等对延迟敏感的场景从「不可用」变为「可能」,且方法可复现。
08:00
Claude Platform:开发者版本说明(RSS)精选
AI 评分 75/100
Anthropic 发布 Claude Fable 5 与 Claude Mythos 5,支持 1M token 上下文窗口

Anthropic 推出最广泛可用的模型 Claude Fable 5,以及面向 Project Glasswing 参与者的 Claude Mythos 5。


推荐理由:Anthropic 发布 Fable 5,标配 1M 上下文和自适应思考,但 tokenizer 变化导致同样文本多出 30% token,成本结构需要重估,数据保留要求也可能影响隐私敏感用例。
05:15
Apple Machine Learning Research(RSS)精选
AI 评分 79/100
苹果发布第三代 Apple Foundation Models(AFM)

苹果推出第三代 Apple Foundation Models(AFM)基础模型家族,与 Google 合作定制,包含五个模型,覆盖从设备端到基于 Private Cloud Compute 的服务器端模型。这些模型旨在驱动 Apple Intelligence 功能,包括全新 Siri 和智能工具,以用户为中心深度融合操作系统,隐私为核心设计原则。


推荐理由:Apple与Google罕见联手推出的第三代基础模型,直接为下一代Siri和系统级AI功能铺路,标志着消费级AI的深度整合,产品经理和iOS开发者必须关注。
01:01
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
小米 MiMo-v2.5-Pro-UltraSpeed 发布:1T 参数模型,每秒 1000 token

小米在 6 月 8 日发布 MiMo-v2.5-Pro-UltraSpeed 模型,拥有 1T 参数规模,推理速度达到每秒 1000 个 token。该模型来自小米旗下的 mimo.xiaomi.com 项目。


推荐理由:小米把万亿模型推上 1000 tokens/s,不是纸面速度,而是模型与系统深耦合的结果,对实时推理和编程智能体是真正可落地的信号。限时申请有点可惜,但开源部分值得关注。
00:00
Cohere 产品与研究博客(网页)精选
AI 评分 62/100
Cohere 发布首个开源编码模型 North Mini Code(30B 总参数,3B 激活)

Cohere 发布 North-Mini-Code-1.0,是该公司首个面向开发者的智能体编码模型,采用 MoE 架构,30B 总参数、3B 激活,上下文 256K,以 Apache 2.0 许可开源。


推荐理由:官方给出完整参数、许可和与同规模开源模型的基准对比,开发者可以据此评估本地部署一个轻量编码智能体模型的可行性。