精选归档 · 第 4 页

6180 条 · 共 166

6月18日6月18日周四

星期四 · 1 条
00:32
TechCrunch:AI(RSS)精选
AI 评分 76/100
Google发布99美元Gemini智能音箱

Google推出首款专为Gemini打造的智能音箱Google Home Speaker,售价99.99美元。支持自然语言请求和多步指令,可在说话中途纠正,并具备连续对话功能。内置10种新声音。高级AI功能需订阅Google Home Premium(月费10美元或年费100美元),包括Gemini Live自由对话、Nest摄像头活动摘要等。即日起预售,本月发货。


推荐理由:Google 终于把 Gemini 塞进了音箱,多步指令和自然纠错是亮点,但高级功能要订阅 Home Premium。普通用户会觉得方便,智能家居玩家可以观望,AI 从业者不会有多大惊喜。

6月17日6月17日周三

星期三 · 1 条
12:23
Greg Brockman@gdb精选
AI 评分 74/100
GPT-Realtime-2:用语音控制操作系统GPT-Realtime-2 is something newGreg Brockman 称 GPT-Realtime-2 是全新事物。@per_simmons_ 体验数周后表示,GPT-Realtime-2 是操作系统的未来,仅用语音即可打开应用、搜索网页、编辑 Premiere Pro,设置只需几个提示词且无需编码。视频演示了通过 MCP 连接 Obsidian 以及利用无障碍树控制 Premiere Pro 等功能。

Pat Simmons: GPT-Realtime 2 is the future of the operating system. I've been experimenting with it for a couple weeks now, and I gott...


推荐理由:Greg Brockman 转发的这个视频,演示了用语音控制 OS 完成搜索、写笔记、甚至剪辑 Premiere,这不是 demo 动画,是真的可以上手试的教程,让人感觉语音 OS 离现实又近了一步。

6月16日6月16日周二

星期二 · 2 条
15:05
🚨 AI News | TestingCatalog@testingcatalog精选
AI 评分 75/100
Cartesia 发布 Sonic 3.5 与 Ink 2 实时语音模型Cartesia shipped Sonic 3.5 and Ink 2, two models built to run as a single real-time voice stack, with transcription on one side and speech on the other.Ink 2 ranks first for accuracy on Artificial Analysis's streaming speech-to-text board.Sonic 3.5 places at the top of the real-time text-to-speech view at around 82ms to first audio.Cartesia 推出 Sonic 3.5 和 Ink 2 两个模型,作为单一实时语音栈,分别负责文本转语音和语音转文本。Ink 2 在 Artificial Analysis 的流式语音转文字排行榜上排名第一。Sonic 3.5 在实时文本转语音中位列榜首,首音频延迟约 82ms。Cartesia 成为目前唯一同时拥有 #1 听与说模型的提供商。

Karan Goel: 我们发布了 Sonic-3.5 和 Ink-2,这是目前可用于语音智能体的、在文本转语音和语音转文本领域排名第一的流式模型。 全新的架构为速度与质量开辟了新的前沿。 我们现在是唯一一家在"说"和"听"两方面都拥有排名第一模型的供应商。


推荐理由:Cartesia 同时发布实时语音合成和识别两个模型的迭代版,双双登顶第三方基准,80ms 首音频延迟让语音代理的交互感接近真人,做实时语音应用的开发者可以重点看一下。
07:59
IT之家(RSS)精选
AI 评分 73/100
项目负责人揭秘为何苹果 AI 版 Siri 姗姗来迟:推倒重来,彻底重构

苹果AI版Siri迟迟未上线,项目负责人迈克·罗克韦尔在WWDC技术分享会上透露,去年团队曾做出在原有Siri基础上小幅改良、新增工具调用的可运行版本,但因无法达到产品愿景,最终选择推倒重来,完整从零重构系统,依托全新大模型搭建。重构后的Siri拥有独立应用程序,原生支持多模态交互,隐私保护贯穿底层架构,并覆盖iPhone、iPad、Mac、Apple Watch、Vision Pro、CarPlay、AirPods等全平台,提供统一连贯体验。


推荐理由:苹果AI版Siri推迟的真实原因浮出水面——不是技术卡壳,而是主动选择推倒重来,这对所有做大模型应用升级的产品团队是个值得细读的决策复盘。

6月12日6月12日周五

星期五 · 1 条
08:00
Zyphra Research(网页)精选
AI 评分 71/100
Zyphra 发布开源实时语音克隆模型 ZONOS2

Zyphra 发布 Apache 2.0 许可的实时 TTS 模型 ZONOS2,采用 8B 总参数、900M 激活参数的 MoE 架构,主打高保真零样本语音克隆,权重已上线 Hugging Face。


推荐理由:原文给出架构、训练数据和评测细节,读者可以了解这个开源实时 TTS 模型在音色保真与生成稳定性之间的取舍。

6月11日6月11日周四

星期四 · 3 条
16:22
The Verge:AI(RSS)精选
AI 评分 73/100
Deezer 推出面向其他流媒体服务的 AI 音乐检测器

Deezer 将扫描用户在其它流媒体平台的播放列表,检测其中的 AI 生成音乐。Deezer 是最早标记 AI 生成音乐的大型流媒体服务之一,曾向其他平台提供该技术但少有采纳。Deezer CEO Alexis Lanternier 表示,由于没有其他公司跟进,他们决定让用户无论使用哪个平台,都能检查自己的播放列表中是否包含合成音乐。


推荐理由:Deezer这手挺狠,自家技术没人买账就做成免费跨平台工具,现在用Spotify和Apple Music的人也能扫歌单了,对在意音乐‘血统’的人来说是个刚需小功能。
10:50
公众号:小米 MiMo精选
AI 评分 74/100
小米发布并开源终端AI编程助手MiMo Code V0.1.0,采用MIT协议

小米发布并开源终端AI编程助手MiMo Code V0.1.0,采用MIT协议。内置限时免费MiMo-V2.5多模态模型,性能比肩Claude Sonnet 4.6;支持接入DeepSeek、Kimi、GLM等模型。核心能力包括持久记忆系统(项目记忆、会话检查点、任务进度)和无限上下文——通过独立subagent自动保存状态解决长会话遗忘。独创Compose模式实现模型与Agent协同优化,SWE-Bench Pro达62%(Claude Code 57%),Terminal Bench 2达73%(68%)。内置语音输入和/dream命令,每7天自动合并记忆。终端输入mimo即可使用,所有设置中文汉化。

另有 1 家信源报道X:小米 MiMo (@XiaomiMiMo)
推荐理由:小米悄悄发了MiMo Code,开源且免费,用记忆系统和Compose模式解决了AI编程两大顽疾:健忘和跑偏,实测比同模型Claude Code更强,开发者现在就能装上试。
02:48
xAI@xai精选
AI 评分 74/100
Grok Voice性能出色价格低廉Grok Voice offers state-of-the-art performance with human-like timing, tone, and warmth. And it's a fraction the price of competitors.Check it out: http://x.ai/api/voiceGrok Voice 提供最先进的性能,具有类人的时机、语调和温暖感。而且价格仅为竞争对手的一小部分。 查看详情:http://x.ai/api/voice

ServiceNow AI Research: 🚀 Grok Voice Think Fast 1.0 (@xAI) lands on the Pareto frontier on EVA-Bench — no system in the eval beats it on accura...

另有 1 家信源报道X:SpaceXAI (@SpaceXAI)
推荐理由:语音AI的SOTA这次不是OpenAI了,Grok Voice在EVA-Bench上无死角领先,价格还打到对手十分之一,做语音产品的可以认真看看这个帕累托前沿选手。

6月10日6月10日周三

星期三 · 2 条
03:55
Hugging Face:Blog(RSS)精选
AI 评分 67/100
Hugging Face 博客发布语音智能体代码切换基准测试

Hugging Face 博客发布针对语音智能体处理代码切换语音的基准测试。数据集覆盖西班牙语‑英语、法语‑英语、加拿大法语‑英语和德语‑英语四对语言,基于人力资源与IT服务管理场景构建。采用词错误率、语义词错误率和答案错误率三项指标评估七种ASR系统,包括AssemblyAI Universal 3-Pro、Deepgram Nova 3 Multilang、ElevenLabs Scribe V2、Gemini 3 Flash、Mistral AI Voxtral Small 24B-2507、Nvidia Parakeet TDT 0.6b V3和OpenAI Whisper Large V3 Turbo。主要发现:代码切换的转录成本因语言对和模型而异;ElevenLabs Scribe V2、Gemini 3 Flash和AssemblyAI Universal 3-Pro在所有指标上表现最佳。数据集和测试框架通过AU-Harness开源发布。


推荐理由:如果你在给多语言客户做语音Agent,这篇博客直接把主流ASR的code-switching能力测了一遍,ElevenLabs Scribe V2目前最强,还开源了数据集,拿来就能测自己的模型。
01:51
Jeff Dean@JeffDean精选
AI 评分 81/100
Gemini 3.5 Live Translate 支持70+语言翻译Speech translation has been one of the longest-running ML efforts at Google, and we’ve come a long way. Gemini 3.5 Live Translate is our latest speech-to-speech model, supporting 70+ languages. It enables more natural conversations across languages in everyday products and apps.Here’s an example of how partners at @InsideGrab are helping connect travelers with drivers. 🚗Rolling out in Google Translate and via the Live API in @GoogleAIStudio.语音翻译一直是Google历时最久的机器学习项目之一,我们已经取得了长足进展。Gemini 3.5 Live Translate是我们最新的语音到语音模型,支持70多种语言。它能让日常产品和应用中跨语言的对话更加自然。 以下是一个示例,展示@InsideGrab的合作伙伴如何帮助旅客与司机建立联系。🚗 已在Google Translate和@GoogleAIStudio的Live API中推出。
另有 14 家信源报道Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)The Decoder:AI News(RSS)Google Blog:AI(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Google DeepMind (@GoogleDeepMind)X:Ethan Mollick (@emollick)X:Gemini (@GeminiApp)X:Google AI (@GoogleAI)X:Google AI for Developers (@googleaidevs)X:Kim (@kimmonismus)X:Logan Kilpatrick (@OfficialLoganK)X:Rohan Paul (@rohanpaul_ai)X:Sundar Pichai (@sundarpichai)
推荐理由:Google把语音翻译做到70+语言,Gemini 3.5 Live Translate直接塞进Google Translate和API,普通人下载App就能用,做跨国生意的这下有福了。

6月9日6月9日周二

星期二 · 2 条
23:35
Google DeepMind@GoogleDeepMind精选
AI 评分 69/100
Gemini 3.5 Live Translate 发布Say hello, hola, 你好 to Gemini 3.5 Live Translate: our latest audio model built for fast, cross-language communication. 🌐说 hello, hola, 你好--欢迎 Gemini 3.5 Live Translate:我们最新的音频模型,专为快速跨语言交流而构建。🌐
另有 14 家信源报道Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)The Decoder:AI News(RSS)Google Blog:AI(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Google DeepMind (@GoogleDeepMind)X:Ethan Mollick (@emollick)X:Gemini (@GeminiApp)X:Google AI (@GoogleAI)X:Google AI for Developers (@googleaidevs)X:Kim (@kimmonismus)X:Logan Kilpatrick (@OfficialLoganK)X:Rohan Paul (@rohanpaul_ai)X:Sundar Pichai (@sundarpichai)
推荐理由:Google 这个实时翻译模型把语音+翻译+大模型拧成了一股绳,虽然具体怎么用还不清楚,但做跨境、做语音助手的同学可以把它当个方向标。
03:14
Apple:Newsroom(RSS)精选
AI 评分 69/100
受 DMA 影响,Siri AI 在欧盟将随 iOS 27 和 iPadOS 27 延迟上线

由于欧盟《数字市场法案》(DMA),Apple 无法在 iOS 27 和 iPadOS 27 发布时于欧盟地区推出 Siri AI。该功能在欧盟的上线时间将晚于其他地区,具体时间未公布。


推荐理由:苹果首次将 DMA 作为 AI 功能地区延迟的直接理由,并详细披露了与欧盟监管者的分歧,这个案例可能定义了 AI 助手在监管下的权限边界。

6月8日6月8日周一

星期一 · 2 条
22:46
OpenBMB@OpenBMB精选
AI 评分 75/100
VoxCPM2 技术报告发布🚀 VoxCPM2 Technical Report is now available on arXiv!VoxCPM2 is the latest speech generation model in the VoxCPM family. Built with 2B parameters and trained on over 2 million hours of multilingual speech data, it supports 30 languages and 9 Chinese dialects, along with natural-language voice design, controllable voice cloning, and high-fidelity continuation-based voice cloning.In this technical report, we provide a comprehensive overview of: 🔹 The VoxCPM2 architecture 🔹 A unified sequence formulation for speech generation and control 🔹 The design of AudioVAE for high-fidelity speech reconstruction 🔹 Large-scale multilingual training and evaluation 🔹 Benchmark results across zero-shot and instruction-following TTS tasksWith 16kHz semantic encoding and 48kHz waveform reconstruction, VoxCPM2 delivers high-quality speech generation and achieves SOTA or highly competitive performance on public TTS benchmarks.To support open research and development, we have open-sourced the model weights, fine-tuning code, and inference toolkit under the Apache 2.0 license.📄 Paper: https://arxiv.org/abs/2606.06928 💻 GitHub: https://github.com/OpenBMB/VoxCPM We hope VoxCPM2 helps advance the open-source multilingual speech ecosystem. Feedback, experiments, and contributions are always welcome! 🔥 #AI #OpenSource #TTS #SpeechAI #VoiceAI #GenerativeAI #MachineLearning面壁智能 OpenBMB 发布 VoxCPM2 技术报告。该模型为最新语音生成模型,拥有 2B 参数,基于超 200 万小时多语言语音数据训练,支持 30 种语言和 9 种中文方言。具备自然语言语音设计、可控及高保真延续性语音克隆能力。技术报告涵盖架构设计、统一序列公式、AudioVAE 高保真语音重建、大规模训练评估,以及零样本和指令跟随 TTS 基准结果。采用 16kHz 语义编码 + 48kHz 波形重建,在公开 TTS 基准上达到 SOTA 或极具竞争力。模型权重、微调代码和推理工具以 Apache 2.0 开源。

推荐理由:面壁把语音生成压进2B参数,支持30种语言加方言克隆,还附完整技术报告和Apache 2.0开源,做语音产品的可以直接拉代码跑起来了。
14:14
Tencent Hy@TencentHunyuan精选
AI 评分 69/100
腾讯混元联合多家机构发布首个音频编辑基准MMAECan AI truly edit audio, not just generate it? 🎧Tencent Hy, in collaboration with SJTU, SII, NTU, TJU, ZODA, PKU, FDU, and other collaborators, introduces MMAE.MMAE--A Massive Multitask Audio Editing Benchmark, is the first comprehensive evaluation benchmark for speech and audio "Banana🍌"Instead of simply requiring the AI to "generate" audio, it demands that the AI understand an existing audio clip and precisely modify it according to natural language instructions—altering what needs to be changed while leaving the rest untouched.Current models show an Exact Match Rate (EMR) below 5%, revealing a major gap in reliable audio editing.MMAE includes: ✅ 2,000 high-fidelity samples from real-world scenarios ✅ 17,741 fine-grained rubric evaluation items ✅ 7 modality settings across sound, music, speech and their mixtures ✅ 6 task complexity from basic modifications to multi-hop reasoning and multi-round editing ✅ 8 operation types across local and global granularitiesHow to use: arXiv: http://arxiv.org/abs/2606.07229 GitHub: https://github.com/ddlBoJack/MMAE HuggingFace: https://huggingface.co/datasets/BoJack/MMAE Demo: https://youtu.be/6At5nTWhlXI腾讯混元联合上海交大、南洋理工等机构推出MMAE(Massive Multitask Audio Editing Benchmark),这是首个全面评估AI语音/音频编辑能力的基准。MMAE要求模型理解现有音频并按自然语言指令精确修改,而非简单生成。当前模型在该基准上的精确匹配率(EMR)低于5%,暴露了可靠音频编辑的短板。MMAE包含2000个真实场景高保真样本、17741条细粒度评估项,覆盖声音/音乐/语音及混合共7种模态、6种任务复杂度(基础修改到多跳推理及多轮编辑)、8种操作类型(局部到全局)。论文、代码、数据集和演示已公开。

推荐理由:过去一年语音和音乐生成很热,但音频编辑还没人正经测过,腾讯这个基准把现状血淋淋地摆出来了,不到5%的准确率意味着整个方向都还在起步期。

6月5日6月5日周五

星期五 · 3 条
23:26
Suno:Blog(网页)精选
AI 评分 64/100
Suno Voices 使用指南:6 个技巧打造高质量人声录制

Suno Voices 面向 Web 付费用户开放。提升人声质量的 6 个技巧:在安静环境录音以减少背景噪音;先练习歌词再正式录制;不必追求完美,保留真实情感;录音时长尽量超过 1 分钟以提供更多学习素材;将人声匹配到合适的音乐流派(如民谣、流行、死亡金属、波萨诺瓦等);敢于尝试不同风格以发现惊喜。这些技巧旨在帮助用户获得更个性化、表现力更强的声音效果。


推荐理由:Suno 官方出的 Voices 录制避坑指南,不是大新闻,但照着做能让你克隆的声音干净不少,尤其是安静环境和别怕走音那两条,做音乐的朋友可以直接收藏。
23:15
IT之家(RSS)精选
AI 评分 73/100
苹果新版 Siri 不会被宣传为完成品,内部将其标记为"Beta"版

苹果新版Siri被内部标记为“Beta”版,不会作为完成品宣传;可能设置等待清单供用户尝试。iOS 27细节:通知到达重新设计,通知中心手势移至左上角;“查找”应用视觉重设计;照片“清理”功能改进;大量底层安全改进。部分Siri查询将通过Google Cloud调用授权版Gemini,并使用谷歌的NVIDIA Blackwell B200集群处理。


推荐理由:古尔曼这料把苹果的策略摊开了,Siri不再死守自研,用谷歌Gemini加英伟达芯片,对追求隐私的苹果是转折点,但标Beta也说明离成熟还远。
00:53
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 77/100
Boson AI 与 LMSYS 发布基于 SGLang-Omni 的 Higgs Audio v3 TTS 端到端服务

Boson AI 与 LMSYS 联合推出基于 SGLang-Omni 推理框架的 Higgs Audio v3 TTS 端到端服务。该模型约 4B 参数,基于 Qwen3-4B 骨干,支持 100 种语言(内部评测覆盖 111 种),在 Seed-TTS、CV3、MiniMax-Multilingual 及 Higgs-Multilingual 零样本语音克隆任务中达到单字级 WER/CER。开发者可通过文本内控制标签实时调整情感(20+种)、风格、韵律(语速/音高/停顿)及音效。模型支持流式合成,文本未完整时即可开始生成语音并保持一致性。SGLang-Omni 专为多阶段生成模型设计,统一调度 AR 解码与轻量计算,实现低延迟推理。


推荐理由:Higgs v3 把多语言和实时可控制整合进一个流式 TTS 模型,SGLang-Omni 为它搭好了多阶段推理的底座,做语音 Agent 的可以直接抄作业,这比多数论文落地快半拍。

6月4日6月4日周四

星期四 · 2 条
21:42
Hugging Face:Blog(RSS)精选
AI 评分 75/100
Nemotron 3.5 ASR:为你的语言、领域或口音进行微调

Nemotron 3.5 ASR 是一个 600M 参数的多语言流式语音识别模型,单个检查点覆盖 40 种语言-地区(含英、西、德、法、意、日、韩、中、阿拉伯等)。采用 Cache-Aware FastConformer 编码器与 RNNT 解码器,缓存内部状态避免重复计算,实现低延迟流式转录且不损失精度。模型原生输出带标点和大写的生产级文本,无需后处理。支持指定语言(target_lang=es-ES)或自动语言检测(target_lang=auto)。通过注意力上下文大小(att_context_size)可在推理时直接调节延迟-准确率权衡,范围从 80ms 到 1.12s,无需重新训练。模型以 NeMo 检查点形式发布,可用于微调以适配特定语言、领域或口音。


推荐理由:一个模型搞定40种语言的实时语音转文字,NVIDIA还给了完整微调代码和实测数据,做语音Agent和字幕的可以照着抄作业。
10:58
xAI:News(网页)精选
AI 评分 72/100
Grok 成为 Vapi 的默认语音引擎

xAI 宣布与 Vapi 合作,Grok 将作为 Vapi 平台上 12 种核心语音的默认引擎,覆盖超过 250 万个语音智能体。在 Vapi 独立盲测中,Grok Voice 位列第一;X 平台上的人机语音盲猜中,超 4500 名用户有一半无法区分 Grok 与真人。现在,Grok Speech-to-Text 和 Text-to-Speech 已集成至 Vapi Dashboard,团队还可通过 Grok Voice API 获取高级定制选项(含语音克隆),用于旁白、播客、广告等场景。

另有 1 家信源报道X:SpaceXAI (@SpaceXAI)
推荐理由:xAI 把 Grok 的语音能力直接接入了 Vapi,250 万+语音代理一夜升级,语音交互的“自然度”竞赛从实验室卷到了生产环境。