内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜Tibo重置监控
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-5
精选全部日报更多
反馈

全部 AI 动态

全部动态
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「语音」清除
全部 AI 动态
全部模型产品行业论文教程观点
标签「语音」 · 1311 条清除

9月14日9月14日周一

星期一 · 1 条
11:03
IT之家(RSS)
AI 评分 55/100
豆包手机助手消费者版发布:推出 SAEP 协议,三方 App 可允许或拒绝 AI 自动化操作

豆包手机助手消费者版 9 月 14 日正式发布,主打稳定性与交互体验,支持 AI 键(带指纹鉴权)、语音唤醒、屏幕问答、本地数据搜索和接入飞书妙记的录音体验。Beta 形式开放操作手机功能,并推出屏幕自动化操作声明协议 SAEP,第三方应用可声明允许或拒绝 AI 自动化操作,同步启动 30 天规则公示。首个消费者版将搭载于努比亚 NaviX Ultra,9 月 16 日发售。

智能体产品更新语音
另有 2 家信源报道IT之家(RSS)公众号:豆包(字节)

9月13日9月13日周日

星期日 · 3 条
22:11
The Decoder:AI News(RSS)
AI 评分 60/100
ElevenLabs 发布 Music v2.5,开放应用与 API 并提供免费和 Pro 档位

ElevenLabs 为 ElevenMusic 发布 Music v2.5,称生成歌曲更饱满自然;在 47,885 组盲测对比中听众多数时候更偏好 v2.5,尤其是 R&B、Soul、Hip-Hop、Rock 和管弦乐。

产品更新多模态语音
07:46
OpenAI Developers@OpenAIDevs已收录
AI 评分 70/100
OpenAI 将 GPT-Live-1 语音模型开放至 API📞 1-800-ChatGPT译OpenAI 宣布 GPT-Live-1 正式登陆 API,即 1-800-ChatGPT 背后的语音能力。开发者可把它接入应用,获得边说边听的自然对话语音智能体,并搭配自选的模型与 harness 使用。

OpenAI Developers: GPT-Live-1 现已在 API 中可用。 将 ChatGPT 自然的来回对话体验带入你的应用,语音智能体可以边说话边聆听,并可与你所选的模型和 harness 配合工作。

OpenAI模型发布语音
00:39
Suno:Blog(网页)精选
AI 评分 68/100
Suno 发布 v6 音乐模型,推出 v6、v6-wild、v6-mini 三个版本

Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放。

多模态模型发布语音

推荐理由:官方发布新一代音乐模型,给出三个版本的定位差异和编辑、混音、采样等具体新能力,可帮助创作者判断如何选择和使用。

9月12日9月12日周六

星期六 · 1 条
00:46
OpenAI Developers@OpenAIDevs
AI 评分 52/100
OpenAI 介绍 GPT-Live-1 语音能力及 Yelp 预订电话应用Restaurant reservations don’t always follow a script.GPT-Live-1 listens while it speaks, so callers can interrupt, add details, or change direction mid-conversation.Hear how @Yelp is using it to make reservation calls feel more natural:译OpenAI Developers 介绍 GPT-Live-1,可在说话的同时监听,通话者能随时打断、补充细节或中途改变方向。Yelp 正在用它让餐厅预订电话更自然,官方发布了演示视频。
OpenAI产品更新语音

9月11日9月11日周五

星期五 · 12 条
22:58
OpenRouter:Announcements(RSS)
AI 评分 56/100
OpenRouter 文本转语音 API 五分钟教程

OpenRouter 通过 OpenAI 兼容的 POST /api/v1/audio/speech 端点提供文本转语音服务,一个 API key 可调用多家供应商的 TTS 模型。

MCP/工具教程/实践语音
21:07
OpenBMB@OpenBMB
AI 评分 56/100
面壁智能 VoxCPM2 驱动开源视频配音工具 YouDub WebUI🎙️ What can VoxCPM2 do in a real video localization workflow?Developer @liuzhao1225 built YouDub WebUI, an open-source video localization tool powered by VoxCPM2, turning videos into dubbed content through a fully automated pipeline.YouDub WebUI is already being used in a real creator workflow, powering localization for a 1M+ follower account across 20K+ videos. 🙌✨ Highlights:🎙️ Natural AI dubbing with VoxCPM2 🌍 Speech recognition → translation → voice generation → audio mixing → final video 🎧 Vocal separation helps preserve the original background music and sound effects 🛠️ Local-first and built for developers to customize and extendNow, explore what VoxCPM2 can do and give YouDub WebUI a try.🔗 GitHub: http://github.com/liuzhao1225/YouDub-webui 🤗 VoxCPM2: http://huggingface.co/openbmb/VoxCPM2译面壁智能 OpenBMB 介绍开发者 @liuzhao1225 基于 VoxCPM2 构建的开源视频本地化工具 YouDub WebUI,通过语音识别、翻译、语音生成、混音到成片的全自动管线生成配音视频。
开源/仓库开源生态语音
15:00
IT之家(RSS)
AI 评分 54/100
小米开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1

小米发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1,针对多人同时说话时识别率大幅下降的鸡尾酒会难题。模型采用端到端 LLM 架构,以目标说话人参考音频作为声纹提示,在多个主流多说话人测试集上达到 SOTA;单人识别性能比肩标准 ASR 模型,可拒识非目标说话人并支持思维链推理模式。代码开源于 GitHub 和 HuggingFace。

开源生态模型发布语音
10:46
Sherwin Wu@sherwinwu同事件
AI 评分 65/100
OpenAI 在 API 中开放 GPT-Live-1 语音模型One of my favorite things about OpenAI is how we let everyone build with the same tech that we use in our own products.Now with GPT-Live-1 in the API, you can build your own voice apps – powered by the same duplex technology that the new ChatGPT voice uses!译OpenAI 宣布 GPT-Live-1 已在 API 中可用,开发者可用与新版 ChatGPT 语音相同的双工技术构建自己的语音应用。语音智能体可在说话的同时监听,并支持开发者自选模型和 harness。

OpenAI Developers: GPT-Live-1 现已在 API 中可用。 将 ChatGPT 自然的来回对话体验带入你的应用,语音智能体可以边说话边聆听,并可与你所选的模型和 harness 配合使用。

OpenAI产品更新语音
同一事件,精选展示《OpenAI 在 API 中推出全双工语音模型 GPT-Live-1》
09:00
IT之家(RSS)同事件
AI 评分 72/100
OpenAI 将 GPT-Live-1 引入 API,支持全双工语音、打断处理与工具调用

OpenAI 宣布 GPT-Live-1 上线 API,支持全双工对话、处理打断与背景噪声,可用于电话语音智能体,并将语音理解与输出整合在同一模型中以降低延迟。

智能体OpenAI模型发布语音
同一事件,精选展示《OpenAI 在 API 中推出全双工语音模型 GPT-Live-1》
05:37
Greg Brockman@gdb同事件
AI 评分 67/100
GPT-Live-1 语音模型上线 OpenAI APIGPT-Live in the API, for empowering builders to create new kinds of applications:译GPT-Live-1 现已登陆 OpenAI API。开发者可将 ChatGPT 式自然对话带入应用,构建能边说边听的语音智能体,并自选所用的模型与 harness。

OpenAI Developers: GPT-Live-1 现已在 API 中可用。 将 ChatGPT 自然的你来我往带入你的应用,语音智能体可以边说话边聆听,并可与你所选的模型和 harness 配合工作。

OpenAI产品更新语音
同一事件,精选展示《OpenAI 在 API 中推出全双工语音模型 GPT-Live-1》
03:29
🚨 AI News | TestingCatalog@testingcatalog同事件
AI 评分 66/100
OpenAI GPT-Live-1 上线 API 与 OpenAI PlatformOPENAI 🔥: GPT-Live-1 is now available on the API and OpenAI Platform!"GPT‑Live‑1 brings ChatGPT’s natural, full-duplex conversations to the API, with more control over how voice agents speak and act."This lets users build apps and workflows powered by bidirectional voice mode that can delegate tasks to other models.The UI is cool 👀译OpenAI 将 GPT-Live-1 开放到 API 和 OpenAI Platform,把 ChatGPT 式的自然全双工语音对话带给开发者。语音智能体可以边说边听,并能将任务委托给用户选择的其他模型。

OpenAI Developers: GPT-Live-1 is now available in the API. Bring ChatGPT’s natural back-and-forth to your app, with voice agents that liste...

OpenAI产品更新语音
同一事件,精选展示《OpenAI 在 API 中推出全双工语音模型 GPT-Live-1》
03:09
Thomas Wolf@Thom_Wolf
AI 评分 71/100
OpenAI 在 API 中上线 GPT-Live-1 语音模型cute robot spotted译OpenAI 通过 @OpenAIDevs 宣布 GPT-Live-1 现已在 API 中可用,把 ChatGPT 的自然对话体验带入应用。该模型支持可边说边听的语音智能体,并可搭配开发者选择的模型与 harness 使用。Thomas Wolf 转发了这一消息。

OpenAI Developers: GPT-Live-1 is now available in the API. Bring ChatGPT’s natural back-and-forth to your app, with voice agents that liste...

OpenAI产品更新语音
02:07
Tibo@thsottiaux同事件
AI 评分 72/100
OpenAI 在 API 中开放 GPT-Live-1 语音模型You can now build on top of the same voice system that we shipped to 1B users in ChatGPT.So many fun applications of a full duplex system with solid toolcalling. Going back to text-only experiences after this feels harder than I had expected.译OpenAI 在 API 中开放 GPT-Live-1,把 ChatGPT 已面向 10 亿用户提供的语音系统带给开发者,支持边说边听、可搭配自选模型与 harness。作者称全双工加工具调用带来很多应用可能,回到纯文本体验会感觉变难。

OpenAI Developers: GPT-Live-1 现已在 API 中可用。 将 ChatGPT 自然的你来我往带入你的应用,语音智能体可以边说话边聆听,并可与你所选的模型和 harness 配合使用。

OpenAI产品更新语音
同一事件,精选展示《OpenAI 在 API 中推出全双工语音模型 GPT-Live-1》
01:58
The Decoder:AI News(RSS)同事件
AI 评分 73/100
OpenAI 开放 GPT-Live-1 语音模型 API,支持全双工边听边说

OpenAI 将语音模型 GPT-Live-1 以 API 形式开放给开发者,支持全双工同时听和说,价格为每分钟 $0.05。相比 GPT-Realtime-2.1,其全双工交互测试得分 80.1% 对 45.4%,轮次延迟从 1.4 秒降至 0.8 秒,工具调用准确率从 60% 升至 87%,银行语音支持基准通过率从 12.4% 升至 32%。

OpenAI模型发布语音
同一事件,精选展示《OpenAI 在 API 中推出全双工语音模型 GPT-Live-1》
01:46
OpenAI Developers@OpenAIDevs同事件
AI 评分 67/100
OpenAI 在 API 中开放 GPT-Live-1 语音模型GPT-Live-1 is now available in the API.Bring ChatGPT’s natural back-and-forth to your app, with voice agents that listen while they speak and work with the models and harness you choose.译OpenAI 宣布 GPT-Live-1 现已在 API 中可用。开发者可在应用中引入 ChatGPT 式自然对话体验,语音智能体可在说话的同时聆听,并支持搭配用户自选的模型和 harness。
OpenAI产品更新语音
同一事件,精选展示《OpenAI 在 API 中推出全双工语音模型 GPT-Live-1》
01:16
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 70/100
OpenAI 在 API 中推出全双工语音模型 GPT-Live-1

OpenAI 在 API 中发布语音模型 GPT-Live-1,可同时听和说,支持将推理和工具调用委派给 GPT-6 Astra 等后端模型,前端语音层定价为每分钟 $0.05。

智能体MCP/工具OpenAI产品更新
另有 3 家信源报道X:Testing Catalog (@testingcatalog)X:洪明 (@hongming731)X:Tibo (@thsottiaux)
推荐理由:原文给出单模型全双工语音架构、基准变化和定价,读者可以据此评估它能否简化现有语音 Agent 的分层方案。

9月10日9月10日周四

星期四 · 8 条
22:28
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 59/100
Apple Watch 新增 Siri 摘要功能引发始终聆听的隐私争议

Apple 在 Apple Watch Series 12 和 Ultra 4 上推出 Audio Intelligence 功能 Siri Recaps,可总结一天中的对话,用户可按计划或在 Smart Stack 顶部开关。

产品更新语音
另有 2 家信源报道The Verge:AI(RSS)X:Testing Catalog (@testingcatalog)
18:58
Tencent Hy@TencentHunyuan
AI 评分 58/100
腾讯混元开源语音模型 AuK,统一语音生成与编辑并推出 4 步推理的 AuK-Flash🚀 AuK is officially here. Nano banana🍌 for audioAn open-source foundation model for unified speech generation and editing. Natural-language instructions + reference audio. One interface. Zero-shot TTS. Instruction-controlled generation. Content editing. Whisper-conversion. De-accent. Timbre/style/emotion edit. Speed/Pitch control. Enhancement, denoising, multi-speaker and music separation. Also releasing AuK-Flash: 4-step inference. ~4.5× faster under matched conditions. Code, weights, and demo are live. Try it and share your feedback.🤗 Paper & upvote: https://huggingface.co/papers/2609.08936 ⭐ GitHub & star: https://github.com/Tencent-Hunyuan/AuK译腾讯混元发布开源语音基础模型 AuK,支持统一语音生成与编辑,可通过自然语言指令加参考音频实现零样本 TTS、指令控制生成、内容与音色/风格/情感编辑、去口音、语速音调控制、增强去噪及多说话人和音乐分离。
开源生态模型发布语音
另有 1 家信源报道X:AK (@_akhaliq)
12:00
公众号:卡尔的AI沃茨
AI 评分 60/100
网易叭哥说语音输入法上手评测:E2E 平均 1683ms,对比 Typeless、豆包与闪电说

作者实测网易有道新上线的语音输入法叭哥说,与 Typeless、豆包输入法、闪电说横向对比。叭哥说采用双模型分工,E2E 平均 1683ms、P95 2134ms,并支持小声拾音、个人词典即刻生效和多语言翻译等功能。

智能体评测/基准语音
09:59
IT之家(RSS)
AI 评分 68/100
OpenAI ChatGPT 语音模式支持调用 GPT-5.6 Sol 和 GPT-6 Astra

OpenAI 语音产品负责人 Atty Eleti 宣布 ChatGPT 语音模式可自由选择模型和推理深度,Pro 套餐可调用 GPT-5.6 Sol 或 GPT-6 Astra,语音模式在需要搜索或复杂推理时自动调用指定模型。

OpenAI产品更新语音
08:37
Suno@suno精选
AI 评分 65/100
Suno v6 发布,支持图片、视频和语音备忘录生成音乐Suno v6 is here.Turn images, videos, and voice memos into music. Make precise changes to songs you’ve already created. Explore more possibilities with v6-wild.Here’s what you can do with v6 in under 2 minutes 👇译Suno 发布 v6 模型,可将图片、视频和语音备忘录转化为音乐,并对已创建的歌曲进行精确修改。同时提供 v6-wild 版本供探索更多可能性,官方附有 2 分钟以内的功能演示视频。
多模态模型发布语音

推荐理由:官方宣布 v6 上线并给出多模态输入与歌曲精修能力,可据此了解音乐生成模型的最新变化。
05:57
The Verge:AI(RSS)
AI 评分 72/100
Suno 发布 v6 AI 音乐模型,首次采用唱片业授权数据训练

Suno 发布 v6 AI 音乐模型,是首个获得唱片业支持的版本,训练数据包含来自 Warner Music Group、BMG 和 Believe 的授权内容及用户数据。

图像生成模型发布语音
03:29
🚨 AI News | TestingCatalog@testingcatalog
AI 评分 68/100
ChatGPT 语音模式支持 GPT-5.6 Sol 和 GPT-6 AstraOPENAI 🔥: Voice Mode on ChatGPT now supports GPT 5.6 Sol and GPT 6 Astra.Support for GPT 6 Astra is only available on ChatGPT Pro accounts.译OpenAI 更新 ChatGPT 语音模式,用户可自选模型和推理档位,语音在需要搜索或推理时会调用所选模型,可选 GPT-5.6 Sol 和 GPT-6 Astra。其中 GPT-6 Astra 仅面向 ChatGPT Pro 账户开放。

Atty Eleti: 🌌 ChatGPT Voice can now use GPT-5.6 Sol and GPT-6 Astra We’re updating how intelligence works in voice. Now, you can se...

OpenAI产品更新语音
02:57
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 62/100
苹果发布 AirPods 5,开放耳设计 ANC 售价 $129 起

苹果发布 AirPods 5,开放耳设计中 ANC 噪声消除量比 AirPods 4 with ANC 提升最多 50%,配备新的 multiport 声学架构和下一代 Adaptive EQ。

语音非AI/通用工具

9月9日9月9日周三

星期三 · 3 条
21:57
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 68/100
Desert Ant Labs 发布 18 个可在设备上运行的专用小模型

欧洲 AI 实验室 Desert Ant Labs 正式成立并上线首批 18 个端侧专用模型(12 个稳定版、6 个 beta),覆盖音频、视觉和文本任务,通过 Swift、Kotlin 和 JavaScript 的统一 SDK 提供,在 GitHub 和 Hugging Face 开放。

多模态开源生态模型发布端侧
15:30
MarkTechPost(RSS)
AI 评分 69/100
Gradium 发布 Voice Design:写一段描述文字,几秒生成全新合成语音

巴黎语音 AI 公司 Gradium(从 Kyutai 研究实验室分拆)推出 Voice Design,输入 1 到 500 字符的描述即可在 3 到 5 秒内生成 1 到 5 个候选语音,无需参考音频,支持英法西葡德 5 种语言,已在 Gradium API 和 Studio 全部套餐免费开放。

产品更新语音
12:58
HuggingFace Daily Papers(社区热门论文)
AI 评分 57/100
Gander 全双工全模态交互智能体技术报告发布并开源

作者发布 Gander 技术报告,这是一个端到端模型,在单一框架内统一全模态感知、实时交互与智能体能力,支持视频、语音、文本流式输入与随时打断的全双工交互。其采用 Cerebellum-Brain 协同框架,小脑负责实时交互与对话,大脑负责复杂推理与智能体任务,并基于流式 Thinker-Talker 架构实现低延迟;模型、代码和数据将开源。

智能体多模态开源生态论文/研究

9月6日9月6日周日

星期日 · 1 条
18:04
The Decoder:AI News(RSS)
AI 评分 70/100
Meta 发布实时音频模型 Muse Voice Transcribe,主打语音转写与说话人分离

Meta Superintelligence Labs 发布首个实时音频感知模型 Muse Voice Transcribe,将音频切分为 80 毫秒块,通过强化学习为每个词动态调整等待时间,并内置说话人区分(可同时区分 20 人以上)和句界检测。

Meta产品更新语音

9月5日9月5日周六

星期六 · 2 条
08:30
IT之家(RSS)
AI 评分 64/100
谷歌在 Gemini 应用和 API 中上线音乐生成模型 Lyria 3.5,可生成长达数分钟的完整歌曲

谷歌于 9 月 5 日宣布在 Gemini 应用和 Gemini API 中上线音乐生成模型 Lyria 3.5,可生成含数段副歌、桥段等数分钟完整歌曲,用户可通过 gemini.google.com/music 网站和应用使用。

Google产品更新多模态语音
01:57
jason@jxnlco
AI 评分 46/100
OpenAI Codex 线程新增桌面端语音功能start voice in any thread on the desktop!译OpenAI Codex 在已有线程中上线语音功能,可在桌面端任意线程开启。用户可与编写 PR 的智能体语音讨论、辩论架构或商量后续计划,沟通结束后让智能体继续工作。

Guinness Chen: Voice is now available in your existing Codex threads. Talk through a PR with the agent that wrote it, debate the archit...

智能体OpenAI产品更新编码

9月4日9月4日周五

星期五 · 7 条
23:37
Suno@suno
AI 评分 9/100
Suno 预告新功能即将到来Soon enough, you’ll hear it all.译Suno 发布推文「Soon enough, you'll hear it all.」,并附一段视频,暗示即将推出与听觉相关的新内容,但未给出产品名称、发布时间或具体功能细节。
产品更新语音
18:32
The Verge:AI(RSS)
AI 评分 50/100
Ugreen 在 IFA 发布 HomeAgent 本地智能家居平台,主打端侧 AI 助手 Uliya

Ugreen 在 IFA 展会发布 HomeAgent 智能家居平台,将 NAS、监控 NVR 和端侧 AI 整合到一个中枢中,由语音助手 Uliya 管理,宣称数据全部本地处理、无月费。

智能体产品更新端侧语音
12:30
IT之家(RSS)
AI 评分 56/100
人人影视更名上线 App,李渊敏称力争激活 3000 万存量用户并优先面向东南亚输出国产影视

人人影视更名为“人人影视分享精彩”,App 已在安卓端上线、iOS 端筹备完成,运营方为分享精彩网络科技(嘉兴)有限公司,负责人李渊敏称本月起点对点推广、力争激活 3000 万存量用户。平台依托 7 万余集影视素材样本打造 AI 影视本地化技术,实现角色音色克隆,计划覆盖 50 余个国家和地区,优先面向东南亚输出国产影视内容,片源与华数传媒合作正版购买,目前处于前期公测、月底正式发布。

语音非AI/通用工具
08:30
IT之家(RSS)
AI 评分 62/100
微软发布转录模型 MAI-Transcribe-2:支持 60 种语言,平均词错误率 5.2%

微软 9 月 3 日发布语音转文字模型 MAI-Transcribe-2,称其是自家最快、最准确、最便宜的转录模型,支持 60 种语言。

Microsoft模型发布语音
04:40
Rohan Paul@rohanpaul_ai
AI 评分 34/100
Hojo-ASR-Multi-V1 上线 Open ASR Leaderboard,开源多语言语音识别平均 WER 3.54%My criteria for buying tech have changed a lot over the years.The biggest limitation of the smartphone might be that it requires your attention.Almost every useful action begins the same way: pull it out, unlock it, find something, interact with a screen.AI hardware has a chance to break that loop. If a device can understand enough context to know when to listen, capture, surface, or act, the screen stops being the center of the product.Also, a device doesn't need hundreds of apps if it understands the one environment it was built for.That makes specialization much more economically interesting than it was ten years ago.Instead of asking, “How many things can this device do?” I want to ask, “How little interaction does this one job require?”That’s also why something like HojoAI/Hojo-ASR-Multi-V1 from @hojoHQ is worth looking at through a hardware lens.An open multilingual speech layer potentially changes what you can build around a very narrow use case.译HojoAI 的 Hojo-ASR-Multi-V1 正式上线 Open ASR Leaderboard,全球排名第 7、开源多语言 ASR 第 1,五语言平均 WER 3.54%。

HojoAI: #7 globally. #1 open multilingual ASR model. Hojo-ASR-Multi-V1 is officially live on the Open ASR Leaderboard. With an a...

Hugging Face开源生态模型发布语音
00:58
Sundar Pichai@sundarpichai
AI 评分 49/100
Google 推出 Gemini 语音功能,可语音操作 Gmail、Keep 和 DocsNew Gemini voice capabilities are rolling out so you can search your Gmail inbox, organize thoughts and tasks in Keep, and create new Docs, all conversationally. Rolling out now for Google AI subscribers!Docs Live going to be super helpful in particular - see it in action below, and read more here: https://blog.google/products-and-platforms/products/workspace/voice-features-gmail-docs-keep/译Sundar Pichai 宣布 Gemini 新语音功能开始推送,用户可对话式搜索 Gmail 收件箱、在 Keep 中整理想法和任务、创建新 Docs。功能现向 Google AI 订阅者开放,其中 Docs Live 被特别提及,详情见官方博客 https://blog.google/products-and-platforms/products/workspace/voice-features-gmail-docs-keep/
Google产品更新语音
00:01
The Verge:AI(RSS)
AI 评分 60/100
Google 推出 Gmail Live、Docs Live 和 Keep Live 语音助手功能

Google 开始向全球移动端推出 Gmail Live、Docs Live 和 Keep Live 三项 AI 语音功能,支持免手操作查询信息、总结和转录。Gmail Live 可从收件箱口头回答问题并附邮件来源链接,Docs Live 能把口述需求整理成结构化文档并可在授权后调用 Gmail、Drive、Chat 和网页信息,Keep Live 支持自然语言记录笔记。

Google产品更新语音

9月3日9月3日周四

星期四 · 2 条
23:29
Microsoft AI:官方博客(网页)
AI 评分 32/100
Microsoft 发布 MAI-Transcribe-2 语音识别模型

Microsoft AI 官方博客宣布发布 MAI-Transcribe-2 语音识别模型,称其为速度最快、准确度最高且价格最低的语音识别模型。原文未提供正文细节。

Microsoft模型发布语音
另有 2 家信源报道X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman)X:Testing Catalog (@testingcatalog)
23:07
OpenRouter@OpenRouter
AI 评分 50/100
Microsoft MAI-Transcribe 2 上线 OpenRouterMicrosoft MAI-Transcribe 2 is live on OpenRouter!Ranked #1 on FLEURS, it supports speech-to-text across 60 languages with automatic language ID, code switching, speaker diarization, and word-level timestamps.Use it now: https://openrouter.ai/microsoft/mai-transcribe-2译Microsoft MAI-Transcribe 2 已上线 OpenRouter。该模型在 FLEURS 上排名第一,支持 60 种语言的语音转文字,具备自动语言识别、code switching、说话人分离和词级时间戳,可通过 openrouter.ai/microsoft/mai-transcribe-2 使用。
产品更新语音
已加载 40 条