xAI发布旗舰语音模型Grok Voice Think Fast 1.0,专为客服、销售等领域的复杂多步骤工作流打造。该模型在τ-voice Bench全双工语音排行榜位列第一,能在电话音频、噪音、口音及频繁打断等真实苛刻条件下稳定运行,并原生支持25种以上语言。其核心优势包括精准的数据录入与复述、实时后台推理不增加延迟,并能通过思考避免错误回答。目前该模型已应用于Starlink的销售与客服,实现了20%的电话销售转化率和70%的客服自主解决率,能跨数百个工作流调用28种工具处理硬件故障排查、换货等高风险任务。
模型发布
精选归档 · 第 27 页
第 521–540 条 · 共 721 条
4月24日
OpenAI 发布了新一代模型 GPT-5.5。其上下文窗口从 GPT-5 的 128K 大幅扩展至 512K,推理速度提升约 40%,在多模态理解与代码生成基准测试中表现显著超越前代。模型在复杂指令遵循和长文档处理方面能力突出,同时 API 调用成本降低了 30%。这一升级被视为通向通用人工智能(AGI)道路上的一个重要里程碑。
尽管GPT-5.5的官方API尚未发布,但作者利用OpenAI为OpenClaw等工具开放的订阅集成机制,通过反向工程开源Codex CLI,开发了一个LLM插件。该插件允许付费订阅用户通过Codex后端API调用GPT-5.5模型。文章以生成“骑自行车的鹈鹕”SVG图像为例,展示了其使用效果,并指出高推理强度设置能显著提升输出质量,但耗时更长。目前,OpenAI表示正与合作伙伴制定API大规模服务的安全要求。
另有 1 家信源报道IT之家(RSS)OpenAI 正式推出 GPT-5.5,该模型被定义为一种代理模型,能够通过自主切换多种工具来完成复杂任务。公司宣称其代表了一种“新型智能”。与此同时,GPT-5.5 的 API 调用价格将提升至原来的两倍。
OpenAI推出迄今最智能的GPT-5.5模型,其速度更快、能力更强,专为处理跨工具的复杂任务而构建。该模型在编程、学术研究与数据分析等领域表现出显著提升,能够高效整合多工具工作流,旨在应对更高阶的专业需求。
小米正式发布 MiMo-V2.5-TTS Series 与 MiMo-V2.5-ASR,覆盖语音识别与合成两大能力。TTS 系列含三款模型,支持风格指令遵循与音频标签控制,其中 VoiceDesign 可零参考音频生成新音色,VoiceClone 仅需数秒参考音频即可复刻音色;ASR 在中英双语、中文方言、强噪音等场景达业界领先水平。
4月23日
腾讯混元发布并开源Hy3 preview,这是其重建预训练与强化学习基础设施后训练的首个模型,也是迄今最智能的版本。该模型为快慢思考融合的混合专家架构,总参数295B,激活参数21B,支持256K上下文,在SWE-Bench Verified等代码与搜索智能体基准上取得强竞争力结果。模型权重已开源,腾讯云API个人版定价最低28元/月。
腾讯发布并开源其混元系列迄今最智能的Hy3 preview语言模型。该模型采用快慢思考融合的混合专家架构,总参数达2950亿,最大支持256K上下文长度。作为基础设施重建后首个模型,其在复杂推理、指令遵循、代码等能力上实现大幅提升,已应用于元宝、QQ、腾讯文档等内部产品,并支持OpenClaw等开源智能体。腾讯云同步推出API服务,输入价格最低每百万tokens 1.2元,同时提供个人版Token Plan套餐,月费最低28元可获3500万tokens额度。
针对智能体任务中Token消耗快速增长的问题,Ling-2.6-flash模型正式发布。该模型采用混合线性架构等技术进行系统性优化,旨在实现更高推理效率和更低使用成本。其推理速度在4卡H20条件下最快可达340 tokens/s,在Artificial Analysis评测中仅消耗约对比模型1/10的Tokens。模型在多个Agent相关基准测试中达到同尺寸SOTA水平,保持了强大的任务执行与工具调用能力。
ChatGPT Images 2.0 推出了一个先进的图像生成模型,该模型在文本渲染、多语言支持和视觉推理能力方面均有显著提升。新版模型能够更精准地生成包含文字的图像,并支持多种语言文本输入。其视觉推理功能也得到增强,可更好地理解和执行复杂图像生成指令。此次升级标志着多模态AI生成质量的一次重要进步。
Qwen 发布 Qwen3.6-27B 开源模型,这款 27B 参数的稠密模型在编码基准测试中超越了上一代 397B 总参数/17B 激活参数的 MoE 旗舰模型 Qwen3.5-397B-A17B。模型体积从 807GB 大幅缩减至 55.6GB,16.8GB 的量化版本即可在本地运行,生成速度约 25 tokens/s。实测显示其能生成复杂的 SVG 图形代码,展现出旗舰级的编程能力。
Xiaomi MiMo-V2.5 系列正式公测,包含 MiMo-V2.5、V2.5-Pro、TTS 与 ASR 等模型。其中 V2.5-Pro 在通用智能体、复杂软件工程等维度对标 Claude Opus 4.6、GPT-5.4,曾用 4.3 小时、672 次工具调用完成北大编译原理课程项目并获满分。
4月21日
Kimi发布K2.6版本,专注提升开源编程能力。新版本在代码生成与理解方面实现优化,发布后在Hacker News获得132个点赞。此次更新强化了Kimi在开发者工具领域的布局,通过改进编程辅助功能,为开源社区提供更高效的代码编写支持。
另有 5 家信源报道X:Testing Catalog (@testingcatalog)X:Kim (@kimmonismus)X:Artificial Analysis (@ArtificialAnlys)The Decoder:AI News(RSS)IT之家(RSS)阿里通义千问团队发布Qwen 3.6-Max-Preview预览版大模型,主打更智能的推理能力与更精准的输出表现,目前仍处于快速迭代阶段。该版本在Hacker News社区获得121个赞,用户可通过官方博客了解详情并体验最新功能。作为Max系列的最新预览版本,模型在保持高性能的同时持续优化,具体技术细节和基准测试成绩尚未完全公布。
另有 2 家信源报道X:Kim (@kimmonismus)Qwen:Blog Retrieval(API)4月20日
DR-Venus 是一个仅用1万条开放数据训练的40亿参数深度研究智能体,基于Qwen3-4B-Thinking-2507架构,支持200步工具调用和超20万tokens的上下文。它通过监督微调与强化学习两阶段训练,在BrowseComp、GAIA等多个深度研究基准上树立了小模型性能新标杆。其SFT版本已超越多数同类开源模型,而RL版本进一步将长程任务可靠性和工具使用校准度提升2-3个百分点。项目已全面开源模型、代码与训练流程。
4月17日
LLaDA2.0-Uni是一个统一的多模态模型,具备对世界的理解与生成能力。该模型通过整合视觉、语言等多模态信息,实现了跨模态的语义理解和内容生成。其架构支持从图像理解到文本生成、跨模态检索等复杂任务,标志着多模态人工智能向更通用、统一的方向演进。
阿里通义千问团队发布Qwen3.5-Omni,模型拥有数百亿参数和256k上下文,基于超1亿小时音视频数据训练,在215项基准测试中达SOTA水平,关键音频任务超越Gemini-3.1 Pro。采用混合注意力MoE架构,支持10小时音频与400秒720P视频理解。提出ARIA技术优化流式语音合成稳定性,支持10种语言。模型具备Audio-Visual Vibe Coding能力,可直接基于音视频指令生成代码。
OpenAI发布面向生命科学的专业推理模型GPT-Rosalind。该模型专门针对药物发现、基因组学分析、蛋白质推理及科学研究工作流设计,旨在加速生物医药研发进程。作为前沿推理模型,GPT-Rosalind将AI能力深度应用于生命科学场景,为科研人员提供从基因数据分析到药物筛选的智能支持,提升复杂生物信息处理效率。
另有 4 家信源报道X:OpenAI (@OpenAI)X:Greg Brockman (@gdb)X:Rohan Paul (@rohanpaul_ai)X:Kim (@kimmonismus)4月16日
Claude Opus 4.7 全面上线,在高级软件工程任务上实现重大飞跃,93项编码基准测试解决率较 Opus 4.6 提升 13%,并首次解决四项前代无法完成的难题。新版本支持更高分辨率图像识别,在研究代理基准测试中总分达 0.715,长上下文性能表现最为稳定。模型定价维持每百万输入 token 5 美元、输出 25 美元不变。出于安全考量,其网络攻击能力较 Claude Mythos Preview 有所削弱,并配备自动拦截高风险网络安全请求的防护机制,合法安全研究人员可通过 Cyber Verification Program 申请使用权限。
另有 12 家信源报道Claude Code:GitHub Releases(RSS)X:Boris Cherny (@bcherny)X:Yuchen Jin (@Yuchenj_UW)X:Kim (@kimmonismus)X:Thariq (@trq212)X:Testing Catalog (@testingcatalog)X:Claude (@claudeai)X:Artificial Analysis (@ArtificialAnlys)X:Rohan Paul (@rohanpaul_ai)The Decoder:AI News(RSS)Claude:Blog(网页)Hacker News 热门(buzzing.cc 中文翻译)阿里巴巴通义千问团队发布Qwen3.6-35B-A3B代码模型,总参数350亿、激活参数30亿,具备能动编码(Agentic Coding)能力,可自主规划并执行复杂编程任务。该模型采用MoE架构平衡性能与成本,现已完全开源并向公众免费开放。
另有 2 家信源报道X:Kim (@kimmonismus)Qwen:Blog Retrieval(API)