Topic · 主题全部主题 →

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

3,857条收录
652条精选

精选归档 · 第 15 页

281300 条 · 共 652

6月13日6月13日周六

星期六 · 6 条
17:54
公众号:智谱(GLM)精选
AI 评分 70/100
智谱 GLM-5.2 全量开放,支持 1M 上下文且下周开源

GLM-5.2 是智谱迄今能力最强的开源模型,支持真正可用的 1M 上下文,在长程任务中继续保持领先,并被智谱称为最强的国产 Coding 模型。今晚 5:21 起面向 GLM Coding Plan 全量用户开放(覆盖 Lite、Pro、Max、团队版)。API 将于下周上线,模型下周正式开源,遵循 MIT 协议。

另有 11 家信源报道X:智谱 Z.ai (@Zai_org)智谱:研究(网页内嵌数据)公众号:智谱(GLM)Simon Willison 博客Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)Hugging Face:Blog(RSS)X:硅基流动 SiliconFlow (@SiliconFlowAI)X:Kim (@kimmonismus)The Decoder:AI News(RSS)X:Testing Catalog (@testingcatalog)
推荐理由:智谱把最强大模型全量开放且开源,这事本身就在打脸那些收回权限的闭源模型,做中文编码的开发者可以认真看看。
14:19
公众号:智谱(GLM)精选
AI 评分 70/100
GLM-5.2 全量开放:智谱最强开源模型支持 1M 上下文

智谱发布迄今能力最强的开源模型 GLM-5.2,支持真正可用的 1M 上下文,并在长程任务中继续保持领先,同时也是其最强的国产 Coding 模型。今晚 5:21,GLM-5.2 将面向 GLM Coding Plan 全量用户开放,覆盖 Lite / Pro / Max / 团队版。GLM-5.2 API 将于下周上线,模型下周正式开源,遵循 MIT 协议。


推荐理由:GLM-5.2 的 MIT 开源意味着企业可无授权顾虑地基此构建编码工具,若长程能力兑现,可能重塑国产代码助手的成本边界。
13:17
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 62/100
inclusionAI 发布 VISTA-4B GUI 定位视觉语言模型

VISTA-4B 是基于 Qwen3.5-4B 骨干的 GUI 定位模型,输入截图与自然语言指令,输出归一化 0-1000 坐标。训练采用视图一致 GRPO 和自验证交叉视图锚定。在 GUI 定位基准上,SSPro 得分 64.2(相比 GRPO-4B 提升 2.0),SSV2 得分 93.8(下降 0.4),OSWorld-G 得分 61.2(提升 1.3),OSWorld-G-R 得分 69.7(提升 0.5)。模型已开源在 HuggingFace,推荐使用提示词并返回 [x,y] 格式坐标。


推荐理由:蚂蚁 inclusionAI 开源了一款 GUI 定位模型,基于 Qwen3.5 微调,在接地基准上小幅提升,关键是提供了自验证训练方法,做桌面自动化的可以直接下载用。
13:17
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 71/100
inclusionAI/VISTA-9B:基于VISTA训练的GUI定位视觉语言模型

VISTA-9B是基于Qwen3.5 9B骨干训练的GUI定位模型,输入截图与自然语言指令,输出0-1000归一化坐标。采用VISTA(视图一致自验证)方法,含view-consistent GRPO与self-verified cross-view anchoring。在SSPro、SSV2、OSWorld-G、OSWorld-G-R上分别取得69.2、95.8、68.1、75.5分,超越Qwen3.5-9B与GRPO-9B基线。模型已开源,可通过HuggingFace加载使用。


推荐理由:蚂蚁 inclusionAI 的 VISTA-9B 专攻 GUI 定位,把截图和指令直接变成点击坐标,做界面自动化的开发者可以直接拿来用。训练中的视角一致性约束有点新意,但基准提升不大,更像个实干范本。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 77/100
Ling-2.6与Ring-2.6技术报告:高效即时的万亿参数智能体智能

Ling-2.6优化即时响应与输出token能力,Ring-2.6针对深度推理和复杂智能体工作流。基于Ling-2.0通过架构迁移预训练和大规模后训练升级。架构引入融合Lightning Attention与MLA的混合线性注意力设计,提升长上下文训练与解码效率。通过进化思维链、语言单元策略优化、双向偏好对齐和最短正确响应蒸馏优化token效率。提出KPop强化学习框架支持Ring-2.6-1T在环境交互数据上稳定训练,通过异步调度提升编码、搜索、工具使用和工作流执行的训练效率。2.6系列全部检查点已开源。


推荐理由:万亿参数开源 Agent 模型,一个走即时响应,一个专攻复杂推理,对于做工具调用和自动化工作流的团队是能立刻上手的重要弹药。

6月12日6月12日周五

星期五 · 5 条
01:20
Logan Kilpatrick@OfficialLoganK精选
AI 评分 81/100
Gemini Omni Flash 视频任务达 SOTAGemini Omni Flash is SOTA at image to video, text to video, and video editing : )Excited to get this to developers in the API soon!Gemini Omni Flash 在图像到视频、文本到视频和视频编辑方面达到了 SATA : ) 很高兴很快能将这一能力通过 API 提供给开发者!

推荐理由:视频生成正式进入全模态一体时代,Gemini Omni Flash 把图生视频、文生视频和剪辑整合在一个模型里,API 很快上线,做视频工具的可以提前琢磨对手在哪了。
01:17
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 72/100
DeepSeek-R1 的开源实现

DeepSeek-R1 的开源复现项目已在 GitHub 发布,在 Hacker News 上获得 101 个积分。该项目旨在以开源方式复现 DeepSeek-R1 模型。


推荐理由:Hugging Face 把 DeepSeek-R1 的完整训练管线拆解得清清楚楚,从数据蒸馏到 GRPO 强化学习都开源了,还放出了复现的模型和数据集。想理解或自己训练推理模型的开发者,这大概是目前最实用的路线图。

6月11日6月11日周四

星期四 · 3 条
12:10
Midjourney:Updates(RSS)精选
AI 评分 64/100
Midjourney V8.1 已成为默认模型

Midjourney 已将默认模型从 V7 升级为 V8.1。V8.1 在智能性、连贯性、对详细提示的遵循度以及文本渲染效果上均有提升,HD 模式也已支持。

另有 1 家信源报道X:Midjourney (@midjourney)
推荐理由:虽然V8.1不是大版本,但设为默认后所有用户自动升级,尤其是文本和复杂提示词的理解增强,做设计的朋友值得重新测试一下关键词。
02:48
xAI@xai精选
AI 评分 74/100
Grok Voice性能出色价格低廉Grok Voice offers state-of-the-art performance with human-like timing, tone, and warmth. And it's a fraction the price of competitors.Check it out: http://x.ai/api/voiceGrok Voice 提供最先进的性能,具有类人的时机、语调和温暖感。而且价格仅为竞争对手的一小部分。 查看详情:http://x.ai/api/voice

ServiceNow AI Research: 🚀 Grok Voice Think Fast 1.0 (@xAI) lands on the Pareto frontier on EVA-Bench — no system in the eval beats it on accura...

另有 2 家信源报道xAI:News(网页)X:SpaceXAI (@SpaceXAI)
推荐理由:语音AI的SOTA这次不是OpenAI了,Grok Voice在EVA-Bench上无死角领先,价格还打到对手十分之一,做语音产品的可以认真看看这个帕累托前沿选手。
00:40
Google DeepMind:Blog(RSS)精选
AI 评分 72/100
DiffusionGemma:文本生成速度提升4倍的开源扩散模型

Google DeepMind 发布开源实验模型 DiffusionGemma,采用文本扩散技术,突破自回归逐 token 生成方式,每次前向并行生成 256 个 token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存消费级 GPU。在 H100 上达 1000+ tokens/s,RTX 5090 上 700+ tokens/s,速度提升 4 倍。具备双向注意力和自我修正能力,面向内联编辑、代码填充等本地交互工作流,以 Apache 2.0 许可证开放。

另有 6 家信源报道X:Google AI for Developers (@googleaidevs)Google Developers Blog(RSS)X:Google DeepMind (@GoogleDeepMind)X:Demis Hassabis (@demishassabis)MarkTechPost(RSS)X:Testing Catalog (@testingcatalog)
推荐理由:DiffusionGemma 虽为实验性质,但它把文本生成从“串行打字机”变成了“并行印刷机”,本地推理速度 4 倍提升,对需要实时交互的开发者是个值得关注的方向。

6月10日6月10日周三

星期三 · 5 条
16:28
IT之家(RSS)精选
AI 评分 72/100
摩尔线程开源 MusaCoder 代码大模型,9B/27B 参数基于国产 GPU 全链路训练

摩尔线程发布并开源 MusaCoder 代码大模型,含 9B 和 27B 两个参数规模,是业内首个基于国产 GPU 算力底座完成全链路训练与验证的开源模型。后训练流程在基于 MTT S5000 的夸娥智算集群上完成,支持从 PyTorch 标准算子自动生成高性能 CUDA/MUSA 原生 Kernel 代码。在 KernelBench 评测中,MusaCoder-27B-RL 以 Overall Pass@8 93.2%、Avg.@8 88.60% 超越 Claude Opus、DeepSeek-V4 Pro、GLM-5.1、Kimi K2.6 等主流 SOTA 代码模型。


推荐理由:摩尔线程这个模型直接瞄准GPU底层算子,KernelBench分数压过了不少主流大模型,虽然场景窄,但在国产硬件自建软件生态的路上,迈出了挺关键一步。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 78/100
JoyAI-VL-Interaction:实时视觉-语言交互智能

JoyAI-VL-Interaction是一个8B参数的视觉优先交互模型,能像人一样持续观察实时画面,自主决定每秒钟保持沉默、回应或将复杂问题委托给后台模型。模型擅长视觉触发响应和时间感知,并涌现出引导用户切换屏幕、根据幻灯片即兴讲解等未专门训练的能力。配合完整可部署系统,支持实时视频流输入、可插拔ASR/TTS模块、记忆、可视化UI及可连接任意API或智能体的后台大脑。在六个真实场景中,人类评估者更偏好该模型而非豆包和Gemini的应用内视频通话助手。这是首个开源且附带训练配方、数据和完整部署系统的视觉驱动交互模型。


推荐理由:这是首次把视觉主动交互能力做成开源模型和完整系统,模型不再等问题才回答,而是自己决定何时开口或保持沉默,对做实时助手和直播产品的团队有直接参考价值。
04:55
Hugging Face:Blog(RSS)精选
AI 评分 73/100
Cohere发布North Mini Code:面向开发者的开源编码模型

Cohere发布North Mini Code,一款30B参数MoE模型(3B活跃参数),Apache 2.0开源。在Artificial Analysis Coding Index上得分33.4,超越Qwen3.5、Gemma 4等同类模型。后训练采用两阶段SFT和RLVR,在SWE-Bench Verified上pass@10达80.2%,Terminal-Bench v2上达55.1%。支持64K/128K上下文长度,专为智能体编码任务优化。


推荐理由:Cohere的新编码模型North Mini Code以30B参数MoE架构,在SWE-bench pass@1达到61%,Apache 2.0开源,是小模型在agent coding领域真正可用的信号。
01:51
Jeff Dean@JeffDean精选
AI 评分 81/100
Gemini 3.5 Live Translate 支持70+语言翻译Speech translation has been one of the longest-running ML efforts at Google, and we’ve come a long way. Gemini 3.5 Live Translate is our latest speech-to-speech model, supporting 70+ languages. It enables more natural conversations across languages in everyday products and apps.Here’s an example of how partners at @InsideGrab are helping connect travelers with drivers. 🚗Rolling out in Google Translate and via the Live API in @GoogleAIStudio.语音翻译一直是Google历时最久的机器学习项目之一,我们已经取得了长足进展。Gemini 3.5 Live Translate是我们最新的语音到语音模型,支持70多种语言。它能让日常产品和应用中跨语言的对话更加自然。 以下是一个示例,展示@InsideGrab的合作伙伴如何帮助旅客与司机建立联系。🚗 已在Google Translate和@GoogleAIStudio的Live API中推出。
另有 17 家信源报道X:Ethan Mollick (@emollick)X:Google AI for Developers (@googleaidevs)X:Gemini (@GeminiApp)Google DeepMind:Blog(RSS)X:Logan Kilpatrick (@OfficialLoganK)X:Google AI (@GoogleAI)Google Blog:AI(RSS)Google Developers Blog(RSS)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:Google DeepMind (@GoogleDeepMind)X:阿易 AI Notes (@AYi_AInotes)X:Sundar Pichai (@sundarpichai)X:Rohan Paul (@rohanpaul_ai)X:Kim (@kimmonismus)The Decoder:AI News(RSS)The Verge:AI(RSS)
推荐理由:Google把语音翻译做到70+语言,Gemini 3.5 Live Translate直接塞进Google Translate和API,普通人下载App就能用,做跨国生意的这下有福了。
01:04
Anthropic:Newsroom(网页)精选
AI 评分 90/100
Claude Fable 5 和 Claude Mythos 5

Anthropic 今日推出 Claude Fable 5(通用安全版)和 Claude Mythos 5(受限安全版)。Fable 5 在软件工程、知识工作、视觉、科研等几乎所有测试基准上达到 SOTA,Stripe 称其将数月工程压缩至数天,FrontierCode 评分居前沿模型之首,可仅凭截图重建网页应用源码。Mythos 5 在药物设计中实现约 10 倍加速,其分子生物学假说盲测获科学家偏好的概率约 80%。两模型售价均为 $10/百万输入 tokens、$50/百万输出 tokens,较 Claude Mythos Preview 降价过半。Fable 5 在部分敏感主题上回退至 Claude Opus 4.8,安全触发率低于 5% 的会话。Mythos 5 通过 Project Glasswing 向网络安全防御者开放。


推荐理由:Anthropic把最危险的模型安全地放出来了,Fable 5在编码、科研上不是小数点级别的提升,价格还砍半,95%的请求直接跑满血版,必读。

6月9日6月9日周二

星期二 · 1 条
23:35
Google DeepMind@GoogleDeepMind精选
AI 评分 69/100
Gemini 3.5 Live Translate 发布Say hello, hola, 你好 to Gemini 3.5 Live Translate: our latest audio model built for fast, cross-language communication. 🌐说 hello, hola, 你好--欢迎 Gemini 3.5 Live Translate:我们最新的音频模型,专为快速跨语言交流而构建。🌐
另有 17 家信源报道X:Ethan Mollick (@emollick)X:Google AI for Developers (@googleaidevs)X:Gemini (@GeminiApp)Google DeepMind:Blog(RSS)X:Logan Kilpatrick (@OfficialLoganK)X:Google AI (@GoogleAI)Google Blog:AI(RSS)Google Developers Blog(RSS)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:Google DeepMind (@GoogleDeepMind)X:阿易 AI Notes (@AYi_AInotes)X:Sundar Pichai (@sundarpichai)X:Rohan Paul (@rohanpaul_ai)X:Kim (@kimmonismus)The Decoder:AI News(RSS)The Verge:AI(RSS)
推荐理由:Google 这个实时翻译模型把语音+翻译+大模型拧成了一股绳,虽然具体怎么用还不清楚,但做跨境、做语音助手的同学可以把它当个方向标。