Topic · 主题全部主题 →

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

3,857条收录
652条精选

精选归档 · 第 3 页

4160 条 · 共 652

8月28日8月28日周五

星期五 · 4 条
14:11
公众号:腾讯混元精选
AI 评分 82/100
腾讯混元发布 Hy4 preview:770B 总参数、1M 上下文,开源上线

腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,现已开源并在腾讯云 TokenHub 和 OpenRouter 上线。

另有 7 家信源报道IT之家(RSS)X:opencode (@opencode)Simon Willison 博客X:腾讯混元 (@TencentHunyuan)X:Testing Catalog (@testingcatalog)Hacker News 热门(buzzing.cc 中文翻译)X:Kim (@kimmonismus)
推荐理由:官方盲测中它与 GLM-5.3、Kimi K3 的分差不足 0.1,选型时 1M 上下文和开源部署成本可能比榜单排名更实际。
07:40
Midjourney:Updates(RSS)精选
AI 评分 64/100
Midjourney 开放 V8.2 图像编辑模型测试

Midjourney 开始向所有用户开放其首个 V8.2 图像编辑模型的测试。该模型支持指令编辑、以图生图(最多同时引用 4 张参考图)、局部重绘与扩画,并兼容个性化、moodboards 和 srefs 功能。用户可通过网页端或 Discord 的 --edit 命令使用,官方同步更新了 midjourney.com 与 alpha.midjourney.com 的界面。

另有 1 家信源报道X:Midjourney (@midjourney)
推荐理由:这一版把图像引用数量从单参考提升到最多四张,做多素材融合时不必先拼接成单图再喂给模型,能减少中间步骤。
00:12
Google DeepMind:Blog(RSS)精选
AI 评分 70/100
Gemini Omni 1.1 Flash 发布,为开发者提供更强生成式视频控制

Google 推出 Gemini Omni 1.1 Flash,为开发者提供更强的生成式视频控制能力。新模型支持场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量累计延长至 40 秒)、指定首尾帧生成平滑过渡,以及 4K 高清输出。

另有 8 家信源报道X:Logan Kilpatrick (@OfficialLoganK)X:Google DeepMind (@GoogleDeepMind)MarkTechPost(RSS)X:Google AI (@GoogleAI)Hacker News 热门(buzzing.cc 中文翻译)The Decoder:AI News(RSS)IT之家(RSS)X:Gemini (@GeminiApp)
推荐理由:360p 预览的成本降到 720p 的三分之一并提速最多 60%,让视频生成的前期探索可以低成本多版本比较,改变的是创意工具迭代的节奏。

8月27日8月27日周四

星期四 · 3 条
04:10
Google Research:Blog(网页)精选
AI 评分 63/100
GlucoFM:面向连续血糖监测的基础模型

Google Research 推出 GlucoFM,一款轻量级自监督 CGM 基础模型,采用双流设计分别建模缓慢血糖趋势与短期波动。在四个队列、七项临床预测任务的 14 项评估中,其 PR-AUC 较最优 GluFormer 变体平均高出 5.8 个百分点,并在 PPGR 预测中取得最低 MAE。模型在 109,066 小时无标注 CGM 数据上预训练,具备跨数据集迁移与少样本适应能力。


推荐理由:把血糖轨迹拆成慢趋势和短时偏差双流,不重建原始读数而是预测潜在表征,再用多天平均提升个体预测,为有限临床标签下构建健康监测模型提供了可复用的训练框架。
01:12
Google DeepMind:Blog(RSS)精选
AI 评分 68/100
Gemini 3.5 Transcribe 发布:面向实时语音交互的高精度语音转文本模型

Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型,支持流式与非流式两种 API。据 Artificial Analysis 评测,其流式与非流式平均词错率分别为 4.0% 和 2.6%,支持超 85 种语言、自定义词汇及最多三人说话人识别。

另有 12 家信源报道The Verge:AI(RSS)X:Google AI (@GoogleAI)X:Sundar Pichai (@sundarpichai)MarkTechPost(RSS)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)Ars Technica:AI(RSS)X:Logan Kilpatrick (@OfficialLoganK)X:Artificial Analysis (@ArtificialAnlys)The Decoder:AI News(RSS)Google AI:DEV 作者专属(RSS)X:Rohan Paul (@rohanpaul_ai)
推荐理由:相较于上一代 Chirp 3,流式词错率降到 4.0% 且最终转录延迟改善 70%,会影响语音代理和实时字幕方案的成本与体验取舍。

8月26日8月26日周三

星期三 · 5 条
22:25
智谱:研究(网页内嵌数据)精选
AI 评分 74/100
GLM-5.3-Flash:前沿智能进入普惠时代

智谱上线并开源GLM-5.3-Flash(320B-A18B),这是GLM-5系列首个原生多模态模型,在AA综合智能指数取得57分,与Claude Opus 4.8持平。其定价为GLM-5.3的1/10(限时1/20),为Opus 4.8的1/40,并首次在大规模流量中由国产芯片集群提供算力支持。模型已接入ZCode等平台,同步开放API调用。

另有 13 家信源报道X:智谱 Z.ai (@Zai_org)X:X.PIN (@thexpin)IT之家(RSS)X:OpenRouter (@OpenRouter)公众号:智谱(GLM)X:Elvis Saravia (@omarsar0, DAIR.AI)MarkTechPost(RSS)X:Kim (@kimmonismus)The Decoder:AI News(RSS)X:Artificial Analysis (@ArtificialAnlys)X:硅基流动 SiliconFlow (@SiliconFlowAI)公众号:数字生命卡兹克X:Testing Catalog (@testingcatalog)
推荐理由:价格降到 Opus 4.8 的四十分之一后,模型选型不必把同等能力等同于同等成本,长上下文和视觉任务可以按普通预算规划。
20:37
Qwen@Alibaba_Qwen精选
AI 评分 84/100
Qwen3.8-Flash 开源,Qwen4 架构预览API is live on QwenCloud: https://www.qwencloud.com/models/qwen3.8-flash 🙌Let's build something!通义千问发布 Qwen3.8-Flash,一款多模态 MoE 模型,作为 Qwen4 架构的早期预览并开放权重。该模型总参数 125B,每 token 仅激活 6B,训练成本仅为 Qwen3.7-Plus 的 1/9,性能全面超越后者。生产版 API 定价 $0.16/1M 输入 tokens 和 $0.47/1M 输出 tokens,原生上下文 262K,可扩展至 1M。

Qwen: ⚡️认识一下 Qwen3.8-Flash,一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,现已开放权重! 生产版本 Qwen3.8-Flash 即将通过 QwenCloud API 提供,价格仅为每 100 万输入 token...

另有 4 家信源报道X:Testing Catalog (@testingcatalog)X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:通义千问 / Qwen (@Alibaba_Qwen)IT之家(RSS)
推荐理由:训练成本降到前代的九分之一,同时编码和办公任务基准分数更高,对成本敏感的 API 调用场景提供了一个新的权衡参考点。
20:36
Qwen:Blog Retrieval(API)精选
AI 评分 83/100
Qwen3.8-Flash-Next 开源:Qwen4 架构早期预览

通义千问开源 Qwen3.8-Flash-Next,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览。该模型采用 GDN + QSA 混合注意力等四项升级,总参数 125B,每 token 激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9,编码与办公任务能力更强。

另有 7 家信源报道X:Kim (@kimmonismus)LMSYS:Blog(Chatbot Arena 团队)Simon Willison 博客X:通义千问 / Qwen (@Alibaba_Qwen)X:SemiAnalysis (@SemiAnalysis_)The Decoder:AI News(RSS)MarkTechPost(RSS)
推荐理由:这次提前开放 Qwen4 架构权重,关键在于 QSA 稀疏注意力与 N-gram 查表参数同时降低长上下文成本、扩大容量,为评估下一代模型提供早期样本。
16:04
公众号:腾讯混元精选
AI 评分 67/100
腾讯混元将端侧翻译模型 Hy-MT2-1.8B 压缩至 440MB,已落地哔哩哔哩直播弹幕翻译

腾讯混元将端侧翻译模型 Hy-MT2-1.8B 通过 2-bit 与 1.25-bit 量化方案压缩至 574MB 和 440MB,翻译质量几乎无损,在 FLORES-200 上优于 Microsoft Translator 等商业 API。该模型已联合英特尔完成 x86 适配,并在哔哩哔哩直播弹幕实时翻译中落地,单条弹幕翻译耗时 500~800ms。


推荐理由:相比精度数字,这套量化给出 x86 优化和直播弹幕实测数据,让端侧替代云翻译 API 的成本与隐私权衡有了可对照的工程基线。
00:00
Google AI@GoogleAI精选
AI 评分 73/100
WeatherNext 预测气旋:提前五天预警五级飓风https://x.com/i/article/2092249927812337664WeatherNext: Our AI model helping to forecast cyclonesPredicting how tropical cyclones (also known as hurricanes or typhoons) develop and move is notoriously tricky, and every single hour of advance warning counts.Recently, we published a paper on WeatherNext, our AI model for global weather forecasting from @GoogleDeepmind and @GoogleResearch. To tackle extreme storms, we built WeatherNext Cyclones to seamlessly bridge the gap between global weather patterns and local storm details to completely revolutionize how we track cyclones.This isn't just happening in a lab — WeatherNext Cyclones was put to the test during the 2025 hurricane season, marking the first time the U.S. National Hurricane Center used AI models in real-time operations. Forecasters used it to predict Hurricane Melissa’s Category 5 landfall in Jamaica a full five days in advance, giving local officials critical extra time to prepare.Historically, meteorologists have faced a tough-trade off when attempting to track cyclones. To track a storm's path, they relied on massive, physics-based supercomputer models, which are great at capturing broad weather patterns sweeping across the planet. But to understand the intense, localized physics driving how strong the storm would get, they had to switch to entirely different "zoomed-in” regional models.WeatherNext Cyclones can predict a storm's track, intensity, and size all at once, giving forecasters an extra full day of advance warning compared to previous systems. To put that in perspective, our three-day forecasts are now as accurate as older two-day forecasts. Historically, it took a full decade of meteorological progress to squeeze out that kind of improvement, and we’ve delivered it in a single modeling leap.The model is also incredibly fast, generating up to 1,000 individual simulations per storm. Instead of just one "most-likely" path, forecasters get a much fuller picture of all possible outcomes, making it easier to spot dangerous events like rapid intensification (when a storm's maximum sustained winds increase by 30 knots or more in 24 hours).Ready to learn more?Take a deep dive into the research and technical details below: Blog → goo.gle/4gkvEpy @Nature article → goo.gle/4wYGzdC Code and model weights now open source on @github → goo.gle/4qDm7xgGoogle AI 发布 WeatherNext 气旋预测模型,可同时预测风暴路径、强度和规模,比现有系统多提供一整天的预警时间。该模型在 2025 飓风季实战测试中,提前五天预测飓风 Melissa 在牙买加的五级登陆,系美国国家飓风中心首次实时使用 AI 模型。模型单场风暴可生成多达 1000 次模拟,代码与权重已开源。
推荐理由:把路径、强度和尺度放进同一模型,省去过去切换全球与区域模型的步骤,对需要快速判断登陆风险的预报流程是种简化。

8月25日8月25日周二

星期二 · 1 条
04:04
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 59/100
GPT-5.6 登陆 Kiro,为开发者提升性价比

GPT-5.6 模型家族现已登陆软件开发智能体 Kiro,包含 Sol、Terra 和 Luna 三款模型。在 Terminal-Bench 2.1 测试中,GPT-5.6 Terra 在 Kiro 内完成任务成本降低约 82%。该更新由 OpenAI 与 AWS 合作优化,旨在以更少迭代和更高 token 价值帮助开发者产出更高质量的代码。


推荐理由:在 Terminal-Bench 2.1 上,GPT‑5.6 Terra 在 Kiro 中完成任务的成本约下降 82%,为长周期编码任务的投入产出评估提供了一个量化基准。

8月21日8月21日周五

星期五 · 4 条
21:07
OpenBMB@OpenBMB精选
AI 评分 69/100
面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型🧮 Introducing MathForm, an open-source framework, dataset, and model for mathematical autoformalization with Lean 4.Formalizing mathematics makes mathematical knowledge machine-checkable, but it is more than translating statements into code. A model must map each concept onto the right types and definitions in Mathlib. A formal statement can compile and still misstate the original problem.Highlights ✨ MathForm Framework: Retrieval-Augmented, Verification-Guided Data Construction A retrieval planner pulls the Mathlib definitions and existing formalizations a statement needs. The generator then revises its output against Lean compiler diagnostics and semantic-consistency feedback for up to 3 rounds.FormalVerse Dataset: 367K+ Verified Lean 4 Examples Each example pairs a natural-language statement with verified Lean 4 code , across diverse mathematical domains and sources.Results 📊 • At a matched 100K budget with the same recipe and init, models trained on FormalVerse reach 60.32% Consistency Check, vs 46.53% on FineLeanCorpus and 41.49% on NuminaMath-LEAN • MathForm-8B achieves 88.06% Syntax Check and 72.37% Consistency Check Pass@8 across six benchmarks, outperforming ReForm-32B and Goedel-Formalizer-V2-32B at a quarter the size • On the hardest FATE-H / FATE-X subsets it reaches 63% / 37% Consistency Check, beating the strongest specialized baseline by 10 and 12 points🔗 Resources 📄 Paper: http://arxiv.org/abs/2608.14221 📚 Dataset: http://huggingface.co/datasets/openbmb/FormalVerse 🤖 Model: http://huggingface.co/openbmb/MathForm-8B 💻 Code: http://github.com/openbmb/MathForm面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。

推荐理由:数学形式化的难点是编译通过但语义漂移,该框架用检索规划和语义一致性反馈迭代修正,并开源数据集和 8B 模型,给小模型做形式化提供了可复用路径。
17:26
DeepSeek:API 更新日志精选
AI 评分 67/100
DeepSeek-V4-Flash-Vision-Exp 发布

DeepSeek 上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,可通过设置 model='deepseek-v4-flash-vision-exp' 在 API 平台访问。

另有 4 家信源报道The Decoder:AI News(RSS)X:阿易 AI Notes (@AYi_AInotes)IT之家(RSS)X:DeepSeek (@deepseek_ai)
推荐理由:实验版在纯文本能力与正式版持平的基础上补齐视觉,多模态 Agent 基准接近 Opus-4.8,让依赖视觉的 DeepSeek 工作流无需切换后端即可评估更强感知能力。
17:12
公众号:DeepSeek(深度求索)精选
AI 评分 73/100
DeepSeek 上线多模态视觉理解模型 V4-Flash-Vision-Exp

DeepSeek 上线多模态视觉理解模型 V4-Flash-Vision-Exp,纯文本能力与 V4-Flash 正式版持平,多模态 Agent 能力接近 Opus-4.8。该模型通过 API 提供,图片按 token 计费,一张最多占 384 tokens,价格与 V4-Flash 一致。同期上线的 Files API 免费,支持图片上传后通过 file_id 复用。

另有 1 家信源报道公众号:卡尔的AI沃茨
推荐理由:比文本能力持平更实际的是多模态 Agent 能力接近 Opus-4.8,同时图片按 token 计费与 V4-Flash 一致,原先依赖外部视觉模型的 Agent 流程可能改用单一 API 且成本更低。
01:06
Hugging Face:Blog(RSS)精选
AI 评分 61/100
Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。


推荐理由:约300M参数的draft模型换最高3.18倍吞吐,贪心输出不变,LFM2.5-2.6B在M4 Max达139 tok/s,本地agent门槛被拉低。

8月20日8月20日周四

星期四 · 2 条
18:24
IT之家(RSS)精选
AI 评分 72/100
阿里发布 Qwen-UI-Agent,主打让模型真正"会用"每一块屏幕

阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。


推荐理由:它把 GUI 智能体评测从模拟分数推向真实手机操作,自建 MobileWorld-Real 基准和百台真机环境,使落地型团队能按真机成功率而非仅看模拟榜单做选型。
10:00
公众号:蚂蚁百灵(Ling)精选
AI 评分 68/100
Ling-3.0 tiny & flash Base Models 正式开源

蚂蚁百灵开源 Ling-3.0-tiny-base 与 Ling-3.0-flash-base,并同步开放预训练、中期训练及 WSM 合并等共 6 个 checkpoints。tiny-base 总参数 7.9B、激活参数 1.3B,flash-base 总参数 124B、激活参数 5.1B,均采用统一训练方案,适合持续预训练、监督微调、偏好优化及强化学习后训练等场景。

另有 2 家信源报道X:蚂蚁百灵 (@AntLingAGI)IT之家(RSS)
推荐理由:Ling-3.0 开放中间 checkpoint 和 WSM 合并策略,研究者可比较各训练阶段增益,并在自己数据上从合适节点继续预训练或后训练,而不只是拿到最终权重。

8月19日8月19日周三

星期三 · 1 条
22:05
Hugging Face:Blog(RSS)精选
AI 评分 64/100
Liquid AI 发布 LFM2.5 系列 QAD Q4_0 量化检查点,恢复 97% 精度损失

Liquid AI 发布基于量化感知蒸馏(QAD)训练的 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 四款 Q4_0 GGUF 检查点,在保持原生 Q4_0 内存与速度的同时,恢复 BF16 平均精度损失的 97%。


推荐理由:QAD 量化蒸馏恢复 Q4_0 模型九成六以上 BF16 精度,对应树莓派和手机等边缘设备,在保持低内存与高吞吐的同时缩小与全精度模型的差距。