Topic · 主题全部主题 →

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

3,857条收录
652条精选

精选归档 · 第 7 页

121140 条 · 共 652

7月27日7月27日周一

星期一 · 1 条
23:31
Kimi.ai@Kimi_Moonshot精选
AI 评分 81/100
Kimi K3 开源:2.8T MoE 模型与技术报告Releasing the model weights and technical report of Kimi K3.Kimi K3 is our most capable model: a 2.8T MoE model with native visual understanding and a 1M-token context window.New model architecture: 2.5x the intelligence per unit of compute, not just more params.Alongside Kimi K3, we're opening up more of the stack behind it — high-performance attention kernels, MoE communication library, and infrastructure for running agent environments at scale.Model weights: http://huggingface.co/moonshotai/Kimi-K3 Tech report: http://github.com/MoonshotAI/Kimi-K3/blob/master/k3_tech_report.pdf Tech blog: http://kimi.com/blog/kimi-k3Kimi 发布其最强模型 Kimi K3,这是一个 2.8T 参数的 MoE 模型,具备原生视觉理解和 1M token 上下文窗口。新架构实现了每单位计算 2.5 倍的智能提升。除模型权重外,Kimi 还开源了高性能注意力内核、MoE 通信库及大规模智能体运行环境基础设施。
另有 15 家信源报道X:Kimi.ai (@Kimi_Moonshot)IT之家(RSS)The Decoder:AI News(RSS)公众号:月之暗面(Kimi)X:阿易 AI Notes (@AYi_AInotes)X:Rohan Paul (@rohanpaul_ai)X:Artificial Analysis (@ArtificialAnlys)X:硅基流动 SiliconFlow (@SiliconFlowAI)X:AK (@_akhaliq)X:Elvis Saravia (@omarsar0, DAIR.AI)LMSYS:Blog(Chatbot Arena 团队)公众号:数字生命卡兹克HuggingFace Daily Papers(社区热门论文)X:Kim (@kimmonismus)The Verge:AI(RSS)
推荐理由:Kimi K3 这次开源很彻底,连注意力内核和 MoE 通信库都给了,对想深入研究 MoE 架构的团队是个宝库。

7月25日7月25日周六

星期六 · 3 条
07:40
公众号:数字生命卡兹克精选
AI 评分 64/100
Claude Opus 5 发布,以一半价格逼近 Fable 5

Anthropic 发布 Claude Opus 5,已全量上线,支持 100 万上下文,知识截止至 2026 年 5 月。在 ARC-AGI-3 上得分 30.2%,接近 GPT-5.6 Sol(7.8%)的四倍;输入每百万 Token 5 美元、输出每百万 Token 25 美元,价格与 Opus 4.8 相同,仅为 Fable 5 的一半。

另有 17 家信源报道TechCrunch:AI(RSS)公众号:卡尔的AI沃茨X:Claude (@claudeai)X:Boris Cherny (@bcherny)X:Thariq (@trq212)X:Rohan Paul (@rohanpaul_ai)Simon Willison 博客X:Yuchen Jin (@Yuchenj_UW)X:Kim (@kimmonismus)X:小北 (@frxiaobei)X:AI Safety Memes (@AISafetyMemes)The Verge:AI(RSS)X:Claude Devs (@ClaudeDevs)X:Testing Catalog (@testingcatalog)MarkTechPost(RSS)The Decoder:AI News(RSS)IT之家(RSS)
推荐理由:卡兹克第一时间上手 Claude Opus 5,用实测撕开官方跑分的伪装,发现它在实际工程中的漏洞,并点出 Anthropic 删掉 80% 系统提示的趋势——模型变聪明了,过去那些繁琐的 Skill 该扔了。
06:22
Midjourney:Updates(RSS)精选
AI 评分 73/100
Midjourney V8.2 发布:专注美学提升与个性化理解

Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。

另有 1 家信源报道X:Midjourney (@midjourney)
推荐理由:Midjourney V8.2 把审美和个性化放到了C位,不再追分辨率,这对重度用户是实在的体验升级,建议立刻用老 profile 试试新模型。
01:24
Anthropic:Newsroom(网页)精选
AI 评分 92/100
Anthropic 发布 Claude Opus 5

Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。


推荐理由:Anthropic 这次把 Opus 的性价比条拉满了,性能翻倍价格减半,实际编码和知识工作基准已经超越所有模型。最打动我的是它自查自纠的严谨,写代码像真开发者一样审自己的页面,这种责任心以前只在人身上见过。

7月24日7月24日周五

星期五 · 4 条
19:50
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 77/100
SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成

SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。


推荐理由:SANA-Video 2.0 视频生成模型把单 GPU 的 720p 生成压到 13 秒,比 Wan 2.2 快 120 倍,做视频应用的开发者该重新评估成本模型了。
14:50
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
FLUX 3 x mimic:新一代视频动作模型

Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。

另有 4 家信源报道X:Emad Mostaque (@EMostaque)MarkTechPost(RSS)X:Deedy Das (@deedydas)The Decoder:AI News(RSS)
推荐理由:Flux 3 证明了一个基础模型能同时生成视频和驱动机器人,Audi 产线的真实部署验证了物理 AI 从实验室走向量产,是基础模型走向通用世界理解的扎实一步。
14:50
IT之家(RSS)精选
AI 评分 73/100
Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频

Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于 Self-Flow 学习框架扩展,可在单次生成中输出最长 20 秒视频并附带原生音频,支持文生视频、图生视频、多镜头串联等任务。

另有 4 家信源报道X:Emad Mostaque (@EMostaque)MarkTechPost(RSS)X:Deedy Das (@deedydas)The Decoder:AI News(RSS)
推荐理由:FLUX 3 把图像、视频、音频塞进同一个架构,单次能出 20 秒带声视频,对比 Grok Video 胜率 69%,视频生成赛道的竞争又升温了。
00:00
蚂蚁百灵:Developer Blog(网页)精选
AI 评分 55/100
蚂蚁百灵发布 Ling-3.0-flash:124B 总参数、5.1B 激活参数,智能密度超越 1T 级旗舰

蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数仅 5.1B。该模型以极致智能密度对标并超越上一代 1T 级旗舰思考模型 Ring-2.6-1T。

另有 3 家信源报道IT之家(RSS)X:蚂蚁百灵 (@AntLingAGI)公众号:蚂蚁百灵(Ling)
推荐理由:蚂蚁把124B模型的激活参数压到5.1B,还敢对标上代1T旗舰,如果实测不翻车,这个智能密度对端侧和低成本部署是个真信号。

7月23日7月23日周四

星期四 · 4 条
17:25
Google AI:DEV 作者专属(RSS)精选
AI 评分 73/100
Gemini 3.6 Flash 与 3.5 Flash-Lite 正式版发布

Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。


推荐理由:Gemini 3.6 Flash 降本增效,3.5 Flash-Lite 主打低成本高速,弃用 temperature 等参数是个硬变更,使用 Gemini 的开发者必须检查迁移。
13:53
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

Cactus 推出基于 Gemma 4 的混合模型“Cactus Hybrid”,在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。


推荐理由:把置信度探针塞进 Gemma 4 E2B,让模型自己判断该不该求助大模型,仅路由 15-35% 的查询就能持平 Flash-Lite,对离线/隐私优先的端侧产品是个省成本的新思路。
00:00
Black Forest Labs:Blog(网页)精选
AI 评分 59/100
FLUX 3 发布:Black Forest Labs 多模态模型,支持原生音频、图像生成与动作预测

Black Forest Labs 发布多模态模型 FLUX 3,面向视频领域,原生支持音频、图像生成与动作预测。该模型旨在成为视觉智能的骨干,目前官方已展示其能力与早期结果。


推荐理由:Black Forest Labs 把图像、视频、音频拉通到一个模型里,这比单纯提升画质更有想象力,但目前只有一句简介,像个预告片,想真评估的还得等技术细节。

7月22日7月22日周三

星期三 · 2 条
20:52
Qwen@Alibaba_Qwen精选
AI 评分 73/100
通义千问发布Qwen-Image-3.0:主打"真实"的第三代图像生成模型🎨 Meet Qwen-Image-3.0 — the third generation of our foundational image generation model.If 1.0 was about "Precision," and 2.0 added "Variety, Completeness, Beauty & Authenticity," then 3.0 comes down to a single word: Real (实).Three dimensions of "Real": 📰 Rich Content — prompts up to 4.5k tokens. One-pass generation of complex layouts: newspapers, storyboards, exam papers — even a 3×3 infographic grid or picture-in-picture-in-picture UIs. 🔬 Authentic Details — text legible down to 10px, full LaTeX paper pages, pores, hair strands & near-photographic skin texture. 🌏 Deep Knowledge — native rendering in 12 languages, 100+ art styles, realistic UIs (web / games / livestreams), plus world knowledge & live web retrieval.Not just "good-looking" — genuinely useful. Image generation as a real productivity tool for design, content, education & e-commerce.Go create 🏃🎨💬Qwen Chat: https://chat.qwen.ai/?inputFeature=t2i 📝Blog: https://qwen.ai/blog?id=qwen-image-3.0通义千问发布第三代图像生成模型Qwen-Image-3.0,核心关键词为"真实"。模型支持最长4.5k token的提示词,可一次性生成复杂布局(如报纸、试卷、3×3信息图),并能渲染10px级文字、完整LaTeX论文页面及逼真皮肤纹理。它还支持12种语言、100多种艺术风格,并具备实时网络检索能力,旨在成为设计、教育等领域的实用生产力工具。
另有 3 家信源报道X:swyx (@swyx)The Decoder:AI News(RSS)X:阿里云 / Alibaba Cloud (@alibaba_cloud)
推荐理由:Qwen-Image 3.0 不再只追求画质,而是把图像生成变成排版工具,支持4.5k token提示和10px可读文本,设计、电商、教育团队可以直接用来出稿,是今年最实用的图像模型更新。
08:49
IT之家(RSS)精选
AI 评分 72/100
小红书大模型 dots-note-3.0 以满分获 IMO 2026 金牌,第三题解法获冠军选手称赞

小红书大模型 dots-note-3.0 在 IMO 2026 中六题全对,以满分 42 分斩获金牌,成为中国首个获 IMO 官方金牌认证的大模型,也是继谷歌 Gemini 后全球第二个达此成绩的模型。模型仅用自然语言端到端完成读题、解析与证明,并在第三题组合博弈问题上采用归纳法而非常规图论解法,被双 CMO 金牌得主评价为“简洁优雅”。该模型即将开源。

另有 1 家信源报道X:Rohan Paul (@rohanpaul_ai)
推荐理由:中国大模型首次 IMO 满分,题目比去年还难,金牌线降了 6 分。小红书 dots-note-3.0 不仅全对,第三题解法还让冠军选手叫绝,做推理的同行该认真看看了。

7月21日7月21日周二

星期二 · 5 条
23:22
Google DeepMind:Blog(RSS)精选
AI 评分 57/100
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 三款新模型

Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。其中 Gemini 3.6 Flash 为最新主力模型,3.5 Flash-Lite 主打更低成本与更高效率,3.5 Flash Cyber 则针对网络安全场景优化。三款模型均通过 Google AI 开发者平台提供 API 访问。

另有 18 家信源报道X:Google AI (@GoogleAI)X:Logan Kilpatrick (@OfficialLoganK)X:Artificial Analysis (@ArtificialAnlys)MarkTechPost(RSS)Ars Technica:AI(RSS)The Verge:AI(RSS)X:Google DeepMind (@GoogleDeepMind)Google DeepMind:Blog(RSS)TechCrunch:AI(RSS)X:Google AI for Developers (@googleaidevs)X:Rohan Paul (@rohanpaul_ai)The Decoder:AI News(RSS)X:Josh Woodward (@joshwoodward, Google Labs VP)X:Jeff Dean (@JeffDean)X:fofr (@fofrAI)X:Gemini (@GeminiApp)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)
推荐理由:Gemini Flash 系列常规更新,Flash-Lite 和 Cyber 变体值得 API 开发者留意,但细节还没出来,目前只能先标记。
19:10
公众号:小红书技术(dots.llm)精选
AI 评分 81/100
小红书 dots 模型获 IMO 2026 满分金牌

小红书 dots 团队携内部版本 dots-note 3.0 参加第 67 届 IMO 2026,六道题均获满分,以 42/42 分取得满分金牌,全球仅 7 位人类选手获此成绩。模型不依赖形式化语言,直接读取原始 LaTeX 题目,通过递归自我批判能力端到端完成解题。dots-note 3.0 是 dots3 系列最轻量级模型,预期将开源。


推荐理由:IMO满分金牌这个里程碑,背后是模型递归自我批判能力的突破。不依赖形式化验证就能给出优雅证明,这对数学推理研究是个真信号,做推理方向的值得细读。
19:07
公众号:小红书技术(dots.llm)精选
AI 评分 77/100
小红书dots模型取得IMO 2026满分金牌成绩

小红书dots团队携dots-note-3.0内部版本参加IMO 2026,六题均获满分7分,以42/42分取得满分金牌,全球仅7位人类选手获满分。该模型不依赖形式化语言,直接读取原始LaTeX题目,通过Proof、Verify、Refine三环节递归自我批判完成解题。dots-note-3.0是dots3系列最轻量级模型,预期将开源。


推荐理由:dots模型在IMO满分验证了递归自我批判方法的有效性,这种不依赖形式化验证、通过自我质疑改进推理的路径,可能为科学研究等难以量化的复杂任务提供新的解决思路。
14:22
Qwen:Blog Retrieval(API)精选
AI 评分 77/100
通义千问发布 Qwen-Image-3.0 图像生成模型,核心关键词为"实"

通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。


推荐理由:我觉得 Qwen-Image-3.0 不只是画得好看,而是真正追求“有用”,4.5k token 输入、12 种语言渲染、10px 精细文字,对做设计、内容生产的人是生产力级突破。
00:49
Hugging Face:Blog(RSS)精选
AI 评分 70/100
NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成

NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。


推荐理由:NVIDIA 把世界模型的能力压进 4B 参数,直接在 Jetson 上实时推理并生成机器人动作,对做具身智能的人来说是个标志性信号,边缘部署终于可以摆脱云端依赖了。

7月20日7月20日周一

星期一 · 1 条
23:00
Sakana AI:Blog(网页)精选
AI 评分 60/100
Sakana AI 推出 Fugu-Cyber 编排模型,面向现代网络防御

Sakana AI 发布 Fugu-Cyber,一款面向现代网络防御的编排模型,现以新 API 端点形式提供。该模型在 CyberGym 上取得 86.9% 的成功率,在 CTI-REALM 上达到 72.1%,与 GPT-5.5-Cyber 和 Mythos-Preview 等网络安全前沿模型相当。


推荐理由:Sakana AI 把 AI 编排带到网络安全领域,Fugu-Cyber 在真实基准上的 SOTA 成绩值得安全从业者认真看看,但具体细节还没公开,别急着上手。