Topic · 主题全部主题 →

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

3,857条收录
652条精选

精选归档 · 第 11 页

201220 条 · 共 652

7月8日7月8日周三

星期三 · 8 条
22:33
Mistral AI:News(网页)精选
AI 评分 70/100
Robostral Navigate:Mistral AI 首个具身导航模型

Robostral Navigate 是 Mistral AI 首个具身导航模型(8B 参数),仅用单 RGB 摄像头,在 R2R-CE 验证集上取得 76.6%(unseen)和 79.4%(seen)的成功率,超越最佳单摄像头方法 9.7 个百分点,超越使用深度或多摄像头的系统 4.5 个百分点。模型通过 pointing 预测目标坐标并结合强化学习持续改进,全部在模拟中训练(约 40 万轨迹、6000 场景),采用 prefix-caching 实现高效训练。通用适配轮式、腿式和飞行机器人,能适应真实环境中未训练的障碍。


推荐理由:Mistral 首个具身导航模型,只用单 RGB 摄像头就在未见环境中跑赢深度传感器方案,对机器人行业是个真信号,做物流和制造的可以仔细看看。
21:22
字节 Seed:Research Feed(网页内嵌数据)精选
AI 评分 78/100
Seedream 5.0 Pro 发布:不止"生成",更懂"设计"

字节 Seed 今日发布多模态图像创作模型 Seedream 5.0 Pro,在图文匹配、结构合理性、文字渲染与画面美感上全面升级。四大核心突破:复杂信息可视化,可生成高密度信息图;交互式精准编辑,支持点选、圈选、草图渲染、色彩与材质替换、图层分离及多图融合,实现像素级编辑;真实的影像与人像质感,还原光影、材质与皮肤肌理;原生多语种输入与生成,支持十余种语言及本地化视觉特征。已陆续在豆包、即梦、火山方舟等平台上线。

另有 1 家信源报道IT之家(RSS)
推荐理由:字节这次发布的 Seedream 5.0 Pro 把图像生成从「画得好看」推进到「能输出信息图、能精准编辑」的实用设计工具,尤其复杂信息图和交互编辑是当前竞品明显短板,做设计的值得立刻试试。
16:08
The Decoder:AI News(RSS)精选
AI 评分 74/100
OpenAI GPT-5.6 周四发布,此前因美国政府强制延迟

OpenAI GPT-5.6 模型于周四发布。该模型6月底亮相,最初因美国政府限制仅向部分合作伙伴提供,商务部在AI标准与创新中心完成额外测试后批准公开。OpenAI公开批评延迟,称将最佳工具与开发者及企业隔离。新模型Sol在TerminalBench 2.1得分88.8%,Sol Ultra达91.9%,高于Anthropic的Claude Mythos 5(88%)。在网络安全任务中,Sol与Mythos 5水平相当但仅用三分之一的token。Sol定价$5/$30每百万输入/输出token,Anthropic的Fable 5为$10/$50。

另有 1 家信源报道X:Charlie Holtz(@charlieholtz)
推荐理由:被美国政府按了暂停键的 GPT-5.6 终于要公开了,基准测试小胜 Claude Mythos 5 且 token 消耗仅三分之一,价格也比 Anthropic 便宜近半,开发者可以准备预算了。
12:13
Greg Brockman@gdb精选
AI 评分 67/100
GPT-5.6 Sol 系列本周四发布Sol is rising. It’s a good model.GPT-5.6 Sol 与 Terra、Luna 将于本周四公开发布。目前正面向全球扩展预览访问权限。Sol 正在升起,是个好模型。

OpenAI: GPT-5.6 Sol, along with Terra and Luna, will launch publicly this Thursday. We’re expanding preview access globally now.


推荐理由:OpenAI的新模型Sol周四上线,虽然信息不多,但任何来自他们的模型更新都值得所有做AI产品的人盯紧机会。
11:24
MarkTechPost(RSS)精选
AI 评分 71/100
蚂蚁集团旗下Robbyant开源LingBot-Vision:1B参数边界中心视觉基础模型,用于密集空间感知

蚂蚁集团旗下具身智能公司Robbyant开源LingBot-Vision,一套自监督视觉Transformer家族,专为密集空间感知设计。旗舰ViT-g/16参数约1.1B,采用掩膜边界建模训练,将边界作为原生预训练信号。在密集空间任务中,该1B模型匹配或超越参数规模高达7倍的大模型(如7B DINOv3)。模型以Apache-2.0许可证在Hugging Face开源,提供ViT-g、ViT-L(300M)、ViT-B(86M)、ViT-S四个规模。

另有 1 家信源报道X:karminski (@karminski3)
推荐理由:在视觉基础模型里把边界当作核心信号,这个思路很反常识,1B模型在深度估计上超过7B的DINOv3,做机器人的可以认真看看。
10:18
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 72/100
Nemotron-Labs-Diffusion:统一自回归、扩散与自我推测解码的三模式语言模型

Nemotron-Labs-Diffusion 是一种三模式语言模型,通过联合自回归(AR)和扩散损失训练,在单一架构中统一了 AR、扩散和自我推测解码。研究显示 AR 与扩散目标互补:扩散增强前瞻规划,AR 提供从左至右的语言先验。自我推测模式下,扩散充当草稿模型、AR 负责验证,其接受率和实际设备效率均优于多 token 预测(MTP)。在最优化采样器下,单次前向传播产出 token 数比自我推测最多高 76.5%。该系列包含 3B、8B、14B 参数的基础、指令和视觉语言模型,在准确率和速度上均超越现有开源 AR 和扩散 LM。例如 8B 模型单次前向解码 token 数是 Qwen3-8B 的 6 倍,在 GB200 GPU 上使用 SGLang 运行 SPEED-Bench 时吞吐量提升 4 倍。


推荐理由:NVIDIA 把自回归和扩散塞进同一个模型,吞吐量拉高 4 倍,做实时应用的团队可以开始换架构了。
09:43
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
Pulpie:用于清理网络的Pareto最优模型

Pulpie是一族Pareto最优模型,用于从HTML页面提取主要内容。其最小模型pulpie-orange-small(210M参数)在WebMainBench上取得0.862的ROUGE-5 F1分数,接近600M参数的Dripper(0.864),但成本仅1/20。在NVIDIA L4 GPU上,Pulpie处理速度13.7页/秒,Dripper仅0.68页/秒。清理10亿页HTML,Pulpie成本约$7,900,Dripper需$159,000。模型采用编码器架构,单次前向传播即可标记每个HTML块为内容或模板,已在HuggingFace开源。


推荐理由:做网页清洗的同行该更新工具了,Pulpie 以二十分之一的成本追平 SOTA 质量,而且开箱即用,是今年数据管线里最值得换的组件之一。
03:58
AI at Meta@AIatMeta精选
AI 评分 75/100
Meta Superintelligence Labs 推出 Muse Image 和 Muse VideoIntroducing Muse Image and Muse Video, the first media generation models developed by Meta Superintelligence Labs.Muse Image is our most advanced image generation model yet. It follows instructions faithfully, edits with precision, composes from multiple references, and draws on Instagram for social context. It also brings agentic tool use capabilities to image generation and integrates with Muse Spark.You can try Muse Image in the Meta AI app and web, as well as in Instagram Stories and WhatsApp – starting in limited countries with more locations on the way.Today we’re also previewing Muse Video, which is built upon the same pretraining base as Muse Image to deliver exceptional visual fidelity with native audio support.Learn more about both models: https://go.meta.me/7f4427Meta Superintelligence Labs 发布首个媒体生成模型 Muse Image 和 Muse Video。Muse Image 是目前最先进的图像生成模型,能精确遵循指令、精准编辑、多参考构图,并利用 Instagram 社交上下文。它还具备智能体工具使用能力并集成 Muse Spark。用户可通过 Meta AI 应用、网页、Instagram Stories 和 WhatsApp 试用,初始限于部分国家。Muse Video 基于相同预训练基础,实现高视觉保真度并原生支持音频。
另有 6 家信源报道X:AI at Meta (@AIatMeta)The Decoder:AI News(RSS)X:Testing Catalog (@testingcatalog)The Verge:AI(RSS)IT之家(RSS)TechCrunch:AI(RSS)
推荐理由:Meta 超级智能实验室的首个媒体生成模型,把图像生成跟 Instagram 社交语境结合听起来很实用,但细节还少,期待后续实测。

7月6日7月6日周一

星期一 · 4 条
15:20
公众号:腾讯混元精选
AI 评分 70/100
腾讯混元 Hy3 正式发布:智能体与产品体验显著提升

腾讯混元发布 Hy3,在推理、智能体、长上下文等任务上显著进步,比肩 2~5 倍参数规模旗舰模型。内部盲测均分 2.67/4,优于 GLM5.1(2.51/4)。幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%,多轮问题率降至 7.9%,MRCR 从 42.9% 升至 75.1%。任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。API 价格为输入 1 元、输出 4 元(每百万 tokens),命中缓存 0.25 元。已以 Apache 2.0 协议在 GitHub、HuggingFace 等平台开源。

另有 1 家信源报道X:腾讯混元 (@TencentHunyuan)
推荐理由:腾讯混元 Hy3 不堆参数,靠 agent 能力和产品实测说话,幻觉率减半、多轮问题率大降,开源+降价让开发者能直接上手,是国内大模型里少见的产品导向发布。
15:11
公众号:腾讯混元精选
AI 评分 85/100
腾讯混元正式发布 Hy3,Agent 能力与产品体验跃升

腾讯混元正式发布 Hy3,在推理、智能体、长上下文等任务上比肩参数规模 2~5 倍的旗舰模型。内部盲测中 Hy3 均分 2.67/4,优于 GLM5.1 的 2.51/4;幻觉率从 12.5% 降至 5.4%,任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。


推荐理由:Hy3 用 8 个业务线的实测数值(幻觉率从 12.5% 降至 5.4%,任务解决率从 72% 升至 90%)说明模型从榜单到生产可用的差距具体落在哪里。
14:20
公众号:通义实验室(千问)精选
AI 评分 73/100
Fun-ASR-Realtime 发布:单模型支持30种语言与16种方言,识别准确率领先

通义实验室发布Fun-ASR-Realtime实时语音识别模型。单模型覆盖30种语言及16种方言,针对东亚、东南亚地区重点优化。在工业级方言测评inhouse上取得87.8%的语义准确率,大幅领先,多地方言接近人工水平。引入上下文理解与动态热词注入,实现同音词、品牌名等语义消歧。流式识别首字延迟控制在百毫秒级,准确率接近离线水平,支持多语言无缝切换。API已上线阿里云百炼平台。

另有 1 家信源报道IT之家(RSS)
推荐理由:Fun-ASR Realtime把多语言方言和流式一体化做得很扎实,特别是对东亚东南亚的优化,准确率提升明显,做语音应用的产品人可以直接关注。
14:09
公众号:通义实验室(千问)精选
AI 评分 65/100
Fun-ASR-Realtime 发布:单模型支持 30 种语言与 16 种方言,流式识别准确率接近离线水平

通义实验室发布 Fun-ASR-Realtime,单模型支持 30 种语言和 16 种方言,在工业级方言测评 inhouse 上取得 87.8% 的语义准确率。该模型支持动态注入热词与对话上下文实现语义消歧,首字延迟控制在百毫秒级别,流式识别准确率接近离线水平,并支持多语言无缝切换。API 现已上线阿里云百炼平台。


推荐理由:多语言方言的流式识别将语音交互的可用边界从英语推向了东亚与方言市场,使原先因识别不准而难以落地的本地化客服、语音助手等应用获得了新的技术基础。

7月5日7月5日周日

星期日 · 1 条
22:21
Meituan LongCat@Meituan_LongCat精选
AI 评分 81/100
美团 LongCat-2.0 完全开源(MIT 许可),1.6T MoE 模型开放权重与推理代码🐱 LongCat-2.0 is now fully open-source — MIT licensed, no restrictions.Since our launch a few days ago, the response from the community has been incredible. Thank you for all the feedback, discussions, and interest.Today, we’re releasing the model weights and inference code to everyone. ◆ 1.6T MoE · ~48B active · 1M token context ◆ Agent-native: Integrates directly with Claude Code, OpenClaw, and Hermes Agent ◆ Deployment: Support both GPU and NPU platforms— verified on large-scale domestic clusters📑 Tech Blog: https://longcat.ai/blog/longcat-2.0/ 🤗 HuggingFace: https://huggingface.co/meituan-longcat/LongCat-2.0 💻 GitHub: https://github.com/meituan-longcat/LongCat-2.0 🪄 ModelScope: https://modelscope.ai/collections/meituan-longcat/LongCat-20 👇 Inference Code GPU: https://github.com/sgl-project/sglang/pull/30042 NPU: https://github.com/meituan-longcat/SGLang-FluentLLM/tree/npu美团今日宣布 LongCat-2.0 完全开源(MIT 许可),公开模型权重与推理代码。该模型为 MoE 架构,总参数量 1.6T,每 token 激活约 48B,支持 1M token 上下文。技术亮点包括 LongCat Sparse Attention 高效处理长文本、Zero-Compute Experts 动态激活 33B-56B 零浪费计算、MOPD 按任务路由 Agent/Reasoning/Interaction 三组专家。Benchmark 成绩:Terminal-Bench 2.1 70.8;SWE-bench Pro 59.5(超越 GPT-5.5 的 58.6);SWE-bench Multilingual 77.3;FORTE 73.2;RWSearch 78.8;BrowseComp 79.9。原生集成 Claude Code、OpenClaw、Hermes Agent 等工具,支持 GPU 与 NPU 部署,已在大规模国内集群验证。

Meituan LongCat: 推出 LongCat-2.0 🐱 1.6T 参数 · MoE 架构,约 48B 活跃参数 · 1M 上下文窗口 这是 @OpenRouter 上 Owl Alpha 背后的完整模型--现已可用。 从零开始为智能体编程构建: ◆ LongC...

另有 1 家信源报道MarkTechPost(RSS)
推荐理由:国内大厂首个在 SWE-bench Pro 上超过 GPT-5.5 的开源模型,MIT 协议无任何限制,搞 agentic coding 的团队可以直接用,是个重要转折。

7月3日7月3日周五

星期五 · 2 条
23:46
公众号:生数科技(Vidu·视频)精选
AI 评分 70/100
生数科技发布 Vidu S1,推动视频生成迈向"实时交互"新时代

7月3日,生数科技在2026全球数字经济大会上发布Vidu S1实时交互模型,支持实时视频通话和语音控制视频走向,实现无限时长连续互动。模型采用自回归扩散路线,基于已生成画面和语音指令持续预测后续内容;无需传统建模,一张图片即可创建角色并自定义音色。Vidu S1在540P分辨率下实现25FPS(最高42FPS)实时生成,通过TurboDiffusion等技术降低计算成本,已开启内测。

另有 1 家信源报道HuggingFace Daily Papers(社区热门论文)
推荐理由:Vidu S1 把视频生成从离线拉到了实时通话级交互,语音控制无限时长是质变,但只有540P,内测阶段实际延迟和稳定性待看,做虚拟陪伴和直播的可以跟。
23:19
Mistral AI:News(网页)精选
AI 评分 66/100
Leanstral 1.5:人人可用的证明丰富性

Mistral AI 今日发布 Leanstral 1.5,一款 Apache-2.0 许可的开源形式化验证模型,119B 总参数仅 6B 活跃。在 miniF2F 上达 100% 饱和,PutnamBench 解决 587/672 题,FATE-H(87%)和 FATE-X(34%)创 SOTA。训练经历 mid-training、SFT 和基于 CISPO 的强化学习。具备智能体式证明能力,在 57 个开源仓库中发现 5 个未知 bug。模型已通过 HuggingFace 和免费 API 开放使用。

另有 1 家信源报道Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:Leanstral 1.5饱和miniF2F基准,成本仅为同类模型1/75,并自动发现5个真实代码bug,表明AI形式验证开始实用化。虽然受众窄,但对代码正确性有执念的开发者必看。

7月2日7月2日周四

星期四 · 1 条
10:32
腾讯混元:Research(API)精选
AI 评分 69/100
腾讯混元正式发布Hy3模型

腾讯混元于7月6日正式发布Hy3模型。相比preview版,任务解决率从72%升至90%,平均耗时缩短34%;幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%,多轮问题率从17.4%降至7.9%,长对话基准MRCR从42.9%升至75.1%。在270位专家盲测中均分2.67/4,优于GLM5.1的2.51/4。API价格为输入1元/百万tokens、输出4元、缓存命中0.25元。模型已基于Apache 2.0协议开源。


推荐理由:腾讯混元重建后的正式版,幻觉率砍半,工具调用稳定性大幅提升,内部盲测压过GLM5.1。做Agent和内部工具的团队值得重新评估这个高性价比选项。

7月1日7月1日周三

星期三 · 4 条
16:32
MarkTechPost(RSS)精选
AI 评分 73/100
NVIDIA 发布 Nemotron-Labs-TwoTower 开放权重扩散语言模型

NVIDIA 发布 Nemotron-Labs-TwoTower,基于冻结的自回归骨干 Nemotron-3-Nano-30B-A3B 的扩散语言模型。采用双塔架构:上下文塔冻结,降噪器塔训练,通过层对齐交叉注意力和状态播种协作。在 2×H100 上 BF16 评估,保留 98.7% 的 AR 基线质量,生成吞吐量提升 2.42 倍(γ=0.8,块大小 S=16)。降噪器在约 2.1T token 上训练,骨干使用 25T token 预训练。总参数约 60B,每 token 活跃参数约 3B/塔。支持扩散、模拟 AR 和 AR 三种解码模式。


推荐理由:NVIDIA这个TwoTower把扩散解码接在已有的AR骨干上,几乎无损质量却让吞吐翻倍,并且开源可商用,对批量文本生成的团队是实在的加速工具。
11:33
Anthropic:Newsroom(网页)精选
AI 评分 71/100
重新部署 Claude Fable 5

美国政府6月12日对Claude Fable 5和Mythos 5实施出口管制,Anthropic暂停其所有用户访问。6月30日管制解除。7月1日起Fable 5在全球平台重新上线,Pro、Max、Team及部分Enterprise计划用户在7月7日前可享每周50%额度,之后按点数计费。Mythos 5已恢复部分美国组织访问。此前Amazon研究人员发现绕过Fable 5安全措施的方法,Anthropic训练新分类器,将该技术阻挡率提升至99%以上,但可能增加良性请求误报。Anthropic正与Amazon、Microsoft、Google等合作开发行业漏洞评估框架。


推荐理由:Fable 5重新上线只是表面,真正重要的是Anthropic借机提出了一套行业通用的jailbreak严重性框架,并拉上亚马逊、微软、谷歌,这可能会成为前沿模型发布的新安全标杆。
10:24
公众号:龙猫LongCat(美团)精选
AI 评分 78/100
美团发布 LongCat-2.0:五万卡国产算力集群训练与推理的万亿参数开源模型

美团6月30日发布并开源万亿参数大模型 LongCat-2.0,总参数1.6T、平均激活约48B,为业界首个在五万卡国产算力集群上完成全流程训练与推理的模型,原生支持1M超长上下文。

另有 1 家信源报道公众号:龙猫LongCat(美团)
推荐理由:在五万卡国产算力集群上稳定训练万亿参数 MoE 并达到前沿编程能力的工程实践,为算力受限场景下的模型架构设计提供了可参照的技术路线。
02:48
Claude Code:GitHub Releases(RSS)精选
AI 评分 81/100
Claude Code v2.1.197 发布:默认模型升级为 Claude Sonnet 5,支持原生 1M-token 上下文窗口

Claude Code v2.1.197 更新将 Claude Sonnet 5 设为默认模型,原生支持 1M-token 上下文窗口。该版本提供促销定价,输入 $2/M tokens、输出 $10/M tokens,持续至 8 月 31 日。用户更新至 v2.1.197 即可启用。


推荐理由:Sonnet 5 把中端模型的上下文干到 1M token,促销价让 Claude Code 性价比突然很能打,用 Claude 写代码的可以无脑升了。