阿里发布 Qwen-UI-Agent,主打让模型真正“会用”每一块屏幕
阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。
推荐理由:它把 GUI 智能体评测从模拟分数推向真实手机操作,自建 MobileWorld-Real 基准和百台真机环境,使落地型团队能按真机成功率而非仅看模拟榜单做选型。
阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。
推荐理由:它把 GUI 智能体评测从模拟分数推向真实手机操作,自建 MobileWorld-Real 基准和百台真机环境,使落地型团队能按真机成功率而非仅看模拟榜单做选型。
微软发布升级版编程模型 MAI-Code-1.1-Flash,在 Terminal-Bench 2.1 测试中表现提升 22%,.NET 相关任务提升 15%,Token 生成速度提升 25%,完成相同任务所需 Token 减少 25%。
我们最新的代码模型比6月发布的模型效率提升25%,质量更高,成本仅为四分之一。现已上线GitHub Copilot——欢迎试用。
小米技术宣布具身基座模型 Xiaomi-Robotics-1 正式开源。该模型基于超过 10 万小时 UMI 数据进行预训练,并使用超过 1 万小时跨本体数据进行后训练。本次开源覆盖从真机后训练到模型部署的完整流程,并提供相关 Benchmark 的评测代码。
📢Meet Qwen3.8-Max — our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!🎉 Qwen3.8-Max, a new bar for coding and cowork at 2.4T parameters: - Autonomous coding: 10+ days of self-evolving development, from empty folder to production without hand-holding, complete project trace in the GitHub:https://github.com/qwen-code-dev-bot/oh-my-cli - Real work, real results: Production-quality deliverables across hundreds of professions. - Long-horizon mastery: System-level autonomous planning with closed-loop adaptive learning, driving 500+ turns of chip design optimization and 365 days of e-commerce strategy. - Native multimodal intelligence: Vision isn't just input — it's a continuous feedback loop for planning, execution, and self-correction. 💰Pricing: Input: $2.0 / M tokens Output: $6.0 / M tokens Implicit Caching: $0.25 / M tokens Start building with Qwen3.8-Max! 🚀 📖 Blog: https://qwen.ai/blog?id=qwen3.8 ✅ Qwen Studio: https://chat.qwen.ai/?models=qwen3.8-max ⚡ API: https://www.qwencloud.com/models/qwen3.8-max
Feyn Labs 推出 FeyNoBg,一个用于自动背景去除的 SOTA 模型。它在八个基准测试中的四项上取得最佳 S-measure 分数,其余四项与领先者差距在 2% 以内。该模型基于 BiRefNet 架构,参数量从 222M 扩展至 263M,同时开源了训练库 NoBg,模型和代码分别可在 Hugging Face 和 GitHub 获取。
推荐理由:FeyNoBg 在多个背景去除基准上达到或接近最佳,还开源了训练库,做图像处理的产品可以直接集成,是个实在的工具发布。
月之暗面发布 2.8 万亿参数的混合专家模型 Kimi K3,支持原生视觉理解和 100 万 token 上下文窗口。其规模化效率较 Kimi K2.5 提升 2.5 倍,并同步开源模型权重、技术报告及 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。
推荐理由:Kimi K3 的完全开放是一个明确信号,月之暗面把最核心的模型权重和技术细节全部公开,国内开发者从此有了媲美国际顶尖开源的底座。虽然部署门槛不低,但开放本身推动了生态发展。
Moonshot AI 发布了 Kimi K3 的模型权重与技术报告,并在 Hugging Face 上开源了高性能注意力内核、MoE 通信库等基础设施组件。新架构声称每单位算力的智能度提升 2.5 倍。该模型在基准测试中接近 Fable 5 和 GPT-5.6 Sol 等西方前沿模型,但英国网络研究所的独立测试显示其网络能力和数学技能仍落后于前沿模型。
上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。
推荐理由:一个模型同时理解蛋白质、气象和医学影像,还全开放权重和代码,对交叉学科的研究者是难得的工具包。比专用模型省去切换成本,值得科学计算方向的产品人关注。
推荐理由:商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。
腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。在 OmniDocBench v1.6 上以 94.74 分居端到端第一。
推荐理由:我觉得这是近期最实在的OCR开源,1B参数覆盖多任务、推理加速6倍,还支持llama.cpp本地部署,做文档解析的同学可以直接上车。
腾讯混元开源端到端 OCR 大模型 HyOCR-1.5,仅 1B 参数覆盖 8 种以上 text-centric 任务,在 OmniDocBench v1.6 上以 94.74 分居端到端第一。
推荐理由:轻量端到端OCR的实用化一步,投机解码让长文档生成加速可落地,智能体数据闭环提示了用短板驱动自进化的可复用路径。
蚂蚁集团具身智能团队 Robbyant 发布 LingBot-World-Infinity(LingBot-World 2.0),一个因果视频生成模型,可作为交互式世界模拟器运行。该模型通过 MoBA 注意力机制和 DMD 自 rollout 训练,解决长程漂移和交互延迟问题。模型采用因果分解架构,每帧仅依赖过去帧和当前动作输入。团队同时发布 14B 参数开源 checkpoint,采用 CC BY-NC-SA 4.0 许可。公开推理脚本在 8 张 GPU 上运行 480×832 分辨率;部署版流式输出可达 60 fps,经 TensorRT 引擎编译。
美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。
推荐理由:国产算力跑万亿模型的第一份完整开源答卷,代码、芯片适配细节全公开,做国产大模型落地的直接抄作业。
腾讯混元发布 Hy3,在推理、智能体、长上下文等任务上显著进步,比肩 2~5 倍参数规模旗舰模型。内部盲测均分 2.67/4,优于 GLM5.1(2.51/4)。幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%,多轮问题率降至 7.9%,MRCR 从 42.9% 升至 75.1%。任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。API 价格为输入 1 元、输出 4 元(每百万 tokens),命中缓存 0.25 元。已以 Apache 2.0 协议在 GitHub、HuggingFace 等平台开源。
推荐理由:腾讯混元 Hy3 不堆参数,靠 agent 能力和产品实测说话,幻觉率减半、多轮问题率大降,开源+降价让开发者能直接上手,是国内大模型里少见的产品导向发布。
推荐理由:单张 RTX 5090 上 1.8 秒生成 5 秒视频,把消费级延迟压到了‘即时生成’的临界点,做短视频和互动应用的开发者可以认真把这个模型放进技术栈。
网易有道推出“子曰 4.0”TTS 引擎 Confucius4-TTS,声称是业内首个支持 14 种语言跨语种无口音、且无需参考文本即可完成语音克隆的开源模型。用户仅需 3 秒音频即可实现零样本音色克隆,克隆音色与原声相似度超 85%,任务准确度达 97%。模型支持中文、英语等 14 种语言,首创音频 Prompt 情感克隆迁移。底层采用 GPT 式语义大模型、SSL 预训练特征与 ECAPA-TDNN 说话人编码器、Flow Matching 框架。已全量开源(Apache 协议),提供 54GB 资源包供本地部署。
推荐理由:网易有道把语音克隆的门槛压到了 3 秒,跨 14 种语言还能保持无口音,而且全量开源、商用无限制,对多语种配音和短剧出海是直接可用的工具。
UniverSat是一种基于Vision Transformer的骨干网络,采用通用补丁编码器(Universal Patch Encoder),将来自任意空间、光谱和时间分辨率以及光学和非光学传感器的补丁映射到共享嵌入空间,使用共享权重。这使得单个模型能够在异构多模态数据集上通过自监督训练,生成鲁棒的传感器无关空间特征。在GeoBench、PANGEABench和SpectralEarth等标准地球观测基准的分类和分割任务中,取得了强劲结果。代码和模型已开源。
6月3日,京东开源JoyAI-Echo框架,解决长视频生成中角色身份崩坏、音色突变和生成缓慢三大难题。该框架通过跨模态音视频记忆库保持5分钟内角色外观与音色一致,记忆驱动后训练结合DMD技术带来约7.5倍推理加速。新增Director Agent支持自然语言对话式局部修订,无需重跑整条视频。配套轻量化实时超分模块,支持736×1280→1152×1920及1472×2560两档分辨率。评测集显示,语音内容准确率0.8646,用户偏好多项领先。代码与权重已开源至GitHub。
推荐理由:长视频生成一直被角色崩塌和龟速生成卡死,JoyAI-Echo 开源给出了角色一致性方案和 7.5 倍加速,Director Agent 对话式编辑的思路很先进,做 AI 视频的朋友可以直接去 GitHub 开跑。
推荐理由:商汤把理解、推理、创作塞进一个模型,而且直接开源,做视觉营销的可以不用再拼凑工具链了。
推荐理由:大部分AI生成的图表都有标注错误或比例失调,商汤这个模型专攻信息图准确性,对常做图表的产品人和分析师来说值得一试。
推荐理由:商汤把新模型U1的ComfyUI部署流程完整放出,还有实测视频,想在自己机器上跑国产图像模型的开发者可以直接抄作业了。
小米AI实验室开源多语言语音克隆TTS模型OmniVoice,覆盖600余种语言。该模型采用极简双向Transformer架构,无需复杂结构即可实现文本到语音的直接转换。其语音合成质量超越同类主流模型,训练速度可达一天10万小时。关键设计包括全码本随机掩蔽策略和引入大语言模型预训练参数,显著提升训练效率与语音可懂度。测试显示,在多种语言中其相似度与可懂度超越多款商用系统,并对低资源小语种也能实现高质量合成。模型还支持自定义音色、带噪音频适配等实用功能。
小红书基础模型 FireRed-Image-Edit 在 GitHub 上正式亮相,该模型专注于图像编辑任务,并达到新的最佳性能(新 SOTA)。