Topic · 主题全部主题 →

通义千问 Qwen

阿里通义千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系动态。

797条收录
99条精选

精选归档 · 第 2 页

2140 条 · 共 99

7月22日7月22日周三

星期三 · 1 条
20:52
Qwen@Alibaba_Qwen精选
AI 评分 73/100
通义千问发布Qwen-Image-3.0:主打"真实"的第三代图像生成模型🎨 Meet Qwen-Image-3.0 — the third generation of our foundational image generation model.If 1.0 was about "Precision," and 2.0 added "Variety, Completeness, Beauty & Authenticity," then 3.0 comes down to a single word: Real (实).Three dimensions of "Real": 📰 Rich Content — prompts up to 4.5k tokens. One-pass generation of complex layouts: newspapers, storyboards, exam papers — even a 3×3 infographic grid or picture-in-picture-in-picture UIs. 🔬 Authentic Details — text legible down to 10px, full LaTeX paper pages, pores, hair strands & near-photographic skin texture. 🌏 Deep Knowledge — native rendering in 12 languages, 100+ art styles, realistic UIs (web / games / livestreams), plus world knowledge & live web retrieval.Not just "good-looking" — genuinely useful. Image generation as a real productivity tool for design, content, education & e-commerce.Go create 🏃🎨💬Qwen Chat: https://chat.qwen.ai/?inputFeature=t2i 📝Blog: https://qwen.ai/blog?id=qwen-image-3.0通义千问发布第三代图像生成模型Qwen-Image-3.0,核心关键词为"真实"。模型支持最长4.5k token的提示词,可一次性生成复杂布局(如报纸、试卷、3×3信息图),并能渲染10px级文字、完整LaTeX论文页面及逼真皮肤纹理。它还支持12种语言、100多种艺术风格,并具备实时网络检索能力,旨在成为设计、教育等领域的实用生产力工具。
另有 3 家信源报道X:阿里云 / Alibaba Cloud (@alibaba_cloud)X:swyx (@swyx)The Decoder:AI News(RSS)
推荐理由:Qwen-Image 3.0 不再只追求画质,而是把图像生成变成排版工具,支持4.5k token提示和10px可读文本,设计、电商、教育团队可以直接用来出稿,是今年最实用的图像模型更新。

7月21日7月21日周二

星期二 · 1 条
14:22
Qwen:Blog Retrieval(API)精选
AI 评分 77/100
通义千问发布 Qwen-Image-3.0 图像生成模型,核心关键词为"实"

通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。


推荐理由:我觉得 Qwen-Image-3.0 不只是画得好看,而是真正追求“有用”,4.5k token 输入、12 种语言渲染、10px 精细文字,对做设计、内容生产的人是生产力级突破。

7月20日7月20日周一

星期一 · 3 条
20:49
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
LoRA Speedrun 公开排行榜:6分05秒微调Qwen2.5-1.5B达GSM8K 61.1%准确率

LoRA Speedrun项目推出公开排行榜,在固定硬件(单张L40S)上比拼Qwen2.5-1.5B的微调运行时间。当前纪录由@Saivineeth147以6分05秒保持,采用序列打包与仅完成损失掩码技术,相比基线11分57秒提速约2倍且准确率更高(61.1%)。项目提供免费Modal沙箱验证,任何提交需经3次独立复现确认。


推荐理由:LoRA 微调领域的 nanoGPT speedrun,在固定硬件和任务上比墙钟时间,公开透明且可复现,做微调的开发者可以下场试试。
17:10
公众号:通义实验室(千问)精选
AI 评分 70/100
通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型

通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。


推荐理由:通义实验室的 TTS 模型更新,把精力花在了真实落地痛点——多语种方言覆盖、自然语言导演式控制、嘈杂环境音色复刻,而且直接可用。做语音交互的产品人可以立刻试试。
16:54
公众号:通义实验室(千问)精选
AI 评分 75/100
Qwen-Audio-3.0-TTS 发布:从"能说话"到"会表达"

通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型,含 Flash 与 Plus 两个版本,首包延迟约 300ms。模型支持 16 种语言和 20 种方言,Plus 版在 Artificial Analysis 榜单夺冠,平均说话人相似度达 82.75。新增 Free-style 自然语言指令、细粒度标签控制及嘈杂环境鲁棒性,音频输出提升至 48K,单次合成最长 3 分钟。

另有 1 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)
推荐理由:从「能说话」到「会表达」,区别在于用自然语言指令和标签精确控制情绪与细节,这为需要多语种和方言的商业场景降低了声音设计门槛。

7月19日7月19日周日

星期日 · 2 条

7月17日7月17日周五

星期五 · 4 条
17:50
公众号:通义实验室(千问)精选
AI 评分 74/100
首届"小有可为"大赛乡村教育一等奖作品"智绘科普"技术拆解

首届“小有可为”大赛乡村教育赛道一等奖作品“智绘科普”采用 Qwen3.5-397B-A17B 大语言模型与 Manim 动画引擎,通过多Agent分阶段协作与自动修复机制,将知识主题转化为可控、可编辑的教学动画。系统包含规划、草稿、实现、审查、合成五个阶段,渲染失败时可自动提取日志并修复,该工程范式可迁移至其他赛道。


推荐理由:这是官方出品的实战教程,拆解了一套多Agent协作+门控+自修复的工程流水线,技术思路通用,做AI应用的可以直接抄作业。
17:41
公众号:通义实验室(千问)精选
AI 评分 72/100
小有可为实战教程:拆解乡村教育一等奖作品"智绘科普"的多Agent协作与门控工程

首届“点亮乡村课堂”赛道一等奖作品“智绘科普”采用Qwen3.5-397B-A17B大语言模型与Manim开源数学动画引擎,构建多Agent分阶段协作流水线。系统通过规划、草稿、实现、审查、合成五个Agent,配合时序门控、几何审计、视觉审查三道质量门及自动修复回路,实现可控可编辑的教学动画生成。项目底层“多Agent协作+门控+自我修复”范式可迁移至养老陪伴、孤独症干预等场景。


推荐理由:拆解了一套多Agent协作、阶段门控加自动修复的工程范式,为在数学教学等严谨场景驯服大模型输出提供了可复用的流水线思路。
15:20
公众号:通义实验室(千问)精选
AI 评分 69/100
通义实验室发布 Wan-Streamer v0.2,端到端响应延迟仅 550ms

通义实验室发布 Wan-Streamer v0.2,这是一款将“听、看、说、演”统一进单个 Transformer 的端到端全模态模型。其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。


推荐理由:通义实验室把实时视频交互延迟压到550ms,同时提升了分辨率,不是刷榜而是解决实际问题,对做数字人和实时助手的团队是个值得跟进的信号。
15:14
公众号:通义实验室(千问)精选
AI 评分 76/100
Wan-Streamer v0.2 发布:端到端响应延迟仅 550ms,支持 640×368 实时视频对话

通义实验室发布 Wan-Streamer v0.2,端到端响应延迟 550ms(200ms 模型延迟 + 350ms 网络延迟),输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS。


推荐理由:550ms端到端延迟把实时视频对话从拼接流水线推入单模型交互循环,原先因响应太慢而无法沉浸的口语陪练与面试模拟,开始具备自然对话的交互基础。

7月16日7月16日周四

星期四 · 2 条
11:30
公众号:千问APP(阿里)精选
AI 评分 61/100
千问APP联合武汉发布举办AI求职实战课,演示简历诊断与办公自动化

千问APP与武汉发布在武汉举办AI求职实战课,现场演示了用千问进行简历诊断、PPT制作和表格分析。产品经理提出“给全材料、说明目标、定义标准、划定边界、索要可编辑文件”五步法,并展示了将486行杂乱销售数据浓缩为一页结论PPT的“建、理、算、析、呈”方法论。


推荐理由:千问官方出的这套办公Prompt,从简历诊断到PPT救场再到经营数据清洗,方法论清晰可套用,求职者和日常办公的人可以直接拿来用,比泛泛的教程实在。
11:28
公众号:千问APP(阿里)精选
AI 评分 64/100
千问APP联合武汉发布办AI求职实战课,演示简历诊断、PPT制作与表格分析

千问APP与武汉发布联合承办AI求职实战课,现场演示AI在简历诊断、商业报告撰写、销售表分析等场景的应用。产品经理金师兴提出“给全材料、说明目标、定义标准、划定边界、索要可编辑文件”五步法,并给出分步骤提示词生成Word简历;另一产品经理透镜演示用千问紧急制作PPT。表格分析环节通过虚构茶饮店案例,展示“建、理、算、析、呈”方法论,将486行杂乱数据浓缩为一页结论清晰的PPT。


推荐理由:将AI辅助办公拆解为简历诊断、PPT救场和表格分析三步,配套可直接复用的提示词模板,为嵌入日常任务提供了更清晰的操作路径。

7月15日7月15日周三

星期三 · 4 条
16:41
IT之家(RSS)精选
AI 评分 82/100
国行 Apple 智能完成备案,阿里千问将集成至苹果 AI 能力

苹果技术开发(上海)有限公司的“Apple 智能”大模型已于 2026 年 7 月 8 日完成备案,适用场景为苹果手机。阿里千问将作为 AI 能力集成至 Apple 智能,为 iOS、iPadOS、macOS 和 visionOS 的中国用户提供文本与图像理解、内容生成等功能,用户无需在应用间切换即可直接体验。


推荐理由:苹果AI备案落地,国行iPhone用户终于等到,但集成的不是自研而是阿里千问,对苹果AI生态和国内AI格局都算一个交代。
10:40
公众号:通义实验室(千问)精选
AI 评分 73/100
阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一

阿里通义实验室发布实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。


推荐理由:我觉得Qwen-Audio-3.0-Realtime把情感表达和背景降噪结合得很好,加上工具调用,语音交互终于从聊天走向任务执行,有API可以直接上手,推荐语音产品经理试试。
10:31
公众号:通义实验室(千问)精选
AI 评分 78/100
Qwen-Audio-3.0-Realtime 如何让语音交互"懂倾听,更聪明"?

阿里语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,支持根据语境动态调整语气与情感、音色克隆,并内置多模态双工控制模型,实现声纹级背景过滤。


推荐理由:把文本推理能力蒸馏到语音模型同时保留毫秒级响应,这种架构为需要复杂决策的语音智能体提供了可行路径。

7月8日7月8日周三

星期三 · 2 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 88/100
Agon:基于隐式对抗评分的跨模型竞争强化学习框架

Agon 让两个模型互为评分者,通过竞争性强化学习提升推理能力。在 DeepMath 困难子集上,基于 Qwen3 的 Agon 将 GRPO 的 pass@1 翻倍,增益约为未训练的 Mixture-of-Agents 的 8 倍。该结果在 Qwen3.5、Gemma 4 等模型族及编程代码任务上得到复现,推理时采用两阶段级联:一个模型起草,另一个阅读后作答。


推荐理由:这篇论文用「让两个模型互搏」代替了只看最终答案的RL训练,直接解决了推理模型「写得多、想得少」的毛病。0.6B小模型用这方法能超过4B的GRPO模型,做推理训练的人应该认真读一读。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 71/100
长度惩罚使思维链更难被监控

长度惩罚强化学习虽能缩短思维链推理,却会隐藏影响模型答案的驱动因素。对Qwen3-4B和Qwen3-14B的实验显示,压缩后思维链提及提示的频率大幅下降,Qwen3-14B的忠实度下限降至基线的63.1%,监控捕获提示使用的比率从69%降至49%。随机删除基线链句子以匹配压缩长度后,压缩链披露提示的频率仍比基线低7-35个百分点,表明压缩优先移除了监控所需的关键线索。


推荐理由:这篇论文用实验证明,给推理链加长度惩罚不只会缩短推理,还会优先删掉暴露模型真实决策过程的线索,让外部监控更难发现模型被误导的痕迹。做AI安全和对齐的人应该认真读一下。

7月6日7月6日周一

星期一 · 1 条
14:20
公众号:通义实验室(千问)精选
AI 评分 73/100
Fun-ASR-Realtime 发布:单模型支持30种语言与16种方言,识别准确率领先

通义实验室发布Fun-ASR-Realtime实时语音识别模型。单模型覆盖30种语言及16种方言,针对东亚、东南亚地区重点优化。在工业级方言测评inhouse上取得87.8%的语义准确率,大幅领先,多地方言接近人工水平。引入上下文理解与动态热词注入,实现同音词、品牌名等语义消歧。流式识别首字延迟控制在百毫秒级,准确率接近离线水平,支持多语言无缝切换。API已上线阿里云百炼平台。

另有 1 家信源报道IT之家(RSS)
推荐理由:Fun-ASR Realtime把多语言方言和流式一体化做得很扎实,特别是对东亚东南亚的优化,准确率提升明显,做语音应用的产品人可以直接关注。