Microsoft Research 发布 VibeVoice-ASR-Streaming 技术报告,提出基于 LLM 的端到端流式说话人归属 ASR,将音频块、0.5 秒 lookahead 和已有文本交错在单一自回归上下文中,无需独立 diarization 阶段即可随语音到达输出谁说了什么。
PromptArmor 披露 Microsoft Copilot Cowork 一个沙箱绕过漏洞,恶意 Skill 代码可借助沙箱外文件同步服务发起网络请求,与攻击者服务器建立命令控制循环,窃取 Outlook、SharePoint、Teams、插件数据和聊天记录,且用户点击停止按钮也无法中断。
逆向工程显示,MS Paint 和“照片”应用会将服务器下发的 GUID 以不可见方式嵌入本地生成的 AI 图像像素中。该水印由服务器签发,用于追踪图片来源,但用户无法直接察觉其存在。
Thinkingbox 是一个工具-智能体-用户交互沙箱,提供隔离的 MCP 兼容工具会话、完整执行轨迹及终端后端状态结果评估。基于该沙箱构建的 Thinkingbox-bench 包含 507 个策略约束工作流,覆盖零售、酒店、汽车保险等场景;最强模型 pass@1 达 65.36%,但 pass^20 仅 25.25%,显示响应或工具调用级信号无法可靠预测端到端任务完成。
Dion3 针对 Muon 优化器中立方时间 Newton-Schulz 正交化步骤的高开销,在堆栈各层进行优化:Gram Newton-Schulz 算法降低正交化 FLOP 成本,CuteDSL 内核利用对称性加速,megabatching 策略减少通信开销。
Microsoft Research 与 Narayana Health 等合作发布研究模型 CARE-X,一个统一胸部X光 VLM,基于 SigLIP2-so400M 视觉编码器和 Phi-4-mini-instruct(3.8B)。
约翰霍普金斯大学、普林斯顿大学与微软提出全带宽 Transformer,通过门控线性单元将上一解码步的顶层隐藏状态与采样 token 嵌入融合后作为下一输入,使非语言化计算能以完整深度预算重新进入堆栈。
Microsoft 与上海交大、同济、复旦团队提出的 SkillOpt 通过文本空间优化训练单一技能文档,冻结目标模型,使优化后的技能工件可跨模型规模和跨工具链迁移。在 Codex 上优化的 SpreadsheetBench 技能部署到 Claude Code 后得分 81.8,超过后者自行训练技能得到的 80.4。全部 4 项跨模型、4 项跨工具链和 3 项跨基准迁移结果均高于目标的无技能基线。
Echoverse 将环境、任务与验证器绑定为“世界”,通过共演化循环让每次分级运行同时用于修复环境和训练模型。在十二个环境中训练的 9B 模型在十四个评估分项上提升显著,与指导它的更大前沿模型差距在十四分以内。同一世界可直接用作强化学习环境,结合接地验证器与密集逐步评判器的奖励将留出集评分从提升至;研究还发布了四个环境作为基准,含应用、种子数据与评分器。
Microsoft Research 推出 Echoverse,为 computer-use agent 构建了 12 个合成训练世界(10 个深度领域世界和 2 个能力世界),9B 模型训练后在全部环境上平均分从 36.5% 升至 67.1%,与 GPT-5.4(80.7%)相差 14 个点。
微软团队提出 Experiential Learning(EL)框架,将 LLM-as-a-Judge 的评估模型改造为 LLM-as-a-Coach,把对每个 on-policy 响应的文本反馈蒸馏为可迁移的经验知识,并通过 on-policy context distillation 内化到策略参数中。
微软与中国高校团队推出 FinanceComplexQA,一个针对工业级金融文档的开放式生成评测基准,包含 2,026 项深度研究任务,覆盖 1009 份真实金融文档。该基准支持双语、六大场景与七类任务,采用 Agent-as-a-Judge 多指标评估。团队还提出 Finance-LaTeX SKILL 多智能体框架,可自动合成 2,000 份金融文档与 6,000 个问答对,用于扩展基准。