精选归档 · 第 18 页

341360 条 · 共 709

6月16日6月16日周二

星期二 · 1 条
09:59
Berkeley RDI:Blog(AI 安全与评测)精选
AI 评分 83/100
伯克利RDI发布Agents' Last Exam基准

2026年6月,伯克利RDI发布Agents’ Last Exam(ALE)基准,包含1,500余项源于真实工作的任务,覆盖55个非体力职业。对Fable 5、GPT-5.5、Composer 2.5等前沿智能体的测评显示:在最困难层级成功率均为0%;整体任务表现接近,但单任务成本差异巨大(Fable 5约$15.70,GPT-5.5约$3.80,Composer 2.5约$1.33)。CLI子集ALE-CLI最佳通过率仅25.2%。主要失败模式是智能体未验证输出即宣称完成。数据集、代码及CLI子集已开源。


推荐理由:在Fable 5发布后,Berkeley的ALE基准首次大规模量化了agent在专业任务上的真实水平,最难任务0%成功率的结果值得所有押注agent落地的团队冷静下来。

6月15日6月15日周一

星期一 · 3 条
22:40
公众号:MiniMax(稀宇科技)精选
AI 评分 72/100
MiniMax 开源原生多模态旗舰模型 M3,总参数 428B

MiniMax 上周五开源 M3 模型权重,并发布 MSA 稀疏注意力技术论文。M3 总参数 428B、激活参数 23B,是首个从 Step 0 进行多模态混合训练的开源模型,发布两周即在 Artificial Analysis 综合智能指数上位列全球开源模型第一。目前输出速度已从约 30 TPS 提升至约 80 TPS,官方称还将继续提速 30-40%。


推荐理由:MSA 注意力机制让长上下文计算成本大幅下降,对于在长文档处理或复杂推理场景下需要控制成本的团队,M3 的开源提供了一种新的选型依据。
17:41
MarkTechPost(RSS)精选
AI 评分 73/100
Flash-KMeans:IO感知的精确K-Means,在GPU上比FAISS快200倍以上

UC Berkeley与UT Austin团队开源Flash-KMeans(Apache 2.0,pip install flash-kmeans),精确实现标准Lloyd's k-Means,通过重构GPU数据流而非改变数学或近似来提速。在NVIDIA H200上,端到端速度比最佳基线快17.9×,比cuML快33×,比FAISS快200×以上。其FlashAssign核避免物化完整N×K距离矩阵,将IO复杂度从O(NK)降至O(Nd+Kd),单核加速最高21.2×;Sort-Inverse Update核通过排序聚类ID减少原子争用,单核加速最高6.3×。支持out-of-core处理,在1B数据点、K=32768时单次迭代仅41.4s。适用于向量搜索索引、稀疏注意力路由、KV缓存压缩等在线场景。


推荐理由:Flash-KMeans 把 k-means 从离线预处理拉进了在线循环,200 倍加速不是纸面数字,而是让向量索引重建、稀疏注意力路由这些场景突然可行了。做大规模聚类的可以立刻换掉 FAISS。
01:59
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 72/100
里约热内卢市政府 AI 模型 Rio3.5 在基准测试中击败 Qwen3.7

里约热内卢市政府开发的 AI 模型 Rio3.5,在近期基准测试中超越了 Qwen3.7。该消息源自 Hacker News 上的一篇帖子,指出 Rio3.5 在多项评测中表现优于 Qwen3.7。目前尚未公开具体的测试细节或基准名称。


推荐理由:一个市政府 IT 部门训练的模型在基准测试中击败了 Qwen3.7,这让人重新审视谁在参与前沿模型竞争。如果结果可复现,可能是今年最意外的黑马。

6月14日6月14日周日

星期日 · 1 条
02:24
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
Paca:一款适用于人机协作的轻量级 Jira 替代方案

Paca 是一款面向人类与 AI 智能体协作场景的轻量级项目管理工具,旨在替代 Jira。项目已开源并托管于 GitHub,支持团队通过直观界面协同管理任务,特别针对 AI 参与工作流进行了优化。


推荐理由:Paca 的理念值得关注——让 AI 代理以正式成员身份加入 Scrum,而非作为外部自动化,但产品成熟度有限,适合早期尝鲜者。

6月13日6月13日周六

星期六 · 5 条
17:54
公众号:智谱(GLM)精选
AI 评分 70/100
智谱 GLM-5.2 全量开放,支持 1M 上下文且下周开源

GLM-5.2 是智谱迄今能力最强的开源模型,支持真正可用的 1M 上下文,在长程任务中继续保持领先,并被智谱称为最强的国产 Coding 模型。今晚 5:21 起面向 GLM Coding Plan 全量用户开放(覆盖 Lite、Pro、Max、团队版)。API 将于下周上线,模型下周正式开源,遵循 MIT 协议。


推荐理由:智谱把最强大模型全量开放且开源,这事本身就在打脸那些收回权限的闭源模型,做中文编码的开发者可以认真看看。
14:19
公众号:智谱(GLM)精选
AI 评分 70/100
GLM-5.2 全量开放:智谱最强开源模型支持 1M 上下文

智谱发布迄今能力最强的开源模型 GLM-5.2,支持真正可用的 1M 上下文,并在长程任务中继续保持领先,同时也是其最强的国产 Coding 模型。今晚 5:21,GLM-5.2 将面向 GLM Coding Plan 全量用户开放,覆盖 Lite / Pro / Max / 团队版。GLM-5.2 API 将于下周上线,模型下周正式开源,遵循 MIT 协议。


推荐理由:GLM-5.2 的 MIT 开源意味着企业可无授权顾虑地基此构建编码工具,若长程能力兑现,可能重塑国产代码助手的成本边界。
04:49
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
如何在macOS上设置本地编码代理

来自ikyle.me的教程,指导在macOS上搭建本地编码代理,获Hacker News社区104个点赞。


推荐理由:这篇文章不是泛泛的「本地跑大模型」,而是给 Mac 开发者一个实测过的、能打的生产环境编码代理方案,尤其 MTP 加速让速度不再鸡肋,可以直接抄作业。
00:00
Hugging Face:Blog(RSS)精选
AI 评分 74/100
olmo-eval:面向模型开发循环的评估工作台

olmo-eval 是基于 OLMES 标准构建的评估工作台,专为 LLM 持续开发中的反复评测场景设计。相比 OLMES,它减少了新增评测的实现工作量,支持 agentic 和多轮评测作为一等用例,并允许根据基准需求选择轻量直接运行或容器化隔离运行。采用模块化架构,模型、工具、容器环境、辅助模型均可独立替换。评测结果同时报告分数、标准误差和最小可检测效应。与 Harbor 侧重于发布不同,olmo-eval 聚焦开发阶段快速迭代,可逐问题对比检查点输出以区分真实改进与噪声。


推荐理由:做模型训练的人会感谢这个工具,它把评估从一次性打分变成能持续对比的流程,按题对比两个 checkpoint 的功能很实用,但如果你不训模型,这篇可以跳过。

6月12日6月12日周五

星期五 · 7 条
14:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 77/100
MiniMax Sparse Attention(MSA)块状稀疏注意力

MiniMax 提出块状稀疏注意力 MSA,基于 GQA 构建。轻量级 Index Branch 为每个 GQA 组独立选择 Top‑k KV 块,Main Branch 仅对选中块执行精确块稀疏注意力。在 109B 参数多模态模型上,MSA 与 GQA 性能持平,1M 上下文下每 token 注意力计算减少 28.4 倍。配合协同设计的 GPU 内核,H800 上实现 14.2 倍 prefill 和 7.6 倍 decoding 端到端加速。推理内核与基于 MSA 的多模态模型已公开发布。


推荐理由:MiniMax这个稀疏注意力把长上下文推理计算砍掉28倍,而且直接开源了高效CUDA kernel和模型,做agent和代码仓库级推理的团队可以赶紧试试。
11:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
EurekAgent:环境工程化实现自主科学发现

EurekAgent 是一个环境工程化的大语言模型智能体系统,专为度量驱动的自主科学发现设计。它从权限工程(可控执行与隔离评估)、产物工程(文件系统与 Git 协作)、预算工程(成本感知探索)和人在回路工程(简便监督干预)四个维度构建执行环境。EurekAgent 在数学、内核工程和机器学习任务上取得新 SOTA,包括以不到 11 美元总 API 成本发现新的 26 圆填充结果。代码与结果已开源。


推荐理由:EurekAgent 把科学发现的目光从设计智能体流程转向环境工程,用不到 11 美元就找到了新的圆打包纪录,这可能是低成本自主科研的转折点。
08:00
vLLM 官方博客(RSS)精选
AI 评分 69/100
vLLM 发布 MiniMax M3 Day-0 支持:1M 上下文多模态推理

vLLM 宣布对 MiniMax M3 的 day-0 支持,覆盖 BF16 与 MXFP8 检查点,支持 1M-token 上下文、原生图像视频输入、minimax_m3 工具与推理解析器、EAGLE3 推测解码(草稿模型 Inferact/MiniMax-M3-EAGLE3)以及 TP/EP 部署和 Docker 镜像。


推荐理由:官方团队拆解了 MSA 稀疏注意力、MXFP8 MoE 与 EAGLE3 在推理引擎中的落地细节,部署者可以照此选择 NVIDIA 或 AMD 配置并理解瓶颈所在。
08:00
Zyphra Research(网页)精选
AI 评分 71/100
Zyphra 发布开源实时语音克隆模型 ZONOS2

Zyphra 发布 Apache 2.0 许可的实时 TTS 模型 ZONOS2,采用 8B 总参数、900M 激活参数的 MoE 架构,主打高保真零样本语音克隆,权重已上线 Hugging Face。


推荐理由:原文给出架构、训练数据和评测细节,读者可以了解这个开源实时 TTS 模型在音色保真与生成稳定性之间的取舍。
01:17
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 72/100
DeepSeek-R1 的开源实现

DeepSeek-R1 的开源复现项目已在 GitHub 发布,在 Hacker News 上获得 101 个积分。该项目旨在以开源方式复现 DeepSeek-R1 模型。


推荐理由:Hugging Face 把 DeepSeek-R1 的完整训练管线拆解得清清楚楚,从数据蒸馏到 GRPO 强化学习都开源了,还放出了复现的模型和数据集。想理解或自己训练推理模型的开发者,这大概是目前最实用的路线图。
00:17
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 75/100
MiMo Code 现已发布并开源

2026年6月11日,小米旗下 MiMo Code 项目正式发布并开源,相关代码已托管于 mimo.xiaomi.com 供社区访问。


推荐理由:小米下场做 AI 编程工具,直接开源,121 个 HN 点赞说明社区有期待,对标 Cursor 还是自成一路,得看实际体验。

6月11日6月11日周四

星期四 · 3 条
17:31
IT之家(RSS)精选
AI 评分 71/100
阿里云发布 Meoo CLI:本地 AI 编程项目可一键部署上线

阿里云今日推出 Meoo(秒悟)开源命令行工具 Meoo CLI,面向开发者,支持 Claude Code、Codex、Cursor 等本地 AI 编程助手。通过调用阿里云云端能力,可自动完成数据库接入、用户登录、文件存储及项目发布,将本地项目一键部署上线并生成可分享的访问链接。该工具定位为本地 Agent 与秒悟云端能力的连接入口,已开放下载,支持主流 Linux、macOS 及 Windows 平台。


推荐理由:本地AI编程工具产出的项目终于有了一条直通云端的管道,Meoo CLI 把数据库、鉴权、部署这些脏活全包了,非前端也可以把原型直接变成产品。