精选归档 · 第 33 页

641648 条 · 共 648

2月10日2月10日周一

星期一 · 1 条
05:05
Sam Altman:Blog(RSS)精选
三点观察

OpenAI 阐述关于 AI 经济学的三点观察:模型智能与训练资源的对数成正比,可预测扩展;AI 使用成本每 12 个月下降约 10 倍,远超摩尔定律速度;智能线性增长将产生超指数级社会经济价值。据此,AI 代理将如虚拟同事般渗透各领域,科学进步将大幅加速,虽然短期内生活照旧,但长期将深刻重塑社会经济结构,个人意志力和适应能力将成为关键价值。


推荐理由:Sam Altman 提出 AI 经济学三大观察,描绘 AGI 时代 Agent 工作图景

1月21日1月21日周二

星期二 · 1 条
20:00
Modal 官方工程博客(RSS)精选
AI 评分 65/100
Modal Sandboxes 正式可用,为不可信代码提供安全执行环境

Modal 宣布 Sandboxes 正式可用,这是安全运行 LLM、用户或第三方来源不可信代码的隔离执行环境。它提供 exec API,可在运行时用与 Functions 相同的 Image API 动态配置任意语言依赖,支持文件系统快照以持久化和多 Sandbox 扇出,并复用 Functions 基础设施带来快速冷启动、GPU 和全球区域选择。


推荐理由:Modal 官方宣布 Sandboxes 正式可用,给出 exec API、动态镜像和 SWE-bench 7 分钟跑完 Verified 等实测数字,可据此评估智能体代码执行方案。

1月6日1月6日周一

星期一 · 1 条
00:00
Anthropic:Engineering(事故复盘 + 工程实践 · 网页)精选
AI 评分 72/100
Claude 3.5 Sonnet 在 SWE-bench Verified 基准测试中刷新纪录

升级版 Claude 3.5 Sonnet 在软件工程评估基准 SWE-bench Verified 上取得 49% 的解决率,超越此前最佳模型的 45%。该基准通过真实 GitHub 问题测试 AI 模型完成软件工程任务的能力,要求模型在给定环境中理解、修改并测试代码,最终通过原始单元测试验证。Claude 团队构建的智能体设计简洁,仅包含提示词、Bash 工具和编辑工具,赋予模型充分的自主判断空间,以灵活步骤解决问题。目前尚无模型在该基准上突破 50% 的解决率。


推荐理由:Anthropic 把自家 SWE-bench agent 的 prompt、工具设计和踩坑经验全公开了,做 coding agent 的人可以直接抄作业,比看十篇二手解读都管用。

12月10日12月10日周二

星期二 · 1 条
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 73/100
Cognition 宣布 Devin 正式全面开放使用

Cognition 宣布 Devin 正式全面可用,无席位限制,所有工程团队可在 app.devin.ai 开始使用,并提供 Slack 集成、IDE 扩展(VSCode 及分支,Beta)和 API,以及 Cognition 工程团队的 onboarding 支持。


推荐理由:官方宣布 Devin 全面开放并给出适用任务、使用建议和多个开源 PR 实例,读者可据此评估如何把 Devin 接入自己的工程流程。

11月22日11月22日周五

星期五 · 1 条
00:00
METR:Research(网页)精选
AI 评分 61/100
METR 发布 RE-Bench:对比语言模型智能体与人类专家的 AI 研发能力

METR 发布 RE-Bench 基准,用 7 个 ML 研究工程环境衡量人类专家与前沿模型智能体的表现,并公开 71 次人类专家尝试及 Claude 3.5 Sonnet 和 o1-preview 的全部运行转录。


推荐理由:原文在同一环境公平对比人类专家与前沿模型智能体,并给出长短时间预算下得分反转的关键数据和完整开源转录。

9月5日9月5日周四

星期四 · 1 条
00:00
DeepSeek:API 更新日志精选
AI 评分 78/100
DeepSeek V2.5 模型发布:合并升级并提升代码与通用能力

DeepSeek 将 V2 Chat 与 Coder V2 合并升级为 V2.5,API 用户通过 deepseek-coder 或 deepseek-chat 均可访问。新模型在通用与代码能力上显著提升,ArenaHard winrate 升至 76.3%,HumanEval 达 89%。


推荐理由:DeepSeek 把 coder 和 chat 合并成 V2.5,API 端点不变但性能全线拉高,已有的集成直接受益,代码和通用能力不再是两张皮。

7月24日7月24日周三

星期三 · 1 条
00:00
DeepSeek:API 更新日志精选
AI 评分 63/100
DeepSeek-Coder 升级为 DeepSeek-Coder-V2-0724

DeepSeek 将 deepseek-coder 模型升级为 DeepSeek-Coder-V2-0724。此次升级为模型版本更新,具体参数规模、性能基准及可用性细节未在更新日志中披露。


推荐理由:DeepSeek Coder 升级到 V2-0724,编码能力再进一步,对 API 用户是直接可用的提升,虽然官方没给技术细节,但仍值得关注。

12月27日12月27日周三

星期三 · 1 条
00:00
Andrej Karpathy:Blog(网页)精选
Licklider 1960《人机共生》评述

Licklider 1960年论文《人机共生》提出"智能增强"(IA)是通向AI的过渡阶段,预测人机能力互补——计算机处理机械工作、人类负责思考,这一范式延续64年直至LLM打破界限。他预见云计算雏形,但误判技术路径:当时看好的逻辑推理AI成死胡同,而因缺乏数据被忽视的统计方法(LLM)终成主流。对交互预测也偏离现实:设想的多人协作大屏未普及,键盘鼠标仍是主导;对语音识别"5年实现"的乐观估计,实际耗时64年未成熟。


推荐理由:Karpathy 借 1960 年文献反思人机共生与 AI 发展路径,历史洞察深刻