精选归档 · 第 68 页

1,3411,348 条 · 共 1,348

12月10日12月10日周二

星期二 · 1 条
00:00
Cognition 模型 / Devin 博客(网页)精选
AI 评分 73/100
Cognition 宣布 Devin 正式全面开放使用

Cognition 宣布 Devin 正式全面可用,无席位限制,所有工程团队可在 app.devin.ai 开始使用,并提供 Slack 集成、IDE 扩展(VSCode 及分支,Beta)和 API,以及 Cognition 工程团队的 onboarding 支持。


推荐理由:官方宣布 Devin 全面开放并给出适用任务、使用建议和多个开源 PR 实例,读者可据此评估如何把 Devin 接入自己的工程流程。

11月22日11月22日周五

星期五 · 1 条
00:00
METR:Research(网页)精选
AI 评分 61/100
METR 发布 RE-Bench:对比语言模型智能体与人类专家的 AI 研发能力

METR 发布 RE-Bench 基准,用 7 个 ML 研究工程环境衡量人类专家与前沿模型智能体的表现,并公开 71 次人类专家尝试及 Claude 3.5 Sonnet 和 o1-preview 的全部运行转录。


推荐理由:原文在同一环境公平对比人类专家与前沿模型智能体,并给出长短时间预算下得分反转的关键数据和完整开源转录。

11月4日11月4日周一

星期一 · 1 条
08:00
xAI:News(网页)精选
Grok API 公测版发布

xAI 启动 Grok API 公测,发布新模型 grok-beta,支持 128k 上下文、函数调用及系统提示,视觉版本下周上线。开发者每月可获 $25 免费额度至年底,已购预付额度可叠加。API 兼容 OpenAI 与 Anthropic 格式,修改 base_url 即可迁移。


推荐理由:xAI开放Grok API公测,每月送$25额度且兼容OpenAI接口,开发者可立即体验

8月20日8月20日周二

星期二 · 1 条
08:00
PromptArmor:Threat Intelligence精选
AI 评分 68/100
PromptArmor 披露 Slack AI 可经间接提示词注入窃取私频数据

PromptArmor 披露 Slack AI 存在间接提示词注入漏洞,攻击者可在其自建的公开频道发布恶意指令,诱导 Slack AI 把用户私有频道中的 API key 等机密数据嵌入钓鱼链接并渲染给用户,点击后数据被外泄。


推荐理由:报告给出完整攻击链和复现细节,读者可以据此评估 Slack AI 的间接提示词注入风险并调整设置。

5月12日5月12日周日

星期日 · 1 条
00:00
Eugene Yan:Writing精选
AI 评分 82/100
Applied LLMs:一年 LLM 应用开发的经验总结

Eugene Yan 等六位作者发布长文 Applied LLMs,总结一年 LLM 应用开发经验,分战术、运营、战略三部分。战术层面涵盖 n-shot 与 CoT 提示词技巧、RAG 文档相关性、结构化输出工具 Instructor 和 Outlines、LLM-as-Judge 评测及幻觉防护;战略层面提出 PMF 之前不买 GPU、先提示词后微调、系统比模型更构成护城河等观点。


推荐理由:多位从业者基于一年真实开发经验总结提示词、RAG、评测到团队与战略的实践清单,读者可对照自己的 LLM 项目逐条借鉴。

12月27日12月27日周三

星期三 · 1 条
00:00
Andrej Karpathy:Blog(网页)精选
Licklider 1960《人机共生》评述

Licklider 1960年论文《人机共生》提出"智能增强"(IA)是通向AI的过渡阶段,预测人机能力互补——计算机处理机械工作、人类负责思考,这一范式延续64年直至LLM打破界限。他预见云计算雏形,但误判技术路径:当时看好的逻辑推理AI成死胡同,而因缺乏数据被忽视的统计方法(LLM)终成主流。对交互预测也偏离现实:设想的多人协作大屏未普及,键盘鼠标仍是主导;对语音识别"5年实现"的乐观估计,实际耗时64年未成熟。


推荐理由:Karpathy 借 1960 年文献反思人机共生与 AI 发展路径,历史洞察深刻

12月20日12月20日周三

星期三 · 1 条
08:00
PromptArmor:Threat Intelligence精选
AI 评分 65/100
PromptArmor 披露 Writer.com 间接提示词注入导致数据外泄漏洞

PromptArmor 披露 Writer.com 存在间接提示词注入漏洞:攻击者在网页中用白色小字隐藏指令,用户将该网页作为资料源后,LLM 会遵照隐藏指令渲染 markdown 图片或链接,把上传文件内容、聊天记录等敏感数据通过 HTTP 参数外传至攻击者服务器。


推荐理由:原文给出完整攻击链、复现细节和披露时间线,读者可以据此理解间接提示词注入如何在 LLM 应用中导致数据外泄。

4月8日4月8日周日

星期日 · 1 条
08:00
Lilian Weng:Lil'Log(RSS)精选
AI 评分 55/100
策略梯度算法

该文章系统梳理了策略梯度算法的发展脉络,深入解析其工作原理,并详细介绍了从基础到前沿的多种算法,包括PPO、SAC、TD3、IMPALA等主流方法。文章自2018年起持续更新,陆续新增了D4PG、SVPG、PPG等新算法,并补充了关于PPO的最新讨论。文中还提供了韩语及中文等多个语言版本的翻译,便于不同读者参考。


推荐理由:这篇是当年策略梯度方法的“圣经”级综述,现在看虽然有些过时,但想理解PPO、SAC的来龙去脉还得从这儿啃起。