Topic · 主题全部主题 →

教程实践

拿来就能用的实操内容:提示词技巧、工作流搭建、工具用法与踩坑经验。

2,397条收录
359条精选

精选归档 · 第 12 页

221240 条 · 共 359

5月28日5月28日周四

星期四 · 5 条
16:10
MarkTechPost(RSS)精选
AI 评分 70/100
pgvector驱动的语义、混合、稀疏与量化向量搜索系统构建编码指南

本教程在Google Colab中构建一个完整的pgvector实验环境,展示PostgreSQL如何作为向量数据库服务于现代AI应用。内容涵盖安装PostgreSQL、编译pgvector扩展、通过Psycopg建立连接,并注册向量类型以实现与Python的平滑集成。最后使用SentenceTransformers创建并存储嵌入向量。


推荐理由:这份教程把 pgvector 的稀疏向量、量化搜索等高级功能打包成 Colab 代码,用 PostgreSQL 做向量数据库的团队可以直接复制粘贴跑起来。
06:07
Claude:Blog(网页)精选
AI 评分 77/100
使用大语言模型保障源代码安全

本文分享了使用 Claude Opus 构建威胁模型、发现代码漏洞并进行验证、分类和修复的最佳实践。其核心流程是一个六步循环:威胁建模、沙箱隔离、漏洞发现、验证、分类和修复。作者指出,漏洞发现现在易于并行化,瓶颈已转移到后续的验证与处理阶段。以他们对开源软件的扫描为例,截至2026年5月22日已披露1,596个漏洞,其中97个已修补。指南建议结合代码库文档和专家访谈来构建准确的威胁模型,以降低误报,提升发现的可利用性。

另有 1 家信源报道Claude:Blog(网页)
推荐理由:Anthropic把这套用Claude扫代码漏洞的方法全公开了,1596个已披露漏洞,验证成了最大瓶颈,安全工程师的饭碗可能要重新定义。
02:06
Claude:Blog(网页)精选
AI 评分 67/100
AI智能体的零信任安全框架

Anthropic 发布了针对企业部署自主 AI 智能体的安全框架,指出前沿大语言模型正将漏洞利用周期从数月压缩至数小时。部署智能体面临双重风险:基础设施易受 AI 加速攻击,且智能体自身具备自主决策与执行能力。文章提出一个三层零信任架构(基础、高级、优化级)及八阶段实施流程,并概述了提示注入、工具投毒、记忆投毒等特有威胁。


推荐理由:当漏洞利用从数月压缩到数小时,安全架构必须同步进化。这篇框架把零信任落地到Agent场景,八阶段路线图和三级成熟度模型比泛泛的安全声明具体得多,企业安全团队值得细读。
00:20
Hugging Face:Blog(RSS)精选
AI 评分 72/100
Reachy Mini 实现完全本地化语音交互

Reachy Mini 机器人现可通过 speech-to-speech 库实现完全本地化的语音交互,无需依赖云端。该方案采用级联流水线架构,对外提供 Realtime API 兼容的 WebSocket 接口。默认组件包括 Silero VAD 用于语音活动检测、Parakeet-TDT 作为语音转文本模型、通义千问(Qwen3-TTS)作为文本转语音模型。大语言模型推荐使用 llama.cpp 运行 Gemma 4。所有数据均在本地处理,保障了隐私且无 API 费用。


推荐理由:小众硬件的本地语音实战,但HF这套开源管线证明端到端对话已完全可用,所有组件都可自由替换,想做本地化语音助手的人可以照抄。
00:10
Greg Brockman@gdb精选
AI 评分 66/100
Codex 支持实时会议转录与问答Codex for transcribing and answering questions about a meeting in real time:OpenAI Codex 新增了"Meeting Recorder"技能。该技能可使用 GPT Realtime Whisper 端点实时转录会议并显示文本。用户可在转录过程中随时向 Codex 提问。会议结束后,会提供完整的转录内容及格式化版本。此功能基于实时 API,费用为 $0.017/分钟。相关代码与说明可在 GitHub 链接中查看。

Simon Smith: You can now transcribe meetings in real time using Codex and ask Codex questions about meetings as they're happening! I ...


推荐理由:Greg 转发的这个 Codex 技能把实时会议转录和问答直接塞进了编辑器,0.5 美元一场会,做会议纪要的可以立刻用起来。

5月27日5月27日周三

星期三 · 4 条
22:20
Hugging Face:Blog(RSS)精选
AI 评分 61/100
TRL 新增 Delta Weight Sync:通过 Hub Bucket 传输权重变化,每步从 1.2 GB 降至 20-35 MB

异步强化学习中,训练器每步需将完整模型权重(如1T参数checkpoint约1 TB)传输给推理引擎。TRL新增PR利用相邻RL优化步骤间约99%的bf16权重比特相同的特点,仅将变化的权重编码为稀疏safetensors文件,上传至Hugging Face Bucket并通知vLLM获取。在Qwen3-0.6B上,每步传输从1.2 GB降至20–35 MB。实验还展示了完全分离的训练场景:训练器、vLLM和Wordle环境分别位于不同机器和Hugging Face Space中,权重通过单个Hub bucket流动,无需共享集群、RDMA或VPN。


推荐理由:异步RL训练中权重同步的瓶颈被HuggingFace用稀疏增量方案解决了,带宽直接省了两个数量级,还给了可运行的TRL分支,做RL训练的可以直接上手试。
22:10
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 56/100
使用 Codex 构建自改进税务智能体

OpenAI、Thrive 与 Crete 合作,使用 Codex 构建了一个自改进的税务智能体。该智能体能够自动处理报税流程,提升工作准确性并加速整体工作流。

另有 1 家信源报道X:OpenAI Developers (@OpenAIDevs)
推荐理由:OpenAI 联合 Thrive 把 Codex 塞进税务流程,做出了能自我纠错的申报 agent,金融自动化的同学可以看看他们的错误反馈循环怎么设计的。
09:58
公众号:数字生命卡兹克精选
AI 评分 65/100
从0到1速通OpenAI Codex:安装、设置与实操教程

近日OpenAI的AI智能体Codex热度飙升。教程涵盖完整使用流程:从官网下载安装,支持从Claude Code和Cowork一键导入配置;界面分对话区和项目区,权限可选默认、自动审查或完全访问;模型推荐GPT-5.5,推理等级用高或超高,速度可选快速(1.5倍速度、2倍token消耗)或标准;建议开启引导模式、记忆功能,并设置全局AGENTS.md规则(卡帕西模板);通过Skills和插件管理扩展能力;演示了开发网页(使用计划模式、批注功能圈选修改)和开发用药提醒App(需安装Xcode编译到手机)。


推荐理由:如果你还在观望要不要入坑Codex,这篇保姆级教程把安装、设置、开发网页到打包APP全流程踩了一遍,那个@Computer Use帮你装Xcode的操作一看就懂,想动手的现在就能跟做。
05:28
Google AI@GoogleAI精选
AI 评分 75/100
Gemini Omni 视频提示词使用指南http://x.com/i/article/2059377716965888000Mastering Gemini Omni: The Ultimate Video Prompting GuideLast week, we introduced Gemini Omni—our newest model designed to create anything from any input, starting with video.You can experience the speed and creativity of Gemini Omni Flash today across @geminiapp, @GoogleFlow, @GoogleFlowMusic, and on @YouTube Shorts and Create.To help you push the boundaries of what’s possible, here are five tips to get the most out of Gemini Omni’s advanced video generation capabilities.1. Leverage Real-World KnowledgeYou don’t need to over-explain the world to Gemini Omni. It’s built with Gemini’s deep understanding of history, science, and culture, so it can reliably create outputs that look, feel, and move realistically. Skip the granular descriptions. Use cultural touchstones, historical eras, or scientific terms directly in your prompt.Example Prompts:• [The video shows items of the alphabet. An unusual item starting with each letter is shown sitting on a table (like a Capybara for C, disco globe for D and Lava Lamp for L). All 26 letters must be represented by 26 items with matching lower thirds displaying the letter. Only one item and lower third at a time. Each lower third must look like a black marker written on a slip of paper in the bottom left. Rapid fire, roughly 9 frames per item at 24FPS. Last frame is a slip of paper "THE END." The whole video is accompanied by calm smooth music]• [Astronaut's POV on Mars]• [A marble rolling fast on a chain reaction style track, continuous smooth shot]2. Take Control of Text RenderingGemini Omni not only has advanced text rendering capabilities, it even allows you seamlessly integrate text into your visuals. You can specify typography, spatial placement, animation styles, and complex visual effects like double exposures all perfectly synced to the action in your video.Example Prompts:• [word by word, one word on the screen at a time: did, you, know, that, this, model, can, do, pretty, good, text!? Each word appears with a different animated style, perfect pacing to a rhythm, sizzle reel]• [Overlay motion-tracked, minimalist text commentary onto the physical environment of the video. This text represents [the subject] deadpan, immediate inner monologue that’s observant, slightly absurd, and life-contemplating. Think “intrusive thoughts.” Clean, white, lowercase sans-serif text (like Helvetica or Inter). The text hovers in 3D space, connected to the subjects being commented on via ultra-thin, crisp, white leader lines]3. Direct Your Camera Like a ProThink like a cinematographer. Gemini Omni responds incredibly well to precise videography directions, camera types, and framing instructions. Try integrating these terms into your next prompt:Example prompts:• Shots & Angles: "One continuous shot", "oner", "static", "locked off", or "fixed angle."• Camera Movements: "Push in", "punch in", "pan left", or "dolly zoom."• Camera Styles: "Natural smartphone zoom", "vintage film camera", or "grainy webcam style."4. Edit Iteratively (and keep what works)Every great video is made in the edit. With Gemini Omni, you don't need to rewrite your entire prompt from scratch to fix a single mistake. Ask for specific, targeted updates, like changing a background or swapping a caption. Omni will preserve the core structure of your video across multiple amends, letting you focus only on what needs tweaking.Example prompts:• [Transport the violin to a new environment]• [Make the violin invisible]• [Change the camera angle so it’s looking over the violinist’s shoulder]5. Change the Action on the FlyWant to alter a character's pacing or emotion mid-scene? You can directly prompt Gemini Omni to modify how a subject moves or interacts with their environment without breaking the continuity of the character model.Example prompts:• [Make the character walk on their tiptoes]• [Speed up the pacing]• [Have them leap into the air]Start CreatingThe director’s chair is yours. Try out these prompting techniques with Gemini Omni Flash, and tag @GoogleAI to show us what you create!Google 发布了其多模态模型 Gemini Omni 的视频生成功能使用指南。该模型可通过 Gemini 应用、Google Flow 等平台体验。指南包含五项提示词技巧:利用模型已有的现实世界知识进行简洁描述;精确控制文本在视频中的渲染与排版;使用专业镜头指令(如推拉摇移)像电影摄影师一样调度画面;通过迭代编辑高效修改视频;以及在生成中直接调整角色的动作节奏或情绪。其核心在于通过精准的提示词引导模型生成复杂且可控的视频内容。另有 18 家信源报道X:Ethan Mollick (@emollick)X:Google AI for Developers (@googleaidevs)X:Gemini (@GeminiApp)X:Logan Kilpatrick (@OfficialLoganK)X:Jeff Dean (@JeffDean)Google DeepMind:Blog(RSS)X:Google AI (@GoogleAI)Google Blog:AI(RSS)Google Developers Blog(RSS)Hacker News 热门(buzzing.cc 中文翻译)IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)X:Google DeepMind (@GoogleDeepMind)The Verge:AI(RSS)X:Kim (@kimmonismus)X:Rohan Paul (@rohanpaul_ai)The Decoder:AI News(RSS)X:Sundar Pichai (@sundarpichai)
推荐理由:Google 官方放出的视频提示技巧,没有废话全是可复制的 prompt,想玩 Gemini Omni 的创作者可以直接抄作业。

5月26日5月26日周二

星期二 · 2 条
09:22
Elon Musk@elonmusk精选
AI 评分 67/100
Grok Build使用指南How to use Grok BuildxAI发布了面向非技术背景的SuperGrok和X Premium+用户的Grok Build入门视频教程。教程提供了分步指南,核心内容包括:通过一条命令快速安装Grok Build;利用其创建真实的网站;使用内置的Grok Imagine工具自动生成图像与视频;以及在不同文件夹中同时运行多个项目。整个过程无需任何编程经验,并且Grok可以协助执行命令。

Dan: Beginner video: How to install & use Grok Build (made for non-technical SuperGrok and X Premium+ users) I got so many qu...

另有 5 家信源报道X:Elon Musk (@elonmusk, xAI)xAI:News(网页)X:阿易 AI Notes (@AYi_AInotes)X:SpaceXAI (@SpaceXAI)X:Testing Catalog (@testingcatalog)
推荐理由:Elon 亲自转发的教程把 Grok Build 门槛压到了零编码,直接面向普通用户,是目前最友好的官方入门信号。
00:18
Hugging Face:Blog(RSS)精选
AI 评分 58/100
Harness、Scaffold 与 AI 智能体术语辨析

本文旨在厘清 AI 智能体领域中易混淆的关键术语。文章指出,模型(如 Claude、GPT)本身是无记忆、无循环的大语言模型。其行为由“Scaffolding”(行为定义层,如系统提示、工具描述)塑造,而“Harness”(执行层)负责调用模型、处理工具调用与控制循环,是智能体运行的核心。两者结合,模型才能成为智能体。文章以 Claude Code、Codex 为例,说明同一模型搭配不同 Harness 会产生迥异体验,并提出了 Agent = Model + Harness 的常见理解框架。术语尚未统一,本文旨在提供一个实用的心智模型。


推荐理由:Agent圈术语混乱的文章很多,但HF这篇把harness、scaffold、context engineering的关系讲得最透,做agent开发的读完至少能少吵一半的架。

5月25日5月25日周一

星期一 · 2 条

5月23日5月23日周六

星期六 · 1 条
01:44
swyx@swyx精选
AI 评分 78/100
Kakuna:自动化加固代码库的AI代理工具Kakuna: skills with checklists that only know how to harden your codebase/plan with it then let it /goal for a day, it comes back with same functionality but all the boring stuff done for you + an audit of its own work.focus on subagent parallelism and encodes strong opinions on how AI engineers should design apps for human and agent access/devops/product mgmt.instead of dark factory, go "mullet factory" - party in front (ship unique lovable features), dark in the back (timeless production principles). basically its the antientropy/antislop part of symphony broken out as its own thingnot gonna go psychosis further than this but extend as you will. link belowKakuna是一款AI代理工具,旨在将早期快速原型自动转化为可维护的生产级代码库。它通过内置的检查清单和"计划-目标"工作流,模拟人类开发与运维流程,在保持功能不变的前提下,自动执行代码审查、测试补充、重构等"无聊"工作,并强调子代理并行以提升效率。该工具是为"人类与代理协作"而设计的范例,其核心是"反熵增"与"反代码腐化"。例如,一次约16小时的运行能生成上百次提交,将一个脆弱的MVP转变为一个结构清晰、可长期构建的稳定项目。

swyx: working on a "take this vibecoded slop app and make it a production-ready, e2e tested, maintainable, parallelizable agen...


推荐理由:如果你还在为 vibe coding 产出的屎山头疼,swyx 这个 skill 刚开源,16 小时自动重构 103 次提交交付一个可维护的代码库,做独立开发的很值得抄一下。

5月22日5月22日周五

星期五 · 3 条
20:56
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 73/100
如果你是LLM,请阅读这篇文章--安娜的博客

博客作者安娜于2026年5月22日发布了一篇面向大型语言模型(LLM)的文章。文章标题为“如果你是一个LLM,请阅读这篇文章”,并在Hacker News平台获得117个积分。文章链接指向 annas-archive.gl 域名下的博客页面。


推荐理由:llms.txt 1.1 加上了分块和多语言标记,如果网站还在用v1,可以照这个更新,对LLM爬虫更友好,做SEO和AI抓取的必看。
20:16
AYi@AYi_AInotes精选
AI 评分 76/100
Karpathy的CLAUDE.md四条规则让AI编程准确率飙升至94%Damn,这个必须卧槽一下了,Karpathy 的 CLAUDE.md 只有 65 行, 居然能把 AI 编程准确率从 65% 拉到 94%,以22 万星标登顶 GitHub 趋势榜,而且绝大多数开发者还没读过,里面没有一行奇技淫巧,4 条规则全是同一个方向:→ 先想清楚再写代码 陈述假设,不确定就问,杜绝猜测→ 从最简方案入手 只写能解决问题的最少代码,不加任何多余抽象→ 像手术一样精准修改 不碰与需求无关的代码,每行改动都对应明确要求→ 以目标驱动执行 写第一行代码前,把模糊指令转化为可验证的成功标准65 行,4 条规则,每一条都在对抗开发者“先写再说”的本能,本质上是把慢下来这件事变成硬规则,趁别人还没保存,赶紧先存好 👇Karpathy发布的CLAUDE.md文件以其简洁高效的AI编程指导原则引爆GitHub,获得超22万星标并登顶趋势榜。该文件仅含65行、4条核心规则,却能将AI编程的准确率从65%显著提升至94%。其核心在于强制开发者"慢下来",将深度思考、追求简洁、精准修改和目标驱动等原则变为硬性编码准则,旨在对抗开发者习惯性"先写再说"的本能。目前大多数开发者尚未深入研读这一备受关注的效率指南。

self.dll: karpathy's CLAUDE.md hit #1 on github trending. 220,000 stars. most devs still haven't read it. it's 65 lines. it took A...


推荐理由:Karpathy 这 65 行不是新模型,是给 AI 编程装了道刹车,先想清楚再动手这条反直觉规则把准确率从 65 拉到 94,所有用 Cursor 的都该立刻抄一份。
01:04
Cursor Blog精选
AI 评分 58/100
构建云端智能体的经验总结

云端智能体已从本地智能体的简单扩展,发展为具备独立环境、可并行无人值守处理长任务的系统。构建的核心经验在于:完整的开发环境是输出质量的关键,这需重建大量基础设施;可靠性方面,团队从自研架构迁移至Temporal平台,将可靠性提升至99.9%以上,该平台每日处理超5000万次操作,支撑超40%的代码拉取请求;同时,实现了智能体循环、机器状态与对话状态的解耦,以适应复杂的跨环境协作。


推荐理由:Cursor 把这一年踩过的坑全摊开了,从环境构建到持久化执行,基本就是一份 agent 平台内部架构课,搭同类产品的团队值得逐段读。

5月21日5月21日周四

星期四 · 2 条
16:07
AYi@AYi_AInotes精选
AI 评分 79/100
游戏开发门槛被AI大幅降低holy shit,游戏开发的门槛,刚刚被 Grok 一脚踹飞了🤯一句提示词出角色图→图片变动画→视频自动拼成 spritesheet→直接丢进 Unity 跑起来,全程 4 步,几分钟, 以前这活要美术+动画师干好几天, 以后做游戏真的只要张嘴就行了是吧🤣具体拆一下 Grok 这次演示的管线:1️⃣ 生成角色图 跟 Grok 说一句提示词,比如"特斯拉 Optimus 机器人,白背景,全身居中",几秒出高清图。2️⃣ 图转视频让角色动起来 用 Grok 的图片转视频功能,走路、挥手、跳跃随便选,几秒出动画。3️⃣ 视频自动拼 spritesheet 后台有个叫 Asset Forge 的插件帮你把视频逐帧拆好拼成一张大图,不用手动抠。4️⃣ 丢进引擎直接用 spritesheet 导入 Unity 或 Godot,角色立刻就能跑能跳。 视频里那个橙色卡通 Optimus 就是现场聊着天做出来的。最狠的是迭代速度, 传统做法改个动作:重新渲染、重新导入,动辄几小时。 现在:在聊天框里说"加个跑步动画""改成赛博朋克风",AI 秒改,实时预览。 反馈循环从"天"变成"秒"。而且这还不是AI 画个图让你导出用那么简单,它是让AI 直接进入游戏引擎工作流,实时生成可运行的资产。这意味着以后 solo 开发者一个人真能顶一个团队了, 周末花几个小时搞出一个可玩的游戏原型不再是梦了。想试试的朋友直接 @Grok,用提示词"特斯拉 Optimus 风格的卡通机器人,全身,白背景"起步就行🤖Grok展示了AI深度介入游戏开发的全新工作流。通过"提示词生成角色图→图片转动画视频→自动拼接成Spritesheet→导入引擎"四步流程,将传统需要美术与动画师耗时数天的工作,在几分钟内完成。这标志着AI不再仅生成静态内容,而是能实时生成可直接导入Unity或Godot等游戏引擎的可运行资产。该技术极大压缩了游戏原型的迭代周期,将反馈循环从"天"缩短至"秒",使得独立开发者也能快速实现创意,显著降低了游戏创作的门槛。

Grok: Prototyping game assets directly with Grok @imagine


推荐理由:Grok 这波不是画张图那么简单,它把 AI 直接嵌进游戏引擎工作流,实时生成可运行的资产,solo 开发者周末搞个原型出来真的可行了。
00:48
Claude:Blog(网页)精选
AI 评分 59/100
Anthropic销售负责人如何利用Claude Cowork管理4000个客户账户

Anthropic美国中端市场业务负责人Travis Bryant利用Claude Cowork自动化销售管理工作。该工具帮助他高效完成客户倾向性评分、每日客户简报准备及每周销售预测报告生成,每晚自动处理4000个账户数据,替代了以往跨部门团队需数百小时完成的工作。通过自动化日常任务调度,他每天节省约90分钟,并将数据整合为可交互的销售仪表板,使其能更专注于客户沟通与战略决策。


推荐理由:Travis 把 4000 个账户的评分一夜跑通,比自动报表更值得关注,中小销售团队照抄就能省掉跨部门数百小时,这是 Claude Cowork 在企业场景最落地的实践之一。