精选归档 · 第 10 页

181200 条 · 共 969

7月17日7月17日周五

星期五 · 1 条
00:32
Google Blog:AI(RSS)精选
AI 评分 60/100
Google Vids 上线 Gemini Omni 与个人数字分身功能

Google Vids 推出两项更新:Gemini Omni 支持用户通过自然语言提示词和图片参考生成、逐步编辑高质量视频片段;个人数字分身功能允许用户上传自拍和语音录制后,输入文字即可让数字分身出镜。两项功能面向 Google AI Pro 和 Ultra 订阅者及 Google Workspace 商业客户开放,所有生成内容均含不可见的 SynthID 数字水印。


推荐理由:如果你已经在用 Google Workspace,这两个更新让 Vids 的可用性提升了一档,但对于外部的 AI 视频生成,没带来新变量。

7月16日7月16日周四

星期四 · 10 条
22:32
Claude:Blog(网页)精选
AI 评分 64/100
在 Claude Cowork 中使用 Claude Fable 5

Anthropic 发布最强通用模型 Claude Fable 5,专为长时间、多步骤的复杂异步工作设计,可在 Claude Cowork 中自主执行深度研究、尽职调查等任务。该模型需手动选择,默认模型为 Claude Sonnet 5。


推荐理由:Anthropic 终于把最强大模型放进 Cowork,这篇指南不只是功能说明,更是一套'把 AI 当同事'的工作方法,开发者看完就能上手。
20:30
公众号:百度智能云(文心)精选
AI 评分 67/100
秒哒 3.5 全球首发 iOS App,无代码开发与多端共享后端能力升级

百度智能云在 WAIC2026 发布秒哒 3.5,新增 iOS 打包能力,用户无需 Mac 或 Xcode 即可将应用打包为 IPA 文件或上架 App Store。3.5 版本还内置 SEO Agent 实现搜索优化自动化,支持多应用共享同一后端数据库,并推出数据库多环境隔离与后端资源分级功能。秒哒累计服务超 3500 万用户,已创造 350 万个商业应用。


推荐理由:秒哒3.5把无代码开发推到了iOS端,一键打包、多端共享后端这些能力对非技术创业者是真降门槛。但百度生态外的吸引力有限,适合已有秒哒应用的人直接升级。
17:58
Google Developers Blog(RSS)精选
AI 评分 60/100
Gemini Enterprise Agent Platform 新增 Parallel Web Search 网络接地提供商

Google Cloud 与 Parallel Web Systems 合作,将 Parallel 的搜索基础设施作为新的网络接地提供商原生集成到 Gemini Enterprise Agent Platform 中。该集成使开发者能将 AI 智能体锚定在可验证的实时网络结果上,以提升企业工作流的事实准确性。用户还可编程提取、永久缓存并与其他大语言模型一起处理网络数据。


推荐理由:为 Gemini Agent 平台引入第三方搜索 grounding,企业开发者多了一个直接可用的实时事实核查选项,虽非重大突破,但对做合规和知识库场景的团队是个实用更新。
10:10
公众号:昆仑万维(天工)精选
AI 评分 68/100
天工短剧工作台发布"Agent智能分镜+无限画布"双轨创作模式

天工短剧工作台推出双轨创作模式,通过导演Agent自动解析剧本、规划站位与机位,并支持多视细节图生成,解决AI短剧角色变脸和站位漂移问题。该工具内置影视级提示词模板、720°全景图及3D导演台,实现可控生产。已有三部作品上线DramaWave 7天实现百万美元级营收。


推荐理由:天工短剧工作台把导演思维实打实地做进了产品,站位置图和3D导演台专门根治角色乱变脸的痼疾,是短剧工具从随机抽卡迈向可控生产的关键一步,创作者值得细看。
10:00
公众号:昆仑万维(天工)精选
AI 评分 66/100
天工短剧工作台推出"Agent智能分镜+无限画布"双轨创作模式,告别AI短剧"随机抽卡"

天工短剧工作台(SkyProduction)推出“Agent智能分镜+无限画布”双轨创作模式,将导演思维拆解为六个可干预环节,通过站位图锁定和多视细节图生成解决角色漂移、变脸问题。该工作台支持720°全景图、3D导演台、多账号分级管理及数据中心,并原生支持英文短剧全流程处理。其三部精品短剧上线DramaWave仅7天,均实现百万美元级营收。


推荐理由:天工短剧工作台把导演思维拆解成可干预的站位、光影和调度环节,降低了从单镜头到连续叙事的落差,适合需要稳定产出精品短剧的团队。
09:40
公众号:MiniMax(稀宇科技)精选
AI 评分 66/100
MiniMax Code 2.0 桌面端焕新:底层架构全面升级,金融模块即将上线

MiniMax Code 2.0 桌面端发布,基于 Pi Agent 框架重构底层架构,显著提升会话启动速度与长程复杂任务的执行稳定性。新版本优化了图表加载与文件预览框选编辑功能,并已与恒生金融数据库、企查查 MCP 打通,金融模块即将上线,支持多源数据实时检索与专业报告生成。桌面端现已开放下载,本月还将上线远程控制、浏览器操控等功能。


推荐理由:MiniMax Code 2.0 把底层推倒重来,金融模块直接打通恒生和企查查,从写代码变成能出分析报告,做二级市场的可以认真看看。
08:00
Modal 官方工程博客(RSS)精选
AI 评分 63/100
Modal 重写沙箱平台,1 分钟内启动 100 万个并发沙箱

Modal 宣布从零重写核心沙箱平台,新系统可并发运行数百万个沙箱,并演示了在 1 分钟内创建全部 100 万个沙箱,平均每秒创建约 1.85 万个。


推荐理由:原文由 Modal 工程团队亲述架构重写思路与实测数据,读者可以了解大规模沙箱系统如何绕开中心化协调的瓶颈。
05:07
xAI:News(网页)精选
AI 评分 77/100
xAI 开源 Grok Build 编程智能体与终端界面

xAI 已将 Grok Build 的源代码在 GitHub 上开源。Grok Build 是 SpaceXAI 的编程智能体与终端用户界面(TUI),开源后用户可自行编译并完全本地运行,指向本地推理引擎并通过 config.toml 配置。


推荐理由:Grok Build 开源让 xAI 的编码智能体变成完全可定制、可本地运行的套件,对想自己拼装开发环境的工程师是个实锤福利,但社区能玩多大还得看后续。

7月15日7月15日周三

星期三 · 7 条
23:59
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 77/100
Telegram 无服务器架构

Telegram Serverless 允许开发者直接在 Telegram 基础设施上运行 Bot 和 Mini App 的后端代码,无需配置服务器或容器。开发者编写普通 JavaScript 模块,通过 npx tgcloud push 单命令部署,代码在靠近 Bot API 和内建数据库的轻量级 V8 隔离沙箱中执行。


推荐理由:Telegram 给机器人开发搭了一套完整的无服务器后端,内置数据库和 CLI,从写代码到部署都在一个文件夹里完成。做 Telegram 机器人的开发者可以彻底扔掉 VPS 和云函数了。
17:13
公众号:火山引擎精选
AI 评分 69/100
Doubao-Seed-Evolving 升级:支持 1M 上下文,长程任务能力超越 Doubao-Seed-2.1-pro

火山引擎升级 Doubao-Seed-Evolving,新增 1M 超长上下文支持,可单次处理大型代码仓库、长篇文档等大规模信息。该模型在长程任务中表现更稳定,开发者众测质量评分超越 Doubao-Seed-2.1-pro,且消耗 tokens 更少、工具调用轮次更简洁。现已上线火山 Agent Plan,单月套餐限时 9.9 元起,参与体验奖励计划可享调用成本立减 20%。


推荐理由:1M上下文将大型代码仓库和长文档纳入单次处理范围,长程任务稳定性的提升更直接地影响智能体复杂步骤的可靠性,统一ID则省去了频繁切换模型版本的工程开销。
17:12
公众号:京东JoyAI精选
AI 评分 67/100
全国首个"模型券"即时补贴平台上线京东云

北京经开区在全国率先试点运行“模型券”即时补贴平台,由京东科技集团提供技术支持。企业购买模型服务时可在京东云优惠价基础上叠加补贴,以1000元券包为例实际支付最低可降至350元,补贴比例最高达65%。平台支持多模型调用,企业完成四项线上流程即可即时抵扣,算力券补贴功能也将加快上线。


推荐理由:补贴从事后申报变为消费时自动抵扣,对现金流敏感的中小企业,降低初次调用门槛的意义大于折扣比例本身。
16:41
IT之家(RSS)精选
AI 评分 70/100
金山办公推出 WPS Comate AI 办公客户端

金山办公在2026 AI生产力大会上推出面向员工的AI办公客户端WPS Comate,可连接组织数据与流程。该产品提供AI岗位专家、Skill技能生态、自动化任务等六大模块,并支持云端与本地双任务模式,个人用户可直接下载体验。


推荐理由:金山办公把WPS Comate从聊天工具升级成能连接组织数据、自动执行任务的AI办公平台,对国内WPS用户群是个实际提效选项,但具体落地效果和第三方集成深度还有待验证。
08:00
vLLM 官方博客(RSS)精选
AI 评分 73/100
vLLM 实现 TML Inkling Day-0 支持并完成推理性能优化

vLLM 宣布对 Thinking Machines Lab 的 1T 参数多模态模型 TML Inkling 提供 Day-0 支持,覆盖 thinkingmachines/Inkling-NVFP4 和 BF16 两个版本,支持文本、图像、音频输入和最长 1M token 上下文。


推荐理由:原文给出 Day-0 支持的具体性能数字、架构优化细节和精度对比,读者可以评估该模型在自己的推理工作流中的可用性。
00:37
Hacker News:AI 热帖精选
AI 评分 73/100
Juggler:一款开源 GUI 编程智能体,由 JUCE 创建者开发

Juggler 是一款开源 GUI 编程智能体,提供可视化工作台,支持可检查的工具调用、分支线程和可编辑上下文。会话以树状结构组织,而非线性聊天记录,用户可创建子线程、回溯、比较和编辑。所有关键信息以 Finder 风格 Miller 列展示。Juggler 支持本地、远程或同时运行,桌面应用与浏览器可连接同一会话。模型支持包括 Claude Code、OpenAI、Gemini、Ollama、OpenRouter、Z.AI、Deepseek 等。后端使用 Go 和 Wails,UI 为 HTML/JS。


推荐理由:我觉得 Juggler 把 AI 编码的交互从聊天记录变成了可编辑的树,这下能细致管理多个修改分支了,而且完全开源,做软件的值得试一下。

7月14日7月14日周二

星期二 · 2 条
23:33
Google AI Developers@googleaidevs精选
AI 评分 70/100
Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言近实时语音到语音翻译http://x.com/i/article/2067347903761485824How Developers are Building with Gemini 3.5 Live Translate70+ languages. Fluid, natural speech-to-speech. Near real-time latency.Gemini 3.5 Live Translate is fundamentally changing how developers build global, multilingual applications. By processing raw audio streams rather than converting text turn-by-turn, it preserves speaker intonation, pacing, and pitch.Southeast Asia's leading superapp, Grab, is exploring how to break down language barriers between drivers and travelers. With users making over 10 million voice calls a month, the model makes cross-lingual communication flow naturally.You can build and deploy your own voice translation apps by using the Gemini Live API with LiveKit, Fishjam, Pipecat, or Vision Agents. These integrations handle the complex real-time media streaming infrastructure, so you can focus on the user experience.Take a closer look at how you build with these tools ⬇️LiveKit (@livekit)By combining LiveKit Agents with Gemini 3.5 Live Translate, the LiveKit team built a virtual meeting room where everyone speaks their native language and instantly understands each other, breaking down language barriers. The model handles the multilingual inputs automatically and streams speech continuously, delivering fluid translations just a few seconds behind the speaker.Software Mansion (@swmansion)The Software Mansion team paired Gemini 3.5 Live Translate with the ultra-fast MoQ (Media over QUIC) protocol. This integration bypasses traditional streaming bottlenecks, setting a new standard for delivering high-quality, speech-to-speech translation to large audiences with exceptionally low latency.VisionAgents AI (@visionagents_ai)Real-time translation is challenging, but switching between different languages dynamically is even harder. Watch as VisionAgents AI tests the limits of the new model by throwing multiple languages at it on the fly. Using Gemini 3.5 Live Translate's auto-detection, the agent effortlessly handles the rapid context switching while maintaining natural intonation, rather than falling back on robotic, turn-based responses.Ready to build?You can try Gemini 3.5 Live Translate in Google AI Studio and grab starter code from the Gemini Cookbook. Read the blog for more details.Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言、近实时延迟的语音到语音翻译。该模型直接处理原始音频流,保留说话者语调、节奏和音高。东南亚超级应用 Grab 正探索将其用于司机与乘客间的跨语言沟通,其用户每月发起超 1000 万次语音通话。开发者可通过 Gemini Live API 集成 LiveKit、Fishjam、Pipecat 或 Vision Agents 构建应用。LiveKit 已实现虚拟会议室多语言即时理解;Software Mansion 结合 MoQ 协议突破流媒体瓶颈;VisionAgents AI 展示了动态多语言切换能力。开发者可在 Google AI Studio 试用并获取 Cookbook 示例代码。
推荐理由:Google把Gemini 3.5的语音翻译做到了近实时、保持语调,这对出海产品是个很实际的升级,实时通话翻译终于从demo走向可用。