精选归档 · 第 8 页

141160 条 · 共 442

7月3日7月3日周五

星期五 · 3 条
13:14
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 81/100
claude-real-video ─ 让任何大语言模型(LLM)都能观看视频

claude-real-video 是一个开源工具,让大语言模型基于视频画面而非字幕进行理解。它通过场景变化检测提取关键帧、滑动窗口去重并转录音频,生成干净的本地文件夹供模型读取。支持 YouTube 链接或本地文件,依赖 ffmpeg 和 Whisper,通过 pip 安装。全部处理在本地完成,不上传云端。


推荐理由:这个工具把视频喂给 LLM 的过程从「固定采样 + 上传云」变成了「场景感知 + 本地去重」,大幅节省 token 且避免隐私泄露,用 Whisper 转录也更完整。是让任何 LLM 真正「看」视频的实用方案。
01:08
Apple Machine Learning Research(RSS)精选
AI 评分 62/100
RL微调VLM的鲁棒性与思维链一致性研究

强化学习(RL)微调被扩展至视觉语言模型(VLM)。研究发现,简单的文本扰动——误导性标题或错误思维链(CoT)——会显著降低模型鲁棒性和置信度,且开源模型衰退更明显。闭源模型呈现类似失败模式,但鲁棒性和推理一致性更强。进一步分析揭示准确性与忠实性的权衡:微调提升基准准确率,但同时侵蚀CoT的可靠性及对上下文变化的鲁棒性;对抗性增强可改善鲁棒性,却无法阻止忠实性漂移。引入忠实性感知奖励能恢复答案与推理的对齐,但与增强结合时训练易崩溃到捷径策略。这些发现强调需联合关注正确性、鲁棒性与视觉推理的忠实性。


推荐理由:RL微调让VLM基准分变好看,却可能让它的推理链变得靠不住,这个反直觉的诊断对正在用RL打磨多模态模型的团队是个警醒。

7月2日7月2日周四

星期四 · 1 条
21:38
公众号:可灵AI(快手·视频)精选
AI 评分 71/100
戛纳金狮首设AI子赛道:可灵制作斩获1银2铜,它们为何打动评委?

戛纳国际创意节今年首次设立AI Craft子赛道,两部使用可灵AI生成的广告作品获奖:《L'Ultimo Uomo Reale》拿下Classic单元Film银奖及Craft单元Film Craft铜奖,《Lorem Ipsum》获得Classic单元Film铜奖。


推荐理由:《L’Ultimo Uomo Reale》和《Lorem Ipsum》用可灵完成从人物表演到视觉奇观的全部画面,戛纳金狮的认可使AI视频生成进入商业交付级评价体系,广告公司的「技术已就绪」主张因此有了第三方权威参考。

7月1日7月1日周三

星期三 · 1 条
00:08
Google DeepMind:Blog(RSS)精选
AI 评分 70/100
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash

Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为 Nano Banana 系列速度最快、成本最低的图像模型,文本到图像输出仅需 4 秒,每 1K 分辨率图像成本 $0.034,已上线 Google AI Studio、Gemini API 及消费者产品(AI Mode in Search、Gemini app 等)。同时推出 Gemini Omni Flash(gemini-omni-flash-preview),支持高画质视频生成与对话式编辑,视频输出定价 $0.10/秒,面向开发者开放 API。


推荐理由:Nano Banana 2 Lite 把图像生成拉到 4 秒延迟和 0.034 美元单价,很适合高频草稿流,Omni Flash 首次对开发者开放视频生成和对话编辑,两个模型串起来的快速迭代工作流是这次最实用的更新。

6月30日6月30日周二

星期二 · 1 条
00:00
Google Research:Blog(网页)精选
AI 评分 61/100
Google Research 将建筑屋顶反射率数据集扩展至全球 50+ 城市

Google Research 发布扩展的建筑屋顶反射率数据集,覆盖全球 50 多个城市,旨在帮助城市规划者优先部署冷屋顶方案以缓解极端高温。该数据集融合 Sentinel-2 卫星数据与 30 厘米分辨率的 Airbus Pléiades Neo 卫星图像生成,可通过新的高分辨率 Heat Resilience Earth Engine App 开放获取。相关方法论发表于《Nature Communications》。此前 2024 年的试点已覆盖 14 个城市,其数据曾指导制定冷屋顶条例与适应计划。


推荐理由:谷歌把屋顶反照率数据的精度做到30厘米,覆盖50+城市,还给了免费App,城市防暑从模糊规划变成可量化的工程,做气候韧性的人可以直接拿这个数据做方案,虽然只是特定领域应用,但AI落地真实场景的路径值得参考。

6月29日6月29日周一

星期一 · 2 条
00:00
Meta AI:Blog(网页)精选
AI 评分 70/100
Brain2Qwerty v2:Meta 发布无需手术的脑波解码文本新方法

Meta 发布 Brain2Qwerty v2,一种无需手术植入即可从非侵入性脑记录中实时解码句子的端到端 AI 管线,词准确率达 61%,最佳参与者达 78%,远超其他非侵入方法 8% 的水平。研究基于 9 名志愿者各 10 小时的 MEG 数据训练,Meta 已开源 v1 和 v2 完整训练代码,合作方 BCBL 发布 v1 数据集。


推荐理由:Meta 的 Brain2Qwerty 展示了不用开颅就能把脑电波转成文字,对渐冻症患者和未来人机交互来说是个重要信号,但离产品化还有距离。

6月27日6月27日周六

星期六 · 2 条
21:24
Runway@runwayml精选
AI 评分 66/100
Runway API 推出广告本地化 RecipeLocalize ads is now available as a Recipe via the Runway API.You can now translate static ads and graphic assets via a single API call.广告本地化现在可通过 Runway API 以 Recipe 形式使用。 现在您可以通过单次 API 调用翻译静态广告和图形资产。

Runway: Runway 新增功能,现在你可以对广告进行本地化处理。 一张图片输入,任意语言输出。只需输入一则广告,就能获得适配每个市场的版本。这一切只需一键操作。


推荐理由:Runway 把广告本地化做成了一键 API,对出海团队是实打实的效率提升,但放在整个 AI 行业里这只是个功能补齐。
12:48
Ethan Mollick@emollick精选
AI 评分 81/100
赫库兰尼姆卷轴两千年来首次被读One of the recovered passages, read for the first time in two thousand years: “Having…strained ourselves to the utmost through research and learning…possessing the same practical wisdom…”其中一段被复原的文字,两千年来首次被读到:"经过研究和学习的极限努力……拥有同样的实践智慧……"

Stewart Brand: 赫库兰尼姆熔合卷轴被完整读取。 https://scrollprize.org/firstscroll


推荐理由:AI 首次从两千年前的火山灰中读出完整段落,而且内容恰恰是关于「研究与智慧」的,这种巧合本身就值得你点开看一眼。

6月26日6月26日周五

星期五 · 1 条
00:15
Google AI Developers@googleaidevs精选
AI 评分 73/100
Gemini 3.5 Flash 的 Computer Use 工具正式可用The Computer Use tool is now available for Gemini 3.5 Flash 🛠️Build agents that see and take action across browser, mobile, and desktop environments to seamlessly handle long-horizon tasks.Here’s what’s new:• Built-in support for mobile and desktop operating systems • Intent arguments for all function calls • Customizable client-side functions to easily support human-in-the-loop (HITL) takeover • Prompt injection detection and configurable action-level safety policies to fit your app’s needsLearn how you can use 3.5 Flash to automate QA testing, business processes, and more in the blog: https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-computer-use-gemini-3-5-flash/Google AI 宣布 Gemini 3.5 Flash 的 Computer Use 工具正式可用,支持构建能观察并操作浏览器、移动端和桌面环境的 AI 智能体,可处理长期任务。新特性包括:内置移动与桌面操作系统支持;所有函数调用配备 intent arguments;可定制的客户端函数实现人工接管(HITL);提示词注入检测及可配置的 action-level 安全策略。可用于自动化 QA 测试、业务流程等场景。
推荐理由:Computer Use 从浏览器扩展到移动和桌面,Google 正式把 agent 战场拉到全部界面。安全策略的加入说明不是 demo,而是认真考虑落地。

6月25日6月25日周四

星期四 · 3 条
14:23
公众号:京东JoyAI精选
AI 评分 62/100
JoyAI 上线「欢乐足球季」:上传一张照片即可生成赛场动态视频

JoyAI APP 上线「欢乐足球季」主题活动,用户上传一张人像照片即可生成沉浸式赛场动态视频,支持肢体动作拟合、环境动态渲染与专业运镜。活动提供近 20 款视频模板,覆盖看台抓拍、进球庆祝、足球手势舞等玩法,并同步上线近 50 款足球主题聊球智能体。上线首周互动量日均增长率超 158%。


推荐理由:模板覆盖看台、进球、手势舞等场景,无需编辑技能即可产出氛围感短片,对丰富观赛社交内容有直接帮助。
14:04
MarkTechPost(RSS)精选
AI 评分 73/100
百度发布Unlimited OCR:3B参数MoE模型,KV缓存恒定实现长文档高效解析

百度推出Unlimited OCR,一个3B参数的MoE模型,推理时仅激活500M参数。其核心创新Reference Sliding Window Attention(R-SWA)将KV缓存大小固定为Lm + n(n默认128),内存和延迟不随输出长度增长。模型基于DeepSeek OCR继续训练4000步,支持32K最大长度,通过DeepEncoder实现16倍token压缩。在OmniDocBench v1.5上整体得分93.23,超出DeepSeek OCR基线6.22分;v1.6得分93.92为最高。Base模式下吞吐达5580 TPS,比DeepSeek OCR提升12.7%,6000 token输出时延迟低35%。适用于整本书转录等场景,代码与权重已在HuggingFace开源。


推荐理由:Baidu这个OCR模型用R-SWA把KV缓存压成常量,长文档解析终于不用越跑越慢了。MIT开源,3B总参但推理只消500M,做文档管线的可以直接接。
01:07
Google DeepMind:Blog(RSS)精选
AI 评分 70/100
Gemini 3.5 Flash 引入 computer use 功能

Google DeepMind 宣布,computer use 现作为内置工具集成于 Gemini 3.5 Flash,开发者可构建跨浏览器、移动端和桌面的智能体,实现视觉感知、推理与操作。此前该功能仅以独立模型形式存在于 Gemini 2.5。3.5 Flash 已支持函数调用及 Search、Maps 等内置工具,新增的 computer use 可提升持续软件测试和跨专业应用知识工作等长周期企业自动化任务的性能。安全方面采用针对性对抗训练,并可选配两项企业防护系统:要求用户确认敏感操作,以及在检测到间接 prompt 注入时自动停止任务。可通过 Gemini API 和 Gemini Enterprise Agent Platform 使用。


推荐理由:把 computer use 能力塞进轻量级的 Flash 模型,意味着在浏览器里跑视觉 agent 的成本会大幅降低,做企业自动化的团队可以立即试起来,安全措施也给了落地信心。

6月24日6月24日周三

星期三 · 5 条
19:31
OpenRouter:Announcements(RSS)精选
AI 评分 73/100
OpenRouter推出统一图像API

OpenRouter推出统一图像API,整合Google、OpenAI、Black Forest Labs、Recraft、ByteDance、Sourceful、Microsoft、xAI等30+模型。新API提供标准化请求格式,通过/api/v1/images/models端点返回每个模型的分辨率、宽高比、输出数量、输入参考图数量、种子等能力描述;通过/api/v1/images/models/{id}/endpoints端点获取具体服务商的定价与参数支持(如Seedream 4.5每张$0.04、FLUX.2 Pro每百万像素$0.03、GPT-5.4 Image 2按token计费)。OpenAI的GPT 5系列图像模型支持SSE流式预览,启用"stream": true即可边生成边返回预览。新图像模型将仅添加至专用API,建议现有用户切换。


推荐理由:OpenRouter 把 30+ 图像模型收进一个 API,参数自动发现和流式预览让频繁切换模型的开发者省去不少适配麻烦,尤其对 Agent 工作流很友好。
15:10
OpenBMB@OpenBMB精选
AI 评分 65/100
MiniCPM-V 4.6 在 Apple Core AI 上高速运行🥳Thanks for sharing this, @MLBoy_DaisukeMajima 🚀 MiniCPM-V 4.6 running at this speed on-device is really impressive — especially under 2B params on Apple Core AI. Great work pushing efficient multimodal AI forward.🫡🥳感谢分享,@MLBoy_DaisukeMajima 🚀 MiniCPM-V 4.6 在设备上以这样的速度运行,实在令人印象深刻--尤其是在 Apple Core AI 上以不到 2B 参数跑出。 干得漂亮,推动高效多模态 AI 向前发展。🫡

MLBoy_DaisukeMajima: 📸 MiniCPM-V 4.6 - 参数量低于 2B 的最强视觉模型之一 - 现已在 iPhone 17 Pro 上通过 Apple Core AI 以约 51 tok/s 的速度运行。 🤗 http://huggingface.co/...


推荐理由:社区把 MiniCPM-V 4.6 搬上 iPhone 17 Pro,跑出 51 tok/s,还给了代码和模型,做端侧多模态的可以直接跑起来了。
12:42
IT之家(RSS)精选
AI 评分 74/100
OpenAI ChatGPT 语音最大规模升级:双向AI语音模型 Bidi 1 已上线测试

6月23日,部分用户反馈 ChatGPT 网页版和 App 版上线了双向 AI 语音模型 Bidi 1,位于设置模型选择器中,与标准语音和高级语音并列。该模型支持边说话边监听,用户可在对话中途打断并发出新指令,例如要求从1数到10时中途喊停倒数,模型会立即切换执行。OpenAI 尚未官宣,预计本周启动更大范围测试。


推荐理由:Bidi 1 让 ChatGPT 语音从回合制变成双向并行,打断后能立即响应,这是语音交互真正的升维,普通人很快就能感受到对话自然感的质变。
09:43
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 65/100
inclusionAI 发布 SingGuard 系列模型,首个版本为 SingGuard-0.8b

inclusionAI 在 HuggingFace 发布 SingGuard 系列模型,首个版本为 SingGuard-0.8b。该模型将安全策略作为运行时输入而非训练时固定分类,支持文本、图像、图文、多语言、查询侧和响应侧六类场景的安全评估。SingGuard 采用动态推理流程,支持快速首 token 路由输出即时安全信号,并在需要深度推理时继续生成更精确的判断。在涵盖多模态安全、图像安全、文本查询安全、文本响应安全、多语言查询安全和多语言响应安全的六类基准测试中,SingGuard 取得平均 SOTA 性能。模型原生兼容 Transformers 和 vLLM 的 chat 消息输入格式。


推荐理由:蚂蚁这个 SingGuard 把安全策略从固定的分类器变成运行时动态输入,对出海应用的合规审核有实际价值,尤其是多模态场景,我觉得能省掉很多重训成本。
09:10
公众号:豆包(字节)精选
AI 评分 77/100
今天,豆包正式推出专业版

豆包专业版基于豆包2.1系列大模型上线,面向复杂办公与生产力场景。办公任务模式接入可执行Agent任务的豆包2.1模型,支持操作本地电脑、浏览器、调用Skills技能、定时任务,内置Office办公套件,并可生成带后端数据库的在线应用。免费用户可体验豆包2.1 Turbo版办公任务模式,专业版接入豆包2.1 Pro模型。定价:标准套餐68元/月(连续包月),加强套餐200元/月,高级套餐500元/月。大学生认证后标准套餐38元/月,持续6个月。


推荐理由:豆包专业版不是简单的会员升级,而是把Agent能力装进办公场景,操作本地电脑、生成应用这些功能,让AI从对话工具变成了真正的生产力帮手。

6月23日6月23日周二

星期二 · 1 条
22:24
Mistral AI:News(网页)精选
AI 评分 68/100
Mistral OCR 4

Mistral AI 发布 OCR 4,新增边界框、块分类(标题、表格、方程式、签名等)及逐页逐词置信度分数。支持 170 种语言、10 个语系,可单容器全自托管部署。在 OlmOCRBench 上得分 85.20,独立标注者偏好率平均 72%。定价每 1000 页 $4,Batch API 享 50% 折扣。可通过 API 或 Mistral Studio 的 Document AI 调用。


推荐理由:Mistral OCR 4 把 bounding box 和置信度输出做进了产品,自托管部署和多语言能力很务实,做文档 RAG 和智能体的团队可以认真看看。