Postgres 中向量内联存储与独立表对比:AlloyDB Omni 实测 join 开销
Gleb Otochkin 在 AlloyDB Omni 上用 3 万行商品数据和 vector(768) 嵌入,实测语义搜索、过滤查询和多表 join 三类场景下向量与业务数据同表存储与独立嵌入表加主键 join 的性能差异。
Gleb Otochkin 在 AlloyDB Omni 上用 3 万行商品数据和 vector(768) 嵌入,实测语义搜索、过滤查询和多表 join 三类场景下向量与业务数据同表存储与独立嵌入表加主键 join 的性能差异。
OpenRouter 于 2026 年 9 月 11 日核实嵌入模型目录共 37 个条目,并通过自家 embeddings API 向 19 个模型发送批量请求、共 28 项检查,确认请求与响应行为。
推荐理由:作者用自家 API 实测 19 个模型并按用例给出候选、价格与维度,读者可按输入类型和存储约束直接对照选型。
百度智能云联合中国电子技术标准化研究院牵头制定的四项人工智能国家标准正式发布,自2026年8月27日起实施,由全国信息技术标准化技术委员会(TC28)归口管理。
OpenAI 发布 Astra for Law,将 GPT-6 Astra 配合法律搜索索引和 Legal 分析写作指令,面向律所和法律科技公司。在 Vals AI Legal Research Bench 私有验证集 200 道美国法律研究题上,最高推理强度下整体正确率 54.0%,比仅用网页搜索的 GPT-6 Astra 的 38.7% 相对提升 40%。
LangChain 发布开源智能体助手 Deep Life Sci,面向临床和实验室科学家。它接入 600K+ ClinicalTrials.gov 研究、2900 万 PubMed 摘要和 1200 万 PubMed Central 全文,并用沙盒子智能体进行真实数据分析。
LlamaIndex 发文分析 OCR 文档处理中准确率与自动化率的关系,指出路由门控而非读取能力决定直通处理率。文中算例显示 20 个字段的发票在 97% 每字段准确率下仅约 54% 文档全对,94% 准确率但带每字段置信度的 Pipeline B 可自动放行 92% 文档,而 97% 准确但无信号的 Pipeline A 直通率为 0。
Google 的 Gleb Otochkin 在 AlloyDB Omni 上实测嵌入向量版本更新对 PostgreSQL 存储的影响:在含 768 维向量和 HNSW 索引的 20k 行表上更新全部向量后,表、TOAST 和索引体积几乎翻倍(TOAST 从 81 MB 到 159 MB,HNSW 索引从 78 MB 到 156 MB),约一半空间被死元组占据。
Redis 发布全托管语义缓存服务 LangCache,现已在 Redis Cloud 以公开预览形式提供,通过 REST API 及 Python、JavaScript SDK 接入。
LlamaIndex 博客提出 just-in-time Agentic OCR 模式:先用 LiteParse 等免费解析器粗读全部文件供检索,再仅对相关页面调用 VLM 做 OCR。
推荐理由:作者用 84 份 SEC 文件实测两遍式文档处理流程,给出明确的适用边界和成本数字,方法可直接迁移到自己的数据室场景。
arXiv 论文(https://arxiv.org/abs/2505.12540)提出 vec2vec,这是首个无需配对数据、编码器或预定义匹配集就能在不同模型嵌入空间之间翻译文本嵌入的方法,基于柏拉图表示假说的强版本,用对抗损失与循环一致性学习共享潜在空间。
Every answer in Perplexity starts with embedding and ranking models picking the most relevant results for the query. Today we published research on how we built SoTA serving infrastructure behind those models. Read the research: https://www.perplexity.ai/hub/blog/fast-embeddings-on-gpus
论文提出 PACE 数据集,评估模型能否识别由自我中心知识库事实构成的隐性约束,使看似合理的用户请求变得不恰当,并提出多智能体框架 PaceMaker,通过查询改写、多跳图遍历和冲突感知过滤协调检索决定性证据。实验同时评估证据检索质量与冲突判断准确率,PaceMaker 一致优于现有方法。
论文提出 CORE,通过合成五个组合匹配级别的候选列表和 Rank-KL 目标,把多模态模型作为重排器时的组合判断蒸馏进嵌入模型。
H Company 团队发布 NeoMME,含 260M 和 800M 两个尺寸的多语言多模态编码器,用单个双向 Transformer 从零处理文本 token 和 32×32 图像 patch,不使用预训练视觉塔或因果语言模型,训练采用掩码离散扩散目标,每个模型处理约 5240 亿 packed token。
论文提出 ContextPilot,让智能体主动规划、存储、压缩或删除旧上下文,并通过 RL 学习哪些上下文决策真正有效。
Meta 发布技术博客,介绍其为合规领域构建的 AI Agent,用结构化知识系统加可组合 recipes 复现专家推理方式,专家反馈经诊断、编译、验证和人工审核后写入 200+ 知识文件,无需重新训练模型。六周三轮开发后,单项评估时间从数天缩短到数分钟,改进周期内零回归,每轮修复自动加入回归测试集。
ByteByteGo 发文解析 RAG 系统中嵌入模型的关键作用,指出语言模型再强也无法弥补错误检索,因为嵌入模型决定了哪些文本进入上下文。文章图解了索引与检索两个阶段的工作流程,列举了语义相似但答非所问的多种失败模式,包括否定句、版本差异和数字标识等,并说明更换嵌入模型需要全量重建向量、索引和权限,成本高昂,类似蓝绿部署。
论文提出 EM^2Mem,一个事件中心的多模态记忆框架,在记忆构建阶段将异构证据绑定到事件锚点,每个事件索引的记忆单元对齐多模态记录、时间上下文、图关联关系、语义事实和来源信息。
LatentPress 将对话历史和长文档压缩为连续记忆 token,由冻结解码器通过输入嵌入接口直接读取,推理时无需重建文本。
论文提出 MaP-SQL,一种免微调的 Text-to-SQL listwise 选择器,用从训练数据蒸馏出的结构化记忆作为评估候选 SQL 的显式标准,并通过聚合多输入排列的排序来缓解位置偏差。
论文提出 CoGR 检索框架,训练 LLM 直接在查询侧和物品侧生成紧凑关键词集,经倒排索引直接匹配,兼容现有关键词检索基础设施。训练采用两阶段流程,先用监督微调对齐关键词空间,再用 GRPO 交替优化两侧生成器,双方共同优化同一 query-to-item 检索 F_1 目标。
论文提出 ExecRetrieval 基准,包含 939 个 Python 任务,每个配一个执行验证的规范实现和最多四个单点变异生成的执行验证错误干扰项。
博通推出 VMware AI 工厂,作为 VMware AI 私有云的软件定义基础,可将 AI 应用直接部署到企业私有云环境,服务器部署至 AI 模型开始服务的时间从数周缩短至数小时。
https://x.com/i/article/2094217470567686144
H 团队发布 NeoMME,一组 260M 与 800M 参数的多模态多语言双向编码器,在单个双向 Transformer 中处理多语言文本与原始图像块,从零预训练,支持 16,384-token 上下文,可编码最多两张 4K UHD 图像。
论文提出 agentic data cracking,智能体在推理时以边际成本派生 cracking 子智能体,自适应且投机地把网页、报告、合同、PDF 等非结构化数据抽取为结构化形式。在 FanOutQA 基准上仅扩展每题一个相关问题,该方法在保持准确率的同时将成本降低 53%,且理想预结构化存储下推理比原方案便宜 28X。作者称这是面向智能体推理的下一代数据基础设施的第一步。
论文提出 Hi-Q,一种证据条件化的层次化查询细化框架,用于多跳问答中的可检索粒度发现问题。框架在查询节点用分辨率算子判断证据是否支持当前查询单元,未解决节点按依赖保持的二元算子扩展,并由语义覆盖验证器检查,查询树拓扑由语料支持信号决定。
一套可运行的 Colab 笔记本,面向 AI 工程师与 FDE 技能栈,用原始 API 而非框架构建基于基础模型的系统,覆盖提示词、RAG、评估、智能体、微调与服务化。全部在免费 Groq API 上运行,无需信用卡;LoRA 微调和自托管服务提供概念讲解及可选的 Colab-GPU 附录。包含三个端到端案例研究,且全程兼容 OpenAI API,模式可直接迁移。
推荐理由:裸 API 写一遍 agent 循环和 RAG,比直接套 LangChain 更能理解框架在封装什么,对于 AI 工程师面试中讲清系统设计和取舍有直接帮助。
该论文系统研究了零数据对话推荐系统(CRS)引导方法,从商品评论、元数据和用户-商品交互等非对话信号生成合成对话监督数据。论文比较了 Jensen-Shannon 多样性和 Fisher 信息两种选择策略,发现领域合成数据一致优于零样本提示和朴素合成基线,主动选择比随机采样更省数据,低资源场景下合成数据可超越稀缺真实对话并与之互补。
ContextPilot 提出一种面向长程智能体任务的主动上下文管理框架,通过扩充规划、长期记忆和软上下文卸载工具,并设计基于上下文与熵变化的细粒度 RL 方法,解决现有方法工具集受限、探索低效和信用分配粗糙的问题。在长上下文问答和深度搜索任务中,ContextPilot 以更紧凑的工作上下文取得更强性能,在多种基座模型和基准上持续优于现有基线。代码已开源。
Introducing Expert Intelligence ✨ A cross-@Google initiative that helps you engage with your trusted sources, starting with eligible @GooglePlay ebooks in Gemini Notebook. You can now combine expertise from your favorite authors with other sources and engage with your books in brand new ways! Try it out here: https://goo.gle/expertintelligence
Cohere 发布文档解析模型 Parse(parse-v5.0),基于 North-Micro-Vision-Instruct 架构,拥有 2.3B 参数、8,192-token 上下文窗口和约 4.6GB 体积,可将 PDF、PPT、JPEG 页面直接转为含 HTML 表格和边界框坐标的 Markdown,无需独立 OCR 阶段。