跳到正文

#RAG

今日 0 条
9月16日周三
  1. LlamaIndex:产品、工程与评测54

    LlamaIndex:为什么更好的抽取模型并不能缩小你的文档复核队列

    LlamaIndex 发文分析 OCR 文档处理中准确率与自动化率的关系,指出路由门控而非读取能力决定直通处理率。文中算例显示 20 个字段的发票在 97% 每字段准确率下仅约 54% 文档全对,94% 准确率但带每字段置信度的 Pipeline B 可自动放行 92% 文档,而 97% 准确但无信号的 Pipeline A 直通率为 0。

8月31日周一
8月30日周日
8月3日周一
  1. LlamaIndex:产品、工程与评测63

    LlamaIndex 解析 LLM OCR:错误更安静了,但没有更少

    LlamaIndex 发布长文分析 LLM OCR 的核心风险:视觉证据弱时语言先验主导,模型会把读不清的数字替换成流畅但错误的值,或静默截断长表格,且没有逐字符置信度可供设阈值。

    推荐理由:原文拆解了 LLM OCR 的静默失败模式,并给出字段级溯源、验证循环等可落地的系统设计方法。

7月17日周五
6月10日周三
  1. ginobefun64

    Anthropic发布Claude Fable 5与Mythos 5,输入$10/M、输出$50/M,5%高风险请求降级到Opus 4.8,药物设计加速10倍。ServiceNow发布语码转换ASR基准,覆盖4组语言对、7个ASR系统,Scribe V2、Gemini 3 Flash和AssemblyAI表现最稳。Salesforce从20,000个Agentforce企业客户总结:支持Agent处理3百万次对话,上线后运营是难点。

    引用ginobefun@hongming731

    http://x.com/i/article/2064485562875260928

6月5日周五
  1. ginobefun59

    本期早报聚焦三则动态:OpenAI发布ChatGPT dreaming V3,记忆架构重写为“写入时合成”,效率提升5倍,免费用户可用个性化记忆摘要;阿里云工程师落地LLM-Wiki模式,从传统RAG转向“写入时合成”知识库,封装五大研发技能包实现PRD到全自动研发;SpaceX招股书披露与Anthropic签订450亿美元算力合同,每月12.5亿美元至2029年5月,年收入增加80%,并持有18712枚比特币。记忆与知识库的“写入时合成”成共同范式。

  2. ginobefun60

    今日早报推荐三篇AI相关文章:① ChatGPT升级记忆系统,可自动整理用户对话历史并记住偏好,无需反复提示,免费用户也可使用。② 阿里云工程师分享实战经验,将团队代码库和文档整理成AI可直接调用的知识库,搭配专项技能包,目标是只需给出需求文档即可由AI完成后续工作。③ SpaceX招股书解读中透露,Anthropic每月支付12.5亿美元购买算力,该数字反映其大规模AI训练与推理的算力需求。

6月1日周一
  1. Rohan Paul62

    该论文评估了商业AI聊天机器人作为新闻中介的能力。研究发现,当以多选题形式提问时,最佳系统对数小时前新闻的准确率已超过90%,这表明检索增强生成技术正从静态知识库迈向实时信息处理。然而,这种高准确性并不稳定。当要求系统自由生成回答、新闻为印地语,或用户提问包含错误预设时,其表现显著下降。超过70%的错误源于检索失败或来源偏差,即系统检索到了近似但不精确的信息,随后基于错误的来源、语言或时间戳生成了回答。论文标题为《Evaluating Commercial AI Chatbots as News Intermediaries》(arxiv.org/abs/2605.22785)。

5月31日周日
5月26日周二
  1. LlamaIndex:产品、工程与评测52

    LlamaIndex 撰文分析 grep 与语义搜索在 Agent 场景下的取舍

    LlamaIndex 发文回应 grep 可取代语义搜索和 RAG 的观点,指出 grep 适合小型纯文本语料,但无法读取 PDF 等非结构化文档,且在百万级语料下延迟、召回和信噪比全面失效。文章建议分层方案:用 LlamaParse 或 LiteParse 解析非结构化文档,再以语义索引支撑大规模检索,同时保留 grep 用于精确匹配场景。

3月3日周二
  1. LlamaIndex:产品、工程与评测61

    LlamaIndex:不止是 RAG 框架,转向智能体文档处理

    LlamaIndex 官方宣布公司使命收窄为构建智能体文档处理基础设施(OCR、抽取与工作流),不再定位为单纯的 RAG 框架。

    推荐理由:官方复盘了通用 LLM 框架价值下降的原因,并说明转向文档基础设施的动机和产品布局,读者可借此理解框架类公司的转型逻辑。

10月1日周三
7月11日周五
4月20日周日
  1. Eugene Yan:Writing52

    Eugene Yan:LLM-as-Judge 救不了产品,修复评估流程才行

    Eugene Yan 撰文指出,靠加评估工具、指标或 LLM-as-judge 不能拯救 AI 产品,评估应是用科学方法驱动产品改进的实践。他给出从观察数据、标注 50:50 通过与失败样本、假设失败原因、设计对照实验到量化分析的循环,并主张先写评估再开发功能的 eval-driven development,同时强调自动评估器只能放大而非替代人工标注与反馈监督。

3月24日周一
12月22日周五
10月15日周日
  1. Eugene Yan:Writing58

    Eugene Yan 复盘首届 AI Engineer Summit:评测与服务成本是 LLM 部署最大痛点

    Eugene Yan 参加在旧金山举行的首届 AI Engineer Summit 并分享 LLM 系统构建演讲,总结出多条要点。Amplify Partners 超 800 份问卷显示评测(evals)与服务成本是部署最大痛点;assert 断言确定但脆弱,用第三方 LLM 评分则规模化后成本高,团队用 VCR.py 缓存应对;代码生成因可直接运行验证而最易评测。