跳到正文
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-05-19精选AI 评分74

优化_anything:通用文本参数优化API

optimize_anything: A Universal API for Optimizing any Text Parameter

AI 导读

该研究提出了一种基于大语言模型的通用文本优化系统,将优化问题统一表述为通过评分函数改进文本产物。在六项任务中达到最优结果:智能体架构使Gemini Flash在ARC-AGI上的准确率从32.5%提升至89.5%;调度算法降低40%云成本;87%的CUDA内核匹配或超越PyTorch表现;圆包装问题超越AlphaEvolve。实验表明,可操作的附加信息比仅使用分数反馈收敛更快、得分更高;多任务搜索通过跨任务迁移学习,在同等预算下优于独立优化,且任务数量越多收益越大。该工作首次证明基于LLM的文本优化是通用问题解决范式,能统一传统领域特定算法。系统已开源,支持多种后端。

推荐理由

让一个LLM同时优化agent架构、调度算法和CUDA内核,还能将ARC-AGI从32%拉到89%,这可能是今年最突破认知的通用问题求解范式,做agent的人必须看。

正文 · AI 翻译
摘要:一个基于大语言模型的单一优化系统,能否在截然不同的领域匹敌专用工具?我们证明,当优化问题被表述为改进由评分函数评估的文本工件时,一个单一的基于AI的优化系统——支持单任务搜索、具有跨问题迁移能力的多任务搜索,以及对未见输入的泛化——能够在六个不同任务上取得最先进的结果。我们的系统发现了使Gemini Flash的ARC-AGI准确率几乎翻三倍(从32.5%提升至89.5%)的智能体架构,找到了将云成本削减40%的调度算法,生成了87%匹配或超越PyTorch的CUDA内核,并超越了AlphaEvolve报告的圆填充解决方案(n=26)。跨三个领域的消融实验表明,与仅提供分数反馈相比,可操作辅助信息能带来更快的收敛速度和显著更高的最终得分;并且,在给定每个问题预算相同的情况下,通过跨任务迁移,多任务搜索优于独立优化,其收益随相关任务数量的增加而扩大。综合来看,我们首次证明,基于大语言模型搜索的文本优化是一种通用的问题解决范式,将传统上需要领域特定算法的任务统一在单一框架之下。我们作为GEPA项目的一部分,在以下网址开源了支持多种后端的optimize\_anything:此 https URL 。
评论:
主题: 计算与语言 (cs.CL);人工智能 (cs.AI);机器学习 (cs.LG);神经与进化计算 (cs.NE);软件工程 (cs.SE)
MSC分类: 68T05, 68T07, 68T20, 68T50, 68W50, 90C26, 90C59, 52C15
ACM分类: I.2.6; I.2.7; I.2.8; I.2.11; D.1.2; D.2.2; G.1.6; F.2.2
引用方式: arXiv:2605.19633 [cs.CL]
  (或本版本的 arXiv:2605.19633v1 [cs.CL])
  https://doi.org/10.48550/arXiv.2605.19633

arXiv 通过 DataCite 发布的 DOI

期刊参考文献: ACM人工智能与智能体系统会议论文集(CAIS 26),2026年5月26-29日,美国加利福尼亚州圣何塞
相关DOI: https://doi.org/10.1145/3786335.3813167

链接到相关资源的DOI

提交历史

来自:Lakshya A Agrawal [

2026年5月19日,星期二,10:18:12 UTC(3,492 KB)

获取论文:

license icon

当前浏览上下文:

cs.NE

参考文献与引用

书签

BibSonomy Reddit

文献目录与引用工具

本文相关的代码、数据与媒体

演示

推荐与搜索工具

arXivLabs:与社区合作者共同开展的实验性项目

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org