HuggingFace Daily Papers·· 3 天前AI 评分33
LLM-as-Jev:LLM 已是 Jev 式决策模型——何时以及如何微调
LLM-as-Jev: LLMs Are Already Jev-Style Decision Models -- When and How to Fine-Tune Them
AI 导读
研究提出 LLM-as-Jev 框架,通过下一 token 在方括号数字标识上的概率直接提取校准决策,无需生成自由文本。在 Qwen3.5-4B 和 Qwen3-0.6B 上,4B 模型免训练即匹配同骨干的社区 Jev 式模型,并原生支持图像多模态决策;微调仅对弱模型和特定任务(如多选项意图路由)收益明显,KL 锚定可防止对话生成能力退化,LoRA 在强模型上表现最佳。
来源:HuggingFace Daily Papers · arxiv.org