GPT-6 在多模态模型容易出现 “Look Light, Think Heavy” 的问题上越来越明显了,用解释代替观看也是人类常犯的错误
看图越来越浅,语言推理越来越长,都是基于语言的自迭代和解释而脱离视觉本身,这在对 image 2.5 的使用里明显干扰和脱节
这个问题的提出来自论文:Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do
论文《Look Light, Think Heavy》指出多模态模型存在"看轻想重"问题:看图越来越浅、语言推理越来越长,靠语言自迭代和解释脱离视觉本身。GPT-6 上这一现象越来越明显,在 image 2.5 的使用中造成明显干扰与脱节,作者认为用解释代替观看也是人类常犯的错误。
论文《Look Light, Think Heavy》指出多模态模型存在"看轻想重"问题:看图越来越浅、语言推理越来越长,靠语言自迭代和解释脱离视觉本身。GPT-6 上这一现象越来越明显,在 image 2.5 的使用中造成明显干扰与脱节,作者认为用解释代替观看也是人类常犯的错误。
GPT-6 在多模态模型容易出现 “Look Light, Think Heavy” 的问题上越来越明显了,用解释代替观看也是人类常犯的错误
看图越来越浅,语言推理越来越长,都是基于语言的自迭代和解释而脱离视觉本身,这在对 image 2.5 的使用里明显干扰和脱节
这个问题的提出来自论文:Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do
来源:-Zho-· x.com