当模型看见了自己的错误,为什么还是改不了?

一个反直觉的事实:你给多模态大模型一张表格图片,让它指出某个单元格的像素坐标。它指错了。然后你把刚才指错的位置用红点标在图上,把这张"反馈图"塞回给它,说:"你看看,你指到哪儿去了?再想想。"——你期待它幡然醒悟、修正坐标。结果呢?在 Qwen2.5-VL-3B 的多轮实验中,77.3% 的样本里,模型只是把上一次的错误坐标原封不动地又说了一遍。换成更难的外推任务(Cell Query,即查找表格内部单元格),这个重复率飙升到 86.1%。也就是说,模型看着自己指偏的红点,嘴上说"我重新考虑一下",手上却纹丝不动。
更讽刺的是,让模型多"反思"几轮不仅没有提升,反而拉低了准确率——零样本单轮提示的分布内准确率是 5.3%,多轮"反思"提示变成了 5.6%,几乎没变,但多出来的轮次全是无效劳动。到了分布外任务上,单轮 6.0% 的 OOD 平均准确率在多轮模式下跌到了 4.5%。提示模型反思,竟然越反思越差。
这就是 Tang、Yin 和 Durrett 在论文中揭示的核心困境:现有多模态模型缺少一种关键能力——视觉锚定的自我修正(visually grounded self-reflection)。它们能"看见"视觉反馈,但无法将看到的反馈转化为有意义的纠错行动。
谜题:为什么"看见错误"不等于"改正错误"?
设一个谜题:一个大模型,明明拥有视觉编码器,明明能识别图片里的文字和图形,明明能在对话中流畅地描述图片内容——为什么当我们在它指错的地方画个红点,它却"视而不见"?
研究者的排除法给出了三条线索。
第一条排除:不是模型不够大。 他们测试了 Qwen2.5-VL-3B 和 7B,也测了专门训练过文本反思链的 VL-Rethinker-7B 和 32B。7B 的单轮零样本 OOD 平均准确率不过 8.8%,多轮模式下也是 8.8%——完全没有反思增益。VL-Rethinker-32B 稍好(OOD 平均 22.1%),但它的反思链几乎无法在分布外任务上产生有意义的纠正。模型尺寸翻了四倍以上,问题依旧。
第二条排除:不是"不会反思格式"。 研究者用多轮监督微调(Multi-SFT)显式教模型反思的格式——先输出一个错误坐标,再看反馈图,然后逐步修正直至正确。训练完后,模型确实学会了"看起来像反思"的输出格式。但一到分布外测试——大表格(Large Table)上 50.4% 准确率,柱状图(Bar Chart)上仅 13.1%——和单轮 SFT(46.1% 和 25.7%)相比,多轮训练甚至在某些任务上还更差。格式学会了,能力没跟上。
第三条排除:不是"强化学习天然就够"。 标准 GRPO 强化学习(只给最终答案对错的稀疏奖励)应用到多轮模型上后,出现了一个致命现象——在空间导航任务中,模型的平均轮数从 2.41 骤降到 2.00,意味着反思行为被彻底压制了。标准 RL 追求效率和正确率,发现直接给正确答案比多轮修补更"划算",于是模型学会了"闭嘴直接答"。反思消失了。
三条路都走不通。那么问题到底出在哪?

解锁:两个核心困境
经过层层排除,研究者将问题聚焦到两个本质困境上。
困境一:奖励信号的结构性错位。 标准强化学习只在轨迹末尾给奖励——答对了 1 分,答错了 0 分。这意味着中间每一步的"靠近目标"的修正努力都得不到训练信号。你从离目标 200 像素修正到 50 像素,跟从 200 修正到 180,在稀疏奖励视角下完全一样——都是"没答对"。模型没有动机去做"部分改善",因为它感受不到渐进的进步。
困境二:失败样本的自然枯竭。 这是更深层的问题。当策略通过 RL 不断优化后,模型犯错的频率越来越低,训练数据中的"失败状态"也就越来越少。但反思能力恰恰需要在失败状态中练习——你得先犯错,才能学会怎么从错误中恢复。一个越来越不会犯错的模型,就越来越没有机会练习纠错。
这两个困境彼此纠缠:稀疏奖励让模型不愿意反思,策略优化让模型不需要反思。结果就是,即使给模型装上视觉反馈的"后视镜",它也从来不看。

方法:VRRL 的三件武器
研究者提出了一个叫 VRRL(Visual Reflection RL)的训练方案,用三个彼此配合的机制来破解上述困境。
武器一:Random Turn Masking——"我不看你怎么摔的,只看你怎么爬起来"
精确技术描述: 在多轮轨迹上,RTM 随机采样一个起始轮次 k(从均匀分布中抽取),只对从 k 到终点 T 的后缀计算策略梯度更新,前缀轮次不参与梯度计算。但前缀轮次决定了第 k 轮的状态条件——也就是说,模型确实处于一个"可能已经犯过错"的状态中,但它不需要为"犯错的过程"被惩罚,只需要为"从当前状态出发的恢复质量"负责。
日常场景类比: 想象一个体操教练。运动员在平衡木上做了一个蹩脚的前空翻,落地时踉踉跄跄。传统 RL 教练会说:"你整个动作串,从起跳到落地,全部重练。"RTM 教练则会随机挑一个时刻——比如"从你落地后那一秒开始,后面的衔接动作我打分,前面摔成什么样我不管。"运动员不需要纠结自己为什么起跳角度偏了 3 度,只需要专注在"情况已经这样了,我怎么把后面的动作做好"。
回到技术揭示意义: 这种设计蕴含了一个微妙的权重分配。从数学上看,每个第 t 轮对梯度的有效贡献权重正比于 t/T——越靠后的轮次,权重越大。这意味着修正和反思步骤天然获得了比初始探索步骤更强的优化信号。研究者不想训练模型"怎么犯错",只想训练模型"怎么纠错"。RTM 通过一种优雅的掩码机制,把这两个目标干净地分开了。
武器二:Buffered Roll-In——"把你最丢人的失误存起来,反复练"
精确技术描述: 维护一个容量为 500 条前缀的重放缓冲区。每次在线生成轨迹时,如果最终答案错误,就把终止动作之前的前缀存入缓冲区。训练时,以概率 1-ρ=1/3 从缓冲区采样失败前缀,让模型从这些"烂摊子"状态出发继续生成并完成轨迹。为防止模型只学会"永远不终止",缓冲区中强制保持 30% 的正确状态前缀。
日常场景类比: 想象一个棋手在准备比赛。他把自己过去半年所有"中局崩盘"的棋局保存了一个档案库。每次训练时,他不是从头下一盘新棋,而是随机抽一盘中局残局,从那个已经快输的位置开始,练怎么翻盘。而且他还强制保留 30% 的"优势残局"来练怎么稳稳收官——否则他会变成一个永远不敢认赢、反复折腾的多疑棋手。
回到技术揭示意义: 这个机制解决了"失败样本自然枯竭"的问题。因为缓冲区是 FIFO 队列且容量很小,里面的失败状态始终反映的是当前策略的能力边界——模型正在努力但还搞不定的那类状态。这形成了一个自适应的难度课程:策略越强,缓冲区里累积的失败模式就越"刁钻"。
武器三:Reflection Reward——"走近一步也有奖励"
精确技术描述: 反思奖励基于一个双高斯距离势函数,包含粗粒度和细粒度两个尺度的信号。只取非负改进部分,避免负奖励压制反思尝试。最终奖励 = 格式奖励(0.1) + 0.9·max(0, 反射改进),答对时奖励上限为 1.0。
日常场景类比: 你教小朋友投篮。传统教练只在球进篮筐时说"好球"(1 分),其他时候沉默(0 分)。VRRL 的反思奖励教练会说:"刚才打在篮板上弹回来,比上次三不沾进步了,0.3 分;这次碰到篮筐了,0.5 分;下次再瞄准一点。"他不会因为你这次没投进而惩罚你——惩罚进步只会让你不敢尝试。
回到技术揭示意义: 双高斯设计很精妙。宽高斯在距离很远时也能提供梯度信号,引导模型从"完全指偏"走向"大致区域";窄高斯在靠近目标时提供精细调整信号。消融实验表明,仅反射奖励一项就将 OOD 平均准确率从 40.0% 提升到 42.7%。

三件武器的协同效应
单独看,每件武器都有缺陷。RTM 单独使用时,OOD 平均准确率从基线 40.0% 降到了 37.5%。Buffered Roll-In 单独使用时更糟:模型几乎完全丧失了多轮反思行为,退化为单轮模式。
但 RTM 和 Buffered Roll-In 组合使用时,奇迹发生了:单轮退化的趋势被逆转,多轮反思行为恢复并增强。再加上反思奖励,全量 VRRL 达到 45.7%——比单轮 RL(30.1%)高出了整整 15.6 个百分点。
在空间导航任务上,协同效应更明显。Qwen2.5-VL-3B 的 OOD 平均准确率从多轮 SFT 的 25.9% 跃升到 VRRL 的 39.2%。

Big Picture 反转:这篇论文真正在说什么?
表面上看,这是一篇关于"让视觉语言模型学会自我反思"的论文。读完之后你会发现,它的真正贡献不在视觉、不在反思,而在强化学习的课程设计哲学。
研究者揭示了一个深刻的悖论:一个在训练中表现越好的策略,反而越难学会它最需要的能力——从失败中恢复。 因为好的策略天然地减少了失败的发生频率,而恢复能力恰恰需要在失败中锤炼。
VRRL 的三件武器——RTM、Buffered Roll-In、Reflection Reward——本质上不是三个独立的技术改进,而是一个完整的反脆弱训练系统:RTM 确保模型不因犯错而被惩罚,解除"不敢动"的心理枷锁;Buffered Roll-In 确保失败状态不会因策略优化而消失,维持"必须练"的难度供给;Reflection Reward 确保每一次靠近目标都被看见,提供"往前走"的渐进指引。
这个框架的普适性远不止于视觉任务。任何需要从中间错误状态中恢复的序列决策问题——代码调试、数学证明、对话纠偏——都可能面临同样的困境。
诚实边界
论文证明了五件事: VRRL 在视觉定位上 3B OOD 从 6.0% 提升到 45.7%,7B 从 8.8% 到 78.4%。三组件全量组合最优。多轮反思增益来自逐步修正。标准 RL 压制反思。零样本提示无效。
没证明六件事: 仅 Qwen 系列模型。最大 7B。合成任务不可泛化到真实场景。因果性未验证。反思奖励依赖任务特定设计。计算成本未分析。
终章:反思的价值不在反思本身
研究者最后展示了一个耐人寻味的现象:VRRL 训练的模型会根据任务难度自适应地调整反思轮数。对于简单表格平均 2.37 轮,大表格延长到 3.39 轮,全新视觉域会持续修正更多轮次。它学会了"什么时候需要多想几遍"和"什么时候该收手"。
这才是自我反思的最高境界——不是机械地多轮迭代,而是有判断力地决定是否继续。在一个越来越痴迷于"让模型多想几步"的时代,这篇论文提醒我们:多想几步不是目的,想得准、在该停的时候停,才是。
本文基于 arXiv 2607.02490v1 "Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning" (Liyan Tang, Fangcong Yin, Greg Durrett, 2026) 撰写。