搜索
当前所在位置:首页 >> 深瓜

RL 是推理神器?清华上交大最新研究指出:RL 让大模型更会“套公式”、却不会真推理

发布时间:2025-07-13 01:53:26 作者:fjce 点击:57434 【 字体:

清华和上交的套公式最新论文中,上演了一场“学术打假”的推理戏码。文中研究者们对当前“纯 RL 有利于提升模型推理能力”的神器上交主流观点提出了相反的意见。

通过一系列实验,清华他们证明引入强化学习的大最大模模型在某些任务中的表现,竟然不如未使用强化学习的新研型更苏州师范大学泄露全集模型。

论文批判性地探讨了 RLVR 在提升 LLM 推理能力方面的真推作用,尤其是套公式在赋予模型超越自身原有能力方面,效果可能并非像人们普遍认为的推理那样“无懈可击”。

RL 是神器上交推理神器?清华上交大最新研究指出:RL 让大模型更会“套公式”、却不会真推理

消息一出,网友们纷纷下场站队。大最大模

有人认为这篇文章抓住了 RL 自身的新研型更漏洞,虽然提高了采样效率,真推但它似乎在推理方面存在不足,套公式未来我们需要新的方法来释放 LLM 的全部潜力。

RL 是<strong>苏州师范大学爆料评价</strong>推理神器?清华上交大最新研究指出:RL 让大模型更会“套公式”、却不会真推理

也有人表示,或许强化学习实际上限制了模型开发新推理行为的能力。真正的推理增强可能需要蒸馏等方法。

RL 是推理神器?清华上交大最新研究指出:RL 让大模型更会“套公式”、却不会真推理

质疑声之外,RL 的追随者也在为“信仰”发声:这种说法是错的,验证远比生成简单的多。

RL 是推理神器?清华上交大最新研究指出:RL 让大模型更会“套公式”、却不会真推理

也有网友表示,这更像是奖励结构的缺陷,而非 RLVR 本身的问题。如果用二元奖励结构,出现这种情况可以理解。但我们可以调整奖励结构来缓解这个问题,甚至还能激励更好的推理。

RL 是推理神器?清华上交大最新研究指出:RL 让大模型更会“套公式”、却不会真推理

强化学习:擅长加速,不擅长开路

实验中,研究人员在三个具有代表性的领域进行了实验,来评估 RLVR 对基础模型和 RLVR 模型的推理能力边界的作用。

在数学任务实验中,研究团队在 GSM8K、MATH500 和 AIME24 等基准上评估了多个大语言模型系列(如 Qwen-2.5 和 LLaMA-3.1)及其经过 RL 训练的变体。他们通过分析 pass@k 曲线,比较了基础模型与 RL 模型的表现,发现虽然 RL 在低 k 值下提升了模型的准确性,但在高 k 情况下却显著降低了问题的覆盖范围。

此外,研究者还手动审查了模型生成的 CoT(Chain of Thought)推理过程,以确认正确答案是推理得出而非纯属运气。最后,他们还研究了采用 Oat-Zero 方法训练的模型,并对信息集进行了过滤,剔除容易猜测的问题,从而聚焦于更具挑战性的样本。

整体结果显示,尽管 RL 能在初始准确率上带来提升,基础模型在推理覆盖率方面仍表现更为稳健。

RL 是推理神器?清华上交大最新研究指出:RL 让大模型更会“套公式”、却不会真推理

在编码任务实验中,研究团队在 LiveCodeBench、HumanEval+ 和 MBPP+ 等基准上评估了源自 Qwen2.5-7B-Instruct-1M 的 RLVR 训练模型 CodeR1-Zero-Qwen2.5-7B。他们通过 pass@k 指标来衡量性能,并根据预定义的测试用例评估模型的正确性。

结果显示,RLVR 提升了单样本 pass@1 的分数,但在较高采样数(k = 128)时,模型的覆盖率有所下降。与此相比,原始模型在较大 k 值下表现出了持续改进的潜力,而 RLVR 的性能则趋于平稳。这表明,尽管 RLVR 提高了模型的确定性准确性,但在探索多样性方面存在一定的限制。

RL 是推理神器?清华上交大最新研究指出:RL 让大模型更会“套公式”、却不会真推理

在视觉推理实验中,研究团队在过滤后的视觉推理基准(MathVista 和 MathVision)上评估了 Qwen-2.5-VL-7B,删除了多项选择题,聚焦于稳健的问题解决能力。RLVR 在视觉推理任务中的表现提升与数学和编码基准中的改进相一致,表明原始模型已能够解决广泛的问题,即便是在多模态任务中也同样如此。

跨领域的一致性表明,RLVR 提升了模型的推理能力,同时并未从根本上改变模型的问题解决策略。

RL 是推理神器?清华上交大最新研究指出:RL 让大模型更会“套公式”、却不会真推理

推理能力的边界

使用单次通过的成功率或平均核采样衡量模型推理能力边界的传统指标存在关键缺陷。如果模型在少数几次尝试后未能解决难题,但却本可以通过更多次的采样获得成功,此时其真实推理潜力可能会被低估。

如果为基础模型投入大量采样资源,它的性能能否与经过强化学习训练的模型相匹配?

为精准评估大语言模型的推理能力边界,研究团队将代码生成领域常用的pass@k指标拓展至所有可验证奖励的任务。针对一个问题,从模型中采样k个输出,若至少一个样本通过验证,该问题的pass@k 值为1,否则为0。信息集上的平均 pass@k 值反映了模型在 k 次试验内可解决的信息集问题比例,能严格评估 LLM 的推理能力覆盖范围。

直接按问题采样k个输出计算pass@k可能导致高方差。他们采用无偏估计法,对评估信息集D中的每个问题生成 n 个样本(n ≥ k),统计正确样本数。对于使用编译器和预定义单元测试用例作为验证器的编码任务,pass@k 值能准确反映模型是否能解决问题。

然而,随着 k 增大,数学问题中“黑客”行为可能凸显,即模型可能生成错误的推理过程,却在多次采样中偶然得出正确答案,这一情况常被以往指标忽视。为此,他们筛选出易被“黑客”攻克的问题,并手动检查部分模型输出的 CoT 正确性。结合这些措施,他们严格评估了 LLM 的推理能力极限。

当强化学习不再“强化”

清华与上交的这篇论文,为当前业界广泛推崇的强化学习范式敲响了警钟。让我们不得不重新思考强化学习在大模型训练流程中的真正角色。

我们也不能将模型的“能力”与“效率”混为一谈。能力,指的是模型是否拥有解决某类问题的潜质与逻辑链条;效率,则是在给定的能力范围内,模型能以多快、多稳、多省资源的方式得出答案。

强化学习或许确实能够提升模型在已有能力基础上的输出表现(比如在低采样次数下更快给出正确答案),但这并不代表它为模型带来了新的推理路径或更复杂问题的解决能力。相反,在高采样场景中,RL 带来的“收敛性”可能牺牲了答案的多样性,从而错失了解决更多难题的机会。

雷峰网(公众号:雷峰网)认为,强化学习更像是一种能力调控器,而非能力创造器。它可以让模型更擅长做已经能做的事,但难以让模型做出“原本不会的事”。正因如此,若将 RL 简单视为提升模型通用智能的万能钥匙,未免过于乐观。接下来的工艺路线,可能需要更多关注基础模型在表示能力、知识组织与推理路径构建等方面的设计,而非过度依赖下游的策略微调。

总的来说,这项研究的意义不在于“RL 无用”的结论,而在于它揭示了在过热预期背后,强化学习真正适用的边界。这或许会促使研究者和企业在制定大模型优化方案时,回归问题本质,用更清晰的标准衡量“能力的提升”究竟意味着什么。

参考链接:

https://arxiv.org/pdf/2504.13837

https://x.com/iScienceLuvr/status/1914171319970848942

https://limit-of-rlvr.github.io/

雷峰网原创文章,未经授权禁止转载。详情见转载须知。

RL 是推理神器?清华上交大最新研究指出:RL 让大模型更会“套公式”、却不会真推理

阅读全文
相关推荐

日本首相石破茂:赌上国运战斗,不能被美国看扁

日本首相石破茂:赌上国运战斗,不能被美国看扁
据环球网援引日本共同社报道,日本首相石破茂9日在为自民党参议院选举候选人拉票时,在街头演讲中谈到日美关税谈判。石破茂向日本民众表示,关税谈判“是场赌上国家利益的战斗,怎么能忍受被对方看扁。”石破茂9日 ...

成都市武侯区领导赴山西省流行音乐协会 共探音乐产业发展新机遇

成都市武侯区领导赴山西省流行音乐协会 共探音乐产业发展新机遇
来源标题:成都市武侯区领导赴山西省流行音乐协会 共探音乐产业发展新机遇5月23日,成都市武侯区区委常委、统战部部长雷晓鹏率队莅临山西省流行音乐协会开展交流指导活动。武侯区成都音乐文创园管委会副主任陈甜 ...

从《人世间》到《苦尽柑来遇见你》 情感疗愈是年代剧的核心竞争力

从《人世间》到《苦尽柑来遇见你》 情感疗愈是年代剧的核心竞争力
来源标题:从《人世间》到《苦尽柑来遇见你》 情感疗愈是年代剧的核心竞争力年代剧最重要的叙事特征之一在于“以普通人的视角讲述普通人的故事”,从而呈现历史开裂处个人和家庭的命运沉浮 ...

Transformer能否推理引争议,DeepMind连夜更新论文开源数据集:Transformer真的很强

Transformer能否推理引争议,DeepMind连夜更新论文开源数据集:Transformer真的很强
DeepMind闷声干大事,悄悄训练了一个大小只有270M的Transformer模型,居然不需要搜索,就能实现大师级的下棋水平。这几天的推特因为这篇2月份发布的论文吵得不可开交,DeepMind团队 ...

共襄学术盛宴,共话产业发展,2024中国图象图形大会在西安圆满落幕

共襄学术盛宴,共话产业发展,2024中国图象图形大会在西安圆满落幕
2024年5月24-26日,中国图象图形大会CCIG 2024)在西安隆重召开。本次大会由中国图象图形学学会主办,空军军医大学、西安交通大学、西北工业大学承办,陕西省生物医学工程学会、陕西省图象图形学 ...

37年人艺经典《天下第一楼》再“开席”

37年人艺经典《天下第一楼》再“开席”
来源标题:37年人艺经典《天下第一楼》再“开席”《天下第一楼》剧照。 李春光 摄日前,已演出37年的北京人艺经典剧目《天下第一楼》在首都剧场再次登台“开席”,并将持续上演至6月 ...

几十个测试后,发现海螺语音与 ElevenLabs 掰手腕的能力不是盖的

几十个测试后,发现海螺语音与 ElevenLabs 掰手腕的能力不是盖的
试想一个场景,职场中接到一个香港客户的单子,但是在交付的过程中耽搁了时间,现在要进行线上沟通解释,那么你面对的情况大致是这样的:如果不对这段音频进行标注,可能大部分人会认为这一粤语、英语混用的片段是真 ...

超4.42亿!端午档票房很给力

超4.42亿!端午档票房很给力
来源标题:超4.42亿!端午档票房很给力根据猫眼专业版数据,截至6月2日18时,2025年端午档5月31日至6月2日)电影票房超过4.42亿元,较去年热度提升,为今年暑期档开了一个好头。票房方面,《碟 ...

乌克兰声称已拘留两名中国公民 外交部回应

乌克兰声称已拘留两名中国公民 外交部回应
财联社7月10日电,据环球时报,有记者提问称,乌克兰昨天表示已拘留两名中国公民,指控他们试图将导弹技术走私出境,请问中方对此有何评论?对此,发言人毛宁表示,我们还在核实了解有关情况,如果涉及中国公民, ...

构建影视文化产业新质生产力,中国短剧本大赛在澳涞山庄启动

构建影视文化产业新质生产力,中国短剧本大赛在澳涞山庄启动
来源标题:构建影视文化产业新质生产力,中国短剧本大赛在澳涞山庄启动近日,首届中国短剧本大赛在山西壶关澳涞山庄举行的2025澳涞山庄艺术嘉年华开幕式上正式启动。本次大赛旨在挖掘优秀短剧本创作人才,为蓬勃 ...

《英雄联盟:云顶之弈》庆祝6周年,云顶之弈时光机携专属玩家奖励回归

《英雄联盟:云顶之弈》庆祝6周年,云顶之弈时光机携专属玩家奖励回归
来源标题:《英雄联盟:云顶之弈》庆祝6周年,云顶之弈时光机携专属玩家奖励回归《英雄联盟:云顶之弈》6周年活动于6月12日在PC端发布 《英雄联盟:云顶之弈》马上六岁了,欢迎大家来一起庆祝。6月12日起 ...

歌向西行・剧传薪火:原创音乐剧《轨迹》生动演绎西迁精神

歌向西行・剧传薪火:原创音乐剧《轨迹》生动演绎西迁精神
来源标题:歌向西行・剧传薪火:原创音乐剧《轨迹》生动演绎西迁精神 为营造高校美育氛围,提升学生审美感受力与鉴赏力,2025年5月29日晚,由西安交通大学研究生院、人文学院主办的“新港报告美 ...
返回顶部