清华大学自动化系团队在第39届神经信息处理系统会议上获论文亚军奖
2025/12/15
12月6日,在美国圣地亚哥举行的第39届神经信息处理系统会议(Conference on Neural Information Processing Systems,NeurIPS)上,清华大学自动化系宋士吉教授、黄高副教授团队的论文“强化学习是否真的能激发大语言模型产生超越基础模型的推理能力?”(Does reinforcement learning really incentivize reasoning capacity in LLMs beyond the base model?)获得最佳论文亚军奖(Best Paper Runner-Up Award)。
获奖合影(中间三位为自动化系获奖学生)
获奖证书
评审委员会对该论文的评价为:“本文针对大语言模型(LLM)研究中一个被广泛接受的基础性假设——带有可验证奖励的强化学习(RLVR)激发了大模型新的推理能力——给出了一种精妙且至关重要的否定性发现。研究表明,在不同的模型类型、任务和算法中,RLVR训练虽能提高正确输出的采样效率,却无法拓展基础模型已有的推理能力。强化学习缩小了探索范围,受奖励的轨迹得到强化,但更广泛的解决方案空间却缩小了。这表明RLVR是在基础分布范围内进行优化,而非超越基础分布。这是一项重要发现,有望激励人们研发全新的强化学习范式,使其能够应对广阔的动作空间,并真正拓展大语言模型的推理能力。”
论文两位共同第一作者分别为清华大学自动化系2021级博士生乐洋和2022级本科生陈之琪。
NeurIPS是人工智能领域的旗舰学术会议之一,其最佳论文奖旨在表彰在机器学习、人工智能及相关领域中具有卓越创新性、重大影响力并能推动学术前沿发展的研究工作。
文章来源清华大学,分享只为学术交流,如涉及侵权问题请联系我们,我们将及时修改或删除。
-
2026年1月高含金量国际学术会议合 12-12
-
第四届金融科技与商业分析国际学术会议 686
-
2026年第十一届复合材料与材料工程 1453
-
2025年机器视觉、智能成像与模式识 2126
-
2025年智能光子学与应用技术国际学 3284
-
2026年机械工程,新能源与电气技术 3476
-
2025年计算机科学、图像分析与信号 3917
-
2025年材料化学与燃料电池技术国际 3633
-
2026年交通数字化、人工智能与韧性 12-19
-
2026年社会文化与公共管理国际会议 12-19
-
2026年人文地理与语言研究国际会议 12-19
-
2026年社会发展与经济发展国际会议 12-19
-
2026年光伏材料、光电转换与可再生 12-19
-
2026年可持续发展与数字化社会国际 12-19
-
2026年管理科学、语言与教育国际会 12-19
-
2025年两院院士增选有效候选人2672
-
2025最新JCR分区及影响因子7552
-
好学术:科研网址导航|学术头条分3540
-
2025年国际期刊预警名单发布!3510
-
2025年中科院期刊分区表重磅发13412
-
中国科协《重要学术会议目录(207866
-
吉林大学校长张希:学术会议中的提4517
-
中国科大提出电化学一体化驱动策12-19
-
中国科大实现电泵浦片上集成高亮度12-19
-
西北农林科技大学【陕西新闻联播】12-19
-
中国科大实现片上非相干泵浦高品质12-19
-
中国科大中性原子量子计算研究成果12-19
-
炔烃远端C-O键的不对称活化转化12-19
-
研究揭示叶片内生真菌分子功能多样12-19
-
科研人员提出柑橘黄龙病防控新策略12-19
-
中国环境科学学会 24021

-
中国电子商务案例中心 2244

-
中国疾病预防控制中心性病控制中心 21077

-
武汉数字电影放映机租赁公司 2228

-
西安科技大学 23317

-
江苏省医学会 21161

-
WILL 24207

-
鼎迈信息技术公司 18184

-
工程信息研究院 18069

-
沈阳博思教育 21119

-
湖州师范学院 23130

-
FEAFEWA 24591

-
上海电子信息 23233

-
香港科学与工程研究中心 23135

-
百奥泰国际会议(大连)有限公司 21101

-
哈尔滨医科大学 2498

-
天津市科学技术信息研究所 18195

-
河南理工大学 23193

-
山东飞鲨国际展览有限公司 8065

-
昆明理工大学 2160

















56











































