清华大学自动化系团队在第39届神经信息处理系统会议上获论文亚军奖
2025/12/15
12月6日,在美国圣地亚哥举行的第39届神经信息处理系统会议(Conference on Neural Information Processing Systems,NeurIPS)上,清华大学自动化系宋士吉教授、黄高副教授团队的论文“强化学习是否真的能激发大语言模型产生超越基础模型的推理能力?”(Does reinforcement learning really incentivize reasoning capacity in LLMs beyond the base model?)获得最佳论文亚军奖(Best Paper Runner-Up Award)。
获奖合影(中间三位为自动化系获奖学生)
获奖证书
评审委员会对该论文的评价为:“本文针对大语言模型(LLM)研究中一个被广泛接受的基础性假设——带有可验证奖励的强化学习(RLVR)激发了大模型新的推理能力——给出了一种精妙且至关重要的否定性发现。研究表明,在不同的模型类型、任务和算法中,RLVR训练虽能提高正确输出的采样效率,却无法拓展基础模型已有的推理能力。强化学习缩小了探索范围,受奖励的轨迹得到强化,但更广泛的解决方案空间却缩小了。这表明RLVR是在基础分布范围内进行优化,而非超越基础分布。这是一项重要发现,有望激励人们研发全新的强化学习范式,使其能够应对广阔的动作空间,并真正拓展大语言模型的推理能力。”
论文两位共同第一作者分别为清华大学自动化系2021级博士生乐洋和2022级本科生陈之琪。
NeurIPS是人工智能领域的旗舰学术会议之一,其最佳论文奖旨在表彰在机器学习、人工智能及相关领域中具有卓越创新性、重大影响力并能推动学术前沿发展的研究工作。
文章来源清华大学,分享只为学术交流,如涉及侵权问题请联系我们,我们将及时修改或删除。
-
2026年4月高录用检索快国际学术会 32
-
2026年第六届计算机、控制和机器人 102
-
2026资源、化学化工与应用材料国际 1529
-
2026年人工智能教育技术与数据科学 535
-
2026年图像处理与数字创意设计国际 1294
-
2026年机械工程,新能源与电气技术 5759
-
2026年材料科学、低碳技术与动力工 1546
-
2026年第二届无线与光通信国际会议 2307
-
2026年增材制造、3D打印与创新设 03-13
-
2026年车辆工程与新能源汽车国际会 03-13
-
2026年精密机械、仪器仪表与传感技 03-13
-
2026年机器人技术、智能装备与自动 03-13
-
2026年通信系统、网络与信号处理国 03-13
-
2026年智能制造、工业互联网与数字 03-13
-
2026年环境治理、生态修复与碳中和 03-13
-
2026年中科院期刊分区表(新锐10
-
2025年两院院士增选有效候选人4281
-
2025最新JCR分区及影响因子11266
-
好学术:科研网址导航|学术头条分5427
-
2025年国际期刊预警名单发布!5541
-
2025年中科院期刊分区表重磅发18728
-
中国科协《重要学术会议目录(2011157
-
吉林大学校长张希:学术会议中的提6696
-
中国科大研制出机器人灵巧手指尖六03-11
-
研究揭示遗传多样性如何重塑微生物03-11
-
研究发现双酰胺类杀虫剂影响蜜蜂蜂03-11
-
研究揭示聚焦光场中内禀自旋纹理03-11
-
新型磁流体机器人破解临床难题03-11
-
南京大学物理学院温锦生课题组在亚03-11
-
南京大学物理学院高力波、袁国文团03-11
-
浙江工业大学机械工程学院化工机械 23366

-
广州市锐博生物科技有限公司 2468

-
中金岭南韶关冶炼厂 18299

-
航天长征火箭技术有限公司 8286

-
武汉大学 18518

-
上海邦临软件工程技术有限公司 18429

-
百奥泰国际会议有限公司 2353

-
北海环球 18349

-
百奥泰国际会议(大连)有限公司+ 24319

-
AUIT 23269

-
北京河之声速记服务中心 18395

-
济南大学材料学院 21202

-
暨南大学 23435

-
龙岩学院 8357

-
珠海铭鼎科技有限公司 8244

-
上海传神网络 23299

-
哈尔滨工业大学管理学院 21287

-
深圳汉威展览策划有限公司 18244

-
拉萨旭日会议服务有限公司 21221

-
上海意凡森医药科技发展有限公司 24270

















202















































