清华大学自动化系团队在第39届神经信息处理系统会议上获论文亚军奖
2025/12/15
12月6日,在美国圣地亚哥举行的第39届神经信息处理系统会议(Conference on Neural Information Processing Systems,NeurIPS)上,清华大学自动化系宋士吉教授、黄高副教授团队的论文“强化学习是否真的能激发大语言模型产生超越基础模型的推理能力?”(Does reinforcement learning really incentivize reasoning capacity in LLMs beyond the base model?)获得最佳论文亚军奖(Best Paper Runner-Up Award)。
获奖合影(中间三位为自动化系获奖学生)
获奖证书
评审委员会对该论文的评价为:“本文针对大语言模型(LLM)研究中一个被广泛接受的基础性假设——带有可验证奖励的强化学习(RLVR)激发了大模型新的推理能力——给出了一种精妙且至关重要的否定性发现。研究表明,在不同的模型类型、任务和算法中,RLVR训练虽能提高正确输出的采样效率,却无法拓展基础模型已有的推理能力。强化学习缩小了探索范围,受奖励的轨迹得到强化,但更广泛的解决方案空间却缩小了。这表明RLVR是在基础分布范围内进行优化,而非超越基础分布。这是一项重要发现,有望激励人们研发全新的强化学习范式,使其能够应对广阔的动作空间,并真正拓展大语言模型的推理能力。”
论文两位共同第一作者分别为清华大学自动化系2021级博士生乐洋和2022级本科生陈之琪。
NeurIPS是人工智能领域的旗舰学术会议之一,其最佳论文奖旨在表彰在机器学习、人工智能及相关领域中具有卓越创新性、重大影响力并能推动学术前沿发展的研究工作。
文章来源清华大学,分享只为学术交流,如涉及侵权问题请联系我们,我们将及时修改或删除。
-
2026年6月优质国际学术会议推荐 7
-
2026年第17届机械与航空航天工程 193
-
2026年先进航空航天技术与卫星应用 324
-
2026资源、化学化工与应用材料国际 1808
-
2026年图像处理与数字创意设计国际 1632
-
2026年机械工程,新能源与电气技术 6095
-
2026年材料科学、低碳技术与动力工 1819
-
2026年艺术、文化产业与数字媒体国 04-29
-
2026年智慧教育、教育研究与文化交 04-29
-
2026年数字社会、公共管理与经济学 04-29
-
2026 政务服务、数字治理与智慧城 04-28
-
2026 制冷技术、暖通设备与环境调 04-28
-
2026 轻工材料、绿色制造与循环利 04-28
-
2026 多语言智能、翻译技术与国际 04-28
-
2026 生物育种、生态种植与现代农 04-28
-
中国科协发布2025年《重要学术12
-
2026年新锐分区(原中科院期刊2595
-
2025年两院院士增选有效候选人4402
-
2025最新JCR分区及影响因子12342
-
好学术:科研网址导航|学术头条分5673
-
2025年国际期刊预警名单发布!5837
-
2025年中科院期刊分区表重磅发20812
-
吉林大学校长张希:学术会议中的提6954
-
二维超导迈斯纳效应探测研究获进展04-29
-
研究发现笼目超导体中多重范霍夫奇04-29
-
二氧化碳加氢制高碳烯烃与航煤馏分04-29
-
靶向特定蛋白互作界面抑制乙肝病毒04-29
-
研究揭示内源信使调控膜损伤与细胞04-29
-
科学家绘制大脑星形胶质细胞转录因04-29
-
上海交大Bio-X研究院石毅与合04-29
-
北京理工大学自动化学院 23494

-
中国生物学会医学 21447

-
中国社会岩石力学工程 23481

-
西安纳米科技学会 8568

-
中国微生物学会农业微生物学专业委 23286

-
hksme 23349

-
上海同巨文化传播 8584

-
浙江蟠桃会网络技术有限公司 24404

-
中南财经政法大学 23303

-
南阳译天地震研究所 21292

-
博宁物资经销处 18348

-
Academy of Engin 2376

-
广州市鸿威展览服务有限公司 18396

-
湖南大学 18448

-
于6个中文字符 18413

-
南京邮电大学 21351

-
西安周道会议策划服务有限公司 18316

-
生物谷 23266

-
广州振威国际展览有限公司 8407

-
百奥泰国际会议(大连)有限公司 24171





















278








































