深研院新材料学院在《自然.通讯》发表运用代数图论与机器学习实现定量预测分子特性
2024/05/08
大数据和人工智能与化学基因和材料基因的融合正推动生物医学和新材料的前沿科学发展。近年来,机器学习,尤其是深度学习,已经成为基于数据驱动的分子尺度发现化学基因和材料基因强大方法。2019年冠状病毒病(COVID-19)暴发一年后还没有特异性的有效药物,这提醒我们生物医药是复杂的前沿科学领域,有效的药物发现涉及一系列相关的分子特性,包括结合亲和力、毒性、分配系数、溶解度、药代动力学、药效学等等。对生物医药分子特性的实验测定是非常耗时和昂贵的。此外,涉及到动物或人类的实验测试会有会有道德问题的禁区。因此,大数据和人工智能的方法在许多情况下可以产生快速的结果而不严重牺牲准确性,其中最受欢迎的方法之一是定量结构活性关系(QSAR)分析,它假定类似的分子具有类似的生物活性和理化性质。尽管科研人员在预测分子性质的方向已经进行了做大量的工作,但各种分子性质的定量预测仍然是一个挑战。
近日,北京大学深圳研究生院新材料学院的潘锋团队与密歇根州立大学数学系的魏国卫教授合作,通过融合代数图论方法和Google开发的深度自注意力变换(Transformer)的机器学习方法提出和发展了一种新型的代数图辅助的双向转化器(AGBT)框架,实现基于小样本数据有效的定量预测分子特性。这一成果近期发表在《自然.通讯》【Nature Communications, 2021,12(1), 1-9.】题目为“Algebraic graph-assisted bidirectional transformers for molecular property prediction”。

代数图论方法辅助的双向转化器(AGBT)框架
通常深度学习方法需要大量的数据集来进行训练,在小型数据集上利用深度学习模型一般很难取得有效准确的预测。在化学中,通过实验或者第一性原理确定有标签性能的数据只占少数。团队发现化学中的分子性能预测极大依赖于分子描述符或分子表示法,拓展深度学习方法来产生高质量的分子描述符可以提升预测的准确性,包括运用自然语言处理(NLP)中自监督学习方法,大量无标签的语言数据可被用于“预学习”和用于模型的训练和预测,在生物医学方面运用分子的SMILES表示的化学语言,利用自然语言处理中的相关模型实现了基于自监督学习方法的预训练。团队在研究中发现基于SMILES数据的训练模型会丢失一些分子结构的三维信息,从而影响相应的分子描述符的质量,从而自主原创设计出一种基于代数图论辅助的深度学习框架(AGBT),这种方法既利用了Transformer这种深度学习方法将大量无标签的分子数据利用起来,又借助了代数图论的方法弥补了深度学习框架(Transformers)所遗失的一些三维信息,可以实现高质量的分子描述符的产生。这种分子描述符,对小数据样本的分子特征预测的能力有较高的提升,实现快速有效的定量的分子特性预测。

一种元素特异性的多尺度加权彩色代数图论方法
此外,本工作利用代数图图论的方法,特别是特定元素的多尺度加权彩色代数图论方法,将三维分子信息嵌入图的不变量中,发展了代数图辅助的双向转化器(AGBT)框架,通过融合代数图论方法产生的分子描述符和Transformers产生的分子描述符表,实现与两种分子信息的互补,借助各种机器学习算法,包括决策树、多任务学习和深度神经网络,实现下游任务中对分子特性的预测。本工作在八个分子数据集上验证了所提出的AGBT框架,涉及定量毒性、物理化学和生理学数据集。大量的数值实验表明,所发展的AGBT是一个高效的分子特性预测模型。
文章的第一作者是北京大学深圳研究生院新材料学院的博士研究生陈冬,通信作者是潘锋和魏国卫教授。本工作得到国家材料基因工程重点专项和广东与深圳科技项目的支持。
文章来源北京大学新闻网,分享只为学术交流,如涉及侵权问题请联系我们,我们将及时修改或删除。
-
2026年1月高含金量国际学术会议合 12-12
-
第四届金融科技与商业分析国际学术会议 686
-
2026年第十一届复合材料与材料工程 1453
-
2025年机器视觉、智能成像与模式识 2126
-
2025年智能光子学与应用技术国际学 3284
-
2026年机械工程,新能源与电气技术 3476
-
2025年计算机科学、图像分析与信号 3917
-
2025年材料化学与燃料电池技术国际 3633
-
2026年交通数字化、人工智能与韧性 12-19
-
2026年社会文化与公共管理国际会议 12-19
-
2026年人文地理与语言研究国际会议 12-19
-
2026年社会发展与经济发展国际会议 12-19
-
2026年光伏材料、光电转换与可再生 12-19
-
2026年可持续发展与数字化社会国际 12-19
-
2026年管理科学、语言与教育国际会 12-19
-
2025年两院院士增选有效候选人2672
-
2025最新JCR分区及影响因子7552
-
好学术:科研网址导航|学术头条分3540
-
2025年国际期刊预警名单发布!3510
-
2025年中科院期刊分区表重磅发13412
-
中国科协《重要学术会议目录(207866
-
吉林大学校长张希:学术会议中的提4517
-
中国科大提出电化学一体化驱动策12-19
-
中国科大实现电泵浦片上集成高亮度12-19
-
西北农林科技大学【陕西新闻联播】12-19
-
中国科大实现片上非相干泵浦高品质12-19
-
中国科大中性原子量子计算研究成果12-19
-
炔烃远端C-O键的不对称活化转化12-19
-
研究揭示叶片内生真菌分子功能多样12-19
-
科研人员提出柑橘黄龙病防控新策略12-19
-
国际工学技术出版协会 8143

-
河南理工大学 21277

-
中南大学土木建筑学院 21167

-
杭州宝盛水博园大酒店有限公司 2150

-
云南省昆明市金孔雀旅行社 18308

-
中国建筑金属结构协会给水排水设备 18189

-
武汉海讯科技会务有限公司 18124

-
北京东方比特科技有限公司 2347

-
中国健康产业工作委员会 2264

-
北京正望咨询 18203

-
广州鑫亚展览有限公司 18039

-
上海易贸商务发展有限公司 24241

-
云南师范大学 2272

-
武汉雅森传媒有限公司 24254

-
International As 8304

-
中南民族大学 24257

-
上海大学社会科学学院 23286

-
浙江大学管理学院 23337

-
武汉新至恒营销策划有限公司 2172

-
ofweek 24170

















506









































