当前位置:首页 >> 学术资讯 >> 科研信息

王选所穆亚东课题组发表电子商务多模态基础模型ECLIP

2024/04/09

以GPT为代表的通用基础模型(foundation model)是人工智能领域近期的研究前沿。基础模型通过预训练等方式在海量数据上学习,再进行微调后用于解决多种下游应用任务。近期,王选计算机所穆亚东长聘副教授课题组在计算机视觉领域顶级会议CVPR 2023发表题为“Learning Instance-Level Representation for Large-Scale Multi-ModalPretraining in E-commerce”的论文。针对电子商务这一垂直应用领域,该工作提出了一种旨在学习商品实体级表的多模态基础模型ECLIP(E代表E-commerce,即电子商务)。通过在上亿级的电商业务数据上进行训练,ECLIP获得了视觉语言定位的能力,并在电商领域的诸多任务中取得了优异的性能,超过了许多传统的多模态学习方法。

电子商务的蓬勃发展给人们的日常生活带来了极大的便利,也由此出现了与之相关联的多种应用任务,如商品分类、检索、推荐等。与为每个特定的任务单独设计模型相比,为多个电商应用任务同时构建一个通用的基础模型可以增强其适用性,降低训练的成本。现阶段,在电子商务领域的数据通常以多个模态呈现,例如一个商品常包含详情图、评论图、商品标题、商品属性等多种模态的数据,可以利用这些多模态信息去学习通用的特征表示。然而,商品图像和自然图像的特点截然不同。自然图像中几乎每个区域都被其对应的文本所描述,电商图片中真正有用的信息往往由它所关联的商品标题所确定,只存在于图像中的某个特定区域。如图1中,“煎锅”或“咖啡机”等商品实例只占据整个图像的一部分,而图中其他物体如“电磁炉”等则和商品文本标题无关。如果像传统的多模态模型那样,简单地将整个图像视为一个整体来与文本进行跨模态对齐,将会不可避免地混淆商品实例和嘈杂的背景物体。因此,电子商务基础模型的核心难题之一是如何学习得到和商品相关的表示(instance-level representation)。

图1 自然图像和商品图像的区别

解决这一挑战需要模型具有视觉-语言精细定位的能力,即根据描述商品的文本内容定位到相关联的特定图像区域。本工作提出一种无须海量人工标注的策略,如图2所示,一个商品相关的图片通常来自不同的源头,例如商品详情页、商品广告视频、以及买家的评论等等。这些不同来源的数据中包含相同的商品实例(例如图中的“红宝石面霜”),因此可以利用这种显式的相关性自动获得弱标注来对模型进行训练。

图2 电子商务领域中存在的多图特性

在模型架构设计上,ECLIP引入了一个样例解码器(instance decoder)结构来提取图像中和商品实体相关的部分,包含了一组可学习的样例查询(instance query)来感知电商图片中潜在的商品实例信息。此外,每个样例查询依赖于特定的多模态提示(multi-modal prompt),用于感知特定类型的商品实例。图3为ECLIP模型的设计细节。

图3(a)ECLIP模型结构图及(b)样例解码器设计

为了优化ECLIP,该工作采用了三种新的代理任务(pretext task),包括图像文本对比学习,商品间和商品内多模态学习,促使样例查询关注到图像中商品实例所在的区域,而忽视其它不相关的物体。其中商品间的多模态学习任务如图4,包含了不同商品所提取的实例特征之间的对比学习(即使得属于同一商品的两则特征之间的相似度大于不同的商品)及商品文本匹配(即提取的实例特征应与其对应的商品文本描述相互匹配)。

图4 商品间对比学习任务

ECLIP的基础版本有220M参数,而大型版本含有450M的参数。为了优化ECLIP的参数,从电子商务网站中收集了大约一亿图像文本对,包含1500万个不同的商品,涵盖了服装、日用品、仪器等约9000个不同的类别。对于每个商品样本,都有相应的文字描述和来自商品详情页、客户评论和附加广告视频的图片。为了评估ECLIP的性能优越性,该文在多个电商下游任务上进行了实验,包括零样本商品分类、零样本商品定位等。与传统的多模态模型相比,ECLIP取得了显著的性能提升,验证了提取商品实例化表示在电子商务领域中的重要性。值得注意的是,在没有任何人工标注的情况下,ECLIP在视觉定位(grounding)等定位任务上仍然获得优异的性能。这充分说明了ECLIP学到了视觉语言定位的能力。图5给出了一些可视化结果。左图展示了商品图片与文本描述之间的相似度热力图,其中深色对应更高的相似度,可以看到同传统的多模态模型CLIP相比,ECLIP更容易正确地关注到与文本描述相对应的商品实例。右图也展示了ECLIP在定位任务上的优越性能。

图5 ECLIP在跨模态定位和视觉检测任务上的可视化结果

通过在上亿级的电商业务多模态数据上进行训练和定制设计的编码器结构,ECLIP取得了优异的性能,目前已经在字节跳动的电商业务中进行部署应用。本文第一作者为前沿交叉学科研究院2020级博士生金阳,通讯作者为穆亚东,其他合作者还包括李勇志、袁泽寰(字节跳动公司)。


版权声明:
文章来源北京大学新闻网,分享只为学术交流,如涉及侵权问题请联系我们,我们将及时修改或删除。

相关学术资讯
近期会议

2025年清洁能源、电力系统与可持续发展国际会议(CEPSSD 2025)(2025-10-28)

2025年电力系统与电器工程国际会议(ICPSEE 2025)(2025-10-29)

2025年第四届计算与人工智能国际会议(ISCAI 2025)(2025-11-14)

2025年设计、数字媒体与多媒体技术国际会议(DDMMT 2025)(2025-11-20)

2025年IEEE电路与系统前沿技术国际会议(FTCS 2025)(2025-11-21)

第一届光电材料与电子信息工程国际学术会议 (OMEIE 2025)(2025-11-21)

2025年船舶、海洋工程与应用技术国际会议(ICSOEAT 2025)(2025-11-24)

第二届自动化、电气控制系统与设备国际学术会议(AECSE 2025)(2025-11-28)

第五届肿瘤治疗与转化医学国际研讨会(CTTM 2025)(2025-11-28)

2025年机械电子与自动化国际研讨会(ISMA 2025)(2025-11-28)

2025人文、教育技术与社会文化国际会议(HETSC 2025)(2025-11-18)

2025年电气、电力工程与能源系统国际会议(ICEPES 2025)(2025-12-23)

2025分子物理学、复合材料与纳米技术国际会议(MPCMN 2025)(2025-11-19)

2025年电力系统、电气技术与自动化国际会议(ICPSETA 2025)(2025-11-6)

2025力学、仪器与能源动力国际会议(MIEP 2025)(2025-11-30)

2025资源、化学化工与应用材料国际会议(RCCEAM 2025)(2025-11-19)

2025年汉语言文学、翻译与文化交流国际学术会议(CLLTCE 2025)(2025-11-16)

2025年物理、数学与统计分析国际会议(ICPMSA 2025)(2025-12-5)

2025年能源动力工程与机械自动化国际会议(ICEPEMA 2025)(2025-11-15)

2025生物医学与人工智能国际学术会议(ICBAI 2025)(2025-12-26)

小贴士:学术会议云是学术会议查询检索的第三方门户网站。它是会议组织发布会议信息、众多学术爱好者参加会议、找会议的双向交流平台。它可提供国内外学术会议信息预报、分类检索、在线报名、论文征集、资料发布以及了解学术资讯,查找会服机构等服务,支持PC、微信、APP,三媒联动。