阿里云 EasyNLP 跨模态学习能力再升级,电商文图检索效果刷新 SOTA

摘要

近日,阿里云机器学习 PAI 开源框架 EasyNLP 进行升级发布,推出了融合了丰富电商场景知识的 CLIP 模型,在电商文图检索效果上刷新了 SOTA 结果,并且将上述模型免费开源,贡献给开源社区。

近日,阿里云机器学习 PAI 开源框架 EasyNLP 进行升级发布,推出了融合了丰富电商场景知识的 CLIP 模型,在电商文图检索效果上刷新了 SOTA 结果,并且将上述模型免费开源,贡献给开源社区。

CLIP(Contrastive Language-Image Pre-training)是一种经典的文图跨模态检索模型,它在大规模图文数据集上进行了对比学习预训练,具有很强的文图跨模态表征学习能力。EasyNLP 借鉴 CLIP 的轻量化、易迁移的预训练架构,构建基于 CLIP 包含图像和文本 Encoder 两部分的双流模型,同时基于商品数据,以优化电商场景的文图检索优化。

Fashion-Gen 数据集是一个大规模的时尚场景的图文数据集,以 Fashion-Gen 数据集为例,EasyNLP 基于 pai-clip-commercial-base-en 和 pai-clip-commercial-large-en 这两个模型在 Fashion-Gen 数据集上进行了 20 个 epoch 的微调。实验结果表明,相比于现公布的 SOTA 模型(CommerceMM),电商 CLIP-large 模型在文到图和图到文的检索结果上均有显著提升,评测指标最高提升了 8.7~15 个百分点。

除此之外,电商 base 模型在文到图与 CommerceMM 相当检索结果下,使用了更少的参数量。由此可见,电商 CLIP 无论在 large 还是 base 图像 Encoder 的设置下,都取得了有竞争力的电商场景跨模态检索能力。

文到图检索评测结果

图到文检索评测结果

目前,电商 CLIP 可在 EasyNLP 中直接安装使用,在未来,EasyNLP 框架会集成更多 NLP 的多模态的知识模型,覆盖各个常见领域和任务,同时也将集成更多 SOTA 模型(特别是中⽂模型),来⽀持各种 NLP 和多模态任务,共建 NLP 和多模态算法库。

来源:互联网

最新文章

极客公园

用极客视角,追踪你不可错过的科技圈.

极客之选

新鲜、有趣的硬件产品,第一时间为你呈现。

张鹏科技商业观察

聊科技,谈商业。