大规模知识图谱预训练模型及电商应用
2021-06-09陈华钧张文黄志文叶橄强文博张伟2
大数据 2021年3期
关键词:模型
陈华钧,张文,黄志文,叶橄强,文博,张伟2,
1. 浙江大学计算机科学与技术学院,浙江 杭州 310007;
2. 阿里巴巴-浙江大学前沿技术联合研究中心,浙江 杭州 311121;
3. 浙江大学软件学院,浙江 杭州 310007;4. 阿里巴巴集团,浙江 杭州 311121
1 引言
知识广泛存在于文本、结构化及多种模态的数据中。除了通过抽取技术[1]将知识从原始数据中萃取出来以支持搜索、问答、推理、分析等应用,另外一种思路是利用数据中本身存在的基本信号对隐藏的知识进行预训练(pre-training)。随着GPT[2]、BERT[3]、XLNet[4]等预训练语言模型在多项自然语言处理领域任务上刷新了之前的最好效果,预训练受到了各界的广泛关注。预训练的核心思想是预训练和微调,例如文本预训练一般包含两个步骤:首先利用大量的自然语言数据训练一个语言模型,获取文本中包含的通用知识信息;然后在下游任务微调阶段,针对不同的下游任务设计相应的目标函数,基于相对较少的监督数据进行微调,即可得到不错的效果。
受预训练语言模型的启发,笔者将预训练和微调的思想应用到大规模商品知识图谱的表示学习与业务应用中。在阿里巴巴电商平台,包含千亿级三元组和300多万条规则的商品知识图谱被构建起来,并为语义搜索、智能问答、商品推荐等众多下游业务任务提供知识图谱服务。通常知识图谱提供服务的方式是直接给出原始的三元组数据,这会导致以下问题:①针对不同任务反复地进行数据选择和查询,存在大量重复性工作;……
登录APP查看全文
