用于金融文本挖掘的多任务学习预训练金融语言模型
2021-08-17WayneLin
计算机研究与发展 2021年8期
刘 壮 刘 畅 Wayne Lin 赵 军
1(东北财经大学应用金融与行为科学学院 辽宁大连 116025) 2(中国石油物资采购中心 沈阳 110031) 3(南加州大学计算机学院 美国加利福尼亚州洛杉矶 90007) 4(IBM研究院 北京 100101)
海量的互联网金融信息在金融市场中有着举足轻重的地位,对网络金融文本信息的挖掘工作具有很大的实际价值.随着大数据时代的到来,金融大数据挖掘已成为行业热点趋势,面向金融的机器学习技术吸引了越来越多的关注.面对每日产生的数量惊人的金融文本数据,如何从中提取有价值的信息已经成为学术界和工业界一个非常有挑战的研究.如果我们采取人工的方式来分析这些文本信息并从中获得可行的见解几乎是一项极其艰巨的任务.机器学习技术的进步使金融科技中的金融文本挖掘模型成为可能.但是,在金融文本挖掘任务中,构建有监督训练数据代价非常高昂,因为这需要使用财务领域的专家知识.由于可用于金融文本挖掘任务的有标签训练数据量很少,因此大多数金融文本挖掘模型无法直接利用深度学习技术.
在本文中,我们创新地提出了F-BERT模型,通过利用自监督学习和多任务学习的深度神经网络方法来解决该问题.当前,金融科技中的金融文本挖掘模型主要是采取基于深度学习(deep learning)的自然语言处理(natural language processing)技术.
目前,自然语言处理主要使用基于深度神经网络的技术,其发展主要有两大里程碑工作.首先是2013年提出并不断发展的以Word2Vec[1]为代表的词向量技术,例如Word2Vec,GloVe[2]等;……
登录APP查看全文
