APP下载

面向低资源场景的论辩挖掘方法

2021-04-23叶锴魏晶晶魏冬春王强廖祥文

福州大学学报(自然科学版) 2021年2期
关键词:文本实验方法

叶锴, 魏晶晶, 魏冬春, 王强, 廖祥文

(1. 福州大学数学与计算机科学学院, 福建 福州 350108; 2. 福建江夏学院电子信息科学学院, 福建 福州 350108)

0 引言

主观性文本能反映人们对现实事物的看法, 具有巨大的研究价值. 论辩挖掘[1]的目标是自动学习文本的论辩结构, 进而识别论点和提取相关论点间的逻辑关系, 从而帮助人们在如政府决策等事务中做出决策, 提供便利.

传统的论辩挖掘方法主要采用机器学习模型, 如朴素贝叶斯[2]等, 并取得不错的性能. 但传统方法依赖于特征工程的设计, 难以应用于低资源场景. 现有工作大多采用神经网络进行端到端的特征表示学习[3],但论辩挖掘单一领域的现有标注数据难以满足神经网络的训练. 因此, 有研究者对多个领域数据集进行联合训练[4-5], 利用任务间的关联信息改进模型性能. 但这些方法没有利用文本的层级结构信息, 难以检测跨段落的论点部件边界.

针对上述问题, 本研究提出一种面向低资源场景的多任务学习论辩挖掘方法, 该方法采用多任务学习策略, 学习文本的字符级共享表示, 同时在序列编码中融入文本的结构信息进行求解. 该模型共享任务的字符级特征, 有效利用领域间的信息以解决低资源场景训练数据不足的问题; 此外, 学习到的结构信息能有效捕获长依赖关系, 帮助模型更好识别长论点部件. 采用了文献[4]中所使用的六个数据集进行实验, 实验结果表明, 与当前最好的方……

登录APP查看全文

猜你喜欢

文本实验方法
记一次有趣的实验
在808DA上文本显示的改善
做个怪怪长实验
基于doc2vec和TF-IDF的相似文本识别
NO与NO2相互转化实验的改进
实践十号上的19项实验
用对方法才能瘦
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
四大方法 教你不再“坐以待病”!
捕鱼