中文单文档摘要模型DSum-SSE
2021-08-06赫俊民鲁梦华
计算机工程与应用 2021年15期
赫俊民,鲁梦华,孟 魁
1.中国石化股份有限公司 胜利油田分公司,物探研究院,山东 东营 257093
2.上海交通大学 电子信息与电气工程学院,上海 200240
随着当今世界知识资源日益膨胀,每时每刻都有大量的信息从各种渠道推送给人们,人们在日常生活中能接触到的信息量级也呈几何级上涨。这纷繁复杂数量庞大的各类信息知识和人们有限的获取能力之间存在着信息过载的问题。如何更加快速地将文字中的信息传达给人们,最简单的方式就是对其进行一定程度上的精简。自动文本摘要技术以此为出发点,致力于生成尽可能覆盖原文本所要表达的关键信息,表述简练,并且内容连贯,易于阅读的摘要,保证信息的高覆盖度、低冗余度、高可读性。
早期的自动摘要技术有基于图的打分方法[1]、统计机器学习[2]、构建语法分析树[3]等等,这些方法应用于不同的场景,难以生成质量尚佳的摘要。而在文本摘要的类型上,分为抽取式摘要和生成式摘要两种[4-5]:抽取式摘要直接从原文中抽取字、单词、短语或者句子,大体上按照文本出现顺序将其重新进行组合;生成式摘要则需要对原文本进行更深层次的理解,采用更加灵活的表达方式对其进行重构。
在中文单文档摘要领域,由于缺少可靠的摘要数据集,目前有监督的摘要模型研究方面并不多见,而无监督摘要模型中最为流行的是TextRank[6],它使用句子之间的相似程度建立带权图,并在此基础上获得每句句子的重要性分数,最终选取相对重要的句子作为摘要输出。……
登录APP查看全文
