基于案件属性感知的案件倾向性抽取式摘要
2021-08-31闫婉莹郭军军余正涛田应飞李岩
山西大学学报(自然科学版) 2021年3期
闫婉莹,郭军军,余正涛,田应飞,李岩
(1. 昆明理工大学 信息工程与自动化学院,云南 昆明 650504;2. 昆明理工大学 云南省人工智能重点实验室,云南 昆明 650504)
0 引言
信息化时代的到来,舆情信息爆炸性增长,网络越来越影响着法院的方方面面,舆论监督也已经渗透到案件的方方面面,涉案新闻文本摘要的形成有利于在司法实践和行政管理中提高工作效率。目前,面向通用领域的文本摘要研究进展较为迅速,然而受限于法律领域知识及开放数据集规模,以涉案新闻文本为核心的文本摘要形成面临极大困难与挑战。
面向涉案新闻的文本摘要方法,其技术难点在于涉及法院新闻的数据包含大量的案件细节及案件属性词,并且主题句都凝练得非常准确,如表1 涉案新闻文本数据所示,涉案新闻文本包含特有的领域知识,如“涉黑、非法、立案侦查”等。案件属性词是描述某一事物属性的词语,是定位、黏着性较强的黏着饰词,其内部结构对涉案新闻文本分布功能会产生重要影响并与文本存在较密切的语义结构关系。
当前文本摘要的方法主要分为抽取式和生成式,抽取式摘要方法是通过分析文本统计特征、潜在语义特征等从原文中选取关键词、关键句,在句子或段落级别上组成摘要[1-2],生成式摘要方法是在理解原文语义的基础上,在词语级别上组成摘要,有可能生成新的词组[3-5]。涉案新闻文本摘要需考虑其可读性、连续性和逻辑完整性,简单地将一个个单词实体拼接起来,无法形成可读的文段[6]。……
登录APP查看全文