一种健康医疗保险格式条款的结构化处理方法
2018-09-05张晶杜明
张晶 杜明
文章编号: 2095-2163(2018)03-0087-04中图分类号: 文献标志码: A
摘要: 关键词: (School of Computer Science and Technology, Donghua University, Shanghai 201620, China)
Abstract: Introduce the data structure and concept level of Chinese insurance contract format clauses, and treat its unstructured insurance clause data set as the object of processing. First, analyze and study the structure and meaning of insurance format clauses, and then use template extraction and matching methods to perform the operating, transform it into structured data. Experiments show that this method can achieve higher accuracy.
Key words:
作者简介:
收稿日期: 引言
随着当前中国经济水平的发展和民众对保险产业认知的加深,使得保险产业在互联网效应的驱动下有了更进一步的发展。目前各大应用平台纷纷上线财产保险、人身保险等相关保险产品,从保险购买者的角度出发,对于健康医疗保险,投保人如何根据保险人的实际身体健康状况和所需相关保障进行投保更大程度上取决于投保人对健康医疗保险条款的理解和判断[1]。但对于普通保险购买人来说,保险行业信息仍然存在着极大的不透明性,保险合同格式条款是由保险公司单方面商定、购买人并不参与定制的文本文件,且保险合同格式条款[2-3]大多为长文本数据类型,文本内容多采用专业性语言和超长词汇进行描述。
因此,如何从保险格式条款中获取有效信息并且根据投保人意愿提供相关合理化意见和建议已经成为保险经营活动的新趋势。 目前在文本数据结构化[4]处理方面,国内外均有许多相关的研究工作,但由于中文语言、语义、文法等存在着特殊性,借鉴国外的技术受到很多制约。首先,处理中文格式化健康保险文档需要对长文本进行分词,但目前现有的中文分词工具,如中科院的NLPIR[5]、复旦的FNLP[6]、斯坦福的NLTK[7]等在处理具有很强专业性的中文保险合同格式条款中并不能取得很好的分词结果;其次,与英文不同,中文不存在类似于英文的词根/前缀,不能直接通过词语本身对词语进行分类,需要借助语境、语义做相应的判别分析。……
