APP下载

一种健康医疗保险格式条款的结构化处理方法

2018-09-05张晶杜明

智能计算机与应用 2018年3期
关键词:文本

张晶 杜明

文章编号: 2095-2163(2018)03-0087-04中图分类号: 文献标志码: A

摘要: 关键词: (School of Computer Science and Technology, Donghua University, Shanghai 201620, China)

Abstract: Introduce the data structure and concept level of Chinese insurance contract format clauses, and treat its unstructured insurance clause data set as the object of processing. First, analyze and study the structure and meaning of insurance format clauses, and then use template extraction and matching methods to perform the operating, transform it into structured data. Experiments show that this method can achieve higher accuracy.

Key words:

作者简介:

收稿日期: 引言

随着当前中国经济水平的发展和民众对保险产业认知的加深,使得保险产业在互联网效应的驱动下有了更进一步的发展。目前各大应用平台纷纷上线财产保险、人身保险等相关保险产品,从保险购买者的角度出发,对于健康医疗保险,投保人如何根据保险人的实际身体健康状况和所需相关保障进行投保更大程度上取决于投保人对健康医疗保险条款的理解和判断[1]。但对于普通保险购买人来说,保险行业信息仍然存在着极大的不透明性,保险合同格式条款是由保险公司单方面商定、购买人并不参与定制的文本文件,且保险合同格式条款[2-3]大多为长文本数据类型,文本内容多采用专业性语言和超长词汇进行描述。

因此,如何从保险格式条款中获取有效信息并且根据投保人意愿提供相关合理化意见和建议已经成为保险经营活动的新趋势。 目前在文本数据结构化[4]处理方面,国内外均有许多相关的研究工作,但由于中文语言、语义、文法等存在着特殊性,借鉴国外的技术受到很多制约。首先,处理中文格式化健康保险文档需要对长文本进行分词,但目前现有的中文分词工具,如中科院的NLPIR[5]、复旦的FNLP[6]、斯坦福的NLTK[7]等在处理具有很强专业性的中文保险合同格式条款中并不能取得很好的分词结果;其次,与英文不同,中文不存在类似于英文的词根/前缀,不能直接通过词语本身对词语进行分类,需要借助语境、语义做相应的判别分析。……

登录APP查看全文

猜你喜欢

文本
重点:论述类文本阅读
重点:实用类文本阅读
初中群文阅读的文本选择及组织
作为“文本链”的元电影
在808DA上文本显示的改善
“文化传承与理解”离不开对具体文本的解读与把握
基于doc2vec和TF-IDF的相似文本识别
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
从背景出发还是从文本出发
如何快速走进文本