基于混合类别序列规则的中文比较评论的识别
2021-06-18朱茂然蒋凯艳王洪伟
系统管理学报 2021年3期
朱茂然 ,蒋凯艳 ,高 松 ,王洪伟
(1.同济大学 经济与管理学院,上海 200092;2.中国信息安全测评中心,北京 100085)
比较在对事物的认识过程中发挥着重要作用[1]。例如,消费者在购物网站输入关键字时,网站会显示数十个对应的产品,消费者会反复比较和选择,通过货比三家买到最满意的产品。比较凸显了事物的共性和差异,给予我们评判一个产品好坏的客观标准[2]。相对于单一商品评论观点,含有比较信息的评论(简称比较评论)涉及两个或多个产品的特征信息。比较评论反映了多个商品之间的优劣比较,彰显了评论者具有丰富的购物经历,也增强了评论的说服效果。
在产品评论中,比较评论约占15%[3],占据了一定的数量,并具有较高的信息价值。近几年,很多研究关注到该领域,内容涉及比较评论的识别、抽取以及应用[2,4-5]。特别是在比较评论的识别任务中,由于商品评论多是非结构化文本,识别方法一直面临人工干预多、句子缺乏完整语义以及比较特征不明显等难题[7],故比较句的识别方法亟待探索。
本文将规则与依存句法关系特征相结合,在缩小人工干预程度的基础上,提高比较评论的识别效果。首先,将比较评论识别视为比较句的挖掘,比较句分为显性和隐性比较句。针对显性比较句,在CSR(Class Sequence Rule)基础上,融合依存句法关系特征,提出一种新的混合CSR 方法,以期提高CSR 方法在生成规则时的准确率和效率;针对隐性比较句,通过对实体名的识别,挖掘隐含的语义特征,完善整个比较句识别过程。……
登录APP查看全文
