自然语言处理背景下的“PP〈被〉+VP1+VP2”格式消歧问题再探
2021-11-24麻广一
今古文创 2021年45期


【摘要】 自然语言处理是近些年来的热门话题,陆俭明先生提出了计算机PP〈被〉+VP1+VP2 这类歧义格式的困境,詹卫东先生以此为題做了相应的研究。文章在詹卫东先生对PP〈被〉+VP1+VP2的歧义研究的基础上,做了进行进一步的延伸:一、挖掘带否定标记的VP与PP〈被〉组合所受的具体限制规则。二、对分化为a式和b式以后的进一步消歧及“我被他拦住不让走”问题和“我被砍头吓晕了”问题的思考。三、总结出该格式的消歧流程图。四、提出该格式消歧中仍待解决的问题。文章对上述进行了细化研究,并尝试提出解决方案,以期能对自然语言处理中的歧义句问题尽微薄之力。
【关键词】 歧义;消歧;“被”字短语;动词性短语
【中图分类号】H109 【文献标识码】A 【文章编号】2096-8264(2021)45-0112-03
自然语言处理是语言学与计算机科学的交叉学科,在现代社会具有很强的现实意义,当今诸多的人工智能系统都要基于机器对人类的自然语言的处理,其中自然语言中的歧义句是机器处理的难题,要解决这样的难题,就要深度挖掘歧义格式背后的语言学原理,通过设立标签、标准等方式,让机器正确识别歧义句。本文所讨论的PP〈被〉+VP1+VP2格式就是一个典型的歧义句格式。
一、PP〈被〉+VP1+VP2格式的已有研究
陆俭明(2013)先生的《现代汉语语法教程》[1]提到一组在人看来没有歧义,但计算机会认为有歧义的句子:
①他被警察叫去罚了一百块钱
②他被警察叫去写了一份检查
例①的介词结构一管到底,全句意思是“他被警察叫去,他被罚了一百块钱”;而例②的介词结构只管到“叫去”,管不到“写了一份检查”。……
登录APP查看全文
