APP下载

自然语言处理背景下的“PP〈被〉+VP1+VP2”格式消歧问题再探

2021-11-24麻广一

今古文创 2021年45期

【摘要】 自然语言处理是近些年来的热门话题,陆俭明先生提出了计算机PP〈被〉+VP1+VP2 这类歧义格式的困境,詹卫东先生以此为題做了相应的研究。文章在詹卫东先生对PP〈被〉+VP1+VP2的歧义研究的基础上,做了进行进一步的延伸:一、挖掘带否定标记的VP与PP〈被〉组合所受的具体限制规则。二、对分化为a式和b式以后的进一步消歧及“我被他拦住不让走”问题和“我被砍头吓晕了”问题的思考。三、总结出该格式的消歧流程图。四、提出该格式消歧中仍待解决的问题。文章对上述进行了细化研究,并尝试提出解决方案,以期能对自然语言处理中的歧义句问题尽微薄之力。

【关键词】 歧义;消歧;“被”字短语;动词性短语

【中图分类号】H109            【文献标识码】A           【文章编号】2096-8264(2021)45-0112-03

自然语言处理是语言学与计算机科学的交叉学科,在现代社会具有很强的现实意义,当今诸多的人工智能系统都要基于机器对人类的自然语言的处理,其中自然语言中的歧义句是机器处理的难题,要解决这样的难题,就要深度挖掘歧义格式背后的语言学原理,通过设立标签、标准等方式,让机器正确识别歧义句。本文所讨论的PP〈被〉+VP1+VP2格式就是一个典型的歧义句格式。

一、PP〈被〉+VP1+VP2格式的已有研究

陆俭明(2013)先生的《现代汉语语法教程》[1]提到一组在人看来没有歧义,但计算机会认为有歧义的句子:

①他被警察叫去罚了一百块钱

②他被警察叫去写了一份检查

例①的介词结构一管到底,全句意思是“他被警察叫去,他被罚了一百块钱”;而例②的介词结构只管到“叫去”,管不到“写了一份检查”。……

登录APP查看全文