基于词聚类CNN和Bi-LSTM的汉语复句关系识别方法*
2021-09-15孙凯丽邓沌华
计算机与数字工程 2021年8期
孙凯丽 李 源 邓沌华 李 妙 李 洋
(1.华中师范大学计算机学院 武汉 430079)(2.华中师范大学语言与语言教育研究中心 武汉 430079)
1 引言
汉语复句是衔接小句与篇章的重要单位,在汉语句法中占有重要地位。汉语言研究中,若要取得“句处理”的重大进展,则汉语复句的句法语义自动判定问题便成为了主要的研究内容[1]。复句是由两个或以上的分句构成,汉语言中近2/3的句子是复句。因此,对汉语句子的研究实则是对复句的研究。复句的关系识别是汉语言应用中语义自动分析的关键,是自然语言理解的基础研究问题。复句关系识别的主要任务是研究复句句间的逻辑语义关系,正确的判断逻辑关系意味着能够有效地理解复句。因此,该课题的研究有利于提升篇章分析[2]、自动问答[3]、信息抽取[4]等系统的性能,并推动多种自然语言处理任务的发展。
复句根据关系标记标示能力的强弱分为充盈态有标复句和非充盈态有标复句。如例1所示,复句中存在关系标记“除了…还…”,由该关系标记可以明确地标示例1属于并列关系复句,因此,像这样的复句称为充盈态有标复句。例2复句中由于关系标记的缺失,此时若判定复句语义关系,就不能仅仅通过关系标记来进行标示,而需结合句子具体的语义来分析,这样的复句称为非充盈态有标复句。如在例2中,a)、b)两复句虽含有相同的关系标记“万一”,但通过具体的语义分析后判定a)为因果关系复句,b)为转折关系复句。所以,在非充盈态有标复句中若要正确地识别语义关系,需要充分考虑复句的语义、语境、句法等特征信息,而不是仅仅单纯地依靠关系标记来确定。……
登录APP查看全文
