话题内相关文本的内容计算
2015-04-21刘冬明杨尔弘
中文信息学报 2015年5期
刘冬明,杨尔弘
(1.中北大学,山西 太原 030051;2. 北京语言大学,北京 100083)
话题内相关文本的内容计算
刘冬明1,杨尔弘2
(1.中北大学,山西 太原 030051;2. 北京语言大学,北京 100083)
信息的暴涨给文本处理带来了更多的挑战。话题检测能够把大量的信息以话题为单位有效地组织起来,然而最终用户有可能并不需要涉及某一话题的所有文本,而是仅仅关心该话题的具体内容。在我们根据相关文本智能表达话题内容推送给用户之前,自动从相关文本中挑选符合用户需求的文本是一个非常有意义的工作。本文致力于相同话题文本之间的内容比较,目的是有效地选出满足需求的文本。我们通过对话题进行重新定义,并根据此定义设定了话题和文本的表示方法,给出了基于该表示方法的话题和文本之间的内容比较计算方法。最后,通过实验说明了这一系列方法的有效性。
话题定义;文本表示; 话题检测;文本内容计算
1 引言
随着互联网的迅速发展,信息规模迅速增长,相同或相近内容的信息,特别是新闻话题,在位置上分散,在形式上多样,导致信息难以被高效利用。话题检测与跟踪[1]、话题演化等相关技术正是为了将信息根据其内容以有效合理的形式组织起来。然而对于最终用户来讲,需要的可能不是关于某一话题成堆的文本,而是关于该话题的具体内容或某一方面的内容。为了精准地给予用户所需信息,需要依据内容进行自动语言生成,然而目前该技术还远未达到应用的要求;……
登录APP查看全文
