基于跨语言广义向量空间模型的跨语言文档聚类方法
2012-06-29唐国瑜夏云庆
中文信息学报 2012年2期
唐国瑜, 夏云庆, 张 民, 郑 方
(1. 清华大学 计算机科学与技术系,北京 100084; 2. 资讯通信研究院,新加坡 138632)
1 引言
文档聚类的目的是按照相似程度将文档划分为不同的类簇,它已经成功应用于改进文档分类和文档流事件发现。国内外学者在单语言文档聚类研究中尝试了很多算法。但是随着商业环境的全球化,文档聚类逐步面临不同语言的挑战。
传统单语言文档聚类方法采取向量空间模型(Vector Space Model, VSM)表示文本,它利用词袋(Bag of Word, BOW)模型来构建特征空间,将每个文档转化为一个向量。词袋模型在特征匹配中通常采用“硬匹配”方法。例如,当词“海岸”被选为特征时,除非“海边”也被选为特征,否则“海边”无法影响到文档表示。这是因为“硬匹配”中“海岸”和“海边”完全不同。为解决这个问题,文献[1]提出的潜语义分析(LSA)方法,基于语料库中的共现信息将一组词与一个特征进行匹配。GVMS则将文档中的词看作向量,然后通过计算词的内积或者相似度进行将文档表示在一个非正交的空间上。但是上述模型都是基于单语文档集设计的,并不能直接用到跨语言文档集中。
研究者提出了用词典或机器翻译工具对特征或者文档进行翻译。然而,一旦词被选为特征,“硬匹配”问题变得更为严重。如何获得不同语言文档中的相似词汇,这是跨语言文档聚类的核心问题。文献[2]提出了采用LSA的解决方法。借助平行语料,他们将相似的词看作为一个特征。与单语言LSA不同,跨语言LSA在固定训练集上选择特征。……
登录APP查看全文
