数据起源在多版本文档检索中的应用
2018-11-02董红斌谭成予梁意文
上海大学学报(自然科学版) 2018年5期
陈 悦,董红斌,谭成予, 梁意文
(1.武汉大学计算机学院,武汉430072;2.武汉大学国际软件学院,武汉430079)
随着计算机技术的普及,个人计算机中的文档数量与日俱增.在实际应用中,对于文档的频繁修改往往会形成大量内容相关的版本,并由此出现了检索效率较低的问题.人类创造信息的能力已经远远超过寻找、组织和报道它们的能力[1].因此,如何运用科学有效的检索方式来提高用户的工作效率就显得十分重要.
多版本文档具有各版本之间内容相关性高且存在演化关系的特点.面对大量版本,记忆文档名称、时间等细节十分困难,用户更需要的是一种基于内容的检索方式.此外,版本间的关联关系可以清晰地描述版本之间的演化过程,进一步为用户提供帮助.
目前,文件系统中基于文件名和全文的检索方式虽然容易实现,但要求用户对检索的关键词极其明确,且在文档数量过多时检索效率较低.以Google Desktop为代表的商用工具运用了Web环境中搜索引擎的检索方式,其本质也是基于关键词的检索.但在实际应用中,用户很难准确地回忆起用于检索的文件名、时间等信息,也只能记起部分内容相关的关键字[2].因此,这种检索方式往往会给出大量与关键词相关的结果,仍然需要用户进行手工确认才能定位目标文档.这些问题的出现对文档检索提出了新的要求,也需要研究者们重新思考只将列表式的检索结果提供给用户是否足够,为用户……
登录APP查看全文