对汉语史语料库文本处理问题的若干思考
2021-09-30化振红南京师范大学文学院江苏南京210097
烟台大学学报(哲学社会科学版) 2021年5期
化振红(南京师范大学 文学院,江苏 南京 210097)
1990年代以来,汉语史语料库已经成为汉语学者不可或缺的学术利器,最早的语料库相当于汇集若干古代文献的电子书,仅支持简单的文本阅读。随后出现了可以进行字、词、句单项或组合检索的文本数据库,流传较广者如《二十五史全文阅读检索系统》、国学宝典等。也出现了一些基于扫描技术的图像版古籍数据库,由于没有对图像进行OCR识别,用户难以进行全文检索。随着图像处理和超链接技术的迅猛发展,支持分类检索、书名检索、著者检索、全文检索等多种检索方式的图像与文本对照的数据库陆续问世,著名者如文渊阁《四库全书》《四部丛刊》全文检索系统、中国基本古籍库等。近10年来,为了满足汉语研究的需要,学界开始尝试建设深加工的标注型语料库,具体工作包括对古代文献进行词语切分,并添加词性、义项、语法地位标注等多方面信息。以董志翘教授主持的国家社科基金重大招标项目“深加工中古汉语语料库建设研究”为依托的中古汉语语料库(MCC),就是其中的尝试之一。MCC课题组选取“既能从整体上反映中古汉语的真实面貌,又能够展示中古汉语局部的各种比较突出的特点”的中古文献,包括正史作品8种,约420万字;子部作品如汉译佛经、佛道文献、笔记小说、医农杂著、诗歌40种,约490万字;敦煌吐鲁番文献、碑刻文献等出土文献约80万字。上述入库文献共约1000万字。在确定入库文献的版本并进行反复校勘之后就进入了文本处理环节。……
登录APP查看全文