APP下载

面向信息自动抽取的中医古籍校注方法探索*

2021-04-25闻永毅

河南中医 2021年4期

闻永毅

陕西中医药大学,陕西 咸阳 712046

理论上讲,校注古籍的结果应该生成一份没有错字、讹误字、脱文、衍文等错误文字的正确文件,然而事实上这种正确文件并没有以具体的形态出现在古籍校注著作之中,而是以原文(有人称之为“白文”或“经文”)与注文(有人称为“阴文”或“朱文”)相互分离的方式散落在校勘或注解文字之中。这种沿袭了数千年的分离式校注方式严重地阻碍了其他学科对古籍校注成果的有效使用,导致很多迫切需要正确文件的研究项目(如中医国际交流、中医翻译、语料库建设、字词频率统计、词典词条收集、信息自动检索与抽取等),都因为无法汇聚这些散落的校注成果而继续使用残缺受损的原文。邢玉瑞[1]、张登本[2]、张双棣[3]、刘利[4]等编著词典所用数据都是以原文为基础材料。如何打破这种研究与应用互不往来的僵局,已经成为制约中医文献学甚至整个古籍整理领域进一步发展的瓶颈问题。本文将从中医古籍校注方法的角度,深入探索如何运用计算机技术把散落在校勘注解文字中的校注成果转化成为一种具体而有形的正确原文,为此本文预设了三条必须坚守的基本原则:第一,坚持古籍校注的传统方式;第二,原文与转化而来的正确原文必须互见互参;第三,原文、校注成果、正确原文等相关校注信息可分别统计,自由输出。

1 讹误字的更正模式

古籍校注类著作中注文是一种笼统的说法,里面包含着校勘文字和注释文字两种性质不同的文件形式。……

登录APP查看全文