适用于PDF文本内容的高效模式匹配算法*
2018-03-21朱玲玉王旌舟陈庆春
通信技术 2018年3期
朱玲玉,王旌舟,陈庆春
0 引 言
模式匹配在网络入侵检测、生物序列数据库比对(DNA)、信息检索、生物计量学等领域得到了广泛应用。模式匹配按同时匹配模式串的个数,分为单模式匹配和多模式匹配,其中KMP[1]、BM[2]为经典单模式匹配,AC[3]、WM[4]算法为经典多模式匹配。每种模式匹配算法都有其最优、最坏匹配复杂度,针对不同模式串的类型,其算法各有优点。
随着信息时代和大数据时代的快速发展,网络安全监管快速兴起,网络空间安全成为了热点。PDF是Portable Document Format(便携文件格式)的缩写,是全世界电子版文档分发的公开实用标准。作为一种通用文件格式,PDF能够保存任何源文档的所有字体、格式、颜色和图形,而不关心创建该文档使用的应用程序和平台。网络中越来越多的文件开始倾向于采用PDF这一主流的文本保存格式。随着PDF文档的广泛使用,PDF文件内容的保密性和安全性问题日益凸显。本文结合PDF文件格式及其编码规则,分析研究BM、QS[5]算法,并分析了一类适用于PDF文件的高效匹配算法,以支持涉密PDF文件内容的高效管控应用。
1 PDF文件格式及编码规则
PDF文档是8 bit字节序,以二进制流保存。深入理解PDF文件的格式,需从其对象、文件结构(逻辑结构)、文档结构(物理结构)、内容流和编码4方面理解[6]。
PDF文件实质由一系列对象构成,这些对象分别有8种基本数据类型,即逻辑对象、名字对象、字典对象、字符串对象、流对象、数组对象、数值对象和空对象。这些基本数据类型的对象是直接对象,可被标识,以便作为间接对象被其他对象引用。……
登录APP查看全文
