不依赖字符集的数据库非标字段检测方法
2012-06-13孟凡奇
孟凡奇,赵 雷
(1.东北电力大学信息工程学院,吉林吉林132012;2.大庆油田电力集团油田热电厂,黑龙江大庆163314)
信息社会的绝大多数信息是存储在MIS(Management Information System,管理信息系统)中的,而MIS中真正存储数据的是数据库,人们从数据库中获取信息,同时也将新的信息录入数据库。因此,数据库中的数据是否规范、正确就显得尤为重要[1]。但是由于主观故意或是数据录入时的合法性检测不严格等诸多原因,数据库中难免出现少量非法数据。比如,电子邮箱的格式应为“邮箱名@域名.com”,录入“victor@yahoo.com”是正确的、合法的,而“★☆*@7#.cn”就是不正确的电子邮箱地址,可以定义为“非法”数据。这些非法数据的显著特征之一就是含有非ASCII(American Standard Code for Information Interchange,美国信息互换标准代码)字符。本文将含有非ASCII字符的字段称为“非标字段”。对于非法的非标字段除了以预防为主以外还要及时的检查并纠正[2]。
目前,大多数检测非标字段的方法是依赖于数据库所用字符集的,检测时要指定字符集名称或使用其中的字符编码,这就迫使DBA(Database Administrator,数据库管理员)要对现有的字符集有一定程度的了解,增加了其额外工作量[3]。本文从数据表中字段的ASCII值和存储空间角度,提出了两种不依赖字符集的数据库非标字段检测方法,实验表明,这两种方法与依赖于数据库所用字符集的非标字段检测方法取得了同样的效果。
1 基于字符集的检测方法
字符是各种文字和符号的总称,包括数字、标点符号、图形符号、各国文字等。计算机要准确识别、存储和处理各种字符,需要对其进行编码[4-6]。……
