APP下载

基于多维度熵值考察的常用字表构建

2024-05-21张艳梅李如龙吕展

华文教学与研究 2024年2期

张艳梅 李如龙 吕展

[关键词] 常用字;常用字表;汉字效用;熵值法

[摘 要] 常用字除了字频这一外显特性外,还应当具有稳定性、较广的分布性、构词构字的能产性等特征。以往基于语料选取来考察汉字,无法对每个汉字不同维度的特征进行量化,最终仍主要通过字频来构建字表。文章基于2007—2021年《中国语言生活状况报告》语言大数据,对常用字的字频、稳定性、分布度、构词频、构字频等五个维度进行详细的数据考察与特征分析,使用熵值法建立汉字效用综合测度模型,构建多维度常用字表。通过熵值法构建的汉字效用综合测度模型,从多个方面测量、量化了汉字的效用,得出的排序结果与以往的字表有着较大的差异。不单单考虑字频这一维度之后,大量在稳定性、分布度、构词构字能力等维度具有突出优势的常用字跻身字表前列,由此也更为科学合理。

[中图分类号]H195.3  [文献标识码]A  [文章编号]1674-8174(2024)02-0068-14

1. 引言

我国关于现代汉字常用字的研究是基于字频统计开展的,比较科学的字频统计起于上世纪二三十年代,发端之作当属1928年陈鹤琴先生的《语体文应用字汇》,随后经过一代代学者筚路蓝缕的探索,字频统计研究的方法更加科学、应用的范围更加广泛。至本世纪初教育部国家语委、国家语言资源监测中心首次进行大规模的社会用字用词调查,字频统计这项工作在语料库规模、统计工具、分析方法等方面均有了长足的进步。

回顾近百年的字频……

登录APP查看全文