文本相似度计算方法提高诊断名称数据标准化过程中人工判断效率的影响
2022-07-21郑景文
中国卫生产业 2022年9期
郑景文
广东省农垦中心医院病案室,广东湛江 524002
国家卫健委曾指出,各医疗单位应设置统一的疾病与手术编码, 其中疾病诊断名称属于主要的医疗数据,保证疾病与手术编码相对应,能够为后续科研工作提供更多准确的信息[1-2]。以往,诊断名称数据标准化期间,主要是对数据进行纠正, 若未能按照标准化进行书写,将成为人工搜索的问题诊断名称,从而难以在名称库内寻找到对应的名称,进一步增加消耗时长[3-4]。 若能够通过相关措施予以帮助,能明显减少人工搜索的时长,达到提升工作效率的目的[5]。随着研究持续深入,临床发现文本相似度计算方法效果显著,在增强诊断名称数据标准化期间的人工判断效率上效果突出。 但相关文献较少,该研究选择2020 年3 月—2021 年8 月使用的23 681条诊断名称文本数据,探讨文本相似度计算方法在提高诊断名称数据标准化过程中人工判断效率的价值,现报道如下。
1 资料与方法
1.1 一般资料
按照国家标准的疾病分类与代码上存在编码的诊断名称,按疾病名称进行排序,并对其ID 进行标记,选择使用的23 681 条诊断名称文本数据。 将其中标点符号及英文字母均定义成汉字等同的字符,但应区分全半角及大小写,获得诊断名称特点,字符长度均值(8.58±2.36)个,统计与诊断名称字符长度相同的字符个数,针对少于6 个字符长度者计算其最大值。
1.2 方法
(1)余弦相似度:计算向量夹角的余弦值,可评价个体之间的差别,若余弦值越邻近1,夹角度数越趋于0,提示向量相似。……
登录APP查看全文
