APP下载

六级、雅思、托福阅读文本难度对比研究
——基于数据挖掘的方法

2021-01-07王萍OAE信息科技有限公司

外语与翻译 2020年4期
关键词:数据挖掘分类文本

王萍 OAE信息科技有限公司

辜向东 重庆大学

【提 要】本研究采用了三种数据挖掘方法,对大学英语六级(以下简称“六级”)、雅思、托福阅读文本进行对比。运用Coh-Metrix对所收集的340篇三项考试的阅读文本进行特征提取,共获取106个文本特征,其中有43个被选为预测变量。然后分别训练决策树、逻辑回归、朴素贝叶斯模型对三项考试阅读文本进行分类。根据分类精确率、召回率、F1和ROC面积等指标对模型进行评估。结果表明,所选的43个文本特征能有效区分三项考试的阅读文本,分类准确率达到90.29%。在三种模型中,决策树的分类效果最好。研究发现,六级、雅思、托福考试的阅读文本在词汇、短语、句子和语篇层面存在诸多差异。研究结果有望在分数解释、测试材料选择、文本改编、计算机自适应测试和考试对接等方面对三项考试,甚至更广泛的语言测试领域产生实质性影响。

1.引言

阅读理解作为语言学习的重要技能之一,在外语考试中一直占据较大比重。阅读理解测试的难度一直是语言测试研究者关注的重要议题(杨惠中、Weir 1998),试题难度控制也是试题开发工作的重要步骤(杨惠中、金艳2018),只有难度适宜的试题才能测出考生真实的语言水平(Green 2014)。语言测试领域对阅读理解试题难度的研究较多,然而现有研究多集中于对阅读理解试题中单项选择题题目难度的研究(如Freedle&Kostin 1991,1992,1993,1996,1999;Perkins,Gupta&Tammana 1995;Rupp,Garcia&Jamieson 2001;Gao& Rogers2011;Aryadoust& Goh2014;Aryadoust,Alizadeh&Mehran 2016),对阅读文本本身的关注相对较少(江进林、韩宝成2018),而阅读文本难度在一定程度上直接影响阅读理解试题的整体难度。……

登录APP查看全文

猜你喜欢

数据挖掘分类文本
分类算一算
探讨人工智能与数据挖掘发展趋势
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
基于并行计算的大数据挖掘在电网中的应用
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
一种基于Hadoop的大数据挖掘云服务及应用
如何快速走进文本
基于GPGPU的离散数据挖掘研究