大规模英语考试作文评分标准效度验证
2016-06-05陈建林
中国考试 2016年1期
陈建林
大规模英语考试作文评分标准效度验证
陈建林
本研究收集评分员对130篇大学专业英语八级考试(TEM-8)作文的评分数据,采用多面Rasch模型分析法以及有声思维法收集证据对TEM-8作文评分标准进行了多维度效度验证。结果表明,评分标准大体上能够反映写作理论构念,评分尺度划分较为合理;大部分评分员能够有效使用评分标准进行评分,可信度较高。
多面Rasch模型;有声思维法;评分标准;效度验证
1 引言
在语言测试中,制定或者选择什么样的评分标准对于由评分员判定结果的行为测试(performance assessment)来说十分重要。Weigle(2002)在总结McNamara(1996)关于评分标准的重要性时指出,“为写作能力行为测试所制定的评分标准,以显性或隐性的方式,体现了测试设计所依据的理论基础”。行为测试曾经一度不被大范围采用,其中一个主要原因就是主观评判的可信度受到了极大的质疑。可见,如何提高评分效度是行为测试的关键所在,而衡量评分效度的一个重要参数就是评分标准效度(Shaw,2007)。大学英语专业八级考试(TEM-8)是用来检查大学英语专业教学质量的一项规模较大、风险性较高的考试。因此,如何提升考试的公平性是考试设计者和开发者的一项重要任务。提升TEM-8考试公平性的措施之一就是保证评分效度(邹申,2011),因此有必要从多方面收集证据对TEM-8作文考试的评分标准进行效度验证。本文采用多面Rasch模型分析法以及有声思维法(TAPs)收集证据对TEM-8作文评分标准进行效度验证。
2 相关文献分析
作文评分标准的效度研究在近20年来取得了较大发展,研究主要集中在两个领域。……
登录APP查看全文
