大规模测评中IRT等值的影响因素研究
2017-12-13曾平飞李雨秦刘文惠焦丽亚康春花
曾平飞 李雨秦 刘文惠 焦丽亚 康春花
(1.浙江师范大学教师教育学院,浙江金华 321004;2.合肥晶合集成电路有限公司,合肥 230012;3.教育部考试中心,北京 100084)
大规模测评中IRT等值的影响因素研究
曾平飞1李雨秦1刘文惠2焦丽亚3康春花1
(1.浙江师范大学教师教育学院,浙江金华 321004;2.合肥晶合集成电路有限公司,合肥 230012;3.教育部考试中心,北京 100084)
通过模拟和实证研究探讨样本量、题本量以及锚题题型对大尺度测评中项目参数等值精度的影响,模拟研究和实证研究的结果均表明:(1)0/1计分项目参数的等值精度在大多数条件下均好于多级计分项目,相对而言,实证研究的差异不如模拟研究明显;(2)相对而言,样本容量的增加对于提高项目参数等值精度有着重要的作用,而增加题本数量的作用甚微;(3)无论是区分度参数还是难度参数,均表现为3个题本和2 000人的搭配已经可以达到较好的等值精度,如果进一步提高等值精度,只需将每一题本的样本容量增加到3 000人即可;在多级计分时,当选用5个题本时,每一个题本2 000人是最适宜的组合。
项目反应理论;等值;同时估计;锚测验非等组设计
1 引言
在日益注重教育质量和教育内涵的“互联网+”时代,学生能力国际评价项目(Programme for International Student Assessment,PISA)、国际教育成就评价协会(International Assessment for the Evaluation of Education,IEA)主持的数学与科学学习国际比较研究(The Trends in International Mathematics and Science Study,TIMSS)、美国国家教育进展评估(National Assessment of Education Progress,NAEP)和我国的基础教育质量监测(Basic Education Quality Assessment)等大型测评项目,在世界上的影响越来越大。就教育测量学的技术而言,这些测评项目的一个共同的经验是:在对教育质量进行大范围、广领域的评估或监测时,都应用了大规模教育测评中的矩阵取样技术(matrix-sampling,MS)[1]。……
