IRT测验等值模型的选择——以广东佛山市中考数学实测数据为例
2012-01-03黎光明张敏强
黎光明 张敏强
IRT测验等值模型的选择
——以广东佛山市中考数学实测数据为例
黎光明 张敏强
以广东省佛山市中考数学实测数据为例,说明IRT测验等值模型的选择过程,其基本步骤包括等值设计、参数估计、量表化和测验等值等。供选择的四种IRT测验等值模型分别为SL、SN、NR和GPCM模型。分析发现,等值误差由小到大依次是SL、SN、NR和GPCM,SL与GPCM、NR存在显著性差异(p<0.001),SN与GPCM、NR存在显著性差异(p<0.001),GPCM与NR 存在显著性差异(p<0.001),但SL与SN不存在显著性差异(p>0.05)。结果表明:(1)从模型等值的效果看,SL和SN最优且相当,NR等值效果欠佳,GPCM等值变异最大,效果最差;(2)选择IRT的SL或SN等级反应模型进行此类测验等值较为合适。
中考数学实测数据;项目反应理论(IRT);测验等值;心理与教育测量
1 引言
测验等值是项目反应理论研究的重要内容,是题库建设和进行自适应测验的基础。测验等值的目的是为了将不同测验形式的分数转换到同一个分数量尺上,以便将不同的测验结果进行比较[1]。不论是基于经典测量理论(Classic Test Theory,CTT)的测验分数等值,还是基于项目反应理论(Item Response Theory,IRT)的测验分数等值,由于存在各种模型、设计和方法,人们不得不对它们进行比较,以选择出适合数据资料的模型、设计和方法。
近年来,国内一些学者[2][3][4]对等值设计及方法均有探讨,但对等值模型的比较研究较少。实际上,在测量理论的实际应用中,如进行题库建设或自适应测验,需要选择合适的反应模型来进行等值,不同的模型适合于不同的等值数据。与CTT等值模型相比,由于IRT等值模型能够进行项目参数等值,IRT等值模型具有更多优点,所应用的范围更为广泛[5]。……
