学位论文 > 优秀研究生学位论文题录展示
大规模网上作文评分的信度研究
作 者: 师艳芹
导 师: 肖云南
学 校: 湖南大学
专 业: 外国语言学及应用语言学
关键词: 信度 评分一致性 多侧面Rasch模型 严厉度 评分标准 FACETS
分类号: H319
类 型: 硕士论文
年 份: 2009年
下 载: 142次
引 用: 0次
阅 读: 论文下载
内容摘要
|
评分不一致是影响评分信度的主要因素。本文通过评分一致性检测来研究大规模网上作文评分的信度。以湖南大学英语分级考试作文测试为研究对象,采用IRT多侧面Rasch模型,通过分析评分员内部一致性及评分员之间的一致性来研究评分的信度。本研究从2007年9月湖南大学英语分级考试作文测试中随机抽出540份考卷,涵盖4个写作任务,并由9位评分员对试卷进行了第二次评分,评分采用了“二读法”。所得的数据利用FACETS软件进行分析。研究采用的模型(即Partial Credit Model)假定每个评分员有独立的评分量表,这种模型可以用来考查评分员对评分标准的理解和使用是否存在显著差异。本文首先运用FACETS主层面分析检查单个评分员的评分严厉度及评分员对评分标准的把握是否保持一致,然后运用偏差分析探讨单个评分员在不同的写作任务上是否具有评分一致性。通过分析,本研究得出以下结论:第一,评分员的严厉度水平存在显著性差异;第二,评分员内部一致性较好,但评分员之间的一致性较差;第三,所有评分员在评阅不同的写作任务时保持了内部一致性,无显著偏差,但总体严厉度不高;第四,部分考生的分数经FACETS分析后得出的平均分与原始分存在差异。本研究对如何提高写作评分的一致性提供如下建议和参考:首先,根据数据分析对评分量表解释有歧义或不准确的地方进行修改;其次,对评分一致性不高的评分员进行再培训,指出并纠正其缺点;最后,由于大规模考试对考生具有很高的利益攸关性(high-stakes),建议对考生分数进行FACETS分析以调整其差异显著分数,这也正是本研究的一个尝试和创新。在大规模考试作文评分中,对误差的控制是十分必要地。控制误差主要是确保评分员内部一致性及评分员之间的一致性。通过利用多侧面Rasch模型的FACET软件对评分差异进行分析,根据拟合值和偏差值来检测评分不一致的评分员,对他们进行再培训或予以更换,以此来保证大规模考试作文评分的信度。
|
全文目录
摘要 5-6 Abstract 6-10 List of Figures 10-11 List of Tables 11-12 Abbreviations 12-13 Chapter 1 Introduction 13-16 1.1 Research Background 13-14 1.2 Research Orientation and Key Research Questions 14 1.3 The Rationale of the Present Study 14-15 1.4 Organization of the Thesis 15-16 Chapter 2 Literature Review 16-23 2.1 An Overview of Online Writing Scoring by Human Raters 16-17 2.2 Exploring Rating Consistency with Many-facet Rasch Measurement 17-18 2.3 Many-facet Rasch Measurement 18-23 2.3.1 Introduction 18-19 2.3.2 Advantages 19-20 2.3.3 The Use of Many-facet Rasch Measurement in the Performance Assessment 20-22 2.3.4 Summary 22-23 Chapter 3 Research Methodology 23-27 3.1 Participants 23 3.2 Instrument 23-24 3.2.1 Writing Essays 23 3.2.2 Computer Equipment 23-24 3.3 Rating Design 24-26 3.4 Questionnaire 26-27 Chapter 4 CEPT Writing Test 27-34 4.1 Introduction 27-28 4.2 Writing Scoring Procedure 28-33 4.2.1 Rating Scale 29-30 4.2.2 Scoring Raters 30 4.2.3 Scoring Process 30-32 4.2.4 Checking Process 32-33 4.2.5 Recording Scores 33 4.3 Summary 33-34 Chapter 5 Data Analysis 34-45 5.1 Primary Facets Analysis 34-43 5.1.1 Task Measurement Report 35-36 5.1.2 Examinee Measurement Report 36-40 5.1.3 Rater Measurement Report 40-43 5.2 Rater-Task Bias Analysis 43-45 Chapter 6 Discussion 45-49 6.1 Discussion of Questionnaire 45-46 6.2 Discussion of the First Research Question 46 6.3 Discussion of the Second Research Question 46-47 6.4 Discussion of the Third Research Question 47 6.5 Discussion of the Fourth Research Question 47-49 Conclusion 49-53 Conclusion 49-50 Implications of the Study 50-51 Limitations of the Present Study 51 Suggestions for Further Research in Online Writing Scoring 51-53 References 53-57 Appendix A Discrimination of Writing Levels 57-58 Appendix B Rating Scale 58-61 Appendix C Questionnaire for Raters' Behaviors 61-63 Appendix D Writing Scoring Samples 63-67 Appendix E Scripts for Running the Primary FACETS Analysis 67-69 Appendix F 详细中文摘要 69-72 Acknowledgements 72
|
相似论文
- 重庆市体育高考评分标准研究,G807.4
- 中国核电厂操纵人员心理健康测评量表的初步修订,B849
- 应用需要层次理论和人性关怀照护理论构建最优陪护模式的研究,R47
- 埃森儿童青少年创伤问卷中文版信效度研究,B841
- 基于多元概化理论的CET-SET信度分析,H310.4
- 正常人动态平衡能力测试的信度和效度,R87
- 护理行为六维度量表的编译评价及适用性研究,R47
- 新疆住院冠心病患者自我管理行为及相关因素的研究,R473.5
- 妇科恶性肿瘤患者心理问题评估量表及其常模的研制,R473.73
- 肝炎后肝硬化中医PRO量表的修订与考核,R259
- 医学研究生PBL模式教学质量评价体系研究,R-4
- DAP-R中文版修订及在中老年基督教信徒中的应用,B978
- 重庆市基层干部领导行为与选拔任用干部公信度的关系研究,D262.3
- 公众期望与选用干部公信度的关系研究,D262.3
- 手机依赖性尺度变量探索,C912
- 中文版轻躁症状自评量表(HCL-32)在综合医院精神/心理科门诊患者中的应用,R749.4
- 超声波联合推拿治疗肌筋膜疼痛综合征的临床观察,R686.3
- 中文版行走受损问卷在2型糖尿病外周动脉疾病及2型糖尿病人群中的应用研究,R587.1
- 神经根型颈椎病“病证结合”量表信度效度验证,R274.9
- 大学生心理弹性问卷的编制及其初步应用,B841.7
- 长沙电业局员工组织承诺与工作绩效关系的实证研究,F426.61;F224
中图分类: > 语言、文字 > 常用外国语 > 英语 > 语文教学
© 2012 www.xueweilunwen.com
|