背景描述

本数据集提供围绕特定主题的英语文章文本数据,可用于针对学生所写的英文作文进行机器自动评分。


数据说明

Tal_SenSco_train_data.txt:

训练数据文件,共有1200个数据样本,共有5个字段;第一个字段为样本编号,第二个字段为一篇文章,第三,第四个字段分别为两个老师按照标准对作文进行的打分,第五个字段为最终的打分;字段之间使用tab键进行分割,举例如下:

1 "Dear Local Newspaper, I believe the ……” 4 4 82 "Dear @CAPS1 @CAPS2, I have heard ……” 6 4 10

Tal_SenSco_test_data.txt :

测试数据文件,共有550个数据样本,共有2个字段;第一个字段为样本编号,第二个字段为一篇文章;字段之间使用tab键分割,举训练样例说明如下:

1 "Dear Local Newspaper, I believe the ……”2 "Dear @CAPS1 @CAPS2, I have heard ……”