背景描述
本数据集提供围绕特定主题的英语文章文本数据,可用于针对学生所写的英文作文进行机器自动评分。
数据说明
Tal_SenSco_train_data.txt:
训练数据文件,共有1200个数据样本,共有5个字段;第一个字段为样本编号,第二个字段为一篇文章,第三,第四个字段分别为两个老师按照标准对作文进行的打分,第五个字段为最终的打分;字段之间使用tab键进行分割,举例如下:
1 "Dear Local Newspaper, I believe the ……” 4 4 82 "Dear @CAPS1 @CAPS2, I have heard ……” 6 4 10
Tal_SenSco_test_data.txt :
测试数据文件,共有550个数据样本,共有2个字段;第一个字段为样本编号,第二个字段为一篇文章;字段之间使用tab键分割,举训练样例说明如下:
1 "Dear Local Newspaper, I believe the ……”2 "Dear @CAPS1 @CAPS2, I have heard ……”
