(args)
| 188 | |
| 189 | |
| 190 | def main(args): |
| 191 | model, tokenizer = load_models_tokenizer(args) |
| 192 | |
| 193 | dev_result = {} |
| 194 | for subject_name in tqdm(SUBJECTS): |
| 195 | # val_file_path = os.path.join(args.eval_data_path, 'val', f'{subject_name}_val.csv') |
| 196 | dev_file_path = os.path.join( |
| 197 | args.eval_data_path, "dev", f"{subject_name}_dev.csv" |
| 198 | ) |
| 199 | test_file_path = os.path.join( |
| 200 | args.eval_data_path, "test", f"{subject_name}_test.csv" |
| 201 | ) |
| 202 | # val_df = pd.read_csv(val_file_path, names=['question','A','B','C','D','answer']) |
| 203 | dev_df = pd.read_csv( |
| 204 | dev_file_path, names=["question", "A", "B", "C", "D", "answer"] |
| 205 | ) |
| 206 | test_df = pd.read_csv( |
| 207 | test_file_path, names=["question", "A", "B", "C", "D", "answer"] |
| 208 | ) |
| 209 | |
| 210 | score = eval_subject( |
| 211 | model, |
| 212 | tokenizer, |
| 213 | subject_name, |
| 214 | test_df, |
| 215 | dev_df=dev_df, |
| 216 | k=5, |
| 217 | few_shot=True, |
| 218 | save_result_dir=f"outs/mmlu_eval_result", |
| 219 | ) |
| 220 | dev_result[subject_name] = score |
| 221 | cal_mmlu(dev_result) |
| 222 | |
| 223 | |
| 224 | TASK_NAME_MAPPING = { |
no test coverage detected