MCPcopy Create free account
hub / github.com/SkyworkAI/Skywork / main

Function main

eval/evaluate_mmlu.py:190–221  ·  view source on GitHub ↗
(args)

Source from the content-addressed store, hash-verified

188
189
190def main(args):
191 model, tokenizer = load_models_tokenizer(args)
192
193 dev_result = {}
194 for subject_name in tqdm(SUBJECTS):
195 # val_file_path = os.path.join(args.eval_data_path, 'val', f'{subject_name}_val.csv')
196 dev_file_path = os.path.join(
197 args.eval_data_path, "dev", f"{subject_name}_dev.csv"
198 )
199 test_file_path = os.path.join(
200 args.eval_data_path, "test", f"{subject_name}_test.csv"
201 )
202 # val_df = pd.read_csv(val_file_path, names=['question','A','B','C','D','answer'])
203 dev_df = pd.read_csv(
204 dev_file_path, names=["question", "A", "B", "C", "D", "answer"]
205 )
206 test_df = pd.read_csv(
207 test_file_path, names=["question", "A", "B", "C", "D", "answer"]
208 )
209
210 score = eval_subject(
211 model,
212 tokenizer,
213 subject_name,
214 test_df,
215 dev_df=dev_df,
216 k=5,
217 few_shot=True,
218 save_result_dir=f"outs/mmlu_eval_result",
219 )
220 dev_result[subject_name] = score
221 cal_mmlu(dev_result)
222
223
224TASK_NAME_MAPPING = {

Callers 1

evaluate_mmlu.pyFile · 0.70

Calls 3

cal_mmluFunction · 0.85
load_models_tokenizerFunction · 0.70
eval_subjectFunction · 0.70

Tested by

no test coverage detected