(story_prompts, generated_answers)
| 104 | |
| 105 | |
| 106 | def get_gpt_eval(story_prompts, generated_answers): |
| 107 | mark_dict = {} |
| 108 | all_labels = [] |
| 109 | |
| 110 | i = 0 |
| 111 | for story_prompt, generated_answer in tqdm(zip(story_prompts, generated_answers)): |
| 112 | messages, gpt_eval = get_eval_prompt_1(story_prompt, generated_answer) |
| 113 | answer = get_eval_prompt_2(gpt_eval, messages) |
| 114 | all_labels.append({"review": gpt_eval, "answer": answer}) |
| 115 | mark_dict[i] = get_final_marks(answer) |
| 116 | i += 1 |
| 117 | return all_labels, mark_dict |
| 118 | |
| 119 | |
| 120 | def print_mean_scores(score_dict): |
no test coverage detected