(json: dict)
| 25 | |
| 26 | |
| 27 | def get_mmlu_result(json: dict): |
| 28 | # MMLU reults needs to be averaged across a few tests... |
| 29 | total_acc = sum(json['results'][key]['acc'] for key in json['results']) |
| 30 | avg_acc = total_acc / len(json['results']) |
| 31 | return avg_acc * 100 |
| 32 | |
| 33 | |
| 34 | def get_truthfulQA_result(json: dict): |
nothing calls this directly
no outgoing calls
no test coverage detected