(predicted_sequences, ground_truths)
| 23 | |
| 24 | |
| 25 | def eval(predicted_sequences, ground_truths): |
| 26 | outputs = resolve(predicted_sequences) |
| 27 | gts = resolve(ground_truths) |
| 28 | |
| 29 | bleu_1 = caculate_bleu(outputs["reasonings"], gts["reasonings"], 1) |
| 30 | bleu_4 = caculate_bleu(outputs["reasonings"], gts["reasonings"], 4) |
| 31 | rouge = caculate_rouge(outputs["reasonings"], gts["reasonings"]) |
| 32 | accuracy = caculate_accuracy(outputs["answers"], gts["answers"]) |
| 33 | |
| 34 | evaluation_result = {"bleu-1": bleu_1, "bleu-4": bleu_4, "rouge-L": rouge, "accuracy": accuracy} |
| 35 | return evaluation_result |
nothing calls this directly
no test coverage detected