| 326 | return res, lines |
| 327 | |
| 328 | def unwrap(self, outputs, num_return_sequences): |
| 329 | batch_return = [] |
| 330 | responses_list = [] |
| 331 | for i in range(len(outputs)): |
| 332 | # sample_idx = i // num_return_sequences |
| 333 | output = outputs[i][self.lengths: ] # slicing on token level |
| 334 | output = self.tokenizer.decode(output, skip_special_tokens=True) |
| 335 | |
| 336 | batch_return.append(output) |
| 337 | if i % num_return_sequences == num_return_sequences - 1: |
| 338 | responses_list.append(batch_return) |
| 339 | batch_return = [] |
| 340 | return responses_list |
| 341 | |
| 342 | |
| 343 | class MyDataset(Dataset): |