(
sources,
targets,
tokenizer: transformers.PreTrainedTokenizer,
)
| 82 | ) |
| 83 | |
| 84 | def preprocess( |
| 85 | sources, |
| 86 | targets, |
| 87 | tokenizer: transformers.PreTrainedTokenizer, |
| 88 | ): |
| 89 | sources_tokenized = _tokenize_fn(sources, tokenizer) |
| 90 | input_ids = sources_tokenized["input_ids"] |
| 91 | return dict(input_ids=input_ids, labels=copy.deepcopy(input_ids)) |
| 92 | |
| 93 | class SupervisedDataset(Dataset): |
| 94 | """Dataset for supervised fine-tuning.""" |
no test coverage detected