(iterable_data, tokenizer, src)
| 7 | |
| 8 | # Turns an iterable into a generator |
| 9 | def _yield_tokens(iterable_data, tokenizer, src): |
| 10 | |
| 11 | # Iterable data stores the samples as (src, tgt) so this will help us select just one language or the other |
| 12 | index = 0 if src else 1 |
| 13 | |
| 14 | for data in iterable_data: |
| 15 | yield tokenizer(data[index]) |
| 16 | |
| 17 | # Get data, tokenizer, text transform, vocab objs, etc. Everything we |
| 18 | # need to start training the model |