| 81 | end |
| 82 | |
| 83 | def test_encode_multibyte_offsets |
| 84 | tokenizer = Tokenizers.from_pretrained("gpt2") |
| 85 | encoded = tokenizer.encode("I wanted to convert 10000 ¥ to $.") |
| 86 | expected_tokens = ["I", "Ġwanted", "Ġto", "Ġconvert", "Ġ10000", "ĠÂ¥", "Ġto", "Ġ$", "."] |
| 87 | expected_offsets = [[0, 1], [1, 8], [8, 11], [11, 19], [19, 25], [25, 27], [27, 30], [30, 32], [32, 33]] |
| 88 | assert_equal expected_tokens, encoded.tokens |
| 89 | assert_equal expected_offsets, encoded.offsets |
| 90 | end |
| 91 | |
| 92 | def test_encode_pair_encoding |
| 93 | tokenizer = Tokenizers.from_pretrained("bert-base-cased") |
nothing calls this directly
no test coverage detected