| 2 | |
| 3 | class TokenizerTest < Minitest::Test |
| 4 | def test_from_pretrained_bert |
| 5 | tokenizer = Tokenizers.from_pretrained("bert-base-cased") |
| 6 | |
| 7 | # encode |
| 8 | encoded = tokenizer.encode("I can feel the magic, can you?") |
| 9 | expected_ids = [101, 146, 1169, 1631, 1103, 3974, 117, 1169, 1128, 136, 102] |
| 10 | expected_tokens = ["[CLS]", "I", "can", "feel", "the", "magic", ",", "can", "you", "?", "[SEP]"] |
| 11 | assert_equal expected_ids, encoded.ids |
| 12 | assert_equal expected_tokens, encoded.tokens |
| 13 | |
| 14 | # decode |
| 15 | assert_equal "I can feel the magic, can you?", tokenizer.decode(encoded.ids) |
| 16 | end |
| 17 | |
| 18 | def test_from_pretrained_gpt2 |
| 19 | tokenizer = Tokenizers.from_pretrained("gpt2") |
nothing calls this directly
no test coverage detected