MCPcopy Create free account
hub / github.com/ankane/tokenizers-ruby / test_encode_multibyte_offsets

Method test_encode_multibyte_offsets

test/tokenizer_test.rb:83–90  ·  view source on GitHub ↗

Source from the content-addressed store, hash-verified

81 end
82
83 def test_encode_multibyte_offsets
84 tokenizer = Tokenizers.from_pretrained("gpt2")
85 encoded = tokenizer.encode("I wanted to convert 10000 ¥ to $.")
86 expected_tokens = ["I", "Ġwanted", "Ġto", "Ġconvert", "Ġ10000", "ĠÂ¥", "Ġto", "Ġ$", "."]
87 expected_offsets = [[0, 1], [1, 8], [8, 11], [11, 19], [19, 25], [25, 27], [27, 30], [30, 32], [32, 33]]
88 assert_equal expected_tokens, encoded.tokens
89 assert_equal expected_offsets, encoded.offsets
90 end
91
92 def test_encode_pair_encoding
93 tokenizer = Tokenizers.from_pretrained("bert-base-cased")

Callers

nothing calls this directly

Calls 2

from_pretrainedMethod · 0.45
encodeMethod · 0.45

Tested by

no test coverage detected