MCPcopy Create free account
hub / github.com/THUDM/GLM / Encoder_SP

Class Encoder_SP

data_utils/sp_tokenizer.py:98–127  ·  view source on GitHub ↗

Source from the content-addressed store, hash-verified

96
97
98class Encoder_SP:
99 def __init__(self, model_path):
100 self.sp = spm.SentencePieceProcessor()
101 self.sp.Load(model_path)
102
103 def encode(self, text):
104 """
105 text="...."
106 """
107 return self.sp.EncodeAsIds(text)
108
109 def decode(self, tokens):
110 """
111 tokens=[x1,x2,...]
112 """
113 text = [int(token) for token in tokens]
114 # print(text)
115 return self.sp.DecodeIds(text)
116
117 def tokenize(self, text):
118 return self.sp.EncodeAsPieces(text)
119
120 def convert_tokens_to_ids(self, tokens):
121 return [self.sp.PieceToId(token) for token in tokens]
122
123 def convert_token_to_id(self, token):
124 return self.sp.PieceToId(token)
125
126 def convert_id_to_token(self, idx):
127 return self.sp.IdToPiece(idx)
128
129
130def get_encoder(encoder_file, bpe_file):

Callers 1

get_encoderFunction · 0.85

Calls

no outgoing calls

Tested by

no test coverage detected