MCPcopy Create free account
hub / github.com/THUDM/GLM / EncodeAsIds

Method EncodeAsIds

data_utils/tokenization.py:747–753  ·  view source on GitHub ↗

convert text to sentencepiece Ids

(self, text, process_fn=None)

Source from the content-addressed store, hash-verified

745 print('sentencepiece model written to ' + self.spm_model, flush=True)
746
747 def EncodeAsIds(self, text, process_fn=None):
748 """convert text to sentencepiece Ids"""
749 processed_text = text
750 if process_fn is not None:
751 processed_text = process_fn(processed_text)
752 tokens = self.sp.EncodeAsIds(processed_text)
753 return Tokenization(tokens, processed_text, text)
754
755 def EncodeAsTokens(self, text, process_fn=None):
756 """convert text to sentencepiece tokens"""

Callers

nothing calls this directly

Calls 2

TokenizationClass · 0.85
EncodeAsIdsMethod · 0.45

Tested by

no test coverage detected