MCPcopy Create free account
hub / github.com/THUDM/GLM / EncodeAsTokens

Method EncodeAsTokens

data_utils/tokenization.py:755–761  ·  view source on GitHub ↗

convert text to sentencepiece tokens

(self, text, process_fn=None)

Source from the content-addressed store, hash-verified

753 return Tokenization(tokens, processed_text, text)
754
755 def EncodeAsTokens(self, text, process_fn=None):
756 """convert text to sentencepiece tokens"""
757 processed_text = text
758 if process_fn is not None:
759 processed_text = process_fn(processed_text)
760 tokens = self.sp.EncodeAsTokens(processed_text)
761 return Tokenization(tokens, processed_text, text, asIds=False)
762
763 def IdToToken(self, Id):
764 """convert Id to sentencpiece token"""

Callers

nothing calls this directly

Calls 2

TokenizationClass · 0.85
EncodeAsTokensMethod · 0.45

Tested by

no test coverage detected