MCPcopy Create free account
hub / github.com/THUDM/GLM / sentence_split

Method sentence_split

data_utils/datasets.py:926–935  ·  view source on GitHub ↗

split document into sentences

(self, document)

Source from the content-addressed store, hash-verified

924 return sample
925
926 def sentence_split(self, document):
927 """split document into sentences"""
928 lines = document.split('\n')
929 if self.presplit_sentences:
930 return [line for line in lines if line]
931 rtn = []
932 for line in lines:
933 if line != '':
934 rtn.extend(tokenize.sent_tokenize(line))
935 return rtn
936
937 def sentence_tokenize(self, sent, sentence_num=0, beginning=False, ending=False):
938 """tokenize sentence and get token types"""

Callers 1

Calls 1

extendMethod · 0.80

Tested by

no test coverage detected