MCPcopy Create free account
hub / github.com/tensorflow/models / make_paragraph

Function make_paragraph

official/projects/triviaqa/preprocess.py:103–122  ·  view source on GitHub ↗

Tokenizes paragraphs.

(
    sentence_tokenizer: nltk.tokenize.api.TokenizerI,
    processor: spm.SentencePieceProcessor,
    text: Text,
    paragraph_metric: Optional[metrics.Metrics.DelegatingDistribution] = None,
    sentence_metric: Optional[metrics.Metrics.DelegatingDistribution] = None
)

Source from the content-addressed store, hash-verified

101
102
103def make_paragraph(
104 sentence_tokenizer: nltk.tokenize.api.TokenizerI,
105 processor: spm.SentencePieceProcessor,
106 text: Text,
107 paragraph_metric: Optional[metrics.Metrics.DelegatingDistribution] = None,
108 sentence_metric: Optional[metrics.Metrics.DelegatingDistribution] = None
109) -> Paragraph:
110 """Tokenizes paragraphs."""
111 paragraph_size = 0
112 sentences = []
113 for sentence in sentence_tokenizer.tokenize(text):
114 sentencepiece_text = sentencepiece_pb2.SentencePieceText.FromString(
115 processor.EncodeAsSerializedProto(sentence))
116 paragraph_size += len(sentencepiece_text.pieces)
117 sentences.append(sentencepiece_text)
118 if sentence_metric:
119 sentence_metric.update(len(sentencepiece_text.pieces))
120 if paragraph_metric:
121 paragraph_metric.update(paragraph_size)
122 return Paragraph(sentences=sentences, size=paragraph_size)
123
124
125def read_question_answers(json_path: Text) -> List[QuestionAnswer]:

Callers 1

_make_featuresMethod · 0.85

Calls 3

ParagraphClass · 0.85
updateMethod · 0.80
tokenizeMethod · 0.45

Tested by

no test coverage detected