Methodm_find_wordsTokenize lines, and look for pairs of adjacent words. Yield (prev_word, word), 1 and (prev_word, '*'), 1 for each pair
mrjob/examples/mr_next_word_stats.py:38
Methodmapper For each log line, with probability self.sampling_probability, yield a None key, and (random seed, line) as the value, so that
mrjob/examples/mr_log_sampler.py:83