| 57 | const TTokenizerSplitParams::THandledMask TTokenizerSplitParams::NOT_PUNCT(NLP_WORD, NLP_INTEGER, NLP_FLOAT, NLP_MARK); |
| 58 | |
| 59 | TVector<TUtf16String> SplitIntoTokens(const TUtf16String& text, const TTokenizerSplitParams& params) { |
| 60 | TVector<TUtf16String> words; |
| 61 | |
| 62 | TSimpleTokenHandler handler(&words, params); |
| 63 | TNlpTokenizer tokenizer(handler, params.BackwardCompatibility); |
| 64 | TTokenizerOptions opts { params.SpacePreserve, params.TokenizerLangMask, params.UrlDecode }; |
| 65 | tokenizer.Tokenize(text.data(), text.size(), opts); |
| 66 | |
| 67 | return words; |
| 68 | } |
| 69 | |
| 70 | TVector<TUtf16String> SplitIntoSentences(const TUtf16String& text, const TTokenizerSplitParams& params) { |
| 71 | TVector<TUtf16String> sentences; |