MCPcopy Create free account
hub / github.com/catboost/catboost / SplitIntoTokens

Function SplitIntoTokens

library/cpp/tokenizer/split.cpp:59–68  ·  view source on GitHub ↗

Source from the content-addressed store, hash-verified

57const TTokenizerSplitParams::THandledMask TTokenizerSplitParams::NOT_PUNCT(NLP_WORD, NLP_INTEGER, NLP_FLOAT, NLP_MARK);
58
59TVector<TUtf16String> SplitIntoTokens(const TUtf16String& text, const TTokenizerSplitParams& params) {
60 TVector<TUtf16String> words;
61
62 TSimpleTokenHandler handler(&words, params);
63 TNlpTokenizer tokenizer(handler, params.BackwardCompatibility);
64 TTokenizerOptions opts { params.SpacePreserve, params.TokenizerLangMask, params.UrlDecode };
65 tokenizer.Tokenize(text.data(), text.size(), opts);
66
67 return words;
68}
69
70TVector<TUtf16String> SplitIntoSentences(const TUtf16String& text, const TTokenizerSplitParams& params) {
71 TVector<TUtf16String> sentences;

Callers

nothing calls this directly

Calls 3

TokenizeMethod · 0.45
dataMethod · 0.45
sizeMethod · 0.45

Tested by

no test coverage detected