MCPcopy Create free account
hub / github.com/M4THYOU/TokenDagger / create_tokenizer

Function create_tokenizer

tokendagger/wrapper.py:358–380  ·  view source on GitHub ↗

Create a tokenizer from in-memory data. Args: name: Name of the tokenizer pattern: Regex pattern for text splitting vocab: Vocabulary items special_tokens: Special tokens mapping Returns: Initialized Tokenizer instance

(
    name: str,
    pattern: str,
    vocab: list[dict],
    special_tokens: dict[str, int] | None = None,
)

Source from the content-addressed store, hash-verified

356
357
358def create_tokenizer(
359 name: str,
360 pattern: str,
361 vocab: list[dict],
362 special_tokens: dict[str, int] | None = None,
363) -> Tokenizer:
364 """Create a tokenizer from in-memory data.
365
366 Args:
367 name: Name of the tokenizer
368 pattern: Regex pattern for text splitting
369 vocab: Vocabulary items
370 special_tokens: Special tokens mapping
371
372 Returns:
373 Initialized Tokenizer instance
374 """
375 return Tokenizer(
376 name=name,
377 pattern=pattern,
378 vocab=vocab,
379 special_tokens=special_tokens,
380 )
381
382def Encoding(
383 name: str,

Callers

nothing calls this directly

Calls 1

TokenizerClass · 0.85

Tested by

no test coverage detected