Trains tokenizers and manages the metadata required by classifier artifacts.
Summary
Functions
Returns the vocabulary size and required special-token IDs for a tokenizer.
Trains a BPE tokenizer from an enumerable of strings.
Functions
Returns the vocabulary size and required special-token IDs for a tokenizer.
Trains a BPE tokenizer from an enumerable of strings.
Options
:vocab_size- Positive maximum vocabulary size. It must be at least5so all required special tokens can be included. Defaults to8000.:normalizer- Text normalizer to apply before tokenization. Accepts:nfkc_lowercase(Unicode NFKC + lowercasing, default),:nfkc,:lowercase,:none,nil, or a customTokenizers.Normalizerstruct. Defaults to:nfkc_lowercase.
The tokenizer always includes [UNK], [CLS], [SEP], [PAD], and
[MASK] as special tokens.