pub enum Tokenizer {
Word,
Whitespace,
Prefix,
Multilingual,
}Expand description
Tokenizer, mirroring Qdrant’s TokenizerType names.
Multilingual parses but fails closed at build time: it needs the
charabia/vaporetto segmentation stack, which qql-embed deliberately
does not depend on (lean core for WASM/edge; no model files to ship).
Variants§
Word
Split on non-alphanumeric boundaries (Qdrant default).
Whitespace
Split on Unicode whitespace only.
Prefix
Document side expands all n-grams; query side keeps the longest only.
Multilingual
Script-aware segmentation (requires tokenizer support not compiled in).
Implementations§
Trait Implementations§
impl Copy for Tokenizer
impl Eq for Tokenizer
impl StructuralPartialEq for Tokenizer
Auto Trait Implementations§
impl Freeze for Tokenizer
impl RefUnwindSafe for Tokenizer
impl Send for Tokenizer
impl Sync for Tokenizer
impl Unpin for Tokenizer
impl UnsafeUnpin for Tokenizer
impl UnwindSafe for Tokenizer
Blanket Implementations§
Source§impl<T> BorrowMut<T> for Twhere
T: ?Sized,
impl<T> BorrowMut<T> for Twhere
T: ?Sized,
Source§fn borrow_mut(&mut self) -> &mut T
fn borrow_mut(&mut self) -> &mut T
Mutably borrows from an owned value. Read more