use tokenizers::{Encoding, Tokenizer};
use super::super::ChunkSizer;
fn num_tokens_with_overflow(encoding: &Encoding, pad_id: Option<u32>) -> usize {
let base = encoding
.get_ids()
.iter()
.skip_while(|&id| pad_id.is_some_and(|pad_id| id == &pad_id))
.take_while(|&id| pad_id.is_none_or(|pad_id| id != &pad_id))
.count();
let overflow: usize = encoding
.get_overflowing()
.iter()
.map(|enc| num_tokens_with_overflow(enc, pad_id))
.sum();
base + overflow
}
impl ChunkSizer for Tokenizer {
fn size(&self, chunk: &str) -> usize {
let encoding = self
.encode_fast(chunk, false)
.expect("Unable to tokenize the following string {chunk}");
let pad_id = self.get_padding().map(|params| params.pad_id);
num_tokens_with_overflow(&encoding, pad_id)
}
}
#[cfg(test)]
mod tests {
use super::*;
fn tokenizer(repo: &str, revision: &str) -> Tokenizer {
let path = crate::model_download::hf_resolve_file(repo, "tokenizer.json", Some(revision), None, None)
.unwrap_or_else(|error| panic!("Could not resolve tokenizer '{repo}@{revision}': {error}"));
Tokenizer::from_file(&path)
.unwrap_or_else(|error| panic!("Could not load tokenizer '{}': {error}", path.display()))
}
#[test]
fn returns_size() {
let tokenizer = tokenizer("bert-base-cased", "cd5ef92a9fb2f889e972770a36d4ed042daf221e");
let size = tokenizer.size(" An apple a");
assert_eq!(size, 3);
}
#[test]
fn returns_size_handles_prefix() {
let tokenizer = tokenizer("thenlper/gte-small", "17e1f347d17fe144873b1201da91788898c639cd");
let size = tokenizer.size("An apple a");
assert_eq!(size, 3);
}
#[test]
fn handles_padding() {
let tokenizer = tokenizer("thenlper/gte-small", "17e1f347d17fe144873b1201da91788898c639cd");
let size = tokenizer.size("An apple a");
assert_eq!(size, 3);
}
#[test]
fn handle_truncation() {
let tokenizer = tokenizer(
"sentence-transformers/all-MiniLM-L6-v2",
"1110a243fdf4706b3f48f1d95db1a4f5529b4d41",
);
assert_eq!(
tokenizer.size("An apple a day keeps the doctor away.".repeat(100).as_str()),
128
);
}
}