xberg 1.0.1

High-performance document intelligence library for Rust. Extract text, metadata, and structured data from PDFs, Office documents, images, and 98 formats and 306 programming languages via tree-sitter code intelligence with async/sync APIs.
Documentation
//! Vendored from text-splitter v0.30.1 (MIT, © 2023 Benjamin Brandt). See ATTRIBUTIONS.md.

use tokenizers::{Encoding, Tokenizer};

use super::super::ChunkSizer;

/// Compute the number of tokens that exist within an entire [`Encoding`] object.
///
/// Take into account [`Encoding::get_overflowing`] for cases where the [`Tokenizer`] producing the [`Encoding`] has truncation parameters set.
fn num_tokens_with_overflow(encoding: &Encoding, pad_id: Option<u32>) -> usize {
    let base = encoding
        .get_ids()
        .iter()
        .skip_while(|&id| pad_id.is_some_and(|pad_id| id == &pad_id))
        .take_while(|&id| pad_id.is_none_or(|pad_id| id != &pad_id))
        .count();

    let overflow: usize = encoding
        .get_overflowing()
        .iter()
        .map(|enc| num_tokens_with_overflow(enc, pad_id))
        .sum();

    base + overflow
}

impl ChunkSizer for Tokenizer {
    /// Returns the number of tokens in a given text after tokenization.
    ///
    /// # Panics
    ///
    /// Will panic if you don't have a byte-level tokenizer and the splitter
    /// encounters text it can't tokenize.
    fn size(&self, chunk: &str) -> usize {
        let encoding = self
            .encode_fast(chunk, false)
            .expect("Unable to tokenize the following string {chunk}");

        let pad_id = self.get_padding().map(|params| params.pad_id);
        num_tokens_with_overflow(&encoding, pad_id)
    }
}

#[cfg(test)]
mod tests {
    use super::*;

    fn tokenizer(repo: &str, revision: &str) -> Tokenizer {
        let path = crate::model_download::hf_resolve_file(repo, "tokenizer.json", Some(revision), None, None)
            .unwrap_or_else(|error| panic!("Could not resolve tokenizer '{repo}@{revision}': {error}"));
        Tokenizer::from_file(&path)
            .unwrap_or_else(|error| panic!("Could not load tokenizer '{}': {error}", path.display()))
    }

    #[test]
    fn returns_size() {
        let tokenizer = tokenizer("bert-base-cased", "cd5ef92a9fb2f889e972770a36d4ed042daf221e");
        let size = tokenizer.size(" An apple a");
        assert_eq!(size, 3);
    }

    #[test]
    fn returns_size_handles_prefix() {
        let tokenizer = tokenizer("thenlper/gte-small", "17e1f347d17fe144873b1201da91788898c639cd");

        let size = tokenizer.size("An apple a");
        assert_eq!(size, 3);
    }

    #[test]
    fn handles_padding() {
        let tokenizer = tokenizer("thenlper/gte-small", "17e1f347d17fe144873b1201da91788898c639cd");
        let size = tokenizer.size("An apple a");
        assert_eq!(size, 3);
    }

    #[test]
    fn handle_truncation() {
        let tokenizer = tokenizer(
            "sentence-transformers/all-MiniLM-L6-v2",
            "1110a243fdf4706b3f48f1d95db1a4f5529b4d41",
        );

        assert_eq!(
            tokenizer.size("An apple a day keeps the doctor away.".repeat(100).as_str()),
            128
        );
    }
}