Expand description
Safe Rust bindings for ik_llama.cpp (ikawrakow’s SOTA-quant fork).
Mirrors the API and codestyle of the llama-cpp-2 crate
(utilityai/llama-cpp-rs), adapted for ik_llama.cpp’s divergent C API:
legacy llama_sample_* sampling, model-pointer tokenizer, ik-specific
model/context params, and the MTP / NextN speculative path.
v1 covers the general generation path (load → tokenize → decode → sample) plus the MTP scaffolding.
Re-exports§
pub use context::params::LlamaContextParams;pub use context::params::LlamaContextType;pub use context::LlamaContext;pub use grammar::json_schema_to_grammar;pub use grammar::JsonSchemaError;pub use grammar::DryInitError;pub use grammar::DryParams;pub use grammar::GrammarInitError;pub use grammar::LlamaDrySampler;pub use grammar::LlamaGrammar;pub use llama_backend::LlamaBackend;pub use llama_batch::LlamaBatch;pub use model::params::LlamaModelParams;pub use model::AddBos;pub use model::LlamaModel;pub use sampling::LlamaSampler;pub use speculative::MtpOpType;pub use speculative::MtpSpeculativeParams;pub use speculative::MtpSpeculative;pub use speculative::MtpStep;pub use token::data::LlamaTokenData;pub use token::data_array::LlamaTokenDataArray;pub use token::LlamaToken;
Modules§
- context
- Safe wrapper around
llama_context(LlamaContext). - gguf
- Safe wrapper around
gguf_contextfor reading GGUF file metadata. - grammar
- Stateful GBNF grammar + DRY samplers.
- llama_
backend - Process-wide ik_llama.cpp backend initialization.
- llama_
batch - Token batch for decode (
LlamaBatch) over ik’sllama_batch. - model
- Safe wrapper around
llama_model(LlamaModel). - quantize
- Model quantization write-path over ik’s
llama_model_quantize. - sampling
- Sampling — a chain-object
LlamaSamplermatchingllama-cpp-2’s API, emulated over ik_llama.cpp’s legacyllama_sample_*array functions. - speculative
- Multi-Token Prediction (MTP / NextN) support.
- timing
- Safe wrapper around
llama_timings. - token
- Token newtype.
Enums§
- Llama
Error - Errors returned by the safe wrapper.