Skip to main content

Crate ri_esp_llm

Crate ri_esp_llm 

Source

Re-exports§

pub use compressed_attention::CompressedAttentionCache;
pub use int4::pack_i4_pair;
pub use int4::quantize_to_i4;
pub use int4::unpack_i4;
pub use sample::argmax;
pub use sample::Lcg;

Modules§

compressed_attention
Compressed attention cache for ESP32 using per-dimension quantized scoring.
int4
kv_cache
rnn
sample