Skip to main content

Module mimi

Module mimi 

Source
Expand description

Mimi neural audio tokenizer support. Mimi neural audio tokenizer support.

Mimi is the neural audio codec used by Moshi-family realtime models. This module implements backend-neutral checkpoint parameters, the split residual vector quantizer, and the non-streaming SEANet/transformer encoder and decoder used to map between PCM and Mimi codebook tokens.

Structs§

CheckpointTensorPlan
Backend-independent loading plan for one tensor in a released Mimi checkpoint.
Config
Mimi codec configuration.
Conv1x1NoBias
Bias-free 1x1 convolution over [batch, channels, frames] tensors.
EuclideanCodebook
Euclidean codebook backed by EMA cluster statistics.
Mimi
Mimi audio tokenizer.
ResidualVectorQuantization
Residual vector quantization layers.
ResidualVectorQuantizer
Residual vector quantizer branch.
SplitResidualVectorQuantizer
Split residual vector quantizer used by Mimi.
VectorQuantization
Single vector-quantization layer.

Enums§

CheckpointTensorLayout
Backend-independent layout conversion required by a Mimi checkpoint tensor.
ResampleMethod
Mimi resampling strategy.

Functions§

checkpoint_tensor_plan
Maps a released Mimi checkpoint tensor name to its stable model parameter and required layout conversion.