pub fn load_mla_attn(
shard: &ShardedSafetensors,
prefix: &str,
num_heads: usize,
q_lora_rank: usize,
kv_lora_rank: usize,
qk_nope_head_dim: usize,
qk_rope_head_dim: usize,
v_head_dim: usize,
hidden_dim: usize,
) -> Result<MlaAttnWeights, KimiLoadError>Expand description
Loads one Gated-MLA-attention layer’s weights (real tensor names
under {prefix}.self_attn.*).