use half::f16;
use crate::{q4_k_scale_min, Q4_K_BLOCK_BYTES, Q4_K_BLOCK_ELEMS, Q4_K_SCALE_BYTES};
const SUB: usize = 8;
const SUB_ELEMS: usize = Q4_K_BLOCK_ELEMS / SUB;
#[inline]
fn nearest_int(fval: f32) -> i32 {
let val = fval + 12_582_912.0f32;
let i = val.to_bits() as i32;
(i & 0x007f_ffff) - 0x0040_0000
}
#[allow(clippy::too_many_arguments)]
fn make_qkx2_quants(
x: &[f32],
weights: &[f32],
l: &mut [u8],
laux: &mut [u8],
nmax: i32,
rmin: f32,
rdelta: f32,
nstep: i32,
use_mad: bool,
) -> (f32, f32) {
let n = x.len();
debug_assert_eq!(weights.len(), n);
debug_assert_eq!(l.len(), n);
debug_assert!(laux.len() >= n);
let mut min = x[0];
let mut max = x[0];
let mut sum_w = weights[0];
let mut sum_x = sum_w * x[0];
for i in 1..n {
if x[i] < min {
min = x[i];
}
if x[i] > max {
max = x[i];
}
let w = weights[i];
sum_w += w;
sum_x += w * x[i];
}
if min > 0.0 {
min = 0.0;
}
if max == min {
l[..n].fill(0);
return (0.0, -min);
}
let mut iscale = nmax as f32 / (max - min);
let mut scale = 1.0 / iscale;
let mut best_error = 0.0f32;
for i in 0..n {
let li = nearest_int(iscale * (x[i] - min)).clamp(0, nmax);
l[i] = li as u8;
let diff = scale * l[i] as f32 + min - x[i];
let diff = if use_mad { diff.abs() } else { diff * diff };
best_error += weights[i] * diff;
}
if nstep < 1 {
return (scale, -min);
}
for is in 0..=nstep {
iscale = (rmin + rdelta * is as f32 + nmax as f32) / (max - min);
let (mut sum_l, mut sum_l2, mut sum_xl) = (0.0f32, 0.0f32, 0.0f32);
for i in 0..n {
let li = nearest_int(iscale * (x[i] - min)).clamp(0, nmax);
laux[i] = li as u8;
let w = weights[i];
sum_l += w * li as f32;
sum_l2 += w * li as f32 * li as f32;
sum_xl += w * li as f32 * x[i];
}
let det = sum_w * sum_l2 - sum_l * sum_l;
if det > 0.0 {
let mut this_scale = (sum_w * sum_xl - sum_x * sum_l) / det;
let mut this_min = (sum_l2 * sum_x - sum_l * sum_xl) / det;
if this_min > 0.0 {
this_min = 0.0;
this_scale = sum_xl / sum_l2;
}
let mut cur_error = 0.0f32;
for i in 0..n {
let diff = this_scale * laux[i] as f32 + this_min - x[i];
let diff = if use_mad { diff.abs() } else { diff * diff };
cur_error += weights[i] * diff;
}
if cur_error < best_error {
l[..n].copy_from_slice(&laux[..n]);
best_error = cur_error;
scale = this_scale;
min = this_min;
}
}
}
(scale, -min)
}
#[doc(hidden)]
pub fn probe_sub_block(xs: &[f32]) -> (f32, f32) {
assert_eq!(xs.len(), SUB_ELEMS);
let mut l = [0u8; SUB_ELEMS];
let mut laux = [0u8; SUB_ELEMS];
let mut weights = [0f32; SUB_ELEMS];
let mut sum_x2 = 0f32;
for &v in xs {
sum_x2 += v * v;
}
let av_x = (sum_x2 / SUB_ELEMS as f32).sqrt();
for (w, &v) in weights.iter_mut().zip(xs) {
*w = av_x + v.abs();
}
make_qkx2_quants(xs, &weights, &mut l, &mut laux, 15, -1.0, 0.1, 20, false)
}
pub fn encode_block_q4_k(block: &[f32; Q4_K_BLOCK_ELEMS], out: &mut Vec<u8>) {
let mut l = [0u8; Q4_K_BLOCK_ELEMS];
let mut laux = [0u8; SUB_ELEMS];
let mut weights = [0f32; SUB_ELEMS];
let mut mins = [0f32; SUB];
let mut scales = [0f32; SUB];
let mut max_scale = 0f32; let mut max_min = 0f32;
for j in 0..SUB {
let lo = SUB_ELEMS * j;
let xs = &block[lo..lo + SUB_ELEMS];
let mut sum_x2 = 0f32;
for &v in xs {
sum_x2 += v * v;
}
let av_x = (sum_x2 / SUB_ELEMS as f32).sqrt();
for (w, &v) in weights.iter_mut().zip(xs) {
*w = av_x + v.abs();
}
let (scale, min) = make_qkx2_quants(
xs,
&weights,
&mut l[lo..lo + SUB_ELEMS],
&mut laux,
15,
-1.0,
0.1,
20,
false,
);
scales[j] = scale;
mins[j] = min;
if scale > max_scale {
max_scale = scale;
}
if min > max_min {
max_min = min;
}
}
let inv_scale = if max_scale > 0.0 {
63.0 / max_scale
} else {
0.0
};
let inv_min = if max_min > 0.0 { 63.0 / max_min } else { 0.0 };
let mut packed = [0u8; Q4_K_SCALE_BYTES];
for j in 0..SUB {
let ls = (nearest_int(inv_scale * scales[j]) as u8).min(63);
let lm = (nearest_int(inv_min * mins[j]) as u8).min(63);
if j < 4 {
packed[j] = ls;
packed[j + 4] = lm;
} else {
packed[j + 4] = (ls & 0xF) | ((lm & 0xF) << 4);
packed[j - 4] |= (ls >> 4) << 6;
packed[j] |= (lm >> 4) << 6;
}
}
let d = f16::from_f32(max_scale / 63.0);
let dmin = f16::from_f32(max_min / 63.0);
for j in 0..SUB {
let (sc, m) = q4_k_scale_min(j, &packed);
let dj = d.to_f32() * sc as f32;
if dj == 0.0 {
continue;
}
let dm = dmin.to_f32() * m as f32;
for ii in 0..SUB_ELEMS {
let idx = SUB_ELEMS * j + ii;
l[idx] = nearest_int((block[idx] + dm) / dj).clamp(0, 15) as u8;
}
}
out.reserve(Q4_K_BLOCK_BYTES);
out.extend_from_slice(&d.to_le_bytes());
out.extend_from_slice(&dmin.to_le_bytes());
out.extend_from_slice(&packed);
for j in (0..Q4_K_BLOCK_ELEMS).step_by(64) {
for i in 0..32 {
out.push(l[j + i] | (l[j + i + 32] << 4));
}
}
}
pub fn encode_row_q4_k(src: &[f32], out: &mut Vec<u8>) -> Option<()> {
let (blocks, rest) = src.as_chunks::<Q4_K_BLOCK_ELEMS>();
if !rest.is_empty() {
return None;
}
out.reserve(blocks.len() * Q4_K_BLOCK_BYTES);
for block in blocks {
encode_block_q4_k(block, out);
}
Some(())
}
#[cfg(test)]
mod tests {
use super::*;
use crate::dequant_q4_k;
fn sample_input() -> Vec<f32> {
const GAINS: [f32; 4] = [0.02, 0.05, 0.1, 0.25];
let mut state: u32 = 0xb54c_da26;
let mut next = move || {
state ^= state << 13;
state ^= state >> 17;
state ^= state << 5;
((state >> 8) as f32 / 8_388_608.0) - 1.0
};
let mut out = Vec::with_capacity(4 * Q4_K_BLOCK_ELEMS);
for sub in 0..4 * SUB {
for _ in 0..SUB_ELEMS {
let v = next();
let shaped = match sub {
8 => 0.0,
9 => 0.125,
10 => v.abs() * 0.05 + 0.01,
11 => -(v.abs() * 0.05 + 0.01),
17 => v * 1e-4,
_ => v * GAINS[sub % GAINS.len()],
};
out.push(f16::from_f32(shaped).to_f32());
}
}
out
}
#[test]
#[ignore = "developer tool: regenerates LLAMA_CPP_Q4_K_GOLDEN"]
fn dump_the_fixture_the_c_harness_reads() {
let path = std::env::var("FERROX_Q4_K_FIXTURE_OUT")
.expect("set FERROX_Q4_K_FIXTURE_OUT to the path to write");
let mut bytes = Vec::new();
for v in sample_input() {
bytes.extend_from_slice(&v.to_le_bytes());
}
std::fs::write(path, bytes).unwrap();
}
const LLAMA_CPP_Q4_K_GOLDEN: [u8; 4 * Q4_K_BLOCK_BYTES] = [
0x32, 0x10, 0x14, 0x1c, 0x05, 0x0c, 0x59, 0xff, 0x04, 0x0b, 0x58, 0xff, 0x55, 0xcc, 0x8a,
0xb3, 0xed, 0xc8, 0xba, 0x4e, 0xeb, 0x91, 0x85, 0xa6, 0x9c, 0x87, 0xd8, 0xab, 0x42, 0xe9,
0x87, 0x0b, 0xb3, 0x82, 0x59, 0xb2, 0xc0, 0x80, 0x87, 0xa7, 0x98, 0x62, 0x75, 0x94, 0x31,
0x0a, 0x89, 0xda, 0xc5, 0x32, 0xd4, 0xfa, 0xf6, 0xd6, 0xc1, 0xbd, 0xf1, 0xc8, 0x6c, 0xbf,
0xc4, 0xa0, 0xeb, 0x46, 0x7d, 0xb0, 0xf4, 0xb7, 0x95, 0xbc, 0xd1, 0xe6, 0x84, 0x8d, 0x77,
0x1d, 0x01, 0xd7, 0x1f, 0xda, 0x1b, 0xf6, 0x4f, 0x62, 0x3f, 0xce, 0x28, 0x47, 0x5b, 0xba,
0xeb, 0xfc, 0x04, 0xb3, 0xba, 0x44, 0x94, 0xe0, 0xd6, 0xbf, 0x7e, 0x02, 0xf0, 0xac, 0x4c,
0xda, 0xbf, 0x21, 0x4d, 0xc7, 0xd1, 0xb0, 0x6b, 0xf0, 0xb2, 0x0a, 0x8d, 0x25, 0xbc, 0x2c,
0xda, 0xd7, 0xa9, 0x51, 0x32, 0xa2, 0xc0, 0x5e, 0x1c, 0x86, 0x95, 0x53, 0x40, 0x7d, 0xf1,
0xf5, 0x34, 0xf8, 0x9c, 0xf0, 0x9f, 0xa8, 0x4c, 0x48, 0x2d, 0x10, 0xeb, 0x1b, 0x00, 0x10,
0x48, 0xc6, 0x00, 0x00, 0x40, 0xcf, 0x45, 0xcc, 0xaa, 0xff, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0,
0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0,
0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xf0, 0xe6, 0xba, 0x13,
0x8b, 0x45, 0x3b, 0x24, 0x4e, 0x69, 0xbb, 0x96, 0xd7, 0xc9, 0xe9, 0x13, 0xad, 0x75, 0xeb,
0xeb, 0x8a, 0x0e, 0x9e, 0x76, 0xfb, 0x0d, 0x17, 0xfe, 0x5a, 0x07, 0x7e, 0x6d, 0x95, 0xa5,
0x30, 0x33, 0xe7, 0xf1, 0x3d, 0x29, 0xfa, 0x07, 0x84, 0x99, 0xea, 0xca, 0x06, 0xe3, 0x27,
0xa5, 0x40, 0x07, 0x12, 0xf3, 0x55, 0x72, 0xe5, 0xa1, 0x12, 0x35, 0xee, 0x06, 0xf2, 0x51,
0x0d, 0x11, 0x70, 0x92, 0xc1, 0xd3, 0x7c, 0x99, 0x33, 0x74, 0x49, 0x6e, 0x6d, 0x2a, 0xdc,
0xa2, 0x57, 0x35, 0xbe, 0xd3, 0x65, 0xbb, 0xf1, 0x14, 0x05, 0x09, 0xd4, 0x87, 0x3e, 0xbf,
0x4c, 0xc8, 0xd1, 0x30, 0x10, 0xdc, 0x1b, 0x05, 0x00, 0x58, 0xff, 0x05, 0x00, 0x58, 0xff,
0x55, 0xdd, 0x89, 0xce, 0x44, 0xa8, 0xc2, 0x9c, 0xec, 0x84, 0x2c, 0x8f, 0x6f, 0x30, 0x74,
0xae, 0x66, 0x2b, 0x16, 0x5b, 0xe6, 0xe0, 0x96, 0x69, 0x66, 0x8f, 0xe4, 0x5c, 0x57, 0x24,
0x06, 0x52, 0x67, 0xa1, 0xa0, 0x43, 0xaa, 0x5d, 0x43, 0x4d, 0x7c, 0xbf, 0x78, 0x16, 0x59,
0xf9, 0x30, 0x58, 0x03, 0x12, 0x73, 0xed, 0x8d, 0x00, 0xdd, 0x49, 0xe2, 0xf9, 0xa1, 0x88,
0x2c, 0x80, 0x90, 0x0f, 0xb3, 0x2b, 0xf5, 0xc9, 0x72, 0x61, 0x6a, 0x85, 0x99, 0xc3, 0x02,
0xd4, 0xd8, 0x2a, 0xee, 0x20, 0xa9, 0xcd, 0x9a, 0xa8, 0xed, 0x6b, 0x95, 0x98, 0x8c, 0x96,
0x6f, 0x1f, 0xda, 0x13, 0xf9, 0xc7, 0x75, 0xdd, 0x55, 0x17, 0x71, 0xd4, 0xbd, 0xc5, 0x79,
0xa0, 0x2d, 0xcb, 0x7b, 0x40, 0x76, 0x1b, 0xf4, 0x04, 0x56, 0xd2, 0x1b, 0x24, 0x44, 0x25,
0x68, 0x01, 0x33, 0xa1, 0x92, 0xf5, 0x1f, 0x69, 0xed, 0xd1, 0xa8, 0x28, 0x3c, 0x10, 0x2d,
0x1c, 0x05, 0x0c, 0x58, 0xff, 0x05, 0x0c, 0x53, 0xff, 0x55, 0xcc, 0x88, 0x9f, 0xba, 0xf2,
0xc5, 0x51, 0xfe, 0x43, 0xec, 0x47, 0x96, 0x64, 0x14, 0x78, 0xf3, 0x6b, 0x46, 0x52, 0x79,
0x15, 0x26, 0x05, 0x50, 0x9f, 0xdd, 0xec, 0x0b, 0x0d, 0x5a, 0x8f, 0xe1, 0x15, 0x76, 0x87,
0x1c, 0x6a, 0xf7, 0xe1, 0xe2, 0x46, 0xc4, 0xcc, 0x90, 0x95, 0x40, 0x67, 0xdb, 0x70, 0x53,
0xd4, 0x70, 0xb4, 0xcd, 0x80, 0x52, 0xb4, 0x0b, 0xc1, 0xd5, 0xda, 0x17, 0x15, 0x1e, 0x99,
0x57, 0x22, 0x9c, 0x58, 0xc3, 0xc4, 0x5e, 0xd2, 0x78, 0x37, 0x69, 0xe2, 0x21, 0xf7, 0x83,
0x5c, 0xa1, 0x6a, 0xbd, 0xbe, 0x72, 0xa4, 0x3d, 0x61, 0x76, 0xcb, 0x55, 0x2a, 0x01, 0x8d,
0x14, 0xcb, 0xdc, 0x4f, 0x6f, 0x15, 0x46, 0x6e, 0xe8, 0x5d, 0x6d, 0xf0, 0xea, 0x0d, 0xaa,
0x8f, 0xdd, 0xd7, 0x3e, 0x52, 0x20, 0x24, 0x1b, 0x15, 0x62, 0x98, 0x0a, 0xf4, 0x42, 0x9b,
0xdc, 0x8a, 0xb7, 0xab, 0xae, 0x57,
];
#[test]
fn q4_k_matches_llama_cpp_quantize_row_q4_k_ref() {
let x = sample_input();
let mut got = Vec::new();
encode_row_q4_k(&x, &mut got).unwrap();
assert_eq!(got.len(), LLAMA_CPP_Q4_K_GOLDEN.len());
for (b, (g, w)) in got
.as_chunks::<Q4_K_BLOCK_BYTES>()
.0
.iter()
.zip(LLAMA_CPP_Q4_K_GOLDEN.as_chunks::<Q4_K_BLOCK_BYTES>().0)
.enumerate()
{
assert_eq!(g, w, "super-block {b} disagrees with llama.cpp");
}
}
#[test]
fn a_row_that_is_not_a_whole_number_of_super_blocks_is_refused() {
let mut out = Vec::new();
assert!(encode_row_q4_k(&[0.5; Q4_K_BLOCK_ELEMS + 1], &mut out).is_none());
assert!(encode_row_q4_k(&[0.5; 32], &mut out).is_none());
assert!(encode_row_q4_k(&[], &mut out).is_some());
}
#[test]
fn every_element_lands_on_its_nearest_representable_level() {
let x = sample_input();
let mut bytes = Vec::new();
encode_row_q4_k(&x, &mut bytes).unwrap();
let back = dequant_q4_k(&bytes).unwrap();
assert_eq!(back.len(), x.len());
for (b, block) in bytes.as_chunks::<Q4_K_BLOCK_BYTES>().0.iter().enumerate() {
let d = f16::from_le_bytes([block[0], block[1]]).to_f32();
let dmin = f16::from_le_bytes([block[2], block[3]]).to_f32();
let packed: [u8; Q4_K_SCALE_BYTES] = block[4..16].try_into().unwrap();
for j in 0..SUB {
let (sc, m) = q4_k_scale_min(j, &packed);
let (dj, dm) = (d * sc as f32, dmin * m as f32);
for ii in 0..SUB_ELEMS {
let idx = b * Q4_K_BLOCK_ELEMS + SUB_ELEMS * j + ii;
let chosen = (x[idx] - back[idx]).abs();
for k in 0..=15u8 {
let level = dj * k as f32 - dm;
assert!(
(x[idx] - level).abs() >= chosen,
"block {b} sub-block {j} element {ii}: {} is closer to {} than to the \
chosen {}",
x[idx],
level,
back[idx]
);
}
}
}
}
}
}