#[cfg(feature = "cuda")]
pub mod fused;
#[cfg(feature = "cuda")]
pub mod fp4;
#[cfg(feature = "cuda")]
pub mod nf4;
#[cfg(feature = "cuda")]
pub use fused::{
fused_nf4_add_kernel, fused_nf4_batched_matmul_kernel, fused_nf4_lora_forward_kernel,
fused_nf4_matmul_bias_act_kernel, fused_nf4_matmul_kernel, simple_nf4_matmul_kernel,
};
#[cfg(feature = "cuda")]
pub use fp4::{
fp4_compute_scale_zeropoint_kernel, fp4_compute_scales_kernel,
fp4_dequantize_asymmetric_kernel, fp4_dequantize_kernel, fp4_quantize_asymmetric_kernel,
fp4_quantize_kernel,
};
#[cfg(feature = "cuda")]
pub use nf4::{
compute_scales_kernel, double_dequantize_scales_kernel, double_quantize_scales_kernel,
nf4_dequantize_double_quant_kernel, nf4_dequantize_kernel, nf4_quantize_kernel,
};
pub const DEFAULT_GPU_BLOCK_SIZE: u32 = 64;
pub const VALUES_PER_U32: u32 = 8;
pub const SUPERBLOCK_SIZE: u32 = 256;
pub const MATMUL_TILE_SIZE: u32 = 32;