matrixmultiply_mt 0.2.1

Multithreaded Fork of bluss's matrixmultiply crate. General matrix multiplication of f32 and f64 matrices in Rust. Supports matrices with general strides. Uses a microkernel strategy, so that the implementation is easy to parallelize and optimize. `RUSTFLAGS="-C target-cpu=native"` is your friend here.
Documentation

test mat_mul_f32::m004             ... bench:         172 ns/iter (+/- 25)
test mat_mul_f32::m005             ... bench:         230 ns/iter (+/- 9)
test mat_mul_f32::m006             ... bench:         250 ns/iter (+/- 7)
test mat_mul_f32::m007             ... bench:         274 ns/iter (+/- 12)
test mat_mul_f32::m008             ... bench:         289 ns/iter (+/- 18)
test mat_mul_f32::m009             ... bench:         499 ns/iter (+/- 14)
test mat_mul_f32::m012             ... bench:         670 ns/iter (+/- 50)
test mat_mul_f32::m016             ... bench:         956 ns/iter (+/- 47)
test mat_mul_f32::m032             ... bench:       4,645 ns/iter (+/- 158)
test mat_mul_f32::m064             ... bench:      27,912 ns/iter (+/- 582)
test mat_mul_f32::m127             ... bench:     189,245 ns/iter (+/- 4,271)
test mat_mul_f32::mix16x4          ... bench:       1,767 ns/iter (+/- 55)
test mat_mul_f32::mix32x2          ... bench:       1,523 ns/iter (+/- 220)
test mat_mul_f64::m004             ... bench:         178 ns/iter (+/- 5)
test mat_mul_f64::m007             ... bench:         286 ns/iter (+/- 3)
test mat_mul_f64::m008             ... bench:         319 ns/iter (+/- 22)
test mat_mul_f64::m012             ... bench:         745 ns/iter (+/- 44)
test mat_mul_f64::m016             ... bench:       1,127 ns/iter (+/- 245)
test mat_mul_f64::m032             ... bench:       6,109 ns/iter (+/- 641)
test mat_mul_f64::m064             ... bench:      39,756 ns/iter (+/- 1,640)
test mat_mul_f64::m127             ... bench:     281,060 ns/iter (+/- 3,167)