use core::{
cmp::Ordering,
f64::{consts::SQRT_2, EPSILON},
};
use distances::Number;
pub fn arg_min<T: PartialOrd + Copy>(values: &[T]) -> Option<(usize, T)> {
values
.iter()
.enumerate()
.min_by(|&(_, l), &(_, r)| l.partial_cmp(r).unwrap_or(Ordering::Greater))
.map(|(i, v)| (i, *v))
}
pub fn arg_max<T: PartialOrd + Copy>(values: &[T]) -> Option<(usize, T)> {
values
.iter()
.enumerate()
.max_by(|&(_, l), &(_, r)| l.partial_cmp(r).unwrap_or(Ordering::Less))
.map(|(i, v)| (i, *v))
}
#[allow(dead_code)]
pub fn mean_variance(values: &[f64]) -> (f64, f64) {
let n = values.len().as_f64();
let (sum, sum_squares): (f64, f64) = values
.iter()
.fold((0., 0.), |(sum, sum_squares), x| (sum + x, sum_squares + x.powi(2)));
let mean = sum / n;
let variance = (sum_squares / n) - (sum.powi(2) / n.powi(2));
(mean, variance)
}
#[allow(dead_code)]
pub fn mean<T: Number>(values: &[T]) -> f64 {
values.iter().copied().sum::<T>().as_f64() / values.len().as_f64()
}
#[allow(dead_code)]
pub fn sd<T: Number>(values: &[T], mean: f64) -> f64 {
let var = values
.iter()
.map(|v| v.as_f64())
.map(|v| v - mean)
.map(|v| v.powi(2))
.sum::<f64>()
/ values.len().as_f64();
var.sqrt()
}
#[allow(dead_code)]
pub fn normalize_1d(values: &[f64], mean: f64, sd: f64) -> Vec<f64> {
values
.iter()
.map(|&v| v - mean)
.map(|v| v / ((EPSILON + sd) * SQRT_2))
.map(libm::erf)
.map(|v| (1. + v) / 2.)
.collect()
}
pub fn compute_lfd<T: Number>(radius: T, distances: &[T]) -> f64 {
if radius == T::zero() {
1.
} else {
let r_2 = radius.as_f64() / 2.;
let half_count = distances.iter().filter(|&&d| d.as_f64() <= r_2).count();
if half_count > 0 {
(distances.len().as_f64() / half_count.as_f64()).log2()
} else {
1.
}
}
}
pub fn next_ema(ratio: f64, parent_ema: f64) -> f64 {
let alpha = 2. / 11.;
alpha.mul_add(ratio, (1. - alpha) * parent_ema)
}
pub fn pos_val<T: Eq + Copy>(values: &[T], v: T) -> Option<(usize, T)> {
values.iter().copied().enumerate().find(|&(_, x)| x == v)
}
pub fn rows_to_cols(values: &[[f64; 6]]) -> [Vec<f64>; 6] {
let all_ratios: Vec<f64> = values.iter().flat_map(|arr| arr.iter().copied()).collect();
let mut transposed: [Vec<f64>; 6] = Default::default();
for (s, element) in transposed.iter_mut().enumerate() {
*element = all_ratios.iter().skip(s).step_by(6).copied().collect();
}
transposed
}
pub fn calc_row_means(values: &[Vec<f64>; 6]) -> [f64; 6] {
values
.iter()
.map(|values| mean(values))
.collect::<Vec<_>>()
.try_into()
.unwrap_or_else(|_| unreachable!("Array always has a length of 6."))
}
pub fn calc_row_sds(values: &[Vec<f64>; 6]) -> [f64; 6] {
values
.iter()
.map(|values| mean_variance(values).1.sqrt())
.collect::<Vec<_>>()
.try_into()
.unwrap_or_else(|_| unreachable!("Array always has a length of 6."))
}
#[cfg(test)]
mod tests {
use super::*;
use symagen::random_data;
#[test]
fn test_transpose() {
let data: Vec<[f64; 6]> = vec![
[2.0, 3.0, 5.0, 7.0, 11.0, 13.0],
[4.0, 3.0, 5.0, 9.0, 10.0, 15.0],
[6.0, 2.0, 8.0, 11.0, 9.0, 11.0],
];
let expected_transposed: [Vec<f64>; 6] = [
vec![2.0, 4.0, 6.0],
vec![3.0, 3.0, 2.0],
vec![5.0, 5.0, 8.0],
vec![7.0, 9.0, 11.0],
vec![11.0, 10.0, 9.0],
vec![13.0, 15.0, 11.0],
];
let transposed_data = rows_to_cols(&data);
for i in 0..6 {
assert_eq!(transposed_data[i], expected_transposed[i]);
}
}
#[test]
fn test_means() {
let all_ratios: Vec<[f64; 6]> = vec![
[2.0, 4.0, 5.0, 6.0, 9.0, 15.0],
[3.0, 3.0, 6.0, 4.0, 7.0, 10.0],
[5.0, 5.0, 8.0, 8.0, 8.0, 1.0],
];
let transposed = rows_to_cols(&all_ratios);
let means = calc_row_means(&transposed);
let expected_means: [f64; 6] = [3.3333333333333335, 4.0, 6.333333333333334, 6.0, 8.0, 8.666666666666668];
means
.iter()
.zip(expected_means.iter())
.for_each(|(&a, &b)| assert!(float_cmp::approx_eq!(f64, a, b, ulps = 2), "{}, {} not equal", a, b));
}
#[test]
fn test_sds() {
let all_ratios: Vec<[f64; 6]> = vec![
[2.0, 4.0, 5.0, 6.0, 9.0, 15.0],
[3.0, 3.0, 6.0, 4.0, 7.0, 10.0],
[5.0, 5.0, 8.0, 8.0, 8.0, 1.0],
];
let expected_standard_deviations: [f64; 6] = [
1.2472191289246,
0.81649658092773,
1.2472191289246,
1.6329931618555,
0.81649658092773,
5.7927157323276,
];
let sds = calc_row_sds(&rows_to_cols(&all_ratios));
sds.iter()
.zip(expected_standard_deviations.iter())
.for_each(|(&a, &b)| {
assert!(
float_cmp::approx_eq!(f64, a, b, epsilon = 0.00000003),
"{}, {} not equal",
a,
b
)
});
}
#[test]
fn test_mean_variance() {
let mut test_cases: Vec<Vec<f64>> = vec![
vec![0.0],
vec![0.0, 0.0],
vec![1.0],
vec![1.0, 2.0],
vec![0.0, 0.25, 0.25, 1.25, 1.5, 1.75, 2.75, 3.25],
];
let cardinalities = vec![1, 2, 1_000, 100_000]
.into_iter()
.chain((1..=10).map(|i| i * 1_000_000))
.collect::<Vec<_>>();
let ranges = vec![
(-100_000., 0.),
(-10_000., 0.),
(-1_000., 0.),
(0., 1_000.),
(0., 10_000.),
(0., 100_000.),
];
let dimensionality = 1;
let seed = 42;
for (cardinality, (min_val, max_val)) in cardinalities.into_iter().zip(ranges.into_iter()) {
let data = random_data::random_tabular_seedable::<f64>(dimensionality, cardinality, min_val, max_val, seed)
.into_iter()
.flatten()
.collect::<Vec<_>>();
test_cases.push(data);
}
let (actual_means, actual_variances): (Vec<f64>, Vec<f64>) =
test_cases.iter().map(|values| mean_variance(values)).unzip();
let expected_means: Vec<f64> = test_cases.iter().map(|values| statistical::mean(values)).collect();
let expected_variances: Vec<f64> = test_cases
.iter()
.zip(expected_means.iter())
.map(|(values, &mean)| statistical::population_variance(values, Some(mean)))
.collect();
actual_means.iter().zip(expected_means.iter()).for_each(|(&a, &b)| {
assert!(
float_cmp::approx_eq!(f64, a, b, ulps = 2),
"Means not equal. Actual: {}. Expected: {}. Difference: {}.",
a,
b,
a - b
)
});
actual_variances
.iter()
.zip(expected_variances.iter())
.for_each(|(&a, &b)| {
assert!(
float_cmp::approx_eq!(f64, a, b, epsilon = 3e-8),
"Variances not equal. Actual: {}. Expected: {}. Difference: {}.",
a,
b,
a - b
)
});
}
}