use std::sync::Arc;
use arrow::array::builder::NullBufferBuilder;
use arrow::array::{Array, ArrayRef, AsArray, PrimitiveArray};
use arrow::datatypes::DataType::{Float16, Float32, Float64};
use arrow::datatypes::{
ArrowPrimitiveType, DataType, Float16Type, Float32Type, Float64Type,
};
use datafusion_common::types::{NativeType, logical_float64};
use datafusion_common::{Result, ScalarValue, exec_err, utils::take_function_args};
use datafusion_expr::{
Coercion, ColumnarValue, Documentation, ScalarFunctionArgs, ScalarUDFImpl, Signature,
TypeSignature, TypeSignatureClass, Volatility,
};
use datafusion_macros::user_doc;
use num_traits::Float;
#[user_doc(
doc_section(label = "Math Functions"),
description = r#"Returns the first argument if it's not _NaN_.
Returns the second argument otherwise."#,
syntax_example = "nanvl(expression_x, expression_y)",
sql_example = r#"```sql
> SELECT nanvl(0, 5);
+------------+
| nanvl(0,5) |
+------------+
| 0 |
+------------+
```"#,
argument(
name = "expression_x",
description = "Numeric expression to return if it's not _NaN_. Can be a constant, column, or function, and any combination of arithmetic operators."
),
argument(
name = "expression_y",
description = "Numeric expression to return if the first expression is _NaN_. Can be a constant, column, or function, and any combination of arithmetic operators."
)
)]
#[derive(Debug, PartialEq, Eq, Hash)]
pub struct NanvlFunc {
signature: Signature,
}
impl Default for NanvlFunc {
fn default() -> Self {
NanvlFunc::new()
}
}
impl NanvlFunc {
pub fn new() -> Self {
let non_float = Coercion::new_implicit(
TypeSignatureClass::Native(logical_float64()),
vec![TypeSignatureClass::Integer, TypeSignatureClass::Decimal],
NativeType::Float64,
);
let to_float64 = Coercion::new_implicit(
TypeSignatureClass::Native(logical_float64()),
vec![TypeSignatureClass::Numeric],
NativeType::Float64,
);
Self {
signature: Signature::one_of(
vec![
TypeSignature::Coercible(vec![non_float.clone(), to_float64.clone()]),
TypeSignature::Coercible(vec![to_float64, non_float]),
TypeSignature::Exact(vec![Float16, Float16]),
TypeSignature::Exact(vec![Float32, Float32]),
TypeSignature::Exact(vec![Float64, Float64]),
],
Volatility::Immutable,
),
}
}
}
impl ScalarUDFImpl for NanvlFunc {
fn name(&self) -> &str {
"nanvl"
}
fn signature(&self) -> &Signature {
&self.signature
}
fn return_type(&self, arg_types: &[DataType]) -> Result<DataType> {
match (&arg_types[0], &arg_types[1]) {
(Float16, Float16) => Ok(Float16),
(Float32, Float32) => Ok(Float32),
_ => Ok(Float64),
}
}
fn invoke_with_args(&self, args: ScalarFunctionArgs) -> Result<ColumnarValue> {
let [x, y] = take_function_args(self.name(), args.args)?;
match (x, y) {
(ColumnarValue::Scalar(ref x), y) if scalar_is_nan(x) => Ok(y),
(x @ ColumnarValue::Scalar(_), _) => Ok(x),
(x, y) => {
let args = ColumnarValue::values_to_arrays(&[x, y])?;
Ok(ColumnarValue::Array(nanvl(&args)?))
}
}
}
fn documentation(&self) -> Option<&Documentation> {
self.doc()
}
}
fn scalar_is_nan(scalar: &ScalarValue) -> bool {
match scalar {
ScalarValue::Float16(Some(v)) => v.is_nan(),
ScalarValue::Float32(Some(v)) => v.is_nan(),
ScalarValue::Float64(Some(v)) => v.is_nan(),
_ => false,
}
}
fn nanvl(args: &[ArrayRef]) -> Result<ArrayRef> {
match args[0].data_type() {
Float64 => Ok(Arc::new(nanvl_impl::<Float64Type>(
args[0].as_primitive(),
args[1].as_primitive(),
))),
Float32 => Ok(Arc::new(nanvl_impl::<Float32Type>(
args[0].as_primitive(),
args[1].as_primitive(),
))),
Float16 => Ok(Arc::new(nanvl_impl::<Float16Type>(
args[0].as_primitive(),
args[1].as_primitive(),
))),
other => exec_err!("Unsupported data type {other:?} for function nanvl"),
}
}
fn nanvl_impl<T>(x: &PrimitiveArray<T>, y: &PrimitiveArray<T>) -> PrimitiveArray<T>
where
T: ArrowPrimitiveType,
T::Native: Float,
{
let xv = x.values();
let yv = y.values();
match (x.nulls(), y.nulls()) {
(None, None) => {
let values: Vec<T::Native> = xv
.iter()
.zip(yv.iter())
.map(
|(&x_value, &y_value)| {
if x_value.is_nan() { y_value } else { x_value }
},
)
.collect();
PrimitiveArray::<T>::new(values.into(), None)
}
_ => {
let len = x.len();
let mut nulls = NullBufferBuilder::new(len);
let mut values = Vec::with_capacity(len);
for i in 0..len {
if x.is_valid(i) {
let x_value = xv[i];
if x_value.is_nan() {
if y.is_valid(i) {
values.push(yv[i]);
nulls.append_non_null();
} else {
values.push(T::Native::default());
nulls.append_null();
}
} else {
values.push(x_value);
nulls.append_non_null();
}
} else {
values.push(T::Native::default());
nulls.append_null();
}
}
PrimitiveArray::<T>::new(values.into(), nulls.finish())
}
}
}
#[cfg(test)]
mod test {
use std::sync::Arc;
use crate::math::nanvl::nanvl;
use arrow::array::{Array, ArrayRef, Float32Array, Float64Array};
use datafusion_common::cast::{as_float32_array, as_float64_array};
#[test]
fn test_nanvl_f64() {
let args: Vec<ArrayRef> = vec![
Arc::new(Float64Array::from(vec![1.0, f64::NAN, 3.0, f64::NAN])), Arc::new(Float64Array::from(vec![5.0, 6.0, f64::NAN, f64::NAN])), ];
let result = nanvl(&args).expect("failed to initialize function nanvl");
let floats =
as_float64_array(&result).expect("failed to initialize function nanvl");
assert_eq!(floats.len(), 4);
assert_eq!(floats.value(0), 1.0);
assert_eq!(floats.value(1), 6.0);
assert_eq!(floats.value(2), 3.0);
assert!(floats.value(3).is_nan());
}
#[test]
fn test_nanvl_f32() {
let args: Vec<ArrayRef> = vec![
Arc::new(Float32Array::from(vec![1.0, f32::NAN, 3.0, f32::NAN])), Arc::new(Float32Array::from(vec![5.0, 6.0, f32::NAN, f32::NAN])), ];
let result = nanvl(&args).expect("failed to initialize function nanvl");
let floats =
as_float32_array(&result).expect("failed to initialize function nanvl");
assert_eq!(floats.len(), 4);
assert_eq!(floats.value(0), 1.0);
assert_eq!(floats.value(1), 6.0);
assert_eq!(floats.value(2), 3.0);
assert!(floats.value(3).is_nan());
}
#[test]
fn test_nanvl_f64_with_nulls() {
let args: Vec<ArrayRef> = vec![
Arc::new(Float64Array::from(vec![
None,
Some(f64::NAN),
Some(f64::NAN),
Some(2.5),
])), Arc::new(Float64Array::from(vec![
Some(9.0),
Some(6.0),
None,
Some(7.0),
])), ];
let result = nanvl(&args).expect("failed to initialize function nanvl");
let floats =
as_float64_array(&result).expect("failed to initialize function nanvl");
assert_eq!(floats.len(), 4);
assert!(floats.is_null(0));
assert_eq!(floats.value(1), 6.0);
assert!(floats.is_null(2));
assert_eq!(floats.value(3), 2.5);
}
#[test]
fn test_nanvl_f64_only_y_nulls() {
let args: Vec<ArrayRef> = vec![
Arc::new(Float64Array::from(vec![1.0, f64::NAN, f64::NAN, 4.0])), Arc::new(Float64Array::from(vec![
Some(5.0),
Some(6.0),
None,
Some(8.0),
])), ];
let result = nanvl(&args).expect("failed to initialize function nanvl");
let floats =
as_float64_array(&result).expect("failed to initialize function nanvl");
assert_eq!(floats.len(), 4);
assert_eq!(floats.value(0), 1.0);
assert_eq!(floats.value(1), 6.0);
assert!(floats.is_null(2));
assert_eq!(floats.value(3), 4.0);
}
#[test]
fn test_nanvl_f64_only_x_nulls() {
let args: Vec<ArrayRef> = vec![
Arc::new(Float64Array::from(vec![
None,
Some(f64::NAN),
Some(3.0),
None,
])), Arc::new(Float64Array::from(vec![5.0, 6.0, 7.0, 8.0])), ];
let result = nanvl(&args).expect("failed to initialize function nanvl");
let floats =
as_float64_array(&result).expect("failed to initialize function nanvl");
assert_eq!(floats.len(), 4);
assert!(floats.is_null(0));
assert_eq!(floats.value(1), 6.0);
assert_eq!(floats.value(2), 3.0);
assert!(floats.is_null(3));
}
}