use crate::filter_op_declare::{Arena, MorthOpFilterFlat2DRow};
use crate::flat_se::AnalyzedSe;
use crate::morph_base::MorphNativeOp;
use crate::op_type::MorphOp;
use crate::unsafe_slice::UnsafeSlice;
use crate::ImageSize;
#[cfg(target_arch = "x86")]
use std::arch::x86::*;
#[cfg(target_arch = "x86_64")]
use std::arch::x86_64::*;
#[derive(Clone)]
pub struct MorphOpFilterSse2DRow<const OP_TYPE: u8> {}
impl<const OP_TYPE: u8> Default for MorphOpFilterSse2DRow<OP_TYPE> {
fn default() -> Self {
MorphOpFilterSse2DRow {}
}
}
impl<T, const OP_TYPE: u8> MorthOpFilterFlat2DRow<T> for MorphOpFilterSse2DRow<OP_TYPE>
where
T: Copy + 'static + MorphNativeOp<T>,
{
#[target_feature(enable = "sse4.1")]
unsafe fn dispatch_row(
&self,
arena: &Arena<T>,
dst: &UnsafeSlice<T>,
image_size: ImageSize,
analyzed_se: AnalyzedSe,
y: usize,
) {
let width = image_size.width;
let op_type: MorphOp = OP_TYPE.into();
let stride = width * arena.components;
let decision = match op_type {
MorphOp::Dilate => _mm_max_epu8,
MorphOp::Erode => _mm_min_epu8,
};
let src: &Vec<u8> = std::mem::transmute(&arena.arena);
let dst: &UnsafeSlice<u8> = std::mem::transmute(dst);
let dx = arena.pad_w as i32;
let dy = arena.pad_h as i32;
let total_width = arena.components * width;
let arena_stride = arena.width * arena.components;
let offsets = analyzed_se
.left_front
.element_offsets
.iter()
.map(|&x| {
src.get_unchecked(
((x.y + dy + y as i32) as usize * arena_stride
+ (x.x + dx) as usize * arena.components)..,
)
})
.collect::<Vec<_>>();
let length = analyzed_se.left_front.element_offsets.iter().len();
let off0 = offsets.get_unchecked(0);
let mut cx = 0usize;
while cx + 64 < total_width {
let ptr0 = (*off0.get_unchecked(cx..)).as_ptr();
let mut row0 = _mm_loadu_si128(ptr0 as *const __m128i);
let mut row1 = _mm_loadu_si128(ptr0.add(16) as *const __m128i);
let mut row2 = _mm_loadu_si128(ptr0.add(32) as *const __m128i);
let mut row3 = _mm_loadu_si128(ptr0.add(48) as *const __m128i);
for i in 1..length {
let ptr_d = (*offsets.get_unchecked(i)).get_unchecked(cx..).as_ptr();
let new_row0 = _mm_loadu_si128(ptr_d as *const __m128i);
let new_row1 = _mm_loadu_si128(ptr_d.add(16) as *const __m128i);
let new_row2 = _mm_loadu_si128(ptr_d.add(32) as *const __m128i);
let new_row3 = _mm_loadu_si128(ptr_d.add(48) as *const __m128i);
row0 = decision(row0, new_row0);
row1 = decision(row1, new_row1);
row2 = decision(row2, new_row2);
row3 = decision(row3, new_row3);
}
let v_dst = dst.slice.as_ptr().add(y * stride + cx) as *mut u8;
_mm_storeu_si128(v_dst as *mut __m128i, row0);
_mm_storeu_si128(v_dst.add(16) as *mut __m128i, row1);
_mm_storeu_si128(v_dst.add(32) as *mut __m128i, row2);
_mm_storeu_si128(v_dst.add(48) as *mut __m128i, row3);
cx += 64;
}
while cx + 32 < total_width {
let ptr0 = (*off0.get_unchecked(cx..)).as_ptr();
let mut row0 = _mm_loadu_si128(ptr0 as *const __m128i);
let mut row1 = _mm_loadu_si128(ptr0.add(16) as *const __m128i);
for i in 1..length {
let ptr_d = (*offsets.get_unchecked(i)).get_unchecked(cx..).as_ptr();
let new_row0 = _mm_loadu_si128(ptr_d as *const __m128i);
let new_row1 = _mm_loadu_si128(ptr_d.add(16) as *const __m128i);
row0 = decision(row0, new_row0);
row1 = decision(row1, new_row1);
}
let v_dst = dst.slice.as_ptr().add(y * stride + cx) as *mut u8;
_mm_storeu_si128(v_dst as *mut __m128i, row0);
_mm_storeu_si128(v_dst.add(16) as *mut __m128i, row1);
cx += 32;
}
while cx + 16 < total_width {
let ptr0 = (*off0.get_unchecked(cx..)).as_ptr();
let mut row0 = _mm_loadu_si128(ptr0 as *const __m128i);
for i in 1..length {
let ptr_d = (*offsets.get_unchecked(i)).get_unchecked(cx..).as_ptr();
let new_row0 = _mm_loadu_si128(ptr_d as *const __m128i);
row0 = decision(row0, new_row0);
}
let v_dst = dst.slice.as_ptr().add(y * stride + cx) as *mut u8;
_mm_storeu_si128(v_dst as *mut __m128i, row0);
cx += 16;
}
while cx + 8 < total_width {
let ptr0 = (*off0.get_unchecked(cx..)).as_ptr();
let mut row0 = _mm_loadu_si64(ptr0);
for i in 1..length {
let ptr_d = (*offsets.get_unchecked(i)).get_unchecked(cx..).as_ptr();
let new_row0 = _mm_loadu_si64(ptr_d);
row0 = decision(row0, new_row0);
}
let v_dst = dst.slice.as_ptr().add(y * stride + cx) as *mut u8;
_mm_storeu_si64(v_dst, row0);
cx += 8;
}
while cx + 4 < total_width {
let mut k0 = *(*off0).get_unchecked(cx);
let mut k1 = *(*off0).get_unchecked(cx + 1);
let mut k2 = *(*off0).get_unchecked(cx + 2);
let mut k3 = *(*off0).get_unchecked(cx + 3);
for i in 1..length {
k0 = k0.op::<OP_TYPE>(*(*offsets.get_unchecked(i)).get_unchecked(cx));
k1 = k1.op::<OP_TYPE>(*(*offsets.get_unchecked(i)).get_unchecked(cx + 1));
k2 = k2.op::<OP_TYPE>(*(*offsets.get_unchecked(i)).get_unchecked(cx + 2));
k3 = k3.op::<OP_TYPE>(*(*offsets.get_unchecked(i)).get_unchecked(cx + 3));
}
let dst_offset = y * stride + cx;
dst.write(dst_offset, k0);
dst.write(dst_offset + 1, k1);
dst.write(dst_offset + 2, k2);
dst.write(dst_offset + 3, k3);
cx += 4;
}
for x in cx..total_width {
let mut k0 = *(*off0).get_unchecked(x);
for i in 1..length {
k0 = k0.op::<OP_TYPE>(*(*offsets.get_unchecked(i)).get_unchecked(x));
}
dst.write(y * stride + x, k0);
}
}
}