use crate::{
Charset,
CharsetCodec,
CharsetDecodeError,
CharsetDecodeErrorKind,
CharsetDecodeResult,
CharsetEncodeError,
CharsetEncodeErrorKind,
CharsetEncodeProbe,
CharsetEncodeResult,
Unicode,
Utf16,
};
use qubit_codec::Codec;
#[derive(Clone, Copy, Debug, Default, Eq, Hash, PartialEq)]
pub struct Utf16U16Codec;
impl Utf16U16Codec {
#[must_use]
#[inline(always)]
pub const fn charset(self) -> Charset {
Charset::UTF_16
}
}
impl CharsetCodec for Utf16U16Codec {
#[inline(always)]
fn charset(&self) -> Charset {
Charset::UTF_16
}
}
impl CharsetEncodeProbe for Utf16U16Codec {
#[inline(always)]
fn encode_len(
&self,
ch: char,
_index: usize,
) -> CharsetEncodeResult<usize> {
Ok(Utf16::unit_len(ch))
}
}
unsafe impl Codec for Utf16U16Codec {
type Value = char;
type Unit = u16;
type DecodeError = CharsetDecodeError;
type EncodeError = CharsetEncodeError;
#[inline(always)]
fn min_units_per_value(&self) -> core::num::NonZeroUsize {
core::num::NonZeroUsize::MIN
}
#[inline(always)]
fn max_units_per_value(&self) -> core::num::NonZeroUsize {
unsafe {
core::num::NonZeroUsize::new_unchecked(Utf16::MAX_UNITS_PER_CHAR)
}
}
#[inline(always)]
unsafe fn decode_unchecked(
&self,
input: &[u16],
index: usize,
) -> CharsetDecodeResult<(char, core::num::NonZeroUsize)> {
let (ch, consumed) = decode_units_prefix(input, index)?;
debug_assert!(consumed.get() <= input.len() - index);
Ok((ch, consumed))
}
#[inline(always)]
unsafe fn encode_unchecked(
&self,
ch: &char,
output: &mut [u16],
index: usize,
) -> CharsetEncodeResult<usize> {
let written = encode_units_char(*ch, output, index)?;
debug_assert_eq!(written, ch.len_utf16());
debug_assert!(written <= output.len() - index);
Ok(written)
}
}
#[inline]
fn decode_units_prefix(
input: &[u16],
index: usize,
) -> CharsetDecodeResult<(char, core::num::NonZeroUsize)> {
if index > input.len() {
let kind = CharsetDecodeErrorKind::InvalidInputIndex {
input_len: input.len(),
};
return Err(CharsetDecodeError::new(Charset::UTF_16, kind, index));
}
if index == input.len() {
let kind = CharsetDecodeErrorKind::IncompleteSequence {
required: 1,
available: 0,
};
return Err(CharsetDecodeError::new(Charset::UTF_16, kind, index));
}
let first = input[index];
if Utf16::is_high_surrogate(first) {
if !has_units(input.len(), index, 2) {
let kind = CharsetDecodeErrorKind::IncompleteSequence {
required: 2,
available: input.len() - index,
};
return Err(CharsetDecodeError::new(Charset::UTF_16, kind, index));
}
let second = input[index + 1];
match Utf16::compose_pair(first, second).and_then(Unicode::to_char) {
Some(ch) => {
Ok((ch, unsafe { core::num::NonZeroUsize::new_unchecked(2) }))
}
None => {
let kind = CharsetDecodeErrorKind::MalformedSequence {
value: Some(second as u32),
};
Err(CharsetDecodeError::new(
Charset::UTF_16,
kind,
required_index(index, 1),
)
.with_consumed(2))
}
}
} else if Utf16::is_low_surrogate(first) {
let kind = CharsetDecodeErrorKind::MalformedSequence {
value: Some(first as u32),
};
Err(CharsetDecodeError::new(Charset::UTF_16, kind, index))
} else {
let ch = char::from_u32(first as u32)
.expect("non-surrogate UTF-16 unit is a scalar value");
Ok((ch, core::num::NonZeroUsize::MIN))
}
}
#[inline]
fn encode_units_char(
ch: char,
output: &mut [u16],
index: usize,
) -> CharsetEncodeResult<usize> {
if index > output.len() {
let kind = CharsetEncodeErrorKind::BufferTooSmall {
required: required_index(index, 1),
available: 0,
};
return Err(CharsetEncodeError::new(Charset::UTF_16, kind, index));
}
let length = Utf16::unit_len(ch);
let available = output.len() - index;
if available < length {
let kind = CharsetEncodeErrorKind::BufferTooSmall {
required: required_index(index, length),
available,
};
return Err(CharsetEncodeError::new(Charset::UTF_16, kind, index));
}
let code_point = ch as u32;
if length == 1 {
output[index] = code_point as u16;
} else {
output[index] = Utf16::high_surrogate(code_point)
.expect("supplementary scalar has high surrogate");
output[index + 1] = Utf16::low_surrogate(code_point)
.expect("supplementary scalar has low surrogate");
}
Ok(length)
}
#[inline(always)]
const fn has_units(len: usize, index: usize, required_units: usize) -> bool {
match index.checked_add(required_units) {
Some(end) => len >= end,
None => false,
}
}
#[inline(always)]
const fn required_index(index: usize, required_units: usize) -> usize {
match index.checked_add(required_units) {
Some(required) => required,
None => usize::MAX,
}
}