#![doc(
html_logo_url = "https://raw.githubusercontent.com/apache/parquet-format/25f05e73d8cd7f5c83532ce51cb4f4de8ba5f2a2/logo/parquet-logos_1.svg",
html_favicon_url = "https://raw.githubusercontent.com/apache/parquet-format/25f05e73d8cd7f5c83532ce51cb4f4de8ba5f2a2/logo/parquet-logos_1.svg"
)]
#![cfg_attr(docsrs, feature(doc_cfg))]
#![warn(missing_docs)]
#![recursion_limit = "128"]
extern crate proc_macro;
extern crate proc_macro2;
extern crate syn;
#[macro_use]
extern crate quote;
extern crate parquet;
use ::syn::{Data, DataStruct, DeriveInput, parse_macro_input};
mod parquet_field;
#[proc_macro_derive(ParquetRecordWriter)]
pub fn parquet_record_writer(input: proc_macro::TokenStream) -> proc_macro::TokenStream {
let input: DeriveInput = parse_macro_input!(input as DeriveInput);
let fields = match input.data {
Data::Struct(DataStruct { fields, .. }) => fields,
Data::Enum(_) => unimplemented!("Enum currently is not supported"),
Data::Union(_) => unimplemented!("Union currently is not supported"),
};
let field_infos: Vec<_> = fields.iter().map(parquet_field::Field::from).collect();
let writer_snippets: Vec<proc_macro2::TokenStream> =
field_infos.iter().map(|x| x.writer_snippet()).collect();
let derived_for = input.ident;
let generics = input.generics;
let field_types: Vec<proc_macro2::TokenStream> =
field_infos.iter().map(|x| x.parquet_type()).collect();
(quote! {
impl #generics ::parquet::record::RecordWriter<#derived_for #generics> for &[#derived_for #generics] {
fn write_to_row_group<W: ::std::io::Write + Send>(
&self,
row_group_writer: &mut ::parquet::file::writer::SerializedRowGroupWriter<'_, W>
) -> ::std::result::Result<(), ::parquet::errors::ParquetError> {
use ::parquet::column::writer::ColumnWriter;
let mut row_group_writer = row_group_writer;
let records = &self;
#(
{
let mut some_column_writer = row_group_writer.next_column().unwrap();
if let Some(mut column_writer) = some_column_writer {
#writer_snippets
column_writer.close()?;
} else {
return Err(::parquet::errors::ParquetError::General("Failed to get next column".into()))
}
}
);*
Ok(())
}
fn schema(&self) -> ::std::result::Result<::parquet::schema::types::TypePtr, ::parquet::errors::ParquetError> {
use ::parquet::schema::types::Type as ParquetType;
use ::parquet::schema::types::TypePtr;
use ::parquet::basic::LogicalType;
let mut fields: ::std::vec::Vec<TypePtr> = ::std::vec::Vec::new();
#(
#field_types
);*;
let group = ParquetType::group_type_builder("rust_schema")
.with_fields(fields)
.build()?;
Ok(group.into())
}
}
}).into()
}
#[proc_macro_derive(ParquetRecordReader)]
pub fn parquet_record_reader(input: proc_macro::TokenStream) -> proc_macro::TokenStream {
let input: DeriveInput = parse_macro_input!(input as DeriveInput);
let fields = match input.data {
Data::Struct(DataStruct { fields, .. }) => fields,
Data::Enum(_) => unimplemented!("Enum currently is not supported"),
Data::Union(_) => unimplemented!("Union currently is not supported"),
};
let field_infos: Vec<_> = fields.iter().map(parquet_field::Field::from).collect();
let field_names: Vec<_> = fields.iter().map(|f| f.ident.clone()).collect();
let reader_snippets: Vec<proc_macro2::TokenStream> =
field_infos.iter().map(|x| x.reader_snippet()).collect();
let derived_for = input.ident;
let generics = input.generics;
(quote! {
impl #generics ::parquet::record::RecordReader<#derived_for #generics> for Vec<#derived_for #generics> {
fn read_from_row_group(
&mut self,
row_group_reader: &mut dyn ::parquet::file::reader::RowGroupReader,
num_records: usize,
) -> ::std::result::Result<(), ::parquet::errors::ParquetError> {
use ::parquet::column::reader::ColumnReader;
let mut row_group_reader = row_group_reader;
let mut name_to_index = std::collections::HashMap::new();
for (idx, col) in row_group_reader.metadata().schema_descr().columns().iter().enumerate() {
name_to_index.insert(col.name().to_string(), idx);
}
for _ in 0..num_records {
self.push(#derived_for {
#(
#field_names: Default::default()
),*
})
}
let records = self;
#(
{
let idx: usize = match name_to_index.get(stringify!(#field_names)) {
Some(&col_idx) => col_idx,
None => {
let error_msg = format!("column name '{}' is not found in parquet file!", stringify!(#field_names));
return Err(::parquet::errors::ParquetError::General(error_msg));
}
};
if let Ok(column_reader) = row_group_reader.get_column_reader(idx) {
#reader_snippets
} else {
return Err(::parquet::errors::ParquetError::General("Failed to get next column".into()))
}
}
);*
Ok(())
}
}
}).into()
}