Skip to main content

Crate pdfni

Crate pdfni 

Source
Expand description

テキスト埋め込みPDFから純粋な表を抽出しJSON可能な構造で返すライブラリ

Structs§

BBox
矩形領域
BidiText
bidi 結果
Cell
表のセル
ContentLine
内容ビューの1行
ContentPage
1ページ分の内容ビュー
ContentText
内容ビューの本文ブロック
DocContent
文字・フォント情報を除いた文書内容ビュー
DocDoc
文書全体
DocPage
1ページ分の文書モデル
Document
ドキュメント全体の出力 JSON のルート
EdgePart
外部リーダーから受け取る軸平行な線分
ExtractOptions
抽出処理のパラメータ
ExtractQuery
抽出範囲の絞り込み条件
GlyphPart
外部リーダーから受け取る1文字
GraphicPart
外部リーダーから受け取る非罫線グラフィックの外接矩形
HybridSettings
検出パラメータ
LatticeSettings
検出パラメータ
Page
1ページ分の出力
PagePart
外部リーダーから受け取る1ページ分の文字と線分
PageSelection
1始まりのページ選択
PartsView
parts 系ビュー
ReaderDump
リーダーが1回のパスで出せる全情報のダンプ
ReaderDumpPage
ダンプ1ページ分の情報
ReaderSettings
読み取り層のパラメータ
Region
top-down 表示座標の矩形
Table
検出された1つの表
TextBlock
本文ブロック
TextChar
1グリフ分の座標付き文字
TextDoc
文書全体の座標付き文字
TextFont
ページ内フォント表の1エントリ
TextItem
TextItem 互換のチャンク
TextLine
行ビュー
TextPage
1ページ分の座標付き文字
TextSettings
検出パラメータ
TextView
テキスト系ビュー
TextWord
単語ビュー

Enums§

ContentBlock
内容ビューの1ブロック
DetectMode
実行する検出方式の選択
DocBlock
ページ内の1ブロック
Error
表抽出のエラー
Orientation
辺の向き
TextBlockKind
本文ブロックの種別
TextBlockRole
本文ブロックの役割(ヘッダ・フッタ検出)

Functions§

apply_bidi
bidi オプション有効時の並べ替え(RTL 基準固定)
assign_header_footer
文書単位のヘッダ・フッタ役割付与
assign_headings
文書単位の見出し推定
assign_lists
文書単位のリスト検出
bidi
start_level == -1 は文字比率で基準方向を推定(単体比較用) 本番の apply_bidi は常に start_level = 1
build_blocks
読み順付きブロック列の構築
build_text_items
build_text_items_with
bidi = RTL 並べ替えの有効化フラグ
build_text_lines
build_text_lines_with
bidi = RTL 並べ替えの有効化フラグ
extract_content_from_bytes
extract_content_from_bytes_with_query
ページ・矩形で絞った内容ビュー構築
extract_document_from_bytes
見出し推定済みの文書モデル
extract_document_from_bytes_with_query
ページ・矩形で絞った文書モデル構築
extract_from_bytes
純Rustリーダーによるバイト列からの表抽出
extract_from_bytes_with_query
ページ・矩形で絞った表抽出
extract_from_parts
外部リーダーが取り出した文字と線分からの全ページ表抽出
extract_markdown_from_bytes
extract_markdown_from_bytes_with_query
ページ・矩形で絞った Markdown 生成
extract_text_from_bytes
純Rustリーダーによるバイト列からの座標付き文字抽出
extract_text_from_bytes_with
読み取り層の設定付きの座標付き文字抽出
extract_text_from_bytes_with_query
ページ・矩形で絞った座標付き文字抽出
read_pages
PDF バイト列からのページ単位 parts 構築
read_pages_full
全情報の 1 パス抽出
read_pages_full_with
読み取り層の設定付きの全情報抽出
read_pages_with
読み取り層の設定付きの parts 構築
retain_chars_in_region
残す基準はグリフ中心点
retain_parts_in_region
矩形に掛かる parts への絞り込み

Type Aliases§

Result