Expand description
テキスト埋め込みPDFから純粋な表を抽出しJSON可能な構造で返すライブラリ
Structs§
- BBox
- 矩形領域
- Bidi
Text - bidi 結果
- Cell
- 表のセル
- Content
Line - 内容ビューの1行
- Content
Page - 1ページ分の内容ビュー
- Content
Text - 内容ビューの本文ブロック
- DocContent
- 文字・フォント情報を除いた文書内容ビュー
- DocDoc
- 文書全体
- DocPage
- 1ページ分の文書モデル
- Document
- ドキュメント全体の出力 JSON のルート
- Edge
Part - 外部リーダーから受け取る軸平行な線分
- Extract
Options - 抽出処理のパラメータ
- Extract
Query - 抽出範囲の絞り込み条件
- Glyph
Part - 外部リーダーから受け取る1文字
- Graphic
Part - 外部リーダーから受け取る非罫線グラフィックの外接矩形
- Hybrid
Settings - 検出パラメータ
- Lattice
Settings - 検出パラメータ
- Page
- 1ページ分の出力
- Page
Part - 外部リーダーから受け取る1ページ分の文字と線分
- Page
Selection - 1始まりのページ選択
- Parts
View - parts 系ビュー
- Reader
Dump - リーダーが1回のパスで出せる全情報のダンプ
- Reader
Dump Page - ダンプ1ページ分の情報
- Reader
Settings - 読み取り層のパラメータ
- Region
- top-down 表示座標の矩形
- Table
- 検出された1つの表
- Text
Block - 本文ブロック
- Text
Char - 1グリフ分の座標付き文字
- TextDoc
- 文書全体の座標付き文字
- Text
Font - ページ内フォント表の1エントリ
- Text
Item - TextItem 互換のチャンク
- Text
Line - 行ビュー
- Text
Page - 1ページ分の座標付き文字
- Text
Settings - 検出パラメータ
- Text
View - テキスト系ビュー
- Text
Word - 単語ビュー
Enums§
- Content
Block - 内容ビューの1ブロック
- Detect
Mode - 実行する検出方式の選択
- DocBlock
- ページ内の1ブロック
- Error
- 表抽出のエラー
- Orientation
- 辺の向き
- Text
Block Kind - 本文ブロックの種別
- Text
Block Role - 本文ブロックの役割(ヘッダ・フッタ検出)
Functions§
- apply_
bidi bidiオプション有効時の並べ替え(RTL 基準固定)- assign_
header_ footer - 文書単位のヘッダ・フッタ役割付与
- assign_
headings - 文書単位の見出し推定
- assign_
lists - 文書単位のリスト検出
- bidi
start_level == -1は文字比率で基準方向を推定(単体比較用) 本番のapply_bidiは常にstart_level = 1- build_
blocks - 読み順付きブロック列の構築
- build_
text_ items - build_
text_ items_ with - bidi = RTL 並べ替えの有効化フラグ
- build_
text_ lines - build_
text_ lines_ with - bidi = RTL 並べ替えの有効化フラグ
- extract_
content_ from_ bytes - extract_
content_ from_ bytes_ with_ query - ページ・矩形で絞った内容ビュー構築
- extract_
document_ from_ bytes - 見出し推定済みの文書モデル
- extract_
document_ from_ bytes_ with_ query - ページ・矩形で絞った文書モデル構築
- extract_
from_ bytes - 純Rustリーダーによるバイト列からの表抽出
- extract_
from_ bytes_ with_ query - ページ・矩形で絞った表抽出
- extract_
from_ parts - 外部リーダーが取り出した文字と線分からの全ページ表抽出
- extract_
markdown_ from_ bytes - extract_
markdown_ from_ bytes_ with_ query - ページ・矩形で絞った Markdown 生成
- extract_
text_ from_ bytes - 純Rustリーダーによるバイト列からの座標付き文字抽出
- extract_
text_ from_ bytes_ with - 読み取り層の設定付きの座標付き文字抽出
- extract_
text_ from_ bytes_ with_ query - ページ・矩形で絞った座標付き文字抽出
- read_
pages - PDF バイト列からのページ単位 parts 構築
- read_
pages_ full - 全情報の 1 パス抽出
- read_
pages_ full_ with - 読み取り層の設定付きの全情報抽出
- read_
pages_ with - 読み取り層の設定付きの parts 構築
- retain_
chars_ in_ region - 残す基準はグリフ中心点
- retain_
parts_ in_ region - 矩形に掛かる parts への絞り込み