[package]
authors.workspace = true
categories = ["text-processing"]
description = "Extract text chunks from common document formats."
edition.workspace = true
homepage.workspace = true
keywords = ["document", "extract", "markdown"]
license.workspace = true
name = "doc_extractor"
repository.workspace = true
rust-version.workspace = true
version = "0.1.1"
[dependencies]
infer = { workspace = true }
office_oxide = { workspace = true }
path-ext = { workspace = true }
pdf_oxide = { workspace = true }
readability = { workspace = true }
serde = { workspace = true, features = ["derive"] }
serde_json = { workspace = true }
strum_macros = { workspace = true }
text-splitter = { workspace = true }
thiserror = { workspace = true }
tiktoken-rs = { workspace = true }
tree-sitter = { workspace = true }
tree-sitter-c = { workspace = true }
tree-sitter-cpp = { workspace = true }
tree-sitter-go = { workspace = true }
tree-sitter-javascript = { workspace = true }
tree-sitter-python = { workspace = true }
tree-sitter-rust = { workspace = true }
tree-sitter-typescript = { workspace = true }
url = { workspace = true }