ferrum-cli 0.8.2

CLI for Ferrum — a Rust-native LLM inference engine
Documentation
[package]
name = "ferrum-cli"
version.workspace = true
edition.workspace = true
authors.workspace = true
license.workspace = true
description = "CLI for Ferrum — a Rust-native LLM inference engine"
readme = "../../README.md"

[[bin]]
name = "ferrum"
path = "src/main.rs"

[dependencies]
# Core dependencies
ferrum-types = { workspace = true }
ferrum-interfaces = { workspace = true }
ferrum-engine = { workspace = true }
ferrum-models = { workspace = true }
ferrum-scheduler = { workspace = true }
ferrum-server = { workspace = true }
ferrum-kernels = { workspace = true }
ferrum-quantization = { workspace = true }
ferrum-bench-core = { workspace = true }

# ML dependencies
candle-core = { workspace = true }
tokenizers = { workspace = true }
rand = { workspace = true }

# CLI framework
clap = { version = "4.4", features = ["derive", "color", "env"] }

# Async runtime
tokio = { workspace = true, features = ["full"] }
async-trait = { workspace = true }

# Serialization
serde = { workspace = true }
serde_json = { workspace = true }
serde_yaml = "0.9"
sha2 = "0.10"

# Error handling
anyhow = { workspace = true }
thiserror = { workspace = true }

# Logging
tracing = { workspace = true }
tracing-subscriber = { version = "0.3", features = ["env-filter", "json"] }

# Configuration
config = { workspace = true }
toml = { workspace = true }

# File operations
walkdir = "2.4"

# Terminal utilities
console = "0.15"
indicatif = "0.17"
dialoguer = "0.11"
colored = "2.1"

# Time and ID
chrono = { workspace = true }
uuid = { workspace = true }

# HTTP client for testing
reqwest = { version = "0.12", default-features = false, features = ["json", "stream", "rustls-tls"] }
tokio-stream = "0.1"
futures = "0.3"

# Benchmarking
criterion = { version = "0.5", features = ["html_reports"] }

# System utilities
num_cpus = { workspace = true }
dirs = { workspace = true }
shellexpand = "3.1"
libc = "0.2"

[dev-dependencies]
rstest = "0.23"
rexpect = "0.6"
async-openai = { version = "0.27", default-features = false, features = ["rustls"] }

[features]
default = []
benchmark = []  # Enable benchmarking utilities
dev-tools = []  # Enable development tools
interactive = [] # Enable interactive mode
accelerate = ["ferrum-engine/accelerate"]  # Use Apple Accelerate BLAS (matches PyTorch precision)
metal = ["ferrum-engine/metal", "ferrum-kernels/metal", "ferrum-quantization/metal"]  # Apple GPU
cuda = ["ferrum-engine/cuda", "ferrum-kernels/cuda", "ferrum-quantization/cuda"]    # NVIDIA CUDA
candle-cuda-compat = ["cuda", "ferrum-engine/candle-cuda-compat", "ferrum-kernels/candle-cuda-compat"]
marlin = ["cuda"]  # backward compat alias
vllm-marlin = ["cuda", "ferrum-kernels/vllm-marlin"]  # Phase 12 — vLLM gptq_marlin port (opt-in)
vllm-moe-marlin = ["cuda", "ferrum-kernels/vllm-moe-marlin"]  # Stage 14 — vLLM marlin_moe_wna16 port (opt-in)
vllm-paged-attn-v2 = ["cuda", "ferrum-kernels/vllm-paged-attn-v2"]  # 2026-05-12 — vLLM paged_attention_v2 port (opt-in, runtime-gated via FERRUM_USE_VLLM_PAGED_ATTN=1)
fa2-source = ["cuda", "ferrum-kernels/fa2-source"]  # Obsolete compatibility alias; FA2 now requires a native operator artifact.
native-op-artifact = ["cuda", "ferrum-kernels/native-op-artifact"]  # Consume explicit Ferrum native operator artifact manifests during CUDA builds.
tensor-parallel = ["cuda"]  # backward compat alias
# Triton-rs PTX path swap for the LLM decode kernels. Requires cuda.
triton-kernels = ["cuda", "ferrum-engine/triton-kernels"]