[package]
name = "memra-server"
description = "OpenAI-compatible HTTP serving for the memra CUDA inference engine - single-GPU multi-model step-interleave scheduling on RTX 50-series"
version.workspace = true
license.workspace = true
repository.workspace = true
rust-version.workspace = true
edition = "2024"
[dependencies]
memra-engine = { workspace = true }
cudarc = { version = "0.19", default-features = false, features = ["std", "cuda-13010", "dynamic-loading", "driver", "cublas", "cublaslt", "nvrtc"] }
memra-gguf = { workspace = true }
memra-lanes = { workspace = true }
memra-tokenizer = { workspace = true }
tokio = { version = "1", features = ["rt-multi-thread", "macros", "net", "sync", "time", "signal"] }
axum = "0.7"
serde = { version = "1", features = ["derive"] }
serde_json = { version = "1", features = ["preserve_order"] }
async-stream = "0.3"
futures-core = "0.3"
llguidance = "1.7.6"
libc = "0.2"
sha2 = "0.10"
toml = "0.8"
[dev-dependencies]
tower = { version = "0.5", features = ["util"] }
[[bin]]
name = "memra-server"
path = "src/main.rs"
[package.metadata.binstall]
pkg-url = "{ repo }/releases/download/v{ version }/memra-server-v{ version }-{ target }.tar.gz"
bin-dir = "memra-server-v{ version }-{ target }/{ bin }"
pkg-fmt = "tgz"