memra-server 0.124.1

OpenAI-compatible HTTP serving for the memra CUDA inference engine - single-GPU multi-model step-interleave scheduling on RTX 50-series
Documentation
1
2
3
4
5
6
7
//! Thin binary over the `memra-server` library. Everything lives in `lib.rs` so a
//! deployment-owned binary can link the same server and supply its own wiring; this
//! stock bin IS the reference wiring.

fn main() -> Result<(), Box<dyn std::error::Error>> {
    memra_server::serve_main()
}