Expand description
Inference Pipeline Implementations
This module provides optimized pipeline implementations for different inference patterns:
- Chunked Prefill: Split long prompts into chunks for better memory efficiency
- Prefill-Decode Separation: Dedicated handling for each phase
- Batch Pipeline: Efficient processing of multiple requests
Re-exports§
pub use chunked_prefill::ChunkedPrefillConfig;pub use chunked_prefill::ChunkedPrefillExecutor;pub use executor::ExecutionPhase;pub use executor::PipelineConfig;pub use executor::PipelineExecutor;
Modules§
- chunked_
prefill - Chunked Prefill Implementation
- executor
- Pipeline Executor