ruda-optim 0.21.3

Ruda optimizer updates, gradient state, clipping and learning-rate schedules.
Documentation

ruda-optim

Optimizer updates, gradient handling, clipping, learning-rate schedules, and training-state records for Ruda models. Device-fused optimizer paths and collective gradient synchronization are explicit features.

Interfaces

  • Crate-root optimizer exports provide optimizer configurations and gradient updates.
  • grad_clipping and lr_scheduler handle clipping and schedules.
  • training combines model, optimizer, scheduler, and accumulated-gradient records.
  • fused_adamw supplies opt-in AdamW/AMSGrad implementations.

Usage

Cargo package: ruda-optim. Rust import: ruda_optim.

[dependencies]
ruda-optim = "0.21"

Features

Default features: std, ruda-model/default.

Feature Purpose
fused-adamw Enable host fused-optimizer interfaces.
fused-adamw-device Enable the runtime-generic device implementation.
fused-adamw-cuda Enable CUDA fused-optimizer integration.
collective Enable ruCCL gradient synchronization.
gradient-guard Enable the gradient-guard integration.

Links