use std::collections::BTreeMap;
use std::sync::Arc;
use std::sync::atomic::Ordering;
use std::time::Duration;
use chrono::{DateTime, Utc};
use tokio::task::JoinSet;
use crate::controller::{Controller, WorkerUpgradeOutcome};
use crate::recovery::{backoff_delay, elapsed_at_least};
use crate::recovery_gate::{
ObservationReceiver, ObservationSender, RecoveryGate, RecoveryObserver, observation_channel,
};
use crate::session_manager::SessionManagerControl;
use crate::targets::CancellableProcessExecutor;
use mj_core::config::Config;
use mj_core::state::{SessionRecord, SessionState, State};
const WORKER_UPGRADE_RETRY_INTERVAL: Duration = Duration::from_secs(10 * 60);
const WORKER_UPGRADE_DEFERRED_INTERVAL: Duration = Duration::from_secs(30);
const MAX_WORKER_UPGRADE_RETRY_INTERVAL: Duration = Duration::from_secs(2 * 60 * 60);
const WORKER_UPGRADE_TIMEOUT: Duration = Duration::from_secs(15 * 60);
#[derive(Debug, Clone)]
pub struct WorkerUpgradeObservation {
pub session: SessionRecord,
pub config: Config,
pub worker_build: Option<String>,
pub quiet: bool,
}
#[derive(Clone)]
pub struct WorkerUpgradeObserver {
observations: ObservationSender<WorkerUpgradeObservation>,
}
impl WorkerUpgradeObserver {
pub fn observe(&self, observation: WorkerUpgradeObservation) {
self.observations
.send(observation.session.id.clone(), observation, |_, _| {});
}
}
#[derive(Debug, Clone)]
pub struct WorkerUpgradeResult {
pub session_id: String,
pub outcome: Result<WorkerUpgradeOutcome, String>,
pub cancelled: bool,
}
pub struct WorkerUpgradeCoordinator {
supervisor: Option<tokio::task::JoinHandle<()>>,
observer: WorkerUpgradeObserver,
results: ObservationReceiver<WorkerUpgradeResult>,
gate: Arc<RecoveryGate>,
}
impl Drop for WorkerUpgradeCoordinator {
fn drop(&mut self) {
self.gate.close();
}
}
impl WorkerUpgradeCoordinator {
pub fn spawn(session_manager: SessionManagerControl, recovery: &RecoveryObserver) -> Self {
let (observations_tx, mut observations_rx) =
observation_channel::<WorkerUpgradeObservation>();
let (results_tx, results_rx) = observation_channel();
let gate = recovery.gate.clone();
let coordinator_gate = gate.clone();
let supervisor = tokio::spawn(async move {
let mut policies = BTreeMap::<String, PolicyState>::new();
let mut attempts = JoinSet::new();
let mut closing = false;
loop {
if closing && attempts.is_empty() {
break;
}
tokio::select! {
_ = coordinator_gate.closed(), if !closing => { closing = true; }
observed = observations_rx.recv(), if !closing => {
let Some(observation) = observed else { coordinator_gate.close(); closing = true; continue; };
let session_id = observation.session.id.clone();
let policy = policies.entry(session_id.clone()).or_default();
policy.observe(&observation);
if !policy.due(&observation, Utc::now()) {
continue;
}
let Some(upgrade_cancelled) = coordinator_gate.try_start(&session_id)
else {
continue;
};
let session_manager = session_manager.clone();
let task_cancelled = upgrade_cancelled.cancellation();
let task_session_id = session_id.clone();
attempts.spawn(async move {
let (joined, admission) = upgrade_cancelled.run_blocking(move |cancelled| {
let Some(session) = crate::recovery_gate::current_background_session(&observation.session)
.map_err(|error| format!("read current upgrade placement: {error:#}"))?
else { return Ok(WorkerUpgradeOutcome::Deferred); };
let mut state = State::default();
state.sessions.insert(task_session_id.clone(), session);
let controller = Controller {
config: observation.config,
state,
};
let executor = CancellableProcessExecutor::new(cancelled)
.with_deadline(WORKER_UPGRADE_TIMEOUT);
mj_core::runtime::block_on(controller.upgrade_session_worker(
&task_session_id,
&executor,
&session_manager,
observation.worker_build.as_deref(),
))
.and_then(|result| result)
.map_err(|error| format!("{error:#}"))
})
.await;
let outcome = match joined {
Ok(outcome) => outcome,
Err(error) => Err(format!("worker upgrade task failed: {error}")),
};
let result = WorkerUpgradeResult {
session_id,
outcome,
cancelled: task_cancelled.load(Ordering::Acquire),
};
(result, admission)
});
}
completed = attempts.join_next(), if !attempts.is_empty() => {
let Some(completed) = completed else { continue };
let (result, _admission) = match completed {
Ok(completed) => completed,
Err(error) => { tracing::error!(%error, "worker upgrade attempt supervisor failed"); continue; }
};
let policy = policies.entry(result.session_id.clone()).or_default();
policy.record(&result, Utc::now());
if let Err(error) = &result.outcome && !result.cancelled {
tracing::warn!(session_id = %result.session_id, %error, "background worker upgrade failed");
}
results_tx.send(result.session_id.clone(), result, |_, _| {});
}
}
}
});
Self {
supervisor: Some(supervisor),
observer: WorkerUpgradeObserver {
observations: observations_tx,
},
results: results_rx,
gate,
}
}
pub async fn shutdown(&mut self) -> anyhow::Result<()> {
self.gate.close();
if let Some(supervisor) = self.supervisor.take() {
supervisor.await.map_err(|error| {
anyhow::anyhow!("background coordinator supervisor failed: {error}")
})?;
}
Ok(())
}
pub fn observer(&self) -> WorkerUpgradeObserver {
self.observer.clone()
}
pub fn try_result(&mut self) -> Option<WorkerUpgradeResult> {
self.results.try_recv()
}
}
#[derive(Debug, Default, PartialEq, Eq)]
struct PolicyState {
current_build: Option<String>,
failed_at: Option<DateTime<Utc>>,
deferred_at: Option<DateTime<Utc>>,
consecutive_failures: u32,
}
impl PolicyState {
fn due(&self, observation: &WorkerUpgradeObservation, now: DateTime<Utc>) -> bool {
if !observation.quiet || observation.session.state != SessionState::Running {
return false;
}
if self.worker_is_known_current(observation.worker_build.as_deref()) {
return false;
}
if self.deferred_at.is_some_and(|deferred| {
!elapsed_at_least(deferred, now, WORKER_UPGRADE_DEFERRED_INTERVAL)
}) {
return false;
}
self.failed_at.is_none_or(|failed_at| {
elapsed_at_least(
failed_at,
now,
backoff_delay(
WORKER_UPGRADE_RETRY_INTERVAL,
MAX_WORKER_UPGRADE_RETRY_INTERVAL,
self.consecutive_failures,
),
)
})
}
fn worker_is_known_current(&self, worker_build: Option<&str>) -> bool {
let (Some(observed), Some(current)) = (worker_build, self.current_build.as_deref()) else {
return false;
};
observed == current
}
fn observe(&mut self, observation: &WorkerUpgradeObservation) {
if self.current_build.is_some()
&& observation.worker_build.as_deref() == self.current_build.as_deref()
{
self.failed_at = None;
self.deferred_at = None;
self.consecutive_failures = 0;
}
}
fn record(&mut self, result: &WorkerUpgradeResult, now: DateTime<Utc>) {
if result.cancelled {
return;
}
self.deferred_at = None;
match &result.outcome {
Ok(WorkerUpgradeOutcome::Deferred) => {
self.deferred_at = Some(now);
}
Ok(outcome @ WorkerUpgradeOutcome::AlreadyCurrent { .. }) => {
self.failed_at = None;
self.consecutive_failures = 0;
self.current_build = outcome.build().map(str::to_owned);
}
Ok(outcome @ WorkerUpgradeOutcome::Upgraded { .. }) => {
self.current_build = outcome.build().map(str::to_owned);
self.consecutive_failures = self.consecutive_failures.saturating_add(1);
self.failed_at = Some(now);
}
Err(_) => {
self.consecutive_failures = self.consecutive_failures.saturating_add(1);
self.failed_at = Some(now);
}
}
}
}
#[cfg(test)]
mod tests {
use super::*;
fn session_record(state: SessionState) -> SessionRecord {
SessionRecord {
target_runtime: None,
launch_base: None,
launch_branch: None,
checkout: None,
expected_runtime_identity: None,
publication: None,
build_cache: None,
container_workspace: None,
subagents: None,
create_managed_worktree: None,
workspace_id: mj_core::workspace::DEFAULT_WORKSPACE_ID.to_owned(),
archived: false,
container_cpus: None,
container_memory: None,
id: "session-1".to_owned(),
title: "work".into(),
harness_kind: mj_core::config::HarnessKind::Codex,
last_profile: "codex-1".into(),
bundle_id: "hel".into(),
project_directory: None,
managed_worktree: None,
target_template_id: "podman".into(),
resource_allocation: None,
additional_mounts: Vec::new(),
state,
target: None,
native_session_id: None,
acp_session_title: None,
session_title_override: None,
created_at: "2026-08-09T12:00:00Z".into(),
updated_at: "2026-08-09T12:01:00Z".into(),
viewed_through_event_ordinal: 0,
draft_input: String::new(),
last_error: None,
last_checkpoint_error: None,
checkpoint: None,
}
}
fn observation(worker_build: Option<&str>, quiet: bool) -> WorkerUpgradeObservation {
WorkerUpgradeObservation {
session: session_record(SessionState::Running),
config: Config::default(),
worker_build: worker_build.map(str::to_owned),
quiet,
}
}
fn failure(detail: &str) -> WorkerUpgradeResult {
WorkerUpgradeResult {
session_id: "session-1".into(),
outcome: Err(detail.into()),
cancelled: false,
}
}
fn current(build: &str) -> WorkerUpgradeOutcome {
WorkerUpgradeOutcome::AlreadyCurrent {
build: build.to_owned(),
}
}
fn upgraded(build: &str) -> WorkerUpgradeOutcome {
WorkerUpgradeOutcome::Upgraded {
build: build.to_owned(),
}
}
fn success(outcome: WorkerUpgradeOutcome) -> WorkerUpgradeResult {
WorkerUpgradeResult {
session_id: "session-1".into(),
outcome: Ok(outcome),
cancelled: false,
}
}
#[test]
fn only_a_quiet_session_with_an_unknown_build_is_due() {
let now = Utc::now();
let policy = PolicyState::default();
assert!(policy.due(&observation(Some("build-a"), true), now));
assert!(
!policy.due(&observation(Some("build-a"), false), now),
"a working session must not have its worker killed"
);
assert!(
policy.due(&observation(None, true), now),
"a worker too old to report a build is outdated"
);
}
#[test]
fn a_busy_turn_is_never_upgraded_no_matter_how_long_it_runs() {
let started = Utc::now();
let policy = PolicyState::default();
let two_days_later = started + chrono::Duration::days(2);
assert!(!policy.due(&observation(Some("old-build"), false), two_days_later));
assert!(
policy.due(&observation(Some("old-build"), true), two_days_later),
"the next quiet observation may upgrade without an age-based busy timeout"
);
}
#[test]
fn only_a_running_session_is_due() {
let now = Utc::now();
let policy = PolicyState::default();
for state in [
SessionState::Provisioning,
SessionState::Disconnected,
SessionState::Checkpointing,
SessionState::Closing,
SessionState::Destroying,
SessionState::Stopped,
SessionState::Lost,
SessionState::Error,
SessionState::DestroyedWithDataLoss,
] {
let mut observation = observation(Some("build-a"), true);
observation.session.state = state;
assert!(!policy.due(&observation, now), "{state:?}");
}
}
#[test]
fn a_worker_proved_current_stays_trusted_for_coordinator_lifetime() {
let now = Utc::now();
let mut policy = PolicyState::default();
policy.record(&success(current("build-a")), now);
assert!(!policy.due(&observation(Some("build-a"), true), now));
assert!(
!policy.due(
&observation(Some("build-a"), true),
now + chrono::Duration::days(2)
),
"the launched build remains trusted for the coordinator lifetime"
);
assert!(
policy.due(&observation(Some("build-b"), true), now),
"a different build is outdated however recently the last one was checked"
);
}
#[test]
fn a_failed_upgrade_backs_off_and_widens() {
let now = Utc::now();
let mut policy = PolicyState::default();
policy.record(&failure("install the current Mjolnir worker binary"), now);
let interval = chrono::Duration::from_std(WORKER_UPGRADE_RETRY_INTERVAL).unwrap();
assert!(!policy.due(&observation(Some("build-a"), true), now));
assert!(!policy.due(
&observation(Some("build-a"), true),
now + interval - chrono::Duration::seconds(1)
));
assert!(policy.due(&observation(Some("build-a"), true), now + interval));
policy.record(&failure("install the current Mjolnir worker binary"), now);
assert!(!policy.due(
&observation(Some("build-a"), true),
now + interval * 2 - chrono::Duration::seconds(1)
));
assert!(policy.due(&observation(Some("build-a"), true), now + interval * 2));
}
#[test]
fn a_successful_upgrade_stops_the_probing_and_confirming_it_clears_the_backoff() {
let now = Utc::now();
let mut policy = PolicyState::default();
policy.record(&failure("install the current Mjolnir worker binary"), now);
policy.record(&success(upgraded("build-b")), now);
let confirmed = observation(Some("build-b"), true);
policy.observe(&confirmed);
assert_eq!(policy.consecutive_failures, 0);
assert_eq!(policy.failed_at, None);
assert!(
!policy.due(&confirmed, now),
"the worker now runs the installed build, so nothing is due"
);
}
#[test]
fn an_upgrade_that_does_not_take_backs_off_instead_of_looping() {
let now = Utc::now();
let mut policy = PolicyState::default();
policy.record(&success(upgraded("build-b")), now);
let unchanged = observation(Some("build-a"), true);
policy.observe(&unchanged);
let interval = chrono::Duration::from_std(WORKER_UPGRADE_RETRY_INTERVAL).unwrap();
assert!(!policy.due(&unchanged, now));
assert!(policy.due(&unchanged, now + interval));
policy.record(&success(upgraded("build-b")), now + interval);
policy.observe(&unchanged);
assert!(!policy.due(&unchanged, now + interval * 2));
assert!(policy.due(&unchanged, now + interval * 3));
}
#[test]
fn a_deferred_upgrade_waits_before_repeating_preparation() {
let now = Utc::now();
let mut policy = PolicyState::default();
policy.record(&success(WorkerUpgradeOutcome::Deferred), now);
assert!(!policy.due(&observation(Some("build-a"), true), now));
let delay = chrono::Duration::from_std(WORKER_UPGRADE_DEFERRED_INTERVAL).unwrap();
assert!(!policy.due(
&observation(Some("build-a"), true),
now + delay - chrono::Duration::milliseconds(1)
));
assert!(policy.due(&observation(Some("build-a"), true), now + delay));
}
#[test]
fn a_preempted_attempt_is_neither_a_success_nor_a_failure() {
let now = Utc::now();
let mut policy = PolicyState::default();
policy.record(
&WorkerUpgradeResult {
session_id: "session-1".into(),
outcome: Err("operation cancelled".into()),
cancelled: true,
},
now,
);
assert_eq!(policy.consecutive_failures, 0);
assert!(policy.due(&observation(Some("build-a"), true), now));
}
#[test]
fn the_shared_gate_keeps_an_upgrade_and_a_recovery_copy_apart() {
let gate = Arc::new(RecoveryGate::default());
let recovery_copy = gate.try_start("session-1").expect("the slot starts free");
assert!(gate.try_start("session-1").is_none());
drop(recovery_copy);
assert!(gate.try_start("session-1").is_some());
}
#[test]
fn observing_hands_off_without_waiting() {
let (observations, mut queued) = observation_channel();
let observer = WorkerUpgradeObserver { observations };
for _ in 0..64 {
observer.observe(observation(Some("build-a"), true));
}
let received = std::iter::from_fn(|| queued.try_recv()).count();
assert_eq!(received, 1);
}
#[test]
fn observing_a_stopped_coordinator_is_a_no_op() {
let (observations, queued) = observation_channel();
let observer = WorkerUpgradeObserver { observations };
drop(queued);
observer.observe(observation(Some("build-a"), true));
}
}