Skip to main content

dtmrs_server/
driver.rs

1//! 事务推进器:把状态机的决策落成真实的 HTTP 调用和状态更新。
2//!
3//! 这里是**唯一**会修改全局事务状态的地方,决策全部来自 `dtmrs_core::saga_advance`,
4//! 本文件只负责 I/O。这样状态迁移的正确性可以在 core 里纯单测覆盖。
5
6use crate::registry::{parse_target, BranchCtx, Registry, Target};
7use dtmrs_core::{
8    msg_advance, saga_advance, tcc_advance, xa_advance, Advance, BranchOp, BranchResult,
9    BranchStatus, GlobalStatus, SagaStep, TransType,
10};
11use dtmrs_store::{GlobalRow, Store};
12use std::sync::Arc;
13use std::time::Duration;
14use tracing::{info, warn};
15
16#[derive(Clone)]
17pub struct Driver {
18    pub store: Store,
19    pub http: reqwest::Client,
20    pub owner: String,
21    /// 租约时长(秒)。持租约的实例崩了,这么久之后别的实例接手
22    pub lease: i64,
23    /// 重试退避策略。默认 10s 起、300s 封顶,可用环境变量改
24    pub retry: dtmrs_core::RetryPolicy,
25    /// 分支调用超时(秒),只为可观测性保留一份
26    branch_timeout_secs: u64,
27    /// 并行推进的 worker 数
28    pub workers: usize,
29    /// 进程内分支注册表。嵌入式模式用,纯 HTTP 部署时是空表
30    pub registry: Arc<Registry>,
31    /// gRPC 分支调用器(带 channel 缓存)
32    #[cfg(feature = "grpc")]
33    pub grpc: crate::grpc::client::GrpcCaller,
34    /// workflow 函数注册表。跟 registry 一样,纯 HTTP 部署时是空表
35    pub workflows: Arc<crate::workflow::WorkflowRegistry>,
36}
37
38impl Driver {
39    /// 默认配置的推进器。分支超时 10s、租约 30s、退避 10s→300s。
40    /// 想按环境变量配就用 [`Driver::from_env`]
41    pub fn new(store: Store, owner: String) -> Self {
42        Self::with_config(store, owner, DriverConfig::default())
43    }
44
45    /// 按环境变量配置:
46    ///
47    /// | 变量 | 默认 | 说明 |
48    /// |---|---|---|
49    /// | `DTMRS_BRANCH_TIMEOUT` | 10 | 调一个分支最多等几秒 |
50    /// | `DTMRS_LEASE` | 30 | 租约时长(秒) |
51    /// | `DTMRS_RETRY_INTERVAL` | 10 | 首次重试间隔(秒) |
52    /// | `DTMRS_RETRY_MAX_INTERVAL` | 300 | 退避上限(秒) |
53    /// | `DTMRS_WORKERS` | 16 | 并行推进的 worker 数 |
54    ///
55    /// 存储连接池另有 `DTMRS_DB_POOL`(默认 32),跟 worker 数**要一起调** ——
56    /// 池子小于 worker 数时,多出来的 worker 只会排队等连接
57    ///
58    /// **非法值一律退回默认**,绝不因为配置写错就让推进器起不来
59    pub fn from_env(store: Store, owner: String) -> Self {
60        Self::with_config(store, owner, DriverConfig::from_env())
61    }
62
63    pub fn with_config(store: Store, owner: String, cfg: DriverConfig) -> Self {
64        Self {
65            store,
66            http: reqwest::Client::builder()
67                .timeout(Duration::from_secs(cfg.branch_timeout_secs.max(1) as u64))
68                .build()
69                .expect("build http client"),
70            owner,
71            lease: cfg.lease_secs,
72            retry: cfg.retry,
73            branch_timeout_secs: cfg.branch_timeout_secs.max(1) as u64,
74            workers: cfg.workers.max(1),
75            registry: Arc::new(Registry::new()),
76            #[cfg(feature = "grpc")]
77            grpc: crate::grpc::client::GrpcCaller::new(Duration::from_secs(
78                cfg.branch_timeout_secs.max(1) as u64,
79            )),
80            workflows: Arc::new(crate::workflow::WorkflowRegistry::new()),
81        }
82    }
83
84    /// 当前的分支调用超时(秒),启动日志里打出来方便确认配置生效
85    pub fn http_timeout_secs(&self) -> u64 {
86        self.branch_timeout_secs
87    }
88
89    /// 挂上进程内分支注册表 —— 嵌入式模式的入口
90    pub fn with_registry(mut self, r: Arc<Registry>) -> Self {
91        self.registry = r;
92        self
93    }
94
95    /// 挂上 workflow 函数注册表
96    pub fn with_workflows(mut self, w: Arc<crate::workflow::WorkflowRegistry>) -> Self {
97        self.workflows = w;
98        self
99    }
100
101    /// 常驻推进器。起 `workers` 个并行的抢占循环。
102    ///
103    /// # 为什么可以直接并行,不需要新的并发控制
104    ///
105    /// 每个 worker 都走 `lock_one_due` —— 那是一次**原子抢占**(SQL 靠带条件的
106    /// UPDATE,Redis 靠 Lua 脚本),抢到才推。所以进程内 N 个 worker
107    /// 跟部署 N 个实例是**完全相同的情形**,而后者的正确性已经有测试钉死了
108    /// (`两个实例并发不会重复推进` / `redis_多实例并发不重复推进`)。
109    ///
110    /// 换句话说:这里没有引入新的竞态,只是把「多实例才能用上的并行」
111    /// 在单进程内也用上。
112    ///
113    /// # 为什么不是把 process() 内部并行
114    ///
115    /// 一笔事务内部的分支**必须按序**(SAGA 就是顺序语义),并行只能跨事务。
116    ///
117    /// # ⚠ 为什么必须用 JoinSet 而不是 Vec<JoinHandle>
118    ///
119    /// 调用方是 `tokio::spawn(driver.run_forever(..))`,靠 **abort 这个外层
120    /// 任务**来停推进器(`Embedded` 的 Drop 就是这么干的)。
121    /// `tokio::spawn` 出来的子任务是**游离的**:外层被 abort 掉,它们照跑不误。
122    ///
123    /// 这个坑实测撞出来过:`跨进程重启_事务不丢且已完成的步骤不重做` 里
124    /// 第一个「进程」析构后,它那些僵尸 worker 还在抢同一笔事务,
125    /// 而它们的 handler 永远返回 Unknown —— 于是第二个「进程」怎么等都推不完。
126    ///
127    /// `JoinSet` 被 drop 时会把里面所有任务一并 abort,正好是我们要的语义。
128    pub async fn run_forever(self, tick: Duration) {
129        let mut set = tokio::task::JoinSet::new();
130        for _ in 0..self.workers.max(1) {
131            let d = self.clone();
132            set.spawn(async move { d.worker_loop(tick).await });
133        }
134        // 任一 worker 意外退出就整体结束 —— 静默少几个 worker 比直接挂更难查
135        set.join_next().await;
136    }
137
138    /// 单个 worker:抢一个到期事务推一下,没活就睡
139    async fn worker_loop(&self, tick: Duration) {
140        loop {
141            match self.store.lock_one_due(&self.owner, self.lease).await {
142                Ok(Some(g)) => {
143                    if let Err(e) = self.process(&g).await {
144                        warn!(gid = %g.gid, error = %e, "推进出错,等下轮重试");
145                    }
146                }
147                Ok(None) => tokio::time::sleep(tick).await,
148                Err(e) => {
149                    warn!(error = %e, "取待办失败");
150                    tokio::time::sleep(tick).await;
151                }
152            }
153        }
154    }
155
156    /// 推进一个全局事务,直到它落终态或需要等待。
157    ///
158    /// 可以被重复调用(崩溃恢复就靠这个)—— 分支的幂等由客户端屏障保证。
159    pub async fn process(&self, g: &GlobalRow) -> anyhow::Result<()> {
160        match g.trans_type {
161            TransType::Saga => self.process_saga(g).await,
162            TransType::Tcc => self.process_tcc(g).await,
163            TransType::Msg => self.process_msg(g).await,
164            TransType::Xa => self.process_xa(g).await,
165            TransType::Workflow => self.process_workflow(g).await,
166        }
167    }
168
169    // ---------------- workflow ----------------
170
171    /// 跑用户的 workflow 函数,失败则逆序补偿它**已经登记过**的分支。
172    ///
173    /// 跟另外四种模式的差别见 [`dtmrs_core::workflow_advance`]:正向走向由
174    /// 用户函数决定,状态机只管「什么时候跑、什么时候补、按什么顺序补」。
175    async fn process_workflow(&self, g: &GlobalRow) -> anyhow::Result<()> {
176        let (name, input) = crate::workflow::decode_payload(&g.payload);
177        let mut status = g.status;
178
179        loop {
180            let rows = self.store.list_branches(&g.gid).await?;
181            let compensates = compensate_states(&rows);
182
183            match dtmrs_core::workflow_advance(status, &compensates) {
184                Advance::Finish(s) => {
185                    info!(gid = %g.gid, status = s.as_str(), "workflow 事务终结");
186                    self.store.set_global_status(&g.gid, s, "").await?;
187                    return Ok(());
188                }
189                Advance::Wait => return Ok(()),
190
191                Advance::RunWorkflow => {
192                    let Some(f) = self.workflows.get(&name) else {
193                        // 漏注册(新版本删了 workflow / 换了名字)。
194                        // **按结果未知处理** —— 这是部署问题,改回来重试就好,
195                        // 判失败会白白触发回滚
196                        warn!(gid = %g.gid, workflow = %name,
197                              "workflow 未注册,按结果未知处理(会重试,不回滚)");
198                        self.retry_later(g).await?;
199                        return Ok(());
200                    };
201                    let ctx =
202                        crate::workflow::WorkflowCtx::new(&g.gid, &input, self.store.clone(), rows);
203                    match f(ctx).await {
204                        Ok(()) => {
205                            info!(gid = %g.gid, workflow = %name, "workflow 跑完");
206                            self.store
207                                .set_global_status(&g.gid, GlobalStatus::Succeed, "")
208                                .await?;
209                            return Ok(());
210                        }
211                        Err(crate::workflow::WorkflowError::Rollback(reason)) => {
212                            info!(gid = %g.gid, workflow = %name, %reason, "workflow 要求回滚");
213                            self.store
214                                .set_global_status(&g.gid, GlobalStatus::Aborting, &reason)
215                                .await?;
216                            status = GlobalStatus::Aborting;
217                            continue;
218                        }
219                        Err(crate::workflow::WorkflowError::Diverged {
220                            branch_id: bid,
221                            recorded,
222                            got,
223                        }) => {
224                            // **绝不能继续**:按位置记忆化会张冠李戴,回滚也会补错对象。
225                            // 也不回滚 —— 我们已经不知道真实进度了,硬回滚更危险。
226                            // 停在这里等人:改回确定性的代码,重启就能接着推。
227                            warn!(gid = %g.gid, workflow = %name, branch = %bid,
228                                  %recorded, %got,
229                                  "workflow 重放走岔了,已停止推进,需要人工介入");
230                            self.retry_later(g).await?;
231                            return Ok(());
232                        }
233                        Err(e) => {
234                            // Retry / Internal:只重试,绝不回滚
235                            warn!(gid = %g.gid, workflow = %name, error = %e, "workflow 需要重试");
236                            self.retry_later(g).await?;
237                            return Ok(());
238                        }
239                    }
240                }
241
242                Advance::Call { index, op } => {
243                    let bid = branch_id(index);
244                    let Some(url) = url_of(&rows, &bid, op) else {
245                        // 补偿行不见了,不该发生
246                        warn!(gid = %g.gid, branch = %bid, "workflow 补偿地址缺失");
247                        self.retry_later(g).await?;
248                        return Ok(());
249                    };
250                    let bp = payload_of(&rows, &bid, op);
251                    match self.call_branch(g, &bid, op, &url, &bp).await {
252                        BranchResult::Success => {
253                            self.store
254                                .set_branch_status(&g.gid, &bid, op, BranchStatus::Succeed)
255                                .await?;
256                        }
257                        // 补偿失败只能不停重试 —— 漏掉就是真的漏了副作用
258                        _ => {
259                            warn!(gid = %g.gid, branch = %bid, "workflow 补偿未成功,会重试");
260                            self.retry_later(g).await?;
261                            return Ok(());
262                        }
263                    }
264                }
265            }
266        }
267    }
268
269    // ---------------- SAGA ----------------
270
271    async fn process_saga(&self, g: &GlobalRow) -> anyhow::Result<()> {
272        let steps: Vec<SagaStep> = serde_json::from_str(&g.payload).unwrap_or_default();
273        if steps.is_empty() {
274            self.store
275                .set_global_status(&g.gid, GlobalStatus::Succeed, "")
276                .await?;
277            return Ok(());
278        }
279        let mut status = g.status;
280
281        loop {
282            let (actions, compensates) = self.branch_states(&g.gid, steps.len()).await?;
283            match saga_advance(status, &actions, &compensates) {
284                Advance::Finish(s) => {
285                    if s == GlobalStatus::Aborting {
286                        // 防御性分支:状态机发现有 failed 分支但全局还没转 aborting
287                        status = s;
288                        self.store
289                            .set_global_status(&g.gid, s, "分支已判失败")
290                            .await?;
291                        continue;
292                    }
293                    info!(gid = %g.gid, status = s.as_str(), "事务终结");
294                    self.store.set_global_status(&g.gid, s, "").await?;
295                    return Ok(());
296                }
297                Advance::Wait => return Ok(()),
298                // 只有 workflow 模式会出现,别的模式走到这里说明状态机接错了。
299                // **不 panic** —— 推进器是常驻的,崩了整个 TC 就停了
300                Advance::RunWorkflow => {
301                    warn!(gid = %g.gid, "非 workflow 事务收到 RunWorkflow 决策,跳过");
302                    return Ok(());
303                }
304                Advance::Call { index, op } => {
305                    let branch_id = branch_id(index);
306                    let url = match op {
307                        BranchOp::Action => &steps[index].action,
308                        _ => &steps[index].compensate,
309                    };
310                    match self
311                        .call_branch(g, &branch_id, op, url, &steps[index].payload)
312                        .await
313                    {
314                        BranchResult::Success => {
315                            self.store
316                                .set_branch_status(&g.gid, &branch_id, op, BranchStatus::Succeed)
317                                .await?;
318                        }
319                        BranchResult::Failure => {
320                            self.store
321                                .set_branch_status(&g.gid, &branch_id, op, BranchStatus::Failed)
322                                .await?;
323                            if op == BranchOp::Action {
324                                // 只有业务**明确**说失败才回滚
325                                info!(gid = %g.gid, branch = %branch_id, "分支要求回滚");
326                                status = GlobalStatus::Aborting;
327                                self.store
328                                    .set_global_status(
329                                        &g.gid,
330                                        GlobalStatus::Aborting,
331                                        &format!("分支 {branch_id} 返回 FAILURE"),
332                                    )
333                                    .await?;
334                            } else {
335                                // 补偿都失败了,只能不停重试 —— 这时候需要人介入
336                                warn!(gid = %g.gid, branch = %branch_id, "补偿失败,需要人工介入");
337                                self.retry_later(g).await?;
338                                return Ok(());
339                            }
340                        }
341                        BranchResult::Ongoing | BranchResult::Unknown => {
342                            // **绝不能当成失败**:对方可能已经成功了。退避重试。
343                            self.retry_later(g).await?;
344                            return Ok(());
345                        }
346                    }
347                }
348            }
349        }
350    }
351
352    // ---------------- TCC ----------------
353
354    /// TCC 的 try 阶段是**客户端驱动**的(客户端先 registerBranch 再调 try),
355    /// TC 只负责 confirm / cancel。所以分支的 URL 来自 `trans_branch_op` 表,
356    /// 不是全局 payload。
357    async fn process_tcc(&self, g: &GlobalRow) -> anyhow::Result<()> {
358        self.drive_two_phase(g, BranchOp::Confirm, BranchOp::Cancel, "TCC")
359            .await
360    }
361
362    // ---------------- XA ----------------
363
364    /// XA 的一阶段(业务 SQL + `PREPARE TRANSACTION`)由**客户端**做,
365    /// TC 只负责统一决定 `COMMIT PREPARED` 还是 `ROLLBACK PREPARED`。
366    ///
367    /// 形状跟 TCC 一样,只是 op 换成 commit/rollback。语义上那条铁律也一样:
368    /// **commit 失败绝不能转 rollback** —— 别的分支可能已经提交了。
369    ///
370    /// XA 独有的严重性:没解决的 prepared 事务会**永久持锁**,在 Postgres 里
371    /// 还阻塞 VACUUM。所以这里的重试比 SAGA 的补偿重试要紧得多。
372    async fn process_xa(&self, g: &GlobalRow) -> anyhow::Result<()> {
373        self.drive_two_phase(g, BranchOp::Commit, BranchOp::Rollback, "XA")
374            .await
375    }
376
377    /// TCC 和 XA 共用的二阶段推进:正向 op 全做完就成功,反向 op 全做完就失败,
378    /// **任一方向的失败都只重试,绝不改变方向**。
379    async fn drive_two_phase(
380        &self,
381        g: &GlobalRow,
382        fwd: BranchOp,
383        bwd: BranchOp,
384        label: &str,
385    ) -> anyhow::Result<()> {
386        let rows = self.store.list_branches(&g.gid).await?;
387        let n = rows
388            .iter()
389            .filter_map(|r| index_of(&r.branch_id))
390            .max()
391            .map(|m| m + 1)
392            .unwrap_or(0);
393        if n == 0 {
394            // 一个分支都没登记就 submit/abort 了 —— 空事务,直接落终态
395            let s = if g.status == GlobalStatus::Aborting {
396                GlobalStatus::Failed
397            } else {
398                GlobalStatus::Succeed
399            };
400            self.store.set_global_status(&g.gid, s, "").await?;
401            return Ok(());
402        }
403
404        let status = g.status;
405        loop {
406            let rows = self.store.list_branches(&g.gid).await?;
407            let (f, b) = split_by_op(&rows, n, fwd, bwd);
408            let adv = if fwd == BranchOp::Commit {
409                xa_advance(status, &f, &b)
410            } else {
411                tcc_advance(status, &f, &b)
412            };
413            match adv {
414                Advance::Finish(s) => {
415                    info!(gid = %g.gid, status = s.as_str(), mode = label, "事务终结");
416                    self.store.set_global_status(&g.gid, s, "").await?;
417                    return Ok(());
418                }
419                Advance::Wait => return Ok(()),
420                // 只有 workflow 模式会出现,别的模式走到这里说明状态机接错了。
421                // **不 panic** —— 推进器是常驻的,崩了整个 TC 就停了
422                Advance::RunWorkflow => {
423                    warn!(gid = %g.gid, "非 workflow 事务收到 RunWorkflow 决策,跳过");
424                    return Ok(());
425                }
426                Advance::Call { index, op } => {
427                    let bid = branch_id(index);
428                    let Some(url) = url_of(&rows, &bid, op) else {
429                        warn!(gid = %g.gid, branch = %bid, op = op.as_str(), mode = label,
430                              "分支没登记这个操作的 URL,无法调用");
431                        self.retry_later(g).await?;
432                        return Ok(());
433                    };
434                    let bp = payload_of(&rows, &bid, op);
435                    match self.call_branch(g, &bid, op, &url, &bp).await {
436                        BranchResult::Success => {
437                            self.store
438                                .set_branch_status(&g.gid, &bid, op, BranchStatus::Succeed)
439                                .await?;
440                        }
441                        // 二阶段失败**绝不改变全局方向**:一阶段已经成功、
442                        // 方向已经定了,反向操作会造成一半提交一半回滚。
443                        // 唯一正确处理是无限重试 + 报警。
444                        BranchResult::Failure => {
445                            self.store
446                                .set_branch_status(&g.gid, &bid, op, BranchStatus::Failed)
447                                .await?;
448                            warn!(gid = %g.gid, branch = %bid, op = op.as_str(), mode = label,
449                                  "二阶段失败,会持续重试,需要人工介入");
450                            self.retry_later(g).await?;
451                            return Ok(());
452                        }
453                        BranchResult::Ongoing | BranchResult::Unknown => {
454                            self.retry_later(g).await?;
455                            return Ok(());
456                        }
457                    }
458                }
459            }
460        }
461    }
462
463    // ---------------- 二阶段消息 ----------------
464
465    /// 流程:`prepare` 落库 → 业务提交本地事务 → `submit`。
466    ///
467    /// 如果进程在这两步之间崩了,事务会一直停在 prepared。这时 TC 靠回查
468    /// `query_prepared` 问业务方"你那个本地事务到底提交了没有",据此决定
469    /// 是往前推还是整单作废。**这是取代 MQ 事务消息的关键一环。**
470    async fn process_msg(&self, g: &GlobalRow) -> anyhow::Result<()> {
471        let mut status = g.status;
472
473        if status == GlobalStatus::Prepared {
474            if g.query_prepared.is_empty() {
475                // 没给回查地址就没法自动决断。不能瞎猜 —— 猜错要么丢单要么重复扣款
476                warn!(gid = %g.gid, "msg 事务没提供 query_prepared,无法回查,等人处理");
477                self.retry_later(g).await?;
478                return Ok(());
479            }
480            // 借用分支调用的通道做回查,branch_id 用 "00" 跟真实分支区分开
481            match self
482                .call_branch(g, "00", BranchOp::Action, &g.query_prepared, "")
483                .await
484            {
485                BranchResult::Success => {
486                    info!(gid = %g.gid, "回查:本地事务已提交 → 继续推进");
487                    self.store
488                        .set_global_status(&g.gid, GlobalStatus::Submitted, "")
489                        .await?;
490                    status = GlobalStatus::Submitted;
491                }
492                BranchResult::Failure => {
493                    // 业务方明确说"这单没提交" → 整单作废。msg 没有补偿分支,
494                    // 但也不需要:正向分支压根还没跑过
495                    info!(gid = %g.gid, "回查:本地事务未提交 → 整单作废");
496                    self.store
497                        .set_global_status(
498                            &g.gid,
499                            GlobalStatus::Failed,
500                            "回查得到 FAILURE:本地事务未提交",
501                        )
502                        .await?;
503                    return Ok(());
504                }
505                BranchResult::Ongoing | BranchResult::Unknown => {
506                    // 回查本身失败了,不能当作"没提交"。退避重试。
507                    self.retry_later(g).await?;
508                    return Ok(());
509                }
510            }
511        }
512
513        let steps: Vec<SagaStep> = serde_json::from_str(&g.payload).unwrap_or_default();
514        if steps.is_empty() {
515            self.store
516                .set_global_status(&g.gid, GlobalStatus::Succeed, "")
517                .await?;
518            return Ok(());
519        }
520        loop {
521            let (actions, _) = self.branch_states(&g.gid, steps.len()).await?;
522            match msg_advance(status, &actions) {
523                Advance::Finish(s) => {
524                    info!(gid = %g.gid, status = s.as_str(), "消息事务终结");
525                    self.store.set_global_status(&g.gid, s, "").await?;
526                    return Ok(());
527                }
528                Advance::Wait => return Ok(()),
529                // 只有 workflow 模式会出现,别的模式走到这里说明状态机接错了。
530                // **不 panic** —— 推进器是常驻的,崩了整个 TC 就停了
531                Advance::RunWorkflow => {
532                    warn!(gid = %g.gid, "非 workflow 事务收到 RunWorkflow 决策,跳过");
533                    return Ok(());
534                }
535                Advance::Call { index, op } => {
536                    let bid = branch_id(index);
537                    match self
538                        .call_branch(g, &bid, op, &steps[index].action, &steps[index].payload)
539                        .await
540                    {
541                        BranchResult::Success => {
542                            self.store
543                                .set_branch_status(&g.gid, &bid, op, BranchStatus::Succeed)
544                                .await?;
545                        }
546                        // msg 保证"最终一定送达",没有补偿一说。失败只能重试。
547                        BranchResult::Failure | BranchResult::Ongoing | BranchResult::Unknown => {
548                            self.retry_later(g).await?;
549                            return Ok(());
550                        }
551                    }
552                }
553            }
554        }
555    }
556
557    async fn retry_later(&self, g: &GlobalRow) -> anyhow::Result<()> {
558        let iv = dtmrs_core::next_interval_with(g.next_cron_interval, self.retry);
559        self.store.schedule_retry(&g.gid, iv).await?;
560        Ok(())
561    }
562
563    /// 取每一步的 action / compensate 分支当前状态,按步序对齐
564    async fn branch_states(
565        &self,
566        gid: &str,
567        n: usize,
568    ) -> anyhow::Result<(Vec<BranchStatus>, Vec<BranchStatus>)> {
569        let rows = self.store.list_branches(gid).await?;
570        let mut actions = vec![BranchStatus::Prepared; n];
571        let mut compensates = vec![BranchStatus::Prepared; n];
572        for r in rows {
573            let Some(i) = index_of(&r.branch_id) else {
574                continue;
575            };
576            if i >= n {
577                continue;
578            }
579            match r.op {
580                BranchOp::Action | BranchOp::Try => actions[i] = r.status,
581                BranchOp::Compensate | BranchOp::Cancel | BranchOp::Rollback => {
582                    compensates[i] = r.status
583                }
584                _ => {}
585            }
586        }
587        Ok((actions, compensates))
588    }
589
590    /// 调一个分支。`local://名字` 走进程内函数,`grpc://` 走 gRPC,其它走 HTTP。
591    async fn call_branch(
592        &self,
593        g: &GlobalRow,
594        branch_id: &str,
595        op: BranchOp,
596        url: &str,
597        payload: &str,
598    ) -> BranchResult {
599        match parse_target(url) {
600            Target::Local(name) => self.call_local(g, branch_id, op, &name).await,
601            Target::Http(u) => self.call_http(g, branch_id, op, &u, payload).await,
602            #[cfg(feature = "grpc")]
603            Target::Grpc(t) => {
604                self.grpc
605                    .call(
606                        &t,
607                        &g.gid,
608                        &g.trans_type.to_string(),
609                        branch_id,
610                        op.as_str(),
611                    )
612                    .await
613            }
614            // 编译时关掉了 grpc feature,却遇到 grpc:// 分支。
615            // 按「结果未知」处理(重试,不回滚)—— 这是构建配置问题,不是业务失败
616            #[cfg(not(feature = "grpc"))]
617            Target::Grpc(t) => {
618                warn!(gid = %g.gid, branch = %branch_id, endpoint = %t.endpoint,
619                      "遇到 grpc:// 分支但本次构建关掉了 grpc feature,按结果未知处理");
620                BranchResult::Unknown
621            }
622        }
623    }
624
625    /// 进程内调用:没有网络、没有序列化,一次函数调用。
626    async fn call_local(
627        &self,
628        g: &GlobalRow,
629        branch_id: &str,
630        op: BranchOp,
631        name: &str,
632    ) -> BranchResult {
633        let Some(h) = self.registry.get(name) else {
634            // 漏注册(比如新版本删了 handler)。**必须当 Unknown 而不是 Failure**:
635            // 判失败会触发回滚,而这其实是部署问题,改回来重试才对。
636            warn!(gid = %g.gid, branch = %branch_id, handler = name,
637                  "本地分支未注册,按结果未知处理(会重试,不回滚)");
638            return BranchResult::Unknown;
639        };
640        let ctx = BranchCtx {
641            gid: g.gid.clone(),
642            branch_id: branch_id.to_string(),
643            op,
644            trans_type: g.trans_type.to_string(),
645        };
646        let r = h(ctx).await;
647        info!(gid = %g.gid, branch = %branch_id, op = op.as_str(),
648              handler = name, result = ?r, "本地分支返回");
649        r
650    }
651
652    /// 远端调用。查询参数跟 DTM 保持一致,客户端屏障库可以直接复用。
653    async fn call_http(
654        &self,
655        g: &GlobalRow,
656        branch_id: &str,
657        op: BranchOp,
658        url: &str,
659        payload: &str,
660    ) -> BranchResult {
661        let req = self
662            .http
663            .post(url)
664            .query(&[
665                ("gid", g.gid.as_str()),
666                ("trans_type", &g.trans_type.to_string()),
667                ("branch_id", branch_id),
668                ("op", op.as_str()),
669            ])
670            .header("content-type", "application/json")
671            .body(branch_payload(payload));
672        match req.send().await {
673            Ok(resp) => {
674                let code = resp.status().as_u16();
675                let body = resp.text().await.unwrap_or_default();
676                let r = BranchResult::from_http(code, &body);
677                info!(gid = %g.gid, branch = %branch_id, op = op.as_str(), code, result = ?r, "分支返回");
678                r
679            }
680            Err(e) => {
681                // 超时/连不上 —— 结果未知,必须重试而不是回滚
682                warn!(gid = %g.gid, branch = %branch_id, error = %e, "分支不可达,结果未知");
683                BranchResult::Unknown
684            }
685        }
686    }
687}
688
689/// 分支号:第 0 步是 "01",跟 DTM 一致
690pub fn branch_id(index: usize) -> String {
691    format!("{:02}", index + 1)
692}
693
694fn index_of(branch_id: &str) -> Option<usize> {
695    branch_id
696        .parse::<usize>()
697        .ok()
698        .and_then(|v| v.checked_sub(1))
699}
700
701/// 按 op 把分支行拆成两列(正向 / 反向),按步序对齐
702fn split_by_op(
703    rows: &[dtmrs_store::BranchRow],
704    n: usize,
705    fwd: BranchOp,
706    bwd: BranchOp,
707) -> (Vec<BranchStatus>, Vec<BranchStatus>) {
708    let mut a = vec![BranchStatus::Prepared; n];
709    let mut b = vec![BranchStatus::Prepared; n];
710    for r in rows {
711        let Some(i) = index_of(&r.branch_id) else {
712            continue;
713        };
714        if i >= n {
715            continue;
716        }
717        if r.op == fwd {
718            a[i] = r.status;
719        } else if r.op == bwd {
720            b[i] = r.status;
721        }
722    }
723    (a, b)
724}
725
726/// 按分支序取出各 compensate 行的状态,用于 workflow 的逆序补偿。
727///
728/// 跟 `split_by_op` 的区别:workflow 的分支数是**运行时长出来的**,
729/// 提交时并不知道有几个,所以长度得从已登记的行里推出来。
730fn compensate_states(rows: &[dtmrs_store::BranchRow]) -> Vec<BranchStatus> {
731    let n = rows
732        .iter()
733        .filter(|r| r.op == BranchOp::Compensate)
734        .filter_map(|r| index_of(&r.branch_id))
735        .max()
736        .map(|m| m + 1)
737        .unwrap_or(0);
738    // 没登记补偿的分支(比如纯查询步骤)留成 Succeed,逆序扫描时会跳过它 ——
739    // 本来就没有副作用要收拾
740    let mut v = vec![BranchStatus::Succeed; n];
741    for r in rows.iter().filter(|r| r.op == BranchOp::Compensate) {
742        if let Some(i) = index_of(&r.branch_id) {
743            if i < n {
744                v[i] = r.status;
745            }
746        }
747    }
748    v
749}
750
751/// 取某个分支行上存的 payload(TCC / XA / workflow 的分支是动态登记的,
752/// 业务数据跟着行走,不在全局 payload 里)
753fn payload_of(rows: &[dtmrs_store::BranchRow], branch_id: &str, op: BranchOp) -> String {
754    rows.iter()
755        .find(|r| r.branch_id == branch_id && r.op == op)
756        .map(|r| r.payload.clone())
757        .unwrap_or_default()
758}
759
760fn url_of(rows: &[dtmrs_store::BranchRow], branch_id: &str, op: BranchOp) -> Option<String> {
761    rows.iter()
762        .find(|r| r.branch_id == branch_id && r.op == op)
763        .map(|r| r.url.clone())
764}
765
766/// 这一步要发给分支的请求体。
767///
768/// 每步各自独立 —— 扣款那步要金额、发货那步要地址,本来就不该收到同一份数据。
769/// 步骤没写 payload 就发 `{}`(很多分支只靠 gid/branch_id/op 做幂等,不需要请求体)。
770fn branch_payload(step_payload: &str) -> String {
771    if step_payload.trim().is_empty() {
772        "{}".to_string()
773    } else {
774        step_payload.to_string()
775    }
776}
777
778/// 推进器的可配置项
779#[derive(Debug, Clone, Copy)]
780pub struct DriverConfig {
781    /// 调一个分支最多等几秒
782    pub branch_timeout_secs: i64,
783    /// 租约时长(秒)
784    pub lease_secs: i64,
785    pub retry: dtmrs_core::RetryPolicy,
786    /// 并行推进的 worker 数。**一笔事务内部仍然按序**,并行只发生在事务之间
787    pub workers: usize,
788}
789
790impl Default for DriverConfig {
791    fn default() -> Self {
792        // 跟 0.2 的写死值一致,不配置的人行为不变
793        Self {
794            branch_timeout_secs: 10,
795            lease_secs: 30,
796            retry: dtmrs_core::RetryPolicy::default(),
797            // 推一笔事务的时间几乎全花在等 I/O(存储往返 + 分支调用)上,
798            // 所以 worker 数可以明显高于核数。
799            //
800            // 16 基本就是这台机器上的天花板了:实测(20 核,空库,
801            //   三次取中位数,bench/)
802            //   Postgres  1→267 笔/秒  16→3424  64→3184(一样,没收益)
803            //   Redis     1→965        16→4695  32→4974
804            //   sqlite    1→435        16→682 —— 写是全库串行的,并行收益有限
805            //   MySQL     1→19         16→129   32→202
806            // 再往上加 worker 不涨,连接池也不是瓶颈。要继续提升得**减少
807            // 每笔事务的存储往返次数**,不是加并发。
808            // 另外 worker 开多少就要占多少条数据库连接,而 TC 常常和业务
809            // 共用一个库,所以默认值往保守取
810            workers: 16,
811        }
812    }
813}
814
815impl DriverConfig {
816    pub fn from_env() -> Self {
817        let d = Self::default();
818        let get = |k: &str, fallback: i64| {
819            std::env::var(k)
820                .ok()
821                .and_then(|v| v.parse::<i64>().ok())
822                .filter(|v| *v > 0)
823                .unwrap_or(fallback)
824        };
825        Self {
826            branch_timeout_secs: get("DTMRS_BRANCH_TIMEOUT", d.branch_timeout_secs),
827            lease_secs: get("DTMRS_LEASE", d.lease_secs),
828            retry: dtmrs_core::RetryPolicy::from_env(),
829            workers: get("DTMRS_WORKERS", d.workers as i64) as usize,
830        }
831    }
832}
833
834#[cfg(test)]
835mod tests {
836    use super::*;
837
838    #[test]
839    fn 分支号与下标互转() {
840        assert_eq!(branch_id(0), "01");
841        assert_eq!(branch_id(9), "10");
842        assert_eq!(index_of("01"), Some(0));
843        assert_eq!(index_of("10"), Some(9));
844        assert_eq!(index_of("00"), None);
845        assert_eq!(index_of("xx"), None);
846    }
847}