Skip to main content

synth_backend/
arm_encoder.rs

1//! ARM Code Encoder - Converts ARM instructions to binary machine code
2//!
3//! Generates ARM32/Thumb-2 machine code from ARM instruction structures
4
5use synth_core::Result;
6use synth_core::target::FPUPrecision;
7use synth_synthesis::contracts::encoding as encoding_contracts;
8use synth_synthesis::{ArmOp, MemAddr, MveSize, Operand2, QReg, Reg, VfpReg};
9
10/// ARM instruction encoding
11pub struct ArmEncoder {
12    /// Use Thumb mode (vs ARM mode)
13    thumb_mode: bool,
14    /// FPU capability for VFP instruction encoding
15    #[allow(dead_code)]
16    fpu: Option<FPUPrecision>,
17}
18
19impl ArmEncoder {
20    /// Create a new ARM encoder in ARM32 mode
21    pub fn new_arm32() -> Self {
22        Self {
23            thumb_mode: false,
24            fpu: None,
25        }
26    }
27
28    /// Create a new ARM encoder in Thumb-2 mode
29    pub fn new_thumb2() -> Self {
30        Self {
31            thumb_mode: true,
32            fpu: None,
33        }
34    }
35
36    /// Create a new Thumb-2 encoder with FPU capability
37    pub fn new_thumb2_with_fpu(fpu: Option<FPUPrecision>) -> Self {
38        Self {
39            thumb_mode: true,
40            fpu,
41        }
42    }
43
44    /// Encode a single ARM instruction to bytes
45    pub fn encode(&self, op: &ArmOp) -> Result<Vec<u8>> {
46        if self.thumb_mode {
47            self.encode_thumb(op)
48        } else {
49            self.encode_arm(op)
50        }
51    }
52
53    /// Encode an ARM instruction in ARM32 mode (32-bit instructions)
54    /// #206: encode an ARM32 (A32) load/store whose address uses a register
55    /// offset (`[rn, rm{, #off}]`). Returns `None` for ops with no register
56    /// offset (the caller falls through to the immediate-form arms). Computes
57    /// `ip = base + rm` then re-encodes the op against `[ip, #off]`, which works
58    /// uniformly for word/byte/halfword/signed forms. IP (R12) is the scratch
59    /// register the selector already treats as clobberable across memory ops.
60    fn encode_arm_reg_offset_mem(&self, op: &ArmOp) -> Result<Option<Vec<u8>>> {
61        use synth_synthesis::Reg;
62        let addr = match op {
63            ArmOp::Ldr { addr, .. }
64            | ArmOp::Str { addr, .. }
65            | ArmOp::Ldrb { addr, .. }
66            | ArmOp::Strb { addr, .. }
67            | ArmOp::Ldrh { addr, .. }
68            | ArmOp::Strh { addr, .. }
69            | ArmOp::Ldrsb { addr, .. }
70            | ArmOp::Ldrsh { addr, .. } => addr,
71            _ => return Ok(None),
72        };
73        let Some(rm) = addr.offset_reg else {
74            return Ok(None);
75        };
76        let ip = Reg::R12;
77        // ADD ip, base, rm  (cond=AL, opcode=ADD, S=0, register operand2)
78        let add: u32 = 0xE0800000
79            | (reg_to_bits(&addr.base) << 16)
80            | (reg_to_bits(&ip) << 12)
81            | reg_to_bits(&rm);
82        let mut bytes = add.to_le_bytes().to_vec();
83        // Re-encode the op against [ip, #off] (immediate form → no offset_reg,
84        // so this recursion hits the immediate arms, not this helper again).
85        let imm_addr = MemAddr::imm(ip, addr.offset);
86        let imm_op = match op {
87            ArmOp::Ldr { rd, .. } => ArmOp::Ldr {
88                rd: *rd,
89                addr: imm_addr,
90            },
91            ArmOp::Str { rd, .. } => ArmOp::Str {
92                rd: *rd,
93                addr: imm_addr,
94            },
95            ArmOp::Ldrb { rd, .. } => ArmOp::Ldrb {
96                rd: *rd,
97                addr: imm_addr,
98            },
99            ArmOp::Strb { rd, .. } => ArmOp::Strb {
100                rd: *rd,
101                addr: imm_addr,
102            },
103            ArmOp::Ldrh { rd, .. } => ArmOp::Ldrh {
104                rd: *rd,
105                addr: imm_addr,
106            },
107            ArmOp::Strh { rd, .. } => ArmOp::Strh {
108                rd: *rd,
109                addr: imm_addr,
110            },
111            ArmOp::Ldrsb { rd, .. } => ArmOp::Ldrsb {
112                rd: *rd,
113                addr: imm_addr,
114            },
115            ArmOp::Ldrsh { rd, .. } => ArmOp::Ldrsh {
116                rd: *rd,
117                addr: imm_addr,
118            },
119            _ => unreachable!(),
120        };
121        bytes.extend(self.encode_arm(&imm_op)?);
122        Ok(Some(bytes))
123    }
124
125    /// #594: A32 expansion of `ArmOp::CallIndirect` — mirror of the Thumb-2
126    /// arm (same contract: R11 holds the function-pointer table base, entry
127    /// `i` is a 4-byte code address, R12 is the encoder-scratch register):
128    ///
129    /// ```text
130    /// MOVW r12, #size        ; #642: table size (compile-time immediate)
131    /// [MOVT r12, #size>>16]  ; only when size exceeds 16 bits
132    /// CMP  idx, r12          ; bounds guard: index >= size must TRAP
133    /// BLO  +1 insn           ; skip the trap when in bounds
134    /// UDF                    ; WASM Core §4.4.8 out-of-bounds trap
135    /// MOV r12, idx, LSL #2   ; table byte offset
136    /// LDR r12, [r11, r12]    ; load function pointer
137    /// BLX r12                ; indirect call
138    /// ```
139    ///
140    /// #650, `table_byte_offset != 0` (a non-zero table of the contiguous
141    /// R11 region): the pointer load becomes
142    /// `ADD r12, r11, r12; LDR r12, [r12, #offset]` — offset 0 keeps the
143    /// single-load form (single-table modules byte-identical by
144    /// construction).
145    ///
146    /// #664, `null_check` (the table has null slots, linked as ZERO words
147    /// per the layout contract): `CMP r12, #0; BNE +1; UDF` between the
148    /// pointer load and the `BLX` — a call reaching an uninitialized slot
149    /// traps (§4.4.8). `false` keeps the expansion byte-identical.
150    ///
151    /// #676, `type_check` (heterogeneous table): the §4.4.8 type check is
152    /// discharged at RUNTIME against the type-id sidecar — after the bounds
153    /// guard, `MOV r12, idx, LSL #2; ADD r12, r11, r12;
154    /// LDR r12, [r12, #type_off]; CMP r12, #expected_id; BEQ +1; UDF`
155    /// (mirror of the Thumb-2 arm; the dispatch tail recomputes `idx*4`).
156    /// Null slots carry the reserved class id 0, subsuming the #664 null
157    /// trap. `None` (every homogeneous table — the verdict discharged at
158    /// COMPILE time by the closed-world verification, see the #642 selector
159    /// guard) emits nothing and keeps the expansion byte-identical.
160    fn encode_arm_call_indirect(
161        table_index_reg: &Reg,
162        table_size: u32,
163        table_byte_offset: u32,
164        null_check: bool,
165        type_check: Option<(u32, u32)>,
166    ) -> Vec<u8> {
167        let idx = reg_to_bits(table_index_reg);
168        let mut bytes = Vec::with_capacity(32);
169        // MOVW r12, #(size & 0xFFFF) — cond=E 0011 0000 imm4 Rd imm12.
170        let size_lo = table_size & 0xFFFF;
171        let movw: u32 = 0xE300_0000 | ((size_lo >> 12) << 16) | (12 << 12) | (size_lo & 0xFFF);
172        bytes.extend_from_slice(&movw.to_le_bytes());
173        // MOVT r12, #(size >> 16) — only for a table size above 16 bits.
174        let size_hi = table_size >> 16;
175        if size_hi != 0 {
176            let movt: u32 = 0xE340_0000 | ((size_hi >> 12) << 16) | (12 << 12) | (size_hi & 0xFFF);
177            bytes.extend_from_slice(&movt.to_le_bytes());
178        }
179        // CMP idx, r12 — cond=E, opcode=1010, S=1, Rn=idx, Rm=r12.
180        let cmp: u32 = 0xE150_000C | (idx << 16);
181        bytes.extend_from_slice(&cmp.to_le_bytes());
182        // BLO +1 insn (skip the UDF when index < size) — cond=LO(0011),
183        // imm24=0: target = branch + 8.
184        bytes.extend_from_slice(&0x3A00_0000u32.to_le_bytes());
185        // UDF — permanently undefined (same trap idiom as the A32 div-by-zero
186        // guards): call_indirect out-of-bounds trap.
187        bytes.extend_from_slice(&0xE7F0_00F0u32.to_le_bytes());
188        // #676: runtime type check for a heterogeneous table — load the
189        // indexed slot's structural class id from the type-id sidecar and
190        // trap on mismatch (§4.4.8). Mirror of the Thumb-2 arm; `None`
191        // emits nothing (homogeneous tables byte-identical by construction).
192        if let Some((expected_id, type_off)) = type_check {
193            debug_assert!(expected_id <= 255, "selector enforces the CMP imm8 range");
194            debug_assert!(type_off <= 4095, "selector enforces the LDR imm12 range");
195            // MOV r12, idx, LSL #2 (same as the dispatch tail's scale).
196            bytes.extend_from_slice(&(0xE1A0C000u32 | (2 << 7) | idx).to_le_bytes());
197            // ADD r12, r11, r12 — data-processing ADD (register).
198            bytes.extend_from_slice(&0xE08BC00Cu32.to_le_bytes());
199            // LDR r12, [r12, #type_off] — immediate offset, P=1 U=1 L=1.
200            bytes.extend_from_slice(&(0xE59CC000u32 | (type_off & 0xFFF)).to_le_bytes());
201            // CMP r12, #expected_id — data-processing CMP (immediate).
202            bytes.extend_from_slice(&(0xE35C_0000u32 | (expected_id & 0xFF)).to_le_bytes());
203            // BEQ +1 insn (skip the UDF when the class id matches) —
204            // cond=EQ(0000), imm24=0: target = branch + 8.
205            bytes.extend_from_slice(&0x0A00_0000u32.to_le_bytes());
206            // UDF — the §4.4.8 type-mismatch trap.
207            bytes.extend_from_slice(&0xE7F0_00F0u32.to_le_bytes());
208        }
209        // MOV r12, idx, LSL #2 — data-processing MOV, register op2 with
210        // imm5=2/LSL: cond=E, opcode=1101, S=0, Rd=r12.
211        let mov: u32 = 0xE1A0C000 | (2 << 7) | idx;
212        bytes.extend_from_slice(&mov.to_le_bytes());
213        if table_byte_offset == 0 {
214            // Table 0 (base = R11 itself): the pre-#650 single-load form.
215            // LDR r12, [r11, r12] — register offset, P=1 U=1 B=0 W=0 L=1.
216            let ldr: u32 = 0xE79BC00C;
217            bytes.extend_from_slice(&ldr.to_le_bytes());
218        } else {
219            // #650: fold the table's compile-time base offset into the
220            // pointer load via the LDR imm12 form.
221            assert!(
222                table_byte_offset <= 4095,
223                "call_indirect table base offset {table_byte_offset} exceeds \
224                 LDR imm12 — the selector must have declined this (#650)"
225            );
226            // ADD r12, r11, r12 — data-processing ADD (register).
227            bytes.extend_from_slice(&0xE08BC00Cu32.to_le_bytes());
228            // LDR r12, [r12, #offset] — immediate offset, P=1 U=1 L=1.
229            let ldr: u32 = 0xE59CC000 | (table_byte_offset & 0xFFF);
230            bytes.extend_from_slice(&ldr.to_le_bytes());
231        }
232        // #664: null-slot trap — only when the table image has null slots
233        // (zero-linked words). A fully-initialized table keeps the pre-#664
234        // bytes identical by construction.
235        if null_check {
236            // CMP r12, #0 — data-processing CMP (immediate), Rn=r12.
237            bytes.extend_from_slice(&0xE35C_0000u32.to_le_bytes());
238            // BNE +1 insn (skip the UDF when the pointer is non-null) —
239            // cond=NE(0001), imm24=0: target = branch + 8.
240            bytes.extend_from_slice(&0x1A00_0000u32.to_le_bytes());
241            // UDF — the §4.4.8 uninitialized-element trap (same idiom as
242            // the bounds guard).
243            bytes.extend_from_slice(&0xE7F0_00F0u32.to_le_bytes());
244        }
245        // BLX r12 — cond=E, 0001 0010 1111 1111 1111 0011, Rm=r12.
246        let blx: u32 = 0xE12FFF3C;
247        bytes.extend_from_slice(&blx.to_le_bytes());
248        bytes
249    }
250
251    /// #615: A32 (ARM-mode) expansions for the multi-instruction ops that the
252    /// Thumb-2 encoder expands but the A32 arm previously encoded as a single
253    /// literal NOP (`0xE1A00000`) — i64 mul / shifts / rotates / comparisons /
254    /// eqz, plus i64 const/load/store/extend/wrap and the i32 SetCond /
255    /// SelectMove pseudo-ops. Each expansion mirrors its Thumb-2 twin's
256    /// register contract and semantics exactly (A32 conditional execution
257    /// replaces the IT blocks). Returns `Ok(None)` for ops this helper does
258    /// not handle; the caller's match encodes or loudly rejects those.
259    fn encode_arm_expanded(&self, op: &ArmOp) -> Result<Option<Vec<u8>>> {
260        use synth_synthesis::Condition;
261
262        /// A32 condition-field bits (instruction bits [31:28]).
263        fn cond_bits(cond: &Condition) -> u32 {
264            match cond {
265                Condition::EQ => 0x0,
266                Condition::NE => 0x1,
267                Condition::HS => 0x2, // CS: unsigned >=
268                Condition::LO => 0x3, // CC: unsigned <
269                Condition::HI => 0x8, // unsigned >
270                Condition::LS => 0x9, // unsigned <=
271                Condition::GE => 0xA,
272                Condition::LT => 0xB,
273                Condition::GT => 0xC,
274                Condition::LE => 0xD,
275            }
276        }
277        fn w(b: &mut Vec<u8>, word: u32) {
278            b.extend_from_slice(&word.to_le_bytes());
279        }
280        /// MOV<cond> rd, #imm (rotated-immediate form; only 0/1 used here).
281        fn mov_cond_imm(b: &mut Vec<u8>, cond: u32, rd: u32, imm: u32) {
282            w(b, (cond << 28) | 0x03A0_0000 | (rd << 12) | imm);
283        }
284        /// After a flag-setting pair: MOV<cond> rd,#1 ; MOV<!cond> rd,#0.
285        fn set_cond(b: &mut Vec<u8>, cond: &Condition, rd: u32) {
286            mov_cond_imm(b, cond_bits(cond), rd, 1);
287            mov_cond_imm(b, cond_bits(&cond.invert()), rd, 0);
288        }
289        /// CMP rn, rm (register form).
290        fn cmp_reg(b: &mut Vec<u8>, rn: u32, rm: u32) {
291            w(b, 0xE150_0000 | (rn << 16) | rm);
292        }
293        /// SBCS rd, rn, rm — the 64-bit compare idiom's high-word subtract.
294        fn sbcs(b: &mut Vec<u8>, rd: u32, rn: u32, rm: u32) {
295            w(b, 0xE0D0_0000 | (rn << 16) | (rd << 12) | rm);
296        }
297        /// MOVW rd, #imm16.
298        fn movw(b: &mut Vec<u8>, rd: u32, v: u32) {
299            w(
300                b,
301                0xE300_0000 | (((v >> 12) & 0xF) << 16) | (rd << 12) | (v & 0xFFF),
302            );
303        }
304        /// MOVT rd, #imm16.
305        fn movt(b: &mut Vec<u8>, rd: u32, v: u32) {
306            w(
307                b,
308                0xE340_0000 | (((v >> 12) & 0xF) << 16) | (rd << 12) | (v & 0xFFF),
309            );
310        }
311        /// Register-controlled shift: MOV rd, rn, <LSL|LSR|ASR> rs.
312        /// `ty`: 0=LSL, 1=LSR, 2=ASR. A32 uses the bottom byte of rs;
313        /// amounts of 32 or more yield 0 (LSL/LSR) or all-sign (ASR) — same
314        /// semantics the Thumb-2 expansions rely on.
315        fn shift_reg(b: &mut Vec<u8>, ty: u32, rd: u32, rn: u32, rs: u32) {
316            w(b, 0xE1A0_0010 | (rd << 12) | (rs << 8) | (ty << 5) | rn);
317        }
318        const LSL: u32 = 0;
319        const LSR: u32 = 1;
320        const ASR: u32 = 2;
321        /// Immediate-shift move: MOV rd, rn, <LSL|LSR|ASR> #imm.
322        fn shift_imm(b: &mut Vec<u8>, ty: u32, rd: u32, rn: u32, imm: u32) {
323            w(
324                b,
325                0xE1A0_0000 | (rd << 12) | ((imm & 0x1F) << 7) | (ty << 5) | rn,
326            );
327        }
328        /// Data-processing register form: `base | rn<<16 | rd<<12 | rm`.
329        /// `base` carries cond/opcode/S (e.g. 0xE090_0000 = ADDS).
330        fn dp_reg(b: &mut Vec<u8>, base: u32, rd: u32, rn: u32, rm: u32) {
331            w(b, base | (rn << 16) | (rd << 12) | rm);
332        }
333        /// ORR rd, rd, rm, LSR #31 — the carry-propagation idiom of the
334        /// shift-subtract division loop (bring rm's MSB into rd's bit 0).
335        fn orr_lsr31(b: &mut Vec<u8>, rd: u32, rm: u32) {
336            w(
337                b,
338                0xE180_0000 | (rd << 16) | (rd << 12) | (31 << 7) | (1 << 5) | rm,
339            );
340        }
341        /// 64-bit two's-complement negate of the lo:hi pair (MVN/MVN/ADDS/ADC).
342        fn negate64(b: &mut Vec<u8>, lo: u32, hi: u32) {
343            w(b, 0xE1E0_0000 | (lo << 12) | lo); //           MVN  lo, lo
344            w(b, 0xE1E0_0000 | (hi << 12) | hi); //           MVN  hi, hi
345            w(b, 0xE290_0001 | (lo << 16) | (lo << 12)); //   ADDS lo, lo, #1
346            w(b, 0xE2A0_0000 | (hi << 16) | (hi << 12)); //   ADC  hi, hi, #0
347        }
348        /// TST x, x ; BPL +4-instructions — the "skip the negate64 when the
349        /// sign bit is clear" guard of the signed div/rem arms.
350        fn skip_negate_if_positive(b: &mut Vec<u8>, x: u32) {
351            w(b, 0xE110_0000 | (x << 16) | x); // TST x, x
352            w(b, 0x5A00_0003); //                 BPL +4 insns (past negate64)
353        }
354        /// The 64-iteration shift-subtract division loop — A32 transcription
355        /// of the Thumb-2 #610 core: dividend R0:R1, divisor R2:R3, quotient
356        /// R4:R5, remainder R6:R7, loop counter in `counter` (R12 or R8).
357        fn div_loop(b: &mut Vec<u8>, counter: u32) {
358            w(b, 0xE3A0_0040 | (counter << 12)); // MOV counter, #64
359            let loop_start = b.len();
360            // quotient <<= 1
361            shift_imm(b, LSL, 5, 5, 1);
362            orr_lsr31(b, 5, 4);
363            shift_imm(b, LSL, 4, 4, 1);
364            // remainder <<= 1, OR in dividend MSB
365            shift_imm(b, LSL, 7, 7, 1);
366            orr_lsr31(b, 7, 6);
367            shift_imm(b, LSL, 6, 6, 1);
368            orr_lsr31(b, 6, 1);
369            // dividend <<= 1
370            shift_imm(b, LSL, 1, 1, 1);
371            orr_lsr31(b, 1, 0);
372            shift_imm(b, LSL, 0, 0, 1);
373            // if remainder >= divisor (64-bit unsigned): subtract, set q bit
374            w(b, 0xE157_0003); // CMP R7, R3      (high words)
375            w(b, 0x8A00_0002); // BHI .subtract   (+2 insns)
376            w(b, 0x3A00_0004); // BLO .next       (+4 insns)
377            w(b, 0xE156_0002); // CMP R6, R2      (low words, highs equal)
378            w(b, 0x3A00_0002); // BLO .next       (+2 insns)
379            w(b, 0xE056_6002); // .subtract: SUBS R6, R6, R2
380            w(b, 0xE0C7_7003); //            SBC  R7, R7, R3
381            w(b, 0xE384_4001); //            ORR  R4, R4, #1
382            // .next: decrement and loop
383            w(b, 0xE250_0001 | (counter << 16) | (counter << 12)); // SUBS counter, #1
384            let diff = (loop_start as i64) - (b.len() as i64 + 8);
385            w(b, 0x1A00_0000 | (((diff / 4) as u32) & 0x00FF_FFFF)); // BNE loop
386        }
387        /// 32-bit population count on working register `x` — A32 transcription
388        /// of the Thumb-2 I64Popcnt per-word core (mul-based fold): `c` is the
389        /// constant register, R12 the shifted temp. Both are clobbered.
390        fn popcnt_word(b: &mut Vec<u8>, x: u32, c: u32) {
391            // x = x - ((x >> 1) & 0x55555555)
392            shift_imm(b, LSR, 12, x, 1);
393            movw(b, c, 0x5555);
394            movt(b, c, 0x5555);
395            dp_reg(b, 0xE000_0000, 12, 12, c); // AND R12, R12, c
396            dp_reg(b, 0xE040_0000, x, x, 12); //  SUB x, x, R12
397            // x = (x & 0x33333333) + ((x >> 2) & 0x33333333)
398            movw(b, c, 0x3333);
399            movt(b, c, 0x3333);
400            dp_reg(b, 0xE000_0000, 12, x, c); //  AND R12, x, c
401            shift_imm(b, LSR, x, x, 2);
402            dp_reg(b, 0xE000_0000, x, x, c); //   AND x, x, c
403            dp_reg(b, 0xE080_0000, x, x, 12); //  ADD x, x, R12
404            // x = (x + (x >> 4)) & 0x0F0F0F0F
405            shift_imm(b, LSR, 12, x, 4);
406            dp_reg(b, 0xE080_0000, x, x, 12); //  ADD x, x, R12
407            movw(b, c, 0x0F0F);
408            movt(b, c, 0x0F0F);
409            dp_reg(b, 0xE000_0000, x, x, c); //   AND x, x, c
410            // x = (x * 0x01010101) >> 24
411            movw(b, c, 0x0101);
412            movt(b, c, 0x0101);
413            w(b, 0xE000_0090 | (x << 16) | (c << 8) | x); // MUL x, x, c
414            shift_imm(b, LSR, x, x, 24);
415        }
416
417        let mut b: Vec<u8> = Vec::new();
418        match op {
419            // SetCond: materialize a flags-predicate as 0/1 — the A32 twin of
420            // the Thumb `ITE cond; MOV rd,#1; MOV rd,#0`.
421            ArmOp::SetCond { rd, cond } => {
422                set_cond(&mut b, cond, reg_to_bits(rd));
423            }
424
425            // SelectMove: conditional register move (Thumb: IT cond; MOV).
426            ArmOp::SelectMove { rd, rm, cond } => {
427                w(
428                    &mut b,
429                    (cond_bits(cond) << 28)
430                        | 0x01A0_0000
431                        | (reg_to_bits(rd) << 12)
432                        | reg_to_bits(rm),
433                );
434            }
435
436            // I64SetCond: compare two i64 register pairs, 0/1 into rd.
437            // EQ/NE: CMP lo,lo; CMPEQ hi,hi (only if lows equal); set.
438            // Ordered: CMP lo,lo; SBCS rd,hi,hi; set — with the same
439            // operand-swap + condition mapping as the Thumb-2 arm.
440            ArmOp::I64SetCond {
441                rd,
442                rn_lo,
443                rn_hi,
444                rm_lo,
445                rm_hi,
446                cond,
447            } => {
448                let rd_b = reg_to_bits(rd);
449                let (n_lo, n_hi, m_lo, m_hi) = (
450                    reg_to_bits(rn_lo),
451                    reg_to_bits(rn_hi),
452                    reg_to_bits(rm_lo),
453                    reg_to_bits(rm_hi),
454                );
455                match cond {
456                    Condition::EQ | Condition::NE => {
457                        cmp_reg(&mut b, n_lo, m_lo);
458                        // CMP<EQ> rn_hi, rm_hi — compare highs only if lows equal.
459                        w(&mut b, 0x0150_0000 | (n_hi << 16) | m_hi);
460                        set_cond(&mut b, cond, rd_b);
461                    }
462                    // (swap operands?, condition after SBCS) per the Thumb arm:
463                    // LT/GE/LO/HS compare (rn, rm); GT/LE/HI/LS swap to (rm, rn).
464                    Condition::LT => {
465                        cmp_reg(&mut b, n_lo, m_lo);
466                        sbcs(&mut b, rd_b, n_hi, m_hi);
467                        set_cond(&mut b, &Condition::LT, rd_b);
468                    }
469                    Condition::GE => {
470                        cmp_reg(&mut b, n_lo, m_lo);
471                        sbcs(&mut b, rd_b, n_hi, m_hi);
472                        set_cond(&mut b, &Condition::GE, rd_b);
473                    }
474                    Condition::GT => {
475                        cmp_reg(&mut b, m_lo, n_lo);
476                        sbcs(&mut b, rd_b, m_hi, n_hi);
477                        set_cond(&mut b, &Condition::LT, rd_b);
478                    }
479                    Condition::LE => {
480                        cmp_reg(&mut b, m_lo, n_lo);
481                        sbcs(&mut b, rd_b, m_hi, n_hi);
482                        set_cond(&mut b, &Condition::GE, rd_b);
483                    }
484                    Condition::LO => {
485                        cmp_reg(&mut b, n_lo, m_lo);
486                        sbcs(&mut b, rd_b, n_hi, m_hi);
487                        set_cond(&mut b, &Condition::LO, rd_b);
488                    }
489                    Condition::HS => {
490                        cmp_reg(&mut b, n_lo, m_lo);
491                        sbcs(&mut b, rd_b, n_hi, m_hi);
492                        set_cond(&mut b, &Condition::HS, rd_b);
493                    }
494                    Condition::HI => {
495                        cmp_reg(&mut b, m_lo, n_lo);
496                        sbcs(&mut b, rd_b, m_hi, n_hi);
497                        set_cond(&mut b, &Condition::LO, rd_b);
498                    }
499                    Condition::LS => {
500                        cmp_reg(&mut b, m_lo, n_lo);
501                        sbcs(&mut b, rd_b, m_hi, n_hi);
502                        set_cond(&mut b, &Condition::HS, rd_b);
503                    }
504                }
505            }
506
507            // I64SetCondZ: ORRS rd, lo, hi sets Z iff the pair is zero.
508            ArmOp::I64SetCondZ { rd, rn_lo, rn_hi } => {
509                let rd_b = reg_to_bits(rd);
510                w(
511                    &mut b,
512                    0xE190_0000 | (reg_to_bits(rn_lo) << 16) | (rd_b << 12) | reg_to_bits(rn_hi),
513                );
514                set_cond(&mut b, &Condition::EQ, rd_b);
515            }
516
517            // i64 comparison wrappers: delegate to I64SetCond/Z, mirroring the
518            // Thumb-2 delegation arms.
519            ArmOp::I64Eqz { rd, rnlo, rnhi } => {
520                return self
521                    .encode_arm(&ArmOp::I64SetCondZ {
522                        rd: *rd,
523                        rn_lo: *rnlo,
524                        rn_hi: *rnhi,
525                    })
526                    .map(Some);
527            }
528            ArmOp::I64Eq {
529                rd,
530                rnlo,
531                rnhi,
532                rmlo,
533                rmhi,
534            }
535            | ArmOp::I64Ne {
536                rd,
537                rnlo,
538                rnhi,
539                rmlo,
540                rmhi,
541            }
542            | ArmOp::I64LtS {
543                rd,
544                rnlo,
545                rnhi,
546                rmlo,
547                rmhi,
548            }
549            | ArmOp::I64LtU {
550                rd,
551                rnlo,
552                rnhi,
553                rmlo,
554                rmhi,
555            }
556            | ArmOp::I64LeS {
557                rd,
558                rnlo,
559                rnhi,
560                rmlo,
561                rmhi,
562            }
563            | ArmOp::I64LeU {
564                rd,
565                rnlo,
566                rnhi,
567                rmlo,
568                rmhi,
569            }
570            | ArmOp::I64GtS {
571                rd,
572                rnlo,
573                rnhi,
574                rmlo,
575                rmhi,
576            }
577            | ArmOp::I64GtU {
578                rd,
579                rnlo,
580                rnhi,
581                rmlo,
582                rmhi,
583            }
584            | ArmOp::I64GeS {
585                rd,
586                rnlo,
587                rnhi,
588                rmlo,
589                rmhi,
590            }
591            | ArmOp::I64GeU {
592                rd,
593                rnlo,
594                rnhi,
595                rmlo,
596                rmhi,
597            } => {
598                let cond = match op {
599                    ArmOp::I64Eq { .. } => Condition::EQ,
600                    ArmOp::I64Ne { .. } => Condition::NE,
601                    ArmOp::I64LtS { .. } => Condition::LT,
602                    ArmOp::I64LtU { .. } => Condition::LO,
603                    ArmOp::I64LeS { .. } => Condition::LE,
604                    ArmOp::I64LeU { .. } => Condition::LS,
605                    ArmOp::I64GtS { .. } => Condition::GT,
606                    ArmOp::I64GtU { .. } => Condition::HI,
607                    ArmOp::I64GeS { .. } => Condition::GE,
608                    _ => Condition::HS,
609                };
610                return self
611                    .encode_arm(&ArmOp::I64SetCond {
612                        rd: *rd,
613                        rn_lo: *rnlo,
614                        rn_hi: *rnhi,
615                        rm_lo: *rmlo,
616                        rm_hi: *rmhi,
617                        cond,
618                    })
619                    .map(Some);
620            }
621
622            // I64Mul: cross products into R12, then UMULL — same sequence and
623            // ordering as the Thumb-2 arm (R12 is encoder scratch, #212).
624            ArmOp::I64Mul {
625                rd_lo,
626                rd_hi,
627                rn_lo,
628                rn_hi,
629                rm_lo,
630                rm_hi,
631            } => {
632                let (dl, dh) = (reg_to_bits(rd_lo), reg_to_bits(rd_hi));
633                let (nl, nh) = (reg_to_bits(rn_lo), reg_to_bits(rn_hi));
634                let (ml, mh) = (reg_to_bits(rm_lo), reg_to_bits(rm_hi));
635                // MUL R12, rn_lo, rm_hi   (R12 = a_lo * b_hi)
636                w(&mut b, 0xE000_0090 | (12 << 16) | (mh << 8) | nl);
637                // MLA R12, rn_hi, rm_lo, R12  (R12 += a_hi * b_lo)
638                w(
639                    &mut b,
640                    0xE020_0090 | (12 << 16) | (12 << 12) | (ml << 8) | nh,
641                );
642                // UMULL rd_lo, rd_hi, rn_lo, rm_lo
643                w(
644                    &mut b,
645                    0xE080_0090 | (dh << 16) | (dl << 12) | (ml << 8) | nl,
646                );
647                // ADD rd_hi, rd_hi, R12
648                w(&mut b, 0xE080_0000 | (dh << 16) | (dh << 12) | 12);
649            }
650
651            // I64Shl / I64ShrU / I64ShrS: same small/large-shift structure as
652            // the Thumb-2 arms (rm_hi is the scratch register; amounts are
653            // masked to 6 bits; register-controlled shifts >= 32 yield 0,
654            // which the small path relies on for n = 0).
655            ArmOp::I64Shl {
656                rd_lo,
657                rd_hi,
658                rn_lo,
659                rn_hi,
660                rm_lo,
661                rm_hi,
662            } => {
663                let (dl, dh) = (reg_to_bits(rd_lo), reg_to_bits(rd_hi));
664                let (nl, nh) = (reg_to_bits(rn_lo), reg_to_bits(rn_hi));
665                let (ml, mh) = (reg_to_bits(rm_lo), reg_to_bits(rm_hi));
666                w(&mut b, 0xE200_003F | (ml << 16) | (ml << 12)); // AND  ml, ml, #63
667                w(&mut b, 0xE250_0020 | (ml << 16) | (mh << 12)); // SUBS mh, ml, #32
668                w(&mut b, 0x5A00_0005); //                            BPL  .large
669                w(&mut b, 0xE260_0020 | (ml << 16) | (mh << 12)); // RSB  mh, ml, #32
670                shift_reg(&mut b, LSR, mh, nl, mh); //               mh = lo >> (32-n)
671                shift_reg(&mut b, LSL, dh, nh, ml); //               dh = hi << n
672                w(&mut b, 0xE180_0000 | (dh << 16) | (dh << 12) | mh); // ORR dh, dh, mh
673                shift_reg(&mut b, LSL, dl, nl, ml); //               dl = lo << n
674                w(&mut b, 0xEA00_0001); //                            B    .done
675                shift_reg(&mut b, LSL, dh, nl, mh); //               .large: dh = lo << (n-32)
676                w(&mut b, 0xE3A0_0000 | (dl << 12)); //              MOV  dl, #0
677            }
678            ArmOp::I64ShrU {
679                rd_lo,
680                rd_hi,
681                rn_lo,
682                rn_hi,
683                rm_lo,
684                rm_hi,
685            } => {
686                let (dl, dh) = (reg_to_bits(rd_lo), reg_to_bits(rd_hi));
687                let (nl, nh) = (reg_to_bits(rn_lo), reg_to_bits(rn_hi));
688                let (ml, mh) = (reg_to_bits(rm_lo), reg_to_bits(rm_hi));
689                w(&mut b, 0xE200_003F | (ml << 16) | (ml << 12)); // AND  ml, ml, #63
690                w(&mut b, 0xE250_0020 | (ml << 16) | (mh << 12)); // SUBS mh, ml, #32
691                w(&mut b, 0x5A00_0005); //                            BPL  .large
692                w(&mut b, 0xE260_0020 | (ml << 16) | (mh << 12)); // RSB  mh, ml, #32
693                shift_reg(&mut b, LSL, mh, nh, mh); //               mh = hi << (32-n)
694                shift_reg(&mut b, LSR, dl, nl, ml); //               dl = lo >> n
695                w(&mut b, 0xE180_0000 | (dl << 16) | (dl << 12) | mh); // ORR dl, dl, mh
696                shift_reg(&mut b, LSR, dh, nh, ml); //               dh = hi >> n
697                w(&mut b, 0xEA00_0001); //                            B    .done
698                shift_reg(&mut b, LSR, dl, nh, mh); //               .large: dl = hi >> (n-32)
699                w(&mut b, 0xE3A0_0000 | (dh << 12)); //              MOV  dh, #0
700            }
701            ArmOp::I64ShrS {
702                rd_lo,
703                rd_hi,
704                rn_lo,
705                rn_hi,
706                rm_lo,
707                rm_hi,
708            } => {
709                let (dl, dh) = (reg_to_bits(rd_lo), reg_to_bits(rd_hi));
710                let (nl, nh) = (reg_to_bits(rn_lo), reg_to_bits(rn_hi));
711                let (ml, mh) = (reg_to_bits(rm_lo), reg_to_bits(rm_hi));
712                w(&mut b, 0xE200_003F | (ml << 16) | (ml << 12)); // AND  ml, ml, #63
713                w(&mut b, 0xE250_0020 | (ml << 16) | (mh << 12)); // SUBS mh, ml, #32
714                w(&mut b, 0x5A00_0005); //                            BPL  .large
715                w(&mut b, 0xE260_0020 | (ml << 16) | (mh << 12)); // RSB  mh, ml, #32
716                shift_reg(&mut b, LSL, mh, nh, mh); //               mh = hi << (32-n)
717                shift_reg(&mut b, LSR, dl, nl, ml); //               dl = lo >> n
718                w(&mut b, 0xE180_0000 | (dl << 16) | (dl << 12) | mh); // ORR dl, dl, mh
719                shift_reg(&mut b, ASR, dh, nh, ml); //               dh = hi >> n (arith)
720                w(&mut b, 0xEA00_0001); //                            B    .done
721                shift_reg(&mut b, ASR, dl, nh, mh); //               .large: dl = hi >> (n-32)
722                w(&mut b, 0xE1A0_0040 | (dh << 12) | (31 << 7) | nh); // ASR dh, nh, #31
723            }
724
725            // I64Rotl / I64Rotr: the #610 fixed-ABI wrapper (A32 form) around
726            // the same fixed-register core as the Thumb-2 arms — value in
727            // R0:R1, amount in R2, scratch R3 + R12.
728            ArmOp::I64Rotl {
729                rdlo,
730                rdhi,
731                rnlo,
732                rnhi,
733                shift,
734            } => {
735                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, shift]);
736                for word in [
737                    0xE202_203Fu32, // AND  R2, R2, #63   (mask amount mod 64)
738                    0xE252_3020,    // SUBS R3, R2, #32   (R3 = n-32, sets N)
739                    0x5A00_0007,    // BPL  .large        (n >= 32)
740                    // --- small rotation (n < 32) ---
741                    0xE262_3020, // RSB  R3, R2, #32   (R3 = 32-n)
742                    0xE1A0_C330, // LSR  R12, R0, R3   (lo >> (32-n))
743                    0xE1A0_3331, // LSR  R3, R1, R3    (hi >> (32-n))
744                    0xE1A0_1211, // LSL  R1, R1, R2    (hi << n)
745                    0xE181_100C, // ORR  R1, R1, R12   (new_hi)
746                    0xE1A0_0210, // LSL  R0, R0, R2    (lo << n)
747                    0xE180_0003, // ORR  R0, R0, R3    (new_lo)
748                    0xEA00_0007, // B    .done
749                    // --- large rotation (n >= 32), R3 = m = n-32 ---
750                    0xE263_2020, // RSB  R2, R3, #32   (R2 = 32-m = 64-n)
751                    0xE1A0_C231, // LSR  R12, R1, R2   (hi >> (64-n))
752                    0xE1A0_2230, // LSR  R2, R0, R2    (lo >> (64-n))
753                    0xE1A0_0310, // LSL  R0, R0, R3    (lo << m)
754                    0xE1A0_1311, // LSL  R1, R1, R3    (hi << m)
755                    0xE180_C00C, // ORR  R12, R0, R12  (new_hi = (lo<<m)|(hi>>(64-n)))
756                    0xE181_0002, // ORR  R0, R1, R2    (new_lo = (hi<<m)|(lo>>(64-n)))
757                    0xE1A0_100C, // MOV  R1, R12       (new_hi into place)
758                ] {
759                    w(&mut b, word);
760                }
761                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
762            }
763            ArmOp::I64Rotr {
764                rdlo,
765                rdhi,
766                rnlo,
767                rnhi,
768                shift,
769            } => {
770                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, shift]);
771                for word in [
772                    0xE202_203Fu32, // AND  R2, R2, #63   (mask amount mod 64)
773                    0xE252_3020,    // SUBS R3, R2, #32   (R3 = n-32, sets N)
774                    0x5A00_0007,    // BPL  .large        (n >= 32)
775                    // --- small rotation (n < 32) ---
776                    0xE262_3020, // RSB  R3, R2, #32   (R3 = 32-n)
777                    0xE1A0_C311, // LSL  R12, R1, R3   (hi << (32-n))
778                    0xE1A0_3310, // LSL  R3, R0, R3    (lo << (32-n))
779                    0xE1A0_0230, // LSR  R0, R0, R2    (lo >> n)
780                    0xE180_000C, // ORR  R0, R0, R12   (new_lo)
781                    0xE1A0_1231, // LSR  R1, R1, R2    (hi >> n)
782                    0xE181_1003, // ORR  R1, R1, R3    (new_hi)
783                    0xEA00_0007, // B    .done
784                    // --- large rotation (n >= 32), R3 = m = n-32 ---
785                    0xE263_2020, // RSB  R2, R3, #32   (R2 = 32-m = 64-n)
786                    0xE1A0_C210, // LSL  R12, R0, R2   (lo << (64-n))
787                    0xE1A0_2211, // LSL  R2, R1, R2    (hi << (64-n))
788                    0xE1A0_1331, // LSR  R1, R1, R3    (hi >> m)
789                    0xE181_C00C, // ORR  R12, R1, R12  (new_lo = (hi>>m)|(lo<<(64-n)))
790                    0xE1A0_1330, // LSR  R1, R0, R3    (lo >> m)
791                    0xE181_1002, // ORR  R1, R1, R2    (new_hi = (lo>>m)|(hi<<(64-n)))
792                    0xE1A0_000C, // MOV  R0, R12       (new_lo into place)
793                ] {
794                    w(&mut b, word);
795                }
796                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
797            }
798
799            // I64Clz: CLZ(hi), or 32 + CLZ(lo) when hi == 0. Conditional
800            // execution replaces the Thumb branches; like the Thumb arm, the
801            // high word of the result pair (rnhi) is cleared last.
802            ArmOp::I64Clz { rd, rnlo, rnhi } => {
803                let (rd_b, lo, hi) = (reg_to_bits(rd), reg_to_bits(rnlo), reg_to_bits(rnhi));
804                w(&mut b, 0xE350_0000 | (hi << 16)); //              CMP   rnhi, #0
805                w(&mut b, 0x116F_0F10 | (rd_b << 12) | hi); //       CLZNE rd, rnhi
806                w(&mut b, 0x016F_0F10 | (rd_b << 12) | lo); //       CLZEQ rd, rnlo
807                w(&mut b, 0x0280_0020 | (rd_b << 16) | (rd_b << 12)); // ADDEQ rd, rd, #32
808                w(&mut b, 0xE3A0_0000 | (hi << 12)); //              MOV   rnhi, #0
809            }
810
811            // I64Ctz: CLZ(RBIT(lo)), or 32 + CLZ(RBIT(hi)) when lo == 0.
812            // RBIT/CLZ leave the flags intact, so the CMP's Z survives to the
813            // conditional ADD.
814            ArmOp::I64Ctz { rd, rnlo, rnhi } => {
815                let (rd_b, lo, hi) = (reg_to_bits(rd), reg_to_bits(rnlo), reg_to_bits(rnhi));
816                w(&mut b, 0xE350_0000 | (lo << 16)); //              CMP    rnlo, #0
817                w(&mut b, 0x16FF_0F30 | (rd_b << 12) | lo); //       RBITNE rd, rnlo
818                w(&mut b, 0x06FF_0F30 | (rd_b << 12) | hi); //       RBITEQ rd, rnhi
819                w(&mut b, 0xE16F_0F10 | (rd_b << 12) | rd_b); //     CLZ    rd, rd
820                w(&mut b, 0x0280_0020 | (rd_b << 16) | (rd_b << 12)); // ADDEQ rd, rd, #32
821                w(&mut b, 0xE3A0_0000 | (hi << 12)); //              MOV    rnhi, #0
822            }
823
824            // I64Const: MOVW/MOVT per half (MOVT elided when the half fits in
825            // 16 bits, mirroring the Thumb-2 arm).
826            ArmOp::I64Const { rdlo, rdhi, value } => {
827                let lo32 = *value as u32;
828                let hi32 = (*value >> 32) as u32;
829                movw(&mut b, reg_to_bits(rdlo), lo32 & 0xFFFF);
830                if lo32 > 0xFFFF {
831                    movt(&mut b, reg_to_bits(rdlo), lo32 >> 16);
832                }
833                movw(&mut b, reg_to_bits(rdhi), hi32 & 0xFFFF);
834                if hi32 > 0xFFFF {
835                    movt(&mut b, reg_to_bits(rdhi), hi32 >> 16);
836                }
837            }
838
839            // I64Ldr / I64Str: two word accesses at [base, #off] / #off+4.
840            // A register offset is materialized into IP once (the #206/#372
841            // hazard: dropping it would read the wrong address).
842            ArmOp::I64Ldr { rdlo, rdhi, addr } | ArmOp::I64Str { rdlo, rdhi, addr } => {
843                let base = if let Some(rm) = addr.offset_reg {
844                    // ADD ip, base, rm
845                    w(
846                        &mut b,
847                        0xE080_0000
848                            | (reg_to_bits(&addr.base) << 16)
849                            | (12 << 12)
850                            | reg_to_bits(&rm),
851                    );
852                    12
853                } else {
854                    reg_to_bits(&addr.base)
855                };
856                if addr.offset < 0 || addr.offset > 0xFFB {
857                    return Err(synth_core::Error::synthesis(format!(
858                        "i64 load/store offset {} out of the A32 imm12 range (0..=4091) — materialize the offset into a register",
859                        addr.offset
860                    )));
861                }
862                let off = addr.offset as u32;
863                let opc: u32 = if matches!(op, ArmOp::I64Ldr { .. }) {
864                    0xE590_0000 // LDR
865                } else {
866                    0xE580_0000 // STR
867                };
868                w(&mut b, opc | (base << 16) | (reg_to_bits(rdlo) << 12) | off);
869                w(
870                    &mut b,
871                    opc | (base << 16) | (reg_to_bits(rdhi) << 12) | (off + 4),
872                );
873            }
874
875            // I64ExtendI32S: rdlo = rn; rdhi = rdlo >> 31 (arithmetic).
876            ArmOp::I64ExtendI32S { rdlo, rdhi, rn } => {
877                if rdlo != rn {
878                    w(
879                        &mut b,
880                        0xE1A0_0000 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rn),
881                    );
882                }
883                w(
884                    &mut b,
885                    0xE1A0_0040 | (reg_to_bits(rdhi) << 12) | (31 << 7) | reg_to_bits(rdlo),
886                );
887            }
888
889            // I64ExtendI32U: rdlo = rn; rdhi = 0.
890            ArmOp::I64ExtendI32U { rdlo, rdhi, rn } => {
891                if rdlo != rn {
892                    w(
893                        &mut b,
894                        0xE1A0_0000 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rn),
895                    );
896                }
897                w(&mut b, 0xE3A0_0000 | (reg_to_bits(rdhi) << 12));
898            }
899
900            // I64Extend8S / I64Extend16S: SXTB/SXTH then sign-fill the high word.
901            ArmOp::I64Extend8S { rdlo, rdhi, rnlo } => {
902                w(
903                    &mut b,
904                    0xE6AF_0070 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rnlo),
905                );
906                w(
907                    &mut b,
908                    0xE1A0_0040 | (reg_to_bits(rdhi) << 12) | (31 << 7) | reg_to_bits(rdlo),
909                );
910            }
911            ArmOp::I64Extend16S { rdlo, rdhi, rnlo } => {
912                w(
913                    &mut b,
914                    0xE6BF_0070 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rnlo),
915                );
916                w(
917                    &mut b,
918                    0xE1A0_0040 | (reg_to_bits(rdhi) << 12) | (31 << 7) | reg_to_bits(rdlo),
919                );
920            }
921            ArmOp::I64Extend32S { rdlo, rdhi, rnlo } => {
922                if rdlo != rnlo {
923                    w(
924                        &mut b,
925                        0xE1A0_0000 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rnlo),
926                    );
927                }
928                w(
929                    &mut b,
930                    0xE1A0_0040 | (reg_to_bits(rdhi) << 12) | (31 << 7) | reg_to_bits(rnlo),
931                );
932            }
933
934            // I32WrapI64: take the low word. When rd == rnlo this is a genuine
935            // no-op (the one case where a NOP word is the correct encoding).
936            ArmOp::I32WrapI64 { rd, rnlo } => {
937                w(
938                    &mut b,
939                    0xE1A0_0000 | (reg_to_bits(rd) << 12) | reg_to_bits(rnlo),
940                );
941            }
942
943            // I64Add / I64Sub: the classic pair — ADDS lo + ADC hi (SUBS/SBC).
944            // The selector emits these as separate Adds/Adc ops; the fused
945            // variants are verification-constructed, but they encode for real.
946            ArmOp::I64Add {
947                rdlo,
948                rdhi,
949                rnlo,
950                rnhi,
951                rmlo,
952                rmhi,
953            } => {
954                dp_reg(
955                    &mut b,
956                    0xE090_0000, // ADDS
957                    reg_to_bits(rdlo),
958                    reg_to_bits(rnlo),
959                    reg_to_bits(rmlo),
960                );
961                dp_reg(
962                    &mut b,
963                    0xE0A0_0000, // ADC
964                    reg_to_bits(rdhi),
965                    reg_to_bits(rnhi),
966                    reg_to_bits(rmhi),
967                );
968            }
969            ArmOp::I64Sub {
970                rdlo,
971                rdhi,
972                rnlo,
973                rnhi,
974                rmlo,
975                rmhi,
976            } => {
977                dp_reg(
978                    &mut b,
979                    0xE050_0000, // SUBS
980                    reg_to_bits(rdlo),
981                    reg_to_bits(rnlo),
982                    reg_to_bits(rmlo),
983                );
984                dp_reg(
985                    &mut b,
986                    0xE0C0_0000, // SBC
987                    reg_to_bits(rdhi),
988                    reg_to_bits(rnhi),
989                    reg_to_bits(rmhi),
990                );
991            }
992
993            // I64And / I64Or / I64Xor: two independent word ops.
994            ArmOp::I64And {
995                rdlo,
996                rdhi,
997                rnlo,
998                rnhi,
999                rmlo,
1000                rmhi,
1001            }
1002            | ArmOp::I64Or {
1003                rdlo,
1004                rdhi,
1005                rnlo,
1006                rnhi,
1007                rmlo,
1008                rmhi,
1009            }
1010            | ArmOp::I64Xor {
1011                rdlo,
1012                rdhi,
1013                rnlo,
1014                rnhi,
1015                rmlo,
1016                rmhi,
1017            } => {
1018                let base = match op {
1019                    ArmOp::I64And { .. } => 0xE000_0000, // AND
1020                    ArmOp::I64Or { .. } => 0xE180_0000,  // ORR
1021                    _ => 0xE020_0000,                    // EOR
1022                };
1023                dp_reg(
1024                    &mut b,
1025                    base,
1026                    reg_to_bits(rdlo),
1027                    reg_to_bits(rnlo),
1028                    reg_to_bits(rmlo),
1029                );
1030                dp_reg(
1031                    &mut b,
1032                    base,
1033                    reg_to_bits(rdhi),
1034                    reg_to_bits(rnhi),
1035                    reg_to_bits(rmhi),
1036                );
1037            }
1038
1039            // I64DivU: binary long division — A32 transcription of the Thumb-2
1040            // #610/#613 arm (fixed-ABI marshal, zero-divisor trap, 64-round
1041            // shift-subtract core, quotient to R0:R1, result to rd pair).
1042            ArmOp::I64DivU {
1043                rdlo,
1044                rdhi,
1045                rnlo,
1046                rnhi,
1047                rmlo,
1048                rmhi,
1049                elide_zero_guard,
1050            } => {
1051                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, rmlo, rmhi]);
1052                // #494 phase 2b: elided only under a certificate-discharged
1053                // UNSAT(P ∧ divisor == 0) obligation (fact-spec pass).
1054                if !elide_zero_guard {
1055                    emit_a32_i64_divisor_zero_trap(&mut b);
1056                }
1057                w(&mut b, 0xE92D_00F0); // PUSH {R4-R7}
1058                for r in 4..8u32 {
1059                    w(&mut b, 0xE3A0_0000 | (r << 12)); // MOV Rr, #0
1060                }
1061                div_loop(&mut b, 12); // counter in R12 (encoder scratch)
1062                w(&mut b, 0xE1A0_0004); // MOV R0, R4 (quotient lo)
1063                w(&mut b, 0xE1A0_1005); // MOV R1, R5 (quotient hi)
1064                w(&mut b, 0xE8BD_00F0); // POP {R4-R7}
1065                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
1066            }
1067
1068            // I64DivS: sign-extract, unsigned core, conditional negate —
1069            // A32 transcription of the Thumb-2 arm.
1070            ArmOp::I64DivS {
1071                rdlo,
1072                rdhi,
1073                rnlo,
1074                rnhi,
1075                rmlo,
1076                rmhi,
1077                elide_zero_guard,
1078                elide_overflow_guard,
1079            } => {
1080                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, rmlo, rmhi]);
1081                // #494 phase 2b: two INDEPENDENT guards, two INDEPENDENT
1082                // obligations. The zero guard falls to UNSAT(P ∧ divisor == 0);
1083                // the #633 overflow guard falls ONLY to
1084                // UNSAT(P ∧ dividend == INT64_MIN ∧ divisor == -1) — a
1085                // divisor-nonzero fact alone must keep it.
1086                if !elide_zero_guard {
1087                    emit_a32_i64_divisor_zero_trap(&mut b);
1088                }
1089                if !elide_overflow_guard {
1090                    // #633: INT64_MIN / -1 overflows — trap like the i32 path
1091                    // (rem_s stays guard-free: rem_s(INT64_MIN, -1) == 0).
1092                    emit_a32_i64_divs_overflow_trap(&mut b);
1093                }
1094                w(&mut b, 0xE92D_0FF0); // PUSH {R4-R11}
1095                w(&mut b, 0xE021_9003); // EOR R9, R1, R3 (result sign in MSB)
1096                skip_negate_if_positive(&mut b, 1);
1097                negate64(&mut b, 0, 1);
1098                skip_negate_if_positive(&mut b, 3);
1099                negate64(&mut b, 2, 3);
1100                for r in 4..8u32 {
1101                    w(&mut b, 0xE3A0_0000 | (r << 12)); // MOV Rr, #0
1102                }
1103                div_loop(&mut b, 8); // counter in R8 (saved above)
1104                w(&mut b, 0xE1A0_0004); // MOV R0, R4
1105                w(&mut b, 0xE1A0_1005); // MOV R1, R5
1106                skip_negate_if_positive(&mut b, 9);
1107                negate64(&mut b, 0, 1);
1108                w(&mut b, 0xE8BD_0FF0); // POP {R4-R11}
1109                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
1110            }
1111
1112            // I64RemU: same core as I64DivU, returns the remainder (R6:R7).
1113            ArmOp::I64RemU {
1114                rdlo,
1115                rdhi,
1116                rnlo,
1117                rnhi,
1118                rmlo,
1119                rmhi,
1120                elide_zero_guard,
1121            } => {
1122                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, rmlo, rmhi]);
1123                if !elide_zero_guard {
1124                    emit_a32_i64_divisor_zero_trap(&mut b);
1125                }
1126                w(&mut b, 0xE92D_01F0); // PUSH {R4-R8}
1127                for r in 4..8u32 {
1128                    w(&mut b, 0xE3A0_0000 | (r << 12)); // MOV Rr, #0
1129                }
1130                div_loop(&mut b, 8);
1131                w(&mut b, 0xE1A0_0006); // MOV R0, R6 (remainder lo)
1132                w(&mut b, 0xE1A0_1007); // MOV R1, R7 (remainder hi)
1133                w(&mut b, 0xE8BD_01F0); // POP {R4-R8}
1134                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
1135            }
1136
1137            // I64RemS: remainder takes the DIVIDEND's sign (WASM semantics).
1138            ArmOp::I64RemS {
1139                rdlo,
1140                rdhi,
1141                rnlo,
1142                rnhi,
1143                rmlo,
1144                rmhi,
1145                elide_zero_guard,
1146            } => {
1147                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, rmlo, rmhi]);
1148                if !elide_zero_guard {
1149                    emit_a32_i64_divisor_zero_trap(&mut b);
1150                }
1151                w(&mut b, 0xE92D_0FF0); // PUSH {R4-R11}
1152                w(&mut b, 0xE1A0_9001); // MOV R9, R1 (dividend sign)
1153                skip_negate_if_positive(&mut b, 1);
1154                negate64(&mut b, 0, 1);
1155                skip_negate_if_positive(&mut b, 3);
1156                negate64(&mut b, 2, 3);
1157                for r in 4..8u32 {
1158                    w(&mut b, 0xE3A0_0000 | (r << 12)); // MOV Rr, #0
1159                }
1160                div_loop(&mut b, 8);
1161                w(&mut b, 0xE1A0_0006); // MOV R0, R6
1162                w(&mut b, 0xE1A0_1007); // MOV R1, R7
1163                skip_negate_if_positive(&mut b, 9);
1164                negate64(&mut b, 0, 1);
1165                w(&mut b, 0xE8BD_0FF0); // POP {R4-R11}
1166                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
1167            }
1168
1169            // Popcnt (i32): bit-twiddle expansion (no native A32 popcount),
1170            // mirroring the Thumb-2 arm's register contract (R11 + R12 as
1171            // scratch, shift-add fold, final AND #0x3F).
1172            ArmOp::Popcnt { rd, rm } => {
1173                let rd_b = reg_to_bits(rd);
1174                if rd != rm {
1175                    w(&mut b, 0xE1A0_0000 | (rd_b << 12) | reg_to_bits(rm)); // MOV rd, rm
1176                }
1177                // x = x - ((x >> 1) & 0x55555555)
1178                movw(&mut b, 12, 0x5555);
1179                movt(&mut b, 12, 0x5555);
1180                shift_imm(&mut b, LSR, 11, rd_b, 1);
1181                dp_reg(&mut b, 0xE000_0000, 11, 11, 12); // AND R11, R11, R12
1182                dp_reg(&mut b, 0xE040_0000, rd_b, rd_b, 11); // SUB rd, rd, R11
1183                // x = (x & 0x33333333) + ((x >> 2) & 0x33333333)
1184                movw(&mut b, 12, 0x3333);
1185                movt(&mut b, 12, 0x3333);
1186                dp_reg(&mut b, 0xE000_0000, 11, rd_b, 12); // AND R11, rd, R12
1187                shift_imm(&mut b, LSR, rd_b, rd_b, 2);
1188                dp_reg(&mut b, 0xE000_0000, rd_b, rd_b, 12); // AND rd, rd, R12
1189                dp_reg(&mut b, 0xE080_0000, rd_b, rd_b, 11); // ADD rd, rd, R11
1190                // x = (x + (x >> 4)) & 0x0F0F0F0F
1191                shift_imm(&mut b, LSR, 11, rd_b, 4);
1192                dp_reg(&mut b, 0xE080_0000, rd_b, rd_b, 11); // ADD rd, rd, R11
1193                movw(&mut b, 12, 0x0F0F);
1194                movt(&mut b, 12, 0x0F0F);
1195                dp_reg(&mut b, 0xE000_0000, rd_b, rd_b, 12); // AND rd, rd, R12
1196                // x += x >> 8; x += x >> 16; x &= 0x3F
1197                shift_imm(&mut b, LSR, 11, rd_b, 8);
1198                dp_reg(&mut b, 0xE080_0000, rd_b, rd_b, 11);
1199                shift_imm(&mut b, LSR, 11, rd_b, 16);
1200                dp_reg(&mut b, 0xE080_0000, rd_b, rd_b, 11);
1201                w(&mut b, 0xE200_003F | (rd_b << 16) | (rd_b << 12)); // AND rd, rd, #63
1202            }
1203
1204            // I64Popcnt: POPCNT(lo) + POPCNT(hi) — A32 transcription of the
1205            // Thumb-2 arm (R3/R4/R5 saved, mul-based per-word fold, high
1206            // result word rnhi cleared last, mirroring the Thumb contract).
1207            ArmOp::I64Popcnt { rd, rnlo, rnhi } => {
1208                let hi = reg_to_bits(rnhi);
1209                w(&mut b, 0xE92D_0038); // PUSH {R3, R4, R5}
1210                // #632 audit: route rnlo through R12 so a pair living at
1211                // (R3,R4) cannot read a clobbered R4 (sources read before any
1212                // scratch register they could occupy is written).
1213                w(&mut b, 0xE1A0_C000 | reg_to_bits(rnlo)); // MOV R12, rnlo
1214                w(&mut b, 0xE1A0_5000 | hi); //                MOV R5, rnhi
1215                w(&mut b, 0xE1A0_400C); //                     MOV R4, R12
1216                popcnt_word(&mut b, 4, 3);
1217                popcnt_word(&mut b, 5, 3);
1218                // #632: carry the count across the scratch restore in R12 —
1219                // rd is allocator-assigned and can land inside {R3,R4,R5};
1220                // the old `ADD rd, R4, R5` before the POP was destroyed by
1221                // the restore. R12 is never allocatable and never restored.
1222                dp_reg(&mut b, 0xE080_0000, 12, 4, 5); // ADD R12, R4, R5
1223                w(&mut b, 0xE8BD_0038); // POP {R3, R4, R5}
1224                w(&mut b, 0xE1A0_0000 | (reg_to_bits(rd) << 12) | 12); // MOV rd, R12
1225                w(&mut b, 0xE3A0_0000 | (hi << 12)); // MOV rnhi, #0 (i64 hi word)
1226            }
1227
1228            _ => return Ok(None),
1229        }
1230        Ok(Some(b))
1231    }
1232
1233    fn encode_arm(&self, op: &ArmOp) -> Result<Vec<u8>> {
1234        // #615: A32 multi-instruction expansions (i64 arithmetic/shift/rotate/
1235        // compare, SetCond/SelectMove, popcnt, ...). These ops were literal
1236        // NOPs on the A32 path — user-reachable via `--target cortex-r5` —
1237        // so the value silently vanished. Mirror of the #594 CallIndirect
1238        // early-return: if the expansion helper covers the op, its bytes are
1239        // the encoding.
1240        if let Some(bytes) = self.encode_arm_expanded(op)? {
1241            return Ok(bytes);
1242        }
1243        // #206: ARM32 register-offset loads/stores. `encode_mem_addr` only
1244        // returns the 12-bit immediate, so the immediate-form arms below
1245        // silently DROP `addr.offset_reg` — a runtime address index vanished,
1246        // turning `ldr rd,[rn,rm,#off]` into `ldr rd,[rn,#off]` (the access went
1247        // to the wrong address). Compute the effective base into IP and re-encode
1248        // against `[ip, #off]`, which is uniform for word/byte/halfword/signed.
1249        if let Some(bytes) = self.encode_arm_reg_offset_mem(op)? {
1250            return Ok(bytes);
1251        }
1252        // #594: call_indirect was encoded as a literal NOP on the A32 path
1253        // (`--target cortex-r5`) — the call never happened and the function
1254        // silently returned garbage. Emit the same three-instruction expansion
1255        // as the Thumb-2 path (R11 = function-pointer table base, R12 scratch):
1256        //   MOV r12, idx, LSL #2 ; LDR r12, [r11, r12] ; BLX r12
1257        if let ArmOp::CallIndirect {
1258            table_index_reg,
1259            table_size,
1260            table_byte_offset,
1261            null_check,
1262            type_check,
1263            ..
1264        } = op
1265        {
1266            return Ok(Self::encode_arm_call_indirect(
1267                table_index_reg,
1268                *table_size,
1269                *table_byte_offset,
1270                *null_check,
1271                *type_check,
1272            ));
1273        }
1274        let instr: u32 = match op {
1275            // Data processing instructions
1276            ArmOp::Add { rd, rn, op2 } => {
1277                let rd_bits = reg_to_bits(rd);
1278                let rn_bits = reg_to_bits(rn);
1279                let (op2_bits, i_flag) = encode_operand2(op2)?;
1280
1281                // ADD encoding: cond(4) | 00 | I(1) | 0100 | S(1) | Rn(4) | Rd(4) | operand2(12)
1282                0xE0800000 // condition=always(E), opcode=ADD(0100), S=0
1283                    | (i_flag << 25)
1284                    | (rn_bits << 16)
1285                    | (rd_bits << 12)
1286                    | op2_bits
1287            }
1288
1289            ArmOp::Sub { rd, rn, op2 } => {
1290                let rd_bits = reg_to_bits(rd);
1291                let rn_bits = reg_to_bits(rn);
1292                let (op2_bits, i_flag) = encode_operand2(op2)?;
1293
1294                // SUB encoding: opcode=0010
1295                0xE0400000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1296            }
1297
1298            // i64 support: ADDS, ADC, SUBS, SBC for ARM32
1299            ArmOp::Adds { rd, rn, op2 } => {
1300                let rd_bits = reg_to_bits(rd);
1301                let rn_bits = reg_to_bits(rn);
1302                let (op2_bits, i_flag) = encode_operand2(op2)?;
1303
1304                // ADDS encoding: opcode=0100, S=1
1305                0xE0900000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1306            }
1307
1308            ArmOp::Adc { rd, rn, op2 } => {
1309                let rd_bits = reg_to_bits(rd);
1310                let rn_bits = reg_to_bits(rn);
1311                let (op2_bits, i_flag) = encode_operand2(op2)?;
1312
1313                // ADC encoding: opcode=0101
1314                0xE0A00000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1315            }
1316
1317            ArmOp::Subs { rd, rn, op2 } => {
1318                let rd_bits = reg_to_bits(rd);
1319                let rn_bits = reg_to_bits(rn);
1320                let (op2_bits, i_flag) = encode_operand2(op2)?;
1321
1322                // SUBS encoding: opcode=0010, S=1
1323                0xE0500000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1324            }
1325
1326            ArmOp::Sbc { rd, rn, op2 } => {
1327                let rd_bits = reg_to_bits(rd);
1328                let rn_bits = reg_to_bits(rn);
1329                let (op2_bits, i_flag) = encode_operand2(op2)?;
1330
1331                // SBC encoding: opcode=0110
1332                0xE0C00000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1333            }
1334
1335            ArmOp::Mul { rd, rn, rm } => {
1336                let rd_bits = reg_to_bits(rd);
1337                let rn_bits = reg_to_bits(rn);
1338                let rm_bits = reg_to_bits(rm);
1339
1340                // MUL encoding: cond(4) | 000000 | A(1) | S(1) | Rd(4) | Rn(4) | Rs(4) | 1001 | Rm(4)
1341                0xE0000090 | (rd_bits << 16) | (rn_bits << 8) | rm_bits
1342            }
1343
1344            ArmOp::Umull { rdlo, rdhi, rn, rm } => {
1345                let rdlo_bits = reg_to_bits(rdlo);
1346                let rdhi_bits = reg_to_bits(rdhi);
1347                let rn_bits = reg_to_bits(rn);
1348                let rm_bits = reg_to_bits(rm);
1349
1350                // UMULL encoding: cond(4) | 0000 1000 | RdHi(4) | RdLo(4) | Rm(4) | 1001 | Rn(4)
1351                0xE0800090 | (rdhi_bits << 16) | (rdlo_bits << 12) | (rm_bits << 8) | rn_bits
1352            }
1353
1354            ArmOp::Sdiv { rd, rn, rm } => {
1355                let rd_bits = reg_to_bits(rd);
1356                let rn_bits = reg_to_bits(rn);
1357                let rm_bits = reg_to_bits(rm);
1358
1359                // SDIV encoding: cond(4) | 01110001 | Rd(4) | 1111 | Rm(4) | 0001 | Rn(4)
1360                // ARMv7-M and above
1361                0xE710F010 | (rd_bits << 16) | (rm_bits << 8) | rn_bits
1362            }
1363
1364            ArmOp::Udiv { rd, rn, rm } => {
1365                let rd_bits = reg_to_bits(rd);
1366                let rn_bits = reg_to_bits(rn);
1367                let rm_bits = reg_to_bits(rm);
1368
1369                // UDIV encoding: cond(4) | 01110011 | Rd(4) | 1111 | Rm(4) | 0001 | Rn(4)
1370                // ARMv7-M and above
1371                0xE730F010 | (rd_bits << 16) | (rm_bits << 8) | rn_bits
1372            }
1373
1374            ArmOp::Mls { rd, rn, rm, ra } => {
1375                let rd_bits = reg_to_bits(rd);
1376                let rn_bits = reg_to_bits(rn);
1377                let rm_bits = reg_to_bits(rm);
1378                let ra_bits = reg_to_bits(ra);
1379
1380                // MLS encoding: cond(4) | 00000110 | Rd(4) | Ra(4) | Rm(4) | 1001 | Rn(4)
1381                // Rd = Ra - (Rn * Rm)
1382                0xE0600090 | (rd_bits << 16) | (ra_bits << 12) | (rm_bits << 8) | rn_bits
1383            }
1384
1385            ArmOp::Mla { rd, rn, rm, ra } => {
1386                let rd_bits = reg_to_bits(rd);
1387                let rn_bits = reg_to_bits(rn);
1388                let rm_bits = reg_to_bits(rm);
1389                let ra_bits = reg_to_bits(ra);
1390
1391                // MLA encoding: cond(4) | 0000001 S | Rd(4) | Ra(4) | Rm(4) | 1001 | Rn(4)
1392                // Rd = Ra + (Rn * Rm). Base 0xE0200090 (S=0).
1393                0xE0200090 | (rd_bits << 16) | (ra_bits << 12) | (rm_bits << 8) | rn_bits
1394            }
1395
1396            ArmOp::And { rd, rn, op2 } => {
1397                let rd_bits = reg_to_bits(rd);
1398                let rn_bits = reg_to_bits(rn);
1399                let (op2_bits, i_flag) = encode_operand2(op2)?;
1400
1401                // AND encoding: opcode=0000
1402                0xE0000000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1403            }
1404
1405            ArmOp::Orr { rd, rn, op2 } => {
1406                let rd_bits = reg_to_bits(rd);
1407                let rn_bits = reg_to_bits(rn);
1408                let (op2_bits, i_flag) = encode_operand2(op2)?;
1409
1410                // ORR encoding: opcode=1100
1411                0xE1800000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1412            }
1413
1414            ArmOp::Eor { rd, rn, op2 } => {
1415                let rd_bits = reg_to_bits(rd);
1416                let rn_bits = reg_to_bits(rn);
1417                let (op2_bits, i_flag) = encode_operand2(op2)?;
1418
1419                // EOR encoding: opcode=0001
1420                0xE0200000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1421            }
1422
1423            // Shift instructions
1424            ArmOp::Lsl { rd, rn, shift } => {
1425                let rd_bits = reg_to_bits(rd);
1426                let rn_bits = reg_to_bits(rn);
1427                let shift_bits = *shift & 0x1F;
1428
1429                // LSL encoding: MOV with shift
1430                0xE1A00000 | (rd_bits << 12) | (shift_bits << 7) | rn_bits
1431            }
1432
1433            ArmOp::Lsr { rd, rn, shift } => {
1434                let rd_bits = reg_to_bits(rd);
1435                let rn_bits = reg_to_bits(rn);
1436                let shift_bits = *shift & 0x1F;
1437
1438                // LSR encoding
1439                0xE1A00020 | (rd_bits << 12) | (shift_bits << 7) | rn_bits
1440            }
1441
1442            ArmOp::Asr { rd, rn, shift } => {
1443                let rd_bits = reg_to_bits(rd);
1444                let rn_bits = reg_to_bits(rn);
1445                let shift_bits = *shift & 0x1F;
1446
1447                // ASR encoding
1448                0xE1A00040 | (rd_bits << 12) | (shift_bits << 7) | rn_bits
1449            }
1450
1451            ArmOp::Ror { rd, rn, shift } => {
1452                let rd_bits = reg_to_bits(rd);
1453                let rn_bits = reg_to_bits(rn);
1454                let shift_bits = *shift & 0x1F;
1455
1456                // ROR encoding: MOV with ROR shift
1457                0xE1A00060 | (rd_bits << 12) | (shift_bits << 7) | rn_bits
1458            }
1459
1460            // Register-based shifts (ARM32)
1461            // LSL Rd, Rn, Rm: cond 0001101S 0000 Rd Rs 0001 Rn
1462            ArmOp::LslReg { rd, rn, rm } => {
1463                let rd_bits = reg_to_bits(rd);
1464                let rn_bits = reg_to_bits(rn);
1465                let rm_bits = reg_to_bits(rm);
1466                0xE1A00010 | (rd_bits << 12) | (rm_bits << 8) | rn_bits
1467            }
1468            ArmOp::LsrReg { rd, rn, rm } => {
1469                let rd_bits = reg_to_bits(rd);
1470                let rn_bits = reg_to_bits(rn);
1471                let rm_bits = reg_to_bits(rm);
1472                0xE1A00030 | (rd_bits << 12) | (rm_bits << 8) | rn_bits
1473            }
1474            ArmOp::AsrReg { rd, rn, rm } => {
1475                let rd_bits = reg_to_bits(rd);
1476                let rn_bits = reg_to_bits(rn);
1477                let rm_bits = reg_to_bits(rm);
1478                0xE1A00050 | (rd_bits << 12) | (rm_bits << 8) | rn_bits
1479            }
1480            ArmOp::RorReg { rd, rn, rm } => {
1481                let rd_bits = reg_to_bits(rd);
1482                let rn_bits = reg_to_bits(rn);
1483                let rm_bits = reg_to_bits(rm);
1484                0xE1A00070 | (rd_bits << 12) | (rm_bits << 8) | rn_bits
1485            }
1486
1487            // RSB (Reverse Subtract): Rd = imm - Rn
1488            ArmOp::Rsb { rd, rn, imm } => {
1489                let rd_bits = reg_to_bits(rd);
1490                let rn_bits = reg_to_bits(rn);
1491                // RSB encoding: cond(4) | 00 1 0011 S | Rn(4) | Rd(4) | imm12
1492                // Opcode for RSB = 0011, I=1 (immediate), S=0
1493                //
1494                // #681 class audit: the A32 imm12 is a rotate(4):imm8 modified
1495                // immediate; `*imm & 0xFF` silently encoded a WRONG constant
1496                // for imm > 0xFF (#378 masking class). All current emitters use
1497                // imm 32, so erroring here is byte-identical for real codegen.
1498                if *imm > 0xFF {
1499                    return Err(synth_core::Error::synthesis(
1500                        "A32 RSB immediate > 0xFF requires a rotated-immediate encoding \
1501                         (not supported) — materialize into a register",
1502                    ));
1503                }
1504                0xE2600000 | (rn_bits << 16) | (rd_bits << 12) | (*imm & 0xFF)
1505            }
1506
1507            // Bit manipulation instructions
1508            ArmOp::Clz { rd, rm } => {
1509                let rd_bits = reg_to_bits(rd);
1510                let rm_bits = reg_to_bits(rm);
1511
1512                // CLZ encoding: cond(4) | 00010110 | 1111 | Rd(4) | 1111 | 0001 | Rm(4)
1513                // ARMv5T and above
1514                0xE16F0F10 | (rd_bits << 12) | rm_bits
1515            }
1516
1517            ArmOp::Rbit { rd, rm } => {
1518                let rd_bits = reg_to_bits(rd);
1519                let rm_bits = reg_to_bits(rm);
1520
1521                // RBIT encoding: cond(4) | 01101111 | 1111 | Rd(4) | 1111 | 0011 | Rm(4)
1522                // ARMv6T2 and above
1523                0xE6FF0F30 | (rd_bits << 12) | rm_bits
1524            }
1525
1526            ArmOp::Sxtb { rd, rm } => {
1527                let rd_bits = reg_to_bits(rd);
1528                let rm_bits = reg_to_bits(rm);
1529
1530                // SXTB encoding: cond(4) | 01101010 | 1111 | Rd(4) | rotate(2) | 00 | 0111 | Rm(4)
1531                // ARMv6 and above. rotate=00 for no rotation
1532                0xE6AF0070 | (rd_bits << 12) | rm_bits
1533            }
1534
1535            ArmOp::Sxth { rd, rm } => {
1536                let rd_bits = reg_to_bits(rd);
1537                let rm_bits = reg_to_bits(rm);
1538
1539                // SXTH encoding: cond(4) | 01101011 | 1111 | Rd(4) | rotate(2) | 00 | 0111 | Rm(4)
1540                // ARMv6 and above. rotate=00 for no rotation
1541                0xE6BF0070 | (rd_bits << 12) | rm_bits
1542            }
1543
1544            ArmOp::Uxtb { rd, rm } => {
1545                let rd_bits = reg_to_bits(rd);
1546                let rm_bits = reg_to_bits(rm);
1547                // UXTB encoding: cond | 01101110 1111 Rd rotate 00 0111 Rm (rotate=00)
1548                0xE6EF0070 | (rd_bits << 12) | rm_bits
1549            }
1550
1551            ArmOp::Uxth { rd, rm } => {
1552                let rd_bits = reg_to_bits(rd);
1553                let rm_bits = reg_to_bits(rm);
1554                // UXTH encoding: cond | 01101111 1111 Rd rotate 00 0111 Rm (rotate=00)
1555                0xE6FF0070 | (rd_bits << 12) | rm_bits
1556            }
1557
1558            // Move instructions
1559            ArmOp::Mov { rd, op2 } => {
1560                let rd_bits = reg_to_bits(rd);
1561                let (op2_bits, i_flag) = encode_operand2(op2)?;
1562
1563                // MOV encoding: opcode=1101
1564                0xE1A00000 | (i_flag << 25) | (rd_bits << 12) | op2_bits
1565            }
1566
1567            ArmOp::Mvn { rd, op2 } => {
1568                let rd_bits = reg_to_bits(rd);
1569                let (op2_bits, i_flag) = encode_operand2(op2)?;
1570
1571                // MVN encoding: opcode=1111
1572                0xE1E00000 | (i_flag << 25) | (rd_bits << 12) | op2_bits
1573            }
1574
1575            // MOVW - Move Wide (ARM32)
1576            // Encoding: cond(4) | 0011 0000 | imm4(4) | Rd(4) | imm12(12)
1577            ArmOp::Movw { rd, imm16 } => {
1578                let rd_bits = reg_to_bits(rd);
1579                let imm4 = ((*imm16 as u32) >> 12) & 0xF;
1580                let imm12 = (*imm16 as u32) & 0xFFF;
1581                0xE3000000 | (imm4 << 16) | (rd_bits << 12) | imm12
1582            }
1583
1584            // MOVT - Move Top (ARM32)
1585            // Encoding: cond(4) | 0011 0100 | imm4(4) | Rd(4) | imm12(12)
1586            ArmOp::Movt { rd, imm16 } => {
1587                let rd_bits = reg_to_bits(rd);
1588                let imm4 = ((*imm16 as u32) >> 12) & 0xF;
1589                let imm12 = (*imm16 as u32) & 0xFFF;
1590                0xE3400000 | (imm4 << 16) | (rd_bits << 12) | imm12
1591            }
1592
1593            // #237: symbol-relative MOVW/MOVT (ARM mode) — addend in place, the
1594            // backend records the MOVW_ABS/MOVT_ABS relocation against `symbol`.
1595            ArmOp::MovwSym { rd, addend, .. } => {
1596                let rd_bits = reg_to_bits(rd);
1597                let v = (*addend as u32) & 0xffff;
1598                0xE3000000 | (((v >> 12) & 0xF) << 16) | (rd_bits << 12) | (v & 0xFFF)
1599            }
1600            ArmOp::MovtSym { rd, addend, .. } => {
1601                let rd_bits = reg_to_bits(rd);
1602                let v = ((*addend as u32) >> 16) & 0xffff;
1603                0xE3400000 | (((v >> 12) & 0xF) << 16) | (rd_bits << 12) | (v & 0xFFF)
1604            }
1605
1606            // #345: LdrSym is the Thumb-2 literal-pool address load. A32 mode is
1607            // not used for relocatable native-pointer objects; fail loudly rather
1608            // than miscompile if it is ever reached here.
1609            ArmOp::LdrSym { .. } => {
1610                return Err(synth_core::Error::synthesis(
1611                    "LdrSym (literal-pool address load) is Thumb-2-only",
1612                ));
1613            }
1614
1615            // Compare
1616            ArmOp::Cmp { rn, op2 } => {
1617                let rn_bits = reg_to_bits(rn);
1618                let (op2_bits, i_flag) = encode_operand2(op2)?;
1619
1620                // CMP encoding: opcode=1010, S=1
1621                0xE1500000 | (i_flag << 25) | (rn_bits << 16) | op2_bits
1622            }
1623
1624            // Compare Negative (CMN) - computes Rn + op2 and sets flags
1625            ArmOp::Cmn { rn, op2 } => {
1626                let rn_bits = reg_to_bits(rn);
1627                let (op2_bits, i_flag) = encode_operand2(op2)?;
1628
1629                // CMN encoding: opcode=1011, S=1
1630                0xE1700000 | (i_flag << 25) | (rn_bits << 16) | op2_bits
1631            }
1632
1633            // Load/Store
1634            ArmOp::Ldr { rd, addr } => {
1635                let rd_bits = reg_to_bits(rd);
1636                let (base_bits, offset_bits) = encode_mem_addr(addr);
1637
1638                // LDR encoding: cond(4) | 01 | I(1) | P(1) | U(1) | B(1) | W(1) | L(1) | Rn(4) | Rd(4) | offset(12)
1639                // P=1 (pre-indexed), U=1 (add offset), L=1 (load)
1640                0xE5900000 | (base_bits << 16) | (rd_bits << 12) | offset_bits
1641            }
1642
1643            ArmOp::Str { rd, addr } => {
1644                let rd_bits = reg_to_bits(rd);
1645                let (base_bits, offset_bits) = encode_mem_addr(addr);
1646
1647                // STR encoding: L=0 (store)
1648                0xE5800000 | (base_bits << 16) | (rd_bits << 12) | offset_bits
1649            }
1650
1651            // Sub-word loads (ARM32 encoding)
1652            ArmOp::Ldrb { rd, addr } => {
1653                let rd_bits = reg_to_bits(rd);
1654                let (base_bits, offset_bits) = encode_mem_addr(addr);
1655                // LDRB: LDR with B=1 (byte): cond|01|I|P|U|1|W|L|Rn|Rd|offset
1656                0xE5D00000 | (base_bits << 16) | (rd_bits << 12) | offset_bits
1657            }
1658
1659            ArmOp::Ldrsb { rd, addr } => {
1660                let rd_bits = reg_to_bits(rd);
1661                let (base_bits, offset_bits) = encode_mem_addr(addr);
1662                // LDRSB (misc load): cond|000|P|U|1|W|1|Rn|Rd|imm4H|1101|imm4L
1663                // Simplified with immediate offset
1664                let offset_val = offset_bits & 0xFF;
1665                let imm4h = (offset_val >> 4) & 0xF;
1666                let imm4l = offset_val & 0xF;
1667                0xE1D000D0 | (base_bits << 16) | (rd_bits << 12) | (imm4h << 8) | imm4l
1668            }
1669
1670            ArmOp::Ldrh { rd, addr } => {
1671                let rd_bits = reg_to_bits(rd);
1672                let (base_bits, offset_bits) = encode_mem_addr(addr);
1673                // LDRH (misc load): cond|000|P|U|1|W|1|Rn|Rd|imm4H|1011|imm4L
1674                let offset_val = offset_bits & 0xFF;
1675                let imm4h = (offset_val >> 4) & 0xF;
1676                let imm4l = offset_val & 0xF;
1677                0xE1D000B0 | (base_bits << 16) | (rd_bits << 12) | (imm4h << 8) | imm4l
1678            }
1679
1680            ArmOp::Ldrsh { rd, addr } => {
1681                let rd_bits = reg_to_bits(rd);
1682                let (base_bits, offset_bits) = encode_mem_addr(addr);
1683                // LDRSH (misc load): cond|000|P|U|1|W|1|Rn|Rd|imm4H|1111|imm4L
1684                let offset_val = offset_bits & 0xFF;
1685                let imm4h = (offset_val >> 4) & 0xF;
1686                let imm4l = offset_val & 0xF;
1687                0xE1D000F0 | (base_bits << 16) | (rd_bits << 12) | (imm4h << 8) | imm4l
1688            }
1689
1690            // Sub-word stores (ARM32 encoding)
1691            ArmOp::Strb { rd, addr } => {
1692                let rd_bits = reg_to_bits(rd);
1693                let (base_bits, offset_bits) = encode_mem_addr(addr);
1694                // STRB: STR with B=1 (byte): cond|01|I|P|U|1|W|0|Rn|Rd|offset
1695                0xE5C00000 | (base_bits << 16) | (rd_bits << 12) | offset_bits
1696            }
1697
1698            ArmOp::Strh { rd, addr } => {
1699                let rd_bits = reg_to_bits(rd);
1700                let (base_bits, offset_bits) = encode_mem_addr(addr);
1701                // STRH (misc store): cond|000|P|U|1|W|0|Rn|Rd|imm4H|1011|imm4L
1702                let offset_val = offset_bits & 0xFF;
1703                let imm4h = (offset_val >> 4) & 0xF;
1704                let imm4l = offset_val & 0xF;
1705                0xE1C000B0 | (base_bits << 16) | (rd_bits << 12) | (imm4h << 8) | imm4l
1706            }
1707
1708            // Memory management (ARM32 encoding)
1709            ArmOp::MemorySize { rd } => {
1710                let rd_bits = reg_to_bits(rd);
1711                // MOV rd, R10, LSR #16  (memory size in bytes / 65536 = pages)
1712                // cond|000|1101|S|0000|Rd|shift5|type|0|Rm
1713                // LSR #16: shift5=10000, type=01
1714                0xE1A00820 | (rd_bits << 12) | 0x0A // Rm=R10, shift=16, LSR
1715            }
1716
1717            ArmOp::MemoryGrow { rd, .. } => {
1718                let rd_bits = reg_to_bits(rd);
1719                // On embedded, always fail: MOV rd, #-1
1720                0xE3E00000 | (rd_bits << 12) // MVN rd, #0 = MOV rd, #-1
1721            }
1722
1723            // Label pseudo-instruction: emits no machine code
1724            ArmOp::Label { .. } => {
1725                return Ok(Vec::new());
1726            }
1727
1728            // Branch instructions
1729            ArmOp::B { label: _ } => {
1730                // B encoding: cond(4) | 1010 | offset(24)
1731                // Simplified: branch to offset 0 (will be patched by linker/resolver)
1732                0xEA000000
1733            }
1734
1735            // Conditional branch to label (generic)
1736            ArmOp::Bcc { cond, label: _ } => {
1737                use synth_synthesis::Condition;
1738                let cond_bits: u32 = match cond {
1739                    Condition::EQ => 0x0,
1740                    Condition::NE => 0x1,
1741                    Condition::HS => 0x2,
1742                    Condition::LO => 0x3,
1743                    Condition::HI => 0x8,
1744                    Condition::LS => 0x9,
1745                    Condition::GE => 0xA,
1746                    Condition::LT => 0xB,
1747                    Condition::GT => 0xC,
1748                    Condition::LE => 0xD,
1749                };
1750                // B<cond> with offset 0 (will be patched)
1751                (cond_bits << 28) | 0x0A000000
1752            }
1753
1754            // BHS (Branch if Higher or Same) - used for bounds checking
1755            ArmOp::Bhs { label: _ } => {
1756                // BHS encoding: cond(2=HS) | 1010 | offset(24)
1757                0x2A000000 // BHS with offset 0
1758            }
1759
1760            // BLO (Branch if Lower) - complementary to BHS
1761            ArmOp::Blo { label: _ } => {
1762                // BLO encoding: cond(3=LO) | 1010 | offset(24)
1763                0x3A000000 // BLO with offset 0
1764            }
1765
1766            // Branch with numeric offset (in instructions)
1767            // ARM32 B instruction: offset is in instructions, stored as words
1768            // The offset is relative to PC+8 (due to ARM pipeline)
1769            ArmOp::BOffset { offset } => {
1770                // B encoding: cond(4) | 1010 | offset(24)
1771                // Offset is signed, in words (4-byte units)
1772                // ARM adds PC+8 to the offset, so we need to adjust:
1773                // target = PC + 8 + (offset * 4)
1774                // For backward branch of N instructions: offset = -(N + 2)
1775                // wrapping_sub keeps the encoder total under fuzzing (#186): an
1776                // extreme i32::MIN offset would otherwise overflow-panic; for any
1777                // real branch offset this is identical to `- 2`.
1778                let adjusted_offset = offset.wrapping_sub(2); // Account for PC+8
1779                let offset_bits = (adjusted_offset as u32) & 0x00FFFFFF;
1780                0xEA000000 | offset_bits
1781            }
1782
1783            // Conditional branch with numeric offset
1784            ArmOp::BCondOffset { cond, offset } => {
1785                use synth_synthesis::Condition;
1786                let cond_bits: u32 = match cond {
1787                    Condition::EQ => 0x0,
1788                    Condition::NE => 0x1,
1789                    Condition::HS => 0x2,
1790                    Condition::LO => 0x3,
1791                    Condition::HI => 0x8,
1792                    Condition::LS => 0x9,
1793                    Condition::GE => 0xA,
1794                    Condition::LT => 0xB,
1795                    Condition::GT => 0xC,
1796                    Condition::LE => 0xD,
1797                };
1798                // B<cond> encoding: cond(4) | 1010 | offset(24)
1799                // wrapping_sub: total under fuzzing (#186), identical for real offsets.
1800                let adjusted_offset = offset.wrapping_sub(2); // Account for PC+8
1801                let offset_bits = (adjusted_offset as u32) & 0x00FFFFFF;
1802                (cond_bits << 28) | 0x0A000000 | offset_bits
1803            }
1804
1805            ArmOp::Bl { label: _ } => {
1806                // BL encoding: cond(4) | 1011 | offset(24)
1807                0xEB000000
1808            }
1809
1810            ArmOp::Bx { rm } => {
1811                let rm_bits = reg_to_bits(rm);
1812
1813                // BX encoding: cond(4) | 000100101111111111110001 | Rm(4)
1814                0xE12FFF10 | rm_bits
1815            }
1816
1817            ArmOp::Blx { rm } => {
1818                let rm_bits = reg_to_bits(rm);
1819
1820                // BLX (register) encoding: cond(4) | 000100101111111111110011 | Rm(4)
1821                0xE12FFF30 | rm_bits
1822            }
1823
1824            ArmOp::Push { regs } => {
1825                // STMDB SP!, {regs} encoding: cond(4) | 100100 | 10 | 1101 | register_list(16)
1826                let mut reg_list: u32 = 0;
1827                for r in regs {
1828                    reg_list |= 1 << reg_to_bits(r);
1829                }
1830                0xE92D0000 | reg_list
1831            }
1832
1833            ArmOp::Pop { regs } => {
1834                // LDMIA SP!, {regs} encoding: cond(4) | 100010 | 11 | 1101 | register_list(16)
1835                let mut reg_list: u32 = 0;
1836                for r in regs {
1837                    reg_list |= 1 << reg_to_bits(r);
1838                }
1839                0xE8BD0000 | reg_list
1840            }
1841
1842            ArmOp::Nop => {
1843                // NOP encoding: MOV R0, R0
1844                0xE1A00000
1845            }
1846
1847            ArmOp::Udf { imm } => {
1848                // UDF (Undefined) encoding in ARM: 0xE7F000F0 | (imm12_hi << 8) | imm4_lo
1849                // We only use imm8, so split into imm4_hi and imm4_lo
1850                let imm8 = *imm as u32;
1851                0xE7F000F0 | ((imm8 & 0xF0) << 4) | (imm8 & 0x0F)
1852            }
1853
1854            // #615: handled by the `encode_arm_expanded` early return at the
1855            // top of this function — a real MOV{cond}/MOV pair now, never a
1856            // silent NOP again.
1857            ArmOp::Popcnt { .. } | ArmOp::SetCond { .. } | ArmOp::SelectMove { .. } => {
1858                unreachable!("handled by encode_arm_expanded (#615)")
1859            }
1860
1861            // Verification-only pseudo-ops: `synth-verify`'s ArmSemantics
1862            // models these, but NO codegen path constructs them (the selector
1863            // lowers select/locals/globals/br_table/call to real instruction
1864            // sequences before the encoder). Encoding one as a NOP silently
1865            // dropped the operation (#615 class); a typed Err keeps the
1866            // encoder total (Ok-or-Err, the `encoder_no_panic` contract)
1867            // while making any future reachability LOUD.
1868            ArmOp::Select { .. }
1869            | ArmOp::LocalGet { .. }
1870            | ArmOp::LocalSet { .. }
1871            | ArmOp::LocalTee { .. }
1872            | ArmOp::GlobalGet { .. }
1873            | ArmOp::GlobalSet { .. }
1874            | ArmOp::BrTable { .. }
1875            | ArmOp::Call { .. } => {
1876                return Err(synth_core::Error::synthesis(format!(
1877                    "verification-only pseudo-op {op:?} reached the A32 encoder — \
1878                     codegen lowers it before encoding; refusing to emit a silent NOP (#615)"
1879                )));
1880            }
1881
1882            // #594: CallIndirect is expanded to a real multi-instruction
1883            // sequence by the early return at the top of this function —
1884            // it must NEVER fall through to a silent NOP again.
1885            ArmOp::CallIndirect { .. } => {
1886                unreachable!("CallIndirect handled by encode_arm_call_indirect (#594)")
1887            }
1888
1889            // #615: every i64 op (and I32WrapI64) is expanded to a real A32
1890            // multi-instruction sequence by `encode_arm_expanded` — the
1891            // "encode as NOP for now" era ended with the value silently
1892            // vanishing on `--target cortex-r5`.
1893            ArmOp::I64Add { .. }
1894            | ArmOp::I64Sub { .. }
1895            | ArmOp::I64DivS { .. }
1896            | ArmOp::I64DivU { .. }
1897            | ArmOp::I64RemS { .. }
1898            | ArmOp::I64RemU { .. }
1899            | ArmOp::I64Clz { .. }
1900            | ArmOp::I64Ctz { .. }
1901            | ArmOp::I64Popcnt { .. }
1902            | ArmOp::I64And { .. }
1903            | ArmOp::I64Or { .. }
1904            | ArmOp::I64Xor { .. }
1905            | ArmOp::I64Eqz { .. }
1906            | ArmOp::I64Eq { .. }
1907            | ArmOp::I64Ne { .. }
1908            | ArmOp::I64LtS { .. }
1909            | ArmOp::I64LtU { .. }
1910            | ArmOp::I64LeS { .. }
1911            | ArmOp::I64LeU { .. }
1912            | ArmOp::I64GtS { .. }
1913            | ArmOp::I64GtU { .. }
1914            | ArmOp::I64GeS { .. }
1915            | ArmOp::I64GeU { .. }
1916            | ArmOp::I64Const { .. }
1917            | ArmOp::I64Ldr { .. }
1918            | ArmOp::I64Str { .. }
1919            | ArmOp::I64ExtendI32S { .. }
1920            | ArmOp::I64ExtendI32U { .. }
1921            | ArmOp::I64Extend8S { .. }
1922            | ArmOp::I64Extend16S { .. }
1923            | ArmOp::I64Extend32S { .. }
1924            | ArmOp::I32WrapI64 { .. } => {
1925                unreachable!("handled by encode_arm_expanded (#615)")
1926            }
1927
1928            // f32 VFP single-precision instructions
1929            ArmOp::F32Add { sd, sn, sm } => encode_vfp_3reg(0xEE300A00, sd, sn, sm)?,
1930            ArmOp::F32Sub { sd, sn, sm } => encode_vfp_3reg(0xEE300A40, sd, sn, sm)?,
1931            ArmOp::F32Mul { sd, sn, sm } => encode_vfp_3reg(0xEE200A00, sd, sn, sm)?,
1932            ArmOp::F32Div { sd, sn, sm } => encode_vfp_3reg(0xEE800A00, sd, sn, sm)?,
1933            ArmOp::F32Abs { sd, sm } => encode_vfp_2reg(0xEEB00AC0, sd, sm)?,
1934            ArmOp::F32Neg { sd, sm } => encode_vfp_2reg(0xEEB10A40, sd, sm)?,
1935            ArmOp::F32Sqrt { sd, sm } => encode_vfp_2reg(0xEEB10AC0, sd, sm)?,
1936
1937            // f32 pseudo-ops — multi-instruction sequences
1938            // FPSCR RMode: 00=nearest, 01=+inf(ceil), 10=-inf(floor), 11=zero(trunc)
1939            ArmOp::F32Ceil { sd, sm } => {
1940                return self.encode_arm_f32_rounding(sd, sm, 0b01); // Round toward +Inf
1941            }
1942            ArmOp::F32Floor { sd, sm } => {
1943                return self.encode_arm_f32_rounding(sd, sm, 0b10); // Round toward -Inf
1944            }
1945            ArmOp::F32Trunc { sd, sm } => {
1946                return self.encode_arm_f32_rounding(sd, sm, 0b11); // VCVT toward zero
1947            }
1948            ArmOp::F32Nearest { sd, sm } => {
1949                return self.encode_arm_f32_rounding(sd, sm, 0b00); // VCVT to nearest
1950            }
1951            ArmOp::F32Min { sd, sn, sm } => {
1952                return self.encode_arm_f32_minmax(sd, sn, sm, true);
1953            }
1954            ArmOp::F32Max { sd, sn, sm } => {
1955                return self.encode_arm_f32_minmax(sd, sn, sm, false);
1956            }
1957            ArmOp::F32Copysign { sd, sn, sm } => {
1958                return self.encode_arm_f32_copysign(sd, sn, sm);
1959            }
1960
1961            // f32 comparisons — multi-instruction: VCMP + VMRS + conditional MOV
1962            ArmOp::F32Eq { rd, sn, sm } => {
1963                return self.encode_arm_f32_compare(rd, sn, sm, 0x0); // EQ
1964            }
1965            ArmOp::F32Ne { rd, sn, sm } => {
1966                return self.encode_arm_f32_compare(rd, sn, sm, 0x1); // NE
1967            }
1968            ArmOp::F32Lt { rd, sn, sm } => {
1969                return self.encode_arm_f32_compare(rd, sn, sm, 0x4); // MI (less than)
1970            }
1971            ArmOp::F32Le { rd, sn, sm } => {
1972                return self.encode_arm_f32_compare(rd, sn, sm, 0x9); // LS (less or same)
1973            }
1974            ArmOp::F32Gt { rd, sn, sm } => {
1975                return self.encode_arm_f32_compare(rd, sn, sm, 0xC); // GT
1976            }
1977            ArmOp::F32Ge { rd, sn, sm } => {
1978                return self.encode_arm_f32_compare(rd, sn, sm, 0xA); // GE
1979            }
1980
1981            // f32 const — multi-instruction: MOVW + MOVT + VMOV
1982            ArmOp::F32Const { sd, value } => {
1983                return self.encode_arm_f32_const(sd, *value);
1984            }
1985
1986            ArmOp::F32Load { sd, addr } => encode_vfp_ldst(0xED900A00, sd, addr)?,
1987            ArmOp::F32Store { sd, addr } => encode_vfp_ldst(0xED800A00, sd, addr)?,
1988
1989            // f32 conversions — multi-instruction sequences
1990            ArmOp::F32ConvertI32S { sd, rm } => {
1991                return self.encode_arm_f32_convert_i32(sd, rm, true);
1992            }
1993            ArmOp::F32ConvertI32U { sd, rm } => {
1994                return self.encode_arm_f32_convert_i32(sd, rm, false);
1995            }
1996            ArmOp::F32ConvertI64S { .. } | ArmOp::F32ConvertI64U { .. } => {
1997                return Err(synth_core::Error::synthesis(
1998                    "F32 i64 conversion not supported (requires register pairs on 32-bit ARM)",
1999                ));
2000            }
2001            ArmOp::F32ReinterpretI32 { sd, rm } => encode_vmov_core_sreg(true, sd, rm)?,
2002            ArmOp::I32ReinterpretF32 { rd, sm } => encode_vmov_core_sreg(false, sm, rd)?,
2003            ArmOp::I32TruncF32S { rd, sm } => {
2004                return self.encode_arm_i32_trunc_f32(rd, sm, true);
2005            }
2006            ArmOp::I32TruncF32U { rd, sm } => {
2007                return self.encode_arm_i32_trunc_f32(rd, sm, false);
2008            }
2009
2010            // f64 VFP double-precision instructions (ARM32)
2011            // F64 arithmetic: same as F32 but with sz=1 (bit 8 = 1, cp11 = 0xB)
2012            ArmOp::F64Add { dd, dn, dm } => encode_vfp_3reg_f64(0xEE300B00, dd, dn, dm)?,
2013            ArmOp::F64Sub { dd, dn, dm } => encode_vfp_3reg_f64(0xEE300B40, dd, dn, dm)?,
2014            ArmOp::F64Mul { dd, dn, dm } => encode_vfp_3reg_f64(0xEE200B00, dd, dn, dm)?,
2015            ArmOp::F64Div { dd, dn, dm } => encode_vfp_3reg_f64(0xEE800B00, dd, dn, dm)?,
2016            ArmOp::F64Abs { dd, dm } => encode_vfp_2reg_f64(0xEEB00BC0, dd, dm)?,
2017            ArmOp::F64Neg { dd, dm } => encode_vfp_2reg_f64(0xEEB10B40, dd, dm)?,
2018            ArmOp::F64Sqrt { dd, dm } => encode_vfp_2reg_f64(0xEEB10BC0, dd, dm)?,
2019
2020            // f64 pseudo-ops
2021            // FPSCR RMode: 00=nearest, 01=+inf(ceil), 10=-inf(floor), 11=zero(trunc)
2022            ArmOp::F64Ceil { dd, dm } => {
2023                return self.encode_arm_f64_rounding(dd, dm, 0b01);
2024            }
2025            ArmOp::F64Floor { dd, dm } => {
2026                return self.encode_arm_f64_rounding(dd, dm, 0b10);
2027            }
2028            ArmOp::F64Trunc { dd, dm } => {
2029                return self.encode_arm_f64_rounding(dd, dm, 0b11);
2030            }
2031            ArmOp::F64Nearest { dd, dm } => {
2032                return self.encode_arm_f64_rounding(dd, dm, 0b00);
2033            }
2034            ArmOp::F64Min { dd, dn, dm } => {
2035                return self.encode_arm_f64_minmax(dd, dn, dm, true);
2036            }
2037            ArmOp::F64Max { dd, dn, dm } => {
2038                return self.encode_arm_f64_minmax(dd, dn, dm, false);
2039            }
2040            ArmOp::F64Copysign { dd, dn, dm } => {
2041                return self.encode_arm_f64_copysign(dd, dn, dm);
2042            }
2043
2044            // f64 comparisons
2045            ArmOp::F64Eq { rd, dn, dm } => {
2046                return self.encode_arm_f64_compare(rd, dn, dm, 0x0);
2047            }
2048            ArmOp::F64Ne { rd, dn, dm } => {
2049                return self.encode_arm_f64_compare(rd, dn, dm, 0x1);
2050            }
2051            ArmOp::F64Lt { rd, dn, dm } => {
2052                return self.encode_arm_f64_compare(rd, dn, dm, 0x4);
2053            }
2054            ArmOp::F64Le { rd, dn, dm } => {
2055                return self.encode_arm_f64_compare(rd, dn, dm, 0x9);
2056            }
2057            ArmOp::F64Gt { rd, dn, dm } => {
2058                return self.encode_arm_f64_compare(rd, dn, dm, 0xC);
2059            }
2060            ArmOp::F64Ge { rd, dn, dm } => {
2061                return self.encode_arm_f64_compare(rd, dn, dm, 0xA);
2062            }
2063
2064            ArmOp::F64Const { dd, value } => {
2065                return self.encode_arm_f64_const(dd, *value);
2066            }
2067
2068            ArmOp::F64Load { dd, addr } => encode_vfp_ldst_f64(0xED900B00, dd, addr)?,
2069            ArmOp::F64Store { dd, addr } => encode_vfp_ldst_f64(0xED800B00, dd, addr)?,
2070
2071            ArmOp::F64ConvertI32S { dd, rm } => {
2072                return self.encode_arm_f64_convert_i32(dd, rm, true);
2073            }
2074            ArmOp::F64ConvertI32U { dd, rm } => {
2075                return self.encode_arm_f64_convert_i32(dd, rm, false);
2076            }
2077            ArmOp::F64ConvertI64S { .. } | ArmOp::F64ConvertI64U { .. } => {
2078                return Err(synth_core::Error::synthesis(
2079                    "F64 i64 conversion not supported (requires register pairs on 32-bit ARM)",
2080                ));
2081            }
2082            ArmOp::F64PromoteF32 { dd, sm } => {
2083                return self.encode_arm_f64_promote_f32(dd, sm);
2084            }
2085            // GI-FPU-002 (#369): no synth A32 target carries an FPU (cortex-r5
2086            // has none — the selector declines every float op there), so the
2087            // A32 encoder refuses loudly instead of shipping an untested
2088            // encoding (#615: never a silent wrong byte).
2089            ArmOp::F32DemoteF64 { .. } => {
2090                return Err(synth_core::Error::synthesis(
2091                    "F32DemoteF64 has no A32 encoding (no A32 target has an FPU)",
2092                ));
2093            }
2094            ArmOp::F64ReinterpretI64 { dd, rmlo, rmhi } => {
2095                encode_vmov_core_dreg(true, dd, rmlo, rmhi)?
2096            }
2097            ArmOp::I64ReinterpretF64 { rdlo, rdhi, dm } => {
2098                encode_vmov_core_dreg(false, dm, rdlo, rdhi)?
2099            }
2100            ArmOp::I64TruncF64S { .. } | ArmOp::I64TruncF64U { .. } => {
2101                return Err(synth_core::Error::synthesis(
2102                    "i64 truncation from F64 not supported (requires i64 register pairs on 32-bit ARM)",
2103                ));
2104            }
2105            ArmOp::I32TruncF64S { rd, dm } => {
2106                return self.encode_arm_i32_trunc_f64(rd, dm, true);
2107            }
2108            ArmOp::I32TruncF64U { rd, dm } => {
2109                return self.encode_arm_i32_trunc_f64(rd, dm, false);
2110            }
2111            // #615: multi-instruction i64 sequences — expanded to real A32 by
2112            // `encode_arm_expanded`, no longer "Thumb-2 only" NOPs.
2113            ArmOp::I64SetCond { .. }
2114            | ArmOp::I64SetCondZ { .. }
2115            | ArmOp::I64Mul { .. }
2116            | ArmOp::I64Shl { .. }
2117            | ArmOp::I64ShrS { .. }
2118            | ArmOp::I64ShrU { .. }
2119            | ArmOp::I64Rotl { .. }
2120            | ArmOp::I64Rotr { .. } => {
2121                unreachable!("handled by encode_arm_expanded (#615)")
2122            }
2123
2124            // MVE instructions — Thumb-2 only (Cortex-M55 is always Thumb-2)
2125            ArmOp::MveLoad { .. }
2126            | ArmOp::MveStore { .. }
2127            | ArmOp::MveConst { .. }
2128            | ArmOp::MveAnd { .. }
2129            | ArmOp::MveOrr { .. }
2130            | ArmOp::MveEor { .. }
2131            | ArmOp::MveMvn { .. }
2132            | ArmOp::MveBic { .. }
2133            | ArmOp::MveAddI { .. }
2134            | ArmOp::MveSubI { .. }
2135            | ArmOp::MveMulI { .. }
2136            | ArmOp::MveNegI { .. }
2137            | ArmOp::MveCmpEqI { .. }
2138            | ArmOp::MveCmpNeI { .. }
2139            | ArmOp::MveCmpLtS { .. }
2140            | ArmOp::MveCmpLtU { .. }
2141            | ArmOp::MveCmpGtS { .. }
2142            | ArmOp::MveCmpGtU { .. }
2143            | ArmOp::MveCmpLeS { .. }
2144            | ArmOp::MveCmpLeU { .. }
2145            | ArmOp::MveCmpGeS { .. }
2146            | ArmOp::MveCmpGeU { .. }
2147            | ArmOp::MveDup { .. }
2148            | ArmOp::MveExtractLane { .. }
2149            | ArmOp::MveInsertLane { .. }
2150            | ArmOp::MveAddF32 { .. }
2151            | ArmOp::MveSubF32 { .. }
2152            | ArmOp::MveMulF32 { .. }
2153            | ArmOp::MveNegF32 { .. }
2154            | ArmOp::MveAbsF32 { .. }
2155            | ArmOp::MveCmpEqF32 { .. }
2156            | ArmOp::MveCmpNeF32 { .. }
2157            | ArmOp::MveCmpLtF32 { .. }
2158            | ArmOp::MveCmpLeF32 { .. }
2159            | ArmOp::MveCmpGtF32 { .. }
2160            | ArmOp::MveCmpGeF32 { .. }
2161            | ArmOp::MveDupF32 { .. }
2162            | ArmOp::MveExtractLaneF32 { .. }
2163            | ArmOp::MveReplaceLaneF32 { .. }
2164            | ArmOp::MveDivF32 { .. }
2165            | ArmOp::MveSqrtF32 { .. } => {
2166                // MVE (Helium) is a Thumb-2-only extension (Cortex-M55); there
2167                // is no A32 encoding. The selector only emits MVE ops for
2168                // Thumb targets — a NOP here silently dropped the vector op
2169                // if that invariant ever broke (#615 class). Err keeps the
2170                // encoder total and the failure loud.
2171                return Err(synth_core::Error::synthesis(format!(
2172                    "MVE op {op:?} has no A32 (ARM-mode) encoding — MVE is Thumb-2 only (#615)"
2173                )));
2174            }
2175        };
2176
2177        // ARM32 instructions are little-endian
2178        Ok(instr.to_le_bytes().to_vec())
2179    }
2180
2181    // === ARM32 VFP multi-instruction helpers ===
2182
2183    /// Encode F32 comparison as ARM32: VCMP.F32 + VMRS + MOV rd,#0 + MOVcond rd,#1
2184    fn encode_arm_f32_compare(
2185        &self,
2186        rd: &Reg,
2187        sn: &VfpReg,
2188        sm: &VfpReg,
2189        cond_code: u32,
2190    ) -> Result<Vec<u8>> {
2191        let mut bytes = Vec::new();
2192
2193        // VCMP.F32 Sn, Sm: 0xEEB40A40 with Sn in Vd position, Sm in Vm position
2194        let sn_num = vfp_sreg_to_num(sn)?;
2195        let sm_num = vfp_sreg_to_num(sm)?;
2196        let (vd, d) = encode_sreg(sn_num);
2197        let (vm, m) = encode_sreg(sm_num);
2198        let vcmp = 0xEEB40A40 | (d << 22) | (vd << 12) | (m << 5) | vm;
2199        bytes.extend_from_slice(&vcmp.to_le_bytes());
2200
2201        // VMRS APSR_nzcv, FPSCR: 0xEEF1FA10
2202        bytes.extend_from_slice(&0xEEF1FA10u32.to_le_bytes());
2203
2204        // MOV rd, #0: 0xE3A0_0000 | (rd << 12)
2205        let rd_bits = reg_to_bits(rd);
2206        let mov_zero = 0xE3A00000 | (rd_bits << 12);
2207        bytes.extend_from_slice(&mov_zero.to_le_bytes());
2208
2209        // MOVcond rd, #1: cond(4) | 0011 1010 0000 rd(4) 0000 0000 0001
2210        let mov_one = (cond_code << 28) | 0x03A00001 | (rd_bits << 12);
2211        bytes.extend_from_slice(&mov_one.to_le_bytes());
2212
2213        Ok(bytes)
2214    }
2215
2216    /// Encode F32 constant load as ARM32: MOVW Rt,#lo16 + MOVT Rt,#hi16 + VMOV Sd,Rt
2217    fn encode_arm_f32_const(&self, sd: &VfpReg, value: f32) -> Result<Vec<u8>> {
2218        let mut bytes = Vec::new();
2219        let bits = value.to_bits();
2220
2221        // Use R12 as temp register for constant loading
2222        let rt: u32 = 12; // R12/IP
2223
2224        // MOVW R12, #lo16: 0xE300_C000 | (imm4 << 16) | imm12
2225        let lo16 = bits & 0xFFFF;
2226        let movw = 0xE3000000 | (rt << 12) | ((lo16 >> 12) << 16) | (lo16 & 0xFFF);
2227        bytes.extend_from_slice(&movw.to_le_bytes());
2228
2229        // MOVT R12, #hi16: 0xE340_C000 | (imm4 << 16) | imm12
2230        let hi16 = (bits >> 16) & 0xFFFF;
2231        let movt = 0xE3400000 | (rt << 12) | ((hi16 >> 12) << 16) | (hi16 & 0xFFF);
2232        bytes.extend_from_slice(&movt.to_le_bytes());
2233
2234        // VMOV Sd, R12
2235        let vmov = encode_vmov_core_sreg(true, sd, &Reg::R12)?;
2236        bytes.extend_from_slice(&vmov.to_le_bytes());
2237
2238        Ok(bytes)
2239    }
2240
2241    /// Encode VMOV + VCVT.F32.S32/U32 as ARM32
2242    fn encode_arm_f32_convert_i32(&self, sd: &VfpReg, rm: &Reg, signed: bool) -> Result<Vec<u8>> {
2243        let mut bytes = Vec::new();
2244
2245        // VMOV Sd, Rm — move integer to VFP register
2246        let vmov = encode_vmov_core_sreg(true, sd, rm)?;
2247        bytes.extend_from_slice(&vmov.to_le_bytes());
2248
2249        // VCVT.F32.S32 Sd, Sd (signed) or VCVT.F32.U32 Sd, Sd (unsigned).
2250        // The "op" bit (bit 7) selects signedness: 1 = signed (S32), 0 =
2251        // unsigned (U32). So signed = 0xEEB80AC0, unsigned = 0xEEB80A40 —
2252        // objdump confirms 0xEEB80A40 decodes to `vcvt.f32.u32` (GI-FPU-002:
2253        // the two were previously swapped, silently making `convert_i32_s`
2254        // an unsigned conversion).
2255        let sd_num = vfp_sreg_to_num(sd)?;
2256        let (vd, d) = encode_sreg(sd_num);
2257        let (vm, m) = encode_sreg(sd_num); // same register as source
2258        let base = if signed { 0xEEB80AC0 } else { 0xEEB80A40 };
2259        let vcvt = base | (d << 22) | (vd << 12) | (m << 5) | vm;
2260        bytes.extend_from_slice(&vcvt.to_le_bytes());
2261
2262        Ok(bytes)
2263    }
2264
2265    /// Encode F32 rounding pseudo-op as ARM32 via VCVT to integer and back.
2266    /// mode: 0b00=nearest, 0b01=floor(-Inf), 0b10=ceil(+Inf), 0b11=trunc(zero)
2267    /// Strategy: VCVT.S32.F32 Sd, Sm (toward zero), then VCVT.F32.S32 Sd, Sd
2268    /// For ceil/floor/nearest, we use VCVTR (round toward mode) + convert back.
2269    /// Simplified: convert to int (toward zero for trunc) then back to float.
2270    /// Encode F32 rounding as ARM32.
2271    /// `mode`: FPSCR RMode — 0b00=nearest, 0b01=+inf(ceil), 0b10=-inf(floor), 0b11=zero(trunc)
2272    ///
2273    /// For trunc (mode=0b11): uses VCVTR.S32.F32 (always rounds toward zero).
2274    /// For ceil/floor/nearest: sets FPSCR rounding mode, uses VCVT.S32.F32 (non-R variant
2275    /// which honours FPSCR rmode), then restores FPSCR.
2276    fn encode_arm_f32_rounding(&self, sd: &VfpReg, sm: &VfpReg, mode: u8) -> Result<Vec<u8>> {
2277        let mut bytes = Vec::new();
2278        let sm_num = vfp_sreg_to_num(sm)?;
2279        let sd_num = vfp_sreg_to_num(sd)?;
2280        let (vd_s, d_s) = encode_sreg(sd_num);
2281        let (vm_s, m_s) = encode_sreg(sm_num);
2282
2283        if mode == 0b11 {
2284            // Trunc (toward zero): VCVTR.S32.F32 — the "R" variant always truncates.
2285            // 0xEEBD0AC0: bit[7]=1 => round toward zero regardless of FPSCR
2286            let vcvt_to_int = 0xEEBD0AC0 | (d_s << 22) | (vd_s << 12) | (m_s << 5) | vm_s;
2287            bytes.extend_from_slice(&vcvt_to_int.to_le_bytes());
2288        } else {
2289            // ceil/floor/nearest: manipulate FPSCR rounding mode
2290            let rt: u32 = 12; // R12/IP as temp
2291
2292            // VMRS R12, FPSCR
2293            let vmrs = 0xEEF10A10 | (rt << 12);
2294            bytes.extend_from_slice(&vmrs.to_le_bytes());
2295
2296            // BIC R12, R12, #(3 << 22) — clear RMode bits [23:22]
2297            // 3<<22 = 0x00C00000. ARM rotated imm: 0x03 ror 10 (rotation=5, imm8=0x03)
2298            let bic = 0xE3CC0000 | (rt << 12) | (0x05 << 8) | 0x03;
2299            bytes.extend_from_slice(&bic.to_le_bytes());
2300
2301            // ORR R12, R12, #(mode << 22) — set desired rounding mode
2302            if mode != 0 {
2303                // mode<<22: rotation=5, imm8=mode
2304                let orr = 0xE38C0000 | (rt << 12) | (0x05 << 8) | (mode as u32);
2305                bytes.extend_from_slice(&orr.to_le_bytes());
2306            }
2307
2308            // VMSR FPSCR, R12
2309            let vmsr = 0xEEE10A10 | (rt << 12);
2310            bytes.extend_from_slice(&vmsr.to_le_bytes());
2311
2312            // VCVT.S32.F32 Sd, Sm — non-R variant (bit[7]=0), uses FPSCR rounding mode
2313            let vcvt_to_int = 0xEEBD0A40 | (d_s << 22) | (vd_s << 12) | (m_s << 5) | vm_s;
2314            bytes.extend_from_slice(&vcvt_to_int.to_le_bytes());
2315
2316            // Restore FPSCR: clear rmode bits back to nearest (default)
2317            bytes.extend_from_slice(&vmrs.to_le_bytes());
2318            bytes.extend_from_slice(&bic.to_le_bytes());
2319            bytes.extend_from_slice(&vmsr.to_le_bytes());
2320        }
2321
2322        // VCVT.F32.S32 Sd, Sd (convert integer result back to float)
2323        let (vd2, d2) = encode_sreg(sd_num);
2324        let vcvt_to_float = 0xEEB80A40 | (d2 << 22) | (vd2 << 12) | (d_s << 5) | vd_s;
2325        bytes.extend_from_slice(&vcvt_to_float.to_le_bytes());
2326
2327        Ok(bytes)
2328    }
2329
2330    /// Encode F32 min/max as ARM32: VCMP + VMRS + conditional VMOV
2331    fn encode_arm_f32_minmax(
2332        &self,
2333        sd: &VfpReg,
2334        sn: &VfpReg,
2335        sm: &VfpReg,
2336        is_min: bool,
2337    ) -> Result<Vec<u8>> {
2338        let mut bytes = Vec::new();
2339        let sn_num = vfp_sreg_to_num(sn)?;
2340        let sm_num = vfp_sreg_to_num(sm)?;
2341        let sd_num = vfp_sreg_to_num(sd)?;
2342
2343        // VMOV Sd, Sn (start with first operand)
2344        let (vd, d) = encode_sreg(sd_num);
2345        let (vn, n) = encode_sreg(sn_num);
2346        let vmov_sn = 0xEEB00A40 | (d << 22) | (vd << 12) | (n << 5) | vn;
2347        bytes.extend_from_slice(&vmov_sn.to_le_bytes());
2348
2349        // VCMP.F32 Sn, Sm
2350        let (vm, m) = encode_sreg(sm_num);
2351        let vcmp = 0xEEB40A40 | (n << 22) | (vn << 12) | (m << 5) | vm;
2352        bytes.extend_from_slice(&vcmp.to_le_bytes());
2353
2354        // VMRS APSR_nzcv, FPSCR
2355        bytes.extend_from_slice(&0xEEF1FA10u32.to_le_bytes());
2356
2357        // For min: if Sn > Sm (GT), use Sm. Condition = GT (0xC)
2358        // For max: if Sn < Sm (MI/LT), use Sm. Condition = MI (0x4)
2359        let cond = if is_min { 0xCu32 } else { 0x4u32 };
2360
2361        // VMOV{cond} Sd, Sm — conditional VMOV
2362        let vmov_cond = (cond << 28) | 0x0EB00A40 | (d << 22) | (vd << 12) | (m << 5) | vm;
2363        bytes.extend_from_slice(&vmov_cond.to_le_bytes());
2364
2365        Ok(bytes)
2366    }
2367
2368    /// Encode F32 copysign as ARM32: extract sign from Sm, magnitude from Sn
2369    fn encode_arm_f32_copysign(&self, sd: &VfpReg, sn: &VfpReg, sm: &VfpReg) -> Result<Vec<u8>> {
2370        let mut bytes = Vec::new();
2371
2372        // VMOV R12, Sm (get sign source bits)
2373        let vmov_sm = encode_vmov_core_sreg(false, sm, &Reg::R12)?;
2374        bytes.extend_from_slice(&vmov_sm.to_le_bytes());
2375
2376        // VMOV R0, Sn (get magnitude source bits) — use R0 as temp
2377        let vmov_sn = encode_vmov_core_sreg(false, sn, &Reg::R0)?;
2378        bytes.extend_from_slice(&vmov_sn.to_le_bytes());
2379
2380        // AND R12, R12, #0x80000000 (keep only sign bit)
2381        // Thumb-2 constant 0x80000000 needs special encoding; in ARM32 use rotated imm
2382        // 0x80000000 = 0x02 rotated right by 2 (rotation=1, imm8=0x02)
2383        let and_sign = 0xE2000000u32 | (12 << 16) | (12 << 12) | (1 << 8) | 0x02;
2384        bytes.extend_from_slice(&and_sign.to_le_bytes());
2385
2386        // BIC R0, R0, #0x80000000 (clear sign bit from magnitude)
2387        // R0 = register 0, so Rn and Rd fields are 0
2388        let bic_sign = 0xE3C00000u32 | (1 << 8) | 0x02;
2389        bytes.extend_from_slice(&bic_sign.to_le_bytes());
2390
2391        // ORR R0, R0, R12 (combine sign + magnitude)
2392        // R0 = register 0, so Rn and Rd fields are 0
2393        let orr = 0xE1800000u32 | 12;
2394        bytes.extend_from_slice(&orr.to_le_bytes());
2395
2396        // VMOV Sd, R0
2397        let vmov_result = encode_vmov_core_sreg(true, sd, &Reg::R0)?;
2398        bytes.extend_from_slice(&vmov_result.to_le_bytes());
2399
2400        Ok(bytes)
2401    }
2402
2403    /// Encode F64 comparison as ARM32: VCMP.F64 + VMRS + MOV rd,#0 + MOVcond rd,#1
2404    fn encode_arm_f64_compare(
2405        &self,
2406        rd: &Reg,
2407        dn: &VfpReg,
2408        dm: &VfpReg,
2409        cond_code: u32,
2410    ) -> Result<Vec<u8>> {
2411        let mut bytes = Vec::new();
2412
2413        // VCMP.F64 Dn, Dm: 0xEEB40B40 with Dn in Vd position, Dm in Vm position
2414        let dn_num = vfp_dreg_to_num(dn)?;
2415        let dm_num = vfp_dreg_to_num(dm)?;
2416        let (vd, d) = encode_dreg(dn_num);
2417        let (vm, m) = encode_dreg(dm_num);
2418        let vcmp = 0xEEB40B40 | (d << 22) | (vd << 12) | (m << 5) | vm;
2419        bytes.extend_from_slice(&vcmp.to_le_bytes());
2420
2421        // VMRS APSR_nzcv, FPSCR
2422        bytes.extend_from_slice(&0xEEF1FA10u32.to_le_bytes());
2423
2424        // MOV rd, #0
2425        let rd_bits = reg_to_bits(rd);
2426        let mov_zero = 0xE3A00000 | (rd_bits << 12);
2427        bytes.extend_from_slice(&mov_zero.to_le_bytes());
2428
2429        // MOVcond rd, #1
2430        let mov_one = (cond_code << 28) | 0x03A00001 | (rd_bits << 12);
2431        bytes.extend_from_slice(&mov_one.to_le_bytes());
2432
2433        Ok(bytes)
2434    }
2435
2436    /// Encode F64 constant load as ARM32: MOVW + MOVT + MOVW + MOVT + VMOV
2437    fn encode_arm_f64_const(&self, dd: &VfpReg, value: f64) -> Result<Vec<u8>> {
2438        let mut bytes = Vec::new();
2439        let bits = value.to_bits();
2440        let lo32 = bits as u32;
2441        let hi32 = (bits >> 32) as u32;
2442
2443        // Load low 32 bits into R0 (Rd field = 0 for R0)
2444        let lo16 = lo32 & 0xFFFF;
2445        let movw_r0 = 0xE3000000 | ((lo16 >> 12) << 16) | (lo16 & 0xFFF);
2446        bytes.extend_from_slice(&movw_r0.to_le_bytes());
2447        let hi16 = (lo32 >> 16) & 0xFFFF;
2448        let movt_r0 = 0xE3400000 | ((hi16 >> 12) << 16) | (hi16 & 0xFFF);
2449        bytes.extend_from_slice(&movt_r0.to_le_bytes());
2450
2451        // Load high 32 bits into R12
2452        let lo16 = hi32 & 0xFFFF;
2453        let movw_r12 = 0xE3000000 | ((lo16 >> 12) << 16) | (12 << 12) | (lo16 & 0xFFF);
2454        bytes.extend_from_slice(&movw_r12.to_le_bytes());
2455        let hi16 = (hi32 >> 16) & 0xFFFF;
2456        let movt_r12 = 0xE3400000 | ((hi16 >> 12) << 16) | (12 << 12) | (hi16 & 0xFFF);
2457        bytes.extend_from_slice(&movt_r12.to_le_bytes());
2458
2459        // VMOV Dd, R0, R12
2460        let vmov = encode_vmov_core_dreg(true, dd, &Reg::R0, &Reg::R12)?;
2461        bytes.extend_from_slice(&vmov.to_le_bytes());
2462
2463        Ok(bytes)
2464    }
2465
2466    /// Encode VMOV Sd, Rm + VCVT.F64.S32/U32 Dd, Sd as ARM32
2467    fn encode_arm_f64_convert_i32(&self, dd: &VfpReg, rm: &Reg, signed: bool) -> Result<Vec<u8>> {
2468        let mut bytes = Vec::new();
2469
2470        // Use S0 as intermediate: VMOV S0, Rm
2471        let vmov = encode_vmov_core_sreg(true, &VfpReg::S0, rm)?;
2472        bytes.extend_from_slice(&vmov.to_le_bytes());
2473
2474        // VCVT.F64.S32 Dd, S0 (signed) or VCVT.F64.U32 Dd, S0 (unsigned)
2475        // Base: 0xEEB80B40 (signed) or 0xEEB80BC0 (unsigned)
2476        let dd_num = vfp_dreg_to_num(dd)?;
2477        let (vd, d) = encode_dreg(dd_num);
2478        let base = if signed { 0xEEB80B40 } else { 0xEEB80BC0 };
2479        // S0 is register 0: Vm=0, M=0
2480        let vcvt = base | (d << 22) | (vd << 12);
2481        bytes.extend_from_slice(&vcvt.to_le_bytes());
2482
2483        Ok(bytes)
2484    }
2485
2486    /// Encode VCVT.F64.F32 Dd, Sm as ARM32 (f32 to f64 promotion)
2487    fn encode_arm_f64_promote_f32(&self, dd: &VfpReg, sm: &VfpReg) -> Result<Vec<u8>> {
2488        let dd_num = vfp_dreg_to_num(dd)?;
2489        let sm_num = vfp_sreg_to_num(sm)?;
2490        let (vd, d) = encode_dreg(dd_num);
2491        let (vm, m) = encode_sreg(sm_num);
2492
2493        // VCVT.F64.F32 Dd, Sm: 0xEEB70AC0
2494        let vcvt = 0xEEB70AC0 | (d << 22) | (vd << 12) | (m << 5) | vm;
2495        Ok(vcvt.to_le_bytes().to_vec())
2496    }
2497
2498    /// Encode VCVT.S32/U32.F64 Sd, Dm + VMOV Rd, Sd as ARM32
2499    fn encode_arm_i32_trunc_f64(&self, rd: &Reg, dm: &VfpReg, signed: bool) -> Result<Vec<u8>> {
2500        let mut bytes = Vec::new();
2501        let dm_num = vfp_dreg_to_num(dm)?;
2502        let (vm, m) = encode_dreg(dm_num);
2503
2504        // VCVT.S32.F64 S0, Dm (toward zero) or VCVT.U32.F64 S0, Dm
2505        // S0: Vd=0, D=0
2506        let base = if signed { 0xEEBD0BC0 } else { 0xEEBC0BC0 };
2507        let vcvt = base | (m << 5) | vm;
2508        bytes.extend_from_slice(&vcvt.to_le_bytes());
2509
2510        // VMOV Rd, S0
2511        let vmov = encode_vmov_core_sreg(false, &VfpReg::S0, rd)?;
2512        bytes.extend_from_slice(&vmov.to_le_bytes());
2513
2514        Ok(bytes)
2515    }
2516
2517    /// Encode F64 rounding pseudo-op as ARM32 via VCVT to integer and back.
2518    /// Encode F64 rounding as ARM32.
2519    /// `mode`: FPSCR RMode — 0b00=nearest, 0b01=+inf(ceil), 0b10=-inf(floor), 0b11=zero(trunc)
2520    ///
2521    /// For trunc: uses VCVTR.S32.F64 (always truncates).
2522    /// For ceil/floor/nearest: sets FPSCR rounding mode, uses VCVT.S32.F64 (non-R variant),
2523    /// then restores FPSCR.
2524    fn encode_arm_f64_rounding(&self, dd: &VfpReg, dm: &VfpReg, mode: u8) -> Result<Vec<u8>> {
2525        let mut bytes = Vec::new();
2526        let dm_num = vfp_dreg_to_num(dm)?;
2527        let dd_num = vfp_dreg_to_num(dd)?;
2528        let (vm, m) = encode_dreg(dm_num);
2529        let (vd, d) = encode_dreg(dd_num);
2530
2531        if mode == 0b11 {
2532            // Trunc (toward zero): VCVTR.S32.F64 — bit[7]=1, always truncates
2533            let vcvt_to_int = 0xEEBD0BC0 | (m << 5) | vm;
2534            bytes.extend_from_slice(&vcvt_to_int.to_le_bytes());
2535        } else {
2536            // ceil/floor/nearest: manipulate FPSCR rounding mode
2537            let rt: u32 = 12;
2538
2539            // VMRS R12, FPSCR
2540            let vmrs = 0xEEF10A10 | (rt << 12);
2541            bytes.extend_from_slice(&vmrs.to_le_bytes());
2542
2543            // BIC R12, R12, #(3 << 22)
2544            let bic = 0xE3CC0000 | (rt << 12) | (0x05 << 8) | 0x03;
2545            bytes.extend_from_slice(&bic.to_le_bytes());
2546
2547            // ORR R12, R12, #(mode << 22)
2548            if mode != 0 {
2549                let orr = 0xE38C0000 | (rt << 12) | (0x05 << 8) | (mode as u32);
2550                bytes.extend_from_slice(&orr.to_le_bytes());
2551            }
2552
2553            // VMSR FPSCR, R12
2554            let vmsr = 0xEEE10A10 | (rt << 12);
2555            bytes.extend_from_slice(&vmsr.to_le_bytes());
2556
2557            // VCVT.S32.F64 S0, Dm — non-R variant (bit[7]=0), uses FPSCR rmode
2558            let vcvt_to_int = 0xEEBD0B40 | (m << 5) | vm;
2559            bytes.extend_from_slice(&vcvt_to_int.to_le_bytes());
2560
2561            // Restore FPSCR
2562            bytes.extend_from_slice(&vmrs.to_le_bytes());
2563            bytes.extend_from_slice(&bic.to_le_bytes());
2564            bytes.extend_from_slice(&vmsr.to_le_bytes());
2565        }
2566
2567        // VCVT.F64.S32 Dd, S0 (convert back to double)
2568        let vcvt_to_float = 0xEEB80B40 | (d << 22) | (vd << 12);
2569        bytes.extend_from_slice(&vcvt_to_float.to_le_bytes());
2570
2571        Ok(bytes)
2572    }
2573
2574    /// Encode F64 min/max as ARM32: VMOV + VCMP + VMRS + conditional VMOV
2575    fn encode_arm_f64_minmax(
2576        &self,
2577        dd: &VfpReg,
2578        dn: &VfpReg,
2579        dm: &VfpReg,
2580        is_min: bool,
2581    ) -> Result<Vec<u8>> {
2582        let mut bytes = Vec::new();
2583        let dn_num = vfp_dreg_to_num(dn)?;
2584        let dm_num = vfp_dreg_to_num(dm)?;
2585        let dd_num = vfp_dreg_to_num(dd)?;
2586
2587        // VMOV.F64 Dd, Dn (start with first operand)
2588        let (vd, d) = encode_dreg(dd_num);
2589        let (vn, n) = encode_dreg(dn_num);
2590        let vmov_dn = 0xEEB00B40 | (d << 22) | (vd << 12) | (n << 5) | vn;
2591        bytes.extend_from_slice(&vmov_dn.to_le_bytes());
2592
2593        // VCMP.F64 Dn, Dm
2594        let (vm, m) = encode_dreg(dm_num);
2595        let vcmp = 0xEEB40B40 | (n << 22) | (vn << 12) | (m << 5) | vm;
2596        bytes.extend_from_slice(&vcmp.to_le_bytes());
2597
2598        // VMRS APSR_nzcv, FPSCR
2599        bytes.extend_from_slice(&0xEEF1FA10u32.to_le_bytes());
2600
2601        let cond = if is_min { 0xCu32 } else { 0x4u32 };
2602        let vmov_cond = (cond << 28) | 0x0EB00B40 | (d << 22) | (vd << 12) | (m << 5) | vm;
2603        bytes.extend_from_slice(&vmov_cond.to_le_bytes());
2604
2605        Ok(bytes)
2606    }
2607
2608    /// Encode F64 copysign as ARM32
2609    fn encode_arm_f64_copysign(&self, dd: &VfpReg, dn: &VfpReg, dm: &VfpReg) -> Result<Vec<u8>> {
2610        let mut bytes = Vec::new();
2611
2612        // VMOV R0, R12, Dm (get sign source bits)
2613        let vmov_dm = encode_vmov_core_dreg(false, dm, &Reg::R0, &Reg::R12)?;
2614        bytes.extend_from_slice(&vmov_dm.to_le_bytes());
2615
2616        // VMOV R1, R2, Dn (get magnitude source bits)
2617        // We use R1 (lo) and R2 (hi) for the magnitude
2618        let vmov_dn = encode_vmov_core_dreg(false, dn, &Reg::R1, &Reg::R2)?;
2619        bytes.extend_from_slice(&vmov_dn.to_le_bytes());
2620
2621        // AND R12, R12, #0x80000000 (keep only sign bit from hi word)
2622        let and_sign = 0xE2000000u32 | (12 << 16) | (12 << 12) | (1 << 8) | 0x02;
2623        bytes.extend_from_slice(&and_sign.to_le_bytes());
2624
2625        // BIC R2, R2, #0x80000000 (clear sign bit from magnitude hi word)
2626        let bic_sign = 0xE3C00000u32 | (2 << 16) | (2 << 12) | (1 << 8) | 0x02;
2627        bytes.extend_from_slice(&bic_sign.to_le_bytes());
2628
2629        // ORR R2, R2, R12 (combine sign + magnitude)
2630        let orr = 0xE1800000u32 | (2 << 16) | (2 << 12) | 12;
2631        bytes.extend_from_slice(&orr.to_le_bytes());
2632
2633        // VMOV Dd, R1, R2
2634        let vmov_result = encode_vmov_core_dreg(true, dd, &Reg::R1, &Reg::R2)?;
2635        bytes.extend_from_slice(&vmov_result.to_le_bytes());
2636
2637        Ok(bytes)
2638    }
2639
2640    /// Encode VCVT.S32/U32.F32 + VMOV as ARM32
2641    fn encode_arm_i32_trunc_f32(&self, rd: &Reg, sm: &VfpReg, signed: bool) -> Result<Vec<u8>> {
2642        let mut bytes = Vec::new();
2643
2644        // VCVT.S32.F32 Sd, Sm (toward zero) or VCVT.U32.F32 Sd, Sm
2645        // We use Sm as both source and destination for the intermediate result
2646        let sm_num = vfp_sreg_to_num(sm)?;
2647        let (vd, d) = encode_sreg(sm_num);
2648        let (vm, m) = encode_sreg(sm_num);
2649        let base = if signed { 0xEEBD0AC0 } else { 0xEEBC0AC0 };
2650        let vcvt = base | (d << 22) | (vd << 12) | (m << 5) | vm;
2651        bytes.extend_from_slice(&vcvt.to_le_bytes());
2652
2653        // VMOV Rd, Sm — move result back to core register
2654        let vmov = encode_vmov_core_sreg(false, sm, rd)?;
2655        bytes.extend_from_slice(&vmov.to_le_bytes());
2656
2657        Ok(bytes)
2658    }
2659
2660    /// Encode an ARM instruction in Thumb-2 mode (16-bit or 32-bit instructions)
2661    fn encode_thumb(&self, op: &ArmOp) -> Result<Vec<u8>> {
2662        // Thumb-2 supports both 16-bit and 32-bit instructions
2663        // 32-bit instructions are encoded as two 16-bit halfwords (big-endian order)
2664        match op {
2665            // === 16-bit Thumb encodings ===
2666            ArmOp::Add { rd, rn, op2 } => {
2667                let rd_bits = reg_to_bits(rd) as u16;
2668                let rn_bits = reg_to_bits(rn) as u16;
2669
2670                if let Operand2::Reg(rm) = op2 {
2671                    let rm_bits = reg_to_bits(rm) as u16;
2672                    // 16-bit ADDS only has 3-bit register fields (R0-R7). For
2673                    // high registers (e.g. R12, the MemLoad/MemStore base
2674                    // scratch) the bits overflow into adjacent fields, silently
2675                    // corrupting the operands — issue #178/#180: `add ip,ip,r0`
2676                    // was emitted as `adds r4,r5,r1`. Guard on all three regs
2677                    // being low and fall back to 32-bit ADD.W otherwise, exactly
2678                    // as the Sub handler below does.
2679                    if rd_bits < 8 && rn_bits < 8 && rm_bits < 8 {
2680                        // ADDS Rd, Rn, Rm (16-bit): 0001 100 Rm Rn Rd
2681                        let instr: u16 = 0x1800 | (rm_bits << 6) | (rn_bits << 3) | rd_bits;
2682                        Ok(instr.to_le_bytes().to_vec())
2683                    } else {
2684                        // ADD.W Rd, Rn, Rm (32-bit) for high registers
2685                        self.encode_thumb32_add_reg_raw(
2686                            rd_bits as u32,
2687                            rn_bits as u32,
2688                            rm_bits as u32,
2689                        )
2690                    }
2691                } else if let Operand2::Imm(imm) = op2 {
2692                    if *imm <= 7 && rd_bits < 8 && rn_bits < 8 {
2693                        // ADDS Rd, Rn, #imm3 (16-bit): 0001 110 imm3 Rn Rd
2694                        let instr: u16 = 0x1C00 | ((*imm as u16) << 6) | (rn_bits << 3) | rd_bits;
2695                        Ok(instr.to_le_bytes().to_vec())
2696                    } else {
2697                        // Use 32-bit ADD for larger immediates
2698                        self.encode_thumb32_add(rd, rn, *imm as u32)
2699                    }
2700                } else {
2701                    // Fallback to 32-bit encoding
2702                    self.encode_thumb32_add(rd, rn, 0)
2703                }
2704            }
2705
2706            ArmOp::Sub { rd, rn, op2 } => {
2707                let rd_bits = reg_to_bits(rd) as u16;
2708                let rn_bits = reg_to_bits(rn) as u16;
2709
2710                if let Operand2::Reg(rm) = op2 {
2711                    let rm_bits = reg_to_bits(rm) as u16;
2712                    // 16-bit SUBS can only use low registers (R0-R7)
2713                    if rd_bits < 8 && rn_bits < 8 && rm_bits < 8 {
2714                        // SUBS Rd, Rn, Rm (16-bit): 0001 101 Rm Rn Rd
2715                        let instr: u16 = 0x1A00 | (rm_bits << 6) | (rn_bits << 3) | rd_bits;
2716                        Ok(instr.to_le_bytes().to_vec())
2717                    } else {
2718                        // Use 32-bit SUB.W for high registers
2719                        self.encode_thumb32_sub_reg_raw(
2720                            rd_bits as u32,
2721                            rn_bits as u32,
2722                            rm_bits as u32,
2723                        )
2724                    }
2725                } else if let Operand2::Imm(imm) = op2 {
2726                    if *imm <= 7 && rd_bits < 8 && rn_bits < 8 {
2727                        // SUBS Rd, Rn, #imm3 (16-bit): 0001 111 imm3 Rn Rd
2728                        let instr: u16 = 0x1E00 | ((*imm as u16) << 6) | (rn_bits << 3) | rd_bits;
2729                        Ok(instr.to_le_bytes().to_vec())
2730                    } else {
2731                        self.encode_thumb32_sub(rd, rn, *imm as u32)
2732                    }
2733                } else {
2734                    self.encode_thumb32_sub(rd, rn, 0)
2735                }
2736            }
2737
2738            ArmOp::Mov { rd, op2 } => {
2739                let rd_bits = reg_to_bits(rd) as u16;
2740
2741                if let Operand2::Imm(imm) = op2 {
2742                    // #498: the old test here was the SIGNED `*imm <= 255`,
2743                    // so a negative immediate (e.g. -1) fell into the 16-bit
2744                    // MOVS arm and encoded the wrong VALUE (#(imm & 0xFF) =
2745                    // #0xFF). A positive imm above 0xFFFF was equally wrong:
2746                    // MOVW truncates to 16 bits. Split on the UNSIGNED value:
2747                    // imm8 → MOVS, imm16 → MOVW, anything wider (negative or
2748                    // >0xFFFF) → the full-value MOVW+MOVT pair. No emitter
2749                    // produces the wide shape today (both selectors
2750                    // materialize wide constants as explicit Movw/Movt or
2751                    // Movw+Mvn), so this is byte-identical on shipped paths —
2752                    // it retires the latent wrong-value encodings the
2753                    // `estimator_encoder_agreement` oracle had pinned.
2754                    let uimm = *imm as u32;
2755                    if uimm <= 255 && rd_bits < 8 {
2756                        // MOVS Rd, #imm8 (16-bit): 0010 0 Rd imm8
2757                        let imm_bits = (*imm as u16) & 0xFF;
2758                        let instr: u16 = 0x2000 | (rd_bits << 8) | imm_bits;
2759                        Ok(instr.to_le_bytes().to_vec())
2760                    } else if uimm <= 0xFFFF {
2761                        // Use 32-bit MOVW for 16-bit immediates
2762                        self.encode_thumb32_movw(rd, uimm)
2763                    } else {
2764                        // Full 32-bit value: MOVW low16 + MOVT high16
2765                        let mut bytes = self.encode_thumb32_movw(rd, uimm & 0xFFFF)?;
2766                        bytes.extend(self.encode_thumb32_movt_raw(reg_to_bits(rd), uimm >> 16)?);
2767                        Ok(bytes)
2768                    }
2769                } else if let Operand2::Reg(rm) = op2 {
2770                    let rm_bits = reg_to_bits(rm) as u16;
2771                    // MOV Rd, Rm (16-bit): 0100 0110 D Rm Rd[2:0]
2772                    // D = Rd[3], Rd[2:0] in lower bits
2773                    let d_bit = (rd_bits >> 3) & 1;
2774                    let instr: u16 = 0x4600 | (d_bit << 7) | (rm_bits << 3) | (rd_bits & 0x7);
2775                    Ok(instr.to_le_bytes().to_vec())
2776                } else {
2777                    let instr: u16 = 0xBF00; // NOP fallback
2778                    Ok(instr.to_le_bytes().to_vec())
2779                }
2780            }
2781
2782            ArmOp::Push { regs } => {
2783                // Thumb-2 PUSH encoding:
2784                // If all regs in R0-R7 + LR, use 16-bit: 1011 010 M rrrrrrrr
2785                // Otherwise use 32-bit: STMDB SP!, {regs} = 1110 1001 0010 1101 | 0M0 reglist(13)
2786                let mut reg_list: u16 = 0;
2787                let mut need_32bit = false;
2788                for r in regs {
2789                    let bit = reg_to_bits(r);
2790                    if bit >= 8 && *r != Reg::LR {
2791                        need_32bit = true;
2792                    }
2793                    reg_list |= 1 << bit;
2794                }
2795                if !need_32bit {
2796                    // 16-bit PUSH: 1011 010 M rrrrrrrr
2797                    let m_bit = if reg_list & (1 << 14) != 0 {
2798                        1u16
2799                    } else {
2800                        0u16
2801                    };
2802                    let low_regs = reg_list & 0xFF;
2803                    let instr: u16 = 0xB400 | (m_bit << 8) | low_regs;
2804                    Ok(instr.to_le_bytes().to_vec())
2805                } else {
2806                    // 32-bit STMDB SP!, {regs}: E92D | reglist(16)
2807                    let hw1: u16 = 0xE92D;
2808                    let hw2: u16 = reg_list;
2809                    let mut bytes = hw1.to_le_bytes().to_vec();
2810                    bytes.extend_from_slice(&hw2.to_le_bytes());
2811                    Ok(bytes)
2812                }
2813            }
2814
2815            ArmOp::Pop { regs } => {
2816                // Thumb-2 POP encoding:
2817                // If all regs in R0-R7 + PC, use 16-bit: 1011 110 P rrrrrrrr
2818                // Otherwise use 32-bit: LDMIA SP!, {regs} = 1110 1000 1011 1101 | PM0 reglist(13)
2819                let mut reg_list: u16 = 0;
2820                let mut need_32bit = false;
2821                for r in regs {
2822                    let bit = reg_to_bits(r);
2823                    if bit >= 8 && *r != Reg::PC {
2824                        need_32bit = true;
2825                    }
2826                    reg_list |= 1 << bit;
2827                }
2828                if !need_32bit {
2829                    // 16-bit POP: 1011 110 P rrrrrrrr
2830                    let p_bit = if reg_list & (1 << 15) != 0 {
2831                        1u16
2832                    } else {
2833                        0u16
2834                    };
2835                    let low_regs = reg_list & 0xFF;
2836                    let instr: u16 = 0xBC00 | (p_bit << 8) | low_regs;
2837                    Ok(instr.to_le_bytes().to_vec())
2838                } else {
2839                    // 32-bit LDMIA SP!, {regs}: E8BD | reglist(16)
2840                    let hw1: u16 = 0xE8BD;
2841                    let hw2: u16 = reg_list;
2842                    let mut bytes = hw1.to_le_bytes().to_vec();
2843                    bytes.extend_from_slice(&hw2.to_le_bytes());
2844                    Ok(bytes)
2845                }
2846            }
2847
2848            ArmOp::Nop => {
2849                let instr: u16 = 0xBF00; // NOP in Thumb-2
2850                Ok(instr.to_le_bytes().to_vec())
2851            }
2852
2853            ArmOp::Udf { imm } => {
2854                // UDF (Undefined) in Thumb-2: 16-bit encoding is 0xDE00 | imm8
2855                // This triggers UsageFault/HardFault, used for WASM traps
2856                let instr: u16 = 0xDE00 | (*imm as u16);
2857                let bytes = instr.to_le_bytes().to_vec();
2858                encoding_contracts::verify_thumb16(&bytes);
2859                Ok(bytes)
2860            }
2861
2862            // i64 support: ADDS, ADC, SUBS, SBC for register pair arithmetic
2863            // ADDS sets flags (carry), ADC uses carry from previous ADDS
2864            ArmOp::Adds { rd, rn, op2 } => {
2865                let rd_bits = reg_to_bits(rd) as u16;
2866                let rn_bits = reg_to_bits(rn) as u16;
2867
2868                if let Operand2::Reg(rm) = op2 {
2869                    let rm_bits = reg_to_bits(rm) as u16;
2870                    // 16-bit ADDS is R0-R7 only; i64 pair allocation can place
2871                    // operands in R8-R11, which would overflow the 3-bit fields
2872                    // and corrupt the operands (#178/#180 class). Guard and fall
2873                    // back to 32-bit ADDS.W for high registers.
2874                    if rd_bits < 8 && rn_bits < 8 && rm_bits < 8 {
2875                        // ADDS Rd, Rn, Rm (16-bit): 0001 100 Rm Rn Rd
2876                        let instr: u16 = 0x1800 | (rm_bits << 6) | (rn_bits << 3) | rd_bits;
2877                        Ok(instr.to_le_bytes().to_vec())
2878                    } else {
2879                        self.encode_thumb32_adds_reg_raw(
2880                            rd_bits as u32,
2881                            rn_bits as u32,
2882                            rm_bits as u32,
2883                        )
2884                    }
2885                } else {
2886                    // 32-bit Thumb-2 ADDS with immediate
2887                    self.encode_thumb32_adds(rd, rn, 0)
2888                }
2889            }
2890
2891            // ADC: Add with Carry (Thumb-2 32-bit)
2892            // ADC.W Rd, Rn, Rm: EB40 Rn | 00 Rd 00 Rm
2893            ArmOp::Adc { rd, rn, op2 } => {
2894                let rd_bits = reg_to_bits(rd);
2895                let rn_bits = reg_to_bits(rn);
2896
2897                if let Operand2::Reg(rm) = op2 {
2898                    let rm_bits = reg_to_bits(rm);
2899                    // ADC.W Rd, Rn, Rm (T2): 1110 1011 0100 Rn | 0 000 Rd 00 00 Rm
2900                    let hw1: u16 = (0xEB40 | rn_bits) as u16;
2901                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
2902
2903                    let mut bytes = hw1.to_le_bytes().to_vec();
2904                    bytes.extend_from_slice(&hw2.to_le_bytes());
2905                    Ok(bytes)
2906                } else {
2907                    // ADC with immediate - use 32-bit encoding
2908                    let hw1: u16 = (0xF140 | rn_bits) as u16;
2909                    let hw2: u16 = (rd_bits << 8) as u16;
2910                    let mut bytes = hw1.to_le_bytes().to_vec();
2911                    bytes.extend_from_slice(&hw2.to_le_bytes());
2912                    Ok(bytes)
2913                }
2914            }
2915
2916            // SUBS sets flags (borrow), SBC uses borrow from previous SUBS
2917            ArmOp::Subs { rd, rn, op2 } => {
2918                let rd_bits = reg_to_bits(rd) as u16;
2919                let rn_bits = reg_to_bits(rn) as u16;
2920
2921                if let Operand2::Reg(rm) = op2 {
2922                    let rm_bits = reg_to_bits(rm) as u16;
2923                    // 16-bit SUBS is R0-R7 only; high-register i64 pair operands
2924                    // would overflow the 3-bit fields (#178/#180 class). Guard
2925                    // and fall back to 32-bit SUBS.W for high registers.
2926                    if rd_bits < 8 && rn_bits < 8 && rm_bits < 8 {
2927                        // SUBS Rd, Rn, Rm (16-bit): 0001 101 Rm Rn Rd
2928                        let instr: u16 = 0x1A00 | (rm_bits << 6) | (rn_bits << 3) | rd_bits;
2929                        Ok(instr.to_le_bytes().to_vec())
2930                    } else {
2931                        self.encode_thumb32_subs_reg_raw(
2932                            rd_bits as u32,
2933                            rn_bits as u32,
2934                            rm_bits as u32,
2935                        )
2936                    }
2937                } else {
2938                    // 32-bit Thumb-2 SUBS with immediate
2939                    self.encode_thumb32_subs(rd, rn, 0)
2940                }
2941            }
2942
2943            // SBC: Subtract with Carry (Thumb-2 32-bit)
2944            // SBC.W Rd, Rn, Rm: EB60 Rn | 00 Rd 00 Rm
2945            ArmOp::Sbc { rd, rn, op2 } => {
2946                let rd_bits = reg_to_bits(rd);
2947                let rn_bits = reg_to_bits(rn);
2948
2949                if let Operand2::Reg(rm) = op2 {
2950                    let rm_bits = reg_to_bits(rm);
2951                    // SBC.W Rd, Rn, Rm (T2): 1110 1011 0110 Rn | 0 000 Rd 00 00 Rm
2952                    let hw1: u16 = (0xEB60 | rn_bits) as u16;
2953                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
2954
2955                    let mut bytes = hw1.to_le_bytes().to_vec();
2956                    bytes.extend_from_slice(&hw2.to_le_bytes());
2957                    Ok(bytes)
2958                } else {
2959                    // SBC with immediate - use 32-bit encoding
2960                    let hw1: u16 = (0xF160 | rn_bits) as u16;
2961                    let hw2: u16 = (rd_bits << 8) as u16;
2962                    let mut bytes = hw1.to_le_bytes().to_vec();
2963                    bytes.extend_from_slice(&hw2.to_le_bytes());
2964                    Ok(bytes)
2965                }
2966            }
2967
2968            // === 32-bit Thumb-2 encodings ===
2969
2970            // SDIV: 11111011 1001 Rn 1111 Rd 1111 Rm
2971            ArmOp::Sdiv { rd, rn, rm } => {
2972                let rd_bits = reg_to_bits(rd);
2973                let rn_bits = reg_to_bits(rn);
2974                let rm_bits = reg_to_bits(rm);
2975                reg_bits_checked(rd_bits)?;
2976                reg_bits_checked(rn_bits)?;
2977                reg_bits_checked(rm_bits)?;
2978
2979                // Thumb-2 SDIV: FB90 F0F0 | Rn<<16 | Rd<<8 | Rm
2980                // First halfword: 1111 1011 1001 Rn = 0xFB90 | Rn
2981                // Second halfword: 1111 Rd 1111 Rm = 0xF0F0 | Rd<<8 | Rm
2982                let hw1: u16 = (0xFB90 | rn_bits) as u16;
2983                let hw2: u16 = (0xF0F0 | (rd_bits << 8) | rm_bits) as u16;
2984
2985                // Thumb-2 32-bit instructions: first halfword, then second halfword (little-endian each)
2986                let mut bytes = hw1.to_le_bytes().to_vec();
2987                bytes.extend_from_slice(&hw2.to_le_bytes());
2988                encoding_contracts::verify_thumb32(&bytes);
2989                Ok(bytes)
2990            }
2991
2992            // UDIV: 11111011 1011 Rn 1111 Rd 1111 Rm
2993            ArmOp::Udiv { rd, rn, rm } => {
2994                let rd_bits = reg_to_bits(rd);
2995                let rn_bits = reg_to_bits(rn);
2996                let rm_bits = reg_to_bits(rm);
2997                reg_bits_checked(rd_bits)?;
2998                reg_bits_checked(rn_bits)?;
2999                reg_bits_checked(rm_bits)?;
3000
3001                // Thumb-2 UDIV: FBB0 F0F0 | Rn<<16 | Rd<<8 | Rm
3002                let hw1: u16 = (0xFBB0 | rn_bits) as u16;
3003                let hw2: u16 = (0xF0F0 | (rd_bits << 8) | rm_bits) as u16;
3004
3005                let mut bytes = hw1.to_le_bytes().to_vec();
3006                bytes.extend_from_slice(&hw2.to_le_bytes());
3007                encoding_contracts::verify_thumb32(&bytes);
3008                Ok(bytes)
3009            }
3010
3011            ArmOp::Umull { rdlo, rdhi, rn, rm } => {
3012                let rdlo_bits = reg_to_bits(rdlo);
3013                let rdhi_bits = reg_to_bits(rdhi);
3014                let rn_bits = reg_to_bits(rn);
3015                let rm_bits = reg_to_bits(rm);
3016                reg_bits_checked(rdlo_bits)?;
3017                reg_bits_checked(rdhi_bits)?;
3018                reg_bits_checked(rn_bits)?;
3019                reg_bits_checked(rm_bits)?;
3020
3021                // Thumb-2 UMULL: 1111 1011 1010 Rn | RdLo RdHi 0000 Rm
3022                let hw1: u16 = (0xFBA0 | rn_bits) as u16;
3023                let hw2: u16 = ((rdlo_bits << 12) | (rdhi_bits << 8) | rm_bits) as u16;
3024
3025                let mut bytes = hw1.to_le_bytes().to_vec();
3026                bytes.extend_from_slice(&hw2.to_le_bytes());
3027                encoding_contracts::verify_thumb32(&bytes);
3028                Ok(bytes)
3029            }
3030
3031            // MUL (Thumb-2 32-bit): MUL Rd, Rn, Rm
3032            ArmOp::Mul { rd, rn, rm } => {
3033                let rd_bits = reg_to_bits(rd);
3034                let rn_bits = reg_to_bits(rn);
3035                let rm_bits = reg_to_bits(rm);
3036
3037                // Thumb-2 MUL: FB00 F000 | Rn | Rd<<8 | Rm
3038                // 11111011 0000 Rn | 1111 Rd 0000 Rm
3039                let hw1: u16 = (0xFB00 | rn_bits) as u16;
3040                let hw2: u16 = (0xF000 | (rd_bits << 8) | rm_bits) as u16;
3041
3042                let mut bytes = hw1.to_le_bytes().to_vec();
3043                bytes.extend_from_slice(&hw2.to_le_bytes());
3044                Ok(bytes)
3045            }
3046
3047            // MLS: Rd = Ra - Rn * Rm
3048            ArmOp::Mls { rd, rn, rm, ra } => {
3049                let rd_bits = reg_to_bits(rd);
3050                let rn_bits = reg_to_bits(rn);
3051                let rm_bits = reg_to_bits(rm);
3052                let ra_bits = reg_to_bits(ra);
3053
3054                // Thumb-2 MLS: FB00 Rn | Ra Rd 0001 Rm
3055                // 11111011 0000 Rn | Ra Rd 0001 Rm
3056                let hw1: u16 = (0xFB00 | rn_bits) as u16;
3057                let hw2: u16 = ((ra_bits << 12) | (rd_bits << 8) | 0x10 | rm_bits) as u16;
3058
3059                let mut bytes = hw1.to_le_bytes().to_vec();
3060                bytes.extend_from_slice(&hw2.to_le_bytes());
3061                Ok(bytes)
3062            }
3063
3064            ArmOp::Mla { rd, rn, rm, ra } => {
3065                let rd_bits = reg_to_bits(rd);
3066                let rn_bits = reg_to_bits(rn);
3067                let rm_bits = reg_to_bits(rm);
3068                let ra_bits = reg_to_bits(ra);
3069
3070                // Thumb-2 MLA: FB00 Rn | Ra Rd 0000 Rm — same as MLS without the
3071                // bit-4 (0x10) op flag. rd = ra + rn*rm.
3072                let hw1: u16 = (0xFB00 | rn_bits) as u16;
3073                let hw2: u16 = ((ra_bits << 12) | (rd_bits << 8) | rm_bits) as u16;
3074
3075                let mut bytes = hw1.to_le_bytes().to_vec();
3076                bytes.extend_from_slice(&hw2.to_le_bytes());
3077                Ok(bytes)
3078            }
3079
3080            // AND (Thumb-2 32-bit)
3081            ArmOp::And { rd, rn, op2 } => {
3082                if let Operand2::Reg(rm) = op2 {
3083                    let rd_bits = reg_to_bits(rd);
3084                    let rn_bits = reg_to_bits(rn);
3085                    let rm_bits = reg_to_bits(rm);
3086
3087                    // Thumb-2 AND register: EA00 Rn | 0 Rd 00 00 Rm
3088                    let hw1: u16 = (0xEA00 | rn_bits) as u16;
3089                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
3090
3091                    let mut bytes = hw1.to_le_bytes().to_vec();
3092                    bytes.extend_from_slice(&hw2.to_le_bytes());
3093                    Ok(bytes)
3094                } else if let Operand2::Imm(imm) = op2 {
3095                    let rd_bits = reg_to_bits(rd);
3096                    let rn_bits = reg_to_bits(rn);
3097
3098                    // Thumb-2 AND.W immediate T1: 11110 i 0 0000 S Rn | 0 imm3 Rd imm8.
3099                    // The i:imm3:imm8 field is a ThumbExpandImm modified immediate —
3100                    // encode it correctly (or error on an un-encodable value)
3101                    // rather than packing raw bits, closing the silent-miscompile
3102                    // class for AND alongside ORR/EOR (#251) / ADD/SUB (#253) /
3103                    // CMP (#255).
3104                    let field = try_thumb_expand_imm(*imm as u32).ok_or_else(|| {
3105                        synth_core::Error::synthesis(
3106                            "AND immediate is not a valid ThumbExpandImm — materialize into a register",
3107                        )
3108                    })?;
3109                    let i_bit = (field >> 11) & 1;
3110                    let imm3 = (field >> 8) & 0x7;
3111                    let imm8 = field & 0xFF;
3112
3113                    let hw1: u16 = (0xF000 | (i_bit << 10) | rn_bits) as u16;
3114                    let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
3115
3116                    let mut bytes = hw1.to_le_bytes().to_vec();
3117                    bytes.extend_from_slice(&hw2.to_le_bytes());
3118                    Ok(bytes)
3119                } else {
3120                    // RegShift variant - fallback to NOP
3121                    let instr: u16 = 0xBF00;
3122                    Ok(instr.to_le_bytes().to_vec())
3123                }
3124            }
3125
3126            // ORR (Thumb-2 32-bit)
3127            ArmOp::Orr { rd, rn, op2 } => {
3128                if let Operand2::Reg(rm) = op2 {
3129                    let rd_bits = reg_to_bits(rd);
3130                    let rn_bits = reg_to_bits(rn);
3131                    let rm_bits = reg_to_bits(rm);
3132
3133                    // Thumb-2 ORR: EA40 Rn | 0 Rd 00 00 Rm
3134                    let hw1: u16 = (0xEA40 | rn_bits) as u16;
3135                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
3136
3137                    let mut bytes = hw1.to_le_bytes().to_vec();
3138                    bytes.extend_from_slice(&hw2.to_le_bytes());
3139                    Ok(bytes)
3140                } else if let Operand2::Imm(imm) = op2 {
3141                    // ORR.W immediate T1: 11110 i 0 0010 S Rn | 0 imm3 Rd imm8.
3142                    // Only the zero-extended byte form (imm <= 0xFF) is encoded;
3143                    // larger modified immediates need ThumbExpandImm — return an
3144                    // error rather than silently emit a NOP (Ok-or-Err, #180/#185).
3145                    let imm_val = *imm as u32;
3146                    if imm_val > 0xFF {
3147                        return Err(synth_core::Error::synthesis(
3148                            "ORR immediate > 0xFF requires ThumbExpandImm (not yet implemented)",
3149                        ));
3150                    }
3151                    let rd_bits = reg_to_bits(rd);
3152                    let rn_bits = reg_to_bits(rn);
3153                    let hw1: u16 = (0xF040 | rn_bits) as u16;
3154                    let hw2: u16 = ((rd_bits << 8) | (imm_val & 0xFF)) as u16;
3155                    let mut bytes = hw1.to_le_bytes().to_vec();
3156                    bytes.extend_from_slice(&hw2.to_le_bytes());
3157                    Ok(bytes)
3158                } else {
3159                    let instr: u16 = 0xBF00;
3160                    Ok(instr.to_le_bytes().to_vec())
3161                }
3162            }
3163
3164            // EOR (Thumb-2 32-bit)
3165            ArmOp::Eor { rd, rn, op2 } => {
3166                if let Operand2::Reg(rm) = op2 {
3167                    let rd_bits = reg_to_bits(rd);
3168                    let rn_bits = reg_to_bits(rn);
3169                    let rm_bits = reg_to_bits(rm);
3170
3171                    // Thumb-2 EOR: EA80 Rn | 0 Rd 00 00 Rm
3172                    let hw1: u16 = (0xEA80 | rn_bits) as u16;
3173                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
3174
3175                    let mut bytes = hw1.to_le_bytes().to_vec();
3176                    bytes.extend_from_slice(&hw2.to_le_bytes());
3177                    Ok(bytes)
3178                } else if let Operand2::Imm(imm) = op2 {
3179                    // EOR.W immediate T1: 11110 i 0 0100 S Rn | 0 imm3 Rd imm8.
3180                    // Byte form only (imm <= 0xFF); larger needs ThumbExpandImm —
3181                    // error, not a silent NOP (Ok-or-Err, #180/#185).
3182                    let imm_val = *imm as u32;
3183                    if imm_val > 0xFF {
3184                        return Err(synth_core::Error::synthesis(
3185                            "EOR immediate > 0xFF requires ThumbExpandImm (not yet implemented)",
3186                        ));
3187                    }
3188                    let rd_bits = reg_to_bits(rd);
3189                    let rn_bits = reg_to_bits(rn);
3190                    let hw1: u16 = (0xF080 | rn_bits) as u16;
3191                    let hw2: u16 = ((rd_bits << 8) | (imm_val & 0xFF)) as u16;
3192                    let mut bytes = hw1.to_le_bytes().to_vec();
3193                    bytes.extend_from_slice(&hw2.to_le_bytes());
3194                    Ok(bytes)
3195                } else {
3196                    let instr: u16 = 0xBF00;
3197                    Ok(instr.to_le_bytes().to_vec())
3198                }
3199            }
3200
3201            // Shift operations (16-bit for low registers)
3202            ArmOp::Lsl { rd, rn, shift } => {
3203                let rd_bits = reg_to_bits(rd) as u16;
3204                let rn_bits = reg_to_bits(rn) as u16;
3205                let shift_bits = (*shift as u16) & 0x1F;
3206
3207                if rd_bits < 8 && rn_bits < 8 {
3208                    // LSLS Rd, Rm, #imm5 (16-bit): 0000 0 imm5 Rm Rd
3209                    let instr: u16 = (shift_bits << 6) | (rn_bits << 3) | rd_bits;
3210                    Ok(instr.to_le_bytes().to_vec())
3211                } else {
3212                    // Use 32-bit encoding for high registers
3213                    self.encode_thumb32_shift(rd, rn, *shift, 0b00) // LSL type
3214                }
3215            }
3216
3217            ArmOp::Lsr { rd, rn, shift } => {
3218                let rd_bits = reg_to_bits(rd) as u16;
3219                let rn_bits = reg_to_bits(rn) as u16;
3220                let shift_bits = (*shift as u16) & 0x1F;
3221
3222                if rd_bits < 8 && rn_bits < 8 && shift_bits > 0 {
3223                    // LSRS Rd, Rm, #imm5 (16-bit): 0000 1 imm5 Rm Rd
3224                    let instr: u16 = 0x0800 | (shift_bits << 6) | (rn_bits << 3) | rd_bits;
3225                    Ok(instr.to_le_bytes().to_vec())
3226                } else {
3227                    self.encode_thumb32_shift(rd, rn, *shift, 0b01) // LSR type
3228                }
3229            }
3230
3231            ArmOp::Asr { rd, rn, shift } => {
3232                let rd_bits = reg_to_bits(rd) as u16;
3233                let rn_bits = reg_to_bits(rn) as u16;
3234                let shift_bits = (*shift as u16) & 0x1F;
3235
3236                if rd_bits < 8 && rn_bits < 8 && shift_bits > 0 {
3237                    // ASRS Rd, Rm, #imm5 (16-bit): 0001 0 imm5 Rm Rd
3238                    let instr: u16 = 0x1000 | (shift_bits << 6) | (rn_bits << 3) | rd_bits;
3239                    Ok(instr.to_le_bytes().to_vec())
3240                } else {
3241                    self.encode_thumb32_shift(rd, rn, *shift, 0b10) // ASR type
3242                }
3243            }
3244
3245            ArmOp::Ror { rd, rn, shift } => {
3246                // ROR doesn't have a 16-bit immediate form, use 32-bit
3247                self.encode_thumb32_shift(rd, rn, *shift, 0b11) // ROR type
3248            }
3249
3250            // Register-based shifts (Thumb-2 32-bit)
3251            // Encoding: 11111010 0xxS Rn 1111 Rd 0000 Rm
3252            // xx = shift type: 00=LSL, 01=LSR, 10=ASR, 11=ROR
3253            ArmOp::LslReg { rd, rn, rm } => self.encode_thumb32_shift_reg(rd, rn, rm, 0b00),
3254            ArmOp::LsrReg { rd, rn, rm } => self.encode_thumb32_shift_reg(rd, rn, rm, 0b01),
3255            ArmOp::AsrReg { rd, rn, rm } => self.encode_thumb32_shift_reg(rd, rn, rm, 0b10),
3256            ArmOp::RorReg { rd, rn, rm } => self.encode_thumb32_shift_reg(rd, rn, rm, 0b11),
3257
3258            // RSB (Reverse Subtract): Rd = imm - Rn
3259            // Thumb-2 T2 encoding: 11110 i 0 1110 S Rn | 0 imm3 Rd imm8
3260            ArmOp::Rsb { rd, rn, imm } => {
3261                let rd_bits = reg_to_bits(rd);
3262                let rn_bits = reg_to_bits(rn);
3263
3264                // #681 class audit: the T2 `i:imm3:imm8` field is a
3265                // ThumbExpandImm modified immediate and RSB has NO plain-imm12
3266                // (T4-style) form — packing a raw value > 0xFF silently encodes
3267                // a different constant (#253/#255 class). All current emitters
3268                // use imm 32 (shift complement), which expands to itself, so
3269                // this gate is byte-identical for existing codegen.
3270                let field = try_thumb_expand_imm(*imm).ok_or_else(|| {
3271                    synth_core::Error::synthesis(
3272                        "RSB immediate is not a valid ThumbExpandImm — materialize into a register",
3273                    )
3274                })?;
3275                let i_bit = (field >> 11) & 1;
3276                let imm3 = (field >> 8) & 0x7;
3277                let imm8 = field & 0xFF;
3278
3279                // hw1: 11110 i 01110 0 Rn  (S=0)
3280                let hw1: u16 = (0xF1C0 | (i_bit << 10) | rn_bits) as u16;
3281                // hw2: 0 imm3 Rd imm8
3282                let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
3283
3284                let mut bytes = hw1.to_le_bytes().to_vec();
3285                bytes.extend_from_slice(&hw2.to_le_bytes());
3286                Ok(bytes)
3287            }
3288
3289            // CLZ (Thumb-2 32-bit)
3290            ArmOp::Clz { rd, rm } => {
3291                let rd_bits = reg_to_bits(rd);
3292                let rm_bits = reg_to_bits(rm);
3293
3294                // Thumb-2 CLZ: FAB0 Rm | F8 Rd Rm
3295                // 11111010 1011 Rm | 1111 1000 Rd Rm
3296                let hw1: u16 = (0xFAB0 | rm_bits) as u16;
3297                let hw2: u16 = (0xF080 | (rd_bits << 8) | rm_bits) as u16;
3298
3299                let mut bytes = hw1.to_le_bytes().to_vec();
3300                bytes.extend_from_slice(&hw2.to_le_bytes());
3301                Ok(bytes)
3302            }
3303
3304            // RBIT (Thumb-2 32-bit)
3305            ArmOp::Rbit { rd, rm } => {
3306                let rd_bits = reg_to_bits(rd);
3307                let rm_bits = reg_to_bits(rm);
3308
3309                // Thumb-2 RBIT: FA90 Rm | F0 Rd A0 Rm
3310                // 11111010 1001 Rm | 1111 Rd 1010 Rm
3311                let hw1: u16 = (0xFA90 | rm_bits) as u16;
3312                let hw2: u16 = (0xF0A0 | (rd_bits << 8) | rm_bits) as u16;
3313
3314                let mut bytes = hw1.to_le_bytes().to_vec();
3315                bytes.extend_from_slice(&hw2.to_le_bytes());
3316                Ok(bytes)
3317            }
3318
3319            // SXTB (16-bit for low registers)
3320            ArmOp::Sxtb { rd, rm } => {
3321                let rd_bits = reg_to_bits(rd) as u16;
3322                let rm_bits = reg_to_bits(rm) as u16;
3323
3324                if rd_bits < 8 && rm_bits < 8 {
3325                    // SXTB Rd, Rm (16-bit): 1011 0010 01 Rm Rd
3326                    let instr: u16 = 0xB240 | (rm_bits << 3) | rd_bits;
3327                    Ok(instr.to_le_bytes().to_vec())
3328                } else {
3329                    // Thumb-2 SXTB.W: FA4F F(rd)80 (rm)
3330                    // 11111010 0100 1111 | 1111 Rd 10 rotate Rm
3331                    let rd_bits32 = rd_bits as u32;
3332                    let rm_bits32 = rm_bits as u32;
3333                    let hw1: u16 = 0xFA4F;
3334                    let hw2: u16 = (0xF080 | (rd_bits32 << 8) | rm_bits32) as u16;
3335                    let mut bytes = hw1.to_le_bytes().to_vec();
3336                    bytes.extend_from_slice(&hw2.to_le_bytes());
3337                    Ok(bytes)
3338                }
3339            }
3340
3341            // SXTH (16-bit for low registers)
3342            ArmOp::Sxth { rd, rm } => {
3343                let rd_bits = reg_to_bits(rd) as u16;
3344                let rm_bits = reg_to_bits(rm) as u16;
3345
3346                if rd_bits < 8 && rm_bits < 8 {
3347                    // SXTH Rd, Rm (16-bit): 1011 0010 00 Rm Rd
3348                    let instr: u16 = 0xB200 | (rm_bits << 3) | rd_bits;
3349                    Ok(instr.to_le_bytes().to_vec())
3350                } else {
3351                    // Thumb-2 SXTH.W: FA0F F(rd)80 (rm)
3352                    // 11111010 0000 1111 | 1111 Rd 10 rotate Rm
3353                    let rd_bits32 = rd_bits as u32;
3354                    let rm_bits32 = rm_bits as u32;
3355                    let hw1: u16 = 0xFA0F;
3356                    let hw2: u16 = (0xF080 | (rd_bits32 << 8) | rm_bits32) as u16;
3357                    let mut bytes = hw1.to_le_bytes().to_vec();
3358                    bytes.extend_from_slice(&hw2.to_le_bytes());
3359                    Ok(bytes)
3360                }
3361            }
3362
3363            // UXTB Rd,Rm — zero-extend byte (rd = rm & 0xff)
3364            ArmOp::Uxtb { rd, rm } => {
3365                let rd_bits = reg_to_bits(rd) as u16;
3366                let rm_bits = reg_to_bits(rm) as u16;
3367                if rd_bits < 8 && rm_bits < 8 {
3368                    // UXTB Rd, Rm (16-bit): 1011 0010 11 Rm Rd
3369                    let instr: u16 = 0xB2C0 | (rm_bits << 3) | rd_bits;
3370                    Ok(instr.to_le_bytes().to_vec())
3371                } else {
3372                    // Thumb-2 UXTB.W: FA5F F(rd)80 (rm)
3373                    let hw1: u16 = 0xFA5F;
3374                    let hw2: u16 = (0xF080 | ((rd_bits as u32) << 8) | rm_bits as u32) as u16;
3375                    let mut bytes = hw1.to_le_bytes().to_vec();
3376                    bytes.extend_from_slice(&hw2.to_le_bytes());
3377                    Ok(bytes)
3378                }
3379            }
3380
3381            // UXTH Rd,Rm — zero-extend halfword (rd = rm & 0xffff)
3382            ArmOp::Uxth { rd, rm } => {
3383                let rd_bits = reg_to_bits(rd) as u16;
3384                let rm_bits = reg_to_bits(rm) as u16;
3385                if rd_bits < 8 && rm_bits < 8 {
3386                    // UXTH Rd, Rm (16-bit): 1011 0010 10 Rm Rd
3387                    let instr: u16 = 0xB280 | (rm_bits << 3) | rd_bits;
3388                    Ok(instr.to_le_bytes().to_vec())
3389                } else {
3390                    // Thumb-2 UXTH.W: FA1F F(rd)80 (rm)
3391                    let hw1: u16 = 0xFA1F;
3392                    let hw2: u16 = (0xF080 | ((rd_bits as u32) << 8) | rm_bits as u32) as u16;
3393                    let mut bytes = hw1.to_le_bytes().to_vec();
3394                    bytes.extend_from_slice(&hw2.to_le_bytes());
3395                    Ok(bytes)
3396                }
3397            }
3398
3399            // CMP (can be 16-bit for low registers)
3400            ArmOp::Cmp { rn, op2 } => {
3401                let rn_bits = reg_to_bits(rn) as u16;
3402
3403                if let Operand2::Imm(imm) = op2 {
3404                    // Only use 16-bit encoding for non-negative immediates 0-255
3405                    // Negative immediates must use 32-bit encoding
3406                    if *imm >= 0 && *imm <= 255 && rn_bits < 8 {
3407                        // CMP Rn, #imm8 (16-bit): 0010 1 Rn imm8
3408                        let instr: u16 = 0x2800 | (rn_bits << 8) | (*imm as u16 & 0xFF);
3409                        Ok(instr.to_le_bytes().to_vec())
3410                    } else {
3411                        self.encode_thumb32_cmp_imm(rn, *imm as u32)
3412                    }
3413                } else if let Operand2::Reg(rm) = op2 {
3414                    let rm_bits = reg_to_bits(rm) as u16;
3415                    if rn_bits < 8 && rm_bits < 8 {
3416                        // CMP Rn, Rm (16-bit low): 0100 0010 10 Rm Rn
3417                        let instr: u16 = 0x4280 | (rm_bits << 3) | rn_bits;
3418                        Ok(instr.to_le_bytes().to_vec())
3419                    } else {
3420                        // CMP Rn, Rm (16-bit high): 0100 0101 N Rm Rn[2:0]
3421                        let n_bit = (rn_bits >> 3) & 1;
3422                        let instr: u16 = 0x4500 | (n_bit << 7) | (rm_bits << 3) | (rn_bits & 0x7);
3423                        Ok(instr.to_le_bytes().to_vec())
3424                    }
3425                } else {
3426                    let instr: u16 = 0xBF00;
3427                    Ok(instr.to_le_bytes().to_vec())
3428                }
3429            }
3430
3431            // CMN (Compare Negative) - computes Rn + op2 and sets flags
3432            // CMN Rn, #1 sets Z flag if Rn == -1 (since -1 + 1 = 0)
3433            ArmOp::Cmn { rn, op2 } => {
3434                let rn_bits = reg_to_bits(rn) as u16;
3435
3436                if let Operand2::Imm(imm) = op2 {
3437                    // CMN.W Rn, #imm (32-bit): i:imm3:imm8 is a ThumbExpandImm
3438                    // modified immediate (the field sits in imm3=hw2[14:12],
3439                    // imm8=hw2[7:0], i=hw1[10]). Encode it correctly, or error on
3440                    // an un-encodable value — replacing the old silent `0xBF00`
3441                    // NOP (the last of the silent-miscompile data-proc encoders).
3442                    let field = try_thumb_expand_imm(*imm as u32).ok_or_else(|| {
3443                        synth_core::Error::synthesis(
3444                            "CMN immediate is not a valid ThumbExpandImm — materialize into a register",
3445                        )
3446                    })?;
3447                    let i_bit = (field >> 11) & 1;
3448                    let imm3 = (field >> 8) & 0x7;
3449                    let imm8 = field & 0xFF;
3450                    let hw1: u16 = (0xF110 | (i_bit << 10) as u16) | rn_bits;
3451                    let hw2: u16 = (imm3 << 12) as u16 | 0x0F00 | imm8 as u16;
3452                    let mut bytes = hw1.to_le_bytes().to_vec();
3453                    bytes.extend_from_slice(&hw2.to_le_bytes());
3454                    Ok(bytes)
3455                } else if let Operand2::Reg(rm) = op2 {
3456                    let rm_bits = reg_to_bits(rm) as u16;
3457                    // 16-bit CMN (T1) only encodes R0-R7; high registers overflow
3458                    // the 3-bit fields and corrupt the operands (#184, the #180
3459                    // class). CMN has no high-register 16-bit form, so fall back
3460                    // to 32-bit CMN.W (T2): EB10 Rn | 0F00 Rm (ADD.W with S=1 and
3461                    // Rd discarded as PC/1111).
3462                    if rn_bits < 8 && rm_bits < 8 {
3463                        // CMN Rn, Rm (16-bit): 0100 0010 11 Rm Rn
3464                        let instr: u16 = 0x42C0 | (rm_bits << 3) | rn_bits;
3465                        Ok(instr.to_le_bytes().to_vec())
3466                    } else {
3467                        let hw1: u16 = 0xEB10 | rn_bits;
3468                        let hw2: u16 = 0x0F00 | rm_bits;
3469                        let mut bytes = hw1.to_le_bytes().to_vec();
3470                        bytes.extend_from_slice(&hw2.to_le_bytes());
3471                        Ok(bytes)
3472                    }
3473                } else {
3474                    Ok(vec![0xBF, 0x00])
3475                }
3476            }
3477
3478            // LDR (can be 16-bit for simple cases)
3479            ArmOp::Ldr { rd, addr } => {
3480                let rd_bits = reg_to_bits(rd);
3481                let base_bits = reg_to_bits(&addr.base);
3482
3483                // Handle register offset mode [base, Roff] or [base, Roff, #imm]
3484                if let Some(offset_reg) = &addr.offset_reg {
3485                    let rm_bits = reg_to_bits(offset_reg);
3486
3487                    // If there's also an immediate offset, we need to ADD it first
3488                    if addr.offset != 0 {
3489                        // Use R12 (IP) as scratch to avoid clobbering the address register
3490                        // ADD R12, Rm, #offset; LDR Rd, [base, R12]
3491                        let scratch = Reg::R12;
3492                        let mut bytes =
3493                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3494                        bytes.extend(self.encode_thumb32_ldr_reg(rd, &addr.base, &scratch)?);
3495                        return Ok(bytes);
3496                    }
3497
3498                    // Simple register offset: LDR Rd, [Rn, Rm]
3499                    // 16-bit: only if Rd, Rn, Rm < R8
3500                    if rd_bits < 8 && base_bits < 8 && rm_bits < 8 {
3501                        // LDR Rd, [Rn, Rm] (16-bit): 0101 100 Rm Rn Rd
3502                        let instr: u16 = 0x5800
3503                            | ((rm_bits as u16) << 6)
3504                            | ((base_bits as u16) << 3)
3505                            | (rd_bits as u16);
3506                        return Ok(instr.to_le_bytes().to_vec());
3507                    }
3508
3509                    // 32-bit register offset
3510                    return self.encode_thumb32_ldr_reg(rd, &addr.base, offset_reg);
3511                }
3512
3513                // Immediate offset mode [base, #imm]
3514                let offset = addr.offset as u32;
3515
3516                if rd_bits < 8 && base_bits < 8 && (offset & 0x3) == 0 && offset <= 124 {
3517                    // LDR Rd, [Rn, #imm5*4] (16-bit): 0110 1 imm5 Rn Rd
3518                    let imm5 = (offset >> 2) as u16;
3519                    let instr: u16 =
3520                        0x6800 | (imm5 << 6) | ((base_bits as u16) << 3) | (rd_bits as u16);
3521                    Ok(instr.to_le_bytes().to_vec())
3522                } else {
3523                    self.encode_thumb32_ldr(rd, &addr.base, offset)
3524                }
3525            }
3526
3527            // STR (can be 16-bit for simple cases)
3528            ArmOp::Str { rd, addr } => {
3529                let rd_bits = reg_to_bits(rd);
3530                let base_bits = reg_to_bits(&addr.base);
3531
3532                // Handle register offset mode [base, Roff] or [base, Roff, #imm]
3533                if let Some(offset_reg) = &addr.offset_reg {
3534                    let rm_bits = reg_to_bits(offset_reg);
3535
3536                    // If there's also an immediate offset, we need to ADD it first
3537                    if addr.offset != 0 {
3538                        // Use R12 (IP) as scratch to avoid clobbering the address register
3539                        // ADD R12, Rm, #offset; STR Rd, [base, R12]
3540                        let scratch = Reg::R12;
3541                        let mut bytes =
3542                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3543                        bytes.extend(self.encode_thumb32_str_reg(rd, &addr.base, &scratch)?);
3544                        return Ok(bytes);
3545                    }
3546
3547                    // Simple register offset: STR Rd, [Rn, Rm]
3548                    // 16-bit: only if Rd, Rn, Rm < R8
3549                    if rd_bits < 8 && base_bits < 8 && rm_bits < 8 {
3550                        // STR Rd, [Rn, Rm] (16-bit): 0101 000 Rm Rn Rd
3551                        let instr: u16 = 0x5000
3552                            | ((rm_bits as u16) << 6)
3553                            | ((base_bits as u16) << 3)
3554                            | (rd_bits as u16);
3555                        return Ok(instr.to_le_bytes().to_vec());
3556                    }
3557
3558                    // 32-bit register offset
3559                    return self.encode_thumb32_str_reg(rd, &addr.base, offset_reg);
3560                }
3561
3562                // Immediate offset mode [base, #imm]
3563                let offset = addr.offset as u32;
3564
3565                if rd_bits < 8 && base_bits < 8 && (offset & 0x3) == 0 && offset <= 124 {
3566                    // STR Rd, [Rn, #imm5*4] (16-bit): 0110 0 imm5 Rn Rd
3567                    let imm5 = (offset >> 2) as u16;
3568                    let instr: u16 =
3569                        0x6000 | (imm5 << 6) | ((base_bits as u16) << 3) | (rd_bits as u16);
3570                    Ok(instr.to_le_bytes().to_vec())
3571                } else {
3572                    self.encode_thumb32_str(rd, &addr.base, offset)
3573                }
3574            }
3575
3576            // LDRB (Thumb-2)
3577            ArmOp::Ldrb { rd, addr } => {
3578                let rd_bits = reg_to_bits(rd);
3579                let base_bits = reg_to_bits(&addr.base);
3580
3581                if let Some(offset_reg) = &addr.offset_reg {
3582                    if addr.offset != 0 {
3583                        let scratch = Reg::R12;
3584                        let mut bytes =
3585                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3586                        bytes.extend(self.encode_thumb32_ldrb_reg(rd, &addr.base, &scratch)?);
3587                        return Ok(bytes);
3588                    }
3589                    return self.encode_thumb32_ldrb_reg(rd, &addr.base, offset_reg);
3590                }
3591
3592                let offset = addr.offset as u32;
3593                if rd_bits < 8 && base_bits < 8 && offset <= 31 {
3594                    // LDRB Rd, [Rn, #imm5] (16-bit): 0111 1 imm5 Rn Rd
3595                    let instr: u16 = 0x7800
3596                        | ((offset as u16) << 6)
3597                        | ((base_bits as u16) << 3)
3598                        | (rd_bits as u16);
3599                    Ok(instr.to_le_bytes().to_vec())
3600                } else {
3601                    self.encode_thumb32_ldrb_imm(rd, &addr.base, offset)
3602                }
3603            }
3604
3605            // LDRSB (Thumb-2)
3606            ArmOp::Ldrsb { rd, addr } => {
3607                let rd_bits = reg_to_bits(rd);
3608                let base_bits = reg_to_bits(&addr.base);
3609
3610                if let Some(offset_reg) = &addr.offset_reg {
3611                    if addr.offset != 0 {
3612                        let scratch = Reg::R12;
3613                        let mut bytes =
3614                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3615                        bytes.extend(self.encode_thumb32_ldrsb_reg(rd, &addr.base, &scratch)?);
3616                        return Ok(bytes);
3617                    }
3618                    return self.encode_thumb32_ldrsb_reg(rd, &addr.base, offset_reg);
3619                }
3620
3621                let offset = addr.offset as u32;
3622                // LDRSB has no 16-bit immediate form (only register)
3623                // For 16-bit reg form: only if Rd, Rn, Rm < R8
3624                if rd_bits < 8 && base_bits < 8 && offset == 0 {
3625                    // No immediate 16-bit encoding for LDRSB; use 32-bit
3626                    self.encode_thumb32_ldrsb_imm(rd, &addr.base, offset)
3627                } else {
3628                    self.encode_thumb32_ldrsb_imm(rd, &addr.base, offset)
3629                }
3630            }
3631
3632            // LDRH (Thumb-2)
3633            ArmOp::Ldrh { rd, addr } => {
3634                let rd_bits = reg_to_bits(rd);
3635                let base_bits = reg_to_bits(&addr.base);
3636
3637                if let Some(offset_reg) = &addr.offset_reg {
3638                    if addr.offset != 0 {
3639                        let scratch = Reg::R12;
3640                        let mut bytes =
3641                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3642                        bytes.extend(self.encode_thumb32_ldrh_reg(rd, &addr.base, &scratch)?);
3643                        return Ok(bytes);
3644                    }
3645                    return self.encode_thumb32_ldrh_reg(rd, &addr.base, offset_reg);
3646                }
3647
3648                let offset = addr.offset as u32;
3649                if rd_bits < 8 && base_bits < 8 && (offset & 0x1) == 0 && offset <= 62 {
3650                    // LDRH Rd, [Rn, #imm5*2] (16-bit): 1000 1 imm5 Rn Rd
3651                    let imm5 = (offset >> 1) as u16;
3652                    let instr: u16 =
3653                        0x8800 | (imm5 << 6) | ((base_bits as u16) << 3) | (rd_bits as u16);
3654                    Ok(instr.to_le_bytes().to_vec())
3655                } else {
3656                    self.encode_thumb32_ldrh_imm(rd, &addr.base, offset)
3657                }
3658            }
3659
3660            // LDRSH (Thumb-2)
3661            ArmOp::Ldrsh { rd, addr } => {
3662                if let Some(offset_reg) = &addr.offset_reg {
3663                    if addr.offset != 0 {
3664                        let scratch = Reg::R12;
3665                        let mut bytes =
3666                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3667                        bytes.extend(self.encode_thumb32_ldrsh_reg(rd, &addr.base, &scratch)?);
3668                        return Ok(bytes);
3669                    }
3670                    return self.encode_thumb32_ldrsh_reg(rd, &addr.base, offset_reg);
3671                }
3672
3673                let offset = addr.offset as u32;
3674                self.encode_thumb32_ldrsh_imm(rd, &addr.base, offset)
3675            }
3676
3677            // STRB (Thumb-2)
3678            ArmOp::Strb { rd, addr } => {
3679                let rd_bits = reg_to_bits(rd);
3680                let base_bits = reg_to_bits(&addr.base);
3681
3682                if let Some(offset_reg) = &addr.offset_reg {
3683                    if addr.offset != 0 {
3684                        let scratch = Reg::R12;
3685                        let mut bytes =
3686                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3687                        bytes.extend(self.encode_thumb32_strb_reg(rd, &addr.base, &scratch)?);
3688                        return Ok(bytes);
3689                    }
3690                    return self.encode_thumb32_strb_reg(rd, &addr.base, offset_reg);
3691                }
3692
3693                let offset = addr.offset as u32;
3694                if rd_bits < 8 && base_bits < 8 && offset <= 31 {
3695                    // STRB Rd, [Rn, #imm5] (16-bit): 0111 0 imm5 Rn Rd
3696                    let instr: u16 = 0x7000
3697                        | ((offset as u16) << 6)
3698                        | ((base_bits as u16) << 3)
3699                        | (rd_bits as u16);
3700                    Ok(instr.to_le_bytes().to_vec())
3701                } else {
3702                    self.encode_thumb32_strb_imm(rd, &addr.base, offset)
3703                }
3704            }
3705
3706            // STRH (Thumb-2)
3707            ArmOp::Strh { rd, addr } => {
3708                let rd_bits = reg_to_bits(rd);
3709                let base_bits = reg_to_bits(&addr.base);
3710
3711                if let Some(offset_reg) = &addr.offset_reg {
3712                    if addr.offset != 0 {
3713                        let scratch = Reg::R12;
3714                        let mut bytes =
3715                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3716                        bytes.extend(self.encode_thumb32_strh_reg(rd, &addr.base, &scratch)?);
3717                        return Ok(bytes);
3718                    }
3719                    return self.encode_thumb32_strh_reg(rd, &addr.base, offset_reg);
3720                }
3721
3722                let offset = addr.offset as u32;
3723                if rd_bits < 8 && base_bits < 8 && (offset & 0x1) == 0 && offset <= 62 {
3724                    // STRH Rd, [Rn, #imm5*2] (16-bit): 1000 0 imm5 Rn Rd
3725                    let imm5 = (offset >> 1) as u16;
3726                    let instr: u16 =
3727                        0x8000 | (imm5 << 6) | ((base_bits as u16) << 3) | (rd_bits as u16);
3728                    Ok(instr.to_le_bytes().to_vec())
3729                } else {
3730                    self.encode_thumb32_strh_imm(rd, &addr.base, offset)
3731                }
3732            }
3733
3734            // MemorySize (Thumb-2)
3735            ArmOp::MemorySize { rd } => {
3736                // LSR rd, R10, #16 — memory size in bytes / 65536 = pages
3737                // Thumb-2 16-bit: LSRS Rd, Rm, #imm5 — 0000 1 imm5 Rm Rd
3738                let rd_bits = reg_to_bits(rd);
3739                let r10_bits = reg_to_bits(&Reg::R10);
3740                if rd_bits < 8 && r10_bits < 8 {
3741                    let instr: u16 =
3742                        0x0800 | (16u16 << 6) | ((r10_bits as u16) << 3) | (rd_bits as u16);
3743                    Ok(instr.to_le_bytes().to_vec())
3744                } else {
3745                    // Thumb-2 32-bit LSR: 1110 1010 010 0 1111 | 0 imm3 Rd imm2 01 Rm
3746                    let imm5: u32 = 16;
3747                    let imm3 = (imm5 >> 2) & 0x7;
3748                    let imm2 = imm5 & 0x3;
3749                    let hw1: u16 = 0xEA4F;
3750                    let hw2: u16 =
3751                        ((imm3 << 12) | (rd_bits << 8) | (imm2 << 6) | 0x10 | r10_bits) as u16;
3752                    let mut bytes = hw1.to_le_bytes().to_vec();
3753                    bytes.extend_from_slice(&hw2.to_le_bytes());
3754                    Ok(bytes)
3755                }
3756            }
3757
3758            // MemoryGrow (Thumb-2)
3759            ArmOp::MemoryGrow { rd, .. } => {
3760                // On embedded with fixed memory, always return -1 (failure)
3761                // MVN rd, #0 → MOV rd, #-1
3762                // Thumb-2 32-bit: MVN: 1111 0 i 0 0 0 1 1 0 1111 | 0 imm3 Rd imm8
3763                let rd_bits = reg_to_bits(rd);
3764                let hw1: u16 = 0xF06F; // MVN with i=0
3765                let hw2: u16 = (rd_bits << 8) as u16; // imm8=0 → ~0 = 0xFFFFFFFF = -1
3766                let mut bytes = hw1.to_le_bytes().to_vec();
3767                bytes.extend_from_slice(&hw2.to_le_bytes());
3768                Ok(bytes)
3769            }
3770
3771            // BX (16-bit)
3772            ArmOp::Bx { rm } => {
3773                let rm_bits = reg_to_bits(rm) as u16;
3774                // BX Rm (16-bit): 0100 0111 0 Rm 000
3775                let instr: u16 = 0x4700 | (rm_bits << 3);
3776                Ok(instr.to_le_bytes().to_vec())
3777            }
3778
3779            // BLX (16-bit) - Branch with Link and Exchange
3780            // BLX Rm: 0100 0111 1 Rm 000
3781            ArmOp::Blx { rm } => {
3782                let rm_bits = reg_to_bits(rm) as u16;
3783                let instr: u16 = 0x4780 | (rm_bits << 3);
3784                Ok(instr.to_le_bytes().to_vec())
3785            }
3786
3787            // CallIndirect - indirect function call via table lookup
3788            // table_index_reg contains the table index
3789            // Generates (#642): MOVW ip,#size [; MOVT]; CMP idx,ip; BLO +1;
3790            //                   UDF #0; LSL R12,idx,#2; LDR R12,[R11,R12]; BLX R12
3791            // #650, table_byte_offset != 0 (a non-zero table in the contiguous
3792            // R11 region): the pointer load becomes
3793            //                   ADD R12,R11,R12; LDR R12,[R12,#offset]
3794            // #664, null_check (the table has null slots, linked as ZERO
3795            // words): the loaded pointer is null-checked before the BLX —
3796            //                   CMP.W R12,#0; BNE +1; UDF #0
3797            // #676, type_check (heterogeneous table — runtime §4.4.8 type
3798            // check against the type-id sidecar at R11+off): after the
3799            // bounds guard —
3800            //                   LSL R12,idx,#2; ADD R12,R11,R12;
3801            //                   LDR R12,[R12,#type_off]; CMP.W R12,#id;
3802            //                   BEQ +1; UDF #0
3803            // (the dispatch tail then recomputes idx*4 — idx stays live).
3804            ArmOp::CallIndirect {
3805                rd: _,
3806                type_idx: _,
3807                table_index_reg,
3808                table_size,
3809                table_byte_offset,
3810                null_check,
3811                type_check,
3812            } => {
3813                let idx_reg = reg_to_bits(table_index_reg);
3814                let mut bytes = Vec::new();
3815
3816                // The expansion:
3817                // 1. Bounds guard (#642): trap (UDF #0, WASM Core §4.4.8) when
3818                //    index >= table size. Without it an out-of-bounds index
3819                //    reads past the table and BLXes whatever word lies there —
3820                //    an uncontrolled indirect branch instead of a trap.
3821                // 2. Multiplies index by 4 (function pointer size)
3822                // 3. Loads function pointer from table (table base in R11)
3823                // 4. Calls the function via BLX
3824                //
3825                // Table base setup must be done by caller/runtime. The type
3826                // check §4.4.8 also requires is discharged at COMPILE time:
3827                // the selector only emits this op after verifying the closed-
3828                // world property that every table entry's signature equals the
3829                // expected type (the raw code-pointer table carries no runtime
3830                // type ids to compare) — see the #642 selector guard.
3831
3832                // MOVW R12, #(size & 0xFFFF) — Thumb-2 T3:
3833                // 11110 i 100100 imm4 | 0 imm3 Rd imm8 (Rd=R12).
3834                let size_lo = *table_size & 0xFFFF;
3835                let hw1: u16 =
3836                    (0xF240 | (((size_lo >> 11) & 1) << 10) | ((size_lo >> 12) & 0xF)) as u16;
3837                let hw2: u16 =
3838                    ((((size_lo >> 8) & 0x7) << 12) | (12 << 8) | (size_lo & 0xFF)) as u16;
3839                bytes.extend_from_slice(&hw1.to_le_bytes());
3840                bytes.extend_from_slice(&hw2.to_le_bytes());
3841                // MOVT R12, #(size >> 16) — only when the table size exceeds
3842                // 16 bits (never in practice, but the guard must not compare
3843                // against a truncated size).
3844                let size_hi = *table_size >> 16;
3845                if size_hi != 0 {
3846                    let hw1: u16 =
3847                        (0xF2C0 | (((size_hi >> 11) & 1) << 10) | ((size_hi >> 12) & 0xF)) as u16;
3848                    let hw2: u16 =
3849                        ((((size_hi >> 8) & 0x7) << 12) | (12 << 8) | (size_hi & 0xFF)) as u16;
3850                    bytes.extend_from_slice(&hw1.to_le_bytes());
3851                    bytes.extend_from_slice(&hw2.to_le_bytes());
3852                }
3853                // CMP idx, R12 — 16-bit T2 (high-register capable):
3854                // 010001 01 N Rm(4) Rn(3), Rn full = N:Rn3.
3855                let cmp: u16 = (0x4500 | ((idx_reg & 8) << 4) | (12 << 3) | (idx_reg & 7)) as u16;
3856                bytes.extend_from_slice(&cmp.to_le_bytes());
3857                // BLO +1 insn (skip the UDF when index < size) — B<cond>.N
3858                // imm8=0: target = branch + 4. LO = unsigned lower.
3859                bytes.extend_from_slice(&0xD300u16.to_le_bytes());
3860                // UDF #0 — call_indirect out-of-bounds trap (same trap idiom as
3861                // the div-by-zero guards).
3862                bytes.extend_from_slice(&0xDE00u16.to_le_bytes());
3863
3864                // #676: runtime type check — ONLY for a heterogeneous table
3865                // (mixed signatures, closed-world verdict impossible). Load
3866                // the indexed slot's structural class id from the type-id
3867                // sidecar (`R11 + type_off + idx*4`; `type_off` = sidecar
3868                // base + this table's base offset, a compile-time constant)
3869                // and compare it against the expected type's class id — a
3870                // mismatch is the WASM Core §4.4.8 type trap. Null slots
3871                // carry the reserved id 0, so this compare subsumes the
3872                // #664 null trap (the selector passes `null_check: false`).
3873                // `None` emits NOTHING: every homogeneous table keeps the
3874                // pre-#676 bytes identical BY CONSTRUCTION. R12 stays the
3875                // only scratch (#212); the dispatch tail below recomputes
3876                // idx*4 — the index register is never clobbered here.
3877                if let Some((expected_id, type_off)) = type_check {
3878                    debug_assert!(*expected_id <= 255, "selector enforces the CMP imm8 range");
3879                    debug_assert!(*type_off <= 4095, "selector enforces the LDR imm12 range");
3880                    // MOV.W R12, idx, LSL #2 (same encoding as the dispatch
3881                    // tail's index scale below).
3882                    bytes.extend_from_slice(&0xEA4Fu16.to_le_bytes());
3883                    bytes.extend_from_slice(
3884                        &(((0x0C00 | (0b10 << 6)) | idx_reg) as u16).to_le_bytes(),
3885                    );
3886                    // ADD.W R12, R11, R12 (the #650 base-add form).
3887                    bytes.extend_from_slice(&0xEB0Bu16.to_le_bytes());
3888                    bytes.extend_from_slice(&0x0C0Cu16.to_le_bytes());
3889                    // LDR.W R12, [R12, #type_off] — T3 LDR (immediate):
3890                    // 1111 1000 1101 Rn=1100 | Rt=1100 imm12.
3891                    bytes.extend_from_slice(&0xF8DCu16.to_le_bytes());
3892                    bytes.extend_from_slice(
3893                        &(0xC000u16 | (*type_off as u16 & 0x0FFF)).to_le_bytes(),
3894                    );
3895                    // CMP.W R12, #expected_id — T2 CMP (immediate), imm8
3896                    // (same form as the #664 null check's CMP.W R12, #0).
3897                    bytes.extend_from_slice(&0xF1BCu16.to_le_bytes());
3898                    bytes.extend_from_slice(
3899                        &(0x0F00u16 | (*expected_id as u16 & 0xFF)).to_le_bytes(),
3900                    );
3901                    // BEQ +1 insn (skip the UDF when the class id matches) —
3902                    // B<cond>.N imm8=0: target = branch + 4. EQ.
3903                    bytes.extend_from_slice(&0xD000u16.to_le_bytes());
3904                    // UDF #0 — the §4.4.8 type-mismatch trap (same idiom as
3905                    // the bounds guard above).
3906                    bytes.extend_from_slice(&0xDE00u16.to_le_bytes());
3907                }
3908
3909                // LSL R12, idx_reg, #2 (multiply index by 4)
3910                // Thumb-2 MOV with shift: 11101010 010 S 1111 | 0 imm3 Rd imm2 type Rm
3911                // LSL: type=00 (bits 5:4), imm5=2 -> imm3=000, imm2=10 (bits 7:6)
3912                // #597: the shift amount was previously shifted into bits 5:4 —
3913                // the TYPE field — encoding `mov.w ip, rm, ASR #32`, which
3914                // destroyed the index and dispatched table entry 0 for every
3915                // call. imm2 lives at bits 7:6.
3916                let hw1: u16 = 0xEA4F_u16; // MOV.W R12, Rm, LSL #2
3917                let hw2: u16 = ((0x0C00 | (0b10 << 6)) | idx_reg) as u16;
3918                bytes.extend_from_slice(&hw1.to_le_bytes());
3919                bytes.extend_from_slice(&hw2.to_le_bytes());
3920
3921                if *table_byte_offset == 0 {
3922                    // Table 0 (base = R11 itself): the pre-#650 single-load
3923                    // form — a single-table module's bytes stay identical BY
3924                    // CONSTRUCTION.
3925                    // LDR R12, [R11, R12] - load function pointer
3926                    // Thumb-2 LDR (register): 1111 1000 0101 Rn | Rt 0000 00 imm2 Rm
3927                    // Rn=R11, Rt=R12, Rm=R12, imm2=00 (no shift)
3928                    let ldr_hw1: u16 = 0xF85B; // LDR.W Rt, [R11, Rm]
3929                    let ldr_hw2: u16 = 0xC00C; // Rt=R12, imm2=00, Rm=R12
3930                    bytes.extend_from_slice(&ldr_hw1.to_le_bytes());
3931                    bytes.extend_from_slice(&ldr_hw2.to_le_bytes());
3932                } else {
3933                    // #650: table N of the contiguous R11 region — fold the
3934                    // compile-time base offset into the pointer load via the
3935                    // LDR imm12 form (R12 stays the only scratch, per the
3936                    // #212 convention).
3937                    assert!(
3938                        *table_byte_offset <= 4095,
3939                        "call_indirect table base offset {table_byte_offset} exceeds \
3940                         LDR imm12 — the selector must have declined this (#650)"
3941                    );
3942                    // ADD.W R12, R11, R12 — T3 ADD (register):
3943                    // 11101011000 S=0 Rn=1011 | 0 imm3=000 Rd=1100 imm2=00 type=00 Rm=1100
3944                    bytes.extend_from_slice(&0xEB0Bu16.to_le_bytes());
3945                    bytes.extend_from_slice(&0x0C0Cu16.to_le_bytes());
3946                    // LDR.W R12, [R12, #offset] — T3 LDR (immediate):
3947                    // 1111 1000 1101 Rn=1100 | Rt=1100 imm12
3948                    bytes.extend_from_slice(&0xF8DCu16.to_le_bytes());
3949                    bytes.extend_from_slice(
3950                        &((0xC000u16) | (*table_byte_offset as u16 & 0x0FFF)).to_le_bytes(),
3951                    );
3952                }
3953
3954                // #664: null-slot trap — ONLY when the table image carries
3955                // null (uninitialized) slots, which the layout contract
3956                // requires to be linked as ZERO words. A fully-initialized
3957                // table skips this branch entirely, keeping the pre-#664
3958                // expansion byte-identical BY CONSTRUCTION (the #650
3959                // offset-0 trick).
3960                if *null_check {
3961                    // CMP.W R12, #0 — T2 CMP (immediate): 11110 i 0 1101 1
3962                    // Rn(4) | 0 imm3 1111 imm8, Rn=R12, imm=0.
3963                    bytes.extend_from_slice(&0xF1BCu16.to_le_bytes());
3964                    bytes.extend_from_slice(&0x0F00u16.to_le_bytes());
3965                    // BNE +1 insn (skip the UDF when the pointer is non-null)
3966                    // — B<cond>.N imm8=0: target = branch + 4. NE.
3967                    bytes.extend_from_slice(&0xD100u16.to_le_bytes());
3968                    // UDF #0 — call_indirect null-funcref trap (WASM Core
3969                    // §4.4.8: calling an uninitialized element traps; same
3970                    // trap idiom as the bounds guard above).
3971                    bytes.extend_from_slice(&0xDE00u16.to_le_bytes());
3972                }
3973
3974                // BLX R12 (call function indirectly)
3975                // BLX Rm (16-bit): 0100 0111 1 Rm 000
3976                let blx: u16 = 0x47E0; // BLX R12
3977                bytes.extend_from_slice(&blx.to_le_bytes());
3978
3979                Ok(bytes)
3980            }
3981
3982            // Label pseudo-instruction: emits no machine code
3983            ArmOp::Label { .. } => Ok(Vec::new()),
3984
3985            // Conditional branch to label (generic) - offset 0, will be patched
3986            ArmOp::Bcc { cond, label: _ } => {
3987                use synth_synthesis::Condition;
3988                let cond_bits: u16 = match cond {
3989                    Condition::EQ => 0x0,
3990                    Condition::NE => 0x1,
3991                    Condition::HS => 0x2,
3992                    Condition::LO => 0x3,
3993                    Condition::HI => 0x8,
3994                    Condition::LS => 0x9,
3995                    Condition::GE => 0xA,
3996                    Condition::LT => 0xB,
3997                    Condition::GT => 0xC,
3998                    Condition::LE => 0xD,
3999                };
4000                // 16-bit B<cond> with offset 0: 1101 cond imm8
4001                let instr: u16 = 0xD000 | (cond_bits << 8);
4002                Ok(instr.to_le_bytes().to_vec())
4003            }
4004
4005            // Branch instructions
4006            ArmOp::B { label: _ } => {
4007                // Simplified: B.N with offset 0
4008                // For real usage, would need label resolution
4009                let instr: u16 = 0xE000; // B.N #0
4010                Ok(instr.to_le_bytes().to_vec())
4011            }
4012
4013            // BHS (Branch if Higher or Same) - used for bounds checking
4014            // Condition code: 0x2 (C set)
4015            ArmOp::Bhs { label: _ } => {
4016                // 16-bit B<cond> with offset 0: 1101 cond imm8
4017                // cond = 0x2 (HS)
4018                let instr: u16 = 0xD200; // BHS.N #0
4019                Ok(instr.to_le_bytes().to_vec())
4020            }
4021
4022            // BLO (Branch if Lower) - complementary to BHS
4023            // Condition code: 0x3 (C clear)
4024            ArmOp::Blo { label: _ } => {
4025                // 16-bit B<cond> with offset 0: 1101 cond imm8
4026                // cond = 0x3 (LO)
4027                let instr: u16 = 0xD300; // BLO.N #0
4028                Ok(instr.to_le_bytes().to_vec())
4029            }
4030
4031            // Branch with numeric offset (Thumb-2)
4032            // Thumb-2 B.W instruction: 32-bit with +-16MB range
4033            ArmOp::BOffset { offset } => {
4034                // offset is already the halfword displacement: (target - branch - 4) / 2
4035                // This is the raw encoded value, accounting for variable-length instructions
4036                let halfword_offset = *offset;
4037
4038                // 16-bit B.N encoding: 1110 0 imm11 (11-bit signed halfword offset)
4039                // Range: -1024 to +1022 halfwords
4040                if (-1024..=1022).contains(&halfword_offset) {
4041                    // 16-bit B.N encoding: 1110 0 imm11
4042                    let imm11 = (halfword_offset as u16) & 0x7FF;
4043                    let instr: u16 = 0xE000 | imm11;
4044                    Ok(instr.to_le_bytes().to_vec())
4045                } else {
4046                    // 32-bit B.W encoding for larger offsets
4047                    // First halfword: 1111 0 S imm10
4048                    // Second halfword: 10 J1 0 J2 imm11
4049                    // Total offset = SignExtend(S:I1:I2:imm10:imm11:0)
4050                    // where I1 = NOT(J1 XOR S), I2 = NOT(J2 XOR S)
4051
4052                    // The B.W (T4) encoding packs the signed offset as:
4053                    //   S:I1:I2:imm10:imm11:0  (25-bit signed, halfword-aligned)
4054                    // where J1 = NOT(I1 XOR S), J2 = NOT(I2 XOR S)
4055                    // Input halfword_offset already equals (target - PC - 4) / 2,
4056                    // so the full byte offset = halfword_offset << 1.
4057                    // The encoding fields split that 25-bit signed value (including the
4058                    // implicit trailing zero) as: S | imm10 | imm11
4059                    // with I1 = bit 23 and I2 = bit 22 of the signed offset.
4060                    let signed_offset = halfword_offset << 1; // byte offset
4061                    let s = if signed_offset < 0 { 1u32 } else { 0u32 };
4062                    let uoffset = signed_offset as u32;
4063                    let imm10 = (uoffset >> 12) & 0x3FF; // bits [21:12]
4064                    let imm11 = (uoffset >> 1) & 0x7FF; // bits [11:1]
4065                    let i1 = (uoffset >> 23) & 1; // bit 23
4066                    let i2 = (uoffset >> 22) & 1; // bit 22
4067                    let j1 = (!(i1 ^ s)) & 1; // J1 = NOT(I1 XOR S)
4068                    let j2 = (!(i2 ^ s)) & 1; // J2 = NOT(I2 XOR S)
4069
4070                    let hw1: u16 = (0xF000 | (s << 10) | imm10) as u16;
4071                    let hw2: u16 = (0x9000 | (j1 << 13) | (j2 << 11) | imm11) as u16;
4072
4073                    let mut bytes = hw1.to_le_bytes().to_vec();
4074                    bytes.extend_from_slice(&hw2.to_le_bytes());
4075                    Ok(bytes)
4076                }
4077            }
4078
4079            // Conditional branch with numeric offset (Thumb-2)
4080            ArmOp::BCondOffset { cond, offset } => {
4081                use synth_synthesis::Condition;
4082                let cond_bits: u16 = match cond {
4083                    Condition::EQ => 0x0,
4084                    Condition::NE => 0x1,
4085                    Condition::HS => 0x2,
4086                    Condition::LO => 0x3,
4087                    Condition::HI => 0x8,
4088                    Condition::LS => 0x9,
4089                    Condition::GE => 0xA,
4090                    Condition::LT => 0xB,
4091                    Condition::GT => 0xC,
4092                    Condition::LE => 0xD,
4093                };
4094
4095                // offset is already the halfword displacement: (target - branch - 4) / 2
4096                // This is the raw imm8 value for 16-bit B<cond> encoding
4097                let halfword_offset = *offset;
4098
4099                // 16-bit B<cond> encoding: 1101 cond imm8
4100                // Range: -256 to +254 halfwords (imm8 is sign-extended and shifted left 1)
4101                if (-128..=127).contains(&halfword_offset) {
4102                    let imm8 = (halfword_offset as u16) & 0xFF;
4103                    let instr: u16 = 0xD000 | (cond_bits << 8) | imm8;
4104                    Ok(instr.to_le_bytes().to_vec())
4105                } else {
4106                    // 32-bit B<cond>.W (encoding T3) for larger offsets
4107                    // First halfword: 1111 0 S cond(4) imm6
4108                    // Second halfword: 10 J1 0 J2 imm11
4109                    //
4110                    // Per ARMv7-M, the branch BYTE offset is
4111                    // SignExtend(S:J2:J1:imm6:imm11:'0'), i.e. the field value
4112                    // S:J2:J1:imm6:imm11 IS the signed 20-bit HALFWORD offset —
4113                    // imm11/imm6/J1/J2/S take `halfword_offset` bits [10:0],
4114                    // [16:11], 17, 18 and 19 directly (mirroring the T4
4115                    // unconditional arm above).
4116                    //
4117                    // #740: this arm previously packed `halfword_offset >> 1`
4118                    // into imm6:imm11 — HALVING the displacement — so every
4119                    // wide conditional branch (span > 254 bytes) landed at half
4120                    // its intended offset: gust_poll's loop-head `br_if` to an
4121                    // outer block end jumped mid-shape. Narrow (16-bit) B<cond>
4122                    // encodings were unaffected, which is why short-range CF
4123                    // fixtures never caught it.
4124                    if !(-(1 << 19)..(1 << 19)).contains(&halfword_offset) {
4125                        return Err(synth_core::Error::synthesis(format!(
4126                            "B<cond>.W (T3) halfword offset {halfword_offset} exceeds \
4127                             the signed 20-bit encoding range (±1 MB) — refusing to \
4128                             emit a truncated branch"
4129                        )));
4130                    }
4131                    let u = halfword_offset as u32;
4132                    let imm11 = u & 0x7FF; // halfword offset bits [10:0]
4133                    let imm6 = (u >> 11) & 0x3F; // bits [16:11]
4134                    let j1 = (u >> 17) & 1; // bit 17
4135                    let j2 = (u >> 18) & 1; // bit 18
4136                    let s = (u >> 19) & 1; // sign (range-checked above)
4137
4138                    let hw1: u16 = (0xF000 | (s << 10) | ((cond_bits as u32) << 6) | imm6) as u16;
4139                    let hw2: u16 = (0x8000 | (j1 << 13) | (j2 << 11) | imm11) as u16;
4140
4141                    let mut bytes = hw1.to_le_bytes().to_vec();
4142                    bytes.extend_from_slice(&hw2.to_le_bytes());
4143                    Ok(bytes)
4144                }
4145            }
4146
4147            ArmOp::Bl { label: _ } => {
4148                // BL is always 32-bit in Thumb-2, encoded here as a relocatable
4149                // placeholder; an R_ARM_THM_CALL relocation patches the target
4150                // (see arm_backend.rs). The placeholder must carry an embedded
4151                // addend of -4 so the relocation nets to exactly the symbol S.
4152                //
4153                // Thumb BL computes `target = (P + 4) + signed_offset`. Under
4154                // R_ARM_THM_CALL the linker resolves using the in-place addend;
4155                // a 0xF800 placeholder (addend 0) lands at S+4 — every call one
4156                // instruction past the callee entry (#174). The correct
4157                // placeholder is what `gas` emits for `bl <extern>`:
4158                //   f7ff fffe  ->  `bl <self>`  (S=1, J1=J2=1, imm = -4 addend),
4159                // i.e. hw1=0xF7FF, hw2=0xFFFE. This nets to S, not S+4.
4160                // (The earlier 0xD000 was worse still — a ~+0x600000 addend,
4161                // the garbage `bl c0000c` and "truncated to fit" of #167.)
4162                let hw1: u16 = 0xF7FF;
4163                let hw2: u16 = 0xFFFE;
4164                let mut bytes = hw1.to_le_bytes().to_vec();
4165                bytes.extend_from_slice(&hw2.to_le_bytes());
4166                Ok(bytes)
4167            }
4168
4169            // MVN
4170            ArmOp::Mvn { rd, op2 } => {
4171                if let Operand2::Reg(rm) = op2 {
4172                    let rd_bits = reg_to_bits(rd) as u16;
4173                    let rm_bits = reg_to_bits(rm) as u16;
4174
4175                    if rd_bits < 8 && rm_bits < 8 {
4176                        // MVNS Rd, Rm (16-bit): 0100 0011 11 Rm Rd
4177                        let instr: u16 = 0x43C0 | (rm_bits << 3) | rd_bits;
4178                        Ok(instr.to_le_bytes().to_vec())
4179                    } else {
4180                        // 32-bit MVN
4181                        let hw1: u16 = 0xEA6F_u16;
4182                        let hw2: u16 = ((reg_to_bits(rd) << 8) | reg_to_bits(rm)) as u16;
4183                        let mut bytes = hw1.to_le_bytes().to_vec();
4184                        bytes.extend_from_slice(&hw2.to_le_bytes());
4185                        Ok(bytes)
4186                    }
4187                } else {
4188                    let instr: u16 = 0xBF00;
4189                    Ok(instr.to_le_bytes().to_vec())
4190                }
4191            }
4192
4193            // MOVW - Move Wide (Thumb-2 32-bit)
4194            ArmOp::Movw { rd, imm16 } => {
4195                self.encode_thumb32_movw_raw(reg_to_bits(rd), *imm16 as u32)
4196            }
4197
4198            // MOVT - Move Top (Thumb-2 32-bit)
4199            ArmOp::Movt { rd, imm16 } => {
4200                self.encode_thumb32_movt_raw(reg_to_bits(rd), *imm16 as u32)
4201            }
4202
4203            // #237: symbol-relative MOVW/MOVT. Encode the addend's low/high 16
4204            // bits in place; the backend records an R_ARM_MOVW_ABS_NC /
4205            // R_ARM_MOVT_ABS relocation against `symbol`, so the linker adds the
4206            // symbol's final address to the in-place addend (REL semantics).
4207            ArmOp::MovwSym { rd, addend, .. } => {
4208                self.encode_thumb32_movw_raw(reg_to_bits(rd), (*addend as u32) & 0xffff)
4209            }
4210            ArmOp::MovtSym { rd, addend, .. } => {
4211                self.encode_thumb32_movt_raw(reg_to_bits(rd), ((*addend as u32) >> 16) & 0xffff)
4212            }
4213
4214            // #345: literal-pool address load — emit a PLACEHOLDER `LDR.W rd,
4215            // [pc, #0]` (U=1, imm12=0). The backend (arm_backend.rs) places the
4216            // 4-byte pool word at the end of the function, records the R_ARM_ABS32
4217            // relocation against `symbol+addend`, and patches the imm12 with the
4218            // real PC-relative distance once the pool offset is known.
4219            // Encoding T2: 1111 1000 1101 1111 | Rt(4) imm12(12), with the literal
4220            // base = Align(PC,4) and PC = address of this instruction + 4.
4221            ArmOp::LdrSym { rd, .. } => {
4222                let rt = reg_to_bits(rd) as u16;
4223                let hw1: u16 = 0xF8DF; // LDR.W (literal), U=1
4224                let hw2: u16 = rt << 12; // imm12 = 0 placeholder
4225                let mut bytes = Vec::with_capacity(4);
4226                bytes.extend_from_slice(&hw1.to_le_bytes());
4227                bytes.extend_from_slice(&hw2.to_le_bytes());
4228                Ok(bytes)
4229            }
4230
4231            // SetCond: Materialize condition flag into register (0 or 1)
4232            // Strategy: ITE <cond>; MOV Rd, #1; MOV Rd, #0
4233            // IMPORTANT: Must use ITE (If-Then-Else) because 16-bit Thumb MOV
4234            // always sets flags (MOVS). We need to evaluate the condition BEFORE
4235            // any MOV instruction clobbers the flags from CMP.
4236            ArmOp::SetCond { rd, cond } => {
4237                let rd_bits = reg_to_bits(rd) as u16;
4238
4239                // Condition code encoding for IT block
4240                use synth_synthesis::Condition;
4241                let cond_bits: u16 = match cond {
4242                    Condition::EQ => 0x0,
4243                    Condition::NE => 0x1,
4244                    Condition::LT => 0xB,
4245                    Condition::LE => 0xD,
4246                    Condition::GT => 0xC,
4247                    Condition::GE => 0xA,
4248                    Condition::LO => 0x3, // CC/LO (unsigned <)
4249                    Condition::LS => 0x9, // LS (unsigned <=)
4250                    Condition::HI => 0x8, // HI (unsigned >)
4251                    Condition::HS => 0x2, // CS/HS (unsigned >=)
4252                };
4253
4254                // ITE <cond>: encodes If-Then-Else block
4255                // The mask field depends on firstcond[0]:
4256                // - If firstcond[0] = 0: mask = 0xC for TE pattern (ITE EQ = BF0C)
4257                // - If firstcond[0] = 1: mask = 0x4 for TE pattern (ITE NE = BF14)
4258                let mask = if (cond_bits & 1) == 0 { 0xC } else { 0x4 };
4259                let ite_instr: u16 = 0xBF00 | (cond_bits << 4) | mask;
4260
4261                // Materialize 0/1 into Rd. The 16-bit MOVS (T1) encodes Rd in a
4262                // 3-bit field (bits[10:8]) — only R0–R7. For a high register
4263                // (R8–R12) `rd_bits << 8` overflows into bit 11 and silently
4264                // turns MOVS into CMP (00100 → 00101), corrupting the result
4265                // (this mis-materialized gale's `has_waiter`, so its `local.set`
4266                // stored a stale register → the binary-sem WAKE dispatch read
4267                // garbage). Use the 32-bit MOV.W (T2) for high registers, which
4268                // has a 4-bit Rd field. MOV.W with S=0 doesn't set flags, which
4269                // is fine inside the ITE (the materialized value is the result;
4270                // the flags are not consumed afterwards).
4271                let mut bytes = ite_instr.to_le_bytes().to_vec();
4272                let push_mov = |bytes: &mut Vec<u8>, imm: u16| {
4273                    if rd_bits <= 7 {
4274                        let m: u16 = 0x2000 | (rd_bits << 8) | imm; // 16-bit MOVS Rd,#imm
4275                        bytes.extend_from_slice(&m.to_le_bytes());
4276                    } else {
4277                        // 32-bit MOV.W Rd, #imm (T2): F04F | (Rd<<8) | imm8
4278                        let hw1: u16 = 0xF04F;
4279                        let hw2: u16 = (rd_bits << 8) | imm;
4280                        bytes.extend_from_slice(&hw1.to_le_bytes());
4281                        bytes.extend_from_slice(&hw2.to_le_bytes());
4282                    }
4283                };
4284                push_mov(&mut bytes, 1); // Then branch (condition true)  → 1
4285                push_mov(&mut bytes, 0); // Else branch (condition false) → 0
4286                Ok(bytes)
4287            }
4288
4289            // I64SetCond: Compare two i64 register pairs, result 0/1 in rd
4290            // EQ/NE: CMP lo,lo; IT EQ; CMPEQ hi,hi; ITE <cond>; MOV 1; MOV 0
4291            // LT: CMP lo,lo; SBCS rd,hi,hi; ITE LT; MOV 1; MOV 0
4292            // GT: CMP lo,lo (swapped); SBCS rd,hi,hi (swapped); ITE LT; MOV 1; MOV 0
4293            ArmOp::I64SetCond {
4294                rd,
4295                rn_lo,
4296                rn_hi,
4297                rm_lo,
4298                rm_hi,
4299                cond,
4300            } => {
4301                use synth_synthesis::Condition;
4302                let rd_bits = reg_to_bits(rd) as u16;
4303                let mut bytes = Vec::new();
4304
4305                // Helper: encode CMP Rn, Rm (16-bit)
4306                let encode_cmp_reg = |rn: &synth_synthesis::Reg,
4307                                      rm: &synth_synthesis::Reg|
4308                 -> Vec<u8> {
4309                    let rn_bits = reg_to_bits(rn) as u16;
4310                    let rm_bits = reg_to_bits(rm) as u16;
4311                    if rn_bits < 8 && rm_bits < 8 {
4312                        let instr: u16 = 0x4280 | (rm_bits << 3) | rn_bits;
4313                        instr.to_le_bytes().to_vec()
4314                    } else {
4315                        let n_bit = (rn_bits >> 3) & 1;
4316                        let instr: u16 = 0x4500 | (n_bit << 7) | (rm_bits << 3) | (rn_bits & 0x7);
4317                        instr.to_le_bytes().to_vec()
4318                    }
4319                };
4320
4321                // Helper: encode ITE <cond> (2 bytes)
4322                let encode_ite = |cond_bits: u16| -> Vec<u8> {
4323                    let mask = if (cond_bits & 1) == 0 { 0xC } else { 0x4 };
4324                    let ite_instr: u16 = 0xBF00 | (cond_bits << 4) | mask;
4325                    ite_instr.to_le_bytes().to_vec()
4326                };
4327
4328                // Helper: encode SetCond (ITE + MOV #1 + MOV #0) for given condition
4329                let encode_setcond = |cond_bits: u16, rd_bits: u16| -> Vec<u8> {
4330                    let mut b = encode_ite(cond_bits);
4331                    if rd_bits < 8 {
4332                        let mov_one: u16 = 0x2001 | (rd_bits << 8);
4333                        let mov_zero: u16 = 0x2000 | (rd_bits << 8);
4334                        b.extend_from_slice(&mov_one.to_le_bytes());
4335                        b.extend_from_slice(&mov_zero.to_le_bytes());
4336                    } else {
4337                        // #311: rd >= R8 — the 16-bit MOV imm8 form has a 3-bit
4338                        // rd field; rd_bits<<8 overflows into bit 11 and
4339                        // TRANSMUTES the MOV into CMP (0x2001|0x0800 = 0x2801 =
4340                        // CMP r0,#1): the boolean dies in the flags and the
4341                        // consumer reads a stale register. Use the 32-bit
4342                        // MOV.W (T2: F04F 0000|rd<<8|imm8) — IT-legal,
4343                        // flag-preserving. Same class as H-CODE-9 / #180.
4344                        for imm in [1u16, 0u16] {
4345                            let hw1: u16 = 0xF04F;
4346                            let hw2: u16 = (rd_bits << 8) | imm;
4347                            b.extend_from_slice(&hw1.to_le_bytes());
4348                            b.extend_from_slice(&hw2.to_le_bytes());
4349                        }
4350                    }
4351                    b
4352                };
4353
4354                match cond {
4355                    Condition::EQ | Condition::NE => {
4356                        // CMP rn_lo, rm_lo (compare low words)
4357                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4358
4359                        // IT EQ (execute next instruction only if Z=1)
4360                        let it_eq: u16 = 0xBF08; // IT EQ: cond=0000, mask=1000
4361                        bytes.extend_from_slice(&it_eq.to_le_bytes());
4362
4363                        // CMPEQ rn_hi, rm_hi (compare high words, only if low equal)
4364                        bytes.extend_from_slice(&encode_cmp_reg(rn_hi, rm_hi));
4365
4366                        // ITE <cond>; MOV rd, #1; MOV rd, #0
4367                        let cond_bits: u16 = match cond {
4368                            Condition::EQ => 0x0,
4369                            Condition::NE => 0x1,
4370                            _ => unreachable!(),
4371                        };
4372                        bytes.extend_from_slice(&encode_setcond(cond_bits, rd_bits));
4373                    }
4374
4375                    Condition::LT => {
4376                        // CMP rn_lo, rm_lo (sets C flag for borrow)
4377                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4378
4379                        // SBCS rd, rn_hi, rm_hi (subtract with carry, sets N,V flags)
4380                        // SBCS.W Rd, Rn, Rm: EB70 Rn | 0000 Rd 0000 Rm
4381                        let rn_hi_bits = reg_to_bits(rn_hi);
4382                        let rm_hi_bits = reg_to_bits(rm_hi);
4383                        let hw1: u16 = (0xEB70 | rn_hi_bits) as u16;
4384                        let hw2: u16 = ((rd_bits as u32) << 8 | rm_hi_bits) as u16;
4385                        bytes.extend_from_slice(&hw1.to_le_bytes());
4386                        bytes.extend_from_slice(&hw2.to_le_bytes());
4387
4388                        // ITE LT; MOV rd, #1; MOV rd, #0
4389                        bytes.extend_from_slice(&encode_setcond(0xB, rd_bits)); // LT = 0xB
4390                    }
4391
4392                    Condition::GT => {
4393                        // GT(a,b) = LT(b,a): swap operands
4394                        // CMP rm_lo, rn_lo (swapped)
4395                        bytes.extend_from_slice(&encode_cmp_reg(rm_lo, rn_lo));
4396
4397                        // SBCS rd, rm_hi, rn_hi (swapped)
4398                        let rm_hi_bits = reg_to_bits(rm_hi);
4399                        let rn_hi_bits = reg_to_bits(rn_hi);
4400                        let hw1: u16 = (0xEB70 | rm_hi_bits) as u16;
4401                        let hw2: u16 = ((rd_bits as u32) << 8 | rn_hi_bits) as u16;
4402                        bytes.extend_from_slice(&hw1.to_le_bytes());
4403                        bytes.extend_from_slice(&hw2.to_le_bytes());
4404
4405                        // ITE LT; MOV rd, #1; MOV rd, #0
4406                        bytes.extend_from_slice(&encode_setcond(0xB, rd_bits)); // LT = 0xB
4407                    }
4408
4409                    Condition::LE => {
4410                        // LE(a,b) = !GT(a,b): use GT logic but invert result
4411                        // GT(a,b) = LT(b,a): so we do CMP(b,a) and check LT, then invert
4412                        // CMP rm_lo, rn_lo (swapped, same as GT)
4413                        bytes.extend_from_slice(&encode_cmp_reg(rm_lo, rn_lo));
4414
4415                        // SBCS rd, rm_hi, rn_hi (swapped)
4416                        let rm_hi_bits = reg_to_bits(rm_hi);
4417                        let rn_hi_bits = reg_to_bits(rn_hi);
4418                        let hw1: u16 = (0xEB70 | rm_hi_bits) as u16;
4419                        let hw2: u16 = ((rd_bits as u32) << 8 | rn_hi_bits) as u16;
4420                        bytes.extend_from_slice(&hw1.to_le_bytes());
4421                        bytes.extend_from_slice(&hw2.to_le_bytes());
4422
4423                        // ITE GE; MOV rd, #1; MOV rd, #0 (GE is !LT, so inverting GT result)
4424                        bytes.extend_from_slice(&encode_setcond(0xA, rd_bits)); // GE = 0xA
4425                    }
4426
4427                    Condition::GE => {
4428                        // GE(a,b) = !LT(a,b): use LT logic but invert result
4429                        // CMP rn_lo, rm_lo (same as LT)
4430                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4431
4432                        // SBCS rd, rn_hi, rm_hi (same as LT)
4433                        let rn_hi_bits = reg_to_bits(rn_hi);
4434                        let rm_hi_bits = reg_to_bits(rm_hi);
4435                        let hw1: u16 = (0xEB70 | rn_hi_bits) as u16;
4436                        let hw2: u16 = ((rd_bits as u32) << 8 | rm_hi_bits) as u16;
4437                        bytes.extend_from_slice(&hw1.to_le_bytes());
4438                        bytes.extend_from_slice(&hw2.to_le_bytes());
4439
4440                        // ITE GE; MOV rd, #1; MOV rd, #0 (GE is !LT)
4441                        bytes.extend_from_slice(&encode_setcond(0xA, rd_bits)); // GE = 0xA
4442                    }
4443
4444                    // Unsigned comparisons - same instruction sequence, different conditions
4445                    Condition::LO => {
4446                        // LO (unsigned LT): CMP lo, SBCS hi, check C=0
4447                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4448                        let rn_hi_bits = reg_to_bits(rn_hi);
4449                        let rm_hi_bits = reg_to_bits(rm_hi);
4450                        let hw1: u16 = (0xEB70 | rn_hi_bits) as u16;
4451                        let hw2: u16 = ((rd_bits as u32) << 8 | rm_hi_bits) as u16;
4452                        bytes.extend_from_slice(&hw1.to_le_bytes());
4453                        bytes.extend_from_slice(&hw2.to_le_bytes());
4454                        bytes.extend_from_slice(&encode_setcond(0x3, rd_bits)); // LO = 0x3 (CC)
4455                    }
4456
4457                    Condition::HI => {
4458                        // HI (unsigned GT): swap operands and check LO
4459                        bytes.extend_from_slice(&encode_cmp_reg(rm_lo, rn_lo));
4460                        let rm_hi_bits = reg_to_bits(rm_hi);
4461                        let rn_hi_bits = reg_to_bits(rn_hi);
4462                        let hw1: u16 = (0xEB70 | rm_hi_bits) as u16;
4463                        let hw2: u16 = ((rd_bits as u32) << 8 | rn_hi_bits) as u16;
4464                        bytes.extend_from_slice(&hw1.to_le_bytes());
4465                        bytes.extend_from_slice(&hw2.to_le_bytes());
4466                        bytes.extend_from_slice(&encode_setcond(0x3, rd_bits)); // LO = 0x3 (CC)
4467                    }
4468
4469                    Condition::LS => {
4470                        // LS (unsigned LE): !(a > b) = !(HI), so do HI and invert
4471                        bytes.extend_from_slice(&encode_cmp_reg(rm_lo, rn_lo));
4472                        let rm_hi_bits = reg_to_bits(rm_hi);
4473                        let rn_hi_bits = reg_to_bits(rn_hi);
4474                        let hw1: u16 = (0xEB70 | rm_hi_bits) as u16;
4475                        let hw2: u16 = ((rd_bits as u32) << 8 | rn_hi_bits) as u16;
4476                        bytes.extend_from_slice(&hw1.to_le_bytes());
4477                        bytes.extend_from_slice(&hw2.to_le_bytes());
4478                        bytes.extend_from_slice(&encode_setcond(0x2, rd_bits)); // HS = 0x2 (CS) = !LO
4479                    }
4480
4481                    Condition::HS => {
4482                        // HS (unsigned GE): !(a < b) = !(LO)
4483                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4484                        let rn_hi_bits = reg_to_bits(rn_hi);
4485                        let rm_hi_bits = reg_to_bits(rm_hi);
4486                        let hw1: u16 = (0xEB70 | rn_hi_bits) as u16;
4487                        let hw2: u16 = ((rd_bits as u32) << 8 | rm_hi_bits) as u16;
4488                        bytes.extend_from_slice(&hw1.to_le_bytes());
4489                        bytes.extend_from_slice(&hw2.to_le_bytes());
4490                        bytes.extend_from_slice(&encode_setcond(0x2, rd_bits)); // HS = 0x2 (CS) = !LO
4491                    }
4492                }
4493
4494                Ok(bytes)
4495            }
4496
4497            // I64SetCondZ: Test if i64 register pair is zero, result 0/1 in rd
4498            // ORR.W rd, rn_lo, rn_hi; CMP rd, #0; ITE EQ; MOV 1; MOV 0
4499            ArmOp::I64SetCondZ { rd, rn_lo, rn_hi } => {
4500                let rd_bits = reg_to_bits(rd);
4501                let rn_lo_bits = reg_to_bits(rn_lo);
4502                let rn_hi_bits = reg_to_bits(rn_hi);
4503                let mut bytes = Vec::new();
4504
4505                // ORR.W rd, rn_lo, rn_hi: EA40 rn_lo | 0000 rd 0000 rn_hi
4506                let hw1: u16 = (0xEA40 | rn_lo_bits) as u16;
4507                let hw2: u16 = ((rd_bits << 8) | rn_hi_bits) as u16;
4508                bytes.extend_from_slice(&hw1.to_le_bytes());
4509                bytes.extend_from_slice(&hw2.to_le_bytes());
4510
4511                // CMP rd, #0 — 16-bit form only for r0-r7 (3-bit rd field);
4512                // high registers take CMP.W (T2: F1B0|rn 0F00|imm8). This was
4513                // H-CODE-9: rd_bits<<8 overflowing the field compared the
4514                // WRONG register. Same hardening as the #311 SetCond fix.
4515                if rd_bits < 8 {
4516                    let cmp_instr: u16 = 0x2800 | ((rd_bits as u16) << 8);
4517                    bytes.extend_from_slice(&cmp_instr.to_le_bytes());
4518                } else {
4519                    let hw1: u16 = 0xF1B0 | (rd_bits as u16);
4520                    let hw2: u16 = 0x0F00;
4521                    bytes.extend_from_slice(&hw1.to_le_bytes());
4522                    bytes.extend_from_slice(&hw2.to_le_bytes());
4523                }
4524
4525                // ITE EQ; MOV rd, #1; MOV rd, #0 (32-bit MOV.W for rd >= R8,
4526                // #311 — see I64SetCond)
4527                let mask = 0xC_u16; // ITE EQ mask: firstcond[0]=0, mask=0xC
4528                let ite_instr: u16 = 0xBF00 | mask;
4529                bytes.extend_from_slice(&ite_instr.to_le_bytes());
4530                if rd_bits < 8 {
4531                    let mov_one: u16 = 0x2001 | ((rd_bits as u16) << 8);
4532                    let mov_zero: u16 = 0x2000 | ((rd_bits as u16) << 8);
4533                    bytes.extend_from_slice(&mov_one.to_le_bytes());
4534                    bytes.extend_from_slice(&mov_zero.to_le_bytes());
4535                } else {
4536                    for imm in [1u16, 0u16] {
4537                        let hw1: u16 = 0xF04F;
4538                        let hw2: u16 = ((rd_bits as u16) << 8) | imm;
4539                        bytes.extend_from_slice(&hw1.to_le_bytes());
4540                        bytes.extend_from_slice(&hw2.to_le_bytes());
4541                    }
4542                }
4543
4544                Ok(bytes)
4545            }
4546
4547            // I64Mul: 64-bit multiply using UMULL + MLA cross products
4548            // Formula: result = (a_lo * b_lo) + ((a_lo * b_hi + a_hi * b_lo) << 32)
4549            // Uses R12 as scratch register
4550            ArmOp::I64Mul {
4551                rd_lo,
4552                rd_hi,
4553                rn_lo,
4554                rn_hi,
4555                rm_lo,
4556                rm_hi,
4557            } => {
4558                let rd_lo_bits = reg_to_bits(rd_lo);
4559                let rd_hi_bits = reg_to_bits(rd_hi);
4560                let rn_lo_bits = reg_to_bits(rn_lo);
4561                let rn_hi_bits = reg_to_bits(rn_hi);
4562                let rm_lo_bits = reg_to_bits(rm_lo);
4563                let rm_hi_bits = reg_to_bits(rm_hi);
4564                let r12: u32 = 12; // IP scratch register
4565                let mut bytes = Vec::new();
4566
4567                // 1. MUL R12, rn_lo, rm_hi  (R12 = a_lo * b_hi)
4568                // Thumb-2 MUL: hw1=0xFB00|Rn, hw2=0xF000|(Rd<<8)|Rm
4569                let hw1: u16 = (0xFB00 | rn_lo_bits) as u16;
4570                let hw2: u16 = (0xF000 | (r12 << 8) | rm_hi_bits) as u16;
4571                bytes.extend_from_slice(&hw1.to_le_bytes());
4572                bytes.extend_from_slice(&hw2.to_le_bytes());
4573
4574                // 2. MLA R12, rn_hi, rm_lo, R12  (R12 += a_hi * b_lo)
4575                // Thumb-2 MLA: hw1=0xFB00|Rn, hw2=(Ra<<12)|(Rd<<8)|Rm
4576                let hw1: u16 = (0xFB00 | rn_hi_bits) as u16;
4577                let hw2: u16 = ((r12 << 12) | (r12 << 8) | rm_lo_bits) as u16;
4578                bytes.extend_from_slice(&hw1.to_le_bytes());
4579                bytes.extend_from_slice(&hw2.to_le_bytes());
4580
4581                // 3. UMULL rd_lo, rd_hi, rn_lo, rm_lo  (rd_lo:rd_hi = a_lo * b_lo)
4582                // Thumb-2 UMULL: hw1=0xFBA0|Rn, hw2=(RdLo<<12)|(RdHi<<8)|Rm
4583                let hw1: u16 = (0xFBA0 | rn_lo_bits) as u16;
4584                let hw2: u16 = ((rd_lo_bits << 12) | (rd_hi_bits << 8) | rm_lo_bits) as u16;
4585                bytes.extend_from_slice(&hw1.to_le_bytes());
4586                bytes.extend_from_slice(&hw2.to_le_bytes());
4587
4588                // 4. ADD rd_hi, R12  (rd_hi += cross products)
4589                // 16-bit high reg ADD: 01000100 D Rm Rdn[2:0]
4590                let d_bit = (rd_hi_bits >> 3) & 1;
4591                let add_instr: u16 =
4592                    (0x4400 | (d_bit << 7) | (r12 << 3) | (rd_hi_bits & 0x7)) as u16;
4593                bytes.extend_from_slice(&add_instr.to_le_bytes());
4594
4595                Ok(bytes)
4596            }
4597
4598            // I64Shl: 64-bit shift left with branch for n<32 vs n>=32
4599            // rm_hi (R3) is used as temp register
4600            ArmOp::I64Shl {
4601                rd_lo,
4602                rd_hi,
4603                rn_lo,
4604                rn_hi,
4605                rm_lo,
4606                rm_hi,
4607            } => {
4608                let rd_lo_bits = reg_to_bits(rd_lo);
4609                let rd_hi_bits = reg_to_bits(rd_hi);
4610                let rn_lo_bits = reg_to_bits(rn_lo);
4611                let rn_hi_bits = reg_to_bits(rn_hi);
4612                let rm_lo_bits = reg_to_bits(rm_lo);
4613                let rm_hi_bits = reg_to_bits(rm_hi); // temp
4614                let mut bytes = Vec::new();
4615
4616                // AND.W rm_lo, rm_lo, #63  (mask shift amount to 6 bits)
4617                let hw1: u16 = (0xF000 | rm_lo_bits) as u16;
4618                let hw2: u16 = ((rm_lo_bits << 8) | 0x3F) as u16;
4619                bytes.extend_from_slice(&hw1.to_le_bytes());
4620                bytes.extend_from_slice(&hw2.to_le_bytes());
4621
4622                // SUBS.W rm_hi, rm_lo, #32  (rm_hi = n-32, sets flags)
4623                let hw1: u16 = (0xF1B0 | rm_lo_bits) as u16;
4624                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4625                bytes.extend_from_slice(&hw1.to_le_bytes());
4626                bytes.extend_from_slice(&hw2.to_le_bytes());
4627
4628                // BPL .large (branch if n >= 32, offset = +10 halfwords)
4629                let bpl: u16 = 0xD50A;
4630                bytes.extend_from_slice(&bpl.to_le_bytes());
4631
4632                // --- Small shift (n < 32) ---
4633                // RSB.W rm_hi, rm_lo, #32  (rm_hi = 32-n)
4634                let hw1: u16 = (0xF1C0 | rm_lo_bits) as u16;
4635                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4636                bytes.extend_from_slice(&hw1.to_le_bytes());
4637                bytes.extend_from_slice(&hw2.to_le_bytes());
4638
4639                // LSR.W rm_hi, rn_lo, rm_hi  (rm_hi = lo >> (32-n), overflow bits)
4640                let hw1: u16 = (0xFA20 | rn_lo_bits) as u16;
4641                let hw2: u16 = (0xF000 | (rm_hi_bits << 8) | rm_hi_bits) as u16;
4642                bytes.extend_from_slice(&hw1.to_le_bytes());
4643                bytes.extend_from_slice(&hw2.to_le_bytes());
4644
4645                // LSL.W rd_hi, rn_hi, rm_lo  (hi <<= n)
4646                let hw1: u16 = (0xFA00 | rn_hi_bits) as u16;
4647                let hw2: u16 = (0xF000 | (rd_hi_bits << 8) | rm_lo_bits) as u16;
4648                bytes.extend_from_slice(&hw1.to_le_bytes());
4649                bytes.extend_from_slice(&hw2.to_le_bytes());
4650
4651                // ORR.W rd_hi, rd_hi, rm_hi  (hi |= overflow bits from lo)
4652                let hw1: u16 = (0xEA40 | rd_hi_bits) as u16;
4653                let hw2: u16 = ((rd_hi_bits << 8) | rm_hi_bits) as u16;
4654                bytes.extend_from_slice(&hw1.to_le_bytes());
4655                bytes.extend_from_slice(&hw2.to_le_bytes());
4656
4657                // LSL.W rd_lo, rn_lo, rm_lo  (lo <<= n)
4658                let hw1: u16 = (0xFA00 | rn_lo_bits) as u16;
4659                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_lo_bits) as u16;
4660                bytes.extend_from_slice(&hw1.to_le_bytes());
4661                bytes.extend_from_slice(&hw2.to_le_bytes());
4662
4663                // B .done (skip large shift: +2 halfwords)
4664                let b_done: u16 = 0xE002;
4665                bytes.extend_from_slice(&b_done.to_le_bytes());
4666
4667                // --- Large shift (n >= 32) ---
4668                // LSL.W rd_hi, rn_lo, rm_hi  (hi = lo << (n-32))
4669                let hw1: u16 = (0xFA00 | rn_lo_bits) as u16;
4670                let hw2: u16 = (0xF000 | (rd_hi_bits << 8) | rm_hi_bits) as u16;
4671                bytes.extend_from_slice(&hw1.to_le_bytes());
4672                bytes.extend_from_slice(&hw2.to_le_bytes());
4673
4674                // MOV rd_lo, #0
4675                let mov_zero: u16 = 0x2000 | ((rd_lo_bits as u16) << 8);
4676                bytes.extend_from_slice(&mov_zero.to_le_bytes());
4677
4678                Ok(bytes) // Total: 38 bytes
4679            }
4680
4681            // I64ShrU: 64-bit logical shift right with branch for n<32 vs n>=32
4682            ArmOp::I64ShrU {
4683                rd_lo,
4684                rd_hi,
4685                rn_lo,
4686                rn_hi,
4687                rm_lo,
4688                rm_hi,
4689            } => {
4690                let rd_lo_bits = reg_to_bits(rd_lo);
4691                let rd_hi_bits = reg_to_bits(rd_hi);
4692                let rn_lo_bits = reg_to_bits(rn_lo);
4693                let rn_hi_bits = reg_to_bits(rn_hi);
4694                let rm_lo_bits = reg_to_bits(rm_lo);
4695                let rm_hi_bits = reg_to_bits(rm_hi); // temp
4696                let mut bytes = Vec::new();
4697
4698                // AND.W rm_lo, rm_lo, #63
4699                let hw1: u16 = (0xF000 | rm_lo_bits) as u16;
4700                let hw2: u16 = ((rm_lo_bits << 8) | 0x3F) as u16;
4701                bytes.extend_from_slice(&hw1.to_le_bytes());
4702                bytes.extend_from_slice(&hw2.to_le_bytes());
4703
4704                // SUBS.W rm_hi, rm_lo, #32
4705                let hw1: u16 = (0xF1B0 | rm_lo_bits) as u16;
4706                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4707                bytes.extend_from_slice(&hw1.to_le_bytes());
4708                bytes.extend_from_slice(&hw2.to_le_bytes());
4709
4710                // BPL .large (+10 halfwords)
4711                let bpl: u16 = 0xD50A;
4712                bytes.extend_from_slice(&bpl.to_le_bytes());
4713
4714                // --- Small shift (n < 32) ---
4715                // RSB.W rm_hi, rm_lo, #32  (rm_hi = 32-n)
4716                let hw1: u16 = (0xF1C0 | rm_lo_bits) as u16;
4717                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4718                bytes.extend_from_slice(&hw1.to_le_bytes());
4719                bytes.extend_from_slice(&hw2.to_le_bytes());
4720
4721                // LSL.W rm_hi, rn_hi, rm_hi  (rm_hi = hi << (32-n), bits flowing to lo)
4722                let hw1: u16 = (0xFA00 | rn_hi_bits) as u16;
4723                let hw2: u16 = (0xF000 | (rm_hi_bits << 8) | rm_hi_bits) as u16;
4724                bytes.extend_from_slice(&hw1.to_le_bytes());
4725                bytes.extend_from_slice(&hw2.to_le_bytes());
4726
4727                // LSR.W rd_lo, rn_lo, rm_lo  (lo >>= n)
4728                let hw1: u16 = (0xFA20 | rn_lo_bits) as u16;
4729                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_lo_bits) as u16;
4730                bytes.extend_from_slice(&hw1.to_le_bytes());
4731                bytes.extend_from_slice(&hw2.to_le_bytes());
4732
4733                // ORR.W rd_lo, rd_lo, rm_hi  (lo |= overflow from hi)
4734                let hw1: u16 = (0xEA40 | rd_lo_bits) as u16;
4735                let hw2: u16 = ((rd_lo_bits << 8) | rm_hi_bits) as u16;
4736                bytes.extend_from_slice(&hw1.to_le_bytes());
4737                bytes.extend_from_slice(&hw2.to_le_bytes());
4738
4739                // LSR.W rd_hi, rn_hi, rm_lo  (hi >>= n, logical)
4740                let hw1: u16 = (0xFA20 | rn_hi_bits) as u16;
4741                let hw2: u16 = (0xF000 | (rd_hi_bits << 8) | rm_lo_bits) as u16;
4742                bytes.extend_from_slice(&hw1.to_le_bytes());
4743                bytes.extend_from_slice(&hw2.to_le_bytes());
4744
4745                // B .done (+2 halfwords)
4746                let b_done: u16 = 0xE002;
4747                bytes.extend_from_slice(&b_done.to_le_bytes());
4748
4749                // --- Large shift (n >= 32) ---
4750                // LSR.W rd_lo, rn_hi, rm_hi  (lo = hi >> (n-32))
4751                let hw1: u16 = (0xFA20 | rn_hi_bits) as u16;
4752                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_hi_bits) as u16;
4753                bytes.extend_from_slice(&hw1.to_le_bytes());
4754                bytes.extend_from_slice(&hw2.to_le_bytes());
4755
4756                // MOV rd_hi, #0
4757                let mov_zero: u16 = 0x2000 | ((rd_hi_bits as u16) << 8);
4758                bytes.extend_from_slice(&mov_zero.to_le_bytes());
4759
4760                Ok(bytes) // Total: 38 bytes
4761            }
4762
4763            // I64ShrS: 64-bit arithmetic shift right with branch for n<32 vs n>=32
4764            ArmOp::I64ShrS {
4765                rd_lo,
4766                rd_hi,
4767                rn_lo,
4768                rn_hi,
4769                rm_lo,
4770                rm_hi,
4771            } => {
4772                let rd_lo_bits = reg_to_bits(rd_lo);
4773                let rd_hi_bits = reg_to_bits(rd_hi);
4774                let rn_lo_bits = reg_to_bits(rn_lo);
4775                let rn_hi_bits = reg_to_bits(rn_hi);
4776                let rm_lo_bits = reg_to_bits(rm_lo);
4777                let rm_hi_bits = reg_to_bits(rm_hi); // temp
4778                let mut bytes = Vec::new();
4779
4780                // AND.W rm_lo, rm_lo, #63
4781                let hw1: u16 = (0xF000 | rm_lo_bits) as u16;
4782                let hw2: u16 = ((rm_lo_bits << 8) | 0x3F) as u16;
4783                bytes.extend_from_slice(&hw1.to_le_bytes());
4784                bytes.extend_from_slice(&hw2.to_le_bytes());
4785
4786                // SUBS.W rm_hi, rm_lo, #32
4787                let hw1: u16 = (0xF1B0 | rm_lo_bits) as u16;
4788                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4789                bytes.extend_from_slice(&hw1.to_le_bytes());
4790                bytes.extend_from_slice(&hw2.to_le_bytes());
4791
4792                // BPL .large (+10 halfwords)
4793                let bpl: u16 = 0xD50A;
4794                bytes.extend_from_slice(&bpl.to_le_bytes());
4795
4796                // --- Small shift (n < 32) ---
4797                // RSB.W rm_hi, rm_lo, #32
4798                let hw1: u16 = (0xF1C0 | rm_lo_bits) as u16;
4799                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4800                bytes.extend_from_slice(&hw1.to_le_bytes());
4801                bytes.extend_from_slice(&hw2.to_le_bytes());
4802
4803                // LSL.W rm_hi, rn_hi, rm_hi  (rm_hi = hi << (32-n), bits flowing to lo)
4804                let hw1: u16 = (0xFA00 | rn_hi_bits) as u16;
4805                let hw2: u16 = (0xF000 | (rm_hi_bits << 8) | rm_hi_bits) as u16;
4806                bytes.extend_from_slice(&hw1.to_le_bytes());
4807                bytes.extend_from_slice(&hw2.to_le_bytes());
4808
4809                // LSR.W rd_lo, rn_lo, rm_lo  (lo >>= n, logical for lo word)
4810                let hw1: u16 = (0xFA20 | rn_lo_bits) as u16;
4811                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_lo_bits) as u16;
4812                bytes.extend_from_slice(&hw1.to_le_bytes());
4813                bytes.extend_from_slice(&hw2.to_le_bytes());
4814
4815                // ORR.W rd_lo, rd_lo, rm_hi  (lo |= overflow from hi)
4816                let hw1: u16 = (0xEA40 | rd_lo_bits) as u16;
4817                let hw2: u16 = ((rd_lo_bits << 8) | rm_hi_bits) as u16;
4818                bytes.extend_from_slice(&hw1.to_le_bytes());
4819                bytes.extend_from_slice(&hw2.to_le_bytes());
4820
4821                // ASR.W rd_hi, rn_hi, rm_lo  (hi >>= n, arithmetic/sign-extending)
4822                let hw1: u16 = (0xFA40 | rn_hi_bits) as u16;
4823                let hw2: u16 = (0xF000 | (rd_hi_bits << 8) | rm_lo_bits) as u16;
4824                bytes.extend_from_slice(&hw1.to_le_bytes());
4825                bytes.extend_from_slice(&hw2.to_le_bytes());
4826
4827                // B .done (+3 halfwords, large shift is 8 bytes)
4828                let b_done: u16 = 0xE003;
4829                bytes.extend_from_slice(&b_done.to_le_bytes());
4830
4831                // --- Large shift (n >= 32) ---
4832                // ASR.W rd_lo, rn_hi, rm_hi  (lo = hi >>> (n-32))
4833                let hw1: u16 = (0xFA40 | rn_hi_bits) as u16;
4834                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_hi_bits) as u16;
4835                bytes.extend_from_slice(&hw1.to_le_bytes());
4836                bytes.extend_from_slice(&hw2.to_le_bytes());
4837
4838                // ASR.W rd_hi, rn_hi, #31  (hi = sign extension, all 0s or all 1s)
4839                // Thumb-2 ASR immediate: hw1=0xEA4F, hw2=imm3:Rd:imm2:10:Rm
4840                // imm5=31=11111 → imm3=111, imm2=11
4841                let hw1: u16 = 0xEA4F;
4842                let hw2: u16 = (0x7000 | (rd_hi_bits << 8) | 0x00E0 | rn_hi_bits) as u16;
4843                bytes.extend_from_slice(&hw1.to_le_bytes());
4844                bytes.extend_from_slice(&hw2.to_le_bytes());
4845
4846                Ok(bytes) // Total: 40 bytes
4847            }
4848
4849            // I64Rotl: 64-bit rotate left (#610 rewrite).
4850            // For n < 32: new_hi = (hi << n) | (lo >> (32-n)), new_lo = (lo << n) | (hi >> (32-n))
4851            // For n >= 32: same formula with lo/hi swapped, shift by m = n-32.
4852            //
4853            // Fixed-reg core: value in R0:R1, amount in R2, scratch R3 + R12
4854            // (all four saved/marshaled by the #610 fixed-ABI wrapper; the
4855            // pre-#610 expansion wrote through the selector's registers with
4856            // colliding R3/R4 scratch and restored the saved R4 OVER the
4857            // result). Relies on ARM register-shift semantics: amounts >= 32
4858            // yield 0 for LSL/LSR, which makes n = 0 and n = 32 exact.
4859            ArmOp::I64Rotl {
4860                rdlo,
4861                rdhi,
4862                rnlo,
4863                rnhi,
4864                shift,
4865            } => {
4866                let mut bytes = Vec::new();
4867                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, shift]);
4868
4869                let core: [u16; 35] = [
4870                    0xF002, 0x023F, // AND.W  R2, R2, #63   (mask amount mod 64)
4871                    0xF1B2, 0x0320, // SUBS.W R3, R2, #32   (R3 = n-32, sets N)
4872                    0xD50E, //         BPL    .large        (n >= 32)
4873                    // --- small rotation (n < 32) ---
4874                    0xF1C2, 0x0320, // RSB.W  R3, R2, #32   (R3 = 32-n)
4875                    0xFA20, 0xFC03, // LSR.W  R12, R0, R3   (lo >> (32-n))
4876                    0xFA21, 0xF303, // LSR.W  R3, R1, R3    (hi >> (32-n))
4877                    0xFA01, 0xF102, // LSL.W  R1, R1, R2    (hi << n)
4878                    0xEA41, 0x010C, // ORR.W  R1, R1, R12   (new_hi)
4879                    0xFA00, 0xF002, // LSL.W  R0, R0, R2    (lo << n)
4880                    0xEA40, 0x0003, // ORR.W  R0, R0, R3    (new_lo)
4881                    0xE00E, //         B      .done
4882                    // --- large rotation (n >= 32), R3 = m = n-32 ---
4883                    0xF1C3, 0x0220, // RSB.W  R2, R3, #32   (R2 = 32-m = 64-n)
4884                    0xFA21, 0xFC02, // LSR.W  R12, R1, R2   (hi >> (64-n))
4885                    0xFA20, 0xF202, // LSR.W  R2, R0, R2    (lo >> (64-n))
4886                    0xFA00, 0xF003, // LSL.W  R0, R0, R3    (lo << m)
4887                    0xFA01, 0xF103, // LSL.W  R1, R1, R3    (hi << m)
4888                    0xEA40, 0x0C0C, // ORR.W  R12, R0, R12  (new_hi = (lo<<m)|(hi>>(64-n)))
4889                    0xEA41, 0x0002, // ORR.W  R0, R1, R2    (new_lo = (hi<<m)|(lo>>(64-n)))
4890                    0x4661, //         MOV    R1, R12       (new_hi into place)
4891                            // .done: result in R0:R1
4892                ];
4893                for hw in core {
4894                    bytes.extend_from_slice(&hw.to_le_bytes());
4895                }
4896
4897                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
4898                Ok(bytes) // Total: 102 bytes
4899            }
4900
4901            // I64Rotr: 64-bit rotate right (#610 rewrite).
4902            // For n < 32: new_lo = (lo >> n) | (hi << (32-n)), new_hi = (hi >> n) | (lo << (32-n))
4903            // For n >= 32: same formula with lo/hi swapped, shift by m = n-32.
4904            //
4905            // Same fixed-reg core contract as I64Rotl: value in R0:R1, amount
4906            // in R2, scratch R3 + R12, all covered by the fixed-ABI wrapper.
4907            ArmOp::I64Rotr {
4908                rdlo,
4909                rdhi,
4910                rnlo,
4911                rnhi,
4912                shift,
4913            } => {
4914                let mut bytes = Vec::new();
4915                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, shift]);
4916
4917                let core: [u16; 35] = [
4918                    0xF002, 0x023F, // AND.W  R2, R2, #63   (mask amount mod 64)
4919                    0xF1B2, 0x0320, // SUBS.W R3, R2, #32   (R3 = n-32, sets N)
4920                    0xD50E, //         BPL    .large        (n >= 32)
4921                    // --- small rotation (n < 32) ---
4922                    0xF1C2, 0x0320, // RSB.W  R3, R2, #32   (R3 = 32-n)
4923                    0xFA01, 0xFC03, // LSL.W  R12, R1, R3   (hi << (32-n))
4924                    0xFA00, 0xF303, // LSL.W  R3, R0, R3    (lo << (32-n))
4925                    0xFA20, 0xF002, // LSR.W  R0, R0, R2    (lo >> n)
4926                    0xEA40, 0x000C, // ORR.W  R0, R0, R12   (new_lo)
4927                    0xFA21, 0xF102, // LSR.W  R1, R1, R2    (hi >> n)
4928                    0xEA41, 0x0103, // ORR.W  R1, R1, R3    (new_hi)
4929                    0xE00E, //         B      .done
4930                    // --- large rotation (n >= 32), R3 = m = n-32 ---
4931                    0xF1C3, 0x0220, // RSB.W  R2, R3, #32   (R2 = 32-m = 64-n)
4932                    0xFA00, 0xFC02, // LSL.W  R12, R0, R2   (lo << (64-n))
4933                    0xFA01, 0xF202, // LSL.W  R2, R1, R2    (hi << (64-n))
4934                    0xFA21, 0xF103, // LSR.W  R1, R1, R3    (hi >> m)
4935                    0xEA41, 0x0C0C, // ORR.W  R12, R1, R12  (new_lo = (hi>>m)|(lo<<(64-n)))
4936                    0xFA20, 0xF103, // LSR.W  R1, R0, R3    (lo >> m)
4937                    0xEA41, 0x0102, // ORR.W  R1, R1, R2    (new_hi = (lo>>m)|(hi<<(64-n)))
4938                    0x4660, //         MOV    R0, R12       (new_lo into place)
4939                            // .done: result in R0:R1
4940                ];
4941                for hw in core {
4942                    bytes.extend_from_slice(&hw.to_le_bytes());
4943                }
4944
4945                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
4946                Ok(bytes) // Total: 102 bytes
4947            }
4948
4949            // I64Clz: Count leading zeros in 64-bit value
4950            // If hi != 0: result = CLZ(hi)
4951            // If hi == 0: result = 32 + CLZ(lo)
4952            //
4953            // Layout (using CMP+BNE approach for consistency):
4954            // 0: CMP.W rnhi, #0 (4 bytes)
4955            // 4: BEQ .hi_zero (2 bytes) - branch forward to offset 14
4956            // 6: CLZ.W rd, rnhi (4 bytes)
4957            // 10: B .done (2 bytes) - branch forward to offset 22
4958            // 12: NOP (2 bytes) - padding for alignment
4959            // 14: .hi_zero: CLZ.W rd, rnlo (4 bytes)
4960            // 18: ADD.W rd, rd, #32 (4 bytes)
4961            // 22: .done
4962            ArmOp::I64Clz { rd, rnlo, rnhi } => {
4963                let rd_bits = reg_to_bits(rd);
4964                let rn_lo_bits = reg_to_bits(rnlo);
4965                let rn_hi_bits = reg_to_bits(rnhi);
4966                let mut bytes = Vec::new();
4967
4968                // CMP.W rnhi, #0 (4 bytes at offset 0)
4969                let hw1: u16 = (0xF1B0 | rn_hi_bits) as u16;
4970                let hw2: u16 = 0x0F00;
4971                bytes.extend_from_slice(&hw1.to_le_bytes());
4972                bytes.extend_from_slice(&hw2.to_le_bytes());
4973
4974                // BEQ .hi_zero (2 bytes at offset 4)
4975                // PC = 4 + 4 = 8, target = 14, offset = 6, imm8 = 3
4976                let beq: u16 = 0xD003;
4977                bytes.extend_from_slice(&beq.to_le_bytes());
4978
4979                // CLZ.W rd, rnhi (4 bytes at offset 6)
4980                // CLZ T1: hw1 = 0xFAB<Rm>, hw2 = 0xF<Rd>8<Rm>
4981                let hw1: u16 = (0xFAB0 | rn_hi_bits) as u16;
4982                let hw2: u16 = (0xF080 | (rd_bits << 8) | rn_hi_bits) as u16;
4983                bytes.extend_from_slice(&hw1.to_le_bytes());
4984                bytes.extend_from_slice(&hw2.to_le_bytes());
4985
4986                // B .done (2 bytes at offset 10)
4987                // PC = 10 + 4 = 14, target = 22, offset = 8, imm11 = 4
4988                let b_done: u16 = 0xE004;
4989                bytes.extend_from_slice(&b_done.to_le_bytes());
4990
4991                // NOP (2 bytes at offset 12) - padding
4992                bytes.extend_from_slice(&0xBF00u16.to_le_bytes());
4993
4994                // .hi_zero: (offset 14)
4995                // CLZ.W rd, rnlo (4 bytes)
4996                // CLZ T1: hw1 = 0xFAB<Rm>, hw2 = 0xF<Rd>8<Rm>
4997                let hw1: u16 = (0xFAB0 | rn_lo_bits) as u16;
4998                let hw2: u16 = (0xF080 | (rd_bits << 8) | rn_lo_bits) as u16;
4999                bytes.extend_from_slice(&hw1.to_le_bytes());
5000                bytes.extend_from_slice(&hw2.to_le_bytes());
5001
5002                // ADD.W rd, rd, #32 (4 bytes at offset 18)
5003                let hw1: u16 = (0xF100 | rd_bits) as u16;
5004                let hw2: u16 = ((rd_bits << 8) | 0x20) as u16;
5005                bytes.extend_from_slice(&hw1.to_le_bytes());
5006                bytes.extend_from_slice(&hw2.to_le_bytes());
5007
5008                // .done: (offset 22)
5009                // i64.clz returns i64, so clear high word: MOV rnhi, #0 (2 bytes)
5010                // MOVS Rn, #0: 0010 0 Rn 00000000
5011                let mov0: u16 = (0x2000 | (rn_hi_bits << 8)) as u16;
5012                bytes.extend_from_slice(&mov0.to_le_bytes());
5013
5014                Ok(bytes)
5015            }
5016
5017            // I64Ctz: Count trailing zeros in 64-bit value
5018            // If lo != 0: result = CTZ(lo) = CLZ(RBIT(lo))
5019            // If lo == 0: result = 32 + CTZ(hi) = 32 + CLZ(RBIT(hi))
5020            //
5021            // Layout:
5022            // 0: CMP.W rnlo, #0 (4 bytes)
5023            // 4: BEQ .lo_zero (2 bytes) - branch to offset 18
5024            // 6: RBIT.W rd, rnlo (4 bytes)
5025            // 10: CLZ.W rd, rd (4 bytes)
5026            // 14: B .done (2 bytes) - branch to offset 30
5027            // 16: NOP (2 bytes) - padding
5028            // 18: .lo_zero: RBIT.W rd, rnhi (4 bytes)
5029            // 22: CLZ.W rd, rd (4 bytes)
5030            // 26: ADD.W rd, rd, #32 (4 bytes)
5031            // 30: .done
5032            ArmOp::I64Ctz { rd, rnlo, rnhi } => {
5033                let rd_bits = reg_to_bits(rd);
5034                let rn_lo_bits = reg_to_bits(rnlo);
5035                let rn_hi_bits = reg_to_bits(rnhi);
5036                let mut bytes = Vec::new();
5037
5038                // CMP.W rnlo, #0 (4 bytes at offset 0)
5039                let hw1: u16 = (0xF1B0 | rn_lo_bits) as u16;
5040                let hw2: u16 = 0x0F00;
5041                bytes.extend_from_slice(&hw1.to_le_bytes());
5042                bytes.extend_from_slice(&hw2.to_le_bytes());
5043
5044                // BEQ .lo_zero (2 bytes at offset 4)
5045                // PC = 4 + 4 = 8, target = 18, offset = 10, imm8 = 5
5046                let beq: u16 = 0xD005;
5047                bytes.extend_from_slice(&beq.to_le_bytes());
5048
5049                // RBIT.W rd, rnlo (4 bytes at offset 6)
5050                // RBIT T1: hw1 = 0xFA9<Rm>, hw2 = 0xF<Rd>A<Rm>
5051                let hw1: u16 = (0xFA90 | rn_lo_bits) as u16;
5052                let hw2: u16 = (0xF0A0 | (rd_bits << 8) | rn_lo_bits) as u16;
5053                bytes.extend_from_slice(&hw1.to_le_bytes());
5054                bytes.extend_from_slice(&hw2.to_le_bytes());
5055
5056                // CLZ.W rd, rd (4 bytes at offset 10)
5057                // CLZ T1: hw1 = 0xFAB<Rm>, hw2 = 0xF<Rd>8<Rm>
5058                let hw1: u16 = (0xFAB0 | rd_bits) as u16;
5059                let hw2: u16 = (0xF080 | (rd_bits << 8) | rd_bits) as u16;
5060                bytes.extend_from_slice(&hw1.to_le_bytes());
5061                bytes.extend_from_slice(&hw2.to_le_bytes());
5062
5063                // B .done (2 bytes at offset 14)
5064                // PC = 14 + 4 = 18, target = 30, offset = 12, imm11 = 6
5065                let b_done: u16 = 0xE006;
5066                bytes.extend_from_slice(&b_done.to_le_bytes());
5067
5068                // NOP (2 bytes at offset 16) - padding
5069                bytes.extend_from_slice(&0xBF00u16.to_le_bytes());
5070
5071                // .lo_zero: (offset 18)
5072                // RBIT.W rd, rnhi (4 bytes)
5073                // RBIT T1: hw1 = 0xFA9<Rm>, hw2 = 0xF<Rd>A<Rm>
5074                let hw1: u16 = (0xFA90 | rn_hi_bits) as u16;
5075                let hw2: u16 = (0xF0A0 | (rd_bits << 8) | rn_hi_bits) as u16;
5076                bytes.extend_from_slice(&hw1.to_le_bytes());
5077                bytes.extend_from_slice(&hw2.to_le_bytes());
5078
5079                // CLZ.W rd, rd (4 bytes at offset 22)
5080                // CLZ T1: hw1 = 0xFAB<Rm>, hw2 = 0xF<Rd>8<Rm>
5081                let hw1: u16 = (0xFAB0 | rd_bits) as u16;
5082                let hw2: u16 = (0xF080 | (rd_bits << 8) | rd_bits) as u16;
5083                bytes.extend_from_slice(&hw1.to_le_bytes());
5084                bytes.extend_from_slice(&hw2.to_le_bytes());
5085
5086                // ADD.W rd, rd, #32 (4 bytes at offset 26)
5087                let hw1: u16 = (0xF100 | rd_bits) as u16;
5088                let hw2: u16 = ((rd_bits << 8) | 0x20) as u16;
5089                bytes.extend_from_slice(&hw1.to_le_bytes());
5090                bytes.extend_from_slice(&hw2.to_le_bytes());
5091
5092                // .done: (offset 30)
5093                // i64.ctz returns i64, so clear high word: MOV rnhi, #0 (2 bytes)
5094                let mov0: u16 = (0x2000 | (rn_hi_bits << 8)) as u16;
5095                bytes.extend_from_slice(&mov0.to_le_bytes());
5096
5097                Ok(bytes)
5098            }
5099
5100            // I64Popcnt: Population count of 64-bit value
5101            // result = POPCNT(lo) + POPCNT(hi)
5102            // Using SIMD-style parallel bit counting algorithm
5103            ArmOp::I64Popcnt { rd, rnlo, rnhi } => {
5104                let rd_bits = reg_to_bits(rd);
5105                let rn_lo_bits = reg_to_bits(rnlo);
5106                let rn_hi_bits = reg_to_bits(rnhi);
5107                let r12: u32 = 12; // IP scratch
5108                let r3: u32 = 3; // Scratch for hi popcnt result
5109                let mut bytes = Vec::new();
5110
5111                // PUSH {R3, R4, R5} - save scratch registers
5112                bytes.extend_from_slice(&0xB438u16.to_le_bytes());
5113
5114                // Strategy: compute popcnt(lo) -> R4, popcnt(hi) -> R5, add them -> rd
5115                // Using lookup table approach for each byte would be too large
5116                // Using shift-and-add approach instead
5117
5118                // For simplicity and correctness, use the efficient parallel algorithm
5119                // but implement it as a series of inline operations
5120
5121                // Marshal the operand pair into the fixed scratch regs, routing
5122                // rnlo through R12 (#632 audit): writing R4 first corrupted the
5123                // rnhi read for a pair living at (R3,R4) — every source is read
5124                // before any scratch register it could occupy is written.
5125                // MOV R12, rnlo
5126                let mov: u16 = (0x4600 | (1 << 7) | (rn_lo_bits << 3) | 4) as u16;
5127                bytes.extend_from_slice(&mov.to_le_bytes());
5128                // MOV R5, rnhi (R4 untouched so far; rnhi == R5 is a no-op)
5129                let mov: u16 = (0x4600 | (rn_hi_bits << 3) | 5) as u16;
5130                bytes.extend_from_slice(&mov.to_le_bytes());
5131                // MOV R4, R12
5132                bytes.extend_from_slice(&0x4664u16.to_le_bytes());
5133
5134                // --- POPCNT for R4 (lo word) ---
5135                // Step 1: x = x - ((x >> 1) & 0x55555555)
5136                // LSR.W R12, R4, #1
5137                let hw1: u16 = 0xEA4F;
5138                let hw2: u16 = ((r12 << 8) | 0x50 | 4) as u16;
5139                bytes.extend_from_slice(&hw1.to_le_bytes());
5140                bytes.extend_from_slice(&hw2.to_le_bytes());
5141
5142                // Load 0x55555555 into R3 using MOVW/MOVT
5143                // MOVW R3, #0x5555
5144                bytes.extend_from_slice(&0xF245u16.to_le_bytes());
5145                bytes.extend_from_slice(&0x5355u16.to_le_bytes());
5146                // MOVT R3, #0x5555
5147                bytes.extend_from_slice(&0xF2C5u16.to_le_bytes());
5148                bytes.extend_from_slice(&0x5355u16.to_le_bytes());
5149
5150                // AND.W R12, R12, R3
5151                let hw1: u16 = (0xEA00 | r12) as u16;
5152                let hw2: u16 = ((r12 << 8) | r3) as u16;
5153                bytes.extend_from_slice(&hw1.to_le_bytes());
5154                bytes.extend_from_slice(&hw2.to_le_bytes());
5155
5156                // SUB.W R4, R4, R12
5157                let hw1: u16 = (0xEBA0 | 4) as u16;
5158                let hw2: u16 = ((4 << 8) | r12) as u16;
5159                bytes.extend_from_slice(&hw1.to_le_bytes());
5160                bytes.extend_from_slice(&hw2.to_le_bytes());
5161
5162                // Step 2: x = (x & 0x33333333) + ((x >> 2) & 0x33333333)
5163                // Load 0x33333333 into R3
5164                // MOVW R3, #0x3333
5165                bytes.extend_from_slice(&0xF243u16.to_le_bytes());
5166                bytes.extend_from_slice(&0x3333u16.to_le_bytes());
5167                // MOVT R3, #0x3333
5168                bytes.extend_from_slice(&0xF2C3u16.to_le_bytes());
5169                bytes.extend_from_slice(&0x3333u16.to_le_bytes());
5170
5171                // AND.W R12, R4, R3
5172                let hw1: u16 = (0xEA00 | 4) as u16;
5173                let hw2: u16 = ((r12 << 8) | r3) as u16;
5174                bytes.extend_from_slice(&hw1.to_le_bytes());
5175                bytes.extend_from_slice(&hw2.to_le_bytes());
5176
5177                // LSR.W R4, R4, #2
5178                let hw1: u16 = 0xEA4F;
5179                let hw2: u16 = ((4 << 8) | 0x90 | 4) as u16;
5180                bytes.extend_from_slice(&hw1.to_le_bytes());
5181                bytes.extend_from_slice(&hw2.to_le_bytes());
5182
5183                // AND.W R4, R4, R3
5184                let hw1: u16 = (0xEA00 | 4) as u16;
5185                let hw2: u16 = ((4 << 8) | r3) as u16;
5186                bytes.extend_from_slice(&hw1.to_le_bytes());
5187                bytes.extend_from_slice(&hw2.to_le_bytes());
5188
5189                // ADD.W R4, R4, R12
5190                let hw1: u16 = (0xEB00 | 4) as u16;
5191                let hw2: u16 = ((4 << 8) | r12) as u16;
5192                bytes.extend_from_slice(&hw1.to_le_bytes());
5193                bytes.extend_from_slice(&hw2.to_le_bytes());
5194
5195                // Step 3: x = (x + (x >> 4)) & 0x0F0F0F0F
5196                // LSR.W R12, R4, #4
5197                // hw2 = (imm3 << 12) | (Rd << 8) | (imm2 << 6) | (type << 4) | Rm
5198                // imm5=4=00100 → imm3=1, imm2=0, type=01(LSR)
5199                let hw1: u16 = 0xEA4F;
5200                let hw2: u16 = (0x1000 | (r12 << 8) | 0x10 | 4) as u16;
5201                bytes.extend_from_slice(&hw1.to_le_bytes());
5202                bytes.extend_from_slice(&hw2.to_le_bytes());
5203
5204                // ADD.W R4, R4, R12
5205                let hw1: u16 = (0xEB00 | 4) as u16;
5206                let hw2: u16 = ((4 << 8) | r12) as u16;
5207                bytes.extend_from_slice(&hw1.to_le_bytes());
5208                bytes.extend_from_slice(&hw2.to_le_bytes());
5209
5210                // Load 0x0F0F0F0F into R3
5211                // MOVW R3, #0x0F0F (imm4=0, i=1, imm3=7, imm8=0x0F)
5212                // hw1 = 11110 1 10 0100 0000 = 0xF640
5213                // hw2 = 0 111 0011 00001111 = 0x730F
5214                bytes.extend_from_slice(&0xF640u16.to_le_bytes());
5215                bytes.extend_from_slice(&0x730Fu16.to_le_bytes());
5216                // MOVT R3, #0x0F0F
5217                bytes.extend_from_slice(&0xF6C0u16.to_le_bytes());
5218                bytes.extend_from_slice(&0x730Fu16.to_le_bytes());
5219
5220                // AND.W R4, R4, R3
5221                let hw1: u16 = (0xEA00 | 4) as u16;
5222                let hw2: u16 = ((4 << 8) | r3) as u16;
5223                bytes.extend_from_slice(&hw1.to_le_bytes());
5224                bytes.extend_from_slice(&hw2.to_le_bytes());
5225
5226                // Step 4: x = x * 0x01010101 >> 24
5227                // Load 0x01010101 into R3
5228                // MOVW R3, #0x0101
5229                bytes.extend_from_slice(&0xF240u16.to_le_bytes());
5230                bytes.extend_from_slice(&0x1301u16.to_le_bytes());
5231                // MOVT R3, #0x0101
5232                bytes.extend_from_slice(&0xF2C0u16.to_le_bytes());
5233                bytes.extend_from_slice(&0x1301u16.to_le_bytes());
5234
5235                // MUL R4, R4, R3
5236                // MUL T2: hw1 = 0xFB00|Rn, hw2 = 0xF000|(Rd<<8)|Rm
5237                let hw1: u16 = (0xFB00 | 4) as u16;
5238                let hw2: u16 = (0xF000 | (4 << 8) | r3) as u16;
5239                bytes.extend_from_slice(&hw1.to_le_bytes());
5240                bytes.extend_from_slice(&hw2.to_le_bytes());
5241
5242                // LSR.W R4, R4, #24
5243                // imm5=24=11000 → imm3=6, imm2=0, type=01(LSR)
5244                let hw1: u16 = 0xEA4F;
5245                let hw2: u16 = (0x6000 | (4 << 8) | 0x10 | 4) as u16;
5246                bytes.extend_from_slice(&hw1.to_le_bytes());
5247                bytes.extend_from_slice(&hw2.to_le_bytes());
5248
5249                // --- POPCNT for R5 (hi word) - same algorithm ---
5250                // Step 1
5251                let hw1: u16 = 0xEA4F;
5252                let hw2: u16 = ((r12 << 8) | 0x50 | 5) as u16;
5253                bytes.extend_from_slice(&hw1.to_le_bytes());
5254                bytes.extend_from_slice(&hw2.to_le_bytes());
5255
5256                // Load 0x55555555 into R3
5257                bytes.extend_from_slice(&0xF245u16.to_le_bytes());
5258                bytes.extend_from_slice(&0x5355u16.to_le_bytes());
5259                bytes.extend_from_slice(&0xF2C5u16.to_le_bytes());
5260                bytes.extend_from_slice(&0x5355u16.to_le_bytes());
5261
5262                let hw1: u16 = (0xEA00 | r12) as u16;
5263                let hw2: u16 = ((r12 << 8) | r3) as u16;
5264                bytes.extend_from_slice(&hw1.to_le_bytes());
5265                bytes.extend_from_slice(&hw2.to_le_bytes());
5266
5267                let hw1: u16 = (0xEBA0 | 5) as u16;
5268                let hw2: u16 = ((5 << 8) | r12) as u16;
5269                bytes.extend_from_slice(&hw1.to_le_bytes());
5270                bytes.extend_from_slice(&hw2.to_le_bytes());
5271
5272                // Step 2
5273                bytes.extend_from_slice(&0xF243u16.to_le_bytes());
5274                bytes.extend_from_slice(&0x3333u16.to_le_bytes());
5275                bytes.extend_from_slice(&0xF2C3u16.to_le_bytes());
5276                bytes.extend_from_slice(&0x3333u16.to_le_bytes());
5277
5278                let hw1: u16 = (0xEA00 | 5) as u16;
5279                let hw2: u16 = ((r12 << 8) | r3) as u16;
5280                bytes.extend_from_slice(&hw1.to_le_bytes());
5281                bytes.extend_from_slice(&hw2.to_le_bytes());
5282
5283                let hw1: u16 = 0xEA4F;
5284                let hw2: u16 = ((5 << 8) | 0x90 | 5) as u16;
5285                bytes.extend_from_slice(&hw1.to_le_bytes());
5286                bytes.extend_from_slice(&hw2.to_le_bytes());
5287
5288                let hw1: u16 = (0xEA00 | 5) as u16;
5289                let hw2: u16 = ((5 << 8) | r3) as u16;
5290                bytes.extend_from_slice(&hw1.to_le_bytes());
5291                bytes.extend_from_slice(&hw2.to_le_bytes());
5292
5293                let hw1: u16 = (0xEB00 | 5) as u16;
5294                let hw2: u16 = ((5 << 8) | r12) as u16;
5295                bytes.extend_from_slice(&hw1.to_le_bytes());
5296                bytes.extend_from_slice(&hw2.to_le_bytes());
5297
5298                // Step 3: LSR.W R12, R5, #4
5299                // imm5=4=00100 → imm3=1, imm2=0, type=01(LSR)
5300                let hw1: u16 = 0xEA4F;
5301                let hw2: u16 = (0x1000 | (r12 << 8) | 0x10 | 5) as u16;
5302                bytes.extend_from_slice(&hw1.to_le_bytes());
5303                bytes.extend_from_slice(&hw2.to_le_bytes());
5304
5305                let hw1: u16 = (0xEB00 | 5) as u16;
5306                let hw2: u16 = ((5 << 8) | r12) as u16;
5307                bytes.extend_from_slice(&hw1.to_le_bytes());
5308                bytes.extend_from_slice(&hw2.to_le_bytes());
5309
5310                // Load 0x0F0F0F0F into R3 (for hi-word)
5311                bytes.extend_from_slice(&0xF640u16.to_le_bytes());
5312                bytes.extend_from_slice(&0x730Fu16.to_le_bytes());
5313                bytes.extend_from_slice(&0xF6C0u16.to_le_bytes());
5314                bytes.extend_from_slice(&0x730Fu16.to_le_bytes());
5315
5316                let hw1: u16 = (0xEA00 | 5) as u16;
5317                let hw2: u16 = ((5 << 8) | r3) as u16;
5318                bytes.extend_from_slice(&hw1.to_le_bytes());
5319                bytes.extend_from_slice(&hw2.to_le_bytes());
5320
5321                // Step 4
5322                bytes.extend_from_slice(&0xF240u16.to_le_bytes());
5323                bytes.extend_from_slice(&0x1301u16.to_le_bytes());
5324                bytes.extend_from_slice(&0xF2C0u16.to_le_bytes());
5325                bytes.extend_from_slice(&0x1301u16.to_le_bytes());
5326
5327                // MUL R5, R5, R3
5328                // MUL T2: hw1 = 0xFB00|Rn, hw2 = 0xF000|(Rd<<8)|Rm
5329                let hw1: u16 = (0xFB00 | 5) as u16;
5330                let hw2: u16 = (0xF000 | (5 << 8) | r3) as u16;
5331                bytes.extend_from_slice(&hw1.to_le_bytes());
5332                bytes.extend_from_slice(&hw2.to_le_bytes());
5333
5334                // LSR.W R5, R5, #24
5335                // imm5=24=11000 → imm3=6, imm2=0, type=01(LSR)
5336                let hw1: u16 = 0xEA4F;
5337                let hw2: u16 = (0x6000 | (5 << 8) | 0x10 | 5) as u16;
5338                bytes.extend_from_slice(&hw1.to_le_bytes());
5339                bytes.extend_from_slice(&hw2.to_le_bytes());
5340
5341                // #632: the count must be carried ACROSS the scratch restore
5342                // in a register the POP cannot touch. rd is allocator-assigned
5343                // (any of R0-R8) and can land inside the {R3,R4,R5} restore set
5344                // — the old `ADDS rd, R4, R5; POP {R3,R4,R5}` destroyed the
5345                // result one instruction after computing it (0 for every input
5346                // under qemu). R12 is encoder scratch: never allocatable (#212)
5347                // and never in a restore set, so no choice of rd can collide.
5348                // ADD.W R12, R4, R5
5349                bytes.extend_from_slice(&0xEB04u16.to_le_bytes());
5350                bytes.extend_from_slice(&0x0C05u16.to_le_bytes());
5351
5352                // POP {R3, R4, R5}
5353                bytes.extend_from_slice(&0xBC38u16.to_le_bytes());
5354
5355                // MOV rd, R12 — after the restore. The 4-bit Rd (D:rd) form is
5356                // also total over rd = R8, where the old ADDS T1 3-bit field
5357                // silently corrupted the encoding (#178/#180 class).
5358                let mov: u16 =
5359                    (0x4600 | (((rd_bits >> 3) & 1) << 7) | (12 << 3) | (rd_bits & 7)) as u16;
5360                bytes.extend_from_slice(&mov.to_le_bytes());
5361
5362                // i64.popcnt returns i64, so clear high word: MOV.W rnhi, #0
5363                // (T2, 4 bytes — total over rnhi = R8, where the old 16-bit
5364                // MOVS encoding overflowed its 3-bit field into CMP R0, #0).
5365                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
5366                bytes.extend_from_slice(&(((rn_hi_bits & 0xF) << 8) as u16).to_le_bytes());
5367
5368                Ok(bytes)
5369            }
5370
5371            // I64Extend8S: Sign-extend low 8 bits to 64 bits
5372            // Result: rdlo = sign_extend_8(rnlo), rdhi = rdlo >> 31
5373            ArmOp::I64Extend8S { rdlo, rdhi, rnlo } => {
5374                let rdlo_bits = reg_to_bits(rdlo);
5375                let rdhi_bits = reg_to_bits(rdhi);
5376                let rnlo_bits = reg_to_bits(rnlo);
5377                let mut bytes = Vec::new();
5378
5379                // SXTB.W rdlo, rnlo (sign-extend byte to 32-bit)
5380                // SXTB T2: hw1 = 0xFA4F, hw2 = 0xF0<Rd><Rm>
5381                let hw1: u16 = 0xFA4F_u16;
5382                let hw2: u16 = (0xF080 | (rdlo_bits << 8) | rnlo_bits) as u16;
5383                bytes.extend_from_slice(&hw1.to_le_bytes());
5384                bytes.extend_from_slice(&hw2.to_le_bytes());
5385
5386                // ASR.W rdhi, rdlo, #31 (sign-extend to high word)
5387                // ASR (immediate): hw1 = 0xEA4F, hw2 = imm3:Rd:imm2:type:Rm
5388                // For imm5=31: imm3=111, imm2=11, type=10 (ASR)
5389                // hw2 = (7 << 12) | (rdhi << 8) | (3 << 6) | (2 << 4) | rdlo
5390                let hw1: u16 = 0xEA4F;
5391                let hw2: u16 = (0x70E0 | (rdhi_bits << 8) | rdlo_bits) as u16;
5392                bytes.extend_from_slice(&hw1.to_le_bytes());
5393                bytes.extend_from_slice(&hw2.to_le_bytes());
5394
5395                Ok(bytes)
5396            }
5397
5398            // I64Extend16S: Sign-extend low 16 bits to 64 bits
5399            // Result: rdlo = sign_extend_16(rnlo), rdhi = rdlo >> 31
5400            ArmOp::I64Extend16S { rdlo, rdhi, rnlo } => {
5401                let rdlo_bits = reg_to_bits(rdlo);
5402                let rdhi_bits = reg_to_bits(rdhi);
5403                let rnlo_bits = reg_to_bits(rnlo);
5404                let mut bytes = Vec::new();
5405
5406                // SXTH.W rdlo, rnlo (sign-extend halfword to 32-bit)
5407                // SXTH T2: hw1 = 0xFA0F, hw2 = 0xF0<Rd><Rm>
5408                let hw1: u16 = 0xFA0F_u16;
5409                let hw2: u16 = (0xF080 | (rdlo_bits << 8) | rnlo_bits) as u16;
5410                bytes.extend_from_slice(&hw1.to_le_bytes());
5411                bytes.extend_from_slice(&hw2.to_le_bytes());
5412
5413                // ASR.W rdhi, rdlo, #31 (sign-extend to high word)
5414                let hw1: u16 = 0xEA4F;
5415                let hw2: u16 = (0x70E0 | (rdhi_bits << 8) | rdlo_bits) as u16;
5416                bytes.extend_from_slice(&hw1.to_le_bytes());
5417                bytes.extend_from_slice(&hw2.to_le_bytes());
5418
5419                Ok(bytes)
5420            }
5421
5422            // I64Extend32S: Sign-extend low 32 bits to 64 bits
5423            // Result: rdlo = rnlo, rdhi = rnlo >> 31
5424            ArmOp::I64Extend32S { rdlo, rdhi, rnlo } => {
5425                let rdlo_bits = reg_to_bits(rdlo);
5426                let rdhi_bits = reg_to_bits(rdhi);
5427                let rnlo_bits = reg_to_bits(rnlo);
5428                let mut bytes = Vec::new();
5429
5430                // MOV rdlo, rnlo (if different)
5431                if rdlo_bits != rnlo_bits {
5432                    // MOV Rd, Rm (16-bit): 0100 0110 D Rm Rd[2:0]
5433                    let d_bit = ((rdlo_bits >> 3) & 1) as u16;
5434                    let mov: u16 = 0x4600
5435                        | (d_bit << 7)
5436                        | ((rnlo_bits as u16) << 3)
5437                        | ((rdlo_bits & 0x7) as u16);
5438                    bytes.extend_from_slice(&mov.to_le_bytes());
5439                }
5440
5441                // ASR.W rdhi, rnlo, #31 (sign-extend to high word)
5442                let hw1: u16 = 0xEA4F;
5443                let hw2: u16 = (0x70E0 | (rdhi_bits << 8) | rnlo_bits) as u16;
5444                bytes.extend_from_slice(&hw1.to_le_bytes());
5445                bytes.extend_from_slice(&hw2.to_le_bytes());
5446
5447                Ok(bytes)
5448            }
5449
5450            // SelectMove: IT <cond>; MOV{cond} rd, rm
5451            // Conditional move: only execute MOV if condition is true
5452            ArmOp::SelectMove { rd, rm, cond } => {
5453                let rd_bits = reg_to_bits(rd) as u16;
5454                let rm_bits = reg_to_bits(rm) as u16;
5455
5456                // Condition code encoding for IT block
5457                use synth_synthesis::Condition;
5458                let cond_bits: u16 = match cond {
5459                    Condition::EQ => 0x0, // Equal
5460                    Condition::NE => 0x1, // Not equal
5461                    Condition::HS => 0x2, // Higher or same (unsigned >=)
5462                    Condition::LO => 0x3, // Lower (unsigned <)
5463                    Condition::HI => 0x8, // Higher (unsigned >)
5464                    Condition::LS => 0x9, // Lower or same (unsigned <=)
5465                    Condition::GE => 0xA, // Greater or equal (signed)
5466                    Condition::LT => 0xB, // Less than (signed)
5467                    Condition::GT => 0xC, // Greater than (signed)
5468                    Condition::LE => 0xD, // Less or equal (signed)
5469                };
5470
5471                // IT <cond>: single Then block (mask = 0x8 for T only)
5472                // IT instruction: 1011 1111 firstcond mask
5473                let it_instr: u16 = 0xBF00 | (cond_bits << 4) | 0x8;
5474
5475                // MOV Rd, Rm (16-bit): 0100 0110 D Rm Rd[2:0]
5476                // This MOV will only execute if condition is true due to IT block
5477                let d_bit = (rd_bits >> 3) & 1;
5478                let mov_instr: u16 = 0x4600 | (d_bit << 7) | (rm_bits << 3) | (rd_bits & 0x7);
5479
5480                // Emit: IT <cond>, MOV rd, rm
5481                let mut bytes = it_instr.to_le_bytes().to_vec();
5482                bytes.extend_from_slice(&mov_instr.to_le_bytes());
5483                Ok(bytes)
5484            }
5485
5486            // Popcnt: Population count (count set bits)
5487            // ARM Cortex-M has no native POPCNT, so we implement the bit manipulation algorithm:
5488            // x = x - ((x >> 1) & 0x55555555);
5489            // x = (x & 0x33333333) + ((x >> 2) & 0x33333333);
5490            // x = (x + (x >> 4)) & 0x0F0F0F0F;
5491            // x = x + (x >> 8);
5492            // x = x + (x >> 16);
5493            // return x & 0x3F;
5494            //
5495            // Uses rd as working register and R12 as scratch for constants
5496            ArmOp::Popcnt { rd, rm } => {
5497                let mut bytes = Vec::new();
5498
5499                // First, move rm to rd if they're different
5500                if rd != rm {
5501                    let rd_bits = reg_to_bits(rd) as u16;
5502                    let rm_bits = reg_to_bits(rm) as u16;
5503                    // MOV Rd, Rm (16-bit): 0100 0110 D Rm Rd[2:0]
5504                    let d_bit = (rd_bits >> 3) & 1;
5505                    let mov_instr: u16 = 0x4600 | (d_bit << 7) | (rm_bits << 3) | (rd_bits & 0x7);
5506                    bytes.extend_from_slice(&mov_instr.to_le_bytes());
5507                }
5508
5509                // Step 1: x = x - ((x >> 1) & 0x55555555)
5510                // Load 0x55555555 into R12
5511                bytes.extend_from_slice(&self.encode_thumb32_movw_raw(12, 0x5555)?);
5512                bytes.extend_from_slice(&self.encode_thumb32_movt_raw(12, 0x5555)?);
5513
5514                // R12_temp = rd >> 1
5515                // We need a second scratch register. Use R11.
5516                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(11, reg_to_bits(rd), 1)?);
5517
5518                // R11 = R11 & R12 (R11 = (x >> 1) & 0x55555555)
5519                bytes.extend_from_slice(&self.encode_thumb32_and_reg_raw(11, 11, 12)?);
5520
5521                // rd = rd - R11
5522                bytes.extend_from_slice(&self.encode_thumb32_sub_reg_raw(
5523                    reg_to_bits(rd),
5524                    reg_to_bits(rd),
5525                    11,
5526                )?);
5527
5528                // Step 2: x = (x & 0x33333333) + ((x >> 2) & 0x33333333)
5529                // Load 0x33333333 into R12
5530                bytes.extend_from_slice(&self.encode_thumb32_movw_raw(12, 0x3333)?);
5531                bytes.extend_from_slice(&self.encode_thumb32_movt_raw(12, 0x3333)?);
5532
5533                // R11 = rd & R12
5534                bytes.extend_from_slice(&self.encode_thumb32_and_reg_raw(
5535                    11,
5536                    reg_to_bits(rd),
5537                    12,
5538                )?);
5539
5540                // rd = rd >> 2
5541                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(
5542                    reg_to_bits(rd),
5543                    reg_to_bits(rd),
5544                    2,
5545                )?);
5546
5547                // rd = rd & R12
5548                bytes.extend_from_slice(&self.encode_thumb32_and_reg_raw(
5549                    reg_to_bits(rd),
5550                    reg_to_bits(rd),
5551                    12,
5552                )?);
5553
5554                // rd = rd + R11
5555                bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
5556                    reg_to_bits(rd),
5557                    reg_to_bits(rd),
5558                    11,
5559                )?);
5560
5561                // Step 3: x = (x + (x >> 4)) & 0x0F0F0F0F
5562                // R11 = rd >> 4
5563                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(11, reg_to_bits(rd), 4)?);
5564
5565                // rd = rd + R11
5566                bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
5567                    reg_to_bits(rd),
5568                    reg_to_bits(rd),
5569                    11,
5570                )?);
5571
5572                // Load 0x0F0F0F0F into R12
5573                bytes.extend_from_slice(&self.encode_thumb32_movw_raw(12, 0x0F0F)?);
5574                bytes.extend_from_slice(&self.encode_thumb32_movt_raw(12, 0x0F0F)?);
5575
5576                // rd = rd & R12
5577                bytes.extend_from_slice(&self.encode_thumb32_and_reg_raw(
5578                    reg_to_bits(rd),
5579                    reg_to_bits(rd),
5580                    12,
5581                )?);
5582
5583                // Step 4: x = x + (x >> 8)
5584                // R11 = rd >> 8
5585                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(11, reg_to_bits(rd), 8)?);
5586
5587                // rd = rd + R11
5588                bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
5589                    reg_to_bits(rd),
5590                    reg_to_bits(rd),
5591                    11,
5592                )?);
5593
5594                // Step 5: x = x + (x >> 16)
5595                // R11 = rd >> 16
5596                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(11, reg_to_bits(rd), 16)?);
5597
5598                // rd = rd + R11
5599                bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
5600                    reg_to_bits(rd),
5601                    reg_to_bits(rd),
5602                    11,
5603                )?);
5604
5605                // Step 6: return x & 0x3F
5606                // AND with 0x3F (small immediate, can use BIC or AND with immediate)
5607                bytes.extend_from_slice(&self.encode_thumb32_and_imm_raw(
5608                    reg_to_bits(rd),
5609                    reg_to_bits(rd),
5610                    0x3F,
5611                )?);
5612
5613                Ok(bytes)
5614            }
5615
5616            // I64DivU: 64-bit unsigned division using binary long division
5617            // Core: R0:R1 = dividend, R2:R3 = divisor -> R0:R1 = quotient
5618            // Uses: R4-R7, R12 as loop counter (avoid R8 for Renode compatibility)
5619            //
5620            // #610: the fixed-ABI wrapper marshals the selector-assigned
5621            // operand registers into the core's fixed regs and lands the
5622            // result in rd — pre-#610 this arm IGNORED its register fields,
5623            // so the selector read its rd pair (e.g. R4:R5) after the core's
5624            // own POP restored the stale caller values over it: 0 for every
5625            // input. A zero divisor now traps (UDF #0), per WASM semantics.
5626            ArmOp::I64DivU {
5627                rdlo,
5628                rdhi,
5629                rnlo,
5630                rnhi,
5631                rmlo,
5632                rmhi,
5633                elide_zero_guard,
5634            } => {
5635                let mut bytes = Vec::new();
5636                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, rmlo, rmhi]);
5637                // #494 phase 2b: elided only under a certificate-discharged
5638                // UNSAT(P ∧ divisor == 0) obligation (fact-spec pass).
5639                if !elide_zero_guard {
5640                    emit_i64_divisor_zero_trap(&mut bytes);
5641                }
5642
5643                // PUSH {R4-R7} - save scratch registers (NO LR — this is inline code)
5644                // 16-bit PUSH: 1011 010 M rrrrrrrr where M=0 (no LR), r=R4-R7 = 0xF0
5645                // Encoding: 1011 0100 1111 0000 = 0xB4F0
5646                bytes.extend_from_slice(&0xB4F0u16.to_le_bytes());
5647
5648                // Initialize quotient (R4:R5) = 0
5649                bytes.extend_from_slice(&0x2400u16.to_le_bytes()); // MOV R4, #0
5650                bytes.extend_from_slice(&0x2500u16.to_le_bytes()); // MOV R5, #0
5651
5652                // Initialize remainder (R6:R7) = 0
5653                bytes.extend_from_slice(&0x2600u16.to_le_bytes()); // MOV R6, #0
5654                bytes.extend_from_slice(&0x2700u16.to_le_bytes()); // MOV R7, #0
5655
5656                // Initialize loop counter R12 = 64 (use R12 scratch instead of R8)
5657                // MOV.W R12, #64: F04F 0C40
5658                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
5659                bytes.extend_from_slice(&0x0C40u16.to_le_bytes());
5660
5661                // Loop start
5662                let loop_start = bytes.len();
5663
5664                // === Loop body: process one bit ===
5665
5666                // 1. Shift quotient R4:R5 left by 1
5667                // LSLS R5, R5, #1 (16-bit: 0000 0010 1010 1101 = 0x006D -> actually 0x002D for LSL R5,R5,#1)
5668                // LSL Rd, Rm, #imm5: 000 00 imm5 Rm Rd = 000 00 00001 101 101 = 0x006D
5669                bytes.extend_from_slice(&0x006Du16.to_le_bytes()); // LSLS R5, R5, #1
5670                // Get carry from R4 into R5: ORR R5, R5, R4 LSR #31
5671                // Thumb-2 ORR with shifted register: EA45 75D4 = ORR.W R5, R5, R4, LSR #31
5672                // 11101010 010 S Rn | 0 imm3 Rd imm2 type Rm
5673                // type=01 (LSR), imm5=31 (imm3=111, imm2=11)
5674                bytes.extend_from_slice(&0xEA45u16.to_le_bytes());
5675                bytes.extend_from_slice(&0x75D4u16.to_le_bytes()); // ORR.W R5, R5, R4, LSR #31
5676                // LSLS R4, R4, #1: 000 00 00001 100 100 = 0x0064
5677                bytes.extend_from_slice(&0x0064u16.to_le_bytes()); // LSLS R4, R4, #1
5678
5679                // 2. Shift remainder R6:R7 left by 1, OR in MSB of dividend R1
5680                // LSLS R7, R7, #1
5681                bytes.extend_from_slice(&0x007Fu16.to_le_bytes()); // LSLS R7, R7, #1
5682                // ORR.W R7, R7, R6, LSR #31
5683                bytes.extend_from_slice(&0xEA47u16.to_le_bytes());
5684                bytes.extend_from_slice(&0x77D6u16.to_le_bytes());
5685                // LSLS R6, R6, #1
5686                bytes.extend_from_slice(&0x0076u16.to_le_bytes()); // LSLS R6, R6, #1
5687                // ORR.W R6, R6, R1, LSR #31 (bring in MSB of dividend high)
5688                bytes.extend_from_slice(&0xEA46u16.to_le_bytes());
5689                bytes.extend_from_slice(&0x76D1u16.to_le_bytes());
5690
5691                // 3. Shift dividend R0:R1 left by 1
5692                // LSLS R1, R1, #1
5693                bytes.extend_from_slice(&0x0049u16.to_le_bytes()); // LSLS R1, R1, #1
5694                // ORR.W R1, R1, R0, LSR #31
5695                bytes.extend_from_slice(&0xEA41u16.to_le_bytes());
5696                bytes.extend_from_slice(&0x71D0u16.to_le_bytes());
5697                // LSLS R0, R0, #1
5698                bytes.extend_from_slice(&0x0040u16.to_le_bytes()); // LSLS R0, R0, #1
5699
5700                // 4. Compare remainder >= divisor (64-bit unsigned comparison)
5701                // Compare high words first: CMP R7, R3
5702                // CMP Rn, Rm encoding: 0x4280 | (Rm << 3) | Rn
5703                bytes.extend_from_slice(&0x429Fu16.to_le_bytes()); // CMP R7, R3 (16-bit)
5704                // BHI means R7 > R3 (unsigned) - definitely subtract
5705                // BLO means R7 < R3 - definitely don't subtract
5706                // BEQ means need to check low words
5707
5708                // If high > divisor high: branch to subtract (forward +offset)
5709                // BHI.N +6 (skip CMP, skip BLO, do subtract)
5710                // BHI: 1101 1000 offset8 where cond=1000 (HI)
5711                bytes.extend_from_slice(&0xD802u16.to_le_bytes()); // BHI +4 (to subtract block)
5712
5713                // If high < divisor high: branch past subtract
5714                // BLO.N +10 (skip to decrement)
5715                bytes.extend_from_slice(&0xD306u16.to_le_bytes()); // BLO/BCC +12 (past subtract)
5716
5717                // High words equal, compare low: CMP R6, R2
5718                bytes.extend_from_slice(&0x4296u16.to_le_bytes()); // CMP R6, R2 (16-bit)
5719                // BLO/BCC past subtract (skip SUBS+SBC.W+ORR.W = 10 bytes = 4 halfwords from PC+4)
5720                bytes.extend_from_slice(&0xD304u16.to_le_bytes()); // BCC +4 halfwords (past subtract)
5721
5722                // === Subtract block: remainder -= divisor, quotient |= 1 ===
5723                // SUBS R6, R6, R2
5724                bytes.extend_from_slice(&0x1AB6u16.to_le_bytes()); // SUBS R6, R6, R2 (16-bit)
5725                // SBC R7, R7, R3 (with borrow)
5726                // Thumb-2 SBC.W: EB67 0703 = SBC.W R7, R7, R3
5727                bytes.extend_from_slice(&0xEB67u16.to_le_bytes());
5728                bytes.extend_from_slice(&0x0703u16.to_le_bytes());
5729                // ORR R4, R4, #1 (set bit 0 of quotient low)
5730                bytes.extend_from_slice(&0xF044u16.to_le_bytes()); // ORR.W R4, R4, #1
5731                bytes.extend_from_slice(&0x0401u16.to_le_bytes());
5732
5733                // === Decrement counter and loop ===
5734                // SUBS.W R12, R12, #1 (decrement loop counter)
5735                // SUBS.W R12, R12, #1: F1BC 0C01
5736                bytes.extend_from_slice(&0xF1BCu16.to_le_bytes());
5737                bytes.extend_from_slice(&0x0C01u16.to_le_bytes());
5738
5739                // BNE back to loop_start
5740                let branch_offset_bytes = bytes.len() - loop_start + 4; // +4 for pipeline
5741                let offset_halfwords = -((branch_offset_bytes / 2) as i16);
5742                let bne_encoding = 0xD100u16 | ((offset_halfwords as u16) & 0xFF);
5743                bytes.extend_from_slice(&bne_encoding.to_le_bytes());
5744
5745                // === Loop done, move quotient to R0:R1 ===
5746                bytes.extend_from_slice(&0x4620u16.to_le_bytes()); // MOV R0, R4
5747                bytes.extend_from_slice(&0x4629u16.to_le_bytes()); // MOV R1, R5
5748
5749                // POP {R4-R7} - restore scratch registers (NO PC — inline code continues)
5750                // 16-bit POP: 1011 110 P rrrrrrrr where P=0 (no PC), r=R4-R7 = 0xF0
5751                // Encoding: 1011 1100 1111 0000 = 0xBCF0
5752                bytes.extend_from_slice(&0xBCF0u16.to_le_bytes());
5753
5754                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
5755                Ok(bytes)
5756            }
5757
5758            // I64DivS: 64-bit signed division
5759            // Converts to unsigned, divides, then applies sign
5760            // Core: R0:R1 = dividend (signed), R2:R3 = divisor (signed)
5761            //   ->  R0:R1 = quotient (signed)
5762            // #610: fixed-ABI wrapper + zero-divisor trap (see I64DivU).
5763            ArmOp::I64DivS {
5764                rdlo,
5765                rdhi,
5766                rnlo,
5767                rnhi,
5768                rmlo,
5769                rmhi,
5770                elide_zero_guard,
5771                elide_overflow_guard,
5772            } => {
5773                let mut bytes = Vec::new();
5774                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, rmlo, rmhi]);
5775                // #494 phase 2b: two INDEPENDENT guards, two INDEPENDENT
5776                // obligations. The zero guard falls to UNSAT(P ∧ divisor == 0);
5777                // the #633 overflow guard falls ONLY to
5778                // UNSAT(P ∧ dividend == INT64_MIN ∧ divisor == -1) — a
5779                // divisor-nonzero fact alone must keep it.
5780                if !elide_zero_guard {
5781                    emit_i64_divisor_zero_trap(&mut bytes);
5782                }
5783                if !elide_overflow_guard {
5784                    // #633: INT64_MIN / -1 overflows — trap like the i32 path
5785                    // (rem_s stays guard-free: rem_s(INT64_MIN, -1) == 0).
5786                    emit_i64_divs_overflow_trap(&mut bytes);
5787                }
5788
5789                // PUSH {R4-R11} - save scratch registers (NO LR — inline code)
5790                bytes.extend_from_slice(&0xE92Du16.to_le_bytes());
5791                bytes.extend_from_slice(&0x0FF0u16.to_le_bytes());
5792
5793                // Save result sign in R9: R9 = R1 XOR R3 (sign bit = MSB)
5794                // EOR.W R9, R1, R3
5795                bytes.extend_from_slice(&0xEA81u16.to_le_bytes());
5796                bytes.extend_from_slice(&0x0903u16.to_le_bytes());
5797
5798                // If dividend negative (R1 MSB set), negate it
5799                // TST R1, R1 (check sign)
5800                bytes.extend_from_slice(&0x4209u16.to_le_bytes()); // TST R1, R1
5801                // BPL skip_neg_dividend (+10 bytes = 5 halfwords)
5802                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
5803
5804                // Negate R0:R1 (64-bit): RSBS R0, R0, #0; SBC R1, R1, R1 LSL #1
5805                // Actually: MVN R0, R0; MVN R1, R1; ADDS R0, R0, #1; ADC R1, R1, #0
5806                bytes.extend_from_slice(&0x43C0u16.to_le_bytes()); // MVNS R0, R0
5807                bytes.extend_from_slice(&0x43C9u16.to_le_bytes()); // MVNS R1, R1
5808                bytes.extend_from_slice(&0x1C40u16.to_le_bytes()); // ADDS R0, R0, #1
5809                bytes.extend_from_slice(&0xF141u16.to_le_bytes()); // ADC.W R1, R1, #0
5810                bytes.extend_from_slice(&0x0100u16.to_le_bytes());
5811
5812                // If divisor negative (R3 MSB set), negate it
5813                bytes.extend_from_slice(&0x421Bu16.to_le_bytes()); // TST R3, R3
5814                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
5815
5816                // Negate R2:R3
5817                bytes.extend_from_slice(&0x43D2u16.to_le_bytes()); // MVNS R2, R2
5818                bytes.extend_from_slice(&0x43DBu16.to_le_bytes()); // MVNS R3, R3
5819                bytes.extend_from_slice(&0x1C52u16.to_le_bytes()); // ADDS R2, R2, #1
5820                bytes.extend_from_slice(&0xF143u16.to_le_bytes()); // ADC.W R3, R3, #0
5821                bytes.extend_from_slice(&0x0300u16.to_le_bytes());
5822
5823                // === Now do unsigned division (same as I64DivU) ===
5824                // Initialize quotient (R4:R5) = 0
5825                bytes.extend_from_slice(&0x2400u16.to_le_bytes());
5826                bytes.extend_from_slice(&0x2500u16.to_le_bytes());
5827                // Initialize remainder (R6:R7) = 0
5828                bytes.extend_from_slice(&0x2600u16.to_le_bytes());
5829                bytes.extend_from_slice(&0x2700u16.to_le_bytes());
5830                // Initialize loop counter R8 = 64
5831                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
5832                bytes.extend_from_slice(&0x0840u16.to_le_bytes());
5833
5834                let loop_start = bytes.len();
5835
5836                // Shift quotient left
5837                bytes.extend_from_slice(&0x006Du16.to_le_bytes()); // LSLS R5, R5, #1
5838                bytes.extend_from_slice(&0xEA45u16.to_le_bytes()); // ORR.W R5, R5, R4, LSR #31
5839                bytes.extend_from_slice(&0x75D4u16.to_le_bytes());
5840                bytes.extend_from_slice(&0x0064u16.to_le_bytes()); // LSLS R4, R4, #1
5841
5842                // Shift remainder left, OR in MSB of dividend
5843                bytes.extend_from_slice(&0x007Fu16.to_le_bytes()); // LSLS R7, R7, #1
5844                bytes.extend_from_slice(&0xEA47u16.to_le_bytes()); // ORR.W R7, R7, R6, LSR #31
5845                bytes.extend_from_slice(&0x77D6u16.to_le_bytes());
5846                bytes.extend_from_slice(&0x0076u16.to_le_bytes()); // LSLS R6, R6, #1
5847                bytes.extend_from_slice(&0xEA46u16.to_le_bytes()); // ORR.W R6, R6, R1, LSR #31
5848                bytes.extend_from_slice(&0x76D1u16.to_le_bytes());
5849
5850                // Shift dividend left
5851                bytes.extend_from_slice(&0x0049u16.to_le_bytes()); // LSLS R1, R1, #1
5852                bytes.extend_from_slice(&0xEA41u16.to_le_bytes()); // ORR.W R1, R1, R0, LSR #31
5853                bytes.extend_from_slice(&0x71D0u16.to_le_bytes());
5854                bytes.extend_from_slice(&0x0040u16.to_le_bytes()); // LSLS R0, R0, #1
5855
5856                // Compare and conditionally subtract
5857                bytes.extend_from_slice(&0x429Fu16.to_le_bytes()); // CMP R7, R3
5858                bytes.extend_from_slice(&0xD802u16.to_le_bytes()); // BHI +4
5859                bytes.extend_from_slice(&0xD306u16.to_le_bytes()); // BCC +12
5860                bytes.extend_from_slice(&0x4296u16.to_le_bytes()); // CMP R6, R2
5861                bytes.extend_from_slice(&0xD304u16.to_le_bytes()); // BCC +4 halfwords
5862
5863                // Subtract and set quotient bit
5864                bytes.extend_from_slice(&0x1AB6u16.to_le_bytes()); // SUBS R6, R6, R2
5865                bytes.extend_from_slice(&0xEB67u16.to_le_bytes()); // SBC.W R7, R7, R3
5866                bytes.extend_from_slice(&0x0703u16.to_le_bytes());
5867                bytes.extend_from_slice(&0xF044u16.to_le_bytes()); // ORR.W R4, R4, #1
5868                bytes.extend_from_slice(&0x0401u16.to_le_bytes());
5869
5870                // Decrement and loop
5871                bytes.extend_from_slice(&0xF1B8u16.to_le_bytes()); // SUB.W R8, R8, #1
5872                bytes.extend_from_slice(&0x0801u16.to_le_bytes());
5873
5874                let branch_offset_bytes = bytes.len() - loop_start + 4;
5875                let offset_halfwords = -((branch_offset_bytes / 2) as i16);
5876                let bne_encoding = 0xD100u16 | ((offset_halfwords as u16) & 0xFF);
5877                bytes.extend_from_slice(&bne_encoding.to_le_bytes());
5878
5879                // Move quotient to R0:R1
5880                bytes.extend_from_slice(&0x4620u16.to_le_bytes()); // MOV R0, R4
5881                bytes.extend_from_slice(&0x4629u16.to_le_bytes()); // MOV R1, R5
5882
5883                // If result should be negative (R9 MSB set), negate R0:R1
5884                bytes.extend_from_slice(&0xF1B9u16.to_le_bytes()); // TST.W R9, R9 (check MSB)
5885                bytes.extend_from_slice(&0x0F00u16.to_le_bytes());
5886                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8 (skip negation)
5887
5888                // Negate result R0:R1
5889                bytes.extend_from_slice(&0x43C0u16.to_le_bytes()); // MVNS R0, R0
5890                bytes.extend_from_slice(&0x43C9u16.to_le_bytes()); // MVNS R1, R1
5891                bytes.extend_from_slice(&0x1C40u16.to_le_bytes()); // ADDS R0, R0, #1
5892                bytes.extend_from_slice(&0xF141u16.to_le_bytes()); // ADC.W R1, R1, #0
5893                bytes.extend_from_slice(&0x0100u16.to_le_bytes());
5894
5895                // POP {R4-R11} - restore scratch registers (NO PC — inline code continues)
5896                bytes.extend_from_slice(&0xE8BDu16.to_le_bytes());
5897                bytes.extend_from_slice(&0x0FF0u16.to_le_bytes());
5898
5899                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
5900                Ok(bytes)
5901            }
5902
5903            // I64RemU: 64-bit unsigned remainder using binary long division
5904            // Same algorithm as I64DivU but returns remainder instead of quotient
5905            // Core: R0:R1 = dividend, R2:R3 = divisor -> R0:R1 = remainder
5906            // #610: fixed-ABI wrapper + zero-divisor trap (see I64DivU).
5907            ArmOp::I64RemU {
5908                rdlo,
5909                rdhi,
5910                rnlo,
5911                rnhi,
5912                rmlo,
5913                rmhi,
5914                elide_zero_guard,
5915            } => {
5916                let mut bytes = Vec::new();
5917                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, rmlo, rmhi]);
5918                if !elide_zero_guard {
5919                    emit_i64_divisor_zero_trap(&mut bytes);
5920                }
5921
5922                // PUSH {R4-R8} - save scratch registers (NO LR — inline code)
5923                bytes.extend_from_slice(&0xE92Du16.to_le_bytes());
5924                bytes.extend_from_slice(&0x01F0u16.to_le_bytes());
5925
5926                // Initialize quotient (R4:R5) = 0 (computed but not returned)
5927                bytes.extend_from_slice(&0x2400u16.to_le_bytes());
5928                bytes.extend_from_slice(&0x2500u16.to_le_bytes());
5929                // Initialize remainder (R6:R7) = 0
5930                bytes.extend_from_slice(&0x2600u16.to_le_bytes());
5931                bytes.extend_from_slice(&0x2700u16.to_le_bytes());
5932                // Initialize loop counter R8 = 64
5933                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
5934                bytes.extend_from_slice(&0x0840u16.to_le_bytes());
5935
5936                let loop_start = bytes.len();
5937
5938                // Shift quotient left (not needed for result, but keeps algorithm same)
5939                bytes.extend_from_slice(&0x006Du16.to_le_bytes()); // LSLS R5, R5, #1
5940                bytes.extend_from_slice(&0xEA45u16.to_le_bytes()); // ORR.W R5, R5, R4, LSR #31
5941                bytes.extend_from_slice(&0x75D4u16.to_le_bytes());
5942                bytes.extend_from_slice(&0x0064u16.to_le_bytes()); // LSLS R4, R4, #1
5943
5944                // Shift remainder left, OR in MSB of dividend
5945                bytes.extend_from_slice(&0x007Fu16.to_le_bytes()); // LSLS R7, R7, #1
5946                bytes.extend_from_slice(&0xEA47u16.to_le_bytes()); // ORR.W R7, R7, R6, LSR #31
5947                bytes.extend_from_slice(&0x77D6u16.to_le_bytes());
5948                bytes.extend_from_slice(&0x0076u16.to_le_bytes()); // LSLS R6, R6, #1
5949                bytes.extend_from_slice(&0xEA46u16.to_le_bytes()); // ORR.W R6, R6, R1, LSR #31
5950                bytes.extend_from_slice(&0x76D1u16.to_le_bytes());
5951
5952                // Shift dividend left
5953                bytes.extend_from_slice(&0x0049u16.to_le_bytes()); // LSLS R1, R1, #1
5954                bytes.extend_from_slice(&0xEA41u16.to_le_bytes()); // ORR.W R1, R1, R0, LSR #31
5955                bytes.extend_from_slice(&0x71D0u16.to_le_bytes());
5956                bytes.extend_from_slice(&0x0040u16.to_le_bytes()); // LSLS R0, R0, #1
5957
5958                // Compare and conditionally subtract
5959                bytes.extend_from_slice(&0x429Fu16.to_le_bytes()); // CMP R7, R3
5960                bytes.extend_from_slice(&0xD802u16.to_le_bytes()); // BHI +4
5961                bytes.extend_from_slice(&0xD306u16.to_le_bytes()); // BCC +12
5962                bytes.extend_from_slice(&0x4296u16.to_le_bytes()); // CMP R6, R2
5963                bytes.extend_from_slice(&0xD304u16.to_le_bytes()); // BCC +4 halfwords
5964
5965                // Subtract and set quotient bit
5966                bytes.extend_from_slice(&0x1AB6u16.to_le_bytes()); // SUBS R6, R6, R2
5967                bytes.extend_from_slice(&0xEB67u16.to_le_bytes()); // SBC.W R7, R7, R3
5968                bytes.extend_from_slice(&0x0703u16.to_le_bytes());
5969                bytes.extend_from_slice(&0xF044u16.to_le_bytes()); // ORR.W R4, R4, #1
5970                bytes.extend_from_slice(&0x0401u16.to_le_bytes());
5971
5972                // Decrement and loop
5973                bytes.extend_from_slice(&0xF1B8u16.to_le_bytes()); // SUB.W R8, R8, #1
5974                bytes.extend_from_slice(&0x0801u16.to_le_bytes());
5975
5976                let branch_offset_bytes = bytes.len() - loop_start + 4;
5977                let offset_halfwords = -((branch_offset_bytes / 2) as i16);
5978                let bne_encoding = 0xD100u16 | ((offset_halfwords as u16) & 0xFF);
5979                bytes.extend_from_slice(&bne_encoding.to_le_bytes());
5980
5981                // Move REMAINDER to R0:R1 (difference from I64DivU)
5982                bytes.extend_from_slice(&0x4630u16.to_le_bytes()); // MOV R0, R6
5983                bytes.extend_from_slice(&0x4639u16.to_le_bytes()); // MOV R1, R7
5984
5985                // POP {R4-R8} - restore scratch registers (NO PC — inline code continues)
5986                bytes.extend_from_slice(&0xE8BDu16.to_le_bytes());
5987                bytes.extend_from_slice(&0x01F0u16.to_le_bytes());
5988
5989                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
5990                Ok(bytes)
5991            }
5992
5993            // I64RemS: 64-bit signed remainder
5994            // Remainder sign follows dividend sign (not quotient rule)
5995            // Core: R0:R1 = dividend (signed), R2:R3 = divisor (signed)
5996            //   ->  R0:R1 = remainder (signed, same sign as dividend)
5997            // #610: fixed-ABI wrapper + zero-divisor trap (see I64DivU).
5998            ArmOp::I64RemS {
5999                rdlo,
6000                rdhi,
6001                rnlo,
6002                rnhi,
6003                rmlo,
6004                rmhi,
6005                elide_zero_guard,
6006            } => {
6007                let mut bytes = Vec::new();
6008                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, rmlo, rmhi]);
6009                if !elide_zero_guard {
6010                    emit_i64_divisor_zero_trap(&mut bytes);
6011                }
6012
6013                // PUSH {R4-R11} - save scratch registers (NO LR — inline code)
6014                bytes.extend_from_slice(&0xE92Du16.to_le_bytes());
6015                bytes.extend_from_slice(&0x0FF0u16.to_le_bytes());
6016
6017                // Save dividend sign in R9 (remainder sign = dividend sign)
6018                // MOV R9, R1 (just need the sign bit)
6019                bytes.extend_from_slice(&0x4689u16.to_le_bytes()); // MOV R9, R1
6020
6021                // If dividend negative (R1 MSB set), negate it
6022                bytes.extend_from_slice(&0x4209u16.to_le_bytes()); // TST R1, R1
6023                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
6024
6025                // Negate R0:R1
6026                bytes.extend_from_slice(&0x43C0u16.to_le_bytes()); // MVNS R0, R0
6027                bytes.extend_from_slice(&0x43C9u16.to_le_bytes()); // MVNS R1, R1
6028                bytes.extend_from_slice(&0x1C40u16.to_le_bytes()); // ADDS R0, R0, #1
6029                bytes.extend_from_slice(&0xF141u16.to_le_bytes()); // ADC.W R1, R1, #0
6030                bytes.extend_from_slice(&0x0100u16.to_le_bytes());
6031
6032                // If divisor negative (R3 MSB set), negate it
6033                bytes.extend_from_slice(&0x421Bu16.to_le_bytes()); // TST R3, R3
6034                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
6035
6036                // Negate R2:R3
6037                bytes.extend_from_slice(&0x43D2u16.to_le_bytes()); // MVNS R2, R2
6038                bytes.extend_from_slice(&0x43DBu16.to_le_bytes()); // MVNS R3, R3
6039                bytes.extend_from_slice(&0x1C52u16.to_le_bytes()); // ADDS R2, R2, #1
6040                bytes.extend_from_slice(&0xF143u16.to_le_bytes()); // ADC.W R3, R3, #0
6041                bytes.extend_from_slice(&0x0300u16.to_le_bytes());
6042
6043                // === Unsigned division algorithm ===
6044                // Initialize quotient (R4:R5) = 0
6045                bytes.extend_from_slice(&0x2400u16.to_le_bytes());
6046                bytes.extend_from_slice(&0x2500u16.to_le_bytes());
6047                // Initialize remainder (R6:R7) = 0
6048                bytes.extend_from_slice(&0x2600u16.to_le_bytes());
6049                bytes.extend_from_slice(&0x2700u16.to_le_bytes());
6050                // Initialize loop counter R8 = 64
6051                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
6052                bytes.extend_from_slice(&0x0840u16.to_le_bytes());
6053
6054                let loop_start = bytes.len();
6055
6056                // Shift quotient left
6057                bytes.extend_from_slice(&0x006Du16.to_le_bytes()); // LSLS R5, R5, #1
6058                bytes.extend_from_slice(&0xEA45u16.to_le_bytes()); // ORR.W R5, R5, R4, LSR #31
6059                bytes.extend_from_slice(&0x75D4u16.to_le_bytes());
6060                bytes.extend_from_slice(&0x0064u16.to_le_bytes()); // LSLS R4, R4, #1
6061
6062                // Shift remainder left, OR in MSB of dividend
6063                bytes.extend_from_slice(&0x007Fu16.to_le_bytes()); // LSLS R7, R7, #1
6064                bytes.extend_from_slice(&0xEA47u16.to_le_bytes()); // ORR.W R7, R7, R6, LSR #31
6065                bytes.extend_from_slice(&0x77D6u16.to_le_bytes());
6066                bytes.extend_from_slice(&0x0076u16.to_le_bytes()); // LSLS R6, R6, #1
6067                bytes.extend_from_slice(&0xEA46u16.to_le_bytes()); // ORR.W R6, R6, R1, LSR #31
6068                bytes.extend_from_slice(&0x76D1u16.to_le_bytes());
6069
6070                // Shift dividend left
6071                bytes.extend_from_slice(&0x0049u16.to_le_bytes()); // LSLS R1, R1, #1
6072                bytes.extend_from_slice(&0xEA41u16.to_le_bytes()); // ORR.W R1, R1, R0, LSR #31
6073                bytes.extend_from_slice(&0x71D0u16.to_le_bytes());
6074                bytes.extend_from_slice(&0x0040u16.to_le_bytes()); // LSLS R0, R0, #1
6075
6076                // Compare and conditionally subtract
6077                bytes.extend_from_slice(&0x429Fu16.to_le_bytes()); // CMP R7, R3
6078                bytes.extend_from_slice(&0xD802u16.to_le_bytes()); // BHI +4
6079                bytes.extend_from_slice(&0xD306u16.to_le_bytes()); // BCC +12
6080                bytes.extend_from_slice(&0x4296u16.to_le_bytes()); // CMP R6, R2
6081                bytes.extend_from_slice(&0xD304u16.to_le_bytes()); // BCC +4 halfwords
6082
6083                // Subtract and set quotient bit
6084                bytes.extend_from_slice(&0x1AB6u16.to_le_bytes()); // SUBS R6, R6, R2
6085                bytes.extend_from_slice(&0xEB67u16.to_le_bytes()); // SBC.W R7, R7, R3
6086                bytes.extend_from_slice(&0x0703u16.to_le_bytes());
6087                bytes.extend_from_slice(&0xF044u16.to_le_bytes()); // ORR.W R4, R4, #1
6088                bytes.extend_from_slice(&0x0401u16.to_le_bytes());
6089
6090                // Decrement and loop
6091                bytes.extend_from_slice(&0xF1B8u16.to_le_bytes()); // SUB.W R8, R8, #1
6092                bytes.extend_from_slice(&0x0801u16.to_le_bytes());
6093
6094                let branch_offset_bytes = bytes.len() - loop_start + 4;
6095                let offset_halfwords = -((branch_offset_bytes / 2) as i16);
6096                let bne_encoding = 0xD100u16 | ((offset_halfwords as u16) & 0xFF);
6097                bytes.extend_from_slice(&bne_encoding.to_le_bytes());
6098
6099                // Move remainder to R0:R1
6100                bytes.extend_from_slice(&0x4630u16.to_le_bytes()); // MOV R0, R6
6101                bytes.extend_from_slice(&0x4639u16.to_le_bytes()); // MOV R1, R7
6102
6103                // If original dividend was negative (R9 MSB set), negate remainder
6104                bytes.extend_from_slice(&0xF1B9u16.to_le_bytes()); // TST.W R9, R9
6105                bytes.extend_from_slice(&0x0F00u16.to_le_bytes());
6106                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
6107
6108                // Negate result R0:R1
6109                bytes.extend_from_slice(&0x43C0u16.to_le_bytes()); // MVNS R0, R0
6110                bytes.extend_from_slice(&0x43C9u16.to_le_bytes()); // MVNS R1, R1
6111                bytes.extend_from_slice(&0x1C40u16.to_le_bytes()); // ADDS R0, R0, #1
6112                bytes.extend_from_slice(&0xF141u16.to_le_bytes()); // ADC.W R1, R1, #0
6113                bytes.extend_from_slice(&0x0100u16.to_le_bytes());
6114
6115                // POP {R4-R11} - restore scratch registers (NO PC — inline code continues)
6116                bytes.extend_from_slice(&0xE8BDu16.to_le_bytes());
6117                bytes.extend_from_slice(&0x0FF0u16.to_le_bytes());
6118
6119                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
6120                Ok(bytes)
6121            }
6122
6123            // === F32 VFP single-precision Thumb-2 encodings ===
6124            // VFP instruction words are identical to ARM32; emit as two LE halfwords.
6125            ArmOp::F32Add { sd, sn, sm } => {
6126                Ok(vfp_to_thumb_bytes(encode_vfp_3reg(0xEE300A00, sd, sn, sm)?))
6127            }
6128            ArmOp::F32Sub { sd, sn, sm } => {
6129                Ok(vfp_to_thumb_bytes(encode_vfp_3reg(0xEE300A40, sd, sn, sm)?))
6130            }
6131            ArmOp::F32Mul { sd, sn, sm } => {
6132                Ok(vfp_to_thumb_bytes(encode_vfp_3reg(0xEE200A00, sd, sn, sm)?))
6133            }
6134            ArmOp::F32Div { sd, sn, sm } => {
6135                Ok(vfp_to_thumb_bytes(encode_vfp_3reg(0xEE800A00, sd, sn, sm)?))
6136            }
6137            ArmOp::F32Abs { sd, sm } => {
6138                Ok(vfp_to_thumb_bytes(encode_vfp_2reg(0xEEB00AC0, sd, sm)?))
6139            }
6140            ArmOp::F32Neg { sd, sm } => {
6141                Ok(vfp_to_thumb_bytes(encode_vfp_2reg(0xEEB10A40, sd, sm)?))
6142            }
6143            ArmOp::F32Sqrt { sd, sm } => {
6144                Ok(vfp_to_thumb_bytes(encode_vfp_2reg(0xEEB10AC0, sd, sm)?))
6145            }
6146
6147            // f32 pseudo-ops — multi-instruction sequences
6148            // FPSCR RMode: 00=nearest, 01=+inf(ceil), 10=-inf(floor), 11=zero(trunc)
6149            ArmOp::F32Ceil { sd, sm } => self.encode_thumb_f32_rounding(sd, sm, 0b01),
6150            ArmOp::F32Floor { sd, sm } => self.encode_thumb_f32_rounding(sd, sm, 0b10),
6151            ArmOp::F32Trunc { sd, sm } => self.encode_thumb_f32_rounding(sd, sm, 0b11),
6152            ArmOp::F32Nearest { sd, sm } => self.encode_thumb_f32_rounding(sd, sm, 0b00),
6153            ArmOp::F32Min { sd, sn, sm } => self.encode_thumb_f32_minmax(sd, sn, sm, true),
6154            ArmOp::F32Max { sd, sn, sm } => self.encode_thumb_f32_minmax(sd, sn, sm, false),
6155            ArmOp::F32Copysign { sd, sn, sm } => self.encode_thumb_f32_copysign(sd, sn, sm),
6156
6157            // f32 comparisons — VCMP + VMRS + MOV #0 + IT + MOV #1
6158            ArmOp::F32Eq { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0x0),
6159            ArmOp::F32Ne { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0x1),
6160            ArmOp::F32Lt { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0x4),
6161            ArmOp::F32Le { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0x9),
6162            ArmOp::F32Gt { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0xC),
6163            ArmOp::F32Ge { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0xA),
6164
6165            ArmOp::F32Const { sd, value } => self.encode_thumb_f32_const(sd, *value),
6166
6167            ArmOp::F32Load { sd, addr } => {
6168                Ok(vfp_to_thumb_bytes(encode_vfp_ldst(0xED900A00, sd, addr)?))
6169            }
6170            ArmOp::F32Store { sd, addr } => {
6171                Ok(vfp_to_thumb_bytes(encode_vfp_ldst(0xED800A00, sd, addr)?))
6172            }
6173
6174            ArmOp::F32ConvertI32S { sd, rm } => self.encode_thumb_f32_convert_i32(sd, rm, true),
6175            ArmOp::F32ConvertI32U { sd, rm } => self.encode_thumb_f32_convert_i32(sd, rm, false),
6176            ArmOp::F32ConvertI64S { .. } | ArmOp::F32ConvertI64U { .. } => {
6177                Err(synth_core::Error::synthesis(
6178                    "F32 i64 conversion not supported (requires register pairs on 32-bit ARM)",
6179                ))
6180            }
6181            ArmOp::F32ReinterpretI32 { sd, rm } => {
6182                Ok(vfp_to_thumb_bytes(encode_vmov_core_sreg(true, sd, rm)?))
6183            }
6184            ArmOp::I32ReinterpretF32 { rd, sm } => {
6185                Ok(vfp_to_thumb_bytes(encode_vmov_core_sreg(false, sm, rd)?))
6186            }
6187            ArmOp::I32TruncF32S { rd, sm } => self.encode_thumb_i32_trunc_f32(rd, sm, true),
6188            ArmOp::I32TruncF32U { rd, sm } => self.encode_thumb_i32_trunc_f32(rd, sm, false),
6189
6190            // === F64 VFP double-precision Thumb-2 encodings ===
6191            // VFP instruction words are identical to ARM32; emit as two LE halfwords.
6192            ArmOp::F64Add { dd, dn, dm } => Ok(vfp_to_thumb_bytes(encode_vfp_3reg_f64(
6193                0xEE300B00, dd, dn, dm,
6194            )?)),
6195            ArmOp::F64Sub { dd, dn, dm } => Ok(vfp_to_thumb_bytes(encode_vfp_3reg_f64(
6196                0xEE300B40, dd, dn, dm,
6197            )?)),
6198            ArmOp::F64Mul { dd, dn, dm } => Ok(vfp_to_thumb_bytes(encode_vfp_3reg_f64(
6199                0xEE200B00, dd, dn, dm,
6200            )?)),
6201            ArmOp::F64Div { dd, dn, dm } => Ok(vfp_to_thumb_bytes(encode_vfp_3reg_f64(
6202                0xEE800B00, dd, dn, dm,
6203            )?)),
6204            ArmOp::F64Abs { dd, dm } => {
6205                Ok(vfp_to_thumb_bytes(encode_vfp_2reg_f64(0xEEB00BC0, dd, dm)?))
6206            }
6207            ArmOp::F64Neg { dd, dm } => {
6208                Ok(vfp_to_thumb_bytes(encode_vfp_2reg_f64(0xEEB10B40, dd, dm)?))
6209            }
6210            ArmOp::F64Sqrt { dd, dm } => {
6211                Ok(vfp_to_thumb_bytes(encode_vfp_2reg_f64(0xEEB10BC0, dd, dm)?))
6212            }
6213
6214            // f64 pseudo-ops
6215            // FPSCR RMode: 00=nearest, 01=+inf(ceil), 10=-inf(floor), 11=zero(trunc)
6216            ArmOp::F64Ceil { dd, dm } => self.encode_thumb_f64_rounding(dd, dm, 0b01),
6217            ArmOp::F64Floor { dd, dm } => self.encode_thumb_f64_rounding(dd, dm, 0b10),
6218            ArmOp::F64Trunc { dd, dm } => self.encode_thumb_f64_rounding(dd, dm, 0b11),
6219            ArmOp::F64Nearest { dd, dm } => self.encode_thumb_f64_rounding(dd, dm, 0b00),
6220            ArmOp::F64Min { dd, dn, dm } => self.encode_thumb_f64_minmax(dd, dn, dm, true),
6221            ArmOp::F64Max { dd, dn, dm } => self.encode_thumb_f64_minmax(dd, dn, dm, false),
6222            ArmOp::F64Copysign { dd, dn, dm } => self.encode_thumb_f64_copysign(dd, dn, dm),
6223
6224            // f64 comparisons
6225            ArmOp::F64Eq { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0x0),
6226            ArmOp::F64Ne { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0x1),
6227            ArmOp::F64Lt { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0x4),
6228            ArmOp::F64Le { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0x9),
6229            ArmOp::F64Gt { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0xC),
6230            ArmOp::F64Ge { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0xA),
6231
6232            ArmOp::F64Const { dd, value } => self.encode_thumb_f64_const(dd, *value),
6233
6234            ArmOp::F64Load { dd, addr } => Ok(vfp_to_thumb_bytes(encode_vfp_ldst_f64(
6235                0xED900B00, dd, addr,
6236            )?)),
6237            ArmOp::F64Store { dd, addr } => Ok(vfp_to_thumb_bytes(encode_vfp_ldst_f64(
6238                0xED800B00, dd, addr,
6239            )?)),
6240
6241            ArmOp::F64ConvertI32S { dd, rm } => self.encode_thumb_f64_convert_i32(dd, rm, true),
6242            ArmOp::F64ConvertI32U { dd, rm } => self.encode_thumb_f64_convert_i32(dd, rm, false),
6243            ArmOp::F64ConvertI64S { .. } | ArmOp::F64ConvertI64U { .. } => {
6244                Err(synth_core::Error::synthesis(
6245                    "F64 i64 conversion not supported (requires register pairs on 32-bit ARM)",
6246                ))
6247            }
6248            ArmOp::F64PromoteF32 { dd, sm } => self.encode_thumb_f64_promote_f32(dd, sm),
6249            ArmOp::F32DemoteF64 { sd, dm } => self.encode_thumb_f32_demote_f64(sd, dm),
6250            ArmOp::F64ReinterpretI64 { dd, rmlo, rmhi } => Ok(vfp_to_thumb_bytes(
6251                encode_vmov_core_dreg(true, dd, rmlo, rmhi)?,
6252            )),
6253            ArmOp::I64ReinterpretF64 { rdlo, rdhi, dm } => Ok(vfp_to_thumb_bytes(
6254                encode_vmov_core_dreg(false, dm, rdlo, rdhi)?,
6255            )),
6256            ArmOp::I64TruncF64S { .. } | ArmOp::I64TruncF64U { .. } => {
6257                Err(synth_core::Error::synthesis(
6258                    "i64 truncation from F64 not supported (requires i64 register pairs on 32-bit ARM)",
6259                ))
6260            }
6261            ArmOp::I32TruncF64S { rd, dm } => self.encode_thumb_i32_trunc_f64(rd, dm, true),
6262            ArmOp::I32TruncF64U { rd, dm } => self.encode_thumb_i32_trunc_f64(rd, dm, false),
6263
6264            // ===== i64 operations: encode as multi-instruction Thumb-2 sequences =====
6265
6266            // I64Add: ADDS rdlo, rnlo, rmlo; ADC.W rdhi, rnhi, rmhi
6267            ArmOp::I64Add {
6268                rdlo,
6269                rdhi,
6270                rnlo,
6271                rnhi,
6272                rmlo,
6273                rmhi,
6274            } => {
6275                let mut bytes = Vec::new();
6276                // ADDS rdlo, rnlo, rmlo (16-bit)
6277                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Adds {
6278                    rd: *rdlo,
6279                    rn: *rnlo,
6280                    op2: Operand2::Reg(*rmlo),
6281                })?);
6282                // ADC.W rdhi, rnhi, rmhi (32-bit)
6283                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Adc {
6284                    rd: *rdhi,
6285                    rn: *rnhi,
6286                    op2: Operand2::Reg(*rmhi),
6287                })?);
6288                Ok(bytes)
6289            }
6290
6291            // I64Sub: SUBS rdlo, rnlo, rmlo; SBC.W rdhi, rnhi, rmhi
6292            ArmOp::I64Sub {
6293                rdlo,
6294                rdhi,
6295                rnlo,
6296                rnhi,
6297                rmlo,
6298                rmhi,
6299            } => {
6300                let mut bytes = Vec::new();
6301                // SUBS rdlo, rnlo, rmlo (16-bit)
6302                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Subs {
6303                    rd: *rdlo,
6304                    rn: *rnlo,
6305                    op2: Operand2::Reg(*rmlo),
6306                })?);
6307                // SBC.W rdhi, rnhi, rmhi (32-bit)
6308                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Sbc {
6309                    rd: *rdhi,
6310                    rn: *rnhi,
6311                    op2: Operand2::Reg(*rmhi),
6312                })?);
6313                Ok(bytes)
6314            }
6315
6316            // I64And: AND rdlo, rnlo, rmlo; AND rdhi, rnhi, rmhi
6317            ArmOp::I64And {
6318                rdlo,
6319                rdhi,
6320                rnlo,
6321                rnhi,
6322                rmlo,
6323                rmhi,
6324            } => {
6325                let mut bytes = Vec::new();
6326                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::And {
6327                    rd: *rdlo,
6328                    rn: *rnlo,
6329                    op2: Operand2::Reg(*rmlo),
6330                })?);
6331                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::And {
6332                    rd: *rdhi,
6333                    rn: *rnhi,
6334                    op2: Operand2::Reg(*rmhi),
6335                })?);
6336                Ok(bytes)
6337            }
6338
6339            // I64Or: ORR rdlo, rnlo, rmlo; ORR rdhi, rnhi, rmhi
6340            ArmOp::I64Or {
6341                rdlo,
6342                rdhi,
6343                rnlo,
6344                rnhi,
6345                rmlo,
6346                rmhi,
6347            } => {
6348                let mut bytes = Vec::new();
6349                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Orr {
6350                    rd: *rdlo,
6351                    rn: *rnlo,
6352                    op2: Operand2::Reg(*rmlo),
6353                })?);
6354                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Orr {
6355                    rd: *rdhi,
6356                    rn: *rnhi,
6357                    op2: Operand2::Reg(*rmhi),
6358                })?);
6359                Ok(bytes)
6360            }
6361
6362            // I64Xor: EOR rdlo, rnlo, rmlo; EOR rdhi, rnhi, rmhi
6363            ArmOp::I64Xor {
6364                rdlo,
6365                rdhi,
6366                rnlo,
6367                rnhi,
6368                rmlo,
6369                rmhi,
6370            } => {
6371                let mut bytes = Vec::new();
6372                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Eor {
6373                    rd: *rdlo,
6374                    rn: *rnlo,
6375                    op2: Operand2::Reg(*rmlo),
6376                })?);
6377                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Eor {
6378                    rd: *rdhi,
6379                    rn: *rnhi,
6380                    op2: Operand2::Reg(*rmhi),
6381                })?);
6382                Ok(bytes)
6383            }
6384
6385            // I64Eqz: ORR scratch, lo, hi; ITE EQ; MOV rd, #1; MOV rd, #0
6386            ArmOp::I64Eqz { rd, rnlo, rnhi } => self.encode_thumb(&ArmOp::I64SetCondZ {
6387                rd: *rd,
6388                rn_lo: *rnlo,
6389                rn_hi: *rnhi,
6390            }),
6391
6392            // I64 comparisons: delegate to I64SetCond
6393            ArmOp::I64Eq {
6394                rd,
6395                rnlo,
6396                rnhi,
6397                rmlo,
6398                rmhi,
6399            } => self.encode_thumb(&ArmOp::I64SetCond {
6400                rd: *rd,
6401                rn_lo: *rnlo,
6402                rn_hi: *rnhi,
6403                rm_lo: *rmlo,
6404                rm_hi: *rmhi,
6405                cond: synth_synthesis::Condition::EQ,
6406            }),
6407
6408            ArmOp::I64Ne {
6409                rd,
6410                rnlo,
6411                rnhi,
6412                rmlo,
6413                rmhi,
6414            } => self.encode_thumb(&ArmOp::I64SetCond {
6415                rd: *rd,
6416                rn_lo: *rnlo,
6417                rn_hi: *rnhi,
6418                rm_lo: *rmlo,
6419                rm_hi: *rmhi,
6420                cond: synth_synthesis::Condition::NE,
6421            }),
6422
6423            ArmOp::I64LtS {
6424                rd,
6425                rnlo,
6426                rnhi,
6427                rmlo,
6428                rmhi,
6429            } => self.encode_thumb(&ArmOp::I64SetCond {
6430                rd: *rd,
6431                rn_lo: *rnlo,
6432                rn_hi: *rnhi,
6433                rm_lo: *rmlo,
6434                rm_hi: *rmhi,
6435                cond: synth_synthesis::Condition::LT,
6436            }),
6437
6438            ArmOp::I64LtU {
6439                rd,
6440                rnlo,
6441                rnhi,
6442                rmlo,
6443                rmhi,
6444            } => self.encode_thumb(&ArmOp::I64SetCond {
6445                rd: *rd,
6446                rn_lo: *rnlo,
6447                rn_hi: *rnhi,
6448                rm_lo: *rmlo,
6449                rm_hi: *rmhi,
6450                cond: synth_synthesis::Condition::LO,
6451            }),
6452
6453            ArmOp::I64LeS {
6454                rd,
6455                rnlo,
6456                rnhi,
6457                rmlo,
6458                rmhi,
6459            } => self.encode_thumb(&ArmOp::I64SetCond {
6460                rd: *rd,
6461                rn_lo: *rnlo,
6462                rn_hi: *rnhi,
6463                rm_lo: *rmlo,
6464                rm_hi: *rmhi,
6465                cond: synth_synthesis::Condition::LE,
6466            }),
6467
6468            ArmOp::I64LeU {
6469                rd,
6470                rnlo,
6471                rnhi,
6472                rmlo,
6473                rmhi,
6474            } => self.encode_thumb(&ArmOp::I64SetCond {
6475                rd: *rd,
6476                rn_lo: *rnlo,
6477                rn_hi: *rnhi,
6478                rm_lo: *rmlo,
6479                rm_hi: *rmhi,
6480                cond: synth_synthesis::Condition::LS,
6481            }),
6482
6483            ArmOp::I64GtS {
6484                rd,
6485                rnlo,
6486                rnhi,
6487                rmlo,
6488                rmhi,
6489            } => self.encode_thumb(&ArmOp::I64SetCond {
6490                rd: *rd,
6491                rn_lo: *rnlo,
6492                rn_hi: *rnhi,
6493                rm_lo: *rmlo,
6494                rm_hi: *rmhi,
6495                cond: synth_synthesis::Condition::GT,
6496            }),
6497
6498            ArmOp::I64GtU {
6499                rd,
6500                rnlo,
6501                rnhi,
6502                rmlo,
6503                rmhi,
6504            } => self.encode_thumb(&ArmOp::I64SetCond {
6505                rd: *rd,
6506                rn_lo: *rnlo,
6507                rn_hi: *rnhi,
6508                rm_lo: *rmlo,
6509                rm_hi: *rmhi,
6510                cond: synth_synthesis::Condition::HI,
6511            }),
6512
6513            ArmOp::I64GeS {
6514                rd,
6515                rnlo,
6516                rnhi,
6517                rmlo,
6518                rmhi,
6519            } => self.encode_thumb(&ArmOp::I64SetCond {
6520                rd: *rd,
6521                rn_lo: *rnlo,
6522                rn_hi: *rnhi,
6523                rm_lo: *rmlo,
6524                rm_hi: *rmhi,
6525                cond: synth_synthesis::Condition::GE,
6526            }),
6527
6528            ArmOp::I64GeU {
6529                rd,
6530                rnlo,
6531                rnhi,
6532                rmlo,
6533                rmhi,
6534            } => self.encode_thumb(&ArmOp::I64SetCond {
6535                rd: *rd,
6536                rn_lo: *rnlo,
6537                rn_hi: *rnhi,
6538                rm_lo: *rmlo,
6539                rm_hi: *rmhi,
6540                cond: synth_synthesis::Condition::HS,
6541            }),
6542
6543            // I64Const: MOVW rdlo, lo16; MOVT rdlo, hi16; MOVW rdhi, lo16_hi; MOVT rdhi, hi16_hi
6544            ArmOp::I64Const { rdlo, rdhi, value } => {
6545                let lo32 = *value as u32;
6546                let hi32 = (*value >> 32) as u32;
6547                let mut bytes = Vec::new();
6548                // Load low 32 bits into rdlo
6549                bytes.extend_from_slice(
6550                    &self.encode_thumb32_movw_raw(reg_to_bits(rdlo), lo32 & 0xFFFF)?,
6551                );
6552                if lo32 > 0xFFFF {
6553                    bytes.extend_from_slice(
6554                        &self.encode_thumb32_movt_raw(reg_to_bits(rdlo), lo32 >> 16)?,
6555                    );
6556                }
6557                // Load high 32 bits into rdhi
6558                bytes.extend_from_slice(
6559                    &self.encode_thumb32_movw_raw(reg_to_bits(rdhi), hi32 & 0xFFFF)?,
6560                );
6561                if hi32 > 0xFFFF {
6562                    bytes.extend_from_slice(
6563                        &self.encode_thumb32_movt_raw(reg_to_bits(rdhi), hi32 >> 16)?,
6564                    );
6565                }
6566                Ok(bytes)
6567            }
6568
6569            // I64Ldr: LDR rdlo, [base, offset]; LDR rdhi, [base, offset+4]
6570            ArmOp::I64Ldr { rdlo, rdhi, addr } => {
6571                let mut bytes = Vec::new();
6572                // #372/#382: a memory `i64.load` carries an index register
6573                // (`reg_imm(R11, addr_reg, offset)` = R11 + addr + offset). The
6574                // immediate `encode_thumb32_ldr` below uses only base+offset and
6575                // would SILENTLY DROP `offset_reg` — the #206 defect, here for
6576                // i64. `i64_effective_base` materializes the effective base into
6577                // `ip` (and, when `offset+4 > 0xFFF`, folds the offset in too so
6578                // the function is NOT skipped — #382), returning the residual
6579                // imm12 for the two halves. Frame i64 loads (no `offset_reg`, e.g.
6580                // a spilled local at `[SP, #off]`) keep the plain `[base,#off]`
6581                // form unchanged — so existing output is byte-identical.
6582                let (base, offset) = self.i64_effective_base(&mut bytes, addr)?;
6583                bytes.extend_from_slice(&self.encode_thumb32_ldr(rdlo, &base, offset)?);
6584                bytes.extend_from_slice(&self.encode_thumb32_ldr(
6585                    rdhi,
6586                    &base,
6587                    offset.wrapping_add(4),
6588                )?);
6589                Ok(bytes)
6590            }
6591
6592            // I64Str: STR rdlo, [base, offset]; STR rdhi, [base, offset+4]
6593            ArmOp::I64Str { rdlo, rdhi, addr } => {
6594                let mut bytes = Vec::new();
6595                // #372/#382: same index-materialization + large-offset fold as
6596                // I64Ldr (see above).
6597                let (base, offset) = self.i64_effective_base(&mut bytes, addr)?;
6598                bytes.extend_from_slice(&self.encode_thumb32_str(rdlo, &base, offset)?);
6599                bytes.extend_from_slice(&self.encode_thumb32_str(
6600                    rdhi,
6601                    &base,
6602                    offset.wrapping_add(4),
6603                )?);
6604                Ok(bytes)
6605            }
6606
6607            // I64ExtendI32S: MOV rdlo, rn; ASR rdhi, rdlo, #31 (sign-extend)
6608            ArmOp::I64ExtendI32S { rdlo, rdhi, rn } => {
6609                let mut bytes = Vec::new();
6610                if rdlo != rn {
6611                    // MOV rdlo, rn (16-bit)
6612                    bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Mov {
6613                        rd: *rdlo,
6614                        op2: Operand2::Reg(*rn),
6615                    })?);
6616                }
6617                // ASR rdhi, rdlo, #31 (sign-extend: fill high word with sign bit)
6618                bytes.extend_from_slice(
6619                    &self.encode_thumb32_shift(rdhi, rdlo, 31, 0b10)?, // ASR type
6620                );
6621                Ok(bytes)
6622            }
6623
6624            // I64ExtendI32U: MOV rdlo, rn; MOV rdhi, #0
6625            ArmOp::I64ExtendI32U { rdlo, rdhi, rn } => {
6626                let mut bytes = Vec::new();
6627                if rdlo != rn {
6628                    // MOV rdlo, rn
6629                    bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Mov {
6630                        rd: *rdlo,
6631                        op2: Operand2::Reg(*rn),
6632                    })?);
6633                }
6634                // MOV rdhi, #0 (16-bit: MOVS Rd, #0)
6635                let rdhi_bits = reg_to_bits(rdhi) as u16;
6636                let instr: u16 = 0x2000 | (rdhi_bits << 8);
6637                bytes.extend_from_slice(&instr.to_le_bytes());
6638                Ok(bytes)
6639            }
6640
6641            // I32WrapI64: MOV rd, rnlo (just take low 32 bits)
6642            ArmOp::I32WrapI64 { rd, rnlo } => {
6643                if rd == rnlo {
6644                    // No-op: already in the right register
6645                    let instr: u16 = 0xBF00; // NOP
6646                    Ok(instr.to_le_bytes().to_vec())
6647                } else {
6648                    // MOV rd, rnlo
6649                    self.encode_thumb(&ArmOp::Mov {
6650                        rd: *rd,
6651                        op2: Operand2::Reg(*rnlo),
6652                    })
6653                }
6654            }
6655
6656            // ===== Helium MVE operations (Thumb-2 encoding) =====
6657            ArmOp::MveLoad { qd, addr } => Ok(vfp_to_thumb_bytes(encode_mve_vldrw(qd, addr))),
6658            ArmOp::MveStore { qd, addr } => Ok(vfp_to_thumb_bytes(encode_mve_vstrw(qd, addr))),
6659            ArmOp::MveConst { qd, bytes } => self.encode_thumb_mve_const(qd, bytes),
6660            ArmOp::MveAnd { qd, qn, qm } => Ok(vfp_to_thumb_bytes(encode_mve_3reg_bitwise(
6661                0xEF000150, qd, qn, qm,
6662            ))),
6663            ArmOp::MveOrr { qd, qn, qm } => Ok(vfp_to_thumb_bytes(encode_mve_3reg_bitwise(
6664                0xEF200150, qd, qn, qm,
6665            ))),
6666            ArmOp::MveEor { qd, qn, qm } => Ok(vfp_to_thumb_bytes(encode_mve_3reg_bitwise(
6667                0xFF000150, qd, qn, qm,
6668            ))),
6669            ArmOp::MveMvn { qd, qm } => {
6670                // VMVN Qd, Qm: 0xFFB005C0 | Qd<<12 | Qm
6671                let qd_enc = qreg_to_num(qd);
6672                let qm_enc = qreg_to_num(qm);
6673                let instr: u32 = 0xFFB005C0 | ((qd_enc * 2) << 12) | (qm_enc * 2);
6674                Ok(vfp_to_thumb_bytes(instr))
6675            }
6676            ArmOp::MveBic { qd, qn, qm } => Ok(vfp_to_thumb_bytes(encode_mve_3reg_bitwise(
6677                0xEF100150, qd, qn, qm,
6678            ))),
6679            ArmOp::MveAddI { qd, qn, qm, size } => {
6680                let sz = mve_size_bits(size);
6681                let base: u32 = 0xEF000840 | (sz << 20);
6682                Ok(vfp_to_thumb_bytes(encode_mve_3reg(base, qd, qn, qm)))
6683            }
6684            ArmOp::MveSubI { qd, qn, qm, size } => {
6685                let sz = mve_size_bits(size);
6686                let base: u32 = 0xFF000840 | (sz << 20);
6687                Ok(vfp_to_thumb_bytes(encode_mve_3reg(base, qd, qn, qm)))
6688            }
6689            ArmOp::MveMulI { qd, qn, qm, size } => {
6690                let sz = mve_size_bits(size);
6691                let base: u32 = 0xEF000950 | (sz << 20);
6692                Ok(vfp_to_thumb_bytes(encode_mve_3reg(base, qd, qn, qm)))
6693            }
6694            ArmOp::MveNegI { qd, qm, size } => {
6695                let sz = mve_size_bits(size);
6696                // VNEG.Sx Qd, Qm
6697                let qd_enc = qreg_to_num(qd);
6698                let qm_enc = qreg_to_num(qm);
6699                let base: u32 = 0xFFB103C0 | (sz << 18);
6700                let instr = base | ((qd_enc * 2) << 12) | (qm_enc * 2);
6701                Ok(vfp_to_thumb_bytes(instr))
6702            }
6703            ArmOp::MveDup { qd, rn, size } => {
6704                let sz = mve_size_bits(size);
6705                let qd_enc = qreg_to_num(qd);
6706                let rn_bits = reg_to_bits(rn);
6707                // VDUP.sz Qd, Rn: EEA0 0B10 variant
6708                // size encoding: 00=32, 01=16, 10=8
6709                let be = match sz {
6710                    0 => 0b00u32, // 8-bit
6711                    1 => 0b01,    // 16-bit
6712                    _ => 0b00,    // 32-bit (default)
6713                };
6714                let instr: u32 = 0xEEA00B10 | ((qd_enc * 2) << 16) | (rn_bits << 12) | (be << 5);
6715                Ok(vfp_to_thumb_bytes(instr))
6716            }
6717            ArmOp::MveExtractLane { rd, qn, lane, size } => {
6718                let qn_enc = qreg_to_num(qn);
6719                let rd_bits = reg_to_bits(rd);
6720                // VMOV.sz Rd, Dn[x] — extract from Q-register lane
6721                // For 32-bit: VMOV Rd, Dn — where Dn is the appropriate D-register
6722                let d_reg = qn_enc * 2 + ((*lane as u32) >> 1);
6723                let lane_in_d = (*lane as u32) & 1;
6724                let _sz = mve_size_bits(size);
6725                // VMOV Rd, Dn[x]: EE10 0B10 for 32-bit
6726                let instr: u32 = 0xEE100B10 | (d_reg << 16) | (rd_bits << 12) | (lane_in_d << 21);
6727                Ok(vfp_to_thumb_bytes(instr))
6728            }
6729            ArmOp::MveInsertLane { qd, rn, lane, size } => {
6730                let qd_enc = qreg_to_num(qd);
6731                let rn_bits = reg_to_bits(rn);
6732                let d_reg = qd_enc * 2 + ((*lane as u32) >> 1);
6733                let lane_in_d = (*lane as u32) & 1;
6734                let _sz = mve_size_bits(size);
6735                // VMOV Dn[x], Rn: EE00 0B10 for 32-bit
6736                let instr: u32 = 0xEE000B10 | (d_reg << 16) | (rn_bits << 12) | (lane_in_d << 21);
6737                Ok(vfp_to_thumb_bytes(instr))
6738            }
6739
6740            // MVE float comparisons — emit VCMP + VPSEL sequence (simplified: just VCMP)
6741            ArmOp::MveCmpEqI { qd, qn, qm, size }
6742            | ArmOp::MveCmpNeI { qd, qn, qm, size }
6743            | ArmOp::MveCmpLtS { qd, qn, qm, size }
6744            | ArmOp::MveCmpLtU { qd, qn, qm, size }
6745            | ArmOp::MveCmpGtS { qd, qn, qm, size }
6746            | ArmOp::MveCmpGtU { qd, qn, qm, size }
6747            | ArmOp::MveCmpLeS { qd, qn, qm, size }
6748            | ArmOp::MveCmpLeU { qd, qn, qm, size }
6749            | ArmOp::MveCmpGeS { qd, qn, qm, size }
6750            | ArmOp::MveCmpGeU { qd, qn, qm, size } => {
6751                // Encode as VADD (placeholder encoding — real implementation
6752                // would use VCMP + VPSEL pair)
6753                let sz = mve_size_bits(size);
6754                let base: u32 = 0xEF000840 | (sz << 20);
6755                Ok(vfp_to_thumb_bytes(encode_mve_3reg(base, qd, qn, qm)))
6756            }
6757
6758            // f32x4 MVE arithmetic
6759            ArmOp::MveAddF32 { qd, qn, qm } => {
6760                // VADD.F32 Qd, Qn, Qm (MVE): 0xEF000D40
6761                Ok(vfp_to_thumb_bytes(encode_mve_3reg(0xEF000D40, qd, qn, qm)))
6762            }
6763            ArmOp::MveSubF32 { qd, qn, qm } => {
6764                // VSUB.F32 Qd, Qn, Qm (MVE): 0xEF200D40
6765                Ok(vfp_to_thumb_bytes(encode_mve_3reg(0xEF200D40, qd, qn, qm)))
6766            }
6767            ArmOp::MveMulF32 { qd, qn, qm } => {
6768                // VMUL.F32 Qd, Qn, Qm (MVE): 0xFF000D50
6769                Ok(vfp_to_thumb_bytes(encode_mve_3reg(0xFF000D50, qd, qn, qm)))
6770            }
6771            ArmOp::MveNegF32 { qd, qm } => {
6772                let qd_enc = qreg_to_num(qd);
6773                let qm_enc = qreg_to_num(qm);
6774                // VNEG.F32 Qd, Qm: FFB907C0
6775                let instr: u32 = 0xFFB907C0 | ((qd_enc * 2) << 12) | (qm_enc * 2);
6776                Ok(vfp_to_thumb_bytes(instr))
6777            }
6778            ArmOp::MveAbsF32 { qd, qm } => {
6779                let qd_enc = qreg_to_num(qd);
6780                let qm_enc = qreg_to_num(qm);
6781                // VABS.F32 Qd, Qm: FFB90740
6782                let instr: u32 = 0xFFB90740 | ((qd_enc * 2) << 12) | (qm_enc * 2);
6783                Ok(vfp_to_thumb_bytes(instr))
6784            }
6785            ArmOp::MveCmpEqF32 { qd, qn, qm }
6786            | ArmOp::MveCmpNeF32 { qd, qn, qm }
6787            | ArmOp::MveCmpLtF32 { qd, qn, qm }
6788            | ArmOp::MveCmpLeF32 { qd, qn, qm }
6789            | ArmOp::MveCmpGtF32 { qd, qn, qm }
6790            | ArmOp::MveCmpGeF32 { qd, qn, qm } => {
6791                // Placeholder: encode as VADD.F32 (real impl needs VCMP.F32 + VPSEL)
6792                Ok(vfp_to_thumb_bytes(encode_mve_3reg(0xEF000D40, qd, qn, qm)))
6793            }
6794            ArmOp::MveDupF32 { qd, rn } => {
6795                let qd_enc = qreg_to_num(qd);
6796                let rn_bits = reg_to_bits(rn);
6797                // VDUP.32 Qd, Rn (same encoding as integer VDUP.32)
6798                let instr: u32 = 0xEEA00B10 | ((qd_enc * 2) << 16) | (rn_bits << 12);
6799                Ok(vfp_to_thumb_bytes(instr))
6800            }
6801            ArmOp::MveExtractLaneF32 { rd, qn, lane } => {
6802                let qn_enc = qreg_to_num(qn);
6803                let rd_bits = reg_to_bits(rd);
6804                // VMOV Rd, Sn where Sn = Q*4 + lane
6805                let s_num = qn_enc * 4 + (*lane as u32);
6806                let (vn, n) = encode_sreg(s_num);
6807                let instr: u32 = 0xEE100A10 | (vn << 16) | (rd_bits << 12) | (n << 7);
6808                Ok(vfp_to_thumb_bytes(instr))
6809            }
6810            ArmOp::MveReplaceLaneF32 { qd, rn, lane } => {
6811                let qd_enc = qreg_to_num(qd);
6812                let rn_bits = reg_to_bits(rn);
6813                // VMOV Sn, Rn where Sn = Q*4 + lane
6814                let s_num = qd_enc * 4 + (*lane as u32);
6815                let (vn, n) = encode_sreg(s_num);
6816                let instr: u32 = 0xEE000A10 | (vn << 16) | (rn_bits << 12) | (n << 7);
6817                Ok(vfp_to_thumb_bytes(instr))
6818            }
6819            ArmOp::MveDivF32 { qd, qn, qm } => {
6820                // Lane-wise: extract 4 S-regs, VDIV, insert back
6821                self.encode_thumb_mve_lane_wise_f32_binop(qd, qn, qm, 0xEE800A00)
6822            }
6823            ArmOp::MveSqrtF32 { qd, qm } => {
6824                // Lane-wise: extract 4 S-regs, VSQRT, insert back
6825                self.encode_thumb_mve_lane_wise_f32_sqrt(qd, qm)
6826            }
6827
6828            // Catch-all for any remaining ops
6829            _ => {
6830                let instr: u16 = 0xBF00; // NOP
6831                Ok(instr.to_le_bytes().to_vec())
6832            }
6833        }
6834    }
6835
6836    // === Thumb-2 VFP multi-instruction helpers ===
6837
6838    /// Encode F32 comparison as Thumb-2: VCMP.F32 + VMRS + MOVS rd,#0 + IT + MOV rd,#1
6839    fn encode_thumb_f32_compare(
6840        &self,
6841        rd: &Reg,
6842        sn: &VfpReg,
6843        sm: &VfpReg,
6844        cond_code: u32,
6845    ) -> Result<Vec<u8>> {
6846        let mut bytes = Vec::new();
6847        let rd_bits = reg_to_bits(rd);
6848
6849        // #709 (bug found under #708/#709): the `MOVS Rd,#0` below is a
6850        // FLAG-SETTING 16-bit move. Emitting it AFTER `VMRS APSR_nzcv, FPSCR`
6851        // (as the original code did) clobbered the N/Z/C/V flags the VMRS just
6852        // transferred from the VFP compare, so the following `IT<cond>` read
6853        // stale flags and every f32 comparison silently returned 0 (verified:
6854        // `flt(1.0,2.0)` → 0 on Cortex-M4F). The 619 harness never caught it
6855        // because it deliberately skipped compare EXECUTION on a false premise
6856        // (unicorn DOES model VMRS→APSR). Fix: materialize the `#0` FIRST, then
6857        // VCMP+VMRS set the flags the `IT` consumes. Instruction sizes are
6858        // unchanged (pure reorder), so the estimator↔encoder oracle (#511) is
6859        // untouched — only the byte ORDER differs.
6860
6861        // MOVS Rd, #0 (16-bit): 0010 0 Rd(3) 0000 0000 — its flag side effect
6862        // is immediately overwritten by the VMRS below.
6863        if rd_bits < 8 {
6864            let movs_zero: u16 = 0x2000 | ((rd_bits as u16) << 8);
6865            bytes.extend_from_slice(&movs_zero.to_le_bytes());
6866        } else {
6867            // MOV.W Rd, #0 (32-bit Thumb-2)
6868            let hw1: u16 = 0xF04F;
6869            let hw2: u16 = (rd_bits as u16) << 8;
6870            bytes.extend_from_slice(&hw1.to_le_bytes());
6871            bytes.extend_from_slice(&hw2.to_le_bytes());
6872        }
6873
6874        // VCMP.F32 Sn, Sm
6875        let sn_num = vfp_sreg_to_num(sn)?;
6876        let sm_num = vfp_sreg_to_num(sm)?;
6877        let (vd, d) = encode_sreg(sn_num);
6878        let (vm, m) = encode_sreg(sm_num);
6879        let vcmp = 0xEEB40A40 | (d << 22) | (vd << 12) | (m << 5) | vm;
6880        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcmp));
6881
6882        // VMRS APSR_nzcv, FPSCR: 0xEEF1FA10 (sets the flags IT consumes)
6883        bytes.extend_from_slice(&vfp_to_thumb_bytes(0xEEF1FA10));
6884
6885        // IT<cond> — If-Then for conditional MOV
6886        // IT encoding: 1011 1111 cond(4) mask(4)
6887        // mask = 0x8 for single "then" (IT)
6888        let it: u16 = 0xBF00 | ((cond_code as u16) << 4) | 0x8;
6889        bytes.extend_from_slice(&it.to_le_bytes());
6890
6891        // MOV Rd, #1 (16-bit, conditional due to IT): 0010 0 Rd(3) 0000 0001
6892        if rd_bits < 8 {
6893            let mov_one: u16 = 0x2001 | ((rd_bits as u16) << 8);
6894            bytes.extend_from_slice(&mov_one.to_le_bytes());
6895        } else {
6896            // MOV.W Rd, #1 (32-bit)
6897            let hw1: u16 = 0xF04F;
6898            let hw2: u16 = ((rd_bits as u16) << 8) | 0x01;
6899            bytes.extend_from_slice(&hw1.to_le_bytes());
6900            bytes.extend_from_slice(&hw2.to_le_bytes());
6901        }
6902
6903        Ok(bytes)
6904    }
6905
6906    /// Encode F32 constant load as Thumb-2: MOVW + MOVT + VMOV
6907    fn encode_thumb_f32_const(&self, sd: &VfpReg, value: f32) -> Result<Vec<u8>> {
6908        let mut bytes = Vec::new();
6909        let bits = value.to_bits();
6910        let rt: u32 = 12; // R12/IP as temp
6911
6912        // MOVW R12, #lo16
6913        // Thumb-2 MOVW: 11110 i 10 0100 imm4 | 0 imm3 Rd imm8
6914        let lo16 = bits & 0xFFFF;
6915        let imm4 = (lo16 >> 12) & 0xF;
6916        let i_bit = (lo16 >> 11) & 1;
6917        let imm3 = (lo16 >> 8) & 0x7;
6918        let imm8 = lo16 & 0xFF;
6919        let hw1: u16 = (0xF240 | (i_bit << 10) | imm4) as u16;
6920        let hw2: u16 = ((imm3 << 12) | (rt << 8) | imm8) as u16;
6921        bytes.extend_from_slice(&hw1.to_le_bytes());
6922        bytes.extend_from_slice(&hw2.to_le_bytes());
6923
6924        // MOVT R12, #hi16
6925        let hi16 = (bits >> 16) & 0xFFFF;
6926        let imm4 = (hi16 >> 12) & 0xF;
6927        let i_bit = (hi16 >> 11) & 1;
6928        let imm3 = (hi16 >> 8) & 0x7;
6929        let imm8 = hi16 & 0xFF;
6930        let hw1: u16 = (0xF2C0 | (i_bit << 10) | imm4) as u16;
6931        let hw2: u16 = ((imm3 << 12) | (rt << 8) | imm8) as u16;
6932        bytes.extend_from_slice(&hw1.to_le_bytes());
6933        bytes.extend_from_slice(&hw2.to_le_bytes());
6934
6935        // VMOV Sd, R12
6936        let vmov = encode_vmov_core_sreg(true, sd, &Reg::R12)?;
6937        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
6938
6939        Ok(bytes)
6940    }
6941
6942    /// Encode VMOV + VCVT.F32.xS32 as Thumb-2
6943    fn encode_thumb_f32_convert_i32(&self, sd: &VfpReg, rm: &Reg, signed: bool) -> Result<Vec<u8>> {
6944        let mut bytes = Vec::new();
6945
6946        // VMOV Sd, Rm
6947        let vmov = encode_vmov_core_sreg(true, sd, rm)?;
6948        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
6949
6950        // VCVT.F32.S32/U32 Sd, Sd. Bit 7 (op) = 1 for signed (S32), 0 for
6951        // unsigned (U32): signed = 0xEEB80AC0, unsigned = 0xEEB80A40
6952        // (GI-FPU-002: previously swapped — see the ARM32 twin).
6953        let sd_num = vfp_sreg_to_num(sd)?;
6954        let (vd, d) = encode_sreg(sd_num);
6955        let (vm, m) = encode_sreg(sd_num);
6956        let base = if signed { 0xEEB80AC0 } else { 0xEEB80A40 };
6957        let vcvt = base | (d << 22) | (vd << 12) | (m << 5) | vm;
6958        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt));
6959
6960        Ok(bytes)
6961    }
6962
6963    /// Encode F32 rounding pseudo-op as Thumb-2 via VCVT to integer and back
6964    /// Encode F32 rounding as Thumb-2.
6965    /// `mode`: FPSCR RMode — 0b00=nearest, 0b01=+inf(ceil), 0b10=-inf(floor), 0b11=zero(trunc)
6966    ///
6967    /// For trunc: uses VCVTR.S32.F32 (always truncates).
6968    /// For ceil/floor/nearest: sets FPSCR rounding mode, uses VCVT.S32.F32 (non-R variant),
6969    /// then restores FPSCR.
6970    fn encode_thumb_f32_rounding(&self, sd: &VfpReg, sm: &VfpReg, mode: u8) -> Result<Vec<u8>> {
6971        let mut bytes = Vec::new();
6972        let sm_num = vfp_sreg_to_num(sm)?;
6973        let sd_num = vfp_sreg_to_num(sd)?;
6974        let (vd_s, d_s) = encode_sreg(sd_num);
6975        let (vm_s, m_s) = encode_sreg(sm_num);
6976
6977        if mode == 0b11 {
6978            // Trunc (toward zero): VCVTR.S32.F32 — bit[7]=1, always truncates
6979            let vcvt_to_int = 0xEEBD0AC0 | (d_s << 22) | (vd_s << 12) | (m_s << 5) | vm_s;
6980            bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt_to_int));
6981        } else {
6982            // ceil/floor/nearest: manipulate FPSCR rounding mode
6983            let rt: u32 = 12; // R12/IP as temp
6984
6985            // VMRS R12, FPSCR
6986            let vmrs = 0xEEF10A10 | (rt << 12);
6987            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmrs));
6988
6989            // BIC.W R12, R12, #(3 << 22) — clear RMode bits [23:22]
6990            // Thumb-2 modified immediate for 3<<22 = 0x00C00000:
6991            // BIC.W encoding: 11110 i 0 0001 S Rn | 0 imm3 Rd imm8
6992            // 0x00C00000 = 0x03 shifted left by 22 => Thumb mod-imm: i=0, imm3=0b101, imm8=0x03
6993            let bic_hw1: u16 = 0xF020 | ((rt as u16) & 0xF); // BIC, Rn=R12
6994            let bic_hw2: u16 = (0x05 << 12) | ((rt as u16) << 8) | 0x03;
6995            bytes.extend_from_slice(&bic_hw1.to_le_bytes());
6996            bytes.extend_from_slice(&bic_hw2.to_le_bytes());
6997
6998            // ORR.W R12, R12, #(mode << 22)
6999            if mode != 0 {
7000                let orr_hw1: u16 = 0xF040 | ((rt as u16) & 0xF); // ORR, Rn=R12
7001                let orr_hw2: u16 = (0x05 << 12) | ((rt as u16) << 8) | (mode as u16);
7002                bytes.extend_from_slice(&orr_hw1.to_le_bytes());
7003                bytes.extend_from_slice(&orr_hw2.to_le_bytes());
7004            }
7005
7006            // VMSR FPSCR, R12
7007            let vmsr = 0xEEE10A10 | (rt << 12);
7008            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmsr));
7009
7010            // VCVT.S32.F32 Sd, Sm — non-R variant (bit[7]=0), uses FPSCR rmode
7011            let vcvt_to_int = 0xEEBD0A40 | (d_s << 22) | (vd_s << 12) | (m_s << 5) | vm_s;
7012            bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt_to_int));
7013
7014            // Restore FPSCR: clear rmode bits back to nearest (default)
7015            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmrs));
7016            bytes.extend_from_slice(&bic_hw1.to_le_bytes());
7017            bytes.extend_from_slice(&bic_hw2.to_le_bytes());
7018            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmsr));
7019        }
7020
7021        // VCVT.F32.S32 Sd, Sd (convert integer result back to float)
7022        let (vd2, d2) = encode_sreg(sd_num);
7023        let vcvt_to_float = 0xEEB80A40 | (d2 << 22) | (vd2 << 12) | (d_s << 5) | vd_s;
7024        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt_to_float));
7025
7026        Ok(bytes)
7027    }
7028
7029    /// Encode F32 min/max as Thumb-2: VMOV + VCMP + VMRS + IT + VMOV
7030    fn encode_thumb_f32_minmax(
7031        &self,
7032        sd: &VfpReg,
7033        sn: &VfpReg,
7034        sm: &VfpReg,
7035        is_min: bool,
7036    ) -> Result<Vec<u8>> {
7037        let mut bytes = Vec::new();
7038        let sn_num = vfp_sreg_to_num(sn)?;
7039        let sm_num = vfp_sreg_to_num(sm)?;
7040        let sd_num = vfp_sreg_to_num(sd)?;
7041
7042        // VMOV.F32 Sd, Sn
7043        let (vd, d) = encode_sreg(sd_num);
7044        let (vn, n) = encode_sreg(sn_num);
7045        let vmov_sn = 0xEEB00A40 | (d << 22) | (vd << 12) | (n << 5) | vn;
7046        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov_sn));
7047
7048        // VCMP.F32 Sn, Sm
7049        let (vm, m) = encode_sreg(sm_num);
7050        let vcmp = 0xEEB40A40 | (n << 22) | (vn << 12) | (m << 5) | vm;
7051        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcmp));
7052
7053        // VMRS APSR_nzcv, FPSCR
7054        bytes.extend_from_slice(&vfp_to_thumb_bytes(0xEEF1FA10));
7055
7056        // IT GT (for min) or IT MI (for max)
7057        let cond: u16 = if is_min { 0xC } else { 0x4 };
7058        let it: u16 = 0xBF00 | (cond << 4) | 0x8;
7059        bytes.extend_from_slice(&it.to_le_bytes());
7060
7061        // VMOV{cond}.F32 Sd, Sm — conditional VMOV in IT block
7062        let vmov_sm = 0xEEB00A40 | (d << 22) | (vd << 12) | (m << 5) | vm;
7063        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov_sm));
7064
7065        Ok(bytes)
7066    }
7067
7068    /// Encode F32 copysign as Thumb-2
7069    /// Encode F32 copysign as Thumb-2, clobbering ONLY R12 (the reserved
7070    /// encoder scratch, #212), the flags, and Sd:
7071    ///
7072    ///   VMOV R12, Sm ; CMP R12, #0    (N flag = the sign bit)
7073    ///   VABS.F32 Sd, Sn               (magnitude, sign cleared)
7074    ///   IT MI ; VNEG.F32(MI) Sd, Sd
7075    ///
7076    /// Bit-exact on ±0.0/NaN-sign/±inf (VABS/VNEG are sign-bit-only edits).
7077    /// The R12 capture happens BEFORE Sd is written, so Sd aliasing Sn or Sm
7078    /// is safe. (The previous sequence staged the magnitude through R0 —
7079    /// clobbering a live allocator-owned value, the #615 class; caught while
7080    /// composing the F64 twin for #369.)
7081    fn encode_thumb_f32_copysign(&self, sd: &VfpReg, sn: &VfpReg, sm: &VfpReg) -> Result<Vec<u8>> {
7082        let mut bytes = Vec::new();
7083
7084        // VMOV R12, Sm (sign source bits)
7085        bytes.extend_from_slice(&vfp_to_thumb_bytes(encode_vmov_core_sreg(
7086            false,
7087            sm,
7088            &Reg::R12,
7089        )?));
7090        // CMP.W R12, #0 — N = bit31 (the sign, incl. -0.0 / -NaN).
7091        bytes.extend_from_slice(&0xF1BC_u16.to_le_bytes());
7092        bytes.extend_from_slice(&0x0F00_u16.to_le_bytes());
7093        // VABS.F32 Sd, Sn
7094        let sd_num = vfp_sreg_to_num(sd)?;
7095        let sn_num = vfp_sreg_to_num(sn)?;
7096        let (vd, d) = encode_sreg(sd_num);
7097        let (vn, n) = encode_sreg(sn_num);
7098        let vabs = 0xEEB00AC0 | (d << 22) | (vd << 12) | (n << 5) | vn;
7099        bytes.extend_from_slice(&vfp_to_thumb_bytes(vabs));
7100        // IT MI ; VNEG.F32(MI) Sd, Sd
7101        bytes.extend_from_slice(&0xBF48_u16.to_le_bytes());
7102        let vneg = 0xEEB10A40 | (d << 22) | (vd << 12) | (d << 5) | vd;
7103        bytes.extend_from_slice(&vfp_to_thumb_bytes(vneg));
7104
7105        Ok(bytes)
7106    }
7107
7108    /// Encode F64 comparison as Thumb-2: VCMP.F64 + VMRS + MOV #0 + IT + MOV #1
7109    fn encode_thumb_f64_compare(
7110        &self,
7111        rd: &Reg,
7112        dn: &VfpReg,
7113        dm: &VfpReg,
7114        cond_code: u32,
7115    ) -> Result<Vec<u8>> {
7116        let mut bytes = Vec::new();
7117        let rd_bits = reg_to_bits(rd);
7118
7119        // #712-class fix (found at f64-phase-2 wiring, #369): the 16-bit
7120        // `MOVS Rd,#0` is FLAG-SETTING. The original order emitted it AFTER
7121        // `VMRS APSR_nzcv, FPSCR`, clobbering the N/Z/C/V flags the VMRS just
7122        // transferred, so the following `IT<cond>` read stale flags and every
7123        // f64 comparison silently returned 0 — the exact bug the f32 compare
7124        // encoder shipped with and #712 fixed. Same fix: materialize the `#0`
7125        // FIRST (its flag side effect is overwritten by the VMRS), then
7126        // VCMP+VMRS set the flags the IT consumes. Pure reorder — sizes
7127        // unchanged.
7128
7129        // MOVS Rd, #0
7130        if rd_bits < 8 {
7131            let movs_zero: u16 = 0x2000 | ((rd_bits as u16) << 8);
7132            bytes.extend_from_slice(&movs_zero.to_le_bytes());
7133        } else {
7134            let hw1: u16 = 0xF04F;
7135            let hw2: u16 = (rd_bits as u16) << 8;
7136            bytes.extend_from_slice(&hw1.to_le_bytes());
7137            bytes.extend_from_slice(&hw2.to_le_bytes());
7138        }
7139
7140        // VCMP.F64 Dn, Dm
7141        let dn_num = vfp_dreg_to_num(dn)?;
7142        let dm_num = vfp_dreg_to_num(dm)?;
7143        let (vd, d) = encode_dreg(dn_num);
7144        let (vm, m) = encode_dreg(dm_num);
7145        let vcmp = 0xEEB40B40 | (d << 22) | (vd << 12) | (m << 5) | vm;
7146        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcmp));
7147
7148        // VMRS APSR_nzcv, FPSCR (sets the flags the IT consumes)
7149        bytes.extend_from_slice(&vfp_to_thumb_bytes(0xEEF1FA10));
7150
7151        // IT<cond>
7152        let it: u16 = 0xBF00 | ((cond_code as u16) << 4) | 0x8;
7153        bytes.extend_from_slice(&it.to_le_bytes());
7154
7155        // MOV Rd, #1
7156        if rd_bits < 8 {
7157            let mov_one: u16 = 0x2001 | ((rd_bits as u16) << 8);
7158            bytes.extend_from_slice(&mov_one.to_le_bytes());
7159        } else {
7160            let hw1: u16 = 0xF04F;
7161            let hw2: u16 = ((rd_bits as u16) << 8) | 0x01;
7162            bytes.extend_from_slice(&hw1.to_le_bytes());
7163            bytes.extend_from_slice(&hw2.to_le_bytes());
7164        }
7165
7166        Ok(bytes)
7167    }
7168
7169    /// Encode F64 constant load as Thumb-2: MOVW+MOVT (lo32 into R0) + MOVW+MOVT (hi32 into R12) + VMOV Dd, R0, R12
7170    fn encode_thumb_f64_const(&self, dd: &VfpReg, value: f64) -> Result<Vec<u8>> {
7171        let mut bytes = Vec::new();
7172        let bits = value.to_bits();
7173        let lo32 = bits as u32;
7174        let hi32 = (bits >> 32) as u32;
7175
7176        // MOVW R0, #lo16(lo32)
7177        let lo16 = lo32 & 0xFFFF;
7178        bytes.extend_from_slice(&self.encode_thumb32_movw_raw(0, lo16)?);
7179
7180        // MOVT R0, #hi16(lo32)
7181        let hi16 = (lo32 >> 16) & 0xFFFF;
7182        bytes.extend_from_slice(&self.encode_thumb32_movt_raw(0, hi16)?);
7183
7184        // MOVW R12, #lo16(hi32)
7185        let lo16 = hi32 & 0xFFFF;
7186        bytes.extend_from_slice(&self.encode_thumb32_movw_raw(12, lo16)?);
7187
7188        // MOVT R12, #hi16(hi32)
7189        let hi16 = (hi32 >> 16) & 0xFFFF;
7190        bytes.extend_from_slice(&self.encode_thumb32_movt_raw(12, hi16)?);
7191
7192        // VMOV Dd, R0, R12
7193        let vmov = encode_vmov_core_dreg(true, dd, &Reg::R0, &Reg::R12)?;
7194        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
7195
7196        Ok(bytes)
7197    }
7198
7199    /// Encode VMOV Sd, Rm + VCVT.F64.S32/U32 Dd, Sd as Thumb-2
7200    /// Encode i32 → f64 conversion as Thumb-2. The integer stages through the
7201    /// DESTINATION's own low S-alias (`S(2d)`) — allocator-owned by
7202    /// definition — never S0 (which may hold a live value; the previous
7203    /// pseudo-op's S0 staging was the #615 class). Also fixes the SWAPPED
7204    /// signed/unsigned VCVT bases (bit7 = 1 is SIGNED — the same swap the f32
7205    /// twin had; latent here because f64.convert_i32_* was decode-dropped
7206    /// until #369): clang-verified vcvt.f64.s32 d1,s2 = eeb8 1bc1,
7207    /// vcvt.f64.u32 d1,s2 = eeb8 1b41.
7208    fn encode_thumb_f64_convert_i32(&self, dd: &VfpReg, rm: &Reg, signed: bool) -> Result<Vec<u8>> {
7209        let dd_num = vfp_dreg_to_num(dd)?;
7210        if dd_num > 7 {
7211            return Err(synth_core::Error::synthesis(format!(
7212                "F64ConvertI32: destination {dd:?} has no S-register alias \
7213                 (D8..D15) — the selector allocates only D0..D7"
7214            )));
7215        }
7216        let mut bytes = Vec::new();
7217
7218        // VMOV S(2d), Rm — stage the integer in the destination's low word.
7219        let (vn_s, n_s) = encode_sreg(2 * dd_num);
7220        let rt = reg_to_bits(rm);
7221        let vmov = 0xEE000A10 | (vn_s << 16) | (rt << 12) | (n_s << 7);
7222        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
7223
7224        // VCVT.F64.S32/U32 Dd, S(2d)
7225        let (vd, d) = encode_dreg(dd_num);
7226        let (vm, m) = encode_sreg(2 * dd_num);
7227        let base = if signed { 0xEEB80BC0 } else { 0xEEB80B40 };
7228        let vcvt = base | (d << 22) | (vd << 12) | (m << 5) | vm;
7229        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt));
7230
7231        Ok(bytes)
7232    }
7233
7234    /// Encode VCVT.F64.F32 Dd, Sm as Thumb-2
7235    fn encode_thumb_f64_promote_f32(&self, dd: &VfpReg, sm: &VfpReg) -> Result<Vec<u8>> {
7236        let dd_num = vfp_dreg_to_num(dd)?;
7237        let sm_num = vfp_sreg_to_num(sm)?;
7238        let (vd, d) = encode_dreg(dd_num);
7239        let (vm, m) = encode_sreg(sm_num);
7240
7241        let vcvt = 0xEEB70AC0 | (d << 22) | (vd << 12) | (m << 5) | vm;
7242        Ok(vfp_to_thumb_bytes(vcvt))
7243    }
7244
7245    /// Encode VCVT.F32.F64 Sd, Dm (f32.demote_f64) as Thumb-2 — single
7246    /// instruction, round-to-nearest-even per FPSCR default, exactly WASM
7247    /// §4.3.3 demote (clang-verified: vcvt.f32.f64 s1,d2 = eef7 0bc2).
7248    fn encode_thumb_f32_demote_f64(&self, sd: &VfpReg, dm: &VfpReg) -> Result<Vec<u8>> {
7249        let sd_num = vfp_sreg_to_num(sd)?;
7250        let dm_num = vfp_dreg_to_num(dm)?;
7251        let (vd, d) = encode_sreg(sd_num);
7252        let (vm, m) = encode_dreg(dm_num);
7253
7254        let vcvt = 0xEEB70BC0 | (d << 22) | (vd << 12) | (m << 5) | vm;
7255        Ok(vfp_to_thumb_bytes(vcvt))
7256    }
7257
7258    /// Encode f64 → i32 truncation as Thumb-2 (round-toward-zero VCVT). The
7259    /// 32-bit result stages through the SOURCE's own low S-alias (`S(2m)`,
7260    /// clobbering half of an operand the selector has already popped) — never
7261    /// S0, which may hold an unrelated live value (the #615 class). The
7262    /// overlapping write is well-defined: VCVT reads its source operand
7263    /// before writing (compilers emit `vcvt.f32.f64 s0, d0` routinely).
7264    /// The SELECTOR guarantees `dm` is a dead temp, never a pinned param/
7265    /// local home (it copies a home into a fresh D-temp first).
7266    fn encode_thumb_i32_trunc_f64(&self, rd: &Reg, dm: &VfpReg, signed: bool) -> Result<Vec<u8>> {
7267        let dm_num = vfp_dreg_to_num(dm)?;
7268        if dm_num > 7 {
7269            return Err(synth_core::Error::synthesis(format!(
7270                "I32TruncF64: source {dm:?} has no S-register alias \
7271                 (D8..D15) — the selector allocates only D0..D7"
7272            )));
7273        }
7274        let mut bytes = Vec::new();
7275
7276        // VCVT.S32/U32.F64 S(2m), Dm (clang-verified:
7277        // vcvt.s32.f64 s1,d2 = eefd 0bc2 ; vcvt.u32.f64 s1,d2 = eefc 0bc2)
7278        let (vm, m) = encode_dreg(dm_num);
7279        let (vd_s, d_s) = encode_sreg(2 * dm_num);
7280        let base = if signed { 0xEEBD0BC0 } else { 0xEEBC0BC0 };
7281        let vcvt = base | (d_s << 22) | (vd_s << 12) | (m << 5) | vm;
7282        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt));
7283
7284        // VMOV Rd, S(2m)
7285        let rt = reg_to_bits(rd);
7286        let vmov = 0xEE100A10 | (vd_s << 16) | (rt << 12) | (d_s << 7);
7287        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
7288
7289        Ok(bytes)
7290    }
7291
7292    /// Encode F64 rounding as a SINGLE Thumb-2 VRINT (FPv5 / cortex-m7dp).
7293    /// `mode` keeps the legacy FPSCR-RMode numbering of the callers —
7294    /// 0b00=nearest(ties-to-even)→VRINTN, 0b01=+inf(ceil)→VRINTP,
7295    /// 0b10=-inf(floor)→VRINTM, 0b11=zero(trunc)→VRINTZ — but the rounding
7296    /// mode is now ENCODED in the instruction, not smuggled through FPSCR.
7297    /// (The previous pseudo-op round-tripped through a 32-bit integer in S0:
7298    /// wrong for |x| >= 2^31, NaN/±inf collapsed to 0, -0.0 lost, and it
7299    /// CLOBBERED S0/R12 behind the allocator's back — the #615 class.)
7300    /// VRINT quietens an sNaN and preserves the sign of ±0.0/NaN per IEEE 754
7301    /// roundToIntegral, which is exactly WASM Core §4.3.3 f64.ceil/floor/
7302    /// trunc/nearest. VRINTN/P/M live in the FE "always-execute" space (never
7303    /// IT-conditional; none of these sequences emits them inside an IT block).
7304    fn encode_thumb_f64_rounding(&self, dd: &VfpReg, dm: &VfpReg, mode: u8) -> Result<Vec<u8>> {
7305        let dd_num = vfp_dreg_to_num(dd)?;
7306        let dm_num = vfp_dreg_to_num(dm)?;
7307        let (vd, d) = encode_dreg(dd_num);
7308        let (vm, m) = encode_dreg(dm_num);
7309        // clang-verified bases (thumbv7em, fpv5-d16):
7310        //   vrintn.f64 d1,d2 = feb9 1b42 ; vrintp = feba 1b42
7311        //   vrintm.f64 d1,d2 = febb 1b42 ; vrintz = eeb6 1bc2
7312        let base: u32 = match mode {
7313            0b00 => 0xFEB90B40, // VRINTN.F64 (round to nearest, ties to even)
7314            0b01 => 0xFEBA0B40, // VRINTP.F64 (round toward +inf)
7315            0b10 => 0xFEBB0B40, // VRINTM.F64 (round toward -inf)
7316            _ => 0xEEB60BC0,    // VRINTZ.F64 (round toward zero)
7317        };
7318        Ok(vfp_to_thumb_bytes(
7319            base | (d << 22) | (vd << 12) | (m << 5) | vm,
7320        ))
7321    }
7322
7323    /// Encode F64 min/max as Thumb-2 with WASM Core §4.3.3 semantics:
7324    ///
7325    ///   VCMP.F64 Dn, Dm ; VMRS APSR_nzcv, FPSCR
7326    ///   VMINNM.F64/VMAXNM.F64 Dd, Dn, Dm      (FPv5; -0.0 < +0.0 ordered)
7327    ///   IT VS ; VADD.F64(VS) Dd, Dn, Dm       (unordered ⇒ NaN-propagating)
7328    ///
7329    /// VMINNM/VMAXNM alone are IEEE minNum/maxNum, which return the NUMBER
7330    /// when exactly one operand is NaN — WASM requires NaN. The VS-guarded
7331    /// VADD overwrites the result with a quiet NaN whenever the compare was
7332    /// unordered (either operand NaN); on the ordered path VMINNM/VMAXNM
7333    /// order -0.0 below +0.0, matching WASM's min(+0,-0) = -0 / max = +0.
7334    /// Clobbers ONLY Dd and the flags (the previous pseudo-op's ordered IT
7335    /// GT/MI select returned the WRONG operand for NaN and ±0 mixes).
7336    ///
7337    /// Ok-or-Err: `dd` must not alias `dn`/`dm` — the VS fix-up reads them
7338    /// AFTER VMINNM wrote `dd` (the selector always allocates a fresh
7339    /// destination while both sources are still marked live).
7340    fn encode_thumb_f64_minmax(
7341        &self,
7342        dd: &VfpReg,
7343        dn: &VfpReg,
7344        dm: &VfpReg,
7345        is_min: bool,
7346    ) -> Result<Vec<u8>> {
7347        if dd == dn || dd == dm {
7348            return Err(synth_core::Error::synthesis(format!(
7349                "F64{}: destination {dd:?} aliases a source ({dn:?},{dm:?}) — \
7350                 the unordered NaN fix-up would read a clobbered operand \
7351                 (compiler bug: the selector must allocate a fresh D-temp)",
7352                if is_min { "Min" } else { "Max" },
7353            )));
7354        }
7355        let mut bytes = Vec::new();
7356        let dd_num = vfp_dreg_to_num(dd)?;
7357        let dn_num = vfp_dreg_to_num(dn)?;
7358        let dm_num = vfp_dreg_to_num(dm)?;
7359        let (vd, d) = encode_dreg(dd_num);
7360        let (vn, n) = encode_dreg(dn_num);
7361        let (vm, m) = encode_dreg(dm_num);
7362
7363        // VCMP.F64 Dn, Dm (clang-verified: vcmp.f64 d2,d3 = eeb4 2b43)
7364        let vcmp = 0xEEB40B40 | (n << 22) | (vn << 12) | (m << 5) | vm;
7365        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcmp));
7366        // VMRS APSR_nzcv, FPSCR
7367        bytes.extend_from_slice(&vfp_to_thumb_bytes(0xEEF1FA10));
7368        // VMINNM.F64 / VMAXNM.F64 Dd, Dn, Dm (clang-verified:
7369        // vminnm.f64 d1,d2,d3 = fe82 1b43 ; vmaxnm = fe82 1b03)
7370        let base: u32 = if is_min { 0xFE800B40 } else { 0xFE800B00 };
7371        let vnm = base | (d << 22) | (vn << 16) | (vd << 12) | (n << 7) | (m << 5) | vm;
7372        bytes.extend_from_slice(&vfp_to_thumb_bytes(vnm));
7373        // IT VS (unordered ⇒ at least one NaN operand)
7374        bytes.extend_from_slice(&0xBF68_u16.to_le_bytes());
7375        // VADD.F64(VS) Dd, Dn, Dm — NaN + x propagates a quiet NaN
7376        let vadd = 0xEE300B00 | (d << 22) | (vn << 16) | (vd << 12) | (n << 7) | (m << 5) | vm;
7377        bytes.extend_from_slice(&vfp_to_thumb_bytes(vadd));
7378
7379        Ok(bytes)
7380    }
7381
7382    /// Encode F64 copysign as Thumb-2, clobbering ONLY R12 (the reserved
7383    /// encoder scratch, #212), the flags, and Dd:
7384    ///
7385    ///   VMOV R12, S(2m+1)   (high word of the SIGN source Dm)
7386    ///   CMP  R12, #0        (N flag = the sign bit)
7387    ///   VABS.F64 Dd, Dn     (magnitude, sign cleared)
7388    ///   IT MI ; VNEG.F64(MI) Dd, Dd
7389    ///
7390    /// Bit-exact on ±0.0/NaN-sign/±inf (VABS/VNEG are sign-bit-only edits).
7391    /// The R12 capture happens BEFORE Dd is written, so Dd aliasing Dn or Dm
7392    /// is safe. (The previous pseudo-op clobbered R0/R1/R2 behind the
7393    /// allocator's back — the #615 class.)
7394    fn encode_thumb_f64_copysign(&self, dd: &VfpReg, dn: &VfpReg, dm: &VfpReg) -> Result<Vec<u8>> {
7395        let dm_num = vfp_dreg_to_num(dm)?;
7396        if dm_num > 7 {
7397            return Err(synth_core::Error::synthesis(format!(
7398                "F64Copysign: sign source {dm:?} has no S-register alias \
7399                 (D8..D15) — the selector allocates only D0..D7"
7400            )));
7401        }
7402        let mut bytes = Vec::new();
7403        // VMOV R12, S(2m+1) — the sign source's high word.
7404        let (vn_s, n_s) = encode_sreg(2 * dm_num + 1);
7405        let vmov = 0xEE100A10 | (vn_s << 16) | (12 << 12) | (n_s << 7);
7406        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
7407        // CMP R12, #0 (T2: CMP.W R12, #0) — N = bit31 of the sign word.
7408        bytes.extend_from_slice(&0xF1BC_u16.to_le_bytes());
7409        bytes.extend_from_slice(&0x0F00_u16.to_le_bytes());
7410        // VABS.F64 Dd, Dn
7411        let dd_num = vfp_dreg_to_num(dd)?;
7412        let dn_num = vfp_dreg_to_num(dn)?;
7413        let (vd, d) = encode_dreg(dd_num);
7414        let (vn, n) = encode_dreg(dn_num);
7415        let vabs = 0xEEB00BC0 | (d << 22) | (vd << 12) | (n << 5) | vn;
7416        bytes.extend_from_slice(&vfp_to_thumb_bytes(vabs));
7417        // IT MI ; VNEG.F64(MI) Dd, Dd
7418        bytes.extend_from_slice(&0xBF48_u16.to_le_bytes());
7419        let vneg = 0xEEB10B40 | (d << 22) | (vd << 12) | (d << 5) | vd;
7420        bytes.extend_from_slice(&vfp_to_thumb_bytes(vneg));
7421
7422        Ok(bytes)
7423    }
7424
7425    /// Encode VCVT.S32/U32.F32 + VMOV as Thumb-2
7426    fn encode_thumb_i32_trunc_f32(&self, rd: &Reg, sm: &VfpReg, signed: bool) -> Result<Vec<u8>> {
7427        let mut bytes = Vec::new();
7428
7429        let sm_num = vfp_sreg_to_num(sm)?;
7430        let (vd, d) = encode_sreg(sm_num);
7431        let (vm, m) = encode_sreg(sm_num);
7432        let base = if signed { 0xEEBD0AC0 } else { 0xEEBC0AC0 };
7433        let vcvt = base | (d << 22) | (vd << 12) | (m << 5) | vm;
7434        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt));
7435
7436        // VMOV Rd, Sm
7437        let vmov = encode_vmov_core_sreg(false, sm, rd)?;
7438        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
7439
7440        Ok(bytes)
7441    }
7442
7443    // === Thumb-2 32-bit encoding helpers ===
7444
7445    /// Encode Thumb-2 32-bit ADD with immediate
7446    fn encode_thumb32_add(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7447        let rd_bits = reg_to_bits(rd);
7448        let rn_bits = reg_to_bits(rn);
7449
7450        // The `i:imm3:imm8` field is split the same way for both forms.
7451        let i_bit = (imm >> 11) & 1;
7452        let imm3 = (imm >> 8) & 0x7;
7453        let imm8 = imm & 0xFF;
7454
7455        let hw1_base = if imm <= 0xFF {
7456            // ADD.W (T3): the field is a ThumbExpandImm modified immediate. For
7457            // imm <= 0xFF (i:imm3 = 0000) it is the zero-extended byte, which is
7458            // correct — keep this form so existing encodings stay bit-identical.
7459            0xF100
7460        } else if imm <= 0xFFF {
7461            // ADDW (T4): a PLAIN 12-bit immediate (0..4095) — no ThumbExpandImm.
7462            // This is what makes `add sp, sp, #frame` correct for frame sizes
7463            // >= 256, which ADD.W (T3) would silently mis-encode (e.g. #256 -> #0).
7464            0xF200
7465        } else {
7466            return Err(synth_core::Error::synthesis(
7467                "ADD immediate > 0xFFF (4095) requires a multi-instruction sequence (not supported)",
7468            ));
7469        };
7470
7471        let hw1: u16 = (hw1_base | (i_bit << 10) | rn_bits) as u16;
7472        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7473
7474        let mut bytes = hw1.to_le_bytes().to_vec();
7475        bytes.extend_from_slice(&hw2.to_le_bytes());
7476        Ok(bytes)
7477    }
7478
7479    /// Encode Thumb-2 32-bit SUB with immediate
7480    fn encode_thumb32_sub(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7481        let rd_bits = reg_to_bits(rd);
7482        let rn_bits = reg_to_bits(rn);
7483
7484        let i_bit = (imm >> 11) & 1;
7485        let imm3 = (imm >> 8) & 0x7;
7486        let imm8 = imm & 0xFF;
7487
7488        let hw1_base = if imm <= 0xFF {
7489            // SUB.W (T3) modified immediate — correct for the zero-extended byte
7490            // (imm <= 0xFF). Kept bit-identical for existing encodings.
7491            0xF1A0
7492        } else if imm <= 0xFFF {
7493            // SUBW (T4): plain 12-bit immediate (0..4095). Makes
7494            // `sub sp, sp, #frame` correct for frame sizes >= 256.
7495            0xF2A0
7496        } else {
7497            return Err(synth_core::Error::synthesis(
7498                "SUB immediate > 0xFFF (4095) requires a multi-instruction sequence (not supported)",
7499            ));
7500        };
7501
7502        let hw1: u16 = (hw1_base | (i_bit << 10) | rn_bits) as u16;
7503        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7504
7505        let mut bytes = hw1.to_le_bytes().to_vec();
7506        bytes.extend_from_slice(&hw2.to_le_bytes());
7507        Ok(bytes)
7508    }
7509
7510    /// Encode Thumb-2 32-bit ADDS with immediate (sets flags)
7511    fn encode_thumb32_adds(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7512        let rd_bits = reg_to_bits(rd);
7513        let rn_bits = reg_to_bits(rn);
7514
7515        // ADDS.W (flag-setting) has only the modified-immediate form — error on
7516        // an un-encodable value rather than silently add the wrong constant.
7517        let field = try_thumb_expand_imm(imm).ok_or_else(|| {
7518            synth_core::Error::synthesis(
7519                "ADDS immediate is not a valid ThumbExpandImm — materialize into a register",
7520            )
7521        })?;
7522        let i_bit = (field >> 11) & 1;
7523        let imm3 = (field >> 8) & 0x7;
7524        let imm8 = field & 0xFF;
7525
7526        // ADDS.W Rd, Rn, #imm (with S=1)
7527        // First halfword: 1111 0 i 0 1000 1 Rn = F110 | i<<10 | Rn
7528        let hw1: u16 = (0xF110 | (i_bit << 10) | rn_bits) as u16;
7529        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7530
7531        let mut bytes = hw1.to_le_bytes().to_vec();
7532        bytes.extend_from_slice(&hw2.to_le_bytes());
7533        Ok(bytes)
7534    }
7535
7536    /// Encode Thumb-2 32-bit SUBS with immediate (sets flags)
7537    fn encode_thumb32_subs(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7538        let rd_bits = reg_to_bits(rd);
7539        let rn_bits = reg_to_bits(rn);
7540
7541        // SUBS.W (flag-setting) has only the modified-immediate form — error on
7542        // an un-encodable value rather than silently subtract the wrong constant.
7543        let field = try_thumb_expand_imm(imm).ok_or_else(|| {
7544            synth_core::Error::synthesis(
7545                "SUBS immediate is not a valid ThumbExpandImm — materialize into a register",
7546            )
7547        })?;
7548        let i_bit = (field >> 11) & 1;
7549        let imm3 = (field >> 8) & 0x7;
7550        let imm8 = field & 0xFF;
7551
7552        // SUBS.W Rd, Rn, #imm (with S=1)
7553        // First halfword: 1111 0 i 0 1101 1 Rn = F1B0 | i<<10 | Rn
7554        let hw1: u16 = (0xF1B0 | (i_bit << 10) | rn_bits) as u16;
7555        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7556
7557        let mut bytes = hw1.to_le_bytes().to_vec();
7558        bytes.extend_from_slice(&hw2.to_le_bytes());
7559        Ok(bytes)
7560    }
7561
7562    /// Encode Thumb-2 32-bit MOVW (16-bit immediate)
7563    ///
7564    /// # Contract (Verus-style)
7565    /// ```text
7566    /// requires rd <= R14
7567    /// ensures result.len() == 4
7568    /// ensures (imm & 0xFFFF) can be reconstructed from the encoding
7569    /// ```
7570    fn encode_thumb32_movw(&self, rd: &Reg, imm: u32) -> Result<Vec<u8>> {
7571        let rd_bits = reg_to_bits(rd);
7572        reg_bits_checked(rd_bits)?;
7573        let imm16 = imm & 0xFFFF;
7574
7575        // MOVW Rd, #imm16
7576        // 1111 0 i 10 0 1 0 0 imm4 | 0 imm3 Rd imm8
7577        let imm4 = (imm16 >> 12) & 0xF;
7578        let i_bit = (imm16 >> 11) & 1;
7579        let imm3 = (imm16 >> 8) & 0x7;
7580        let imm8 = imm16 & 0xFF;
7581
7582        let hw1: u16 = (0xF240 | (i_bit << 10) | imm4) as u16;
7583        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7584
7585        let mut bytes = hw1.to_le_bytes().to_vec();
7586        bytes.extend_from_slice(&hw2.to_le_bytes());
7587        encoding_contracts::verify_thumb32(&bytes);
7588        Ok(bytes)
7589    }
7590
7591    /// Encode Thumb-2 32-bit shift with immediate
7592    ///
7593    /// # Contract (Verus-style)
7594    /// ```text
7595    /// requires rd <= R14, rm <= R14
7596    /// ensures result.len() == 4
7597    /// ```
7598    fn encode_thumb32_shift(
7599        &self,
7600        rd: &Reg,
7601        rm: &Reg,
7602        shift: u32,
7603        shift_type: u8,
7604    ) -> Result<Vec<u8>> {
7605        let rd_bits = reg_to_bits(rd);
7606        let rm_bits = reg_to_bits(rm);
7607        reg_bits_checked(rd_bits)?;
7608        reg_bits_checked(rm_bits)?;
7609        let imm5 = shift & 0x1F;
7610        let imm2 = imm5 & 0x3;
7611        let imm3 = (imm5 >> 2) & 0x7;
7612
7613        // MOV.W Rd, Rm, <shift> #imm
7614        // EA4F 0 imm3 Rd imm2 type Rm
7615        let hw1: u16 = 0xEA4F;
7616        let hw2: u16 =
7617            ((imm3 << 12) | (rd_bits << 8) | (imm2 << 6) | ((shift_type as u32) << 4) | rm_bits)
7618                as u16;
7619
7620        let mut bytes = hw1.to_le_bytes().to_vec();
7621        bytes.extend_from_slice(&hw2.to_le_bytes());
7622        Ok(bytes)
7623    }
7624
7625    /// Encode Thumb-2 32-bit shift by register
7626    /// Encoding: 11111010 0xx0 Rn | 1111 Rd 0000 Rm
7627    /// shift_type: 00=LSL, 01=LSR, 10=ASR, 11=ROR
7628    fn encode_thumb32_shift_reg(
7629        &self,
7630        rd: &Reg,
7631        rn: &Reg,
7632        rm: &Reg,
7633        shift_type: u8,
7634    ) -> Result<Vec<u8>> {
7635        let rd_bits = reg_to_bits(rd);
7636        let rn_bits = reg_to_bits(rn);
7637        let rm_bits = reg_to_bits(rm);
7638
7639        // hw1: 1111 1010 0xx0 Rn
7640        let hw1: u16 = (0xFA00 | ((shift_type as u32) << 5) | rn_bits) as u16;
7641        // hw2: 1111 Rd 0000 Rm
7642        let hw2: u16 = (0xF000 | (rd_bits << 8) | rm_bits) as u16;
7643
7644        let mut bytes = hw1.to_le_bytes().to_vec();
7645        bytes.extend_from_slice(&hw2.to_le_bytes());
7646        Ok(bytes)
7647    }
7648
7649    /// Encode Thumb-2 32-bit CMP with immediate
7650    fn encode_thumb32_cmp_imm(&self, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7651        let rn_bits = reg_to_bits(rn);
7652
7653        // CMP.W has only the modified-immediate form (no plain-imm12 like ADDW),
7654        // so an un-encodable immediate MUST be materialized into a register by
7655        // the selector. Error rather than silently compare the wrong constant.
7656        let field = try_thumb_expand_imm(imm).ok_or_else(|| {
7657            synth_core::Error::synthesis(
7658                "CMP immediate is not a valid ThumbExpandImm — materialize into a register",
7659            )
7660        })?;
7661        let i_bit = (field >> 11) & 1;
7662        let imm3 = (field >> 8) & 0x7;
7663        let imm8 = field & 0xFF;
7664
7665        // CMP.W Rn, #imm
7666        let hw1: u16 = (0xF1B0 | (i_bit << 10) | rn_bits) as u16;
7667        let hw2: u16 = ((imm3 << 12) | 0x0F00 | imm8) as u16;
7668
7669        let mut bytes = hw1.to_le_bytes().to_vec();
7670        bytes.extend_from_slice(&hw2.to_le_bytes());
7671        Ok(bytes)
7672    }
7673
7674    /// #372/#382: resolve the base register AND residual immediate offset for an
7675    /// `I64Ldr`/`I64Str` whose address may carry an index register. Returns
7676    /// `(base, low_offset)`; the caller accesses the halves at `[base,
7677    /// #low_offset]` and `[base, #low_offset + 4]`.
7678    ///
7679    /// - Frame access (no `offset_reg`, e.g. a spilled local at `[SP, #off]`):
7680    ///   returns `(addr.base, off)` and emits NOTHING — byte-identical.
7681    /// - Memory access (`reg_imm(R11, addr, offset)` = `R11 + addr + offset`)
7682    ///   with `offset + 4 <= 0xFFF`: emits `ADD.W ip, base, index` and returns
7683    ///   `(ip, offset)`, folding `offset`/`offset+4` into the halves' imm12.
7684    ///   Byte-identical to the pre-#382 (#372) behavior.
7685    /// - Memory access with `offset + 4 > 0xFFF`: the imm12 form cannot hold the
7686    ///   high half's offset, so `encode_thumb32_ldr`'s `check_ldst_imm12` (#259)
7687    ///   rightly refused it and the WHOLE function was skipped (#382). Instead
7688    ///   MATERIALIZE the offset into the base: `ADD ip, index, #offset` (against
7689    ///   the read-only INDEX register, so `encode_thumb32_add_imm` never trips its
7690    ///   `rd==rn==R12` alias trap), then `ADD.W ip, ip, base` (+ R11), and return
7691    ///   `(ip, 0)` so the halves use `[ip, #0]` / `[ip, #4]`.
7692    ///
7693    /// The effective address is fully materialized into `ip` BEFORE the halves
7694    /// are accessed, so an `rdlo` aliasing the index register is safe.
7695    fn i64_effective_base(&self, bytes: &mut Vec<u8>, addr: &MemAddr) -> Result<(Reg, u32)> {
7696        let offset = if addr.offset < 0 {
7697            0u32
7698        } else {
7699            addr.offset as u32
7700        };
7701        match addr.offset_reg {
7702            Some(idx) => {
7703                let ip = Reg::R12;
7704                if offset.wrapping_add(4) > 0xFFF {
7705                    // Large static offset (#382): fold it (and R11) into ip so the
7706                    // imm12 halves stay in range instead of skipping the function.
7707                    // ADD ip, index, #offset  (index != ip → no add_imm alias trap)
7708                    bytes.extend_from_slice(&self.encode_thumb32_add_imm(&ip, &idx, offset)?);
7709                    // ADD.W ip, ip, base  (+ R11)
7710                    bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
7711                        reg_to_bits(&ip),
7712                        reg_to_bits(&ip),
7713                        reg_to_bits(&addr.base),
7714                    )?);
7715                    Ok((ip, 0))
7716                } else {
7717                    // ADD.W ip, addr.base, idx  (Thumb-2, byte-verified vs as)
7718                    let hw1: u16 = 0xEB00 | reg_to_bits(&addr.base) as u16;
7719                    let hw2: u16 = 0x0C00 | reg_to_bits(&idx) as u16;
7720                    bytes.extend_from_slice(&hw1.to_le_bytes());
7721                    bytes.extend_from_slice(&hw2.to_le_bytes());
7722                    Ok((ip, offset))
7723                }
7724            }
7725            None => Ok((addr.base, offset)),
7726        }
7727    }
7728
7729    /// Encode Thumb-2 32-bit LDR
7730    fn encode_thumb32_ldr(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7731        let rd_bits = reg_to_bits(rd);
7732        let base_bits = reg_to_bits(base);
7733
7734        // LDR.W Rd, [Rn, #imm12]
7735        check_ldst_imm12(offset)?;
7736        let hw1: u16 = (0xF8D0 | base_bits) as u16;
7737        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7738
7739        let mut bytes = hw1.to_le_bytes().to_vec();
7740        bytes.extend_from_slice(&hw2.to_le_bytes());
7741        Ok(bytes)
7742    }
7743
7744    /// Encode Thumb-2 32-bit STR
7745    fn encode_thumb32_str(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7746        let rd_bits = reg_to_bits(rd);
7747        let base_bits = reg_to_bits(base);
7748
7749        // STR.W Rd, [Rn, #imm12]
7750        check_ldst_imm12(offset)?;
7751        let hw1: u16 = (0xF8C0 | base_bits) as u16;
7752        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7753
7754        let mut bytes = hw1.to_le_bytes().to_vec();
7755        bytes.extend_from_slice(&hw2.to_le_bytes());
7756        Ok(bytes)
7757    }
7758
7759    /// Encode Thumb-2 32-bit LDR with register offset: LDR.W Rd, [Rn, Rm]
7760    fn encode_thumb32_ldr_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7761        let rd_bits = reg_to_bits(rd);
7762        let base_bits = reg_to_bits(base);
7763        let rm_bits = reg_to_bits(offset_reg);
7764
7765        // LDR.W Rd, [Rn, Rm, LSL #0]
7766        // Encoding: 1111 1000 0101 Rn | Rt 0000 00 imm2 Rm
7767        // imm2 = 00 for no shift (LSL #0)
7768        let hw1: u16 = (0xF850 | base_bits) as u16;
7769        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7770
7771        let mut bytes = hw1.to_le_bytes().to_vec();
7772        bytes.extend_from_slice(&hw2.to_le_bytes());
7773        Ok(bytes)
7774    }
7775
7776    /// Encode Thumb-2 32-bit STR with register offset: STR.W Rd, [Rn, Rm]
7777    fn encode_thumb32_str_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7778        let rd_bits = reg_to_bits(rd);
7779        let base_bits = reg_to_bits(base);
7780        let rm_bits = reg_to_bits(offset_reg);
7781
7782        // STR.W Rd, [Rn, Rm, LSL #0]
7783        // Encoding: 1111 1000 0100 Rn | Rt 0000 00 imm2 Rm
7784        // imm2 = 00 for no shift (LSL #0)
7785        let hw1: u16 = (0xF840 | base_bits) as u16;
7786        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7787
7788        let mut bytes = hw1.to_le_bytes().to_vec();
7789        bytes.extend_from_slice(&hw2.to_le_bytes());
7790        Ok(bytes)
7791    }
7792
7793    // === Sub-word load/store Thumb-2 encoding helpers ===
7794
7795    /// Encode Thumb-2 32-bit LDRB with immediate: LDRB.W Rd, [Rn, #imm12]
7796    fn encode_thumb32_ldrb_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7797        let rd_bits = reg_to_bits(rd);
7798        let base_bits = reg_to_bits(base);
7799        // LDRB.W Rd, [Rn, #imm12]: 1111 1000 1001 Rn | Rt imm12
7800        check_ldst_imm12(offset)?;
7801        let hw1: u16 = (0xF890 | base_bits) as u16;
7802        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7803        let mut bytes = hw1.to_le_bytes().to_vec();
7804        bytes.extend_from_slice(&hw2.to_le_bytes());
7805        Ok(bytes)
7806    }
7807
7808    /// Encode Thumb-2 32-bit LDRB with register: LDRB.W Rd, [Rn, Rm]
7809    fn encode_thumb32_ldrb_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7810        let rd_bits = reg_to_bits(rd);
7811        let base_bits = reg_to_bits(base);
7812        let rm_bits = reg_to_bits(offset_reg);
7813        // LDRB.W Rd, [Rn, Rm, LSL #0]: 1111 1000 0001 Rn | Rt 0000 00 imm2 Rm
7814        let hw1: u16 = (0xF810 | base_bits) as u16;
7815        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7816        let mut bytes = hw1.to_le_bytes().to_vec();
7817        bytes.extend_from_slice(&hw2.to_le_bytes());
7818        Ok(bytes)
7819    }
7820
7821    /// Encode Thumb-2 32-bit LDRSB with immediate: LDRSB.W Rd, [Rn, #imm12]
7822    fn encode_thumb32_ldrsb_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7823        let rd_bits = reg_to_bits(rd);
7824        let base_bits = reg_to_bits(base);
7825        // LDRSB.W Rd, [Rn, #imm12]: 1111 1001 1001 Rn | Rt imm12
7826        check_ldst_imm12(offset)?;
7827        let hw1: u16 = (0xF990 | base_bits) as u16;
7828        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7829        let mut bytes = hw1.to_le_bytes().to_vec();
7830        bytes.extend_from_slice(&hw2.to_le_bytes());
7831        Ok(bytes)
7832    }
7833
7834    /// Encode Thumb-2 32-bit LDRSB with register: LDRSB.W Rd, [Rn, Rm]
7835    fn encode_thumb32_ldrsb_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7836        let rd_bits = reg_to_bits(rd);
7837        let base_bits = reg_to_bits(base);
7838        let rm_bits = reg_to_bits(offset_reg);
7839        // LDRSB.W Rd, [Rn, Rm, LSL #0]: 1111 1001 0001 Rn | Rt 0000 00 imm2 Rm
7840        let hw1: u16 = (0xF910 | base_bits) as u16;
7841        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7842        let mut bytes = hw1.to_le_bytes().to_vec();
7843        bytes.extend_from_slice(&hw2.to_le_bytes());
7844        Ok(bytes)
7845    }
7846
7847    /// Encode Thumb-2 32-bit LDRH with immediate: LDRH.W Rd, [Rn, #imm12]
7848    fn encode_thumb32_ldrh_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7849        let rd_bits = reg_to_bits(rd);
7850        let base_bits = reg_to_bits(base);
7851        // LDRH.W Rd, [Rn, #imm12]: 1111 1000 1011 Rn | Rt imm12
7852        check_ldst_imm12(offset)?;
7853        let hw1: u16 = (0xF8B0 | base_bits) as u16;
7854        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7855        let mut bytes = hw1.to_le_bytes().to_vec();
7856        bytes.extend_from_slice(&hw2.to_le_bytes());
7857        Ok(bytes)
7858    }
7859
7860    /// Encode Thumb-2 32-bit LDRH with register: LDRH.W Rd, [Rn, Rm]
7861    fn encode_thumb32_ldrh_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7862        let rd_bits = reg_to_bits(rd);
7863        let base_bits = reg_to_bits(base);
7864        let rm_bits = reg_to_bits(offset_reg);
7865        // LDRH.W Rd, [Rn, Rm, LSL #0]: 1111 1000 0011 Rn | Rt 0000 00 imm2 Rm
7866        let hw1: u16 = (0xF830 | base_bits) as u16;
7867        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7868        let mut bytes = hw1.to_le_bytes().to_vec();
7869        bytes.extend_from_slice(&hw2.to_le_bytes());
7870        Ok(bytes)
7871    }
7872
7873    /// Encode Thumb-2 32-bit LDRSH with immediate: LDRSH.W Rd, [Rn, #imm12]
7874    fn encode_thumb32_ldrsh_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7875        let rd_bits = reg_to_bits(rd);
7876        let base_bits = reg_to_bits(base);
7877        // LDRSH.W Rd, [Rn, #imm12]: 1111 1001 1011 Rn | Rt imm12
7878        check_ldst_imm12(offset)?;
7879        let hw1: u16 = (0xF9B0 | base_bits) as u16;
7880        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7881        let mut bytes = hw1.to_le_bytes().to_vec();
7882        bytes.extend_from_slice(&hw2.to_le_bytes());
7883        Ok(bytes)
7884    }
7885
7886    /// Encode Thumb-2 32-bit LDRSH with register: LDRSH.W Rd, [Rn, Rm]
7887    fn encode_thumb32_ldrsh_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7888        let rd_bits = reg_to_bits(rd);
7889        let base_bits = reg_to_bits(base);
7890        let rm_bits = reg_to_bits(offset_reg);
7891        // LDRSH.W Rd, [Rn, Rm, LSL #0]: 1111 1001 0011 Rn | Rt 0000 00 imm2 Rm
7892        let hw1: u16 = (0xF930 | base_bits) as u16;
7893        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7894        let mut bytes = hw1.to_le_bytes().to_vec();
7895        bytes.extend_from_slice(&hw2.to_le_bytes());
7896        Ok(bytes)
7897    }
7898
7899    /// Encode Thumb-2 32-bit STRB with immediate: STRB.W Rd, [Rn, #imm12]
7900    fn encode_thumb32_strb_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7901        let rd_bits = reg_to_bits(rd);
7902        let base_bits = reg_to_bits(base);
7903        // STRB.W Rd, [Rn, #imm12]: 1111 1000 1000 Rn | Rt imm12
7904        check_ldst_imm12(offset)?;
7905        let hw1: u16 = (0xF880 | base_bits) as u16;
7906        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7907        let mut bytes = hw1.to_le_bytes().to_vec();
7908        bytes.extend_from_slice(&hw2.to_le_bytes());
7909        Ok(bytes)
7910    }
7911
7912    /// Encode Thumb-2 32-bit STRB with register: STRB.W Rd, [Rn, Rm]
7913    fn encode_thumb32_strb_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7914        let rd_bits = reg_to_bits(rd);
7915        let base_bits = reg_to_bits(base);
7916        let rm_bits = reg_to_bits(offset_reg);
7917        // STRB.W Rd, [Rn, Rm, LSL #0]: 1111 1000 0000 Rn | Rt 0000 00 imm2 Rm
7918        let hw1: u16 = (0xF800 | base_bits) as u16;
7919        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7920        let mut bytes = hw1.to_le_bytes().to_vec();
7921        bytes.extend_from_slice(&hw2.to_le_bytes());
7922        Ok(bytes)
7923    }
7924
7925    /// Encode Thumb-2 32-bit STRH with immediate: STRH.W Rd, [Rn, #imm12]
7926    fn encode_thumb32_strh_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7927        let rd_bits = reg_to_bits(rd);
7928        let base_bits = reg_to_bits(base);
7929        // STRH.W Rd, [Rn, #imm12]: 1111 1000 1010 Rn | Rt imm12
7930        check_ldst_imm12(offset)?;
7931        let hw1: u16 = (0xF8A0 | base_bits) as u16;
7932        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7933        let mut bytes = hw1.to_le_bytes().to_vec();
7934        bytes.extend_from_slice(&hw2.to_le_bytes());
7935        Ok(bytes)
7936    }
7937
7938    /// Encode Thumb-2 32-bit STRH with register: STRH.W Rd, [Rn, Rm]
7939    fn encode_thumb32_strh_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7940        let rd_bits = reg_to_bits(rd);
7941        let base_bits = reg_to_bits(base);
7942        let rm_bits = reg_to_bits(offset_reg);
7943        // STRH.W Rd, [Rn, Rm, LSL #0]: 1111 1000 0010 Rn | Rt 0000 00 imm2 Rm
7944        let hw1: u16 = (0xF820 | base_bits) as u16;
7945        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7946        let mut bytes = hw1.to_le_bytes().to_vec();
7947        bytes.extend_from_slice(&hw2.to_le_bytes());
7948        Ok(bytes)
7949    }
7950
7951    /// Encode Thumb-2 32-bit ADD with immediate: ADD.W Rd, Rn, #imm
7952    fn encode_thumb32_add_imm(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7953        let rd_bits = reg_to_bits(rd);
7954        let rn_bits = reg_to_bits(rn);
7955
7956        // In-range immediates (<= 0xFFF) delegate to `encode_thumb32_add`,
7957        // which picks the correct form per value:
7958        //   - imm <= 0xFF  -> ADD.W (T3). Its `i:imm3:imm8` field is a
7959        //     ThumbExpandImm MODIFIED immediate — raw == expanded only here.
7960        //   - 0x100..=0xFFF -> ADDW (T4, 0xF200): a PLAIN 12-bit immediate.
7961        //
7962        // #681: this function used to pack the raw value into the T3 field for
7963        // ALL imm <= 0xFFF. ThumbExpandImm(0x200) = 0 and ThumbExpandImm(0x400)
7964        // = 0x8000_0000, so every dynamic-address load/store with a static
7965        // offset in 0x100..=0xFFF silently computed a WRONG address — and in
7966        // --safety-bounds software the guard checked the intended address while
7967        // the access used the mis-encoded one (bounds bypass). Same
7968        // ThumbExpandImm raw-packing class as #253/#255, reached via #382.
7969        if imm <= 0xFFF {
7970            self.encode_thumb32_add(rd, rn, imm)
7971        } else {
7972            // Out-of-range immediate (> 0xFFF): materialize it into a scratch
7973            // register, then ADD.W Rd, Rn, scratch. This is the #180/#185
7974            // "encoder must produce a legal sequence, not assert" class — see #350.
7975            //
7976            // Scratch choice (must NEVER equal Rn, or Rn would be clobbered before
7977            // the ADD reads it):
7978            //   - rd != rn  => use rd itself (rn is untouched, since rd != rn).
7979            //   - rd == rn  => use R12/IP (the reserved encoder scratch). rd/rn are
7980            //                  never R12 (R12 is non-allocatable), so it can't alias.
7981            //
7982            // The materialized value is the same whether or not MOVT is emitted, so
7983            // the byte length depends only on `imm` (and rd==rn) — the size probe and
7984            // the final emit therefore agree (mandatory: the function is encoded twice).
7985            let scratch: u32 = if rd_bits == rn_bits {
7986                12 // R12/IP — in-place add, can't use rd because rd == rn
7987            } else {
7988                rd_bits // rn is preserved because rd != rn
7989            };
7990            // Invariant: the scratch must never alias Rn (would clobber it before
7991            // the ADD reads it). Unreachable in real codegen (rd/rn are never R12,
7992            // which is reserved encoder scratch), but the encoder is also driven by
7993            // the `encoder_no_panic` fuzz harness with ARBITRARY registers — incl.
7994            // rd==rn==R12, which makes scratch (R12) alias Rn. The encoder contract
7995            // (#180/#185) is Ok-or-Err, never a panic, so return a typed error
7996            // instead of asserting. #350 follow-up.
7997            if scratch == rn_bits {
7998                return Err(synth_core::Error::synthesis(format!(
7999                    "ADD #imm: cannot lower #{imm:#x} for Rd==Rn==R12 — no free scratch \
8000                     register (R12 is the reserved encoder scratch and aliases Rn here)"
8001                )));
8002            }
8003
8004            let lo16 = imm & 0xFFFF;
8005            let hi16 = (imm >> 16) & 0xFFFF;
8006
8007            let mut bytes = self.encode_thumb32_movw_raw(scratch, lo16)?;
8008            if hi16 != 0 {
8009                bytes.extend_from_slice(&self.encode_thumb32_movt_raw(scratch, hi16)?);
8010            }
8011            bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(rd_bits, rn_bits, scratch)?);
8012            Ok(bytes)
8013        }
8014    }
8015
8016    // === Raw encoding helpers for POPCNT (take register numbers directly) ===
8017
8018    /// Encode Thumb-2 32-bit MOVW (16-bit immediate) - raw version
8019    ///
8020    /// # Contract (Verus-style)
8021    /// ```text
8022    /// requires rd <= 14, imm16 <= 0xFFFF
8023    /// ensures result.len() == 4
8024    /// ```
8025    fn encode_thumb32_movw_raw(&self, rd: u32, imm16: u32) -> Result<Vec<u8>> {
8026        reg_bits_checked(rd)?;
8027        encoding_contracts::verify_imm16(imm16);
8028        // MOVW Rd, #imm16
8029        // 1111 0 i 10 0 1 0 0 imm4 | 0 imm3 Rd imm8
8030        let imm16 = imm16 & 0xFFFF;
8031        let imm4 = (imm16 >> 12) & 0xF;
8032        let i_bit = (imm16 >> 11) & 1;
8033        let imm3 = (imm16 >> 8) & 0x7;
8034        let imm8 = imm16 & 0xFF;
8035
8036        let hw1: u16 = (0xF240 | (i_bit << 10) | imm4) as u16;
8037        let hw2: u16 = ((imm3 << 12) | (rd << 8) | imm8) as u16;
8038
8039        let mut bytes = hw1.to_le_bytes().to_vec();
8040        bytes.extend_from_slice(&hw2.to_le_bytes());
8041        encoding_contracts::verify_thumb32(&bytes);
8042        Ok(bytes)
8043    }
8044
8045    /// Encode Thumb-2 32-bit MOVT (move top 16 bits) - raw version
8046    ///
8047    /// # Contract (Verus-style)
8048    /// ```text
8049    /// requires rd <= 14, imm16 <= 0xFFFF
8050    /// ensures result.len() == 4
8051    /// ```
8052    fn encode_thumb32_movt_raw(&self, rd: u32, imm16: u32) -> Result<Vec<u8>> {
8053        reg_bits_checked(rd)?;
8054        encoding_contracts::verify_imm16(imm16);
8055        // MOVT Rd, #imm16
8056        // 1111 0 i 10 1 1 0 0 imm4 | 0 imm3 Rd imm8
8057        let imm16 = imm16 & 0xFFFF;
8058        let imm4 = (imm16 >> 12) & 0xF;
8059        let i_bit = (imm16 >> 11) & 1;
8060        let imm3 = (imm16 >> 8) & 0x7;
8061        let imm8 = imm16 & 0xFF;
8062
8063        let hw1: u16 = (0xF2C0 | (i_bit << 10) | imm4) as u16;
8064        let hw2: u16 = ((imm3 << 12) | (rd << 8) | imm8) as u16;
8065
8066        let mut bytes = hw1.to_le_bytes().to_vec();
8067        bytes.extend_from_slice(&hw2.to_le_bytes());
8068        encoding_contracts::verify_thumb32(&bytes);
8069        Ok(bytes)
8070    }
8071
8072    /// Encode Thumb-2 32-bit LSR (logical shift right) with immediate - raw version
8073    fn encode_thumb32_lsr_raw(&self, rd: u32, rm: u32, shift: u32) -> Result<Vec<u8>> {
8074        // MOV.W Rd, Rm, LSR #imm
8075        // EA4F 0 imm3 Rd imm2 01 Rm
8076        let imm5 = shift & 0x1F;
8077        let imm2 = imm5 & 0x3;
8078        let imm3 = (imm5 >> 2) & 0x7;
8079
8080        let hw1: u16 = 0xEA4F;
8081        let hw2: u16 = ((imm3 << 12) | (rd << 8) | (imm2 << 6) | (0b01 << 4) | rm) as u16;
8082
8083        let mut bytes = hw1.to_le_bytes().to_vec();
8084        bytes.extend_from_slice(&hw2.to_le_bytes());
8085        Ok(bytes)
8086    }
8087
8088    /// Encode Thumb-2 32-bit AND (register) - raw version
8089    fn encode_thumb32_and_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8090        // AND.W Rd, Rn, Rm
8091        // EA00 Rn | 0 Rd 00 00 Rm
8092        let hw1: u16 = (0xEA00 | rn) as u16;
8093        let hw2: u16 = ((rd << 8) | rm) as u16;
8094
8095        let mut bytes = hw1.to_le_bytes().to_vec();
8096        bytes.extend_from_slice(&hw2.to_le_bytes());
8097        Ok(bytes)
8098    }
8099
8100    /// Encode Thumb-2 32-bit AND with immediate - raw version
8101    fn encode_thumb32_and_imm_raw(&self, rd: u32, rn: u32, imm: u32) -> Result<Vec<u8>> {
8102        // AND.W Rd, Rn, #<modified_immediate>
8103        // F0 00 Rn | 0 imm3 Rd imm8
8104        //
8105        // #681 class audit: the field is a ThumbExpandImm modified immediate,
8106        // not a raw value. The only current caller (POPCNT final mask) passes
8107        // 0x3F, which expands to itself — the gate is byte-identical today and
8108        // closes the raw-packing landmine for any future caller.
8109        let field = try_thumb_expand_imm(imm).ok_or_else(|| {
8110            synth_core::Error::synthesis(
8111                "AND immediate is not a valid ThumbExpandImm — materialize into a register",
8112            )
8113        })?;
8114        let i_bit = (field >> 11) & 1;
8115        let imm3 = (field >> 8) & 0x7;
8116        let imm8 = field & 0xFF;
8117
8118        let hw1: u16 = (0xF000 | (i_bit << 10) | rn) as u16;
8119        let hw2: u16 = ((imm3 << 12) | (rd << 8) | imm8) as u16;
8120
8121        let mut bytes = hw1.to_le_bytes().to_vec();
8122        bytes.extend_from_slice(&hw2.to_le_bytes());
8123        Ok(bytes)
8124    }
8125
8126    /// Encode Thumb-2 32-bit SUB (register) - raw version
8127    fn encode_thumb32_sub_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8128        // SUB.W Rd, Rn, Rm
8129        // EBA0 Rn | 0 Rd 00 00 Rm
8130        let hw1: u16 = (0xEBA0 | rn) as u16;
8131        let hw2: u16 = ((rd << 8) | rm) as u16;
8132
8133        let mut bytes = hw1.to_le_bytes().to_vec();
8134        bytes.extend_from_slice(&hw2.to_le_bytes());
8135        Ok(bytes)
8136    }
8137
8138    /// Encode Thumb-2 32-bit ADD (register) - raw version
8139    fn encode_thumb32_add_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8140        // ADD.W Rd, Rn, Rm
8141        // EB00 Rn | 0 Rd 00 00 Rm
8142        let hw1: u16 = (0xEB00 | rn) as u16;
8143        let hw2: u16 = ((rd << 8) | rm) as u16;
8144
8145        let mut bytes = hw1.to_le_bytes().to_vec();
8146        bytes.extend_from_slice(&hw2.to_le_bytes());
8147        Ok(bytes)
8148    }
8149
8150    /// Encode Thumb-2 32-bit ADDS (register, flag-setting) - raw version.
8151    /// Used as the high-register fallback for `ArmOp::Adds` (i64 low-word add)
8152    /// so R8-R11 pair operands don't overflow the 16-bit field — #178/#180.
8153    fn encode_thumb32_adds_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8154        // ADDS.W Rd, Rn, Rm (T3, S=1): EB10 Rn | 0 Rd 00 00 Rm
8155        let hw1: u16 = (0xEB10 | rn) as u16;
8156        let hw2: u16 = ((rd << 8) | rm) as u16;
8157        let mut bytes = hw1.to_le_bytes().to_vec();
8158        bytes.extend_from_slice(&hw2.to_le_bytes());
8159        Ok(bytes)
8160    }
8161
8162    /// Encode Thumb-2 32-bit SUBS (register, flag-setting) - raw version.
8163    /// High-register fallback for `ArmOp::Subs` (i64 low-word subtract) — #178/#180.
8164    fn encode_thumb32_subs_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8165        // SUBS.W Rd, Rn, Rm (T3, S=1): EBB0 Rn | 0 Rd 00 00 Rm
8166        let hw1: u16 = (0xEBB0 | rn) as u16;
8167        let hw2: u16 = ((rd << 8) | rm) as u16;
8168        let mut bytes = hw1.to_le_bytes().to_vec();
8169        bytes.extend_from_slice(&hw2.to_le_bytes());
8170        Ok(bytes)
8171    }
8172
8173    /// Encode a sequence of ARM instructions
8174    pub fn encode_sequence(&self, ops: &[ArmOp]) -> Result<Vec<u8>> {
8175        let mut code = Vec::new();
8176
8177        for op in ops {
8178            let encoded = self.encode(op)?;
8179            code.extend_from_slice(&encoded);
8180        }
8181
8182        Ok(code)
8183    }
8184}
8185
8186/// Convert register to bit encoding (0-15)
8187/// Reverse of the ARMv7-M `ThumbExpandImm`: given a 32-bit immediate, return the
8188/// 12-bit `i:imm3:imm8` field if it is a representable modified immediate, else
8189/// `None` (the caller must materialize the value into a register). This is the
8190/// shared correct path for the data-processing immediate encoders — without it
8191/// they pack raw bits and silently mis-encode any value `> 0xFF` that isn't a
8192/// modified immediate (the silent-miscompile class behind #251/#253/#255).
8193fn try_thumb_expand_imm(value: u32) -> Option<u32> {
8194    // i:imm3 = 0000 → 8-bit value, zero-extended (00000000 00000000 00000000 XY).
8195    if value <= 0xFF {
8196        return Some(value);
8197    }
8198    let b0 = value & 0xFF; // byte 0
8199    let b1 = (value >> 8) & 0xFF; // byte 1
8200    // 0x00XY00XY (i:imm3 = 0001) — XY in bytes 0 and 2
8201    if value == (b0 << 16) | b0 {
8202        return Some(0x100 | b0);
8203    }
8204    // 0xXY00XY00 (i:imm3 = 0010) — XY in bytes 1 and 3
8205    if value == (b1 << 24) | (b1 << 8) {
8206        return Some(0x200 | b1);
8207    }
8208    // 0xXYXYXYXY (i:imm3 = 0011) — XY in all four bytes
8209    if value == (b0 << 24) | (b0 << 16) | (b0 << 8) | b0 {
8210        return Some(0x300 | b0);
8211    }
8212    // An 8-bit value with bit 7 set, rotated right by 8..=31. `rotate_left(rot)`
8213    // undoes the encoded right rotation; if the result is `1bbbbbbb` (0x80..=0xFF)
8214    // the value is representable. imm12[11:7] = rot, imm12[6:0] = low 7 bits.
8215    for rot in 8..=31u32 {
8216        let unrot = value.rotate_left(rot);
8217        if (0x80..=0xFF).contains(&unrot) {
8218            return Some((rot << 7) | (unrot & 0x7F));
8219        }
8220    }
8221    None
8222}
8223
8224/// Guard a Thumb-2 `LDR/STR Rd, [Rn, #imm12]` offset. The imm12 form supports
8225/// `0..=4095`; a larger offset must be materialized into a register by the
8226/// selector (register-offset addressing). Returning `Err` rather than silently
8227/// masking `offset & 0xFFF` closes the wrong-address miscompile class (#259,
8228/// the load/store sibling of #253/#255).
8229fn check_ldst_imm12(offset: u32) -> Result<()> {
8230    if offset > 0xFFF {
8231        Err(synth_core::Error::synthesis(
8232            "load/store immediate offset > 0xFFF (4095) — materialize the offset into a register",
8233        ))
8234    } else {
8235        Ok(())
8236    }
8237}
8238
8239fn reg_to_bits(reg: &Reg) -> u32 {
8240    match reg {
8241        Reg::R0 => 0,
8242        Reg::R1 => 1,
8243        Reg::R2 => 2,
8244        Reg::R3 => 3,
8245        Reg::R4 => 4,
8246        Reg::R5 => 5,
8247        Reg::R6 => 6,
8248        Reg::R7 => 7,
8249        Reg::R8 => 8,
8250        Reg::R9 => 9,
8251        Reg::R10 => 10,
8252        Reg::R11 => 11,
8253        Reg::R12 => 12,
8254        Reg::SP => 13,
8255        Reg::LR => 14,
8256        Reg::PC => 15,
8257    }
8258}
8259
8260// ======================================================================
8261// #610 — i64 fixed-ABI expansion wrappers.
8262//
8263// The hand-written multi-instruction i64 cores (rotl/rotr and the div/rem
8264// shift-subtract loops) compute in FIXED low registers. Before #610 the
8265// div/rem arms ignored their operand fields outright (hardcoded R0:R1 /
8266// R2:R3 in, result to R0:R1) and the rot arms used R3/R4 scratch that
8267// collided with selector-assigned registers — then restored the saved
8268// scratch OVER the result (`POP {R4}` with rd_lo == R4), so the op
8269// returned the caller's stale register: 0 for every input under qemu.
8270//
8271// These wrappers make each core honor its register parameters:
8272//   1. save R0-R3,
8273//   2. marshal the operand registers into the core's fixed input regs via
8274//      the stack (permutation-safe: every source is read before any fixed
8275//      register is written),
8276//   3. run the fixed-reg core (self-preserving for R4+; R12 is encoder
8277//      scratch and never allocatable, #212),
8278//   4. MOV the result pair from R0:R1 into the selector's rd pair,
8279//   5. restore R0-R3, skipping any register the result now occupies.
8280//
8281// All emitted lengths are register-independent so the optimized path's
8282// byte-size estimator (`estimate_arm_byte_size`, pinned by the
8283// estimator↔encoder agreement oracle #498/#511) stays a constant per op.
8284// ======================================================================
8285
8286/// Steps 1+2: `PUSH {R0-R3}`, then marshal `srcs` (operand registers, any of
8287/// R0-R12) into `R0..R<n>` via individual stack pushes. Sources are all read
8288/// before any destination register is written, so arbitrary source/target
8289/// permutations (including operands living in R0-R3) are safe.
8290fn emit_i64_fixed_abi_entry(bytes: &mut Vec<u8>, srcs: &[&Reg]) {
8291    debug_assert!(srcs.len() <= 4);
8292    // PUSH {R0-R3} — save the caller-visible low registers.
8293    bytes.extend_from_slice(&0xB40Fu16.to_le_bytes());
8294    // STR src, [SP, #-4]! — push in reverse so srcs[0] ends up on top.
8295    for src in srcs.iter().rev() {
8296        let rt = reg_to_bits(src) as u16;
8297        bytes.extend_from_slice(&0xF84Du16.to_le_bytes());
8298        bytes.extend_from_slice(&((rt << 12) | 0x0D04).to_le_bytes());
8299    }
8300    // POP {Ri} — Ri := srcs[i].
8301    for i in 0..srcs.len() as u16 {
8302        bytes.extend_from_slice(&(0xBC00u16 | (1u16 << i)).to_le_bytes());
8303    }
8304}
8305
8306/// Steps 4+5: move the core's R0:R1 result into the selector's rd pair, then
8307/// restore the R0-R3 saved by [`emit_i64_fixed_abi_entry`], skipping any
8308/// register the result now lives in (its saved caller word is discarded).
8309fn emit_i64_fixed_abi_exit(bytes: &mut Vec<u8>, rdlo: &Reg, rdhi: &Reg) -> Result<()> {
8310    let lo = reg_to_bits(rdlo);
8311    let hi = reg_to_bits(rdhi);
8312    if lo == 1 && hi == 0 {
8313        // A fully swapped pair would clobber one half in either MOV order.
8314        // Selector pairs are consecutive (lo, lo+1), so this cannot occur.
8315        return Err(synth_core::Error::synthesis(
8316            "i64 expansion: swapped result pair (rd_lo=R1, rd_hi=R0) is unsupported (#610)",
8317        ));
8318    }
8319    let mov16 = |bytes: &mut Vec<u8>, rd: u32, rm: u32| {
8320        let d = ((rd >> 3) & 1) as u16;
8321        bytes.extend_from_slice(
8322            &(0x4600u16 | (d << 7) | ((rm as u16) << 3) | ((rd & 7) as u16)).to_le_bytes(),
8323        );
8324    };
8325    if hi == 0 {
8326        // rd_hi is R0: read R0 into rd_lo BEFORE overwriting R0 with R1.
8327        mov16(bytes, lo, 0);
8328        mov16(bytes, hi, 1);
8329    } else {
8330        // rd_lo may be R1: read R1 into rd_hi BEFORE overwriting R1 with R0.
8331        mov16(bytes, hi, 1);
8332        mov16(bytes, lo, 0);
8333    }
8334    for i in 0..4u32 {
8335        if i == lo || i == hi {
8336            // The result lives here — drop the saved caller word.
8337            bytes.extend_from_slice(&0xB001u16.to_le_bytes()); // ADD SP, #4
8338        } else {
8339            bytes.extend_from_slice(&(0xBC00u16 | (1u16 << i)).to_le_bytes()); // POP {Ri}
8340        }
8341    }
8342    Ok(())
8343}
8344
8345/// WASM `i64.div_*` / `i64.rem_*` by zero must trap, matching the i32 path's
8346/// cmp/bne/udf guard. Emitted after marshaling, when the divisor pair is in
8347/// R2:R3: `ORRS R12, R2, R3` — `BNE` over a `UDF #0` when nonzero.
8348fn emit_i64_divisor_zero_trap(bytes: &mut Vec<u8>) {
8349    bytes.extend_from_slice(&0xEA52u16.to_le_bytes()); // ORRS.W R12, R2, R3
8350    bytes.extend_from_slice(&0x0C03u16.to_le_bytes());
8351    bytes.extend_from_slice(&0xD100u16.to_le_bytes()); // BNE.N +0 (skip the UDF)
8352    bytes.extend_from_slice(&0xDE00u16.to_le_bytes()); // UDF #0 — divide by zero
8353}
8354
8355/// WASM `i64.div_s(INT64_MIN, -1)` must trap (Core §4.3.2 `idiv_s`: the
8356/// quotient +2^63 is unrepresentable), matching the i32 path's overflow
8357/// guard — #633: without it the core negated INT64_MIN onto itself and
8358/// silently returned INT64_MIN. Emitted after marshaling, when the dividend
8359/// pair is in R0:R1 and the divisor pair in R2:R3; R12 is encoder scratch.
8360///
8361/// div_s ONLY — `i64.rem_s(INT64_MIN, -1)` is defined as 0 and must NOT
8362/// trap (`irem_s`), so the I64RemS arm never calls this. 22 bytes,
8363/// register-independent (estimator contract, #498/#511).
8364fn emit_i64_divs_overflow_trap(bytes: &mut Vec<u8>) {
8365    // AND.W R12, R2, R3 — R12 == 0xFFFFFFFF iff divisor == -1
8366    bytes.extend_from_slice(&0xEA02u16.to_le_bytes());
8367    bytes.extend_from_slice(&0x0C03u16.to_le_bytes());
8368    // CMN.W R12, #1 — EQ iff both divisor words are all-ones
8369    bytes.extend_from_slice(&0xF11Cu16.to_le_bytes());
8370    bytes.extend_from_slice(&0x0F01u16.to_le_bytes());
8371    // BNE .no_trap
8372    bytes.extend_from_slice(&0xD105u16.to_le_bytes());
8373    // CMP R0, #0 — dividend lo word of INT64_MIN
8374    bytes.extend_from_slice(&0x2800u16.to_le_bytes());
8375    // BNE .no_trap
8376    bytes.extend_from_slice(&0xD103u16.to_le_bytes());
8377    // CMP.W R1, #0x80000000 — dividend hi word of INT64_MIN
8378    bytes.extend_from_slice(&0xF1B1u16.to_le_bytes());
8379    bytes.extend_from_slice(&0x4F00u16.to_le_bytes());
8380    // BNE .no_trap
8381    bytes.extend_from_slice(&0xD100u16.to_le_bytes());
8382    // UDF #0 — signed-division overflow
8383    bytes.extend_from_slice(&0xDE00u16.to_le_bytes());
8384    // .no_trap:
8385}
8386
8387// ======================================================================
8388// #615 — A32 (ARM-mode) twins of the #610 i64 fixed-ABI wrappers above.
8389// Identical register contract, A32 encodings: the multi-instruction i64
8390// cores (rotl/rotr, div/rem) compute in fixed low registers (value/dividend
8391// R0:R1, amount R2 / divisor R2:R3, result to R0:R1); the wrappers marshal
8392// the selector-assigned operand registers in and the result out, saving and
8393// restoring the caller-visible R0-R3 around the core.
8394// ======================================================================
8395
8396/// A32 steps 1+2: `STMDB SP!, {R0-R3}`, then marshal `srcs` into `R0..R<n>`
8397/// via individual stack pushes (`STR src, [SP, #-4]!` in reverse order, then
8398/// `LDR Ri, [SP], #4`). Every source is read before any fixed register is
8399/// written, so arbitrary source/target permutations are safe.
8400fn emit_a32_i64_fixed_abi_entry(bytes: &mut Vec<u8>, srcs: &[&Reg]) {
8401    debug_assert!(srcs.len() <= 4);
8402    let w = |bytes: &mut Vec<u8>, word: u32| bytes.extend_from_slice(&word.to_le_bytes());
8403    // PUSH {R0-R3} — save the caller-visible low registers.
8404    w(bytes, 0xE92D_000F);
8405    // STR src, [SP, #-4]! — push in reverse so srcs[0] ends up on top.
8406    for src in srcs.iter().rev() {
8407        w(bytes, 0xE52D_0004 | (reg_to_bits(src) << 12));
8408    }
8409    // LDR Ri, [SP], #4 — Ri := srcs[i].
8410    for i in 0..srcs.len() as u32 {
8411        w(bytes, 0xE49D_0004 | (i << 12));
8412    }
8413}
8414
8415/// A32 steps 4+5: move the core's R0:R1 result into the selector's rd pair,
8416/// then restore the R0-R3 saved by [`emit_a32_i64_fixed_abi_entry`], skipping
8417/// any register the result now lives in (its saved caller word is discarded).
8418fn emit_a32_i64_fixed_abi_exit(bytes: &mut Vec<u8>, rdlo: &Reg, rdhi: &Reg) -> Result<()> {
8419    let lo = reg_to_bits(rdlo);
8420    let hi = reg_to_bits(rdhi);
8421    if lo == 1 && hi == 0 {
8422        // A fully swapped pair would clobber one half in either MOV order.
8423        // Selector pairs are consecutive (lo, lo+1), so this cannot occur.
8424        return Err(synth_core::Error::synthesis(
8425            "i64 expansion: swapped result pair (rd_lo=R1, rd_hi=R0) is unsupported (#610)",
8426        ));
8427    }
8428    let w = |bytes: &mut Vec<u8>, word: u32| bytes.extend_from_slice(&word.to_le_bytes());
8429    let mov = |bytes: &mut Vec<u8>, rd: u32, rm: u32| w(bytes, 0xE1A0_0000 | (rd << 12) | rm);
8430    if hi == 0 {
8431        // rd_hi is R0: read R0 into rd_lo BEFORE overwriting R0 with R1.
8432        mov(bytes, lo, 0);
8433        mov(bytes, hi, 1);
8434    } else {
8435        // rd_lo may be R1: read R1 into rd_hi BEFORE overwriting R1 with R0.
8436        mov(bytes, hi, 1);
8437        mov(bytes, lo, 0);
8438    }
8439    for i in 0..4u32 {
8440        if i == lo || i == hi {
8441            // The result lives here — drop the saved caller word.
8442            w(bytes, 0xE28D_D004); // ADD SP, SP, #4
8443        } else {
8444            w(bytes, 0xE49D_0004 | (i << 12)); // LDR Ri, [SP], #4
8445        }
8446    }
8447    Ok(())
8448}
8449
8450/// A32 zero-divisor trap, emitted after marshaling when the divisor pair is
8451/// in R2:R3: `ORRS R12, R2, R3` sets Z iff the divisor is zero; `BNE` skips a
8452/// `UDF #0` (WASM div/rem-by-zero must trap, matching the Thumb-2 twin).
8453fn emit_a32_i64_divisor_zero_trap(bytes: &mut Vec<u8>) {
8454    let w = |bytes: &mut Vec<u8>, word: u32| bytes.extend_from_slice(&word.to_le_bytes());
8455    w(bytes, 0xE192_C003); // ORRS R12, R2, R3
8456    w(bytes, 0x1A00_0000); // BNE +1 insn (skip the UDF)
8457    w(bytes, 0xE7F0_00F0); // UDF #0 — divide by zero
8458}
8459
8460/// A32 twin of [`emit_i64_divs_overflow_trap`] (#633): trap on
8461/// `i64.div_s(INT64_MIN, -1)`. Conditional execution replaces the Thumb
8462/// branches — the CMPEQ chain leaves EQ set only when divisor == -1 AND
8463/// dividend == INT64_MIN. div_s only; rem_s must keep returning 0.
8464fn emit_a32_i64_divs_overflow_trap(bytes: &mut Vec<u8>) {
8465    let w = |bytes: &mut Vec<u8>, word: u32| bytes.extend_from_slice(&word.to_le_bytes());
8466    w(bytes, 0xE002_C003); // AND   R12, R2, R3 (== 0xFFFFFFFF iff divisor == -1)
8467    w(bytes, 0xE37C_0001); // CMN   R12, #1     (EQ iff divisor == -1)
8468    w(bytes, 0x0350_0000); // CMPEQ R0, #0      (EQ iff also dividend lo == 0)
8469    w(bytes, 0x0351_0102); // CMPEQ R1, #0x80000000 (EQ iff dividend == INT64_MIN)
8470    w(bytes, 0x1A00_0000); // BNE +1 insn (skip the UDF)
8471    w(bytes, 0xE7F0_00F0); // UDF #0 — signed-division overflow
8472}
8473
8474/// Fallible form of the `verify_reg_bits` contract. PC (R15) is not a valid
8475/// data operand for the Thumb-2 encodings that use this guard (SDIV/UDIV/MLS/…
8476/// are UNPREDICTABLE with PC). Synth's own codegen never emits PC there, but
8477/// the encoder must stay *total* over arbitrary `ArmOp` inputs — the fuzz
8478/// harness (`encoder_no_panic`) requires Ok-or-Err, never a panic. Pre-fix, the
8479/// `debug_assert` in `verify_reg_bits` aborted under `-Cdebug-assertions`.
8480/// Returns a typed Err instead. See #185.
8481fn reg_bits_checked(bits: u32) -> Result<()> {
8482    if bits > 14 {
8483        return Err(synth_core::Error::synthesis(format!(
8484            "register bits {bits} (PC/R15) is not a valid operand for this Thumb-2 encoding"
8485        )));
8486    }
8487    Ok(())
8488}
8489
8490/// Try to encode a 32-bit value as an ARM rotated immediate (imm8 ROR 2*rot4).
8491/// Returns Some((encoded_bits, 1)) if representable, None otherwise.
8492fn try_encode_rotated_imm(val: u32) -> Option<(u32, u32)> {
8493    if val == 0 {
8494        return Some((0, 1));
8495    }
8496    for rot in 0..16u32 {
8497        let shift = rot * 2;
8498        // Rotate left by shift (undo the ROR) to see if result fits in 8 bits
8499        let unrotated = val.rotate_left(shift);
8500        if unrotated <= 0xFF {
8501            // Encoded as: rot4(4 bits) | imm8(8 bits) = rotate_imm << 8 | imm8
8502            return Some(((rot << 8) | unrotated, 1));
8503        }
8504    }
8505    None
8506}
8507
8508/// Encode operand2 field and return (bits, immediate_flag).
8509/// For ARM32 mode, immediates use the rotated-immediate encoding (imm8 ROR 2*rot4).
8510/// Panics if an immediate value cannot be represented. Callers that need large
8511/// immediates should use MOVW/MOVT instead of Operand2::Imm.
8512fn encode_operand2(op2: &Operand2) -> Result<(u32, u32)> {
8513    match op2 {
8514        Operand2::Imm(val) => {
8515            let uval = *val as u32;
8516            // Attempt rotated-immediate encoding (ARM32 Operand2)
8517            if let Some(encoded) = try_encode_rotated_imm(uval) {
8518                Ok(encoded)
8519            } else {
8520                // #378-class honesty: an immediate that can't be expressed as an
8521                // ARM32 rotated immediate is an INTERNAL selector bug — large
8522                // constants must be materialized via MOVW/MOVT, not passed here.
8523                // FAIL HONESTLY with an Err rather than silently masking to
8524                // `uval & 0xFF` and emitting a WRONG immediate. The encoder is
8525                // Ok-or-Err, never corrupt (#180/#185); a loud Err is also why
8526                // this is an Err and not a panic (the `encoder_no_panic` fuzz
8527                // contract — malformed/oversized input must degrade, not crash).
8528                Err(synth_core::Error::synthesis(format!(
8529                    "encode_operand2: immediate {uval:#x} ({val}) is not an ARM32 \
8530                     rotated immediate — the selector must materialize large \
8531                     constants via MOVW/MOVT"
8532                )))
8533            }
8534        }
8535
8536        Operand2::Reg(reg) => {
8537            let reg_bits = reg_to_bits(reg);
8538            Ok((reg_bits, 0)) // I=0 for register
8539        }
8540
8541        Operand2::RegShift {
8542            rm,
8543            shift: _,
8544            amount,
8545        } => {
8546            // Simplified encoding with shift
8547            let rm_bits = reg_to_bits(rm);
8548            let shift_bits = (*amount & 0x1F) << 7;
8549            Ok((shift_bits | rm_bits, 0))
8550        }
8551    }
8552}
8553
8554/// Encode memory address to (base_reg, offset)
8555fn encode_mem_addr(addr: &MemAddr) -> (u32, u32) {
8556    let base_bits = reg_to_bits(&addr.base);
8557    let offset_bits = (addr.offset as u32) & 0xFFF; // 12-bit offset
8558    (base_bits, offset_bits)
8559}
8560
8561/// S-register number: S0=0, S1=1, ..., S31=31
8562fn vfp_sreg_to_num(reg: &VfpReg) -> Result<u32> {
8563    match reg {
8564        VfpReg::S0 => Ok(0),
8565        VfpReg::S1 => Ok(1),
8566        VfpReg::S2 => Ok(2),
8567        VfpReg::S3 => Ok(3),
8568        VfpReg::S4 => Ok(4),
8569        VfpReg::S5 => Ok(5),
8570        VfpReg::S6 => Ok(6),
8571        VfpReg::S7 => Ok(7),
8572        VfpReg::S8 => Ok(8),
8573        VfpReg::S9 => Ok(9),
8574        VfpReg::S10 => Ok(10),
8575        VfpReg::S11 => Ok(11),
8576        VfpReg::S12 => Ok(12),
8577        VfpReg::S13 => Ok(13),
8578        VfpReg::S14 => Ok(14),
8579        VfpReg::S15 => Ok(15),
8580        VfpReg::S16 => Ok(16),
8581        VfpReg::S17 => Ok(17),
8582        VfpReg::S18 => Ok(18),
8583        VfpReg::S19 => Ok(19),
8584        VfpReg::S20 => Ok(20),
8585        VfpReg::S21 => Ok(21),
8586        VfpReg::S22 => Ok(22),
8587        VfpReg::S23 => Ok(23),
8588        VfpReg::S24 => Ok(24),
8589        VfpReg::S25 => Ok(25),
8590        VfpReg::S26 => Ok(26),
8591        VfpReg::S27 => Ok(27),
8592        VfpReg::S28 => Ok(28),
8593        VfpReg::S29 => Ok(29),
8594        VfpReg::S30 => Ok(30),
8595        VfpReg::S31 => Ok(31),
8596        // D-registers are not used in F32 single-precision encodings
8597        _ => Err(synth_core::Error::SynthesisError(
8598            "D-register not supported in single-precision VFP encoding".to_string(),
8599        )),
8600    }
8601}
8602
8603/// D-register number: D0=0, D1=1, ..., D15=15
8604fn vfp_dreg_to_num(reg: &VfpReg) -> Result<u32> {
8605    match reg {
8606        VfpReg::D0 => Ok(0),
8607        VfpReg::D1 => Ok(1),
8608        VfpReg::D2 => Ok(2),
8609        VfpReg::D3 => Ok(3),
8610        VfpReg::D4 => Ok(4),
8611        VfpReg::D5 => Ok(5),
8612        VfpReg::D6 => Ok(6),
8613        VfpReg::D7 => Ok(7),
8614        VfpReg::D8 => Ok(8),
8615        VfpReg::D9 => Ok(9),
8616        VfpReg::D10 => Ok(10),
8617        VfpReg::D11 => Ok(11),
8618        VfpReg::D12 => Ok(12),
8619        VfpReg::D13 => Ok(13),
8620        VfpReg::D14 => Ok(14),
8621        VfpReg::D15 => Ok(15),
8622        // S-registers are not used in F64 double-precision encodings
8623        _ => Err(synth_core::Error::SynthesisError(
8624            "S-register not supported in double-precision VFP encoding".to_string(),
8625        )),
8626    }
8627}
8628
8629/// Split S-register into (Vx[3:0], qualifier_bit) for VFP encoding.
8630/// For an S-register number s: Vx = s >> 1, qualifier = s & 1.
8631/// The qualifier bit goes to D (bit 22), N (bit 7), or M (bit 5) depending on role.
8632fn encode_sreg(s: u32) -> (u32, u32) {
8633    (s >> 1, s & 1)
8634}
8635
8636/// Split D-register into (Vx[3:0], qualifier_bit) for VFP double-precision encoding.
8637/// For a D-register number d: Vx = d & 0xF, qualifier = (d >> 4) & 1.
8638/// For D0-D15, qualifier is always 0.
8639fn encode_dreg(d: u32) -> (u32, u32) {
8640    (d & 0xF, (d >> 4) & 1)
8641}
8642
8643/// Encode a VFP 3-register arithmetic instruction (VADD.F32, VSUB.F32, VMUL.F32, VDIV.F32).
8644/// Returns the full 32-bit instruction word.
8645///
8646/// VFP encoding: [cond 1110] [D opc1 Vn] [Vd 101 sz] [N opc2 M 0 Vm]
8647/// For single-precision (sz=0), coprocessor = 0xA (bits[11:8]).
8648fn encode_vfp_3reg(base: u32, sd: &VfpReg, sn: &VfpReg, sm: &VfpReg) -> Result<u32> {
8649    let sd_num = vfp_sreg_to_num(sd)?;
8650    let sn_num = vfp_sreg_to_num(sn)?;
8651    let sm_num = vfp_sreg_to_num(sm)?;
8652    let (vd, d) = encode_sreg(sd_num);
8653    let (vn, n) = encode_sreg(sn_num);
8654    let (vm, m) = encode_sreg(sm_num);
8655
8656    Ok(base | (d << 22) | (vn << 16) | (vd << 12) | (n << 7) | (m << 5) | vm)
8657}
8658
8659/// Encode a VFP 2-register instruction (VNEG.F32, VABS.F32, VSQRT.F32).
8660/// Returns the full 32-bit instruction word.
8661fn encode_vfp_2reg(base: u32, sd: &VfpReg, sm: &VfpReg) -> Result<u32> {
8662    let sd_num = vfp_sreg_to_num(sd)?;
8663    let sm_num = vfp_sreg_to_num(sm)?;
8664    let (vd, d) = encode_sreg(sd_num);
8665    let (vm, m) = encode_sreg(sm_num);
8666
8667    Ok(base | (d << 22) | (vd << 12) | (m << 5) | vm)
8668}
8669
8670/// Encode a VFP load/store (VLDR.F32 / VSTR.F32).
8671/// offset is in bytes and must be word-aligned; encoded as imm8 = offset/4.
8672/// U bit (bit 23) controls add/subtract offset.
8673fn encode_vfp_ldst(base: u32, sd: &VfpReg, addr: &MemAddr) -> Result<u32> {
8674    let sd_num = vfp_sreg_to_num(sd)?;
8675    let (vd, d) = encode_sreg(sd_num);
8676    let rn = reg_to_bits(&addr.base);
8677
8678    let offset = addr.offset;
8679    let u_bit = if offset >= 0 { 1u32 } else { 0u32 };
8680    let abs_offset = offset.unsigned_abs();
8681    let imm8 = (abs_offset / 4) & 0xFF;
8682
8683    Ok(base | (u_bit << 23) | (d << 22) | (rn << 16) | (vd << 12) | imm8)
8684}
8685
8686/// Encode VMOV between core register and S-register.
8687/// VMOV Sn, Rt: 0xEE00_0A10 | (Vn << 16) | (N << 7) | (Rt << 12)
8688/// VMOV Rt, Sn: 0xEE10_0A10 | (Vn << 16) | (N << 7) | (Rt << 12)
8689fn encode_vmov_core_sreg(to_sreg: bool, sreg: &VfpReg, core: &Reg) -> Result<u32> {
8690    let s_num = vfp_sreg_to_num(sreg)?;
8691    let (vn, n) = encode_sreg(s_num);
8692    let rt = reg_to_bits(core);
8693
8694    let base = if to_sreg { 0xEE000A10 } else { 0xEE100A10 };
8695    Ok(base | (vn << 16) | (rt << 12) | (n << 7))
8696}
8697
8698/// Encode a VFP 3-register double-precision instruction (VADD.F64, VSUB.F64, etc.).
8699/// For double-precision (sz=1), coprocessor = 0xB (bits[11:8]).
8700/// The base should have bit 8 = 1 for F64 (0xB suffix instead of 0xA).
8701fn encode_vfp_3reg_f64(base: u32, dd: &VfpReg, dn: &VfpReg, dm: &VfpReg) -> Result<u32> {
8702    let dd_num = vfp_dreg_to_num(dd)?;
8703    let dn_num = vfp_dreg_to_num(dn)?;
8704    let dm_num = vfp_dreg_to_num(dm)?;
8705    let (vd, d) = encode_dreg(dd_num);
8706    let (vn, n) = encode_dreg(dn_num);
8707    let (vm, m) = encode_dreg(dm_num);
8708
8709    Ok(base | (d << 22) | (vn << 16) | (vd << 12) | (n << 7) | (m << 5) | vm)
8710}
8711
8712/// Encode a VFP 2-register double-precision instruction (VNEG.F64, VABS.F64, VSQRT.F64).
8713fn encode_vfp_2reg_f64(base: u32, dd: &VfpReg, dm: &VfpReg) -> Result<u32> {
8714    let dd_num = vfp_dreg_to_num(dd)?;
8715    let dm_num = vfp_dreg_to_num(dm)?;
8716    let (vd, d) = encode_dreg(dd_num);
8717    let (vm, m) = encode_dreg(dm_num);
8718
8719    Ok(base | (d << 22) | (vd << 12) | (m << 5) | vm)
8720}
8721
8722/// Encode a VFP load/store for double-precision (VLDR.64 / VSTR.64).
8723/// offset is in bytes and must be word-aligned; encoded as imm8 = offset/4.
8724fn encode_vfp_ldst_f64(base: u32, dd: &VfpReg, addr: &MemAddr) -> Result<u32> {
8725    let dd_num = vfp_dreg_to_num(dd)?;
8726    let (vd, d) = encode_dreg(dd_num);
8727    let rn = reg_to_bits(&addr.base);
8728
8729    let offset = addr.offset;
8730    let u_bit = if offset >= 0 { 1u32 } else { 0u32 };
8731    let abs_offset = offset.unsigned_abs();
8732    let imm8 = (abs_offset / 4) & 0xFF;
8733
8734    Ok(base | (u_bit << 23) | (d << 22) | (rn << 16) | (vd << 12) | imm8)
8735}
8736
8737/// Encode VMOV between two core registers and a D-register.
8738/// VMOV Dm, Rt, Rt2: 0xEC40_0B10 | (Rt2 << 16) | (Rt << 12) | (M << 5) | Vm
8739/// VMOV Rt, Rt2, Dm: 0xEC50_0B10 | (Rt2 << 16) | (Rt << 12) | (M << 5) | Vm
8740fn encode_vmov_core_dreg(
8741    to_dreg: bool,
8742    dreg: &VfpReg,
8743    core_lo: &Reg,
8744    core_hi: &Reg,
8745) -> Result<u32> {
8746    let d_num = vfp_dreg_to_num(dreg)?;
8747    let (vm, m) = encode_dreg(d_num);
8748    let rt = reg_to_bits(core_lo);
8749    let rt2 = reg_to_bits(core_hi);
8750
8751    let base = if to_dreg { 0xEC400B10 } else { 0xEC500B10 };
8752    Ok(base | (rt2 << 16) | (rt << 12) | (m << 5) | vm)
8753}
8754
8755/// Emit a VFP 32-bit instruction as Thumb-2 bytes (two LE halfwords).
8756fn vfp_to_thumb_bytes(instr: u32) -> Vec<u8> {
8757    let hw1 = ((instr >> 16) & 0xFFFF) as u16;
8758    let hw2 = (instr & 0xFFFF) as u16;
8759    let mut bytes = hw1.to_le_bytes().to_vec();
8760    bytes.extend_from_slice(&hw2.to_le_bytes());
8761    bytes
8762}
8763
8764// ============================================================================
8765// Helium MVE encoding helpers
8766// ============================================================================
8767
8768/// Q-register number: Q0=0, Q1=1, ..., Q7=7
8769fn qreg_to_num(reg: &QReg) -> u32 {
8770    match reg {
8771        QReg::Q0 => 0,
8772        QReg::Q1 => 1,
8773        QReg::Q2 => 2,
8774        QReg::Q3 => 3,
8775        QReg::Q4 => 4,
8776        QReg::Q5 => 5,
8777        QReg::Q6 => 6,
8778        QReg::Q7 => 7,
8779    }
8780}
8781
8782/// MVE element size to encoding bits: S8=0b00, S16=0b01, S32=0b10
8783fn mve_size_bits(size: &MveSize) -> u32 {
8784    match size {
8785        MveSize::S8 => 0b00,
8786        MveSize::S16 => 0b01,
8787        MveSize::S32 => 0b10,
8788    }
8789}
8790
8791/// Encode MVE 3-register instruction.
8792/// Q-registers are encoded as D-register pairs: Q0=D0:D1, Q1=D2:D3, etc.
8793/// In NEON/MVE encoding, the Q-register uses D-register number = Qn * 2.
8794fn encode_mve_3reg(base: u32, qd: &QReg, qn: &QReg, qm: &QReg) -> u32 {
8795    let d = qreg_to_num(qd) * 2;
8796    let n = qreg_to_num(qn) * 2;
8797    let m = qreg_to_num(qm) * 2;
8798
8799    // Standard NEON/MVE 3-register encoding:
8800    // D bit (bit 22) = Vd[4], Vd[3:0] = bits [15:12]
8801    // N bit (bit 7)  = Vn[4], Vn[3:0] = bits [19:16]
8802    // M bit (bit 5)  = Vm[4], Vm[3:0] = bits [3:0]
8803    let vd = d & 0xF;
8804    let d_bit = (d >> 4) & 1;
8805    let vn = n & 0xF;
8806    let n_bit = (n >> 4) & 1;
8807    let vm = m & 0xF;
8808    let m_bit = (m >> 4) & 1;
8809
8810    base | (d_bit << 22) | (vn << 16) | (vd << 12) | (n_bit << 7) | (m_bit << 5) | vm
8811}
8812
8813/// Encode MVE 3-register bitwise instruction (VAND, VORR, VEOR, VBIC).
8814fn encode_mve_3reg_bitwise(base: u32, qd: &QReg, qn: &QReg, qm: &QReg) -> u32 {
8815    encode_mve_3reg(base, qd, qn, qm)
8816}
8817
8818/// Encode MVE VLDRW.32 Qd, [Rn, #offset]
8819/// Format: EC9x xxxx - contiguous load, word-sized elements
8820fn encode_mve_vldrw(qd: &QReg, addr: &MemAddr) -> u32 {
8821    let qd_enc = qreg_to_num(qd) * 2;
8822    let rn = reg_to_bits(&addr.base);
8823    let offset = addr.offset;
8824    let u_bit = if offset >= 0 { 1u32 } else { 0u32 };
8825    let abs_offset = offset.unsigned_abs();
8826    let imm7 = (abs_offset / 4) & 0x7F; // 7-bit word-aligned offset
8827
8828    // VLDRW.32 Qd, [Rn, #imm]: ED10 xx80 variant
8829    0xED100E80
8830        | (u_bit << 23)
8831        | ((qd_enc >> 4) << 22)
8832        | (rn << 16)
8833        | ((qd_enc & 0xF) << 12)
8834        | (imm7 & 0x7F)
8835}
8836
8837/// Encode MVE VSTRW.32 Qd, [Rn, #offset]
8838fn encode_mve_vstrw(qd: &QReg, addr: &MemAddr) -> u32 {
8839    let qd_enc = qreg_to_num(qd) * 2;
8840    let rn = reg_to_bits(&addr.base);
8841    let offset = addr.offset;
8842    let u_bit = if offset >= 0 { 1u32 } else { 0u32 };
8843    let abs_offset = offset.unsigned_abs();
8844    let imm7 = (abs_offset / 4) & 0x7F;
8845
8846    0xED000E80
8847        | (u_bit << 23)
8848        | ((qd_enc >> 4) << 22)
8849        | (rn << 16)
8850        | ((qd_enc & 0xF) << 12)
8851        | (imm7 & 0x7F)
8852}
8853
8854impl ArmEncoder {
8855    /// Encode MVE constant load: MOVW+MOVT+VMOV for each 32-bit word, then assemble Q-register
8856    fn encode_thumb_mve_const(&self, qd: &QReg, bytes: &[u8; 16]) -> Result<Vec<u8>> {
8857        let mut result = Vec::new();
8858        let qd_num = qreg_to_num(qd);
8859
8860        // Load each 32-bit word into R12 (temp) then VMOV into S-register
8861        for i in 0..4 {
8862            let word = u32::from_le_bytes([
8863                bytes[i * 4],
8864                bytes[i * 4 + 1],
8865                bytes[i * 4 + 2],
8866                bytes[i * 4 + 3],
8867            ]);
8868            let lo16 = word & 0xFFFF;
8869            let hi16 = (word >> 16) & 0xFFFF;
8870
8871            // MOVW R12, #lo16
8872            result.extend_from_slice(&self.encode_thumb32_movw_raw(12, lo16)?);
8873            // MOVT R12, #hi16
8874            if hi16 != 0 {
8875                result.extend_from_slice(&self.encode_thumb32_movt_raw(12, hi16)?);
8876            }
8877
8878            // VMOV Sn, R12 where Sn = Qd*4 + i
8879            let s_num = qd_num * 4 + i as u32;
8880            let (vn, n) = encode_sreg(s_num);
8881            let vmov: u32 = 0xEE000A10 | (vn << 16) | (12 << 12) | (n << 7);
8882            result.extend_from_slice(&vfp_to_thumb_bytes(vmov));
8883        }
8884
8885        Ok(result)
8886    }
8887
8888    /// Encode lane-wise f32 binary operation (VDIV, etc.) via S-register extraction
8889    fn encode_thumb_mve_lane_wise_f32_binop(
8890        &self,
8891        qd: &QReg,
8892        qn: &QReg,
8893        qm: &QReg,
8894        vfp_base: u32,
8895    ) -> Result<Vec<u8>> {
8896        let mut result = Vec::new();
8897        let qd_num = qreg_to_num(qd);
8898        let qn_num = qreg_to_num(qn);
8899        let qm_num = qreg_to_num(qm);
8900
8901        // For each lane 0..3: use S-registers directly (Q aliasing)
8902        for i in 0..4u32 {
8903            let sd = qd_num * 4 + i;
8904            let sn = qn_num * 4 + i;
8905            let sm = qm_num * 4 + i;
8906
8907            let (vd, d) = encode_sreg(sd);
8908            let (vn, n) = encode_sreg(sn);
8909            let (vm, m) = encode_sreg(sm);
8910
8911            let instr = vfp_base | (d << 22) | (vn << 16) | (vd << 12) | (n << 7) | (m << 5) | vm;
8912            result.extend_from_slice(&vfp_to_thumb_bytes(instr));
8913        }
8914
8915        Ok(result)
8916    }
8917
8918    /// Encode lane-wise f32 VSQRT via S-register extraction
8919    fn encode_thumb_mve_lane_wise_f32_sqrt(&self, qd: &QReg, qm: &QReg) -> Result<Vec<u8>> {
8920        let mut result = Vec::new();
8921        let qd_num = qreg_to_num(qd);
8922        let qm_num = qreg_to_num(qm);
8923
8924        // VSQRT.F32 base: 0xEEB10AC0
8925        for i in 0..4u32 {
8926            let sd = qd_num * 4 + i;
8927            let sm = qm_num * 4 + i;
8928
8929            let (vd, d) = encode_sreg(sd);
8930            let (vm, m) = encode_sreg(sm);
8931
8932            let instr: u32 = 0xEEB10AC0 | (d << 22) | (vd << 12) | (m << 5) | vm;
8933            result.extend_from_slice(&vfp_to_thumb_bytes(instr));
8934        }
8935
8936        Ok(result)
8937    }
8938}
8939
8940#[cfg(test)]
8941mod tests {
8942    use super::*;
8943
8944    #[test]
8945    fn test_encoder_creation() {
8946        let encoder_arm = ArmEncoder::new_arm32();
8947        assert!(!encoder_arm.thumb_mode);
8948
8949        let encoder_thumb = ArmEncoder::new_thumb2();
8950        assert!(encoder_thumb.thumb_mode);
8951    }
8952
8953    /// #204 WAKE-path regression: `SetCond` materialized 0/1 with the 16-bit
8954    /// `MOVS Rd,#imm` (T1), whose Rd field is 3 bits (R0–R7). For a high Rd
8955    /// (R8–R12) `rd_bits << 8` overflows bit 11, flipping the opcode MOVS→CMP
8956    /// (`0x2c00`), so the boolean was never written — gale's `has_waiter` kept a
8957    /// stale value and the binary-sem WAKE dispatch read garbage. High Rd must
8958    /// use the 32-bit `MOV.W` (T2). Verify the bytes, not the IR.
8959    /// #311: the SAME high-Rd MOVS→CMP transmutation as #204, but in the
8960    /// i64 comparison expansions (I64SetCond / I64SetCondZ) — missed by the
8961    /// #204 hardening. With rd=R8 the boolean died in the flags
8962    /// (`ite eq; cmpeq r0,#1; cmpne r0,#0`), so gale's packed-u64 select
8963    /// read a stale register on silicon. High Rd must take MOV.W / CMP.W.
8964    #[test]
8965    fn test_encode_i64setcond_high_reg_uses_mov_w_311() {
8966        use synth_synthesis::{ArmOp, Condition, Reg};
8967        let enc = ArmEncoder::new_thumb2();
8968        let bytes = enc
8969            .encode(&ArmOp::I64SetCond {
8970                rd: Reg::R8,
8971                rn_lo: Reg::R2,
8972                rn_hi: Reg::R3,
8973                rm_lo: Reg::R6,
8974                rm_hi: Reg::R7,
8975                cond: Condition::EQ,
8976            })
8977            .unwrap();
8978        // The 32-bit MOV.W immediate (T2) first halfword is 0xF04F; the
8979        // 16-bit transmuted forms would contain 0x2801/0x2800 (CMP r0,#1/#0).
8980        let halfwords: Vec<u16> = bytes
8981            .chunks(2)
8982            .map(|c| u16::from_le_bytes([c[0], c[1]]))
8983            .collect();
8984        assert!(
8985            halfwords.iter().filter(|&&h| h == 0xF04F).count() == 2,
8986            "high rd must use two MOV.W (T2) encodings, got {halfwords:04x?}"
8987        );
8988        assert!(
8989            !halfwords.contains(&0x2801) && !halfwords.contains(&0x2800),
8990            "no transmuted 16-bit CMP imm: {halfwords:04x?}"
8991        );
8992
8993        let bytes_z = enc
8994            .encode(&ArmOp::I64SetCondZ {
8995                rd: Reg::R8,
8996                rn_lo: Reg::R2,
8997                rn_hi: Reg::R3,
8998            })
8999            .unwrap();
9000        let hw_z: Vec<u16> = bytes_z
9001            .chunks(2)
9002            .map(|c| u16::from_le_bytes([c[0], c[1]]))
9003            .collect();
9004        assert!(
9005            hw_z.iter().filter(|&&h| h == 0xF04F).count() == 2,
9006            "SetCondZ high rd MOV.W: {hw_z:04x?}"
9007        );
9008        // CMP.W rd,#0 (T2) first halfword: 0xF1B0 | rd
9009        assert!(
9010            hw_z.contains(&(0xF1B0 | 8)),
9011            "SetCondZ high rd must use CMP.W: {hw_z:04x?}"
9012        );
9013    }
9014
9015    #[test]
9016    fn test_encode_setcond_high_reg_uses_mov_w_204() {
9017        use synth_synthesis::{ArmOp, Condition, Reg};
9018        let enc = ArmEncoder::new_thumb2();
9019        // R12 (high): must be ITE + MOV.W #1 + MOV.W #0, never a 16-bit MOVS/CMP.
9020        let hi = enc
9021            .encode(&ArmOp::SetCond {
9022                rd: Reg::R12,
9023                cond: Condition::NE,
9024            })
9025            .unwrap();
9026        assert_eq!(hi.len(), 10, "ITE(2) + MOV.W(4) + MOV.W(4): {hi:02x?}");
9027        // both value halfwords are MOV.W (0xF04F) — NOT the corrupt CMP (0x2c..).
9028        assert_eq!(&hi[2..4], &[0x4F, 0xF0], "then = MOV.W: {hi:02x?}");
9029        assert_eq!(&hi[6..8], &[0x4F, 0xF0], "else = MOV.W: {hi:02x?}");
9030        assert_eq!(hi[4] & 0x0F, 0x01, "then imm = #1");
9031        assert_eq!(hi[8] & 0x0F, 0x00, "else imm = #0");
9032        // Low Rd keeps the compact 16-bit MOVS form.
9033        let lo = enc
9034            .encode(&ArmOp::SetCond {
9035                rd: Reg::R0,
9036                cond: Condition::NE,
9037            })
9038            .unwrap();
9039        assert_eq!(lo.len(), 6, "ITE(2) + MOVS(2) + MOVS(2): {lo:02x?}");
9040        assert_eq!(lo[2..4], [0x01, 0x20], "then = MOVS R0,#1");
9041        assert_eq!(lo[4..6], [0x00, 0x20], "else = MOVS R0,#0");
9042    }
9043
9044    /// #209 Opt 1b: UMULL RdLo, RdHi, Rn, Rm encodes correctly on both ISAs.
9045    /// Thumb-2 T1: 1111 1011 1010 Rn | RdLo RdHi 0000 Rm.
9046    /// A32:        cond 0000 1000 RdHi RdLo Rm 1001 Rn.
9047    #[test]
9048    fn test_encode_umull_209b() {
9049        use synth_synthesis::{ArmOp, Reg};
9050        let op = ArmOp::Umull {
9051            rdlo: Reg::R4,
9052            rdhi: Reg::R5,
9053            rn: Reg::R0,
9054            rm: Reg::R3,
9055        };
9056        // Thumb-2: hw1 = 0xFBA0 | 0 = 0xFBA0; hw2 = (4<<12)|(5<<8)|3 = 0x4503.
9057        let t = ArmEncoder::new_thumb2().encode(&op).unwrap();
9058        assert_eq!(
9059            t,
9060            vec![0xA0, 0xFB, 0x03, 0x45],
9061            "umull r4,r5,r0,r3 (T2): {t:02x?}"
9062        );
9063        // A32: 0xE0800090 | (5<<16) | (4<<12) | (3<<8) | 0 = 0xE0854390.
9064        let a = ArmEncoder::new_arm32().encode(&op).unwrap();
9065        assert_eq!(
9066            a,
9067            0xE085_4390u32.to_le_bytes().to_vec(),
9068            "umull (A32): {a:02x?}"
9069        );
9070    }
9071
9072    /// #206 regression: the ARM32 (A32) `Ldr`/`Str` encoders fed `addr` through
9073    /// `encode_mem_addr`, which returns only the 12-bit immediate — so a register
9074    /// offset (`[rn, rm, #off]`) was silently dropped to `[rn, #off]`, sending
9075    /// the access to the wrong runtime address (silent miscompile on the default
9076    /// `--target arm`). A register offset must materialize `ip = rn + rm` and
9077    /// load from `[ip, #off]`. Verify the bytes.
9078    #[test]
9079    fn test_encode_arm32_indexed_load_keeps_index_206() {
9080        use synth_synthesis::{ArmOp, MemAddr, Reg};
9081        let enc = ArmEncoder::new_arm32();
9082        // ldr r0, [r11, r1, #8]  must NOT collapse to a single immediate ldr.
9083        let bytes = enc
9084            .encode(&ArmOp::Ldr {
9085                rd: Reg::R0,
9086                addr: MemAddr::reg_imm(Reg::R11, Reg::R1, 8),
9087            })
9088            .unwrap();
9089        assert_eq!(
9090            bytes.len(),
9091            8,
9092            "expected ADD ip + LDR (2 words): {bytes:02x?}"
9093        );
9094        let add = u32::from_le_bytes(bytes[0..4].try_into().unwrap());
9095        let ldr = u32::from_le_bytes(bytes[4..8].try_into().unwrap());
9096        // ADD ip, r11, r1  = 0xE08BC001
9097        assert_eq!(add, 0xE08B_C001, "ADD ip,r11,r1: {add:#010x}");
9098        // LDR r0, [ip, #8] = 0xE59C0008
9099        assert_eq!(ldr, 0xE59C_0008, "LDR r0,[ip,#8]: {ldr:#010x}");
9100        // A bare immediate ldr (the bug) would be 0xE59B0008 (base=r11) — reject.
9101        assert_ne!(ldr, 0xE59B_0008, "index must not be dropped");
9102    }
9103
9104    /// #594 regression: `call_indirect` on the A32 path (`--target cortex-r5`)
9105    /// was encoded as a literal NOP (0xE1A00000) — the call never happened and
9106    /// the function silently returned the leftover table-index value. The A32
9107    /// encoder must emit a real dispatch expansion, since #642 guarded by an
9108    /// inline bounds check:
9109    /// `MOVW r12, #size; CMP idx, r12; BLO +1; UDF;
9110    ///  MOV r12, idx, LSL #2; LDR r12, [r11, r12]; BLX r12`.
9111    #[test]
9112    fn test_encode_arm32_call_indirect_is_real_call_594() {
9113        use synth_synthesis::{ArmOp, Reg};
9114        let enc = ArmEncoder::new_arm32();
9115        let bytes = enc
9116            .encode(&ArmOp::CallIndirect {
9117                rd: Reg::R0,
9118                type_idx: 0,
9119                table_index_reg: Reg::R0,
9120                table_size: 4,
9121                table_byte_offset: 0,
9122                null_check: false,
9123                type_check: None,
9124            })
9125            .unwrap();
9126        assert_eq!(
9127            bytes.len(),
9128            28,
9129            "expected MOVW + CMP + BLO + UDF + MOV + LDR + BLX (7 words): {bytes:02x?}"
9130        );
9131        let words: Vec<u32> = bytes
9132            .chunks_exact(4)
9133            .map(|w| u32::from_le_bytes(w.try_into().unwrap()))
9134            .collect();
9135        // #642 bounds guard: MOVW r12, #4; CMP r0, r12; BLO +1; UDF
9136        assert_eq!(words[0], 0xE300_C004, "MOVW r12,#4: {:#010x}", words[0]);
9137        assert_eq!(words[1], 0xE150_000C, "CMP r0,r12: {:#010x}", words[1]);
9138        assert_eq!(words[2], 0x3A00_0000, "BLO +1 insn: {:#010x}", words[2]);
9139        assert_eq!(words[3], 0xE7F0_00F0, "UDF: {:#010x}", words[3]);
9140        // MOV r12, r0, LSL #2 = 0xE1A0C100
9141        assert_eq!(
9142            words[4], 0xE1A0_C100,
9143            "MOV r12,r0,LSL#2: {:#010x}",
9144            words[4]
9145        );
9146        // LDR r12, [r11, r12] = 0xE79BC00C
9147        assert_eq!(
9148            words[5], 0xE79B_C00C,
9149            "LDR r12,[r11,r12]: {:#010x}",
9150            words[5]
9151        );
9152        // BLX r12 = 0xE12FFF3C
9153        assert_eq!(words[6], 0xE12F_FF3C, "BLX r12: {:#010x}", words[6]);
9154        // The bug: a single NOP word. Must never come back.
9155        assert!(
9156            !bytes
9157                .chunks_exact(4)
9158                .any(|w| w == 0xE1A0_0000u32.to_le_bytes()),
9159            "call_indirect must not contain a NOP (#594): {bytes:02x?}"
9160        );
9161
9162        // A non-R0 index register lands in the MOV's Rm and CMP's Rn fields.
9163        let bytes = enc
9164            .encode(&ArmOp::CallIndirect {
9165                rd: Reg::R0,
9166                type_idx: 0,
9167                table_index_reg: Reg::R4,
9168                table_size: 4,
9169                table_byte_offset: 0,
9170                null_check: false,
9171                type_check: None,
9172            })
9173            .unwrap();
9174        let cmp = u32::from_le_bytes(bytes[4..8].try_into().unwrap());
9175        assert_eq!(cmp, 0xE154_000C, "CMP r4,r12: {cmp:#010x}");
9176        let mov = u32::from_le_bytes(bytes[16..20].try_into().unwrap());
9177        assert_eq!(mov, 0xE1A0_C104, "MOV r12,r4,LSL#2: {mov:#010x}");
9178    }
9179
9180    /// #642: a table size above 16 bits must not be silently truncated by the
9181    /// MOVW — the A32 guard adds a MOVT for the high half.
9182    #[test]
9183    fn test_encode_arm32_call_indirect_wide_table_size_642() {
9184        use synth_synthesis::{ArmOp, Reg};
9185        let enc = ArmEncoder::new_arm32();
9186        let bytes = enc
9187            .encode(&ArmOp::CallIndirect {
9188                rd: Reg::R0,
9189                type_idx: 0,
9190                table_index_reg: Reg::R0,
9191                table_size: 0x0002_0003,
9192                table_byte_offset: 0,
9193                null_check: false,
9194                type_check: None,
9195            })
9196            .unwrap();
9197        assert_eq!(bytes.len(), 32, "MOVT arm adds one word: {bytes:02x?}");
9198        let movw = u32::from_le_bytes(bytes[0..4].try_into().unwrap());
9199        let movt = u32::from_le_bytes(bytes[4..8].try_into().unwrap());
9200        assert_eq!(movw, 0xE300_C003, "MOVW r12,#3: {movw:#010x}");
9201        assert_eq!(movt, 0xE340_C002, "MOVT r12,#2: {movt:#010x}");
9202    }
9203
9204    /// #597 anchor (justified correctness RE-PIN of the #594-era freeze): the
9205    /// Thumb-2 `CallIndirect` expansion is `mov.w ip, rm, LSL #2; ldr.w ip,
9206    /// [r11, ip]; blx ip`.
9207    ///
9208    /// The #594 PR froze the then-current bytes `4F EA 20 0C ...` whose first
9209    /// word decodes as `mov.w ip, rm, ASR #32` — the intended `LSL #2` had
9210    /// its shift amount in the TYPE field (bits 5:4) instead of imm2 (bits
9211    /// 7:6), so the index was destroyed and every call_indirect dispatched
9212    /// table entry 0 (shipped miscompile, masked by index-0 probes). #597
9213    /// corrects the encoding; new bytes `4F EA 80 0C ...` were
9214    /// execution-validated under unicorn against the wasmtime oracle on a
9215    /// multi-entry table (indexes 0, 1, 3 —
9216    /// scripts/repro/call_indirect_597_differential.py) before this pin was
9217    /// replaced. Old pin: [4F EA 20 0C, 5B F8 0C C0, E0 47] (ASR #32 — must
9218    /// never come back).
9219    #[test]
9220    fn test_encode_thumb_call_indirect_lsl2_597() {
9221        use synth_synthesis::{ArmOp, Reg};
9222        let enc = ArmEncoder::new_thumb2();
9223        let bytes = enc
9224            .encode(&ArmOp::CallIndirect {
9225                rd: Reg::R0,
9226                type_idx: 0,
9227                table_index_reg: Reg::R0,
9228                table_size: 4,
9229                table_byte_offset: 0,
9230                null_check: false,
9231                type_check: None,
9232            })
9233            .unwrap();
9234        assert_eq!(
9235            bytes,
9236            vec![
9237                // #642 bounds guard: movw ip,#4; cmp r0,ip; blo +1; udf #0
9238                0x40, 0xF2, 0x04, 0x0C, // movw ip, #4
9239                0x60, 0x45, // cmp r0, ip
9240                0x00, 0xD3, // blo .+4 (skip the udf)
9241                0x00, 0xDE, // udf #0 — OOB index trap (WASM §4.4.8)
9242                // #597-pinned dispatch
9243                0x4F, 0xEA, 0x80, 0x0C, // mov.w ip, r0, lsl #2
9244                0x5B, 0xF8, 0x0C, 0xC0, // ldr.w ip, [r11, ip]
9245                0xE0, 0x47, // blx ip
9246            ],
9247            "Thumb-2 CallIndirect: bounds guard + mov.w/ldr.w/blx dispatch: {bytes:02x?}"
9248        );
9249        // The #597 bug bytes (ASR #32 dispatch first word) must never come back.
9250        assert!(
9251            !bytes.windows(4).any(|w| w == [0x4F, 0xEA, 0x20, 0x0C]),
9252            "mov.w ip, rm, ASR #32 — the #597 type-field bug"
9253        );
9254
9255        // A non-R0 index register lands in the mov.w's Rm field (hw2 bits 3:0)
9256        // and the cmp's Rn field.
9257        let bytes = enc
9258            .encode(&ArmOp::CallIndirect {
9259                rd: Reg::R0,
9260                type_idx: 0,
9261                table_index_reg: Reg::R4,
9262                table_size: 4,
9263                table_byte_offset: 0,
9264                null_check: false,
9265                type_check: None,
9266            })
9267            .unwrap();
9268        assert_eq!(&bytes[4..6], &[0x64, 0x45], "cmp r4, ip: {bytes:02x?}");
9269        assert_eq!(
9270            &bytes[10..14],
9271            &[0x4F, 0xEA, 0x84, 0x0C],
9272            "mov.w ip, r4, LSL #2: {bytes:02x?}"
9273        );
9274    }
9275
9276    /// #642: the Thumb-2 bounds guard for a high-register index (R8 — the top
9277    /// of the allocatable pool) uses the high-reg-capable 16-bit CMP (T2) with
9278    /// the N bit set; a table size above 16 bits adds a MOVT.
9279    #[test]
9280    fn test_encode_thumb_call_indirect_guard_shapes_642() {
9281        use synth_synthesis::{ArmOp, Reg};
9282        let enc = ArmEncoder::new_thumb2();
9283        let bytes = enc
9284            .encode(&ArmOp::CallIndirect {
9285                rd: Reg::R0,
9286                type_idx: 0,
9287                table_index_reg: Reg::R8,
9288                table_size: 3,
9289                table_byte_offset: 0,
9290                null_check: false,
9291                type_check: None,
9292            })
9293            .unwrap();
9294        // cmp r8, ip — T2: 0x4500 | N(1)<<7 | Rm(12)<<3 | Rn(0) = 0x45E0
9295        assert_eq!(&bytes[4..6], &[0xE0, 0x45], "cmp r8, ip: {bytes:02x?}");
9296
9297        let bytes = enc
9298            .encode(&ArmOp::CallIndirect {
9299                rd: Reg::R0,
9300                type_idx: 0,
9301                table_index_reg: Reg::R0,
9302                table_size: 0x0002_0003,
9303                table_byte_offset: 0,
9304                null_check: false,
9305                type_check: None,
9306            })
9307            .unwrap();
9308        // movw ip,#3 then movt ip,#2 — the size must not be truncated.
9309        assert_eq!(
9310            &bytes[0..8],
9311            &[0x40, 0xF2, 0x03, 0x0C, 0xC0, 0xF2, 0x02, 0x0C],
9312            "movw ip,#3; movt ip,#2: {bytes:02x?}"
9313        );
9314    }
9315
9316    /// #650: a non-zero table base offset (table N of the contiguous R11
9317    /// region) routes the Thumb-2 pointer load through
9318    /// `add.w ip, r11, ip; ldr.w ip, [ip, #offset]` — and offset 0 keeps the
9319    /// pre-#650 single-load bytes IDENTICAL (the by-construction pin).
9320    #[test]
9321    fn test_encode_thumb_call_indirect_table_offset_650() {
9322        use synth_synthesis::{ArmOp, Reg};
9323        let enc = ArmEncoder::new_thumb2();
9324        // falcon's fused-component shape: table 0 has 7 entries, so table 1
9325        // sits at byte offset 28.
9326        let bytes = enc
9327            .encode(&ArmOp::CallIndirect {
9328                rd: Reg::R0,
9329                type_idx: 0,
9330                table_index_reg: Reg::R1,
9331                table_size: 41,
9332                table_byte_offset: 28,
9333                null_check: false,
9334                type_check: None,
9335            })
9336            .unwrap();
9337        assert_eq!(
9338            bytes,
9339            vec![
9340                // #642 bounds guard against TABLE 1's OWN size (41)
9341                0x40, 0xF2, 0x29, 0x0C, // movw ip, #41
9342                0x61, 0x45, // cmp r1, ip
9343                0x00, 0xD3, // blo .+4 (skip the udf)
9344                0x00, 0xDE, // udf #0 — OOB trap (WASM §4.4.8)
9345                // dispatch through table 1's base (R11 + 28)
9346                0x4F, 0xEA, 0x81, 0x0C, // mov.w ip, r1, lsl #2
9347                0x0B, 0xEB, 0x0C, 0x0C, // add.w ip, r11, ip
9348                0xDC, 0xF8, 0x1C, 0xC0, // ldr.w ip, [ip, #28]
9349                0xE0, 0x47, // blx ip
9350            ],
9351            "Thumb-2 table-1 dispatch (#650): {bytes:02x?}"
9352        );
9353
9354        // Offset 0 must stay the #597-pinned single-load form (no add.w, no
9355        // imm-form ldr) — single-table byte identity by construction.
9356        let zero = enc
9357            .encode(&ArmOp::CallIndirect {
9358                rd: Reg::R0,
9359                type_idx: 0,
9360                table_index_reg: Reg::R1,
9361                table_size: 41,
9362                table_byte_offset: 0,
9363                null_check: false,
9364                type_check: None,
9365            })
9366            .unwrap();
9367        assert_eq!(
9368            &zero[10..],
9369            &[
9370                0x4F, 0xEA, 0x81, 0x0C, // mov.w ip, r1, lsl #2
9371                0x5B, 0xF8, 0x0C, 0xC0, // ldr.w ip, [r11, ip]
9372                0xE0, 0x47, // blx ip
9373            ],
9374            "offset 0 keeps the pre-#650 dispatch bytes: {zero:02x?}"
9375        );
9376    }
9377
9378    /// #650: the A32 twin — `add r12, r11, r12; ldr r12, [r12, #offset]` for
9379    /// a non-zero table base offset; offset 0 keeps the #594/#642 form.
9380    #[test]
9381    fn test_encode_arm32_call_indirect_table_offset_650() {
9382        use synth_synthesis::{ArmOp, Reg};
9383        let enc = ArmEncoder::new_arm32();
9384        let bytes = enc
9385            .encode(&ArmOp::CallIndirect {
9386                rd: Reg::R0,
9387                type_idx: 0,
9388                table_index_reg: Reg::R1,
9389                table_size: 41,
9390                table_byte_offset: 28,
9391                null_check: false,
9392                type_check: None,
9393            })
9394            .unwrap();
9395        let words: Vec<u32> = bytes
9396            .chunks_exact(4)
9397            .map(|w| u32::from_le_bytes(w.try_into().unwrap()))
9398            .collect();
9399        assert_eq!(words[0], 0xE300_C029, "MOVW r12,#41: {:#010x}", words[0]);
9400        assert_eq!(words[1], 0xE151_000C, "CMP r1,r12: {:#010x}", words[1]);
9401        assert_eq!(words[2], 0x3A00_0000, "BLO +1 insn: {:#010x}", words[2]);
9402        assert_eq!(words[3], 0xE7F0_00F0, "UDF: {:#010x}", words[3]);
9403        assert_eq!(
9404            words[4], 0xE1A0_C101,
9405            "MOV r12,r1,LSL#2: {:#010x}",
9406            words[4]
9407        );
9408        assert_eq!(
9409            words[5], 0xE08B_C00C,
9410            "ADD r12,r11,r12 (#650): {:#010x}",
9411            words[5]
9412        );
9413        assert_eq!(
9414            words[6], 0xE59C_C01C,
9415            "LDR r12,[r12,#28] (#650): {:#010x}",
9416            words[6]
9417        );
9418        assert_eq!(words[7], 0xE12F_FF3C, "BLX r12: {:#010x}", words[7]);
9419    }
9420
9421    /// #664: `null_check` inserts a null-funcref trap between the Thumb-2
9422    /// pointer load and the `BLX` (`cmp.w ip, #0; bne .+4; udf #0`) — a
9423    /// zero-linked (uninitialized) slot must TRAP (WASM §4.4.8), never
9424    /// branch to address 0. `null_check: false` keeps the expansion
9425    /// byte-identical to the pre-#664 form (by-construction pin).
9426    #[test]
9427    fn test_encode_thumb_call_indirect_null_check_664() {
9428        use synth_synthesis::{ArmOp, Reg};
9429        let enc = ArmEncoder::new_thumb2();
9430        let op = |null_check| ArmOp::CallIndirect {
9431            rd: Reg::R0,
9432            type_idx: 0,
9433            table_index_reg: Reg::R1,
9434            table_size: 4,
9435            table_byte_offset: 0,
9436            null_check,
9437            type_check: None,
9438        };
9439        let with = enc.encode(&op(true)).unwrap();
9440        let without = enc.encode(&op(false)).unwrap();
9441        // The checked form = the unchecked form with EXACTLY the three-insn
9442        // null check spliced in before the final BLX (byte identity of the
9443        // shared prefix/suffix — nothing else may move).
9444        assert_eq!(
9445            with.len(),
9446            without.len() + 8,
9447            "cmp.w (4) + bne (2) + udf (2): {with:02x?}"
9448        );
9449        let blx_at = without.len() - 2;
9450        assert_eq!(&with[..blx_at], &without[..blx_at], "shared prefix");
9451        assert_eq!(
9452            &with[blx_at..],
9453            &[
9454                0xBC, 0xF1, 0x00, 0x0F, // cmp.w ip, #0
9455                0x00, 0xD1, // bne .+4 (skip the udf)
9456                0x00, 0xDE, // udf #0 — null-funcref trap (#664)
9457                0xE0, 0x47, // blx ip
9458            ],
9459            "null check precedes the BLX: {with:02x?}"
9460        );
9461        assert_eq!(&with[with.len() - 2..], &without[blx_at..], "same BLX");
9462    }
9463
9464    /// #664: the A32 twin — `cmp r12, #0; bne .+8; udf` before the `BLX`;
9465    /// `null_check: false` keeps the #594/#642/#650 bytes identical.
9466    #[test]
9467    fn test_encode_arm32_call_indirect_null_check_664() {
9468        use synth_synthesis::{ArmOp, Reg};
9469        let enc = ArmEncoder::new_arm32();
9470        let op = |null_check| ArmOp::CallIndirect {
9471            rd: Reg::R0,
9472            type_idx: 0,
9473            table_index_reg: Reg::R1,
9474            table_size: 4,
9475            table_byte_offset: 0,
9476            null_check,
9477            type_check: None,
9478        };
9479        let with = enc.encode(&op(true)).unwrap();
9480        let without = enc.encode(&op(false)).unwrap();
9481        assert_eq!(with.len(), without.len() + 12, "3 A32 words: {with:02x?}");
9482        let blx_at = without.len() - 4;
9483        assert_eq!(&with[..blx_at], &without[..blx_at], "shared prefix");
9484        let words: Vec<u32> = with[blx_at..]
9485            .chunks_exact(4)
9486            .map(|w| u32::from_le_bytes(w.try_into().unwrap()))
9487            .collect();
9488        assert_eq!(words[0], 0xE35C_0000, "CMP r12,#0: {:#010x}", words[0]);
9489        assert_eq!(words[1], 0x1A00_0000, "BNE +1 insn: {:#010x}", words[1]);
9490        assert_eq!(words[2], 0xE7F0_00F0, "UDF (null trap): {:#010x}", words[2]);
9491        assert_eq!(words[3], 0xE12F_FF3C, "BLX r12: {:#010x}", words[3]);
9492    }
9493
9494    /// #676: `type_check` splices the runtime type check — scale the index,
9495    /// load the slot's structural class id from the type-id sidecar
9496    /// (`ldr.w ip, [ip, #type_off]`), compare against the expected class id
9497    /// and trap on mismatch (WASM §4.4.8) — between the bounds guard and
9498    /// the dispatch tail. `type_check: None` keeps the expansion
9499    /// byte-identical to the pre-#676 form (by-construction pin, the same
9500    /// trick as #650 offset-0 / #664 `null_check: false`).
9501    #[test]
9502    fn test_encode_thumb_call_indirect_type_check_676() {
9503        use synth_synthesis::{ArmOp, Reg};
9504        let enc = ArmEncoder::new_thumb2();
9505        let op = |type_check| ArmOp::CallIndirect {
9506            rd: Reg::R0,
9507            type_idx: 1,
9508            table_index_reg: Reg::R1,
9509            table_size: 5,
9510            table_byte_offset: 0,
9511            null_check: false,
9512            type_check,
9513        };
9514        let with = enc.encode(&op(Some((2, 20)))).unwrap();
9515        let without = enc.encode(&op(None)).unwrap();
9516        // The checked form = the unchecked form with EXACTLY the six-insn
9517        // type check spliced in after the bounds guard (byte identity of
9518        // the shared prefix/suffix — nothing else may move).
9519        assert_eq!(
9520            with.len(),
9521            without.len() + 20,
9522            "lsl.w(4)+add.w(4)+ldr.w(4)+cmp.w(4)+beq(2)+udf(2): {with:02x?}"
9523        );
9524        // Bounds guard: movw(4) + cmp(2) + blo(2) + udf(2) = 10 bytes.
9525        let guard_end = 10;
9526        assert_eq!(&with[..guard_end], &without[..guard_end], "shared guard");
9527        assert_eq!(
9528            &with[guard_end..guard_end + 20],
9529            &[
9530                0x4F, 0xEA, 0x81, 0x0C, // mov.w ip, r1, lsl #2
9531                0x0B, 0xEB, 0x0C, 0x0C, // add.w ip, r11, ip
9532                0xDC, 0xF8, 0x14, 0xC0, // ldr.w ip, [ip, #20] — sidecar slot id
9533                0xBC, 0xF1, 0x02, 0x0F, // cmp.w ip, #2 — expected class id
9534                0x00, 0xD0, // beq .+4 (skip the udf on a match)
9535                0x00, 0xDE, // udf #0 — §4.4.8 type-mismatch trap (#676)
9536            ],
9537            "type check follows the bounds guard: {with:02x?}"
9538        );
9539        assert_eq!(
9540            &with[guard_end + 20..],
9541            &without[guard_end..],
9542            "dispatch tail unchanged (idx*4 recomputed)"
9543        );
9544    }
9545
9546    /// #676: the A32 twin — `mov r12, idx, lsl #2; add r12, r11, r12;
9547    /// ldr r12, [r12, #type_off]; cmp r12, #id; beq .+8; udf` after the
9548    /// bounds guard; `type_check: None` keeps the #594/#642/#650/#664
9549    /// bytes identical.
9550    #[test]
9551    fn test_encode_arm32_call_indirect_type_check_676() {
9552        use synth_synthesis::{ArmOp, Reg};
9553        let enc = ArmEncoder::new_arm32();
9554        let op = |type_check| ArmOp::CallIndirect {
9555            rd: Reg::R0,
9556            type_idx: 1,
9557            table_index_reg: Reg::R1,
9558            table_size: 5,
9559            table_byte_offset: 0,
9560            null_check: false,
9561            type_check,
9562        };
9563        let with = enc.encode(&op(Some((2, 20)))).unwrap();
9564        let without = enc.encode(&op(None)).unwrap();
9565        assert_eq!(with.len(), without.len() + 24, "6 A32 words: {with:02x?}");
9566        // Bounds guard: movw + cmp + blo + udf = 4 words = 16 bytes.
9567        let guard_end = 16;
9568        assert_eq!(&with[..guard_end], &without[..guard_end], "shared guard");
9569        let words: Vec<u32> = with[guard_end..guard_end + 24]
9570            .chunks_exact(4)
9571            .map(|w| u32::from_le_bytes(w.try_into().unwrap()))
9572            .collect();
9573        assert_eq!(
9574            words[0], 0xE1A0_C101,
9575            "MOV r12,r1,LSL#2: {:#010x}",
9576            words[0]
9577        );
9578        assert_eq!(words[1], 0xE08B_C00C, "ADD r12,r11,r12: {:#010x}", words[1]);
9579        assert_eq!(
9580            words[2], 0xE59C_C014,
9581            "LDR r12,[r12,#20] (sidecar): {:#010x}",
9582            words[2]
9583        );
9584        assert_eq!(
9585            words[3], 0xE35C_0002,
9586            "CMP r12,#2 (expected class id): {:#010x}",
9587            words[3]
9588        );
9589        assert_eq!(words[4], 0x0A00_0000, "BEQ +1 insn: {:#010x}", words[4]);
9590        assert_eq!(
9591            words[5], 0xE7F0_00F0,
9592            "UDF (type-mismatch trap): {:#010x}",
9593            words[5]
9594        );
9595        assert_eq!(
9596            &with[guard_end + 24..],
9597            &without[guard_end..],
9598            "dispatch tail unchanged"
9599        );
9600    }
9601
9602    /// #178/#180 regression: the Thumb `Add`/`Adds`/`Subs` reg-forms used the
9603    /// 16-bit encoding unconditionally. For high registers (R12 base scratch,
9604    /// R8-R11 i64 pairs) the 3-bit register fields overflow and corrupt the
9605    /// operands — `add ip,ip,r0` came out as `adds r4,r5,r1` (0x186C), silently
9606    /// dropping the address operand and miscompiling every optimized memory
9607    /// access. High registers must use the 32-bit `.W` forms.
9608    #[test]
9609    fn test_encode_thumb_add_high_reg_uses_add_w_178_180() {
9610        let encoder = ArmEncoder::new_thumb2();
9611
9612        // add ip, ip, r0  — the exact MemLoad/MemStore base+addr op.
9613        let code = encoder
9614            .encode(&ArmOp::Add {
9615                rd: Reg::R12,
9616                rn: Reg::R12,
9617                op2: Operand2::Reg(Reg::R0),
9618            })
9619            .unwrap();
9620        // ADD.W ip, ip, r0 = EB0C 0C00 (little-endian halfwords).
9621        assert_eq!(
9622            code,
9623            vec![0x0C, 0xEB, 0x00, 0x0C],
9624            "high-reg Thumb ADD must be 32-bit ADD.W (EB0C 0C00), not corrupt 16-bit; got {code:02X?}"
9625        );
9626        // Must NOT be the buggy 16-bit 0x186C (`adds r4,r5,r1`).
9627        assert_ne!(code, vec![0x6C, 0x18], "regressed to corrupt 16-bit ADDS");
9628
9629        // Low-register add stays 16-bit (no regression for the common case).
9630        let lo = encoder
9631            .encode(&ArmOp::Add {
9632                rd: Reg::R1,
9633                rn: Reg::R2,
9634                op2: Operand2::Reg(Reg::R3),
9635            })
9636            .unwrap();
9637        assert_eq!(
9638            lo.len(),
9639            2,
9640            "low-reg ADD should remain 16-bit, got {lo:02X?}"
9641        );
9642    }
9643
9644    /// #178/#180 sibling: i64 low-word `Adds`/`Subs` can land in R8-R11 pairs;
9645    /// those must fall back to 32-bit ADDS.W/SUBS.W (flag-setting preserved).
9646    #[test]
9647    fn test_encode_thumb_adds_subs_high_reg_use_32bit_178_180() {
9648        let encoder = ArmEncoder::new_thumb2();
9649
9650        // adds r10, r10, r8  → ADDS.W = EB1A 0A08
9651        let adds = encoder
9652            .encode(&ArmOp::Adds {
9653                rd: Reg::R10,
9654                rn: Reg::R10,
9655                op2: Operand2::Reg(Reg::R8),
9656            })
9657            .unwrap();
9658        assert_eq!(
9659            adds,
9660            vec![0x1A, 0xEB, 0x08, 0x0A],
9661            "high-reg ADDS must be 32-bit ADDS.W (EB1A 0A08); got {adds:02X?}"
9662        );
9663
9664        // subs r10, r10, r8  → SUBS.W = EBBA 0A08
9665        let subs = encoder
9666            .encode(&ArmOp::Subs {
9667                rd: Reg::R10,
9668                rn: Reg::R10,
9669                op2: Operand2::Reg(Reg::R8),
9670            })
9671            .unwrap();
9672        assert_eq!(
9673            subs,
9674            vec![0xBA, 0xEB, 0x08, 0x0A],
9675            "high-reg SUBS must be 32-bit SUBS.W (EBBA 0A08); got {subs:02X?}"
9676        );
9677    }
9678
9679    /// #184 (sibling of #180): 16-bit CMN (T1) only encodes R0-R7. High registers
9680    /// must use 32-bit CMN.W, not the corrupt truncated 16-bit form.
9681    #[test]
9682    fn test_encode_thumb_cmn_high_reg_uses_cmn_w_184() {
9683        let encoder = ArmEncoder::new_thumb2();
9684
9685        // cmn r10, r8  → CMN.W = EB1A 0F08 (ADD.W S=1, Rd=PC discarded).
9686        let cmn = encoder
9687            .encode(&ArmOp::Cmn {
9688                rn: Reg::R10,
9689                op2: Operand2::Reg(Reg::R8),
9690            })
9691            .unwrap();
9692        assert_eq!(
9693            cmn,
9694            vec![0x1A, 0xEB, 0x08, 0x0F],
9695            "high-reg CMN must be 32-bit CMN.W (EB1A 0F08); got {cmn:02X?}"
9696        );
9697
9698        // Low registers stay 16-bit: cmn r1, r2 = 0x42D1.
9699        let lo = encoder
9700            .encode(&ArmOp::Cmn {
9701                rn: Reg::R1,
9702                op2: Operand2::Reg(Reg::R2),
9703            })
9704            .unwrap();
9705        assert_eq!(
9706            lo.len(),
9707            2,
9708            "low-reg CMN should remain 16-bit, got {lo:02X?}"
9709        );
9710        assert_eq!(lo, vec![0xD1, 0x42], "low-reg CMN bytes wrong: {lo:02X?}");
9711    }
9712
9713    /// #185 regression: feeding PC (R15) as a data operand to a Thumb-2 op that
9714    /// guards its registers must return Err, not panic under debug-assertions.
9715    /// (Synth never emits PC here; the fuzz harness requires encode() be total.)
9716    #[test]
9717    fn test_encode_pc_operand_returns_err_not_panic_185() {
9718        let encoder = ArmEncoder::new_thumb2();
9719        for op in [
9720            ArmOp::Sdiv {
9721                rd: Reg::PC,
9722                rn: Reg::R0,
9723                rm: Reg::R1,
9724            },
9725            ArmOp::Udiv {
9726                rd: Reg::R0,
9727                rn: Reg::PC,
9728                rm: Reg::R1,
9729            },
9730            ArmOp::Sdiv {
9731                rd: Reg::R0,
9732                rn: Reg::R1,
9733                rm: Reg::PC,
9734            },
9735        ] {
9736            let r = encoder.encode(&op);
9737            assert!(
9738                r.is_err(),
9739                "encode({op:?}) must return Err for a PC operand, got {r:?}"
9740            );
9741        }
9742        // Valid registers still encode fine (no false rejection).
9743        assert!(
9744            encoder
9745                .encode(&ArmOp::Sdiv {
9746                    rd: Reg::R0,
9747                    rn: Reg::R1,
9748                    rm: Reg::R2
9749                })
9750                .is_ok()
9751        );
9752    }
9753
9754    #[test]
9755    fn test_encode_nop_arm32() {
9756        let encoder = ArmEncoder::new_arm32();
9757        let code = encoder.encode(&ArmOp::Nop).unwrap();
9758
9759        assert_eq!(code.len(), 4); // ARM32 instructions are 4 bytes
9760        assert_eq!(code, vec![0x00, 0x00, 0xA0, 0xE1]); // MOV R0, R0
9761    }
9762
9763    #[test]
9764    fn test_encode_nop_thumb() {
9765        let encoder = ArmEncoder::new_thumb2();
9766        let code = encoder.encode(&ArmOp::Nop).unwrap();
9767
9768        assert_eq!(code.len(), 2); // Thumb instructions are 2 bytes
9769        assert_eq!(code, vec![0x00, 0xBF]); // NOP
9770    }
9771
9772    #[test]
9773    fn test_encode_mov_immediate_arm32() {
9774        let encoder = ArmEncoder::new_arm32();
9775        let op = ArmOp::Mov {
9776            rd: Reg::R0,
9777            op2: Operand2::Imm(42),
9778        };
9779
9780        let code = encoder.encode(&op).unwrap();
9781        assert_eq!(code.len(), 4);
9782
9783        // Verify it's a MOV instruction (bits should have immediate flag set)
9784        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
9785        assert_eq!(instr & 0x0E000000, 0x02000000); // Check I bit is set
9786    }
9787
9788    #[test]
9789    fn test_encode_add_registers_arm32() {
9790        let encoder = ArmEncoder::new_arm32();
9791        let op = ArmOp::Add {
9792            rd: Reg::R0,
9793            rn: Reg::R1,
9794            op2: Operand2::Reg(Reg::R2),
9795        };
9796
9797        let code = encoder.encode(&op).unwrap();
9798        assert_eq!(code.len(), 4);
9799
9800        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
9801        // Verify it's an ADD instruction with correct opcode
9802        assert_eq!(instr & 0x0FE00000, 0x00800000);
9803    }
9804
9805    /// #350 — `encode_thumb32_add_imm` must lower an out-of-range immediate
9806    /// (> 0xFFF) to a legal MOVW(/MOVT) + ADD.W-register sequence instead of
9807    /// erroring. The small-imm fast path (imm <= 0xFFF) stays byte-identical.
9808    #[test]
9809    fn test_encode_add_imm_large_350() {
9810        let enc = ArmEncoder::new_thumb2();
9811
9812        // --- Fast path: imm <= 0xFFF is a single 4-byte instruction, and the
9813        // VALUE must be right (#681: this test used to assert only the length,
9814        // letting the raw-packed T3 mis-encoding of 0x123 pass CI). 0x123 is
9815        // not ThumbExpandImm-representable, so it must be ADDW (T4, plain
9816        // imm12): clang `addw r0, r1, #0x123` = f201 0023.
9817        let small = enc
9818            .encode_thumb32_add_imm(&Reg::R0, &Reg::R1, 0x123)
9819            .unwrap();
9820        assert_eq!(small, vec![0x01, 0xF2, 0x23, 0x10], "ADDW r0, r1, #0x123");
9821
9822        // helper: decode a Thumb-2 MOVW/MOVT halfword pair back to its imm16
9823        fn movx_imm16(b: &[u8]) -> u32 {
9824            let hw1 = u16::from_le_bytes([b[0], b[1]]) as u32;
9825            let hw2 = u16::from_le_bytes([b[2], b[3]]) as u32;
9826            let imm4 = hw1 & 0xF;
9827            let i = (hw1 >> 10) & 1;
9828            let imm3 = (hw2 >> 12) & 0x7;
9829            let imm8 = hw2 & 0xFF;
9830            (imm4 << 12) | (i << 11) | (imm3 << 8) | imm8
9831        }
9832        fn movx_rd(b: &[u8]) -> u32 {
9833            (u16::from_le_bytes([b[2], b[3]]) as u32 >> 8) & 0xF
9834        }
9835
9836        // --- rd != rn: scratch is rd. imm = 70000 = 0x11170 needs MOVW+MOVT. ---
9837        // 0x11170: lo16 = 0x1170, hi16 = 0x0001
9838        let seq = enc
9839            .encode_thumb32_add_imm(&Reg::R12, &Reg::R0, 70000)
9840            .unwrap();
9841        assert_eq!(seq.len(), 12, "MOVW + MOVT + ADD = 12 bytes");
9842        // MOVW r12, #0x1170
9843        assert_eq!(u16::from_le_bytes([seq[0], seq[1]]) & 0xFBF0, 0xF240);
9844        assert_eq!(movx_rd(&seq[0..4]), 12);
9845        assert_eq!(movx_imm16(&seq[0..4]), 0x1170);
9846        // MOVT r12, #0x0001
9847        assert_eq!(u16::from_le_bytes([seq[4], seq[5]]) & 0xFBF0, 0xF2C0);
9848        assert_eq!(movx_rd(&seq[4..8]), 12);
9849        assert_eq!(movx_imm16(&seq[4..8]), 0x0001);
9850        // ADD.W r12, r0, r12  (EB00 | rn=0 ; rd=12, rm=12)
9851        let add1 = u16::from_le_bytes([seq[8], seq[9]]) as u32;
9852        let add2 = u16::from_le_bytes([seq[10], seq[11]]) as u32;
9853        assert_eq!(add1 & 0xFFF0, 0xEB00);
9854        assert_eq!(add1 & 0xF, 0); // rn = r0
9855        assert_eq!((add2 >> 8) & 0xF, 12); // rd = r12
9856        assert_eq!(add2 & 0xF, 12); // rm = scratch = r12
9857        // The materialized scratch must reconstruct exactly 70000.
9858        assert_eq!(
9859            (movx_imm16(&seq[4..8]) << 16) | movx_imm16(&seq[0..4]),
9860            70000
9861        );
9862
9863        // --- imm <= 0xFFFF: MOVT is skipped (MOVW + ADD = 8 bytes). ---
9864        let seq16 = enc
9865            .encode_thumb32_add_imm(&Reg::R3, &Reg::R0, 0xABCD)
9866            .unwrap();
9867        assert_eq!(seq16.len(), 8, "imm <= 0xFFFF skips MOVT");
9868        assert_eq!(movx_imm16(&seq16[0..4]), 0xABCD);
9869        assert_eq!(movx_rd(&seq16[0..4]), 3); // scratch = rd = r3
9870
9871        // --- rd == rn (in-place add): scratch must be R12, not rd. ---
9872        // imm = 0x12345: lo16 = 0x2345, hi16 = 0x0001
9873        let inplace = enc
9874            .encode_thumb32_add_imm(&Reg::R5, &Reg::R5, 0x12345)
9875            .unwrap();
9876        assert_eq!(inplace.len(), 12);
9877        assert_eq!(movx_rd(&inplace[0..4]), 12, "rd==rn must use R12 scratch");
9878        assert_eq!(
9879            (movx_imm16(&inplace[4..8]) << 16) | movx_imm16(&inplace[0..4]),
9880            0x12345
9881        );
9882        // ADD.W r5, r5, r12 — rm must be the scratch (12), never rn.
9883        let ip_add2 = u16::from_le_bytes([inplace[10], inplace[11]]) as u32;
9884        assert_eq!(ip_add2 & 0xF, 12);
9885        assert_eq!((ip_add2 >> 8) & 0xF, 5);
9886    }
9887
9888    /// #681 — `encode_thumb32_add_imm` packed a RAW immediate into the T3
9889    /// ADD.W `i:imm3:imm8` field, which is a ThumbExpandImm MODIFIED immediate:
9890    /// ThumbExpandImm(0x200) = 0, ThumbExpandImm(0x400) = 0x8000_0000. Every
9891    /// dynamic-address load/store with a static offset in 0x100..=0xFFF
9892    /// computed a wrong address (and bypassed --safety-bounds software: the
9893    /// guard checked the intended address, the access used the mis-encoded
9894    /// one). Fix: imm <= 0xFF keeps T3 (raw == expanded there, bit-identical);
9895    /// 0x100..=0xFFF uses ADDW (T4, plain imm12) — same lowering
9896    /// `encode_thumb32_add` already uses per #253.
9897    ///
9898    /// Every expected byte sequence below is pinned against clang
9899    /// (`-target thumbv7m-none-eabi`) output, bit-for-bit (#544 pattern).
9900    #[test]
9901    fn test_encode_add_imm_thumb_expand_681() {
9902        let enc = ArmEncoder::new_thumb2();
9903        let add = |rd: &Reg, rn: &Reg, imm: u32| enc.encode_thumb32_add_imm(rd, rn, imm).unwrap();
9904
9905        // imm <= 0xFF stays T3 ADD.W (raw == ThumbExpandImm-expanded):
9906        // clang: add.w r12, r0, #0xff  = f100 0cff
9907        assert_eq!(add(&Reg::R12, &Reg::R0, 0xFF), vec![0x00, 0xF1, 0xFF, 0x0C]);
9908
9909        // 0x100..=0xFFF must be ADDW (T4, plain imm12). The old T3 raw packing
9910        // decoded as +0 (0x100/0x200), +0x80000000 (0x400), etc.
9911        // clang: addw r12, r0, #0x100 = f200 1c00
9912        assert_eq!(
9913            add(&Reg::R12, &Reg::R0, 0x100),
9914            vec![0x00, 0xF2, 0x00, 0x1C]
9915        );
9916        // clang: addw r12, r0, #0x104 = f200 1c04
9917        assert_eq!(
9918            add(&Reg::R12, &Reg::R0, 0x104),
9919            vec![0x00, 0xF2, 0x04, 0x1C]
9920        );
9921        // clang: addw r12, r0, #0x200 = f200 2c00
9922        assert_eq!(
9923            add(&Reg::R12, &Reg::R0, 0x200),
9924            vec![0x00, 0xF2, 0x00, 0x2C]
9925        );
9926        // clang: addw r12, r0, #0x3fc = f200 3cfc
9927        assert_eq!(
9928            add(&Reg::R12, &Reg::R0, 0x3FC),
9929            vec![0x00, 0xF2, 0xFC, 0x3C]
9930        );
9931        // clang: addw r12, r0, #0x400 = f200 4c00
9932        assert_eq!(
9933            add(&Reg::R12, &Reg::R0, 0x400),
9934            vec![0x00, 0xF2, 0x00, 0x4C]
9935        );
9936        // clang: addw r12, r0, #0xfff = f600 7cff
9937        assert_eq!(
9938            add(&Reg::R12, &Reg::R0, 0xFFF),
9939            vec![0x00, 0xF6, 0xFF, 0x7C]
9940        );
9941        // Non-scratch rd/rn — clang: addw r1, r2, #0x104 = f202 1104
9942        assert_eq!(add(&Reg::R1, &Reg::R2, 0x104), vec![0x02, 0xF2, 0x04, 0x11]);
9943    }
9944
9945    /// #681 class audit — the T2 RSB and AND.W immediate fields are also
9946    /// ThumbExpandImm-coded and were raw-packed. Neither has a plain-imm12
9947    /// (T4-style) form, so a non-representable immediate must Err loudly
9948    /// (#253/#255/#378 class: never silently encode a different constant).
9949    /// Existing emitters only use representable values (RSB #32, AND #0x3F),
9950    /// pinned here bit-for-bit against clang.
9951    #[test]
9952    fn test_rsb_and_imm_thumb_expand_gate_681() {
9953        let enc = ArmEncoder::new_thumb2();
9954
9955        // clang: rsb.w r3, r2, #0x20 = f1c2 0320 — byte-identical to before.
9956        let rsb = enc
9957            .encode(&ArmOp::Rsb {
9958                rd: Reg::R3,
9959                rn: Reg::R2,
9960                imm: 32,
9961            })
9962            .unwrap();
9963        assert_eq!(rsb, vec![0xC2, 0xF1, 0x20, 0x03]);
9964
9965        // 0x101 is not ThumbExpandImm-representable -> must Err, not mis-encode.
9966        assert!(
9967            enc.encode(&ArmOp::Rsb {
9968                rd: Reg::R3,
9969                rn: Reg::R2,
9970                imm: 0x101,
9971            })
9972            .is_err(),
9973            "non-ThumbExpandImm RSB immediate must Err"
9974        );
9975
9976        // clang: and r4, r4, #0x3f = f004 043f — byte-identical to before.
9977        let and = enc.encode_thumb32_and_imm_raw(4, 4, 0x3F).unwrap();
9978        assert_eq!(and, vec![0x04, 0xF0, 0x3F, 0x04]);
9979        assert!(
9980            enc.encode_thumb32_and_imm_raw(4, 4, 0x101).is_err(),
9981            "non-ThumbExpandImm AND immediate must Err"
9982        );
9983
9984        // A32 RSB: imm12 is a rotate:imm8 modified immediate; > 0xFF used to be
9985        // silently masked to `imm & 0xFF` (#378 masking class) -> must Err.
9986        let a32 = ArmEncoder::new_arm32();
9987        assert!(
9988            a32.encode(&ArmOp::Rsb {
9989                rd: Reg::R3,
9990                rn: Reg::R2,
9991                imm: 0x120,
9992            })
9993            .is_err(),
9994            "A32 RSB immediate > 0xFF must Err, not mask"
9995        );
9996        // imm 32 (the only value real codegen emits) still encodes.
9997        assert!(
9998            a32.encode(&ArmOp::Rsb {
9999                rd: Reg::R3,
10000                rn: Reg::R2,
10001                imm: 32,
10002            })
10003            .is_ok()
10004        );
10005    }
10006
10007    /// #350 follow-up — the `encoder_no_panic` fuzz harness drives the encoder
10008    /// with ARBITRARY registers, including the one case the in-place lowering
10009    /// cannot serve: rd==rn==R12. There the scratch (R12, the reserved encoder
10010    /// register) would alias Rn and clobber it before the ADD reads it. The
10011    /// encoder contract (#180/#185) is Ok-or-Err, never a panic — so this must
10012    /// return Err, not assert. (Real codegen never emits rd==rn==R12 because R12
10013    /// is non-allocatable; this guards only the fuzz/adversarial path.)
10014    #[test]
10015    fn test_encode_add_imm_large_rd_rn_r12_errs_not_panics_350() {
10016        let enc = ArmEncoder::new_thumb2();
10017        // Out-of-range imm with rd==rn==R12: no free scratch -> Err.
10018        let r = enc.encode_thumb32_add_imm(&Reg::R12, &Reg::R12, 70000);
10019        assert!(
10020            r.is_err(),
10021            "rd==rn==R12 with out-of-range imm must Err (no free scratch), got {r:?}"
10022        );
10023        // Small imm with rd==rn==R12 still takes the single-instruction fast path
10024        // (no scratch needed) and must succeed — the guard is scoped to the
10025        // out-of-range lowering only.
10026        let small = enc.encode_thumb32_add_imm(&Reg::R12, &Reg::R12, 0x10);
10027        assert!(small.is_ok(), "small imm needs no scratch, must stay Ok");
10028    }
10029
10030    /// #378 — `encode_operand2` (ARM32 data-processing operand) must FAIL
10031    /// HONESTLY on an immediate that is not a valid rotated immediate, rather
10032    /// than silently masking it to `imm & 0xFF` and emitting a WRONG
10033    /// instruction. `0x1FF` has 9 set bits, so it cannot come from rotating an
10034    /// 8-bit imm8 — non-encodable. Real codegen materializes large constants via
10035    /// MOVW/MOVT; this guards the encoder's Ok-or-Err contract (#180/#185)
10036    /// directly. It is an Err (not a panic) so the `encoder_no_panic` fuzz
10037    /// harness — which drives arbitrary operands — still passes.
10038    #[test]
10039    fn test_encode_operand2_non_rotatable_imm_errs_not_masks_378() {
10040        let enc = ArmEncoder::new_arm32();
10041        let bad = enc.encode(&ArmOp::Add {
10042            rd: Reg::R0,
10043            rn: Reg::R1,
10044            op2: Operand2::Imm(0x1FF),
10045        });
10046        assert!(
10047            bad.is_err(),
10048            "non-rotatable ARM32 immediate 0x1FF must Err (was silently masked \
10049             to 0xFF), got {bad:?}"
10050        );
10051        // A representable rotated immediate still encodes fine (regression guard).
10052        let ok = enc.encode(&ArmOp::Add {
10053            rd: Reg::R0,
10054            rn: Reg::R1,
10055            op2: Operand2::Imm(0xFF),
10056        });
10057        assert!(
10058            ok.is_ok(),
10059            "0xFF is a valid rotated immediate, must stay Ok"
10060        );
10061    }
10062
10063    #[test]
10064    fn test_encode_ldr_arm32() {
10065        let encoder = ArmEncoder::new_arm32();
10066        let op = ArmOp::Ldr {
10067            rd: Reg::R0,
10068            addr: MemAddr::imm(Reg::R1, 4),
10069        };
10070
10071        let code = encoder.encode(&op).unwrap();
10072        assert_eq!(code.len(), 4);
10073
10074        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10075        // Verify load bit is set
10076        assert_eq!(instr & 0x00100000, 0x00100000);
10077    }
10078
10079    #[test]
10080    fn test_encode_str_arm32() {
10081        let encoder = ArmEncoder::new_arm32();
10082        let op = ArmOp::Str {
10083            rd: Reg::R0,
10084            addr: MemAddr::imm(Reg::SP, 0),
10085        };
10086
10087        let code = encoder.encode(&op).unwrap();
10088        assert_eq!(code.len(), 4);
10089    }
10090
10091    #[test]
10092    fn test_encode_branch_arm32() {
10093        let encoder = ArmEncoder::new_arm32();
10094        let op = ArmOp::Bl {
10095            label: "main".to_string(),
10096        };
10097
10098        let code = encoder.encode(&op).unwrap();
10099        assert_eq!(code.len(), 4);
10100
10101        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10102        // Verify BL opcode
10103        assert_eq!(instr & 0x0F000000, 0x0B000000);
10104    }
10105
10106    /// Regression test for #167 + #174: the Thumb-2 BL relocatable placeholder
10107    /// must carry a -4 addend so an R_ARM_THM_CALL nets to exactly the symbol S.
10108    /// The correct encoding is what `gas` emits for `bl <extern>`: f7ff fffe
10109    /// (hw1=0xF7FF, hw2=0xFFFE), little-endian bytes FF F7 FE FF.
10110    ///   - 0xD000 (J1=J2=0) → ~+0x600000 garbage addend: `bl c0000c` / truncated
10111    ///     to fit (#167).
10112    ///   - 0xF800 (addend 0) → lands at S+4, one instruction past the callee
10113    ///     entry (#174).
10114    ///   - 0xFFFE (addend -4) → lands at S. Correct.
10115    #[test]
10116    fn test_encode_thumb_bl_placeholder_addend_167_174() {
10117        let encoder = ArmEncoder::new_thumb2();
10118        let op = ArmOp::Bl {
10119            label: "callee".to_string(),
10120        };
10121
10122        let code = encoder.encode(&op).unwrap();
10123        assert_eq!(code.len(), 4, "Thumb-2 BL is 32-bit");
10124
10125        let hw1 = u16::from_le_bytes([code[0], code[1]]);
10126        let hw2 = u16::from_le_bytes([code[2], code[3]]);
10127        assert_eq!(hw1, 0xF7FF, "BL first halfword (matches gas `bl <extern>`)");
10128        assert_eq!(
10129            hw2, 0xFFFE,
10130            "BL second halfword must be 0xFFFE (-4 addend → nets to S), not 0xF800 (→ S+4, #174) or 0xD000 (#167)"
10131        );
10132        assert_ne!(hw2, 0xF800, "0xF800 (addend 0) lands at S+4 (#174)");
10133        assert_ne!(hw2, 0xD000, "0xD000 bakes in a ~+0x600000 addend (#167)");
10134    }
10135
10136    /// #740: the Thumb-2 32-bit B<cond>.W (encoding T3) must pack the
10137    /// HALFWORD offset directly into S:J2:J1:imm6:imm11 — the byte offset is
10138    /// SignExtend(S:J2:J1:imm6:imm11:'0'). The old arm packed
10139    /// `halfword_offset >> 1`, HALVING every wide conditional branch's
10140    /// displacement: gust_poll's loop-head `br_if` to an outer block end
10141    /// landed mid-shape (a spurious state write + spurious calls on the
10142    /// empty-budget path). Narrow (16-bit) B<cond> was unaffected — only
10143    /// spans > 254 bytes hit the bug. Bytes cross-checked against the llvm
10144    /// disassembler (`bne.w #0x224` = f040 8112).
10145    #[test]
10146    fn test_encode_thumb_bcond_wide_t3_halfword_offset_740() {
10147        use synth_synthesis::Condition;
10148        let encoder = ArmEncoder::new_thumb2();
10149
10150        // gust_poll's loop-head edge: NE, +0x112 halfwords (+0x224 bytes).
10151        let code = encoder
10152            .encode(&ArmOp::BCondOffset {
10153                cond: Condition::NE,
10154                offset: 0x112,
10155            })
10156            .unwrap();
10157        assert_eq!(code.len(), 4, "offset beyond ±127 halfwords must be wide");
10158        let hw1 = u16::from_le_bytes([code[0], code[1]]);
10159        let hw2 = u16::from_le_bytes([code[2], code[3]]);
10160        assert_eq!(hw1, 0xF040, "T3 hw1: 1111 0 S=0 cond=NE imm6=0");
10161        assert_eq!(
10162            hw2, 0x8112,
10163            "T3 hw2 imm11 must carry halfword offset bits [10:0] directly — \
10164             0x8089 (offset>>1) is the halved #740 miscompile"
10165        );
10166
10167        // Backward wide branch: EQ, -0x100 halfwords. S=1, J2=J1=1,
10168        // imm6=0b111111, imm11=0x700 → f43f af00.
10169        let code = encoder
10170            .encode(&ArmOp::BCondOffset {
10171                cond: Condition::EQ,
10172                offset: -0x100,
10173            })
10174            .unwrap();
10175        assert_eq!(code.len(), 4);
10176        let hw1 = u16::from_le_bytes([code[0], code[1]]);
10177        let hw2 = u16::from_le_bytes([code[2], code[3]]);
10178        assert_eq!(hw1, 0xF43F, "T3 hw1: S=1, cond=EQ, imm6=0x3F");
10179        assert_eq!(hw2, 0xAF00, "T3 hw2: J1=1 J2=1 imm11=0x700");
10180
10181        // Narrow encoding stays byte-identical (in-range offsets untouched).
10182        let code = encoder
10183            .encode(&ArmOp::BCondOffset {
10184                cond: Condition::EQ,
10185                offset: 5,
10186            })
10187            .unwrap();
10188        assert_eq!(code, vec![0x05, 0xD0], "narrow B<cond> unchanged");
10189
10190        // Out of the signed 20-bit T3 range: loud Err, never a truncated jump.
10191        assert!(
10192            encoder
10193                .encode(&ArmOp::BCondOffset {
10194                    cond: Condition::NE,
10195                    offset: 1 << 19,
10196                })
10197                .is_err(),
10198            "out-of-range T3 offset must be a loud decline"
10199        );
10200    }
10201
10202    #[test]
10203    fn test_encode_sequence() {
10204        let encoder = ArmEncoder::new_arm32();
10205        let ops = vec![
10206            ArmOp::Mov {
10207                rd: Reg::R0,
10208                op2: Operand2::Imm(42),
10209            },
10210            ArmOp::Mov {
10211                rd: Reg::R1,
10212                op2: Operand2::Imm(10),
10213            },
10214            ArmOp::Add {
10215                rd: Reg::R2,
10216                rn: Reg::R0,
10217                op2: Operand2::Reg(Reg::R1),
10218            },
10219        ];
10220
10221        let code = encoder.encode_sequence(&ops).unwrap();
10222        assert_eq!(code.len(), 12); // 3 instructions * 4 bytes
10223    }
10224
10225    #[test]
10226    fn test_reg_to_bits() {
10227        assert_eq!(reg_to_bits(&Reg::R0), 0);
10228        assert_eq!(reg_to_bits(&Reg::R7), 7);
10229        assert_eq!(reg_to_bits(&Reg::SP), 13);
10230        assert_eq!(reg_to_bits(&Reg::LR), 14);
10231        assert_eq!(reg_to_bits(&Reg::PC), 15);
10232    }
10233
10234    #[test]
10235    fn test_encode_bitwise_operations() {
10236        let encoder = ArmEncoder::new_arm32();
10237
10238        let and_op = ArmOp::And {
10239            rd: Reg::R0,
10240            rn: Reg::R1,
10241            op2: Operand2::Reg(Reg::R2),
10242        };
10243        let and_code = encoder.encode(&and_op).unwrap();
10244        assert_eq!(and_code.len(), 4);
10245
10246        let orr_op = ArmOp::Orr {
10247            rd: Reg::R0,
10248            rn: Reg::R1,
10249            op2: Operand2::Reg(Reg::R2),
10250        };
10251        let orr_code = encoder.encode(&orr_op).unwrap();
10252        assert_eq!(orr_code.len(), 4);
10253
10254        let eor_op = ArmOp::Eor {
10255            rd: Reg::R0,
10256            rn: Reg::R1,
10257            op2: Operand2::Reg(Reg::R2),
10258        };
10259        let eor_code = encoder.encode(&eor_op).unwrap();
10260        assert_eq!(eor_code.len(), 4);
10261    }
10262
10263    // === Thumb-2 32-bit encoding tests ===
10264
10265    #[test]
10266    fn test_encode_sdiv_thumb2() {
10267        let encoder = ArmEncoder::new_thumb2();
10268        let op = ArmOp::Sdiv {
10269            rd: Reg::R0,
10270            rn: Reg::R1,
10271            rm: Reg::R2,
10272        };
10273
10274        let code = encoder.encode(&op).unwrap();
10275        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10276
10277        // SDIV R0, R1, R2: 0xFB91 0xF0F2
10278        // First halfword: 0xFB90 | Rn(1) = 0xFB91
10279        // Second halfword: 0xF0F0 | Rd(0)<<8 | Rm(2) = 0xF0F2
10280        // Little-endian: [0x91, 0xFB, 0xF2, 0xF0]
10281        assert_eq!(code[0], 0x91);
10282        assert_eq!(code[1], 0xFB);
10283        assert_eq!(code[2], 0xF2);
10284        assert_eq!(code[3], 0xF0);
10285    }
10286
10287    #[test]
10288    fn test_encode_udiv_thumb2() {
10289        let encoder = ArmEncoder::new_thumb2();
10290        let op = ArmOp::Udiv {
10291            rd: Reg::R0,
10292            rn: Reg::R1,
10293            rm: Reg::R2,
10294        };
10295
10296        let code = encoder.encode(&op).unwrap();
10297        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10298
10299        // UDIV R0, R1, R2: 0xFBB1 0xF0F2
10300        // Little-endian: [0xB1, 0xFB, 0xF2, 0xF0]
10301        assert_eq!(code[0], 0xB1);
10302        assert_eq!(code[1], 0xFB);
10303        assert_eq!(code[2], 0xF2);
10304        assert_eq!(code[3], 0xF0);
10305    }
10306
10307    #[test]
10308    fn test_encode_mul_thumb2() {
10309        let encoder = ArmEncoder::new_thumb2();
10310        let op = ArmOp::Mul {
10311            rd: Reg::R0,
10312            rn: Reg::R1,
10313            rm: Reg::R2,
10314        };
10315
10316        let code = encoder.encode(&op).unwrap();
10317        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10318    }
10319
10320    #[test]
10321    fn test_encode_and_thumb2() {
10322        let encoder = ArmEncoder::new_thumb2();
10323        let op = ArmOp::And {
10324            rd: Reg::R0,
10325            rn: Reg::R1,
10326            op2: Operand2::Reg(Reg::R2),
10327        };
10328
10329        let code = encoder.encode(&op).unwrap();
10330        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10331    }
10332
10333    #[test]
10334    fn test_encode_lsl_thumb2_low_regs() {
10335        let encoder = ArmEncoder::new_thumb2();
10336        let op = ArmOp::Lsl {
10337            rd: Reg::R0,
10338            rn: Reg::R1,
10339            shift: 5,
10340        };
10341
10342        let code = encoder.encode(&op).unwrap();
10343        assert_eq!(code.len(), 2); // 16-bit for low registers
10344    }
10345
10346    #[test]
10347    fn test_encode_clz_thumb2() {
10348        let encoder = ArmEncoder::new_thumb2();
10349        let op = ArmOp::Clz {
10350            rd: Reg::R0,
10351            rm: Reg::R1,
10352        };
10353
10354        let code = encoder.encode(&op).unwrap();
10355        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10356    }
10357
10358    #[test]
10359    fn test_encode_bx_thumb2() {
10360        let encoder = ArmEncoder::new_thumb2();
10361        let op = ArmOp::Bx { rm: Reg::LR };
10362
10363        let code = encoder.encode(&op).unwrap();
10364        assert_eq!(code.len(), 2); // 16-bit instruction
10365
10366        // BX LR: 0x4770
10367        assert_eq!(code, vec![0x70, 0x47]);
10368    }
10369
10370    // ========================================================================
10371    // f32 pseudo-op encoding tests
10372    // ========================================================================
10373
10374    #[test]
10375    fn test_encode_f32_abs_arm32() {
10376        let encoder = ArmEncoder::new_arm32();
10377        let op = ArmOp::F32Abs {
10378            sd: VfpReg::S0,
10379            sm: VfpReg::S2,
10380        };
10381        let code = encoder.encode(&op).unwrap();
10382        assert_eq!(code.len(), 4); // Single VFP instruction
10383    }
10384
10385    #[test]
10386    fn test_encode_f32_neg_arm32() {
10387        let encoder = ArmEncoder::new_arm32();
10388        let op = ArmOp::F32Neg {
10389            sd: VfpReg::S0,
10390            sm: VfpReg::S2,
10391        };
10392        let code = encoder.encode(&op).unwrap();
10393        assert_eq!(code.len(), 4);
10394    }
10395
10396    #[test]
10397    fn test_encode_f32_sqrt_arm32() {
10398        let encoder = ArmEncoder::new_arm32();
10399        let op = ArmOp::F32Sqrt {
10400            sd: VfpReg::S0,
10401            sm: VfpReg::S2,
10402        };
10403        let code = encoder.encode(&op).unwrap();
10404        assert_eq!(code.len(), 4);
10405    }
10406
10407    #[test]
10408    fn test_encode_f32_ceil_arm32() {
10409        let encoder = ArmEncoder::new_arm32();
10410        let op = ArmOp::F32Ceil {
10411            sd: VfpReg::S0,
10412            sm: VfpReg::S2,
10413        };
10414        let code = encoder.encode(&op).unwrap();
10415        // VMRS + BIC + ORR + VMSR + VCVT.S32.F32 + VMRS + BIC + VMSR + VCVT.F32.S32
10416        assert_eq!(code.len(), 36);
10417    }
10418
10419    #[test]
10420    fn test_encode_f32_floor_thumb2() {
10421        let encoder = ArmEncoder::new_thumb2();
10422        let op = ArmOp::F32Floor {
10423            sd: VfpReg::S0,
10424            sm: VfpReg::S2,
10425        };
10426        let code = encoder.encode(&op).unwrap();
10427        // VMRS + BIC.W + ORR.W + VMSR + VCVT + VMRS + BIC.W + VMSR + VCVT.F32.S32
10428        assert_eq!(code.len(), 36);
10429    }
10430
10431    #[test]
10432    fn test_encode_f32_min_arm32() {
10433        let encoder = ArmEncoder::new_arm32();
10434        let op = ArmOp::F32Min {
10435            sd: VfpReg::S0,
10436            sn: VfpReg::S2,
10437            sm: VfpReg::S4,
10438        };
10439        let code = encoder.encode(&op).unwrap();
10440        assert_eq!(code.len(), 16); // VMOV + VCMP + VMRS + conditional VMOV
10441    }
10442
10443    #[test]
10444    fn test_encode_f32_max_thumb2() {
10445        let encoder = ArmEncoder::new_thumb2();
10446        let op = ArmOp::F32Max {
10447            sd: VfpReg::S0,
10448            sn: VfpReg::S2,
10449            sm: VfpReg::S4,
10450        };
10451        let code = encoder.encode(&op).unwrap();
10452        // VMOV(4) + VCMP(4) + VMRS(4) + IT(2) + VMOV(4) = 18
10453        assert_eq!(code.len(), 18);
10454    }
10455
10456    #[test]
10457    fn test_encode_f32_copysign_arm32() {
10458        let encoder = ArmEncoder::new_arm32();
10459        let op = ArmOp::F32Copysign {
10460            sd: VfpReg::S0,
10461            sn: VfpReg::S2,
10462            sm: VfpReg::S4,
10463        };
10464        let code = encoder.encode(&op).unwrap();
10465        // VMOV + VMOV + AND + BIC + ORR + VMOV = 6 * 4 = 24
10466        assert_eq!(code.len(), 24);
10467    }
10468
10469    // ========================================================================
10470    // f64 encoding tests
10471    // ========================================================================
10472
10473    #[test]
10474    fn test_encode_f64_add_arm32() {
10475        let encoder = ArmEncoder::new_arm32();
10476        let op = ArmOp::F64Add {
10477            dd: VfpReg::D0,
10478            dn: VfpReg::D1,
10479            dm: VfpReg::D2,
10480        };
10481        let code = encoder.encode(&op).unwrap();
10482        assert_eq!(code.len(), 4);
10483        // VADD.F64 D0, D1, D2: check coprocessor is cp11 (0xB)
10484        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10485        assert_eq!((instr >> 8) & 0xF, 0xB); // cp11
10486    }
10487
10488    #[test]
10489    fn test_encode_f64_sub_thumb2() {
10490        let encoder = ArmEncoder::new_thumb2();
10491        let op = ArmOp::F64Sub {
10492            dd: VfpReg::D0,
10493            dn: VfpReg::D1,
10494            dm: VfpReg::D2,
10495        };
10496        let code = encoder.encode(&op).unwrap();
10497        assert_eq!(code.len(), 4); // 32-bit VFP as two Thumb halfwords
10498    }
10499
10500    #[test]
10501    fn test_encode_f64_mul_arm32() {
10502        let encoder = ArmEncoder::new_arm32();
10503        let op = ArmOp::F64Mul {
10504            dd: VfpReg::D0,
10505            dn: VfpReg::D1,
10506            dm: VfpReg::D2,
10507        };
10508        let code = encoder.encode(&op).unwrap();
10509        assert_eq!(code.len(), 4);
10510    }
10511
10512    #[test]
10513    fn test_encode_f64_div_arm32() {
10514        let encoder = ArmEncoder::new_arm32();
10515        let op = ArmOp::F64Div {
10516            dd: VfpReg::D0,
10517            dn: VfpReg::D1,
10518            dm: VfpReg::D2,
10519        };
10520        let code = encoder.encode(&op).unwrap();
10521        assert_eq!(code.len(), 4);
10522    }
10523
10524    #[test]
10525    fn test_encode_f64_abs_arm32() {
10526        let encoder = ArmEncoder::new_arm32();
10527        let op = ArmOp::F64Abs {
10528            dd: VfpReg::D0,
10529            dm: VfpReg::D2,
10530        };
10531        let code = encoder.encode(&op).unwrap();
10532        assert_eq!(code.len(), 4);
10533    }
10534
10535    #[test]
10536    fn test_encode_f64_neg_arm32() {
10537        let encoder = ArmEncoder::new_arm32();
10538        let op = ArmOp::F64Neg {
10539            dd: VfpReg::D0,
10540            dm: VfpReg::D2,
10541        };
10542        let code = encoder.encode(&op).unwrap();
10543        assert_eq!(code.len(), 4);
10544    }
10545
10546    #[test]
10547    fn test_encode_f64_sqrt_arm32() {
10548        let encoder = ArmEncoder::new_arm32();
10549        let op = ArmOp::F64Sqrt {
10550            dd: VfpReg::D0,
10551            dm: VfpReg::D2,
10552        };
10553        let code = encoder.encode(&op).unwrap();
10554        assert_eq!(code.len(), 4);
10555    }
10556
10557    #[test]
10558    fn test_encode_f64_load_arm32() {
10559        let encoder = ArmEncoder::new_arm32();
10560        let op = ArmOp::F64Load {
10561            dd: VfpReg::D0,
10562            addr: MemAddr::imm(Reg::R0, 8),
10563        };
10564        let code = encoder.encode(&op).unwrap();
10565        assert_eq!(code.len(), 4);
10566        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10567        assert_eq!((instr >> 8) & 0xF, 0xB); // cp11 for F64
10568        assert_eq!(instr & 0xFF, 2); // offset 8 / 4 = 2
10569    }
10570
10571    #[test]
10572    fn test_encode_f64_store_thumb2() {
10573        let encoder = ArmEncoder::new_thumb2();
10574        let op = ArmOp::F64Store {
10575            dd: VfpReg::D0,
10576            addr: MemAddr::imm(Reg::SP, 0),
10577        };
10578        let code = encoder.encode(&op).unwrap();
10579        assert_eq!(code.len(), 4);
10580    }
10581
10582    #[test]
10583    fn test_encode_f64_compare_arm32() {
10584        let encoder = ArmEncoder::new_arm32();
10585        let op = ArmOp::F64Eq {
10586            rd: Reg::R0,
10587            dn: VfpReg::D0,
10588            dm: VfpReg::D1,
10589        };
10590        let code = encoder.encode(&op).unwrap();
10591        assert_eq!(code.len(), 16); // VCMP + VMRS + MOV #0 + MOVcond #1
10592    }
10593
10594    #[test]
10595    fn test_encode_f64_compare_thumb2() {
10596        let encoder = ArmEncoder::new_thumb2();
10597        let op = ArmOp::F64Lt {
10598            rd: Reg::R0,
10599            dn: VfpReg::D0,
10600            dm: VfpReg::D1,
10601        };
10602        let code = encoder.encode(&op).unwrap();
10603        // VCMP(4) + VMRS(4) + MOVS(2) + IT(2) + MOV(2) = 14
10604        assert_eq!(code.len(), 14);
10605    }
10606
10607    #[test]
10608    fn test_encode_f64_const_arm32() {
10609        let encoder = ArmEncoder::new_arm32();
10610        let op = ArmOp::F64Const {
10611            dd: VfpReg::D0,
10612            value: 3.125,
10613        };
10614        let code = encoder.encode(&op).unwrap();
10615        // MOVW(4) + MOVT(4) + MOVW(4) + MOVT(4) + VMOV(4) = 20
10616        assert_eq!(code.len(), 20);
10617    }
10618
10619    #[test]
10620    fn test_encode_f64_const_thumb2() {
10621        let encoder = ArmEncoder::new_thumb2();
10622        let op = ArmOp::F64Const {
10623            dd: VfpReg::D0,
10624            value: 2.5,
10625        };
10626        let code = encoder.encode(&op).unwrap();
10627        // MOVW(4) + MOVT(4) + MOVW(4) + MOVT(4) + VMOV(4) = 20
10628        assert_eq!(code.len(), 20);
10629    }
10630
10631    #[test]
10632    fn test_encode_f64_convert_i32s_arm32() {
10633        let encoder = ArmEncoder::new_arm32();
10634        let op = ArmOp::F64ConvertI32S {
10635            dd: VfpReg::D0,
10636            rm: Reg::R0,
10637        };
10638        let code = encoder.encode(&op).unwrap();
10639        // VMOV(4) + VCVT(4) = 8
10640        assert_eq!(code.len(), 8);
10641    }
10642
10643    #[test]
10644    fn test_encode_f64_promote_f32_arm32() {
10645        let encoder = ArmEncoder::new_arm32();
10646        let op = ArmOp::F64PromoteF32 {
10647            dd: VfpReg::D0,
10648            sm: VfpReg::S0,
10649        };
10650        let code = encoder.encode(&op).unwrap();
10651        assert_eq!(code.len(), 4); // Single VCVT.F64.F32 instruction
10652    }
10653
10654    #[test]
10655    fn test_encode_f64_promote_f32_thumb2() {
10656        let encoder = ArmEncoder::new_thumb2();
10657        let op = ArmOp::F64PromoteF32 {
10658            dd: VfpReg::D0,
10659            sm: VfpReg::S0,
10660        };
10661        let code = encoder.encode(&op).unwrap();
10662        assert_eq!(code.len(), 4);
10663    }
10664
10665    #[test]
10666    fn test_encode_i32_trunc_f64s_arm32() {
10667        let encoder = ArmEncoder::new_arm32();
10668        let op = ArmOp::I32TruncF64S {
10669            rd: Reg::R0,
10670            dm: VfpReg::D0,
10671        };
10672        let code = encoder.encode(&op).unwrap();
10673        // VCVT(4) + VMOV(4) = 8
10674        assert_eq!(code.len(), 8);
10675    }
10676
10677    #[test]
10678    fn test_encode_f64_reinterpret_i64_arm32() {
10679        let encoder = ArmEncoder::new_arm32();
10680        let op = ArmOp::F64ReinterpretI64 {
10681            dd: VfpReg::D0,
10682            rmlo: Reg::R0,
10683            rmhi: Reg::R1,
10684        };
10685        let code = encoder.encode(&op).unwrap();
10686        assert_eq!(code.len(), 4); // Single VMOV instruction
10687    }
10688
10689    #[test]
10690    fn test_encode_i64_reinterpret_f64_thumb2() {
10691        let encoder = ArmEncoder::new_thumb2();
10692        let op = ArmOp::I64ReinterpretF64 {
10693            rdlo: Reg::R0,
10694            rdhi: Reg::R1,
10695            dm: VfpReg::D0,
10696        };
10697        let code = encoder.encode(&op).unwrap();
10698        assert_eq!(code.len(), 4);
10699    }
10700
10701    #[test]
10702    fn test_encode_f64_trunc_thumb2() {
10703        let encoder = ArmEncoder::new_thumb2();
10704        let op = ArmOp::F64Trunc {
10705            dd: VfpReg::D0,
10706            dm: VfpReg::D1,
10707        };
10708        let code = encoder.encode(&op).unwrap();
10709        // GI-FPU-002 phase 3 (#369): a single VRINTZ.F64 (clang-verified
10710        // vrintz.f64 d0,d1 base) — no more FPSCR dance / S0 clobber.
10711        assert_eq!(code.len(), 4);
10712        assert_eq!(code, vec![0xb6, 0xee, 0xc1, 0x0b]);
10713    }
10714
10715    /// GI-FPU-002 phase 3 (#369): the rewritten f64 tail sequences, byte-exact
10716    /// against clang (`-target thumbv7em-none-eabi -mfpu=fpv5-d16`). Each
10717    /// clobbers ONLY its destination (+R12/flags where noted) — the previous
10718    /// pseudo-ops staged through live S0/R0-R2 (the #615 class) and the
10719    /// min/max/rounding semantics were wrong (ordered IT select returned the
10720    /// wrong operand on NaN/±0; rounding round-tripped through a 32-bit int).
10721    #[test]
10722    fn test_369_f64_tail_thumb2_encodings_match_clang() {
10723        let enc = ArmEncoder::new_thumb2();
10724        // vrintn/vrintp/vrintm.f64 d1, d2 (FE space, never IT'd).
10725        for (op, want) in [
10726            (
10727                ArmOp::F64Nearest {
10728                    dd: VfpReg::D1,
10729                    dm: VfpReg::D2,
10730                },
10731                vec![0xb9, 0xfe, 0x42, 0x1b],
10732            ),
10733            (
10734                ArmOp::F64Ceil {
10735                    dd: VfpReg::D1,
10736                    dm: VfpReg::D2,
10737                },
10738                vec![0xba, 0xfe, 0x42, 0x1b],
10739            ),
10740            (
10741                ArmOp::F64Floor {
10742                    dd: VfpReg::D1,
10743                    dm: VfpReg::D2,
10744                },
10745                vec![0xbb, 0xfe, 0x42, 0x1b],
10746            ),
10747        ] {
10748            assert_eq!(enc.encode(&op).unwrap(), want, "{op:?}");
10749        }
10750        // vcmp.f64 d1,d2 ; vmrs ; vminnm.f64 d0,d1,d2 ; it vs ; vaddvs.f64
10751        let min = enc
10752            .encode(&ArmOp::F64Min {
10753                dd: VfpReg::D0,
10754                dn: VfpReg::D1,
10755                dm: VfpReg::D2,
10756            })
10757            .unwrap();
10758        assert_eq!(
10759            min,
10760            vec![
10761                0xb4, 0xee, 0x42, 0x1b, // vcmp.f64 d1, d2
10762                0xf1, 0xee, 0x10, 0xfa, // vmrs APSR_nzcv, fpscr
10763                0x81, 0xfe, 0x42, 0x0b, // vminnm.f64 d0, d1, d2
10764                0x68, 0xbf, // it vs
10765                0x31, 0xee, 0x02, 0x0b, // vaddvs.f64 d0, d1, d2
10766            ]
10767        );
10768        // vmaxnm variant flips only bit6 of the VMINNM word.
10769        let max = enc
10770            .encode(&ArmOp::F64Max {
10771                dd: VfpReg::D0,
10772                dn: VfpReg::D1,
10773                dm: VfpReg::D2,
10774            })
10775            .unwrap();
10776        assert_eq!(&max[8..12], &[0x81, 0xfe, 0x02, 0x0b]);
10777        // Destination aliasing a source must ERR (the NaN fix-up would read
10778        // a clobbered operand), never encode.
10779        assert!(
10780            enc.encode(&ArmOp::F64Min {
10781                dd: VfpReg::D1,
10782                dn: VfpReg::D1,
10783                dm: VfpReg::D2,
10784            })
10785            .is_err()
10786        );
10787        // copysign d0,(mag)d1,(sign)d2:
10788        // vmov r12,s5 ; cmp.w r12,#0 ; vabs.f64 d0,d1 ; it mi ; vnegmi.f64 d0,d0
10789        let cs = enc
10790            .encode(&ArmOp::F64Copysign {
10791                dd: VfpReg::D0,
10792                dn: VfpReg::D1,
10793                dm: VfpReg::D2,
10794            })
10795            .unwrap();
10796        assert_eq!(
10797            cs,
10798            vec![
10799                0x12, 0xee, 0x90, 0xca, // vmov r12, s5
10800                0xbc, 0xf1, 0x00, 0x0f, // cmp.w r12, #0
10801                0xb0, 0xee, 0xc1, 0x0b, // vabs.f64 d0, d1
10802                0x48, 0xbf, // it mi
10803                0xb1, 0xee, 0x40, 0x0b, // vnegmi.f64 d0, d0
10804            ]
10805        );
10806        // f32 copysign s0,(mag)s1,(sign)s2 — the R0-clobber-free rewrite:
10807        // vmov r12,s2 ; cmp.w r12,#0 ; vabs.f32 s0,s1 ; it mi ; vnegmi.f32
10808        let cs32 = enc
10809            .encode(&ArmOp::F32Copysign {
10810                sd: VfpReg::S0,
10811                sn: VfpReg::S1,
10812                sm: VfpReg::S2,
10813            })
10814            .unwrap();
10815        assert_eq!(
10816            cs32,
10817            vec![
10818                0x11, 0xee, 0x10, 0xca, // vmov r12, s2
10819                0xbc, 0xf1, 0x00, 0x0f, // cmp.w r12, #0
10820                0xb0, 0xee, 0xe0, 0x0a, // vabs.f32 s0, s1
10821                0x48, 0xbf, // it mi
10822                0xb1, 0xee, 0x40, 0x0a, // vnegmi.f32 s0, s0
10823            ]
10824        );
10825        // i32 -> f64 stages through the DESTINATION's S-alias (never S0) and
10826        // uses the CORRECT signed/unsigned VCVT bases (previously swapped):
10827        // vmov s0,r3 ; vcvt.f64.s32 d0,s0
10828        let conv_s = enc
10829            .encode(&ArmOp::F64ConvertI32S {
10830                dd: VfpReg::D0,
10831                rm: Reg::R3,
10832            })
10833            .unwrap();
10834        assert_eq!(
10835            conv_s,
10836            vec![
10837                0x00, 0xee, 0x10, 0x3a, // vmov s0, r3
10838                0xb8, 0xee, 0xc0, 0x0b, // vcvt.f64.s32 d0, s0
10839            ]
10840        );
10841        let conv_u = enc
10842            .encode(&ArmOp::F64ConvertI32U {
10843                dd: VfpReg::D0,
10844                rm: Reg::R3,
10845            })
10846            .unwrap();
10847        assert_eq!(&conv_u[4..8], &[0xb8, 0xee, 0x40, 0x0b]); // vcvt.f64.u32
10848        // f64 -> i32 stages through the SOURCE's S-alias (never S0):
10849        // vcvt.s32.f64 s2,d1 ; vmov r3,s2
10850        let trunc_s = enc
10851            .encode(&ArmOp::I32TruncF64S {
10852                rd: Reg::R3,
10853                dm: VfpReg::D1,
10854            })
10855            .unwrap();
10856        assert_eq!(
10857            trunc_s,
10858            vec![
10859                0xbd, 0xee, 0xc1, 0x1b, // vcvt.s32.f64 s2, d1
10860                0x11, 0xee, 0x10, 0x3a, // vmov r3, s2
10861            ]
10862        );
10863        let trunc_u = enc
10864            .encode(&ArmOp::I32TruncF64U {
10865                rd: Reg::R3,
10866                dm: VfpReg::D1,
10867            })
10868            .unwrap();
10869        assert_eq!(&trunc_u[0..4], &[0xbc, 0xee, 0xc1, 0x1b]); // vcvt.u32.f64
10870        // f32.demote_f64: vcvt.f32.f64 s1, d2
10871        let demote = enc
10872            .encode(&ArmOp::F32DemoteF64 {
10873                sd: VfpReg::S1,
10874                dm: VfpReg::D2,
10875            })
10876            .unwrap();
10877        assert_eq!(demote, vec![0xf7, 0xee, 0xc2, 0x0b]);
10878    }
10879
10880    #[test]
10881    fn test_encode_f64_min_arm32() {
10882        let encoder = ArmEncoder::new_arm32();
10883        let op = ArmOp::F64Min {
10884            dd: VfpReg::D0,
10885            dn: VfpReg::D1,
10886            dm: VfpReg::D2,
10887        };
10888        let code = encoder.encode(&op).unwrap();
10889        // VMOV + VCMP + VMRS + conditional VMOV = 16
10890        assert_eq!(code.len(), 16);
10891    }
10892
10893    #[test]
10894    fn test_f64_cp11_encoding() {
10895        // Verify that F64 instructions use coprocessor 11 (0xB), not 10 (0xA)
10896        let encoder = ArmEncoder::new_arm32();
10897
10898        // F64Add
10899        let code = encoder
10900            .encode(&ArmOp::F64Add {
10901                dd: VfpReg::D0,
10902                dn: VfpReg::D0,
10903                dm: VfpReg::D0,
10904            })
10905            .unwrap();
10906        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10907        assert_eq!((instr >> 8) & 0xF, 0xB, "F64 should use cp11");
10908
10909        // F32Add for comparison
10910        let code = encoder
10911            .encode(&ArmOp::F32Add {
10912                sd: VfpReg::S0,
10913                sn: VfpReg::S0,
10914                sm: VfpReg::S0,
10915            })
10916            .unwrap();
10917        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10918        assert_eq!((instr >> 8) & 0xF, 0xA, "F32 should use cp10");
10919    }
10920
10921    #[test]
10922    fn test_dreg_encoding_higher_registers() {
10923        let encoder = ArmEncoder::new_arm32();
10924
10925        // Test with D15 (highest register)
10926        let op = ArmOp::F64Add {
10927            dd: VfpReg::D15,
10928            dn: VfpReg::D14,
10929            dm: VfpReg::D13,
10930        };
10931        let code = encoder.encode(&op).unwrap();
10932        assert_eq!(code.len(), 4);
10933
10934        // Verify the register encoding worked (instruction is valid)
10935        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10936        assert_eq!((instr >> 8) & 0xF, 0xB); // cp11
10937    }
10938
10939    // ========================================================================
10940    // Control flow encoding tests
10941    // ========================================================================
10942
10943    #[test]
10944    fn test_encode_label_emits_no_bytes() {
10945        let encoder = ArmEncoder::new_thumb2();
10946        let op = ArmOp::Label {
10947            name: ".Lblock_end_0".to_string(),
10948        };
10949        let code = encoder.encode(&op).unwrap();
10950        assert!(code.is_empty(), "Label should emit zero bytes");
10951
10952        let encoder32 = ArmEncoder::new_arm32();
10953        let code32 = encoder32.encode(&op).unwrap();
10954        assert!(
10955            code32.is_empty(),
10956            "Label should emit zero bytes in ARM32 too"
10957        );
10958    }
10959
10960    #[test]
10961    fn test_encode_bcc_eq_thumb2() {
10962        use synth_synthesis::Condition;
10963        let encoder = ArmEncoder::new_thumb2();
10964        let op = ArmOp::Bcc {
10965            cond: Condition::EQ,
10966            label: "target".to_string(),
10967        };
10968        let code = encoder.encode(&op).unwrap();
10969        assert_eq!(code.len(), 2); // 16-bit conditional branch
10970
10971        // BEQ with offset 0: 0xD000 in little-endian
10972        assert_eq!(code, vec![0x00, 0xD0]);
10973    }
10974
10975    #[test]
10976    fn test_encode_bcc_ne_thumb2() {
10977        use synth_synthesis::Condition;
10978        let encoder = ArmEncoder::new_thumb2();
10979        let op = ArmOp::Bcc {
10980            cond: Condition::NE,
10981            label: "target".to_string(),
10982        };
10983        let code = encoder.encode(&op).unwrap();
10984        assert_eq!(code.len(), 2);
10985
10986        // BNE with offset 0: 0xD100 in little-endian
10987        assert_eq!(code, vec![0x00, 0xD1]);
10988    }
10989
10990    #[test]
10991    fn test_encode_bcc_arm32() {
10992        use synth_synthesis::Condition;
10993        let encoder = ArmEncoder::new_arm32();
10994        let op = ArmOp::Bcc {
10995            cond: Condition::EQ,
10996            label: "target".to_string(),
10997        };
10998        let code = encoder.encode(&op).unwrap();
10999        assert_eq!(code.len(), 4); // 32-bit ARM instruction
11000
11001        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
11002        // BEQ: cond=0x0, opcode=0xA, offset=0
11003        assert_eq!(instr & 0xF0000000, 0x00000000); // EQ condition
11004        assert_eq!(instr & 0x0F000000, 0x0A000000); // Branch opcode
11005    }
11006
11007    #[test]
11008    fn test_encode_udf_thumb2() {
11009        let encoder = ArmEncoder::new_thumb2();
11010        let op = ArmOp::Udf { imm: 0 };
11011        let code = encoder.encode(&op).unwrap();
11012        assert_eq!(code.len(), 2); // 16-bit
11013
11014        // UDF #0: 0xDE00 in little-endian
11015        assert_eq!(code, vec![0x00, 0xDE]);
11016    }
11017
11018    /// #610: the i64 rot/div/rem expansions must land the result in the
11019    /// selector-assigned rd pair and leave R0-R3 preserved (restored from the
11020    /// fixed-ABI wrapper's save area) — pre-#610 the rot expansion's own
11021    /// `POP {R4}` restored stale scratch OVER the result (rd_lo == R4) and
11022    /// the div/rem expansions ignored their register fields outright.
11023    #[test]
11024    fn test_610_i64_rot_expansion_ends_with_rd_movs_and_restore() {
11025        let encoder = ArmEncoder::new_thumb2();
11026        for op in [
11027            ArmOp::I64Rotl {
11028                rdlo: Reg::R4,
11029                rdhi: Reg::R5,
11030                rnlo: Reg::R0,
11031                rnhi: Reg::R1,
11032                shift: Reg::R2,
11033            },
11034            ArmOp::I64Rotr {
11035                rdlo: Reg::R4,
11036                rdhi: Reg::R5,
11037                rnlo: Reg::R0,
11038                rnhi: Reg::R1,
11039                shift: Reg::R2,
11040            },
11041        ] {
11042            let code = encoder.encode(&op).unwrap();
11043            assert_eq!(code.len(), 102, "register-independent size (estimator pin)");
11044            // Tail: MOV r5, r1 (0x460D); MOV r4, r0 (0x4604); POP {r0..r3}
11045            // (rd pair r4:r5 does not overlap the save area — all 4 restored).
11046            let tail: Vec<u16> = code[code.len() - 12..]
11047                .chunks(2)
11048                .map(|c| u16::from_le_bytes([c[0], c[1]]))
11049                .collect();
11050            assert_eq!(tail, vec![0x460D, 0x4604, 0xBC01, 0xBC02, 0xBC04, 0xBC08]);
11051        }
11052    }
11053
11054    /// #610: div/rem expansions honor rd and carry the divide-by-zero trap
11055    /// guard (`ORRS R12, R2, R3; BNE +0; UDF #0`) after operand marshaling.
11056    #[test]
11057    fn test_610_i64_div_rem_expansion_guard_and_rd() {
11058        let encoder = ArmEncoder::new_thumb2();
11059        let mk = |which: u8| {
11060            let (rdlo, rdhi, rnlo, rnhi, rmlo, rmhi) =
11061                (Reg::R4, Reg::R5, Reg::R0, Reg::R1, Reg::R2, Reg::R3);
11062            match which {
11063                0 => ArmOp::I64DivU {
11064                    rdlo,
11065                    rdhi,
11066                    rnlo,
11067                    rnhi,
11068                    rmlo,
11069                    rmhi,
11070                    elide_zero_guard: false,
11071                },
11072                1 => ArmOp::I64RemU {
11073                    rdlo,
11074                    rdhi,
11075                    rnlo,
11076                    rnhi,
11077                    rmlo,
11078                    rmhi,
11079                    elide_zero_guard: false,
11080                },
11081                2 => ArmOp::I64DivS {
11082                    rdlo,
11083                    rdhi,
11084                    rnlo,
11085                    rnhi,
11086                    rmlo,
11087                    rmhi,
11088                    elide_zero_guard: false,
11089                    elide_overflow_guard: false,
11090                },
11091                _ => ArmOp::I64RemS {
11092                    rdlo,
11093                    rdhi,
11094                    rnlo,
11095                    rnhi,
11096                    rmlo,
11097                    rmhi,
11098                    elide_zero_guard: false,
11099                },
11100            }
11101        };
11102        for which in 0..4u8 {
11103            let code = encoder.encode(&mk(which)).unwrap();
11104            // Zero-divisor trap guard right after the 26-byte marshal prologue.
11105            let guard: Vec<u16> = code[26..34]
11106                .chunks(2)
11107                .map(|c| u16::from_le_bytes([c[0], c[1]]))
11108                .collect();
11109            assert_eq!(
11110                guard,
11111                vec![0xEA52, 0x0C03, 0xD100, 0xDE00],
11112                "ORRS R12,R2,R3; BNE +0; UDF #0"
11113            );
11114            // Tail: result into rd pair (r5:r4), then restore all of R0-R3.
11115            let tail: Vec<u16> = code[code.len() - 12..]
11116                .chunks(2)
11117                .map(|c| u16::from_le_bytes([c[0], c[1]]))
11118                .collect();
11119            assert_eq!(tail, vec![0x460D, 0x4604, 0xBC01, 0xBC02, 0xBC04, 0xBC08]);
11120        }
11121    }
11122
11123    /// #610: when rd overlaps R0-R3 the restore must SKIP the result
11124    /// registers (drop the saved caller word) instead of popping over them.
11125    #[test]
11126    fn test_610_i64_divu_rd_in_r0_r1_skips_restore() {
11127        let encoder = ArmEncoder::new_thumb2();
11128        let code = encoder
11129            .encode(&ArmOp::I64DivU {
11130                rdlo: Reg::R0,
11131                rdhi: Reg::R1,
11132                rnlo: Reg::R0,
11133                rnhi: Reg::R1,
11134                rmlo: Reg::R2,
11135                rmhi: Reg::R3,
11136                elide_zero_guard: false,
11137            })
11138            .unwrap();
11139        let tail: Vec<u16> = code[code.len() - 12..]
11140            .chunks(2)
11141            .map(|c| u16::from_le_bytes([c[0], c[1]]))
11142            .collect();
11143        // MOV r1,r1 / MOV r0,r0 (no-ops, size-stable), ADD SP,#4 twice
11144        // (discard saved r0/r1 — the result lives there), POP {r2}, POP {r3}.
11145        assert_eq!(tail, vec![0x4609, 0x4600, 0xB001, 0xB001, 0xBC04, 0xBC08]);
11146    }
11147
11148    /// #610: a fully swapped rd pair (rd_lo=R1, rd_hi=R0) cannot be
11149    /// materialized by two MOVs in either order — must be a loud Err, never
11150    /// silent corruption. (Selector pairs are consecutive, so unreachable.)
11151    #[test]
11152    fn test_610_i64_swapped_rd_pair_rejected() {
11153        let encoder = ArmEncoder::new_thumb2();
11154        let result = encoder.encode(&ArmOp::I64RemU {
11155            rdlo: Reg::R1,
11156            rdhi: Reg::R0,
11157            rnlo: Reg::R2,
11158            rnhi: Reg::R3,
11159            rmlo: Reg::R4,
11160            rmhi: Reg::R5,
11161            elide_zero_guard: false,
11162        });
11163        assert!(result.is_err(), "swapped rd pair must be rejected loudly");
11164    }
11165
11166    /// #632: the I64Popcnt expansion's own scratch restore (`POP {R3,R4,R5}`)
11167    /// must not clobber the result. Pre-fix the total was materialized with
11168    /// `ADDS rd, R4, R5` BEFORE the pop, so any allocator-assigned
11169    /// rd ∈ {R3,R4,R5} received stale stack garbage. Post-fix the count is
11170    /// carried across the restore in R12 (never allocatable, never restored)
11171    /// and moved into rd only after the pop — structurally rd-independent.
11172    #[test]
11173    fn test_632_i64_popcnt_result_survives_scratch_restore() {
11174        let encoder = ArmEncoder::new_thumb2();
11175        // Every allocatable rd, including the restore set {R3,R4,R5} and R8.
11176        for rd in [
11177            Reg::R0,
11178            Reg::R2,
11179            Reg::R3,
11180            Reg::R4,
11181            Reg::R5,
11182            Reg::R6,
11183            Reg::R8,
11184        ] {
11185            let code = encoder
11186                .encode(&ArmOp::I64Popcnt {
11187                    rd,
11188                    rnlo: Reg::R6,
11189                    rnhi: Reg::R7,
11190                })
11191                .unwrap();
11192            assert_eq!(code.len(), 180, "register-independent size (estimator pin)");
11193            let hw: Vec<u16> = code
11194                .chunks(2)
11195                .map(|c| u16::from_le_bytes([c[0], c[1]]))
11196                .collect();
11197            let pop = hw
11198                .iter()
11199                .position(|&h| h == 0xBC38)
11200                .expect("POP {R3,R4,R5} present");
11201            // Immediately before the POP: ADD.W R12, R4, R5 (the total lives
11202            // in R12, which the POP cannot touch).
11203            assert_eq!(
11204                &hw[pop - 2..pop],
11205                &[0xEB04, 0x0C05],
11206                "total must be carried in R12 across the restore"
11207            );
11208            // Immediately after the POP: MOV rd, R12.
11209            let rd_bits = match rd {
11210                Reg::R8 => 8u16,
11211                Reg::R6 => 6,
11212                Reg::R5 => 5,
11213                Reg::R4 => 4,
11214                Reg::R3 => 3,
11215                Reg::R2 => 2,
11216                _ => 0,
11217            };
11218            let expect_mov = 0x4600 | (((rd_bits >> 3) & 1) << 7) | (12 << 3) | (rd_bits & 7);
11219            assert_eq!(hw[pop + 1], expect_mov, "MOV rd, R12 after the restore");
11220            // No write into rd between the PUSH and the POP (the old
11221            // pre-restore ADDS is gone).
11222            assert!(
11223                !hw[..pop].contains(&(0x1800 | (5 << 6) | (4 << 3) | rd_bits)),
11224                "no ADDS rd, R4, R5 before the restore pop"
11225            );
11226        }
11227    }
11228
11229    /// #632 audit: the entry marshal must be permutation-safe. Pre-fix
11230    /// `MOV R4, rnlo; MOV R5, rnhi` read a clobbered R4 when the operand
11231    /// pair lived at (R3, R4). Post-fix rnlo routes through R12.
11232    #[test]
11233    fn test_632_i64_popcnt_marshal_pair_at_r3_r4() {
11234        let encoder = ArmEncoder::new_thumb2();
11235        let code = encoder
11236            .encode(&ArmOp::I64Popcnt {
11237                rd: Reg::R0,
11238                rnlo: Reg::R3,
11239                rnhi: Reg::R4,
11240            })
11241            .unwrap();
11242        let hw: Vec<u16> = code
11243            .chunks(2)
11244            .map(|c| u16::from_le_bytes([c[0], c[1]]))
11245            .collect();
11246        // PUSH {R3,R4,R5}; MOV R12, R3; MOV R5, R4 (rnhi read BEFORE any
11247        // write to R4); MOV R4, R12.
11248        assert_eq!(hw[0], 0xB438);
11249        assert_eq!(hw[1], 0x4600 | (1 << 7) | (3 << 3) | 4, "MOV R12, rnlo");
11250        assert_eq!(hw[2], 0x4600 | (4 << 3) | 5, "MOV R5, rnhi");
11251        assert_eq!(hw[3], 0x4664, "MOV R4, R12");
11252    }
11253
11254    /// #632: A32 twin — same structural fix on the ARM-mode path
11255    /// (`--target cortex-r5`): total carried in R12 across the restore.
11256    #[test]
11257    fn test_632_a32_i64_popcnt_result_survives_scratch_restore() {
11258        let encoder = ArmEncoder::new_arm32();
11259        for rd in [Reg::R0, Reg::R3, Reg::R4, Reg::R5, Reg::R8] {
11260            let code = encoder
11261                .encode(&ArmOp::I64Popcnt {
11262                    rd,
11263                    rnlo: Reg::R6,
11264                    rnhi: Reg::R7,
11265                })
11266                .unwrap();
11267            let words: Vec<u32> = code
11268                .chunks(4)
11269                .map(|c| u32::from_le_bytes([c[0], c[1], c[2], c[3]]))
11270                .collect();
11271            let pop = words
11272                .iter()
11273                .position(|&w| w == 0xE8BD_0038)
11274                .expect("POP {R3,R4,R5} present");
11275            assert_eq!(words[pop - 1], 0xE084_C005, "ADD R12, R4, R5 before POP");
11276            let rd_bits = match rd {
11277                Reg::R8 => 8u32,
11278                Reg::R5 => 5,
11279                Reg::R4 => 4,
11280                Reg::R3 => 3,
11281                _ => 0,
11282            };
11283            assert_eq!(
11284                words[pop + 1],
11285                0xE1A0_0000 | (rd_bits << 12) | 12,
11286                "MOV rd, R12 after the restore"
11287            );
11288        }
11289    }
11290
11291    /// #633: I64DivS must carry the INT64_MIN/-1 overflow guard (mirroring
11292    /// the i32 path) right after the zero-divisor guard — dividend in R0:R1,
11293    /// divisor in R2:R3 on the #610/#613 fixed-ABI wrapper path.
11294    #[test]
11295    fn test_633_i64_divs_overflow_guard_emitted() {
11296        let encoder = ArmEncoder::new_thumb2();
11297        let code = encoder
11298            .encode(&ArmOp::I64DivS {
11299                rdlo: Reg::R4,
11300                rdhi: Reg::R5,
11301                rnlo: Reg::R0,
11302                rnhi: Reg::R1,
11303                rmlo: Reg::R2,
11304                rmhi: Reg::R3,
11305                elide_zero_guard: false,
11306                elide_overflow_guard: false,
11307            })
11308            .unwrap();
11309        // 26-byte marshal + 8-byte zero-trap, then the 22-byte overflow guard.
11310        let guard: Vec<u16> = code[34..56]
11311            .chunks(2)
11312            .map(|c| u16::from_le_bytes([c[0], c[1]]))
11313            .collect();
11314        assert_eq!(
11315            guard,
11316            vec![
11317                0xEA02, 0x0C03, // AND.W R12, R2, R3
11318                0xF11C, 0x0F01, // CMN.W R12, #1
11319                0xD105, // BNE .no_trap
11320                0x2800, // CMP R0, #0
11321                0xD103, // BNE .no_trap
11322                0xF1B1, 0x4F00, // CMP.W R1, #0x80000000
11323                0xD100, // BNE .no_trap
11324                0xDE00, // UDF #0 — signed-division overflow
11325            ],
11326            "INT64_MIN/-1 overflow guard after the zero-divisor guard"
11327        );
11328    }
11329
11330    /// #633 fix-guard twin: I64RemS must NOT carry the overflow guard —
11331    /// rem_s(INT64_MIN, -1) is defined as 0 and must not trap. Exactly one
11332    /// UDF (the zero-divisor trap) in the whole expansion.
11333    #[test]
11334    fn test_633_i64_rems_has_no_overflow_guard() {
11335        let encoder = ArmEncoder::new_thumb2();
11336        for (is_rem_s, op) in [
11337            (
11338                true,
11339                ArmOp::I64RemS {
11340                    rdlo: Reg::R4,
11341                    rdhi: Reg::R5,
11342                    rnlo: Reg::R0,
11343                    rnhi: Reg::R1,
11344                    rmlo: Reg::R2,
11345                    rmhi: Reg::R3,
11346                    elide_zero_guard: false,
11347                },
11348            ),
11349            (
11350                false,
11351                ArmOp::I64DivS {
11352                    rdlo: Reg::R4,
11353                    rdhi: Reg::R5,
11354                    rnlo: Reg::R0,
11355                    rnhi: Reg::R1,
11356                    rmlo: Reg::R2,
11357                    rmhi: Reg::R3,
11358                    elide_zero_guard: false,
11359                    elide_overflow_guard: false,
11360                },
11361            ),
11362        ] {
11363            let code = encoder.encode(&op).unwrap();
11364            let udfs = code
11365                .chunks(2)
11366                .filter(|c| u16::from_le_bytes([c[0], c[1]]) == 0xDE00)
11367                .count();
11368            let want = if is_rem_s { 1 } else { 2 };
11369            assert_eq!(
11370                udfs, want,
11371                "rem_s: zero-trap only; div_s: zero-trap + overflow trap"
11372            );
11373        }
11374    }
11375
11376    /// #494 phase 2b: `elide_zero_guard` drops EXACTLY the 8-byte fused
11377    /// zero-trap (`ORRS.W R12,R2,R3; BNE; UDF #0`) and nothing else — the
11378    /// rest of the expansion is byte-identical (splice check).
11379    #[test]
11380    fn test_494_i64_zero_guard_elision_is_exact_splice() {
11381        let encoder = ArmEncoder::new_thumb2();
11382        let mk = |elide_zero_guard: bool| {
11383            encoder
11384                .encode(&ArmOp::I64DivU {
11385                    rdlo: Reg::R4,
11386                    rdhi: Reg::R5,
11387                    rnlo: Reg::R0,
11388                    rnhi: Reg::R1,
11389                    rmlo: Reg::R2,
11390                    rmhi: Reg::R3,
11391                    elide_zero_guard,
11392                })
11393                .unwrap()
11394        };
11395        let full = mk(false);
11396        let elided = mk(true);
11397        assert_eq!(full.len(), elided.len() + 8, "zero guard is 8 bytes");
11398        // Marshal prologue (26 B) unchanged, guard (8 B) gone, tail identical.
11399        assert_eq!(&full[..26], &elided[..26]);
11400        assert_eq!(
11401            &full[26..34],
11402            &[0x52, 0xEA, 0x03, 0x0C, 0x00, 0xD1, 0x00, 0xDE],
11403            "the spliced-out bytes are exactly ORRS.W; BNE; UDF #0"
11404        );
11405        assert_eq!(&full[34..], &elided[26..]);
11406    }
11407
11408    /// #494 phase 2b two-guard distinction (the #633/#634 synergy): a
11409    /// divisor-nonzero fact elides ONLY the zero guard — the INT64_MIN/-1
11410    /// OVERFLOW guard is a separate obligation and must survive
11411    /// `elide_zero_guard: true`. Pinned on div_s in all flag states.
11412    #[test]
11413    fn test_494_i64_divs_overflow_guard_retained_when_only_zero_elided() {
11414        let encoder = ArmEncoder::new_thumb2();
11415        let mk = |zero: bool, ovf: bool| {
11416            encoder
11417                .encode(&ArmOp::I64DivS {
11418                    rdlo: Reg::R4,
11419                    rdhi: Reg::R5,
11420                    rnlo: Reg::R0,
11421                    rnhi: Reg::R1,
11422                    rmlo: Reg::R2,
11423                    rmhi: Reg::R3,
11424                    elide_zero_guard: zero,
11425                    elide_overflow_guard: ovf,
11426                })
11427                .unwrap()
11428        };
11429        let udf_count = |code: &[u8]| {
11430            code.chunks(2)
11431                .filter(|c| u16::from_le_bytes([c[0], c[1]]) == 0xDE00)
11432                .count()
11433        };
11434        let full = mk(false, false);
11435        let zero_only = mk(true, false);
11436        let both = mk(true, true);
11437        assert_eq!(udf_count(&full), 2, "baseline: zero trap + overflow trap");
11438        assert_eq!(
11439            udf_count(&zero_only),
11440            1,
11441            "divisor-nonzero elides the zero trap ONLY — the #633 overflow \
11442             guard must be retained"
11443        );
11444        // The retained guard is the 22-byte overflow sequence, now right
11445        // after the 26-byte marshal prologue.
11446        let guard: Vec<u16> = zero_only[26..48]
11447            .chunks(2)
11448            .map(|c| u16::from_le_bytes([c[0], c[1]]))
11449            .collect();
11450        assert_eq!(
11451            guard,
11452            vec![
11453                0xEA02, 0x0C03, 0xF11C, 0x0F01, 0xD105, 0x2800, 0xD103, 0xF1B1, 0x4F00, 0xD100,
11454                0xDE00,
11455            ],
11456            "the surviving guard is the INT64_MIN/-1 overflow trap"
11457        );
11458        assert_eq!(full.len(), zero_only.len() + 8);
11459        assert_eq!(zero_only.len(), both.len() + 22);
11460        assert_eq!(udf_count(&both), 0, "both obligations discharged ⇒ no UDF");
11461    }
11462
11463    /// #494 phase 2b A32 twin: zero-guard elision is an exact 12-byte splice
11464    /// and the A32 overflow guard survives a zero-only elision.
11465    #[test]
11466    fn test_494_a32_i64_guard_elision() {
11467        let encoder = ArmEncoder::new_arm32();
11468        let mk = |zero: bool, ovf: bool| {
11469            encoder
11470                .encode(&ArmOp::I64DivS {
11471                    rdlo: Reg::R4,
11472                    rdhi: Reg::R5,
11473                    rnlo: Reg::R0,
11474                    rnhi: Reg::R1,
11475                    rmlo: Reg::R2,
11476                    rmhi: Reg::R3,
11477                    elide_zero_guard: zero,
11478                    elide_overflow_guard: ovf,
11479                })
11480                .unwrap()
11481        };
11482        let full = mk(false, false);
11483        let zero_only = mk(true, false);
11484        let both = mk(true, true);
11485        // A32 zero guard = 3 words (ORRS/BNE/UDF), overflow guard = 6 words.
11486        assert_eq!(full.len(), zero_only.len() + 12);
11487        assert_eq!(zero_only.len(), both.len() + 24);
11488        let udf_count = |code: &[u8]| {
11489            code.chunks(4)
11490                .filter(|c| u32::from_le_bytes([c[0], c[1], c[2], c[3]]) == 0xE7F0_00F0)
11491                .count()
11492        };
11493        assert_eq!(udf_count(&full), 2);
11494        assert_eq!(
11495            udf_count(&zero_only),
11496            1,
11497            "A32: overflow guard retained under zero-only elision"
11498        );
11499        assert_eq!(udf_count(&both), 0);
11500    }
11501
11502    /// #633: A32 twin — the conditional-execution overflow guard on the
11503    /// ARM-mode I64DivS, and its absence from I64RemS.
11504    #[test]
11505    fn test_633_a32_i64_divs_overflow_guard() {
11506        let encoder = ArmEncoder::new_arm32();
11507        let mk_divs = ArmOp::I64DivS {
11508            rdlo: Reg::R4,
11509            rdhi: Reg::R5,
11510            rnlo: Reg::R0,
11511            rnhi: Reg::R1,
11512            rmlo: Reg::R2,
11513            rmhi: Reg::R3,
11514            elide_zero_guard: false,
11515            elide_overflow_guard: false,
11516        };
11517        let code = encoder.encode(&mk_divs).unwrap();
11518        let words: Vec<u32> = code
11519            .chunks(4)
11520            .map(|c| u32::from_le_bytes([c[0], c[1], c[2], c[3]]))
11521            .collect();
11522        let guard = [
11523            0xE002_C003u32, // AND   R12, R2, R3
11524            0xE37C_0001,    // CMN   R12, #1
11525            0x0350_0000,    // CMPEQ R0, #0
11526            0x0351_0102,    // CMPEQ R1, #0x80000000
11527            0x1A00_0000,    // BNE +1 insn
11528            0xE7F0_00F0,    // UDF #0
11529        ];
11530        assert!(
11531            words.windows(6).any(|w| w == guard),
11532            "A32 I64DivS carries the INT64_MIN/-1 overflow guard"
11533        );
11534        let rems = encoder
11535            .encode(&ArmOp::I64RemS {
11536                rdlo: Reg::R4,
11537                rdhi: Reg::R5,
11538                rnlo: Reg::R0,
11539                rnhi: Reg::R1,
11540                rmlo: Reg::R2,
11541                rmhi: Reg::R3,
11542                elide_zero_guard: false,
11543            })
11544            .unwrap();
11545        let rems_udfs = rems
11546            .chunks(4)
11547            .filter(|c| u32::from_le_bytes([c[0], c[1], c[2], c[3]]) == 0xE7F0_00F0)
11548            .count();
11549        assert_eq!(rems_udfs, 1, "A32 I64RemS keeps only the zero-divisor trap");
11550    }
11551
11552    #[test]
11553    fn test_encode_nop_thumb2() {
11554        let encoder = ArmEncoder::new_thumb2();
11555        let op = ArmOp::Nop;
11556        let code = encoder.encode(&op).unwrap();
11557        assert_eq!(code.len(), 2); // 16-bit
11558
11559        // NOP: 0xBF00 in little-endian
11560        assert_eq!(code, vec![0x00, 0xBF]);
11561    }
11562
11563    // =========================================================================
11564    // i64 Thumb-2 encoding tests
11565    // =========================================================================
11566
11567    #[test]
11568    fn test_encode_i64_add_thumb2() {
11569        let encoder = ArmEncoder::new_thumb2();
11570        let op = ArmOp::I64Add {
11571            rdlo: Reg::R0,
11572            rdhi: Reg::R1,
11573            rnlo: Reg::R0,
11574            rnhi: Reg::R1,
11575            rmlo: Reg::R2,
11576            rmhi: Reg::R3,
11577        };
11578        let code = encoder.encode(&op).unwrap();
11579        // Should emit ADDS (2 bytes) + ADC.W (4 bytes) = 6 bytes
11580        assert_eq!(code.len(), 6, "I64Add should be 6 bytes (ADDS + ADC.W)");
11581    }
11582
11583    #[test]
11584    fn test_encode_i64_sub_thumb2() {
11585        let encoder = ArmEncoder::new_thumb2();
11586        let op = ArmOp::I64Sub {
11587            rdlo: Reg::R0,
11588            rdhi: Reg::R1,
11589            rnlo: Reg::R0,
11590            rnhi: Reg::R1,
11591            rmlo: Reg::R2,
11592            rmhi: Reg::R3,
11593        };
11594        let code = encoder.encode(&op).unwrap();
11595        // Should emit SUBS (2 bytes) + SBC.W (4 bytes) = 6 bytes
11596        assert_eq!(code.len(), 6, "I64Sub should be 6 bytes (SUBS + SBC.W)");
11597    }
11598
11599    #[test]
11600    fn test_encode_i64_and_thumb2() {
11601        let encoder = ArmEncoder::new_thumb2();
11602        let op = ArmOp::I64And {
11603            rdlo: Reg::R0,
11604            rdhi: Reg::R1,
11605            rnlo: Reg::R0,
11606            rnhi: Reg::R1,
11607            rmlo: Reg::R2,
11608            rmhi: Reg::R3,
11609        };
11610        let code = encoder.encode(&op).unwrap();
11611        // AND.W (4 bytes) + AND.W (4 bytes) = 8 bytes
11612        assert!(code.len() >= 4, "I64And should emit at least 4 bytes");
11613    }
11614
11615    #[test]
11616    fn test_encode_i64_or_thumb2() {
11617        let encoder = ArmEncoder::new_thumb2();
11618        let op = ArmOp::I64Or {
11619            rdlo: Reg::R0,
11620            rdhi: Reg::R1,
11621            rnlo: Reg::R0,
11622            rnhi: Reg::R1,
11623            rmlo: Reg::R2,
11624            rmhi: Reg::R3,
11625        };
11626        let code = encoder.encode(&op).unwrap();
11627        assert!(code.len() >= 4, "I64Or should emit at least 4 bytes");
11628    }
11629
11630    #[test]
11631    fn test_encode_i64_xor_thumb2() {
11632        let encoder = ArmEncoder::new_thumb2();
11633        let op = ArmOp::I64Xor {
11634            rdlo: Reg::R0,
11635            rdhi: Reg::R1,
11636            rnlo: Reg::R0,
11637            rnhi: Reg::R1,
11638            rmlo: Reg::R2,
11639            rmhi: Reg::R3,
11640        };
11641        let code = encoder.encode(&op).unwrap();
11642        assert!(code.len() >= 4, "I64Xor should emit at least 4 bytes");
11643    }
11644
11645    #[test]
11646    fn test_encode_i64_const_small_thumb2() {
11647        let encoder = ArmEncoder::new_thumb2();
11648        // Small constant: only needs MOVW for each half
11649        let op = ArmOp::I64Const {
11650            rdlo: Reg::R0,
11651            rdhi: Reg::R1,
11652            value: 42,
11653        };
11654        let code = encoder.encode(&op).unwrap();
11655        // MOVW R0, #42 (4 bytes) + MOVW R1, #0 (4 bytes) = 8 bytes minimum
11656        assert!(code.len() >= 8, "I64Const should emit at least 8 bytes");
11657    }
11658
11659    #[test]
11660    fn test_encode_i64_const_large_thumb2() {
11661        let encoder = ArmEncoder::new_thumb2();
11662        // Large constant: needs MOVW+MOVT for each half
11663        let op = ArmOp::I64Const {
11664            rdlo: Reg::R0,
11665            rdhi: Reg::R1,
11666            value: 0x1234_5678_9ABC_DEF0_u64 as i64,
11667        };
11668        let code = encoder.encode(&op).unwrap();
11669        // MOVW + MOVT for lo (8 bytes) + MOVW + MOVT for hi (8 bytes) = 16 bytes
11670        assert_eq!(
11671            code.len(),
11672            16,
11673            "I64Const with large value should be 16 bytes"
11674        );
11675    }
11676
11677    #[test]
11678    fn test_encode_i64_extend_i32_s_thumb2() {
11679        let encoder = ArmEncoder::new_thumb2();
11680        let op = ArmOp::I64ExtendI32S {
11681            rdlo: Reg::R0,
11682            rdhi: Reg::R1,
11683            rn: Reg::R0,
11684        };
11685        let code = encoder.encode(&op).unwrap();
11686        // When rdlo == rn, only ASR (4 bytes) is emitted
11687        assert_eq!(
11688            code.len(),
11689            4,
11690            "I64ExtendI32S (same reg) should be 4 bytes (ASR only)"
11691        );
11692    }
11693
11694    #[test]
11695    fn test_encode_i64_extend_i32_s_diff_reg_thumb2() {
11696        let encoder = ArmEncoder::new_thumb2();
11697        let op = ArmOp::I64ExtendI32S {
11698            rdlo: Reg::R0,
11699            rdhi: Reg::R1,
11700            rn: Reg::R2,
11701        };
11702        let code = encoder.encode(&op).unwrap();
11703        // MOV rdlo, rn (2 bytes for low regs) + ASR rdhi, rdlo, #31 (4 bytes) = 6 bytes
11704        assert!(
11705            code.len() >= 6,
11706            "I64ExtendI32S (diff reg) should be at least 6 bytes"
11707        );
11708    }
11709
11710    #[test]
11711    fn test_encode_i64_extend_i32_u_thumb2() {
11712        let encoder = ArmEncoder::new_thumb2();
11713        let op = ArmOp::I64ExtendI32U {
11714            rdlo: Reg::R0,
11715            rdhi: Reg::R1,
11716            rn: Reg::R0,
11717        };
11718        let code = encoder.encode(&op).unwrap();
11719        // When rdlo == rn, only MOV rdhi, #0 (2 bytes) is emitted
11720        assert_eq!(
11721            code.len(),
11722            2,
11723            "I64ExtendI32U (same reg) should be 2 bytes (MOV #0 only)"
11724        );
11725    }
11726
11727    #[test]
11728    fn test_encode_i32_wrap_i64_nop_thumb2() {
11729        let encoder = ArmEncoder::new_thumb2();
11730        // When rd == rnlo, should be a NOP
11731        let op = ArmOp::I32WrapI64 {
11732            rd: Reg::R0,
11733            rnlo: Reg::R0,
11734        };
11735        let code = encoder.encode(&op).unwrap();
11736        assert_eq!(code.len(), 2, "I32WrapI64 same reg should be NOP (2 bytes)");
11737        assert_eq!(code, vec![0x00, 0xBF]); // NOP
11738    }
11739
11740    #[test]
11741    fn test_encode_i32_wrap_i64_diff_reg_thumb2() {
11742        let encoder = ArmEncoder::new_thumb2();
11743        let op = ArmOp::I32WrapI64 {
11744            rd: Reg::R2,
11745            rnlo: Reg::R0,
11746        };
11747        let code = encoder.encode(&op).unwrap();
11748        // MOV R2, R0 (2 or 4 bytes)
11749        assert!(
11750            code.len() >= 2,
11751            "I32WrapI64 diff reg should emit at least 2 bytes"
11752        );
11753    }
11754
11755    #[test]
11756    fn test_encode_i64_eqz_thumb2() {
11757        let encoder = ArmEncoder::new_thumb2();
11758        let op = ArmOp::I64Eqz {
11759            rd: Reg::R0,
11760            rnlo: Reg::R0,
11761            rnhi: Reg::R1,
11762        };
11763        let code = encoder.encode(&op).unwrap();
11764        // Delegates to I64SetCondZ which is already encoded
11765        assert!(
11766            code.len() >= 6,
11767            "I64Eqz should emit at least 6 bytes for ORR+ITE+MOV+MOV"
11768        );
11769    }
11770
11771    #[test]
11772    fn test_encode_i64_eq_thumb2() {
11773        let encoder = ArmEncoder::new_thumb2();
11774        let op = ArmOp::I64Eq {
11775            rd: Reg::R0,
11776            rnlo: Reg::R0,
11777            rnhi: Reg::R1,
11778            rmlo: Reg::R2,
11779            rmhi: Reg::R3,
11780        };
11781        let code = encoder.encode(&op).unwrap();
11782        // Delegates to I64SetCond EQ: CMP lo + IT EQ + CMPEQ hi + ITE EQ + MOV 1 + MOV 0
11783        assert!(code.len() >= 10, "I64Eq should emit at least 10 bytes");
11784    }
11785
11786    #[test]
11787    fn test_encode_i64_ldr_thumb2() {
11788        let encoder = ArmEncoder::new_thumb2();
11789        let op = ArmOp::I64Ldr {
11790            rdlo: Reg::R0,
11791            rdhi: Reg::R1,
11792            addr: MemAddr::imm(Reg::SP, 0),
11793        };
11794        let code = encoder.encode(&op).unwrap();
11795        // Two LDR instructions (lo at offset, hi at offset+4)
11796        assert!(code.len() >= 4, "I64Ldr should emit at least 4 bytes");
11797    }
11798
11799    #[test]
11800    fn test_372_i64_ldr_indexed_materializes_address() {
11801        // #372: a memory i64.load carries an index register (R11 + addr + off).
11802        // The encoder must materialize `ip = base + index` (ADD.W) and load via
11803        // `[ip,#off]` — NOT drop the index. A frame (non-indexed) i64.load must
11804        // stay byte-identical (plain `[base,#off]`, no ADD).
11805        let encoder = ArmEncoder::new_thumb2();
11806        let indexed = encoder
11807            .encode(&ArmOp::I64Ldr {
11808                rdlo: Reg::R0,
11809                rdhi: Reg::R1,
11810                addr: MemAddr::reg_imm(Reg::R11, Reg::R0, 0),
11811            })
11812            .unwrap();
11813        // ADD.W ip, fp, r0 = eb0b 0c00 (byte-verified vs arm-none-eabi-as).
11814        assert_eq!(
11815            &indexed[0..4],
11816            &[0x0b, 0xeb, 0x00, 0x0c],
11817            "indexed I64Ldr must start with ADD.W ip, base, index"
11818        );
11819        let frame = encoder
11820            .encode(&ArmOp::I64Ldr {
11821                rdlo: Reg::R0,
11822                rdhi: Reg::R1,
11823                addr: MemAddr::imm(Reg::SP, 8),
11824            })
11825            .unwrap();
11826        // No index -> no ADD.W prefix (byte-identical frame access).
11827        assert_ne!(
11828            &frame[0..2],
11829            &[0x0b, 0xeb],
11830            "frame (non-indexed) I64Ldr must NOT emit an ADD.W"
11831        );
11832    }
11833
11834    #[test]
11835    fn test_382_i64_ldst_large_offset_materializes_not_skips() {
11836        // #382: an indexed i64.load/store whose static offset > 0xFFF must
11837        // MATERIALIZE the offset into the base — NOT return Err (skip the fn).
11838        // Sequence for reg_imm(R11, R0, 5000): MOVW ip,#5000 ; ADD ip,r0,ip ;
11839        // ADD ip,ip,fp ; LDR/STR halves at [ip,#0] / [ip,#4]. Byte-verified tail
11840        // vs arm-none-eabi-as.
11841        let encoder = ArmEncoder::new_thumb2();
11842        // 0x1388 > 0xFFF (MemAddr is not Copy, so build it per use).
11843
11844        let ld = encoder
11845            .encode(&ArmOp::I64Ldr {
11846                rdlo: Reg::R0,
11847                rdhi: Reg::R1,
11848                addr: MemAddr::reg_imm(Reg::R11, Reg::R0, 5000),
11849            })
11850            .expect("large-offset i64.load must lower, not skip");
11851        // MOVW ip,#0x1388 (4) + ADD ip,r0,ip (4) + ADD ip,ip,fp (4) + 2 LDR (8).
11852        assert_eq!(ld.len(), 20, "expected MOVW + 2×ADD + 2×LDR");
11853        // Must NOT be the small-offset `ADD.W ip, fp, r0` (0x0b 0xeb) prefix —
11854        // that path can only reach imm12 offsets.
11855        assert_ne!(
11856            &ld[0..2],
11857            &[0x0b, 0xeb],
11858            "must materialize the large offset"
11859        );
11860        // Effective base built in ip, then halves at [ip,#0] / [ip,#4].
11861        assert_eq!(
11862            &ld[4..20],
11863            &[
11864                0x00, 0xeb, 0x0c, 0x0c, // ADD.W ip, r0, ip
11865                0x0c, 0xeb, 0x0b, 0x0c, // ADD.W ip, ip, fp
11866                0xdc, 0xf8, 0x00, 0x00, // LDR.W r0, [ip, #0]
11867                0xdc, 0xf8, 0x04, 0x10, // LDR.W r1, [ip, #4]
11868            ],
11869            "large-offset i64.load must fold offset into ip and access [ip,#0]/[ip,#4]"
11870        );
11871
11872        // Store: same base materialization, STR halves.
11873        let st = encoder
11874            .encode(&ArmOp::I64Str {
11875                rdlo: Reg::R2,
11876                rdhi: Reg::R3,
11877                addr: MemAddr::reg_imm(Reg::R11, Reg::R0, 5000),
11878            })
11879            .expect("large-offset i64.store must lower, not skip");
11880        assert_eq!(st.len(), 20);
11881        assert_eq!(
11882            &st[4..20],
11883            &[
11884                0x00, 0xeb, 0x0c, 0x0c, // ADD.W ip, r0, ip
11885                0x0c, 0xeb, 0x0b, 0x0c, // ADD.W ip, ip, fp
11886                0xcc, 0xf8, 0x00, 0x20, // STR.W r2, [ip, #0]
11887                0xcc, 0xf8, 0x04, 0x30, // STR.W r3, [ip, #4]
11888            ],
11889            "large-offset i64.store must fold offset into ip and access [ip,#0]/[ip,#4]"
11890        );
11891
11892        // Small-offset (imm12) indexed access stays byte-identical (#372): the
11893        // effective base is a single `ADD.W ip, fp, r0` and the halves keep the
11894        // folded immediates — NO extra MOVW/ADD.
11895        let small = encoder
11896            .encode(&ArmOp::I64Ldr {
11897                rdlo: Reg::R0,
11898                rdhi: Reg::R1,
11899                addr: MemAddr::reg_imm(Reg::R11, Reg::R0, 8),
11900            })
11901            .unwrap();
11902        assert_eq!(
11903            &small[0..4],
11904            &[0x0b, 0xeb, 0x00, 0x0c],
11905            "small-offset indexed i64 must keep the single ADD.W ip, fp, r0"
11906        );
11907        assert_eq!(small.len(), 12, "ADD.W + 2×LDR.W (offset folded in imm12)");
11908    }
11909
11910    #[test]
11911    fn test_encode_i64_str_thumb2() {
11912        let encoder = ArmEncoder::new_thumb2();
11913        let op = ArmOp::I64Str {
11914            rdlo: Reg::R0,
11915            rdhi: Reg::R1,
11916            addr: MemAddr::imm(Reg::SP, 0),
11917        };
11918        let code = encoder.encode(&op).unwrap();
11919        // Two STR instructions (lo at offset, hi at offset+4)
11920        assert!(code.len() >= 4, "I64Str should emit at least 4 bytes");
11921    }
11922
11923    #[test]
11924    fn test_encode_i64_all_comparisons_thumb2() {
11925        let encoder = ArmEncoder::new_thumb2();
11926
11927        let ops = vec![
11928            ArmOp::I64Ne {
11929                rd: Reg::R0,
11930                rnlo: Reg::R0,
11931                rnhi: Reg::R1,
11932                rmlo: Reg::R2,
11933                rmhi: Reg::R3,
11934            },
11935            ArmOp::I64LtS {
11936                rd: Reg::R0,
11937                rnlo: Reg::R0,
11938                rnhi: Reg::R1,
11939                rmlo: Reg::R2,
11940                rmhi: Reg::R3,
11941            },
11942            ArmOp::I64LtU {
11943                rd: Reg::R0,
11944                rnlo: Reg::R0,
11945                rnhi: Reg::R1,
11946                rmlo: Reg::R2,
11947                rmhi: Reg::R3,
11948            },
11949            ArmOp::I64LeS {
11950                rd: Reg::R0,
11951                rnlo: Reg::R0,
11952                rnhi: Reg::R1,
11953                rmlo: Reg::R2,
11954                rmhi: Reg::R3,
11955            },
11956            ArmOp::I64LeU {
11957                rd: Reg::R0,
11958                rnlo: Reg::R0,
11959                rnhi: Reg::R1,
11960                rmlo: Reg::R2,
11961                rmhi: Reg::R3,
11962            },
11963            ArmOp::I64GtS {
11964                rd: Reg::R0,
11965                rnlo: Reg::R0,
11966                rnhi: Reg::R1,
11967                rmlo: Reg::R2,
11968                rmhi: Reg::R3,
11969            },
11970            ArmOp::I64GtU {
11971                rd: Reg::R0,
11972                rnlo: Reg::R0,
11973                rnhi: Reg::R1,
11974                rmlo: Reg::R2,
11975                rmhi: Reg::R3,
11976            },
11977            ArmOp::I64GeS {
11978                rd: Reg::R0,
11979                rnlo: Reg::R0,
11980                rnhi: Reg::R1,
11981                rmlo: Reg::R2,
11982                rmhi: Reg::R3,
11983            },
11984            ArmOp::I64GeU {
11985                rd: Reg::R0,
11986                rnlo: Reg::R0,
11987                rnhi: Reg::R1,
11988                rmlo: Reg::R2,
11989                rmhi: Reg::R3,
11990            },
11991        ];
11992
11993        for op in &ops {
11994            let code = encoder.encode(op).unwrap();
11995            assert!(
11996                code.len() >= 8,
11997                "i64 comparison {:?} should emit at least 8 bytes, got {}",
11998                op,
11999                code.len()
12000            );
12001        }
12002    }
12003
12004    #[test]
12005    fn test_encode_i64_const_zero_thumb2() {
12006        let encoder = ArmEncoder::new_thumb2();
12007        let op = ArmOp::I64Const {
12008            rdlo: Reg::R0,
12009            rdhi: Reg::R1,
12010            value: 0,
12011        };
12012        let code = encoder.encode(&op).unwrap();
12013        // MOVW R0, #0 (4 bytes) + MOVW R1, #0 (4 bytes) = 8 bytes
12014        assert_eq!(code.len(), 8, "I64Const(0) should be 8 bytes");
12015    }
12016
12017    #[test]
12018    fn test_encode_i64_const_negative_one_thumb2() {
12019        let encoder = ArmEncoder::new_thumb2();
12020        let op = ArmOp::I64Const {
12021            rdlo: Reg::R0,
12022            rdhi: Reg::R1,
12023            value: -1, // 0xFFFF_FFFF_FFFF_FFFF
12024        };
12025        let code = encoder.encode(&op).unwrap();
12026        // MOVW + MOVT for lo (8 bytes) + MOVW + MOVT for hi (8 bytes) = 16 bytes
12027        assert_eq!(code.len(), 16, "I64Const(-1) should be 16 bytes");
12028    }
12029
12030    // =========================================================================
12031    // Sub-word load/store encoding tests
12032    // =========================================================================
12033
12034    #[test]
12035    fn test_encode_ldrb_arm32() {
12036        let encoder = ArmEncoder::new_arm32();
12037        let op = ArmOp::Ldrb {
12038            rd: Reg::R0,
12039            addr: MemAddr::imm(Reg::R1, 4),
12040        };
12041        let code = encoder.encode(&op).unwrap();
12042        assert_eq!(code.len(), 4, "ARM32 LDRB should be 4 bytes");
12043        // LDRB R0, [R1, #4] = 0xE5D10004
12044        let encoded = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
12045        assert_eq!(encoded, 0xE5D10004, "Should encode LDRB R0, [R1, #4]");
12046    }
12047
12048    #[test]
12049    fn test_encode_strb_arm32() {
12050        let encoder = ArmEncoder::new_arm32();
12051        let op = ArmOp::Strb {
12052            rd: Reg::R0,
12053            addr: MemAddr::imm(Reg::R1, 0),
12054        };
12055        let code = encoder.encode(&op).unwrap();
12056        assert_eq!(code.len(), 4, "ARM32 STRB should be 4 bytes");
12057        // STRB R0, [R1, #0] = 0xE5C10000
12058        let encoded = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
12059        assert_eq!(encoded, 0xE5C10000, "Should encode STRB R0, [R1, #0]");
12060    }
12061
12062    #[test]
12063    fn test_encode_ldrh_arm32() {
12064        let encoder = ArmEncoder::new_arm32();
12065        let op = ArmOp::Ldrh {
12066            rd: Reg::R0,
12067            addr: MemAddr::imm(Reg::R1, 2),
12068        };
12069        let code = encoder.encode(&op).unwrap();
12070        assert_eq!(code.len(), 4, "ARM32 LDRH should be 4 bytes");
12071    }
12072
12073    #[test]
12074    fn test_encode_strh_arm32() {
12075        let encoder = ArmEncoder::new_arm32();
12076        let op = ArmOp::Strh {
12077            rd: Reg::R0,
12078            addr: MemAddr::imm(Reg::R1, 0),
12079        };
12080        let code = encoder.encode(&op).unwrap();
12081        assert_eq!(code.len(), 4, "ARM32 STRH should be 4 bytes");
12082    }
12083
12084    #[test]
12085    fn test_encode_ldrsb_arm32() {
12086        let encoder = ArmEncoder::new_arm32();
12087        let op = ArmOp::Ldrsb {
12088            rd: Reg::R0,
12089            addr: MemAddr::imm(Reg::R1, 0),
12090        };
12091        let code = encoder.encode(&op).unwrap();
12092        assert_eq!(code.len(), 4, "ARM32 LDRSB should be 4 bytes");
12093    }
12094
12095    #[test]
12096    fn test_encode_ldrsh_arm32() {
12097        let encoder = ArmEncoder::new_arm32();
12098        let op = ArmOp::Ldrsh {
12099            rd: Reg::R0,
12100            addr: MemAddr::imm(Reg::R1, 0),
12101        };
12102        let code = encoder.encode(&op).unwrap();
12103        assert_eq!(code.len(), 4, "ARM32 LDRSH should be 4 bytes");
12104    }
12105
12106    #[test]
12107    fn test_encode_ldrb_thumb2_16bit() {
12108        let encoder = ArmEncoder::new_thumb2();
12109        let op = ArmOp::Ldrb {
12110            rd: Reg::R0,
12111            addr: MemAddr::imm(Reg::R1, 4),
12112        };
12113        let code = encoder.encode(&op).unwrap();
12114        // Low registers + small offset -> 16-bit encoding
12115        assert_eq!(
12116            code.len(),
12117            2,
12118            "Thumb-2 LDRB with small offset should be 16-bit"
12119        );
12120    }
12121
12122    #[test]
12123    fn test_encode_ldrb_thumb2_32bit() {
12124        let encoder = ArmEncoder::new_thumb2();
12125        let op = ArmOp::Ldrb {
12126            rd: Reg::R0,
12127            addr: MemAddr::imm(Reg::R1, 100), // offset > 31 needs 32-bit
12128        };
12129        let code = encoder.encode(&op).unwrap();
12130        assert_eq!(
12131            code.len(),
12132            4,
12133            "Thumb-2 LDRB with large offset should be 32-bit"
12134        );
12135    }
12136
12137    #[test]
12138    fn test_encode_strb_thumb2_16bit() {
12139        let encoder = ArmEncoder::new_thumb2();
12140        let op = ArmOp::Strb {
12141            rd: Reg::R0,
12142            addr: MemAddr::imm(Reg::R1, 10),
12143        };
12144        let code = encoder.encode(&op).unwrap();
12145        assert_eq!(
12146            code.len(),
12147            2,
12148            "Thumb-2 STRB with small offset should be 16-bit"
12149        );
12150    }
12151
12152    #[test]
12153    fn test_encode_ldrh_thumb2_16bit() {
12154        let encoder = ArmEncoder::new_thumb2();
12155        let op = ArmOp::Ldrh {
12156            rd: Reg::R0,
12157            addr: MemAddr::imm(Reg::R1, 4), // offset aligned to 2, <= 62
12158        };
12159        let code = encoder.encode(&op).unwrap();
12160        assert_eq!(
12161            code.len(),
12162            2,
12163            "Thumb-2 LDRH with small aligned offset should be 16-bit"
12164        );
12165    }
12166
12167    #[test]
12168    fn test_encode_strh_thumb2_16bit() {
12169        let encoder = ArmEncoder::new_thumb2();
12170        let op = ArmOp::Strh {
12171            rd: Reg::R0,
12172            addr: MemAddr::imm(Reg::R1, 4),
12173        };
12174        let code = encoder.encode(&op).unwrap();
12175        assert_eq!(
12176            code.len(),
12177            2,
12178            "Thumb-2 STRH with small aligned offset should be 16-bit"
12179        );
12180    }
12181
12182    #[test]
12183    fn test_encode_ldrsb_thumb2() {
12184        let encoder = ArmEncoder::new_thumb2();
12185        let op = ArmOp::Ldrsb {
12186            rd: Reg::R0,
12187            addr: MemAddr::imm(Reg::R1, 0),
12188        };
12189        let code = encoder.encode(&op).unwrap();
12190        // LDRSB has no 16-bit immediate form, always 32-bit
12191        assert_eq!(code.len(), 4, "Thumb-2 LDRSB should be 32-bit");
12192    }
12193
12194    #[test]
12195    fn test_encode_ldrsh_thumb2() {
12196        let encoder = ArmEncoder::new_thumb2();
12197        let op = ArmOp::Ldrsh {
12198            rd: Reg::R0,
12199            addr: MemAddr::imm(Reg::R1, 0),
12200        };
12201        let code = encoder.encode(&op).unwrap();
12202        assert_eq!(code.len(), 4, "Thumb-2 LDRSH should be 32-bit");
12203    }
12204
12205    #[test]
12206    fn test_encode_memory_size_thumb2() {
12207        let encoder = ArmEncoder::new_thumb2();
12208        let op = ArmOp::MemorySize { rd: Reg::R0 };
12209        let code = encoder.encode(&op).unwrap();
12210        // R0 and R10 are not both low registers, so this needs careful handling
12211        assert!(!code.is_empty(), "MemorySize should produce code");
12212    }
12213
12214    #[test]
12215    fn test_encode_memory_grow_thumb2() {
12216        let encoder = ArmEncoder::new_thumb2();
12217        let op = ArmOp::MemoryGrow {
12218            rd: Reg::R0,
12219            rn: Reg::R0,
12220        };
12221        let code = encoder.encode(&op).unwrap();
12222        assert_eq!(code.len(), 4, "MemoryGrow (MVN) should be 32-bit Thumb-2");
12223    }
12224
12225    #[test]
12226    fn test_encode_subword_reg_offset_thumb2() {
12227        let encoder = ArmEncoder::new_thumb2();
12228
12229        // LDRB with register offset
12230        let op = ArmOp::Ldrb {
12231            rd: Reg::R0,
12232            addr: MemAddr::reg(Reg::R1, Reg::R2),
12233        };
12234        let code = encoder.encode(&op).unwrap();
12235        assert_eq!(
12236            code.len(),
12237            4,
12238            "Thumb-2 LDRB with reg offset should be 32-bit"
12239        );
12240
12241        // STRB with register offset
12242        let op = ArmOp::Strb {
12243            rd: Reg::R0,
12244            addr: MemAddr::reg(Reg::R1, Reg::R2),
12245        };
12246        let code = encoder.encode(&op).unwrap();
12247        assert_eq!(
12248            code.len(),
12249            4,
12250            "Thumb-2 STRB with reg offset should be 32-bit"
12251        );
12252
12253        // LDRH with register offset
12254        let op = ArmOp::Ldrh {
12255            rd: Reg::R0,
12256            addr: MemAddr::reg(Reg::R1, Reg::R2),
12257        };
12258        let code = encoder.encode(&op).unwrap();
12259        assert_eq!(
12260            code.len(),
12261            4,
12262            "Thumb-2 LDRH with reg offset should be 32-bit"
12263        );
12264
12265        // STRH with register offset
12266        let op = ArmOp::Strh {
12267            rd: Reg::R0,
12268            addr: MemAddr::reg(Reg::R1, Reg::R2),
12269        };
12270        let code = encoder.encode(&op).unwrap();
12271        assert_eq!(
12272            code.len(),
12273            4,
12274            "Thumb-2 STRH with reg offset should be 32-bit"
12275        );
12276    }
12277
12278    #[test]
12279    fn test_encode_subword_reg_imm_offset_thumb2() {
12280        let encoder = ArmEncoder::new_thumb2();
12281
12282        // LDRB with both register and immediate offset
12283        let op = ArmOp::Ldrb {
12284            rd: Reg::R0,
12285            addr: MemAddr::reg_imm(Reg::R1, Reg::R2, 4),
12286        };
12287        let code = encoder.encode(&op).unwrap();
12288        // ADD R12, R2, #4 (4 bytes) + LDRB R0, [R1, R12] (4 bytes) = 8 bytes
12289        assert_eq!(
12290            code.len(),
12291            8,
12292            "Thumb-2 LDRB with reg+imm offset should be 8 bytes"
12293        );
12294    }
12295
12296    // ========================================================================
12297    // Helium MVE encoding tests
12298    // ========================================================================
12299
12300    #[test]
12301    fn test_encode_mve_addi32_thumb2() {
12302        let encoder = ArmEncoder::new_thumb2();
12303        let op = ArmOp::MveAddI {
12304            qd: QReg::Q0,
12305            qn: QReg::Q1,
12306            qm: QReg::Q2,
12307            size: MveSize::S32,
12308        };
12309        let code = encoder.encode(&op).unwrap();
12310        assert_eq!(
12311            code.len(),
12312            4,
12313            "MVE VADD.I32 should be 4 bytes (Thumb-2 32-bit)"
12314        );
12315    }
12316
12317    #[test]
12318    fn test_encode_mve_subi16_thumb2() {
12319        let encoder = ArmEncoder::new_thumb2();
12320        let op = ArmOp::MveSubI {
12321            qd: QReg::Q0,
12322            qn: QReg::Q1,
12323            qm: QReg::Q2,
12324            size: MveSize::S16,
12325        };
12326        let code = encoder.encode(&op).unwrap();
12327        assert_eq!(code.len(), 4, "MVE VSUB.I16 should be 4 bytes");
12328    }
12329
12330    #[test]
12331    fn test_encode_mve_muli8_thumb2() {
12332        let encoder = ArmEncoder::new_thumb2();
12333        let op = ArmOp::MveMulI {
12334            qd: QReg::Q0,
12335            qn: QReg::Q1,
12336            qm: QReg::Q2,
12337            size: MveSize::S8,
12338        };
12339        let code = encoder.encode(&op).unwrap();
12340        assert_eq!(code.len(), 4, "MVE VMUL.I8 should be 4 bytes");
12341    }
12342
12343    #[test]
12344    fn test_encode_mve_bitwise_thumb2() {
12345        let encoder = ArmEncoder::new_thumb2();
12346
12347        let ops = vec![
12348            ArmOp::MveAnd {
12349                qd: QReg::Q0,
12350                qn: QReg::Q1,
12351                qm: QReg::Q2,
12352            },
12353            ArmOp::MveOrr {
12354                qd: QReg::Q0,
12355                qn: QReg::Q1,
12356                qm: QReg::Q2,
12357            },
12358            ArmOp::MveEor {
12359                qd: QReg::Q0,
12360                qn: QReg::Q1,
12361                qm: QReg::Q2,
12362            },
12363            ArmOp::MveBic {
12364                qd: QReg::Q0,
12365                qn: QReg::Q1,
12366                qm: QReg::Q2,
12367            },
12368        ];
12369        for op in ops {
12370            let code = encoder.encode(&op).unwrap();
12371            assert_eq!(code.len(), 4, "MVE bitwise op should be 4 bytes");
12372        }
12373    }
12374
12375    #[test]
12376    fn test_encode_mve_mvn_thumb2() {
12377        let encoder = ArmEncoder::new_thumb2();
12378        let op = ArmOp::MveMvn {
12379            qd: QReg::Q0,
12380            qm: QReg::Q1,
12381        };
12382        let code = encoder.encode(&op).unwrap();
12383        assert_eq!(code.len(), 4, "MVE VMVN should be 4 bytes");
12384    }
12385
12386    #[test]
12387    fn test_encode_mve_load_store_thumb2() {
12388        let encoder = ArmEncoder::new_thumb2();
12389
12390        let load = ArmOp::MveLoad {
12391            qd: QReg::Q0,
12392            addr: MemAddr::imm(Reg::R0, 16),
12393        };
12394        let code = encoder.encode(&load).unwrap();
12395        assert_eq!(code.len(), 4, "MVE VLDRW.32 should be 4 bytes");
12396
12397        let store = ArmOp::MveStore {
12398            qd: QReg::Q1,
12399            addr: MemAddr::imm(Reg::R1, 0),
12400        };
12401        let code = encoder.encode(&store).unwrap();
12402        assert_eq!(code.len(), 4, "MVE VSTRW.32 should be 4 bytes");
12403    }
12404
12405    #[test]
12406    fn test_encode_mve_const_thumb2() {
12407        let encoder = ArmEncoder::new_thumb2();
12408        let op = ArmOp::MveConst {
12409            qd: QReg::Q0,
12410            bytes: [1, 0, 0, 0, 2, 0, 0, 0, 3, 0, 0, 0, 4, 0, 0, 0],
12411        };
12412        let code = encoder.encode(&op).unwrap();
12413        // Should be 4 words of (MOVW R12 + VMOV Sn) = 4 * (4+4) = 32 bytes min
12414        // Some words with hi16=0 skip MOVT, so length varies
12415        assert!(
12416            code.len() >= 24,
12417            "MVE const should produce multiple instructions"
12418        );
12419    }
12420
12421    #[test]
12422    fn test_encode_mve_dup_thumb2() {
12423        let encoder = ArmEncoder::new_thumb2();
12424        let op = ArmOp::MveDup {
12425            qd: QReg::Q0,
12426            rn: Reg::R0,
12427            size: MveSize::S32,
12428        };
12429        let code = encoder.encode(&op).unwrap();
12430        assert_eq!(code.len(), 4, "MVE VDUP.32 should be 4 bytes");
12431    }
12432
12433    #[test]
12434    fn test_encode_mve_extract_lane_thumb2() {
12435        let encoder = ArmEncoder::new_thumb2();
12436        let op = ArmOp::MveExtractLane {
12437            rd: Reg::R0,
12438            qn: QReg::Q1,
12439            lane: 2,
12440            size: MveSize::S32,
12441        };
12442        let code = encoder.encode(&op).unwrap();
12443        assert_eq!(code.len(), 4, "MVE extract lane should be 4 bytes");
12444    }
12445
12446    #[test]
12447    fn test_encode_mve_insert_lane_thumb2() {
12448        let encoder = ArmEncoder::new_thumb2();
12449        let op = ArmOp::MveInsertLane {
12450            qd: QReg::Q0,
12451            rn: Reg::R1,
12452            lane: 3,
12453            size: MveSize::S32,
12454        };
12455        let code = encoder.encode(&op).unwrap();
12456        assert_eq!(code.len(), 4, "MVE insert lane should be 4 bytes");
12457    }
12458
12459    #[test]
12460    fn test_encode_mve_addf32_thumb2() {
12461        let encoder = ArmEncoder::new_thumb2();
12462        let op = ArmOp::MveAddF32 {
12463            qd: QReg::Q0,
12464            qn: QReg::Q1,
12465            qm: QReg::Q2,
12466        };
12467        let code = encoder.encode(&op).unwrap();
12468        assert_eq!(code.len(), 4, "MVE VADD.F32 should be 4 bytes");
12469    }
12470
12471    #[test]
12472    fn test_encode_mve_divf32_thumb2() {
12473        let encoder = ArmEncoder::new_thumb2();
12474        let op = ArmOp::MveDivF32 {
12475            qd: QReg::Q0,
12476            qn: QReg::Q1,
12477            qm: QReg::Q2,
12478        };
12479        let code = encoder.encode(&op).unwrap();
12480        // Lane-wise: 4 x VDIV.F32 = 4 x 4 = 16 bytes
12481        assert_eq!(
12482            code.len(),
12483            16,
12484            "MVE VDIV.F32 (lane-wise) should be 16 bytes"
12485        );
12486    }
12487
12488    #[test]
12489    fn test_encode_mve_sqrtf32_thumb2() {
12490        let encoder = ArmEncoder::new_thumb2();
12491        let op = ArmOp::MveSqrtF32 {
12492            qd: QReg::Q0,
12493            qm: QReg::Q1,
12494        };
12495        let code = encoder.encode(&op).unwrap();
12496        // Lane-wise: 4 x VSQRT.F32 = 4 x 4 = 16 bytes
12497        assert_eq!(
12498            code.len(),
12499            16,
12500            "MVE VSQRT.F32 (lane-wise) should be 16 bytes"
12501        );
12502    }
12503
12504    #[test]
12505    fn test_encode_mve_negf32_thumb2() {
12506        let encoder = ArmEncoder::new_thumb2();
12507        let op = ArmOp::MveNegF32 {
12508            qd: QReg::Q0,
12509            qm: QReg::Q1,
12510        };
12511        let code = encoder.encode(&op).unwrap();
12512        assert_eq!(code.len(), 4, "MVE VNEG.F32 should be 4 bytes");
12513    }
12514
12515    #[test]
12516    fn test_encode_mve_absf32_thumb2() {
12517        let encoder = ArmEncoder::new_thumb2();
12518        let op = ArmOp::MveAbsF32 {
12519            qd: QReg::Q0,
12520            qm: QReg::Q1,
12521        };
12522        let code = encoder.encode(&op).unwrap();
12523        assert_eq!(code.len(), 4, "MVE VABS.F32 should be 4 bytes");
12524    }
12525
12526    /// VCR-RA-001 / immediate-folding precondition: pins the Thumb-2 `AND`
12527    /// immediate encoding for the byte range and documents its bound.
12528    ///
12529    /// The `And { Operand2::Imm }` encoder packs the low 12 bits straight into
12530    /// the `i:imm3:imm8` field WITHOUT applying ThumbExpandImm (the modified-
12531    /// immediate expansion). For `imm <= 0xFF` (e.g. gale's int8 clamps
12532    /// `#0x7e` / `#0x7f`) that is correct — `i:imm3 = 0000` means "imm8
12533    /// zero-extended". So `and r2, r0, #0x7e` encodes to the canonical
12534    /// `00 f0 7e 02`. For `imm >= 0x100` the field would need a true
12535    /// ThumbExpandImm pattern (rotation / replication), which is NOT
12536    /// implemented here — so **immediate folding must gate on `imm <= 0xFF`**
12537    /// until the encoder is hardened to ThumbExpandImm/Ok-or-Err (the
12538    /// "encoder must be Ok-or-Err, never silently wrong" principle, #180/#185).
12539    /// This bound covers the measured `flat_flight` waste (#209).
12540    #[test]
12541    fn and_immediate_encodes_correctly_in_byte_range_documents_fold_bound() {
12542        let encoder = ArmEncoder::new_thumb2();
12543        let op = ArmOp::And {
12544            rd: Reg::R2,
12545            rn: Reg::R0,
12546            op2: Operand2::Imm(0x7e),
12547        };
12548        let code = encoder.encode(&op).unwrap();
12549        assert_eq!(
12550            code,
12551            vec![0x00, 0xf0, 0x7e, 0x02],
12552            "and r2, r0, #0x7e must encode to the canonical AND.W T1 (imm8=0x7e)"
12553        );
12554    }
12555
12556    /// #255: the shared ThumbExpandImm reverse-encoder underpinning the
12557    /// data-processing immediate fix. Encodable modified immediates round-trip to
12558    /// the expected `i:imm3:imm8` field; a genuinely non-modified value is `None`
12559    /// (caller must materialize into a register). Note `1000 = 0xFA ror 30` *is*
12560    /// representable (field 0xF7A) — the old encoder mis-encoded it (raw 0x3E8);
12561    /// this encodes it correctly.
12562    #[test]
12563    fn try_thumb_expand_imm_encodes_modified_immediates() {
12564        assert_eq!(try_thumb_expand_imm(0x7e), Some(0x07e)); // zero-extended byte
12565        assert_eq!(try_thumb_expand_imm(0xff), Some(0x0ff));
12566        assert_eq!(try_thumb_expand_imm(0x0001_0001), Some(0x101)); // 0x00XY00XY
12567        assert_eq!(try_thumb_expand_imm(0xff00_ff00), Some(0x2ff)); // 0xXY00XY00
12568        assert_eq!(try_thumb_expand_imm(0xffff_ffff), Some(0x3ff)); // 0xXYXYXYXY
12569        assert_eq!(try_thumb_expand_imm(0x100), Some(0xf80)); // 0x80 ror 31
12570        assert_eq!(try_thumb_expand_imm(0x8000_0000), Some(0x400)); // 0x80 ror 8
12571        assert_eq!(try_thumb_expand_imm(1000), Some(0xf7a)); // 0xFA ror 30
12572        // Genuinely unrepresentable (bits too far apart for an 8-bit window).
12573        assert_eq!(try_thumb_expand_imm(0x101), None);
12574        assert_eq!(try_thumb_expand_imm(0x12345), None);
12575    }
12576
12577    /// #255: CMP/ADDS/SUBS encode any valid modified immediate correctly, and
12578    /// ERROR (not silently mis-encode) on a genuinely unrepresentable one,
12579    /// forcing the selector to materialize into a register — closing the
12580    /// silent-miscompile class of #251/#253.
12581    #[test]
12582    fn cmp_adds_subs_immediate_error_on_non_modified_imm() {
12583        let encoder = ArmEncoder::new_thumb2();
12584        // cmp r0, #0xff → valid → Ok; cmp r0, #1000 → valid (0xFA ror 30) → Ok.
12585        assert!(encoder.encode_thumb32_cmp_imm(&Reg::R0, 0xff).is_ok());
12586        assert!(encoder.encode_thumb32_cmp_imm(&Reg::R0, 1000).is_ok());
12587        // cmp r0, #0x101 → NOT a modified immediate → Err (materialize-reg).
12588        assert!(
12589            encoder.encode_thumb32_cmp_imm(&Reg::R0, 0x101).is_err(),
12590            "cmp #0x101 must error, not compare the wrong constant"
12591        );
12592        assert!(
12593            encoder
12594                .encode_thumb32_adds(&Reg::R0, &Reg::R0, 0x101)
12595                .is_err()
12596        );
12597        assert!(
12598            encoder
12599                .encode_thumb32_subs(&Reg::R0, &Reg::R0, 0x101)
12600                .is_err()
12601        );
12602        // ...but a valid modified immediate still encodes.
12603        assert!(
12604            encoder
12605                .encode_thumb32_adds(&Reg::R0, &Reg::R0, 0x80)
12606                .is_ok()
12607        );
12608    }
12609
12610    /// #257: MLA (multiply-accumulate) encodes as MLS without the bit-4 op flag.
12611    /// `mla r2, r3, r4, r8` (rd=r2, rn=r3, rm=r4, ra=r8) → Thumb-2 `03 fb 04 82`.
12612    #[test]
12613    fn mla_thumb2_encodes_correctly() {
12614        let encoder = ArmEncoder::new_thumb2();
12615        let code = encoder
12616            .encode(&ArmOp::Mla {
12617                rd: Reg::R2,
12618                rn: Reg::R3,
12619                rm: Reg::R4,
12620                ra: Reg::R8,
12621            })
12622            .unwrap();
12623        // hw1 = 0xFB03, hw2 = (8<<12)|(2<<8)|4 = 0x8204
12624        assert_eq!(code, vec![0x03, 0xfb, 0x04, 0x82]);
12625    }
12626
12627    /// #259: LDR/STR (and sub-word) immediate-offset encoders truncated
12628    /// `offset & 0xFFF`, silently targeting the wrong address for offset >= 4096.
12629    /// They now error (the selector must use register-offset addressing) — the
12630    /// load/store sibling of the #253/#255 class. Offsets <= 4095 still encode.
12631    #[test]
12632    fn ldst_imm12_offset_errors_when_out_of_range() {
12633        let encoder = ArmEncoder::new_thumb2();
12634        // offset 0xFFF (4095): valid → Ok; ldr r0, [r1, #4095].
12635        assert!(
12636            encoder
12637                .encode_thumb32_ldr(&Reg::R0, &Reg::R1, 0xFFF)
12638                .is_ok()
12639        );
12640        // offset 0x1000 (4096): out of imm12 range → Err (not & 0xFFF → #0).
12641        assert!(
12642            encoder
12643                .encode_thumb32_ldr(&Reg::R0, &Reg::R1, 0x1000)
12644                .is_err(),
12645            "ldr offset 4096 must error, not wrap to 0"
12646        );
12647        assert!(
12648            encoder
12649                .encode_thumb32_str(&Reg::R0, &Reg::R1, 0x1000)
12650                .is_err()
12651        );
12652        assert!(
12653            encoder
12654                .encode_thumb32_ldrb_imm(&Reg::R0, &Reg::R1, 5000)
12655                .is_err()
12656        );
12657        assert!(
12658            encoder
12659                .encode_thumb32_strh_imm(&Reg::R0, &Reg::R1, 5000)
12660                .is_err()
12661        );
12662    }
12663
12664    /// Latent miscompile fix: ADD/SUB with a >0xFF immediate (e.g.
12665    /// `add sp, sp, #frame` for a >=256-byte frame) used ADD.W (T3), whose
12666    /// `i:imm3:imm8` is a ThumbExpandImm modified immediate — so `#256` silently
12667    /// encoded as `#0` (stack corruption). Use ADDW/SUBW (T4), a PLAIN 12-bit
12668    /// immediate, for 0x100..=0xFFF; keep T3 for <=0xFF (bit-identical); error
12669    /// beyond 4095.
12670    #[test]
12671    fn add_sub_large_immediate_use_addw_subw_not_misencoded() {
12672        let encoder = ArmEncoder::new_thumb2();
12673        // add sp, sp, #256  →  ADDW (T4) SP, SP, #256  =  0d f2 00 1d
12674        assert_eq!(
12675            encoder
12676                .encode(&ArmOp::Add {
12677                    rd: Reg::SP,
12678                    rn: Reg::SP,
12679                    op2: Operand2::Imm(256),
12680                })
12681                .unwrap(),
12682            vec![0x0d, 0xf2, 0x00, 0x1d],
12683            "add sp,sp,#256 must be ADDW (plain imm12), not a mis-encoded ADD.W"
12684        );
12685        // sub sp, sp, #256  →  SUBW (T4) SP, SP, #256  =  ad f2 00 1d
12686        assert_eq!(
12687            encoder
12688                .encode(&ArmOp::Sub {
12689                    rd: Reg::SP,
12690                    rn: Reg::SP,
12691                    op2: Operand2::Imm(256),
12692                })
12693                .unwrap(),
12694            vec![0xad, 0xf2, 0x00, 0x1d],
12695        );
12696        // > 4095 has no single-instruction encoding → error, not silent wrong.
12697        assert!(
12698            encoder
12699                .encode(&ArmOp::Add {
12700                    rd: Reg::SP,
12701                    rn: Reg::SP,
12702                    op2: Operand2::Imm(5000),
12703                })
12704                .is_err(),
12705            "add #5000 must error (no single ADDW), not mis-encode"
12706        );
12707    }
12708
12709    /// Closes the data-proc immediate class: AND and CMN now go through
12710    /// `try_thumb_expand_imm` like ORR/EOR/CMP — correct for any modified
12711    /// immediate, `Err` (not raw-pack / NOP) on an un-encodable one. The byte
12712    /// range stays bit-identical (`and r2,r0,#0x7e` is unchanged).
12713    #[test]
12714    fn and_cmn_immediate_thumb_expand_else_error() {
12715        let encoder = ArmEncoder::new_thumb2();
12716        // byte range unchanged (bit-identical with the pre-retrofit encoding)
12717        assert_eq!(
12718            encoder
12719                .encode(&ArmOp::And {
12720                    rd: Reg::R2,
12721                    rn: Reg::R0,
12722                    op2: Operand2::Imm(0x7e),
12723                })
12724                .unwrap(),
12725            vec![0x00, 0xf0, 0x7e, 0x02],
12726        );
12727        // a valid replicated modified immediate now encodes (was silently wrong)
12728        assert!(
12729            encoder
12730                .encode(&ArmOp::And {
12731                    rd: Reg::R2,
12732                    rn: Reg::R0,
12733                    op2: Operand2::Imm(0xff00ff00u32 as i32),
12734                })
12735                .is_ok()
12736        );
12737        // a genuinely un-encodable immediate errors (AND was raw-pack; CMN NOP)
12738        assert!(
12739            encoder
12740                .encode(&ArmOp::And {
12741                    rd: Reg::R2,
12742                    rn: Reg::R0,
12743                    op2: Operand2::Imm(0x101),
12744                })
12745                .is_err()
12746        );
12747        assert!(
12748            encoder
12749                .encode(&ArmOp::Cmn {
12750                    rn: Reg::R0,
12751                    op2: Operand2::Imm(0x101),
12752                })
12753                .is_err(),
12754            "CMN #0x101 must error, not emit a NOP"
12755        );
12756    }
12757
12758    /// VCR-RA-001: ORR/EOR with a small immediate must encode the real
12759    /// instruction (not a silent `0xBF00` NOP). Pins the byte range and the
12760    /// Ok-or-Err bound that makes future Or/Eor immediate folding safe.
12761    #[test]
12762    fn orr_eor_immediate_encode_in_byte_range_else_error() {
12763        let encoder = ArmEncoder::new_thumb2();
12764        // orr r2, r0, #0x7e  →  ORR.W T1, imm8=0x7e
12765        assert_eq!(
12766            encoder
12767                .encode(&ArmOp::Orr {
12768                    rd: Reg::R2,
12769                    rn: Reg::R0,
12770                    op2: Operand2::Imm(0x7e),
12771                })
12772                .unwrap(),
12773            vec![0x40, 0xf0, 0x7e, 0x02],
12774        );
12775        // eor r2, r0, #0x7e  →  EOR.W T1, imm8=0x7e
12776        assert_eq!(
12777            encoder
12778                .encode(&ArmOp::Eor {
12779                    rd: Reg::R2,
12780                    rn: Reg::R0,
12781                    op2: Operand2::Imm(0x7e),
12782                })
12783                .unwrap(),
12784            vec![0x80, 0xf0, 0x7e, 0x02],
12785        );
12786        // Out-of-range immediates error rather than silently mis-encode / NOP.
12787        assert!(
12788            encoder
12789                .encode(&ArmOp::Orr {
12790                    rd: Reg::R2,
12791                    rn: Reg::R0,
12792                    op2: Operand2::Imm(0x140),
12793                })
12794                .is_err(),
12795            "ORR #0x140 must error, not emit a NOP"
12796        );
12797    }
12798
12799    #[test]
12800    fn test_encode_mve_different_qregs() {
12801        let encoder = ArmEncoder::new_thumb2();
12802
12803        // Test that different Q-register numbers produce different encodings
12804        let op1 = ArmOp::MveAddI {
12805            qd: QReg::Q0,
12806            qn: QReg::Q0,
12807            qm: QReg::Q0,
12808            size: MveSize::S32,
12809        };
12810        let op2 = ArmOp::MveAddI {
12811            qd: QReg::Q3,
12812            qn: QReg::Q5,
12813            qm: QReg::Q7,
12814            size: MveSize::S32,
12815        };
12816        let code1 = encoder.encode(&op1).unwrap();
12817        let code2 = encoder.encode(&op2).unwrap();
12818        assert_ne!(
12819            code1, code2,
12820            "Different Q-registers should produce different encodings"
12821        );
12822    }
12823
12824    #[test]
12825    fn test_encode_mve_arm32_loud_err() {
12826        // #615: MVE (Helium) is Thumb-2-only. The ARM32 encoder used to emit
12827        // a silent NOP here (dropping the vector op); it must now be a typed
12828        // Err so a broken "MVE implies Thumb" invariant fails loudly.
12829        let encoder = ArmEncoder::new_arm32();
12830        let op = ArmOp::MveAddI {
12831            qd: QReg::Q0,
12832            qn: QReg::Q1,
12833            qm: QReg::Q2,
12834            size: MveSize::S32,
12835        };
12836        let err = encoder
12837            .encode(&op)
12838            .expect_err("ARM32 MVE must be a loud Err, not a silent NOP (#615)");
12839        assert!(
12840            err.to_string().contains("Thumb-2 only"),
12841            "unexpected error message: {err}"
12842        );
12843    }
12844}