Skip to main content

synth_backend/
arm_encoder.rs

1//! ARM Code Encoder - Converts ARM instructions to binary machine code
2//!
3//! Generates ARM32/Thumb-2 machine code from ARM instruction structures
4
5use synth_core::Result;
6use synth_core::target::FPUPrecision;
7use synth_synthesis::contracts::encoding as encoding_contracts;
8use synth_synthesis::{ArmOp, MemAddr, MveSize, Operand2, QReg, Reg, VfpReg};
9
10/// ARM instruction encoding
11pub struct ArmEncoder {
12    /// Use Thumb mode (vs ARM mode)
13    thumb_mode: bool,
14    /// FPU capability for VFP instruction encoding
15    #[allow(dead_code)]
16    fpu: Option<FPUPrecision>,
17}
18
19impl ArmEncoder {
20    /// Create a new ARM encoder in ARM32 mode
21    pub fn new_arm32() -> Self {
22        Self {
23            thumb_mode: false,
24            fpu: None,
25        }
26    }
27
28    /// Create a new ARM encoder in Thumb-2 mode
29    pub fn new_thumb2() -> Self {
30        Self {
31            thumb_mode: true,
32            fpu: None,
33        }
34    }
35
36    /// Create a new Thumb-2 encoder with FPU capability
37    pub fn new_thumb2_with_fpu(fpu: Option<FPUPrecision>) -> Self {
38        Self {
39            thumb_mode: true,
40            fpu,
41        }
42    }
43
44    /// Encode a single ARM instruction to bytes
45    pub fn encode(&self, op: &ArmOp) -> Result<Vec<u8>> {
46        if self.thumb_mode {
47            self.encode_thumb(op)
48        } else {
49            self.encode_arm(op)
50        }
51    }
52
53    /// Encode an ARM instruction in ARM32 mode (32-bit instructions)
54    /// #206: encode an ARM32 (A32) load/store whose address uses a register
55    /// offset (`[rn, rm{, #off}]`). Returns `None` for ops with no register
56    /// offset (the caller falls through to the immediate-form arms). Computes
57    /// `ip = base + rm` then re-encodes the op against `[ip, #off]`, which works
58    /// uniformly for word/byte/halfword/signed forms. IP (R12) is the scratch
59    /// register the selector already treats as clobberable across memory ops.
60    fn encode_arm_reg_offset_mem(&self, op: &ArmOp) -> Result<Option<Vec<u8>>> {
61        use synth_synthesis::Reg;
62        let addr = match op {
63            ArmOp::Ldr { addr, .. }
64            | ArmOp::Str { addr, .. }
65            | ArmOp::Ldrb { addr, .. }
66            | ArmOp::Strb { addr, .. }
67            | ArmOp::Ldrh { addr, .. }
68            | ArmOp::Strh { addr, .. }
69            | ArmOp::Ldrsb { addr, .. }
70            | ArmOp::Ldrsh { addr, .. } => addr,
71            _ => return Ok(None),
72        };
73        let Some(rm) = addr.offset_reg else {
74            return Ok(None);
75        };
76        let ip = Reg::R12;
77        // ADD ip, base, rm  (cond=AL, opcode=ADD, S=0, register operand2)
78        let add: u32 = 0xE0800000
79            | (reg_to_bits(&addr.base) << 16)
80            | (reg_to_bits(&ip) << 12)
81            | reg_to_bits(&rm);
82        let mut bytes = add.to_le_bytes().to_vec();
83        // Re-encode the op against [ip, #off] (immediate form → no offset_reg,
84        // so this recursion hits the immediate arms, not this helper again).
85        let imm_addr = MemAddr::imm(ip, addr.offset);
86        let imm_op = match op {
87            ArmOp::Ldr { rd, .. } => ArmOp::Ldr {
88                rd: *rd,
89                addr: imm_addr,
90            },
91            ArmOp::Str { rd, .. } => ArmOp::Str {
92                rd: *rd,
93                addr: imm_addr,
94            },
95            ArmOp::Ldrb { rd, .. } => ArmOp::Ldrb {
96                rd: *rd,
97                addr: imm_addr,
98            },
99            ArmOp::Strb { rd, .. } => ArmOp::Strb {
100                rd: *rd,
101                addr: imm_addr,
102            },
103            ArmOp::Ldrh { rd, .. } => ArmOp::Ldrh {
104                rd: *rd,
105                addr: imm_addr,
106            },
107            ArmOp::Strh { rd, .. } => ArmOp::Strh {
108                rd: *rd,
109                addr: imm_addr,
110            },
111            ArmOp::Ldrsb { rd, .. } => ArmOp::Ldrsb {
112                rd: *rd,
113                addr: imm_addr,
114            },
115            ArmOp::Ldrsh { rd, .. } => ArmOp::Ldrsh {
116                rd: *rd,
117                addr: imm_addr,
118            },
119            _ => unreachable!(),
120        };
121        bytes.extend(self.encode_arm(&imm_op)?);
122        Ok(Some(bytes))
123    }
124
125    /// #594: A32 expansion of `ArmOp::CallIndirect` — mirror of the Thumb-2
126    /// arm (same contract: R11 holds the function-pointer table base, entry
127    /// `i` is a 4-byte code address, R12 is the encoder-scratch register):
128    ///
129    /// ```text
130    /// MOVW r12, #size        ; #642: table size (compile-time immediate)
131    /// [MOVT r12, #size>>16]  ; only when size exceeds 16 bits
132    /// CMP  idx, r12          ; bounds guard: index >= size must TRAP
133    /// BLO  +1 insn           ; skip the trap when in bounds
134    /// UDF                    ; WASM Core §4.4.8 out-of-bounds trap
135    /// MOV r12, idx, LSL #2   ; table byte offset
136    /// LDR r12, [r11, r12]    ; load function pointer
137    /// BLX r12                ; indirect call
138    /// ```
139    ///
140    /// #650, `table_byte_offset != 0` (a non-zero table of the contiguous
141    /// R11 region): the pointer load becomes
142    /// `ADD r12, r11, r12; LDR r12, [r12, #offset]` — offset 0 keeps the
143    /// single-load form (single-table modules byte-identical by
144    /// construction).
145    ///
146    /// #664, `null_check` (the table has null slots, linked as ZERO words
147    /// per the layout contract): `CMP r12, #0; BNE +1; UDF` between the
148    /// pointer load and the `BLX` — a call reaching an uninitialized slot
149    /// traps (§4.4.8). `false` keeps the expansion byte-identical.
150    ///
151    /// #676, `type_check` (heterogeneous table): the §4.4.8 type check is
152    /// discharged at RUNTIME against the type-id sidecar — after the bounds
153    /// guard, `MOV r12, idx, LSL #2; ADD r12, r11, r12;
154    /// LDR r12, [r12, #type_off]; CMP r12, #expected_id; BEQ +1; UDF`
155    /// (mirror of the Thumb-2 arm; the dispatch tail recomputes `idx*4`).
156    /// Null slots carry the reserved class id 0, subsuming the #664 null
157    /// trap. `None` (every homogeneous table — the verdict discharged at
158    /// COMPILE time by the closed-world verification, see the #642 selector
159    /// guard) emits nothing and keeps the expansion byte-identical.
160    fn encode_arm_call_indirect(
161        table_index_reg: &Reg,
162        table_size: u32,
163        table_byte_offset: u32,
164        null_check: bool,
165        type_check: Option<(u32, u32)>,
166    ) -> Vec<u8> {
167        let idx = reg_to_bits(table_index_reg);
168        let mut bytes = Vec::with_capacity(32);
169        // MOVW r12, #(size & 0xFFFF) — cond=E 0011 0000 imm4 Rd imm12.
170        let size_lo = table_size & 0xFFFF;
171        let movw: u32 = 0xE300_0000 | ((size_lo >> 12) << 16) | (12 << 12) | (size_lo & 0xFFF);
172        bytes.extend_from_slice(&movw.to_le_bytes());
173        // MOVT r12, #(size >> 16) — only for a table size above 16 bits.
174        let size_hi = table_size >> 16;
175        if size_hi != 0 {
176            let movt: u32 = 0xE340_0000 | ((size_hi >> 12) << 16) | (12 << 12) | (size_hi & 0xFFF);
177            bytes.extend_from_slice(&movt.to_le_bytes());
178        }
179        // CMP idx, r12 — cond=E, opcode=1010, S=1, Rn=idx, Rm=r12.
180        let cmp: u32 = 0xE150_000C | (idx << 16);
181        bytes.extend_from_slice(&cmp.to_le_bytes());
182        // BLO +1 insn (skip the UDF when index < size) — cond=LO(0011),
183        // imm24=0: target = branch + 8.
184        bytes.extend_from_slice(&0x3A00_0000u32.to_le_bytes());
185        // UDF — permanently undefined (same trap idiom as the A32 div-by-zero
186        // guards): call_indirect out-of-bounds trap.
187        bytes.extend_from_slice(&0xE7F0_00F0u32.to_le_bytes());
188        // #676: runtime type check for a heterogeneous table — load the
189        // indexed slot's structural class id from the type-id sidecar and
190        // trap on mismatch (§4.4.8). Mirror of the Thumb-2 arm; `None`
191        // emits nothing (homogeneous tables byte-identical by construction).
192        if let Some((expected_id, type_off)) = type_check {
193            debug_assert!(expected_id <= 255, "selector enforces the CMP imm8 range");
194            debug_assert!(type_off <= 4095, "selector enforces the LDR imm12 range");
195            // MOV r12, idx, LSL #2 (same as the dispatch tail's scale).
196            bytes.extend_from_slice(&(0xE1A0C000u32 | (2 << 7) | idx).to_le_bytes());
197            // ADD r12, r11, r12 — data-processing ADD (register).
198            bytes.extend_from_slice(&0xE08BC00Cu32.to_le_bytes());
199            // LDR r12, [r12, #type_off] — immediate offset, P=1 U=1 L=1.
200            bytes.extend_from_slice(&(0xE59CC000u32 | (type_off & 0xFFF)).to_le_bytes());
201            // CMP r12, #expected_id — data-processing CMP (immediate).
202            bytes.extend_from_slice(&(0xE35C_0000u32 | (expected_id & 0xFF)).to_le_bytes());
203            // BEQ +1 insn (skip the UDF when the class id matches) —
204            // cond=EQ(0000), imm24=0: target = branch + 8.
205            bytes.extend_from_slice(&0x0A00_0000u32.to_le_bytes());
206            // UDF — the §4.4.8 type-mismatch trap.
207            bytes.extend_from_slice(&0xE7F0_00F0u32.to_le_bytes());
208        }
209        // MOV r12, idx, LSL #2 — data-processing MOV, register op2 with
210        // imm5=2/LSL: cond=E, opcode=1101, S=0, Rd=r12.
211        let mov: u32 = 0xE1A0C000 | (2 << 7) | idx;
212        bytes.extend_from_slice(&mov.to_le_bytes());
213        if table_byte_offset == 0 {
214            // Table 0 (base = R11 itself): the pre-#650 single-load form.
215            // LDR r12, [r11, r12] — register offset, P=1 U=1 B=0 W=0 L=1.
216            let ldr: u32 = 0xE79BC00C;
217            bytes.extend_from_slice(&ldr.to_le_bytes());
218        } else {
219            // #650: fold the table's compile-time base offset into the
220            // pointer load via the LDR imm12 form.
221            assert!(
222                table_byte_offset <= 4095,
223                "call_indirect table base offset {table_byte_offset} exceeds \
224                 LDR imm12 — the selector must have declined this (#650)"
225            );
226            // ADD r12, r11, r12 — data-processing ADD (register).
227            bytes.extend_from_slice(&0xE08BC00Cu32.to_le_bytes());
228            // LDR r12, [r12, #offset] — immediate offset, P=1 U=1 L=1.
229            let ldr: u32 = 0xE59CC000 | (table_byte_offset & 0xFFF);
230            bytes.extend_from_slice(&ldr.to_le_bytes());
231        }
232        // #664: null-slot trap — only when the table image has null slots
233        // (zero-linked words). A fully-initialized table keeps the pre-#664
234        // bytes identical by construction.
235        if null_check {
236            // CMP r12, #0 — data-processing CMP (immediate), Rn=r12.
237            bytes.extend_from_slice(&0xE35C_0000u32.to_le_bytes());
238            // BNE +1 insn (skip the UDF when the pointer is non-null) —
239            // cond=NE(0001), imm24=0: target = branch + 8.
240            bytes.extend_from_slice(&0x1A00_0000u32.to_le_bytes());
241            // UDF — the §4.4.8 uninitialized-element trap (same idiom as
242            // the bounds guard).
243            bytes.extend_from_slice(&0xE7F0_00F0u32.to_le_bytes());
244        }
245        // BLX r12 — cond=E, 0001 0010 1111 1111 1111 0011, Rm=r12.
246        let blx: u32 = 0xE12FFF3C;
247        bytes.extend_from_slice(&blx.to_le_bytes());
248        bytes
249    }
250
251    /// #615: A32 (ARM-mode) expansions for the multi-instruction ops that the
252    /// Thumb-2 encoder expands but the A32 arm previously encoded as a single
253    /// literal NOP (`0xE1A00000`) — i64 mul / shifts / rotates / comparisons /
254    /// eqz, plus i64 const/load/store/extend/wrap and the i32 SetCond /
255    /// SelectMove pseudo-ops. Each expansion mirrors its Thumb-2 twin's
256    /// register contract and semantics exactly (A32 conditional execution
257    /// replaces the IT blocks). Returns `Ok(None)` for ops this helper does
258    /// not handle; the caller's match encodes or loudly rejects those.
259    fn encode_arm_expanded(&self, op: &ArmOp) -> Result<Option<Vec<u8>>> {
260        use synth_synthesis::Condition;
261
262        /// A32 condition-field bits (instruction bits [31:28]).
263        fn cond_bits(cond: &Condition) -> u32 {
264            match cond {
265                Condition::EQ => 0x0,
266                Condition::NE => 0x1,
267                Condition::HS => 0x2, // CS: unsigned >=
268                Condition::LO => 0x3, // CC: unsigned <
269                Condition::HI => 0x8, // unsigned >
270                Condition::LS => 0x9, // unsigned <=
271                Condition::GE => 0xA,
272                Condition::LT => 0xB,
273                Condition::GT => 0xC,
274                Condition::LE => 0xD,
275            }
276        }
277        fn w(b: &mut Vec<u8>, word: u32) {
278            b.extend_from_slice(&word.to_le_bytes());
279        }
280        /// MOV<cond> rd, #imm (rotated-immediate form; only 0/1 used here).
281        fn mov_cond_imm(b: &mut Vec<u8>, cond: u32, rd: u32, imm: u32) {
282            w(b, (cond << 28) | 0x03A0_0000 | (rd << 12) | imm);
283        }
284        /// After a flag-setting pair: MOV<cond> rd,#1 ; MOV<!cond> rd,#0.
285        fn set_cond(b: &mut Vec<u8>, cond: &Condition, rd: u32) {
286            mov_cond_imm(b, cond_bits(cond), rd, 1);
287            mov_cond_imm(b, cond_bits(&cond.invert()), rd, 0);
288        }
289        /// CMP rn, rm (register form).
290        fn cmp_reg(b: &mut Vec<u8>, rn: u32, rm: u32) {
291            w(b, 0xE150_0000 | (rn << 16) | rm);
292        }
293        /// SBCS rd, rn, rm — the 64-bit compare idiom's high-word subtract.
294        fn sbcs(b: &mut Vec<u8>, rd: u32, rn: u32, rm: u32) {
295            w(b, 0xE0D0_0000 | (rn << 16) | (rd << 12) | rm);
296        }
297        /// MOVW rd, #imm16.
298        fn movw(b: &mut Vec<u8>, rd: u32, v: u32) {
299            w(
300                b,
301                0xE300_0000 | (((v >> 12) & 0xF) << 16) | (rd << 12) | (v & 0xFFF),
302            );
303        }
304        /// MOVT rd, #imm16.
305        fn movt(b: &mut Vec<u8>, rd: u32, v: u32) {
306            w(
307                b,
308                0xE340_0000 | (((v >> 12) & 0xF) << 16) | (rd << 12) | (v & 0xFFF),
309            );
310        }
311        /// Register-controlled shift: MOV rd, rn, <LSL|LSR|ASR> rs.
312        /// `ty`: 0=LSL, 1=LSR, 2=ASR. A32 uses the bottom byte of rs;
313        /// amounts of 32 or more yield 0 (LSL/LSR) or all-sign (ASR) — same
314        /// semantics the Thumb-2 expansions rely on.
315        fn shift_reg(b: &mut Vec<u8>, ty: u32, rd: u32, rn: u32, rs: u32) {
316            w(b, 0xE1A0_0010 | (rd << 12) | (rs << 8) | (ty << 5) | rn);
317        }
318        const LSL: u32 = 0;
319        const LSR: u32 = 1;
320        const ASR: u32 = 2;
321        /// Immediate-shift move: MOV rd, rn, <LSL|LSR|ASR> #imm.
322        fn shift_imm(b: &mut Vec<u8>, ty: u32, rd: u32, rn: u32, imm: u32) {
323            w(
324                b,
325                0xE1A0_0000 | (rd << 12) | ((imm & 0x1F) << 7) | (ty << 5) | rn,
326            );
327        }
328        /// Data-processing register form: `base | rn<<16 | rd<<12 | rm`.
329        /// `base` carries cond/opcode/S (e.g. 0xE090_0000 = ADDS).
330        fn dp_reg(b: &mut Vec<u8>, base: u32, rd: u32, rn: u32, rm: u32) {
331            w(b, base | (rn << 16) | (rd << 12) | rm);
332        }
333        /// ORR rd, rd, rm, LSR #31 — the carry-propagation idiom of the
334        /// shift-subtract division loop (bring rm's MSB into rd's bit 0).
335        fn orr_lsr31(b: &mut Vec<u8>, rd: u32, rm: u32) {
336            w(
337                b,
338                0xE180_0000 | (rd << 16) | (rd << 12) | (31 << 7) | (1 << 5) | rm,
339            );
340        }
341        /// 64-bit two's-complement negate of the lo:hi pair (MVN/MVN/ADDS/ADC).
342        fn negate64(b: &mut Vec<u8>, lo: u32, hi: u32) {
343            w(b, 0xE1E0_0000 | (lo << 12) | lo); //           MVN  lo, lo
344            w(b, 0xE1E0_0000 | (hi << 12) | hi); //           MVN  hi, hi
345            w(b, 0xE290_0001 | (lo << 16) | (lo << 12)); //   ADDS lo, lo, #1
346            w(b, 0xE2A0_0000 | (hi << 16) | (hi << 12)); //   ADC  hi, hi, #0
347        }
348        /// TST x, x ; BPL +4-instructions — the "skip the negate64 when the
349        /// sign bit is clear" guard of the signed div/rem arms.
350        fn skip_negate_if_positive(b: &mut Vec<u8>, x: u32) {
351            w(b, 0xE110_0000 | (x << 16) | x); // TST x, x
352            w(b, 0x5A00_0003); //                 BPL +4 insns (past negate64)
353        }
354        /// The 64-iteration shift-subtract division loop — A32 transcription
355        /// of the Thumb-2 #610 core: dividend R0:R1, divisor R2:R3, quotient
356        /// R4:R5, remainder R6:R7, loop counter in `counter` (R12 or R8).
357        fn div_loop(b: &mut Vec<u8>, counter: u32) {
358            w(b, 0xE3A0_0040 | (counter << 12)); // MOV counter, #64
359            let loop_start = b.len();
360            // quotient <<= 1
361            shift_imm(b, LSL, 5, 5, 1);
362            orr_lsr31(b, 5, 4);
363            shift_imm(b, LSL, 4, 4, 1);
364            // remainder <<= 1, OR in dividend MSB
365            shift_imm(b, LSL, 7, 7, 1);
366            orr_lsr31(b, 7, 6);
367            shift_imm(b, LSL, 6, 6, 1);
368            orr_lsr31(b, 6, 1);
369            // dividend <<= 1
370            shift_imm(b, LSL, 1, 1, 1);
371            orr_lsr31(b, 1, 0);
372            shift_imm(b, LSL, 0, 0, 1);
373            // if remainder >= divisor (64-bit unsigned): subtract, set q bit
374            w(b, 0xE157_0003); // CMP R7, R3      (high words)
375            w(b, 0x8A00_0002); // BHI .subtract   (+2 insns)
376            w(b, 0x3A00_0004); // BLO .next       (+4 insns)
377            w(b, 0xE156_0002); // CMP R6, R2      (low words, highs equal)
378            w(b, 0x3A00_0002); // BLO .next       (+2 insns)
379            w(b, 0xE056_6002); // .subtract: SUBS R6, R6, R2
380            w(b, 0xE0C7_7003); //            SBC  R7, R7, R3
381            w(b, 0xE384_4001); //            ORR  R4, R4, #1
382            // .next: decrement and loop
383            w(b, 0xE250_0001 | (counter << 16) | (counter << 12)); // SUBS counter, #1
384            let diff = (loop_start as i64) - (b.len() as i64 + 8);
385            w(b, 0x1A00_0000 | (((diff / 4) as u32) & 0x00FF_FFFF)); // BNE loop
386        }
387        /// 32-bit population count on working register `x` — A32 transcription
388        /// of the Thumb-2 I64Popcnt per-word core (mul-based fold): `c` is the
389        /// constant register, R12 the shifted temp. Both are clobbered.
390        fn popcnt_word(b: &mut Vec<u8>, x: u32, c: u32) {
391            // x = x - ((x >> 1) & 0x55555555)
392            shift_imm(b, LSR, 12, x, 1);
393            movw(b, c, 0x5555);
394            movt(b, c, 0x5555);
395            dp_reg(b, 0xE000_0000, 12, 12, c); // AND R12, R12, c
396            dp_reg(b, 0xE040_0000, x, x, 12); //  SUB x, x, R12
397            // x = (x & 0x33333333) + ((x >> 2) & 0x33333333)
398            movw(b, c, 0x3333);
399            movt(b, c, 0x3333);
400            dp_reg(b, 0xE000_0000, 12, x, c); //  AND R12, x, c
401            shift_imm(b, LSR, x, x, 2);
402            dp_reg(b, 0xE000_0000, x, x, c); //   AND x, x, c
403            dp_reg(b, 0xE080_0000, x, x, 12); //  ADD x, x, R12
404            // x = (x + (x >> 4)) & 0x0F0F0F0F
405            shift_imm(b, LSR, 12, x, 4);
406            dp_reg(b, 0xE080_0000, x, x, 12); //  ADD x, x, R12
407            movw(b, c, 0x0F0F);
408            movt(b, c, 0x0F0F);
409            dp_reg(b, 0xE000_0000, x, x, c); //   AND x, x, c
410            // x = (x * 0x01010101) >> 24
411            movw(b, c, 0x0101);
412            movt(b, c, 0x0101);
413            w(b, 0xE000_0090 | (x << 16) | (c << 8) | x); // MUL x, x, c
414            shift_imm(b, LSR, x, x, 24);
415        }
416
417        let mut b: Vec<u8> = Vec::new();
418        match op {
419            // SetCond: materialize a flags-predicate as 0/1 — the A32 twin of
420            // the Thumb `ITE cond; MOV rd,#1; MOV rd,#0`.
421            ArmOp::SetCond { rd, cond } => {
422                set_cond(&mut b, cond, reg_to_bits(rd));
423            }
424
425            // SelectMove: conditional register move (Thumb: IT cond; MOV).
426            ArmOp::SelectMove { rd, rm, cond } => {
427                w(
428                    &mut b,
429                    (cond_bits(cond) << 28)
430                        | 0x01A0_0000
431                        | (reg_to_bits(rd) << 12)
432                        | reg_to_bits(rm),
433                );
434            }
435
436            // I64SetCond: compare two i64 register pairs, 0/1 into rd.
437            // EQ/NE: CMP lo,lo; CMPEQ hi,hi (only if lows equal); set.
438            // Ordered: CMP lo,lo; SBCS rd,hi,hi; set — with the same
439            // operand-swap + condition mapping as the Thumb-2 arm.
440            ArmOp::I64SetCond {
441                rd,
442                rn_lo,
443                rn_hi,
444                rm_lo,
445                rm_hi,
446                cond,
447            } => {
448                let rd_b = reg_to_bits(rd);
449                let (n_lo, n_hi, m_lo, m_hi) = (
450                    reg_to_bits(rn_lo),
451                    reg_to_bits(rn_hi),
452                    reg_to_bits(rm_lo),
453                    reg_to_bits(rm_hi),
454                );
455                match cond {
456                    Condition::EQ | Condition::NE => {
457                        cmp_reg(&mut b, n_lo, m_lo);
458                        // CMP<EQ> rn_hi, rm_hi — compare highs only if lows equal.
459                        w(&mut b, 0x0150_0000 | (n_hi << 16) | m_hi);
460                        set_cond(&mut b, cond, rd_b);
461                    }
462                    // (swap operands?, condition after SBCS) per the Thumb arm:
463                    // LT/GE/LO/HS compare (rn, rm); GT/LE/HI/LS swap to (rm, rn).
464                    Condition::LT => {
465                        cmp_reg(&mut b, n_lo, m_lo);
466                        sbcs(&mut b, rd_b, n_hi, m_hi);
467                        set_cond(&mut b, &Condition::LT, rd_b);
468                    }
469                    Condition::GE => {
470                        cmp_reg(&mut b, n_lo, m_lo);
471                        sbcs(&mut b, rd_b, n_hi, m_hi);
472                        set_cond(&mut b, &Condition::GE, rd_b);
473                    }
474                    Condition::GT => {
475                        cmp_reg(&mut b, m_lo, n_lo);
476                        sbcs(&mut b, rd_b, m_hi, n_hi);
477                        set_cond(&mut b, &Condition::LT, rd_b);
478                    }
479                    Condition::LE => {
480                        cmp_reg(&mut b, m_lo, n_lo);
481                        sbcs(&mut b, rd_b, m_hi, n_hi);
482                        set_cond(&mut b, &Condition::GE, rd_b);
483                    }
484                    Condition::LO => {
485                        cmp_reg(&mut b, n_lo, m_lo);
486                        sbcs(&mut b, rd_b, n_hi, m_hi);
487                        set_cond(&mut b, &Condition::LO, rd_b);
488                    }
489                    Condition::HS => {
490                        cmp_reg(&mut b, n_lo, m_lo);
491                        sbcs(&mut b, rd_b, n_hi, m_hi);
492                        set_cond(&mut b, &Condition::HS, rd_b);
493                    }
494                    Condition::HI => {
495                        cmp_reg(&mut b, m_lo, n_lo);
496                        sbcs(&mut b, rd_b, m_hi, n_hi);
497                        set_cond(&mut b, &Condition::LO, rd_b);
498                    }
499                    Condition::LS => {
500                        cmp_reg(&mut b, m_lo, n_lo);
501                        sbcs(&mut b, rd_b, m_hi, n_hi);
502                        set_cond(&mut b, &Condition::HS, rd_b);
503                    }
504                }
505            }
506
507            // I64SetCondZ: ORRS rd, lo, hi sets Z iff the pair is zero.
508            ArmOp::I64SetCondZ { rd, rn_lo, rn_hi } => {
509                let rd_b = reg_to_bits(rd);
510                w(
511                    &mut b,
512                    0xE190_0000 | (reg_to_bits(rn_lo) << 16) | (rd_b << 12) | reg_to_bits(rn_hi),
513                );
514                set_cond(&mut b, &Condition::EQ, rd_b);
515            }
516
517            // i64 comparison wrappers: delegate to I64SetCond/Z, mirroring the
518            // Thumb-2 delegation arms.
519            ArmOp::I64Eqz { rd, rnlo, rnhi } => {
520                return self
521                    .encode_arm(&ArmOp::I64SetCondZ {
522                        rd: *rd,
523                        rn_lo: *rnlo,
524                        rn_hi: *rnhi,
525                    })
526                    .map(Some);
527            }
528            ArmOp::I64Eq {
529                rd,
530                rnlo,
531                rnhi,
532                rmlo,
533                rmhi,
534            }
535            | ArmOp::I64Ne {
536                rd,
537                rnlo,
538                rnhi,
539                rmlo,
540                rmhi,
541            }
542            | ArmOp::I64LtS {
543                rd,
544                rnlo,
545                rnhi,
546                rmlo,
547                rmhi,
548            }
549            | ArmOp::I64LtU {
550                rd,
551                rnlo,
552                rnhi,
553                rmlo,
554                rmhi,
555            }
556            | ArmOp::I64LeS {
557                rd,
558                rnlo,
559                rnhi,
560                rmlo,
561                rmhi,
562            }
563            | ArmOp::I64LeU {
564                rd,
565                rnlo,
566                rnhi,
567                rmlo,
568                rmhi,
569            }
570            | ArmOp::I64GtS {
571                rd,
572                rnlo,
573                rnhi,
574                rmlo,
575                rmhi,
576            }
577            | ArmOp::I64GtU {
578                rd,
579                rnlo,
580                rnhi,
581                rmlo,
582                rmhi,
583            }
584            | ArmOp::I64GeS {
585                rd,
586                rnlo,
587                rnhi,
588                rmlo,
589                rmhi,
590            }
591            | ArmOp::I64GeU {
592                rd,
593                rnlo,
594                rnhi,
595                rmlo,
596                rmhi,
597            } => {
598                let cond = match op {
599                    ArmOp::I64Eq { .. } => Condition::EQ,
600                    ArmOp::I64Ne { .. } => Condition::NE,
601                    ArmOp::I64LtS { .. } => Condition::LT,
602                    ArmOp::I64LtU { .. } => Condition::LO,
603                    ArmOp::I64LeS { .. } => Condition::LE,
604                    ArmOp::I64LeU { .. } => Condition::LS,
605                    ArmOp::I64GtS { .. } => Condition::GT,
606                    ArmOp::I64GtU { .. } => Condition::HI,
607                    ArmOp::I64GeS { .. } => Condition::GE,
608                    _ => Condition::HS,
609                };
610                return self
611                    .encode_arm(&ArmOp::I64SetCond {
612                        rd: *rd,
613                        rn_lo: *rnlo,
614                        rn_hi: *rnhi,
615                        rm_lo: *rmlo,
616                        rm_hi: *rmhi,
617                        cond,
618                    })
619                    .map(Some);
620            }
621
622            // I64Mul: cross products into R12, then UMULL — same sequence and
623            // ordering as the Thumb-2 arm (R12 is encoder scratch, #212).
624            ArmOp::I64Mul {
625                rd_lo,
626                rd_hi,
627                rn_lo,
628                rn_hi,
629                rm_lo,
630                rm_hi,
631            } => {
632                let (dl, dh) = (reg_to_bits(rd_lo), reg_to_bits(rd_hi));
633                let (nl, nh) = (reg_to_bits(rn_lo), reg_to_bits(rn_hi));
634                let (ml, mh) = (reg_to_bits(rm_lo), reg_to_bits(rm_hi));
635                // MUL R12, rn_lo, rm_hi   (R12 = a_lo * b_hi)
636                w(&mut b, 0xE000_0090 | (12 << 16) | (mh << 8) | nl);
637                // MLA R12, rn_hi, rm_lo, R12  (R12 += a_hi * b_lo)
638                w(
639                    &mut b,
640                    0xE020_0090 | (12 << 16) | (12 << 12) | (ml << 8) | nh,
641                );
642                // UMULL rd_lo, rd_hi, rn_lo, rm_lo
643                w(
644                    &mut b,
645                    0xE080_0090 | (dh << 16) | (dl << 12) | (ml << 8) | nl,
646                );
647                // ADD rd_hi, rd_hi, R12
648                w(&mut b, 0xE080_0000 | (dh << 16) | (dh << 12) | 12);
649            }
650
651            // I64Shl / I64ShrU / I64ShrS: same small/large-shift structure as
652            // the Thumb-2 arms (rm_hi is the scratch register; amounts are
653            // masked to 6 bits; register-controlled shifts >= 32 yield 0,
654            // which the small path relies on for n = 0).
655            ArmOp::I64Shl {
656                rd_lo,
657                rd_hi,
658                rn_lo,
659                rn_hi,
660                rm_lo,
661                rm_hi,
662            } => {
663                let (dl, dh) = (reg_to_bits(rd_lo), reg_to_bits(rd_hi));
664                let (nl, nh) = (reg_to_bits(rn_lo), reg_to_bits(rn_hi));
665                let (ml, mh) = (reg_to_bits(rm_lo), reg_to_bits(rm_hi));
666                w(&mut b, 0xE200_003F | (ml << 16) | (ml << 12)); // AND  ml, ml, #63
667                w(&mut b, 0xE250_0020 | (ml << 16) | (mh << 12)); // SUBS mh, ml, #32
668                w(&mut b, 0x5A00_0005); //                            BPL  .large
669                w(&mut b, 0xE260_0020 | (ml << 16) | (mh << 12)); // RSB  mh, ml, #32
670                shift_reg(&mut b, LSR, mh, nl, mh); //               mh = lo >> (32-n)
671                shift_reg(&mut b, LSL, dh, nh, ml); //               dh = hi << n
672                w(&mut b, 0xE180_0000 | (dh << 16) | (dh << 12) | mh); // ORR dh, dh, mh
673                shift_reg(&mut b, LSL, dl, nl, ml); //               dl = lo << n
674                w(&mut b, 0xEA00_0001); //                            B    .done
675                shift_reg(&mut b, LSL, dh, nl, mh); //               .large: dh = lo << (n-32)
676                w(&mut b, 0xE3A0_0000 | (dl << 12)); //              MOV  dl, #0
677            }
678            ArmOp::I64ShrU {
679                rd_lo,
680                rd_hi,
681                rn_lo,
682                rn_hi,
683                rm_lo,
684                rm_hi,
685            } => {
686                let (dl, dh) = (reg_to_bits(rd_lo), reg_to_bits(rd_hi));
687                let (nl, nh) = (reg_to_bits(rn_lo), reg_to_bits(rn_hi));
688                let (ml, mh) = (reg_to_bits(rm_lo), reg_to_bits(rm_hi));
689                w(&mut b, 0xE200_003F | (ml << 16) | (ml << 12)); // AND  ml, ml, #63
690                w(&mut b, 0xE250_0020 | (ml << 16) | (mh << 12)); // SUBS mh, ml, #32
691                w(&mut b, 0x5A00_0005); //                            BPL  .large
692                w(&mut b, 0xE260_0020 | (ml << 16) | (mh << 12)); // RSB  mh, ml, #32
693                shift_reg(&mut b, LSL, mh, nh, mh); //               mh = hi << (32-n)
694                shift_reg(&mut b, LSR, dl, nl, ml); //               dl = lo >> n
695                w(&mut b, 0xE180_0000 | (dl << 16) | (dl << 12) | mh); // ORR dl, dl, mh
696                shift_reg(&mut b, LSR, dh, nh, ml); //               dh = hi >> n
697                w(&mut b, 0xEA00_0001); //                            B    .done
698                shift_reg(&mut b, LSR, dl, nh, mh); //               .large: dl = hi >> (n-32)
699                w(&mut b, 0xE3A0_0000 | (dh << 12)); //              MOV  dh, #0
700            }
701            ArmOp::I64ShrS {
702                rd_lo,
703                rd_hi,
704                rn_lo,
705                rn_hi,
706                rm_lo,
707                rm_hi,
708            } => {
709                let (dl, dh) = (reg_to_bits(rd_lo), reg_to_bits(rd_hi));
710                let (nl, nh) = (reg_to_bits(rn_lo), reg_to_bits(rn_hi));
711                let (ml, mh) = (reg_to_bits(rm_lo), reg_to_bits(rm_hi));
712                w(&mut b, 0xE200_003F | (ml << 16) | (ml << 12)); // AND  ml, ml, #63
713                w(&mut b, 0xE250_0020 | (ml << 16) | (mh << 12)); // SUBS mh, ml, #32
714                w(&mut b, 0x5A00_0005); //                            BPL  .large
715                w(&mut b, 0xE260_0020 | (ml << 16) | (mh << 12)); // RSB  mh, ml, #32
716                shift_reg(&mut b, LSL, mh, nh, mh); //               mh = hi << (32-n)
717                shift_reg(&mut b, LSR, dl, nl, ml); //               dl = lo >> n
718                w(&mut b, 0xE180_0000 | (dl << 16) | (dl << 12) | mh); // ORR dl, dl, mh
719                shift_reg(&mut b, ASR, dh, nh, ml); //               dh = hi >> n (arith)
720                w(&mut b, 0xEA00_0001); //                            B    .done
721                shift_reg(&mut b, ASR, dl, nh, mh); //               .large: dl = hi >> (n-32)
722                w(&mut b, 0xE1A0_0040 | (dh << 12) | (31 << 7) | nh); // ASR dh, nh, #31
723            }
724
725            // I64Rotl / I64Rotr: the #610 fixed-ABI wrapper (A32 form) around
726            // the same fixed-register core as the Thumb-2 arms — value in
727            // R0:R1, amount in R2, scratch R3 + R12.
728            ArmOp::I64Rotl {
729                rdlo,
730                rdhi,
731                rnlo,
732                rnhi,
733                shift,
734            } => {
735                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, shift]);
736                for word in [
737                    0xE202_203Fu32, // AND  R2, R2, #63   (mask amount mod 64)
738                    0xE252_3020,    // SUBS R3, R2, #32   (R3 = n-32, sets N)
739                    0x5A00_0007,    // BPL  .large        (n >= 32)
740                    // --- small rotation (n < 32) ---
741                    0xE262_3020, // RSB  R3, R2, #32   (R3 = 32-n)
742                    0xE1A0_C330, // LSR  R12, R0, R3   (lo >> (32-n))
743                    0xE1A0_3331, // LSR  R3, R1, R3    (hi >> (32-n))
744                    0xE1A0_1211, // LSL  R1, R1, R2    (hi << n)
745                    0xE181_100C, // ORR  R1, R1, R12   (new_hi)
746                    0xE1A0_0210, // LSL  R0, R0, R2    (lo << n)
747                    0xE180_0003, // ORR  R0, R0, R3    (new_lo)
748                    0xEA00_0007, // B    .done
749                    // --- large rotation (n >= 32), R3 = m = n-32 ---
750                    0xE263_2020, // RSB  R2, R3, #32   (R2 = 32-m = 64-n)
751                    0xE1A0_C231, // LSR  R12, R1, R2   (hi >> (64-n))
752                    0xE1A0_2230, // LSR  R2, R0, R2    (lo >> (64-n))
753                    0xE1A0_0310, // LSL  R0, R0, R3    (lo << m)
754                    0xE1A0_1311, // LSL  R1, R1, R3    (hi << m)
755                    0xE180_C00C, // ORR  R12, R0, R12  (new_hi = (lo<<m)|(hi>>(64-n)))
756                    0xE181_0002, // ORR  R0, R1, R2    (new_lo = (hi<<m)|(lo>>(64-n)))
757                    0xE1A0_100C, // MOV  R1, R12       (new_hi into place)
758                ] {
759                    w(&mut b, word);
760                }
761                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
762            }
763            ArmOp::I64Rotr {
764                rdlo,
765                rdhi,
766                rnlo,
767                rnhi,
768                shift,
769            } => {
770                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, shift]);
771                for word in [
772                    0xE202_203Fu32, // AND  R2, R2, #63   (mask amount mod 64)
773                    0xE252_3020,    // SUBS R3, R2, #32   (R3 = n-32, sets N)
774                    0x5A00_0007,    // BPL  .large        (n >= 32)
775                    // --- small rotation (n < 32) ---
776                    0xE262_3020, // RSB  R3, R2, #32   (R3 = 32-n)
777                    0xE1A0_C311, // LSL  R12, R1, R3   (hi << (32-n))
778                    0xE1A0_3310, // LSL  R3, R0, R3    (lo << (32-n))
779                    0xE1A0_0230, // LSR  R0, R0, R2    (lo >> n)
780                    0xE180_000C, // ORR  R0, R0, R12   (new_lo)
781                    0xE1A0_1231, // LSR  R1, R1, R2    (hi >> n)
782                    0xE181_1003, // ORR  R1, R1, R3    (new_hi)
783                    0xEA00_0007, // B    .done
784                    // --- large rotation (n >= 32), R3 = m = n-32 ---
785                    0xE263_2020, // RSB  R2, R3, #32   (R2 = 32-m = 64-n)
786                    0xE1A0_C210, // LSL  R12, R0, R2   (lo << (64-n))
787                    0xE1A0_2211, // LSL  R2, R1, R2    (hi << (64-n))
788                    0xE1A0_1331, // LSR  R1, R1, R3    (hi >> m)
789                    0xE181_C00C, // ORR  R12, R1, R12  (new_lo = (hi>>m)|(lo<<(64-n)))
790                    0xE1A0_1330, // LSR  R1, R0, R3    (lo >> m)
791                    0xE181_1002, // ORR  R1, R1, R2    (new_hi = (lo>>m)|(hi<<(64-n)))
792                    0xE1A0_000C, // MOV  R0, R12       (new_lo into place)
793                ] {
794                    w(&mut b, word);
795                }
796                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
797            }
798
799            // I64Clz: CLZ(hi), or 32 + CLZ(lo) when hi == 0. Conditional
800            // execution replaces the Thumb branches; like the Thumb arm, the
801            // high word of the result pair (rnhi) is cleared last.
802            ArmOp::I64Clz { rd, rnlo, rnhi } => {
803                let (rd_b, lo, hi) = (reg_to_bits(rd), reg_to_bits(rnlo), reg_to_bits(rnhi));
804                w(&mut b, 0xE350_0000 | (hi << 16)); //              CMP   rnhi, #0
805                w(&mut b, 0x116F_0F10 | (rd_b << 12) | hi); //       CLZNE rd, rnhi
806                w(&mut b, 0x016F_0F10 | (rd_b << 12) | lo); //       CLZEQ rd, rnlo
807                w(&mut b, 0x0280_0020 | (rd_b << 16) | (rd_b << 12)); // ADDEQ rd, rd, #32
808                w(&mut b, 0xE3A0_0000 | (hi << 12)); //              MOV   rnhi, #0
809            }
810
811            // I64Ctz: CLZ(RBIT(lo)), or 32 + CLZ(RBIT(hi)) when lo == 0.
812            // RBIT/CLZ leave the flags intact, so the CMP's Z survives to the
813            // conditional ADD.
814            ArmOp::I64Ctz { rd, rnlo, rnhi } => {
815                let (rd_b, lo, hi) = (reg_to_bits(rd), reg_to_bits(rnlo), reg_to_bits(rnhi));
816                w(&mut b, 0xE350_0000 | (lo << 16)); //              CMP    rnlo, #0
817                w(&mut b, 0x16FF_0F30 | (rd_b << 12) | lo); //       RBITNE rd, rnlo
818                w(&mut b, 0x06FF_0F30 | (rd_b << 12) | hi); //       RBITEQ rd, rnhi
819                w(&mut b, 0xE16F_0F10 | (rd_b << 12) | rd_b); //     CLZ    rd, rd
820                w(&mut b, 0x0280_0020 | (rd_b << 16) | (rd_b << 12)); // ADDEQ rd, rd, #32
821                w(&mut b, 0xE3A0_0000 | (hi << 12)); //              MOV    rnhi, #0
822            }
823
824            // I64Const: MOVW/MOVT per half (MOVT elided when the half fits in
825            // 16 bits, mirroring the Thumb-2 arm).
826            ArmOp::I64Const { rdlo, rdhi, value } => {
827                let lo32 = *value as u32;
828                let hi32 = (*value >> 32) as u32;
829                movw(&mut b, reg_to_bits(rdlo), lo32 & 0xFFFF);
830                if lo32 > 0xFFFF {
831                    movt(&mut b, reg_to_bits(rdlo), lo32 >> 16);
832                }
833                movw(&mut b, reg_to_bits(rdhi), hi32 & 0xFFFF);
834                if hi32 > 0xFFFF {
835                    movt(&mut b, reg_to_bits(rdhi), hi32 >> 16);
836                }
837            }
838
839            // I64Ldr / I64Str: two word accesses at [base, #off] / #off+4.
840            // A register offset is materialized into IP once (the #206/#372
841            // hazard: dropping it would read the wrong address).
842            ArmOp::I64Ldr { rdlo, rdhi, addr } | ArmOp::I64Str { rdlo, rdhi, addr } => {
843                let base = if let Some(rm) = addr.offset_reg {
844                    // ADD ip, base, rm
845                    w(
846                        &mut b,
847                        0xE080_0000
848                            | (reg_to_bits(&addr.base) << 16)
849                            | (12 << 12)
850                            | reg_to_bits(&rm),
851                    );
852                    12
853                } else {
854                    reg_to_bits(&addr.base)
855                };
856                if addr.offset < 0 || addr.offset > 0xFFB {
857                    return Err(synth_core::Error::synthesis(format!(
858                        "i64 load/store offset {} out of the A32 imm12 range (0..=4091) — materialize the offset into a register",
859                        addr.offset
860                    )));
861                }
862                let off = addr.offset as u32;
863                let opc: u32 = if matches!(op, ArmOp::I64Ldr { .. }) {
864                    0xE590_0000 // LDR
865                } else {
866                    0xE580_0000 // STR
867                };
868                w(&mut b, opc | (base << 16) | (reg_to_bits(rdlo) << 12) | off);
869                w(
870                    &mut b,
871                    opc | (base << 16) | (reg_to_bits(rdhi) << 12) | (off + 4),
872                );
873            }
874
875            // I64ExtendI32S: rdlo = rn; rdhi = rdlo >> 31 (arithmetic).
876            ArmOp::I64ExtendI32S { rdlo, rdhi, rn } => {
877                if rdlo != rn {
878                    w(
879                        &mut b,
880                        0xE1A0_0000 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rn),
881                    );
882                }
883                w(
884                    &mut b,
885                    0xE1A0_0040 | (reg_to_bits(rdhi) << 12) | (31 << 7) | reg_to_bits(rdlo),
886                );
887            }
888
889            // I64ExtendI32U: rdlo = rn; rdhi = 0.
890            ArmOp::I64ExtendI32U { rdlo, rdhi, rn } => {
891                if rdlo != rn {
892                    w(
893                        &mut b,
894                        0xE1A0_0000 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rn),
895                    );
896                }
897                w(&mut b, 0xE3A0_0000 | (reg_to_bits(rdhi) << 12));
898            }
899
900            // I64Extend8S / I64Extend16S: SXTB/SXTH then sign-fill the high word.
901            ArmOp::I64Extend8S { rdlo, rdhi, rnlo } => {
902                w(
903                    &mut b,
904                    0xE6AF_0070 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rnlo),
905                );
906                w(
907                    &mut b,
908                    0xE1A0_0040 | (reg_to_bits(rdhi) << 12) | (31 << 7) | reg_to_bits(rdlo),
909                );
910            }
911            ArmOp::I64Extend16S { rdlo, rdhi, rnlo } => {
912                w(
913                    &mut b,
914                    0xE6BF_0070 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rnlo),
915                );
916                w(
917                    &mut b,
918                    0xE1A0_0040 | (reg_to_bits(rdhi) << 12) | (31 << 7) | reg_to_bits(rdlo),
919                );
920            }
921            ArmOp::I64Extend32S { rdlo, rdhi, rnlo } => {
922                if rdlo != rnlo {
923                    w(
924                        &mut b,
925                        0xE1A0_0000 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rnlo),
926                    );
927                }
928                w(
929                    &mut b,
930                    0xE1A0_0040 | (reg_to_bits(rdhi) << 12) | (31 << 7) | reg_to_bits(rnlo),
931                );
932            }
933
934            // I32WrapI64: take the low word. When rd == rnlo this is a genuine
935            // no-op (the one case where a NOP word is the correct encoding).
936            ArmOp::I32WrapI64 { rd, rnlo } => {
937                w(
938                    &mut b,
939                    0xE1A0_0000 | (reg_to_bits(rd) << 12) | reg_to_bits(rnlo),
940                );
941            }
942
943            // I64Add / I64Sub: the classic pair — ADDS lo + ADC hi (SUBS/SBC).
944            // The selector emits these as separate Adds/Adc ops; the fused
945            // variants are verification-constructed, but they encode for real.
946            ArmOp::I64Add {
947                rdlo,
948                rdhi,
949                rnlo,
950                rnhi,
951                rmlo,
952                rmhi,
953            } => {
954                dp_reg(
955                    &mut b,
956                    0xE090_0000, // ADDS
957                    reg_to_bits(rdlo),
958                    reg_to_bits(rnlo),
959                    reg_to_bits(rmlo),
960                );
961                dp_reg(
962                    &mut b,
963                    0xE0A0_0000, // ADC
964                    reg_to_bits(rdhi),
965                    reg_to_bits(rnhi),
966                    reg_to_bits(rmhi),
967                );
968            }
969            ArmOp::I64Sub {
970                rdlo,
971                rdhi,
972                rnlo,
973                rnhi,
974                rmlo,
975                rmhi,
976            } => {
977                dp_reg(
978                    &mut b,
979                    0xE050_0000, // SUBS
980                    reg_to_bits(rdlo),
981                    reg_to_bits(rnlo),
982                    reg_to_bits(rmlo),
983                );
984                dp_reg(
985                    &mut b,
986                    0xE0C0_0000, // SBC
987                    reg_to_bits(rdhi),
988                    reg_to_bits(rnhi),
989                    reg_to_bits(rmhi),
990                );
991            }
992
993            // I64And / I64Or / I64Xor: two independent word ops.
994            ArmOp::I64And {
995                rdlo,
996                rdhi,
997                rnlo,
998                rnhi,
999                rmlo,
1000                rmhi,
1001            }
1002            | ArmOp::I64Or {
1003                rdlo,
1004                rdhi,
1005                rnlo,
1006                rnhi,
1007                rmlo,
1008                rmhi,
1009            }
1010            | ArmOp::I64Xor {
1011                rdlo,
1012                rdhi,
1013                rnlo,
1014                rnhi,
1015                rmlo,
1016                rmhi,
1017            } => {
1018                let base = match op {
1019                    ArmOp::I64And { .. } => 0xE000_0000, // AND
1020                    ArmOp::I64Or { .. } => 0xE180_0000,  // ORR
1021                    _ => 0xE020_0000,                    // EOR
1022                };
1023                dp_reg(
1024                    &mut b,
1025                    base,
1026                    reg_to_bits(rdlo),
1027                    reg_to_bits(rnlo),
1028                    reg_to_bits(rmlo),
1029                );
1030                dp_reg(
1031                    &mut b,
1032                    base,
1033                    reg_to_bits(rdhi),
1034                    reg_to_bits(rnhi),
1035                    reg_to_bits(rmhi),
1036                );
1037            }
1038
1039            // I64DivU: binary long division — A32 transcription of the Thumb-2
1040            // #610/#613 arm (fixed-ABI marshal, zero-divisor trap, 64-round
1041            // shift-subtract core, quotient to R0:R1, result to rd pair).
1042            ArmOp::I64DivU {
1043                rdlo,
1044                rdhi,
1045                rnlo,
1046                rnhi,
1047                rmlo,
1048                rmhi,
1049                elide_zero_guard,
1050            } => {
1051                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, rmlo, rmhi]);
1052                // #494 phase 2b: elided only under a certificate-discharged
1053                // UNSAT(P ∧ divisor == 0) obligation (fact-spec pass).
1054                if !elide_zero_guard {
1055                    emit_a32_i64_divisor_zero_trap(&mut b);
1056                }
1057                w(&mut b, 0xE92D_00F0); // PUSH {R4-R7}
1058                for r in 4..8u32 {
1059                    w(&mut b, 0xE3A0_0000 | (r << 12)); // MOV Rr, #0
1060                }
1061                div_loop(&mut b, 12); // counter in R12 (encoder scratch)
1062                w(&mut b, 0xE1A0_0004); // MOV R0, R4 (quotient lo)
1063                w(&mut b, 0xE1A0_1005); // MOV R1, R5 (quotient hi)
1064                w(&mut b, 0xE8BD_00F0); // POP {R4-R7}
1065                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
1066            }
1067
1068            // I64DivS: sign-extract, unsigned core, conditional negate —
1069            // A32 transcription of the Thumb-2 arm.
1070            ArmOp::I64DivS {
1071                rdlo,
1072                rdhi,
1073                rnlo,
1074                rnhi,
1075                rmlo,
1076                rmhi,
1077                elide_zero_guard,
1078                elide_overflow_guard,
1079            } => {
1080                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, rmlo, rmhi]);
1081                // #494 phase 2b: two INDEPENDENT guards, two INDEPENDENT
1082                // obligations. The zero guard falls to UNSAT(P ∧ divisor == 0);
1083                // the #633 overflow guard falls ONLY to
1084                // UNSAT(P ∧ dividend == INT64_MIN ∧ divisor == -1) — a
1085                // divisor-nonzero fact alone must keep it.
1086                if !elide_zero_guard {
1087                    emit_a32_i64_divisor_zero_trap(&mut b);
1088                }
1089                if !elide_overflow_guard {
1090                    // #633: INT64_MIN / -1 overflows — trap like the i32 path
1091                    // (rem_s stays guard-free: rem_s(INT64_MIN, -1) == 0).
1092                    emit_a32_i64_divs_overflow_trap(&mut b);
1093                }
1094                w(&mut b, 0xE92D_0FF0); // PUSH {R4-R11}
1095                w(&mut b, 0xE021_9003); // EOR R9, R1, R3 (result sign in MSB)
1096                skip_negate_if_positive(&mut b, 1);
1097                negate64(&mut b, 0, 1);
1098                skip_negate_if_positive(&mut b, 3);
1099                negate64(&mut b, 2, 3);
1100                for r in 4..8u32 {
1101                    w(&mut b, 0xE3A0_0000 | (r << 12)); // MOV Rr, #0
1102                }
1103                div_loop(&mut b, 8); // counter in R8 (saved above)
1104                w(&mut b, 0xE1A0_0004); // MOV R0, R4
1105                w(&mut b, 0xE1A0_1005); // MOV R1, R5
1106                skip_negate_if_positive(&mut b, 9);
1107                negate64(&mut b, 0, 1);
1108                w(&mut b, 0xE8BD_0FF0); // POP {R4-R11}
1109                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
1110            }
1111
1112            // I64RemU: same core as I64DivU, returns the remainder (R6:R7).
1113            ArmOp::I64RemU {
1114                rdlo,
1115                rdhi,
1116                rnlo,
1117                rnhi,
1118                rmlo,
1119                rmhi,
1120                elide_zero_guard,
1121            } => {
1122                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, rmlo, rmhi]);
1123                if !elide_zero_guard {
1124                    emit_a32_i64_divisor_zero_trap(&mut b);
1125                }
1126                w(&mut b, 0xE92D_01F0); // PUSH {R4-R8}
1127                for r in 4..8u32 {
1128                    w(&mut b, 0xE3A0_0000 | (r << 12)); // MOV Rr, #0
1129                }
1130                div_loop(&mut b, 8);
1131                w(&mut b, 0xE1A0_0006); // MOV R0, R6 (remainder lo)
1132                w(&mut b, 0xE1A0_1007); // MOV R1, R7 (remainder hi)
1133                w(&mut b, 0xE8BD_01F0); // POP {R4-R8}
1134                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
1135            }
1136
1137            // I64RemS: remainder takes the DIVIDEND's sign (WASM semantics).
1138            ArmOp::I64RemS {
1139                rdlo,
1140                rdhi,
1141                rnlo,
1142                rnhi,
1143                rmlo,
1144                rmhi,
1145                elide_zero_guard,
1146            } => {
1147                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, rmlo, rmhi]);
1148                if !elide_zero_guard {
1149                    emit_a32_i64_divisor_zero_trap(&mut b);
1150                }
1151                w(&mut b, 0xE92D_0FF0); // PUSH {R4-R11}
1152                w(&mut b, 0xE1A0_9001); // MOV R9, R1 (dividend sign)
1153                skip_negate_if_positive(&mut b, 1);
1154                negate64(&mut b, 0, 1);
1155                skip_negate_if_positive(&mut b, 3);
1156                negate64(&mut b, 2, 3);
1157                for r in 4..8u32 {
1158                    w(&mut b, 0xE3A0_0000 | (r << 12)); // MOV Rr, #0
1159                }
1160                div_loop(&mut b, 8);
1161                w(&mut b, 0xE1A0_0006); // MOV R0, R6
1162                w(&mut b, 0xE1A0_1007); // MOV R1, R7
1163                skip_negate_if_positive(&mut b, 9);
1164                negate64(&mut b, 0, 1);
1165                w(&mut b, 0xE8BD_0FF0); // POP {R4-R11}
1166                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
1167            }
1168
1169            // Popcnt (i32): bit-twiddle expansion (no native A32 popcount),
1170            // mirroring the Thumb-2 arm's register contract (R11 + R12 as
1171            // scratch, shift-add fold, final AND #0x3F).
1172            ArmOp::Popcnt { rd, rm } => {
1173                let rd_b = reg_to_bits(rd);
1174                if rd != rm {
1175                    w(&mut b, 0xE1A0_0000 | (rd_b << 12) | reg_to_bits(rm)); // MOV rd, rm
1176                }
1177                // x = x - ((x >> 1) & 0x55555555)
1178                movw(&mut b, 12, 0x5555);
1179                movt(&mut b, 12, 0x5555);
1180                shift_imm(&mut b, LSR, 11, rd_b, 1);
1181                dp_reg(&mut b, 0xE000_0000, 11, 11, 12); // AND R11, R11, R12
1182                dp_reg(&mut b, 0xE040_0000, rd_b, rd_b, 11); // SUB rd, rd, R11
1183                // x = (x & 0x33333333) + ((x >> 2) & 0x33333333)
1184                movw(&mut b, 12, 0x3333);
1185                movt(&mut b, 12, 0x3333);
1186                dp_reg(&mut b, 0xE000_0000, 11, rd_b, 12); // AND R11, rd, R12
1187                shift_imm(&mut b, LSR, rd_b, rd_b, 2);
1188                dp_reg(&mut b, 0xE000_0000, rd_b, rd_b, 12); // AND rd, rd, R12
1189                dp_reg(&mut b, 0xE080_0000, rd_b, rd_b, 11); // ADD rd, rd, R11
1190                // x = (x + (x >> 4)) & 0x0F0F0F0F
1191                shift_imm(&mut b, LSR, 11, rd_b, 4);
1192                dp_reg(&mut b, 0xE080_0000, rd_b, rd_b, 11); // ADD rd, rd, R11
1193                movw(&mut b, 12, 0x0F0F);
1194                movt(&mut b, 12, 0x0F0F);
1195                dp_reg(&mut b, 0xE000_0000, rd_b, rd_b, 12); // AND rd, rd, R12
1196                // x += x >> 8; x += x >> 16; x &= 0x3F
1197                shift_imm(&mut b, LSR, 11, rd_b, 8);
1198                dp_reg(&mut b, 0xE080_0000, rd_b, rd_b, 11);
1199                shift_imm(&mut b, LSR, 11, rd_b, 16);
1200                dp_reg(&mut b, 0xE080_0000, rd_b, rd_b, 11);
1201                w(&mut b, 0xE200_003F | (rd_b << 16) | (rd_b << 12)); // AND rd, rd, #63
1202            }
1203
1204            // I64Popcnt: POPCNT(lo) + POPCNT(hi) — A32 transcription of the
1205            // Thumb-2 arm (R3/R4/R5 saved, mul-based per-word fold, high
1206            // result word rnhi cleared last, mirroring the Thumb contract).
1207            ArmOp::I64Popcnt { rd, rnlo, rnhi } => {
1208                let hi = reg_to_bits(rnhi);
1209                w(&mut b, 0xE92D_0038); // PUSH {R3, R4, R5}
1210                // #632 audit: route rnlo through R12 so a pair living at
1211                // (R3,R4) cannot read a clobbered R4 (sources read before any
1212                // scratch register they could occupy is written).
1213                w(&mut b, 0xE1A0_C000 | reg_to_bits(rnlo)); // MOV R12, rnlo
1214                w(&mut b, 0xE1A0_5000 | hi); //                MOV R5, rnhi
1215                w(&mut b, 0xE1A0_400C); //                     MOV R4, R12
1216                popcnt_word(&mut b, 4, 3);
1217                popcnt_word(&mut b, 5, 3);
1218                // #632: carry the count across the scratch restore in R12 —
1219                // rd is allocator-assigned and can land inside {R3,R4,R5};
1220                // the old `ADD rd, R4, R5` before the POP was destroyed by
1221                // the restore. R12 is never allocatable and never restored.
1222                dp_reg(&mut b, 0xE080_0000, 12, 4, 5); // ADD R12, R4, R5
1223                w(&mut b, 0xE8BD_0038); // POP {R3, R4, R5}
1224                w(&mut b, 0xE1A0_0000 | (reg_to_bits(rd) << 12) | 12); // MOV rd, R12
1225                w(&mut b, 0xE3A0_0000 | (hi << 12)); // MOV rnhi, #0 (i64 hi word)
1226            }
1227
1228            _ => return Ok(None),
1229        }
1230        Ok(Some(b))
1231    }
1232
1233    fn encode_arm(&self, op: &ArmOp) -> Result<Vec<u8>> {
1234        // #615: A32 multi-instruction expansions (i64 arithmetic/shift/rotate/
1235        // compare, SetCond/SelectMove, popcnt, ...). These ops were literal
1236        // NOPs on the A32 path — user-reachable via `--target cortex-r5` —
1237        // so the value silently vanished. Mirror of the #594 CallIndirect
1238        // early-return: if the expansion helper covers the op, its bytes are
1239        // the encoding.
1240        if let Some(bytes) = self.encode_arm_expanded(op)? {
1241            return Ok(bytes);
1242        }
1243        // #206: ARM32 register-offset loads/stores. `encode_mem_addr` only
1244        // returns the 12-bit immediate, so the immediate-form arms below
1245        // silently DROP `addr.offset_reg` — a runtime address index vanished,
1246        // turning `ldr rd,[rn,rm,#off]` into `ldr rd,[rn,#off]` (the access went
1247        // to the wrong address). Compute the effective base into IP and re-encode
1248        // against `[ip, #off]`, which is uniform for word/byte/halfword/signed.
1249        if let Some(bytes) = self.encode_arm_reg_offset_mem(op)? {
1250            return Ok(bytes);
1251        }
1252        // #594: call_indirect was encoded as a literal NOP on the A32 path
1253        // (`--target cortex-r5`) — the call never happened and the function
1254        // silently returned garbage. Emit the same three-instruction expansion
1255        // as the Thumb-2 path (R11 = function-pointer table base, R12 scratch):
1256        //   MOV r12, idx, LSL #2 ; LDR r12, [r11, r12] ; BLX r12
1257        if let ArmOp::CallIndirect {
1258            table_index_reg,
1259            table_size,
1260            table_byte_offset,
1261            null_check,
1262            type_check,
1263            ..
1264        } = op
1265        {
1266            return Ok(Self::encode_arm_call_indirect(
1267                table_index_reg,
1268                *table_size,
1269                *table_byte_offset,
1270                *null_check,
1271                *type_check,
1272            ));
1273        }
1274        let instr: u32 = match op {
1275            // Data processing instructions
1276            ArmOp::Add { rd, rn, op2 } => {
1277                let rd_bits = reg_to_bits(rd);
1278                let rn_bits = reg_to_bits(rn);
1279                let (op2_bits, i_flag) = encode_operand2(op2)?;
1280
1281                // ADD encoding: cond(4) | 00 | I(1) | 0100 | S(1) | Rn(4) | Rd(4) | operand2(12)
1282                0xE0800000 // condition=always(E), opcode=ADD(0100), S=0
1283                    | (i_flag << 25)
1284                    | (rn_bits << 16)
1285                    | (rd_bits << 12)
1286                    | op2_bits
1287            }
1288
1289            ArmOp::Sub { rd, rn, op2 } => {
1290                let rd_bits = reg_to_bits(rd);
1291                let rn_bits = reg_to_bits(rn);
1292                let (op2_bits, i_flag) = encode_operand2(op2)?;
1293
1294                // SUB encoding: opcode=0010
1295                0xE0400000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1296            }
1297
1298            // i64 support: ADDS, ADC, SUBS, SBC for ARM32
1299            ArmOp::Adds { rd, rn, op2 } => {
1300                let rd_bits = reg_to_bits(rd);
1301                let rn_bits = reg_to_bits(rn);
1302                let (op2_bits, i_flag) = encode_operand2(op2)?;
1303
1304                // ADDS encoding: opcode=0100, S=1
1305                0xE0900000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1306            }
1307
1308            ArmOp::Adc { rd, rn, op2 } => {
1309                let rd_bits = reg_to_bits(rd);
1310                let rn_bits = reg_to_bits(rn);
1311                let (op2_bits, i_flag) = encode_operand2(op2)?;
1312
1313                // ADC encoding: opcode=0101
1314                0xE0A00000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1315            }
1316
1317            ArmOp::Subs { rd, rn, op2 } => {
1318                let rd_bits = reg_to_bits(rd);
1319                let rn_bits = reg_to_bits(rn);
1320                let (op2_bits, i_flag) = encode_operand2(op2)?;
1321
1322                // SUBS encoding: opcode=0010, S=1
1323                0xE0500000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1324            }
1325
1326            ArmOp::Sbc { rd, rn, op2 } => {
1327                let rd_bits = reg_to_bits(rd);
1328                let rn_bits = reg_to_bits(rn);
1329                let (op2_bits, i_flag) = encode_operand2(op2)?;
1330
1331                // SBC encoding: opcode=0110
1332                0xE0C00000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1333            }
1334
1335            ArmOp::Mul { rd, rn, rm } => {
1336                let rd_bits = reg_to_bits(rd);
1337                let rn_bits = reg_to_bits(rn);
1338                let rm_bits = reg_to_bits(rm);
1339
1340                // MUL encoding: cond(4) | 000000 | A(1) | S(1) | Rd(4) | Rn(4) | Rs(4) | 1001 | Rm(4)
1341                0xE0000090 | (rd_bits << 16) | (rn_bits << 8) | rm_bits
1342            }
1343
1344            ArmOp::Umull { rdlo, rdhi, rn, rm } => {
1345                let rdlo_bits = reg_to_bits(rdlo);
1346                let rdhi_bits = reg_to_bits(rdhi);
1347                let rn_bits = reg_to_bits(rn);
1348                let rm_bits = reg_to_bits(rm);
1349
1350                // UMULL encoding: cond(4) | 0000 1000 | RdHi(4) | RdLo(4) | Rm(4) | 1001 | Rn(4)
1351                0xE0800090 | (rdhi_bits << 16) | (rdlo_bits << 12) | (rm_bits << 8) | rn_bits
1352            }
1353
1354            ArmOp::Sdiv { rd, rn, rm } => {
1355                let rd_bits = reg_to_bits(rd);
1356                let rn_bits = reg_to_bits(rn);
1357                let rm_bits = reg_to_bits(rm);
1358
1359                // SDIV encoding: cond(4) | 01110001 | Rd(4) | 1111 | Rm(4) | 0001 | Rn(4)
1360                // ARMv7-M and above
1361                0xE710F010 | (rd_bits << 16) | (rm_bits << 8) | rn_bits
1362            }
1363
1364            ArmOp::Udiv { rd, rn, rm } => {
1365                let rd_bits = reg_to_bits(rd);
1366                let rn_bits = reg_to_bits(rn);
1367                let rm_bits = reg_to_bits(rm);
1368
1369                // UDIV encoding: cond(4) | 01110011 | Rd(4) | 1111 | Rm(4) | 0001 | Rn(4)
1370                // ARMv7-M and above
1371                0xE730F010 | (rd_bits << 16) | (rm_bits << 8) | rn_bits
1372            }
1373
1374            ArmOp::Mls { rd, rn, rm, ra } => {
1375                let rd_bits = reg_to_bits(rd);
1376                let rn_bits = reg_to_bits(rn);
1377                let rm_bits = reg_to_bits(rm);
1378                let ra_bits = reg_to_bits(ra);
1379
1380                // MLS encoding: cond(4) | 00000110 | Rd(4) | Ra(4) | Rm(4) | 1001 | Rn(4)
1381                // Rd = Ra - (Rn * Rm)
1382                0xE0600090 | (rd_bits << 16) | (ra_bits << 12) | (rm_bits << 8) | rn_bits
1383            }
1384
1385            ArmOp::Mla { rd, rn, rm, ra } => {
1386                let rd_bits = reg_to_bits(rd);
1387                let rn_bits = reg_to_bits(rn);
1388                let rm_bits = reg_to_bits(rm);
1389                let ra_bits = reg_to_bits(ra);
1390
1391                // MLA encoding: cond(4) | 0000001 S | Rd(4) | Ra(4) | Rm(4) | 1001 | Rn(4)
1392                // Rd = Ra + (Rn * Rm). Base 0xE0200090 (S=0).
1393                0xE0200090 | (rd_bits << 16) | (ra_bits << 12) | (rm_bits << 8) | rn_bits
1394            }
1395
1396            ArmOp::And { rd, rn, op2 } => {
1397                let rd_bits = reg_to_bits(rd);
1398                let rn_bits = reg_to_bits(rn);
1399                let (op2_bits, i_flag) = encode_operand2(op2)?;
1400
1401                // AND encoding: opcode=0000
1402                0xE0000000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1403            }
1404
1405            ArmOp::Orr { rd, rn, op2 } => {
1406                let rd_bits = reg_to_bits(rd);
1407                let rn_bits = reg_to_bits(rn);
1408                let (op2_bits, i_flag) = encode_operand2(op2)?;
1409
1410                // ORR encoding: opcode=1100
1411                0xE1800000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1412            }
1413
1414            ArmOp::Eor { rd, rn, op2 } => {
1415                let rd_bits = reg_to_bits(rd);
1416                let rn_bits = reg_to_bits(rn);
1417                let (op2_bits, i_flag) = encode_operand2(op2)?;
1418
1419                // EOR encoding: opcode=0001
1420                0xE0200000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1421            }
1422
1423            // Shift instructions
1424            ArmOp::Lsl { rd, rn, shift } => {
1425                let rd_bits = reg_to_bits(rd);
1426                let rn_bits = reg_to_bits(rn);
1427                let shift_bits = *shift & 0x1F;
1428
1429                // LSL encoding: MOV with shift
1430                0xE1A00000 | (rd_bits << 12) | (shift_bits << 7) | rn_bits
1431            }
1432
1433            ArmOp::Lsr { rd, rn, shift } => {
1434                let rd_bits = reg_to_bits(rd);
1435                let rn_bits = reg_to_bits(rn);
1436                let shift_bits = *shift & 0x1F;
1437
1438                // LSR encoding
1439                0xE1A00020 | (rd_bits << 12) | (shift_bits << 7) | rn_bits
1440            }
1441
1442            ArmOp::Asr { rd, rn, shift } => {
1443                let rd_bits = reg_to_bits(rd);
1444                let rn_bits = reg_to_bits(rn);
1445                let shift_bits = *shift & 0x1F;
1446
1447                // ASR encoding
1448                0xE1A00040 | (rd_bits << 12) | (shift_bits << 7) | rn_bits
1449            }
1450
1451            ArmOp::Ror { rd, rn, shift } => {
1452                let rd_bits = reg_to_bits(rd);
1453                let rn_bits = reg_to_bits(rn);
1454                let shift_bits = *shift & 0x1F;
1455
1456                // ROR encoding: MOV with ROR shift
1457                0xE1A00060 | (rd_bits << 12) | (shift_bits << 7) | rn_bits
1458            }
1459
1460            // Register-based shifts (ARM32)
1461            // LSL Rd, Rn, Rm: cond 0001101S 0000 Rd Rs 0001 Rn
1462            ArmOp::LslReg { rd, rn, rm } => {
1463                let rd_bits = reg_to_bits(rd);
1464                let rn_bits = reg_to_bits(rn);
1465                let rm_bits = reg_to_bits(rm);
1466                0xE1A00010 | (rd_bits << 12) | (rm_bits << 8) | rn_bits
1467            }
1468            ArmOp::LsrReg { rd, rn, rm } => {
1469                let rd_bits = reg_to_bits(rd);
1470                let rn_bits = reg_to_bits(rn);
1471                let rm_bits = reg_to_bits(rm);
1472                0xE1A00030 | (rd_bits << 12) | (rm_bits << 8) | rn_bits
1473            }
1474            ArmOp::AsrReg { rd, rn, rm } => {
1475                let rd_bits = reg_to_bits(rd);
1476                let rn_bits = reg_to_bits(rn);
1477                let rm_bits = reg_to_bits(rm);
1478                0xE1A00050 | (rd_bits << 12) | (rm_bits << 8) | rn_bits
1479            }
1480            ArmOp::RorReg { rd, rn, rm } => {
1481                let rd_bits = reg_to_bits(rd);
1482                let rn_bits = reg_to_bits(rn);
1483                let rm_bits = reg_to_bits(rm);
1484                0xE1A00070 | (rd_bits << 12) | (rm_bits << 8) | rn_bits
1485            }
1486
1487            // RSB (Reverse Subtract): Rd = imm - Rn
1488            ArmOp::Rsb { rd, rn, imm } => {
1489                let rd_bits = reg_to_bits(rd);
1490                let rn_bits = reg_to_bits(rn);
1491                // RSB encoding: cond(4) | 00 1 0011 S | Rn(4) | Rd(4) | imm12
1492                // Opcode for RSB = 0011, I=1 (immediate), S=0
1493                //
1494                // #681 class audit: the A32 imm12 is a rotate(4):imm8 modified
1495                // immediate; `*imm & 0xFF` silently encoded a WRONG constant
1496                // for imm > 0xFF (#378 masking class). All current emitters use
1497                // imm 32, so erroring here is byte-identical for real codegen.
1498                if *imm > 0xFF {
1499                    return Err(synth_core::Error::synthesis(
1500                        "A32 RSB immediate > 0xFF requires a rotated-immediate encoding \
1501                         (not supported) — materialize into a register",
1502                    ));
1503                }
1504                0xE2600000 | (rn_bits << 16) | (rd_bits << 12) | (*imm & 0xFF)
1505            }
1506
1507            // Bit manipulation instructions
1508            ArmOp::Clz { rd, rm } => {
1509                let rd_bits = reg_to_bits(rd);
1510                let rm_bits = reg_to_bits(rm);
1511
1512                // CLZ encoding: cond(4) | 00010110 | 1111 | Rd(4) | 1111 | 0001 | Rm(4)
1513                // ARMv5T and above
1514                0xE16F0F10 | (rd_bits << 12) | rm_bits
1515            }
1516
1517            ArmOp::Rbit { rd, rm } => {
1518                let rd_bits = reg_to_bits(rd);
1519                let rm_bits = reg_to_bits(rm);
1520
1521                // RBIT encoding: cond(4) | 01101111 | 1111 | Rd(4) | 1111 | 0011 | Rm(4)
1522                // ARMv6T2 and above
1523                0xE6FF0F30 | (rd_bits << 12) | rm_bits
1524            }
1525
1526            ArmOp::Sxtb { rd, rm } => {
1527                let rd_bits = reg_to_bits(rd);
1528                let rm_bits = reg_to_bits(rm);
1529
1530                // SXTB encoding: cond(4) | 01101010 | 1111 | Rd(4) | rotate(2) | 00 | 0111 | Rm(4)
1531                // ARMv6 and above. rotate=00 for no rotation
1532                0xE6AF0070 | (rd_bits << 12) | rm_bits
1533            }
1534
1535            ArmOp::Sxth { rd, rm } => {
1536                let rd_bits = reg_to_bits(rd);
1537                let rm_bits = reg_to_bits(rm);
1538
1539                // SXTH encoding: cond(4) | 01101011 | 1111 | Rd(4) | rotate(2) | 00 | 0111 | Rm(4)
1540                // ARMv6 and above. rotate=00 for no rotation
1541                0xE6BF0070 | (rd_bits << 12) | rm_bits
1542            }
1543
1544            ArmOp::Uxtb { rd, rm } => {
1545                let rd_bits = reg_to_bits(rd);
1546                let rm_bits = reg_to_bits(rm);
1547                // UXTB encoding: cond | 01101110 1111 Rd rotate 00 0111 Rm (rotate=00)
1548                0xE6EF0070 | (rd_bits << 12) | rm_bits
1549            }
1550
1551            ArmOp::Uxth { rd, rm } => {
1552                let rd_bits = reg_to_bits(rd);
1553                let rm_bits = reg_to_bits(rm);
1554                // UXTH encoding: cond | 01101111 1111 Rd rotate 00 0111 Rm (rotate=00)
1555                0xE6FF0070 | (rd_bits << 12) | rm_bits
1556            }
1557
1558            // Move instructions
1559            ArmOp::Mov { rd, op2 } => {
1560                let rd_bits = reg_to_bits(rd);
1561                let (op2_bits, i_flag) = encode_operand2(op2)?;
1562
1563                // MOV encoding: opcode=1101
1564                0xE1A00000 | (i_flag << 25) | (rd_bits << 12) | op2_bits
1565            }
1566
1567            ArmOp::Mvn { rd, op2 } => {
1568                let rd_bits = reg_to_bits(rd);
1569                let (op2_bits, i_flag) = encode_operand2(op2)?;
1570
1571                // MVN encoding: opcode=1111
1572                0xE1E00000 | (i_flag << 25) | (rd_bits << 12) | op2_bits
1573            }
1574
1575            // MOVW - Move Wide (ARM32)
1576            // Encoding: cond(4) | 0011 0000 | imm4(4) | Rd(4) | imm12(12)
1577            ArmOp::Movw { rd, imm16 } => {
1578                let rd_bits = reg_to_bits(rd);
1579                let imm4 = ((*imm16 as u32) >> 12) & 0xF;
1580                let imm12 = (*imm16 as u32) & 0xFFF;
1581                0xE3000000 | (imm4 << 16) | (rd_bits << 12) | imm12
1582            }
1583
1584            // MOVT - Move Top (ARM32)
1585            // Encoding: cond(4) | 0011 0100 | imm4(4) | Rd(4) | imm12(12)
1586            ArmOp::Movt { rd, imm16 } => {
1587                let rd_bits = reg_to_bits(rd);
1588                let imm4 = ((*imm16 as u32) >> 12) & 0xF;
1589                let imm12 = (*imm16 as u32) & 0xFFF;
1590                0xE3400000 | (imm4 << 16) | (rd_bits << 12) | imm12
1591            }
1592
1593            // #237: symbol-relative MOVW/MOVT (ARM mode) — addend in place, the
1594            // backend records the MOVW_ABS/MOVT_ABS relocation against `symbol`.
1595            ArmOp::MovwSym { rd, addend, .. } => {
1596                let rd_bits = reg_to_bits(rd);
1597                let v = (*addend as u32) & 0xffff;
1598                0xE3000000 | (((v >> 12) & 0xF) << 16) | (rd_bits << 12) | (v & 0xFFF)
1599            }
1600            ArmOp::MovtSym { rd, addend, .. } => {
1601                let rd_bits = reg_to_bits(rd);
1602                let v = ((*addend as u32) >> 16) & 0xffff;
1603                0xE3400000 | (((v >> 12) & 0xF) << 16) | (rd_bits << 12) | (v & 0xFFF)
1604            }
1605
1606            // #345: LdrSym is the Thumb-2 literal-pool address load. A32 mode is
1607            // not used for relocatable native-pointer objects; fail loudly rather
1608            // than miscompile if it is ever reached here.
1609            ArmOp::LdrSym { .. } => {
1610                return Err(synth_core::Error::synthesis(
1611                    "LdrSym (literal-pool address load) is Thumb-2-only",
1612                ));
1613            }
1614
1615            // Compare
1616            ArmOp::Cmp { rn, op2 } => {
1617                let rn_bits = reg_to_bits(rn);
1618                let (op2_bits, i_flag) = encode_operand2(op2)?;
1619
1620                // CMP encoding: opcode=1010, S=1
1621                0xE1500000 | (i_flag << 25) | (rn_bits << 16) | op2_bits
1622            }
1623
1624            // Compare Negative (CMN) - computes Rn + op2 and sets flags
1625            ArmOp::Cmn { rn, op2 } => {
1626                let rn_bits = reg_to_bits(rn);
1627                let (op2_bits, i_flag) = encode_operand2(op2)?;
1628
1629                // CMN encoding: opcode=1011, S=1
1630                0xE1700000 | (i_flag << 25) | (rn_bits << 16) | op2_bits
1631            }
1632
1633            // Load/Store
1634            ArmOp::Ldr { rd, addr } => {
1635                let rd_bits = reg_to_bits(rd);
1636                let (base_bits, offset_bits) = encode_mem_addr(addr);
1637
1638                // LDR encoding: cond(4) | 01 | I(1) | P(1) | U(1) | B(1) | W(1) | L(1) | Rn(4) | Rd(4) | offset(12)
1639                // P=1 (pre-indexed), U=1 (add offset), L=1 (load)
1640                0xE5900000 | (base_bits << 16) | (rd_bits << 12) | offset_bits
1641            }
1642
1643            ArmOp::Str { rd, addr } => {
1644                let rd_bits = reg_to_bits(rd);
1645                let (base_bits, offset_bits) = encode_mem_addr(addr);
1646
1647                // STR encoding: L=0 (store)
1648                0xE5800000 | (base_bits << 16) | (rd_bits << 12) | offset_bits
1649            }
1650
1651            // Sub-word loads (ARM32 encoding)
1652            ArmOp::Ldrb { rd, addr } => {
1653                let rd_bits = reg_to_bits(rd);
1654                let (base_bits, offset_bits) = encode_mem_addr(addr);
1655                // LDRB: LDR with B=1 (byte): cond|01|I|P|U|1|W|L|Rn|Rd|offset
1656                0xE5D00000 | (base_bits << 16) | (rd_bits << 12) | offset_bits
1657            }
1658
1659            ArmOp::Ldrsb { rd, addr } => {
1660                let rd_bits = reg_to_bits(rd);
1661                let (base_bits, offset_bits) = encode_mem_addr(addr);
1662                // LDRSB (misc load): cond|000|P|U|1|W|1|Rn|Rd|imm4H|1101|imm4L
1663                // Simplified with immediate offset
1664                let offset_val = offset_bits & 0xFF;
1665                let imm4h = (offset_val >> 4) & 0xF;
1666                let imm4l = offset_val & 0xF;
1667                0xE1D000D0 | (base_bits << 16) | (rd_bits << 12) | (imm4h << 8) | imm4l
1668            }
1669
1670            ArmOp::Ldrh { rd, addr } => {
1671                let rd_bits = reg_to_bits(rd);
1672                let (base_bits, offset_bits) = encode_mem_addr(addr);
1673                // LDRH (misc load): cond|000|P|U|1|W|1|Rn|Rd|imm4H|1011|imm4L
1674                let offset_val = offset_bits & 0xFF;
1675                let imm4h = (offset_val >> 4) & 0xF;
1676                let imm4l = offset_val & 0xF;
1677                0xE1D000B0 | (base_bits << 16) | (rd_bits << 12) | (imm4h << 8) | imm4l
1678            }
1679
1680            ArmOp::Ldrsh { rd, addr } => {
1681                let rd_bits = reg_to_bits(rd);
1682                let (base_bits, offset_bits) = encode_mem_addr(addr);
1683                // LDRSH (misc load): cond|000|P|U|1|W|1|Rn|Rd|imm4H|1111|imm4L
1684                let offset_val = offset_bits & 0xFF;
1685                let imm4h = (offset_val >> 4) & 0xF;
1686                let imm4l = offset_val & 0xF;
1687                0xE1D000F0 | (base_bits << 16) | (rd_bits << 12) | (imm4h << 8) | imm4l
1688            }
1689
1690            // Sub-word stores (ARM32 encoding)
1691            ArmOp::Strb { rd, addr } => {
1692                let rd_bits = reg_to_bits(rd);
1693                let (base_bits, offset_bits) = encode_mem_addr(addr);
1694                // STRB: STR with B=1 (byte): cond|01|I|P|U|1|W|0|Rn|Rd|offset
1695                0xE5C00000 | (base_bits << 16) | (rd_bits << 12) | offset_bits
1696            }
1697
1698            ArmOp::Strh { rd, addr } => {
1699                let rd_bits = reg_to_bits(rd);
1700                let (base_bits, offset_bits) = encode_mem_addr(addr);
1701                // STRH (misc store): cond|000|P|U|1|W|0|Rn|Rd|imm4H|1011|imm4L
1702                let offset_val = offset_bits & 0xFF;
1703                let imm4h = (offset_val >> 4) & 0xF;
1704                let imm4l = offset_val & 0xF;
1705                0xE1C000B0 | (base_bits << 16) | (rd_bits << 12) | (imm4h << 8) | imm4l
1706            }
1707
1708            // Memory management (ARM32 encoding)
1709            ArmOp::MemorySize { rd } => {
1710                let rd_bits = reg_to_bits(rd);
1711                // MOV rd, R10, LSR #16  (memory size in bytes / 65536 = pages)
1712                // cond|000|1101|S|0000|Rd|shift5|type|0|Rm
1713                // LSR #16: shift5=10000, type=01
1714                0xE1A00820 | (rd_bits << 12) | 0x0A // Rm=R10, shift=16, LSR
1715            }
1716
1717            ArmOp::MemoryGrow { rd, .. } => {
1718                let rd_bits = reg_to_bits(rd);
1719                // On embedded, always fail: MOV rd, #-1
1720                0xE3E00000 | (rd_bits << 12) // MVN rd, #0 = MOV rd, #-1
1721            }
1722
1723            // Label pseudo-instruction: emits no machine code
1724            ArmOp::Label { .. } => {
1725                return Ok(Vec::new());
1726            }
1727
1728            // Branch instructions
1729            ArmOp::B { label: _ } => {
1730                // B encoding: cond(4) | 1010 | offset(24)
1731                // Simplified: branch to offset 0 (will be patched by linker/resolver)
1732                0xEA000000
1733            }
1734
1735            // Conditional branch to label (generic)
1736            ArmOp::Bcc { cond, label: _ } => {
1737                use synth_synthesis::Condition;
1738                let cond_bits: u32 = match cond {
1739                    Condition::EQ => 0x0,
1740                    Condition::NE => 0x1,
1741                    Condition::HS => 0x2,
1742                    Condition::LO => 0x3,
1743                    Condition::HI => 0x8,
1744                    Condition::LS => 0x9,
1745                    Condition::GE => 0xA,
1746                    Condition::LT => 0xB,
1747                    Condition::GT => 0xC,
1748                    Condition::LE => 0xD,
1749                };
1750                // B<cond> with offset 0 (will be patched)
1751                (cond_bits << 28) | 0x0A000000
1752            }
1753
1754            // BHS (Branch if Higher or Same) - used for bounds checking
1755            ArmOp::Bhs { label: _ } => {
1756                // BHS encoding: cond(2=HS) | 1010 | offset(24)
1757                0x2A000000 // BHS with offset 0
1758            }
1759
1760            // BLO (Branch if Lower) - complementary to BHS
1761            ArmOp::Blo { label: _ } => {
1762                // BLO encoding: cond(3=LO) | 1010 | offset(24)
1763                0x3A000000 // BLO with offset 0
1764            }
1765
1766            // Branch with numeric offset (in instructions)
1767            // ARM32 B instruction: offset is in instructions, stored as words
1768            // The offset is relative to PC+8 (due to ARM pipeline)
1769            ArmOp::BOffset { offset } => {
1770                // B encoding: cond(4) | 1010 | offset(24)
1771                // Offset is signed, in words (4-byte units)
1772                // ARM adds PC+8 to the offset, so we need to adjust:
1773                // target = PC + 8 + (offset * 4)
1774                // For backward branch of N instructions: offset = -(N + 2)
1775                // wrapping_sub keeps the encoder total under fuzzing (#186): an
1776                // extreme i32::MIN offset would otherwise overflow-panic; for any
1777                // real branch offset this is identical to `- 2`.
1778                let adjusted_offset = offset.wrapping_sub(2); // Account for PC+8
1779                let offset_bits = (adjusted_offset as u32) & 0x00FFFFFF;
1780                0xEA000000 | offset_bits
1781            }
1782
1783            // Conditional branch with numeric offset
1784            ArmOp::BCondOffset { cond, offset } => {
1785                use synth_synthesis::Condition;
1786                let cond_bits: u32 = match cond {
1787                    Condition::EQ => 0x0,
1788                    Condition::NE => 0x1,
1789                    Condition::HS => 0x2,
1790                    Condition::LO => 0x3,
1791                    Condition::HI => 0x8,
1792                    Condition::LS => 0x9,
1793                    Condition::GE => 0xA,
1794                    Condition::LT => 0xB,
1795                    Condition::GT => 0xC,
1796                    Condition::LE => 0xD,
1797                };
1798                // B<cond> encoding: cond(4) | 1010 | offset(24)
1799                // wrapping_sub: total under fuzzing (#186), identical for real offsets.
1800                let adjusted_offset = offset.wrapping_sub(2); // Account for PC+8
1801                let offset_bits = (adjusted_offset as u32) & 0x00FFFFFF;
1802                (cond_bits << 28) | 0x0A000000 | offset_bits
1803            }
1804
1805            ArmOp::Bl { label: _ } => {
1806                // BL encoding: cond(4) | 1011 | offset(24)
1807                0xEB000000
1808            }
1809
1810            ArmOp::Bx { rm } => {
1811                let rm_bits = reg_to_bits(rm);
1812
1813                // BX encoding: cond(4) | 000100101111111111110001 | Rm(4)
1814                0xE12FFF10 | rm_bits
1815            }
1816
1817            ArmOp::Blx { rm } => {
1818                let rm_bits = reg_to_bits(rm);
1819
1820                // BLX (register) encoding: cond(4) | 000100101111111111110011 | Rm(4)
1821                0xE12FFF30 | rm_bits
1822            }
1823
1824            ArmOp::Push { regs } => {
1825                // STMDB SP!, {regs} encoding: cond(4) | 100100 | 10 | 1101 | register_list(16)
1826                let mut reg_list: u32 = 0;
1827                for r in regs {
1828                    reg_list |= 1 << reg_to_bits(r);
1829                }
1830                0xE92D0000 | reg_list
1831            }
1832
1833            ArmOp::Pop { regs } => {
1834                // LDMIA SP!, {regs} encoding: cond(4) | 100010 | 11 | 1101 | register_list(16)
1835                let mut reg_list: u32 = 0;
1836                for r in regs {
1837                    reg_list |= 1 << reg_to_bits(r);
1838                }
1839                0xE8BD0000 | reg_list
1840            }
1841
1842            ArmOp::Nop => {
1843                // NOP encoding: MOV R0, R0
1844                0xE1A00000
1845            }
1846
1847            ArmOp::Udf { imm } => {
1848                // UDF (Undefined) encoding in ARM: 0xE7F000F0 | (imm12_hi << 8) | imm4_lo
1849                // We only use imm8, so split into imm4_hi and imm4_lo
1850                let imm8 = *imm as u32;
1851                0xE7F000F0 | ((imm8 & 0xF0) << 4) | (imm8 & 0x0F)
1852            }
1853
1854            // #615: handled by the `encode_arm_expanded` early return at the
1855            // top of this function — a real MOV{cond}/MOV pair now, never a
1856            // silent NOP again.
1857            ArmOp::Popcnt { .. } | ArmOp::SetCond { .. } | ArmOp::SelectMove { .. } => {
1858                unreachable!("handled by encode_arm_expanded (#615)")
1859            }
1860
1861            // Verification-only pseudo-ops: `synth-verify`'s ArmSemantics
1862            // models these, but NO codegen path constructs them (the selector
1863            // lowers select/locals/globals/br_table/call to real instruction
1864            // sequences before the encoder). Encoding one as a NOP silently
1865            // dropped the operation (#615 class); a typed Err keeps the
1866            // encoder total (Ok-or-Err, the `encoder_no_panic` contract)
1867            // while making any future reachability LOUD.
1868            ArmOp::Select { .. }
1869            | ArmOp::LocalGet { .. }
1870            | ArmOp::LocalSet { .. }
1871            | ArmOp::LocalTee { .. }
1872            | ArmOp::GlobalGet { .. }
1873            | ArmOp::GlobalSet { .. }
1874            | ArmOp::BrTable { .. }
1875            | ArmOp::Call { .. } => {
1876                return Err(synth_core::Error::synthesis(format!(
1877                    "verification-only pseudo-op {op:?} reached the A32 encoder — \
1878                     codegen lowers it before encoding; refusing to emit a silent NOP (#615)"
1879                )));
1880            }
1881
1882            // #594: CallIndirect is expanded to a real multi-instruction
1883            // sequence by the early return at the top of this function —
1884            // it must NEVER fall through to a silent NOP again.
1885            ArmOp::CallIndirect { .. } => {
1886                unreachable!("CallIndirect handled by encode_arm_call_indirect (#594)")
1887            }
1888
1889            // #615: every i64 op (and I32WrapI64) is expanded to a real A32
1890            // multi-instruction sequence by `encode_arm_expanded` — the
1891            // "encode as NOP for now" era ended with the value silently
1892            // vanishing on `--target cortex-r5`.
1893            ArmOp::I64Add { .. }
1894            | ArmOp::I64Sub { .. }
1895            | ArmOp::I64DivS { .. }
1896            | ArmOp::I64DivU { .. }
1897            | ArmOp::I64RemS { .. }
1898            | ArmOp::I64RemU { .. }
1899            | ArmOp::I64Clz { .. }
1900            | ArmOp::I64Ctz { .. }
1901            | ArmOp::I64Popcnt { .. }
1902            | ArmOp::I64And { .. }
1903            | ArmOp::I64Or { .. }
1904            | ArmOp::I64Xor { .. }
1905            | ArmOp::I64Eqz { .. }
1906            | ArmOp::I64Eq { .. }
1907            | ArmOp::I64Ne { .. }
1908            | ArmOp::I64LtS { .. }
1909            | ArmOp::I64LtU { .. }
1910            | ArmOp::I64LeS { .. }
1911            | ArmOp::I64LeU { .. }
1912            | ArmOp::I64GtS { .. }
1913            | ArmOp::I64GtU { .. }
1914            | ArmOp::I64GeS { .. }
1915            | ArmOp::I64GeU { .. }
1916            | ArmOp::I64Const { .. }
1917            | ArmOp::I64Ldr { .. }
1918            | ArmOp::I64Str { .. }
1919            | ArmOp::I64ExtendI32S { .. }
1920            | ArmOp::I64ExtendI32U { .. }
1921            | ArmOp::I64Extend8S { .. }
1922            | ArmOp::I64Extend16S { .. }
1923            | ArmOp::I64Extend32S { .. }
1924            | ArmOp::I32WrapI64 { .. } => {
1925                unreachable!("handled by encode_arm_expanded (#615)")
1926            }
1927
1928            // f32 VFP single-precision instructions
1929            ArmOp::F32Add { sd, sn, sm } => encode_vfp_3reg(0xEE300A00, sd, sn, sm)?,
1930            ArmOp::F32Sub { sd, sn, sm } => encode_vfp_3reg(0xEE300A40, sd, sn, sm)?,
1931            ArmOp::F32Mul { sd, sn, sm } => encode_vfp_3reg(0xEE200A00, sd, sn, sm)?,
1932            ArmOp::F32Div { sd, sn, sm } => encode_vfp_3reg(0xEE800A00, sd, sn, sm)?,
1933            ArmOp::F32Abs { sd, sm } => encode_vfp_2reg(0xEEB00AC0, sd, sm)?,
1934            ArmOp::F32Neg { sd, sm } => encode_vfp_2reg(0xEEB10A40, sd, sm)?,
1935            ArmOp::F32Sqrt { sd, sm } => encode_vfp_2reg(0xEEB10AC0, sd, sm)?,
1936
1937            // f32 pseudo-ops — multi-instruction sequences
1938            // FPSCR RMode: 00=nearest, 01=+inf(ceil), 10=-inf(floor), 11=zero(trunc)
1939            ArmOp::F32Ceil { sd, sm } => {
1940                return self.encode_arm_f32_rounding(sd, sm, 0b01); // Round toward +Inf
1941            }
1942            ArmOp::F32Floor { sd, sm } => {
1943                return self.encode_arm_f32_rounding(sd, sm, 0b10); // Round toward -Inf
1944            }
1945            ArmOp::F32Trunc { sd, sm } => {
1946                return self.encode_arm_f32_rounding(sd, sm, 0b11); // VCVT toward zero
1947            }
1948            ArmOp::F32Nearest { sd, sm } => {
1949                return self.encode_arm_f32_rounding(sd, sm, 0b00); // VCVT to nearest
1950            }
1951            ArmOp::F32Min { sd, sn, sm } => {
1952                return self.encode_arm_f32_minmax(sd, sn, sm, true);
1953            }
1954            ArmOp::F32Max { sd, sn, sm } => {
1955                return self.encode_arm_f32_minmax(sd, sn, sm, false);
1956            }
1957            ArmOp::F32Copysign { sd, sn, sm } => {
1958                return self.encode_arm_f32_copysign(sd, sn, sm);
1959            }
1960
1961            // f32 comparisons — multi-instruction: VCMP + VMRS + conditional MOV
1962            ArmOp::F32Eq { rd, sn, sm } => {
1963                return self.encode_arm_f32_compare(rd, sn, sm, 0x0); // EQ
1964            }
1965            ArmOp::F32Ne { rd, sn, sm } => {
1966                return self.encode_arm_f32_compare(rd, sn, sm, 0x1); // NE
1967            }
1968            ArmOp::F32Lt { rd, sn, sm } => {
1969                return self.encode_arm_f32_compare(rd, sn, sm, 0x4); // MI (less than)
1970            }
1971            ArmOp::F32Le { rd, sn, sm } => {
1972                return self.encode_arm_f32_compare(rd, sn, sm, 0x9); // LS (less or same)
1973            }
1974            ArmOp::F32Gt { rd, sn, sm } => {
1975                return self.encode_arm_f32_compare(rd, sn, sm, 0xC); // GT
1976            }
1977            ArmOp::F32Ge { rd, sn, sm } => {
1978                return self.encode_arm_f32_compare(rd, sn, sm, 0xA); // GE
1979            }
1980
1981            // f32 const — multi-instruction: MOVW + MOVT + VMOV
1982            ArmOp::F32Const { sd, value } => {
1983                return self.encode_arm_f32_const(sd, *value);
1984            }
1985
1986            ArmOp::F32Load { sd, addr } => encode_vfp_ldst(0xED900A00, sd, addr)?,
1987            ArmOp::F32Store { sd, addr } => encode_vfp_ldst(0xED800A00, sd, addr)?,
1988
1989            // f32 conversions — multi-instruction sequences
1990            ArmOp::F32ConvertI32S { sd, rm } => {
1991                return self.encode_arm_f32_convert_i32(sd, rm, true);
1992            }
1993            ArmOp::F32ConvertI32U { sd, rm } => {
1994                return self.encode_arm_f32_convert_i32(sd, rm, false);
1995            }
1996            ArmOp::F32ConvertI64S { .. } | ArmOp::F32ConvertI64U { .. } => {
1997                return Err(synth_core::Error::synthesis(
1998                    "F32 i64 conversion not supported (requires register pairs on 32-bit ARM)",
1999                ));
2000            }
2001            ArmOp::F32ReinterpretI32 { sd, rm } => encode_vmov_core_sreg(true, sd, rm)?,
2002            ArmOp::I32ReinterpretF32 { rd, sm } => encode_vmov_core_sreg(false, sm, rd)?,
2003            ArmOp::I32TruncF32S { rd, sm } => {
2004                return self.encode_arm_i32_trunc_f32(rd, sm, true);
2005            }
2006            ArmOp::I32TruncF32U { rd, sm } => {
2007                return self.encode_arm_i32_trunc_f32(rd, sm, false);
2008            }
2009
2010            // f64 VFP double-precision instructions (ARM32)
2011            // F64 arithmetic: same as F32 but with sz=1 (bit 8 = 1, cp11 = 0xB)
2012            ArmOp::F64Add { dd, dn, dm } => encode_vfp_3reg_f64(0xEE300B00, dd, dn, dm)?,
2013            ArmOp::F64Sub { dd, dn, dm } => encode_vfp_3reg_f64(0xEE300B40, dd, dn, dm)?,
2014            ArmOp::F64Mul { dd, dn, dm } => encode_vfp_3reg_f64(0xEE200B00, dd, dn, dm)?,
2015            ArmOp::F64Div { dd, dn, dm } => encode_vfp_3reg_f64(0xEE800B00, dd, dn, dm)?,
2016            ArmOp::F64Abs { dd, dm } => encode_vfp_2reg_f64(0xEEB00BC0, dd, dm)?,
2017            ArmOp::F64Neg { dd, dm } => encode_vfp_2reg_f64(0xEEB10B40, dd, dm)?,
2018            ArmOp::F64Sqrt { dd, dm } => encode_vfp_2reg_f64(0xEEB10BC0, dd, dm)?,
2019
2020            // f64 pseudo-ops
2021            // FPSCR RMode: 00=nearest, 01=+inf(ceil), 10=-inf(floor), 11=zero(trunc)
2022            ArmOp::F64Ceil { dd, dm } => {
2023                return self.encode_arm_f64_rounding(dd, dm, 0b01);
2024            }
2025            ArmOp::F64Floor { dd, dm } => {
2026                return self.encode_arm_f64_rounding(dd, dm, 0b10);
2027            }
2028            ArmOp::F64Trunc { dd, dm } => {
2029                return self.encode_arm_f64_rounding(dd, dm, 0b11);
2030            }
2031            ArmOp::F64Nearest { dd, dm } => {
2032                return self.encode_arm_f64_rounding(dd, dm, 0b00);
2033            }
2034            ArmOp::F64Min { dd, dn, dm } => {
2035                return self.encode_arm_f64_minmax(dd, dn, dm, true);
2036            }
2037            ArmOp::F64Max { dd, dn, dm } => {
2038                return self.encode_arm_f64_minmax(dd, dn, dm, false);
2039            }
2040            ArmOp::F64Copysign { dd, dn, dm } => {
2041                return self.encode_arm_f64_copysign(dd, dn, dm);
2042            }
2043
2044            // f64 comparisons
2045            ArmOp::F64Eq { rd, dn, dm } => {
2046                return self.encode_arm_f64_compare(rd, dn, dm, 0x0);
2047            }
2048            ArmOp::F64Ne { rd, dn, dm } => {
2049                return self.encode_arm_f64_compare(rd, dn, dm, 0x1);
2050            }
2051            ArmOp::F64Lt { rd, dn, dm } => {
2052                return self.encode_arm_f64_compare(rd, dn, dm, 0x4);
2053            }
2054            ArmOp::F64Le { rd, dn, dm } => {
2055                return self.encode_arm_f64_compare(rd, dn, dm, 0x9);
2056            }
2057            ArmOp::F64Gt { rd, dn, dm } => {
2058                return self.encode_arm_f64_compare(rd, dn, dm, 0xC);
2059            }
2060            ArmOp::F64Ge { rd, dn, dm } => {
2061                return self.encode_arm_f64_compare(rd, dn, dm, 0xA);
2062            }
2063
2064            ArmOp::F64Const { dd, value } => {
2065                return self.encode_arm_f64_const(dd, *value);
2066            }
2067
2068            ArmOp::F64Load { dd, addr } => encode_vfp_ldst_f64(0xED900B00, dd, addr)?,
2069            ArmOp::F64Store { dd, addr } => encode_vfp_ldst_f64(0xED800B00, dd, addr)?,
2070
2071            ArmOp::F64ConvertI32S { dd, rm } => {
2072                return self.encode_arm_f64_convert_i32(dd, rm, true);
2073            }
2074            ArmOp::F64ConvertI32U { dd, rm } => {
2075                return self.encode_arm_f64_convert_i32(dd, rm, false);
2076            }
2077            ArmOp::F64ConvertI64S { .. } | ArmOp::F64ConvertI64U { .. } => {
2078                return Err(synth_core::Error::synthesis(
2079                    "F64 i64 conversion not supported (requires register pairs on 32-bit ARM)",
2080                ));
2081            }
2082            ArmOp::F64PromoteF32 { dd, sm } => {
2083                return self.encode_arm_f64_promote_f32(dd, sm);
2084            }
2085            // GI-FPU-002 (#369): no synth A32 target carries an FPU (cortex-r5
2086            // has none — the selector declines every float op there), so the
2087            // A32 encoder refuses loudly instead of shipping an untested
2088            // encoding (#615: never a silent wrong byte).
2089            ArmOp::F32DemoteF64 { .. } => {
2090                return Err(synth_core::Error::synthesis(
2091                    "F32DemoteF64 has no A32 encoding (no A32 target has an FPU)",
2092                ));
2093            }
2094            ArmOp::F64ReinterpretI64 { dd, rmlo, rmhi } => {
2095                encode_vmov_core_dreg(true, dd, rmlo, rmhi)?
2096            }
2097            ArmOp::I64ReinterpretF64 { rdlo, rdhi, dm } => {
2098                encode_vmov_core_dreg(false, dm, rdlo, rdhi)?
2099            }
2100            ArmOp::I64TruncF64S { .. } | ArmOp::I64TruncF64U { .. } => {
2101                return Err(synth_core::Error::synthesis(
2102                    "i64 truncation from F64 not supported (requires i64 register pairs on 32-bit ARM)",
2103                ));
2104            }
2105            ArmOp::I32TruncF64S { rd, dm } => {
2106                return self.encode_arm_i32_trunc_f64(rd, dm, true);
2107            }
2108            ArmOp::I32TruncF64U { rd, dm } => {
2109                return self.encode_arm_i32_trunc_f64(rd, dm, false);
2110            }
2111            // #615: multi-instruction i64 sequences — expanded to real A32 by
2112            // `encode_arm_expanded`, no longer "Thumb-2 only" NOPs.
2113            ArmOp::I64SetCond { .. }
2114            | ArmOp::I64SetCondZ { .. }
2115            | ArmOp::I64Mul { .. }
2116            | ArmOp::I64Shl { .. }
2117            | ArmOp::I64ShrS { .. }
2118            | ArmOp::I64ShrU { .. }
2119            | ArmOp::I64Rotl { .. }
2120            | ArmOp::I64Rotr { .. } => {
2121                unreachable!("handled by encode_arm_expanded (#615)")
2122            }
2123
2124            // MVE instructions — Thumb-2 only (Cortex-M55 is always Thumb-2)
2125            ArmOp::MveLoad { .. }
2126            | ArmOp::MveStore { .. }
2127            | ArmOp::MveConst { .. }
2128            | ArmOp::MveAnd { .. }
2129            | ArmOp::MveOrr { .. }
2130            | ArmOp::MveEor { .. }
2131            | ArmOp::MveMvn { .. }
2132            | ArmOp::MveBic { .. }
2133            | ArmOp::MveAddI { .. }
2134            | ArmOp::MveSubI { .. }
2135            | ArmOp::MveMulI { .. }
2136            | ArmOp::MveNegI { .. }
2137            | ArmOp::MveCmpEqI { .. }
2138            | ArmOp::MveCmpNeI { .. }
2139            | ArmOp::MveCmpLtS { .. }
2140            | ArmOp::MveCmpLtU { .. }
2141            | ArmOp::MveCmpGtS { .. }
2142            | ArmOp::MveCmpGtU { .. }
2143            | ArmOp::MveCmpLeS { .. }
2144            | ArmOp::MveCmpLeU { .. }
2145            | ArmOp::MveCmpGeS { .. }
2146            | ArmOp::MveCmpGeU { .. }
2147            | ArmOp::MveDup { .. }
2148            | ArmOp::MveExtractLane { .. }
2149            | ArmOp::MveInsertLane { .. }
2150            | ArmOp::MveAddF32 { .. }
2151            | ArmOp::MveSubF32 { .. }
2152            | ArmOp::MveMulF32 { .. }
2153            | ArmOp::MveNegF32 { .. }
2154            | ArmOp::MveAbsF32 { .. }
2155            | ArmOp::MveCmpEqF32 { .. }
2156            | ArmOp::MveCmpNeF32 { .. }
2157            | ArmOp::MveCmpLtF32 { .. }
2158            | ArmOp::MveCmpLeF32 { .. }
2159            | ArmOp::MveCmpGtF32 { .. }
2160            | ArmOp::MveCmpGeF32 { .. }
2161            | ArmOp::MveDupF32 { .. }
2162            | ArmOp::MveExtractLaneF32 { .. }
2163            | ArmOp::MveReplaceLaneF32 { .. }
2164            | ArmOp::MveDivF32 { .. }
2165            | ArmOp::MveSqrtF32 { .. } => {
2166                // MVE (Helium) is a Thumb-2-only extension (Cortex-M55); there
2167                // is no A32 encoding. The selector only emits MVE ops for
2168                // Thumb targets — a NOP here silently dropped the vector op
2169                // if that invariant ever broke (#615 class). Err keeps the
2170                // encoder total and the failure loud.
2171                return Err(synth_core::Error::synthesis(format!(
2172                    "MVE op {op:?} has no A32 (ARM-mode) encoding — MVE is Thumb-2 only (#615)"
2173                )));
2174            }
2175        };
2176
2177        // ARM32 instructions are little-endian
2178        Ok(instr.to_le_bytes().to_vec())
2179    }
2180
2181    // === ARM32 VFP multi-instruction helpers ===
2182
2183    /// Encode F32 comparison as ARM32: VCMP.F32 + VMRS + MOV rd,#0 + MOVcond rd,#1
2184    fn encode_arm_f32_compare(
2185        &self,
2186        rd: &Reg,
2187        sn: &VfpReg,
2188        sm: &VfpReg,
2189        cond_code: u32,
2190    ) -> Result<Vec<u8>> {
2191        let mut bytes = Vec::new();
2192
2193        // VCMP.F32 Sn, Sm: 0xEEB40A40 with Sn in Vd position, Sm in Vm position
2194        let sn_num = vfp_sreg_to_num(sn)?;
2195        let sm_num = vfp_sreg_to_num(sm)?;
2196        let (vd, d) = encode_sreg(sn_num);
2197        let (vm, m) = encode_sreg(sm_num);
2198        let vcmp = 0xEEB40A40 | (d << 22) | (vd << 12) | (m << 5) | vm;
2199        bytes.extend_from_slice(&vcmp.to_le_bytes());
2200
2201        // VMRS APSR_nzcv, FPSCR: 0xEEF1FA10
2202        bytes.extend_from_slice(&0xEEF1FA10u32.to_le_bytes());
2203
2204        // MOV rd, #0: 0xE3A0_0000 | (rd << 12)
2205        let rd_bits = reg_to_bits(rd);
2206        let mov_zero = 0xE3A00000 | (rd_bits << 12);
2207        bytes.extend_from_slice(&mov_zero.to_le_bytes());
2208
2209        // MOVcond rd, #1: cond(4) | 0011 1010 0000 rd(4) 0000 0000 0001
2210        let mov_one = (cond_code << 28) | 0x03A00001 | (rd_bits << 12);
2211        bytes.extend_from_slice(&mov_one.to_le_bytes());
2212
2213        Ok(bytes)
2214    }
2215
2216    /// Encode F32 constant load as ARM32: MOVW Rt,#lo16 + MOVT Rt,#hi16 + VMOV Sd,Rt
2217    fn encode_arm_f32_const(&self, sd: &VfpReg, value: f32) -> Result<Vec<u8>> {
2218        let mut bytes = Vec::new();
2219        let bits = value.to_bits();
2220
2221        // Use R12 as temp register for constant loading
2222        let rt: u32 = 12; // R12/IP
2223
2224        // MOVW R12, #lo16: 0xE300_C000 | (imm4 << 16) | imm12
2225        let lo16 = bits & 0xFFFF;
2226        let movw = 0xE3000000 | (rt << 12) | ((lo16 >> 12) << 16) | (lo16 & 0xFFF);
2227        bytes.extend_from_slice(&movw.to_le_bytes());
2228
2229        // MOVT R12, #hi16: 0xE340_C000 | (imm4 << 16) | imm12
2230        let hi16 = (bits >> 16) & 0xFFFF;
2231        let movt = 0xE3400000 | (rt << 12) | ((hi16 >> 12) << 16) | (hi16 & 0xFFF);
2232        bytes.extend_from_slice(&movt.to_le_bytes());
2233
2234        // VMOV Sd, R12
2235        let vmov = encode_vmov_core_sreg(true, sd, &Reg::R12)?;
2236        bytes.extend_from_slice(&vmov.to_le_bytes());
2237
2238        Ok(bytes)
2239    }
2240
2241    /// Encode VMOV + VCVT.F32.S32/U32 as ARM32
2242    fn encode_arm_f32_convert_i32(&self, sd: &VfpReg, rm: &Reg, signed: bool) -> Result<Vec<u8>> {
2243        let mut bytes = Vec::new();
2244
2245        // VMOV Sd, Rm — move integer to VFP register
2246        let vmov = encode_vmov_core_sreg(true, sd, rm)?;
2247        bytes.extend_from_slice(&vmov.to_le_bytes());
2248
2249        // VCVT.F32.S32 Sd, Sd (signed) or VCVT.F32.U32 Sd, Sd (unsigned).
2250        // The "op" bit (bit 7) selects signedness: 1 = signed (S32), 0 =
2251        // unsigned (U32). So signed = 0xEEB80AC0, unsigned = 0xEEB80A40 —
2252        // objdump confirms 0xEEB80A40 decodes to `vcvt.f32.u32` (GI-FPU-002:
2253        // the two were previously swapped, silently making `convert_i32_s`
2254        // an unsigned conversion).
2255        let sd_num = vfp_sreg_to_num(sd)?;
2256        let (vd, d) = encode_sreg(sd_num);
2257        let (vm, m) = encode_sreg(sd_num); // same register as source
2258        let base = if signed { 0xEEB80AC0 } else { 0xEEB80A40 };
2259        let vcvt = base | (d << 22) | (vd << 12) | (m << 5) | vm;
2260        bytes.extend_from_slice(&vcvt.to_le_bytes());
2261
2262        Ok(bytes)
2263    }
2264
2265    /// Encode F32 rounding pseudo-op as ARM32 via VCVT to integer and back.
2266    /// mode: 0b00=nearest, 0b01=floor(-Inf), 0b10=ceil(+Inf), 0b11=trunc(zero)
2267    /// Strategy: VCVT.S32.F32 Sd, Sm (toward zero), then VCVT.F32.S32 Sd, Sd
2268    /// For ceil/floor/nearest, we use VCVTR (round toward mode) + convert back.
2269    /// Simplified: convert to int (toward zero for trunc) then back to float.
2270    /// Encode F32 rounding as ARM32.
2271    /// `mode`: FPSCR RMode — 0b00=nearest, 0b01=+inf(ceil), 0b10=-inf(floor), 0b11=zero(trunc)
2272    ///
2273    /// For trunc (mode=0b11): uses VCVTR.S32.F32 (always rounds toward zero).
2274    /// For ceil/floor/nearest: sets FPSCR rounding mode, uses VCVT.S32.F32 (non-R variant
2275    /// which honours FPSCR rmode), then restores FPSCR.
2276    fn encode_arm_f32_rounding(&self, sd: &VfpReg, sm: &VfpReg, mode: u8) -> Result<Vec<u8>> {
2277        let mut bytes = Vec::new();
2278        let sm_num = vfp_sreg_to_num(sm)?;
2279        let sd_num = vfp_sreg_to_num(sd)?;
2280        let (vd_s, d_s) = encode_sreg(sd_num);
2281        let (vm_s, m_s) = encode_sreg(sm_num);
2282
2283        if mode == 0b11 {
2284            // Trunc (toward zero): VCVTR.S32.F32 — the "R" variant always truncates.
2285            // 0xEEBD0AC0: bit[7]=1 => round toward zero regardless of FPSCR
2286            let vcvt_to_int = 0xEEBD0AC0 | (d_s << 22) | (vd_s << 12) | (m_s << 5) | vm_s;
2287            bytes.extend_from_slice(&vcvt_to_int.to_le_bytes());
2288        } else {
2289            // ceil/floor/nearest: manipulate FPSCR rounding mode
2290            let rt: u32 = 12; // R12/IP as temp
2291
2292            // VMRS R12, FPSCR
2293            let vmrs = 0xEEF10A10 | (rt << 12);
2294            bytes.extend_from_slice(&vmrs.to_le_bytes());
2295
2296            // BIC R12, R12, #(3 << 22) — clear RMode bits [23:22]
2297            // 3<<22 = 0x00C00000. ARM rotated imm: 0x03 ror 10 (rotation=5, imm8=0x03)
2298            let bic = 0xE3CC0000 | (rt << 12) | (0x05 << 8) | 0x03;
2299            bytes.extend_from_slice(&bic.to_le_bytes());
2300
2301            // ORR R12, R12, #(mode << 22) — set desired rounding mode
2302            if mode != 0 {
2303                // mode<<22: rotation=5, imm8=mode
2304                let orr = 0xE38C0000 | (rt << 12) | (0x05 << 8) | (mode as u32);
2305                bytes.extend_from_slice(&orr.to_le_bytes());
2306            }
2307
2308            // VMSR FPSCR, R12
2309            let vmsr = 0xEEE10A10 | (rt << 12);
2310            bytes.extend_from_slice(&vmsr.to_le_bytes());
2311
2312            // VCVT.S32.F32 Sd, Sm — non-R variant (bit[7]=0), uses FPSCR rounding mode
2313            let vcvt_to_int = 0xEEBD0A40 | (d_s << 22) | (vd_s << 12) | (m_s << 5) | vm_s;
2314            bytes.extend_from_slice(&vcvt_to_int.to_le_bytes());
2315
2316            // Restore FPSCR: clear rmode bits back to nearest (default)
2317            bytes.extend_from_slice(&vmrs.to_le_bytes());
2318            bytes.extend_from_slice(&bic.to_le_bytes());
2319            bytes.extend_from_slice(&vmsr.to_le_bytes());
2320        }
2321
2322        // VCVT.F32.S32 Sd, Sd (convert integer result back to float)
2323        let (vd2, d2) = encode_sreg(sd_num);
2324        let vcvt_to_float = 0xEEB80A40 | (d2 << 22) | (vd2 << 12) | (d_s << 5) | vd_s;
2325        bytes.extend_from_slice(&vcvt_to_float.to_le_bytes());
2326
2327        Ok(bytes)
2328    }
2329
2330    /// Encode F32 min/max as ARM32: VCMP + VMRS + conditional VMOV
2331    fn encode_arm_f32_minmax(
2332        &self,
2333        sd: &VfpReg,
2334        sn: &VfpReg,
2335        sm: &VfpReg,
2336        is_min: bool,
2337    ) -> Result<Vec<u8>> {
2338        let mut bytes = Vec::new();
2339        let sn_num = vfp_sreg_to_num(sn)?;
2340        let sm_num = vfp_sreg_to_num(sm)?;
2341        let sd_num = vfp_sreg_to_num(sd)?;
2342
2343        // VMOV Sd, Sn (start with first operand)
2344        let (vd, d) = encode_sreg(sd_num);
2345        let (vn, n) = encode_sreg(sn_num);
2346        let vmov_sn = 0xEEB00A40 | (d << 22) | (vd << 12) | (n << 5) | vn;
2347        bytes.extend_from_slice(&vmov_sn.to_le_bytes());
2348
2349        // VCMP.F32 Sn, Sm
2350        let (vm, m) = encode_sreg(sm_num);
2351        let vcmp = 0xEEB40A40 | (n << 22) | (vn << 12) | (m << 5) | vm;
2352        bytes.extend_from_slice(&vcmp.to_le_bytes());
2353
2354        // VMRS APSR_nzcv, FPSCR
2355        bytes.extend_from_slice(&0xEEF1FA10u32.to_le_bytes());
2356
2357        // For min: if Sn > Sm (GT), use Sm. Condition = GT (0xC)
2358        // For max: if Sn < Sm (MI/LT), use Sm. Condition = MI (0x4)
2359        let cond = if is_min { 0xCu32 } else { 0x4u32 };
2360
2361        // VMOV{cond} Sd, Sm — conditional VMOV
2362        let vmov_cond = (cond << 28) | 0x0EB00A40 | (d << 22) | (vd << 12) | (m << 5) | vm;
2363        bytes.extend_from_slice(&vmov_cond.to_le_bytes());
2364
2365        Ok(bytes)
2366    }
2367
2368    /// Encode F32 copysign as ARM32: extract sign from Sm, magnitude from Sn
2369    fn encode_arm_f32_copysign(&self, sd: &VfpReg, sn: &VfpReg, sm: &VfpReg) -> Result<Vec<u8>> {
2370        let mut bytes = Vec::new();
2371
2372        // VMOV R12, Sm (get sign source bits)
2373        let vmov_sm = encode_vmov_core_sreg(false, sm, &Reg::R12)?;
2374        bytes.extend_from_slice(&vmov_sm.to_le_bytes());
2375
2376        // VMOV R0, Sn (get magnitude source bits) — use R0 as temp
2377        let vmov_sn = encode_vmov_core_sreg(false, sn, &Reg::R0)?;
2378        bytes.extend_from_slice(&vmov_sn.to_le_bytes());
2379
2380        // AND R12, R12, #0x80000000 (keep only sign bit)
2381        // Thumb-2 constant 0x80000000 needs special encoding; in ARM32 use rotated imm
2382        // 0x80000000 = 0x02 rotated right by 2 (rotation=1, imm8=0x02)
2383        let and_sign = 0xE2000000u32 | (12 << 16) | (12 << 12) | (1 << 8) | 0x02;
2384        bytes.extend_from_slice(&and_sign.to_le_bytes());
2385
2386        // BIC R0, R0, #0x80000000 (clear sign bit from magnitude)
2387        // R0 = register 0, so Rn and Rd fields are 0
2388        let bic_sign = 0xE3C00000u32 | (1 << 8) | 0x02;
2389        bytes.extend_from_slice(&bic_sign.to_le_bytes());
2390
2391        // ORR R0, R0, R12 (combine sign + magnitude)
2392        // R0 = register 0, so Rn and Rd fields are 0
2393        let orr = 0xE1800000u32 | 12;
2394        bytes.extend_from_slice(&orr.to_le_bytes());
2395
2396        // VMOV Sd, R0
2397        let vmov_result = encode_vmov_core_sreg(true, sd, &Reg::R0)?;
2398        bytes.extend_from_slice(&vmov_result.to_le_bytes());
2399
2400        Ok(bytes)
2401    }
2402
2403    /// Encode F64 comparison as ARM32: VCMP.F64 + VMRS + MOV rd,#0 + MOVcond rd,#1
2404    fn encode_arm_f64_compare(
2405        &self,
2406        rd: &Reg,
2407        dn: &VfpReg,
2408        dm: &VfpReg,
2409        cond_code: u32,
2410    ) -> Result<Vec<u8>> {
2411        let mut bytes = Vec::new();
2412
2413        // VCMP.F64 Dn, Dm: 0xEEB40B40 with Dn in Vd position, Dm in Vm position
2414        let dn_num = vfp_dreg_to_num(dn)?;
2415        let dm_num = vfp_dreg_to_num(dm)?;
2416        let (vd, d) = encode_dreg(dn_num);
2417        let (vm, m) = encode_dreg(dm_num);
2418        let vcmp = 0xEEB40B40 | (d << 22) | (vd << 12) | (m << 5) | vm;
2419        bytes.extend_from_slice(&vcmp.to_le_bytes());
2420
2421        // VMRS APSR_nzcv, FPSCR
2422        bytes.extend_from_slice(&0xEEF1FA10u32.to_le_bytes());
2423
2424        // MOV rd, #0
2425        let rd_bits = reg_to_bits(rd);
2426        let mov_zero = 0xE3A00000 | (rd_bits << 12);
2427        bytes.extend_from_slice(&mov_zero.to_le_bytes());
2428
2429        // MOVcond rd, #1
2430        let mov_one = (cond_code << 28) | 0x03A00001 | (rd_bits << 12);
2431        bytes.extend_from_slice(&mov_one.to_le_bytes());
2432
2433        Ok(bytes)
2434    }
2435
2436    /// Encode F64 constant load as ARM32: MOVW + MOVT + MOVW + MOVT + VMOV
2437    fn encode_arm_f64_const(&self, dd: &VfpReg, value: f64) -> Result<Vec<u8>> {
2438        let mut bytes = Vec::new();
2439        let bits = value.to_bits();
2440        let lo32 = bits as u32;
2441        let hi32 = (bits >> 32) as u32;
2442
2443        // Load low 32 bits into R0 (Rd field = 0 for R0)
2444        let lo16 = lo32 & 0xFFFF;
2445        let movw_r0 = 0xE3000000 | ((lo16 >> 12) << 16) | (lo16 & 0xFFF);
2446        bytes.extend_from_slice(&movw_r0.to_le_bytes());
2447        let hi16 = (lo32 >> 16) & 0xFFFF;
2448        let movt_r0 = 0xE3400000 | ((hi16 >> 12) << 16) | (hi16 & 0xFFF);
2449        bytes.extend_from_slice(&movt_r0.to_le_bytes());
2450
2451        // Load high 32 bits into R12
2452        let lo16 = hi32 & 0xFFFF;
2453        let movw_r12 = 0xE3000000 | ((lo16 >> 12) << 16) | (12 << 12) | (lo16 & 0xFFF);
2454        bytes.extend_from_slice(&movw_r12.to_le_bytes());
2455        let hi16 = (hi32 >> 16) & 0xFFFF;
2456        let movt_r12 = 0xE3400000 | ((hi16 >> 12) << 16) | (12 << 12) | (hi16 & 0xFFF);
2457        bytes.extend_from_slice(&movt_r12.to_le_bytes());
2458
2459        // VMOV Dd, R0, R12
2460        let vmov = encode_vmov_core_dreg(true, dd, &Reg::R0, &Reg::R12)?;
2461        bytes.extend_from_slice(&vmov.to_le_bytes());
2462
2463        Ok(bytes)
2464    }
2465
2466    /// Encode VMOV Sd, Rm + VCVT.F64.S32/U32 Dd, Sd as ARM32
2467    fn encode_arm_f64_convert_i32(&self, dd: &VfpReg, rm: &Reg, signed: bool) -> Result<Vec<u8>> {
2468        let mut bytes = Vec::new();
2469
2470        // Use S0 as intermediate: VMOV S0, Rm
2471        let vmov = encode_vmov_core_sreg(true, &VfpReg::S0, rm)?;
2472        bytes.extend_from_slice(&vmov.to_le_bytes());
2473
2474        // VCVT.F64.S32 Dd, S0 (signed) or VCVT.F64.U32 Dd, S0 (unsigned)
2475        // Base: 0xEEB80B40 (signed) or 0xEEB80BC0 (unsigned)
2476        let dd_num = vfp_dreg_to_num(dd)?;
2477        let (vd, d) = encode_dreg(dd_num);
2478        let base = if signed { 0xEEB80B40 } else { 0xEEB80BC0 };
2479        // S0 is register 0: Vm=0, M=0
2480        let vcvt = base | (d << 22) | (vd << 12);
2481        bytes.extend_from_slice(&vcvt.to_le_bytes());
2482
2483        Ok(bytes)
2484    }
2485
2486    /// Encode VCVT.F64.F32 Dd, Sm as ARM32 (f32 to f64 promotion)
2487    fn encode_arm_f64_promote_f32(&self, dd: &VfpReg, sm: &VfpReg) -> Result<Vec<u8>> {
2488        let dd_num = vfp_dreg_to_num(dd)?;
2489        let sm_num = vfp_sreg_to_num(sm)?;
2490        let (vd, d) = encode_dreg(dd_num);
2491        let (vm, m) = encode_sreg(sm_num);
2492
2493        // VCVT.F64.F32 Dd, Sm: 0xEEB70AC0
2494        let vcvt = 0xEEB70AC0 | (d << 22) | (vd << 12) | (m << 5) | vm;
2495        Ok(vcvt.to_le_bytes().to_vec())
2496    }
2497
2498    /// Encode VCVT.S32/U32.F64 Sd, Dm + VMOV Rd, Sd as ARM32
2499    fn encode_arm_i32_trunc_f64(&self, rd: &Reg, dm: &VfpReg, signed: bool) -> Result<Vec<u8>> {
2500        let mut bytes = Vec::new();
2501        let dm_num = vfp_dreg_to_num(dm)?;
2502        let (vm, m) = encode_dreg(dm_num);
2503
2504        // VCVT.S32.F64 S0, Dm (toward zero) or VCVT.U32.F64 S0, Dm
2505        // S0: Vd=0, D=0
2506        let base = if signed { 0xEEBD0BC0 } else { 0xEEBC0BC0 };
2507        let vcvt = base | (m << 5) | vm;
2508        bytes.extend_from_slice(&vcvt.to_le_bytes());
2509
2510        // VMOV Rd, S0
2511        let vmov = encode_vmov_core_sreg(false, &VfpReg::S0, rd)?;
2512        bytes.extend_from_slice(&vmov.to_le_bytes());
2513
2514        Ok(bytes)
2515    }
2516
2517    /// Encode F64 rounding pseudo-op as ARM32 via VCVT to integer and back.
2518    /// Encode F64 rounding as ARM32.
2519    /// `mode`: FPSCR RMode — 0b00=nearest, 0b01=+inf(ceil), 0b10=-inf(floor), 0b11=zero(trunc)
2520    ///
2521    /// For trunc: uses VCVTR.S32.F64 (always truncates).
2522    /// For ceil/floor/nearest: sets FPSCR rounding mode, uses VCVT.S32.F64 (non-R variant),
2523    /// then restores FPSCR.
2524    fn encode_arm_f64_rounding(&self, dd: &VfpReg, dm: &VfpReg, mode: u8) -> Result<Vec<u8>> {
2525        let mut bytes = Vec::new();
2526        let dm_num = vfp_dreg_to_num(dm)?;
2527        let dd_num = vfp_dreg_to_num(dd)?;
2528        let (vm, m) = encode_dreg(dm_num);
2529        let (vd, d) = encode_dreg(dd_num);
2530
2531        if mode == 0b11 {
2532            // Trunc (toward zero): VCVTR.S32.F64 — bit[7]=1, always truncates
2533            let vcvt_to_int = 0xEEBD0BC0 | (m << 5) | vm;
2534            bytes.extend_from_slice(&vcvt_to_int.to_le_bytes());
2535        } else {
2536            // ceil/floor/nearest: manipulate FPSCR rounding mode
2537            let rt: u32 = 12;
2538
2539            // VMRS R12, FPSCR
2540            let vmrs = 0xEEF10A10 | (rt << 12);
2541            bytes.extend_from_slice(&vmrs.to_le_bytes());
2542
2543            // BIC R12, R12, #(3 << 22)
2544            let bic = 0xE3CC0000 | (rt << 12) | (0x05 << 8) | 0x03;
2545            bytes.extend_from_slice(&bic.to_le_bytes());
2546
2547            // ORR R12, R12, #(mode << 22)
2548            if mode != 0 {
2549                let orr = 0xE38C0000 | (rt << 12) | (0x05 << 8) | (mode as u32);
2550                bytes.extend_from_slice(&orr.to_le_bytes());
2551            }
2552
2553            // VMSR FPSCR, R12
2554            let vmsr = 0xEEE10A10 | (rt << 12);
2555            bytes.extend_from_slice(&vmsr.to_le_bytes());
2556
2557            // VCVT.S32.F64 S0, Dm — non-R variant (bit[7]=0), uses FPSCR rmode
2558            let vcvt_to_int = 0xEEBD0B40 | (m << 5) | vm;
2559            bytes.extend_from_slice(&vcvt_to_int.to_le_bytes());
2560
2561            // Restore FPSCR
2562            bytes.extend_from_slice(&vmrs.to_le_bytes());
2563            bytes.extend_from_slice(&bic.to_le_bytes());
2564            bytes.extend_from_slice(&vmsr.to_le_bytes());
2565        }
2566
2567        // VCVT.F64.S32 Dd, S0 (convert back to double)
2568        let vcvt_to_float = 0xEEB80B40 | (d << 22) | (vd << 12);
2569        bytes.extend_from_slice(&vcvt_to_float.to_le_bytes());
2570
2571        Ok(bytes)
2572    }
2573
2574    /// Encode F64 min/max as ARM32: VMOV + VCMP + VMRS + conditional VMOV
2575    fn encode_arm_f64_minmax(
2576        &self,
2577        dd: &VfpReg,
2578        dn: &VfpReg,
2579        dm: &VfpReg,
2580        is_min: bool,
2581    ) -> Result<Vec<u8>> {
2582        let mut bytes = Vec::new();
2583        let dn_num = vfp_dreg_to_num(dn)?;
2584        let dm_num = vfp_dreg_to_num(dm)?;
2585        let dd_num = vfp_dreg_to_num(dd)?;
2586
2587        // VMOV.F64 Dd, Dn (start with first operand)
2588        let (vd, d) = encode_dreg(dd_num);
2589        let (vn, n) = encode_dreg(dn_num);
2590        let vmov_dn = 0xEEB00B40 | (d << 22) | (vd << 12) | (n << 5) | vn;
2591        bytes.extend_from_slice(&vmov_dn.to_le_bytes());
2592
2593        // VCMP.F64 Dn, Dm
2594        let (vm, m) = encode_dreg(dm_num);
2595        let vcmp = 0xEEB40B40 | (n << 22) | (vn << 12) | (m << 5) | vm;
2596        bytes.extend_from_slice(&vcmp.to_le_bytes());
2597
2598        // VMRS APSR_nzcv, FPSCR
2599        bytes.extend_from_slice(&0xEEF1FA10u32.to_le_bytes());
2600
2601        let cond = if is_min { 0xCu32 } else { 0x4u32 };
2602        let vmov_cond = (cond << 28) | 0x0EB00B40 | (d << 22) | (vd << 12) | (m << 5) | vm;
2603        bytes.extend_from_slice(&vmov_cond.to_le_bytes());
2604
2605        Ok(bytes)
2606    }
2607
2608    /// Encode F64 copysign as ARM32
2609    fn encode_arm_f64_copysign(&self, dd: &VfpReg, dn: &VfpReg, dm: &VfpReg) -> Result<Vec<u8>> {
2610        let mut bytes = Vec::new();
2611
2612        // VMOV R0, R12, Dm (get sign source bits)
2613        let vmov_dm = encode_vmov_core_dreg(false, dm, &Reg::R0, &Reg::R12)?;
2614        bytes.extend_from_slice(&vmov_dm.to_le_bytes());
2615
2616        // VMOV R1, R2, Dn (get magnitude source bits)
2617        // We use R1 (lo) and R2 (hi) for the magnitude
2618        let vmov_dn = encode_vmov_core_dreg(false, dn, &Reg::R1, &Reg::R2)?;
2619        bytes.extend_from_slice(&vmov_dn.to_le_bytes());
2620
2621        // AND R12, R12, #0x80000000 (keep only sign bit from hi word)
2622        let and_sign = 0xE2000000u32 | (12 << 16) | (12 << 12) | (1 << 8) | 0x02;
2623        bytes.extend_from_slice(&and_sign.to_le_bytes());
2624
2625        // BIC R2, R2, #0x80000000 (clear sign bit from magnitude hi word)
2626        let bic_sign = 0xE3C00000u32 | (2 << 16) | (2 << 12) | (1 << 8) | 0x02;
2627        bytes.extend_from_slice(&bic_sign.to_le_bytes());
2628
2629        // ORR R2, R2, R12 (combine sign + magnitude)
2630        let orr = 0xE1800000u32 | (2 << 16) | (2 << 12) | 12;
2631        bytes.extend_from_slice(&orr.to_le_bytes());
2632
2633        // VMOV Dd, R1, R2
2634        let vmov_result = encode_vmov_core_dreg(true, dd, &Reg::R1, &Reg::R2)?;
2635        bytes.extend_from_slice(&vmov_result.to_le_bytes());
2636
2637        Ok(bytes)
2638    }
2639
2640    /// Encode VCVT.S32/U32.F32 + VMOV as ARM32
2641    fn encode_arm_i32_trunc_f32(&self, rd: &Reg, sm: &VfpReg, signed: bool) -> Result<Vec<u8>> {
2642        let mut bytes = Vec::new();
2643
2644        // VCVT.S32.F32 Sd, Sm (toward zero) or VCVT.U32.F32 Sd, Sm
2645        // We use Sm as both source and destination for the intermediate result
2646        let sm_num = vfp_sreg_to_num(sm)?;
2647        let (vd, d) = encode_sreg(sm_num);
2648        let (vm, m) = encode_sreg(sm_num);
2649        let base = if signed { 0xEEBD0AC0 } else { 0xEEBC0AC0 };
2650        let vcvt = base | (d << 22) | (vd << 12) | (m << 5) | vm;
2651        bytes.extend_from_slice(&vcvt.to_le_bytes());
2652
2653        // VMOV Rd, Sm — move result back to core register
2654        let vmov = encode_vmov_core_sreg(false, sm, rd)?;
2655        bytes.extend_from_slice(&vmov.to_le_bytes());
2656
2657        Ok(bytes)
2658    }
2659
2660    /// Encode an ARM instruction in Thumb-2 mode (16-bit or 32-bit instructions)
2661    fn encode_thumb(&self, op: &ArmOp) -> Result<Vec<u8>> {
2662        // Thumb-2 supports both 16-bit and 32-bit instructions
2663        // 32-bit instructions are encoded as two 16-bit halfwords (big-endian order)
2664        match op {
2665            // === 16-bit Thumb encodings ===
2666            ArmOp::Add { rd, rn, op2 } => {
2667                let rd_bits = reg_to_bits(rd) as u16;
2668                let rn_bits = reg_to_bits(rn) as u16;
2669
2670                if let Operand2::Reg(rm) = op2 {
2671                    let rm_bits = reg_to_bits(rm) as u16;
2672                    // 16-bit ADDS only has 3-bit register fields (R0-R7). For
2673                    // high registers (e.g. R12, the MemLoad/MemStore base
2674                    // scratch) the bits overflow into adjacent fields, silently
2675                    // corrupting the operands — issue #178/#180: `add ip,ip,r0`
2676                    // was emitted as `adds r4,r5,r1`. Guard on all three regs
2677                    // being low and fall back to 32-bit ADD.W otherwise, exactly
2678                    // as the Sub handler below does.
2679                    if rd_bits < 8 && rn_bits < 8 && rm_bits < 8 {
2680                        // ADDS Rd, Rn, Rm (16-bit): 0001 100 Rm Rn Rd
2681                        let instr: u16 = 0x1800 | (rm_bits << 6) | (rn_bits << 3) | rd_bits;
2682                        Ok(instr.to_le_bytes().to_vec())
2683                    } else {
2684                        // ADD.W Rd, Rn, Rm (32-bit) for high registers
2685                        self.encode_thumb32_add_reg_raw(
2686                            rd_bits as u32,
2687                            rn_bits as u32,
2688                            rm_bits as u32,
2689                        )
2690                    }
2691                } else if let Operand2::Imm(imm) = op2 {
2692                    if *imm <= 7 && rd_bits < 8 && rn_bits < 8 {
2693                        // ADDS Rd, Rn, #imm3 (16-bit): 0001 110 imm3 Rn Rd
2694                        let instr: u16 = 0x1C00 | ((*imm as u16) << 6) | (rn_bits << 3) | rd_bits;
2695                        Ok(instr.to_le_bytes().to_vec())
2696                    } else {
2697                        // Use 32-bit ADD for larger immediates
2698                        self.encode_thumb32_add(rd, rn, *imm as u32)
2699                    }
2700                } else {
2701                    // Fallback to 32-bit encoding
2702                    self.encode_thumb32_add(rd, rn, 0)
2703                }
2704            }
2705
2706            ArmOp::Sub { rd, rn, op2 } => {
2707                let rd_bits = reg_to_bits(rd) as u16;
2708                let rn_bits = reg_to_bits(rn) as u16;
2709
2710                if let Operand2::Reg(rm) = op2 {
2711                    let rm_bits = reg_to_bits(rm) as u16;
2712                    // 16-bit SUBS can only use low registers (R0-R7)
2713                    if rd_bits < 8 && rn_bits < 8 && rm_bits < 8 {
2714                        // SUBS Rd, Rn, Rm (16-bit): 0001 101 Rm Rn Rd
2715                        let instr: u16 = 0x1A00 | (rm_bits << 6) | (rn_bits << 3) | rd_bits;
2716                        Ok(instr.to_le_bytes().to_vec())
2717                    } else {
2718                        // Use 32-bit SUB.W for high registers
2719                        self.encode_thumb32_sub_reg_raw(
2720                            rd_bits as u32,
2721                            rn_bits as u32,
2722                            rm_bits as u32,
2723                        )
2724                    }
2725                } else if let Operand2::Imm(imm) = op2 {
2726                    if *imm <= 7 && rd_bits < 8 && rn_bits < 8 {
2727                        // SUBS Rd, Rn, #imm3 (16-bit): 0001 111 imm3 Rn Rd
2728                        let instr: u16 = 0x1E00 | ((*imm as u16) << 6) | (rn_bits << 3) | rd_bits;
2729                        Ok(instr.to_le_bytes().to_vec())
2730                    } else {
2731                        self.encode_thumb32_sub(rd, rn, *imm as u32)
2732                    }
2733                } else {
2734                    self.encode_thumb32_sub(rd, rn, 0)
2735                }
2736            }
2737
2738            ArmOp::Mov { rd, op2 } => {
2739                let rd_bits = reg_to_bits(rd) as u16;
2740
2741                if let Operand2::Imm(imm) = op2 {
2742                    // #498: the old test here was the SIGNED `*imm <= 255`,
2743                    // so a negative immediate (e.g. -1) fell into the 16-bit
2744                    // MOVS arm and encoded the wrong VALUE (#(imm & 0xFF) =
2745                    // #0xFF). A positive imm above 0xFFFF was equally wrong:
2746                    // MOVW truncates to 16 bits. Split on the UNSIGNED value:
2747                    // imm8 → MOVS, imm16 → MOVW, anything wider (negative or
2748                    // >0xFFFF) → the full-value MOVW+MOVT pair. No emitter
2749                    // produces the wide shape today (both selectors
2750                    // materialize wide constants as explicit Movw/Movt or
2751                    // Movw+Mvn), so this is byte-identical on shipped paths —
2752                    // it retires the latent wrong-value encodings the
2753                    // `estimator_encoder_agreement` oracle had pinned.
2754                    let uimm = *imm as u32;
2755                    if uimm <= 255 && rd_bits < 8 {
2756                        // MOVS Rd, #imm8 (16-bit): 0010 0 Rd imm8
2757                        let imm_bits = (*imm as u16) & 0xFF;
2758                        let instr: u16 = 0x2000 | (rd_bits << 8) | imm_bits;
2759                        Ok(instr.to_le_bytes().to_vec())
2760                    } else if uimm <= 0xFFFF {
2761                        // Use 32-bit MOVW for 16-bit immediates
2762                        self.encode_thumb32_movw(rd, uimm)
2763                    } else {
2764                        // Full 32-bit value: MOVW low16 + MOVT high16
2765                        let mut bytes = self.encode_thumb32_movw(rd, uimm & 0xFFFF)?;
2766                        bytes.extend(self.encode_thumb32_movt_raw(reg_to_bits(rd), uimm >> 16)?);
2767                        Ok(bytes)
2768                    }
2769                } else if let Operand2::Reg(rm) = op2 {
2770                    let rm_bits = reg_to_bits(rm) as u16;
2771                    // MOV Rd, Rm (16-bit): 0100 0110 D Rm Rd[2:0]
2772                    // D = Rd[3], Rd[2:0] in lower bits
2773                    let d_bit = (rd_bits >> 3) & 1;
2774                    let instr: u16 = 0x4600 | (d_bit << 7) | (rm_bits << 3) | (rd_bits & 0x7);
2775                    Ok(instr.to_le_bytes().to_vec())
2776                } else {
2777                    let instr: u16 = 0xBF00; // NOP fallback
2778                    Ok(instr.to_le_bytes().to_vec())
2779                }
2780            }
2781
2782            ArmOp::Push { regs } => {
2783                // Thumb-2 PUSH encoding:
2784                // If all regs in R0-R7 + LR, use 16-bit: 1011 010 M rrrrrrrr
2785                // Otherwise use 32-bit: STMDB SP!, {regs} = 1110 1001 0010 1101 | 0M0 reglist(13)
2786                let mut reg_list: u16 = 0;
2787                let mut need_32bit = false;
2788                for r in regs {
2789                    let bit = reg_to_bits(r);
2790                    if bit >= 8 && *r != Reg::LR {
2791                        need_32bit = true;
2792                    }
2793                    reg_list |= 1 << bit;
2794                }
2795                if !need_32bit {
2796                    // 16-bit PUSH: 1011 010 M rrrrrrrr
2797                    let m_bit = if reg_list & (1 << 14) != 0 {
2798                        1u16
2799                    } else {
2800                        0u16
2801                    };
2802                    let low_regs = reg_list & 0xFF;
2803                    let instr: u16 = 0xB400 | (m_bit << 8) | low_regs;
2804                    Ok(instr.to_le_bytes().to_vec())
2805                } else {
2806                    // 32-bit STMDB SP!, {regs}: E92D | reglist(16)
2807                    let hw1: u16 = 0xE92D;
2808                    let hw2: u16 = reg_list;
2809                    let mut bytes = hw1.to_le_bytes().to_vec();
2810                    bytes.extend_from_slice(&hw2.to_le_bytes());
2811                    Ok(bytes)
2812                }
2813            }
2814
2815            ArmOp::Pop { regs } => {
2816                // Thumb-2 POP encoding:
2817                // If all regs in R0-R7 + PC, use 16-bit: 1011 110 P rrrrrrrr
2818                // Otherwise use 32-bit: LDMIA SP!, {regs} = 1110 1000 1011 1101 | PM0 reglist(13)
2819                let mut reg_list: u16 = 0;
2820                let mut need_32bit = false;
2821                for r in regs {
2822                    let bit = reg_to_bits(r);
2823                    if bit >= 8 && *r != Reg::PC {
2824                        need_32bit = true;
2825                    }
2826                    reg_list |= 1 << bit;
2827                }
2828                if !need_32bit {
2829                    // 16-bit POP: 1011 110 P rrrrrrrr
2830                    let p_bit = if reg_list & (1 << 15) != 0 {
2831                        1u16
2832                    } else {
2833                        0u16
2834                    };
2835                    let low_regs = reg_list & 0xFF;
2836                    let instr: u16 = 0xBC00 | (p_bit << 8) | low_regs;
2837                    Ok(instr.to_le_bytes().to_vec())
2838                } else {
2839                    // 32-bit LDMIA SP!, {regs}: E8BD | reglist(16)
2840                    let hw1: u16 = 0xE8BD;
2841                    let hw2: u16 = reg_list;
2842                    let mut bytes = hw1.to_le_bytes().to_vec();
2843                    bytes.extend_from_slice(&hw2.to_le_bytes());
2844                    Ok(bytes)
2845                }
2846            }
2847
2848            ArmOp::Nop => {
2849                let instr: u16 = 0xBF00; // NOP in Thumb-2
2850                Ok(instr.to_le_bytes().to_vec())
2851            }
2852
2853            ArmOp::Udf { imm } => {
2854                // UDF (Undefined) in Thumb-2: 16-bit encoding is 0xDE00 | imm8
2855                // This triggers UsageFault/HardFault, used for WASM traps
2856                let instr: u16 = 0xDE00 | (*imm as u16);
2857                let bytes = instr.to_le_bytes().to_vec();
2858                encoding_contracts::verify_thumb16(&bytes);
2859                Ok(bytes)
2860            }
2861
2862            // i64 support: ADDS, ADC, SUBS, SBC for register pair arithmetic
2863            // ADDS sets flags (carry), ADC uses carry from previous ADDS
2864            ArmOp::Adds { rd, rn, op2 } => {
2865                let rd_bits = reg_to_bits(rd) as u16;
2866                let rn_bits = reg_to_bits(rn) as u16;
2867
2868                if let Operand2::Reg(rm) = op2 {
2869                    let rm_bits = reg_to_bits(rm) as u16;
2870                    // 16-bit ADDS is R0-R7 only; i64 pair allocation can place
2871                    // operands in R8-R11, which would overflow the 3-bit fields
2872                    // and corrupt the operands (#178/#180 class). Guard and fall
2873                    // back to 32-bit ADDS.W for high registers.
2874                    if rd_bits < 8 && rn_bits < 8 && rm_bits < 8 {
2875                        // ADDS Rd, Rn, Rm (16-bit): 0001 100 Rm Rn Rd
2876                        let instr: u16 = 0x1800 | (rm_bits << 6) | (rn_bits << 3) | rd_bits;
2877                        Ok(instr.to_le_bytes().to_vec())
2878                    } else {
2879                        self.encode_thumb32_adds_reg_raw(
2880                            rd_bits as u32,
2881                            rn_bits as u32,
2882                            rm_bits as u32,
2883                        )
2884                    }
2885                } else {
2886                    // 32-bit Thumb-2 ADDS with immediate
2887                    self.encode_thumb32_adds(rd, rn, 0)
2888                }
2889            }
2890
2891            // ADC: Add with Carry (Thumb-2 32-bit)
2892            // ADC.W Rd, Rn, Rm: EB40 Rn | 00 Rd 00 Rm
2893            ArmOp::Adc { rd, rn, op2 } => {
2894                let rd_bits = reg_to_bits(rd);
2895                let rn_bits = reg_to_bits(rn);
2896
2897                if let Operand2::Reg(rm) = op2 {
2898                    let rm_bits = reg_to_bits(rm);
2899                    // ADC.W Rd, Rn, Rm (T2): 1110 1011 0100 Rn | 0 000 Rd 00 00 Rm
2900                    let hw1: u16 = (0xEB40 | rn_bits) as u16;
2901                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
2902
2903                    let mut bytes = hw1.to_le_bytes().to_vec();
2904                    bytes.extend_from_slice(&hw2.to_le_bytes());
2905                    Ok(bytes)
2906                } else {
2907                    // ADC with immediate - use 32-bit encoding
2908                    let hw1: u16 = (0xF140 | rn_bits) as u16;
2909                    let hw2: u16 = (rd_bits << 8) as u16;
2910                    let mut bytes = hw1.to_le_bytes().to_vec();
2911                    bytes.extend_from_slice(&hw2.to_le_bytes());
2912                    Ok(bytes)
2913                }
2914            }
2915
2916            // SUBS sets flags (borrow), SBC uses borrow from previous SUBS
2917            ArmOp::Subs { rd, rn, op2 } => {
2918                let rd_bits = reg_to_bits(rd) as u16;
2919                let rn_bits = reg_to_bits(rn) as u16;
2920
2921                if let Operand2::Reg(rm) = op2 {
2922                    let rm_bits = reg_to_bits(rm) as u16;
2923                    // 16-bit SUBS is R0-R7 only; high-register i64 pair operands
2924                    // would overflow the 3-bit fields (#178/#180 class). Guard
2925                    // and fall back to 32-bit SUBS.W for high registers.
2926                    if rd_bits < 8 && rn_bits < 8 && rm_bits < 8 {
2927                        // SUBS Rd, Rn, Rm (16-bit): 0001 101 Rm Rn Rd
2928                        let instr: u16 = 0x1A00 | (rm_bits << 6) | (rn_bits << 3) | rd_bits;
2929                        Ok(instr.to_le_bytes().to_vec())
2930                    } else {
2931                        self.encode_thumb32_subs_reg_raw(
2932                            rd_bits as u32,
2933                            rn_bits as u32,
2934                            rm_bits as u32,
2935                        )
2936                    }
2937                } else {
2938                    // 32-bit Thumb-2 SUBS with immediate
2939                    self.encode_thumb32_subs(rd, rn, 0)
2940                }
2941            }
2942
2943            // SBC: Subtract with Carry (Thumb-2 32-bit)
2944            // SBC.W Rd, Rn, Rm: EB60 Rn | 00 Rd 00 Rm
2945            ArmOp::Sbc { rd, rn, op2 } => {
2946                let rd_bits = reg_to_bits(rd);
2947                let rn_bits = reg_to_bits(rn);
2948
2949                if let Operand2::Reg(rm) = op2 {
2950                    let rm_bits = reg_to_bits(rm);
2951                    // SBC.W Rd, Rn, Rm (T2): 1110 1011 0110 Rn | 0 000 Rd 00 00 Rm
2952                    let hw1: u16 = (0xEB60 | rn_bits) as u16;
2953                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
2954
2955                    let mut bytes = hw1.to_le_bytes().to_vec();
2956                    bytes.extend_from_slice(&hw2.to_le_bytes());
2957                    Ok(bytes)
2958                } else {
2959                    // SBC with immediate - use 32-bit encoding
2960                    let hw1: u16 = (0xF160 | rn_bits) as u16;
2961                    let hw2: u16 = (rd_bits << 8) as u16;
2962                    let mut bytes = hw1.to_le_bytes().to_vec();
2963                    bytes.extend_from_slice(&hw2.to_le_bytes());
2964                    Ok(bytes)
2965                }
2966            }
2967
2968            // === 32-bit Thumb-2 encodings ===
2969
2970            // SDIV: 11111011 1001 Rn 1111 Rd 1111 Rm
2971            ArmOp::Sdiv { rd, rn, rm } => {
2972                let rd_bits = reg_to_bits(rd);
2973                let rn_bits = reg_to_bits(rn);
2974                let rm_bits = reg_to_bits(rm);
2975                reg_bits_checked(rd_bits)?;
2976                reg_bits_checked(rn_bits)?;
2977                reg_bits_checked(rm_bits)?;
2978
2979                // Thumb-2 SDIV: FB90 F0F0 | Rn<<16 | Rd<<8 | Rm
2980                // First halfword: 1111 1011 1001 Rn = 0xFB90 | Rn
2981                // Second halfword: 1111 Rd 1111 Rm = 0xF0F0 | Rd<<8 | Rm
2982                let hw1: u16 = (0xFB90 | rn_bits) as u16;
2983                let hw2: u16 = (0xF0F0 | (rd_bits << 8) | rm_bits) as u16;
2984
2985                // Thumb-2 32-bit instructions: first halfword, then second halfword (little-endian each)
2986                let mut bytes = hw1.to_le_bytes().to_vec();
2987                bytes.extend_from_slice(&hw2.to_le_bytes());
2988                encoding_contracts::verify_thumb32(&bytes);
2989                Ok(bytes)
2990            }
2991
2992            // UDIV: 11111011 1011 Rn 1111 Rd 1111 Rm
2993            ArmOp::Udiv { rd, rn, rm } => {
2994                let rd_bits = reg_to_bits(rd);
2995                let rn_bits = reg_to_bits(rn);
2996                let rm_bits = reg_to_bits(rm);
2997                reg_bits_checked(rd_bits)?;
2998                reg_bits_checked(rn_bits)?;
2999                reg_bits_checked(rm_bits)?;
3000
3001                // Thumb-2 UDIV: FBB0 F0F0 | Rn<<16 | Rd<<8 | Rm
3002                let hw1: u16 = (0xFBB0 | rn_bits) as u16;
3003                let hw2: u16 = (0xF0F0 | (rd_bits << 8) | rm_bits) as u16;
3004
3005                let mut bytes = hw1.to_le_bytes().to_vec();
3006                bytes.extend_from_slice(&hw2.to_le_bytes());
3007                encoding_contracts::verify_thumb32(&bytes);
3008                Ok(bytes)
3009            }
3010
3011            ArmOp::Umull { rdlo, rdhi, rn, rm } => {
3012                let rdlo_bits = reg_to_bits(rdlo);
3013                let rdhi_bits = reg_to_bits(rdhi);
3014                let rn_bits = reg_to_bits(rn);
3015                let rm_bits = reg_to_bits(rm);
3016                reg_bits_checked(rdlo_bits)?;
3017                reg_bits_checked(rdhi_bits)?;
3018                reg_bits_checked(rn_bits)?;
3019                reg_bits_checked(rm_bits)?;
3020
3021                // Thumb-2 UMULL: 1111 1011 1010 Rn | RdLo RdHi 0000 Rm
3022                let hw1: u16 = (0xFBA0 | rn_bits) as u16;
3023                let hw2: u16 = ((rdlo_bits << 12) | (rdhi_bits << 8) | rm_bits) as u16;
3024
3025                let mut bytes = hw1.to_le_bytes().to_vec();
3026                bytes.extend_from_slice(&hw2.to_le_bytes());
3027                encoding_contracts::verify_thumb32(&bytes);
3028                Ok(bytes)
3029            }
3030
3031            // MUL (Thumb-2 32-bit): MUL Rd, Rn, Rm
3032            ArmOp::Mul { rd, rn, rm } => {
3033                let rd_bits = reg_to_bits(rd);
3034                let rn_bits = reg_to_bits(rn);
3035                let rm_bits = reg_to_bits(rm);
3036
3037                // Thumb-2 MUL: FB00 F000 | Rn | Rd<<8 | Rm
3038                // 11111011 0000 Rn | 1111 Rd 0000 Rm
3039                let hw1: u16 = (0xFB00 | rn_bits) as u16;
3040                let hw2: u16 = (0xF000 | (rd_bits << 8) | rm_bits) as u16;
3041
3042                let mut bytes = hw1.to_le_bytes().to_vec();
3043                bytes.extend_from_slice(&hw2.to_le_bytes());
3044                Ok(bytes)
3045            }
3046
3047            // MLS: Rd = Ra - Rn * Rm
3048            ArmOp::Mls { rd, rn, rm, ra } => {
3049                let rd_bits = reg_to_bits(rd);
3050                let rn_bits = reg_to_bits(rn);
3051                let rm_bits = reg_to_bits(rm);
3052                let ra_bits = reg_to_bits(ra);
3053
3054                // Thumb-2 MLS: FB00 Rn | Ra Rd 0001 Rm
3055                // 11111011 0000 Rn | Ra Rd 0001 Rm
3056                let hw1: u16 = (0xFB00 | rn_bits) as u16;
3057                let hw2: u16 = ((ra_bits << 12) | (rd_bits << 8) | 0x10 | rm_bits) as u16;
3058
3059                let mut bytes = hw1.to_le_bytes().to_vec();
3060                bytes.extend_from_slice(&hw2.to_le_bytes());
3061                Ok(bytes)
3062            }
3063
3064            ArmOp::Mla { rd, rn, rm, ra } => {
3065                let rd_bits = reg_to_bits(rd);
3066                let rn_bits = reg_to_bits(rn);
3067                let rm_bits = reg_to_bits(rm);
3068                let ra_bits = reg_to_bits(ra);
3069
3070                // Thumb-2 MLA: FB00 Rn | Ra Rd 0000 Rm — same as MLS without the
3071                // bit-4 (0x10) op flag. rd = ra + rn*rm.
3072                let hw1: u16 = (0xFB00 | rn_bits) as u16;
3073                let hw2: u16 = ((ra_bits << 12) | (rd_bits << 8) | rm_bits) as u16;
3074
3075                let mut bytes = hw1.to_le_bytes().to_vec();
3076                bytes.extend_from_slice(&hw2.to_le_bytes());
3077                Ok(bytes)
3078            }
3079
3080            // AND (Thumb-2 32-bit)
3081            ArmOp::And { rd, rn, op2 } => {
3082                if let Operand2::Reg(rm) = op2 {
3083                    let rd_bits = reg_to_bits(rd);
3084                    let rn_bits = reg_to_bits(rn);
3085                    let rm_bits = reg_to_bits(rm);
3086
3087                    // Thumb-2 AND register: EA00 Rn | 0 Rd 00 00 Rm
3088                    let hw1: u16 = (0xEA00 | rn_bits) as u16;
3089                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
3090
3091                    let mut bytes = hw1.to_le_bytes().to_vec();
3092                    bytes.extend_from_slice(&hw2.to_le_bytes());
3093                    Ok(bytes)
3094                } else if let Operand2::Imm(imm) = op2 {
3095                    let rd_bits = reg_to_bits(rd);
3096                    let rn_bits = reg_to_bits(rn);
3097
3098                    // Thumb-2 AND.W immediate T1: 11110 i 0 0000 S Rn | 0 imm3 Rd imm8.
3099                    // The i:imm3:imm8 field is a ThumbExpandImm modified immediate —
3100                    // encode it correctly (or error on an un-encodable value)
3101                    // rather than packing raw bits, closing the silent-miscompile
3102                    // class for AND alongside ORR/EOR (#251) / ADD/SUB (#253) /
3103                    // CMP (#255).
3104                    let field = try_thumb_expand_imm(*imm as u32).ok_or_else(|| {
3105                        synth_core::Error::synthesis(
3106                            "AND immediate is not a valid ThumbExpandImm — materialize into a register",
3107                        )
3108                    })?;
3109                    let i_bit = (field >> 11) & 1;
3110                    let imm3 = (field >> 8) & 0x7;
3111                    let imm8 = field & 0xFF;
3112
3113                    let hw1: u16 = (0xF000 | (i_bit << 10) | rn_bits) as u16;
3114                    let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
3115
3116                    let mut bytes = hw1.to_le_bytes().to_vec();
3117                    bytes.extend_from_slice(&hw2.to_le_bytes());
3118                    Ok(bytes)
3119                } else {
3120                    // RegShift variant - fallback to NOP
3121                    let instr: u16 = 0xBF00;
3122                    Ok(instr.to_le_bytes().to_vec())
3123                }
3124            }
3125
3126            // ORR (Thumb-2 32-bit)
3127            ArmOp::Orr { rd, rn, op2 } => {
3128                if let Operand2::Reg(rm) = op2 {
3129                    let rd_bits = reg_to_bits(rd);
3130                    let rn_bits = reg_to_bits(rn);
3131                    let rm_bits = reg_to_bits(rm);
3132
3133                    // Thumb-2 ORR: EA40 Rn | 0 Rd 00 00 Rm
3134                    let hw1: u16 = (0xEA40 | rn_bits) as u16;
3135                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
3136
3137                    let mut bytes = hw1.to_le_bytes().to_vec();
3138                    bytes.extend_from_slice(&hw2.to_le_bytes());
3139                    Ok(bytes)
3140                } else if let Operand2::Imm(imm) = op2 {
3141                    // ORR.W immediate T1: 11110 i 0 0010 S Rn | 0 imm3 Rd imm8.
3142                    // Only the zero-extended byte form (imm <= 0xFF) is encoded;
3143                    // larger modified immediates need ThumbExpandImm — return an
3144                    // error rather than silently emit a NOP (Ok-or-Err, #180/#185).
3145                    let imm_val = *imm as u32;
3146                    if imm_val > 0xFF {
3147                        return Err(synth_core::Error::synthesis(
3148                            "ORR immediate > 0xFF requires ThumbExpandImm (not yet implemented)",
3149                        ));
3150                    }
3151                    let rd_bits = reg_to_bits(rd);
3152                    let rn_bits = reg_to_bits(rn);
3153                    let hw1: u16 = (0xF040 | rn_bits) as u16;
3154                    let hw2: u16 = ((rd_bits << 8) | (imm_val & 0xFF)) as u16;
3155                    let mut bytes = hw1.to_le_bytes().to_vec();
3156                    bytes.extend_from_slice(&hw2.to_le_bytes());
3157                    Ok(bytes)
3158                } else {
3159                    let instr: u16 = 0xBF00;
3160                    Ok(instr.to_le_bytes().to_vec())
3161                }
3162            }
3163
3164            // EOR (Thumb-2 32-bit)
3165            ArmOp::Eor { rd, rn, op2 } => {
3166                if let Operand2::Reg(rm) = op2 {
3167                    let rd_bits = reg_to_bits(rd);
3168                    let rn_bits = reg_to_bits(rn);
3169                    let rm_bits = reg_to_bits(rm);
3170
3171                    // Thumb-2 EOR: EA80 Rn | 0 Rd 00 00 Rm
3172                    let hw1: u16 = (0xEA80 | rn_bits) as u16;
3173                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
3174
3175                    let mut bytes = hw1.to_le_bytes().to_vec();
3176                    bytes.extend_from_slice(&hw2.to_le_bytes());
3177                    Ok(bytes)
3178                } else if let Operand2::Imm(imm) = op2 {
3179                    // EOR.W immediate T1: 11110 i 0 0100 S Rn | 0 imm3 Rd imm8.
3180                    // Byte form only (imm <= 0xFF); larger needs ThumbExpandImm —
3181                    // error, not a silent NOP (Ok-or-Err, #180/#185).
3182                    let imm_val = *imm as u32;
3183                    if imm_val > 0xFF {
3184                        return Err(synth_core::Error::synthesis(
3185                            "EOR immediate > 0xFF requires ThumbExpandImm (not yet implemented)",
3186                        ));
3187                    }
3188                    let rd_bits = reg_to_bits(rd);
3189                    let rn_bits = reg_to_bits(rn);
3190                    let hw1: u16 = (0xF080 | rn_bits) as u16;
3191                    let hw2: u16 = ((rd_bits << 8) | (imm_val & 0xFF)) as u16;
3192                    let mut bytes = hw1.to_le_bytes().to_vec();
3193                    bytes.extend_from_slice(&hw2.to_le_bytes());
3194                    Ok(bytes)
3195                } else {
3196                    let instr: u16 = 0xBF00;
3197                    Ok(instr.to_le_bytes().to_vec())
3198                }
3199            }
3200
3201            // Shift operations (16-bit for low registers)
3202            ArmOp::Lsl { rd, rn, shift } => {
3203                let rd_bits = reg_to_bits(rd) as u16;
3204                let rn_bits = reg_to_bits(rn) as u16;
3205                let shift_bits = (*shift as u16) & 0x1F;
3206
3207                if rd_bits < 8 && rn_bits < 8 {
3208                    // LSLS Rd, Rm, #imm5 (16-bit): 0000 0 imm5 Rm Rd
3209                    let instr: u16 = (shift_bits << 6) | (rn_bits << 3) | rd_bits;
3210                    Ok(instr.to_le_bytes().to_vec())
3211                } else {
3212                    // Use 32-bit encoding for high registers
3213                    self.encode_thumb32_shift(rd, rn, *shift, 0b00) // LSL type
3214                }
3215            }
3216
3217            ArmOp::Lsr { rd, rn, shift } => {
3218                let rd_bits = reg_to_bits(rd) as u16;
3219                let rn_bits = reg_to_bits(rn) as u16;
3220                let shift_bits = (*shift as u16) & 0x1F;
3221
3222                if rd_bits < 8 && rn_bits < 8 && shift_bits > 0 {
3223                    // LSRS Rd, Rm, #imm5 (16-bit): 0000 1 imm5 Rm Rd
3224                    let instr: u16 = 0x0800 | (shift_bits << 6) | (rn_bits << 3) | rd_bits;
3225                    Ok(instr.to_le_bytes().to_vec())
3226                } else {
3227                    self.encode_thumb32_shift(rd, rn, *shift, 0b01) // LSR type
3228                }
3229            }
3230
3231            ArmOp::Asr { rd, rn, shift } => {
3232                let rd_bits = reg_to_bits(rd) as u16;
3233                let rn_bits = reg_to_bits(rn) as u16;
3234                let shift_bits = (*shift as u16) & 0x1F;
3235
3236                if rd_bits < 8 && rn_bits < 8 && shift_bits > 0 {
3237                    // ASRS Rd, Rm, #imm5 (16-bit): 0001 0 imm5 Rm Rd
3238                    let instr: u16 = 0x1000 | (shift_bits << 6) | (rn_bits << 3) | rd_bits;
3239                    Ok(instr.to_le_bytes().to_vec())
3240                } else {
3241                    self.encode_thumb32_shift(rd, rn, *shift, 0b10) // ASR type
3242                }
3243            }
3244
3245            ArmOp::Ror { rd, rn, shift } => {
3246                // ROR doesn't have a 16-bit immediate form, use 32-bit
3247                self.encode_thumb32_shift(rd, rn, *shift, 0b11) // ROR type
3248            }
3249
3250            // Register-based shifts (Thumb-2 32-bit)
3251            // Encoding: 11111010 0xxS Rn 1111 Rd 0000 Rm
3252            // xx = shift type: 00=LSL, 01=LSR, 10=ASR, 11=ROR
3253            ArmOp::LslReg { rd, rn, rm } => self.encode_thumb32_shift_reg(rd, rn, rm, 0b00),
3254            ArmOp::LsrReg { rd, rn, rm } => self.encode_thumb32_shift_reg(rd, rn, rm, 0b01),
3255            ArmOp::AsrReg { rd, rn, rm } => self.encode_thumb32_shift_reg(rd, rn, rm, 0b10),
3256            ArmOp::RorReg { rd, rn, rm } => self.encode_thumb32_shift_reg(rd, rn, rm, 0b11),
3257
3258            // RSB (Reverse Subtract): Rd = imm - Rn
3259            // Thumb-2 T2 encoding: 11110 i 0 1110 S Rn | 0 imm3 Rd imm8
3260            ArmOp::Rsb { rd, rn, imm } => {
3261                let rd_bits = reg_to_bits(rd);
3262                let rn_bits = reg_to_bits(rn);
3263
3264                // #681 class audit: the T2 `i:imm3:imm8` field is a
3265                // ThumbExpandImm modified immediate and RSB has NO plain-imm12
3266                // (T4-style) form — packing a raw value > 0xFF silently encodes
3267                // a different constant (#253/#255 class). All current emitters
3268                // use imm 32 (shift complement), which expands to itself, so
3269                // this gate is byte-identical for existing codegen.
3270                let field = try_thumb_expand_imm(*imm).ok_or_else(|| {
3271                    synth_core::Error::synthesis(
3272                        "RSB immediate is not a valid ThumbExpandImm — materialize into a register",
3273                    )
3274                })?;
3275                let i_bit = (field >> 11) & 1;
3276                let imm3 = (field >> 8) & 0x7;
3277                let imm8 = field & 0xFF;
3278
3279                // hw1: 11110 i 01110 0 Rn  (S=0)
3280                let hw1: u16 = (0xF1C0 | (i_bit << 10) | rn_bits) as u16;
3281                // hw2: 0 imm3 Rd imm8
3282                let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
3283
3284                let mut bytes = hw1.to_le_bytes().to_vec();
3285                bytes.extend_from_slice(&hw2.to_le_bytes());
3286                Ok(bytes)
3287            }
3288
3289            // CLZ (Thumb-2 32-bit)
3290            ArmOp::Clz { rd, rm } => {
3291                let rd_bits = reg_to_bits(rd);
3292                let rm_bits = reg_to_bits(rm);
3293
3294                // Thumb-2 CLZ: FAB0 Rm | F8 Rd Rm
3295                // 11111010 1011 Rm | 1111 1000 Rd Rm
3296                let hw1: u16 = (0xFAB0 | rm_bits) as u16;
3297                let hw2: u16 = (0xF080 | (rd_bits << 8) | rm_bits) as u16;
3298
3299                let mut bytes = hw1.to_le_bytes().to_vec();
3300                bytes.extend_from_slice(&hw2.to_le_bytes());
3301                Ok(bytes)
3302            }
3303
3304            // RBIT (Thumb-2 32-bit)
3305            ArmOp::Rbit { rd, rm } => {
3306                let rd_bits = reg_to_bits(rd);
3307                let rm_bits = reg_to_bits(rm);
3308
3309                // Thumb-2 RBIT: FA90 Rm | F0 Rd A0 Rm
3310                // 11111010 1001 Rm | 1111 Rd 1010 Rm
3311                let hw1: u16 = (0xFA90 | rm_bits) as u16;
3312                let hw2: u16 = (0xF0A0 | (rd_bits << 8) | rm_bits) as u16;
3313
3314                let mut bytes = hw1.to_le_bytes().to_vec();
3315                bytes.extend_from_slice(&hw2.to_le_bytes());
3316                Ok(bytes)
3317            }
3318
3319            // SXTB (16-bit for low registers)
3320            ArmOp::Sxtb { rd, rm } => {
3321                let rd_bits = reg_to_bits(rd) as u16;
3322                let rm_bits = reg_to_bits(rm) as u16;
3323
3324                if rd_bits < 8 && rm_bits < 8 {
3325                    // SXTB Rd, Rm (16-bit): 1011 0010 01 Rm Rd
3326                    let instr: u16 = 0xB240 | (rm_bits << 3) | rd_bits;
3327                    Ok(instr.to_le_bytes().to_vec())
3328                } else {
3329                    // Thumb-2 SXTB.W: FA4F F(rd)80 (rm)
3330                    // 11111010 0100 1111 | 1111 Rd 10 rotate Rm
3331                    let rd_bits32 = rd_bits as u32;
3332                    let rm_bits32 = rm_bits as u32;
3333                    let hw1: u16 = 0xFA4F;
3334                    let hw2: u16 = (0xF080 | (rd_bits32 << 8) | rm_bits32) as u16;
3335                    let mut bytes = hw1.to_le_bytes().to_vec();
3336                    bytes.extend_from_slice(&hw2.to_le_bytes());
3337                    Ok(bytes)
3338                }
3339            }
3340
3341            // SXTH (16-bit for low registers)
3342            ArmOp::Sxth { rd, rm } => {
3343                let rd_bits = reg_to_bits(rd) as u16;
3344                let rm_bits = reg_to_bits(rm) as u16;
3345
3346                if rd_bits < 8 && rm_bits < 8 {
3347                    // SXTH Rd, Rm (16-bit): 1011 0010 00 Rm Rd
3348                    let instr: u16 = 0xB200 | (rm_bits << 3) | rd_bits;
3349                    Ok(instr.to_le_bytes().to_vec())
3350                } else {
3351                    // Thumb-2 SXTH.W: FA0F F(rd)80 (rm)
3352                    // 11111010 0000 1111 | 1111 Rd 10 rotate Rm
3353                    let rd_bits32 = rd_bits as u32;
3354                    let rm_bits32 = rm_bits as u32;
3355                    let hw1: u16 = 0xFA0F;
3356                    let hw2: u16 = (0xF080 | (rd_bits32 << 8) | rm_bits32) as u16;
3357                    let mut bytes = hw1.to_le_bytes().to_vec();
3358                    bytes.extend_from_slice(&hw2.to_le_bytes());
3359                    Ok(bytes)
3360                }
3361            }
3362
3363            // UXTB Rd,Rm — zero-extend byte (rd = rm & 0xff)
3364            ArmOp::Uxtb { rd, rm } => {
3365                let rd_bits = reg_to_bits(rd) as u16;
3366                let rm_bits = reg_to_bits(rm) as u16;
3367                if rd_bits < 8 && rm_bits < 8 {
3368                    // UXTB Rd, Rm (16-bit): 1011 0010 11 Rm Rd
3369                    let instr: u16 = 0xB2C0 | (rm_bits << 3) | rd_bits;
3370                    Ok(instr.to_le_bytes().to_vec())
3371                } else {
3372                    // Thumb-2 UXTB.W: FA5F F(rd)80 (rm)
3373                    let hw1: u16 = 0xFA5F;
3374                    let hw2: u16 = (0xF080 | ((rd_bits as u32) << 8) | rm_bits as u32) as u16;
3375                    let mut bytes = hw1.to_le_bytes().to_vec();
3376                    bytes.extend_from_slice(&hw2.to_le_bytes());
3377                    Ok(bytes)
3378                }
3379            }
3380
3381            // UXTH Rd,Rm — zero-extend halfword (rd = rm & 0xffff)
3382            ArmOp::Uxth { rd, rm } => {
3383                let rd_bits = reg_to_bits(rd) as u16;
3384                let rm_bits = reg_to_bits(rm) as u16;
3385                if rd_bits < 8 && rm_bits < 8 {
3386                    // UXTH Rd, Rm (16-bit): 1011 0010 10 Rm Rd
3387                    let instr: u16 = 0xB280 | (rm_bits << 3) | rd_bits;
3388                    Ok(instr.to_le_bytes().to_vec())
3389                } else {
3390                    // Thumb-2 UXTH.W: FA1F F(rd)80 (rm)
3391                    let hw1: u16 = 0xFA1F;
3392                    let hw2: u16 = (0xF080 | ((rd_bits as u32) << 8) | rm_bits as u32) as u16;
3393                    let mut bytes = hw1.to_le_bytes().to_vec();
3394                    bytes.extend_from_slice(&hw2.to_le_bytes());
3395                    Ok(bytes)
3396                }
3397            }
3398
3399            // CMP (can be 16-bit for low registers)
3400            ArmOp::Cmp { rn, op2 } => {
3401                let rn_bits = reg_to_bits(rn) as u16;
3402
3403                if let Operand2::Imm(imm) = op2 {
3404                    // Only use 16-bit encoding for non-negative immediates 0-255
3405                    // Negative immediates must use 32-bit encoding
3406                    if *imm >= 0 && *imm <= 255 && rn_bits < 8 {
3407                        // CMP Rn, #imm8 (16-bit): 0010 1 Rn imm8
3408                        let instr: u16 = 0x2800 | (rn_bits << 8) | (*imm as u16 & 0xFF);
3409                        Ok(instr.to_le_bytes().to_vec())
3410                    } else {
3411                        self.encode_thumb32_cmp_imm(rn, *imm as u32)
3412                    }
3413                } else if let Operand2::Reg(rm) = op2 {
3414                    let rm_bits = reg_to_bits(rm) as u16;
3415                    if rn_bits < 8 && rm_bits < 8 {
3416                        // CMP Rn, Rm (16-bit low): 0100 0010 10 Rm Rn
3417                        let instr: u16 = 0x4280 | (rm_bits << 3) | rn_bits;
3418                        Ok(instr.to_le_bytes().to_vec())
3419                    } else {
3420                        // CMP Rn, Rm (16-bit high): 0100 0101 N Rm Rn[2:0]
3421                        let n_bit = (rn_bits >> 3) & 1;
3422                        let instr: u16 = 0x4500 | (n_bit << 7) | (rm_bits << 3) | (rn_bits & 0x7);
3423                        Ok(instr.to_le_bytes().to_vec())
3424                    }
3425                } else {
3426                    let instr: u16 = 0xBF00;
3427                    Ok(instr.to_le_bytes().to_vec())
3428                }
3429            }
3430
3431            // CMN (Compare Negative) - computes Rn + op2 and sets flags
3432            // CMN Rn, #1 sets Z flag if Rn == -1 (since -1 + 1 = 0)
3433            ArmOp::Cmn { rn, op2 } => {
3434                let rn_bits = reg_to_bits(rn) as u16;
3435
3436                if let Operand2::Imm(imm) = op2 {
3437                    // CMN.W Rn, #imm (32-bit): i:imm3:imm8 is a ThumbExpandImm
3438                    // modified immediate (the field sits in imm3=hw2[14:12],
3439                    // imm8=hw2[7:0], i=hw1[10]). Encode it correctly, or error on
3440                    // an un-encodable value — replacing the old silent `0xBF00`
3441                    // NOP (the last of the silent-miscompile data-proc encoders).
3442                    let field = try_thumb_expand_imm(*imm as u32).ok_or_else(|| {
3443                        synth_core::Error::synthesis(
3444                            "CMN immediate is not a valid ThumbExpandImm — materialize into a register",
3445                        )
3446                    })?;
3447                    let i_bit = (field >> 11) & 1;
3448                    let imm3 = (field >> 8) & 0x7;
3449                    let imm8 = field & 0xFF;
3450                    let hw1: u16 = (0xF110 | (i_bit << 10) as u16) | rn_bits;
3451                    let hw2: u16 = (imm3 << 12) as u16 | 0x0F00 | imm8 as u16;
3452                    let mut bytes = hw1.to_le_bytes().to_vec();
3453                    bytes.extend_from_slice(&hw2.to_le_bytes());
3454                    Ok(bytes)
3455                } else if let Operand2::Reg(rm) = op2 {
3456                    let rm_bits = reg_to_bits(rm) as u16;
3457                    // 16-bit CMN (T1) only encodes R0-R7; high registers overflow
3458                    // the 3-bit fields and corrupt the operands (#184, the #180
3459                    // class). CMN has no high-register 16-bit form, so fall back
3460                    // to 32-bit CMN.W (T2): EB10 Rn | 0F00 Rm (ADD.W with S=1 and
3461                    // Rd discarded as PC/1111).
3462                    if rn_bits < 8 && rm_bits < 8 {
3463                        // CMN Rn, Rm (16-bit): 0100 0010 11 Rm Rn
3464                        let instr: u16 = 0x42C0 | (rm_bits << 3) | rn_bits;
3465                        Ok(instr.to_le_bytes().to_vec())
3466                    } else {
3467                        let hw1: u16 = 0xEB10 | rn_bits;
3468                        let hw2: u16 = 0x0F00 | rm_bits;
3469                        let mut bytes = hw1.to_le_bytes().to_vec();
3470                        bytes.extend_from_slice(&hw2.to_le_bytes());
3471                        Ok(bytes)
3472                    }
3473                } else {
3474                    Ok(vec![0xBF, 0x00])
3475                }
3476            }
3477
3478            // LDR (can be 16-bit for simple cases)
3479            ArmOp::Ldr { rd, addr } => {
3480                let rd_bits = reg_to_bits(rd);
3481                let base_bits = reg_to_bits(&addr.base);
3482
3483                // Handle register offset mode [base, Roff] or [base, Roff, #imm]
3484                if let Some(offset_reg) = &addr.offset_reg {
3485                    let rm_bits = reg_to_bits(offset_reg);
3486
3487                    // If there's also an immediate offset, we need to ADD it first
3488                    if addr.offset != 0 {
3489                        // Use R12 (IP) as scratch to avoid clobbering the address register
3490                        // ADD R12, Rm, #offset; LDR Rd, [base, R12]
3491                        let scratch = Reg::R12;
3492                        let mut bytes =
3493                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3494                        bytes.extend(self.encode_thumb32_ldr_reg(rd, &addr.base, &scratch)?);
3495                        return Ok(bytes);
3496                    }
3497
3498                    // Simple register offset: LDR Rd, [Rn, Rm]
3499                    // 16-bit: only if Rd, Rn, Rm < R8
3500                    if rd_bits < 8 && base_bits < 8 && rm_bits < 8 {
3501                        // LDR Rd, [Rn, Rm] (16-bit): 0101 100 Rm Rn Rd
3502                        let instr: u16 = 0x5800
3503                            | ((rm_bits as u16) << 6)
3504                            | ((base_bits as u16) << 3)
3505                            | (rd_bits as u16);
3506                        return Ok(instr.to_le_bytes().to_vec());
3507                    }
3508
3509                    // 32-bit register offset
3510                    return self.encode_thumb32_ldr_reg(rd, &addr.base, offset_reg);
3511                }
3512
3513                // Immediate offset mode [base, #imm]
3514                let offset = addr.offset as u32;
3515
3516                if rd_bits < 8 && base_bits < 8 && (offset & 0x3) == 0 && offset <= 124 {
3517                    // LDR Rd, [Rn, #imm5*4] (16-bit): 0110 1 imm5 Rn Rd
3518                    let imm5 = (offset >> 2) as u16;
3519                    let instr: u16 =
3520                        0x6800 | (imm5 << 6) | ((base_bits as u16) << 3) | (rd_bits as u16);
3521                    Ok(instr.to_le_bytes().to_vec())
3522                } else {
3523                    self.encode_thumb32_ldr(rd, &addr.base, offset)
3524                }
3525            }
3526
3527            // STR (can be 16-bit for simple cases)
3528            ArmOp::Str { rd, addr } => {
3529                let rd_bits = reg_to_bits(rd);
3530                let base_bits = reg_to_bits(&addr.base);
3531
3532                // Handle register offset mode [base, Roff] or [base, Roff, #imm]
3533                if let Some(offset_reg) = &addr.offset_reg {
3534                    let rm_bits = reg_to_bits(offset_reg);
3535
3536                    // If there's also an immediate offset, we need to ADD it first
3537                    if addr.offset != 0 {
3538                        // Use R12 (IP) as scratch to avoid clobbering the address register
3539                        // ADD R12, Rm, #offset; STR Rd, [base, R12]
3540                        let scratch = Reg::R12;
3541                        let mut bytes =
3542                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3543                        bytes.extend(self.encode_thumb32_str_reg(rd, &addr.base, &scratch)?);
3544                        return Ok(bytes);
3545                    }
3546
3547                    // Simple register offset: STR Rd, [Rn, Rm]
3548                    // 16-bit: only if Rd, Rn, Rm < R8
3549                    if rd_bits < 8 && base_bits < 8 && rm_bits < 8 {
3550                        // STR Rd, [Rn, Rm] (16-bit): 0101 000 Rm Rn Rd
3551                        let instr: u16 = 0x5000
3552                            | ((rm_bits as u16) << 6)
3553                            | ((base_bits as u16) << 3)
3554                            | (rd_bits as u16);
3555                        return Ok(instr.to_le_bytes().to_vec());
3556                    }
3557
3558                    // 32-bit register offset
3559                    return self.encode_thumb32_str_reg(rd, &addr.base, offset_reg);
3560                }
3561
3562                // Immediate offset mode [base, #imm]
3563                let offset = addr.offset as u32;
3564
3565                if rd_bits < 8 && base_bits < 8 && (offset & 0x3) == 0 && offset <= 124 {
3566                    // STR Rd, [Rn, #imm5*4] (16-bit): 0110 0 imm5 Rn Rd
3567                    let imm5 = (offset >> 2) as u16;
3568                    let instr: u16 =
3569                        0x6000 | (imm5 << 6) | ((base_bits as u16) << 3) | (rd_bits as u16);
3570                    Ok(instr.to_le_bytes().to_vec())
3571                } else {
3572                    self.encode_thumb32_str(rd, &addr.base, offset)
3573                }
3574            }
3575
3576            // LDRB (Thumb-2)
3577            ArmOp::Ldrb { rd, addr } => {
3578                let rd_bits = reg_to_bits(rd);
3579                let base_bits = reg_to_bits(&addr.base);
3580
3581                if let Some(offset_reg) = &addr.offset_reg {
3582                    if addr.offset != 0 {
3583                        let scratch = Reg::R12;
3584                        let mut bytes =
3585                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3586                        bytes.extend(self.encode_thumb32_ldrb_reg(rd, &addr.base, &scratch)?);
3587                        return Ok(bytes);
3588                    }
3589                    return self.encode_thumb32_ldrb_reg(rd, &addr.base, offset_reg);
3590                }
3591
3592                let offset = addr.offset as u32;
3593                if rd_bits < 8 && base_bits < 8 && offset <= 31 {
3594                    // LDRB Rd, [Rn, #imm5] (16-bit): 0111 1 imm5 Rn Rd
3595                    let instr: u16 = 0x7800
3596                        | ((offset as u16) << 6)
3597                        | ((base_bits as u16) << 3)
3598                        | (rd_bits as u16);
3599                    Ok(instr.to_le_bytes().to_vec())
3600                } else {
3601                    self.encode_thumb32_ldrb_imm(rd, &addr.base, offset)
3602                }
3603            }
3604
3605            // LDRSB (Thumb-2)
3606            ArmOp::Ldrsb { rd, addr } => {
3607                let rd_bits = reg_to_bits(rd);
3608                let base_bits = reg_to_bits(&addr.base);
3609
3610                if let Some(offset_reg) = &addr.offset_reg {
3611                    if addr.offset != 0 {
3612                        let scratch = Reg::R12;
3613                        let mut bytes =
3614                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3615                        bytes.extend(self.encode_thumb32_ldrsb_reg(rd, &addr.base, &scratch)?);
3616                        return Ok(bytes);
3617                    }
3618                    return self.encode_thumb32_ldrsb_reg(rd, &addr.base, offset_reg);
3619                }
3620
3621                let offset = addr.offset as u32;
3622                // LDRSB has no 16-bit immediate form (only register)
3623                // For 16-bit reg form: only if Rd, Rn, Rm < R8
3624                if rd_bits < 8 && base_bits < 8 && offset == 0 {
3625                    // No immediate 16-bit encoding for LDRSB; use 32-bit
3626                    self.encode_thumb32_ldrsb_imm(rd, &addr.base, offset)
3627                } else {
3628                    self.encode_thumb32_ldrsb_imm(rd, &addr.base, offset)
3629                }
3630            }
3631
3632            // LDRH (Thumb-2)
3633            ArmOp::Ldrh { rd, addr } => {
3634                let rd_bits = reg_to_bits(rd);
3635                let base_bits = reg_to_bits(&addr.base);
3636
3637                if let Some(offset_reg) = &addr.offset_reg {
3638                    if addr.offset != 0 {
3639                        let scratch = Reg::R12;
3640                        let mut bytes =
3641                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3642                        bytes.extend(self.encode_thumb32_ldrh_reg(rd, &addr.base, &scratch)?);
3643                        return Ok(bytes);
3644                    }
3645                    return self.encode_thumb32_ldrh_reg(rd, &addr.base, offset_reg);
3646                }
3647
3648                let offset = addr.offset as u32;
3649                if rd_bits < 8 && base_bits < 8 && (offset & 0x1) == 0 && offset <= 62 {
3650                    // LDRH Rd, [Rn, #imm5*2] (16-bit): 1000 1 imm5 Rn Rd
3651                    let imm5 = (offset >> 1) as u16;
3652                    let instr: u16 =
3653                        0x8800 | (imm5 << 6) | ((base_bits as u16) << 3) | (rd_bits as u16);
3654                    Ok(instr.to_le_bytes().to_vec())
3655                } else {
3656                    self.encode_thumb32_ldrh_imm(rd, &addr.base, offset)
3657                }
3658            }
3659
3660            // LDRSH (Thumb-2)
3661            ArmOp::Ldrsh { rd, addr } => {
3662                if let Some(offset_reg) = &addr.offset_reg {
3663                    if addr.offset != 0 {
3664                        let scratch = Reg::R12;
3665                        let mut bytes =
3666                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3667                        bytes.extend(self.encode_thumb32_ldrsh_reg(rd, &addr.base, &scratch)?);
3668                        return Ok(bytes);
3669                    }
3670                    return self.encode_thumb32_ldrsh_reg(rd, &addr.base, offset_reg);
3671                }
3672
3673                let offset = addr.offset as u32;
3674                self.encode_thumb32_ldrsh_imm(rd, &addr.base, offset)
3675            }
3676
3677            // STRB (Thumb-2)
3678            ArmOp::Strb { rd, addr } => {
3679                let rd_bits = reg_to_bits(rd);
3680                let base_bits = reg_to_bits(&addr.base);
3681
3682                if let Some(offset_reg) = &addr.offset_reg {
3683                    if addr.offset != 0 {
3684                        let scratch = Reg::R12;
3685                        let mut bytes =
3686                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3687                        bytes.extend(self.encode_thumb32_strb_reg(rd, &addr.base, &scratch)?);
3688                        return Ok(bytes);
3689                    }
3690                    return self.encode_thumb32_strb_reg(rd, &addr.base, offset_reg);
3691                }
3692
3693                let offset = addr.offset as u32;
3694                if rd_bits < 8 && base_bits < 8 && offset <= 31 {
3695                    // STRB Rd, [Rn, #imm5] (16-bit): 0111 0 imm5 Rn Rd
3696                    let instr: u16 = 0x7000
3697                        | ((offset as u16) << 6)
3698                        | ((base_bits as u16) << 3)
3699                        | (rd_bits as u16);
3700                    Ok(instr.to_le_bytes().to_vec())
3701                } else {
3702                    self.encode_thumb32_strb_imm(rd, &addr.base, offset)
3703                }
3704            }
3705
3706            // STRH (Thumb-2)
3707            ArmOp::Strh { rd, addr } => {
3708                let rd_bits = reg_to_bits(rd);
3709                let base_bits = reg_to_bits(&addr.base);
3710
3711                if let Some(offset_reg) = &addr.offset_reg {
3712                    if addr.offset != 0 {
3713                        let scratch = Reg::R12;
3714                        let mut bytes =
3715                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3716                        bytes.extend(self.encode_thumb32_strh_reg(rd, &addr.base, &scratch)?);
3717                        return Ok(bytes);
3718                    }
3719                    return self.encode_thumb32_strh_reg(rd, &addr.base, offset_reg);
3720                }
3721
3722                let offset = addr.offset as u32;
3723                if rd_bits < 8 && base_bits < 8 && (offset & 0x1) == 0 && offset <= 62 {
3724                    // STRH Rd, [Rn, #imm5*2] (16-bit): 1000 0 imm5 Rn Rd
3725                    let imm5 = (offset >> 1) as u16;
3726                    let instr: u16 =
3727                        0x8000 | (imm5 << 6) | ((base_bits as u16) << 3) | (rd_bits as u16);
3728                    Ok(instr.to_le_bytes().to_vec())
3729                } else {
3730                    self.encode_thumb32_strh_imm(rd, &addr.base, offset)
3731                }
3732            }
3733
3734            // MemorySize (Thumb-2)
3735            ArmOp::MemorySize { rd } => {
3736                // LSR rd, R10, #16 — memory size in bytes / 65536 = pages
3737                // Thumb-2 16-bit: LSRS Rd, Rm, #imm5 — 0000 1 imm5 Rm Rd
3738                let rd_bits = reg_to_bits(rd);
3739                let r10_bits = reg_to_bits(&Reg::R10);
3740                if rd_bits < 8 && r10_bits < 8 {
3741                    let instr: u16 =
3742                        0x0800 | (16u16 << 6) | ((r10_bits as u16) << 3) | (rd_bits as u16);
3743                    Ok(instr.to_le_bytes().to_vec())
3744                } else {
3745                    // Thumb-2 32-bit LSR: 1110 1010 010 0 1111 | 0 imm3 Rd imm2 01 Rm
3746                    let imm5: u32 = 16;
3747                    let imm3 = (imm5 >> 2) & 0x7;
3748                    let imm2 = imm5 & 0x3;
3749                    let hw1: u16 = 0xEA4F;
3750                    let hw2: u16 =
3751                        ((imm3 << 12) | (rd_bits << 8) | (imm2 << 6) | 0x10 | r10_bits) as u16;
3752                    let mut bytes = hw1.to_le_bytes().to_vec();
3753                    bytes.extend_from_slice(&hw2.to_le_bytes());
3754                    Ok(bytes)
3755                }
3756            }
3757
3758            // MemoryGrow (Thumb-2)
3759            ArmOp::MemoryGrow { rd, .. } => {
3760                // On embedded with fixed memory, always return -1 (failure)
3761                // MVN rd, #0 → MOV rd, #-1
3762                // Thumb-2 32-bit: MVN: 1111 0 i 0 0 0 1 1 0 1111 | 0 imm3 Rd imm8
3763                let rd_bits = reg_to_bits(rd);
3764                let hw1: u16 = 0xF06F; // MVN with i=0
3765                let hw2: u16 = (rd_bits << 8) as u16; // imm8=0 → ~0 = 0xFFFFFFFF = -1
3766                let mut bytes = hw1.to_le_bytes().to_vec();
3767                bytes.extend_from_slice(&hw2.to_le_bytes());
3768                Ok(bytes)
3769            }
3770
3771            // BX (16-bit)
3772            ArmOp::Bx { rm } => {
3773                let rm_bits = reg_to_bits(rm) as u16;
3774                // BX Rm (16-bit): 0100 0111 0 Rm 000
3775                let instr: u16 = 0x4700 | (rm_bits << 3);
3776                Ok(instr.to_le_bytes().to_vec())
3777            }
3778
3779            // BLX (16-bit) - Branch with Link and Exchange
3780            // BLX Rm: 0100 0111 1 Rm 000
3781            ArmOp::Blx { rm } => {
3782                let rm_bits = reg_to_bits(rm) as u16;
3783                let instr: u16 = 0x4780 | (rm_bits << 3);
3784                Ok(instr.to_le_bytes().to_vec())
3785            }
3786
3787            // CallIndirect - indirect function call via table lookup
3788            // table_index_reg contains the table index
3789            // Generates (#642): MOVW ip,#size [; MOVT]; CMP idx,ip; BLO +1;
3790            //                   UDF #0; LSL R12,idx,#2; LDR R12,[R11,R12]; BLX R12
3791            // #650, table_byte_offset != 0 (a non-zero table in the contiguous
3792            // R11 region): the pointer load becomes
3793            //                   ADD R12,R11,R12; LDR R12,[R12,#offset]
3794            // #664, null_check (the table has null slots, linked as ZERO
3795            // words): the loaded pointer is null-checked before the BLX —
3796            //                   CMP.W R12,#0; BNE +1; UDF #0
3797            // #676, type_check (heterogeneous table — runtime §4.4.8 type
3798            // check against the type-id sidecar at R11+off): after the
3799            // bounds guard —
3800            //                   LSL R12,idx,#2; ADD R12,R11,R12;
3801            //                   LDR R12,[R12,#type_off]; CMP.W R12,#id;
3802            //                   BEQ +1; UDF #0
3803            // (the dispatch tail then recomputes idx*4 — idx stays live).
3804            ArmOp::CallIndirect {
3805                rd: _,
3806                type_idx: _,
3807                table_index_reg,
3808                table_size,
3809                table_byte_offset,
3810                null_check,
3811                type_check,
3812            } => {
3813                let idx_reg = reg_to_bits(table_index_reg);
3814                let mut bytes = Vec::new();
3815
3816                // The expansion:
3817                // 1. Bounds guard (#642): trap (UDF #0, WASM Core §4.4.8) when
3818                //    index >= table size. Without it an out-of-bounds index
3819                //    reads past the table and BLXes whatever word lies there —
3820                //    an uncontrolled indirect branch instead of a trap.
3821                // 2. Multiplies index by 4 (function pointer size)
3822                // 3. Loads function pointer from table (table base in R11)
3823                // 4. Calls the function via BLX
3824                //
3825                // Table base setup must be done by caller/runtime. The type
3826                // check §4.4.8 also requires is discharged at COMPILE time:
3827                // the selector only emits this op after verifying the closed-
3828                // world property that every table entry's signature equals the
3829                // expected type (the raw code-pointer table carries no runtime
3830                // type ids to compare) — see the #642 selector guard.
3831
3832                // MOVW R12, #(size & 0xFFFF) — Thumb-2 T3:
3833                // 11110 i 100100 imm4 | 0 imm3 Rd imm8 (Rd=R12).
3834                let size_lo = *table_size & 0xFFFF;
3835                let hw1: u16 =
3836                    (0xF240 | (((size_lo >> 11) & 1) << 10) | ((size_lo >> 12) & 0xF)) as u16;
3837                let hw2: u16 =
3838                    ((((size_lo >> 8) & 0x7) << 12) | (12 << 8) | (size_lo & 0xFF)) as u16;
3839                bytes.extend_from_slice(&hw1.to_le_bytes());
3840                bytes.extend_from_slice(&hw2.to_le_bytes());
3841                // MOVT R12, #(size >> 16) — only when the table size exceeds
3842                // 16 bits (never in practice, but the guard must not compare
3843                // against a truncated size).
3844                let size_hi = *table_size >> 16;
3845                if size_hi != 0 {
3846                    let hw1: u16 =
3847                        (0xF2C0 | (((size_hi >> 11) & 1) << 10) | ((size_hi >> 12) & 0xF)) as u16;
3848                    let hw2: u16 =
3849                        ((((size_hi >> 8) & 0x7) << 12) | (12 << 8) | (size_hi & 0xFF)) as u16;
3850                    bytes.extend_from_slice(&hw1.to_le_bytes());
3851                    bytes.extend_from_slice(&hw2.to_le_bytes());
3852                }
3853                // CMP idx, R12 — 16-bit T2 (high-register capable):
3854                // 010001 01 N Rm(4) Rn(3), Rn full = N:Rn3.
3855                let cmp: u16 = (0x4500 | ((idx_reg & 8) << 4) | (12 << 3) | (idx_reg & 7)) as u16;
3856                bytes.extend_from_slice(&cmp.to_le_bytes());
3857                // BLO +1 insn (skip the UDF when index < size) — B<cond>.N
3858                // imm8=0: target = branch + 4. LO = unsigned lower.
3859                bytes.extend_from_slice(&0xD300u16.to_le_bytes());
3860                // UDF #0 — call_indirect out-of-bounds trap (same trap idiom as
3861                // the div-by-zero guards).
3862                bytes.extend_from_slice(&0xDE00u16.to_le_bytes());
3863
3864                // #676: runtime type check — ONLY for a heterogeneous table
3865                // (mixed signatures, closed-world verdict impossible). Load
3866                // the indexed slot's structural class id from the type-id
3867                // sidecar (`R11 + type_off + idx*4`; `type_off` = sidecar
3868                // base + this table's base offset, a compile-time constant)
3869                // and compare it against the expected type's class id — a
3870                // mismatch is the WASM Core §4.4.8 type trap. Null slots
3871                // carry the reserved id 0, so this compare subsumes the
3872                // #664 null trap (the selector passes `null_check: false`).
3873                // `None` emits NOTHING: every homogeneous table keeps the
3874                // pre-#676 bytes identical BY CONSTRUCTION. R12 stays the
3875                // only scratch (#212); the dispatch tail below recomputes
3876                // idx*4 — the index register is never clobbered here.
3877                if let Some((expected_id, type_off)) = type_check {
3878                    debug_assert!(*expected_id <= 255, "selector enforces the CMP imm8 range");
3879                    debug_assert!(*type_off <= 4095, "selector enforces the LDR imm12 range");
3880                    // MOV.W R12, idx, LSL #2 (same encoding as the dispatch
3881                    // tail's index scale below).
3882                    bytes.extend_from_slice(&0xEA4Fu16.to_le_bytes());
3883                    bytes.extend_from_slice(
3884                        &(((0x0C00 | (0b10 << 6)) | idx_reg) as u16).to_le_bytes(),
3885                    );
3886                    // ADD.W R12, R11, R12 (the #650 base-add form).
3887                    bytes.extend_from_slice(&0xEB0Bu16.to_le_bytes());
3888                    bytes.extend_from_slice(&0x0C0Cu16.to_le_bytes());
3889                    // LDR.W R12, [R12, #type_off] — T3 LDR (immediate):
3890                    // 1111 1000 1101 Rn=1100 | Rt=1100 imm12.
3891                    bytes.extend_from_slice(&0xF8DCu16.to_le_bytes());
3892                    bytes.extend_from_slice(
3893                        &(0xC000u16 | (*type_off as u16 & 0x0FFF)).to_le_bytes(),
3894                    );
3895                    // CMP.W R12, #expected_id — T2 CMP (immediate), imm8
3896                    // (same form as the #664 null check's CMP.W R12, #0).
3897                    bytes.extend_from_slice(&0xF1BCu16.to_le_bytes());
3898                    bytes.extend_from_slice(
3899                        &(0x0F00u16 | (*expected_id as u16 & 0xFF)).to_le_bytes(),
3900                    );
3901                    // BEQ +1 insn (skip the UDF when the class id matches) —
3902                    // B<cond>.N imm8=0: target = branch + 4. EQ.
3903                    bytes.extend_from_slice(&0xD000u16.to_le_bytes());
3904                    // UDF #0 — the §4.4.8 type-mismatch trap (same idiom as
3905                    // the bounds guard above).
3906                    bytes.extend_from_slice(&0xDE00u16.to_le_bytes());
3907                }
3908
3909                // LSL R12, idx_reg, #2 (multiply index by 4)
3910                // Thumb-2 MOV with shift: 11101010 010 S 1111 | 0 imm3 Rd imm2 type Rm
3911                // LSL: type=00 (bits 5:4), imm5=2 -> imm3=000, imm2=10 (bits 7:6)
3912                // #597: the shift amount was previously shifted into bits 5:4 —
3913                // the TYPE field — encoding `mov.w ip, rm, ASR #32`, which
3914                // destroyed the index and dispatched table entry 0 for every
3915                // call. imm2 lives at bits 7:6.
3916                let hw1: u16 = 0xEA4F_u16; // MOV.W R12, Rm, LSL #2
3917                let hw2: u16 = ((0x0C00 | (0b10 << 6)) | idx_reg) as u16;
3918                bytes.extend_from_slice(&hw1.to_le_bytes());
3919                bytes.extend_from_slice(&hw2.to_le_bytes());
3920
3921                if *table_byte_offset == 0 {
3922                    // Table 0 (base = R11 itself): the pre-#650 single-load
3923                    // form — a single-table module's bytes stay identical BY
3924                    // CONSTRUCTION.
3925                    // LDR R12, [R11, R12] - load function pointer
3926                    // Thumb-2 LDR (register): 1111 1000 0101 Rn | Rt 0000 00 imm2 Rm
3927                    // Rn=R11, Rt=R12, Rm=R12, imm2=00 (no shift)
3928                    let ldr_hw1: u16 = 0xF85B; // LDR.W Rt, [R11, Rm]
3929                    let ldr_hw2: u16 = 0xC00C; // Rt=R12, imm2=00, Rm=R12
3930                    bytes.extend_from_slice(&ldr_hw1.to_le_bytes());
3931                    bytes.extend_from_slice(&ldr_hw2.to_le_bytes());
3932                } else {
3933                    // #650: table N of the contiguous R11 region — fold the
3934                    // compile-time base offset into the pointer load via the
3935                    // LDR imm12 form (R12 stays the only scratch, per the
3936                    // #212 convention).
3937                    assert!(
3938                        *table_byte_offset <= 4095,
3939                        "call_indirect table base offset {table_byte_offset} exceeds \
3940                         LDR imm12 — the selector must have declined this (#650)"
3941                    );
3942                    // ADD.W R12, R11, R12 — T3 ADD (register):
3943                    // 11101011000 S=0 Rn=1011 | 0 imm3=000 Rd=1100 imm2=00 type=00 Rm=1100
3944                    bytes.extend_from_slice(&0xEB0Bu16.to_le_bytes());
3945                    bytes.extend_from_slice(&0x0C0Cu16.to_le_bytes());
3946                    // LDR.W R12, [R12, #offset] — T3 LDR (immediate):
3947                    // 1111 1000 1101 Rn=1100 | Rt=1100 imm12
3948                    bytes.extend_from_slice(&0xF8DCu16.to_le_bytes());
3949                    bytes.extend_from_slice(
3950                        &((0xC000u16) | (*table_byte_offset as u16 & 0x0FFF)).to_le_bytes(),
3951                    );
3952                }
3953
3954                // #664: null-slot trap — ONLY when the table image carries
3955                // null (uninitialized) slots, which the layout contract
3956                // requires to be linked as ZERO words. A fully-initialized
3957                // table skips this branch entirely, keeping the pre-#664
3958                // expansion byte-identical BY CONSTRUCTION (the #650
3959                // offset-0 trick).
3960                if *null_check {
3961                    // CMP.W R12, #0 — T2 CMP (immediate): 11110 i 0 1101 1
3962                    // Rn(4) | 0 imm3 1111 imm8, Rn=R12, imm=0.
3963                    bytes.extend_from_slice(&0xF1BCu16.to_le_bytes());
3964                    bytes.extend_from_slice(&0x0F00u16.to_le_bytes());
3965                    // BNE +1 insn (skip the UDF when the pointer is non-null)
3966                    // — B<cond>.N imm8=0: target = branch + 4. NE.
3967                    bytes.extend_from_slice(&0xD100u16.to_le_bytes());
3968                    // UDF #0 — call_indirect null-funcref trap (WASM Core
3969                    // §4.4.8: calling an uninitialized element traps; same
3970                    // trap idiom as the bounds guard above).
3971                    bytes.extend_from_slice(&0xDE00u16.to_le_bytes());
3972                }
3973
3974                // BLX R12 (call function indirectly)
3975                // BLX Rm (16-bit): 0100 0111 1 Rm 000
3976                let blx: u16 = 0x47E0; // BLX R12
3977                bytes.extend_from_slice(&blx.to_le_bytes());
3978
3979                Ok(bytes)
3980            }
3981
3982            // Label pseudo-instruction: emits no machine code
3983            ArmOp::Label { .. } => Ok(Vec::new()),
3984
3985            // Conditional branch to label (generic) - offset 0, will be patched
3986            ArmOp::Bcc { cond, label: _ } => {
3987                use synth_synthesis::Condition;
3988                let cond_bits: u16 = match cond {
3989                    Condition::EQ => 0x0,
3990                    Condition::NE => 0x1,
3991                    Condition::HS => 0x2,
3992                    Condition::LO => 0x3,
3993                    Condition::HI => 0x8,
3994                    Condition::LS => 0x9,
3995                    Condition::GE => 0xA,
3996                    Condition::LT => 0xB,
3997                    Condition::GT => 0xC,
3998                    Condition::LE => 0xD,
3999                };
4000                // 16-bit B<cond> with offset 0: 1101 cond imm8
4001                let instr: u16 = 0xD000 | (cond_bits << 8);
4002                Ok(instr.to_le_bytes().to_vec())
4003            }
4004
4005            // Branch instructions
4006            ArmOp::B { label: _ } => {
4007                // Simplified: B.N with offset 0
4008                // For real usage, would need label resolution
4009                let instr: u16 = 0xE000; // B.N #0
4010                Ok(instr.to_le_bytes().to_vec())
4011            }
4012
4013            // BHS (Branch if Higher or Same) - used for bounds checking
4014            // Condition code: 0x2 (C set)
4015            ArmOp::Bhs { label: _ } => {
4016                // 16-bit B<cond> with offset 0: 1101 cond imm8
4017                // cond = 0x2 (HS)
4018                let instr: u16 = 0xD200; // BHS.N #0
4019                Ok(instr.to_le_bytes().to_vec())
4020            }
4021
4022            // BLO (Branch if Lower) - complementary to BHS
4023            // Condition code: 0x3 (C clear)
4024            ArmOp::Blo { label: _ } => {
4025                // 16-bit B<cond> with offset 0: 1101 cond imm8
4026                // cond = 0x3 (LO)
4027                let instr: u16 = 0xD300; // BLO.N #0
4028                Ok(instr.to_le_bytes().to_vec())
4029            }
4030
4031            // Branch with numeric offset (Thumb-2)
4032            // Thumb-2 B.W instruction: 32-bit with +-16MB range
4033            ArmOp::BOffset { offset } => {
4034                // offset is already the halfword displacement: (target - branch - 4) / 2
4035                // This is the raw encoded value, accounting for variable-length instructions
4036                let halfword_offset = *offset;
4037
4038                // 16-bit B.N encoding: 1110 0 imm11 (11-bit signed halfword offset)
4039                // Range: -1024 to +1022 halfwords
4040                if (-1024..=1022).contains(&halfword_offset) {
4041                    // 16-bit B.N encoding: 1110 0 imm11
4042                    let imm11 = (halfword_offset as u16) & 0x7FF;
4043                    let instr: u16 = 0xE000 | imm11;
4044                    Ok(instr.to_le_bytes().to_vec())
4045                } else {
4046                    // 32-bit B.W encoding for larger offsets
4047                    // First halfword: 1111 0 S imm10
4048                    // Second halfword: 10 J1 0 J2 imm11
4049                    // Total offset = SignExtend(S:I1:I2:imm10:imm11:0)
4050                    // where I1 = NOT(J1 XOR S), I2 = NOT(J2 XOR S)
4051
4052                    // The B.W (T4) encoding packs the signed offset as:
4053                    //   S:I1:I2:imm10:imm11:0  (25-bit signed, halfword-aligned)
4054                    // where J1 = NOT(I1 XOR S), J2 = NOT(I2 XOR S)
4055                    // Input halfword_offset already equals (target - PC - 4) / 2,
4056                    // so the full byte offset = halfword_offset << 1.
4057                    // The encoding fields split that 25-bit signed value (including the
4058                    // implicit trailing zero) as: S | imm10 | imm11
4059                    // with I1 = bit 23 and I2 = bit 22 of the signed offset.
4060                    let signed_offset = halfword_offset << 1; // byte offset
4061                    let s = if signed_offset < 0 { 1u32 } else { 0u32 };
4062                    let uoffset = signed_offset as u32;
4063                    let imm10 = (uoffset >> 12) & 0x3FF; // bits [21:12]
4064                    let imm11 = (uoffset >> 1) & 0x7FF; // bits [11:1]
4065                    let i1 = (uoffset >> 23) & 1; // bit 23
4066                    let i2 = (uoffset >> 22) & 1; // bit 22
4067                    let j1 = (!(i1 ^ s)) & 1; // J1 = NOT(I1 XOR S)
4068                    let j2 = (!(i2 ^ s)) & 1; // J2 = NOT(I2 XOR S)
4069
4070                    let hw1: u16 = (0xF000 | (s << 10) | imm10) as u16;
4071                    let hw2: u16 = (0x9000 | (j1 << 13) | (j2 << 11) | imm11) as u16;
4072
4073                    let mut bytes = hw1.to_le_bytes().to_vec();
4074                    bytes.extend_from_slice(&hw2.to_le_bytes());
4075                    Ok(bytes)
4076                }
4077            }
4078
4079            // Conditional branch with numeric offset (Thumb-2)
4080            ArmOp::BCondOffset { cond, offset } => {
4081                use synth_synthesis::Condition;
4082                let cond_bits: u16 = match cond {
4083                    Condition::EQ => 0x0,
4084                    Condition::NE => 0x1,
4085                    Condition::HS => 0x2,
4086                    Condition::LO => 0x3,
4087                    Condition::HI => 0x8,
4088                    Condition::LS => 0x9,
4089                    Condition::GE => 0xA,
4090                    Condition::LT => 0xB,
4091                    Condition::GT => 0xC,
4092                    Condition::LE => 0xD,
4093                };
4094
4095                // offset is already the halfword displacement: (target - branch - 4) / 2
4096                // This is the raw imm8 value for 16-bit B<cond> encoding
4097                let halfword_offset = *offset;
4098
4099                // 16-bit B<cond> encoding: 1101 cond imm8
4100                // Range: -256 to +254 halfwords (imm8 is sign-extended and shifted left 1)
4101                if (-128..=127).contains(&halfword_offset) {
4102                    let imm8 = (halfword_offset as u16) & 0xFF;
4103                    let instr: u16 = 0xD000 | (cond_bits << 8) | imm8;
4104                    Ok(instr.to_le_bytes().to_vec())
4105                } else {
4106                    // 32-bit B<cond>.W (encoding T3) for larger offsets
4107                    // First halfword: 1111 0 S cond(4) imm6
4108                    // Second halfword: 10 J1 0 J2 imm11
4109                    //
4110                    // Per ARMv7-M, the branch BYTE offset is
4111                    // SignExtend(S:J2:J1:imm6:imm11:'0'), i.e. the field value
4112                    // S:J2:J1:imm6:imm11 IS the signed 20-bit HALFWORD offset —
4113                    // imm11/imm6/J1/J2/S take `halfword_offset` bits [10:0],
4114                    // [16:11], 17, 18 and 19 directly (mirroring the T4
4115                    // unconditional arm above).
4116                    //
4117                    // #740: this arm previously packed `halfword_offset >> 1`
4118                    // into imm6:imm11 — HALVING the displacement — so every
4119                    // wide conditional branch (span > 254 bytes) landed at half
4120                    // its intended offset: gust_poll's loop-head `br_if` to an
4121                    // outer block end jumped mid-shape. Narrow (16-bit) B<cond>
4122                    // encodings were unaffected, which is why short-range CF
4123                    // fixtures never caught it.
4124                    if !(-(1 << 19)..(1 << 19)).contains(&halfword_offset) {
4125                        return Err(synth_core::Error::synthesis(format!(
4126                            "B<cond>.W (T3) halfword offset {halfword_offset} exceeds \
4127                             the signed 20-bit encoding range (±1 MB) — refusing to \
4128                             emit a truncated branch"
4129                        )));
4130                    }
4131                    let u = halfword_offset as u32;
4132                    let imm11 = u & 0x7FF; // halfword offset bits [10:0]
4133                    let imm6 = (u >> 11) & 0x3F; // bits [16:11]
4134                    let j1 = (u >> 17) & 1; // bit 17
4135                    let j2 = (u >> 18) & 1; // bit 18
4136                    let s = (u >> 19) & 1; // sign (range-checked above)
4137
4138                    let hw1: u16 = (0xF000 | (s << 10) | ((cond_bits as u32) << 6) | imm6) as u16;
4139                    let hw2: u16 = (0x8000 | (j1 << 13) | (j2 << 11) | imm11) as u16;
4140
4141                    let mut bytes = hw1.to_le_bytes().to_vec();
4142                    bytes.extend_from_slice(&hw2.to_le_bytes());
4143                    Ok(bytes)
4144                }
4145            }
4146
4147            ArmOp::Bl { label: _ } => {
4148                // BL is always 32-bit in Thumb-2, encoded here as a relocatable
4149                // placeholder; an R_ARM_THM_CALL relocation patches the target
4150                // (see arm_backend.rs). The placeholder must carry an embedded
4151                // addend of -4 so the relocation nets to exactly the symbol S.
4152                //
4153                // Thumb BL computes `target = (P + 4) + signed_offset`. Under
4154                // R_ARM_THM_CALL the linker resolves using the in-place addend;
4155                // a 0xF800 placeholder (addend 0) lands at S+4 — every call one
4156                // instruction past the callee entry (#174). The correct
4157                // placeholder is what `gas` emits for `bl <extern>`:
4158                //   f7ff fffe  ->  `bl <self>`  (S=1, J1=J2=1, imm = -4 addend),
4159                // i.e. hw1=0xF7FF, hw2=0xFFFE. This nets to S, not S+4.
4160                // (The earlier 0xD000 was worse still — a ~+0x600000 addend,
4161                // the garbage `bl c0000c` and "truncated to fit" of #167.)
4162                let hw1: u16 = 0xF7FF;
4163                let hw2: u16 = 0xFFFE;
4164                let mut bytes = hw1.to_le_bytes().to_vec();
4165                bytes.extend_from_slice(&hw2.to_le_bytes());
4166                Ok(bytes)
4167            }
4168
4169            // MVN
4170            ArmOp::Mvn { rd, op2 } => {
4171                if let Operand2::Reg(rm) = op2 {
4172                    let rd_bits = reg_to_bits(rd) as u16;
4173                    let rm_bits = reg_to_bits(rm) as u16;
4174
4175                    if rd_bits < 8 && rm_bits < 8 {
4176                        // MVNS Rd, Rm (16-bit): 0100 0011 11 Rm Rd
4177                        let instr: u16 = 0x43C0 | (rm_bits << 3) | rd_bits;
4178                        Ok(instr.to_le_bytes().to_vec())
4179                    } else {
4180                        // 32-bit MVN
4181                        let hw1: u16 = 0xEA6F_u16;
4182                        let hw2: u16 = ((reg_to_bits(rd) << 8) | reg_to_bits(rm)) as u16;
4183                        let mut bytes = hw1.to_le_bytes().to_vec();
4184                        bytes.extend_from_slice(&hw2.to_le_bytes());
4185                        Ok(bytes)
4186                    }
4187                } else {
4188                    let instr: u16 = 0xBF00;
4189                    Ok(instr.to_le_bytes().to_vec())
4190                }
4191            }
4192
4193            // MOVW - Move Wide (Thumb-2 32-bit)
4194            ArmOp::Movw { rd, imm16 } => {
4195                self.encode_thumb32_movw_raw(reg_to_bits(rd), *imm16 as u32)
4196            }
4197
4198            // MOVT - Move Top (Thumb-2 32-bit)
4199            ArmOp::Movt { rd, imm16 } => {
4200                self.encode_thumb32_movt_raw(reg_to_bits(rd), *imm16 as u32)
4201            }
4202
4203            // #237: symbol-relative MOVW/MOVT. Encode the addend's low/high 16
4204            // bits in place; the backend records an R_ARM_MOVW_ABS_NC /
4205            // R_ARM_MOVT_ABS relocation against `symbol`, so the linker adds the
4206            // symbol's final address to the in-place addend (REL semantics).
4207            ArmOp::MovwSym { rd, addend, .. } => {
4208                self.encode_thumb32_movw_raw(reg_to_bits(rd), (*addend as u32) & 0xffff)
4209            }
4210            ArmOp::MovtSym { rd, addend, .. } => {
4211                self.encode_thumb32_movt_raw(reg_to_bits(rd), ((*addend as u32) >> 16) & 0xffff)
4212            }
4213
4214            // #345: literal-pool address load — emit a PLACEHOLDER `LDR.W rd,
4215            // [pc, #0]` (U=1, imm12=0). The backend (arm_backend.rs) places the
4216            // 4-byte pool word at the end of the function, records the R_ARM_ABS32
4217            // relocation against `symbol+addend`, and patches the imm12 with the
4218            // real PC-relative distance once the pool offset is known.
4219            // Encoding T2: 1111 1000 1101 1111 | Rt(4) imm12(12), with the literal
4220            // base = Align(PC,4) and PC = address of this instruction + 4.
4221            ArmOp::LdrSym { rd, .. } => {
4222                let rt = reg_to_bits(rd) as u16;
4223                let hw1: u16 = 0xF8DF; // LDR.W (literal), U=1
4224                let hw2: u16 = rt << 12; // imm12 = 0 placeholder
4225                let mut bytes = Vec::with_capacity(4);
4226                bytes.extend_from_slice(&hw1.to_le_bytes());
4227                bytes.extend_from_slice(&hw2.to_le_bytes());
4228                Ok(bytes)
4229            }
4230
4231            // SetCond: Materialize condition flag into register (0 or 1)
4232            // Strategy: ITE <cond>; MOV Rd, #1; MOV Rd, #0
4233            // IMPORTANT: Must use ITE (If-Then-Else) because 16-bit Thumb MOV
4234            // always sets flags (MOVS). We need to evaluate the condition BEFORE
4235            // any MOV instruction clobbers the flags from CMP.
4236            ArmOp::SetCond { rd, cond } => {
4237                let rd_bits = reg_to_bits(rd) as u16;
4238
4239                // Condition code encoding for IT block
4240                use synth_synthesis::Condition;
4241                let cond_bits: u16 = match cond {
4242                    Condition::EQ => 0x0,
4243                    Condition::NE => 0x1,
4244                    Condition::LT => 0xB,
4245                    Condition::LE => 0xD,
4246                    Condition::GT => 0xC,
4247                    Condition::GE => 0xA,
4248                    Condition::LO => 0x3, // CC/LO (unsigned <)
4249                    Condition::LS => 0x9, // LS (unsigned <=)
4250                    Condition::HI => 0x8, // HI (unsigned >)
4251                    Condition::HS => 0x2, // CS/HS (unsigned >=)
4252                };
4253
4254                // ITE <cond>: encodes If-Then-Else block
4255                // The mask field depends on firstcond[0]:
4256                // - If firstcond[0] = 0: mask = 0xC for TE pattern (ITE EQ = BF0C)
4257                // - If firstcond[0] = 1: mask = 0x4 for TE pattern (ITE NE = BF14)
4258                let mask = if (cond_bits & 1) == 0 { 0xC } else { 0x4 };
4259                let ite_instr: u16 = 0xBF00 | (cond_bits << 4) | mask;
4260
4261                // Materialize 0/1 into Rd. The 16-bit MOVS (T1) encodes Rd in a
4262                // 3-bit field (bits[10:8]) — only R0–R7. For a high register
4263                // (R8–R12) `rd_bits << 8` overflows into bit 11 and silently
4264                // turns MOVS into CMP (00100 → 00101), corrupting the result
4265                // (this mis-materialized gale's `has_waiter`, so its `local.set`
4266                // stored a stale register → the binary-sem WAKE dispatch read
4267                // garbage). Use the 32-bit MOV.W (T2) for high registers, which
4268                // has a 4-bit Rd field. MOV.W with S=0 doesn't set flags, which
4269                // is fine inside the ITE (the materialized value is the result;
4270                // the flags are not consumed afterwards).
4271                let mut bytes = ite_instr.to_le_bytes().to_vec();
4272                let push_mov = |bytes: &mut Vec<u8>, imm: u16| {
4273                    if rd_bits <= 7 {
4274                        let m: u16 = 0x2000 | (rd_bits << 8) | imm; // 16-bit MOVS Rd,#imm
4275                        bytes.extend_from_slice(&m.to_le_bytes());
4276                    } else {
4277                        // 32-bit MOV.W Rd, #imm (T2): F04F | (Rd<<8) | imm8
4278                        let hw1: u16 = 0xF04F;
4279                        let hw2: u16 = (rd_bits << 8) | imm;
4280                        bytes.extend_from_slice(&hw1.to_le_bytes());
4281                        bytes.extend_from_slice(&hw2.to_le_bytes());
4282                    }
4283                };
4284                push_mov(&mut bytes, 1); // Then branch (condition true)  → 1
4285                push_mov(&mut bytes, 0); // Else branch (condition false) → 0
4286                Ok(bytes)
4287            }
4288
4289            // I64SetCond: Compare two i64 register pairs, result 0/1 in rd
4290            // EQ/NE: CMP lo,lo; IT EQ; CMPEQ hi,hi; ITE <cond>; MOV 1; MOV 0
4291            // LT: CMP lo,lo; SBCS rd,hi,hi; ITE LT; MOV 1; MOV 0
4292            // GT: CMP lo,lo (swapped); SBCS rd,hi,hi (swapped); ITE LT; MOV 1; MOV 0
4293            ArmOp::I64SetCond {
4294                rd,
4295                rn_lo,
4296                rn_hi,
4297                rm_lo,
4298                rm_hi,
4299                cond,
4300            } => {
4301                use synth_synthesis::Condition;
4302                let rd_bits = reg_to_bits(rd) as u16;
4303                let mut bytes = Vec::new();
4304
4305                // Helper: encode CMP Rn, Rm (16-bit)
4306                let encode_cmp_reg = |rn: &synth_synthesis::Reg,
4307                                      rm: &synth_synthesis::Reg|
4308                 -> Vec<u8> {
4309                    let rn_bits = reg_to_bits(rn) as u16;
4310                    let rm_bits = reg_to_bits(rm) as u16;
4311                    if rn_bits < 8 && rm_bits < 8 {
4312                        let instr: u16 = 0x4280 | (rm_bits << 3) | rn_bits;
4313                        instr.to_le_bytes().to_vec()
4314                    } else {
4315                        let n_bit = (rn_bits >> 3) & 1;
4316                        let instr: u16 = 0x4500 | (n_bit << 7) | (rm_bits << 3) | (rn_bits & 0x7);
4317                        instr.to_le_bytes().to_vec()
4318                    }
4319                };
4320
4321                // Helper: encode ITE <cond> (2 bytes)
4322                let encode_ite = |cond_bits: u16| -> Vec<u8> {
4323                    let mask = if (cond_bits & 1) == 0 { 0xC } else { 0x4 };
4324                    let ite_instr: u16 = 0xBF00 | (cond_bits << 4) | mask;
4325                    ite_instr.to_le_bytes().to_vec()
4326                };
4327
4328                // Helper: encode SetCond (ITE + MOV #1 + MOV #0) for given condition
4329                let encode_setcond = |cond_bits: u16, rd_bits: u16| -> Vec<u8> {
4330                    let mut b = encode_ite(cond_bits);
4331                    if rd_bits < 8 {
4332                        let mov_one: u16 = 0x2001 | (rd_bits << 8);
4333                        let mov_zero: u16 = 0x2000 | (rd_bits << 8);
4334                        b.extend_from_slice(&mov_one.to_le_bytes());
4335                        b.extend_from_slice(&mov_zero.to_le_bytes());
4336                    } else {
4337                        // #311: rd >= R8 — the 16-bit MOV imm8 form has a 3-bit
4338                        // rd field; rd_bits<<8 overflows into bit 11 and
4339                        // TRANSMUTES the MOV into CMP (0x2001|0x0800 = 0x2801 =
4340                        // CMP r0,#1): the boolean dies in the flags and the
4341                        // consumer reads a stale register. Use the 32-bit
4342                        // MOV.W (T2: F04F 0000|rd<<8|imm8) — IT-legal,
4343                        // flag-preserving. Same class as H-CODE-9 / #180.
4344                        for imm in [1u16, 0u16] {
4345                            let hw1: u16 = 0xF04F;
4346                            let hw2: u16 = (rd_bits << 8) | imm;
4347                            b.extend_from_slice(&hw1.to_le_bytes());
4348                            b.extend_from_slice(&hw2.to_le_bytes());
4349                        }
4350                    }
4351                    b
4352                };
4353
4354                match cond {
4355                    Condition::EQ | Condition::NE => {
4356                        // CMP rn_lo, rm_lo (compare low words)
4357                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4358
4359                        // IT EQ (execute next instruction only if Z=1)
4360                        let it_eq: u16 = 0xBF08; // IT EQ: cond=0000, mask=1000
4361                        bytes.extend_from_slice(&it_eq.to_le_bytes());
4362
4363                        // CMPEQ rn_hi, rm_hi (compare high words, only if low equal)
4364                        bytes.extend_from_slice(&encode_cmp_reg(rn_hi, rm_hi));
4365
4366                        // ITE <cond>; MOV rd, #1; MOV rd, #0
4367                        let cond_bits: u16 = match cond {
4368                            Condition::EQ => 0x0,
4369                            Condition::NE => 0x1,
4370                            _ => unreachable!(),
4371                        };
4372                        bytes.extend_from_slice(&encode_setcond(cond_bits, rd_bits));
4373                    }
4374
4375                    Condition::LT => {
4376                        // CMP rn_lo, rm_lo (sets C flag for borrow)
4377                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4378
4379                        // SBCS rd, rn_hi, rm_hi (subtract with carry, sets N,V flags)
4380                        // SBCS.W Rd, Rn, Rm: EB70 Rn | 0000 Rd 0000 Rm
4381                        let rn_hi_bits = reg_to_bits(rn_hi);
4382                        let rm_hi_bits = reg_to_bits(rm_hi);
4383                        let hw1: u16 = (0xEB70 | rn_hi_bits) as u16;
4384                        let hw2: u16 = ((rd_bits as u32) << 8 | rm_hi_bits) as u16;
4385                        bytes.extend_from_slice(&hw1.to_le_bytes());
4386                        bytes.extend_from_slice(&hw2.to_le_bytes());
4387
4388                        // ITE LT; MOV rd, #1; MOV rd, #0
4389                        bytes.extend_from_slice(&encode_setcond(0xB, rd_bits)); // LT = 0xB
4390                    }
4391
4392                    Condition::GT => {
4393                        // GT(a,b) = LT(b,a): swap operands
4394                        // CMP rm_lo, rn_lo (swapped)
4395                        bytes.extend_from_slice(&encode_cmp_reg(rm_lo, rn_lo));
4396
4397                        // SBCS rd, rm_hi, rn_hi (swapped)
4398                        let rm_hi_bits = reg_to_bits(rm_hi);
4399                        let rn_hi_bits = reg_to_bits(rn_hi);
4400                        let hw1: u16 = (0xEB70 | rm_hi_bits) as u16;
4401                        let hw2: u16 = ((rd_bits as u32) << 8 | rn_hi_bits) as u16;
4402                        bytes.extend_from_slice(&hw1.to_le_bytes());
4403                        bytes.extend_from_slice(&hw2.to_le_bytes());
4404
4405                        // ITE LT; MOV rd, #1; MOV rd, #0
4406                        bytes.extend_from_slice(&encode_setcond(0xB, rd_bits)); // LT = 0xB
4407                    }
4408
4409                    Condition::LE => {
4410                        // LE(a,b) = !GT(a,b): use GT logic but invert result
4411                        // GT(a,b) = LT(b,a): so we do CMP(b,a) and check LT, then invert
4412                        // CMP rm_lo, rn_lo (swapped, same as GT)
4413                        bytes.extend_from_slice(&encode_cmp_reg(rm_lo, rn_lo));
4414
4415                        // SBCS rd, rm_hi, rn_hi (swapped)
4416                        let rm_hi_bits = reg_to_bits(rm_hi);
4417                        let rn_hi_bits = reg_to_bits(rn_hi);
4418                        let hw1: u16 = (0xEB70 | rm_hi_bits) as u16;
4419                        let hw2: u16 = ((rd_bits as u32) << 8 | rn_hi_bits) as u16;
4420                        bytes.extend_from_slice(&hw1.to_le_bytes());
4421                        bytes.extend_from_slice(&hw2.to_le_bytes());
4422
4423                        // ITE GE; MOV rd, #1; MOV rd, #0 (GE is !LT, so inverting GT result)
4424                        bytes.extend_from_slice(&encode_setcond(0xA, rd_bits)); // GE = 0xA
4425                    }
4426
4427                    Condition::GE => {
4428                        // GE(a,b) = !LT(a,b): use LT logic but invert result
4429                        // CMP rn_lo, rm_lo (same as LT)
4430                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4431
4432                        // SBCS rd, rn_hi, rm_hi (same as LT)
4433                        let rn_hi_bits = reg_to_bits(rn_hi);
4434                        let rm_hi_bits = reg_to_bits(rm_hi);
4435                        let hw1: u16 = (0xEB70 | rn_hi_bits) as u16;
4436                        let hw2: u16 = ((rd_bits as u32) << 8 | rm_hi_bits) as u16;
4437                        bytes.extend_from_slice(&hw1.to_le_bytes());
4438                        bytes.extend_from_slice(&hw2.to_le_bytes());
4439
4440                        // ITE GE; MOV rd, #1; MOV rd, #0 (GE is !LT)
4441                        bytes.extend_from_slice(&encode_setcond(0xA, rd_bits)); // GE = 0xA
4442                    }
4443
4444                    // Unsigned comparisons - same instruction sequence, different conditions
4445                    Condition::LO => {
4446                        // LO (unsigned LT): CMP lo, SBCS hi, check C=0
4447                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4448                        let rn_hi_bits = reg_to_bits(rn_hi);
4449                        let rm_hi_bits = reg_to_bits(rm_hi);
4450                        let hw1: u16 = (0xEB70 | rn_hi_bits) as u16;
4451                        let hw2: u16 = ((rd_bits as u32) << 8 | rm_hi_bits) as u16;
4452                        bytes.extend_from_slice(&hw1.to_le_bytes());
4453                        bytes.extend_from_slice(&hw2.to_le_bytes());
4454                        bytes.extend_from_slice(&encode_setcond(0x3, rd_bits)); // LO = 0x3 (CC)
4455                    }
4456
4457                    Condition::HI => {
4458                        // HI (unsigned GT): swap operands and check LO
4459                        bytes.extend_from_slice(&encode_cmp_reg(rm_lo, rn_lo));
4460                        let rm_hi_bits = reg_to_bits(rm_hi);
4461                        let rn_hi_bits = reg_to_bits(rn_hi);
4462                        let hw1: u16 = (0xEB70 | rm_hi_bits) as u16;
4463                        let hw2: u16 = ((rd_bits as u32) << 8 | rn_hi_bits) as u16;
4464                        bytes.extend_from_slice(&hw1.to_le_bytes());
4465                        bytes.extend_from_slice(&hw2.to_le_bytes());
4466                        bytes.extend_from_slice(&encode_setcond(0x3, rd_bits)); // LO = 0x3 (CC)
4467                    }
4468
4469                    Condition::LS => {
4470                        // LS (unsigned LE): !(a > b) = !(HI), so do HI and invert
4471                        bytes.extend_from_slice(&encode_cmp_reg(rm_lo, rn_lo));
4472                        let rm_hi_bits = reg_to_bits(rm_hi);
4473                        let rn_hi_bits = reg_to_bits(rn_hi);
4474                        let hw1: u16 = (0xEB70 | rm_hi_bits) as u16;
4475                        let hw2: u16 = ((rd_bits as u32) << 8 | rn_hi_bits) as u16;
4476                        bytes.extend_from_slice(&hw1.to_le_bytes());
4477                        bytes.extend_from_slice(&hw2.to_le_bytes());
4478                        bytes.extend_from_slice(&encode_setcond(0x2, rd_bits)); // HS = 0x2 (CS) = !LO
4479                    }
4480
4481                    Condition::HS => {
4482                        // HS (unsigned GE): !(a < b) = !(LO)
4483                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4484                        let rn_hi_bits = reg_to_bits(rn_hi);
4485                        let rm_hi_bits = reg_to_bits(rm_hi);
4486                        let hw1: u16 = (0xEB70 | rn_hi_bits) as u16;
4487                        let hw2: u16 = ((rd_bits as u32) << 8 | rm_hi_bits) as u16;
4488                        bytes.extend_from_slice(&hw1.to_le_bytes());
4489                        bytes.extend_from_slice(&hw2.to_le_bytes());
4490                        bytes.extend_from_slice(&encode_setcond(0x2, rd_bits)); // HS = 0x2 (CS) = !LO
4491                    }
4492                }
4493
4494                Ok(bytes)
4495            }
4496
4497            // I64SetCondZ: Test if i64 register pair is zero, result 0/1 in rd
4498            // ORR.W rd, rn_lo, rn_hi; CMP rd, #0; ITE EQ; MOV 1; MOV 0
4499            ArmOp::I64SetCondZ { rd, rn_lo, rn_hi } => {
4500                let rd_bits = reg_to_bits(rd);
4501                let rn_lo_bits = reg_to_bits(rn_lo);
4502                let rn_hi_bits = reg_to_bits(rn_hi);
4503                let mut bytes = Vec::new();
4504
4505                // ORR.W rd, rn_lo, rn_hi: EA40 rn_lo | 0000 rd 0000 rn_hi
4506                let hw1: u16 = (0xEA40 | rn_lo_bits) as u16;
4507                let hw2: u16 = ((rd_bits << 8) | rn_hi_bits) as u16;
4508                bytes.extend_from_slice(&hw1.to_le_bytes());
4509                bytes.extend_from_slice(&hw2.to_le_bytes());
4510
4511                // CMP rd, #0 — 16-bit form only for r0-r7 (3-bit rd field);
4512                // high registers take CMP.W (T2: F1B0|rn 0F00|imm8). This was
4513                // H-CODE-9: rd_bits<<8 overflowing the field compared the
4514                // WRONG register. Same hardening as the #311 SetCond fix.
4515                if rd_bits < 8 {
4516                    let cmp_instr: u16 = 0x2800 | ((rd_bits as u16) << 8);
4517                    bytes.extend_from_slice(&cmp_instr.to_le_bytes());
4518                } else {
4519                    let hw1: u16 = 0xF1B0 | (rd_bits as u16);
4520                    let hw2: u16 = 0x0F00;
4521                    bytes.extend_from_slice(&hw1.to_le_bytes());
4522                    bytes.extend_from_slice(&hw2.to_le_bytes());
4523                }
4524
4525                // ITE EQ; MOV rd, #1; MOV rd, #0 (32-bit MOV.W for rd >= R8,
4526                // #311 — see I64SetCond)
4527                let mask = 0xC_u16; // ITE EQ mask: firstcond[0]=0, mask=0xC
4528                let ite_instr: u16 = 0xBF00 | mask;
4529                bytes.extend_from_slice(&ite_instr.to_le_bytes());
4530                if rd_bits < 8 {
4531                    let mov_one: u16 = 0x2001 | ((rd_bits as u16) << 8);
4532                    let mov_zero: u16 = 0x2000 | ((rd_bits as u16) << 8);
4533                    bytes.extend_from_slice(&mov_one.to_le_bytes());
4534                    bytes.extend_from_slice(&mov_zero.to_le_bytes());
4535                } else {
4536                    for imm in [1u16, 0u16] {
4537                        let hw1: u16 = 0xF04F;
4538                        let hw2: u16 = ((rd_bits as u16) << 8) | imm;
4539                        bytes.extend_from_slice(&hw1.to_le_bytes());
4540                        bytes.extend_from_slice(&hw2.to_le_bytes());
4541                    }
4542                }
4543
4544                Ok(bytes)
4545            }
4546
4547            // I64Mul: 64-bit multiply using UMULL + MLA cross products
4548            // Formula: result = (a_lo * b_lo) + ((a_lo * b_hi + a_hi * b_lo) << 32)
4549            // Uses R12 as scratch register
4550            ArmOp::I64Mul {
4551                rd_lo,
4552                rd_hi,
4553                rn_lo,
4554                rn_hi,
4555                rm_lo,
4556                rm_hi,
4557            } => {
4558                let rd_lo_bits = reg_to_bits(rd_lo);
4559                let rd_hi_bits = reg_to_bits(rd_hi);
4560                let rn_lo_bits = reg_to_bits(rn_lo);
4561                let rn_hi_bits = reg_to_bits(rn_hi);
4562                let rm_lo_bits = reg_to_bits(rm_lo);
4563                let rm_hi_bits = reg_to_bits(rm_hi);
4564                let r12: u32 = 12; // IP scratch register
4565                let mut bytes = Vec::new();
4566
4567                // 1. MUL R12, rn_lo, rm_hi  (R12 = a_lo * b_hi)
4568                // Thumb-2 MUL: hw1=0xFB00|Rn, hw2=0xF000|(Rd<<8)|Rm
4569                let hw1: u16 = (0xFB00 | rn_lo_bits) as u16;
4570                let hw2: u16 = (0xF000 | (r12 << 8) | rm_hi_bits) as u16;
4571                bytes.extend_from_slice(&hw1.to_le_bytes());
4572                bytes.extend_from_slice(&hw2.to_le_bytes());
4573
4574                // 2. MLA R12, rn_hi, rm_lo, R12  (R12 += a_hi * b_lo)
4575                // Thumb-2 MLA: hw1=0xFB00|Rn, hw2=(Ra<<12)|(Rd<<8)|Rm
4576                let hw1: u16 = (0xFB00 | rn_hi_bits) as u16;
4577                let hw2: u16 = ((r12 << 12) | (r12 << 8) | rm_lo_bits) as u16;
4578                bytes.extend_from_slice(&hw1.to_le_bytes());
4579                bytes.extend_from_slice(&hw2.to_le_bytes());
4580
4581                // 3. UMULL rd_lo, rd_hi, rn_lo, rm_lo  (rd_lo:rd_hi = a_lo * b_lo)
4582                // Thumb-2 UMULL: hw1=0xFBA0|Rn, hw2=(RdLo<<12)|(RdHi<<8)|Rm
4583                let hw1: u16 = (0xFBA0 | rn_lo_bits) as u16;
4584                let hw2: u16 = ((rd_lo_bits << 12) | (rd_hi_bits << 8) | rm_lo_bits) as u16;
4585                bytes.extend_from_slice(&hw1.to_le_bytes());
4586                bytes.extend_from_slice(&hw2.to_le_bytes());
4587
4588                // 4. ADD rd_hi, R12  (rd_hi += cross products)
4589                // 16-bit high reg ADD: 01000100 D Rm Rdn[2:0]
4590                let d_bit = (rd_hi_bits >> 3) & 1;
4591                let add_instr: u16 =
4592                    (0x4400 | (d_bit << 7) | (r12 << 3) | (rd_hi_bits & 0x7)) as u16;
4593                bytes.extend_from_slice(&add_instr.to_le_bytes());
4594
4595                Ok(bytes)
4596            }
4597
4598            // I64Shl: 64-bit shift left with branch for n<32 vs n>=32
4599            // rm_hi (R3) is used as temp register
4600            ArmOp::I64Shl {
4601                rd_lo,
4602                rd_hi,
4603                rn_lo,
4604                rn_hi,
4605                rm_lo,
4606                rm_hi,
4607            } => {
4608                let rd_lo_bits = reg_to_bits(rd_lo);
4609                let rd_hi_bits = reg_to_bits(rd_hi);
4610                let rn_lo_bits = reg_to_bits(rn_lo);
4611                let rn_hi_bits = reg_to_bits(rn_hi);
4612                let rm_lo_bits = reg_to_bits(rm_lo);
4613                let rm_hi_bits = reg_to_bits(rm_hi); // temp
4614                let mut bytes = Vec::new();
4615
4616                // AND.W rm_lo, rm_lo, #63  (mask shift amount to 6 bits)
4617                let hw1: u16 = (0xF000 | rm_lo_bits) as u16;
4618                let hw2: u16 = ((rm_lo_bits << 8) | 0x3F) as u16;
4619                bytes.extend_from_slice(&hw1.to_le_bytes());
4620                bytes.extend_from_slice(&hw2.to_le_bytes());
4621
4622                // SUBS.W rm_hi, rm_lo, #32  (rm_hi = n-32, sets flags)
4623                let hw1: u16 = (0xF1B0 | rm_lo_bits) as u16;
4624                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4625                bytes.extend_from_slice(&hw1.to_le_bytes());
4626                bytes.extend_from_slice(&hw2.to_le_bytes());
4627
4628                // BPL .large (branch if n >= 32, offset = +10 halfwords)
4629                let bpl: u16 = 0xD50A;
4630                bytes.extend_from_slice(&bpl.to_le_bytes());
4631
4632                // --- Small shift (n < 32) ---
4633                // RSB.W rm_hi, rm_lo, #32  (rm_hi = 32-n)
4634                let hw1: u16 = (0xF1C0 | rm_lo_bits) as u16;
4635                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4636                bytes.extend_from_slice(&hw1.to_le_bytes());
4637                bytes.extend_from_slice(&hw2.to_le_bytes());
4638
4639                // LSR.W rm_hi, rn_lo, rm_hi  (rm_hi = lo >> (32-n), overflow bits)
4640                let hw1: u16 = (0xFA20 | rn_lo_bits) as u16;
4641                let hw2: u16 = (0xF000 | (rm_hi_bits << 8) | rm_hi_bits) as u16;
4642                bytes.extend_from_slice(&hw1.to_le_bytes());
4643                bytes.extend_from_slice(&hw2.to_le_bytes());
4644
4645                // LSL.W rd_hi, rn_hi, rm_lo  (hi <<= n)
4646                let hw1: u16 = (0xFA00 | rn_hi_bits) as u16;
4647                let hw2: u16 = (0xF000 | (rd_hi_bits << 8) | rm_lo_bits) as u16;
4648                bytes.extend_from_slice(&hw1.to_le_bytes());
4649                bytes.extend_from_slice(&hw2.to_le_bytes());
4650
4651                // ORR.W rd_hi, rd_hi, rm_hi  (hi |= overflow bits from lo)
4652                let hw1: u16 = (0xEA40 | rd_hi_bits) as u16;
4653                let hw2: u16 = ((rd_hi_bits << 8) | rm_hi_bits) as u16;
4654                bytes.extend_from_slice(&hw1.to_le_bytes());
4655                bytes.extend_from_slice(&hw2.to_le_bytes());
4656
4657                // LSL.W rd_lo, rn_lo, rm_lo  (lo <<= n)
4658                let hw1: u16 = (0xFA00 | rn_lo_bits) as u16;
4659                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_lo_bits) as u16;
4660                bytes.extend_from_slice(&hw1.to_le_bytes());
4661                bytes.extend_from_slice(&hw2.to_le_bytes());
4662
4663                // B .done — `.done` is the END of the expansion, i.e. PAST the
4664                // large-shift arm's trailing zero-fill. #916: that zero-fill is
4665                // 1 halfword for a low rd_lo but 2 for R8-R12 (MOV.W), so the
4666                // displacement is DERIVED from its real width instead of the
4667                // hard-coded 0xE002 — widening the MOV without this would
4668                // overshoot `.done` and turn a data miscompile into a
4669                // control-flow one. Thumb `B` reads PC as its own address + 4
4670                // (= +2 halfwords), so imm11 = (large-arm halfwords) - 1.
4671                let large_arm_hw = 2 + thumb_zero_fill_halfwords(rd_lo_bits);
4672                let b_done: u16 = 0xE000 | (large_arm_hw - 1);
4673                bytes.extend_from_slice(&b_done.to_le_bytes());
4674
4675                // --- Large shift (n >= 32) ---
4676                // LSL.W rd_hi, rn_lo, rm_hi  (hi = lo << (n-32))
4677                let hw1: u16 = (0xFA00 | rn_lo_bits) as u16;
4678                let hw2: u16 = (0xF000 | (rd_hi_bits << 8) | rm_hi_bits) as u16;
4679                bytes.extend_from_slice(&hw1.to_le_bytes());
4680                bytes.extend_from_slice(&hw2.to_le_bytes());
4681
4682                // MOV rd_lo, #0 (#916: MOV.W for rd_lo >= R8). NOTE the order
4683                // is load-bearing — zeroing rd_lo BEFORE the LSL.W would
4684                // destroy rn_lo in the in-place case rd_lo == rn_lo, so this
4685                // cannot be reordered to dodge the displacement change.
4686                emit_thumb_zero_fill(&mut bytes, rd_lo_bits);
4687
4688                Ok(bytes) // 38 bytes (40 when rd_lo >= R8 takes MOV.W)
4689            }
4690
4691            // I64ShrU: 64-bit logical shift right with branch for n<32 vs n>=32
4692            ArmOp::I64ShrU {
4693                rd_lo,
4694                rd_hi,
4695                rn_lo,
4696                rn_hi,
4697                rm_lo,
4698                rm_hi,
4699            } => {
4700                let rd_lo_bits = reg_to_bits(rd_lo);
4701                let rd_hi_bits = reg_to_bits(rd_hi);
4702                let rn_lo_bits = reg_to_bits(rn_lo);
4703                let rn_hi_bits = reg_to_bits(rn_hi);
4704                let rm_lo_bits = reg_to_bits(rm_lo);
4705                let rm_hi_bits = reg_to_bits(rm_hi); // temp
4706                let mut bytes = Vec::new();
4707
4708                // AND.W rm_lo, rm_lo, #63
4709                let hw1: u16 = (0xF000 | rm_lo_bits) as u16;
4710                let hw2: u16 = ((rm_lo_bits << 8) | 0x3F) as u16;
4711                bytes.extend_from_slice(&hw1.to_le_bytes());
4712                bytes.extend_from_slice(&hw2.to_le_bytes());
4713
4714                // SUBS.W rm_hi, rm_lo, #32
4715                let hw1: u16 = (0xF1B0 | rm_lo_bits) as u16;
4716                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4717                bytes.extend_from_slice(&hw1.to_le_bytes());
4718                bytes.extend_from_slice(&hw2.to_le_bytes());
4719
4720                // BPL .large (+10 halfwords)
4721                let bpl: u16 = 0xD50A;
4722                bytes.extend_from_slice(&bpl.to_le_bytes());
4723
4724                // --- Small shift (n < 32) ---
4725                // RSB.W rm_hi, rm_lo, #32  (rm_hi = 32-n)
4726                let hw1: u16 = (0xF1C0 | rm_lo_bits) as u16;
4727                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4728                bytes.extend_from_slice(&hw1.to_le_bytes());
4729                bytes.extend_from_slice(&hw2.to_le_bytes());
4730
4731                // LSL.W rm_hi, rn_hi, rm_hi  (rm_hi = hi << (32-n), bits flowing to lo)
4732                let hw1: u16 = (0xFA00 | rn_hi_bits) as u16;
4733                let hw2: u16 = (0xF000 | (rm_hi_bits << 8) | rm_hi_bits) as u16;
4734                bytes.extend_from_slice(&hw1.to_le_bytes());
4735                bytes.extend_from_slice(&hw2.to_le_bytes());
4736
4737                // LSR.W rd_lo, rn_lo, rm_lo  (lo >>= n)
4738                let hw1: u16 = (0xFA20 | rn_lo_bits) as u16;
4739                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_lo_bits) as u16;
4740                bytes.extend_from_slice(&hw1.to_le_bytes());
4741                bytes.extend_from_slice(&hw2.to_le_bytes());
4742
4743                // ORR.W rd_lo, rd_lo, rm_hi  (lo |= overflow from hi)
4744                let hw1: u16 = (0xEA40 | rd_lo_bits) as u16;
4745                let hw2: u16 = ((rd_lo_bits << 8) | rm_hi_bits) as u16;
4746                bytes.extend_from_slice(&hw1.to_le_bytes());
4747                bytes.extend_from_slice(&hw2.to_le_bytes());
4748
4749                // LSR.W rd_hi, rn_hi, rm_lo  (hi >>= n, logical)
4750                let hw1: u16 = (0xFA20 | rn_hi_bits) as u16;
4751                let hw2: u16 = (0xF000 | (rd_hi_bits << 8) | rm_lo_bits) as u16;
4752                bytes.extend_from_slice(&hw1.to_le_bytes());
4753                bytes.extend_from_slice(&hw2.to_le_bytes());
4754
4755                // B .done — see I64Shl: `.done` is the END of the expansion,
4756                // past the trailing zero-fill, so the displacement is derived
4757                // from that zero-fill's real width (#916).
4758                let large_arm_hw = 2 + thumb_zero_fill_halfwords(rd_hi_bits);
4759                let b_done: u16 = 0xE000 | (large_arm_hw - 1);
4760                bytes.extend_from_slice(&b_done.to_le_bytes());
4761
4762                // --- Large shift (n >= 32) ---
4763                // LSR.W rd_lo, rn_hi, rm_hi  (lo = hi >> (n-32))
4764                let hw1: u16 = (0xFA20 | rn_hi_bits) as u16;
4765                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_hi_bits) as u16;
4766                bytes.extend_from_slice(&hw1.to_le_bytes());
4767                bytes.extend_from_slice(&hw2.to_le_bytes());
4768
4769                // MOV rd_hi, #0 (#916: MOV.W for rd_hi >= R8). Order is
4770                // load-bearing: the LSR.W above reads rn_hi, which may BE
4771                // rd_hi in the in-place case.
4772                emit_thumb_zero_fill(&mut bytes, rd_hi_bits);
4773
4774                Ok(bytes) // 38 bytes (40 when rd_hi >= R8 takes MOV.W)
4775            }
4776
4777            // I64ShrS: 64-bit arithmetic shift right with branch for n<32 vs n>=32
4778            ArmOp::I64ShrS {
4779                rd_lo,
4780                rd_hi,
4781                rn_lo,
4782                rn_hi,
4783                rm_lo,
4784                rm_hi,
4785            } => {
4786                let rd_lo_bits = reg_to_bits(rd_lo);
4787                let rd_hi_bits = reg_to_bits(rd_hi);
4788                let rn_lo_bits = reg_to_bits(rn_lo);
4789                let rn_hi_bits = reg_to_bits(rn_hi);
4790                let rm_lo_bits = reg_to_bits(rm_lo);
4791                let rm_hi_bits = reg_to_bits(rm_hi); // temp
4792                let mut bytes = Vec::new();
4793
4794                // AND.W rm_lo, rm_lo, #63
4795                let hw1: u16 = (0xF000 | rm_lo_bits) as u16;
4796                let hw2: u16 = ((rm_lo_bits << 8) | 0x3F) as u16;
4797                bytes.extend_from_slice(&hw1.to_le_bytes());
4798                bytes.extend_from_slice(&hw2.to_le_bytes());
4799
4800                // SUBS.W rm_hi, rm_lo, #32
4801                let hw1: u16 = (0xF1B0 | rm_lo_bits) as u16;
4802                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4803                bytes.extend_from_slice(&hw1.to_le_bytes());
4804                bytes.extend_from_slice(&hw2.to_le_bytes());
4805
4806                // BPL .large (+10 halfwords)
4807                let bpl: u16 = 0xD50A;
4808                bytes.extend_from_slice(&bpl.to_le_bytes());
4809
4810                // --- Small shift (n < 32) ---
4811                // RSB.W rm_hi, rm_lo, #32
4812                let hw1: u16 = (0xF1C0 | rm_lo_bits) as u16;
4813                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4814                bytes.extend_from_slice(&hw1.to_le_bytes());
4815                bytes.extend_from_slice(&hw2.to_le_bytes());
4816
4817                // LSL.W rm_hi, rn_hi, rm_hi  (rm_hi = hi << (32-n), bits flowing to lo)
4818                let hw1: u16 = (0xFA00 | rn_hi_bits) as u16;
4819                let hw2: u16 = (0xF000 | (rm_hi_bits << 8) | rm_hi_bits) as u16;
4820                bytes.extend_from_slice(&hw1.to_le_bytes());
4821                bytes.extend_from_slice(&hw2.to_le_bytes());
4822
4823                // LSR.W rd_lo, rn_lo, rm_lo  (lo >>= n, logical for lo word)
4824                let hw1: u16 = (0xFA20 | rn_lo_bits) as u16;
4825                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_lo_bits) as u16;
4826                bytes.extend_from_slice(&hw1.to_le_bytes());
4827                bytes.extend_from_slice(&hw2.to_le_bytes());
4828
4829                // ORR.W rd_lo, rd_lo, rm_hi  (lo |= overflow from hi)
4830                let hw1: u16 = (0xEA40 | rd_lo_bits) as u16;
4831                let hw2: u16 = ((rd_lo_bits << 8) | rm_hi_bits) as u16;
4832                bytes.extend_from_slice(&hw1.to_le_bytes());
4833                bytes.extend_from_slice(&hw2.to_le_bytes());
4834
4835                // ASR.W rd_hi, rn_hi, rm_lo  (hi >>= n, arithmetic/sign-extending)
4836                let hw1: u16 = (0xFA40 | rn_hi_bits) as u16;
4837                let hw2: u16 = (0xF000 | (rd_hi_bits << 8) | rm_lo_bits) as u16;
4838                bytes.extend_from_slice(&hw1.to_le_bytes());
4839                bytes.extend_from_slice(&hw2.to_le_bytes());
4840
4841                // B .done (+3 halfwords, large shift is 8 bytes)
4842                let b_done: u16 = 0xE003;
4843                bytes.extend_from_slice(&b_done.to_le_bytes());
4844
4845                // --- Large shift (n >= 32) ---
4846                // ASR.W rd_lo, rn_hi, rm_hi  (lo = hi >>> (n-32))
4847                let hw1: u16 = (0xFA40 | rn_hi_bits) as u16;
4848                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_hi_bits) as u16;
4849                bytes.extend_from_slice(&hw1.to_le_bytes());
4850                bytes.extend_from_slice(&hw2.to_le_bytes());
4851
4852                // ASR.W rd_hi, rn_hi, #31  (hi = sign extension, all 0s or all 1s)
4853                // Thumb-2 ASR immediate: hw1=0xEA4F, hw2=imm3:Rd:imm2:10:Rm
4854                // imm5=31=11111 → imm3=111, imm2=11
4855                let hw1: u16 = 0xEA4F;
4856                let hw2: u16 = (0x7000 | (rd_hi_bits << 8) | 0x00E0 | rn_hi_bits) as u16;
4857                bytes.extend_from_slice(&hw1.to_le_bytes());
4858                bytes.extend_from_slice(&hw2.to_le_bytes());
4859
4860                Ok(bytes) // Total: 40 bytes
4861            }
4862
4863            // I64Rotl: 64-bit rotate left (#610 rewrite).
4864            // For n < 32: new_hi = (hi << n) | (lo >> (32-n)), new_lo = (lo << n) | (hi >> (32-n))
4865            // For n >= 32: same formula with lo/hi swapped, shift by m = n-32.
4866            //
4867            // Fixed-reg core: value in R0:R1, amount in R2, scratch R3 + R12
4868            // (all four saved/marshaled by the #610 fixed-ABI wrapper; the
4869            // pre-#610 expansion wrote through the selector's registers with
4870            // colliding R3/R4 scratch and restored the saved R4 OVER the
4871            // result). Relies on ARM register-shift semantics: amounts >= 32
4872            // yield 0 for LSL/LSR, which makes n = 0 and n = 32 exact.
4873            ArmOp::I64Rotl {
4874                rdlo,
4875                rdhi,
4876                rnlo,
4877                rnhi,
4878                shift,
4879            } => {
4880                let mut bytes = Vec::new();
4881                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, shift]);
4882
4883                let core: [u16; 35] = [
4884                    0xF002, 0x023F, // AND.W  R2, R2, #63   (mask amount mod 64)
4885                    0xF1B2, 0x0320, // SUBS.W R3, R2, #32   (R3 = n-32, sets N)
4886                    0xD50E, //         BPL    .large        (n >= 32)
4887                    // --- small rotation (n < 32) ---
4888                    0xF1C2, 0x0320, // RSB.W  R3, R2, #32   (R3 = 32-n)
4889                    0xFA20, 0xFC03, // LSR.W  R12, R0, R3   (lo >> (32-n))
4890                    0xFA21, 0xF303, // LSR.W  R3, R1, R3    (hi >> (32-n))
4891                    0xFA01, 0xF102, // LSL.W  R1, R1, R2    (hi << n)
4892                    0xEA41, 0x010C, // ORR.W  R1, R1, R12   (new_hi)
4893                    0xFA00, 0xF002, // LSL.W  R0, R0, R2    (lo << n)
4894                    0xEA40, 0x0003, // ORR.W  R0, R0, R3    (new_lo)
4895                    0xE00E, //         B      .done
4896                    // --- large rotation (n >= 32), R3 = m = n-32 ---
4897                    0xF1C3, 0x0220, // RSB.W  R2, R3, #32   (R2 = 32-m = 64-n)
4898                    0xFA21, 0xFC02, // LSR.W  R12, R1, R2   (hi >> (64-n))
4899                    0xFA20, 0xF202, // LSR.W  R2, R0, R2    (lo >> (64-n))
4900                    0xFA00, 0xF003, // LSL.W  R0, R0, R3    (lo << m)
4901                    0xFA01, 0xF103, // LSL.W  R1, R1, R3    (hi << m)
4902                    0xEA40, 0x0C0C, // ORR.W  R12, R0, R12  (new_hi = (lo<<m)|(hi>>(64-n)))
4903                    0xEA41, 0x0002, // ORR.W  R0, R1, R2    (new_lo = (hi<<m)|(lo>>(64-n)))
4904                    0x4661, //         MOV    R1, R12       (new_hi into place)
4905                            // .done: result in R0:R1
4906                ];
4907                for hw in core {
4908                    bytes.extend_from_slice(&hw.to_le_bytes());
4909                }
4910
4911                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
4912                Ok(bytes) // Total: 102 bytes
4913            }
4914
4915            // I64Rotr: 64-bit rotate right (#610 rewrite).
4916            // For n < 32: new_lo = (lo >> n) | (hi << (32-n)), new_hi = (hi >> n) | (lo << (32-n))
4917            // For n >= 32: same formula with lo/hi swapped, shift by m = n-32.
4918            //
4919            // Same fixed-reg core contract as I64Rotl: value in R0:R1, amount
4920            // in R2, scratch R3 + R12, all covered by the fixed-ABI wrapper.
4921            ArmOp::I64Rotr {
4922                rdlo,
4923                rdhi,
4924                rnlo,
4925                rnhi,
4926                shift,
4927            } => {
4928                let mut bytes = Vec::new();
4929                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, shift]);
4930
4931                let core: [u16; 35] = [
4932                    0xF002, 0x023F, // AND.W  R2, R2, #63   (mask amount mod 64)
4933                    0xF1B2, 0x0320, // SUBS.W R3, R2, #32   (R3 = n-32, sets N)
4934                    0xD50E, //         BPL    .large        (n >= 32)
4935                    // --- small rotation (n < 32) ---
4936                    0xF1C2, 0x0320, // RSB.W  R3, R2, #32   (R3 = 32-n)
4937                    0xFA01, 0xFC03, // LSL.W  R12, R1, R3   (hi << (32-n))
4938                    0xFA00, 0xF303, // LSL.W  R3, R0, R3    (lo << (32-n))
4939                    0xFA20, 0xF002, // LSR.W  R0, R0, R2    (lo >> n)
4940                    0xEA40, 0x000C, // ORR.W  R0, R0, R12   (new_lo)
4941                    0xFA21, 0xF102, // LSR.W  R1, R1, R2    (hi >> n)
4942                    0xEA41, 0x0103, // ORR.W  R1, R1, R3    (new_hi)
4943                    0xE00E, //         B      .done
4944                    // --- large rotation (n >= 32), R3 = m = n-32 ---
4945                    0xF1C3, 0x0220, // RSB.W  R2, R3, #32   (R2 = 32-m = 64-n)
4946                    0xFA00, 0xFC02, // LSL.W  R12, R0, R2   (lo << (64-n))
4947                    0xFA01, 0xF202, // LSL.W  R2, R1, R2    (hi << (64-n))
4948                    0xFA21, 0xF103, // LSR.W  R1, R1, R3    (hi >> m)
4949                    0xEA41, 0x0C0C, // ORR.W  R12, R1, R12  (new_lo = (hi>>m)|(lo<<(64-n)))
4950                    0xFA20, 0xF103, // LSR.W  R1, R0, R3    (lo >> m)
4951                    0xEA41, 0x0102, // ORR.W  R1, R1, R2    (new_hi = (lo>>m)|(hi<<(64-n)))
4952                    0x4660, //         MOV    R0, R12       (new_lo into place)
4953                            // .done: result in R0:R1
4954                ];
4955                for hw in core {
4956                    bytes.extend_from_slice(&hw.to_le_bytes());
4957                }
4958
4959                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
4960                Ok(bytes) // Total: 102 bytes
4961            }
4962
4963            // I64Clz: Count leading zeros in 64-bit value
4964            // If hi != 0: result = CLZ(hi)
4965            // If hi == 0: result = 32 + CLZ(lo)
4966            //
4967            // Layout (using CMP+BNE approach for consistency):
4968            // 0: CMP.W rnhi, #0 (4 bytes)
4969            // 4: BEQ .hi_zero (2 bytes) - branch forward to offset 14
4970            // 6: CLZ.W rd, rnhi (4 bytes)
4971            // 10: B .done (2 bytes) - branch forward to offset 22
4972            // 12: NOP (2 bytes) - padding for alignment
4973            // 14: .hi_zero: CLZ.W rd, rnlo (4 bytes)
4974            // 18: ADD.W rd, rd, #32 (4 bytes)
4975            // 22: .done
4976            ArmOp::I64Clz { rd, rnlo, rnhi } => {
4977                let rd_bits = reg_to_bits(rd);
4978                let rn_lo_bits = reg_to_bits(rnlo);
4979                let rn_hi_bits = reg_to_bits(rnhi);
4980                let mut bytes = Vec::new();
4981
4982                // CMP.W rnhi, #0 (4 bytes at offset 0)
4983                let hw1: u16 = (0xF1B0 | rn_hi_bits) as u16;
4984                let hw2: u16 = 0x0F00;
4985                bytes.extend_from_slice(&hw1.to_le_bytes());
4986                bytes.extend_from_slice(&hw2.to_le_bytes());
4987
4988                // BEQ .hi_zero (2 bytes at offset 4)
4989                // PC = 4 + 4 = 8, target = 14, offset = 6, imm8 = 3
4990                let beq: u16 = 0xD003;
4991                bytes.extend_from_slice(&beq.to_le_bytes());
4992
4993                // CLZ.W rd, rnhi (4 bytes at offset 6)
4994                // CLZ T1: hw1 = 0xFAB<Rm>, hw2 = 0xF<Rd>8<Rm>
4995                let hw1: u16 = (0xFAB0 | rn_hi_bits) as u16;
4996                let hw2: u16 = (0xF080 | (rd_bits << 8) | rn_hi_bits) as u16;
4997                bytes.extend_from_slice(&hw1.to_le_bytes());
4998                bytes.extend_from_slice(&hw2.to_le_bytes());
4999
5000                // B .done (2 bytes at offset 10)
5001                // PC = 10 + 4 = 14, target = 22, offset = 8, imm11 = 4
5002                let b_done: u16 = 0xE004;
5003                bytes.extend_from_slice(&b_done.to_le_bytes());
5004
5005                // NOP (2 bytes at offset 12) - padding
5006                bytes.extend_from_slice(&0xBF00u16.to_le_bytes());
5007
5008                // .hi_zero: (offset 14)
5009                // CLZ.W rd, rnlo (4 bytes)
5010                // CLZ T1: hw1 = 0xFAB<Rm>, hw2 = 0xF<Rd>8<Rm>
5011                let hw1: u16 = (0xFAB0 | rn_lo_bits) as u16;
5012                let hw2: u16 = (0xF080 | (rd_bits << 8) | rn_lo_bits) as u16;
5013                bytes.extend_from_slice(&hw1.to_le_bytes());
5014                bytes.extend_from_slice(&hw2.to_le_bytes());
5015
5016                // ADD.W rd, rd, #32 (4 bytes at offset 18)
5017                let hw1: u16 = (0xF100 | rd_bits) as u16;
5018                let hw2: u16 = ((rd_bits << 8) | 0x20) as u16;
5019                bytes.extend_from_slice(&hw1.to_le_bytes());
5020                bytes.extend_from_slice(&hw2.to_le_bytes());
5021
5022                // .done: (offset 22)
5023                // i64.clz returns i64, so clear high word (#916: MOV.W for
5024                // rnhi >= R8 — this site is UNCONDITIONALLY reached, so every
5025                // i64.clz with a high `rnhi` returned garbage in its upper 32
5026                // bits, not just the shift ops the issue named). No branch
5027                // displacement changes: `B .done` above targets offset 22,
5028                // which IS this instruction's own address, and `BEQ` targets
5029                // offset 14, before it.
5030                emit_thumb_zero_fill(&mut bytes, rn_hi_bits);
5031
5032                Ok(bytes) // 24 bytes (26 when rnhi >= R8 takes MOV.W)
5033            }
5034
5035            // I64Ctz: Count trailing zeros in 64-bit value
5036            // If lo != 0: result = CTZ(lo) = CLZ(RBIT(lo))
5037            // If lo == 0: result = 32 + CTZ(hi) = 32 + CLZ(RBIT(hi))
5038            //
5039            // Layout:
5040            // 0: CMP.W rnlo, #0 (4 bytes)
5041            // 4: BEQ .lo_zero (2 bytes) - branch to offset 18
5042            // 6: RBIT.W rd, rnlo (4 bytes)
5043            // 10: CLZ.W rd, rd (4 bytes)
5044            // 14: B .done (2 bytes) - branch to offset 30
5045            // 16: NOP (2 bytes) - padding
5046            // 18: .lo_zero: RBIT.W rd, rnhi (4 bytes)
5047            // 22: CLZ.W rd, rd (4 bytes)
5048            // 26: ADD.W rd, rd, #32 (4 bytes)
5049            // 30: .done
5050            ArmOp::I64Ctz { rd, rnlo, rnhi } => {
5051                let rd_bits = reg_to_bits(rd);
5052                let rn_lo_bits = reg_to_bits(rnlo);
5053                let rn_hi_bits = reg_to_bits(rnhi);
5054                let mut bytes = Vec::new();
5055
5056                // CMP.W rnlo, #0 (4 bytes at offset 0)
5057                let hw1: u16 = (0xF1B0 | rn_lo_bits) as u16;
5058                let hw2: u16 = 0x0F00;
5059                bytes.extend_from_slice(&hw1.to_le_bytes());
5060                bytes.extend_from_slice(&hw2.to_le_bytes());
5061
5062                // BEQ .lo_zero (2 bytes at offset 4)
5063                // PC = 4 + 4 = 8, target = 18, offset = 10, imm8 = 5
5064                let beq: u16 = 0xD005;
5065                bytes.extend_from_slice(&beq.to_le_bytes());
5066
5067                // RBIT.W rd, rnlo (4 bytes at offset 6)
5068                // RBIT T1: hw1 = 0xFA9<Rm>, hw2 = 0xF<Rd>A<Rm>
5069                let hw1: u16 = (0xFA90 | rn_lo_bits) as u16;
5070                let hw2: u16 = (0xF0A0 | (rd_bits << 8) | rn_lo_bits) as u16;
5071                bytes.extend_from_slice(&hw1.to_le_bytes());
5072                bytes.extend_from_slice(&hw2.to_le_bytes());
5073
5074                // CLZ.W rd, rd (4 bytes at offset 10)
5075                // CLZ T1: hw1 = 0xFAB<Rm>, hw2 = 0xF<Rd>8<Rm>
5076                let hw1: u16 = (0xFAB0 | rd_bits) as u16;
5077                let hw2: u16 = (0xF080 | (rd_bits << 8) | rd_bits) as u16;
5078                bytes.extend_from_slice(&hw1.to_le_bytes());
5079                bytes.extend_from_slice(&hw2.to_le_bytes());
5080
5081                // B .done (2 bytes at offset 14)
5082                // PC = 14 + 4 = 18, target = 30, offset = 12, imm11 = 6
5083                let b_done: u16 = 0xE006;
5084                bytes.extend_from_slice(&b_done.to_le_bytes());
5085
5086                // NOP (2 bytes at offset 16) - padding
5087                bytes.extend_from_slice(&0xBF00u16.to_le_bytes());
5088
5089                // .lo_zero: (offset 18)
5090                // RBIT.W rd, rnhi (4 bytes)
5091                // RBIT T1: hw1 = 0xFA9<Rm>, hw2 = 0xF<Rd>A<Rm>
5092                let hw1: u16 = (0xFA90 | rn_hi_bits) as u16;
5093                let hw2: u16 = (0xF0A0 | (rd_bits << 8) | rn_hi_bits) as u16;
5094                bytes.extend_from_slice(&hw1.to_le_bytes());
5095                bytes.extend_from_slice(&hw2.to_le_bytes());
5096
5097                // CLZ.W rd, rd (4 bytes at offset 22)
5098                // CLZ T1: hw1 = 0xFAB<Rm>, hw2 = 0xF<Rd>8<Rm>
5099                let hw1: u16 = (0xFAB0 | rd_bits) as u16;
5100                let hw2: u16 = (0xF080 | (rd_bits << 8) | rd_bits) as u16;
5101                bytes.extend_from_slice(&hw1.to_le_bytes());
5102                bytes.extend_from_slice(&hw2.to_le_bytes());
5103
5104                // ADD.W rd, rd, #32 (4 bytes at offset 26)
5105                let hw1: u16 = (0xF100 | rd_bits) as u16;
5106                let hw2: u16 = ((rd_bits << 8) | 0x20) as u16;
5107                bytes.extend_from_slice(&hw1.to_le_bytes());
5108                bytes.extend_from_slice(&hw2.to_le_bytes());
5109
5110                // .done: (offset 30)
5111                // i64.ctz returns i64, so clear high word (#916: MOV.W for
5112                // rnhi >= R8). As with I64Clz this site is unconditional, and
5113                // no displacement moves: `B .done` targets offset 30 = this
5114                // instruction's own address, `BEQ` targets offset 18.
5115                emit_thumb_zero_fill(&mut bytes, rn_hi_bits);
5116
5117                Ok(bytes) // 32 bytes (34 when rnhi >= R8 takes MOV.W)
5118            }
5119
5120            // I64Popcnt: Population count of 64-bit value
5121            // result = POPCNT(lo) + POPCNT(hi)
5122            // Using SIMD-style parallel bit counting algorithm
5123            ArmOp::I64Popcnt { rd, rnlo, rnhi } => {
5124                let rd_bits = reg_to_bits(rd);
5125                let rn_lo_bits = reg_to_bits(rnlo);
5126                let rn_hi_bits = reg_to_bits(rnhi);
5127                let r12: u32 = 12; // IP scratch
5128                let r3: u32 = 3; // Scratch for hi popcnt result
5129                let mut bytes = Vec::new();
5130
5131                // PUSH {R3, R4, R5} - save scratch registers
5132                bytes.extend_from_slice(&0xB438u16.to_le_bytes());
5133
5134                // Strategy: compute popcnt(lo) -> R4, popcnt(hi) -> R5, add them -> rd
5135                // Using lookup table approach for each byte would be too large
5136                // Using shift-and-add approach instead
5137
5138                // For simplicity and correctness, use the efficient parallel algorithm
5139                // but implement it as a series of inline operations
5140
5141                // Marshal the operand pair into the fixed scratch regs, routing
5142                // rnlo through R12 (#632 audit): writing R4 first corrupted the
5143                // rnhi read for a pair living at (R3,R4) — every source is read
5144                // before any scratch register it could occupy is written.
5145                // MOV R12, rnlo
5146                let mov: u16 = (0x4600 | (1 << 7) | (rn_lo_bits << 3) | 4) as u16;
5147                bytes.extend_from_slice(&mov.to_le_bytes());
5148                // MOV R5, rnhi (R4 untouched so far; rnhi == R5 is a no-op)
5149                let mov: u16 = (0x4600 | (rn_hi_bits << 3) | 5) as u16;
5150                bytes.extend_from_slice(&mov.to_le_bytes());
5151                // MOV R4, R12
5152                bytes.extend_from_slice(&0x4664u16.to_le_bytes());
5153
5154                // --- POPCNT for R4 (lo word) ---
5155                // Step 1: x = x - ((x >> 1) & 0x55555555)
5156                // LSR.W R12, R4, #1
5157                let hw1: u16 = 0xEA4F;
5158                let hw2: u16 = ((r12 << 8) | 0x50 | 4) as u16;
5159                bytes.extend_from_slice(&hw1.to_le_bytes());
5160                bytes.extend_from_slice(&hw2.to_le_bytes());
5161
5162                // Load 0x55555555 into R3 using MOVW/MOVT
5163                // MOVW R3, #0x5555
5164                bytes.extend_from_slice(&0xF245u16.to_le_bytes());
5165                bytes.extend_from_slice(&0x5355u16.to_le_bytes());
5166                // MOVT R3, #0x5555
5167                bytes.extend_from_slice(&0xF2C5u16.to_le_bytes());
5168                bytes.extend_from_slice(&0x5355u16.to_le_bytes());
5169
5170                // AND.W R12, R12, R3
5171                let hw1: u16 = (0xEA00 | r12) as u16;
5172                let hw2: u16 = ((r12 << 8) | r3) as u16;
5173                bytes.extend_from_slice(&hw1.to_le_bytes());
5174                bytes.extend_from_slice(&hw2.to_le_bytes());
5175
5176                // SUB.W R4, R4, R12
5177                let hw1: u16 = (0xEBA0 | 4) as u16;
5178                let hw2: u16 = ((4 << 8) | r12) as u16;
5179                bytes.extend_from_slice(&hw1.to_le_bytes());
5180                bytes.extend_from_slice(&hw2.to_le_bytes());
5181
5182                // Step 2: x = (x & 0x33333333) + ((x >> 2) & 0x33333333)
5183                // Load 0x33333333 into R3
5184                // MOVW R3, #0x3333
5185                bytes.extend_from_slice(&0xF243u16.to_le_bytes());
5186                bytes.extend_from_slice(&0x3333u16.to_le_bytes());
5187                // MOVT R3, #0x3333
5188                bytes.extend_from_slice(&0xF2C3u16.to_le_bytes());
5189                bytes.extend_from_slice(&0x3333u16.to_le_bytes());
5190
5191                // AND.W R12, R4, R3
5192                let hw1: u16 = (0xEA00 | 4) as u16;
5193                let hw2: u16 = ((r12 << 8) | r3) as u16;
5194                bytes.extend_from_slice(&hw1.to_le_bytes());
5195                bytes.extend_from_slice(&hw2.to_le_bytes());
5196
5197                // LSR.W R4, R4, #2
5198                let hw1: u16 = 0xEA4F;
5199                let hw2: u16 = ((4 << 8) | 0x90 | 4) as u16;
5200                bytes.extend_from_slice(&hw1.to_le_bytes());
5201                bytes.extend_from_slice(&hw2.to_le_bytes());
5202
5203                // AND.W R4, R4, R3
5204                let hw1: u16 = (0xEA00 | 4) as u16;
5205                let hw2: u16 = ((4 << 8) | r3) as u16;
5206                bytes.extend_from_slice(&hw1.to_le_bytes());
5207                bytes.extend_from_slice(&hw2.to_le_bytes());
5208
5209                // ADD.W R4, R4, R12
5210                let hw1: u16 = (0xEB00 | 4) as u16;
5211                let hw2: u16 = ((4 << 8) | r12) as u16;
5212                bytes.extend_from_slice(&hw1.to_le_bytes());
5213                bytes.extend_from_slice(&hw2.to_le_bytes());
5214
5215                // Step 3: x = (x + (x >> 4)) & 0x0F0F0F0F
5216                // LSR.W R12, R4, #4
5217                // hw2 = (imm3 << 12) | (Rd << 8) | (imm2 << 6) | (type << 4) | Rm
5218                // imm5=4=00100 → imm3=1, imm2=0, type=01(LSR)
5219                let hw1: u16 = 0xEA4F;
5220                let hw2: u16 = (0x1000 | (r12 << 8) | 0x10 | 4) as u16;
5221                bytes.extend_from_slice(&hw1.to_le_bytes());
5222                bytes.extend_from_slice(&hw2.to_le_bytes());
5223
5224                // ADD.W R4, R4, R12
5225                let hw1: u16 = (0xEB00 | 4) as u16;
5226                let hw2: u16 = ((4 << 8) | r12) as u16;
5227                bytes.extend_from_slice(&hw1.to_le_bytes());
5228                bytes.extend_from_slice(&hw2.to_le_bytes());
5229
5230                // Load 0x0F0F0F0F into R3
5231                // MOVW R3, #0x0F0F (imm4=0, i=1, imm3=7, imm8=0x0F)
5232                // hw1 = 11110 1 10 0100 0000 = 0xF640
5233                // hw2 = 0 111 0011 00001111 = 0x730F
5234                bytes.extend_from_slice(&0xF640u16.to_le_bytes());
5235                bytes.extend_from_slice(&0x730Fu16.to_le_bytes());
5236                // MOVT R3, #0x0F0F
5237                bytes.extend_from_slice(&0xF6C0u16.to_le_bytes());
5238                bytes.extend_from_slice(&0x730Fu16.to_le_bytes());
5239
5240                // AND.W R4, R4, R3
5241                let hw1: u16 = (0xEA00 | 4) as u16;
5242                let hw2: u16 = ((4 << 8) | r3) as u16;
5243                bytes.extend_from_slice(&hw1.to_le_bytes());
5244                bytes.extend_from_slice(&hw2.to_le_bytes());
5245
5246                // Step 4: x = x * 0x01010101 >> 24
5247                // Load 0x01010101 into R3
5248                // MOVW R3, #0x0101
5249                bytes.extend_from_slice(&0xF240u16.to_le_bytes());
5250                bytes.extend_from_slice(&0x1301u16.to_le_bytes());
5251                // MOVT R3, #0x0101
5252                bytes.extend_from_slice(&0xF2C0u16.to_le_bytes());
5253                bytes.extend_from_slice(&0x1301u16.to_le_bytes());
5254
5255                // MUL R4, R4, R3
5256                // MUL T2: hw1 = 0xFB00|Rn, hw2 = 0xF000|(Rd<<8)|Rm
5257                let hw1: u16 = (0xFB00 | 4) as u16;
5258                let hw2: u16 = (0xF000 | (4 << 8) | r3) as u16;
5259                bytes.extend_from_slice(&hw1.to_le_bytes());
5260                bytes.extend_from_slice(&hw2.to_le_bytes());
5261
5262                // LSR.W R4, R4, #24
5263                // imm5=24=11000 → imm3=6, imm2=0, type=01(LSR)
5264                let hw1: u16 = 0xEA4F;
5265                let hw2: u16 = (0x6000 | (4 << 8) | 0x10 | 4) as u16;
5266                bytes.extend_from_slice(&hw1.to_le_bytes());
5267                bytes.extend_from_slice(&hw2.to_le_bytes());
5268
5269                // --- POPCNT for R5 (hi word) - same algorithm ---
5270                // Step 1
5271                let hw1: u16 = 0xEA4F;
5272                let hw2: u16 = ((r12 << 8) | 0x50 | 5) as u16;
5273                bytes.extend_from_slice(&hw1.to_le_bytes());
5274                bytes.extend_from_slice(&hw2.to_le_bytes());
5275
5276                // Load 0x55555555 into R3
5277                bytes.extend_from_slice(&0xF245u16.to_le_bytes());
5278                bytes.extend_from_slice(&0x5355u16.to_le_bytes());
5279                bytes.extend_from_slice(&0xF2C5u16.to_le_bytes());
5280                bytes.extend_from_slice(&0x5355u16.to_le_bytes());
5281
5282                let hw1: u16 = (0xEA00 | r12) as u16;
5283                let hw2: u16 = ((r12 << 8) | r3) as u16;
5284                bytes.extend_from_slice(&hw1.to_le_bytes());
5285                bytes.extend_from_slice(&hw2.to_le_bytes());
5286
5287                let hw1: u16 = (0xEBA0 | 5) as u16;
5288                let hw2: u16 = ((5 << 8) | r12) as u16;
5289                bytes.extend_from_slice(&hw1.to_le_bytes());
5290                bytes.extend_from_slice(&hw2.to_le_bytes());
5291
5292                // Step 2
5293                bytes.extend_from_slice(&0xF243u16.to_le_bytes());
5294                bytes.extend_from_slice(&0x3333u16.to_le_bytes());
5295                bytes.extend_from_slice(&0xF2C3u16.to_le_bytes());
5296                bytes.extend_from_slice(&0x3333u16.to_le_bytes());
5297
5298                let hw1: u16 = (0xEA00 | 5) as u16;
5299                let hw2: u16 = ((r12 << 8) | r3) as u16;
5300                bytes.extend_from_slice(&hw1.to_le_bytes());
5301                bytes.extend_from_slice(&hw2.to_le_bytes());
5302
5303                let hw1: u16 = 0xEA4F;
5304                let hw2: u16 = ((5 << 8) | 0x90 | 5) as u16;
5305                bytes.extend_from_slice(&hw1.to_le_bytes());
5306                bytes.extend_from_slice(&hw2.to_le_bytes());
5307
5308                let hw1: u16 = (0xEA00 | 5) as u16;
5309                let hw2: u16 = ((5 << 8) | r3) as u16;
5310                bytes.extend_from_slice(&hw1.to_le_bytes());
5311                bytes.extend_from_slice(&hw2.to_le_bytes());
5312
5313                let hw1: u16 = (0xEB00 | 5) as u16;
5314                let hw2: u16 = ((5 << 8) | r12) as u16;
5315                bytes.extend_from_slice(&hw1.to_le_bytes());
5316                bytes.extend_from_slice(&hw2.to_le_bytes());
5317
5318                // Step 3: LSR.W R12, R5, #4
5319                // imm5=4=00100 → imm3=1, imm2=0, type=01(LSR)
5320                let hw1: u16 = 0xEA4F;
5321                let hw2: u16 = (0x1000 | (r12 << 8) | 0x10 | 5) as u16;
5322                bytes.extend_from_slice(&hw1.to_le_bytes());
5323                bytes.extend_from_slice(&hw2.to_le_bytes());
5324
5325                let hw1: u16 = (0xEB00 | 5) as u16;
5326                let hw2: u16 = ((5 << 8) | r12) as u16;
5327                bytes.extend_from_slice(&hw1.to_le_bytes());
5328                bytes.extend_from_slice(&hw2.to_le_bytes());
5329
5330                // Load 0x0F0F0F0F into R3 (for hi-word)
5331                bytes.extend_from_slice(&0xF640u16.to_le_bytes());
5332                bytes.extend_from_slice(&0x730Fu16.to_le_bytes());
5333                bytes.extend_from_slice(&0xF6C0u16.to_le_bytes());
5334                bytes.extend_from_slice(&0x730Fu16.to_le_bytes());
5335
5336                let hw1: u16 = (0xEA00 | 5) as u16;
5337                let hw2: u16 = ((5 << 8) | r3) as u16;
5338                bytes.extend_from_slice(&hw1.to_le_bytes());
5339                bytes.extend_from_slice(&hw2.to_le_bytes());
5340
5341                // Step 4
5342                bytes.extend_from_slice(&0xF240u16.to_le_bytes());
5343                bytes.extend_from_slice(&0x1301u16.to_le_bytes());
5344                bytes.extend_from_slice(&0xF2C0u16.to_le_bytes());
5345                bytes.extend_from_slice(&0x1301u16.to_le_bytes());
5346
5347                // MUL R5, R5, R3
5348                // MUL T2: hw1 = 0xFB00|Rn, hw2 = 0xF000|(Rd<<8)|Rm
5349                let hw1: u16 = (0xFB00 | 5) as u16;
5350                let hw2: u16 = (0xF000 | (5 << 8) | r3) as u16;
5351                bytes.extend_from_slice(&hw1.to_le_bytes());
5352                bytes.extend_from_slice(&hw2.to_le_bytes());
5353
5354                // LSR.W R5, R5, #24
5355                // imm5=24=11000 → imm3=6, imm2=0, type=01(LSR)
5356                let hw1: u16 = 0xEA4F;
5357                let hw2: u16 = (0x6000 | (5 << 8) | 0x10 | 5) as u16;
5358                bytes.extend_from_slice(&hw1.to_le_bytes());
5359                bytes.extend_from_slice(&hw2.to_le_bytes());
5360
5361                // #632: the count must be carried ACROSS the scratch restore
5362                // in a register the POP cannot touch. rd is allocator-assigned
5363                // (any of R0-R8) and can land inside the {R3,R4,R5} restore set
5364                // — the old `ADDS rd, R4, R5; POP {R3,R4,R5}` destroyed the
5365                // result one instruction after computing it (0 for every input
5366                // under qemu). R12 is encoder scratch: never allocatable (#212)
5367                // and never in a restore set, so no choice of rd can collide.
5368                // ADD.W R12, R4, R5
5369                bytes.extend_from_slice(&0xEB04u16.to_le_bytes());
5370                bytes.extend_from_slice(&0x0C05u16.to_le_bytes());
5371
5372                // POP {R3, R4, R5}
5373                bytes.extend_from_slice(&0xBC38u16.to_le_bytes());
5374
5375                // MOV rd, R12 — after the restore. The 4-bit Rd (D:rd) form is
5376                // also total over rd = R8, where the old ADDS T1 3-bit field
5377                // silently corrupted the encoding (#178/#180 class).
5378                let mov: u16 =
5379                    (0x4600 | (((rd_bits >> 3) & 1) << 7) | (12 << 3) | (rd_bits & 7)) as u16;
5380                bytes.extend_from_slice(&mov.to_le_bytes());
5381
5382                // i64.popcnt returns i64, so clear high word: MOV.W rnhi, #0
5383                // (T2, 4 bytes — total over rnhi = R8, where the old 16-bit
5384                // MOVS encoding overflowed its 3-bit field into CMP R0, #0).
5385                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
5386                bytes.extend_from_slice(&(((rn_hi_bits & 0xF) << 8) as u16).to_le_bytes());
5387
5388                Ok(bytes)
5389            }
5390
5391            // I64Extend8S: Sign-extend low 8 bits to 64 bits
5392            // Result: rdlo = sign_extend_8(rnlo), rdhi = rdlo >> 31
5393            ArmOp::I64Extend8S { rdlo, rdhi, rnlo } => {
5394                let rdlo_bits = reg_to_bits(rdlo);
5395                let rdhi_bits = reg_to_bits(rdhi);
5396                let rnlo_bits = reg_to_bits(rnlo);
5397                let mut bytes = Vec::new();
5398
5399                // SXTB.W rdlo, rnlo (sign-extend byte to 32-bit)
5400                // SXTB T2: hw1 = 0xFA4F, hw2 = 0xF0<Rd><Rm>
5401                let hw1: u16 = 0xFA4F_u16;
5402                let hw2: u16 = (0xF080 | (rdlo_bits << 8) | rnlo_bits) as u16;
5403                bytes.extend_from_slice(&hw1.to_le_bytes());
5404                bytes.extend_from_slice(&hw2.to_le_bytes());
5405
5406                // ASR.W rdhi, rdlo, #31 (sign-extend to high word)
5407                // ASR (immediate): hw1 = 0xEA4F, hw2 = imm3:Rd:imm2:type:Rm
5408                // For imm5=31: imm3=111, imm2=11, type=10 (ASR)
5409                // hw2 = (7 << 12) | (rdhi << 8) | (3 << 6) | (2 << 4) | rdlo
5410                let hw1: u16 = 0xEA4F;
5411                let hw2: u16 = (0x70E0 | (rdhi_bits << 8) | rdlo_bits) as u16;
5412                bytes.extend_from_slice(&hw1.to_le_bytes());
5413                bytes.extend_from_slice(&hw2.to_le_bytes());
5414
5415                Ok(bytes)
5416            }
5417
5418            // I64Extend16S: Sign-extend low 16 bits to 64 bits
5419            // Result: rdlo = sign_extend_16(rnlo), rdhi = rdlo >> 31
5420            ArmOp::I64Extend16S { rdlo, rdhi, rnlo } => {
5421                let rdlo_bits = reg_to_bits(rdlo);
5422                let rdhi_bits = reg_to_bits(rdhi);
5423                let rnlo_bits = reg_to_bits(rnlo);
5424                let mut bytes = Vec::new();
5425
5426                // SXTH.W rdlo, rnlo (sign-extend halfword to 32-bit)
5427                // SXTH T2: hw1 = 0xFA0F, hw2 = 0xF0<Rd><Rm>
5428                let hw1: u16 = 0xFA0F_u16;
5429                let hw2: u16 = (0xF080 | (rdlo_bits << 8) | rnlo_bits) as u16;
5430                bytes.extend_from_slice(&hw1.to_le_bytes());
5431                bytes.extend_from_slice(&hw2.to_le_bytes());
5432
5433                // ASR.W rdhi, rdlo, #31 (sign-extend to high word)
5434                let hw1: u16 = 0xEA4F;
5435                let hw2: u16 = (0x70E0 | (rdhi_bits << 8) | rdlo_bits) as u16;
5436                bytes.extend_from_slice(&hw1.to_le_bytes());
5437                bytes.extend_from_slice(&hw2.to_le_bytes());
5438
5439                Ok(bytes)
5440            }
5441
5442            // I64Extend32S: Sign-extend low 32 bits to 64 bits
5443            // Result: rdlo = rnlo, rdhi = rnlo >> 31
5444            ArmOp::I64Extend32S { rdlo, rdhi, rnlo } => {
5445                let rdlo_bits = reg_to_bits(rdlo);
5446                let rdhi_bits = reg_to_bits(rdhi);
5447                let rnlo_bits = reg_to_bits(rnlo);
5448                let mut bytes = Vec::new();
5449
5450                // MOV rdlo, rnlo (if different)
5451                if rdlo_bits != rnlo_bits {
5452                    // MOV Rd, Rm (16-bit): 0100 0110 D Rm Rd[2:0]
5453                    let d_bit = ((rdlo_bits >> 3) & 1) as u16;
5454                    let mov: u16 = 0x4600
5455                        | (d_bit << 7)
5456                        | ((rnlo_bits as u16) << 3)
5457                        | ((rdlo_bits & 0x7) as u16);
5458                    bytes.extend_from_slice(&mov.to_le_bytes());
5459                }
5460
5461                // ASR.W rdhi, rnlo, #31 (sign-extend to high word)
5462                let hw1: u16 = 0xEA4F;
5463                let hw2: u16 = (0x70E0 | (rdhi_bits << 8) | rnlo_bits) as u16;
5464                bytes.extend_from_slice(&hw1.to_le_bytes());
5465                bytes.extend_from_slice(&hw2.to_le_bytes());
5466
5467                Ok(bytes)
5468            }
5469
5470            // SelectMove: IT <cond>; MOV{cond} rd, rm
5471            // Conditional move: only execute MOV if condition is true
5472            ArmOp::SelectMove { rd, rm, cond } => {
5473                let rd_bits = reg_to_bits(rd) as u16;
5474                let rm_bits = reg_to_bits(rm) as u16;
5475
5476                // Condition code encoding for IT block
5477                use synth_synthesis::Condition;
5478                let cond_bits: u16 = match cond {
5479                    Condition::EQ => 0x0, // Equal
5480                    Condition::NE => 0x1, // Not equal
5481                    Condition::HS => 0x2, // Higher or same (unsigned >=)
5482                    Condition::LO => 0x3, // Lower (unsigned <)
5483                    Condition::HI => 0x8, // Higher (unsigned >)
5484                    Condition::LS => 0x9, // Lower or same (unsigned <=)
5485                    Condition::GE => 0xA, // Greater or equal (signed)
5486                    Condition::LT => 0xB, // Less than (signed)
5487                    Condition::GT => 0xC, // Greater than (signed)
5488                    Condition::LE => 0xD, // Less or equal (signed)
5489                };
5490
5491                // IT <cond>: single Then block (mask = 0x8 for T only)
5492                // IT instruction: 1011 1111 firstcond mask
5493                let it_instr: u16 = 0xBF00 | (cond_bits << 4) | 0x8;
5494
5495                // MOV Rd, Rm (16-bit): 0100 0110 D Rm Rd[2:0]
5496                // This MOV will only execute if condition is true due to IT block
5497                let d_bit = (rd_bits >> 3) & 1;
5498                let mov_instr: u16 = 0x4600 | (d_bit << 7) | (rm_bits << 3) | (rd_bits & 0x7);
5499
5500                // Emit: IT <cond>, MOV rd, rm
5501                let mut bytes = it_instr.to_le_bytes().to_vec();
5502                bytes.extend_from_slice(&mov_instr.to_le_bytes());
5503                Ok(bytes)
5504            }
5505
5506            // Popcnt: Population count (count set bits)
5507            // ARM Cortex-M has no native POPCNT, so we implement the bit manipulation algorithm:
5508            // x = x - ((x >> 1) & 0x55555555);
5509            // x = (x & 0x33333333) + ((x >> 2) & 0x33333333);
5510            // x = (x + (x >> 4)) & 0x0F0F0F0F;
5511            // x = x + (x >> 8);
5512            // x = x + (x >> 16);
5513            // return x & 0x3F;
5514            //
5515            // Uses rd as working register and R12 as scratch for constants
5516            ArmOp::Popcnt { rd, rm } => {
5517                let mut bytes = Vec::new();
5518
5519                // First, move rm to rd if they're different
5520                if rd != rm {
5521                    let rd_bits = reg_to_bits(rd) as u16;
5522                    let rm_bits = reg_to_bits(rm) as u16;
5523                    // MOV Rd, Rm (16-bit): 0100 0110 D Rm Rd[2:0]
5524                    let d_bit = (rd_bits >> 3) & 1;
5525                    let mov_instr: u16 = 0x4600 | (d_bit << 7) | (rm_bits << 3) | (rd_bits & 0x7);
5526                    bytes.extend_from_slice(&mov_instr.to_le_bytes());
5527                }
5528
5529                // Step 1: x = x - ((x >> 1) & 0x55555555)
5530                // Load 0x55555555 into R12
5531                bytes.extend_from_slice(&self.encode_thumb32_movw_raw(12, 0x5555)?);
5532                bytes.extend_from_slice(&self.encode_thumb32_movt_raw(12, 0x5555)?);
5533
5534                // R12_temp = rd >> 1
5535                // We need a second scratch register. Use R11.
5536                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(11, reg_to_bits(rd), 1)?);
5537
5538                // R11 = R11 & R12 (R11 = (x >> 1) & 0x55555555)
5539                bytes.extend_from_slice(&self.encode_thumb32_and_reg_raw(11, 11, 12)?);
5540
5541                // rd = rd - R11
5542                bytes.extend_from_slice(&self.encode_thumb32_sub_reg_raw(
5543                    reg_to_bits(rd),
5544                    reg_to_bits(rd),
5545                    11,
5546                )?);
5547
5548                // Step 2: x = (x & 0x33333333) + ((x >> 2) & 0x33333333)
5549                // Load 0x33333333 into R12
5550                bytes.extend_from_slice(&self.encode_thumb32_movw_raw(12, 0x3333)?);
5551                bytes.extend_from_slice(&self.encode_thumb32_movt_raw(12, 0x3333)?);
5552
5553                // R11 = rd & R12
5554                bytes.extend_from_slice(&self.encode_thumb32_and_reg_raw(
5555                    11,
5556                    reg_to_bits(rd),
5557                    12,
5558                )?);
5559
5560                // rd = rd >> 2
5561                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(
5562                    reg_to_bits(rd),
5563                    reg_to_bits(rd),
5564                    2,
5565                )?);
5566
5567                // rd = rd & R12
5568                bytes.extend_from_slice(&self.encode_thumb32_and_reg_raw(
5569                    reg_to_bits(rd),
5570                    reg_to_bits(rd),
5571                    12,
5572                )?);
5573
5574                // rd = rd + R11
5575                bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
5576                    reg_to_bits(rd),
5577                    reg_to_bits(rd),
5578                    11,
5579                )?);
5580
5581                // Step 3: x = (x + (x >> 4)) & 0x0F0F0F0F
5582                // R11 = rd >> 4
5583                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(11, reg_to_bits(rd), 4)?);
5584
5585                // rd = rd + R11
5586                bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
5587                    reg_to_bits(rd),
5588                    reg_to_bits(rd),
5589                    11,
5590                )?);
5591
5592                // Load 0x0F0F0F0F into R12
5593                bytes.extend_from_slice(&self.encode_thumb32_movw_raw(12, 0x0F0F)?);
5594                bytes.extend_from_slice(&self.encode_thumb32_movt_raw(12, 0x0F0F)?);
5595
5596                // rd = rd & R12
5597                bytes.extend_from_slice(&self.encode_thumb32_and_reg_raw(
5598                    reg_to_bits(rd),
5599                    reg_to_bits(rd),
5600                    12,
5601                )?);
5602
5603                // Step 4: x = x + (x >> 8)
5604                // R11 = rd >> 8
5605                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(11, reg_to_bits(rd), 8)?);
5606
5607                // rd = rd + R11
5608                bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
5609                    reg_to_bits(rd),
5610                    reg_to_bits(rd),
5611                    11,
5612                )?);
5613
5614                // Step 5: x = x + (x >> 16)
5615                // R11 = rd >> 16
5616                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(11, reg_to_bits(rd), 16)?);
5617
5618                // rd = rd + R11
5619                bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
5620                    reg_to_bits(rd),
5621                    reg_to_bits(rd),
5622                    11,
5623                )?);
5624
5625                // Step 6: return x & 0x3F
5626                // AND with 0x3F (small immediate, can use BIC or AND with immediate)
5627                bytes.extend_from_slice(&self.encode_thumb32_and_imm_raw(
5628                    reg_to_bits(rd),
5629                    reg_to_bits(rd),
5630                    0x3F,
5631                )?);
5632
5633                Ok(bytes)
5634            }
5635
5636            // I64DivU: 64-bit unsigned division using binary long division
5637            // Core: R0:R1 = dividend, R2:R3 = divisor -> R0:R1 = quotient
5638            // Uses: R4-R7, R12 as loop counter (avoid R8 for Renode compatibility)
5639            //
5640            // #610: the fixed-ABI wrapper marshals the selector-assigned
5641            // operand registers into the core's fixed regs and lands the
5642            // result in rd — pre-#610 this arm IGNORED its register fields,
5643            // so the selector read its rd pair (e.g. R4:R5) after the core's
5644            // own POP restored the stale caller values over it: 0 for every
5645            // input. A zero divisor now traps (UDF #0), per WASM semantics.
5646            ArmOp::I64DivU {
5647                rdlo,
5648                rdhi,
5649                rnlo,
5650                rnhi,
5651                rmlo,
5652                rmhi,
5653                elide_zero_guard,
5654            } => {
5655                let mut bytes = Vec::new();
5656                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, rmlo, rmhi]);
5657                // #494 phase 2b: elided only under a certificate-discharged
5658                // UNSAT(P ∧ divisor == 0) obligation (fact-spec pass).
5659                if !elide_zero_guard {
5660                    emit_i64_divisor_zero_trap(&mut bytes);
5661                }
5662
5663                // PUSH {R4-R7} - save scratch registers (NO LR — this is inline code)
5664                // 16-bit PUSH: 1011 010 M rrrrrrrr where M=0 (no LR), r=R4-R7 = 0xF0
5665                // Encoding: 1011 0100 1111 0000 = 0xB4F0
5666                bytes.extend_from_slice(&0xB4F0u16.to_le_bytes());
5667
5668                // Initialize quotient (R4:R5) = 0
5669                bytes.extend_from_slice(&0x2400u16.to_le_bytes()); // MOV R4, #0
5670                bytes.extend_from_slice(&0x2500u16.to_le_bytes()); // MOV R5, #0
5671
5672                // Initialize remainder (R6:R7) = 0
5673                bytes.extend_from_slice(&0x2600u16.to_le_bytes()); // MOV R6, #0
5674                bytes.extend_from_slice(&0x2700u16.to_le_bytes()); // MOV R7, #0
5675
5676                // Initialize loop counter R12 = 64 (use R12 scratch instead of R8)
5677                // MOV.W R12, #64: F04F 0C40
5678                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
5679                bytes.extend_from_slice(&0x0C40u16.to_le_bytes());
5680
5681                // Loop start
5682                let loop_start = bytes.len();
5683
5684                // === Loop body: process one bit ===
5685
5686                // 1. Shift quotient R4:R5 left by 1
5687                // LSLS R5, R5, #1 (16-bit: 0000 0010 1010 1101 = 0x006D -> actually 0x002D for LSL R5,R5,#1)
5688                // LSL Rd, Rm, #imm5: 000 00 imm5 Rm Rd = 000 00 00001 101 101 = 0x006D
5689                bytes.extend_from_slice(&0x006Du16.to_le_bytes()); // LSLS R5, R5, #1
5690                // Get carry from R4 into R5: ORR R5, R5, R4 LSR #31
5691                // Thumb-2 ORR with shifted register: EA45 75D4 = ORR.W R5, R5, R4, LSR #31
5692                // 11101010 010 S Rn | 0 imm3 Rd imm2 type Rm
5693                // type=01 (LSR), imm5=31 (imm3=111, imm2=11)
5694                bytes.extend_from_slice(&0xEA45u16.to_le_bytes());
5695                bytes.extend_from_slice(&0x75D4u16.to_le_bytes()); // ORR.W R5, R5, R4, LSR #31
5696                // LSLS R4, R4, #1: 000 00 00001 100 100 = 0x0064
5697                bytes.extend_from_slice(&0x0064u16.to_le_bytes()); // LSLS R4, R4, #1
5698
5699                // 2. Shift remainder R6:R7 left by 1, OR in MSB of dividend R1
5700                // LSLS R7, R7, #1
5701                bytes.extend_from_slice(&0x007Fu16.to_le_bytes()); // LSLS R7, R7, #1
5702                // ORR.W R7, R7, R6, LSR #31
5703                bytes.extend_from_slice(&0xEA47u16.to_le_bytes());
5704                bytes.extend_from_slice(&0x77D6u16.to_le_bytes());
5705                // LSLS R6, R6, #1
5706                bytes.extend_from_slice(&0x0076u16.to_le_bytes()); // LSLS R6, R6, #1
5707                // ORR.W R6, R6, R1, LSR #31 (bring in MSB of dividend high)
5708                bytes.extend_from_slice(&0xEA46u16.to_le_bytes());
5709                bytes.extend_from_slice(&0x76D1u16.to_le_bytes());
5710
5711                // 3. Shift dividend R0:R1 left by 1
5712                // LSLS R1, R1, #1
5713                bytes.extend_from_slice(&0x0049u16.to_le_bytes()); // LSLS R1, R1, #1
5714                // ORR.W R1, R1, R0, LSR #31
5715                bytes.extend_from_slice(&0xEA41u16.to_le_bytes());
5716                bytes.extend_from_slice(&0x71D0u16.to_le_bytes());
5717                // LSLS R0, R0, #1
5718                bytes.extend_from_slice(&0x0040u16.to_le_bytes()); // LSLS R0, R0, #1
5719
5720                // 4. Compare remainder >= divisor (64-bit unsigned comparison)
5721                // Compare high words first: CMP R7, R3
5722                // CMP Rn, Rm encoding: 0x4280 | (Rm << 3) | Rn
5723                bytes.extend_from_slice(&0x429Fu16.to_le_bytes()); // CMP R7, R3 (16-bit)
5724                // BHI means R7 > R3 (unsigned) - definitely subtract
5725                // BLO means R7 < R3 - definitely don't subtract
5726                // BEQ means need to check low words
5727
5728                // If high > divisor high: branch to subtract (forward +offset)
5729                // BHI.N +6 (skip CMP, skip BLO, do subtract)
5730                // BHI: 1101 1000 offset8 where cond=1000 (HI)
5731                bytes.extend_from_slice(&0xD802u16.to_le_bytes()); // BHI +4 (to subtract block)
5732
5733                // If high < divisor high: branch past subtract
5734                // BLO.N +10 (skip to decrement)
5735                bytes.extend_from_slice(&0xD306u16.to_le_bytes()); // BLO/BCC +12 (past subtract)
5736
5737                // High words equal, compare low: CMP R6, R2
5738                bytes.extend_from_slice(&0x4296u16.to_le_bytes()); // CMP R6, R2 (16-bit)
5739                // BLO/BCC past subtract (skip SUBS+SBC.W+ORR.W = 10 bytes = 4 halfwords from PC+4)
5740                bytes.extend_from_slice(&0xD304u16.to_le_bytes()); // BCC +4 halfwords (past subtract)
5741
5742                // === Subtract block: remainder -= divisor, quotient |= 1 ===
5743                // SUBS R6, R6, R2
5744                bytes.extend_from_slice(&0x1AB6u16.to_le_bytes()); // SUBS R6, R6, R2 (16-bit)
5745                // SBC R7, R7, R3 (with borrow)
5746                // Thumb-2 SBC.W: EB67 0703 = SBC.W R7, R7, R3
5747                bytes.extend_from_slice(&0xEB67u16.to_le_bytes());
5748                bytes.extend_from_slice(&0x0703u16.to_le_bytes());
5749                // ORR R4, R4, #1 (set bit 0 of quotient low)
5750                bytes.extend_from_slice(&0xF044u16.to_le_bytes()); // ORR.W R4, R4, #1
5751                bytes.extend_from_slice(&0x0401u16.to_le_bytes());
5752
5753                // === Decrement counter and loop ===
5754                // SUBS.W R12, R12, #1 (decrement loop counter)
5755                // SUBS.W R12, R12, #1: F1BC 0C01
5756                bytes.extend_from_slice(&0xF1BCu16.to_le_bytes());
5757                bytes.extend_from_slice(&0x0C01u16.to_le_bytes());
5758
5759                // BNE back to loop_start
5760                let branch_offset_bytes = bytes.len() - loop_start + 4; // +4 for pipeline
5761                let offset_halfwords = -((branch_offset_bytes / 2) as i16);
5762                let bne_encoding = 0xD100u16 | ((offset_halfwords as u16) & 0xFF);
5763                bytes.extend_from_slice(&bne_encoding.to_le_bytes());
5764
5765                // === Loop done, move quotient to R0:R1 ===
5766                bytes.extend_from_slice(&0x4620u16.to_le_bytes()); // MOV R0, R4
5767                bytes.extend_from_slice(&0x4629u16.to_le_bytes()); // MOV R1, R5
5768
5769                // POP {R4-R7} - restore scratch registers (NO PC — inline code continues)
5770                // 16-bit POP: 1011 110 P rrrrrrrr where P=0 (no PC), r=R4-R7 = 0xF0
5771                // Encoding: 1011 1100 1111 0000 = 0xBCF0
5772                bytes.extend_from_slice(&0xBCF0u16.to_le_bytes());
5773
5774                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
5775                Ok(bytes)
5776            }
5777
5778            // I64DivS: 64-bit signed division
5779            // Converts to unsigned, divides, then applies sign
5780            // Core: R0:R1 = dividend (signed), R2:R3 = divisor (signed)
5781            //   ->  R0:R1 = quotient (signed)
5782            // #610: fixed-ABI wrapper + zero-divisor trap (see I64DivU).
5783            ArmOp::I64DivS {
5784                rdlo,
5785                rdhi,
5786                rnlo,
5787                rnhi,
5788                rmlo,
5789                rmhi,
5790                elide_zero_guard,
5791                elide_overflow_guard,
5792            } => {
5793                let mut bytes = Vec::new();
5794                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, rmlo, rmhi]);
5795                // #494 phase 2b: two INDEPENDENT guards, two INDEPENDENT
5796                // obligations. The zero guard falls to UNSAT(P ∧ divisor == 0);
5797                // the #633 overflow guard falls ONLY to
5798                // UNSAT(P ∧ dividend == INT64_MIN ∧ divisor == -1) — a
5799                // divisor-nonzero fact alone must keep it.
5800                if !elide_zero_guard {
5801                    emit_i64_divisor_zero_trap(&mut bytes);
5802                }
5803                if !elide_overflow_guard {
5804                    // #633: INT64_MIN / -1 overflows — trap like the i32 path
5805                    // (rem_s stays guard-free: rem_s(INT64_MIN, -1) == 0).
5806                    emit_i64_divs_overflow_trap(&mut bytes);
5807                }
5808
5809                // PUSH {R4-R11} - save scratch registers (NO LR — inline code)
5810                bytes.extend_from_slice(&0xE92Du16.to_le_bytes());
5811                bytes.extend_from_slice(&0x0FF0u16.to_le_bytes());
5812
5813                // Save result sign in R9: R9 = R1 XOR R3 (sign bit = MSB)
5814                // EOR.W R9, R1, R3
5815                bytes.extend_from_slice(&0xEA81u16.to_le_bytes());
5816                bytes.extend_from_slice(&0x0903u16.to_le_bytes());
5817
5818                // If dividend negative (R1 MSB set), negate it
5819                // TST R1, R1 (check sign)
5820                bytes.extend_from_slice(&0x4209u16.to_le_bytes()); // TST R1, R1
5821                // BPL skip_neg_dividend (+10 bytes = 5 halfwords)
5822                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
5823
5824                // Negate R0:R1 (64-bit): RSBS R0, R0, #0; SBC R1, R1, R1 LSL #1
5825                // Actually: MVN R0, R0; MVN R1, R1; ADDS R0, R0, #1; ADC R1, R1, #0
5826                bytes.extend_from_slice(&0x43C0u16.to_le_bytes()); // MVNS R0, R0
5827                bytes.extend_from_slice(&0x43C9u16.to_le_bytes()); // MVNS R1, R1
5828                bytes.extend_from_slice(&0x1C40u16.to_le_bytes()); // ADDS R0, R0, #1
5829                bytes.extend_from_slice(&0xF141u16.to_le_bytes()); // ADC.W R1, R1, #0
5830                bytes.extend_from_slice(&0x0100u16.to_le_bytes());
5831
5832                // If divisor negative (R3 MSB set), negate it
5833                bytes.extend_from_slice(&0x421Bu16.to_le_bytes()); // TST R3, R3
5834                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
5835
5836                // Negate R2:R3
5837                bytes.extend_from_slice(&0x43D2u16.to_le_bytes()); // MVNS R2, R2
5838                bytes.extend_from_slice(&0x43DBu16.to_le_bytes()); // MVNS R3, R3
5839                bytes.extend_from_slice(&0x1C52u16.to_le_bytes()); // ADDS R2, R2, #1
5840                bytes.extend_from_slice(&0xF143u16.to_le_bytes()); // ADC.W R3, R3, #0
5841                bytes.extend_from_slice(&0x0300u16.to_le_bytes());
5842
5843                // === Now do unsigned division (same as I64DivU) ===
5844                // Initialize quotient (R4:R5) = 0
5845                bytes.extend_from_slice(&0x2400u16.to_le_bytes());
5846                bytes.extend_from_slice(&0x2500u16.to_le_bytes());
5847                // Initialize remainder (R6:R7) = 0
5848                bytes.extend_from_slice(&0x2600u16.to_le_bytes());
5849                bytes.extend_from_slice(&0x2700u16.to_le_bytes());
5850                // Initialize loop counter R8 = 64
5851                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
5852                bytes.extend_from_slice(&0x0840u16.to_le_bytes());
5853
5854                let loop_start = bytes.len();
5855
5856                // Shift quotient left
5857                bytes.extend_from_slice(&0x006Du16.to_le_bytes()); // LSLS R5, R5, #1
5858                bytes.extend_from_slice(&0xEA45u16.to_le_bytes()); // ORR.W R5, R5, R4, LSR #31
5859                bytes.extend_from_slice(&0x75D4u16.to_le_bytes());
5860                bytes.extend_from_slice(&0x0064u16.to_le_bytes()); // LSLS R4, R4, #1
5861
5862                // Shift remainder left, OR in MSB of dividend
5863                bytes.extend_from_slice(&0x007Fu16.to_le_bytes()); // LSLS R7, R7, #1
5864                bytes.extend_from_slice(&0xEA47u16.to_le_bytes()); // ORR.W R7, R7, R6, LSR #31
5865                bytes.extend_from_slice(&0x77D6u16.to_le_bytes());
5866                bytes.extend_from_slice(&0x0076u16.to_le_bytes()); // LSLS R6, R6, #1
5867                bytes.extend_from_slice(&0xEA46u16.to_le_bytes()); // ORR.W R6, R6, R1, LSR #31
5868                bytes.extend_from_slice(&0x76D1u16.to_le_bytes());
5869
5870                // Shift dividend left
5871                bytes.extend_from_slice(&0x0049u16.to_le_bytes()); // LSLS R1, R1, #1
5872                bytes.extend_from_slice(&0xEA41u16.to_le_bytes()); // ORR.W R1, R1, R0, LSR #31
5873                bytes.extend_from_slice(&0x71D0u16.to_le_bytes());
5874                bytes.extend_from_slice(&0x0040u16.to_le_bytes()); // LSLS R0, R0, #1
5875
5876                // Compare and conditionally subtract
5877                bytes.extend_from_slice(&0x429Fu16.to_le_bytes()); // CMP R7, R3
5878                bytes.extend_from_slice(&0xD802u16.to_le_bytes()); // BHI +4
5879                bytes.extend_from_slice(&0xD306u16.to_le_bytes()); // BCC +12
5880                bytes.extend_from_slice(&0x4296u16.to_le_bytes()); // CMP R6, R2
5881                bytes.extend_from_slice(&0xD304u16.to_le_bytes()); // BCC +4 halfwords
5882
5883                // Subtract and set quotient bit
5884                bytes.extend_from_slice(&0x1AB6u16.to_le_bytes()); // SUBS R6, R6, R2
5885                bytes.extend_from_slice(&0xEB67u16.to_le_bytes()); // SBC.W R7, R7, R3
5886                bytes.extend_from_slice(&0x0703u16.to_le_bytes());
5887                bytes.extend_from_slice(&0xF044u16.to_le_bytes()); // ORR.W R4, R4, #1
5888                bytes.extend_from_slice(&0x0401u16.to_le_bytes());
5889
5890                // Decrement and loop
5891                bytes.extend_from_slice(&0xF1B8u16.to_le_bytes()); // SUB.W R8, R8, #1
5892                bytes.extend_from_slice(&0x0801u16.to_le_bytes());
5893
5894                let branch_offset_bytes = bytes.len() - loop_start + 4;
5895                let offset_halfwords = -((branch_offset_bytes / 2) as i16);
5896                let bne_encoding = 0xD100u16 | ((offset_halfwords as u16) & 0xFF);
5897                bytes.extend_from_slice(&bne_encoding.to_le_bytes());
5898
5899                // Move quotient to R0:R1
5900                bytes.extend_from_slice(&0x4620u16.to_le_bytes()); // MOV R0, R4
5901                bytes.extend_from_slice(&0x4629u16.to_le_bytes()); // MOV R1, R5
5902
5903                // If result should be negative (R9 MSB set), negate R0:R1
5904                bytes.extend_from_slice(&0xF1B9u16.to_le_bytes()); // TST.W R9, R9 (check MSB)
5905                bytes.extend_from_slice(&0x0F00u16.to_le_bytes());
5906                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8 (skip negation)
5907
5908                // Negate result R0:R1
5909                bytes.extend_from_slice(&0x43C0u16.to_le_bytes()); // MVNS R0, R0
5910                bytes.extend_from_slice(&0x43C9u16.to_le_bytes()); // MVNS R1, R1
5911                bytes.extend_from_slice(&0x1C40u16.to_le_bytes()); // ADDS R0, R0, #1
5912                bytes.extend_from_slice(&0xF141u16.to_le_bytes()); // ADC.W R1, R1, #0
5913                bytes.extend_from_slice(&0x0100u16.to_le_bytes());
5914
5915                // POP {R4-R11} - restore scratch registers (NO PC — inline code continues)
5916                bytes.extend_from_slice(&0xE8BDu16.to_le_bytes());
5917                bytes.extend_from_slice(&0x0FF0u16.to_le_bytes());
5918
5919                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
5920                Ok(bytes)
5921            }
5922
5923            // I64RemU: 64-bit unsigned remainder using binary long division
5924            // Same algorithm as I64DivU but returns remainder instead of quotient
5925            // Core: R0:R1 = dividend, R2:R3 = divisor -> R0:R1 = remainder
5926            // #610: fixed-ABI wrapper + zero-divisor trap (see I64DivU).
5927            ArmOp::I64RemU {
5928                rdlo,
5929                rdhi,
5930                rnlo,
5931                rnhi,
5932                rmlo,
5933                rmhi,
5934                elide_zero_guard,
5935            } => {
5936                let mut bytes = Vec::new();
5937                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, rmlo, rmhi]);
5938                if !elide_zero_guard {
5939                    emit_i64_divisor_zero_trap(&mut bytes);
5940                }
5941
5942                // PUSH {R4-R8} - save scratch registers (NO LR — inline code)
5943                bytes.extend_from_slice(&0xE92Du16.to_le_bytes());
5944                bytes.extend_from_slice(&0x01F0u16.to_le_bytes());
5945
5946                // Initialize quotient (R4:R5) = 0 (computed but not returned)
5947                bytes.extend_from_slice(&0x2400u16.to_le_bytes());
5948                bytes.extend_from_slice(&0x2500u16.to_le_bytes());
5949                // Initialize remainder (R6:R7) = 0
5950                bytes.extend_from_slice(&0x2600u16.to_le_bytes());
5951                bytes.extend_from_slice(&0x2700u16.to_le_bytes());
5952                // Initialize loop counter R8 = 64
5953                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
5954                bytes.extend_from_slice(&0x0840u16.to_le_bytes());
5955
5956                let loop_start = bytes.len();
5957
5958                // Shift quotient left (not needed for result, but keeps algorithm same)
5959                bytes.extend_from_slice(&0x006Du16.to_le_bytes()); // LSLS R5, R5, #1
5960                bytes.extend_from_slice(&0xEA45u16.to_le_bytes()); // ORR.W R5, R5, R4, LSR #31
5961                bytes.extend_from_slice(&0x75D4u16.to_le_bytes());
5962                bytes.extend_from_slice(&0x0064u16.to_le_bytes()); // LSLS R4, R4, #1
5963
5964                // Shift remainder left, OR in MSB of dividend
5965                bytes.extend_from_slice(&0x007Fu16.to_le_bytes()); // LSLS R7, R7, #1
5966                bytes.extend_from_slice(&0xEA47u16.to_le_bytes()); // ORR.W R7, R7, R6, LSR #31
5967                bytes.extend_from_slice(&0x77D6u16.to_le_bytes());
5968                bytes.extend_from_slice(&0x0076u16.to_le_bytes()); // LSLS R6, R6, #1
5969                bytes.extend_from_slice(&0xEA46u16.to_le_bytes()); // ORR.W R6, R6, R1, LSR #31
5970                bytes.extend_from_slice(&0x76D1u16.to_le_bytes());
5971
5972                // Shift dividend left
5973                bytes.extend_from_slice(&0x0049u16.to_le_bytes()); // LSLS R1, R1, #1
5974                bytes.extend_from_slice(&0xEA41u16.to_le_bytes()); // ORR.W R1, R1, R0, LSR #31
5975                bytes.extend_from_slice(&0x71D0u16.to_le_bytes());
5976                bytes.extend_from_slice(&0x0040u16.to_le_bytes()); // LSLS R0, R0, #1
5977
5978                // Compare and conditionally subtract
5979                bytes.extend_from_slice(&0x429Fu16.to_le_bytes()); // CMP R7, R3
5980                bytes.extend_from_slice(&0xD802u16.to_le_bytes()); // BHI +4
5981                bytes.extend_from_slice(&0xD306u16.to_le_bytes()); // BCC +12
5982                bytes.extend_from_slice(&0x4296u16.to_le_bytes()); // CMP R6, R2
5983                bytes.extend_from_slice(&0xD304u16.to_le_bytes()); // BCC +4 halfwords
5984
5985                // Subtract and set quotient bit
5986                bytes.extend_from_slice(&0x1AB6u16.to_le_bytes()); // SUBS R6, R6, R2
5987                bytes.extend_from_slice(&0xEB67u16.to_le_bytes()); // SBC.W R7, R7, R3
5988                bytes.extend_from_slice(&0x0703u16.to_le_bytes());
5989                bytes.extend_from_slice(&0xF044u16.to_le_bytes()); // ORR.W R4, R4, #1
5990                bytes.extend_from_slice(&0x0401u16.to_le_bytes());
5991
5992                // Decrement and loop
5993                bytes.extend_from_slice(&0xF1B8u16.to_le_bytes()); // SUB.W R8, R8, #1
5994                bytes.extend_from_slice(&0x0801u16.to_le_bytes());
5995
5996                let branch_offset_bytes = bytes.len() - loop_start + 4;
5997                let offset_halfwords = -((branch_offset_bytes / 2) as i16);
5998                let bne_encoding = 0xD100u16 | ((offset_halfwords as u16) & 0xFF);
5999                bytes.extend_from_slice(&bne_encoding.to_le_bytes());
6000
6001                // Move REMAINDER to R0:R1 (difference from I64DivU)
6002                bytes.extend_from_slice(&0x4630u16.to_le_bytes()); // MOV R0, R6
6003                bytes.extend_from_slice(&0x4639u16.to_le_bytes()); // MOV R1, R7
6004
6005                // POP {R4-R8} - restore scratch registers (NO PC — inline code continues)
6006                bytes.extend_from_slice(&0xE8BDu16.to_le_bytes());
6007                bytes.extend_from_slice(&0x01F0u16.to_le_bytes());
6008
6009                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
6010                Ok(bytes)
6011            }
6012
6013            // I64RemS: 64-bit signed remainder
6014            // Remainder sign follows dividend sign (not quotient rule)
6015            // Core: R0:R1 = dividend (signed), R2:R3 = divisor (signed)
6016            //   ->  R0:R1 = remainder (signed, same sign as dividend)
6017            // #610: fixed-ABI wrapper + zero-divisor trap (see I64DivU).
6018            ArmOp::I64RemS {
6019                rdlo,
6020                rdhi,
6021                rnlo,
6022                rnhi,
6023                rmlo,
6024                rmhi,
6025                elide_zero_guard,
6026            } => {
6027                let mut bytes = Vec::new();
6028                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, rmlo, rmhi]);
6029                if !elide_zero_guard {
6030                    emit_i64_divisor_zero_trap(&mut bytes);
6031                }
6032
6033                // PUSH {R4-R11} - save scratch registers (NO LR — inline code)
6034                bytes.extend_from_slice(&0xE92Du16.to_le_bytes());
6035                bytes.extend_from_slice(&0x0FF0u16.to_le_bytes());
6036
6037                // Save dividend sign in R9 (remainder sign = dividend sign)
6038                // MOV R9, R1 (just need the sign bit)
6039                bytes.extend_from_slice(&0x4689u16.to_le_bytes()); // MOV R9, R1
6040
6041                // If dividend negative (R1 MSB set), negate it
6042                bytes.extend_from_slice(&0x4209u16.to_le_bytes()); // TST R1, R1
6043                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
6044
6045                // Negate R0:R1
6046                bytes.extend_from_slice(&0x43C0u16.to_le_bytes()); // MVNS R0, R0
6047                bytes.extend_from_slice(&0x43C9u16.to_le_bytes()); // MVNS R1, R1
6048                bytes.extend_from_slice(&0x1C40u16.to_le_bytes()); // ADDS R0, R0, #1
6049                bytes.extend_from_slice(&0xF141u16.to_le_bytes()); // ADC.W R1, R1, #0
6050                bytes.extend_from_slice(&0x0100u16.to_le_bytes());
6051
6052                // If divisor negative (R3 MSB set), negate it
6053                bytes.extend_from_slice(&0x421Bu16.to_le_bytes()); // TST R3, R3
6054                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
6055
6056                // Negate R2:R3
6057                bytes.extend_from_slice(&0x43D2u16.to_le_bytes()); // MVNS R2, R2
6058                bytes.extend_from_slice(&0x43DBu16.to_le_bytes()); // MVNS R3, R3
6059                bytes.extend_from_slice(&0x1C52u16.to_le_bytes()); // ADDS R2, R2, #1
6060                bytes.extend_from_slice(&0xF143u16.to_le_bytes()); // ADC.W R3, R3, #0
6061                bytes.extend_from_slice(&0x0300u16.to_le_bytes());
6062
6063                // === Unsigned division algorithm ===
6064                // Initialize quotient (R4:R5) = 0
6065                bytes.extend_from_slice(&0x2400u16.to_le_bytes());
6066                bytes.extend_from_slice(&0x2500u16.to_le_bytes());
6067                // Initialize remainder (R6:R7) = 0
6068                bytes.extend_from_slice(&0x2600u16.to_le_bytes());
6069                bytes.extend_from_slice(&0x2700u16.to_le_bytes());
6070                // Initialize loop counter R8 = 64
6071                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
6072                bytes.extend_from_slice(&0x0840u16.to_le_bytes());
6073
6074                let loop_start = bytes.len();
6075
6076                // Shift quotient left
6077                bytes.extend_from_slice(&0x006Du16.to_le_bytes()); // LSLS R5, R5, #1
6078                bytes.extend_from_slice(&0xEA45u16.to_le_bytes()); // ORR.W R5, R5, R4, LSR #31
6079                bytes.extend_from_slice(&0x75D4u16.to_le_bytes());
6080                bytes.extend_from_slice(&0x0064u16.to_le_bytes()); // LSLS R4, R4, #1
6081
6082                // Shift remainder left, OR in MSB of dividend
6083                bytes.extend_from_slice(&0x007Fu16.to_le_bytes()); // LSLS R7, R7, #1
6084                bytes.extend_from_slice(&0xEA47u16.to_le_bytes()); // ORR.W R7, R7, R6, LSR #31
6085                bytes.extend_from_slice(&0x77D6u16.to_le_bytes());
6086                bytes.extend_from_slice(&0x0076u16.to_le_bytes()); // LSLS R6, R6, #1
6087                bytes.extend_from_slice(&0xEA46u16.to_le_bytes()); // ORR.W R6, R6, R1, LSR #31
6088                bytes.extend_from_slice(&0x76D1u16.to_le_bytes());
6089
6090                // Shift dividend left
6091                bytes.extend_from_slice(&0x0049u16.to_le_bytes()); // LSLS R1, R1, #1
6092                bytes.extend_from_slice(&0xEA41u16.to_le_bytes()); // ORR.W R1, R1, R0, LSR #31
6093                bytes.extend_from_slice(&0x71D0u16.to_le_bytes());
6094                bytes.extend_from_slice(&0x0040u16.to_le_bytes()); // LSLS R0, R0, #1
6095
6096                // Compare and conditionally subtract
6097                bytes.extend_from_slice(&0x429Fu16.to_le_bytes()); // CMP R7, R3
6098                bytes.extend_from_slice(&0xD802u16.to_le_bytes()); // BHI +4
6099                bytes.extend_from_slice(&0xD306u16.to_le_bytes()); // BCC +12
6100                bytes.extend_from_slice(&0x4296u16.to_le_bytes()); // CMP R6, R2
6101                bytes.extend_from_slice(&0xD304u16.to_le_bytes()); // BCC +4 halfwords
6102
6103                // Subtract and set quotient bit
6104                bytes.extend_from_slice(&0x1AB6u16.to_le_bytes()); // SUBS R6, R6, R2
6105                bytes.extend_from_slice(&0xEB67u16.to_le_bytes()); // SBC.W R7, R7, R3
6106                bytes.extend_from_slice(&0x0703u16.to_le_bytes());
6107                bytes.extend_from_slice(&0xF044u16.to_le_bytes()); // ORR.W R4, R4, #1
6108                bytes.extend_from_slice(&0x0401u16.to_le_bytes());
6109
6110                // Decrement and loop
6111                bytes.extend_from_slice(&0xF1B8u16.to_le_bytes()); // SUB.W R8, R8, #1
6112                bytes.extend_from_slice(&0x0801u16.to_le_bytes());
6113
6114                let branch_offset_bytes = bytes.len() - loop_start + 4;
6115                let offset_halfwords = -((branch_offset_bytes / 2) as i16);
6116                let bne_encoding = 0xD100u16 | ((offset_halfwords as u16) & 0xFF);
6117                bytes.extend_from_slice(&bne_encoding.to_le_bytes());
6118
6119                // Move remainder to R0:R1
6120                bytes.extend_from_slice(&0x4630u16.to_le_bytes()); // MOV R0, R6
6121                bytes.extend_from_slice(&0x4639u16.to_le_bytes()); // MOV R1, R7
6122
6123                // If original dividend was negative (R9 MSB set), negate remainder
6124                bytes.extend_from_slice(&0xF1B9u16.to_le_bytes()); // TST.W R9, R9
6125                bytes.extend_from_slice(&0x0F00u16.to_le_bytes());
6126                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
6127
6128                // Negate result R0:R1
6129                bytes.extend_from_slice(&0x43C0u16.to_le_bytes()); // MVNS R0, R0
6130                bytes.extend_from_slice(&0x43C9u16.to_le_bytes()); // MVNS R1, R1
6131                bytes.extend_from_slice(&0x1C40u16.to_le_bytes()); // ADDS R0, R0, #1
6132                bytes.extend_from_slice(&0xF141u16.to_le_bytes()); // ADC.W R1, R1, #0
6133                bytes.extend_from_slice(&0x0100u16.to_le_bytes());
6134
6135                // POP {R4-R11} - restore scratch registers (NO PC — inline code continues)
6136                bytes.extend_from_slice(&0xE8BDu16.to_le_bytes());
6137                bytes.extend_from_slice(&0x0FF0u16.to_le_bytes());
6138
6139                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
6140                Ok(bytes)
6141            }
6142
6143            // === F32 VFP single-precision Thumb-2 encodings ===
6144            // VFP instruction words are identical to ARM32; emit as two LE halfwords.
6145            ArmOp::F32Add { sd, sn, sm } => {
6146                Ok(vfp_to_thumb_bytes(encode_vfp_3reg(0xEE300A00, sd, sn, sm)?))
6147            }
6148            ArmOp::F32Sub { sd, sn, sm } => {
6149                Ok(vfp_to_thumb_bytes(encode_vfp_3reg(0xEE300A40, sd, sn, sm)?))
6150            }
6151            ArmOp::F32Mul { sd, sn, sm } => {
6152                Ok(vfp_to_thumb_bytes(encode_vfp_3reg(0xEE200A00, sd, sn, sm)?))
6153            }
6154            ArmOp::F32Div { sd, sn, sm } => {
6155                Ok(vfp_to_thumb_bytes(encode_vfp_3reg(0xEE800A00, sd, sn, sm)?))
6156            }
6157            ArmOp::F32Abs { sd, sm } => {
6158                Ok(vfp_to_thumb_bytes(encode_vfp_2reg(0xEEB00AC0, sd, sm)?))
6159            }
6160            ArmOp::F32Neg { sd, sm } => {
6161                Ok(vfp_to_thumb_bytes(encode_vfp_2reg(0xEEB10A40, sd, sm)?))
6162            }
6163            ArmOp::F32Sqrt { sd, sm } => {
6164                Ok(vfp_to_thumb_bytes(encode_vfp_2reg(0xEEB10AC0, sd, sm)?))
6165            }
6166
6167            // f32 pseudo-ops — multi-instruction sequences
6168            // FPSCR RMode: 00=nearest, 01=+inf(ceil), 10=-inf(floor), 11=zero(trunc)
6169            ArmOp::F32Ceil { sd, sm } => self.encode_thumb_f32_rounding(sd, sm, 0b01),
6170            ArmOp::F32Floor { sd, sm } => self.encode_thumb_f32_rounding(sd, sm, 0b10),
6171            ArmOp::F32Trunc { sd, sm } => self.encode_thumb_f32_rounding(sd, sm, 0b11),
6172            ArmOp::F32Nearest { sd, sm } => self.encode_thumb_f32_rounding(sd, sm, 0b00),
6173            ArmOp::F32Min { sd, sn, sm } => self.encode_thumb_f32_minmax(sd, sn, sm, true),
6174            ArmOp::F32Max { sd, sn, sm } => self.encode_thumb_f32_minmax(sd, sn, sm, false),
6175            ArmOp::F32Copysign { sd, sn, sm } => self.encode_thumb_f32_copysign(sd, sn, sm),
6176
6177            // f32 comparisons — VCMP + VMRS + MOV #0 + IT + MOV #1
6178            ArmOp::F32Eq { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0x0),
6179            ArmOp::F32Ne { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0x1),
6180            ArmOp::F32Lt { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0x4),
6181            ArmOp::F32Le { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0x9),
6182            ArmOp::F32Gt { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0xC),
6183            ArmOp::F32Ge { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0xA),
6184
6185            ArmOp::F32Const { sd, value } => self.encode_thumb_f32_const(sd, *value),
6186
6187            ArmOp::F32Load { sd, addr } => {
6188                Ok(vfp_to_thumb_bytes(encode_vfp_ldst(0xED900A00, sd, addr)?))
6189            }
6190            ArmOp::F32Store { sd, addr } => {
6191                Ok(vfp_to_thumb_bytes(encode_vfp_ldst(0xED800A00, sd, addr)?))
6192            }
6193
6194            ArmOp::F32ConvertI32S { sd, rm } => self.encode_thumb_f32_convert_i32(sd, rm, true),
6195            ArmOp::F32ConvertI32U { sd, rm } => self.encode_thumb_f32_convert_i32(sd, rm, false),
6196            ArmOp::F32ConvertI64S { .. } | ArmOp::F32ConvertI64U { .. } => {
6197                Err(synth_core::Error::synthesis(
6198                    "F32 i64 conversion not supported (requires register pairs on 32-bit ARM)",
6199                ))
6200            }
6201            ArmOp::F32ReinterpretI32 { sd, rm } => {
6202                Ok(vfp_to_thumb_bytes(encode_vmov_core_sreg(true, sd, rm)?))
6203            }
6204            ArmOp::I32ReinterpretF32 { rd, sm } => {
6205                Ok(vfp_to_thumb_bytes(encode_vmov_core_sreg(false, sm, rd)?))
6206            }
6207            ArmOp::I32TruncF32S { rd, sm } => self.encode_thumb_i32_trunc_f32(rd, sm, true),
6208            ArmOp::I32TruncF32U { rd, sm } => self.encode_thumb_i32_trunc_f32(rd, sm, false),
6209
6210            // === F64 VFP double-precision Thumb-2 encodings ===
6211            // VFP instruction words are identical to ARM32; emit as two LE halfwords.
6212            ArmOp::F64Add { dd, dn, dm } => Ok(vfp_to_thumb_bytes(encode_vfp_3reg_f64(
6213                0xEE300B00, dd, dn, dm,
6214            )?)),
6215            ArmOp::F64Sub { dd, dn, dm } => Ok(vfp_to_thumb_bytes(encode_vfp_3reg_f64(
6216                0xEE300B40, dd, dn, dm,
6217            )?)),
6218            ArmOp::F64Mul { dd, dn, dm } => Ok(vfp_to_thumb_bytes(encode_vfp_3reg_f64(
6219                0xEE200B00, dd, dn, dm,
6220            )?)),
6221            ArmOp::F64Div { dd, dn, dm } => Ok(vfp_to_thumb_bytes(encode_vfp_3reg_f64(
6222                0xEE800B00, dd, dn, dm,
6223            )?)),
6224            ArmOp::F64Abs { dd, dm } => {
6225                Ok(vfp_to_thumb_bytes(encode_vfp_2reg_f64(0xEEB00BC0, dd, dm)?))
6226            }
6227            ArmOp::F64Neg { dd, dm } => {
6228                Ok(vfp_to_thumb_bytes(encode_vfp_2reg_f64(0xEEB10B40, dd, dm)?))
6229            }
6230            ArmOp::F64Sqrt { dd, dm } => {
6231                Ok(vfp_to_thumb_bytes(encode_vfp_2reg_f64(0xEEB10BC0, dd, dm)?))
6232            }
6233
6234            // f64 pseudo-ops
6235            // FPSCR RMode: 00=nearest, 01=+inf(ceil), 10=-inf(floor), 11=zero(trunc)
6236            ArmOp::F64Ceil { dd, dm } => self.encode_thumb_f64_rounding(dd, dm, 0b01),
6237            ArmOp::F64Floor { dd, dm } => self.encode_thumb_f64_rounding(dd, dm, 0b10),
6238            ArmOp::F64Trunc { dd, dm } => self.encode_thumb_f64_rounding(dd, dm, 0b11),
6239            ArmOp::F64Nearest { dd, dm } => self.encode_thumb_f64_rounding(dd, dm, 0b00),
6240            ArmOp::F64Min { dd, dn, dm } => self.encode_thumb_f64_minmax(dd, dn, dm, true),
6241            ArmOp::F64Max { dd, dn, dm } => self.encode_thumb_f64_minmax(dd, dn, dm, false),
6242            ArmOp::F64Copysign { dd, dn, dm } => self.encode_thumb_f64_copysign(dd, dn, dm),
6243
6244            // f64 comparisons
6245            ArmOp::F64Eq { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0x0),
6246            ArmOp::F64Ne { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0x1),
6247            ArmOp::F64Lt { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0x4),
6248            ArmOp::F64Le { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0x9),
6249            ArmOp::F64Gt { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0xC),
6250            ArmOp::F64Ge { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0xA),
6251
6252            ArmOp::F64Const { dd, value } => self.encode_thumb_f64_const(dd, *value),
6253
6254            ArmOp::F64Load { dd, addr } => Ok(vfp_to_thumb_bytes(encode_vfp_ldst_f64(
6255                0xED900B00, dd, addr,
6256            )?)),
6257            ArmOp::F64Store { dd, addr } => Ok(vfp_to_thumb_bytes(encode_vfp_ldst_f64(
6258                0xED800B00, dd, addr,
6259            )?)),
6260
6261            ArmOp::F64ConvertI32S { dd, rm } => self.encode_thumb_f64_convert_i32(dd, rm, true),
6262            ArmOp::F64ConvertI32U { dd, rm } => self.encode_thumb_f64_convert_i32(dd, rm, false),
6263            ArmOp::F64ConvertI64S { .. } | ArmOp::F64ConvertI64U { .. } => {
6264                Err(synth_core::Error::synthesis(
6265                    "F64 i64 conversion not supported (requires register pairs on 32-bit ARM)",
6266                ))
6267            }
6268            ArmOp::F64PromoteF32 { dd, sm } => self.encode_thumb_f64_promote_f32(dd, sm),
6269            ArmOp::F32DemoteF64 { sd, dm } => self.encode_thumb_f32_demote_f64(sd, dm),
6270            ArmOp::F64ReinterpretI64 { dd, rmlo, rmhi } => Ok(vfp_to_thumb_bytes(
6271                encode_vmov_core_dreg(true, dd, rmlo, rmhi)?,
6272            )),
6273            ArmOp::I64ReinterpretF64 { rdlo, rdhi, dm } => Ok(vfp_to_thumb_bytes(
6274                encode_vmov_core_dreg(false, dm, rdlo, rdhi)?,
6275            )),
6276            ArmOp::I64TruncF64S { .. } | ArmOp::I64TruncF64U { .. } => {
6277                Err(synth_core::Error::synthesis(
6278                    "i64 truncation from F64 not supported (requires i64 register pairs on 32-bit ARM)",
6279                ))
6280            }
6281            ArmOp::I32TruncF64S { rd, dm } => self.encode_thumb_i32_trunc_f64(rd, dm, true),
6282            ArmOp::I32TruncF64U { rd, dm } => self.encode_thumb_i32_trunc_f64(rd, dm, false),
6283
6284            // ===== i64 operations: encode as multi-instruction Thumb-2 sequences =====
6285
6286            // I64Add: ADDS rdlo, rnlo, rmlo; ADC.W rdhi, rnhi, rmhi
6287            ArmOp::I64Add {
6288                rdlo,
6289                rdhi,
6290                rnlo,
6291                rnhi,
6292                rmlo,
6293                rmhi,
6294            } => {
6295                let mut bytes = Vec::new();
6296                // ADDS rdlo, rnlo, rmlo (16-bit)
6297                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Adds {
6298                    rd: *rdlo,
6299                    rn: *rnlo,
6300                    op2: Operand2::Reg(*rmlo),
6301                })?);
6302                // ADC.W rdhi, rnhi, rmhi (32-bit)
6303                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Adc {
6304                    rd: *rdhi,
6305                    rn: *rnhi,
6306                    op2: Operand2::Reg(*rmhi),
6307                })?);
6308                Ok(bytes)
6309            }
6310
6311            // I64Sub: SUBS rdlo, rnlo, rmlo; SBC.W rdhi, rnhi, rmhi
6312            ArmOp::I64Sub {
6313                rdlo,
6314                rdhi,
6315                rnlo,
6316                rnhi,
6317                rmlo,
6318                rmhi,
6319            } => {
6320                let mut bytes = Vec::new();
6321                // SUBS rdlo, rnlo, rmlo (16-bit)
6322                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Subs {
6323                    rd: *rdlo,
6324                    rn: *rnlo,
6325                    op2: Operand2::Reg(*rmlo),
6326                })?);
6327                // SBC.W rdhi, rnhi, rmhi (32-bit)
6328                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Sbc {
6329                    rd: *rdhi,
6330                    rn: *rnhi,
6331                    op2: Operand2::Reg(*rmhi),
6332                })?);
6333                Ok(bytes)
6334            }
6335
6336            // I64And: AND rdlo, rnlo, rmlo; AND rdhi, rnhi, rmhi
6337            ArmOp::I64And {
6338                rdlo,
6339                rdhi,
6340                rnlo,
6341                rnhi,
6342                rmlo,
6343                rmhi,
6344            } => {
6345                let mut bytes = Vec::new();
6346                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::And {
6347                    rd: *rdlo,
6348                    rn: *rnlo,
6349                    op2: Operand2::Reg(*rmlo),
6350                })?);
6351                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::And {
6352                    rd: *rdhi,
6353                    rn: *rnhi,
6354                    op2: Operand2::Reg(*rmhi),
6355                })?);
6356                Ok(bytes)
6357            }
6358
6359            // I64Or: ORR rdlo, rnlo, rmlo; ORR rdhi, rnhi, rmhi
6360            ArmOp::I64Or {
6361                rdlo,
6362                rdhi,
6363                rnlo,
6364                rnhi,
6365                rmlo,
6366                rmhi,
6367            } => {
6368                let mut bytes = Vec::new();
6369                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Orr {
6370                    rd: *rdlo,
6371                    rn: *rnlo,
6372                    op2: Operand2::Reg(*rmlo),
6373                })?);
6374                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Orr {
6375                    rd: *rdhi,
6376                    rn: *rnhi,
6377                    op2: Operand2::Reg(*rmhi),
6378                })?);
6379                Ok(bytes)
6380            }
6381
6382            // I64Xor: EOR rdlo, rnlo, rmlo; EOR rdhi, rnhi, rmhi
6383            ArmOp::I64Xor {
6384                rdlo,
6385                rdhi,
6386                rnlo,
6387                rnhi,
6388                rmlo,
6389                rmhi,
6390            } => {
6391                let mut bytes = Vec::new();
6392                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Eor {
6393                    rd: *rdlo,
6394                    rn: *rnlo,
6395                    op2: Operand2::Reg(*rmlo),
6396                })?);
6397                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Eor {
6398                    rd: *rdhi,
6399                    rn: *rnhi,
6400                    op2: Operand2::Reg(*rmhi),
6401                })?);
6402                Ok(bytes)
6403            }
6404
6405            // I64Eqz: ORR scratch, lo, hi; ITE EQ; MOV rd, #1; MOV rd, #0
6406            ArmOp::I64Eqz { rd, rnlo, rnhi } => self.encode_thumb(&ArmOp::I64SetCondZ {
6407                rd: *rd,
6408                rn_lo: *rnlo,
6409                rn_hi: *rnhi,
6410            }),
6411
6412            // I64 comparisons: delegate to I64SetCond
6413            ArmOp::I64Eq {
6414                rd,
6415                rnlo,
6416                rnhi,
6417                rmlo,
6418                rmhi,
6419            } => self.encode_thumb(&ArmOp::I64SetCond {
6420                rd: *rd,
6421                rn_lo: *rnlo,
6422                rn_hi: *rnhi,
6423                rm_lo: *rmlo,
6424                rm_hi: *rmhi,
6425                cond: synth_synthesis::Condition::EQ,
6426            }),
6427
6428            ArmOp::I64Ne {
6429                rd,
6430                rnlo,
6431                rnhi,
6432                rmlo,
6433                rmhi,
6434            } => self.encode_thumb(&ArmOp::I64SetCond {
6435                rd: *rd,
6436                rn_lo: *rnlo,
6437                rn_hi: *rnhi,
6438                rm_lo: *rmlo,
6439                rm_hi: *rmhi,
6440                cond: synth_synthesis::Condition::NE,
6441            }),
6442
6443            ArmOp::I64LtS {
6444                rd,
6445                rnlo,
6446                rnhi,
6447                rmlo,
6448                rmhi,
6449            } => self.encode_thumb(&ArmOp::I64SetCond {
6450                rd: *rd,
6451                rn_lo: *rnlo,
6452                rn_hi: *rnhi,
6453                rm_lo: *rmlo,
6454                rm_hi: *rmhi,
6455                cond: synth_synthesis::Condition::LT,
6456            }),
6457
6458            ArmOp::I64LtU {
6459                rd,
6460                rnlo,
6461                rnhi,
6462                rmlo,
6463                rmhi,
6464            } => self.encode_thumb(&ArmOp::I64SetCond {
6465                rd: *rd,
6466                rn_lo: *rnlo,
6467                rn_hi: *rnhi,
6468                rm_lo: *rmlo,
6469                rm_hi: *rmhi,
6470                cond: synth_synthesis::Condition::LO,
6471            }),
6472
6473            ArmOp::I64LeS {
6474                rd,
6475                rnlo,
6476                rnhi,
6477                rmlo,
6478                rmhi,
6479            } => self.encode_thumb(&ArmOp::I64SetCond {
6480                rd: *rd,
6481                rn_lo: *rnlo,
6482                rn_hi: *rnhi,
6483                rm_lo: *rmlo,
6484                rm_hi: *rmhi,
6485                cond: synth_synthesis::Condition::LE,
6486            }),
6487
6488            ArmOp::I64LeU {
6489                rd,
6490                rnlo,
6491                rnhi,
6492                rmlo,
6493                rmhi,
6494            } => self.encode_thumb(&ArmOp::I64SetCond {
6495                rd: *rd,
6496                rn_lo: *rnlo,
6497                rn_hi: *rnhi,
6498                rm_lo: *rmlo,
6499                rm_hi: *rmhi,
6500                cond: synth_synthesis::Condition::LS,
6501            }),
6502
6503            ArmOp::I64GtS {
6504                rd,
6505                rnlo,
6506                rnhi,
6507                rmlo,
6508                rmhi,
6509            } => self.encode_thumb(&ArmOp::I64SetCond {
6510                rd: *rd,
6511                rn_lo: *rnlo,
6512                rn_hi: *rnhi,
6513                rm_lo: *rmlo,
6514                rm_hi: *rmhi,
6515                cond: synth_synthesis::Condition::GT,
6516            }),
6517
6518            ArmOp::I64GtU {
6519                rd,
6520                rnlo,
6521                rnhi,
6522                rmlo,
6523                rmhi,
6524            } => self.encode_thumb(&ArmOp::I64SetCond {
6525                rd: *rd,
6526                rn_lo: *rnlo,
6527                rn_hi: *rnhi,
6528                rm_lo: *rmlo,
6529                rm_hi: *rmhi,
6530                cond: synth_synthesis::Condition::HI,
6531            }),
6532
6533            ArmOp::I64GeS {
6534                rd,
6535                rnlo,
6536                rnhi,
6537                rmlo,
6538                rmhi,
6539            } => self.encode_thumb(&ArmOp::I64SetCond {
6540                rd: *rd,
6541                rn_lo: *rnlo,
6542                rn_hi: *rnhi,
6543                rm_lo: *rmlo,
6544                rm_hi: *rmhi,
6545                cond: synth_synthesis::Condition::GE,
6546            }),
6547
6548            ArmOp::I64GeU {
6549                rd,
6550                rnlo,
6551                rnhi,
6552                rmlo,
6553                rmhi,
6554            } => self.encode_thumb(&ArmOp::I64SetCond {
6555                rd: *rd,
6556                rn_lo: *rnlo,
6557                rn_hi: *rnhi,
6558                rm_lo: *rmlo,
6559                rm_hi: *rmhi,
6560                cond: synth_synthesis::Condition::HS,
6561            }),
6562
6563            // I64Const: MOVW rdlo, lo16; MOVT rdlo, hi16; MOVW rdhi, lo16_hi; MOVT rdhi, hi16_hi
6564            ArmOp::I64Const { rdlo, rdhi, value } => {
6565                let lo32 = *value as u32;
6566                let hi32 = (*value >> 32) as u32;
6567                let mut bytes = Vec::new();
6568                // Load low 32 bits into rdlo
6569                bytes.extend_from_slice(
6570                    &self.encode_thumb32_movw_raw(reg_to_bits(rdlo), lo32 & 0xFFFF)?,
6571                );
6572                if lo32 > 0xFFFF {
6573                    bytes.extend_from_slice(
6574                        &self.encode_thumb32_movt_raw(reg_to_bits(rdlo), lo32 >> 16)?,
6575                    );
6576                }
6577                // Load high 32 bits into rdhi
6578                bytes.extend_from_slice(
6579                    &self.encode_thumb32_movw_raw(reg_to_bits(rdhi), hi32 & 0xFFFF)?,
6580                );
6581                if hi32 > 0xFFFF {
6582                    bytes.extend_from_slice(
6583                        &self.encode_thumb32_movt_raw(reg_to_bits(rdhi), hi32 >> 16)?,
6584                    );
6585                }
6586                Ok(bytes)
6587            }
6588
6589            // I64Ldr: LDR rdlo, [base, offset]; LDR rdhi, [base, offset+4]
6590            ArmOp::I64Ldr { rdlo, rdhi, addr } => {
6591                let mut bytes = Vec::new();
6592                // #372/#382: a memory `i64.load` carries an index register
6593                // (`reg_imm(R11, addr_reg, offset)` = R11 + addr + offset). The
6594                // immediate `encode_thumb32_ldr` below uses only base+offset and
6595                // would SILENTLY DROP `offset_reg` — the #206 defect, here for
6596                // i64. `i64_effective_base` materializes the effective base into
6597                // `ip` (and, when `offset+4 > 0xFFF`, folds the offset in too so
6598                // the function is NOT skipped — #382), returning the residual
6599                // imm12 for the two halves. Frame i64 loads (no `offset_reg`, e.g.
6600                // a spilled local at `[SP, #off]`) keep the plain `[base,#off]`
6601                // form unchanged — so existing output is byte-identical.
6602                let (base, offset) = self.i64_effective_base(&mut bytes, addr)?;
6603                bytes.extend_from_slice(&self.encode_thumb32_ldr(rdlo, &base, offset)?);
6604                bytes.extend_from_slice(&self.encode_thumb32_ldr(
6605                    rdhi,
6606                    &base,
6607                    offset.wrapping_add(4),
6608                )?);
6609                Ok(bytes)
6610            }
6611
6612            // I64Str: STR rdlo, [base, offset]; STR rdhi, [base, offset+4]
6613            ArmOp::I64Str { rdlo, rdhi, addr } => {
6614                let mut bytes = Vec::new();
6615                // #372/#382: same index-materialization + large-offset fold as
6616                // I64Ldr (see above).
6617                let (base, offset) = self.i64_effective_base(&mut bytes, addr)?;
6618                bytes.extend_from_slice(&self.encode_thumb32_str(rdlo, &base, offset)?);
6619                bytes.extend_from_slice(&self.encode_thumb32_str(
6620                    rdhi,
6621                    &base,
6622                    offset.wrapping_add(4),
6623                )?);
6624                Ok(bytes)
6625            }
6626
6627            // I64ExtendI32S: MOV rdlo, rn; ASR rdhi, rdlo, #31 (sign-extend)
6628            ArmOp::I64ExtendI32S { rdlo, rdhi, rn } => {
6629                let mut bytes = Vec::new();
6630                if rdlo != rn {
6631                    // MOV rdlo, rn (16-bit)
6632                    bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Mov {
6633                        rd: *rdlo,
6634                        op2: Operand2::Reg(*rn),
6635                    })?);
6636                }
6637                // ASR rdhi, rdlo, #31 (sign-extend: fill high word with sign bit)
6638                bytes.extend_from_slice(
6639                    &self.encode_thumb32_shift(rdhi, rdlo, 31, 0b10)?, // ASR type
6640                );
6641                Ok(bytes)
6642            }
6643
6644            // I64ExtendI32U: MOV rdlo, rn; MOV rdhi, #0
6645            ArmOp::I64ExtendI32U { rdlo, rdhi, rn } => {
6646                let mut bytes = Vec::new();
6647                if rdlo != rn {
6648                    // MOV rdlo, rn
6649                    bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Mov {
6650                        rd: *rdlo,
6651                        op2: Operand2::Reg(*rn),
6652                    })?);
6653                }
6654                // MOV rdhi, #0 (#916: MOV.W for rdhi >= R8). Unconditional
6655                // site with no branches in the expansion — before the fix this
6656                // emitted the literal two-instruction stream [4608, 2800], half
6657                // of which was `CMP r0,#0` rather than the high-word clear, so
6658                // every i64.extend_i32_u into a high pair leaked stale bits.
6659                emit_thumb_zero_fill(&mut bytes, reg_to_bits(rdhi));
6660                Ok(bytes)
6661            }
6662
6663            // I32WrapI64: MOV rd, rnlo (just take low 32 bits)
6664            ArmOp::I32WrapI64 { rd, rnlo } => {
6665                if rd == rnlo {
6666                    // No-op: already in the right register
6667                    let instr: u16 = 0xBF00; // NOP
6668                    Ok(instr.to_le_bytes().to_vec())
6669                } else {
6670                    // MOV rd, rnlo
6671                    self.encode_thumb(&ArmOp::Mov {
6672                        rd: *rd,
6673                        op2: Operand2::Reg(*rnlo),
6674                    })
6675                }
6676            }
6677
6678            // ===== Helium MVE operations (Thumb-2 encoding) =====
6679            ArmOp::MveLoad { qd, addr } => Ok(vfp_to_thumb_bytes(encode_mve_vldrw(qd, addr))),
6680            ArmOp::MveStore { qd, addr } => Ok(vfp_to_thumb_bytes(encode_mve_vstrw(qd, addr))),
6681            ArmOp::MveConst { qd, bytes } => self.encode_thumb_mve_const(qd, bytes),
6682            ArmOp::MveAnd { qd, qn, qm } => Ok(vfp_to_thumb_bytes(encode_mve_3reg_bitwise(
6683                0xEF000150, qd, qn, qm,
6684            ))),
6685            ArmOp::MveOrr { qd, qn, qm } => Ok(vfp_to_thumb_bytes(encode_mve_3reg_bitwise(
6686                0xEF200150, qd, qn, qm,
6687            ))),
6688            ArmOp::MveEor { qd, qn, qm } => Ok(vfp_to_thumb_bytes(encode_mve_3reg_bitwise(
6689                0xFF000150, qd, qn, qm,
6690            ))),
6691            ArmOp::MveMvn { qd, qm } => {
6692                // VMVN Qd, Qm: 0xFFB005C0 | Qd<<12 | Qm
6693                let qd_enc = qreg_to_num(qd);
6694                let qm_enc = qreg_to_num(qm);
6695                let instr: u32 = 0xFFB005C0 | ((qd_enc * 2) << 12) | (qm_enc * 2);
6696                Ok(vfp_to_thumb_bytes(instr))
6697            }
6698            ArmOp::MveBic { qd, qn, qm } => Ok(vfp_to_thumb_bytes(encode_mve_3reg_bitwise(
6699                0xEF100150, qd, qn, qm,
6700            ))),
6701            ArmOp::MveAddI { qd, qn, qm, size } => {
6702                let sz = mve_size_bits(size);
6703                let base: u32 = 0xEF000840 | (sz << 20);
6704                Ok(vfp_to_thumb_bytes(encode_mve_3reg(base, qd, qn, qm)))
6705            }
6706            ArmOp::MveSubI { qd, qn, qm, size } => {
6707                let sz = mve_size_bits(size);
6708                let base: u32 = 0xFF000840 | (sz << 20);
6709                Ok(vfp_to_thumb_bytes(encode_mve_3reg(base, qd, qn, qm)))
6710            }
6711            ArmOp::MveMulI { qd, qn, qm, size } => {
6712                let sz = mve_size_bits(size);
6713                let base: u32 = 0xEF000950 | (sz << 20);
6714                Ok(vfp_to_thumb_bytes(encode_mve_3reg(base, qd, qn, qm)))
6715            }
6716            ArmOp::MveNegI { qd, qm, size } => {
6717                let sz = mve_size_bits(size);
6718                // VNEG.Sx Qd, Qm
6719                let qd_enc = qreg_to_num(qd);
6720                let qm_enc = qreg_to_num(qm);
6721                let base: u32 = 0xFFB103C0 | (sz << 18);
6722                let instr = base | ((qd_enc * 2) << 12) | (qm_enc * 2);
6723                Ok(vfp_to_thumb_bytes(instr))
6724            }
6725            ArmOp::MveDup { qd, rn, size } => {
6726                let sz = mve_size_bits(size);
6727                let qd_enc = qreg_to_num(qd);
6728                let rn_bits = reg_to_bits(rn);
6729                // VDUP.sz Qd, Rn: EEA0 0B10 variant
6730                // size encoding: 00=32, 01=16, 10=8
6731                let be = match sz {
6732                    0 => 0b00u32, // 8-bit
6733                    1 => 0b01,    // 16-bit
6734                    _ => 0b00,    // 32-bit (default)
6735                };
6736                let instr: u32 = 0xEEA00B10 | ((qd_enc * 2) << 16) | (rn_bits << 12) | (be << 5);
6737                Ok(vfp_to_thumb_bytes(instr))
6738            }
6739            ArmOp::MveExtractLane { rd, qn, lane, size } => {
6740                let qn_enc = qreg_to_num(qn);
6741                let rd_bits = reg_to_bits(rd);
6742                // VMOV.sz Rd, Dn[x] — extract from Q-register lane
6743                // For 32-bit: VMOV Rd, Dn — where Dn is the appropriate D-register
6744                let d_reg = qn_enc * 2 + ((*lane as u32) >> 1);
6745                let lane_in_d = (*lane as u32) & 1;
6746                let _sz = mve_size_bits(size);
6747                // VMOV Rd, Dn[x]: EE10 0B10 for 32-bit
6748                let instr: u32 = 0xEE100B10 | (d_reg << 16) | (rd_bits << 12) | (lane_in_d << 21);
6749                Ok(vfp_to_thumb_bytes(instr))
6750            }
6751            ArmOp::MveInsertLane { qd, rn, lane, size } => {
6752                let qd_enc = qreg_to_num(qd);
6753                let rn_bits = reg_to_bits(rn);
6754                let d_reg = qd_enc * 2 + ((*lane as u32) >> 1);
6755                let lane_in_d = (*lane as u32) & 1;
6756                let _sz = mve_size_bits(size);
6757                // VMOV Dn[x], Rn: EE00 0B10 for 32-bit
6758                let instr: u32 = 0xEE000B10 | (d_reg << 16) | (rn_bits << 12) | (lane_in_d << 21);
6759                Ok(vfp_to_thumb_bytes(instr))
6760            }
6761
6762            // MVE float comparisons — emit VCMP + VPSEL sequence (simplified: just VCMP)
6763            ArmOp::MveCmpEqI { qd, qn, qm, size }
6764            | ArmOp::MveCmpNeI { qd, qn, qm, size }
6765            | ArmOp::MveCmpLtS { qd, qn, qm, size }
6766            | ArmOp::MveCmpLtU { qd, qn, qm, size }
6767            | ArmOp::MveCmpGtS { qd, qn, qm, size }
6768            | ArmOp::MveCmpGtU { qd, qn, qm, size }
6769            | ArmOp::MveCmpLeS { qd, qn, qm, size }
6770            | ArmOp::MveCmpLeU { qd, qn, qm, size }
6771            | ArmOp::MveCmpGeS { qd, qn, qm, size }
6772            | ArmOp::MveCmpGeU { qd, qn, qm, size } => {
6773                // Encode as VADD (placeholder encoding — real implementation
6774                // would use VCMP + VPSEL pair)
6775                let sz = mve_size_bits(size);
6776                let base: u32 = 0xEF000840 | (sz << 20);
6777                Ok(vfp_to_thumb_bytes(encode_mve_3reg(base, qd, qn, qm)))
6778            }
6779
6780            // f32x4 MVE arithmetic
6781            ArmOp::MveAddF32 { qd, qn, qm } => {
6782                // VADD.F32 Qd, Qn, Qm (MVE): 0xEF000D40
6783                Ok(vfp_to_thumb_bytes(encode_mve_3reg(0xEF000D40, qd, qn, qm)))
6784            }
6785            ArmOp::MveSubF32 { qd, qn, qm } => {
6786                // VSUB.F32 Qd, Qn, Qm (MVE): 0xEF200D40
6787                Ok(vfp_to_thumb_bytes(encode_mve_3reg(0xEF200D40, qd, qn, qm)))
6788            }
6789            ArmOp::MveMulF32 { qd, qn, qm } => {
6790                // VMUL.F32 Qd, Qn, Qm (MVE): 0xFF000D50
6791                Ok(vfp_to_thumb_bytes(encode_mve_3reg(0xFF000D50, qd, qn, qm)))
6792            }
6793            ArmOp::MveNegF32 { qd, qm } => {
6794                let qd_enc = qreg_to_num(qd);
6795                let qm_enc = qreg_to_num(qm);
6796                // VNEG.F32 Qd, Qm: FFB907C0
6797                let instr: u32 = 0xFFB907C0 | ((qd_enc * 2) << 12) | (qm_enc * 2);
6798                Ok(vfp_to_thumb_bytes(instr))
6799            }
6800            ArmOp::MveAbsF32 { qd, qm } => {
6801                let qd_enc = qreg_to_num(qd);
6802                let qm_enc = qreg_to_num(qm);
6803                // VABS.F32 Qd, Qm: FFB90740
6804                let instr: u32 = 0xFFB90740 | ((qd_enc * 2) << 12) | (qm_enc * 2);
6805                Ok(vfp_to_thumb_bytes(instr))
6806            }
6807            ArmOp::MveCmpEqF32 { qd, qn, qm }
6808            | ArmOp::MveCmpNeF32 { qd, qn, qm }
6809            | ArmOp::MveCmpLtF32 { qd, qn, qm }
6810            | ArmOp::MveCmpLeF32 { qd, qn, qm }
6811            | ArmOp::MveCmpGtF32 { qd, qn, qm }
6812            | ArmOp::MveCmpGeF32 { qd, qn, qm } => {
6813                // Placeholder: encode as VADD.F32 (real impl needs VCMP.F32 + VPSEL)
6814                Ok(vfp_to_thumb_bytes(encode_mve_3reg(0xEF000D40, qd, qn, qm)))
6815            }
6816            ArmOp::MveDupF32 { qd, rn } => {
6817                let qd_enc = qreg_to_num(qd);
6818                let rn_bits = reg_to_bits(rn);
6819                // VDUP.32 Qd, Rn (same encoding as integer VDUP.32)
6820                let instr: u32 = 0xEEA00B10 | ((qd_enc * 2) << 16) | (rn_bits << 12);
6821                Ok(vfp_to_thumb_bytes(instr))
6822            }
6823            ArmOp::MveExtractLaneF32 { rd, qn, lane } => {
6824                let qn_enc = qreg_to_num(qn);
6825                let rd_bits = reg_to_bits(rd);
6826                // VMOV Rd, Sn where Sn = Q*4 + lane
6827                let s_num = qn_enc * 4 + (*lane as u32);
6828                let (vn, n) = encode_sreg(s_num);
6829                let instr: u32 = 0xEE100A10 | (vn << 16) | (rd_bits << 12) | (n << 7);
6830                Ok(vfp_to_thumb_bytes(instr))
6831            }
6832            ArmOp::MveReplaceLaneF32 { qd, rn, lane } => {
6833                let qd_enc = qreg_to_num(qd);
6834                let rn_bits = reg_to_bits(rn);
6835                // VMOV Sn, Rn where Sn = Q*4 + lane
6836                let s_num = qd_enc * 4 + (*lane as u32);
6837                let (vn, n) = encode_sreg(s_num);
6838                let instr: u32 = 0xEE000A10 | (vn << 16) | (rn_bits << 12) | (n << 7);
6839                Ok(vfp_to_thumb_bytes(instr))
6840            }
6841            ArmOp::MveDivF32 { qd, qn, qm } => {
6842                // Lane-wise: extract 4 S-regs, VDIV, insert back
6843                self.encode_thumb_mve_lane_wise_f32_binop(qd, qn, qm, 0xEE800A00)
6844            }
6845            ArmOp::MveSqrtF32 { qd, qm } => {
6846                // Lane-wise: extract 4 S-regs, VSQRT, insert back
6847                self.encode_thumb_mve_lane_wise_f32_sqrt(qd, qm)
6848            }
6849
6850            // Catch-all for any remaining ops
6851            _ => {
6852                let instr: u16 = 0xBF00; // NOP
6853                Ok(instr.to_le_bytes().to_vec())
6854            }
6855        }
6856    }
6857
6858    // === Thumb-2 VFP multi-instruction helpers ===
6859
6860    /// Encode F32 comparison as Thumb-2: VCMP.F32 + VMRS + MOVS rd,#0 + IT + MOV rd,#1
6861    fn encode_thumb_f32_compare(
6862        &self,
6863        rd: &Reg,
6864        sn: &VfpReg,
6865        sm: &VfpReg,
6866        cond_code: u32,
6867    ) -> Result<Vec<u8>> {
6868        let mut bytes = Vec::new();
6869        let rd_bits = reg_to_bits(rd);
6870
6871        // #709 (bug found under #708/#709): the `MOVS Rd,#0` below is a
6872        // FLAG-SETTING 16-bit move. Emitting it AFTER `VMRS APSR_nzcv, FPSCR`
6873        // (as the original code did) clobbered the N/Z/C/V flags the VMRS just
6874        // transferred from the VFP compare, so the following `IT<cond>` read
6875        // stale flags and every f32 comparison silently returned 0 (verified:
6876        // `flt(1.0,2.0)` → 0 on Cortex-M4F). The 619 harness never caught it
6877        // because it deliberately skipped compare EXECUTION on a false premise
6878        // (unicorn DOES model VMRS→APSR). Fix: materialize the `#0` FIRST, then
6879        // VCMP+VMRS set the flags the `IT` consumes. Instruction sizes are
6880        // unchanged (pure reorder), so the estimator↔encoder oracle (#511) is
6881        // untouched — only the byte ORDER differs.
6882
6883        // MOVS Rd, #0 (16-bit): 0010 0 Rd(3) 0000 0000 — its flag side effect
6884        // is immediately overwritten by the VMRS below.
6885        if rd_bits < 8 {
6886            let movs_zero: u16 = 0x2000 | ((rd_bits as u16) << 8);
6887            bytes.extend_from_slice(&movs_zero.to_le_bytes());
6888        } else {
6889            // MOV.W Rd, #0 (32-bit Thumb-2)
6890            let hw1: u16 = 0xF04F;
6891            let hw2: u16 = (rd_bits as u16) << 8;
6892            bytes.extend_from_slice(&hw1.to_le_bytes());
6893            bytes.extend_from_slice(&hw2.to_le_bytes());
6894        }
6895
6896        // VCMP.F32 Sn, Sm
6897        let sn_num = vfp_sreg_to_num(sn)?;
6898        let sm_num = vfp_sreg_to_num(sm)?;
6899        let (vd, d) = encode_sreg(sn_num);
6900        let (vm, m) = encode_sreg(sm_num);
6901        let vcmp = 0xEEB40A40 | (d << 22) | (vd << 12) | (m << 5) | vm;
6902        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcmp));
6903
6904        // VMRS APSR_nzcv, FPSCR: 0xEEF1FA10 (sets the flags IT consumes)
6905        bytes.extend_from_slice(&vfp_to_thumb_bytes(0xEEF1FA10));
6906
6907        // IT<cond> — If-Then for conditional MOV
6908        // IT encoding: 1011 1111 cond(4) mask(4)
6909        // mask = 0x8 for single "then" (IT)
6910        let it: u16 = 0xBF00 | ((cond_code as u16) << 4) | 0x8;
6911        bytes.extend_from_slice(&it.to_le_bytes());
6912
6913        // MOV Rd, #1 (16-bit, conditional due to IT): 0010 0 Rd(3) 0000 0001
6914        if rd_bits < 8 {
6915            let mov_one: u16 = 0x2001 | ((rd_bits as u16) << 8);
6916            bytes.extend_from_slice(&mov_one.to_le_bytes());
6917        } else {
6918            // MOV.W Rd, #1 (32-bit)
6919            let hw1: u16 = 0xF04F;
6920            let hw2: u16 = ((rd_bits as u16) << 8) | 0x01;
6921            bytes.extend_from_slice(&hw1.to_le_bytes());
6922            bytes.extend_from_slice(&hw2.to_le_bytes());
6923        }
6924
6925        Ok(bytes)
6926    }
6927
6928    /// Encode F32 constant load as Thumb-2: MOVW + MOVT + VMOV
6929    fn encode_thumb_f32_const(&self, sd: &VfpReg, value: f32) -> Result<Vec<u8>> {
6930        let mut bytes = Vec::new();
6931        let bits = value.to_bits();
6932        let rt: u32 = 12; // R12/IP as temp
6933
6934        // MOVW R12, #lo16
6935        // Thumb-2 MOVW: 11110 i 10 0100 imm4 | 0 imm3 Rd imm8
6936        let lo16 = bits & 0xFFFF;
6937        let imm4 = (lo16 >> 12) & 0xF;
6938        let i_bit = (lo16 >> 11) & 1;
6939        let imm3 = (lo16 >> 8) & 0x7;
6940        let imm8 = lo16 & 0xFF;
6941        let hw1: u16 = (0xF240 | (i_bit << 10) | imm4) as u16;
6942        let hw2: u16 = ((imm3 << 12) | (rt << 8) | imm8) as u16;
6943        bytes.extend_from_slice(&hw1.to_le_bytes());
6944        bytes.extend_from_slice(&hw2.to_le_bytes());
6945
6946        // MOVT R12, #hi16
6947        let hi16 = (bits >> 16) & 0xFFFF;
6948        let imm4 = (hi16 >> 12) & 0xF;
6949        let i_bit = (hi16 >> 11) & 1;
6950        let imm3 = (hi16 >> 8) & 0x7;
6951        let imm8 = hi16 & 0xFF;
6952        let hw1: u16 = (0xF2C0 | (i_bit << 10) | imm4) as u16;
6953        let hw2: u16 = ((imm3 << 12) | (rt << 8) | imm8) as u16;
6954        bytes.extend_from_slice(&hw1.to_le_bytes());
6955        bytes.extend_from_slice(&hw2.to_le_bytes());
6956
6957        // VMOV Sd, R12
6958        let vmov = encode_vmov_core_sreg(true, sd, &Reg::R12)?;
6959        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
6960
6961        Ok(bytes)
6962    }
6963
6964    /// Encode VMOV + VCVT.F32.xS32 as Thumb-2
6965    fn encode_thumb_f32_convert_i32(&self, sd: &VfpReg, rm: &Reg, signed: bool) -> Result<Vec<u8>> {
6966        let mut bytes = Vec::new();
6967
6968        // VMOV Sd, Rm
6969        let vmov = encode_vmov_core_sreg(true, sd, rm)?;
6970        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
6971
6972        // VCVT.F32.S32/U32 Sd, Sd. Bit 7 (op) = 1 for signed (S32), 0 for
6973        // unsigned (U32): signed = 0xEEB80AC0, unsigned = 0xEEB80A40
6974        // (GI-FPU-002: previously swapped — see the ARM32 twin).
6975        let sd_num = vfp_sreg_to_num(sd)?;
6976        let (vd, d) = encode_sreg(sd_num);
6977        let (vm, m) = encode_sreg(sd_num);
6978        let base = if signed { 0xEEB80AC0 } else { 0xEEB80A40 };
6979        let vcvt = base | (d << 22) | (vd << 12) | (m << 5) | vm;
6980        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt));
6981
6982        Ok(bytes)
6983    }
6984
6985    /// Encode F32 rounding pseudo-op as Thumb-2 via VCVT to integer and back
6986    /// Encode F32 rounding as Thumb-2.
6987    /// `mode`: FPSCR RMode — 0b00=nearest, 0b01=+inf(ceil), 0b10=-inf(floor), 0b11=zero(trunc)
6988    ///
6989    /// For trunc: uses VCVTR.S32.F32 (always truncates).
6990    /// For ceil/floor/nearest: sets FPSCR rounding mode, uses VCVT.S32.F32 (non-R variant),
6991    /// then restores FPSCR.
6992    fn encode_thumb_f32_rounding(&self, sd: &VfpReg, sm: &VfpReg, mode: u8) -> Result<Vec<u8>> {
6993        let mut bytes = Vec::new();
6994        let sm_num = vfp_sreg_to_num(sm)?;
6995        let sd_num = vfp_sreg_to_num(sd)?;
6996        let (vd_s, d_s) = encode_sreg(sd_num);
6997        let (vm_s, m_s) = encode_sreg(sm_num);
6998
6999        if mode == 0b11 {
7000            // Trunc (toward zero): VCVTR.S32.F32 — bit[7]=1, always truncates
7001            let vcvt_to_int = 0xEEBD0AC0 | (d_s << 22) | (vd_s << 12) | (m_s << 5) | vm_s;
7002            bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt_to_int));
7003        } else {
7004            // ceil/floor/nearest: manipulate FPSCR rounding mode
7005            let rt: u32 = 12; // R12/IP as temp
7006
7007            // VMRS R12, FPSCR
7008            let vmrs = 0xEEF10A10 | (rt << 12);
7009            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmrs));
7010
7011            // BIC.W R12, R12, #(3 << 22) — clear RMode bits [23:22]
7012            // Thumb-2 modified immediate for 3<<22 = 0x00C00000:
7013            // BIC.W encoding: 11110 i 0 0001 S Rn | 0 imm3 Rd imm8
7014            // 0x00C00000 = 0x03 shifted left by 22 => Thumb mod-imm: i=0, imm3=0b101, imm8=0x03
7015            let bic_hw1: u16 = 0xF020 | ((rt as u16) & 0xF); // BIC, Rn=R12
7016            let bic_hw2: u16 = (0x05 << 12) | ((rt as u16) << 8) | 0x03;
7017            bytes.extend_from_slice(&bic_hw1.to_le_bytes());
7018            bytes.extend_from_slice(&bic_hw2.to_le_bytes());
7019
7020            // ORR.W R12, R12, #(mode << 22)
7021            if mode != 0 {
7022                let orr_hw1: u16 = 0xF040 | ((rt as u16) & 0xF); // ORR, Rn=R12
7023                let orr_hw2: u16 = (0x05 << 12) | ((rt as u16) << 8) | (mode as u16);
7024                bytes.extend_from_slice(&orr_hw1.to_le_bytes());
7025                bytes.extend_from_slice(&orr_hw2.to_le_bytes());
7026            }
7027
7028            // VMSR FPSCR, R12
7029            let vmsr = 0xEEE10A10 | (rt << 12);
7030            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmsr));
7031
7032            // VCVT.S32.F32 Sd, Sm — non-R variant (bit[7]=0), uses FPSCR rmode
7033            let vcvt_to_int = 0xEEBD0A40 | (d_s << 22) | (vd_s << 12) | (m_s << 5) | vm_s;
7034            bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt_to_int));
7035
7036            // Restore FPSCR: clear rmode bits back to nearest (default)
7037            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmrs));
7038            bytes.extend_from_slice(&bic_hw1.to_le_bytes());
7039            bytes.extend_from_slice(&bic_hw2.to_le_bytes());
7040            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmsr));
7041        }
7042
7043        // VCVT.F32.S32 Sd, Sd (convert integer result back to float)
7044        let (vd2, d2) = encode_sreg(sd_num);
7045        let vcvt_to_float = 0xEEB80A40 | (d2 << 22) | (vd2 << 12) | (d_s << 5) | vd_s;
7046        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt_to_float));
7047
7048        Ok(bytes)
7049    }
7050
7051    /// Encode F32 min/max as Thumb-2: VMOV + VCMP + VMRS + IT + VMOV
7052    fn encode_thumb_f32_minmax(
7053        &self,
7054        sd: &VfpReg,
7055        sn: &VfpReg,
7056        sm: &VfpReg,
7057        is_min: bool,
7058    ) -> Result<Vec<u8>> {
7059        let mut bytes = Vec::new();
7060        let sn_num = vfp_sreg_to_num(sn)?;
7061        let sm_num = vfp_sreg_to_num(sm)?;
7062        let sd_num = vfp_sreg_to_num(sd)?;
7063
7064        // VMOV.F32 Sd, Sn
7065        let (vd, d) = encode_sreg(sd_num);
7066        let (vn, n) = encode_sreg(sn_num);
7067        let vmov_sn = 0xEEB00A40 | (d << 22) | (vd << 12) | (n << 5) | vn;
7068        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov_sn));
7069
7070        // VCMP.F32 Sn, Sm
7071        let (vm, m) = encode_sreg(sm_num);
7072        let vcmp = 0xEEB40A40 | (n << 22) | (vn << 12) | (m << 5) | vm;
7073        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcmp));
7074
7075        // VMRS APSR_nzcv, FPSCR
7076        bytes.extend_from_slice(&vfp_to_thumb_bytes(0xEEF1FA10));
7077
7078        // IT GT (for min) or IT MI (for max)
7079        let cond: u16 = if is_min { 0xC } else { 0x4 };
7080        let it: u16 = 0xBF00 | (cond << 4) | 0x8;
7081        bytes.extend_from_slice(&it.to_le_bytes());
7082
7083        // VMOV{cond}.F32 Sd, Sm — conditional VMOV in IT block
7084        let vmov_sm = 0xEEB00A40 | (d << 22) | (vd << 12) | (m << 5) | vm;
7085        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov_sm));
7086
7087        Ok(bytes)
7088    }
7089
7090    /// Encode F32 copysign as Thumb-2
7091    /// Encode F32 copysign as Thumb-2, clobbering ONLY R12 (the reserved
7092    /// encoder scratch, #212), the flags, and Sd:
7093    ///
7094    ///   VMOV R12, Sm ; CMP R12, #0    (N flag = the sign bit)
7095    ///   VABS.F32 Sd, Sn               (magnitude, sign cleared)
7096    ///   IT MI ; VNEG.F32(MI) Sd, Sd
7097    ///
7098    /// Bit-exact on ±0.0/NaN-sign/±inf (VABS/VNEG are sign-bit-only edits).
7099    /// The R12 capture happens BEFORE Sd is written, so Sd aliasing Sn or Sm
7100    /// is safe. (The previous sequence staged the magnitude through R0 —
7101    /// clobbering a live allocator-owned value, the #615 class; caught while
7102    /// composing the F64 twin for #369.)
7103    fn encode_thumb_f32_copysign(&self, sd: &VfpReg, sn: &VfpReg, sm: &VfpReg) -> Result<Vec<u8>> {
7104        let mut bytes = Vec::new();
7105
7106        // VMOV R12, Sm (sign source bits)
7107        bytes.extend_from_slice(&vfp_to_thumb_bytes(encode_vmov_core_sreg(
7108            false,
7109            sm,
7110            &Reg::R12,
7111        )?));
7112        // CMP.W R12, #0 — N = bit31 (the sign, incl. -0.0 / -NaN).
7113        bytes.extend_from_slice(&0xF1BC_u16.to_le_bytes());
7114        bytes.extend_from_slice(&0x0F00_u16.to_le_bytes());
7115        // VABS.F32 Sd, Sn
7116        let sd_num = vfp_sreg_to_num(sd)?;
7117        let sn_num = vfp_sreg_to_num(sn)?;
7118        let (vd, d) = encode_sreg(sd_num);
7119        let (vn, n) = encode_sreg(sn_num);
7120        let vabs = 0xEEB00AC0 | (d << 22) | (vd << 12) | (n << 5) | vn;
7121        bytes.extend_from_slice(&vfp_to_thumb_bytes(vabs));
7122        // IT MI ; VNEG.F32(MI) Sd, Sd
7123        bytes.extend_from_slice(&0xBF48_u16.to_le_bytes());
7124        let vneg = 0xEEB10A40 | (d << 22) | (vd << 12) | (d << 5) | vd;
7125        bytes.extend_from_slice(&vfp_to_thumb_bytes(vneg));
7126
7127        Ok(bytes)
7128    }
7129
7130    /// Encode F64 comparison as Thumb-2: VCMP.F64 + VMRS + MOV #0 + IT + MOV #1
7131    fn encode_thumb_f64_compare(
7132        &self,
7133        rd: &Reg,
7134        dn: &VfpReg,
7135        dm: &VfpReg,
7136        cond_code: u32,
7137    ) -> Result<Vec<u8>> {
7138        let mut bytes = Vec::new();
7139        let rd_bits = reg_to_bits(rd);
7140
7141        // #712-class fix (found at f64-phase-2 wiring, #369): the 16-bit
7142        // `MOVS Rd,#0` is FLAG-SETTING. The original order emitted it AFTER
7143        // `VMRS APSR_nzcv, FPSCR`, clobbering the N/Z/C/V flags the VMRS just
7144        // transferred, so the following `IT<cond>` read stale flags and every
7145        // f64 comparison silently returned 0 — the exact bug the f32 compare
7146        // encoder shipped with and #712 fixed. Same fix: materialize the `#0`
7147        // FIRST (its flag side effect is overwritten by the VMRS), then
7148        // VCMP+VMRS set the flags the IT consumes. Pure reorder — sizes
7149        // unchanged.
7150
7151        // MOVS Rd, #0
7152        if rd_bits < 8 {
7153            let movs_zero: u16 = 0x2000 | ((rd_bits as u16) << 8);
7154            bytes.extend_from_slice(&movs_zero.to_le_bytes());
7155        } else {
7156            let hw1: u16 = 0xF04F;
7157            let hw2: u16 = (rd_bits as u16) << 8;
7158            bytes.extend_from_slice(&hw1.to_le_bytes());
7159            bytes.extend_from_slice(&hw2.to_le_bytes());
7160        }
7161
7162        // VCMP.F64 Dn, Dm
7163        let dn_num = vfp_dreg_to_num(dn)?;
7164        let dm_num = vfp_dreg_to_num(dm)?;
7165        let (vd, d) = encode_dreg(dn_num);
7166        let (vm, m) = encode_dreg(dm_num);
7167        let vcmp = 0xEEB40B40 | (d << 22) | (vd << 12) | (m << 5) | vm;
7168        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcmp));
7169
7170        // VMRS APSR_nzcv, FPSCR (sets the flags the IT consumes)
7171        bytes.extend_from_slice(&vfp_to_thumb_bytes(0xEEF1FA10));
7172
7173        // IT<cond>
7174        let it: u16 = 0xBF00 | ((cond_code as u16) << 4) | 0x8;
7175        bytes.extend_from_slice(&it.to_le_bytes());
7176
7177        // MOV Rd, #1
7178        if rd_bits < 8 {
7179            let mov_one: u16 = 0x2001 | ((rd_bits as u16) << 8);
7180            bytes.extend_from_slice(&mov_one.to_le_bytes());
7181        } else {
7182            let hw1: u16 = 0xF04F;
7183            let hw2: u16 = ((rd_bits as u16) << 8) | 0x01;
7184            bytes.extend_from_slice(&hw1.to_le_bytes());
7185            bytes.extend_from_slice(&hw2.to_le_bytes());
7186        }
7187
7188        Ok(bytes)
7189    }
7190
7191    /// Encode F64 constant load as Thumb-2: MOVW+MOVT (lo32 into R0) + MOVW+MOVT (hi32 into R12) + VMOV Dd, R0, R12
7192    fn encode_thumb_f64_const(&self, dd: &VfpReg, value: f64) -> Result<Vec<u8>> {
7193        let mut bytes = Vec::new();
7194        let bits = value.to_bits();
7195        let lo32 = bits as u32;
7196        let hi32 = (bits >> 32) as u32;
7197
7198        // MOVW R0, #lo16(lo32)
7199        let lo16 = lo32 & 0xFFFF;
7200        bytes.extend_from_slice(&self.encode_thumb32_movw_raw(0, lo16)?);
7201
7202        // MOVT R0, #hi16(lo32)
7203        let hi16 = (lo32 >> 16) & 0xFFFF;
7204        bytes.extend_from_slice(&self.encode_thumb32_movt_raw(0, hi16)?);
7205
7206        // MOVW R12, #lo16(hi32)
7207        let lo16 = hi32 & 0xFFFF;
7208        bytes.extend_from_slice(&self.encode_thumb32_movw_raw(12, lo16)?);
7209
7210        // MOVT R12, #hi16(hi32)
7211        let hi16 = (hi32 >> 16) & 0xFFFF;
7212        bytes.extend_from_slice(&self.encode_thumb32_movt_raw(12, hi16)?);
7213
7214        // VMOV Dd, R0, R12
7215        let vmov = encode_vmov_core_dreg(true, dd, &Reg::R0, &Reg::R12)?;
7216        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
7217
7218        Ok(bytes)
7219    }
7220
7221    /// Encode VMOV Sd, Rm + VCVT.F64.S32/U32 Dd, Sd as Thumb-2
7222    /// Encode i32 → f64 conversion as Thumb-2. The integer stages through the
7223    /// DESTINATION's own low S-alias (`S(2d)`) — allocator-owned by
7224    /// definition — never S0 (which may hold a live value; the previous
7225    /// pseudo-op's S0 staging was the #615 class). Also fixes the SWAPPED
7226    /// signed/unsigned VCVT bases (bit7 = 1 is SIGNED — the same swap the f32
7227    /// twin had; latent here because f64.convert_i32_* was decode-dropped
7228    /// until #369): clang-verified vcvt.f64.s32 d1,s2 = eeb8 1bc1,
7229    /// vcvt.f64.u32 d1,s2 = eeb8 1b41.
7230    fn encode_thumb_f64_convert_i32(&self, dd: &VfpReg, rm: &Reg, signed: bool) -> Result<Vec<u8>> {
7231        let dd_num = vfp_dreg_to_num(dd)?;
7232        if dd_num > 7 {
7233            return Err(synth_core::Error::synthesis(format!(
7234                "F64ConvertI32: destination {dd:?} has no S-register alias \
7235                 (D8..D15) — the selector allocates only D0..D7"
7236            )));
7237        }
7238        let mut bytes = Vec::new();
7239
7240        // VMOV S(2d), Rm — stage the integer in the destination's low word.
7241        let (vn_s, n_s) = encode_sreg(2 * dd_num);
7242        let rt = reg_to_bits(rm);
7243        let vmov = 0xEE000A10 | (vn_s << 16) | (rt << 12) | (n_s << 7);
7244        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
7245
7246        // VCVT.F64.S32/U32 Dd, S(2d)
7247        let (vd, d) = encode_dreg(dd_num);
7248        let (vm, m) = encode_sreg(2 * dd_num);
7249        let base = if signed { 0xEEB80BC0 } else { 0xEEB80B40 };
7250        let vcvt = base | (d << 22) | (vd << 12) | (m << 5) | vm;
7251        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt));
7252
7253        Ok(bytes)
7254    }
7255
7256    /// Encode VCVT.F64.F32 Dd, Sm as Thumb-2
7257    fn encode_thumb_f64_promote_f32(&self, dd: &VfpReg, sm: &VfpReg) -> Result<Vec<u8>> {
7258        let dd_num = vfp_dreg_to_num(dd)?;
7259        let sm_num = vfp_sreg_to_num(sm)?;
7260        let (vd, d) = encode_dreg(dd_num);
7261        let (vm, m) = encode_sreg(sm_num);
7262
7263        let vcvt = 0xEEB70AC0 | (d << 22) | (vd << 12) | (m << 5) | vm;
7264        Ok(vfp_to_thumb_bytes(vcvt))
7265    }
7266
7267    /// Encode VCVT.F32.F64 Sd, Dm (f32.demote_f64) as Thumb-2 — single
7268    /// instruction, round-to-nearest-even per FPSCR default, exactly WASM
7269    /// §4.3.3 demote (clang-verified: vcvt.f32.f64 s1,d2 = eef7 0bc2).
7270    fn encode_thumb_f32_demote_f64(&self, sd: &VfpReg, dm: &VfpReg) -> Result<Vec<u8>> {
7271        let sd_num = vfp_sreg_to_num(sd)?;
7272        let dm_num = vfp_dreg_to_num(dm)?;
7273        let (vd, d) = encode_sreg(sd_num);
7274        let (vm, m) = encode_dreg(dm_num);
7275
7276        let vcvt = 0xEEB70BC0 | (d << 22) | (vd << 12) | (m << 5) | vm;
7277        Ok(vfp_to_thumb_bytes(vcvt))
7278    }
7279
7280    /// Encode f64 → i32 truncation as Thumb-2 (round-toward-zero VCVT). The
7281    /// 32-bit result stages through the SOURCE's own low S-alias (`S(2m)`,
7282    /// clobbering half of an operand the selector has already popped) — never
7283    /// S0, which may hold an unrelated live value (the #615 class). The
7284    /// overlapping write is well-defined: VCVT reads its source operand
7285    /// before writing (compilers emit `vcvt.f32.f64 s0, d0` routinely).
7286    /// The SELECTOR guarantees `dm` is a dead temp, never a pinned param/
7287    /// local home (it copies a home into a fresh D-temp first).
7288    fn encode_thumb_i32_trunc_f64(&self, rd: &Reg, dm: &VfpReg, signed: bool) -> Result<Vec<u8>> {
7289        let dm_num = vfp_dreg_to_num(dm)?;
7290        if dm_num > 7 {
7291            return Err(synth_core::Error::synthesis(format!(
7292                "I32TruncF64: source {dm:?} has no S-register alias \
7293                 (D8..D15) — the selector allocates only D0..D7"
7294            )));
7295        }
7296        let mut bytes = Vec::new();
7297
7298        // VCVT.S32/U32.F64 S(2m), Dm (clang-verified:
7299        // vcvt.s32.f64 s1,d2 = eefd 0bc2 ; vcvt.u32.f64 s1,d2 = eefc 0bc2)
7300        let (vm, m) = encode_dreg(dm_num);
7301        let (vd_s, d_s) = encode_sreg(2 * dm_num);
7302        let base = if signed { 0xEEBD0BC0 } else { 0xEEBC0BC0 };
7303        let vcvt = base | (d_s << 22) | (vd_s << 12) | (m << 5) | vm;
7304        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt));
7305
7306        // VMOV Rd, S(2m)
7307        let rt = reg_to_bits(rd);
7308        let vmov = 0xEE100A10 | (vd_s << 16) | (rt << 12) | (d_s << 7);
7309        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
7310
7311        Ok(bytes)
7312    }
7313
7314    /// Encode F64 rounding as a SINGLE Thumb-2 VRINT (FPv5 / cortex-m7dp).
7315    /// `mode` keeps the legacy FPSCR-RMode numbering of the callers —
7316    /// 0b00=nearest(ties-to-even)→VRINTN, 0b01=+inf(ceil)→VRINTP,
7317    /// 0b10=-inf(floor)→VRINTM, 0b11=zero(trunc)→VRINTZ — but the rounding
7318    /// mode is now ENCODED in the instruction, not smuggled through FPSCR.
7319    /// (The previous pseudo-op round-tripped through a 32-bit integer in S0:
7320    /// wrong for |x| >= 2^31, NaN/±inf collapsed to 0, -0.0 lost, and it
7321    /// CLOBBERED S0/R12 behind the allocator's back — the #615 class.)
7322    /// VRINT quietens an sNaN and preserves the sign of ±0.0/NaN per IEEE 754
7323    /// roundToIntegral, which is exactly WASM Core §4.3.3 f64.ceil/floor/
7324    /// trunc/nearest. VRINTN/P/M live in the FE "always-execute" space (never
7325    /// IT-conditional; none of these sequences emits them inside an IT block).
7326    fn encode_thumb_f64_rounding(&self, dd: &VfpReg, dm: &VfpReg, mode: u8) -> Result<Vec<u8>> {
7327        let dd_num = vfp_dreg_to_num(dd)?;
7328        let dm_num = vfp_dreg_to_num(dm)?;
7329        let (vd, d) = encode_dreg(dd_num);
7330        let (vm, m) = encode_dreg(dm_num);
7331        // clang-verified bases (thumbv7em, fpv5-d16):
7332        //   vrintn.f64 d1,d2 = feb9 1b42 ; vrintp = feba 1b42
7333        //   vrintm.f64 d1,d2 = febb 1b42 ; vrintz = eeb6 1bc2
7334        let base: u32 = match mode {
7335            0b00 => 0xFEB90B40, // VRINTN.F64 (round to nearest, ties to even)
7336            0b01 => 0xFEBA0B40, // VRINTP.F64 (round toward +inf)
7337            0b10 => 0xFEBB0B40, // VRINTM.F64 (round toward -inf)
7338            _ => 0xEEB60BC0,    // VRINTZ.F64 (round toward zero)
7339        };
7340        Ok(vfp_to_thumb_bytes(
7341            base | (d << 22) | (vd << 12) | (m << 5) | vm,
7342        ))
7343    }
7344
7345    /// Encode F64 min/max as Thumb-2 with WASM Core §4.3.3 semantics:
7346    ///
7347    ///   VCMP.F64 Dn, Dm ; VMRS APSR_nzcv, FPSCR
7348    ///   VMINNM.F64/VMAXNM.F64 Dd, Dn, Dm      (FPv5; -0.0 < +0.0 ordered)
7349    ///   IT VS ; VADD.F64(VS) Dd, Dn, Dm       (unordered ⇒ NaN-propagating)
7350    ///
7351    /// VMINNM/VMAXNM alone are IEEE minNum/maxNum, which return the NUMBER
7352    /// when exactly one operand is NaN — WASM requires NaN. The VS-guarded
7353    /// VADD overwrites the result with a quiet NaN whenever the compare was
7354    /// unordered (either operand NaN); on the ordered path VMINNM/VMAXNM
7355    /// order -0.0 below +0.0, matching WASM's min(+0,-0) = -0 / max = +0.
7356    /// Clobbers ONLY Dd and the flags (the previous pseudo-op's ordered IT
7357    /// GT/MI select returned the WRONG operand for NaN and ±0 mixes).
7358    ///
7359    /// Ok-or-Err: `dd` must not alias `dn`/`dm` — the VS fix-up reads them
7360    /// AFTER VMINNM wrote `dd` (the selector always allocates a fresh
7361    /// destination while both sources are still marked live).
7362    fn encode_thumb_f64_minmax(
7363        &self,
7364        dd: &VfpReg,
7365        dn: &VfpReg,
7366        dm: &VfpReg,
7367        is_min: bool,
7368    ) -> Result<Vec<u8>> {
7369        if dd == dn || dd == dm {
7370            return Err(synth_core::Error::synthesis(format!(
7371                "F64{}: destination {dd:?} aliases a source ({dn:?},{dm:?}) — \
7372                 the unordered NaN fix-up would read a clobbered operand \
7373                 (compiler bug: the selector must allocate a fresh D-temp)",
7374                if is_min { "Min" } else { "Max" },
7375            )));
7376        }
7377        let mut bytes = Vec::new();
7378        let dd_num = vfp_dreg_to_num(dd)?;
7379        let dn_num = vfp_dreg_to_num(dn)?;
7380        let dm_num = vfp_dreg_to_num(dm)?;
7381        let (vd, d) = encode_dreg(dd_num);
7382        let (vn, n) = encode_dreg(dn_num);
7383        let (vm, m) = encode_dreg(dm_num);
7384
7385        // VCMP.F64 Dn, Dm (clang-verified: vcmp.f64 d2,d3 = eeb4 2b43)
7386        let vcmp = 0xEEB40B40 | (n << 22) | (vn << 12) | (m << 5) | vm;
7387        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcmp));
7388        // VMRS APSR_nzcv, FPSCR
7389        bytes.extend_from_slice(&vfp_to_thumb_bytes(0xEEF1FA10));
7390        // VMINNM.F64 / VMAXNM.F64 Dd, Dn, Dm (clang-verified:
7391        // vminnm.f64 d1,d2,d3 = fe82 1b43 ; vmaxnm = fe82 1b03)
7392        let base: u32 = if is_min { 0xFE800B40 } else { 0xFE800B00 };
7393        let vnm = base | (d << 22) | (vn << 16) | (vd << 12) | (n << 7) | (m << 5) | vm;
7394        bytes.extend_from_slice(&vfp_to_thumb_bytes(vnm));
7395        // IT VS (unordered ⇒ at least one NaN operand)
7396        bytes.extend_from_slice(&0xBF68_u16.to_le_bytes());
7397        // VADD.F64(VS) Dd, Dn, Dm — NaN + x propagates a quiet NaN
7398        let vadd = 0xEE300B00 | (d << 22) | (vn << 16) | (vd << 12) | (n << 7) | (m << 5) | vm;
7399        bytes.extend_from_slice(&vfp_to_thumb_bytes(vadd));
7400
7401        Ok(bytes)
7402    }
7403
7404    /// Encode F64 copysign as Thumb-2, clobbering ONLY R12 (the reserved
7405    /// encoder scratch, #212), the flags, and Dd:
7406    ///
7407    ///   VMOV R12, S(2m+1)   (high word of the SIGN source Dm)
7408    ///   CMP  R12, #0        (N flag = the sign bit)
7409    ///   VABS.F64 Dd, Dn     (magnitude, sign cleared)
7410    ///   IT MI ; VNEG.F64(MI) Dd, Dd
7411    ///
7412    /// Bit-exact on ±0.0/NaN-sign/±inf (VABS/VNEG are sign-bit-only edits).
7413    /// The R12 capture happens BEFORE Dd is written, so Dd aliasing Dn or Dm
7414    /// is safe. (The previous pseudo-op clobbered R0/R1/R2 behind the
7415    /// allocator's back — the #615 class.)
7416    fn encode_thumb_f64_copysign(&self, dd: &VfpReg, dn: &VfpReg, dm: &VfpReg) -> Result<Vec<u8>> {
7417        let dm_num = vfp_dreg_to_num(dm)?;
7418        if dm_num > 7 {
7419            return Err(synth_core::Error::synthesis(format!(
7420                "F64Copysign: sign source {dm:?} has no S-register alias \
7421                 (D8..D15) — the selector allocates only D0..D7"
7422            )));
7423        }
7424        let mut bytes = Vec::new();
7425        // VMOV R12, S(2m+1) — the sign source's high word.
7426        let (vn_s, n_s) = encode_sreg(2 * dm_num + 1);
7427        let vmov = 0xEE100A10 | (vn_s << 16) | (12 << 12) | (n_s << 7);
7428        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
7429        // CMP R12, #0 (T2: CMP.W R12, #0) — N = bit31 of the sign word.
7430        bytes.extend_from_slice(&0xF1BC_u16.to_le_bytes());
7431        bytes.extend_from_slice(&0x0F00_u16.to_le_bytes());
7432        // VABS.F64 Dd, Dn
7433        let dd_num = vfp_dreg_to_num(dd)?;
7434        let dn_num = vfp_dreg_to_num(dn)?;
7435        let (vd, d) = encode_dreg(dd_num);
7436        let (vn, n) = encode_dreg(dn_num);
7437        let vabs = 0xEEB00BC0 | (d << 22) | (vd << 12) | (n << 5) | vn;
7438        bytes.extend_from_slice(&vfp_to_thumb_bytes(vabs));
7439        // IT MI ; VNEG.F64(MI) Dd, Dd
7440        bytes.extend_from_slice(&0xBF48_u16.to_le_bytes());
7441        let vneg = 0xEEB10B40 | (d << 22) | (vd << 12) | (d << 5) | vd;
7442        bytes.extend_from_slice(&vfp_to_thumb_bytes(vneg));
7443
7444        Ok(bytes)
7445    }
7446
7447    /// Encode VCVT.S32/U32.F32 + VMOV as Thumb-2
7448    fn encode_thumb_i32_trunc_f32(&self, rd: &Reg, sm: &VfpReg, signed: bool) -> Result<Vec<u8>> {
7449        let mut bytes = Vec::new();
7450
7451        let sm_num = vfp_sreg_to_num(sm)?;
7452        let (vd, d) = encode_sreg(sm_num);
7453        let (vm, m) = encode_sreg(sm_num);
7454        let base = if signed { 0xEEBD0AC0 } else { 0xEEBC0AC0 };
7455        let vcvt = base | (d << 22) | (vd << 12) | (m << 5) | vm;
7456        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt));
7457
7458        // VMOV Rd, Sm
7459        let vmov = encode_vmov_core_sreg(false, sm, rd)?;
7460        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
7461
7462        Ok(bytes)
7463    }
7464
7465    // === Thumb-2 32-bit encoding helpers ===
7466
7467    /// Encode Thumb-2 32-bit ADD with immediate
7468    fn encode_thumb32_add(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7469        let rd_bits = reg_to_bits(rd);
7470        let rn_bits = reg_to_bits(rn);
7471
7472        // The `i:imm3:imm8` field is split the same way for both forms.
7473        let i_bit = (imm >> 11) & 1;
7474        let imm3 = (imm >> 8) & 0x7;
7475        let imm8 = imm & 0xFF;
7476
7477        let hw1_base = if imm <= 0xFF {
7478            // ADD.W (T3): the field is a ThumbExpandImm modified immediate. For
7479            // imm <= 0xFF (i:imm3 = 0000) it is the zero-extended byte, which is
7480            // correct — keep this form so existing encodings stay bit-identical.
7481            0xF100
7482        } else if imm <= 0xFFF {
7483            // ADDW (T4): a PLAIN 12-bit immediate (0..4095) — no ThumbExpandImm.
7484            // This is what makes `add sp, sp, #frame` correct for frame sizes
7485            // >= 256, which ADD.W (T3) would silently mis-encode (e.g. #256 -> #0).
7486            0xF200
7487        } else {
7488            return Err(synth_core::Error::synthesis(
7489                "ADD immediate > 0xFFF (4095) requires a multi-instruction sequence (not supported)",
7490            ));
7491        };
7492
7493        let hw1: u16 = (hw1_base | (i_bit << 10) | rn_bits) as u16;
7494        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7495
7496        let mut bytes = hw1.to_le_bytes().to_vec();
7497        bytes.extend_from_slice(&hw2.to_le_bytes());
7498        Ok(bytes)
7499    }
7500
7501    /// Encode Thumb-2 32-bit SUB with immediate
7502    fn encode_thumb32_sub(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7503        let rd_bits = reg_to_bits(rd);
7504        let rn_bits = reg_to_bits(rn);
7505
7506        let i_bit = (imm >> 11) & 1;
7507        let imm3 = (imm >> 8) & 0x7;
7508        let imm8 = imm & 0xFF;
7509
7510        let hw1_base = if imm <= 0xFF {
7511            // SUB.W (T3) modified immediate — correct for the zero-extended byte
7512            // (imm <= 0xFF). Kept bit-identical for existing encodings.
7513            0xF1A0
7514        } else if imm <= 0xFFF {
7515            // SUBW (T4): plain 12-bit immediate (0..4095). Makes
7516            // `sub sp, sp, #frame` correct for frame sizes >= 256.
7517            0xF2A0
7518        } else {
7519            return Err(synth_core::Error::synthesis(
7520                "SUB immediate > 0xFFF (4095) requires a multi-instruction sequence (not supported)",
7521            ));
7522        };
7523
7524        let hw1: u16 = (hw1_base | (i_bit << 10) | rn_bits) as u16;
7525        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7526
7527        let mut bytes = hw1.to_le_bytes().to_vec();
7528        bytes.extend_from_slice(&hw2.to_le_bytes());
7529        Ok(bytes)
7530    }
7531
7532    /// Encode Thumb-2 32-bit ADDS with immediate (sets flags)
7533    fn encode_thumb32_adds(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7534        let rd_bits = reg_to_bits(rd);
7535        let rn_bits = reg_to_bits(rn);
7536
7537        // ADDS.W (flag-setting) has only the modified-immediate form — error on
7538        // an un-encodable value rather than silently add the wrong constant.
7539        let field = try_thumb_expand_imm(imm).ok_or_else(|| {
7540            synth_core::Error::synthesis(
7541                "ADDS immediate is not a valid ThumbExpandImm — materialize into a register",
7542            )
7543        })?;
7544        let i_bit = (field >> 11) & 1;
7545        let imm3 = (field >> 8) & 0x7;
7546        let imm8 = field & 0xFF;
7547
7548        // ADDS.W Rd, Rn, #imm (with S=1)
7549        // First halfword: 1111 0 i 0 1000 1 Rn = F110 | i<<10 | Rn
7550        let hw1: u16 = (0xF110 | (i_bit << 10) | rn_bits) as u16;
7551        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7552
7553        let mut bytes = hw1.to_le_bytes().to_vec();
7554        bytes.extend_from_slice(&hw2.to_le_bytes());
7555        Ok(bytes)
7556    }
7557
7558    /// Encode Thumb-2 32-bit SUBS with immediate (sets flags)
7559    fn encode_thumb32_subs(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7560        let rd_bits = reg_to_bits(rd);
7561        let rn_bits = reg_to_bits(rn);
7562
7563        // SUBS.W (flag-setting) has only the modified-immediate form — error on
7564        // an un-encodable value rather than silently subtract the wrong constant.
7565        let field = try_thumb_expand_imm(imm).ok_or_else(|| {
7566            synth_core::Error::synthesis(
7567                "SUBS immediate is not a valid ThumbExpandImm — materialize into a register",
7568            )
7569        })?;
7570        let i_bit = (field >> 11) & 1;
7571        let imm3 = (field >> 8) & 0x7;
7572        let imm8 = field & 0xFF;
7573
7574        // SUBS.W Rd, Rn, #imm (with S=1)
7575        // First halfword: 1111 0 i 0 1101 1 Rn = F1B0 | i<<10 | Rn
7576        let hw1: u16 = (0xF1B0 | (i_bit << 10) | rn_bits) as u16;
7577        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7578
7579        let mut bytes = hw1.to_le_bytes().to_vec();
7580        bytes.extend_from_slice(&hw2.to_le_bytes());
7581        Ok(bytes)
7582    }
7583
7584    /// Encode Thumb-2 32-bit MOVW (16-bit immediate)
7585    ///
7586    /// # Contract (Verus-style)
7587    /// ```text
7588    /// requires rd <= R14
7589    /// ensures result.len() == 4
7590    /// ensures (imm & 0xFFFF) can be reconstructed from the encoding
7591    /// ```
7592    fn encode_thumb32_movw(&self, rd: &Reg, imm: u32) -> Result<Vec<u8>> {
7593        let rd_bits = reg_to_bits(rd);
7594        reg_bits_checked(rd_bits)?;
7595        let imm16 = imm & 0xFFFF;
7596
7597        // MOVW Rd, #imm16
7598        // 1111 0 i 10 0 1 0 0 imm4 | 0 imm3 Rd imm8
7599        let imm4 = (imm16 >> 12) & 0xF;
7600        let i_bit = (imm16 >> 11) & 1;
7601        let imm3 = (imm16 >> 8) & 0x7;
7602        let imm8 = imm16 & 0xFF;
7603
7604        let hw1: u16 = (0xF240 | (i_bit << 10) | imm4) as u16;
7605        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7606
7607        let mut bytes = hw1.to_le_bytes().to_vec();
7608        bytes.extend_from_slice(&hw2.to_le_bytes());
7609        encoding_contracts::verify_thumb32(&bytes);
7610        Ok(bytes)
7611    }
7612
7613    /// Encode Thumb-2 32-bit shift with immediate
7614    ///
7615    /// # Contract (Verus-style)
7616    /// ```text
7617    /// requires rd <= R14, rm <= R14
7618    /// ensures result.len() == 4
7619    /// ```
7620    fn encode_thumb32_shift(
7621        &self,
7622        rd: &Reg,
7623        rm: &Reg,
7624        shift: u32,
7625        shift_type: u8,
7626    ) -> Result<Vec<u8>> {
7627        let rd_bits = reg_to_bits(rd);
7628        let rm_bits = reg_to_bits(rm);
7629        reg_bits_checked(rd_bits)?;
7630        reg_bits_checked(rm_bits)?;
7631        let imm5 = shift & 0x1F;
7632        let imm2 = imm5 & 0x3;
7633        let imm3 = (imm5 >> 2) & 0x7;
7634
7635        // MOV.W Rd, Rm, <shift> #imm
7636        // EA4F 0 imm3 Rd imm2 type Rm
7637        let hw1: u16 = 0xEA4F;
7638        let hw2: u16 =
7639            ((imm3 << 12) | (rd_bits << 8) | (imm2 << 6) | ((shift_type as u32) << 4) | rm_bits)
7640                as u16;
7641
7642        let mut bytes = hw1.to_le_bytes().to_vec();
7643        bytes.extend_from_slice(&hw2.to_le_bytes());
7644        Ok(bytes)
7645    }
7646
7647    /// Encode Thumb-2 32-bit shift by register
7648    /// Encoding: 11111010 0xx0 Rn | 1111 Rd 0000 Rm
7649    /// shift_type: 00=LSL, 01=LSR, 10=ASR, 11=ROR
7650    fn encode_thumb32_shift_reg(
7651        &self,
7652        rd: &Reg,
7653        rn: &Reg,
7654        rm: &Reg,
7655        shift_type: u8,
7656    ) -> Result<Vec<u8>> {
7657        let rd_bits = reg_to_bits(rd);
7658        let rn_bits = reg_to_bits(rn);
7659        let rm_bits = reg_to_bits(rm);
7660
7661        // hw1: 1111 1010 0xx0 Rn
7662        let hw1: u16 = (0xFA00 | ((shift_type as u32) << 5) | rn_bits) as u16;
7663        // hw2: 1111 Rd 0000 Rm
7664        let hw2: u16 = (0xF000 | (rd_bits << 8) | rm_bits) as u16;
7665
7666        let mut bytes = hw1.to_le_bytes().to_vec();
7667        bytes.extend_from_slice(&hw2.to_le_bytes());
7668        Ok(bytes)
7669    }
7670
7671    /// Encode Thumb-2 32-bit CMP with immediate
7672    fn encode_thumb32_cmp_imm(&self, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7673        let rn_bits = reg_to_bits(rn);
7674
7675        // CMP.W has only the modified-immediate form (no plain-imm12 like ADDW),
7676        // so an un-encodable immediate MUST be materialized into a register by
7677        // the selector. Error rather than silently compare the wrong constant.
7678        let field = try_thumb_expand_imm(imm).ok_or_else(|| {
7679            synth_core::Error::synthesis(
7680                "CMP immediate is not a valid ThumbExpandImm — materialize into a register",
7681            )
7682        })?;
7683        let i_bit = (field >> 11) & 1;
7684        let imm3 = (field >> 8) & 0x7;
7685        let imm8 = field & 0xFF;
7686
7687        // CMP.W Rn, #imm
7688        let hw1: u16 = (0xF1B0 | (i_bit << 10) | rn_bits) as u16;
7689        let hw2: u16 = ((imm3 << 12) | 0x0F00 | imm8) as u16;
7690
7691        let mut bytes = hw1.to_le_bytes().to_vec();
7692        bytes.extend_from_slice(&hw2.to_le_bytes());
7693        Ok(bytes)
7694    }
7695
7696    /// #372/#382: resolve the base register AND residual immediate offset for an
7697    /// `I64Ldr`/`I64Str` whose address may carry an index register. Returns
7698    /// `(base, low_offset)`; the caller accesses the halves at `[base,
7699    /// #low_offset]` and `[base, #low_offset + 4]`.
7700    ///
7701    /// - Frame access (no `offset_reg`, e.g. a spilled local at `[SP, #off]`):
7702    ///   returns `(addr.base, off)` and emits NOTHING — byte-identical.
7703    /// - Memory access (`reg_imm(R11, addr, offset)` = `R11 + addr + offset`)
7704    ///   with `offset + 4 <= 0xFFF`: emits `ADD.W ip, base, index` and returns
7705    ///   `(ip, offset)`, folding `offset`/`offset+4` into the halves' imm12.
7706    ///   Byte-identical to the pre-#382 (#372) behavior.
7707    /// - Memory access with `offset + 4 > 0xFFF`: the imm12 form cannot hold the
7708    ///   high half's offset, so `encode_thumb32_ldr`'s `check_ldst_imm12` (#259)
7709    ///   rightly refused it and the WHOLE function was skipped (#382). Instead
7710    ///   MATERIALIZE the offset into the base: `ADD ip, index, #offset` (against
7711    ///   the read-only INDEX register, so `encode_thumb32_add_imm` never trips its
7712    ///   `rd==rn==R12` alias trap), then `ADD.W ip, ip, base` (+ R11), and return
7713    ///   `(ip, 0)` so the halves use `[ip, #0]` / `[ip, #4]`.
7714    ///
7715    /// The effective address is fully materialized into `ip` BEFORE the halves
7716    /// are accessed, so an `rdlo` aliasing the index register is safe.
7717    fn i64_effective_base(&self, bytes: &mut Vec<u8>, addr: &MemAddr) -> Result<(Reg, u32)> {
7718        let offset = if addr.offset < 0 {
7719            0u32
7720        } else {
7721            addr.offset as u32
7722        };
7723        match addr.offset_reg {
7724            Some(idx) => {
7725                let ip = Reg::R12;
7726                if offset.wrapping_add(4) > 0xFFF {
7727                    // Large static offset (#382): fold it (and R11) into ip so the
7728                    // imm12 halves stay in range instead of skipping the function.
7729                    // ADD ip, index, #offset  (index != ip → no add_imm alias trap)
7730                    bytes.extend_from_slice(&self.encode_thumb32_add_imm(&ip, &idx, offset)?);
7731                    // ADD.W ip, ip, base  (+ R11)
7732                    bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
7733                        reg_to_bits(&ip),
7734                        reg_to_bits(&ip),
7735                        reg_to_bits(&addr.base),
7736                    )?);
7737                    Ok((ip, 0))
7738                } else {
7739                    // ADD.W ip, addr.base, idx  (Thumb-2, byte-verified vs as)
7740                    let hw1: u16 = 0xEB00 | reg_to_bits(&addr.base) as u16;
7741                    let hw2: u16 = 0x0C00 | reg_to_bits(&idx) as u16;
7742                    bytes.extend_from_slice(&hw1.to_le_bytes());
7743                    bytes.extend_from_slice(&hw2.to_le_bytes());
7744                    Ok((ip, offset))
7745                }
7746            }
7747            None => Ok((addr.base, offset)),
7748        }
7749    }
7750
7751    /// Encode Thumb-2 32-bit LDR
7752    fn encode_thumb32_ldr(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7753        let rd_bits = reg_to_bits(rd);
7754        let base_bits = reg_to_bits(base);
7755
7756        // LDR.W Rd, [Rn, #imm12]
7757        check_ldst_imm12(offset)?;
7758        let hw1: u16 = (0xF8D0 | base_bits) as u16;
7759        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7760
7761        let mut bytes = hw1.to_le_bytes().to_vec();
7762        bytes.extend_from_slice(&hw2.to_le_bytes());
7763        Ok(bytes)
7764    }
7765
7766    /// Encode Thumb-2 32-bit STR
7767    fn encode_thumb32_str(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7768        let rd_bits = reg_to_bits(rd);
7769        let base_bits = reg_to_bits(base);
7770
7771        // STR.W Rd, [Rn, #imm12]
7772        check_ldst_imm12(offset)?;
7773        let hw1: u16 = (0xF8C0 | base_bits) as u16;
7774        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7775
7776        let mut bytes = hw1.to_le_bytes().to_vec();
7777        bytes.extend_from_slice(&hw2.to_le_bytes());
7778        Ok(bytes)
7779    }
7780
7781    /// Encode Thumb-2 32-bit LDR with register offset: LDR.W Rd, [Rn, Rm]
7782    fn encode_thumb32_ldr_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7783        let rd_bits = reg_to_bits(rd);
7784        let base_bits = reg_to_bits(base);
7785        let rm_bits = reg_to_bits(offset_reg);
7786
7787        // LDR.W Rd, [Rn, Rm, LSL #0]
7788        // Encoding: 1111 1000 0101 Rn | Rt 0000 00 imm2 Rm
7789        // imm2 = 00 for no shift (LSL #0)
7790        let hw1: u16 = (0xF850 | base_bits) as u16;
7791        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7792
7793        let mut bytes = hw1.to_le_bytes().to_vec();
7794        bytes.extend_from_slice(&hw2.to_le_bytes());
7795        Ok(bytes)
7796    }
7797
7798    /// Encode Thumb-2 32-bit STR with register offset: STR.W Rd, [Rn, Rm]
7799    fn encode_thumb32_str_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7800        let rd_bits = reg_to_bits(rd);
7801        let base_bits = reg_to_bits(base);
7802        let rm_bits = reg_to_bits(offset_reg);
7803
7804        // STR.W Rd, [Rn, Rm, LSL #0]
7805        // Encoding: 1111 1000 0100 Rn | Rt 0000 00 imm2 Rm
7806        // imm2 = 00 for no shift (LSL #0)
7807        let hw1: u16 = (0xF840 | base_bits) as u16;
7808        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7809
7810        let mut bytes = hw1.to_le_bytes().to_vec();
7811        bytes.extend_from_slice(&hw2.to_le_bytes());
7812        Ok(bytes)
7813    }
7814
7815    // === Sub-word load/store Thumb-2 encoding helpers ===
7816
7817    /// Encode Thumb-2 32-bit LDRB with immediate: LDRB.W Rd, [Rn, #imm12]
7818    fn encode_thumb32_ldrb_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7819        let rd_bits = reg_to_bits(rd);
7820        let base_bits = reg_to_bits(base);
7821        // LDRB.W Rd, [Rn, #imm12]: 1111 1000 1001 Rn | Rt imm12
7822        check_ldst_imm12(offset)?;
7823        let hw1: u16 = (0xF890 | base_bits) as u16;
7824        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7825        let mut bytes = hw1.to_le_bytes().to_vec();
7826        bytes.extend_from_slice(&hw2.to_le_bytes());
7827        Ok(bytes)
7828    }
7829
7830    /// Encode Thumb-2 32-bit LDRB with register: LDRB.W Rd, [Rn, Rm]
7831    fn encode_thumb32_ldrb_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7832        let rd_bits = reg_to_bits(rd);
7833        let base_bits = reg_to_bits(base);
7834        let rm_bits = reg_to_bits(offset_reg);
7835        // LDRB.W Rd, [Rn, Rm, LSL #0]: 1111 1000 0001 Rn | Rt 0000 00 imm2 Rm
7836        let hw1: u16 = (0xF810 | base_bits) as u16;
7837        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7838        let mut bytes = hw1.to_le_bytes().to_vec();
7839        bytes.extend_from_slice(&hw2.to_le_bytes());
7840        Ok(bytes)
7841    }
7842
7843    /// Encode Thumb-2 32-bit LDRSB with immediate: LDRSB.W Rd, [Rn, #imm12]
7844    fn encode_thumb32_ldrsb_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7845        let rd_bits = reg_to_bits(rd);
7846        let base_bits = reg_to_bits(base);
7847        // LDRSB.W Rd, [Rn, #imm12]: 1111 1001 1001 Rn | Rt imm12
7848        check_ldst_imm12(offset)?;
7849        let hw1: u16 = (0xF990 | base_bits) as u16;
7850        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7851        let mut bytes = hw1.to_le_bytes().to_vec();
7852        bytes.extend_from_slice(&hw2.to_le_bytes());
7853        Ok(bytes)
7854    }
7855
7856    /// Encode Thumb-2 32-bit LDRSB with register: LDRSB.W Rd, [Rn, Rm]
7857    fn encode_thumb32_ldrsb_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7858        let rd_bits = reg_to_bits(rd);
7859        let base_bits = reg_to_bits(base);
7860        let rm_bits = reg_to_bits(offset_reg);
7861        // LDRSB.W Rd, [Rn, Rm, LSL #0]: 1111 1001 0001 Rn | Rt 0000 00 imm2 Rm
7862        let hw1: u16 = (0xF910 | base_bits) as u16;
7863        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7864        let mut bytes = hw1.to_le_bytes().to_vec();
7865        bytes.extend_from_slice(&hw2.to_le_bytes());
7866        Ok(bytes)
7867    }
7868
7869    /// Encode Thumb-2 32-bit LDRH with immediate: LDRH.W Rd, [Rn, #imm12]
7870    fn encode_thumb32_ldrh_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7871        let rd_bits = reg_to_bits(rd);
7872        let base_bits = reg_to_bits(base);
7873        // LDRH.W Rd, [Rn, #imm12]: 1111 1000 1011 Rn | Rt imm12
7874        check_ldst_imm12(offset)?;
7875        let hw1: u16 = (0xF8B0 | base_bits) as u16;
7876        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7877        let mut bytes = hw1.to_le_bytes().to_vec();
7878        bytes.extend_from_slice(&hw2.to_le_bytes());
7879        Ok(bytes)
7880    }
7881
7882    /// Encode Thumb-2 32-bit LDRH with register: LDRH.W Rd, [Rn, Rm]
7883    fn encode_thumb32_ldrh_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7884        let rd_bits = reg_to_bits(rd);
7885        let base_bits = reg_to_bits(base);
7886        let rm_bits = reg_to_bits(offset_reg);
7887        // LDRH.W Rd, [Rn, Rm, LSL #0]: 1111 1000 0011 Rn | Rt 0000 00 imm2 Rm
7888        let hw1: u16 = (0xF830 | base_bits) as u16;
7889        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7890        let mut bytes = hw1.to_le_bytes().to_vec();
7891        bytes.extend_from_slice(&hw2.to_le_bytes());
7892        Ok(bytes)
7893    }
7894
7895    /// Encode Thumb-2 32-bit LDRSH with immediate: LDRSH.W Rd, [Rn, #imm12]
7896    fn encode_thumb32_ldrsh_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7897        let rd_bits = reg_to_bits(rd);
7898        let base_bits = reg_to_bits(base);
7899        // LDRSH.W Rd, [Rn, #imm12]: 1111 1001 1011 Rn | Rt imm12
7900        check_ldst_imm12(offset)?;
7901        let hw1: u16 = (0xF9B0 | base_bits) as u16;
7902        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7903        let mut bytes = hw1.to_le_bytes().to_vec();
7904        bytes.extend_from_slice(&hw2.to_le_bytes());
7905        Ok(bytes)
7906    }
7907
7908    /// Encode Thumb-2 32-bit LDRSH with register: LDRSH.W Rd, [Rn, Rm]
7909    fn encode_thumb32_ldrsh_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7910        let rd_bits = reg_to_bits(rd);
7911        let base_bits = reg_to_bits(base);
7912        let rm_bits = reg_to_bits(offset_reg);
7913        // LDRSH.W Rd, [Rn, Rm, LSL #0]: 1111 1001 0011 Rn | Rt 0000 00 imm2 Rm
7914        let hw1: u16 = (0xF930 | base_bits) as u16;
7915        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7916        let mut bytes = hw1.to_le_bytes().to_vec();
7917        bytes.extend_from_slice(&hw2.to_le_bytes());
7918        Ok(bytes)
7919    }
7920
7921    /// Encode Thumb-2 32-bit STRB with immediate: STRB.W Rd, [Rn, #imm12]
7922    fn encode_thumb32_strb_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7923        let rd_bits = reg_to_bits(rd);
7924        let base_bits = reg_to_bits(base);
7925        // STRB.W Rd, [Rn, #imm12]: 1111 1000 1000 Rn | Rt imm12
7926        check_ldst_imm12(offset)?;
7927        let hw1: u16 = (0xF880 | base_bits) as u16;
7928        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7929        let mut bytes = hw1.to_le_bytes().to_vec();
7930        bytes.extend_from_slice(&hw2.to_le_bytes());
7931        Ok(bytes)
7932    }
7933
7934    /// Encode Thumb-2 32-bit STRB with register: STRB.W Rd, [Rn, Rm]
7935    fn encode_thumb32_strb_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7936        let rd_bits = reg_to_bits(rd);
7937        let base_bits = reg_to_bits(base);
7938        let rm_bits = reg_to_bits(offset_reg);
7939        // STRB.W Rd, [Rn, Rm, LSL #0]: 1111 1000 0000 Rn | Rt 0000 00 imm2 Rm
7940        let hw1: u16 = (0xF800 | base_bits) as u16;
7941        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7942        let mut bytes = hw1.to_le_bytes().to_vec();
7943        bytes.extend_from_slice(&hw2.to_le_bytes());
7944        Ok(bytes)
7945    }
7946
7947    /// Encode Thumb-2 32-bit STRH with immediate: STRH.W Rd, [Rn, #imm12]
7948    fn encode_thumb32_strh_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7949        let rd_bits = reg_to_bits(rd);
7950        let base_bits = reg_to_bits(base);
7951        // STRH.W Rd, [Rn, #imm12]: 1111 1000 1010 Rn | Rt imm12
7952        check_ldst_imm12(offset)?;
7953        let hw1: u16 = (0xF8A0 | base_bits) as u16;
7954        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7955        let mut bytes = hw1.to_le_bytes().to_vec();
7956        bytes.extend_from_slice(&hw2.to_le_bytes());
7957        Ok(bytes)
7958    }
7959
7960    /// Encode Thumb-2 32-bit STRH with register: STRH.W Rd, [Rn, Rm]
7961    fn encode_thumb32_strh_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7962        let rd_bits = reg_to_bits(rd);
7963        let base_bits = reg_to_bits(base);
7964        let rm_bits = reg_to_bits(offset_reg);
7965        // STRH.W Rd, [Rn, Rm, LSL #0]: 1111 1000 0010 Rn | Rt 0000 00 imm2 Rm
7966        let hw1: u16 = (0xF820 | base_bits) as u16;
7967        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7968        let mut bytes = hw1.to_le_bytes().to_vec();
7969        bytes.extend_from_slice(&hw2.to_le_bytes());
7970        Ok(bytes)
7971    }
7972
7973    /// Encode Thumb-2 32-bit ADD with immediate: ADD.W Rd, Rn, #imm
7974    fn encode_thumb32_add_imm(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7975        let rd_bits = reg_to_bits(rd);
7976        let rn_bits = reg_to_bits(rn);
7977
7978        // In-range immediates (<= 0xFFF) delegate to `encode_thumb32_add`,
7979        // which picks the correct form per value:
7980        //   - imm <= 0xFF  -> ADD.W (T3). Its `i:imm3:imm8` field is a
7981        //     ThumbExpandImm MODIFIED immediate — raw == expanded only here.
7982        //   - 0x100..=0xFFF -> ADDW (T4, 0xF200): a PLAIN 12-bit immediate.
7983        //
7984        // #681: this function used to pack the raw value into the T3 field for
7985        // ALL imm <= 0xFFF. ThumbExpandImm(0x200) = 0 and ThumbExpandImm(0x400)
7986        // = 0x8000_0000, so every dynamic-address load/store with a static
7987        // offset in 0x100..=0xFFF silently computed a WRONG address — and in
7988        // --safety-bounds software the guard checked the intended address while
7989        // the access used the mis-encoded one (bounds bypass). Same
7990        // ThumbExpandImm raw-packing class as #253/#255, reached via #382.
7991        if imm <= 0xFFF {
7992            self.encode_thumb32_add(rd, rn, imm)
7993        } else {
7994            // Out-of-range immediate (> 0xFFF): materialize it into a scratch
7995            // register, then ADD.W Rd, Rn, scratch. This is the #180/#185
7996            // "encoder must produce a legal sequence, not assert" class — see #350.
7997            //
7998            // Scratch choice (must NEVER equal Rn, or Rn would be clobbered before
7999            // the ADD reads it):
8000            //   - rd != rn  => use rd itself (rn is untouched, since rd != rn).
8001            //   - rd == rn  => use R12/IP (the reserved encoder scratch). rd/rn are
8002            //                  never R12 (R12 is non-allocatable), so it can't alias.
8003            //
8004            // The materialized value is the same whether or not MOVT is emitted, so
8005            // the byte length depends only on `imm` (and rd==rn) — the size probe and
8006            // the final emit therefore agree (mandatory: the function is encoded twice).
8007            let scratch: u32 = if rd_bits == rn_bits {
8008                12 // R12/IP — in-place add, can't use rd because rd == rn
8009            } else {
8010                rd_bits // rn is preserved because rd != rn
8011            };
8012            // Invariant: the scratch must never alias Rn (would clobber it before
8013            // the ADD reads it). Unreachable in real codegen (rd/rn are never R12,
8014            // which is reserved encoder scratch), but the encoder is also driven by
8015            // the `encoder_no_panic` fuzz harness with ARBITRARY registers — incl.
8016            // rd==rn==R12, which makes scratch (R12) alias Rn. The encoder contract
8017            // (#180/#185) is Ok-or-Err, never a panic, so return a typed error
8018            // instead of asserting. #350 follow-up.
8019            if scratch == rn_bits {
8020                return Err(synth_core::Error::synthesis(format!(
8021                    "ADD #imm: cannot lower #{imm:#x} for Rd==Rn==R12 — no free scratch \
8022                     register (R12 is the reserved encoder scratch and aliases Rn here)"
8023                )));
8024            }
8025
8026            let lo16 = imm & 0xFFFF;
8027            let hi16 = (imm >> 16) & 0xFFFF;
8028
8029            let mut bytes = self.encode_thumb32_movw_raw(scratch, lo16)?;
8030            if hi16 != 0 {
8031                bytes.extend_from_slice(&self.encode_thumb32_movt_raw(scratch, hi16)?);
8032            }
8033            bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(rd_bits, rn_bits, scratch)?);
8034            Ok(bytes)
8035        }
8036    }
8037
8038    // === Raw encoding helpers for POPCNT (take register numbers directly) ===
8039
8040    /// Encode Thumb-2 32-bit MOVW (16-bit immediate) - raw version
8041    ///
8042    /// # Contract (Verus-style)
8043    /// ```text
8044    /// requires rd <= 14, imm16 <= 0xFFFF
8045    /// ensures result.len() == 4
8046    /// ```
8047    fn encode_thumb32_movw_raw(&self, rd: u32, imm16: u32) -> Result<Vec<u8>> {
8048        reg_bits_checked(rd)?;
8049        encoding_contracts::verify_imm16(imm16);
8050        // MOVW Rd, #imm16
8051        // 1111 0 i 10 0 1 0 0 imm4 | 0 imm3 Rd imm8
8052        let imm16 = imm16 & 0xFFFF;
8053        let imm4 = (imm16 >> 12) & 0xF;
8054        let i_bit = (imm16 >> 11) & 1;
8055        let imm3 = (imm16 >> 8) & 0x7;
8056        let imm8 = imm16 & 0xFF;
8057
8058        let hw1: u16 = (0xF240 | (i_bit << 10) | imm4) as u16;
8059        let hw2: u16 = ((imm3 << 12) | (rd << 8) | imm8) as u16;
8060
8061        let mut bytes = hw1.to_le_bytes().to_vec();
8062        bytes.extend_from_slice(&hw2.to_le_bytes());
8063        encoding_contracts::verify_thumb32(&bytes);
8064        Ok(bytes)
8065    }
8066
8067    /// Encode Thumb-2 32-bit MOVT (move top 16 bits) - raw version
8068    ///
8069    /// # Contract (Verus-style)
8070    /// ```text
8071    /// requires rd <= 14, imm16 <= 0xFFFF
8072    /// ensures result.len() == 4
8073    /// ```
8074    fn encode_thumb32_movt_raw(&self, rd: u32, imm16: u32) -> Result<Vec<u8>> {
8075        reg_bits_checked(rd)?;
8076        encoding_contracts::verify_imm16(imm16);
8077        // MOVT Rd, #imm16
8078        // 1111 0 i 10 1 1 0 0 imm4 | 0 imm3 Rd imm8
8079        let imm16 = imm16 & 0xFFFF;
8080        let imm4 = (imm16 >> 12) & 0xF;
8081        let i_bit = (imm16 >> 11) & 1;
8082        let imm3 = (imm16 >> 8) & 0x7;
8083        let imm8 = imm16 & 0xFF;
8084
8085        let hw1: u16 = (0xF2C0 | (i_bit << 10) | imm4) as u16;
8086        let hw2: u16 = ((imm3 << 12) | (rd << 8) | imm8) as u16;
8087
8088        let mut bytes = hw1.to_le_bytes().to_vec();
8089        bytes.extend_from_slice(&hw2.to_le_bytes());
8090        encoding_contracts::verify_thumb32(&bytes);
8091        Ok(bytes)
8092    }
8093
8094    /// Encode Thumb-2 32-bit LSR (logical shift right) with immediate - raw version
8095    fn encode_thumb32_lsr_raw(&self, rd: u32, rm: u32, shift: u32) -> Result<Vec<u8>> {
8096        // MOV.W Rd, Rm, LSR #imm
8097        // EA4F 0 imm3 Rd imm2 01 Rm
8098        let imm5 = shift & 0x1F;
8099        let imm2 = imm5 & 0x3;
8100        let imm3 = (imm5 >> 2) & 0x7;
8101
8102        let hw1: u16 = 0xEA4F;
8103        let hw2: u16 = ((imm3 << 12) | (rd << 8) | (imm2 << 6) | (0b01 << 4) | rm) as u16;
8104
8105        let mut bytes = hw1.to_le_bytes().to_vec();
8106        bytes.extend_from_slice(&hw2.to_le_bytes());
8107        Ok(bytes)
8108    }
8109
8110    /// Encode Thumb-2 32-bit AND (register) - raw version
8111    fn encode_thumb32_and_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8112        // AND.W Rd, Rn, Rm
8113        // EA00 Rn | 0 Rd 00 00 Rm
8114        let hw1: u16 = (0xEA00 | rn) as u16;
8115        let hw2: u16 = ((rd << 8) | rm) as u16;
8116
8117        let mut bytes = hw1.to_le_bytes().to_vec();
8118        bytes.extend_from_slice(&hw2.to_le_bytes());
8119        Ok(bytes)
8120    }
8121
8122    /// Encode Thumb-2 32-bit AND with immediate - raw version
8123    fn encode_thumb32_and_imm_raw(&self, rd: u32, rn: u32, imm: u32) -> Result<Vec<u8>> {
8124        // AND.W Rd, Rn, #<modified_immediate>
8125        // F0 00 Rn | 0 imm3 Rd imm8
8126        //
8127        // #681 class audit: the field is a ThumbExpandImm modified immediate,
8128        // not a raw value. The only current caller (POPCNT final mask) passes
8129        // 0x3F, which expands to itself — the gate is byte-identical today and
8130        // closes the raw-packing landmine for any future caller.
8131        let field = try_thumb_expand_imm(imm).ok_or_else(|| {
8132            synth_core::Error::synthesis(
8133                "AND immediate is not a valid ThumbExpandImm — materialize into a register",
8134            )
8135        })?;
8136        let i_bit = (field >> 11) & 1;
8137        let imm3 = (field >> 8) & 0x7;
8138        let imm8 = field & 0xFF;
8139
8140        let hw1: u16 = (0xF000 | (i_bit << 10) | rn) as u16;
8141        let hw2: u16 = ((imm3 << 12) | (rd << 8) | imm8) as u16;
8142
8143        let mut bytes = hw1.to_le_bytes().to_vec();
8144        bytes.extend_from_slice(&hw2.to_le_bytes());
8145        Ok(bytes)
8146    }
8147
8148    /// Encode Thumb-2 32-bit SUB (register) - raw version
8149    fn encode_thumb32_sub_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8150        // SUB.W Rd, Rn, Rm
8151        // EBA0 Rn | 0 Rd 00 00 Rm
8152        let hw1: u16 = (0xEBA0 | rn) as u16;
8153        let hw2: u16 = ((rd << 8) | rm) as u16;
8154
8155        let mut bytes = hw1.to_le_bytes().to_vec();
8156        bytes.extend_from_slice(&hw2.to_le_bytes());
8157        Ok(bytes)
8158    }
8159
8160    /// Encode Thumb-2 32-bit ADD (register) - raw version
8161    fn encode_thumb32_add_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8162        // ADD.W Rd, Rn, Rm
8163        // EB00 Rn | 0 Rd 00 00 Rm
8164        let hw1: u16 = (0xEB00 | rn) as u16;
8165        let hw2: u16 = ((rd << 8) | rm) as u16;
8166
8167        let mut bytes = hw1.to_le_bytes().to_vec();
8168        bytes.extend_from_slice(&hw2.to_le_bytes());
8169        Ok(bytes)
8170    }
8171
8172    /// Encode Thumb-2 32-bit ADDS (register, flag-setting) - raw version.
8173    /// Used as the high-register fallback for `ArmOp::Adds` (i64 low-word add)
8174    /// so R8-R11 pair operands don't overflow the 16-bit field — #178/#180.
8175    fn encode_thumb32_adds_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8176        // ADDS.W Rd, Rn, Rm (T3, S=1): EB10 Rn | 0 Rd 00 00 Rm
8177        let hw1: u16 = (0xEB10 | rn) as u16;
8178        let hw2: u16 = ((rd << 8) | rm) as u16;
8179        let mut bytes = hw1.to_le_bytes().to_vec();
8180        bytes.extend_from_slice(&hw2.to_le_bytes());
8181        Ok(bytes)
8182    }
8183
8184    /// Encode Thumb-2 32-bit SUBS (register, flag-setting) - raw version.
8185    /// High-register fallback for `ArmOp::Subs` (i64 low-word subtract) — #178/#180.
8186    fn encode_thumb32_subs_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8187        // SUBS.W Rd, Rn, Rm (T3, S=1): EBB0 Rn | 0 Rd 00 00 Rm
8188        let hw1: u16 = (0xEBB0 | rn) as u16;
8189        let hw2: u16 = ((rd << 8) | rm) as u16;
8190        let mut bytes = hw1.to_le_bytes().to_vec();
8191        bytes.extend_from_slice(&hw2.to_le_bytes());
8192        Ok(bytes)
8193    }
8194
8195    /// Encode a sequence of ARM instructions
8196    pub fn encode_sequence(&self, ops: &[ArmOp]) -> Result<Vec<u8>> {
8197        let mut code = Vec::new();
8198
8199        for op in ops {
8200            let encoded = self.encode(op)?;
8201            code.extend_from_slice(&encoded);
8202        }
8203
8204        Ok(code)
8205    }
8206}
8207
8208/// Convert register to bit encoding (0-15)
8209/// Reverse of the ARMv7-M `ThumbExpandImm`: given a 32-bit immediate, return the
8210/// 12-bit `i:imm3:imm8` field if it is a representable modified immediate, else
8211/// `None` (the caller must materialize the value into a register). This is the
8212/// shared correct path for the data-processing immediate encoders — without it
8213/// they pack raw bits and silently mis-encode any value `> 0xFF` that isn't a
8214/// modified immediate (the silent-miscompile class behind #251/#253/#255).
8215fn try_thumb_expand_imm(value: u32) -> Option<u32> {
8216    // i:imm3 = 0000 → 8-bit value, zero-extended (00000000 00000000 00000000 XY).
8217    if value <= 0xFF {
8218        return Some(value);
8219    }
8220    let b0 = value & 0xFF; // byte 0
8221    let b1 = (value >> 8) & 0xFF; // byte 1
8222    // 0x00XY00XY (i:imm3 = 0001) — XY in bytes 0 and 2
8223    if value == (b0 << 16) | b0 {
8224        return Some(0x100 | b0);
8225    }
8226    // 0xXY00XY00 (i:imm3 = 0010) — XY in bytes 1 and 3
8227    if value == (b1 << 24) | (b1 << 8) {
8228        return Some(0x200 | b1);
8229    }
8230    // 0xXYXYXYXY (i:imm3 = 0011) — XY in all four bytes
8231    if value == (b0 << 24) | (b0 << 16) | (b0 << 8) | b0 {
8232        return Some(0x300 | b0);
8233    }
8234    // An 8-bit value with bit 7 set, rotated right by 8..=31. `rotate_left(rot)`
8235    // undoes the encoded right rotation; if the result is `1bbbbbbb` (0x80..=0xFF)
8236    // the value is representable. imm12[11:7] = rot, imm12[6:0] = low 7 bits.
8237    for rot in 8..=31u32 {
8238        let unrot = value.rotate_left(rot);
8239        if (0x80..=0xFF).contains(&unrot) {
8240            return Some((rot << 7) | (unrot & 0x7F));
8241        }
8242    }
8243    None
8244}
8245
8246/// Guard a Thumb-2 `LDR/STR Rd, [Rn, #imm12]` offset. The imm12 form supports
8247/// `0..=4095`; a larger offset must be materialized into a register by the
8248/// selector (register-offset addressing). Returning `Err` rather than silently
8249/// masking `offset & 0xFFF` closes the wrong-address miscompile class (#259,
8250/// the load/store sibling of #253/#255).
8251fn check_ldst_imm12(offset: u32) -> Result<()> {
8252    if offset > 0xFFF {
8253        Err(synth_core::Error::synthesis(
8254            "load/store immediate offset > 0xFFF (4095) — materialize the offset into a register",
8255        ))
8256    } else {
8257        Ok(())
8258    }
8259}
8260
8261/// #916 — emit `Rd = 0` in Thumb-2, correctly for EVERY destination register.
8262///
8263/// The 16-bit `MOVS Rd, #imm8` (T1) is `0010 0 Rd(3) imm8` — the Rd field is
8264/// **three bits**. For R8-R12 `reg_to_bits` yields 8..12, so `rd_bits << 8`
8265/// overflows into bit 11 and `0x2000 | 0x0800` is `0x2800` = `CMP r0, #0`:
8266/// not a move at all. The destination is never written (it keeps stale data)
8267/// and the flags are clobbered. Same class as #180 / H-CODE-9, and the same
8268/// defect #311 fixed for `I64SetCond`.
8269///
8270/// High registers therefore take the 32-bit `MOV.W Rd, #imm8` (T2,
8271/// `F04F 0000 | Rd<<8 | imm8`), whose Rd field is four bits. `MOV.W` with S=0
8272/// does not set flags, which is what these zero-fill sites want anyway.
8273///
8274/// **Callers with branches must consult [`thumb_zero_fill_halfwords`].** This
8275/// emits 1 halfword for R0-R7 and 2 for R8-R12; any branch whose target lies
8276/// PAST this instruction moves when it widens and its displacement has to be
8277/// derived rather than hard-coded. (A branch targeting this instruction's own
8278/// address is unaffected — an instruction cannot move itself.)
8279fn emit_thumb_zero_fill(bytes: &mut Vec<u8>, rd_bits: u32) {
8280    if rd_bits < 8 {
8281        let movs: u16 = 0x2000 | ((rd_bits as u16) << 8);
8282        bytes.extend_from_slice(&movs.to_le_bytes());
8283    } else {
8284        bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
8285        bytes.extend_from_slice(&((rd_bits as u16) << 8).to_le_bytes());
8286    }
8287}
8288
8289/// Halfword length of the encoding [`emit_thumb_zero_fill`] picks for
8290/// `rd_bits`. Branch displacements spanning the zero-fill derive from this so
8291/// the encoder cannot drift from itself (#916; the byte-size estimator mirrors
8292/// it in `synth_synthesis::estimate_arm_byte_size`, pinned by the #498
8293/// `estimator_encoder_agreement` oracle).
8294fn thumb_zero_fill_halfwords(rd_bits: u32) -> u16 {
8295    if rd_bits < 8 { 1 } else { 2 }
8296}
8297
8298fn reg_to_bits(reg: &Reg) -> u32 {
8299    match reg {
8300        Reg::R0 => 0,
8301        Reg::R1 => 1,
8302        Reg::R2 => 2,
8303        Reg::R3 => 3,
8304        Reg::R4 => 4,
8305        Reg::R5 => 5,
8306        Reg::R6 => 6,
8307        Reg::R7 => 7,
8308        Reg::R8 => 8,
8309        Reg::R9 => 9,
8310        Reg::R10 => 10,
8311        Reg::R11 => 11,
8312        Reg::R12 => 12,
8313        Reg::SP => 13,
8314        Reg::LR => 14,
8315        Reg::PC => 15,
8316    }
8317}
8318
8319// ======================================================================
8320// #610 — i64 fixed-ABI expansion wrappers.
8321//
8322// The hand-written multi-instruction i64 cores (rotl/rotr and the div/rem
8323// shift-subtract loops) compute in FIXED low registers. Before #610 the
8324// div/rem arms ignored their operand fields outright (hardcoded R0:R1 /
8325// R2:R3 in, result to R0:R1) and the rot arms used R3/R4 scratch that
8326// collided with selector-assigned registers — then restored the saved
8327// scratch OVER the result (`POP {R4}` with rd_lo == R4), so the op
8328// returned the caller's stale register: 0 for every input under qemu.
8329//
8330// These wrappers make each core honor its register parameters:
8331//   1. save R0-R3,
8332//   2. marshal the operand registers into the core's fixed input regs via
8333//      the stack (permutation-safe: every source is read before any fixed
8334//      register is written),
8335//   3. run the fixed-reg core (self-preserving for R4+; R12 is encoder
8336//      scratch and never allocatable, #212),
8337//   4. MOV the result pair from R0:R1 into the selector's rd pair,
8338//   5. restore R0-R3, skipping any register the result now occupies.
8339//
8340// All emitted lengths are register-independent so the optimized path's
8341// byte-size estimator (`estimate_arm_byte_size`, pinned by the
8342// estimator↔encoder agreement oracle #498/#511) stays a constant per op.
8343// ======================================================================
8344
8345/// Steps 1+2: `PUSH {R0-R3}`, then marshal `srcs` (operand registers, any of
8346/// R0-R12) into `R0..R<n>` via individual stack pushes. Sources are all read
8347/// before any destination register is written, so arbitrary source/target
8348/// permutations (including operands living in R0-R3) are safe.
8349fn emit_i64_fixed_abi_entry(bytes: &mut Vec<u8>, srcs: &[&Reg]) {
8350    debug_assert!(srcs.len() <= 4);
8351    // PUSH {R0-R3} — save the caller-visible low registers.
8352    bytes.extend_from_slice(&0xB40Fu16.to_le_bytes());
8353    // STR src, [SP, #-4]! — push in reverse so srcs[0] ends up on top.
8354    for src in srcs.iter().rev() {
8355        let rt = reg_to_bits(src) as u16;
8356        bytes.extend_from_slice(&0xF84Du16.to_le_bytes());
8357        bytes.extend_from_slice(&((rt << 12) | 0x0D04).to_le_bytes());
8358    }
8359    // POP {Ri} — Ri := srcs[i].
8360    for i in 0..srcs.len() as u16 {
8361        bytes.extend_from_slice(&(0xBC00u16 | (1u16 << i)).to_le_bytes());
8362    }
8363}
8364
8365/// Steps 4+5: move the core's R0:R1 result into the selector's rd pair, then
8366/// restore the R0-R3 saved by [`emit_i64_fixed_abi_entry`], skipping any
8367/// register the result now lives in (its saved caller word is discarded).
8368fn emit_i64_fixed_abi_exit(bytes: &mut Vec<u8>, rdlo: &Reg, rdhi: &Reg) -> Result<()> {
8369    let lo = reg_to_bits(rdlo);
8370    let hi = reg_to_bits(rdhi);
8371    if lo == 1 && hi == 0 {
8372        // A fully swapped pair would clobber one half in either MOV order.
8373        // Selector pairs are consecutive (lo, lo+1), so this cannot occur.
8374        return Err(synth_core::Error::synthesis(
8375            "i64 expansion: swapped result pair (rd_lo=R1, rd_hi=R0) is unsupported (#610)",
8376        ));
8377    }
8378    let mov16 = |bytes: &mut Vec<u8>, rd: u32, rm: u32| {
8379        let d = ((rd >> 3) & 1) as u16;
8380        bytes.extend_from_slice(
8381            &(0x4600u16 | (d << 7) | ((rm as u16) << 3) | ((rd & 7) as u16)).to_le_bytes(),
8382        );
8383    };
8384    if hi == 0 {
8385        // rd_hi is R0: read R0 into rd_lo BEFORE overwriting R0 with R1.
8386        mov16(bytes, lo, 0);
8387        mov16(bytes, hi, 1);
8388    } else {
8389        // rd_lo may be R1: read R1 into rd_hi BEFORE overwriting R1 with R0.
8390        mov16(bytes, hi, 1);
8391        mov16(bytes, lo, 0);
8392    }
8393    for i in 0..4u32 {
8394        if i == lo || i == hi {
8395            // The result lives here — drop the saved caller word.
8396            bytes.extend_from_slice(&0xB001u16.to_le_bytes()); // ADD SP, #4
8397        } else {
8398            bytes.extend_from_slice(&(0xBC00u16 | (1u16 << i)).to_le_bytes()); // POP {Ri}
8399        }
8400    }
8401    Ok(())
8402}
8403
8404/// WASM `i64.div_*` / `i64.rem_*` by zero must trap, matching the i32 path's
8405/// cmp/bne/udf guard. Emitted after marshaling, when the divisor pair is in
8406/// R2:R3: `ORRS R12, R2, R3` — `BNE` over a `UDF #0` when nonzero.
8407fn emit_i64_divisor_zero_trap(bytes: &mut Vec<u8>) {
8408    bytes.extend_from_slice(&0xEA52u16.to_le_bytes()); // ORRS.W R12, R2, R3
8409    bytes.extend_from_slice(&0x0C03u16.to_le_bytes());
8410    bytes.extend_from_slice(&0xD100u16.to_le_bytes()); // BNE.N +0 (skip the UDF)
8411    bytes.extend_from_slice(&0xDE00u16.to_le_bytes()); // UDF #0 — divide by zero
8412}
8413
8414/// WASM `i64.div_s(INT64_MIN, -1)` must trap (Core §4.3.2 `idiv_s`: the
8415/// quotient +2^63 is unrepresentable), matching the i32 path's overflow
8416/// guard — #633: without it the core negated INT64_MIN onto itself and
8417/// silently returned INT64_MIN. Emitted after marshaling, when the dividend
8418/// pair is in R0:R1 and the divisor pair in R2:R3; R12 is encoder scratch.
8419///
8420/// div_s ONLY — `i64.rem_s(INT64_MIN, -1)` is defined as 0 and must NOT
8421/// trap (`irem_s`), so the I64RemS arm never calls this. 22 bytes,
8422/// register-independent (estimator contract, #498/#511).
8423fn emit_i64_divs_overflow_trap(bytes: &mut Vec<u8>) {
8424    // AND.W R12, R2, R3 — R12 == 0xFFFFFFFF iff divisor == -1
8425    bytes.extend_from_slice(&0xEA02u16.to_le_bytes());
8426    bytes.extend_from_slice(&0x0C03u16.to_le_bytes());
8427    // CMN.W R12, #1 — EQ iff both divisor words are all-ones
8428    bytes.extend_from_slice(&0xF11Cu16.to_le_bytes());
8429    bytes.extend_from_slice(&0x0F01u16.to_le_bytes());
8430    // BNE .no_trap
8431    bytes.extend_from_slice(&0xD105u16.to_le_bytes());
8432    // CMP R0, #0 — dividend lo word of INT64_MIN
8433    bytes.extend_from_slice(&0x2800u16.to_le_bytes());
8434    // BNE .no_trap
8435    bytes.extend_from_slice(&0xD103u16.to_le_bytes());
8436    // CMP.W R1, #0x80000000 — dividend hi word of INT64_MIN
8437    bytes.extend_from_slice(&0xF1B1u16.to_le_bytes());
8438    bytes.extend_from_slice(&0x4F00u16.to_le_bytes());
8439    // BNE .no_trap
8440    bytes.extend_from_slice(&0xD100u16.to_le_bytes());
8441    // UDF #0 — signed-division overflow
8442    bytes.extend_from_slice(&0xDE00u16.to_le_bytes());
8443    // .no_trap:
8444}
8445
8446// ======================================================================
8447// #615 — A32 (ARM-mode) twins of the #610 i64 fixed-ABI wrappers above.
8448// Identical register contract, A32 encodings: the multi-instruction i64
8449// cores (rotl/rotr, div/rem) compute in fixed low registers (value/dividend
8450// R0:R1, amount R2 / divisor R2:R3, result to R0:R1); the wrappers marshal
8451// the selector-assigned operand registers in and the result out, saving and
8452// restoring the caller-visible R0-R3 around the core.
8453// ======================================================================
8454
8455/// A32 steps 1+2: `STMDB SP!, {R0-R3}`, then marshal `srcs` into `R0..R<n>`
8456/// via individual stack pushes (`STR src, [SP, #-4]!` in reverse order, then
8457/// `LDR Ri, [SP], #4`). Every source is read before any fixed register is
8458/// written, so arbitrary source/target permutations are safe.
8459fn emit_a32_i64_fixed_abi_entry(bytes: &mut Vec<u8>, srcs: &[&Reg]) {
8460    debug_assert!(srcs.len() <= 4);
8461    let w = |bytes: &mut Vec<u8>, word: u32| bytes.extend_from_slice(&word.to_le_bytes());
8462    // PUSH {R0-R3} — save the caller-visible low registers.
8463    w(bytes, 0xE92D_000F);
8464    // STR src, [SP, #-4]! — push in reverse so srcs[0] ends up on top.
8465    for src in srcs.iter().rev() {
8466        w(bytes, 0xE52D_0004 | (reg_to_bits(src) << 12));
8467    }
8468    // LDR Ri, [SP], #4 — Ri := srcs[i].
8469    for i in 0..srcs.len() as u32 {
8470        w(bytes, 0xE49D_0004 | (i << 12));
8471    }
8472}
8473
8474/// A32 steps 4+5: move the core's R0:R1 result into the selector's rd pair,
8475/// then restore the R0-R3 saved by [`emit_a32_i64_fixed_abi_entry`], skipping
8476/// any register the result now lives in (its saved caller word is discarded).
8477fn emit_a32_i64_fixed_abi_exit(bytes: &mut Vec<u8>, rdlo: &Reg, rdhi: &Reg) -> Result<()> {
8478    let lo = reg_to_bits(rdlo);
8479    let hi = reg_to_bits(rdhi);
8480    if lo == 1 && hi == 0 {
8481        // A fully swapped pair would clobber one half in either MOV order.
8482        // Selector pairs are consecutive (lo, lo+1), so this cannot occur.
8483        return Err(synth_core::Error::synthesis(
8484            "i64 expansion: swapped result pair (rd_lo=R1, rd_hi=R0) is unsupported (#610)",
8485        ));
8486    }
8487    let w = |bytes: &mut Vec<u8>, word: u32| bytes.extend_from_slice(&word.to_le_bytes());
8488    let mov = |bytes: &mut Vec<u8>, rd: u32, rm: u32| w(bytes, 0xE1A0_0000 | (rd << 12) | rm);
8489    if hi == 0 {
8490        // rd_hi is R0: read R0 into rd_lo BEFORE overwriting R0 with R1.
8491        mov(bytes, lo, 0);
8492        mov(bytes, hi, 1);
8493    } else {
8494        // rd_lo may be R1: read R1 into rd_hi BEFORE overwriting R1 with R0.
8495        mov(bytes, hi, 1);
8496        mov(bytes, lo, 0);
8497    }
8498    for i in 0..4u32 {
8499        if i == lo || i == hi {
8500            // The result lives here — drop the saved caller word.
8501            w(bytes, 0xE28D_D004); // ADD SP, SP, #4
8502        } else {
8503            w(bytes, 0xE49D_0004 | (i << 12)); // LDR Ri, [SP], #4
8504        }
8505    }
8506    Ok(())
8507}
8508
8509/// A32 zero-divisor trap, emitted after marshaling when the divisor pair is
8510/// in R2:R3: `ORRS R12, R2, R3` sets Z iff the divisor is zero; `BNE` skips a
8511/// `UDF #0` (WASM div/rem-by-zero must trap, matching the Thumb-2 twin).
8512fn emit_a32_i64_divisor_zero_trap(bytes: &mut Vec<u8>) {
8513    let w = |bytes: &mut Vec<u8>, word: u32| bytes.extend_from_slice(&word.to_le_bytes());
8514    w(bytes, 0xE192_C003); // ORRS R12, R2, R3
8515    w(bytes, 0x1A00_0000); // BNE +1 insn (skip the UDF)
8516    w(bytes, 0xE7F0_00F0); // UDF #0 — divide by zero
8517}
8518
8519/// A32 twin of [`emit_i64_divs_overflow_trap`] (#633): trap on
8520/// `i64.div_s(INT64_MIN, -1)`. Conditional execution replaces the Thumb
8521/// branches — the CMPEQ chain leaves EQ set only when divisor == -1 AND
8522/// dividend == INT64_MIN. div_s only; rem_s must keep returning 0.
8523fn emit_a32_i64_divs_overflow_trap(bytes: &mut Vec<u8>) {
8524    let w = |bytes: &mut Vec<u8>, word: u32| bytes.extend_from_slice(&word.to_le_bytes());
8525    w(bytes, 0xE002_C003); // AND   R12, R2, R3 (== 0xFFFFFFFF iff divisor == -1)
8526    w(bytes, 0xE37C_0001); // CMN   R12, #1     (EQ iff divisor == -1)
8527    w(bytes, 0x0350_0000); // CMPEQ R0, #0      (EQ iff also dividend lo == 0)
8528    w(bytes, 0x0351_0102); // CMPEQ R1, #0x80000000 (EQ iff dividend == INT64_MIN)
8529    w(bytes, 0x1A00_0000); // BNE +1 insn (skip the UDF)
8530    w(bytes, 0xE7F0_00F0); // UDF #0 — signed-division overflow
8531}
8532
8533/// Fallible form of the `verify_reg_bits` contract. PC (R15) is not a valid
8534/// data operand for the Thumb-2 encodings that use this guard (SDIV/UDIV/MLS/…
8535/// are UNPREDICTABLE with PC). Synth's own codegen never emits PC there, but
8536/// the encoder must stay *total* over arbitrary `ArmOp` inputs — the fuzz
8537/// harness (`encoder_no_panic`) requires Ok-or-Err, never a panic. Pre-fix, the
8538/// `debug_assert` in `verify_reg_bits` aborted under `-Cdebug-assertions`.
8539/// Returns a typed Err instead. See #185.
8540fn reg_bits_checked(bits: u32) -> Result<()> {
8541    if bits > 14 {
8542        return Err(synth_core::Error::synthesis(format!(
8543            "register bits {bits} (PC/R15) is not a valid operand for this Thumb-2 encoding"
8544        )));
8545    }
8546    Ok(())
8547}
8548
8549/// Try to encode a 32-bit value as an ARM rotated immediate (imm8 ROR 2*rot4).
8550/// Returns Some((encoded_bits, 1)) if representable, None otherwise.
8551fn try_encode_rotated_imm(val: u32) -> Option<(u32, u32)> {
8552    if val == 0 {
8553        return Some((0, 1));
8554    }
8555    for rot in 0..16u32 {
8556        let shift = rot * 2;
8557        // Rotate left by shift (undo the ROR) to see if result fits in 8 bits
8558        let unrotated = val.rotate_left(shift);
8559        if unrotated <= 0xFF {
8560            // Encoded as: rot4(4 bits) | imm8(8 bits) = rotate_imm << 8 | imm8
8561            return Some(((rot << 8) | unrotated, 1));
8562        }
8563    }
8564    None
8565}
8566
8567/// Encode operand2 field and return (bits, immediate_flag).
8568/// For ARM32 mode, immediates use the rotated-immediate encoding (imm8 ROR 2*rot4).
8569/// Panics if an immediate value cannot be represented. Callers that need large
8570/// immediates should use MOVW/MOVT instead of Operand2::Imm.
8571fn encode_operand2(op2: &Operand2) -> Result<(u32, u32)> {
8572    match op2 {
8573        Operand2::Imm(val) => {
8574            let uval = *val as u32;
8575            // Attempt rotated-immediate encoding (ARM32 Operand2)
8576            if let Some(encoded) = try_encode_rotated_imm(uval) {
8577                Ok(encoded)
8578            } else {
8579                // #378-class honesty: an immediate that can't be expressed as an
8580                // ARM32 rotated immediate is an INTERNAL selector bug — large
8581                // constants must be materialized via MOVW/MOVT, not passed here.
8582                // FAIL HONESTLY with an Err rather than silently masking to
8583                // `uval & 0xFF` and emitting a WRONG immediate. The encoder is
8584                // Ok-or-Err, never corrupt (#180/#185); a loud Err is also why
8585                // this is an Err and not a panic (the `encoder_no_panic` fuzz
8586                // contract — malformed/oversized input must degrade, not crash).
8587                Err(synth_core::Error::synthesis(format!(
8588                    "encode_operand2: immediate {uval:#x} ({val}) is not an ARM32 \
8589                     rotated immediate — the selector must materialize large \
8590                     constants via MOVW/MOVT"
8591                )))
8592            }
8593        }
8594
8595        Operand2::Reg(reg) => {
8596            let reg_bits = reg_to_bits(reg);
8597            Ok((reg_bits, 0)) // I=0 for register
8598        }
8599
8600        Operand2::RegShift {
8601            rm,
8602            shift: _,
8603            amount,
8604        } => {
8605            // Simplified encoding with shift
8606            let rm_bits = reg_to_bits(rm);
8607            let shift_bits = (*amount & 0x1F) << 7;
8608            Ok((shift_bits | rm_bits, 0))
8609        }
8610    }
8611}
8612
8613/// Encode memory address to (base_reg, offset)
8614fn encode_mem_addr(addr: &MemAddr) -> (u32, u32) {
8615    let base_bits = reg_to_bits(&addr.base);
8616    let offset_bits = (addr.offset as u32) & 0xFFF; // 12-bit offset
8617    (base_bits, offset_bits)
8618}
8619
8620/// S-register number: S0=0, S1=1, ..., S31=31
8621fn vfp_sreg_to_num(reg: &VfpReg) -> Result<u32> {
8622    match reg {
8623        VfpReg::S0 => Ok(0),
8624        VfpReg::S1 => Ok(1),
8625        VfpReg::S2 => Ok(2),
8626        VfpReg::S3 => Ok(3),
8627        VfpReg::S4 => Ok(4),
8628        VfpReg::S5 => Ok(5),
8629        VfpReg::S6 => Ok(6),
8630        VfpReg::S7 => Ok(7),
8631        VfpReg::S8 => Ok(8),
8632        VfpReg::S9 => Ok(9),
8633        VfpReg::S10 => Ok(10),
8634        VfpReg::S11 => Ok(11),
8635        VfpReg::S12 => Ok(12),
8636        VfpReg::S13 => Ok(13),
8637        VfpReg::S14 => Ok(14),
8638        VfpReg::S15 => Ok(15),
8639        VfpReg::S16 => Ok(16),
8640        VfpReg::S17 => Ok(17),
8641        VfpReg::S18 => Ok(18),
8642        VfpReg::S19 => Ok(19),
8643        VfpReg::S20 => Ok(20),
8644        VfpReg::S21 => Ok(21),
8645        VfpReg::S22 => Ok(22),
8646        VfpReg::S23 => Ok(23),
8647        VfpReg::S24 => Ok(24),
8648        VfpReg::S25 => Ok(25),
8649        VfpReg::S26 => Ok(26),
8650        VfpReg::S27 => Ok(27),
8651        VfpReg::S28 => Ok(28),
8652        VfpReg::S29 => Ok(29),
8653        VfpReg::S30 => Ok(30),
8654        VfpReg::S31 => Ok(31),
8655        // D-registers are not used in F32 single-precision encodings
8656        _ => Err(synth_core::Error::SynthesisError(
8657            "D-register not supported in single-precision VFP encoding".to_string(),
8658        )),
8659    }
8660}
8661
8662/// D-register number: D0=0, D1=1, ..., D15=15
8663fn vfp_dreg_to_num(reg: &VfpReg) -> Result<u32> {
8664    match reg {
8665        VfpReg::D0 => Ok(0),
8666        VfpReg::D1 => Ok(1),
8667        VfpReg::D2 => Ok(2),
8668        VfpReg::D3 => Ok(3),
8669        VfpReg::D4 => Ok(4),
8670        VfpReg::D5 => Ok(5),
8671        VfpReg::D6 => Ok(6),
8672        VfpReg::D7 => Ok(7),
8673        VfpReg::D8 => Ok(8),
8674        VfpReg::D9 => Ok(9),
8675        VfpReg::D10 => Ok(10),
8676        VfpReg::D11 => Ok(11),
8677        VfpReg::D12 => Ok(12),
8678        VfpReg::D13 => Ok(13),
8679        VfpReg::D14 => Ok(14),
8680        VfpReg::D15 => Ok(15),
8681        // S-registers are not used in F64 double-precision encodings
8682        _ => Err(synth_core::Error::SynthesisError(
8683            "S-register not supported in double-precision VFP encoding".to_string(),
8684        )),
8685    }
8686}
8687
8688/// Split S-register into (Vx[3:0], qualifier_bit) for VFP encoding.
8689/// For an S-register number s: Vx = s >> 1, qualifier = s & 1.
8690/// The qualifier bit goes to D (bit 22), N (bit 7), or M (bit 5) depending on role.
8691fn encode_sreg(s: u32) -> (u32, u32) {
8692    (s >> 1, s & 1)
8693}
8694
8695/// Split D-register into (Vx[3:0], qualifier_bit) for VFP double-precision encoding.
8696/// For a D-register number d: Vx = d & 0xF, qualifier = (d >> 4) & 1.
8697/// For D0-D15, qualifier is always 0.
8698fn encode_dreg(d: u32) -> (u32, u32) {
8699    (d & 0xF, (d >> 4) & 1)
8700}
8701
8702/// Encode a VFP 3-register arithmetic instruction (VADD.F32, VSUB.F32, VMUL.F32, VDIV.F32).
8703/// Returns the full 32-bit instruction word.
8704///
8705/// VFP encoding: [cond 1110] [D opc1 Vn] [Vd 101 sz] [N opc2 M 0 Vm]
8706/// For single-precision (sz=0), coprocessor = 0xA (bits[11:8]).
8707fn encode_vfp_3reg(base: u32, sd: &VfpReg, sn: &VfpReg, sm: &VfpReg) -> Result<u32> {
8708    let sd_num = vfp_sreg_to_num(sd)?;
8709    let sn_num = vfp_sreg_to_num(sn)?;
8710    let sm_num = vfp_sreg_to_num(sm)?;
8711    let (vd, d) = encode_sreg(sd_num);
8712    let (vn, n) = encode_sreg(sn_num);
8713    let (vm, m) = encode_sreg(sm_num);
8714
8715    Ok(base | (d << 22) | (vn << 16) | (vd << 12) | (n << 7) | (m << 5) | vm)
8716}
8717
8718/// Encode a VFP 2-register instruction (VNEG.F32, VABS.F32, VSQRT.F32).
8719/// Returns the full 32-bit instruction word.
8720fn encode_vfp_2reg(base: u32, sd: &VfpReg, sm: &VfpReg) -> Result<u32> {
8721    let sd_num = vfp_sreg_to_num(sd)?;
8722    let sm_num = vfp_sreg_to_num(sm)?;
8723    let (vd, d) = encode_sreg(sd_num);
8724    let (vm, m) = encode_sreg(sm_num);
8725
8726    Ok(base | (d << 22) | (vd << 12) | (m << 5) | vm)
8727}
8728
8729/// Encode a VFP load/store (VLDR.F32 / VSTR.F32).
8730/// offset is in bytes and must be word-aligned; encoded as imm8 = offset/4.
8731/// U bit (bit 23) controls add/subtract offset.
8732fn encode_vfp_ldst(base: u32, sd: &VfpReg, addr: &MemAddr) -> Result<u32> {
8733    let sd_num = vfp_sreg_to_num(sd)?;
8734    let (vd, d) = encode_sreg(sd_num);
8735    let rn = reg_to_bits(&addr.base);
8736
8737    let offset = addr.offset;
8738    let u_bit = if offset >= 0 { 1u32 } else { 0u32 };
8739    let abs_offset = offset.unsigned_abs();
8740    let imm8 = (abs_offset / 4) & 0xFF;
8741
8742    Ok(base | (u_bit << 23) | (d << 22) | (rn << 16) | (vd << 12) | imm8)
8743}
8744
8745/// Encode VMOV between core register and S-register.
8746/// VMOV Sn, Rt: 0xEE00_0A10 | (Vn << 16) | (N << 7) | (Rt << 12)
8747/// VMOV Rt, Sn: 0xEE10_0A10 | (Vn << 16) | (N << 7) | (Rt << 12)
8748fn encode_vmov_core_sreg(to_sreg: bool, sreg: &VfpReg, core: &Reg) -> Result<u32> {
8749    let s_num = vfp_sreg_to_num(sreg)?;
8750    let (vn, n) = encode_sreg(s_num);
8751    let rt = reg_to_bits(core);
8752
8753    let base = if to_sreg { 0xEE000A10 } else { 0xEE100A10 };
8754    Ok(base | (vn << 16) | (rt << 12) | (n << 7))
8755}
8756
8757/// Encode a VFP 3-register double-precision instruction (VADD.F64, VSUB.F64, etc.).
8758/// For double-precision (sz=1), coprocessor = 0xB (bits[11:8]).
8759/// The base should have bit 8 = 1 for F64 (0xB suffix instead of 0xA).
8760fn encode_vfp_3reg_f64(base: u32, dd: &VfpReg, dn: &VfpReg, dm: &VfpReg) -> Result<u32> {
8761    let dd_num = vfp_dreg_to_num(dd)?;
8762    let dn_num = vfp_dreg_to_num(dn)?;
8763    let dm_num = vfp_dreg_to_num(dm)?;
8764    let (vd, d) = encode_dreg(dd_num);
8765    let (vn, n) = encode_dreg(dn_num);
8766    let (vm, m) = encode_dreg(dm_num);
8767
8768    Ok(base | (d << 22) | (vn << 16) | (vd << 12) | (n << 7) | (m << 5) | vm)
8769}
8770
8771/// Encode a VFP 2-register double-precision instruction (VNEG.F64, VABS.F64, VSQRT.F64).
8772fn encode_vfp_2reg_f64(base: u32, dd: &VfpReg, dm: &VfpReg) -> Result<u32> {
8773    let dd_num = vfp_dreg_to_num(dd)?;
8774    let dm_num = vfp_dreg_to_num(dm)?;
8775    let (vd, d) = encode_dreg(dd_num);
8776    let (vm, m) = encode_dreg(dm_num);
8777
8778    Ok(base | (d << 22) | (vd << 12) | (m << 5) | vm)
8779}
8780
8781/// Encode a VFP load/store for double-precision (VLDR.64 / VSTR.64).
8782/// offset is in bytes and must be word-aligned; encoded as imm8 = offset/4.
8783fn encode_vfp_ldst_f64(base: u32, dd: &VfpReg, addr: &MemAddr) -> Result<u32> {
8784    let dd_num = vfp_dreg_to_num(dd)?;
8785    let (vd, d) = encode_dreg(dd_num);
8786    let rn = reg_to_bits(&addr.base);
8787
8788    let offset = addr.offset;
8789    let u_bit = if offset >= 0 { 1u32 } else { 0u32 };
8790    let abs_offset = offset.unsigned_abs();
8791    let imm8 = (abs_offset / 4) & 0xFF;
8792
8793    Ok(base | (u_bit << 23) | (d << 22) | (rn << 16) | (vd << 12) | imm8)
8794}
8795
8796/// Encode VMOV between two core registers and a D-register.
8797/// VMOV Dm, Rt, Rt2: 0xEC40_0B10 | (Rt2 << 16) | (Rt << 12) | (M << 5) | Vm
8798/// VMOV Rt, Rt2, Dm: 0xEC50_0B10 | (Rt2 << 16) | (Rt << 12) | (M << 5) | Vm
8799fn encode_vmov_core_dreg(
8800    to_dreg: bool,
8801    dreg: &VfpReg,
8802    core_lo: &Reg,
8803    core_hi: &Reg,
8804) -> Result<u32> {
8805    let d_num = vfp_dreg_to_num(dreg)?;
8806    let (vm, m) = encode_dreg(d_num);
8807    let rt = reg_to_bits(core_lo);
8808    let rt2 = reg_to_bits(core_hi);
8809
8810    let base = if to_dreg { 0xEC400B10 } else { 0xEC500B10 };
8811    Ok(base | (rt2 << 16) | (rt << 12) | (m << 5) | vm)
8812}
8813
8814/// Emit a VFP 32-bit instruction as Thumb-2 bytes (two LE halfwords).
8815fn vfp_to_thumb_bytes(instr: u32) -> Vec<u8> {
8816    let hw1 = ((instr >> 16) & 0xFFFF) as u16;
8817    let hw2 = (instr & 0xFFFF) as u16;
8818    let mut bytes = hw1.to_le_bytes().to_vec();
8819    bytes.extend_from_slice(&hw2.to_le_bytes());
8820    bytes
8821}
8822
8823// ============================================================================
8824// Helium MVE encoding helpers
8825// ============================================================================
8826
8827/// Q-register number: Q0=0, Q1=1, ..., Q7=7
8828fn qreg_to_num(reg: &QReg) -> u32 {
8829    match reg {
8830        QReg::Q0 => 0,
8831        QReg::Q1 => 1,
8832        QReg::Q2 => 2,
8833        QReg::Q3 => 3,
8834        QReg::Q4 => 4,
8835        QReg::Q5 => 5,
8836        QReg::Q6 => 6,
8837        QReg::Q7 => 7,
8838    }
8839}
8840
8841/// MVE element size to encoding bits: S8=0b00, S16=0b01, S32=0b10
8842fn mve_size_bits(size: &MveSize) -> u32 {
8843    match size {
8844        MveSize::S8 => 0b00,
8845        MveSize::S16 => 0b01,
8846        MveSize::S32 => 0b10,
8847    }
8848}
8849
8850/// Encode MVE 3-register instruction.
8851/// Q-registers are encoded as D-register pairs: Q0=D0:D1, Q1=D2:D3, etc.
8852/// In NEON/MVE encoding, the Q-register uses D-register number = Qn * 2.
8853fn encode_mve_3reg(base: u32, qd: &QReg, qn: &QReg, qm: &QReg) -> u32 {
8854    let d = qreg_to_num(qd) * 2;
8855    let n = qreg_to_num(qn) * 2;
8856    let m = qreg_to_num(qm) * 2;
8857
8858    // Standard NEON/MVE 3-register encoding:
8859    // D bit (bit 22) = Vd[4], Vd[3:0] = bits [15:12]
8860    // N bit (bit 7)  = Vn[4], Vn[3:0] = bits [19:16]
8861    // M bit (bit 5)  = Vm[4], Vm[3:0] = bits [3:0]
8862    let vd = d & 0xF;
8863    let d_bit = (d >> 4) & 1;
8864    let vn = n & 0xF;
8865    let n_bit = (n >> 4) & 1;
8866    let vm = m & 0xF;
8867    let m_bit = (m >> 4) & 1;
8868
8869    base | (d_bit << 22) | (vn << 16) | (vd << 12) | (n_bit << 7) | (m_bit << 5) | vm
8870}
8871
8872/// Encode MVE 3-register bitwise instruction (VAND, VORR, VEOR, VBIC).
8873fn encode_mve_3reg_bitwise(base: u32, qd: &QReg, qn: &QReg, qm: &QReg) -> u32 {
8874    encode_mve_3reg(base, qd, qn, qm)
8875}
8876
8877/// Encode MVE VLDRW.32 Qd, [Rn, #offset]
8878/// Format: EC9x xxxx - contiguous load, word-sized elements
8879fn encode_mve_vldrw(qd: &QReg, addr: &MemAddr) -> u32 {
8880    let qd_enc = qreg_to_num(qd) * 2;
8881    let rn = reg_to_bits(&addr.base);
8882    let offset = addr.offset;
8883    let u_bit = if offset >= 0 { 1u32 } else { 0u32 };
8884    let abs_offset = offset.unsigned_abs();
8885    let imm7 = (abs_offset / 4) & 0x7F; // 7-bit word-aligned offset
8886
8887    // VLDRW.32 Qd, [Rn, #imm]: ED10 xx80 variant
8888    0xED100E80
8889        | (u_bit << 23)
8890        | ((qd_enc >> 4) << 22)
8891        | (rn << 16)
8892        | ((qd_enc & 0xF) << 12)
8893        | (imm7 & 0x7F)
8894}
8895
8896/// Encode MVE VSTRW.32 Qd, [Rn, #offset]
8897fn encode_mve_vstrw(qd: &QReg, addr: &MemAddr) -> u32 {
8898    let qd_enc = qreg_to_num(qd) * 2;
8899    let rn = reg_to_bits(&addr.base);
8900    let offset = addr.offset;
8901    let u_bit = if offset >= 0 { 1u32 } else { 0u32 };
8902    let abs_offset = offset.unsigned_abs();
8903    let imm7 = (abs_offset / 4) & 0x7F;
8904
8905    0xED000E80
8906        | (u_bit << 23)
8907        | ((qd_enc >> 4) << 22)
8908        | (rn << 16)
8909        | ((qd_enc & 0xF) << 12)
8910        | (imm7 & 0x7F)
8911}
8912
8913impl ArmEncoder {
8914    /// Encode MVE constant load: MOVW+MOVT+VMOV for each 32-bit word, then assemble Q-register
8915    fn encode_thumb_mve_const(&self, qd: &QReg, bytes: &[u8; 16]) -> Result<Vec<u8>> {
8916        let mut result = Vec::new();
8917        let qd_num = qreg_to_num(qd);
8918
8919        // Load each 32-bit word into R12 (temp) then VMOV into S-register
8920        for i in 0..4 {
8921            let word = u32::from_le_bytes([
8922                bytes[i * 4],
8923                bytes[i * 4 + 1],
8924                bytes[i * 4 + 2],
8925                bytes[i * 4 + 3],
8926            ]);
8927            let lo16 = word & 0xFFFF;
8928            let hi16 = (word >> 16) & 0xFFFF;
8929
8930            // MOVW R12, #lo16
8931            result.extend_from_slice(&self.encode_thumb32_movw_raw(12, lo16)?);
8932            // MOVT R12, #hi16
8933            if hi16 != 0 {
8934                result.extend_from_slice(&self.encode_thumb32_movt_raw(12, hi16)?);
8935            }
8936
8937            // VMOV Sn, R12 where Sn = Qd*4 + i
8938            let s_num = qd_num * 4 + i as u32;
8939            let (vn, n) = encode_sreg(s_num);
8940            let vmov: u32 = 0xEE000A10 | (vn << 16) | (12 << 12) | (n << 7);
8941            result.extend_from_slice(&vfp_to_thumb_bytes(vmov));
8942        }
8943
8944        Ok(result)
8945    }
8946
8947    /// Encode lane-wise f32 binary operation (VDIV, etc.) via S-register extraction
8948    fn encode_thumb_mve_lane_wise_f32_binop(
8949        &self,
8950        qd: &QReg,
8951        qn: &QReg,
8952        qm: &QReg,
8953        vfp_base: u32,
8954    ) -> Result<Vec<u8>> {
8955        let mut result = Vec::new();
8956        let qd_num = qreg_to_num(qd);
8957        let qn_num = qreg_to_num(qn);
8958        let qm_num = qreg_to_num(qm);
8959
8960        // For each lane 0..3: use S-registers directly (Q aliasing)
8961        for i in 0..4u32 {
8962            let sd = qd_num * 4 + i;
8963            let sn = qn_num * 4 + i;
8964            let sm = qm_num * 4 + i;
8965
8966            let (vd, d) = encode_sreg(sd);
8967            let (vn, n) = encode_sreg(sn);
8968            let (vm, m) = encode_sreg(sm);
8969
8970            let instr = vfp_base | (d << 22) | (vn << 16) | (vd << 12) | (n << 7) | (m << 5) | vm;
8971            result.extend_from_slice(&vfp_to_thumb_bytes(instr));
8972        }
8973
8974        Ok(result)
8975    }
8976
8977    /// Encode lane-wise f32 VSQRT via S-register extraction
8978    fn encode_thumb_mve_lane_wise_f32_sqrt(&self, qd: &QReg, qm: &QReg) -> Result<Vec<u8>> {
8979        let mut result = Vec::new();
8980        let qd_num = qreg_to_num(qd);
8981        let qm_num = qreg_to_num(qm);
8982
8983        // VSQRT.F32 base: 0xEEB10AC0
8984        for i in 0..4u32 {
8985            let sd = qd_num * 4 + i;
8986            let sm = qm_num * 4 + i;
8987
8988            let (vd, d) = encode_sreg(sd);
8989            let (vm, m) = encode_sreg(sm);
8990
8991            let instr: u32 = 0xEEB10AC0 | (d << 22) | (vd << 12) | (m << 5) | vm;
8992            result.extend_from_slice(&vfp_to_thumb_bytes(instr));
8993        }
8994
8995        Ok(result)
8996    }
8997}
8998
8999#[cfg(test)]
9000mod tests {
9001    use super::*;
9002
9003    #[test]
9004    fn test_encoder_creation() {
9005        let encoder_arm = ArmEncoder::new_arm32();
9006        assert!(!encoder_arm.thumb_mode);
9007
9008        let encoder_thumb = ArmEncoder::new_thumb2();
9009        assert!(encoder_thumb.thumb_mode);
9010    }
9011
9012    /// #204 WAKE-path regression: `SetCond` materialized 0/1 with the 16-bit
9013    /// `MOVS Rd,#imm` (T1), whose Rd field is 3 bits (R0–R7). For a high Rd
9014    /// (R8–R12) `rd_bits << 8` overflows bit 11, flipping the opcode MOVS→CMP
9015    /// (`0x2c00`), so the boolean was never written — gale's `has_waiter` kept a
9016    /// stale value and the binary-sem WAKE dispatch read garbage. High Rd must
9017    /// use the 32-bit `MOV.W` (T2). Verify the bytes, not the IR.
9018    /// #311: the SAME high-Rd MOVS→CMP transmutation as #204, but in the
9019    /// i64 comparison expansions (I64SetCond / I64SetCondZ) — missed by the
9020    /// #204 hardening. With rd=R8 the boolean died in the flags
9021    /// (`ite eq; cmpeq r0,#1; cmpne r0,#0`), so gale's packed-u64 select
9022    /// read a stale register on silicon. High Rd must take MOV.W / CMP.W.
9023    #[test]
9024    fn test_encode_i64setcond_high_reg_uses_mov_w_311() {
9025        use synth_synthesis::{ArmOp, Condition, Reg};
9026        let enc = ArmEncoder::new_thumb2();
9027        let bytes = enc
9028            .encode(&ArmOp::I64SetCond {
9029                rd: Reg::R8,
9030                rn_lo: Reg::R2,
9031                rn_hi: Reg::R3,
9032                rm_lo: Reg::R6,
9033                rm_hi: Reg::R7,
9034                cond: Condition::EQ,
9035            })
9036            .unwrap();
9037        // The 32-bit MOV.W immediate (T2) first halfword is 0xF04F; the
9038        // 16-bit transmuted forms would contain 0x2801/0x2800 (CMP r0,#1/#0).
9039        let halfwords: Vec<u16> = bytes
9040            .chunks(2)
9041            .map(|c| u16::from_le_bytes([c[0], c[1]]))
9042            .collect();
9043        assert!(
9044            halfwords.iter().filter(|&&h| h == 0xF04F).count() == 2,
9045            "high rd must use two MOV.W (T2) encodings, got {halfwords:04x?}"
9046        );
9047        assert!(
9048            !halfwords.contains(&0x2801) && !halfwords.contains(&0x2800),
9049            "no transmuted 16-bit CMP imm: {halfwords:04x?}"
9050        );
9051
9052        let bytes_z = enc
9053            .encode(&ArmOp::I64SetCondZ {
9054                rd: Reg::R8,
9055                rn_lo: Reg::R2,
9056                rn_hi: Reg::R3,
9057            })
9058            .unwrap();
9059        let hw_z: Vec<u16> = bytes_z
9060            .chunks(2)
9061            .map(|c| u16::from_le_bytes([c[0], c[1]]))
9062            .collect();
9063        assert!(
9064            hw_z.iter().filter(|&&h| h == 0xF04F).count() == 2,
9065            "SetCondZ high rd MOV.W: {hw_z:04x?}"
9066        );
9067        // CMP.W rd,#0 (T2) first halfword: 0xF1B0 | rd
9068        assert!(
9069            hw_z.contains(&(0xF1B0 | 8)),
9070            "SetCondZ high rd must use CMP.W: {hw_z:04x?}"
9071        );
9072    }
9073
9074    #[test]
9075    fn test_encode_setcond_high_reg_uses_mov_w_204() {
9076        use synth_synthesis::{ArmOp, Condition, Reg};
9077        let enc = ArmEncoder::new_thumb2();
9078        // R12 (high): must be ITE + MOV.W #1 + MOV.W #0, never a 16-bit MOVS/CMP.
9079        let hi = enc
9080            .encode(&ArmOp::SetCond {
9081                rd: Reg::R12,
9082                cond: Condition::NE,
9083            })
9084            .unwrap();
9085        assert_eq!(hi.len(), 10, "ITE(2) + MOV.W(4) + MOV.W(4): {hi:02x?}");
9086        // both value halfwords are MOV.W (0xF04F) — NOT the corrupt CMP (0x2c..).
9087        assert_eq!(&hi[2..4], &[0x4F, 0xF0], "then = MOV.W: {hi:02x?}");
9088        assert_eq!(&hi[6..8], &[0x4F, 0xF0], "else = MOV.W: {hi:02x?}");
9089        assert_eq!(hi[4] & 0x0F, 0x01, "then imm = #1");
9090        assert_eq!(hi[8] & 0x0F, 0x00, "else imm = #0");
9091        // Low Rd keeps the compact 16-bit MOVS form.
9092        let lo = enc
9093            .encode(&ArmOp::SetCond {
9094                rd: Reg::R0,
9095                cond: Condition::NE,
9096            })
9097            .unwrap();
9098        assert_eq!(lo.len(), 6, "ITE(2) + MOVS(2) + MOVS(2): {lo:02x?}");
9099        assert_eq!(lo[2..4], [0x01, 0x20], "then = MOVS R0,#1");
9100        assert_eq!(lo[4..6], [0x00, 0x20], "else = MOVS R0,#0");
9101    }
9102
9103    /// #209 Opt 1b: UMULL RdLo, RdHi, Rn, Rm encodes correctly on both ISAs.
9104    /// Thumb-2 T1: 1111 1011 1010 Rn | RdLo RdHi 0000 Rm.
9105    /// A32:        cond 0000 1000 RdHi RdLo Rm 1001 Rn.
9106    #[test]
9107    fn test_encode_umull_209b() {
9108        use synth_synthesis::{ArmOp, Reg};
9109        let op = ArmOp::Umull {
9110            rdlo: Reg::R4,
9111            rdhi: Reg::R5,
9112            rn: Reg::R0,
9113            rm: Reg::R3,
9114        };
9115        // Thumb-2: hw1 = 0xFBA0 | 0 = 0xFBA0; hw2 = (4<<12)|(5<<8)|3 = 0x4503.
9116        let t = ArmEncoder::new_thumb2().encode(&op).unwrap();
9117        assert_eq!(
9118            t,
9119            vec![0xA0, 0xFB, 0x03, 0x45],
9120            "umull r4,r5,r0,r3 (T2): {t:02x?}"
9121        );
9122        // A32: 0xE0800090 | (5<<16) | (4<<12) | (3<<8) | 0 = 0xE0854390.
9123        let a = ArmEncoder::new_arm32().encode(&op).unwrap();
9124        assert_eq!(
9125            a,
9126            0xE085_4390u32.to_le_bytes().to_vec(),
9127            "umull (A32): {a:02x?}"
9128        );
9129    }
9130
9131    /// #206 regression: the ARM32 (A32) `Ldr`/`Str` encoders fed `addr` through
9132    /// `encode_mem_addr`, which returns only the 12-bit immediate — so a register
9133    /// offset (`[rn, rm, #off]`) was silently dropped to `[rn, #off]`, sending
9134    /// the access to the wrong runtime address (silent miscompile on the default
9135    /// `--target arm`). A register offset must materialize `ip = rn + rm` and
9136    /// load from `[ip, #off]`. Verify the bytes.
9137    #[test]
9138    fn test_encode_arm32_indexed_load_keeps_index_206() {
9139        use synth_synthesis::{ArmOp, MemAddr, Reg};
9140        let enc = ArmEncoder::new_arm32();
9141        // ldr r0, [r11, r1, #8]  must NOT collapse to a single immediate ldr.
9142        let bytes = enc
9143            .encode(&ArmOp::Ldr {
9144                rd: Reg::R0,
9145                addr: MemAddr::reg_imm(Reg::R11, Reg::R1, 8),
9146            })
9147            .unwrap();
9148        assert_eq!(
9149            bytes.len(),
9150            8,
9151            "expected ADD ip + LDR (2 words): {bytes:02x?}"
9152        );
9153        let add = u32::from_le_bytes(bytes[0..4].try_into().unwrap());
9154        let ldr = u32::from_le_bytes(bytes[4..8].try_into().unwrap());
9155        // ADD ip, r11, r1  = 0xE08BC001
9156        assert_eq!(add, 0xE08B_C001, "ADD ip,r11,r1: {add:#010x}");
9157        // LDR r0, [ip, #8] = 0xE59C0008
9158        assert_eq!(ldr, 0xE59C_0008, "LDR r0,[ip,#8]: {ldr:#010x}");
9159        // A bare immediate ldr (the bug) would be 0xE59B0008 (base=r11) — reject.
9160        assert_ne!(ldr, 0xE59B_0008, "index must not be dropped");
9161    }
9162
9163    /// #594 regression: `call_indirect` on the A32 path (`--target cortex-r5`)
9164    /// was encoded as a literal NOP (0xE1A00000) — the call never happened and
9165    /// the function silently returned the leftover table-index value. The A32
9166    /// encoder must emit a real dispatch expansion, since #642 guarded by an
9167    /// inline bounds check:
9168    /// `MOVW r12, #size; CMP idx, r12; BLO +1; UDF;
9169    ///  MOV r12, idx, LSL #2; LDR r12, [r11, r12]; BLX r12`.
9170    #[test]
9171    fn test_encode_arm32_call_indirect_is_real_call_594() {
9172        use synth_synthesis::{ArmOp, Reg};
9173        let enc = ArmEncoder::new_arm32();
9174        let bytes = enc
9175            .encode(&ArmOp::CallIndirect {
9176                rd: Reg::R0,
9177                type_idx: 0,
9178                table_index_reg: Reg::R0,
9179                table_size: 4,
9180                table_byte_offset: 0,
9181                null_check: false,
9182                type_check: None,
9183            })
9184            .unwrap();
9185        assert_eq!(
9186            bytes.len(),
9187            28,
9188            "expected MOVW + CMP + BLO + UDF + MOV + LDR + BLX (7 words): {bytes:02x?}"
9189        );
9190        let words: Vec<u32> = bytes
9191            .chunks_exact(4)
9192            .map(|w| u32::from_le_bytes(w.try_into().unwrap()))
9193            .collect();
9194        // #642 bounds guard: MOVW r12, #4; CMP r0, r12; BLO +1; UDF
9195        assert_eq!(words[0], 0xE300_C004, "MOVW r12,#4: {:#010x}", words[0]);
9196        assert_eq!(words[1], 0xE150_000C, "CMP r0,r12: {:#010x}", words[1]);
9197        assert_eq!(words[2], 0x3A00_0000, "BLO +1 insn: {:#010x}", words[2]);
9198        assert_eq!(words[3], 0xE7F0_00F0, "UDF: {:#010x}", words[3]);
9199        // MOV r12, r0, LSL #2 = 0xE1A0C100
9200        assert_eq!(
9201            words[4], 0xE1A0_C100,
9202            "MOV r12,r0,LSL#2: {:#010x}",
9203            words[4]
9204        );
9205        // LDR r12, [r11, r12] = 0xE79BC00C
9206        assert_eq!(
9207            words[5], 0xE79B_C00C,
9208            "LDR r12,[r11,r12]: {:#010x}",
9209            words[5]
9210        );
9211        // BLX r12 = 0xE12FFF3C
9212        assert_eq!(words[6], 0xE12F_FF3C, "BLX r12: {:#010x}", words[6]);
9213        // The bug: a single NOP word. Must never come back.
9214        assert!(
9215            !bytes
9216                .chunks_exact(4)
9217                .any(|w| w == 0xE1A0_0000u32.to_le_bytes()),
9218            "call_indirect must not contain a NOP (#594): {bytes:02x?}"
9219        );
9220
9221        // A non-R0 index register lands in the MOV's Rm and CMP's Rn fields.
9222        let bytes = enc
9223            .encode(&ArmOp::CallIndirect {
9224                rd: Reg::R0,
9225                type_idx: 0,
9226                table_index_reg: Reg::R4,
9227                table_size: 4,
9228                table_byte_offset: 0,
9229                null_check: false,
9230                type_check: None,
9231            })
9232            .unwrap();
9233        let cmp = u32::from_le_bytes(bytes[4..8].try_into().unwrap());
9234        assert_eq!(cmp, 0xE154_000C, "CMP r4,r12: {cmp:#010x}");
9235        let mov = u32::from_le_bytes(bytes[16..20].try_into().unwrap());
9236        assert_eq!(mov, 0xE1A0_C104, "MOV r12,r4,LSL#2: {mov:#010x}");
9237    }
9238
9239    /// #642: a table size above 16 bits must not be silently truncated by the
9240    /// MOVW — the A32 guard adds a MOVT for the high half.
9241    #[test]
9242    fn test_encode_arm32_call_indirect_wide_table_size_642() {
9243        use synth_synthesis::{ArmOp, Reg};
9244        let enc = ArmEncoder::new_arm32();
9245        let bytes = enc
9246            .encode(&ArmOp::CallIndirect {
9247                rd: Reg::R0,
9248                type_idx: 0,
9249                table_index_reg: Reg::R0,
9250                table_size: 0x0002_0003,
9251                table_byte_offset: 0,
9252                null_check: false,
9253                type_check: None,
9254            })
9255            .unwrap();
9256        assert_eq!(bytes.len(), 32, "MOVT arm adds one word: {bytes:02x?}");
9257        let movw = u32::from_le_bytes(bytes[0..4].try_into().unwrap());
9258        let movt = u32::from_le_bytes(bytes[4..8].try_into().unwrap());
9259        assert_eq!(movw, 0xE300_C003, "MOVW r12,#3: {movw:#010x}");
9260        assert_eq!(movt, 0xE340_C002, "MOVT r12,#2: {movt:#010x}");
9261    }
9262
9263    /// #597 anchor (justified correctness RE-PIN of the #594-era freeze): the
9264    /// Thumb-2 `CallIndirect` expansion is `mov.w ip, rm, LSL #2; ldr.w ip,
9265    /// [r11, ip]; blx ip`.
9266    ///
9267    /// The #594 PR froze the then-current bytes `4F EA 20 0C ...` whose first
9268    /// word decodes as `mov.w ip, rm, ASR #32` — the intended `LSL #2` had
9269    /// its shift amount in the TYPE field (bits 5:4) instead of imm2 (bits
9270    /// 7:6), so the index was destroyed and every call_indirect dispatched
9271    /// table entry 0 (shipped miscompile, masked by index-0 probes). #597
9272    /// corrects the encoding; new bytes `4F EA 80 0C ...` were
9273    /// execution-validated under unicorn against the wasmtime oracle on a
9274    /// multi-entry table (indexes 0, 1, 3 —
9275    /// scripts/repro/call_indirect_597_differential.py) before this pin was
9276    /// replaced. Old pin: [4F EA 20 0C, 5B F8 0C C0, E0 47] (ASR #32 — must
9277    /// never come back).
9278    #[test]
9279    fn test_encode_thumb_call_indirect_lsl2_597() {
9280        use synth_synthesis::{ArmOp, Reg};
9281        let enc = ArmEncoder::new_thumb2();
9282        let bytes = enc
9283            .encode(&ArmOp::CallIndirect {
9284                rd: Reg::R0,
9285                type_idx: 0,
9286                table_index_reg: Reg::R0,
9287                table_size: 4,
9288                table_byte_offset: 0,
9289                null_check: false,
9290                type_check: None,
9291            })
9292            .unwrap();
9293        assert_eq!(
9294            bytes,
9295            vec![
9296                // #642 bounds guard: movw ip,#4; cmp r0,ip; blo +1; udf #0
9297                0x40, 0xF2, 0x04, 0x0C, // movw ip, #4
9298                0x60, 0x45, // cmp r0, ip
9299                0x00, 0xD3, // blo .+4 (skip the udf)
9300                0x00, 0xDE, // udf #0 — OOB index trap (WASM §4.4.8)
9301                // #597-pinned dispatch
9302                0x4F, 0xEA, 0x80, 0x0C, // mov.w ip, r0, lsl #2
9303                0x5B, 0xF8, 0x0C, 0xC0, // ldr.w ip, [r11, ip]
9304                0xE0, 0x47, // blx ip
9305            ],
9306            "Thumb-2 CallIndirect: bounds guard + mov.w/ldr.w/blx dispatch: {bytes:02x?}"
9307        );
9308        // The #597 bug bytes (ASR #32 dispatch first word) must never come back.
9309        assert!(
9310            !bytes.windows(4).any(|w| w == [0x4F, 0xEA, 0x20, 0x0C]),
9311            "mov.w ip, rm, ASR #32 — the #597 type-field bug"
9312        );
9313
9314        // A non-R0 index register lands in the mov.w's Rm field (hw2 bits 3:0)
9315        // and the cmp's Rn field.
9316        let bytes = enc
9317            .encode(&ArmOp::CallIndirect {
9318                rd: Reg::R0,
9319                type_idx: 0,
9320                table_index_reg: Reg::R4,
9321                table_size: 4,
9322                table_byte_offset: 0,
9323                null_check: false,
9324                type_check: None,
9325            })
9326            .unwrap();
9327        assert_eq!(&bytes[4..6], &[0x64, 0x45], "cmp r4, ip: {bytes:02x?}");
9328        assert_eq!(
9329            &bytes[10..14],
9330            &[0x4F, 0xEA, 0x84, 0x0C],
9331            "mov.w ip, r4, LSL #2: {bytes:02x?}"
9332        );
9333    }
9334
9335    /// #642: the Thumb-2 bounds guard for a high-register index (R8 — the top
9336    /// of the allocatable pool) uses the high-reg-capable 16-bit CMP (T2) with
9337    /// the N bit set; a table size above 16 bits adds a MOVT.
9338    #[test]
9339    fn test_encode_thumb_call_indirect_guard_shapes_642() {
9340        use synth_synthesis::{ArmOp, Reg};
9341        let enc = ArmEncoder::new_thumb2();
9342        let bytes = enc
9343            .encode(&ArmOp::CallIndirect {
9344                rd: Reg::R0,
9345                type_idx: 0,
9346                table_index_reg: Reg::R8,
9347                table_size: 3,
9348                table_byte_offset: 0,
9349                null_check: false,
9350                type_check: None,
9351            })
9352            .unwrap();
9353        // cmp r8, ip — T2: 0x4500 | N(1)<<7 | Rm(12)<<3 | Rn(0) = 0x45E0
9354        assert_eq!(&bytes[4..6], &[0xE0, 0x45], "cmp r8, ip: {bytes:02x?}");
9355
9356        let bytes = enc
9357            .encode(&ArmOp::CallIndirect {
9358                rd: Reg::R0,
9359                type_idx: 0,
9360                table_index_reg: Reg::R0,
9361                table_size: 0x0002_0003,
9362                table_byte_offset: 0,
9363                null_check: false,
9364                type_check: None,
9365            })
9366            .unwrap();
9367        // movw ip,#3 then movt ip,#2 — the size must not be truncated.
9368        assert_eq!(
9369            &bytes[0..8],
9370            &[0x40, 0xF2, 0x03, 0x0C, 0xC0, 0xF2, 0x02, 0x0C],
9371            "movw ip,#3; movt ip,#2: {bytes:02x?}"
9372        );
9373    }
9374
9375    /// #650: a non-zero table base offset (table N of the contiguous R11
9376    /// region) routes the Thumb-2 pointer load through
9377    /// `add.w ip, r11, ip; ldr.w ip, [ip, #offset]` — and offset 0 keeps the
9378    /// pre-#650 single-load bytes IDENTICAL (the by-construction pin).
9379    #[test]
9380    fn test_encode_thumb_call_indirect_table_offset_650() {
9381        use synth_synthesis::{ArmOp, Reg};
9382        let enc = ArmEncoder::new_thumb2();
9383        // falcon's fused-component shape: table 0 has 7 entries, so table 1
9384        // sits at byte offset 28.
9385        let bytes = enc
9386            .encode(&ArmOp::CallIndirect {
9387                rd: Reg::R0,
9388                type_idx: 0,
9389                table_index_reg: Reg::R1,
9390                table_size: 41,
9391                table_byte_offset: 28,
9392                null_check: false,
9393                type_check: None,
9394            })
9395            .unwrap();
9396        assert_eq!(
9397            bytes,
9398            vec![
9399                // #642 bounds guard against TABLE 1's OWN size (41)
9400                0x40, 0xF2, 0x29, 0x0C, // movw ip, #41
9401                0x61, 0x45, // cmp r1, ip
9402                0x00, 0xD3, // blo .+4 (skip the udf)
9403                0x00, 0xDE, // udf #0 — OOB trap (WASM §4.4.8)
9404                // dispatch through table 1's base (R11 + 28)
9405                0x4F, 0xEA, 0x81, 0x0C, // mov.w ip, r1, lsl #2
9406                0x0B, 0xEB, 0x0C, 0x0C, // add.w ip, r11, ip
9407                0xDC, 0xF8, 0x1C, 0xC0, // ldr.w ip, [ip, #28]
9408                0xE0, 0x47, // blx ip
9409            ],
9410            "Thumb-2 table-1 dispatch (#650): {bytes:02x?}"
9411        );
9412
9413        // Offset 0 must stay the #597-pinned single-load form (no add.w, no
9414        // imm-form ldr) — single-table byte identity by construction.
9415        let zero = enc
9416            .encode(&ArmOp::CallIndirect {
9417                rd: Reg::R0,
9418                type_idx: 0,
9419                table_index_reg: Reg::R1,
9420                table_size: 41,
9421                table_byte_offset: 0,
9422                null_check: false,
9423                type_check: None,
9424            })
9425            .unwrap();
9426        assert_eq!(
9427            &zero[10..],
9428            &[
9429                0x4F, 0xEA, 0x81, 0x0C, // mov.w ip, r1, lsl #2
9430                0x5B, 0xF8, 0x0C, 0xC0, // ldr.w ip, [r11, ip]
9431                0xE0, 0x47, // blx ip
9432            ],
9433            "offset 0 keeps the pre-#650 dispatch bytes: {zero:02x?}"
9434        );
9435    }
9436
9437    /// #650: the A32 twin — `add r12, r11, r12; ldr r12, [r12, #offset]` for
9438    /// a non-zero table base offset; offset 0 keeps the #594/#642 form.
9439    #[test]
9440    fn test_encode_arm32_call_indirect_table_offset_650() {
9441        use synth_synthesis::{ArmOp, Reg};
9442        let enc = ArmEncoder::new_arm32();
9443        let bytes = enc
9444            .encode(&ArmOp::CallIndirect {
9445                rd: Reg::R0,
9446                type_idx: 0,
9447                table_index_reg: Reg::R1,
9448                table_size: 41,
9449                table_byte_offset: 28,
9450                null_check: false,
9451                type_check: None,
9452            })
9453            .unwrap();
9454        let words: Vec<u32> = bytes
9455            .chunks_exact(4)
9456            .map(|w| u32::from_le_bytes(w.try_into().unwrap()))
9457            .collect();
9458        assert_eq!(words[0], 0xE300_C029, "MOVW r12,#41: {:#010x}", words[0]);
9459        assert_eq!(words[1], 0xE151_000C, "CMP r1,r12: {:#010x}", words[1]);
9460        assert_eq!(words[2], 0x3A00_0000, "BLO +1 insn: {:#010x}", words[2]);
9461        assert_eq!(words[3], 0xE7F0_00F0, "UDF: {:#010x}", words[3]);
9462        assert_eq!(
9463            words[4], 0xE1A0_C101,
9464            "MOV r12,r1,LSL#2: {:#010x}",
9465            words[4]
9466        );
9467        assert_eq!(
9468            words[5], 0xE08B_C00C,
9469            "ADD r12,r11,r12 (#650): {:#010x}",
9470            words[5]
9471        );
9472        assert_eq!(
9473            words[6], 0xE59C_C01C,
9474            "LDR r12,[r12,#28] (#650): {:#010x}",
9475            words[6]
9476        );
9477        assert_eq!(words[7], 0xE12F_FF3C, "BLX r12: {:#010x}", words[7]);
9478    }
9479
9480    /// #664: `null_check` inserts a null-funcref trap between the Thumb-2
9481    /// pointer load and the `BLX` (`cmp.w ip, #0; bne .+4; udf #0`) — a
9482    /// zero-linked (uninitialized) slot must TRAP (WASM §4.4.8), never
9483    /// branch to address 0. `null_check: false` keeps the expansion
9484    /// byte-identical to the pre-#664 form (by-construction pin).
9485    #[test]
9486    fn test_encode_thumb_call_indirect_null_check_664() {
9487        use synth_synthesis::{ArmOp, Reg};
9488        let enc = ArmEncoder::new_thumb2();
9489        let op = |null_check| ArmOp::CallIndirect {
9490            rd: Reg::R0,
9491            type_idx: 0,
9492            table_index_reg: Reg::R1,
9493            table_size: 4,
9494            table_byte_offset: 0,
9495            null_check,
9496            type_check: None,
9497        };
9498        let with = enc.encode(&op(true)).unwrap();
9499        let without = enc.encode(&op(false)).unwrap();
9500        // The checked form = the unchecked form with EXACTLY the three-insn
9501        // null check spliced in before the final BLX (byte identity of the
9502        // shared prefix/suffix — nothing else may move).
9503        assert_eq!(
9504            with.len(),
9505            without.len() + 8,
9506            "cmp.w (4) + bne (2) + udf (2): {with:02x?}"
9507        );
9508        let blx_at = without.len() - 2;
9509        assert_eq!(&with[..blx_at], &without[..blx_at], "shared prefix");
9510        assert_eq!(
9511            &with[blx_at..],
9512            &[
9513                0xBC, 0xF1, 0x00, 0x0F, // cmp.w ip, #0
9514                0x00, 0xD1, // bne .+4 (skip the udf)
9515                0x00, 0xDE, // udf #0 — null-funcref trap (#664)
9516                0xE0, 0x47, // blx ip
9517            ],
9518            "null check precedes the BLX: {with:02x?}"
9519        );
9520        assert_eq!(&with[with.len() - 2..], &without[blx_at..], "same BLX");
9521    }
9522
9523    /// #664: the A32 twin — `cmp r12, #0; bne .+8; udf` before the `BLX`;
9524    /// `null_check: false` keeps the #594/#642/#650 bytes identical.
9525    #[test]
9526    fn test_encode_arm32_call_indirect_null_check_664() {
9527        use synth_synthesis::{ArmOp, Reg};
9528        let enc = ArmEncoder::new_arm32();
9529        let op = |null_check| ArmOp::CallIndirect {
9530            rd: Reg::R0,
9531            type_idx: 0,
9532            table_index_reg: Reg::R1,
9533            table_size: 4,
9534            table_byte_offset: 0,
9535            null_check,
9536            type_check: None,
9537        };
9538        let with = enc.encode(&op(true)).unwrap();
9539        let without = enc.encode(&op(false)).unwrap();
9540        assert_eq!(with.len(), without.len() + 12, "3 A32 words: {with:02x?}");
9541        let blx_at = without.len() - 4;
9542        assert_eq!(&with[..blx_at], &without[..blx_at], "shared prefix");
9543        let words: Vec<u32> = with[blx_at..]
9544            .chunks_exact(4)
9545            .map(|w| u32::from_le_bytes(w.try_into().unwrap()))
9546            .collect();
9547        assert_eq!(words[0], 0xE35C_0000, "CMP r12,#0: {:#010x}", words[0]);
9548        assert_eq!(words[1], 0x1A00_0000, "BNE +1 insn: {:#010x}", words[1]);
9549        assert_eq!(words[2], 0xE7F0_00F0, "UDF (null trap): {:#010x}", words[2]);
9550        assert_eq!(words[3], 0xE12F_FF3C, "BLX r12: {:#010x}", words[3]);
9551    }
9552
9553    /// #676: `type_check` splices the runtime type check — scale the index,
9554    /// load the slot's structural class id from the type-id sidecar
9555    /// (`ldr.w ip, [ip, #type_off]`), compare against the expected class id
9556    /// and trap on mismatch (WASM §4.4.8) — between the bounds guard and
9557    /// the dispatch tail. `type_check: None` keeps the expansion
9558    /// byte-identical to the pre-#676 form (by-construction pin, the same
9559    /// trick as #650 offset-0 / #664 `null_check: false`).
9560    #[test]
9561    fn test_encode_thumb_call_indirect_type_check_676() {
9562        use synth_synthesis::{ArmOp, Reg};
9563        let enc = ArmEncoder::new_thumb2();
9564        let op = |type_check| ArmOp::CallIndirect {
9565            rd: Reg::R0,
9566            type_idx: 1,
9567            table_index_reg: Reg::R1,
9568            table_size: 5,
9569            table_byte_offset: 0,
9570            null_check: false,
9571            type_check,
9572        };
9573        let with = enc.encode(&op(Some((2, 20)))).unwrap();
9574        let without = enc.encode(&op(None)).unwrap();
9575        // The checked form = the unchecked form with EXACTLY the six-insn
9576        // type check spliced in after the bounds guard (byte identity of
9577        // the shared prefix/suffix — nothing else may move).
9578        assert_eq!(
9579            with.len(),
9580            without.len() + 20,
9581            "lsl.w(4)+add.w(4)+ldr.w(4)+cmp.w(4)+beq(2)+udf(2): {with:02x?}"
9582        );
9583        // Bounds guard: movw(4) + cmp(2) + blo(2) + udf(2) = 10 bytes.
9584        let guard_end = 10;
9585        assert_eq!(&with[..guard_end], &without[..guard_end], "shared guard");
9586        assert_eq!(
9587            &with[guard_end..guard_end + 20],
9588            &[
9589                0x4F, 0xEA, 0x81, 0x0C, // mov.w ip, r1, lsl #2
9590                0x0B, 0xEB, 0x0C, 0x0C, // add.w ip, r11, ip
9591                0xDC, 0xF8, 0x14, 0xC0, // ldr.w ip, [ip, #20] — sidecar slot id
9592                0xBC, 0xF1, 0x02, 0x0F, // cmp.w ip, #2 — expected class id
9593                0x00, 0xD0, // beq .+4 (skip the udf on a match)
9594                0x00, 0xDE, // udf #0 — §4.4.8 type-mismatch trap (#676)
9595            ],
9596            "type check follows the bounds guard: {with:02x?}"
9597        );
9598        assert_eq!(
9599            &with[guard_end + 20..],
9600            &without[guard_end..],
9601            "dispatch tail unchanged (idx*4 recomputed)"
9602        );
9603    }
9604
9605    /// #676: the A32 twin — `mov r12, idx, lsl #2; add r12, r11, r12;
9606    /// ldr r12, [r12, #type_off]; cmp r12, #id; beq .+8; udf` after the
9607    /// bounds guard; `type_check: None` keeps the #594/#642/#650/#664
9608    /// bytes identical.
9609    #[test]
9610    fn test_encode_arm32_call_indirect_type_check_676() {
9611        use synth_synthesis::{ArmOp, Reg};
9612        let enc = ArmEncoder::new_arm32();
9613        let op = |type_check| ArmOp::CallIndirect {
9614            rd: Reg::R0,
9615            type_idx: 1,
9616            table_index_reg: Reg::R1,
9617            table_size: 5,
9618            table_byte_offset: 0,
9619            null_check: false,
9620            type_check,
9621        };
9622        let with = enc.encode(&op(Some((2, 20)))).unwrap();
9623        let without = enc.encode(&op(None)).unwrap();
9624        assert_eq!(with.len(), without.len() + 24, "6 A32 words: {with:02x?}");
9625        // Bounds guard: movw + cmp + blo + udf = 4 words = 16 bytes.
9626        let guard_end = 16;
9627        assert_eq!(&with[..guard_end], &without[..guard_end], "shared guard");
9628        let words: Vec<u32> = with[guard_end..guard_end + 24]
9629            .chunks_exact(4)
9630            .map(|w| u32::from_le_bytes(w.try_into().unwrap()))
9631            .collect();
9632        assert_eq!(
9633            words[0], 0xE1A0_C101,
9634            "MOV r12,r1,LSL#2: {:#010x}",
9635            words[0]
9636        );
9637        assert_eq!(words[1], 0xE08B_C00C, "ADD r12,r11,r12: {:#010x}", words[1]);
9638        assert_eq!(
9639            words[2], 0xE59C_C014,
9640            "LDR r12,[r12,#20] (sidecar): {:#010x}",
9641            words[2]
9642        );
9643        assert_eq!(
9644            words[3], 0xE35C_0002,
9645            "CMP r12,#2 (expected class id): {:#010x}",
9646            words[3]
9647        );
9648        assert_eq!(words[4], 0x0A00_0000, "BEQ +1 insn: {:#010x}", words[4]);
9649        assert_eq!(
9650            words[5], 0xE7F0_00F0,
9651            "UDF (type-mismatch trap): {:#010x}",
9652            words[5]
9653        );
9654        assert_eq!(
9655            &with[guard_end + 24..],
9656            &without[guard_end..],
9657            "dispatch tail unchanged"
9658        );
9659    }
9660
9661    /// #178/#180 regression: the Thumb `Add`/`Adds`/`Subs` reg-forms used the
9662    /// 16-bit encoding unconditionally. For high registers (R12 base scratch,
9663    /// R8-R11 i64 pairs) the 3-bit register fields overflow and corrupt the
9664    /// operands — `add ip,ip,r0` came out as `adds r4,r5,r1` (0x186C), silently
9665    /// dropping the address operand and miscompiling every optimized memory
9666    /// access. High registers must use the 32-bit `.W` forms.
9667    #[test]
9668    fn test_encode_thumb_add_high_reg_uses_add_w_178_180() {
9669        let encoder = ArmEncoder::new_thumb2();
9670
9671        // add ip, ip, r0  — the exact MemLoad/MemStore base+addr op.
9672        let code = encoder
9673            .encode(&ArmOp::Add {
9674                rd: Reg::R12,
9675                rn: Reg::R12,
9676                op2: Operand2::Reg(Reg::R0),
9677            })
9678            .unwrap();
9679        // ADD.W ip, ip, r0 = EB0C 0C00 (little-endian halfwords).
9680        assert_eq!(
9681            code,
9682            vec![0x0C, 0xEB, 0x00, 0x0C],
9683            "high-reg Thumb ADD must be 32-bit ADD.W (EB0C 0C00), not corrupt 16-bit; got {code:02X?}"
9684        );
9685        // Must NOT be the buggy 16-bit 0x186C (`adds r4,r5,r1`).
9686        assert_ne!(code, vec![0x6C, 0x18], "regressed to corrupt 16-bit ADDS");
9687
9688        // Low-register add stays 16-bit (no regression for the common case).
9689        let lo = encoder
9690            .encode(&ArmOp::Add {
9691                rd: Reg::R1,
9692                rn: Reg::R2,
9693                op2: Operand2::Reg(Reg::R3),
9694            })
9695            .unwrap();
9696        assert_eq!(
9697            lo.len(),
9698            2,
9699            "low-reg ADD should remain 16-bit, got {lo:02X?}"
9700        );
9701    }
9702
9703    /// #178/#180 sibling: i64 low-word `Adds`/`Subs` can land in R8-R11 pairs;
9704    /// those must fall back to 32-bit ADDS.W/SUBS.W (flag-setting preserved).
9705    #[test]
9706    fn test_encode_thumb_adds_subs_high_reg_use_32bit_178_180() {
9707        let encoder = ArmEncoder::new_thumb2();
9708
9709        // adds r10, r10, r8  → ADDS.W = EB1A 0A08
9710        let adds = encoder
9711            .encode(&ArmOp::Adds {
9712                rd: Reg::R10,
9713                rn: Reg::R10,
9714                op2: Operand2::Reg(Reg::R8),
9715            })
9716            .unwrap();
9717        assert_eq!(
9718            adds,
9719            vec![0x1A, 0xEB, 0x08, 0x0A],
9720            "high-reg ADDS must be 32-bit ADDS.W (EB1A 0A08); got {adds:02X?}"
9721        );
9722
9723        // subs r10, r10, r8  → SUBS.W = EBBA 0A08
9724        let subs = encoder
9725            .encode(&ArmOp::Subs {
9726                rd: Reg::R10,
9727                rn: Reg::R10,
9728                op2: Operand2::Reg(Reg::R8),
9729            })
9730            .unwrap();
9731        assert_eq!(
9732            subs,
9733            vec![0xBA, 0xEB, 0x08, 0x0A],
9734            "high-reg SUBS must be 32-bit SUBS.W (EBBA 0A08); got {subs:02X?}"
9735        );
9736    }
9737
9738    /// #184 (sibling of #180): 16-bit CMN (T1) only encodes R0-R7. High registers
9739    /// must use 32-bit CMN.W, not the corrupt truncated 16-bit form.
9740    #[test]
9741    fn test_encode_thumb_cmn_high_reg_uses_cmn_w_184() {
9742        let encoder = ArmEncoder::new_thumb2();
9743
9744        // cmn r10, r8  → CMN.W = EB1A 0F08 (ADD.W S=1, Rd=PC discarded).
9745        let cmn = encoder
9746            .encode(&ArmOp::Cmn {
9747                rn: Reg::R10,
9748                op2: Operand2::Reg(Reg::R8),
9749            })
9750            .unwrap();
9751        assert_eq!(
9752            cmn,
9753            vec![0x1A, 0xEB, 0x08, 0x0F],
9754            "high-reg CMN must be 32-bit CMN.W (EB1A 0F08); got {cmn:02X?}"
9755        );
9756
9757        // Low registers stay 16-bit: cmn r1, r2 = 0x42D1.
9758        let lo = encoder
9759            .encode(&ArmOp::Cmn {
9760                rn: Reg::R1,
9761                op2: Operand2::Reg(Reg::R2),
9762            })
9763            .unwrap();
9764        assert_eq!(
9765            lo.len(),
9766            2,
9767            "low-reg CMN should remain 16-bit, got {lo:02X?}"
9768        );
9769        assert_eq!(lo, vec![0xD1, 0x42], "low-reg CMN bytes wrong: {lo:02X?}");
9770    }
9771
9772    /// #185 regression: feeding PC (R15) as a data operand to a Thumb-2 op that
9773    /// guards its registers must return Err, not panic under debug-assertions.
9774    /// (Synth never emits PC here; the fuzz harness requires encode() be total.)
9775    #[test]
9776    fn test_encode_pc_operand_returns_err_not_panic_185() {
9777        let encoder = ArmEncoder::new_thumb2();
9778        for op in [
9779            ArmOp::Sdiv {
9780                rd: Reg::PC,
9781                rn: Reg::R0,
9782                rm: Reg::R1,
9783            },
9784            ArmOp::Udiv {
9785                rd: Reg::R0,
9786                rn: Reg::PC,
9787                rm: Reg::R1,
9788            },
9789            ArmOp::Sdiv {
9790                rd: Reg::R0,
9791                rn: Reg::R1,
9792                rm: Reg::PC,
9793            },
9794        ] {
9795            let r = encoder.encode(&op);
9796            assert!(
9797                r.is_err(),
9798                "encode({op:?}) must return Err for a PC operand, got {r:?}"
9799            );
9800        }
9801        // Valid registers still encode fine (no false rejection).
9802        assert!(
9803            encoder
9804                .encode(&ArmOp::Sdiv {
9805                    rd: Reg::R0,
9806                    rn: Reg::R1,
9807                    rm: Reg::R2
9808                })
9809                .is_ok()
9810        );
9811    }
9812
9813    #[test]
9814    fn test_encode_nop_arm32() {
9815        let encoder = ArmEncoder::new_arm32();
9816        let code = encoder.encode(&ArmOp::Nop).unwrap();
9817
9818        assert_eq!(code.len(), 4); // ARM32 instructions are 4 bytes
9819        assert_eq!(code, vec![0x00, 0x00, 0xA0, 0xE1]); // MOV R0, R0
9820    }
9821
9822    #[test]
9823    fn test_encode_nop_thumb() {
9824        let encoder = ArmEncoder::new_thumb2();
9825        let code = encoder.encode(&ArmOp::Nop).unwrap();
9826
9827        assert_eq!(code.len(), 2); // Thumb instructions are 2 bytes
9828        assert_eq!(code, vec![0x00, 0xBF]); // NOP
9829    }
9830
9831    #[test]
9832    fn test_encode_mov_immediate_arm32() {
9833        let encoder = ArmEncoder::new_arm32();
9834        let op = ArmOp::Mov {
9835            rd: Reg::R0,
9836            op2: Operand2::Imm(42),
9837        };
9838
9839        let code = encoder.encode(&op).unwrap();
9840        assert_eq!(code.len(), 4);
9841
9842        // Verify it's a MOV instruction (bits should have immediate flag set)
9843        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
9844        assert_eq!(instr & 0x0E000000, 0x02000000); // Check I bit is set
9845    }
9846
9847    #[test]
9848    fn test_encode_add_registers_arm32() {
9849        let encoder = ArmEncoder::new_arm32();
9850        let op = ArmOp::Add {
9851            rd: Reg::R0,
9852            rn: Reg::R1,
9853            op2: Operand2::Reg(Reg::R2),
9854        };
9855
9856        let code = encoder.encode(&op).unwrap();
9857        assert_eq!(code.len(), 4);
9858
9859        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
9860        // Verify it's an ADD instruction with correct opcode
9861        assert_eq!(instr & 0x0FE00000, 0x00800000);
9862    }
9863
9864    /// #350 — `encode_thumb32_add_imm` must lower an out-of-range immediate
9865    /// (> 0xFFF) to a legal MOVW(/MOVT) + ADD.W-register sequence instead of
9866    /// erroring. The small-imm fast path (imm <= 0xFFF) stays byte-identical.
9867    #[test]
9868    fn test_encode_add_imm_large_350() {
9869        let enc = ArmEncoder::new_thumb2();
9870
9871        // --- Fast path: imm <= 0xFFF is a single 4-byte instruction, and the
9872        // VALUE must be right (#681: this test used to assert only the length,
9873        // letting the raw-packed T3 mis-encoding of 0x123 pass CI). 0x123 is
9874        // not ThumbExpandImm-representable, so it must be ADDW (T4, plain
9875        // imm12): clang `addw r0, r1, #0x123` = f201 0023.
9876        let small = enc
9877            .encode_thumb32_add_imm(&Reg::R0, &Reg::R1, 0x123)
9878            .unwrap();
9879        assert_eq!(small, vec![0x01, 0xF2, 0x23, 0x10], "ADDW r0, r1, #0x123");
9880
9881        // helper: decode a Thumb-2 MOVW/MOVT halfword pair back to its imm16
9882        fn movx_imm16(b: &[u8]) -> u32 {
9883            let hw1 = u16::from_le_bytes([b[0], b[1]]) as u32;
9884            let hw2 = u16::from_le_bytes([b[2], b[3]]) as u32;
9885            let imm4 = hw1 & 0xF;
9886            let i = (hw1 >> 10) & 1;
9887            let imm3 = (hw2 >> 12) & 0x7;
9888            let imm8 = hw2 & 0xFF;
9889            (imm4 << 12) | (i << 11) | (imm3 << 8) | imm8
9890        }
9891        fn movx_rd(b: &[u8]) -> u32 {
9892            (u16::from_le_bytes([b[2], b[3]]) as u32 >> 8) & 0xF
9893        }
9894
9895        // --- rd != rn: scratch is rd. imm = 70000 = 0x11170 needs MOVW+MOVT. ---
9896        // 0x11170: lo16 = 0x1170, hi16 = 0x0001
9897        let seq = enc
9898            .encode_thumb32_add_imm(&Reg::R12, &Reg::R0, 70000)
9899            .unwrap();
9900        assert_eq!(seq.len(), 12, "MOVW + MOVT + ADD = 12 bytes");
9901        // MOVW r12, #0x1170
9902        assert_eq!(u16::from_le_bytes([seq[0], seq[1]]) & 0xFBF0, 0xF240);
9903        assert_eq!(movx_rd(&seq[0..4]), 12);
9904        assert_eq!(movx_imm16(&seq[0..4]), 0x1170);
9905        // MOVT r12, #0x0001
9906        assert_eq!(u16::from_le_bytes([seq[4], seq[5]]) & 0xFBF0, 0xF2C0);
9907        assert_eq!(movx_rd(&seq[4..8]), 12);
9908        assert_eq!(movx_imm16(&seq[4..8]), 0x0001);
9909        // ADD.W r12, r0, r12  (EB00 | rn=0 ; rd=12, rm=12)
9910        let add1 = u16::from_le_bytes([seq[8], seq[9]]) as u32;
9911        let add2 = u16::from_le_bytes([seq[10], seq[11]]) as u32;
9912        assert_eq!(add1 & 0xFFF0, 0xEB00);
9913        assert_eq!(add1 & 0xF, 0); // rn = r0
9914        assert_eq!((add2 >> 8) & 0xF, 12); // rd = r12
9915        assert_eq!(add2 & 0xF, 12); // rm = scratch = r12
9916        // The materialized scratch must reconstruct exactly 70000.
9917        assert_eq!(
9918            (movx_imm16(&seq[4..8]) << 16) | movx_imm16(&seq[0..4]),
9919            70000
9920        );
9921
9922        // --- imm <= 0xFFFF: MOVT is skipped (MOVW + ADD = 8 bytes). ---
9923        let seq16 = enc
9924            .encode_thumb32_add_imm(&Reg::R3, &Reg::R0, 0xABCD)
9925            .unwrap();
9926        assert_eq!(seq16.len(), 8, "imm <= 0xFFFF skips MOVT");
9927        assert_eq!(movx_imm16(&seq16[0..4]), 0xABCD);
9928        assert_eq!(movx_rd(&seq16[0..4]), 3); // scratch = rd = r3
9929
9930        // --- rd == rn (in-place add): scratch must be R12, not rd. ---
9931        // imm = 0x12345: lo16 = 0x2345, hi16 = 0x0001
9932        let inplace = enc
9933            .encode_thumb32_add_imm(&Reg::R5, &Reg::R5, 0x12345)
9934            .unwrap();
9935        assert_eq!(inplace.len(), 12);
9936        assert_eq!(movx_rd(&inplace[0..4]), 12, "rd==rn must use R12 scratch");
9937        assert_eq!(
9938            (movx_imm16(&inplace[4..8]) << 16) | movx_imm16(&inplace[0..4]),
9939            0x12345
9940        );
9941        // ADD.W r5, r5, r12 — rm must be the scratch (12), never rn.
9942        let ip_add2 = u16::from_le_bytes([inplace[10], inplace[11]]) as u32;
9943        assert_eq!(ip_add2 & 0xF, 12);
9944        assert_eq!((ip_add2 >> 8) & 0xF, 5);
9945    }
9946
9947    /// #681 — `encode_thumb32_add_imm` packed a RAW immediate into the T3
9948    /// ADD.W `i:imm3:imm8` field, which is a ThumbExpandImm MODIFIED immediate:
9949    /// ThumbExpandImm(0x200) = 0, ThumbExpandImm(0x400) = 0x8000_0000. Every
9950    /// dynamic-address load/store with a static offset in 0x100..=0xFFF
9951    /// computed a wrong address (and bypassed --safety-bounds software: the
9952    /// guard checked the intended address, the access used the mis-encoded
9953    /// one). Fix: imm <= 0xFF keeps T3 (raw == expanded there, bit-identical);
9954    /// 0x100..=0xFFF uses ADDW (T4, plain imm12) — same lowering
9955    /// `encode_thumb32_add` already uses per #253.
9956    ///
9957    /// Every expected byte sequence below is pinned against clang
9958    /// (`-target thumbv7m-none-eabi`) output, bit-for-bit (#544 pattern).
9959    #[test]
9960    fn test_encode_add_imm_thumb_expand_681() {
9961        let enc = ArmEncoder::new_thumb2();
9962        let add = |rd: &Reg, rn: &Reg, imm: u32| enc.encode_thumb32_add_imm(rd, rn, imm).unwrap();
9963
9964        // imm <= 0xFF stays T3 ADD.W (raw == ThumbExpandImm-expanded):
9965        // clang: add.w r12, r0, #0xff  = f100 0cff
9966        assert_eq!(add(&Reg::R12, &Reg::R0, 0xFF), vec![0x00, 0xF1, 0xFF, 0x0C]);
9967
9968        // 0x100..=0xFFF must be ADDW (T4, plain imm12). The old T3 raw packing
9969        // decoded as +0 (0x100/0x200), +0x80000000 (0x400), etc.
9970        // clang: addw r12, r0, #0x100 = f200 1c00
9971        assert_eq!(
9972            add(&Reg::R12, &Reg::R0, 0x100),
9973            vec![0x00, 0xF2, 0x00, 0x1C]
9974        );
9975        // clang: addw r12, r0, #0x104 = f200 1c04
9976        assert_eq!(
9977            add(&Reg::R12, &Reg::R0, 0x104),
9978            vec![0x00, 0xF2, 0x04, 0x1C]
9979        );
9980        // clang: addw r12, r0, #0x200 = f200 2c00
9981        assert_eq!(
9982            add(&Reg::R12, &Reg::R0, 0x200),
9983            vec![0x00, 0xF2, 0x00, 0x2C]
9984        );
9985        // clang: addw r12, r0, #0x3fc = f200 3cfc
9986        assert_eq!(
9987            add(&Reg::R12, &Reg::R0, 0x3FC),
9988            vec![0x00, 0xF2, 0xFC, 0x3C]
9989        );
9990        // clang: addw r12, r0, #0x400 = f200 4c00
9991        assert_eq!(
9992            add(&Reg::R12, &Reg::R0, 0x400),
9993            vec![0x00, 0xF2, 0x00, 0x4C]
9994        );
9995        // clang: addw r12, r0, #0xfff = f600 7cff
9996        assert_eq!(
9997            add(&Reg::R12, &Reg::R0, 0xFFF),
9998            vec![0x00, 0xF6, 0xFF, 0x7C]
9999        );
10000        // Non-scratch rd/rn — clang: addw r1, r2, #0x104 = f202 1104
10001        assert_eq!(add(&Reg::R1, &Reg::R2, 0x104), vec![0x02, 0xF2, 0x04, 0x11]);
10002    }
10003
10004    /// #681 class audit — the T2 RSB and AND.W immediate fields are also
10005    /// ThumbExpandImm-coded and were raw-packed. Neither has a plain-imm12
10006    /// (T4-style) form, so a non-representable immediate must Err loudly
10007    /// (#253/#255/#378 class: never silently encode a different constant).
10008    /// Existing emitters only use representable values (RSB #32, AND #0x3F),
10009    /// pinned here bit-for-bit against clang.
10010    #[test]
10011    fn test_rsb_and_imm_thumb_expand_gate_681() {
10012        let enc = ArmEncoder::new_thumb2();
10013
10014        // clang: rsb.w r3, r2, #0x20 = f1c2 0320 — byte-identical to before.
10015        let rsb = enc
10016            .encode(&ArmOp::Rsb {
10017                rd: Reg::R3,
10018                rn: Reg::R2,
10019                imm: 32,
10020            })
10021            .unwrap();
10022        assert_eq!(rsb, vec![0xC2, 0xF1, 0x20, 0x03]);
10023
10024        // 0x101 is not ThumbExpandImm-representable -> must Err, not mis-encode.
10025        assert!(
10026            enc.encode(&ArmOp::Rsb {
10027                rd: Reg::R3,
10028                rn: Reg::R2,
10029                imm: 0x101,
10030            })
10031            .is_err(),
10032            "non-ThumbExpandImm RSB immediate must Err"
10033        );
10034
10035        // clang: and r4, r4, #0x3f = f004 043f — byte-identical to before.
10036        let and = enc.encode_thumb32_and_imm_raw(4, 4, 0x3F).unwrap();
10037        assert_eq!(and, vec![0x04, 0xF0, 0x3F, 0x04]);
10038        assert!(
10039            enc.encode_thumb32_and_imm_raw(4, 4, 0x101).is_err(),
10040            "non-ThumbExpandImm AND immediate must Err"
10041        );
10042
10043        // A32 RSB: imm12 is a rotate:imm8 modified immediate; > 0xFF used to be
10044        // silently masked to `imm & 0xFF` (#378 masking class) -> must Err.
10045        let a32 = ArmEncoder::new_arm32();
10046        assert!(
10047            a32.encode(&ArmOp::Rsb {
10048                rd: Reg::R3,
10049                rn: Reg::R2,
10050                imm: 0x120,
10051            })
10052            .is_err(),
10053            "A32 RSB immediate > 0xFF must Err, not mask"
10054        );
10055        // imm 32 (the only value real codegen emits) still encodes.
10056        assert!(
10057            a32.encode(&ArmOp::Rsb {
10058                rd: Reg::R3,
10059                rn: Reg::R2,
10060                imm: 32,
10061            })
10062            .is_ok()
10063        );
10064    }
10065
10066    /// #350 follow-up — the `encoder_no_panic` fuzz harness drives the encoder
10067    /// with ARBITRARY registers, including the one case the in-place lowering
10068    /// cannot serve: rd==rn==R12. There the scratch (R12, the reserved encoder
10069    /// register) would alias Rn and clobber it before the ADD reads it. The
10070    /// encoder contract (#180/#185) is Ok-or-Err, never a panic — so this must
10071    /// return Err, not assert. (Real codegen never emits rd==rn==R12 because R12
10072    /// is non-allocatable; this guards only the fuzz/adversarial path.)
10073    #[test]
10074    fn test_encode_add_imm_large_rd_rn_r12_errs_not_panics_350() {
10075        let enc = ArmEncoder::new_thumb2();
10076        // Out-of-range imm with rd==rn==R12: no free scratch -> Err.
10077        let r = enc.encode_thumb32_add_imm(&Reg::R12, &Reg::R12, 70000);
10078        assert!(
10079            r.is_err(),
10080            "rd==rn==R12 with out-of-range imm must Err (no free scratch), got {r:?}"
10081        );
10082        // Small imm with rd==rn==R12 still takes the single-instruction fast path
10083        // (no scratch needed) and must succeed — the guard is scoped to the
10084        // out-of-range lowering only.
10085        let small = enc.encode_thumb32_add_imm(&Reg::R12, &Reg::R12, 0x10);
10086        assert!(small.is_ok(), "small imm needs no scratch, must stay Ok");
10087    }
10088
10089    /// #378 — `encode_operand2` (ARM32 data-processing operand) must FAIL
10090    /// HONESTLY on an immediate that is not a valid rotated immediate, rather
10091    /// than silently masking it to `imm & 0xFF` and emitting a WRONG
10092    /// instruction. `0x1FF` has 9 set bits, so it cannot come from rotating an
10093    /// 8-bit imm8 — non-encodable. Real codegen materializes large constants via
10094    /// MOVW/MOVT; this guards the encoder's Ok-or-Err contract (#180/#185)
10095    /// directly. It is an Err (not a panic) so the `encoder_no_panic` fuzz
10096    /// harness — which drives arbitrary operands — still passes.
10097    #[test]
10098    fn test_encode_operand2_non_rotatable_imm_errs_not_masks_378() {
10099        let enc = ArmEncoder::new_arm32();
10100        let bad = enc.encode(&ArmOp::Add {
10101            rd: Reg::R0,
10102            rn: Reg::R1,
10103            op2: Operand2::Imm(0x1FF),
10104        });
10105        assert!(
10106            bad.is_err(),
10107            "non-rotatable ARM32 immediate 0x1FF must Err (was silently masked \
10108             to 0xFF), got {bad:?}"
10109        );
10110        // A representable rotated immediate still encodes fine (regression guard).
10111        let ok = enc.encode(&ArmOp::Add {
10112            rd: Reg::R0,
10113            rn: Reg::R1,
10114            op2: Operand2::Imm(0xFF),
10115        });
10116        assert!(
10117            ok.is_ok(),
10118            "0xFF is a valid rotated immediate, must stay Ok"
10119        );
10120    }
10121
10122    #[test]
10123    fn test_encode_ldr_arm32() {
10124        let encoder = ArmEncoder::new_arm32();
10125        let op = ArmOp::Ldr {
10126            rd: Reg::R0,
10127            addr: MemAddr::imm(Reg::R1, 4),
10128        };
10129
10130        let code = encoder.encode(&op).unwrap();
10131        assert_eq!(code.len(), 4);
10132
10133        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10134        // Verify load bit is set
10135        assert_eq!(instr & 0x00100000, 0x00100000);
10136    }
10137
10138    #[test]
10139    fn test_encode_str_arm32() {
10140        let encoder = ArmEncoder::new_arm32();
10141        let op = ArmOp::Str {
10142            rd: Reg::R0,
10143            addr: MemAddr::imm(Reg::SP, 0),
10144        };
10145
10146        let code = encoder.encode(&op).unwrap();
10147        assert_eq!(code.len(), 4);
10148    }
10149
10150    #[test]
10151    fn test_encode_branch_arm32() {
10152        let encoder = ArmEncoder::new_arm32();
10153        let op = ArmOp::Bl {
10154            label: "main".to_string(),
10155        };
10156
10157        let code = encoder.encode(&op).unwrap();
10158        assert_eq!(code.len(), 4);
10159
10160        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10161        // Verify BL opcode
10162        assert_eq!(instr & 0x0F000000, 0x0B000000);
10163    }
10164
10165    /// Regression test for #167 + #174: the Thumb-2 BL relocatable placeholder
10166    /// must carry a -4 addend so an R_ARM_THM_CALL nets to exactly the symbol S.
10167    /// The correct encoding is what `gas` emits for `bl <extern>`: f7ff fffe
10168    /// (hw1=0xF7FF, hw2=0xFFFE), little-endian bytes FF F7 FE FF.
10169    ///   - 0xD000 (J1=J2=0) → ~+0x600000 garbage addend: `bl c0000c` / truncated
10170    ///     to fit (#167).
10171    ///   - 0xF800 (addend 0) → lands at S+4, one instruction past the callee
10172    ///     entry (#174).
10173    ///   - 0xFFFE (addend -4) → lands at S. Correct.
10174    #[test]
10175    fn test_encode_thumb_bl_placeholder_addend_167_174() {
10176        let encoder = ArmEncoder::new_thumb2();
10177        let op = ArmOp::Bl {
10178            label: "callee".to_string(),
10179        };
10180
10181        let code = encoder.encode(&op).unwrap();
10182        assert_eq!(code.len(), 4, "Thumb-2 BL is 32-bit");
10183
10184        let hw1 = u16::from_le_bytes([code[0], code[1]]);
10185        let hw2 = u16::from_le_bytes([code[2], code[3]]);
10186        assert_eq!(hw1, 0xF7FF, "BL first halfword (matches gas `bl <extern>`)");
10187        assert_eq!(
10188            hw2, 0xFFFE,
10189            "BL second halfword must be 0xFFFE (-4 addend → nets to S), not 0xF800 (→ S+4, #174) or 0xD000 (#167)"
10190        );
10191        assert_ne!(hw2, 0xF800, "0xF800 (addend 0) lands at S+4 (#174)");
10192        assert_ne!(hw2, 0xD000, "0xD000 bakes in a ~+0x600000 addend (#167)");
10193    }
10194
10195    /// #740: the Thumb-2 32-bit B<cond>.W (encoding T3) must pack the
10196    /// HALFWORD offset directly into S:J2:J1:imm6:imm11 — the byte offset is
10197    /// SignExtend(S:J2:J1:imm6:imm11:'0'). The old arm packed
10198    /// `halfword_offset >> 1`, HALVING every wide conditional branch's
10199    /// displacement: gust_poll's loop-head `br_if` to an outer block end
10200    /// landed mid-shape (a spurious state write + spurious calls on the
10201    /// empty-budget path). Narrow (16-bit) B<cond> was unaffected — only
10202    /// spans > 254 bytes hit the bug. Bytes cross-checked against the llvm
10203    /// disassembler (`bne.w #0x224` = f040 8112).
10204    #[test]
10205    fn test_encode_thumb_bcond_wide_t3_halfword_offset_740() {
10206        use synth_synthesis::Condition;
10207        let encoder = ArmEncoder::new_thumb2();
10208
10209        // gust_poll's loop-head edge: NE, +0x112 halfwords (+0x224 bytes).
10210        let code = encoder
10211            .encode(&ArmOp::BCondOffset {
10212                cond: Condition::NE,
10213                offset: 0x112,
10214            })
10215            .unwrap();
10216        assert_eq!(code.len(), 4, "offset beyond ±127 halfwords must be wide");
10217        let hw1 = u16::from_le_bytes([code[0], code[1]]);
10218        let hw2 = u16::from_le_bytes([code[2], code[3]]);
10219        assert_eq!(hw1, 0xF040, "T3 hw1: 1111 0 S=0 cond=NE imm6=0");
10220        assert_eq!(
10221            hw2, 0x8112,
10222            "T3 hw2 imm11 must carry halfword offset bits [10:0] directly — \
10223             0x8089 (offset>>1) is the halved #740 miscompile"
10224        );
10225
10226        // Backward wide branch: EQ, -0x100 halfwords. S=1, J2=J1=1,
10227        // imm6=0b111111, imm11=0x700 → f43f af00.
10228        let code = encoder
10229            .encode(&ArmOp::BCondOffset {
10230                cond: Condition::EQ,
10231                offset: -0x100,
10232            })
10233            .unwrap();
10234        assert_eq!(code.len(), 4);
10235        let hw1 = u16::from_le_bytes([code[0], code[1]]);
10236        let hw2 = u16::from_le_bytes([code[2], code[3]]);
10237        assert_eq!(hw1, 0xF43F, "T3 hw1: S=1, cond=EQ, imm6=0x3F");
10238        assert_eq!(hw2, 0xAF00, "T3 hw2: J1=1 J2=1 imm11=0x700");
10239
10240        // Narrow encoding stays byte-identical (in-range offsets untouched).
10241        let code = encoder
10242            .encode(&ArmOp::BCondOffset {
10243                cond: Condition::EQ,
10244                offset: 5,
10245            })
10246            .unwrap();
10247        assert_eq!(code, vec![0x05, 0xD0], "narrow B<cond> unchanged");
10248
10249        // Out of the signed 20-bit T3 range: loud Err, never a truncated jump.
10250        assert!(
10251            encoder
10252                .encode(&ArmOp::BCondOffset {
10253                    cond: Condition::NE,
10254                    offset: 1 << 19,
10255                })
10256                .is_err(),
10257            "out-of-range T3 offset must be a loud decline"
10258        );
10259    }
10260
10261    #[test]
10262    fn test_encode_sequence() {
10263        let encoder = ArmEncoder::new_arm32();
10264        let ops = vec![
10265            ArmOp::Mov {
10266                rd: Reg::R0,
10267                op2: Operand2::Imm(42),
10268            },
10269            ArmOp::Mov {
10270                rd: Reg::R1,
10271                op2: Operand2::Imm(10),
10272            },
10273            ArmOp::Add {
10274                rd: Reg::R2,
10275                rn: Reg::R0,
10276                op2: Operand2::Reg(Reg::R1),
10277            },
10278        ];
10279
10280        let code = encoder.encode_sequence(&ops).unwrap();
10281        assert_eq!(code.len(), 12); // 3 instructions * 4 bytes
10282    }
10283
10284    #[test]
10285    fn test_reg_to_bits() {
10286        assert_eq!(reg_to_bits(&Reg::R0), 0);
10287        assert_eq!(reg_to_bits(&Reg::R7), 7);
10288        assert_eq!(reg_to_bits(&Reg::SP), 13);
10289        assert_eq!(reg_to_bits(&Reg::LR), 14);
10290        assert_eq!(reg_to_bits(&Reg::PC), 15);
10291    }
10292
10293    #[test]
10294    fn test_encode_bitwise_operations() {
10295        let encoder = ArmEncoder::new_arm32();
10296
10297        let and_op = ArmOp::And {
10298            rd: Reg::R0,
10299            rn: Reg::R1,
10300            op2: Operand2::Reg(Reg::R2),
10301        };
10302        let and_code = encoder.encode(&and_op).unwrap();
10303        assert_eq!(and_code.len(), 4);
10304
10305        let orr_op = ArmOp::Orr {
10306            rd: Reg::R0,
10307            rn: Reg::R1,
10308            op2: Operand2::Reg(Reg::R2),
10309        };
10310        let orr_code = encoder.encode(&orr_op).unwrap();
10311        assert_eq!(orr_code.len(), 4);
10312
10313        let eor_op = ArmOp::Eor {
10314            rd: Reg::R0,
10315            rn: Reg::R1,
10316            op2: Operand2::Reg(Reg::R2),
10317        };
10318        let eor_code = encoder.encode(&eor_op).unwrap();
10319        assert_eq!(eor_code.len(), 4);
10320    }
10321
10322    // === Thumb-2 32-bit encoding tests ===
10323
10324    #[test]
10325    fn test_encode_sdiv_thumb2() {
10326        let encoder = ArmEncoder::new_thumb2();
10327        let op = ArmOp::Sdiv {
10328            rd: Reg::R0,
10329            rn: Reg::R1,
10330            rm: Reg::R2,
10331        };
10332
10333        let code = encoder.encode(&op).unwrap();
10334        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10335
10336        // SDIV R0, R1, R2: 0xFB91 0xF0F2
10337        // First halfword: 0xFB90 | Rn(1) = 0xFB91
10338        // Second halfword: 0xF0F0 | Rd(0)<<8 | Rm(2) = 0xF0F2
10339        // Little-endian: [0x91, 0xFB, 0xF2, 0xF0]
10340        assert_eq!(code[0], 0x91);
10341        assert_eq!(code[1], 0xFB);
10342        assert_eq!(code[2], 0xF2);
10343        assert_eq!(code[3], 0xF0);
10344    }
10345
10346    #[test]
10347    fn test_encode_udiv_thumb2() {
10348        let encoder = ArmEncoder::new_thumb2();
10349        let op = ArmOp::Udiv {
10350            rd: Reg::R0,
10351            rn: Reg::R1,
10352            rm: Reg::R2,
10353        };
10354
10355        let code = encoder.encode(&op).unwrap();
10356        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10357
10358        // UDIV R0, R1, R2: 0xFBB1 0xF0F2
10359        // Little-endian: [0xB1, 0xFB, 0xF2, 0xF0]
10360        assert_eq!(code[0], 0xB1);
10361        assert_eq!(code[1], 0xFB);
10362        assert_eq!(code[2], 0xF2);
10363        assert_eq!(code[3], 0xF0);
10364    }
10365
10366    #[test]
10367    fn test_encode_mul_thumb2() {
10368        let encoder = ArmEncoder::new_thumb2();
10369        let op = ArmOp::Mul {
10370            rd: Reg::R0,
10371            rn: Reg::R1,
10372            rm: Reg::R2,
10373        };
10374
10375        let code = encoder.encode(&op).unwrap();
10376        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10377    }
10378
10379    #[test]
10380    fn test_encode_and_thumb2() {
10381        let encoder = ArmEncoder::new_thumb2();
10382        let op = ArmOp::And {
10383            rd: Reg::R0,
10384            rn: Reg::R1,
10385            op2: Operand2::Reg(Reg::R2),
10386        };
10387
10388        let code = encoder.encode(&op).unwrap();
10389        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10390    }
10391
10392    #[test]
10393    fn test_encode_lsl_thumb2_low_regs() {
10394        let encoder = ArmEncoder::new_thumb2();
10395        let op = ArmOp::Lsl {
10396            rd: Reg::R0,
10397            rn: Reg::R1,
10398            shift: 5,
10399        };
10400
10401        let code = encoder.encode(&op).unwrap();
10402        assert_eq!(code.len(), 2); // 16-bit for low registers
10403    }
10404
10405    #[test]
10406    fn test_encode_clz_thumb2() {
10407        let encoder = ArmEncoder::new_thumb2();
10408        let op = ArmOp::Clz {
10409            rd: Reg::R0,
10410            rm: Reg::R1,
10411        };
10412
10413        let code = encoder.encode(&op).unwrap();
10414        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10415    }
10416
10417    #[test]
10418    fn test_encode_bx_thumb2() {
10419        let encoder = ArmEncoder::new_thumb2();
10420        let op = ArmOp::Bx { rm: Reg::LR };
10421
10422        let code = encoder.encode(&op).unwrap();
10423        assert_eq!(code.len(), 2); // 16-bit instruction
10424
10425        // BX LR: 0x4770
10426        assert_eq!(code, vec![0x70, 0x47]);
10427    }
10428
10429    // ========================================================================
10430    // f32 pseudo-op encoding tests
10431    // ========================================================================
10432
10433    #[test]
10434    fn test_encode_f32_abs_arm32() {
10435        let encoder = ArmEncoder::new_arm32();
10436        let op = ArmOp::F32Abs {
10437            sd: VfpReg::S0,
10438            sm: VfpReg::S2,
10439        };
10440        let code = encoder.encode(&op).unwrap();
10441        assert_eq!(code.len(), 4); // Single VFP instruction
10442    }
10443
10444    #[test]
10445    fn test_encode_f32_neg_arm32() {
10446        let encoder = ArmEncoder::new_arm32();
10447        let op = ArmOp::F32Neg {
10448            sd: VfpReg::S0,
10449            sm: VfpReg::S2,
10450        };
10451        let code = encoder.encode(&op).unwrap();
10452        assert_eq!(code.len(), 4);
10453    }
10454
10455    #[test]
10456    fn test_encode_f32_sqrt_arm32() {
10457        let encoder = ArmEncoder::new_arm32();
10458        let op = ArmOp::F32Sqrt {
10459            sd: VfpReg::S0,
10460            sm: VfpReg::S2,
10461        };
10462        let code = encoder.encode(&op).unwrap();
10463        assert_eq!(code.len(), 4);
10464    }
10465
10466    #[test]
10467    fn test_encode_f32_ceil_arm32() {
10468        let encoder = ArmEncoder::new_arm32();
10469        let op = ArmOp::F32Ceil {
10470            sd: VfpReg::S0,
10471            sm: VfpReg::S2,
10472        };
10473        let code = encoder.encode(&op).unwrap();
10474        // VMRS + BIC + ORR + VMSR + VCVT.S32.F32 + VMRS + BIC + VMSR + VCVT.F32.S32
10475        assert_eq!(code.len(), 36);
10476    }
10477
10478    #[test]
10479    fn test_encode_f32_floor_thumb2() {
10480        let encoder = ArmEncoder::new_thumb2();
10481        let op = ArmOp::F32Floor {
10482            sd: VfpReg::S0,
10483            sm: VfpReg::S2,
10484        };
10485        let code = encoder.encode(&op).unwrap();
10486        // VMRS + BIC.W + ORR.W + VMSR + VCVT + VMRS + BIC.W + VMSR + VCVT.F32.S32
10487        assert_eq!(code.len(), 36);
10488    }
10489
10490    #[test]
10491    fn test_encode_f32_min_arm32() {
10492        let encoder = ArmEncoder::new_arm32();
10493        let op = ArmOp::F32Min {
10494            sd: VfpReg::S0,
10495            sn: VfpReg::S2,
10496            sm: VfpReg::S4,
10497        };
10498        let code = encoder.encode(&op).unwrap();
10499        assert_eq!(code.len(), 16); // VMOV + VCMP + VMRS + conditional VMOV
10500    }
10501
10502    #[test]
10503    fn test_encode_f32_max_thumb2() {
10504        let encoder = ArmEncoder::new_thumb2();
10505        let op = ArmOp::F32Max {
10506            sd: VfpReg::S0,
10507            sn: VfpReg::S2,
10508            sm: VfpReg::S4,
10509        };
10510        let code = encoder.encode(&op).unwrap();
10511        // VMOV(4) + VCMP(4) + VMRS(4) + IT(2) + VMOV(4) = 18
10512        assert_eq!(code.len(), 18);
10513    }
10514
10515    #[test]
10516    fn test_encode_f32_copysign_arm32() {
10517        let encoder = ArmEncoder::new_arm32();
10518        let op = ArmOp::F32Copysign {
10519            sd: VfpReg::S0,
10520            sn: VfpReg::S2,
10521            sm: VfpReg::S4,
10522        };
10523        let code = encoder.encode(&op).unwrap();
10524        // VMOV + VMOV + AND + BIC + ORR + VMOV = 6 * 4 = 24
10525        assert_eq!(code.len(), 24);
10526    }
10527
10528    // ========================================================================
10529    // f64 encoding tests
10530    // ========================================================================
10531
10532    #[test]
10533    fn test_encode_f64_add_arm32() {
10534        let encoder = ArmEncoder::new_arm32();
10535        let op = ArmOp::F64Add {
10536            dd: VfpReg::D0,
10537            dn: VfpReg::D1,
10538            dm: VfpReg::D2,
10539        };
10540        let code = encoder.encode(&op).unwrap();
10541        assert_eq!(code.len(), 4);
10542        // VADD.F64 D0, D1, D2: check coprocessor is cp11 (0xB)
10543        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10544        assert_eq!((instr >> 8) & 0xF, 0xB); // cp11
10545    }
10546
10547    #[test]
10548    fn test_encode_f64_sub_thumb2() {
10549        let encoder = ArmEncoder::new_thumb2();
10550        let op = ArmOp::F64Sub {
10551            dd: VfpReg::D0,
10552            dn: VfpReg::D1,
10553            dm: VfpReg::D2,
10554        };
10555        let code = encoder.encode(&op).unwrap();
10556        assert_eq!(code.len(), 4); // 32-bit VFP as two Thumb halfwords
10557    }
10558
10559    #[test]
10560    fn test_encode_f64_mul_arm32() {
10561        let encoder = ArmEncoder::new_arm32();
10562        let op = ArmOp::F64Mul {
10563            dd: VfpReg::D0,
10564            dn: VfpReg::D1,
10565            dm: VfpReg::D2,
10566        };
10567        let code = encoder.encode(&op).unwrap();
10568        assert_eq!(code.len(), 4);
10569    }
10570
10571    #[test]
10572    fn test_encode_f64_div_arm32() {
10573        let encoder = ArmEncoder::new_arm32();
10574        let op = ArmOp::F64Div {
10575            dd: VfpReg::D0,
10576            dn: VfpReg::D1,
10577            dm: VfpReg::D2,
10578        };
10579        let code = encoder.encode(&op).unwrap();
10580        assert_eq!(code.len(), 4);
10581    }
10582
10583    #[test]
10584    fn test_encode_f64_abs_arm32() {
10585        let encoder = ArmEncoder::new_arm32();
10586        let op = ArmOp::F64Abs {
10587            dd: VfpReg::D0,
10588            dm: VfpReg::D2,
10589        };
10590        let code = encoder.encode(&op).unwrap();
10591        assert_eq!(code.len(), 4);
10592    }
10593
10594    #[test]
10595    fn test_encode_f64_neg_arm32() {
10596        let encoder = ArmEncoder::new_arm32();
10597        let op = ArmOp::F64Neg {
10598            dd: VfpReg::D0,
10599            dm: VfpReg::D2,
10600        };
10601        let code = encoder.encode(&op).unwrap();
10602        assert_eq!(code.len(), 4);
10603    }
10604
10605    #[test]
10606    fn test_encode_f64_sqrt_arm32() {
10607        let encoder = ArmEncoder::new_arm32();
10608        let op = ArmOp::F64Sqrt {
10609            dd: VfpReg::D0,
10610            dm: VfpReg::D2,
10611        };
10612        let code = encoder.encode(&op).unwrap();
10613        assert_eq!(code.len(), 4);
10614    }
10615
10616    #[test]
10617    fn test_encode_f64_load_arm32() {
10618        let encoder = ArmEncoder::new_arm32();
10619        let op = ArmOp::F64Load {
10620            dd: VfpReg::D0,
10621            addr: MemAddr::imm(Reg::R0, 8),
10622        };
10623        let code = encoder.encode(&op).unwrap();
10624        assert_eq!(code.len(), 4);
10625        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10626        assert_eq!((instr >> 8) & 0xF, 0xB); // cp11 for F64
10627        assert_eq!(instr & 0xFF, 2); // offset 8 / 4 = 2
10628    }
10629
10630    #[test]
10631    fn test_encode_f64_store_thumb2() {
10632        let encoder = ArmEncoder::new_thumb2();
10633        let op = ArmOp::F64Store {
10634            dd: VfpReg::D0,
10635            addr: MemAddr::imm(Reg::SP, 0),
10636        };
10637        let code = encoder.encode(&op).unwrap();
10638        assert_eq!(code.len(), 4);
10639    }
10640
10641    #[test]
10642    fn test_encode_f64_compare_arm32() {
10643        let encoder = ArmEncoder::new_arm32();
10644        let op = ArmOp::F64Eq {
10645            rd: Reg::R0,
10646            dn: VfpReg::D0,
10647            dm: VfpReg::D1,
10648        };
10649        let code = encoder.encode(&op).unwrap();
10650        assert_eq!(code.len(), 16); // VCMP + VMRS + MOV #0 + MOVcond #1
10651    }
10652
10653    #[test]
10654    fn test_encode_f64_compare_thumb2() {
10655        let encoder = ArmEncoder::new_thumb2();
10656        let op = ArmOp::F64Lt {
10657            rd: Reg::R0,
10658            dn: VfpReg::D0,
10659            dm: VfpReg::D1,
10660        };
10661        let code = encoder.encode(&op).unwrap();
10662        // VCMP(4) + VMRS(4) + MOVS(2) + IT(2) + MOV(2) = 14
10663        assert_eq!(code.len(), 14);
10664    }
10665
10666    #[test]
10667    fn test_encode_f64_const_arm32() {
10668        let encoder = ArmEncoder::new_arm32();
10669        let op = ArmOp::F64Const {
10670            dd: VfpReg::D0,
10671            value: 3.125,
10672        };
10673        let code = encoder.encode(&op).unwrap();
10674        // MOVW(4) + MOVT(4) + MOVW(4) + MOVT(4) + VMOV(4) = 20
10675        assert_eq!(code.len(), 20);
10676    }
10677
10678    #[test]
10679    fn test_encode_f64_const_thumb2() {
10680        let encoder = ArmEncoder::new_thumb2();
10681        let op = ArmOp::F64Const {
10682            dd: VfpReg::D0,
10683            value: 2.5,
10684        };
10685        let code = encoder.encode(&op).unwrap();
10686        // MOVW(4) + MOVT(4) + MOVW(4) + MOVT(4) + VMOV(4) = 20
10687        assert_eq!(code.len(), 20);
10688    }
10689
10690    #[test]
10691    fn test_encode_f64_convert_i32s_arm32() {
10692        let encoder = ArmEncoder::new_arm32();
10693        let op = ArmOp::F64ConvertI32S {
10694            dd: VfpReg::D0,
10695            rm: Reg::R0,
10696        };
10697        let code = encoder.encode(&op).unwrap();
10698        // VMOV(4) + VCVT(4) = 8
10699        assert_eq!(code.len(), 8);
10700    }
10701
10702    #[test]
10703    fn test_encode_f64_promote_f32_arm32() {
10704        let encoder = ArmEncoder::new_arm32();
10705        let op = ArmOp::F64PromoteF32 {
10706            dd: VfpReg::D0,
10707            sm: VfpReg::S0,
10708        };
10709        let code = encoder.encode(&op).unwrap();
10710        assert_eq!(code.len(), 4); // Single VCVT.F64.F32 instruction
10711    }
10712
10713    #[test]
10714    fn test_encode_f64_promote_f32_thumb2() {
10715        let encoder = ArmEncoder::new_thumb2();
10716        let op = ArmOp::F64PromoteF32 {
10717            dd: VfpReg::D0,
10718            sm: VfpReg::S0,
10719        };
10720        let code = encoder.encode(&op).unwrap();
10721        assert_eq!(code.len(), 4);
10722    }
10723
10724    #[test]
10725    fn test_encode_i32_trunc_f64s_arm32() {
10726        let encoder = ArmEncoder::new_arm32();
10727        let op = ArmOp::I32TruncF64S {
10728            rd: Reg::R0,
10729            dm: VfpReg::D0,
10730        };
10731        let code = encoder.encode(&op).unwrap();
10732        // VCVT(4) + VMOV(4) = 8
10733        assert_eq!(code.len(), 8);
10734    }
10735
10736    #[test]
10737    fn test_encode_f64_reinterpret_i64_arm32() {
10738        let encoder = ArmEncoder::new_arm32();
10739        let op = ArmOp::F64ReinterpretI64 {
10740            dd: VfpReg::D0,
10741            rmlo: Reg::R0,
10742            rmhi: Reg::R1,
10743        };
10744        let code = encoder.encode(&op).unwrap();
10745        assert_eq!(code.len(), 4); // Single VMOV instruction
10746    }
10747
10748    #[test]
10749    fn test_encode_i64_reinterpret_f64_thumb2() {
10750        let encoder = ArmEncoder::new_thumb2();
10751        let op = ArmOp::I64ReinterpretF64 {
10752            rdlo: Reg::R0,
10753            rdhi: Reg::R1,
10754            dm: VfpReg::D0,
10755        };
10756        let code = encoder.encode(&op).unwrap();
10757        assert_eq!(code.len(), 4);
10758    }
10759
10760    #[test]
10761    fn test_encode_f64_trunc_thumb2() {
10762        let encoder = ArmEncoder::new_thumb2();
10763        let op = ArmOp::F64Trunc {
10764            dd: VfpReg::D0,
10765            dm: VfpReg::D1,
10766        };
10767        let code = encoder.encode(&op).unwrap();
10768        // GI-FPU-002 phase 3 (#369): a single VRINTZ.F64 (clang-verified
10769        // vrintz.f64 d0,d1 base) — no more FPSCR dance / S0 clobber.
10770        assert_eq!(code.len(), 4);
10771        assert_eq!(code, vec![0xb6, 0xee, 0xc1, 0x0b]);
10772    }
10773
10774    /// GI-FPU-002 phase 3 (#369): the rewritten f64 tail sequences, byte-exact
10775    /// against clang (`-target thumbv7em-none-eabi -mfpu=fpv5-d16`). Each
10776    /// clobbers ONLY its destination (+R12/flags where noted) — the previous
10777    /// pseudo-ops staged through live S0/R0-R2 (the #615 class) and the
10778    /// min/max/rounding semantics were wrong (ordered IT select returned the
10779    /// wrong operand on NaN/±0; rounding round-tripped through a 32-bit int).
10780    #[test]
10781    fn test_369_f64_tail_thumb2_encodings_match_clang() {
10782        let enc = ArmEncoder::new_thumb2();
10783        // vrintn/vrintp/vrintm.f64 d1, d2 (FE space, never IT'd).
10784        for (op, want) in [
10785            (
10786                ArmOp::F64Nearest {
10787                    dd: VfpReg::D1,
10788                    dm: VfpReg::D2,
10789                },
10790                vec![0xb9, 0xfe, 0x42, 0x1b],
10791            ),
10792            (
10793                ArmOp::F64Ceil {
10794                    dd: VfpReg::D1,
10795                    dm: VfpReg::D2,
10796                },
10797                vec![0xba, 0xfe, 0x42, 0x1b],
10798            ),
10799            (
10800                ArmOp::F64Floor {
10801                    dd: VfpReg::D1,
10802                    dm: VfpReg::D2,
10803                },
10804                vec![0xbb, 0xfe, 0x42, 0x1b],
10805            ),
10806        ] {
10807            assert_eq!(enc.encode(&op).unwrap(), want, "{op:?}");
10808        }
10809        // vcmp.f64 d1,d2 ; vmrs ; vminnm.f64 d0,d1,d2 ; it vs ; vaddvs.f64
10810        let min = enc
10811            .encode(&ArmOp::F64Min {
10812                dd: VfpReg::D0,
10813                dn: VfpReg::D1,
10814                dm: VfpReg::D2,
10815            })
10816            .unwrap();
10817        assert_eq!(
10818            min,
10819            vec![
10820                0xb4, 0xee, 0x42, 0x1b, // vcmp.f64 d1, d2
10821                0xf1, 0xee, 0x10, 0xfa, // vmrs APSR_nzcv, fpscr
10822                0x81, 0xfe, 0x42, 0x0b, // vminnm.f64 d0, d1, d2
10823                0x68, 0xbf, // it vs
10824                0x31, 0xee, 0x02, 0x0b, // vaddvs.f64 d0, d1, d2
10825            ]
10826        );
10827        // vmaxnm variant flips only bit6 of the VMINNM word.
10828        let max = enc
10829            .encode(&ArmOp::F64Max {
10830                dd: VfpReg::D0,
10831                dn: VfpReg::D1,
10832                dm: VfpReg::D2,
10833            })
10834            .unwrap();
10835        assert_eq!(&max[8..12], &[0x81, 0xfe, 0x02, 0x0b]);
10836        // Destination aliasing a source must ERR (the NaN fix-up would read
10837        // a clobbered operand), never encode.
10838        assert!(
10839            enc.encode(&ArmOp::F64Min {
10840                dd: VfpReg::D1,
10841                dn: VfpReg::D1,
10842                dm: VfpReg::D2,
10843            })
10844            .is_err()
10845        );
10846        // copysign d0,(mag)d1,(sign)d2:
10847        // vmov r12,s5 ; cmp.w r12,#0 ; vabs.f64 d0,d1 ; it mi ; vnegmi.f64 d0,d0
10848        let cs = enc
10849            .encode(&ArmOp::F64Copysign {
10850                dd: VfpReg::D0,
10851                dn: VfpReg::D1,
10852                dm: VfpReg::D2,
10853            })
10854            .unwrap();
10855        assert_eq!(
10856            cs,
10857            vec![
10858                0x12, 0xee, 0x90, 0xca, // vmov r12, s5
10859                0xbc, 0xf1, 0x00, 0x0f, // cmp.w r12, #0
10860                0xb0, 0xee, 0xc1, 0x0b, // vabs.f64 d0, d1
10861                0x48, 0xbf, // it mi
10862                0xb1, 0xee, 0x40, 0x0b, // vnegmi.f64 d0, d0
10863            ]
10864        );
10865        // f32 copysign s0,(mag)s1,(sign)s2 — the R0-clobber-free rewrite:
10866        // vmov r12,s2 ; cmp.w r12,#0 ; vabs.f32 s0,s1 ; it mi ; vnegmi.f32
10867        let cs32 = enc
10868            .encode(&ArmOp::F32Copysign {
10869                sd: VfpReg::S0,
10870                sn: VfpReg::S1,
10871                sm: VfpReg::S2,
10872            })
10873            .unwrap();
10874        assert_eq!(
10875            cs32,
10876            vec![
10877                0x11, 0xee, 0x10, 0xca, // vmov r12, s2
10878                0xbc, 0xf1, 0x00, 0x0f, // cmp.w r12, #0
10879                0xb0, 0xee, 0xe0, 0x0a, // vabs.f32 s0, s1
10880                0x48, 0xbf, // it mi
10881                0xb1, 0xee, 0x40, 0x0a, // vnegmi.f32 s0, s0
10882            ]
10883        );
10884        // i32 -> f64 stages through the DESTINATION's S-alias (never S0) and
10885        // uses the CORRECT signed/unsigned VCVT bases (previously swapped):
10886        // vmov s0,r3 ; vcvt.f64.s32 d0,s0
10887        let conv_s = enc
10888            .encode(&ArmOp::F64ConvertI32S {
10889                dd: VfpReg::D0,
10890                rm: Reg::R3,
10891            })
10892            .unwrap();
10893        assert_eq!(
10894            conv_s,
10895            vec![
10896                0x00, 0xee, 0x10, 0x3a, // vmov s0, r3
10897                0xb8, 0xee, 0xc0, 0x0b, // vcvt.f64.s32 d0, s0
10898            ]
10899        );
10900        let conv_u = enc
10901            .encode(&ArmOp::F64ConvertI32U {
10902                dd: VfpReg::D0,
10903                rm: Reg::R3,
10904            })
10905            .unwrap();
10906        assert_eq!(&conv_u[4..8], &[0xb8, 0xee, 0x40, 0x0b]); // vcvt.f64.u32
10907        // f64 -> i32 stages through the SOURCE's S-alias (never S0):
10908        // vcvt.s32.f64 s2,d1 ; vmov r3,s2
10909        let trunc_s = enc
10910            .encode(&ArmOp::I32TruncF64S {
10911                rd: Reg::R3,
10912                dm: VfpReg::D1,
10913            })
10914            .unwrap();
10915        assert_eq!(
10916            trunc_s,
10917            vec![
10918                0xbd, 0xee, 0xc1, 0x1b, // vcvt.s32.f64 s2, d1
10919                0x11, 0xee, 0x10, 0x3a, // vmov r3, s2
10920            ]
10921        );
10922        let trunc_u = enc
10923            .encode(&ArmOp::I32TruncF64U {
10924                rd: Reg::R3,
10925                dm: VfpReg::D1,
10926            })
10927            .unwrap();
10928        assert_eq!(&trunc_u[0..4], &[0xbc, 0xee, 0xc1, 0x1b]); // vcvt.u32.f64
10929        // f32.demote_f64: vcvt.f32.f64 s1, d2
10930        let demote = enc
10931            .encode(&ArmOp::F32DemoteF64 {
10932                sd: VfpReg::S1,
10933                dm: VfpReg::D2,
10934            })
10935            .unwrap();
10936        assert_eq!(demote, vec![0xf7, 0xee, 0xc2, 0x0b]);
10937    }
10938
10939    #[test]
10940    fn test_encode_f64_min_arm32() {
10941        let encoder = ArmEncoder::new_arm32();
10942        let op = ArmOp::F64Min {
10943            dd: VfpReg::D0,
10944            dn: VfpReg::D1,
10945            dm: VfpReg::D2,
10946        };
10947        let code = encoder.encode(&op).unwrap();
10948        // VMOV + VCMP + VMRS + conditional VMOV = 16
10949        assert_eq!(code.len(), 16);
10950    }
10951
10952    #[test]
10953    fn test_f64_cp11_encoding() {
10954        // Verify that F64 instructions use coprocessor 11 (0xB), not 10 (0xA)
10955        let encoder = ArmEncoder::new_arm32();
10956
10957        // F64Add
10958        let code = encoder
10959            .encode(&ArmOp::F64Add {
10960                dd: VfpReg::D0,
10961                dn: VfpReg::D0,
10962                dm: VfpReg::D0,
10963            })
10964            .unwrap();
10965        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10966        assert_eq!((instr >> 8) & 0xF, 0xB, "F64 should use cp11");
10967
10968        // F32Add for comparison
10969        let code = encoder
10970            .encode(&ArmOp::F32Add {
10971                sd: VfpReg::S0,
10972                sn: VfpReg::S0,
10973                sm: VfpReg::S0,
10974            })
10975            .unwrap();
10976        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10977        assert_eq!((instr >> 8) & 0xF, 0xA, "F32 should use cp10");
10978    }
10979
10980    #[test]
10981    fn test_dreg_encoding_higher_registers() {
10982        let encoder = ArmEncoder::new_arm32();
10983
10984        // Test with D15 (highest register)
10985        let op = ArmOp::F64Add {
10986            dd: VfpReg::D15,
10987            dn: VfpReg::D14,
10988            dm: VfpReg::D13,
10989        };
10990        let code = encoder.encode(&op).unwrap();
10991        assert_eq!(code.len(), 4);
10992
10993        // Verify the register encoding worked (instruction is valid)
10994        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10995        assert_eq!((instr >> 8) & 0xF, 0xB); // cp11
10996    }
10997
10998    // ========================================================================
10999    // Control flow encoding tests
11000    // ========================================================================
11001
11002    #[test]
11003    fn test_encode_label_emits_no_bytes() {
11004        let encoder = ArmEncoder::new_thumb2();
11005        let op = ArmOp::Label {
11006            name: ".Lblock_end_0".to_string(),
11007        };
11008        let code = encoder.encode(&op).unwrap();
11009        assert!(code.is_empty(), "Label should emit zero bytes");
11010
11011        let encoder32 = ArmEncoder::new_arm32();
11012        let code32 = encoder32.encode(&op).unwrap();
11013        assert!(
11014            code32.is_empty(),
11015            "Label should emit zero bytes in ARM32 too"
11016        );
11017    }
11018
11019    #[test]
11020    fn test_encode_bcc_eq_thumb2() {
11021        use synth_synthesis::Condition;
11022        let encoder = ArmEncoder::new_thumb2();
11023        let op = ArmOp::Bcc {
11024            cond: Condition::EQ,
11025            label: "target".to_string(),
11026        };
11027        let code = encoder.encode(&op).unwrap();
11028        assert_eq!(code.len(), 2); // 16-bit conditional branch
11029
11030        // BEQ with offset 0: 0xD000 in little-endian
11031        assert_eq!(code, vec![0x00, 0xD0]);
11032    }
11033
11034    #[test]
11035    fn test_encode_bcc_ne_thumb2() {
11036        use synth_synthesis::Condition;
11037        let encoder = ArmEncoder::new_thumb2();
11038        let op = ArmOp::Bcc {
11039            cond: Condition::NE,
11040            label: "target".to_string(),
11041        };
11042        let code = encoder.encode(&op).unwrap();
11043        assert_eq!(code.len(), 2);
11044
11045        // BNE with offset 0: 0xD100 in little-endian
11046        assert_eq!(code, vec![0x00, 0xD1]);
11047    }
11048
11049    #[test]
11050    fn test_encode_bcc_arm32() {
11051        use synth_synthesis::Condition;
11052        let encoder = ArmEncoder::new_arm32();
11053        let op = ArmOp::Bcc {
11054            cond: Condition::EQ,
11055            label: "target".to_string(),
11056        };
11057        let code = encoder.encode(&op).unwrap();
11058        assert_eq!(code.len(), 4); // 32-bit ARM instruction
11059
11060        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
11061        // BEQ: cond=0x0, opcode=0xA, offset=0
11062        assert_eq!(instr & 0xF0000000, 0x00000000); // EQ condition
11063        assert_eq!(instr & 0x0F000000, 0x0A000000); // Branch opcode
11064    }
11065
11066    #[test]
11067    fn test_encode_udf_thumb2() {
11068        let encoder = ArmEncoder::new_thumb2();
11069        let op = ArmOp::Udf { imm: 0 };
11070        let code = encoder.encode(&op).unwrap();
11071        assert_eq!(code.len(), 2); // 16-bit
11072
11073        // UDF #0: 0xDE00 in little-endian
11074        assert_eq!(code, vec![0x00, 0xDE]);
11075    }
11076
11077    /// #610: the i64 rot/div/rem expansions must land the result in the
11078    /// selector-assigned rd pair and leave R0-R3 preserved (restored from the
11079    /// fixed-ABI wrapper's save area) — pre-#610 the rot expansion's own
11080    /// `POP {R4}` restored stale scratch OVER the result (rd_lo == R4) and
11081    /// the div/rem expansions ignored their register fields outright.
11082    #[test]
11083    fn test_610_i64_rot_expansion_ends_with_rd_movs_and_restore() {
11084        let encoder = ArmEncoder::new_thumb2();
11085        for op in [
11086            ArmOp::I64Rotl {
11087                rdlo: Reg::R4,
11088                rdhi: Reg::R5,
11089                rnlo: Reg::R0,
11090                rnhi: Reg::R1,
11091                shift: Reg::R2,
11092            },
11093            ArmOp::I64Rotr {
11094                rdlo: Reg::R4,
11095                rdhi: Reg::R5,
11096                rnlo: Reg::R0,
11097                rnhi: Reg::R1,
11098                shift: Reg::R2,
11099            },
11100        ] {
11101            let code = encoder.encode(&op).unwrap();
11102            assert_eq!(code.len(), 102, "register-independent size (estimator pin)");
11103            // Tail: MOV r5, r1 (0x460D); MOV r4, r0 (0x4604); POP {r0..r3}
11104            // (rd pair r4:r5 does not overlap the save area — all 4 restored).
11105            let tail: Vec<u16> = code[code.len() - 12..]
11106                .chunks(2)
11107                .map(|c| u16::from_le_bytes([c[0], c[1]]))
11108                .collect();
11109            assert_eq!(tail, vec![0x460D, 0x4604, 0xBC01, 0xBC02, 0xBC04, 0xBC08]);
11110        }
11111    }
11112
11113    /// #610: div/rem expansions honor rd and carry the divide-by-zero trap
11114    /// guard (`ORRS R12, R2, R3; BNE +0; UDF #0`) after operand marshaling.
11115    #[test]
11116    fn test_610_i64_div_rem_expansion_guard_and_rd() {
11117        let encoder = ArmEncoder::new_thumb2();
11118        let mk = |which: u8| {
11119            let (rdlo, rdhi, rnlo, rnhi, rmlo, rmhi) =
11120                (Reg::R4, Reg::R5, Reg::R0, Reg::R1, Reg::R2, Reg::R3);
11121            match which {
11122                0 => ArmOp::I64DivU {
11123                    rdlo,
11124                    rdhi,
11125                    rnlo,
11126                    rnhi,
11127                    rmlo,
11128                    rmhi,
11129                    elide_zero_guard: false,
11130                },
11131                1 => ArmOp::I64RemU {
11132                    rdlo,
11133                    rdhi,
11134                    rnlo,
11135                    rnhi,
11136                    rmlo,
11137                    rmhi,
11138                    elide_zero_guard: false,
11139                },
11140                2 => ArmOp::I64DivS {
11141                    rdlo,
11142                    rdhi,
11143                    rnlo,
11144                    rnhi,
11145                    rmlo,
11146                    rmhi,
11147                    elide_zero_guard: false,
11148                    elide_overflow_guard: false,
11149                },
11150                _ => ArmOp::I64RemS {
11151                    rdlo,
11152                    rdhi,
11153                    rnlo,
11154                    rnhi,
11155                    rmlo,
11156                    rmhi,
11157                    elide_zero_guard: false,
11158                },
11159            }
11160        };
11161        for which in 0..4u8 {
11162            let code = encoder.encode(&mk(which)).unwrap();
11163            // Zero-divisor trap guard right after the 26-byte marshal prologue.
11164            let guard: Vec<u16> = code[26..34]
11165                .chunks(2)
11166                .map(|c| u16::from_le_bytes([c[0], c[1]]))
11167                .collect();
11168            assert_eq!(
11169                guard,
11170                vec![0xEA52, 0x0C03, 0xD100, 0xDE00],
11171                "ORRS R12,R2,R3; BNE +0; UDF #0"
11172            );
11173            // Tail: result into rd pair (r5:r4), then restore all of R0-R3.
11174            let tail: Vec<u16> = code[code.len() - 12..]
11175                .chunks(2)
11176                .map(|c| u16::from_le_bytes([c[0], c[1]]))
11177                .collect();
11178            assert_eq!(tail, vec![0x460D, 0x4604, 0xBC01, 0xBC02, 0xBC04, 0xBC08]);
11179        }
11180    }
11181
11182    /// #610: when rd overlaps R0-R3 the restore must SKIP the result
11183    /// registers (drop the saved caller word) instead of popping over them.
11184    #[test]
11185    fn test_610_i64_divu_rd_in_r0_r1_skips_restore() {
11186        let encoder = ArmEncoder::new_thumb2();
11187        let code = encoder
11188            .encode(&ArmOp::I64DivU {
11189                rdlo: Reg::R0,
11190                rdhi: Reg::R1,
11191                rnlo: Reg::R0,
11192                rnhi: Reg::R1,
11193                rmlo: Reg::R2,
11194                rmhi: Reg::R3,
11195                elide_zero_guard: false,
11196            })
11197            .unwrap();
11198        let tail: Vec<u16> = code[code.len() - 12..]
11199            .chunks(2)
11200            .map(|c| u16::from_le_bytes([c[0], c[1]]))
11201            .collect();
11202        // MOV r1,r1 / MOV r0,r0 (no-ops, size-stable), ADD SP,#4 twice
11203        // (discard saved r0/r1 — the result lives there), POP {r2}, POP {r3}.
11204        assert_eq!(tail, vec![0x4609, 0x4600, 0xB001, 0xB001, 0xBC04, 0xBC08]);
11205    }
11206
11207    /// #610: a fully swapped rd pair (rd_lo=R1, rd_hi=R0) cannot be
11208    /// materialized by two MOVs in either order — must be a loud Err, never
11209    /// silent corruption. (Selector pairs are consecutive, so unreachable.)
11210    #[test]
11211    fn test_610_i64_swapped_rd_pair_rejected() {
11212        let encoder = ArmEncoder::new_thumb2();
11213        let result = encoder.encode(&ArmOp::I64RemU {
11214            rdlo: Reg::R1,
11215            rdhi: Reg::R0,
11216            rnlo: Reg::R2,
11217            rnhi: Reg::R3,
11218            rmlo: Reg::R4,
11219            rmhi: Reg::R5,
11220            elide_zero_guard: false,
11221        });
11222        assert!(result.is_err(), "swapped rd pair must be rejected loudly");
11223    }
11224
11225    /// #632: the I64Popcnt expansion's own scratch restore (`POP {R3,R4,R5}`)
11226    /// must not clobber the result. Pre-fix the total was materialized with
11227    /// `ADDS rd, R4, R5` BEFORE the pop, so any allocator-assigned
11228    /// rd ∈ {R3,R4,R5} received stale stack garbage. Post-fix the count is
11229    /// carried across the restore in R12 (never allocatable, never restored)
11230    /// and moved into rd only after the pop — structurally rd-independent.
11231    #[test]
11232    fn test_632_i64_popcnt_result_survives_scratch_restore() {
11233        let encoder = ArmEncoder::new_thumb2();
11234        // Every allocatable rd, including the restore set {R3,R4,R5} and R8.
11235        for rd in [
11236            Reg::R0,
11237            Reg::R2,
11238            Reg::R3,
11239            Reg::R4,
11240            Reg::R5,
11241            Reg::R6,
11242            Reg::R8,
11243        ] {
11244            let code = encoder
11245                .encode(&ArmOp::I64Popcnt {
11246                    rd,
11247                    rnlo: Reg::R6,
11248                    rnhi: Reg::R7,
11249                })
11250                .unwrap();
11251            assert_eq!(code.len(), 180, "register-independent size (estimator pin)");
11252            let hw: Vec<u16> = code
11253                .chunks(2)
11254                .map(|c| u16::from_le_bytes([c[0], c[1]]))
11255                .collect();
11256            let pop = hw
11257                .iter()
11258                .position(|&h| h == 0xBC38)
11259                .expect("POP {R3,R4,R5} present");
11260            // Immediately before the POP: ADD.W R12, R4, R5 (the total lives
11261            // in R12, which the POP cannot touch).
11262            assert_eq!(
11263                &hw[pop - 2..pop],
11264                &[0xEB04, 0x0C05],
11265                "total must be carried in R12 across the restore"
11266            );
11267            // Immediately after the POP: MOV rd, R12.
11268            let rd_bits = match rd {
11269                Reg::R8 => 8u16,
11270                Reg::R6 => 6,
11271                Reg::R5 => 5,
11272                Reg::R4 => 4,
11273                Reg::R3 => 3,
11274                Reg::R2 => 2,
11275                _ => 0,
11276            };
11277            let expect_mov = 0x4600 | (((rd_bits >> 3) & 1) << 7) | (12 << 3) | (rd_bits & 7);
11278            assert_eq!(hw[pop + 1], expect_mov, "MOV rd, R12 after the restore");
11279            // No write into rd between the PUSH and the POP (the old
11280            // pre-restore ADDS is gone).
11281            assert!(
11282                !hw[..pop].contains(&(0x1800 | (5 << 6) | (4 << 3) | rd_bits)),
11283                "no ADDS rd, R4, R5 before the restore pop"
11284            );
11285        }
11286    }
11287
11288    /// #632 audit: the entry marshal must be permutation-safe. Pre-fix
11289    /// `MOV R4, rnlo; MOV R5, rnhi` read a clobbered R4 when the operand
11290    /// pair lived at (R3, R4). Post-fix rnlo routes through R12.
11291    #[test]
11292    fn test_632_i64_popcnt_marshal_pair_at_r3_r4() {
11293        let encoder = ArmEncoder::new_thumb2();
11294        let code = encoder
11295            .encode(&ArmOp::I64Popcnt {
11296                rd: Reg::R0,
11297                rnlo: Reg::R3,
11298                rnhi: Reg::R4,
11299            })
11300            .unwrap();
11301        let hw: Vec<u16> = code
11302            .chunks(2)
11303            .map(|c| u16::from_le_bytes([c[0], c[1]]))
11304            .collect();
11305        // PUSH {R3,R4,R5}; MOV R12, R3; MOV R5, R4 (rnhi read BEFORE any
11306        // write to R4); MOV R4, R12.
11307        assert_eq!(hw[0], 0xB438);
11308        assert_eq!(hw[1], 0x4600 | (1 << 7) | (3 << 3) | 4, "MOV R12, rnlo");
11309        assert_eq!(hw[2], 0x4600 | (4 << 3) | 5, "MOV R5, rnhi");
11310        assert_eq!(hw[3], 0x4664, "MOV R4, R12");
11311    }
11312
11313    /// #632: A32 twin — same structural fix on the ARM-mode path
11314    /// (`--target cortex-r5`): total carried in R12 across the restore.
11315    #[test]
11316    fn test_632_a32_i64_popcnt_result_survives_scratch_restore() {
11317        let encoder = ArmEncoder::new_arm32();
11318        for rd in [Reg::R0, Reg::R3, Reg::R4, Reg::R5, Reg::R8] {
11319            let code = encoder
11320                .encode(&ArmOp::I64Popcnt {
11321                    rd,
11322                    rnlo: Reg::R6,
11323                    rnhi: Reg::R7,
11324                })
11325                .unwrap();
11326            let words: Vec<u32> = code
11327                .chunks(4)
11328                .map(|c| u32::from_le_bytes([c[0], c[1], c[2], c[3]]))
11329                .collect();
11330            let pop = words
11331                .iter()
11332                .position(|&w| w == 0xE8BD_0038)
11333                .expect("POP {R3,R4,R5} present");
11334            assert_eq!(words[pop - 1], 0xE084_C005, "ADD R12, R4, R5 before POP");
11335            let rd_bits = match rd {
11336                Reg::R8 => 8u32,
11337                Reg::R5 => 5,
11338                Reg::R4 => 4,
11339                Reg::R3 => 3,
11340                _ => 0,
11341            };
11342            assert_eq!(
11343                words[pop + 1],
11344                0xE1A0_0000 | (rd_bits << 12) | 12,
11345                "MOV rd, R12 after the restore"
11346            );
11347        }
11348    }
11349
11350    /// #633: I64DivS must carry the INT64_MIN/-1 overflow guard (mirroring
11351    /// the i32 path) right after the zero-divisor guard — dividend in R0:R1,
11352    /// divisor in R2:R3 on the #610/#613 fixed-ABI wrapper path.
11353    #[test]
11354    fn test_633_i64_divs_overflow_guard_emitted() {
11355        let encoder = ArmEncoder::new_thumb2();
11356        let code = encoder
11357            .encode(&ArmOp::I64DivS {
11358                rdlo: Reg::R4,
11359                rdhi: Reg::R5,
11360                rnlo: Reg::R0,
11361                rnhi: Reg::R1,
11362                rmlo: Reg::R2,
11363                rmhi: Reg::R3,
11364                elide_zero_guard: false,
11365                elide_overflow_guard: false,
11366            })
11367            .unwrap();
11368        // 26-byte marshal + 8-byte zero-trap, then the 22-byte overflow guard.
11369        let guard: Vec<u16> = code[34..56]
11370            .chunks(2)
11371            .map(|c| u16::from_le_bytes([c[0], c[1]]))
11372            .collect();
11373        assert_eq!(
11374            guard,
11375            vec![
11376                0xEA02, 0x0C03, // AND.W R12, R2, R3
11377                0xF11C, 0x0F01, // CMN.W R12, #1
11378                0xD105, // BNE .no_trap
11379                0x2800, // CMP R0, #0
11380                0xD103, // BNE .no_trap
11381                0xF1B1, 0x4F00, // CMP.W R1, #0x80000000
11382                0xD100, // BNE .no_trap
11383                0xDE00, // UDF #0 — signed-division overflow
11384            ],
11385            "INT64_MIN/-1 overflow guard after the zero-divisor guard"
11386        );
11387    }
11388
11389    /// #633 fix-guard twin: I64RemS must NOT carry the overflow guard —
11390    /// rem_s(INT64_MIN, -1) is defined as 0 and must not trap. Exactly one
11391    /// UDF (the zero-divisor trap) in the whole expansion.
11392    #[test]
11393    fn test_633_i64_rems_has_no_overflow_guard() {
11394        let encoder = ArmEncoder::new_thumb2();
11395        for (is_rem_s, op) in [
11396            (
11397                true,
11398                ArmOp::I64RemS {
11399                    rdlo: Reg::R4,
11400                    rdhi: Reg::R5,
11401                    rnlo: Reg::R0,
11402                    rnhi: Reg::R1,
11403                    rmlo: Reg::R2,
11404                    rmhi: Reg::R3,
11405                    elide_zero_guard: false,
11406                },
11407            ),
11408            (
11409                false,
11410                ArmOp::I64DivS {
11411                    rdlo: Reg::R4,
11412                    rdhi: Reg::R5,
11413                    rnlo: Reg::R0,
11414                    rnhi: Reg::R1,
11415                    rmlo: Reg::R2,
11416                    rmhi: Reg::R3,
11417                    elide_zero_guard: false,
11418                    elide_overflow_guard: false,
11419                },
11420            ),
11421        ] {
11422            let code = encoder.encode(&op).unwrap();
11423            let udfs = code
11424                .chunks(2)
11425                .filter(|c| u16::from_le_bytes([c[0], c[1]]) == 0xDE00)
11426                .count();
11427            let want = if is_rem_s { 1 } else { 2 };
11428            assert_eq!(
11429                udfs, want,
11430                "rem_s: zero-trap only; div_s: zero-trap + overflow trap"
11431            );
11432        }
11433    }
11434
11435    /// #494 phase 2b: `elide_zero_guard` drops EXACTLY the 8-byte fused
11436    /// zero-trap (`ORRS.W R12,R2,R3; BNE; UDF #0`) and nothing else — the
11437    /// rest of the expansion is byte-identical (splice check).
11438    #[test]
11439    fn test_494_i64_zero_guard_elision_is_exact_splice() {
11440        let encoder = ArmEncoder::new_thumb2();
11441        let mk = |elide_zero_guard: bool| {
11442            encoder
11443                .encode(&ArmOp::I64DivU {
11444                    rdlo: Reg::R4,
11445                    rdhi: Reg::R5,
11446                    rnlo: Reg::R0,
11447                    rnhi: Reg::R1,
11448                    rmlo: Reg::R2,
11449                    rmhi: Reg::R3,
11450                    elide_zero_guard,
11451                })
11452                .unwrap()
11453        };
11454        let full = mk(false);
11455        let elided = mk(true);
11456        assert_eq!(full.len(), elided.len() + 8, "zero guard is 8 bytes");
11457        // Marshal prologue (26 B) unchanged, guard (8 B) gone, tail identical.
11458        assert_eq!(&full[..26], &elided[..26]);
11459        assert_eq!(
11460            &full[26..34],
11461            &[0x52, 0xEA, 0x03, 0x0C, 0x00, 0xD1, 0x00, 0xDE],
11462            "the spliced-out bytes are exactly ORRS.W; BNE; UDF #0"
11463        );
11464        assert_eq!(&full[34..], &elided[26..]);
11465    }
11466
11467    /// #494 phase 2b two-guard distinction (the #633/#634 synergy): a
11468    /// divisor-nonzero fact elides ONLY the zero guard — the INT64_MIN/-1
11469    /// OVERFLOW guard is a separate obligation and must survive
11470    /// `elide_zero_guard: true`. Pinned on div_s in all flag states.
11471    #[test]
11472    fn test_494_i64_divs_overflow_guard_retained_when_only_zero_elided() {
11473        let encoder = ArmEncoder::new_thumb2();
11474        let mk = |zero: bool, ovf: bool| {
11475            encoder
11476                .encode(&ArmOp::I64DivS {
11477                    rdlo: Reg::R4,
11478                    rdhi: Reg::R5,
11479                    rnlo: Reg::R0,
11480                    rnhi: Reg::R1,
11481                    rmlo: Reg::R2,
11482                    rmhi: Reg::R3,
11483                    elide_zero_guard: zero,
11484                    elide_overflow_guard: ovf,
11485                })
11486                .unwrap()
11487        };
11488        let udf_count = |code: &[u8]| {
11489            code.chunks(2)
11490                .filter(|c| u16::from_le_bytes([c[0], c[1]]) == 0xDE00)
11491                .count()
11492        };
11493        let full = mk(false, false);
11494        let zero_only = mk(true, false);
11495        let both = mk(true, true);
11496        assert_eq!(udf_count(&full), 2, "baseline: zero trap + overflow trap");
11497        assert_eq!(
11498            udf_count(&zero_only),
11499            1,
11500            "divisor-nonzero elides the zero trap ONLY — the #633 overflow \
11501             guard must be retained"
11502        );
11503        // The retained guard is the 22-byte overflow sequence, now right
11504        // after the 26-byte marshal prologue.
11505        let guard: Vec<u16> = zero_only[26..48]
11506            .chunks(2)
11507            .map(|c| u16::from_le_bytes([c[0], c[1]]))
11508            .collect();
11509        assert_eq!(
11510            guard,
11511            vec![
11512                0xEA02, 0x0C03, 0xF11C, 0x0F01, 0xD105, 0x2800, 0xD103, 0xF1B1, 0x4F00, 0xD100,
11513                0xDE00,
11514            ],
11515            "the surviving guard is the INT64_MIN/-1 overflow trap"
11516        );
11517        assert_eq!(full.len(), zero_only.len() + 8);
11518        assert_eq!(zero_only.len(), both.len() + 22);
11519        assert_eq!(udf_count(&both), 0, "both obligations discharged ⇒ no UDF");
11520    }
11521
11522    /// #494 phase 2b A32 twin: zero-guard elision is an exact 12-byte splice
11523    /// and the A32 overflow guard survives a zero-only elision.
11524    #[test]
11525    fn test_494_a32_i64_guard_elision() {
11526        let encoder = ArmEncoder::new_arm32();
11527        let mk = |zero: bool, ovf: bool| {
11528            encoder
11529                .encode(&ArmOp::I64DivS {
11530                    rdlo: Reg::R4,
11531                    rdhi: Reg::R5,
11532                    rnlo: Reg::R0,
11533                    rnhi: Reg::R1,
11534                    rmlo: Reg::R2,
11535                    rmhi: Reg::R3,
11536                    elide_zero_guard: zero,
11537                    elide_overflow_guard: ovf,
11538                })
11539                .unwrap()
11540        };
11541        let full = mk(false, false);
11542        let zero_only = mk(true, false);
11543        let both = mk(true, true);
11544        // A32 zero guard = 3 words (ORRS/BNE/UDF), overflow guard = 6 words.
11545        assert_eq!(full.len(), zero_only.len() + 12);
11546        assert_eq!(zero_only.len(), both.len() + 24);
11547        let udf_count = |code: &[u8]| {
11548            code.chunks(4)
11549                .filter(|c| u32::from_le_bytes([c[0], c[1], c[2], c[3]]) == 0xE7F0_00F0)
11550                .count()
11551        };
11552        assert_eq!(udf_count(&full), 2);
11553        assert_eq!(
11554            udf_count(&zero_only),
11555            1,
11556            "A32: overflow guard retained under zero-only elision"
11557        );
11558        assert_eq!(udf_count(&both), 0);
11559    }
11560
11561    /// #633: A32 twin — the conditional-execution overflow guard on the
11562    /// ARM-mode I64DivS, and its absence from I64RemS.
11563    #[test]
11564    fn test_633_a32_i64_divs_overflow_guard() {
11565        let encoder = ArmEncoder::new_arm32();
11566        let mk_divs = ArmOp::I64DivS {
11567            rdlo: Reg::R4,
11568            rdhi: Reg::R5,
11569            rnlo: Reg::R0,
11570            rnhi: Reg::R1,
11571            rmlo: Reg::R2,
11572            rmhi: Reg::R3,
11573            elide_zero_guard: false,
11574            elide_overflow_guard: false,
11575        };
11576        let code = encoder.encode(&mk_divs).unwrap();
11577        let words: Vec<u32> = code
11578            .chunks(4)
11579            .map(|c| u32::from_le_bytes([c[0], c[1], c[2], c[3]]))
11580            .collect();
11581        let guard = [
11582            0xE002_C003u32, // AND   R12, R2, R3
11583            0xE37C_0001,    // CMN   R12, #1
11584            0x0350_0000,    // CMPEQ R0, #0
11585            0x0351_0102,    // CMPEQ R1, #0x80000000
11586            0x1A00_0000,    // BNE +1 insn
11587            0xE7F0_00F0,    // UDF #0
11588        ];
11589        assert!(
11590            words.windows(6).any(|w| w == guard),
11591            "A32 I64DivS carries the INT64_MIN/-1 overflow guard"
11592        );
11593        let rems = encoder
11594            .encode(&ArmOp::I64RemS {
11595                rdlo: Reg::R4,
11596                rdhi: Reg::R5,
11597                rnlo: Reg::R0,
11598                rnhi: Reg::R1,
11599                rmlo: Reg::R2,
11600                rmhi: Reg::R3,
11601                elide_zero_guard: false,
11602            })
11603            .unwrap();
11604        let rems_udfs = rems
11605            .chunks(4)
11606            .filter(|c| u32::from_le_bytes([c[0], c[1], c[2], c[3]]) == 0xE7F0_00F0)
11607            .count();
11608        assert_eq!(rems_udfs, 1, "A32 I64RemS keeps only the zero-divisor trap");
11609    }
11610
11611    #[test]
11612    fn test_encode_nop_thumb2() {
11613        let encoder = ArmEncoder::new_thumb2();
11614        let op = ArmOp::Nop;
11615        let code = encoder.encode(&op).unwrap();
11616        assert_eq!(code.len(), 2); // 16-bit
11617
11618        // NOP: 0xBF00 in little-endian
11619        assert_eq!(code, vec![0x00, 0xBF]);
11620    }
11621
11622    // =========================================================================
11623    // i64 Thumb-2 encoding tests
11624    // =========================================================================
11625
11626    #[test]
11627    fn test_encode_i64_add_thumb2() {
11628        let encoder = ArmEncoder::new_thumb2();
11629        let op = ArmOp::I64Add {
11630            rdlo: Reg::R0,
11631            rdhi: Reg::R1,
11632            rnlo: Reg::R0,
11633            rnhi: Reg::R1,
11634            rmlo: Reg::R2,
11635            rmhi: Reg::R3,
11636        };
11637        let code = encoder.encode(&op).unwrap();
11638        // Should emit ADDS (2 bytes) + ADC.W (4 bytes) = 6 bytes
11639        assert_eq!(code.len(), 6, "I64Add should be 6 bytes (ADDS + ADC.W)");
11640    }
11641
11642    #[test]
11643    fn test_encode_i64_sub_thumb2() {
11644        let encoder = ArmEncoder::new_thumb2();
11645        let op = ArmOp::I64Sub {
11646            rdlo: Reg::R0,
11647            rdhi: Reg::R1,
11648            rnlo: Reg::R0,
11649            rnhi: Reg::R1,
11650            rmlo: Reg::R2,
11651            rmhi: Reg::R3,
11652        };
11653        let code = encoder.encode(&op).unwrap();
11654        // Should emit SUBS (2 bytes) + SBC.W (4 bytes) = 6 bytes
11655        assert_eq!(code.len(), 6, "I64Sub should be 6 bytes (SUBS + SBC.W)");
11656    }
11657
11658    #[test]
11659    fn test_encode_i64_and_thumb2() {
11660        let encoder = ArmEncoder::new_thumb2();
11661        let op = ArmOp::I64And {
11662            rdlo: Reg::R0,
11663            rdhi: Reg::R1,
11664            rnlo: Reg::R0,
11665            rnhi: Reg::R1,
11666            rmlo: Reg::R2,
11667            rmhi: Reg::R3,
11668        };
11669        let code = encoder.encode(&op).unwrap();
11670        // AND.W (4 bytes) + AND.W (4 bytes) = 8 bytes
11671        assert!(code.len() >= 4, "I64And should emit at least 4 bytes");
11672    }
11673
11674    #[test]
11675    fn test_encode_i64_or_thumb2() {
11676        let encoder = ArmEncoder::new_thumb2();
11677        let op = ArmOp::I64Or {
11678            rdlo: Reg::R0,
11679            rdhi: Reg::R1,
11680            rnlo: Reg::R0,
11681            rnhi: Reg::R1,
11682            rmlo: Reg::R2,
11683            rmhi: Reg::R3,
11684        };
11685        let code = encoder.encode(&op).unwrap();
11686        assert!(code.len() >= 4, "I64Or should emit at least 4 bytes");
11687    }
11688
11689    #[test]
11690    fn test_encode_i64_xor_thumb2() {
11691        let encoder = ArmEncoder::new_thumb2();
11692        let op = ArmOp::I64Xor {
11693            rdlo: Reg::R0,
11694            rdhi: Reg::R1,
11695            rnlo: Reg::R0,
11696            rnhi: Reg::R1,
11697            rmlo: Reg::R2,
11698            rmhi: Reg::R3,
11699        };
11700        let code = encoder.encode(&op).unwrap();
11701        assert!(code.len() >= 4, "I64Xor should emit at least 4 bytes");
11702    }
11703
11704    #[test]
11705    fn test_encode_i64_const_small_thumb2() {
11706        let encoder = ArmEncoder::new_thumb2();
11707        // Small constant: only needs MOVW for each half
11708        let op = ArmOp::I64Const {
11709            rdlo: Reg::R0,
11710            rdhi: Reg::R1,
11711            value: 42,
11712        };
11713        let code = encoder.encode(&op).unwrap();
11714        // MOVW R0, #42 (4 bytes) + MOVW R1, #0 (4 bytes) = 8 bytes minimum
11715        assert!(code.len() >= 8, "I64Const should emit at least 8 bytes");
11716    }
11717
11718    #[test]
11719    fn test_encode_i64_const_large_thumb2() {
11720        let encoder = ArmEncoder::new_thumb2();
11721        // Large constant: needs MOVW+MOVT for each half
11722        let op = ArmOp::I64Const {
11723            rdlo: Reg::R0,
11724            rdhi: Reg::R1,
11725            value: 0x1234_5678_9ABC_DEF0_u64 as i64,
11726        };
11727        let code = encoder.encode(&op).unwrap();
11728        // MOVW + MOVT for lo (8 bytes) + MOVW + MOVT for hi (8 bytes) = 16 bytes
11729        assert_eq!(
11730            code.len(),
11731            16,
11732            "I64Const with large value should be 16 bytes"
11733        );
11734    }
11735
11736    #[test]
11737    fn test_encode_i64_extend_i32_s_thumb2() {
11738        let encoder = ArmEncoder::new_thumb2();
11739        let op = ArmOp::I64ExtendI32S {
11740            rdlo: Reg::R0,
11741            rdhi: Reg::R1,
11742            rn: Reg::R0,
11743        };
11744        let code = encoder.encode(&op).unwrap();
11745        // When rdlo == rn, only ASR (4 bytes) is emitted
11746        assert_eq!(
11747            code.len(),
11748            4,
11749            "I64ExtendI32S (same reg) should be 4 bytes (ASR only)"
11750        );
11751    }
11752
11753    #[test]
11754    fn test_encode_i64_extend_i32_s_diff_reg_thumb2() {
11755        let encoder = ArmEncoder::new_thumb2();
11756        let op = ArmOp::I64ExtendI32S {
11757            rdlo: Reg::R0,
11758            rdhi: Reg::R1,
11759            rn: Reg::R2,
11760        };
11761        let code = encoder.encode(&op).unwrap();
11762        // MOV rdlo, rn (2 bytes for low regs) + ASR rdhi, rdlo, #31 (4 bytes) = 6 bytes
11763        assert!(
11764            code.len() >= 6,
11765            "I64ExtendI32S (diff reg) should be at least 6 bytes"
11766        );
11767    }
11768
11769    #[test]
11770    fn test_encode_i64_extend_i32_u_thumb2() {
11771        let encoder = ArmEncoder::new_thumb2();
11772        let op = ArmOp::I64ExtendI32U {
11773            rdlo: Reg::R0,
11774            rdhi: Reg::R1,
11775            rn: Reg::R0,
11776        };
11777        let code = encoder.encode(&op).unwrap();
11778        // When rdlo == rn, only MOV rdhi, #0 (2 bytes) is emitted
11779        assert_eq!(
11780            code.len(),
11781            2,
11782            "I64ExtendI32U (same reg) should be 2 bytes (MOV #0 only)"
11783        );
11784    }
11785
11786    #[test]
11787    fn test_encode_i32_wrap_i64_nop_thumb2() {
11788        let encoder = ArmEncoder::new_thumb2();
11789        // When rd == rnlo, should be a NOP
11790        let op = ArmOp::I32WrapI64 {
11791            rd: Reg::R0,
11792            rnlo: Reg::R0,
11793        };
11794        let code = encoder.encode(&op).unwrap();
11795        assert_eq!(code.len(), 2, "I32WrapI64 same reg should be NOP (2 bytes)");
11796        assert_eq!(code, vec![0x00, 0xBF]); // NOP
11797    }
11798
11799    #[test]
11800    fn test_encode_i32_wrap_i64_diff_reg_thumb2() {
11801        let encoder = ArmEncoder::new_thumb2();
11802        let op = ArmOp::I32WrapI64 {
11803            rd: Reg::R2,
11804            rnlo: Reg::R0,
11805        };
11806        let code = encoder.encode(&op).unwrap();
11807        // MOV R2, R0 (2 or 4 bytes)
11808        assert!(
11809            code.len() >= 2,
11810            "I32WrapI64 diff reg should emit at least 2 bytes"
11811        );
11812    }
11813
11814    #[test]
11815    fn test_encode_i64_eqz_thumb2() {
11816        let encoder = ArmEncoder::new_thumb2();
11817        let op = ArmOp::I64Eqz {
11818            rd: Reg::R0,
11819            rnlo: Reg::R0,
11820            rnhi: Reg::R1,
11821        };
11822        let code = encoder.encode(&op).unwrap();
11823        // Delegates to I64SetCondZ which is already encoded
11824        assert!(
11825            code.len() >= 6,
11826            "I64Eqz should emit at least 6 bytes for ORR+ITE+MOV+MOV"
11827        );
11828    }
11829
11830    #[test]
11831    fn test_encode_i64_eq_thumb2() {
11832        let encoder = ArmEncoder::new_thumb2();
11833        let op = ArmOp::I64Eq {
11834            rd: Reg::R0,
11835            rnlo: Reg::R0,
11836            rnhi: Reg::R1,
11837            rmlo: Reg::R2,
11838            rmhi: Reg::R3,
11839        };
11840        let code = encoder.encode(&op).unwrap();
11841        // Delegates to I64SetCond EQ: CMP lo + IT EQ + CMPEQ hi + ITE EQ + MOV 1 + MOV 0
11842        assert!(code.len() >= 10, "I64Eq should emit at least 10 bytes");
11843    }
11844
11845    #[test]
11846    fn test_encode_i64_ldr_thumb2() {
11847        let encoder = ArmEncoder::new_thumb2();
11848        let op = ArmOp::I64Ldr {
11849            rdlo: Reg::R0,
11850            rdhi: Reg::R1,
11851            addr: MemAddr::imm(Reg::SP, 0),
11852        };
11853        let code = encoder.encode(&op).unwrap();
11854        // Two LDR instructions (lo at offset, hi at offset+4)
11855        assert!(code.len() >= 4, "I64Ldr should emit at least 4 bytes");
11856    }
11857
11858    #[test]
11859    fn test_372_i64_ldr_indexed_materializes_address() {
11860        // #372: a memory i64.load carries an index register (R11 + addr + off).
11861        // The encoder must materialize `ip = base + index` (ADD.W) and load via
11862        // `[ip,#off]` — NOT drop the index. A frame (non-indexed) i64.load must
11863        // stay byte-identical (plain `[base,#off]`, no ADD).
11864        let encoder = ArmEncoder::new_thumb2();
11865        let indexed = encoder
11866            .encode(&ArmOp::I64Ldr {
11867                rdlo: Reg::R0,
11868                rdhi: Reg::R1,
11869                addr: MemAddr::reg_imm(Reg::R11, Reg::R0, 0),
11870            })
11871            .unwrap();
11872        // ADD.W ip, fp, r0 = eb0b 0c00 (byte-verified vs arm-none-eabi-as).
11873        assert_eq!(
11874            &indexed[0..4],
11875            &[0x0b, 0xeb, 0x00, 0x0c],
11876            "indexed I64Ldr must start with ADD.W ip, base, index"
11877        );
11878        let frame = encoder
11879            .encode(&ArmOp::I64Ldr {
11880                rdlo: Reg::R0,
11881                rdhi: Reg::R1,
11882                addr: MemAddr::imm(Reg::SP, 8),
11883            })
11884            .unwrap();
11885        // No index -> no ADD.W prefix (byte-identical frame access).
11886        assert_ne!(
11887            &frame[0..2],
11888            &[0x0b, 0xeb],
11889            "frame (non-indexed) I64Ldr must NOT emit an ADD.W"
11890        );
11891    }
11892
11893    #[test]
11894    fn test_382_i64_ldst_large_offset_materializes_not_skips() {
11895        // #382: an indexed i64.load/store whose static offset > 0xFFF must
11896        // MATERIALIZE the offset into the base — NOT return Err (skip the fn).
11897        // Sequence for reg_imm(R11, R0, 5000): MOVW ip,#5000 ; ADD ip,r0,ip ;
11898        // ADD ip,ip,fp ; LDR/STR halves at [ip,#0] / [ip,#4]. Byte-verified tail
11899        // vs arm-none-eabi-as.
11900        let encoder = ArmEncoder::new_thumb2();
11901        // 0x1388 > 0xFFF (MemAddr is not Copy, so build it per use).
11902
11903        let ld = encoder
11904            .encode(&ArmOp::I64Ldr {
11905                rdlo: Reg::R0,
11906                rdhi: Reg::R1,
11907                addr: MemAddr::reg_imm(Reg::R11, Reg::R0, 5000),
11908            })
11909            .expect("large-offset i64.load must lower, not skip");
11910        // MOVW ip,#0x1388 (4) + ADD ip,r0,ip (4) + ADD ip,ip,fp (4) + 2 LDR (8).
11911        assert_eq!(ld.len(), 20, "expected MOVW + 2×ADD + 2×LDR");
11912        // Must NOT be the small-offset `ADD.W ip, fp, r0` (0x0b 0xeb) prefix —
11913        // that path can only reach imm12 offsets.
11914        assert_ne!(
11915            &ld[0..2],
11916            &[0x0b, 0xeb],
11917            "must materialize the large offset"
11918        );
11919        // Effective base built in ip, then halves at [ip,#0] / [ip,#4].
11920        assert_eq!(
11921            &ld[4..20],
11922            &[
11923                0x00, 0xeb, 0x0c, 0x0c, // ADD.W ip, r0, ip
11924                0x0c, 0xeb, 0x0b, 0x0c, // ADD.W ip, ip, fp
11925                0xdc, 0xf8, 0x00, 0x00, // LDR.W r0, [ip, #0]
11926                0xdc, 0xf8, 0x04, 0x10, // LDR.W r1, [ip, #4]
11927            ],
11928            "large-offset i64.load must fold offset into ip and access [ip,#0]/[ip,#4]"
11929        );
11930
11931        // Store: same base materialization, STR halves.
11932        let st = encoder
11933            .encode(&ArmOp::I64Str {
11934                rdlo: Reg::R2,
11935                rdhi: Reg::R3,
11936                addr: MemAddr::reg_imm(Reg::R11, Reg::R0, 5000),
11937            })
11938            .expect("large-offset i64.store must lower, not skip");
11939        assert_eq!(st.len(), 20);
11940        assert_eq!(
11941            &st[4..20],
11942            &[
11943                0x00, 0xeb, 0x0c, 0x0c, // ADD.W ip, r0, ip
11944                0x0c, 0xeb, 0x0b, 0x0c, // ADD.W ip, ip, fp
11945                0xcc, 0xf8, 0x00, 0x20, // STR.W r2, [ip, #0]
11946                0xcc, 0xf8, 0x04, 0x30, // STR.W r3, [ip, #4]
11947            ],
11948            "large-offset i64.store must fold offset into ip and access [ip,#0]/[ip,#4]"
11949        );
11950
11951        // Small-offset (imm12) indexed access stays byte-identical (#372): the
11952        // effective base is a single `ADD.W ip, fp, r0` and the halves keep the
11953        // folded immediates — NO extra MOVW/ADD.
11954        let small = encoder
11955            .encode(&ArmOp::I64Ldr {
11956                rdlo: Reg::R0,
11957                rdhi: Reg::R1,
11958                addr: MemAddr::reg_imm(Reg::R11, Reg::R0, 8),
11959            })
11960            .unwrap();
11961        assert_eq!(
11962            &small[0..4],
11963            &[0x0b, 0xeb, 0x00, 0x0c],
11964            "small-offset indexed i64 must keep the single ADD.W ip, fp, r0"
11965        );
11966        assert_eq!(small.len(), 12, "ADD.W + 2×LDR.W (offset folded in imm12)");
11967    }
11968
11969    #[test]
11970    fn test_encode_i64_str_thumb2() {
11971        let encoder = ArmEncoder::new_thumb2();
11972        let op = ArmOp::I64Str {
11973            rdlo: Reg::R0,
11974            rdhi: Reg::R1,
11975            addr: MemAddr::imm(Reg::SP, 0),
11976        };
11977        let code = encoder.encode(&op).unwrap();
11978        // Two STR instructions (lo at offset, hi at offset+4)
11979        assert!(code.len() >= 4, "I64Str should emit at least 4 bytes");
11980    }
11981
11982    #[test]
11983    fn test_encode_i64_all_comparisons_thumb2() {
11984        let encoder = ArmEncoder::new_thumb2();
11985
11986        let ops = vec![
11987            ArmOp::I64Ne {
11988                rd: Reg::R0,
11989                rnlo: Reg::R0,
11990                rnhi: Reg::R1,
11991                rmlo: Reg::R2,
11992                rmhi: Reg::R3,
11993            },
11994            ArmOp::I64LtS {
11995                rd: Reg::R0,
11996                rnlo: Reg::R0,
11997                rnhi: Reg::R1,
11998                rmlo: Reg::R2,
11999                rmhi: Reg::R3,
12000            },
12001            ArmOp::I64LtU {
12002                rd: Reg::R0,
12003                rnlo: Reg::R0,
12004                rnhi: Reg::R1,
12005                rmlo: Reg::R2,
12006                rmhi: Reg::R3,
12007            },
12008            ArmOp::I64LeS {
12009                rd: Reg::R0,
12010                rnlo: Reg::R0,
12011                rnhi: Reg::R1,
12012                rmlo: Reg::R2,
12013                rmhi: Reg::R3,
12014            },
12015            ArmOp::I64LeU {
12016                rd: Reg::R0,
12017                rnlo: Reg::R0,
12018                rnhi: Reg::R1,
12019                rmlo: Reg::R2,
12020                rmhi: Reg::R3,
12021            },
12022            ArmOp::I64GtS {
12023                rd: Reg::R0,
12024                rnlo: Reg::R0,
12025                rnhi: Reg::R1,
12026                rmlo: Reg::R2,
12027                rmhi: Reg::R3,
12028            },
12029            ArmOp::I64GtU {
12030                rd: Reg::R0,
12031                rnlo: Reg::R0,
12032                rnhi: Reg::R1,
12033                rmlo: Reg::R2,
12034                rmhi: Reg::R3,
12035            },
12036            ArmOp::I64GeS {
12037                rd: Reg::R0,
12038                rnlo: Reg::R0,
12039                rnhi: Reg::R1,
12040                rmlo: Reg::R2,
12041                rmhi: Reg::R3,
12042            },
12043            ArmOp::I64GeU {
12044                rd: Reg::R0,
12045                rnlo: Reg::R0,
12046                rnhi: Reg::R1,
12047                rmlo: Reg::R2,
12048                rmhi: Reg::R3,
12049            },
12050        ];
12051
12052        for op in &ops {
12053            let code = encoder.encode(op).unwrap();
12054            assert!(
12055                code.len() >= 8,
12056                "i64 comparison {:?} should emit at least 8 bytes, got {}",
12057                op,
12058                code.len()
12059            );
12060        }
12061    }
12062
12063    #[test]
12064    fn test_encode_i64_const_zero_thumb2() {
12065        let encoder = ArmEncoder::new_thumb2();
12066        let op = ArmOp::I64Const {
12067            rdlo: Reg::R0,
12068            rdhi: Reg::R1,
12069            value: 0,
12070        };
12071        let code = encoder.encode(&op).unwrap();
12072        // MOVW R0, #0 (4 bytes) + MOVW R1, #0 (4 bytes) = 8 bytes
12073        assert_eq!(code.len(), 8, "I64Const(0) should be 8 bytes");
12074    }
12075
12076    #[test]
12077    fn test_encode_i64_const_negative_one_thumb2() {
12078        let encoder = ArmEncoder::new_thumb2();
12079        let op = ArmOp::I64Const {
12080            rdlo: Reg::R0,
12081            rdhi: Reg::R1,
12082            value: -1, // 0xFFFF_FFFF_FFFF_FFFF
12083        };
12084        let code = encoder.encode(&op).unwrap();
12085        // MOVW + MOVT for lo (8 bytes) + MOVW + MOVT for hi (8 bytes) = 16 bytes
12086        assert_eq!(code.len(), 16, "I64Const(-1) should be 16 bytes");
12087    }
12088
12089    // =========================================================================
12090    // Sub-word load/store encoding tests
12091    // =========================================================================
12092
12093    #[test]
12094    fn test_encode_ldrb_arm32() {
12095        let encoder = ArmEncoder::new_arm32();
12096        let op = ArmOp::Ldrb {
12097            rd: Reg::R0,
12098            addr: MemAddr::imm(Reg::R1, 4),
12099        };
12100        let code = encoder.encode(&op).unwrap();
12101        assert_eq!(code.len(), 4, "ARM32 LDRB should be 4 bytes");
12102        // LDRB R0, [R1, #4] = 0xE5D10004
12103        let encoded = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
12104        assert_eq!(encoded, 0xE5D10004, "Should encode LDRB R0, [R1, #4]");
12105    }
12106
12107    #[test]
12108    fn test_encode_strb_arm32() {
12109        let encoder = ArmEncoder::new_arm32();
12110        let op = ArmOp::Strb {
12111            rd: Reg::R0,
12112            addr: MemAddr::imm(Reg::R1, 0),
12113        };
12114        let code = encoder.encode(&op).unwrap();
12115        assert_eq!(code.len(), 4, "ARM32 STRB should be 4 bytes");
12116        // STRB R0, [R1, #0] = 0xE5C10000
12117        let encoded = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
12118        assert_eq!(encoded, 0xE5C10000, "Should encode STRB R0, [R1, #0]");
12119    }
12120
12121    #[test]
12122    fn test_encode_ldrh_arm32() {
12123        let encoder = ArmEncoder::new_arm32();
12124        let op = ArmOp::Ldrh {
12125            rd: Reg::R0,
12126            addr: MemAddr::imm(Reg::R1, 2),
12127        };
12128        let code = encoder.encode(&op).unwrap();
12129        assert_eq!(code.len(), 4, "ARM32 LDRH should be 4 bytes");
12130    }
12131
12132    #[test]
12133    fn test_encode_strh_arm32() {
12134        let encoder = ArmEncoder::new_arm32();
12135        let op = ArmOp::Strh {
12136            rd: Reg::R0,
12137            addr: MemAddr::imm(Reg::R1, 0),
12138        };
12139        let code = encoder.encode(&op).unwrap();
12140        assert_eq!(code.len(), 4, "ARM32 STRH should be 4 bytes");
12141    }
12142
12143    #[test]
12144    fn test_encode_ldrsb_arm32() {
12145        let encoder = ArmEncoder::new_arm32();
12146        let op = ArmOp::Ldrsb {
12147            rd: Reg::R0,
12148            addr: MemAddr::imm(Reg::R1, 0),
12149        };
12150        let code = encoder.encode(&op).unwrap();
12151        assert_eq!(code.len(), 4, "ARM32 LDRSB should be 4 bytes");
12152    }
12153
12154    #[test]
12155    fn test_encode_ldrsh_arm32() {
12156        let encoder = ArmEncoder::new_arm32();
12157        let op = ArmOp::Ldrsh {
12158            rd: Reg::R0,
12159            addr: MemAddr::imm(Reg::R1, 0),
12160        };
12161        let code = encoder.encode(&op).unwrap();
12162        assert_eq!(code.len(), 4, "ARM32 LDRSH should be 4 bytes");
12163    }
12164
12165    #[test]
12166    fn test_encode_ldrb_thumb2_16bit() {
12167        let encoder = ArmEncoder::new_thumb2();
12168        let op = ArmOp::Ldrb {
12169            rd: Reg::R0,
12170            addr: MemAddr::imm(Reg::R1, 4),
12171        };
12172        let code = encoder.encode(&op).unwrap();
12173        // Low registers + small offset -> 16-bit encoding
12174        assert_eq!(
12175            code.len(),
12176            2,
12177            "Thumb-2 LDRB with small offset should be 16-bit"
12178        );
12179    }
12180
12181    #[test]
12182    fn test_encode_ldrb_thumb2_32bit() {
12183        let encoder = ArmEncoder::new_thumb2();
12184        let op = ArmOp::Ldrb {
12185            rd: Reg::R0,
12186            addr: MemAddr::imm(Reg::R1, 100), // offset > 31 needs 32-bit
12187        };
12188        let code = encoder.encode(&op).unwrap();
12189        assert_eq!(
12190            code.len(),
12191            4,
12192            "Thumb-2 LDRB with large offset should be 32-bit"
12193        );
12194    }
12195
12196    #[test]
12197    fn test_encode_strb_thumb2_16bit() {
12198        let encoder = ArmEncoder::new_thumb2();
12199        let op = ArmOp::Strb {
12200            rd: Reg::R0,
12201            addr: MemAddr::imm(Reg::R1, 10),
12202        };
12203        let code = encoder.encode(&op).unwrap();
12204        assert_eq!(
12205            code.len(),
12206            2,
12207            "Thumb-2 STRB with small offset should be 16-bit"
12208        );
12209    }
12210
12211    #[test]
12212    fn test_encode_ldrh_thumb2_16bit() {
12213        let encoder = ArmEncoder::new_thumb2();
12214        let op = ArmOp::Ldrh {
12215            rd: Reg::R0,
12216            addr: MemAddr::imm(Reg::R1, 4), // offset aligned to 2, <= 62
12217        };
12218        let code = encoder.encode(&op).unwrap();
12219        assert_eq!(
12220            code.len(),
12221            2,
12222            "Thumb-2 LDRH with small aligned offset should be 16-bit"
12223        );
12224    }
12225
12226    #[test]
12227    fn test_encode_strh_thumb2_16bit() {
12228        let encoder = ArmEncoder::new_thumb2();
12229        let op = ArmOp::Strh {
12230            rd: Reg::R0,
12231            addr: MemAddr::imm(Reg::R1, 4),
12232        };
12233        let code = encoder.encode(&op).unwrap();
12234        assert_eq!(
12235            code.len(),
12236            2,
12237            "Thumb-2 STRH with small aligned offset should be 16-bit"
12238        );
12239    }
12240
12241    #[test]
12242    fn test_encode_ldrsb_thumb2() {
12243        let encoder = ArmEncoder::new_thumb2();
12244        let op = ArmOp::Ldrsb {
12245            rd: Reg::R0,
12246            addr: MemAddr::imm(Reg::R1, 0),
12247        };
12248        let code = encoder.encode(&op).unwrap();
12249        // LDRSB has no 16-bit immediate form, always 32-bit
12250        assert_eq!(code.len(), 4, "Thumb-2 LDRSB should be 32-bit");
12251    }
12252
12253    #[test]
12254    fn test_encode_ldrsh_thumb2() {
12255        let encoder = ArmEncoder::new_thumb2();
12256        let op = ArmOp::Ldrsh {
12257            rd: Reg::R0,
12258            addr: MemAddr::imm(Reg::R1, 0),
12259        };
12260        let code = encoder.encode(&op).unwrap();
12261        assert_eq!(code.len(), 4, "Thumb-2 LDRSH should be 32-bit");
12262    }
12263
12264    #[test]
12265    fn test_encode_memory_size_thumb2() {
12266        let encoder = ArmEncoder::new_thumb2();
12267        let op = ArmOp::MemorySize { rd: Reg::R0 };
12268        let code = encoder.encode(&op).unwrap();
12269        // R0 and R10 are not both low registers, so this needs careful handling
12270        assert!(!code.is_empty(), "MemorySize should produce code");
12271    }
12272
12273    #[test]
12274    fn test_encode_memory_grow_thumb2() {
12275        let encoder = ArmEncoder::new_thumb2();
12276        let op = ArmOp::MemoryGrow {
12277            rd: Reg::R0,
12278            rn: Reg::R0,
12279        };
12280        let code = encoder.encode(&op).unwrap();
12281        assert_eq!(code.len(), 4, "MemoryGrow (MVN) should be 32-bit Thumb-2");
12282    }
12283
12284    #[test]
12285    fn test_encode_subword_reg_offset_thumb2() {
12286        let encoder = ArmEncoder::new_thumb2();
12287
12288        // LDRB with register offset
12289        let op = ArmOp::Ldrb {
12290            rd: Reg::R0,
12291            addr: MemAddr::reg(Reg::R1, Reg::R2),
12292        };
12293        let code = encoder.encode(&op).unwrap();
12294        assert_eq!(
12295            code.len(),
12296            4,
12297            "Thumb-2 LDRB with reg offset should be 32-bit"
12298        );
12299
12300        // STRB with register offset
12301        let op = ArmOp::Strb {
12302            rd: Reg::R0,
12303            addr: MemAddr::reg(Reg::R1, Reg::R2),
12304        };
12305        let code = encoder.encode(&op).unwrap();
12306        assert_eq!(
12307            code.len(),
12308            4,
12309            "Thumb-2 STRB with reg offset should be 32-bit"
12310        );
12311
12312        // LDRH with register offset
12313        let op = ArmOp::Ldrh {
12314            rd: Reg::R0,
12315            addr: MemAddr::reg(Reg::R1, Reg::R2),
12316        };
12317        let code = encoder.encode(&op).unwrap();
12318        assert_eq!(
12319            code.len(),
12320            4,
12321            "Thumb-2 LDRH with reg offset should be 32-bit"
12322        );
12323
12324        // STRH with register offset
12325        let op = ArmOp::Strh {
12326            rd: Reg::R0,
12327            addr: MemAddr::reg(Reg::R1, Reg::R2),
12328        };
12329        let code = encoder.encode(&op).unwrap();
12330        assert_eq!(
12331            code.len(),
12332            4,
12333            "Thumb-2 STRH with reg offset should be 32-bit"
12334        );
12335    }
12336
12337    #[test]
12338    fn test_encode_subword_reg_imm_offset_thumb2() {
12339        let encoder = ArmEncoder::new_thumb2();
12340
12341        // LDRB with both register and immediate offset
12342        let op = ArmOp::Ldrb {
12343            rd: Reg::R0,
12344            addr: MemAddr::reg_imm(Reg::R1, Reg::R2, 4),
12345        };
12346        let code = encoder.encode(&op).unwrap();
12347        // ADD R12, R2, #4 (4 bytes) + LDRB R0, [R1, R12] (4 bytes) = 8 bytes
12348        assert_eq!(
12349            code.len(),
12350            8,
12351            "Thumb-2 LDRB with reg+imm offset should be 8 bytes"
12352        );
12353    }
12354
12355    // ========================================================================
12356    // Helium MVE encoding tests
12357    // ========================================================================
12358
12359    #[test]
12360    fn test_encode_mve_addi32_thumb2() {
12361        let encoder = ArmEncoder::new_thumb2();
12362        let op = ArmOp::MveAddI {
12363            qd: QReg::Q0,
12364            qn: QReg::Q1,
12365            qm: QReg::Q2,
12366            size: MveSize::S32,
12367        };
12368        let code = encoder.encode(&op).unwrap();
12369        assert_eq!(
12370            code.len(),
12371            4,
12372            "MVE VADD.I32 should be 4 bytes (Thumb-2 32-bit)"
12373        );
12374    }
12375
12376    #[test]
12377    fn test_encode_mve_subi16_thumb2() {
12378        let encoder = ArmEncoder::new_thumb2();
12379        let op = ArmOp::MveSubI {
12380            qd: QReg::Q0,
12381            qn: QReg::Q1,
12382            qm: QReg::Q2,
12383            size: MveSize::S16,
12384        };
12385        let code = encoder.encode(&op).unwrap();
12386        assert_eq!(code.len(), 4, "MVE VSUB.I16 should be 4 bytes");
12387    }
12388
12389    #[test]
12390    fn test_encode_mve_muli8_thumb2() {
12391        let encoder = ArmEncoder::new_thumb2();
12392        let op = ArmOp::MveMulI {
12393            qd: QReg::Q0,
12394            qn: QReg::Q1,
12395            qm: QReg::Q2,
12396            size: MveSize::S8,
12397        };
12398        let code = encoder.encode(&op).unwrap();
12399        assert_eq!(code.len(), 4, "MVE VMUL.I8 should be 4 bytes");
12400    }
12401
12402    #[test]
12403    fn test_encode_mve_bitwise_thumb2() {
12404        let encoder = ArmEncoder::new_thumb2();
12405
12406        let ops = vec![
12407            ArmOp::MveAnd {
12408                qd: QReg::Q0,
12409                qn: QReg::Q1,
12410                qm: QReg::Q2,
12411            },
12412            ArmOp::MveOrr {
12413                qd: QReg::Q0,
12414                qn: QReg::Q1,
12415                qm: QReg::Q2,
12416            },
12417            ArmOp::MveEor {
12418                qd: QReg::Q0,
12419                qn: QReg::Q1,
12420                qm: QReg::Q2,
12421            },
12422            ArmOp::MveBic {
12423                qd: QReg::Q0,
12424                qn: QReg::Q1,
12425                qm: QReg::Q2,
12426            },
12427        ];
12428        for op in ops {
12429            let code = encoder.encode(&op).unwrap();
12430            assert_eq!(code.len(), 4, "MVE bitwise op should be 4 bytes");
12431        }
12432    }
12433
12434    #[test]
12435    fn test_encode_mve_mvn_thumb2() {
12436        let encoder = ArmEncoder::new_thumb2();
12437        let op = ArmOp::MveMvn {
12438            qd: QReg::Q0,
12439            qm: QReg::Q1,
12440        };
12441        let code = encoder.encode(&op).unwrap();
12442        assert_eq!(code.len(), 4, "MVE VMVN should be 4 bytes");
12443    }
12444
12445    #[test]
12446    fn test_encode_mve_load_store_thumb2() {
12447        let encoder = ArmEncoder::new_thumb2();
12448
12449        let load = ArmOp::MveLoad {
12450            qd: QReg::Q0,
12451            addr: MemAddr::imm(Reg::R0, 16),
12452        };
12453        let code = encoder.encode(&load).unwrap();
12454        assert_eq!(code.len(), 4, "MVE VLDRW.32 should be 4 bytes");
12455
12456        let store = ArmOp::MveStore {
12457            qd: QReg::Q1,
12458            addr: MemAddr::imm(Reg::R1, 0),
12459        };
12460        let code = encoder.encode(&store).unwrap();
12461        assert_eq!(code.len(), 4, "MVE VSTRW.32 should be 4 bytes");
12462    }
12463
12464    #[test]
12465    fn test_encode_mve_const_thumb2() {
12466        let encoder = ArmEncoder::new_thumb2();
12467        let op = ArmOp::MveConst {
12468            qd: QReg::Q0,
12469            bytes: [1, 0, 0, 0, 2, 0, 0, 0, 3, 0, 0, 0, 4, 0, 0, 0],
12470        };
12471        let code = encoder.encode(&op).unwrap();
12472        // Should be 4 words of (MOVW R12 + VMOV Sn) = 4 * (4+4) = 32 bytes min
12473        // Some words with hi16=0 skip MOVT, so length varies
12474        assert!(
12475            code.len() >= 24,
12476            "MVE const should produce multiple instructions"
12477        );
12478    }
12479
12480    #[test]
12481    fn test_encode_mve_dup_thumb2() {
12482        let encoder = ArmEncoder::new_thumb2();
12483        let op = ArmOp::MveDup {
12484            qd: QReg::Q0,
12485            rn: Reg::R0,
12486            size: MveSize::S32,
12487        };
12488        let code = encoder.encode(&op).unwrap();
12489        assert_eq!(code.len(), 4, "MVE VDUP.32 should be 4 bytes");
12490    }
12491
12492    #[test]
12493    fn test_encode_mve_extract_lane_thumb2() {
12494        let encoder = ArmEncoder::new_thumb2();
12495        let op = ArmOp::MveExtractLane {
12496            rd: Reg::R0,
12497            qn: QReg::Q1,
12498            lane: 2,
12499            size: MveSize::S32,
12500        };
12501        let code = encoder.encode(&op).unwrap();
12502        assert_eq!(code.len(), 4, "MVE extract lane should be 4 bytes");
12503    }
12504
12505    #[test]
12506    fn test_encode_mve_insert_lane_thumb2() {
12507        let encoder = ArmEncoder::new_thumb2();
12508        let op = ArmOp::MveInsertLane {
12509            qd: QReg::Q0,
12510            rn: Reg::R1,
12511            lane: 3,
12512            size: MveSize::S32,
12513        };
12514        let code = encoder.encode(&op).unwrap();
12515        assert_eq!(code.len(), 4, "MVE insert lane should be 4 bytes");
12516    }
12517
12518    #[test]
12519    fn test_encode_mve_addf32_thumb2() {
12520        let encoder = ArmEncoder::new_thumb2();
12521        let op = ArmOp::MveAddF32 {
12522            qd: QReg::Q0,
12523            qn: QReg::Q1,
12524            qm: QReg::Q2,
12525        };
12526        let code = encoder.encode(&op).unwrap();
12527        assert_eq!(code.len(), 4, "MVE VADD.F32 should be 4 bytes");
12528    }
12529
12530    #[test]
12531    fn test_encode_mve_divf32_thumb2() {
12532        let encoder = ArmEncoder::new_thumb2();
12533        let op = ArmOp::MveDivF32 {
12534            qd: QReg::Q0,
12535            qn: QReg::Q1,
12536            qm: QReg::Q2,
12537        };
12538        let code = encoder.encode(&op).unwrap();
12539        // Lane-wise: 4 x VDIV.F32 = 4 x 4 = 16 bytes
12540        assert_eq!(
12541            code.len(),
12542            16,
12543            "MVE VDIV.F32 (lane-wise) should be 16 bytes"
12544        );
12545    }
12546
12547    #[test]
12548    fn test_encode_mve_sqrtf32_thumb2() {
12549        let encoder = ArmEncoder::new_thumb2();
12550        let op = ArmOp::MveSqrtF32 {
12551            qd: QReg::Q0,
12552            qm: QReg::Q1,
12553        };
12554        let code = encoder.encode(&op).unwrap();
12555        // Lane-wise: 4 x VSQRT.F32 = 4 x 4 = 16 bytes
12556        assert_eq!(
12557            code.len(),
12558            16,
12559            "MVE VSQRT.F32 (lane-wise) should be 16 bytes"
12560        );
12561    }
12562
12563    #[test]
12564    fn test_encode_mve_negf32_thumb2() {
12565        let encoder = ArmEncoder::new_thumb2();
12566        let op = ArmOp::MveNegF32 {
12567            qd: QReg::Q0,
12568            qm: QReg::Q1,
12569        };
12570        let code = encoder.encode(&op).unwrap();
12571        assert_eq!(code.len(), 4, "MVE VNEG.F32 should be 4 bytes");
12572    }
12573
12574    #[test]
12575    fn test_encode_mve_absf32_thumb2() {
12576        let encoder = ArmEncoder::new_thumb2();
12577        let op = ArmOp::MveAbsF32 {
12578            qd: QReg::Q0,
12579            qm: QReg::Q1,
12580        };
12581        let code = encoder.encode(&op).unwrap();
12582        assert_eq!(code.len(), 4, "MVE VABS.F32 should be 4 bytes");
12583    }
12584
12585    /// VCR-RA-001 / immediate-folding precondition: pins the Thumb-2 `AND`
12586    /// immediate encoding for the byte range and documents its bound.
12587    ///
12588    /// The `And { Operand2::Imm }` encoder packs the low 12 bits straight into
12589    /// the `i:imm3:imm8` field WITHOUT applying ThumbExpandImm (the modified-
12590    /// immediate expansion). For `imm <= 0xFF` (e.g. gale's int8 clamps
12591    /// `#0x7e` / `#0x7f`) that is correct — `i:imm3 = 0000` means "imm8
12592    /// zero-extended". So `and r2, r0, #0x7e` encodes to the canonical
12593    /// `00 f0 7e 02`. For `imm >= 0x100` the field would need a true
12594    /// ThumbExpandImm pattern (rotation / replication), which is NOT
12595    /// implemented here — so **immediate folding must gate on `imm <= 0xFF`**
12596    /// until the encoder is hardened to ThumbExpandImm/Ok-or-Err (the
12597    /// "encoder must be Ok-or-Err, never silently wrong" principle, #180/#185).
12598    /// This bound covers the measured `flat_flight` waste (#209).
12599    #[test]
12600    fn and_immediate_encodes_correctly_in_byte_range_documents_fold_bound() {
12601        let encoder = ArmEncoder::new_thumb2();
12602        let op = ArmOp::And {
12603            rd: Reg::R2,
12604            rn: Reg::R0,
12605            op2: Operand2::Imm(0x7e),
12606        };
12607        let code = encoder.encode(&op).unwrap();
12608        assert_eq!(
12609            code,
12610            vec![0x00, 0xf0, 0x7e, 0x02],
12611            "and r2, r0, #0x7e must encode to the canonical AND.W T1 (imm8=0x7e)"
12612        );
12613    }
12614
12615    /// #255: the shared ThumbExpandImm reverse-encoder underpinning the
12616    /// data-processing immediate fix. Encodable modified immediates round-trip to
12617    /// the expected `i:imm3:imm8` field; a genuinely non-modified value is `None`
12618    /// (caller must materialize into a register). Note `1000 = 0xFA ror 30` *is*
12619    /// representable (field 0xF7A) — the old encoder mis-encoded it (raw 0x3E8);
12620    /// this encodes it correctly.
12621    #[test]
12622    fn try_thumb_expand_imm_encodes_modified_immediates() {
12623        assert_eq!(try_thumb_expand_imm(0x7e), Some(0x07e)); // zero-extended byte
12624        assert_eq!(try_thumb_expand_imm(0xff), Some(0x0ff));
12625        assert_eq!(try_thumb_expand_imm(0x0001_0001), Some(0x101)); // 0x00XY00XY
12626        assert_eq!(try_thumb_expand_imm(0xff00_ff00), Some(0x2ff)); // 0xXY00XY00
12627        assert_eq!(try_thumb_expand_imm(0xffff_ffff), Some(0x3ff)); // 0xXYXYXYXY
12628        assert_eq!(try_thumb_expand_imm(0x100), Some(0xf80)); // 0x80 ror 31
12629        assert_eq!(try_thumb_expand_imm(0x8000_0000), Some(0x400)); // 0x80 ror 8
12630        assert_eq!(try_thumb_expand_imm(1000), Some(0xf7a)); // 0xFA ror 30
12631        // Genuinely unrepresentable (bits too far apart for an 8-bit window).
12632        assert_eq!(try_thumb_expand_imm(0x101), None);
12633        assert_eq!(try_thumb_expand_imm(0x12345), None);
12634    }
12635
12636    /// #255: CMP/ADDS/SUBS encode any valid modified immediate correctly, and
12637    /// ERROR (not silently mis-encode) on a genuinely unrepresentable one,
12638    /// forcing the selector to materialize into a register — closing the
12639    /// silent-miscompile class of #251/#253.
12640    #[test]
12641    fn cmp_adds_subs_immediate_error_on_non_modified_imm() {
12642        let encoder = ArmEncoder::new_thumb2();
12643        // cmp r0, #0xff → valid → Ok; cmp r0, #1000 → valid (0xFA ror 30) → Ok.
12644        assert!(encoder.encode_thumb32_cmp_imm(&Reg::R0, 0xff).is_ok());
12645        assert!(encoder.encode_thumb32_cmp_imm(&Reg::R0, 1000).is_ok());
12646        // cmp r0, #0x101 → NOT a modified immediate → Err (materialize-reg).
12647        assert!(
12648            encoder.encode_thumb32_cmp_imm(&Reg::R0, 0x101).is_err(),
12649            "cmp #0x101 must error, not compare the wrong constant"
12650        );
12651        assert!(
12652            encoder
12653                .encode_thumb32_adds(&Reg::R0, &Reg::R0, 0x101)
12654                .is_err()
12655        );
12656        assert!(
12657            encoder
12658                .encode_thumb32_subs(&Reg::R0, &Reg::R0, 0x101)
12659                .is_err()
12660        );
12661        // ...but a valid modified immediate still encodes.
12662        assert!(
12663            encoder
12664                .encode_thumb32_adds(&Reg::R0, &Reg::R0, 0x80)
12665                .is_ok()
12666        );
12667    }
12668
12669    /// #257: MLA (multiply-accumulate) encodes as MLS without the bit-4 op flag.
12670    /// `mla r2, r3, r4, r8` (rd=r2, rn=r3, rm=r4, ra=r8) → Thumb-2 `03 fb 04 82`.
12671    #[test]
12672    fn mla_thumb2_encodes_correctly() {
12673        let encoder = ArmEncoder::new_thumb2();
12674        let code = encoder
12675            .encode(&ArmOp::Mla {
12676                rd: Reg::R2,
12677                rn: Reg::R3,
12678                rm: Reg::R4,
12679                ra: Reg::R8,
12680            })
12681            .unwrap();
12682        // hw1 = 0xFB03, hw2 = (8<<12)|(2<<8)|4 = 0x8204
12683        assert_eq!(code, vec![0x03, 0xfb, 0x04, 0x82]);
12684    }
12685
12686    /// #259: LDR/STR (and sub-word) immediate-offset encoders truncated
12687    /// `offset & 0xFFF`, silently targeting the wrong address for offset >= 4096.
12688    /// They now error (the selector must use register-offset addressing) — the
12689    /// load/store sibling of the #253/#255 class. Offsets <= 4095 still encode.
12690    #[test]
12691    fn ldst_imm12_offset_errors_when_out_of_range() {
12692        let encoder = ArmEncoder::new_thumb2();
12693        // offset 0xFFF (4095): valid → Ok; ldr r0, [r1, #4095].
12694        assert!(
12695            encoder
12696                .encode_thumb32_ldr(&Reg::R0, &Reg::R1, 0xFFF)
12697                .is_ok()
12698        );
12699        // offset 0x1000 (4096): out of imm12 range → Err (not & 0xFFF → #0).
12700        assert!(
12701            encoder
12702                .encode_thumb32_ldr(&Reg::R0, &Reg::R1, 0x1000)
12703                .is_err(),
12704            "ldr offset 4096 must error, not wrap to 0"
12705        );
12706        assert!(
12707            encoder
12708                .encode_thumb32_str(&Reg::R0, &Reg::R1, 0x1000)
12709                .is_err()
12710        );
12711        assert!(
12712            encoder
12713                .encode_thumb32_ldrb_imm(&Reg::R0, &Reg::R1, 5000)
12714                .is_err()
12715        );
12716        assert!(
12717            encoder
12718                .encode_thumb32_strh_imm(&Reg::R0, &Reg::R1, 5000)
12719                .is_err()
12720        );
12721    }
12722
12723    /// Latent miscompile fix: ADD/SUB with a >0xFF immediate (e.g.
12724    /// `add sp, sp, #frame` for a >=256-byte frame) used ADD.W (T3), whose
12725    /// `i:imm3:imm8` is a ThumbExpandImm modified immediate — so `#256` silently
12726    /// encoded as `#0` (stack corruption). Use ADDW/SUBW (T4), a PLAIN 12-bit
12727    /// immediate, for 0x100..=0xFFF; keep T3 for <=0xFF (bit-identical); error
12728    /// beyond 4095.
12729    #[test]
12730    fn add_sub_large_immediate_use_addw_subw_not_misencoded() {
12731        let encoder = ArmEncoder::new_thumb2();
12732        // add sp, sp, #256  →  ADDW (T4) SP, SP, #256  =  0d f2 00 1d
12733        assert_eq!(
12734            encoder
12735                .encode(&ArmOp::Add {
12736                    rd: Reg::SP,
12737                    rn: Reg::SP,
12738                    op2: Operand2::Imm(256),
12739                })
12740                .unwrap(),
12741            vec![0x0d, 0xf2, 0x00, 0x1d],
12742            "add sp,sp,#256 must be ADDW (plain imm12), not a mis-encoded ADD.W"
12743        );
12744        // sub sp, sp, #256  →  SUBW (T4) SP, SP, #256  =  ad f2 00 1d
12745        assert_eq!(
12746            encoder
12747                .encode(&ArmOp::Sub {
12748                    rd: Reg::SP,
12749                    rn: Reg::SP,
12750                    op2: Operand2::Imm(256),
12751                })
12752                .unwrap(),
12753            vec![0xad, 0xf2, 0x00, 0x1d],
12754        );
12755        // > 4095 has no single-instruction encoding → error, not silent wrong.
12756        assert!(
12757            encoder
12758                .encode(&ArmOp::Add {
12759                    rd: Reg::SP,
12760                    rn: Reg::SP,
12761                    op2: Operand2::Imm(5000),
12762                })
12763                .is_err(),
12764            "add #5000 must error (no single ADDW), not mis-encode"
12765        );
12766    }
12767
12768    /// Closes the data-proc immediate class: AND and CMN now go through
12769    /// `try_thumb_expand_imm` like ORR/EOR/CMP — correct for any modified
12770    /// immediate, `Err` (not raw-pack / NOP) on an un-encodable one. The byte
12771    /// range stays bit-identical (`and r2,r0,#0x7e` is unchanged).
12772    #[test]
12773    fn and_cmn_immediate_thumb_expand_else_error() {
12774        let encoder = ArmEncoder::new_thumb2();
12775        // byte range unchanged (bit-identical with the pre-retrofit encoding)
12776        assert_eq!(
12777            encoder
12778                .encode(&ArmOp::And {
12779                    rd: Reg::R2,
12780                    rn: Reg::R0,
12781                    op2: Operand2::Imm(0x7e),
12782                })
12783                .unwrap(),
12784            vec![0x00, 0xf0, 0x7e, 0x02],
12785        );
12786        // a valid replicated modified immediate now encodes (was silently wrong)
12787        assert!(
12788            encoder
12789                .encode(&ArmOp::And {
12790                    rd: Reg::R2,
12791                    rn: Reg::R0,
12792                    op2: Operand2::Imm(0xff00ff00u32 as i32),
12793                })
12794                .is_ok()
12795        );
12796        // a genuinely un-encodable immediate errors (AND was raw-pack; CMN NOP)
12797        assert!(
12798            encoder
12799                .encode(&ArmOp::And {
12800                    rd: Reg::R2,
12801                    rn: Reg::R0,
12802                    op2: Operand2::Imm(0x101),
12803                })
12804                .is_err()
12805        );
12806        assert!(
12807            encoder
12808                .encode(&ArmOp::Cmn {
12809                    rn: Reg::R0,
12810                    op2: Operand2::Imm(0x101),
12811                })
12812                .is_err(),
12813            "CMN #0x101 must error, not emit a NOP"
12814        );
12815    }
12816
12817    /// VCR-RA-001: ORR/EOR with a small immediate must encode the real
12818    /// instruction (not a silent `0xBF00` NOP). Pins the byte range and the
12819    /// Ok-or-Err bound that makes future Or/Eor immediate folding safe.
12820    #[test]
12821    fn orr_eor_immediate_encode_in_byte_range_else_error() {
12822        let encoder = ArmEncoder::new_thumb2();
12823        // orr r2, r0, #0x7e  →  ORR.W T1, imm8=0x7e
12824        assert_eq!(
12825            encoder
12826                .encode(&ArmOp::Orr {
12827                    rd: Reg::R2,
12828                    rn: Reg::R0,
12829                    op2: Operand2::Imm(0x7e),
12830                })
12831                .unwrap(),
12832            vec![0x40, 0xf0, 0x7e, 0x02],
12833        );
12834        // eor r2, r0, #0x7e  →  EOR.W T1, imm8=0x7e
12835        assert_eq!(
12836            encoder
12837                .encode(&ArmOp::Eor {
12838                    rd: Reg::R2,
12839                    rn: Reg::R0,
12840                    op2: Operand2::Imm(0x7e),
12841                })
12842                .unwrap(),
12843            vec![0x80, 0xf0, 0x7e, 0x02],
12844        );
12845        // Out-of-range immediates error rather than silently mis-encode / NOP.
12846        assert!(
12847            encoder
12848                .encode(&ArmOp::Orr {
12849                    rd: Reg::R2,
12850                    rn: Reg::R0,
12851                    op2: Operand2::Imm(0x140),
12852                })
12853                .is_err(),
12854            "ORR #0x140 must error, not emit a NOP"
12855        );
12856    }
12857
12858    #[test]
12859    fn test_encode_mve_different_qregs() {
12860        let encoder = ArmEncoder::new_thumb2();
12861
12862        // Test that different Q-register numbers produce different encodings
12863        let op1 = ArmOp::MveAddI {
12864            qd: QReg::Q0,
12865            qn: QReg::Q0,
12866            qm: QReg::Q0,
12867            size: MveSize::S32,
12868        };
12869        let op2 = ArmOp::MveAddI {
12870            qd: QReg::Q3,
12871            qn: QReg::Q5,
12872            qm: QReg::Q7,
12873            size: MveSize::S32,
12874        };
12875        let code1 = encoder.encode(&op1).unwrap();
12876        let code2 = encoder.encode(&op2).unwrap();
12877        assert_ne!(
12878            code1, code2,
12879            "Different Q-registers should produce different encodings"
12880        );
12881    }
12882
12883    #[test]
12884    fn test_encode_mve_arm32_loud_err() {
12885        // #615: MVE (Helium) is Thumb-2-only. The ARM32 encoder used to emit
12886        // a silent NOP here (dropping the vector op); it must now be a typed
12887        // Err so a broken "MVE implies Thumb" invariant fails loudly.
12888        let encoder = ArmEncoder::new_arm32();
12889        let op = ArmOp::MveAddI {
12890            qd: QReg::Q0,
12891            qn: QReg::Q1,
12892            qm: QReg::Q2,
12893            size: MveSize::S32,
12894        };
12895        let err = encoder
12896            .encode(&op)
12897            .expect_err("ARM32 MVE must be a loud Err, not a silent NOP (#615)");
12898        assert!(
12899            err.to_string().contains("Thumb-2 only"),
12900            "unexpected error message: {err}"
12901        );
12902    }
12903}