Skip to main content

synth_backend/
arm_encoder.rs

1//! ARM Code Encoder - Converts ARM instructions to binary machine code
2//!
3//! Generates ARM32/Thumb-2 machine code from ARM instruction structures
4
5use synth_core::Result;
6use synth_core::target::FPUPrecision;
7use synth_synthesis::contracts::encoding as encoding_contracts;
8use synth_synthesis::{ArmOp, MemAddr, MveSize, Operand2, QReg, Reg, VfpReg};
9
10/// ARM instruction encoding
11pub struct ArmEncoder {
12    /// Use Thumb mode (vs ARM mode)
13    thumb_mode: bool,
14    /// FPU capability for VFP instruction encoding
15    #[allow(dead_code)]
16    fpu: Option<FPUPrecision>,
17}
18
19impl ArmEncoder {
20    /// Create a new ARM encoder in ARM32 mode
21    pub fn new_arm32() -> Self {
22        Self {
23            thumb_mode: false,
24            fpu: None,
25        }
26    }
27
28    /// Create a new ARM encoder in Thumb-2 mode
29    pub fn new_thumb2() -> Self {
30        Self {
31            thumb_mode: true,
32            fpu: None,
33        }
34    }
35
36    /// Create a new Thumb-2 encoder with FPU capability
37    pub fn new_thumb2_with_fpu(fpu: Option<FPUPrecision>) -> Self {
38        Self {
39            thumb_mode: true,
40            fpu,
41        }
42    }
43
44    /// Encode a single ARM instruction to bytes
45    pub fn encode(&self, op: &ArmOp) -> Result<Vec<u8>> {
46        if self.thumb_mode {
47            self.encode_thumb(op)
48        } else {
49            self.encode_arm(op)
50        }
51    }
52
53    /// Encode an ARM instruction in ARM32 mode (32-bit instructions)
54    /// #206: encode an ARM32 (A32) load/store whose address uses a register
55    /// offset (`[rn, rm{, #off}]`). Returns `None` for ops with no register
56    /// offset (the caller falls through to the immediate-form arms). Computes
57    /// `ip = base + rm` then re-encodes the op against `[ip, #off]`, which works
58    /// uniformly for word/byte/halfword/signed forms. IP (R12) is the scratch
59    /// register the selector already treats as clobberable across memory ops.
60    fn encode_arm_reg_offset_mem(&self, op: &ArmOp) -> Result<Option<Vec<u8>>> {
61        use synth_synthesis::Reg;
62        let addr = match op {
63            ArmOp::Ldr { addr, .. }
64            | ArmOp::Str { addr, .. }
65            | ArmOp::Ldrb { addr, .. }
66            | ArmOp::Strb { addr, .. }
67            | ArmOp::Ldrh { addr, .. }
68            | ArmOp::Strh { addr, .. }
69            | ArmOp::Ldrsb { addr, .. }
70            | ArmOp::Ldrsh { addr, .. } => addr,
71            _ => return Ok(None),
72        };
73        let Some(rm) = addr.offset_reg else {
74            return Ok(None);
75        };
76        let ip = Reg::R12;
77        // ADD ip, base, rm  (cond=AL, opcode=ADD, S=0, register operand2)
78        let add: u32 = 0xE0800000
79            | (reg_to_bits(&addr.base) << 16)
80            | (reg_to_bits(&ip) << 12)
81            | reg_to_bits(&rm);
82        let mut bytes = add.to_le_bytes().to_vec();
83        // Re-encode the op against [ip, #off] (immediate form → no offset_reg,
84        // so this recursion hits the immediate arms, not this helper again).
85        let imm_addr = MemAddr::imm(ip, addr.offset);
86        let imm_op = match op {
87            ArmOp::Ldr { rd, .. } => ArmOp::Ldr {
88                rd: *rd,
89                addr: imm_addr,
90            },
91            ArmOp::Str { rd, .. } => ArmOp::Str {
92                rd: *rd,
93                addr: imm_addr,
94            },
95            ArmOp::Ldrb { rd, .. } => ArmOp::Ldrb {
96                rd: *rd,
97                addr: imm_addr,
98            },
99            ArmOp::Strb { rd, .. } => ArmOp::Strb {
100                rd: *rd,
101                addr: imm_addr,
102            },
103            ArmOp::Ldrh { rd, .. } => ArmOp::Ldrh {
104                rd: *rd,
105                addr: imm_addr,
106            },
107            ArmOp::Strh { rd, .. } => ArmOp::Strh {
108                rd: *rd,
109                addr: imm_addr,
110            },
111            ArmOp::Ldrsb { rd, .. } => ArmOp::Ldrsb {
112                rd: *rd,
113                addr: imm_addr,
114            },
115            ArmOp::Ldrsh { rd, .. } => ArmOp::Ldrsh {
116                rd: *rd,
117                addr: imm_addr,
118            },
119            _ => unreachable!(),
120        };
121        bytes.extend(self.encode_arm(&imm_op)?);
122        Ok(Some(bytes))
123    }
124
125    /// #594: A32 expansion of `ArmOp::CallIndirect` — mirror of the Thumb-2
126    /// arm (same contract: R11 holds the function-pointer table base, entry
127    /// `i` is a 4-byte code address, R12 is the encoder-scratch register):
128    ///
129    /// ```text
130    /// MOVW r12, #size        ; #642: table size (compile-time immediate)
131    /// [MOVT r12, #size>>16]  ; only when size exceeds 16 bits
132    /// CMP  idx, r12          ; bounds guard: index >= size must TRAP
133    /// BLO  +1 insn           ; skip the trap when in bounds
134    /// UDF                    ; WASM Core §4.4.8 out-of-bounds trap
135    /// MOV r12, idx, LSL #2   ; table byte offset
136    /// LDR r12, [r11, r12]    ; load function pointer
137    /// BLX r12                ; indirect call
138    /// ```
139    ///
140    /// #650, `table_byte_offset != 0` (a non-zero table of the contiguous
141    /// R11 region): the pointer load becomes
142    /// `ADD r12, r11, r12; LDR r12, [r12, #offset]` — offset 0 keeps the
143    /// single-load form (single-table modules byte-identical by
144    /// construction).
145    ///
146    /// #664, `null_check` (the table has null slots, linked as ZERO words
147    /// per the layout contract): `CMP r12, #0; BNE +1; UDF` between the
148    /// pointer load and the `BLX` — a call reaching an uninitialized slot
149    /// traps (§4.4.8). `false` keeps the expansion byte-identical.
150    ///
151    /// #676, `type_check` (heterogeneous table): the §4.4.8 type check is
152    /// discharged at RUNTIME against the type-id sidecar — after the bounds
153    /// guard, `MOV r12, idx, LSL #2; ADD r12, r11, r12;
154    /// LDR r12, [r12, #type_off]; CMP r12, #expected_id; BEQ +1; UDF`
155    /// (mirror of the Thumb-2 arm; the dispatch tail recomputes `idx*4`).
156    /// Null slots carry the reserved class id 0, subsuming the #664 null
157    /// trap. `None` (every homogeneous table — the verdict discharged at
158    /// COMPILE time by the closed-world verification, see the #642 selector
159    /// guard) emits nothing and keeps the expansion byte-identical.
160    fn encode_arm_call_indirect(
161        table_index_reg: &Reg,
162        table_size: u32,
163        table_byte_offset: u32,
164        null_check: bool,
165        type_check: Option<(u32, u32)>,
166    ) -> Vec<u8> {
167        let idx = reg_to_bits(table_index_reg);
168        let mut bytes = Vec::with_capacity(32);
169        // MOVW r12, #(size & 0xFFFF) — cond=E 0011 0000 imm4 Rd imm12.
170        let size_lo = table_size & 0xFFFF;
171        let movw: u32 = 0xE300_0000 | ((size_lo >> 12) << 16) | (12 << 12) | (size_lo & 0xFFF);
172        bytes.extend_from_slice(&movw.to_le_bytes());
173        // MOVT r12, #(size >> 16) — only for a table size above 16 bits.
174        let size_hi = table_size >> 16;
175        if size_hi != 0 {
176            let movt: u32 = 0xE340_0000 | ((size_hi >> 12) << 16) | (12 << 12) | (size_hi & 0xFFF);
177            bytes.extend_from_slice(&movt.to_le_bytes());
178        }
179        // CMP idx, r12 — cond=E, opcode=1010, S=1, Rn=idx, Rm=r12.
180        let cmp: u32 = 0xE150_000C | (idx << 16);
181        bytes.extend_from_slice(&cmp.to_le_bytes());
182        // BLO +1 insn (skip the UDF when index < size) — cond=LO(0011),
183        // imm24=0: target = branch + 8.
184        bytes.extend_from_slice(&0x3A00_0000u32.to_le_bytes());
185        // UDF — permanently undefined (same trap idiom as the A32 div-by-zero
186        // guards): call_indirect out-of-bounds trap.
187        bytes.extend_from_slice(&0xE7F0_00F0u32.to_le_bytes());
188        // #676: runtime type check for a heterogeneous table — load the
189        // indexed slot's structural class id from the type-id sidecar and
190        // trap on mismatch (§4.4.8). Mirror of the Thumb-2 arm; `None`
191        // emits nothing (homogeneous tables byte-identical by construction).
192        if let Some((expected_id, type_off)) = type_check {
193            debug_assert!(expected_id <= 255, "selector enforces the CMP imm8 range");
194            debug_assert!(type_off <= 4095, "selector enforces the LDR imm12 range");
195            // MOV r12, idx, LSL #2 (same as the dispatch tail's scale).
196            bytes.extend_from_slice(&(0xE1A0C000u32 | (2 << 7) | idx).to_le_bytes());
197            // ADD r12, r11, r12 — data-processing ADD (register).
198            bytes.extend_from_slice(&0xE08BC00Cu32.to_le_bytes());
199            // LDR r12, [r12, #type_off] — immediate offset, P=1 U=1 L=1.
200            bytes.extend_from_slice(&(0xE59CC000u32 | (type_off & 0xFFF)).to_le_bytes());
201            // CMP r12, #expected_id — data-processing CMP (immediate).
202            bytes.extend_from_slice(&(0xE35C_0000u32 | (expected_id & 0xFF)).to_le_bytes());
203            // BEQ +1 insn (skip the UDF when the class id matches) —
204            // cond=EQ(0000), imm24=0: target = branch + 8.
205            bytes.extend_from_slice(&0x0A00_0000u32.to_le_bytes());
206            // UDF — the §4.4.8 type-mismatch trap.
207            bytes.extend_from_slice(&0xE7F0_00F0u32.to_le_bytes());
208        }
209        // MOV r12, idx, LSL #2 — data-processing MOV, register op2 with
210        // imm5=2/LSL: cond=E, opcode=1101, S=0, Rd=r12.
211        let mov: u32 = 0xE1A0C000 | (2 << 7) | idx;
212        bytes.extend_from_slice(&mov.to_le_bytes());
213        if table_byte_offset == 0 {
214            // Table 0 (base = R11 itself): the pre-#650 single-load form.
215            // LDR r12, [r11, r12] — register offset, P=1 U=1 B=0 W=0 L=1.
216            let ldr: u32 = 0xE79BC00C;
217            bytes.extend_from_slice(&ldr.to_le_bytes());
218        } else {
219            // #650: fold the table's compile-time base offset into the
220            // pointer load via the LDR imm12 form.
221            assert!(
222                table_byte_offset <= 4095,
223                "call_indirect table base offset {table_byte_offset} exceeds \
224                 LDR imm12 — the selector must have declined this (#650)"
225            );
226            // ADD r12, r11, r12 — data-processing ADD (register).
227            bytes.extend_from_slice(&0xE08BC00Cu32.to_le_bytes());
228            // LDR r12, [r12, #offset] — immediate offset, P=1 U=1 L=1.
229            let ldr: u32 = 0xE59CC000 | (table_byte_offset & 0xFFF);
230            bytes.extend_from_slice(&ldr.to_le_bytes());
231        }
232        // #664: null-slot trap — only when the table image has null slots
233        // (zero-linked words). A fully-initialized table keeps the pre-#664
234        // bytes identical by construction.
235        if null_check {
236            // CMP r12, #0 — data-processing CMP (immediate), Rn=r12.
237            bytes.extend_from_slice(&0xE35C_0000u32.to_le_bytes());
238            // BNE +1 insn (skip the UDF when the pointer is non-null) —
239            // cond=NE(0001), imm24=0: target = branch + 8.
240            bytes.extend_from_slice(&0x1A00_0000u32.to_le_bytes());
241            // UDF — the §4.4.8 uninitialized-element trap (same idiom as
242            // the bounds guard).
243            bytes.extend_from_slice(&0xE7F0_00F0u32.to_le_bytes());
244        }
245        // BLX r12 — cond=E, 0001 0010 1111 1111 1111 0011, Rm=r12.
246        let blx: u32 = 0xE12FFF3C;
247        bytes.extend_from_slice(&blx.to_le_bytes());
248        bytes
249    }
250
251    /// #615: A32 (ARM-mode) expansions for the multi-instruction ops that the
252    /// Thumb-2 encoder expands but the A32 arm previously encoded as a single
253    /// literal NOP (`0xE1A00000`) — i64 mul / shifts / rotates / comparisons /
254    /// eqz, plus i64 const/load/store/extend/wrap and the i32 SetCond /
255    /// SelectMove pseudo-ops. Each expansion mirrors its Thumb-2 twin's
256    /// register contract and semantics exactly (A32 conditional execution
257    /// replaces the IT blocks). Returns `Ok(None)` for ops this helper does
258    /// not handle; the caller's match encodes or loudly rejects those.
259    fn encode_arm_expanded(&self, op: &ArmOp) -> Result<Option<Vec<u8>>> {
260        use synth_synthesis::Condition;
261
262        /// A32 condition-field bits (instruction bits [31:28]).
263        fn cond_bits(cond: &Condition) -> u32 {
264            match cond {
265                Condition::EQ => 0x0,
266                Condition::NE => 0x1,
267                Condition::HS => 0x2, // CS: unsigned >=
268                Condition::LO => 0x3, // CC: unsigned <
269                Condition::HI => 0x8, // unsigned >
270                Condition::LS => 0x9, // unsigned <=
271                Condition::GE => 0xA,
272                Condition::LT => 0xB,
273                Condition::GT => 0xC,
274                Condition::LE => 0xD,
275            }
276        }
277        fn w(b: &mut Vec<u8>, word: u32) {
278            b.extend_from_slice(&word.to_le_bytes());
279        }
280        /// MOV<cond> rd, #imm (rotated-immediate form; only 0/1 used here).
281        fn mov_cond_imm(b: &mut Vec<u8>, cond: u32, rd: u32, imm: u32) {
282            w(b, (cond << 28) | 0x03A0_0000 | (rd << 12) | imm);
283        }
284        /// After a flag-setting pair: MOV<cond> rd,#1 ; MOV<!cond> rd,#0.
285        fn set_cond(b: &mut Vec<u8>, cond: &Condition, rd: u32) {
286            mov_cond_imm(b, cond_bits(cond), rd, 1);
287            mov_cond_imm(b, cond_bits(&cond.invert()), rd, 0);
288        }
289        /// CMP rn, rm (register form).
290        fn cmp_reg(b: &mut Vec<u8>, rn: u32, rm: u32) {
291            w(b, 0xE150_0000 | (rn << 16) | rm);
292        }
293        /// SBCS rd, rn, rm — the 64-bit compare idiom's high-word subtract.
294        fn sbcs(b: &mut Vec<u8>, rd: u32, rn: u32, rm: u32) {
295            w(b, 0xE0D0_0000 | (rn << 16) | (rd << 12) | rm);
296        }
297        /// MOVW rd, #imm16.
298        fn movw(b: &mut Vec<u8>, rd: u32, v: u32) {
299            w(
300                b,
301                0xE300_0000 | (((v >> 12) & 0xF) << 16) | (rd << 12) | (v & 0xFFF),
302            );
303        }
304        /// MOVT rd, #imm16.
305        fn movt(b: &mut Vec<u8>, rd: u32, v: u32) {
306            w(
307                b,
308                0xE340_0000 | (((v >> 12) & 0xF) << 16) | (rd << 12) | (v & 0xFFF),
309            );
310        }
311        /// Register-controlled shift: MOV rd, rn, <LSL|LSR|ASR> rs.
312        /// `ty`: 0=LSL, 1=LSR, 2=ASR. A32 uses the bottom byte of rs;
313        /// amounts of 32 or more yield 0 (LSL/LSR) or all-sign (ASR) — same
314        /// semantics the Thumb-2 expansions rely on.
315        fn shift_reg(b: &mut Vec<u8>, ty: u32, rd: u32, rn: u32, rs: u32) {
316            w(b, 0xE1A0_0010 | (rd << 12) | (rs << 8) | (ty << 5) | rn);
317        }
318        const LSL: u32 = 0;
319        const LSR: u32 = 1;
320        const ASR: u32 = 2;
321        /// Immediate-shift move: MOV rd, rn, <LSL|LSR|ASR> #imm.
322        fn shift_imm(b: &mut Vec<u8>, ty: u32, rd: u32, rn: u32, imm: u32) {
323            w(
324                b,
325                0xE1A0_0000 | (rd << 12) | ((imm & 0x1F) << 7) | (ty << 5) | rn,
326            );
327        }
328        /// Data-processing register form: `base | rn<<16 | rd<<12 | rm`.
329        /// `base` carries cond/opcode/S (e.g. 0xE090_0000 = ADDS).
330        fn dp_reg(b: &mut Vec<u8>, base: u32, rd: u32, rn: u32, rm: u32) {
331            w(b, base | (rn << 16) | (rd << 12) | rm);
332        }
333        /// ORR rd, rd, rm, LSR #31 — the carry-propagation idiom of the
334        /// shift-subtract division loop (bring rm's MSB into rd's bit 0).
335        fn orr_lsr31(b: &mut Vec<u8>, rd: u32, rm: u32) {
336            w(
337                b,
338                0xE180_0000 | (rd << 16) | (rd << 12) | (31 << 7) | (1 << 5) | rm,
339            );
340        }
341        /// 64-bit two's-complement negate of the lo:hi pair (MVN/MVN/ADDS/ADC).
342        fn negate64(b: &mut Vec<u8>, lo: u32, hi: u32) {
343            w(b, 0xE1E0_0000 | (lo << 12) | lo); //           MVN  lo, lo
344            w(b, 0xE1E0_0000 | (hi << 12) | hi); //           MVN  hi, hi
345            w(b, 0xE290_0001 | (lo << 16) | (lo << 12)); //   ADDS lo, lo, #1
346            w(b, 0xE2A0_0000 | (hi << 16) | (hi << 12)); //   ADC  hi, hi, #0
347        }
348        /// TST x, x ; BPL +4-instructions — the "skip the negate64 when the
349        /// sign bit is clear" guard of the signed div/rem arms.
350        fn skip_negate_if_positive(b: &mut Vec<u8>, x: u32) {
351            w(b, 0xE110_0000 | (x << 16) | x); // TST x, x
352            w(b, 0x5A00_0003); //                 BPL +4 insns (past negate64)
353        }
354        /// The 64-iteration shift-subtract division loop — A32 transcription
355        /// of the Thumb-2 #610 core: dividend R0:R1, divisor R2:R3, quotient
356        /// R4:R5, remainder R6:R7, loop counter in `counter` (R12 or R8).
357        fn div_loop(b: &mut Vec<u8>, counter: u32) {
358            w(b, 0xE3A0_0040 | (counter << 12)); // MOV counter, #64
359            let loop_start = b.len();
360            // quotient <<= 1
361            shift_imm(b, LSL, 5, 5, 1);
362            orr_lsr31(b, 5, 4);
363            shift_imm(b, LSL, 4, 4, 1);
364            // remainder <<= 1, OR in dividend MSB
365            shift_imm(b, LSL, 7, 7, 1);
366            orr_lsr31(b, 7, 6);
367            shift_imm(b, LSL, 6, 6, 1);
368            orr_lsr31(b, 6, 1);
369            // dividend <<= 1
370            shift_imm(b, LSL, 1, 1, 1);
371            orr_lsr31(b, 1, 0);
372            shift_imm(b, LSL, 0, 0, 1);
373            // if remainder >= divisor (64-bit unsigned): subtract, set q bit
374            w(b, 0xE157_0003); // CMP R7, R3      (high words)
375            w(b, 0x8A00_0002); // BHI .subtract   (+2 insns)
376            w(b, 0x3A00_0004); // BLO .next       (+4 insns)
377            w(b, 0xE156_0002); // CMP R6, R2      (low words, highs equal)
378            w(b, 0x3A00_0002); // BLO .next       (+2 insns)
379            w(b, 0xE056_6002); // .subtract: SUBS R6, R6, R2
380            w(b, 0xE0C7_7003); //            SBC  R7, R7, R3
381            w(b, 0xE384_4001); //            ORR  R4, R4, #1
382            // .next: decrement and loop
383            w(b, 0xE250_0001 | (counter << 16) | (counter << 12)); // SUBS counter, #1
384            let diff = (loop_start as i64) - (b.len() as i64 + 8);
385            w(b, 0x1A00_0000 | (((diff / 4) as u32) & 0x00FF_FFFF)); // BNE loop
386        }
387        /// 32-bit population count on working register `x` — A32 transcription
388        /// of the Thumb-2 I64Popcnt per-word core (mul-based fold): `c` is the
389        /// constant register, R12 the shifted temp. Both are clobbered.
390        fn popcnt_word(b: &mut Vec<u8>, x: u32, c: u32) {
391            // x = x - ((x >> 1) & 0x55555555)
392            shift_imm(b, LSR, 12, x, 1);
393            movw(b, c, 0x5555);
394            movt(b, c, 0x5555);
395            dp_reg(b, 0xE000_0000, 12, 12, c); // AND R12, R12, c
396            dp_reg(b, 0xE040_0000, x, x, 12); //  SUB x, x, R12
397            // x = (x & 0x33333333) + ((x >> 2) & 0x33333333)
398            movw(b, c, 0x3333);
399            movt(b, c, 0x3333);
400            dp_reg(b, 0xE000_0000, 12, x, c); //  AND R12, x, c
401            shift_imm(b, LSR, x, x, 2);
402            dp_reg(b, 0xE000_0000, x, x, c); //   AND x, x, c
403            dp_reg(b, 0xE080_0000, x, x, 12); //  ADD x, x, R12
404            // x = (x + (x >> 4)) & 0x0F0F0F0F
405            shift_imm(b, LSR, 12, x, 4);
406            dp_reg(b, 0xE080_0000, x, x, 12); //  ADD x, x, R12
407            movw(b, c, 0x0F0F);
408            movt(b, c, 0x0F0F);
409            dp_reg(b, 0xE000_0000, x, x, c); //   AND x, x, c
410            // x = (x * 0x01010101) >> 24
411            movw(b, c, 0x0101);
412            movt(b, c, 0x0101);
413            w(b, 0xE000_0090 | (x << 16) | (c << 8) | x); // MUL x, x, c
414            shift_imm(b, LSR, x, x, 24);
415        }
416
417        let mut b: Vec<u8> = Vec::new();
418        match op {
419            // SetCond: materialize a flags-predicate as 0/1 — the A32 twin of
420            // the Thumb `ITE cond; MOV rd,#1; MOV rd,#0`.
421            ArmOp::SetCond { rd, cond } => {
422                set_cond(&mut b, cond, reg_to_bits(rd));
423            }
424
425            // SelectMove: conditional register move (Thumb: IT cond; MOV).
426            ArmOp::SelectMove { rd, rm, cond } => {
427                w(
428                    &mut b,
429                    (cond_bits(cond) << 28)
430                        | 0x01A0_0000
431                        | (reg_to_bits(rd) << 12)
432                        | reg_to_bits(rm),
433                );
434            }
435
436            // I64SetCond: compare two i64 register pairs, 0/1 into rd.
437            // EQ/NE: CMP lo,lo; CMPEQ hi,hi (only if lows equal); set.
438            // Ordered: CMP lo,lo; SBCS rd,hi,hi; set — with the same
439            // operand-swap + condition mapping as the Thumb-2 arm.
440            ArmOp::I64SetCond {
441                rd,
442                rn_lo,
443                rn_hi,
444                rm_lo,
445                rm_hi,
446                cond,
447            } => {
448                let rd_b = reg_to_bits(rd);
449                let (n_lo, n_hi, m_lo, m_hi) = (
450                    reg_to_bits(rn_lo),
451                    reg_to_bits(rn_hi),
452                    reg_to_bits(rm_lo),
453                    reg_to_bits(rm_hi),
454                );
455                match cond {
456                    Condition::EQ | Condition::NE => {
457                        cmp_reg(&mut b, n_lo, m_lo);
458                        // CMP<EQ> rn_hi, rm_hi — compare highs only if lows equal.
459                        w(&mut b, 0x0150_0000 | (n_hi << 16) | m_hi);
460                        set_cond(&mut b, cond, rd_b);
461                    }
462                    // (swap operands?, condition after SBCS) per the Thumb arm:
463                    // LT/GE/LO/HS compare (rn, rm); GT/LE/HI/LS swap to (rm, rn).
464                    Condition::LT => {
465                        cmp_reg(&mut b, n_lo, m_lo);
466                        sbcs(&mut b, rd_b, n_hi, m_hi);
467                        set_cond(&mut b, &Condition::LT, rd_b);
468                    }
469                    Condition::GE => {
470                        cmp_reg(&mut b, n_lo, m_lo);
471                        sbcs(&mut b, rd_b, n_hi, m_hi);
472                        set_cond(&mut b, &Condition::GE, rd_b);
473                    }
474                    Condition::GT => {
475                        cmp_reg(&mut b, m_lo, n_lo);
476                        sbcs(&mut b, rd_b, m_hi, n_hi);
477                        set_cond(&mut b, &Condition::LT, rd_b);
478                    }
479                    Condition::LE => {
480                        cmp_reg(&mut b, m_lo, n_lo);
481                        sbcs(&mut b, rd_b, m_hi, n_hi);
482                        set_cond(&mut b, &Condition::GE, rd_b);
483                    }
484                    Condition::LO => {
485                        cmp_reg(&mut b, n_lo, m_lo);
486                        sbcs(&mut b, rd_b, n_hi, m_hi);
487                        set_cond(&mut b, &Condition::LO, rd_b);
488                    }
489                    Condition::HS => {
490                        cmp_reg(&mut b, n_lo, m_lo);
491                        sbcs(&mut b, rd_b, n_hi, m_hi);
492                        set_cond(&mut b, &Condition::HS, rd_b);
493                    }
494                    Condition::HI => {
495                        cmp_reg(&mut b, m_lo, n_lo);
496                        sbcs(&mut b, rd_b, m_hi, n_hi);
497                        set_cond(&mut b, &Condition::LO, rd_b);
498                    }
499                    Condition::LS => {
500                        cmp_reg(&mut b, m_lo, n_lo);
501                        sbcs(&mut b, rd_b, m_hi, n_hi);
502                        set_cond(&mut b, &Condition::HS, rd_b);
503                    }
504                }
505            }
506
507            // I64SetCondZ: ORRS rd, lo, hi sets Z iff the pair is zero.
508            ArmOp::I64SetCondZ { rd, rn_lo, rn_hi } => {
509                let rd_b = reg_to_bits(rd);
510                w(
511                    &mut b,
512                    0xE190_0000 | (reg_to_bits(rn_lo) << 16) | (rd_b << 12) | reg_to_bits(rn_hi),
513                );
514                set_cond(&mut b, &Condition::EQ, rd_b);
515            }
516
517            // i64 comparison wrappers: delegate to I64SetCond/Z, mirroring the
518            // Thumb-2 delegation arms.
519            ArmOp::I64Eqz { rd, rnlo, rnhi } => {
520                return self
521                    .encode_arm(&ArmOp::I64SetCondZ {
522                        rd: *rd,
523                        rn_lo: *rnlo,
524                        rn_hi: *rnhi,
525                    })
526                    .map(Some);
527            }
528            ArmOp::I64Eq {
529                rd,
530                rnlo,
531                rnhi,
532                rmlo,
533                rmhi,
534            }
535            | ArmOp::I64Ne {
536                rd,
537                rnlo,
538                rnhi,
539                rmlo,
540                rmhi,
541            }
542            | ArmOp::I64LtS {
543                rd,
544                rnlo,
545                rnhi,
546                rmlo,
547                rmhi,
548            }
549            | ArmOp::I64LtU {
550                rd,
551                rnlo,
552                rnhi,
553                rmlo,
554                rmhi,
555            }
556            | ArmOp::I64LeS {
557                rd,
558                rnlo,
559                rnhi,
560                rmlo,
561                rmhi,
562            }
563            | ArmOp::I64LeU {
564                rd,
565                rnlo,
566                rnhi,
567                rmlo,
568                rmhi,
569            }
570            | ArmOp::I64GtS {
571                rd,
572                rnlo,
573                rnhi,
574                rmlo,
575                rmhi,
576            }
577            | ArmOp::I64GtU {
578                rd,
579                rnlo,
580                rnhi,
581                rmlo,
582                rmhi,
583            }
584            | ArmOp::I64GeS {
585                rd,
586                rnlo,
587                rnhi,
588                rmlo,
589                rmhi,
590            }
591            | ArmOp::I64GeU {
592                rd,
593                rnlo,
594                rnhi,
595                rmlo,
596                rmhi,
597            } => {
598                let cond = match op {
599                    ArmOp::I64Eq { .. } => Condition::EQ,
600                    ArmOp::I64Ne { .. } => Condition::NE,
601                    ArmOp::I64LtS { .. } => Condition::LT,
602                    ArmOp::I64LtU { .. } => Condition::LO,
603                    ArmOp::I64LeS { .. } => Condition::LE,
604                    ArmOp::I64LeU { .. } => Condition::LS,
605                    ArmOp::I64GtS { .. } => Condition::GT,
606                    ArmOp::I64GtU { .. } => Condition::HI,
607                    ArmOp::I64GeS { .. } => Condition::GE,
608                    _ => Condition::HS,
609                };
610                return self
611                    .encode_arm(&ArmOp::I64SetCond {
612                        rd: *rd,
613                        rn_lo: *rnlo,
614                        rn_hi: *rnhi,
615                        rm_lo: *rmlo,
616                        rm_hi: *rmhi,
617                        cond,
618                    })
619                    .map(Some);
620            }
621
622            // I64Mul: cross products into R12, then UMULL — same sequence and
623            // ordering as the Thumb-2 arm (R12 is encoder scratch, #212).
624            ArmOp::I64Mul {
625                rd_lo,
626                rd_hi,
627                rn_lo,
628                rn_hi,
629                rm_lo,
630                rm_hi,
631            } => {
632                let (dl, dh) = (reg_to_bits(rd_lo), reg_to_bits(rd_hi));
633                let (nl, nh) = (reg_to_bits(rn_lo), reg_to_bits(rn_hi));
634                let (ml, mh) = (reg_to_bits(rm_lo), reg_to_bits(rm_hi));
635                // MUL R12, rn_lo, rm_hi   (R12 = a_lo * b_hi)
636                w(&mut b, 0xE000_0090 | (12 << 16) | (mh << 8) | nl);
637                // MLA R12, rn_hi, rm_lo, R12  (R12 += a_hi * b_lo)
638                w(
639                    &mut b,
640                    0xE020_0090 | (12 << 16) | (12 << 12) | (ml << 8) | nh,
641                );
642                // UMULL rd_lo, rd_hi, rn_lo, rm_lo
643                w(
644                    &mut b,
645                    0xE080_0090 | (dh << 16) | (dl << 12) | (ml << 8) | nl,
646                );
647                // ADD rd_hi, rd_hi, R12
648                w(&mut b, 0xE080_0000 | (dh << 16) | (dh << 12) | 12);
649            }
650
651            // I64Shl / I64ShrU / I64ShrS: same small/large-shift structure as
652            // the Thumb-2 arms (rm_hi is the scratch register; amounts are
653            // masked to 6 bits; register-controlled shifts >= 32 yield 0,
654            // which the small path relies on for n = 0).
655            ArmOp::I64Shl {
656                rd_lo,
657                rd_hi,
658                rn_lo,
659                rn_hi,
660                rm_lo,
661                rm_hi,
662            } => {
663                let (dl, dh) = (reg_to_bits(rd_lo), reg_to_bits(rd_hi));
664                let (nl, nh) = (reg_to_bits(rn_lo), reg_to_bits(rn_hi));
665                let (ml, mh) = (reg_to_bits(rm_lo), reg_to_bits(rm_hi));
666                w(&mut b, 0xE200_003F | (ml << 16) | (ml << 12)); // AND  ml, ml, #63
667                w(&mut b, 0xE250_0020 | (ml << 16) | (mh << 12)); // SUBS mh, ml, #32
668                w(&mut b, 0x5A00_0005); //                            BPL  .large
669                w(&mut b, 0xE260_0020 | (ml << 16) | (mh << 12)); // RSB  mh, ml, #32
670                shift_reg(&mut b, LSR, mh, nl, mh); //               mh = lo >> (32-n)
671                shift_reg(&mut b, LSL, dh, nh, ml); //               dh = hi << n
672                w(&mut b, 0xE180_0000 | (dh << 16) | (dh << 12) | mh); // ORR dh, dh, mh
673                shift_reg(&mut b, LSL, dl, nl, ml); //               dl = lo << n
674                w(&mut b, 0xEA00_0001); //                            B    .done
675                shift_reg(&mut b, LSL, dh, nl, mh); //               .large: dh = lo << (n-32)
676                w(&mut b, 0xE3A0_0000 | (dl << 12)); //              MOV  dl, #0
677            }
678            ArmOp::I64ShrU {
679                rd_lo,
680                rd_hi,
681                rn_lo,
682                rn_hi,
683                rm_lo,
684                rm_hi,
685            } => {
686                let (dl, dh) = (reg_to_bits(rd_lo), reg_to_bits(rd_hi));
687                let (nl, nh) = (reg_to_bits(rn_lo), reg_to_bits(rn_hi));
688                let (ml, mh) = (reg_to_bits(rm_lo), reg_to_bits(rm_hi));
689                w(&mut b, 0xE200_003F | (ml << 16) | (ml << 12)); // AND  ml, ml, #63
690                w(&mut b, 0xE250_0020 | (ml << 16) | (mh << 12)); // SUBS mh, ml, #32
691                w(&mut b, 0x5A00_0005); //                            BPL  .large
692                w(&mut b, 0xE260_0020 | (ml << 16) | (mh << 12)); // RSB  mh, ml, #32
693                shift_reg(&mut b, LSL, mh, nh, mh); //               mh = hi << (32-n)
694                shift_reg(&mut b, LSR, dl, nl, ml); //               dl = lo >> n
695                w(&mut b, 0xE180_0000 | (dl << 16) | (dl << 12) | mh); // ORR dl, dl, mh
696                shift_reg(&mut b, LSR, dh, nh, ml); //               dh = hi >> n
697                w(&mut b, 0xEA00_0001); //                            B    .done
698                shift_reg(&mut b, LSR, dl, nh, mh); //               .large: dl = hi >> (n-32)
699                w(&mut b, 0xE3A0_0000 | (dh << 12)); //              MOV  dh, #0
700            }
701            ArmOp::I64ShrS {
702                rd_lo,
703                rd_hi,
704                rn_lo,
705                rn_hi,
706                rm_lo,
707                rm_hi,
708            } => {
709                let (dl, dh) = (reg_to_bits(rd_lo), reg_to_bits(rd_hi));
710                let (nl, nh) = (reg_to_bits(rn_lo), reg_to_bits(rn_hi));
711                let (ml, mh) = (reg_to_bits(rm_lo), reg_to_bits(rm_hi));
712                w(&mut b, 0xE200_003F | (ml << 16) | (ml << 12)); // AND  ml, ml, #63
713                w(&mut b, 0xE250_0020 | (ml << 16) | (mh << 12)); // SUBS mh, ml, #32
714                w(&mut b, 0x5A00_0005); //                            BPL  .large
715                w(&mut b, 0xE260_0020 | (ml << 16) | (mh << 12)); // RSB  mh, ml, #32
716                shift_reg(&mut b, LSL, mh, nh, mh); //               mh = hi << (32-n)
717                shift_reg(&mut b, LSR, dl, nl, ml); //               dl = lo >> n
718                w(&mut b, 0xE180_0000 | (dl << 16) | (dl << 12) | mh); // ORR dl, dl, mh
719                shift_reg(&mut b, ASR, dh, nh, ml); //               dh = hi >> n (arith)
720                w(&mut b, 0xEA00_0001); //                            B    .done
721                shift_reg(&mut b, ASR, dl, nh, mh); //               .large: dl = hi >> (n-32)
722                w(&mut b, 0xE1A0_0040 | (dh << 12) | (31 << 7) | nh); // ASR dh, nh, #31
723            }
724
725            // I64Rotl / I64Rotr: the #610 fixed-ABI wrapper (A32 form) around
726            // the same fixed-register core as the Thumb-2 arms — value in
727            // R0:R1, amount in R2, scratch R3 + R12.
728            ArmOp::I64Rotl {
729                rdlo,
730                rdhi,
731                rnlo,
732                rnhi,
733                shift,
734            } => {
735                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, shift]);
736                for word in [
737                    0xE202_203Fu32, // AND  R2, R2, #63   (mask amount mod 64)
738                    0xE252_3020,    // SUBS R3, R2, #32   (R3 = n-32, sets N)
739                    0x5A00_0007,    // BPL  .large        (n >= 32)
740                    // --- small rotation (n < 32) ---
741                    0xE262_3020, // RSB  R3, R2, #32   (R3 = 32-n)
742                    0xE1A0_C330, // LSR  R12, R0, R3   (lo >> (32-n))
743                    0xE1A0_3331, // LSR  R3, R1, R3    (hi >> (32-n))
744                    0xE1A0_1211, // LSL  R1, R1, R2    (hi << n)
745                    0xE181_100C, // ORR  R1, R1, R12   (new_hi)
746                    0xE1A0_0210, // LSL  R0, R0, R2    (lo << n)
747                    0xE180_0003, // ORR  R0, R0, R3    (new_lo)
748                    0xEA00_0007, // B    .done
749                    // --- large rotation (n >= 32), R3 = m = n-32 ---
750                    0xE263_2020, // RSB  R2, R3, #32   (R2 = 32-m = 64-n)
751                    0xE1A0_C231, // LSR  R12, R1, R2   (hi >> (64-n))
752                    0xE1A0_2230, // LSR  R2, R0, R2    (lo >> (64-n))
753                    0xE1A0_0310, // LSL  R0, R0, R3    (lo << m)
754                    0xE1A0_1311, // LSL  R1, R1, R3    (hi << m)
755                    0xE180_C00C, // ORR  R12, R0, R12  (new_hi = (lo<<m)|(hi>>(64-n)))
756                    0xE181_0002, // ORR  R0, R1, R2    (new_lo = (hi<<m)|(lo>>(64-n)))
757                    0xE1A0_100C, // MOV  R1, R12       (new_hi into place)
758                ] {
759                    w(&mut b, word);
760                }
761                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
762            }
763            ArmOp::I64Rotr {
764                rdlo,
765                rdhi,
766                rnlo,
767                rnhi,
768                shift,
769            } => {
770                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, shift]);
771                for word in [
772                    0xE202_203Fu32, // AND  R2, R2, #63   (mask amount mod 64)
773                    0xE252_3020,    // SUBS R3, R2, #32   (R3 = n-32, sets N)
774                    0x5A00_0007,    // BPL  .large        (n >= 32)
775                    // --- small rotation (n < 32) ---
776                    0xE262_3020, // RSB  R3, R2, #32   (R3 = 32-n)
777                    0xE1A0_C311, // LSL  R12, R1, R3   (hi << (32-n))
778                    0xE1A0_3310, // LSL  R3, R0, R3    (lo << (32-n))
779                    0xE1A0_0230, // LSR  R0, R0, R2    (lo >> n)
780                    0xE180_000C, // ORR  R0, R0, R12   (new_lo)
781                    0xE1A0_1231, // LSR  R1, R1, R2    (hi >> n)
782                    0xE181_1003, // ORR  R1, R1, R3    (new_hi)
783                    0xEA00_0007, // B    .done
784                    // --- large rotation (n >= 32), R3 = m = n-32 ---
785                    0xE263_2020, // RSB  R2, R3, #32   (R2 = 32-m = 64-n)
786                    0xE1A0_C210, // LSL  R12, R0, R2   (lo << (64-n))
787                    0xE1A0_2211, // LSL  R2, R1, R2    (hi << (64-n))
788                    0xE1A0_1331, // LSR  R1, R1, R3    (hi >> m)
789                    0xE181_C00C, // ORR  R12, R1, R12  (new_lo = (hi>>m)|(lo<<(64-n)))
790                    0xE1A0_1330, // LSR  R1, R0, R3    (lo >> m)
791                    0xE181_1002, // ORR  R1, R1, R2    (new_hi = (lo>>m)|(hi<<(64-n)))
792                    0xE1A0_000C, // MOV  R0, R12       (new_lo into place)
793                ] {
794                    w(&mut b, word);
795                }
796                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
797            }
798
799            // I64Clz: CLZ(hi), or 32 + CLZ(lo) when hi == 0. Conditional
800            // execution replaces the Thumb branches; like the Thumb arm, the
801            // high word of the result pair (rnhi) is cleared last.
802            ArmOp::I64Clz { rd, rnlo, rnhi } => {
803                let (rd_b, lo, hi) = (reg_to_bits(rd), reg_to_bits(rnlo), reg_to_bits(rnhi));
804                w(&mut b, 0xE350_0000 | (hi << 16)); //              CMP   rnhi, #0
805                w(&mut b, 0x116F_0F10 | (rd_b << 12) | hi); //       CLZNE rd, rnhi
806                w(&mut b, 0x016F_0F10 | (rd_b << 12) | lo); //       CLZEQ rd, rnlo
807                w(&mut b, 0x0280_0020 | (rd_b << 16) | (rd_b << 12)); // ADDEQ rd, rd, #32
808                w(&mut b, 0xE3A0_0000 | (hi << 12)); //              MOV   rnhi, #0
809            }
810
811            // I64Ctz: CLZ(RBIT(lo)), or 32 + CLZ(RBIT(hi)) when lo == 0.
812            // RBIT/CLZ leave the flags intact, so the CMP's Z survives to the
813            // conditional ADD.
814            ArmOp::I64Ctz { rd, rnlo, rnhi } => {
815                let (rd_b, lo, hi) = (reg_to_bits(rd), reg_to_bits(rnlo), reg_to_bits(rnhi));
816                w(&mut b, 0xE350_0000 | (lo << 16)); //              CMP    rnlo, #0
817                w(&mut b, 0x16FF_0F30 | (rd_b << 12) | lo); //       RBITNE rd, rnlo
818                w(&mut b, 0x06FF_0F30 | (rd_b << 12) | hi); //       RBITEQ rd, rnhi
819                w(&mut b, 0xE16F_0F10 | (rd_b << 12) | rd_b); //     CLZ    rd, rd
820                w(&mut b, 0x0280_0020 | (rd_b << 16) | (rd_b << 12)); // ADDEQ rd, rd, #32
821                w(&mut b, 0xE3A0_0000 | (hi << 12)); //              MOV    rnhi, #0
822            }
823
824            // I64Const: MOVW/MOVT per half (MOVT elided when the half fits in
825            // 16 bits, mirroring the Thumb-2 arm).
826            ArmOp::I64Const { rdlo, rdhi, value } => {
827                let lo32 = *value as u32;
828                let hi32 = (*value >> 32) as u32;
829                movw(&mut b, reg_to_bits(rdlo), lo32 & 0xFFFF);
830                if lo32 > 0xFFFF {
831                    movt(&mut b, reg_to_bits(rdlo), lo32 >> 16);
832                }
833                movw(&mut b, reg_to_bits(rdhi), hi32 & 0xFFFF);
834                if hi32 > 0xFFFF {
835                    movt(&mut b, reg_to_bits(rdhi), hi32 >> 16);
836                }
837            }
838
839            // I64Ldr / I64Str: two word accesses at [base, #off] / #off+4.
840            // A register offset is materialized into IP once (the #206/#372
841            // hazard: dropping it would read the wrong address).
842            ArmOp::I64Ldr { rdlo, rdhi, addr } | ArmOp::I64Str { rdlo, rdhi, addr } => {
843                let base = if let Some(rm) = addr.offset_reg {
844                    // ADD ip, base, rm
845                    w(
846                        &mut b,
847                        0xE080_0000
848                            | (reg_to_bits(&addr.base) << 16)
849                            | (12 << 12)
850                            | reg_to_bits(&rm),
851                    );
852                    12
853                } else {
854                    reg_to_bits(&addr.base)
855                };
856                if addr.offset < 0 || addr.offset > 0xFFB {
857                    return Err(synth_core::Error::synthesis(format!(
858                        "i64 load/store offset {} out of the A32 imm12 range (0..=4091) — materialize the offset into a register",
859                        addr.offset
860                    )));
861                }
862                let off = addr.offset as u32;
863                let opc: u32 = if matches!(op, ArmOp::I64Ldr { .. }) {
864                    0xE590_0000 // LDR
865                } else {
866                    0xE580_0000 // STR
867                };
868                w(&mut b, opc | (base << 16) | (reg_to_bits(rdlo) << 12) | off);
869                w(
870                    &mut b,
871                    opc | (base << 16) | (reg_to_bits(rdhi) << 12) | (off + 4),
872                );
873            }
874
875            // I64ExtendI32S: rdlo = rn; rdhi = rdlo >> 31 (arithmetic).
876            ArmOp::I64ExtendI32S { rdlo, rdhi, rn } => {
877                if rdlo != rn {
878                    w(
879                        &mut b,
880                        0xE1A0_0000 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rn),
881                    );
882                }
883                w(
884                    &mut b,
885                    0xE1A0_0040 | (reg_to_bits(rdhi) << 12) | (31 << 7) | reg_to_bits(rdlo),
886                );
887            }
888
889            // I64ExtendI32U: rdlo = rn; rdhi = 0.
890            ArmOp::I64ExtendI32U { rdlo, rdhi, rn } => {
891                if rdlo != rn {
892                    w(
893                        &mut b,
894                        0xE1A0_0000 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rn),
895                    );
896                }
897                w(&mut b, 0xE3A0_0000 | (reg_to_bits(rdhi) << 12));
898            }
899
900            // I64Extend8S / I64Extend16S: SXTB/SXTH then sign-fill the high word.
901            ArmOp::I64Extend8S { rdlo, rdhi, rnlo } => {
902                w(
903                    &mut b,
904                    0xE6AF_0070 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rnlo),
905                );
906                w(
907                    &mut b,
908                    0xE1A0_0040 | (reg_to_bits(rdhi) << 12) | (31 << 7) | reg_to_bits(rdlo),
909                );
910            }
911            ArmOp::I64Extend16S { rdlo, rdhi, rnlo } => {
912                w(
913                    &mut b,
914                    0xE6BF_0070 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rnlo),
915                );
916                w(
917                    &mut b,
918                    0xE1A0_0040 | (reg_to_bits(rdhi) << 12) | (31 << 7) | reg_to_bits(rdlo),
919                );
920            }
921            ArmOp::I64Extend32S { rdlo, rdhi, rnlo } => {
922                if rdlo != rnlo {
923                    w(
924                        &mut b,
925                        0xE1A0_0000 | (reg_to_bits(rdlo) << 12) | reg_to_bits(rnlo),
926                    );
927                }
928                w(
929                    &mut b,
930                    0xE1A0_0040 | (reg_to_bits(rdhi) << 12) | (31 << 7) | reg_to_bits(rnlo),
931                );
932            }
933
934            // I32WrapI64: take the low word. When rd == rnlo this is a genuine
935            // no-op (the one case where a NOP word is the correct encoding).
936            ArmOp::I32WrapI64 { rd, rnlo } => {
937                w(
938                    &mut b,
939                    0xE1A0_0000 | (reg_to_bits(rd) << 12) | reg_to_bits(rnlo),
940                );
941            }
942
943            // I64Add / I64Sub: the classic pair — ADDS lo + ADC hi (SUBS/SBC).
944            // The selector emits these as separate Adds/Adc ops; the fused
945            // variants are verification-constructed, but they encode for real.
946            ArmOp::I64Add {
947                rdlo,
948                rdhi,
949                rnlo,
950                rnhi,
951                rmlo,
952                rmhi,
953            } => {
954                dp_reg(
955                    &mut b,
956                    0xE090_0000, // ADDS
957                    reg_to_bits(rdlo),
958                    reg_to_bits(rnlo),
959                    reg_to_bits(rmlo),
960                );
961                dp_reg(
962                    &mut b,
963                    0xE0A0_0000, // ADC
964                    reg_to_bits(rdhi),
965                    reg_to_bits(rnhi),
966                    reg_to_bits(rmhi),
967                );
968            }
969            ArmOp::I64Sub {
970                rdlo,
971                rdhi,
972                rnlo,
973                rnhi,
974                rmlo,
975                rmhi,
976            } => {
977                dp_reg(
978                    &mut b,
979                    0xE050_0000, // SUBS
980                    reg_to_bits(rdlo),
981                    reg_to_bits(rnlo),
982                    reg_to_bits(rmlo),
983                );
984                dp_reg(
985                    &mut b,
986                    0xE0C0_0000, // SBC
987                    reg_to_bits(rdhi),
988                    reg_to_bits(rnhi),
989                    reg_to_bits(rmhi),
990                );
991            }
992
993            // I64And / I64Or / I64Xor: two independent word ops.
994            ArmOp::I64And {
995                rdlo,
996                rdhi,
997                rnlo,
998                rnhi,
999                rmlo,
1000                rmhi,
1001            }
1002            | ArmOp::I64Or {
1003                rdlo,
1004                rdhi,
1005                rnlo,
1006                rnhi,
1007                rmlo,
1008                rmhi,
1009            }
1010            | ArmOp::I64Xor {
1011                rdlo,
1012                rdhi,
1013                rnlo,
1014                rnhi,
1015                rmlo,
1016                rmhi,
1017            } => {
1018                let base = match op {
1019                    ArmOp::I64And { .. } => 0xE000_0000, // AND
1020                    ArmOp::I64Or { .. } => 0xE180_0000,  // ORR
1021                    _ => 0xE020_0000,                    // EOR
1022                };
1023                dp_reg(
1024                    &mut b,
1025                    base,
1026                    reg_to_bits(rdlo),
1027                    reg_to_bits(rnlo),
1028                    reg_to_bits(rmlo),
1029                );
1030                dp_reg(
1031                    &mut b,
1032                    base,
1033                    reg_to_bits(rdhi),
1034                    reg_to_bits(rnhi),
1035                    reg_to_bits(rmhi),
1036                );
1037            }
1038
1039            // I64DivU: binary long division — A32 transcription of the Thumb-2
1040            // #610/#613 arm (fixed-ABI marshal, zero-divisor trap, 64-round
1041            // shift-subtract core, quotient to R0:R1, result to rd pair).
1042            ArmOp::I64DivU {
1043                rdlo,
1044                rdhi,
1045                rnlo,
1046                rnhi,
1047                rmlo,
1048                rmhi,
1049                elide_zero_guard,
1050            } => {
1051                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, rmlo, rmhi]);
1052                // #494 phase 2b: elided only under a certificate-discharged
1053                // UNSAT(P ∧ divisor == 0) obligation (fact-spec pass).
1054                if !elide_zero_guard {
1055                    emit_a32_i64_divisor_zero_trap(&mut b);
1056                }
1057                w(&mut b, 0xE92D_00F0); // PUSH {R4-R7}
1058                for r in 4..8u32 {
1059                    w(&mut b, 0xE3A0_0000 | (r << 12)); // MOV Rr, #0
1060                }
1061                div_loop(&mut b, 12); // counter in R12 (encoder scratch)
1062                w(&mut b, 0xE1A0_0004); // MOV R0, R4 (quotient lo)
1063                w(&mut b, 0xE1A0_1005); // MOV R1, R5 (quotient hi)
1064                w(&mut b, 0xE8BD_00F0); // POP {R4-R7}
1065                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
1066            }
1067
1068            // I64DivS: sign-extract, unsigned core, conditional negate —
1069            // A32 transcription of the Thumb-2 arm.
1070            ArmOp::I64DivS {
1071                rdlo,
1072                rdhi,
1073                rnlo,
1074                rnhi,
1075                rmlo,
1076                rmhi,
1077                elide_zero_guard,
1078                elide_overflow_guard,
1079            } => {
1080                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, rmlo, rmhi]);
1081                // #494 phase 2b: two INDEPENDENT guards, two INDEPENDENT
1082                // obligations. The zero guard falls to UNSAT(P ∧ divisor == 0);
1083                // the #633 overflow guard falls ONLY to
1084                // UNSAT(P ∧ dividend == INT64_MIN ∧ divisor == -1) — a
1085                // divisor-nonzero fact alone must keep it.
1086                if !elide_zero_guard {
1087                    emit_a32_i64_divisor_zero_trap(&mut b);
1088                }
1089                if !elide_overflow_guard {
1090                    // #633: INT64_MIN / -1 overflows — trap like the i32 path
1091                    // (rem_s stays guard-free: rem_s(INT64_MIN, -1) == 0).
1092                    emit_a32_i64_divs_overflow_trap(&mut b);
1093                }
1094                w(&mut b, 0xE92D_0FF0); // PUSH {R4-R11}
1095                w(&mut b, 0xE021_9003); // EOR R9, R1, R3 (result sign in MSB)
1096                skip_negate_if_positive(&mut b, 1);
1097                negate64(&mut b, 0, 1);
1098                skip_negate_if_positive(&mut b, 3);
1099                negate64(&mut b, 2, 3);
1100                for r in 4..8u32 {
1101                    w(&mut b, 0xE3A0_0000 | (r << 12)); // MOV Rr, #0
1102                }
1103                div_loop(&mut b, 8); // counter in R8 (saved above)
1104                w(&mut b, 0xE1A0_0004); // MOV R0, R4
1105                w(&mut b, 0xE1A0_1005); // MOV R1, R5
1106                skip_negate_if_positive(&mut b, 9);
1107                negate64(&mut b, 0, 1);
1108                w(&mut b, 0xE8BD_0FF0); // POP {R4-R11}
1109                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
1110            }
1111
1112            // I64RemU: same core as I64DivU, returns the remainder (R6:R7).
1113            ArmOp::I64RemU {
1114                rdlo,
1115                rdhi,
1116                rnlo,
1117                rnhi,
1118                rmlo,
1119                rmhi,
1120                elide_zero_guard,
1121            } => {
1122                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, rmlo, rmhi]);
1123                if !elide_zero_guard {
1124                    emit_a32_i64_divisor_zero_trap(&mut b);
1125                }
1126                w(&mut b, 0xE92D_01F0); // PUSH {R4-R8}
1127                for r in 4..8u32 {
1128                    w(&mut b, 0xE3A0_0000 | (r << 12)); // MOV Rr, #0
1129                }
1130                div_loop(&mut b, 8);
1131                w(&mut b, 0xE1A0_0006); // MOV R0, R6 (remainder lo)
1132                w(&mut b, 0xE1A0_1007); // MOV R1, R7 (remainder hi)
1133                w(&mut b, 0xE8BD_01F0); // POP {R4-R8}
1134                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
1135            }
1136
1137            // I64RemS: remainder takes the DIVIDEND's sign (WASM semantics).
1138            ArmOp::I64RemS {
1139                rdlo,
1140                rdhi,
1141                rnlo,
1142                rnhi,
1143                rmlo,
1144                rmhi,
1145                elide_zero_guard,
1146            } => {
1147                emit_a32_i64_fixed_abi_entry(&mut b, &[rnlo, rnhi, rmlo, rmhi]);
1148                if !elide_zero_guard {
1149                    emit_a32_i64_divisor_zero_trap(&mut b);
1150                }
1151                w(&mut b, 0xE92D_0FF0); // PUSH {R4-R11}
1152                w(&mut b, 0xE1A0_9001); // MOV R9, R1 (dividend sign)
1153                skip_negate_if_positive(&mut b, 1);
1154                negate64(&mut b, 0, 1);
1155                skip_negate_if_positive(&mut b, 3);
1156                negate64(&mut b, 2, 3);
1157                for r in 4..8u32 {
1158                    w(&mut b, 0xE3A0_0000 | (r << 12)); // MOV Rr, #0
1159                }
1160                div_loop(&mut b, 8);
1161                w(&mut b, 0xE1A0_0006); // MOV R0, R6
1162                w(&mut b, 0xE1A0_1007); // MOV R1, R7
1163                skip_negate_if_positive(&mut b, 9);
1164                negate64(&mut b, 0, 1);
1165                w(&mut b, 0xE8BD_0FF0); // POP {R4-R11}
1166                emit_a32_i64_fixed_abi_exit(&mut b, rdlo, rdhi)?;
1167            }
1168
1169            // Popcnt (i32): bit-twiddle expansion (no native A32 popcount),
1170            // mirroring the Thumb-2 arm's register contract (R11 + R12 as
1171            // scratch, shift-add fold, final AND #0x3F).
1172            ArmOp::Popcnt { rd, rm } => {
1173                let rd_b = reg_to_bits(rd);
1174                if rd != rm {
1175                    w(&mut b, 0xE1A0_0000 | (rd_b << 12) | reg_to_bits(rm)); // MOV rd, rm
1176                }
1177                // x = x - ((x >> 1) & 0x55555555)
1178                movw(&mut b, 12, 0x5555);
1179                movt(&mut b, 12, 0x5555);
1180                shift_imm(&mut b, LSR, 11, rd_b, 1);
1181                dp_reg(&mut b, 0xE000_0000, 11, 11, 12); // AND R11, R11, R12
1182                dp_reg(&mut b, 0xE040_0000, rd_b, rd_b, 11); // SUB rd, rd, R11
1183                // x = (x & 0x33333333) + ((x >> 2) & 0x33333333)
1184                movw(&mut b, 12, 0x3333);
1185                movt(&mut b, 12, 0x3333);
1186                dp_reg(&mut b, 0xE000_0000, 11, rd_b, 12); // AND R11, rd, R12
1187                shift_imm(&mut b, LSR, rd_b, rd_b, 2);
1188                dp_reg(&mut b, 0xE000_0000, rd_b, rd_b, 12); // AND rd, rd, R12
1189                dp_reg(&mut b, 0xE080_0000, rd_b, rd_b, 11); // ADD rd, rd, R11
1190                // x = (x + (x >> 4)) & 0x0F0F0F0F
1191                shift_imm(&mut b, LSR, 11, rd_b, 4);
1192                dp_reg(&mut b, 0xE080_0000, rd_b, rd_b, 11); // ADD rd, rd, R11
1193                movw(&mut b, 12, 0x0F0F);
1194                movt(&mut b, 12, 0x0F0F);
1195                dp_reg(&mut b, 0xE000_0000, rd_b, rd_b, 12); // AND rd, rd, R12
1196                // x += x >> 8; x += x >> 16; x &= 0x3F
1197                shift_imm(&mut b, LSR, 11, rd_b, 8);
1198                dp_reg(&mut b, 0xE080_0000, rd_b, rd_b, 11);
1199                shift_imm(&mut b, LSR, 11, rd_b, 16);
1200                dp_reg(&mut b, 0xE080_0000, rd_b, rd_b, 11);
1201                w(&mut b, 0xE200_003F | (rd_b << 16) | (rd_b << 12)); // AND rd, rd, #63
1202            }
1203
1204            // I64Popcnt: POPCNT(lo) + POPCNT(hi) — A32 transcription of the
1205            // Thumb-2 arm (R3/R4/R5 saved, mul-based per-word fold, high
1206            // result word rnhi cleared last, mirroring the Thumb contract).
1207            ArmOp::I64Popcnt { rd, rnlo, rnhi } => {
1208                let hi = reg_to_bits(rnhi);
1209                w(&mut b, 0xE92D_0038); // PUSH {R3, R4, R5}
1210                // #632 audit: route rnlo through R12 so a pair living at
1211                // (R3,R4) cannot read a clobbered R4 (sources read before any
1212                // scratch register they could occupy is written).
1213                w(&mut b, 0xE1A0_C000 | reg_to_bits(rnlo)); // MOV R12, rnlo
1214                w(&mut b, 0xE1A0_5000 | hi); //                MOV R5, rnhi
1215                w(&mut b, 0xE1A0_400C); //                     MOV R4, R12
1216                popcnt_word(&mut b, 4, 3);
1217                popcnt_word(&mut b, 5, 3);
1218                // #632: carry the count across the scratch restore in R12 —
1219                // rd is allocator-assigned and can land inside {R3,R4,R5};
1220                // the old `ADD rd, R4, R5` before the POP was destroyed by
1221                // the restore. R12 is never allocatable and never restored.
1222                dp_reg(&mut b, 0xE080_0000, 12, 4, 5); // ADD R12, R4, R5
1223                w(&mut b, 0xE8BD_0038); // POP {R3, R4, R5}
1224                w(&mut b, 0xE1A0_0000 | (reg_to_bits(rd) << 12) | 12); // MOV rd, R12
1225                w(&mut b, 0xE3A0_0000 | (hi << 12)); // MOV rnhi, #0 (i64 hi word)
1226            }
1227
1228            _ => return Ok(None),
1229        }
1230        Ok(Some(b))
1231    }
1232
1233    fn encode_arm(&self, op: &ArmOp) -> Result<Vec<u8>> {
1234        // #615: A32 multi-instruction expansions (i64 arithmetic/shift/rotate/
1235        // compare, SetCond/SelectMove, popcnt, ...). These ops were literal
1236        // NOPs on the A32 path — user-reachable via `--target cortex-r5` —
1237        // so the value silently vanished. Mirror of the #594 CallIndirect
1238        // early-return: if the expansion helper covers the op, its bytes are
1239        // the encoding.
1240        if let Some(bytes) = self.encode_arm_expanded(op)? {
1241            return Ok(bytes);
1242        }
1243        // #206: ARM32 register-offset loads/stores. `encode_mem_addr` only
1244        // returns the 12-bit immediate, so the immediate-form arms below
1245        // silently DROP `addr.offset_reg` — a runtime address index vanished,
1246        // turning `ldr rd,[rn,rm,#off]` into `ldr rd,[rn,#off]` (the access went
1247        // to the wrong address). Compute the effective base into IP and re-encode
1248        // against `[ip, #off]`, which is uniform for word/byte/halfword/signed.
1249        if let Some(bytes) = self.encode_arm_reg_offset_mem(op)? {
1250            return Ok(bytes);
1251        }
1252        // #594: call_indirect was encoded as a literal NOP on the A32 path
1253        // (`--target cortex-r5`) — the call never happened and the function
1254        // silently returned garbage. Emit the same three-instruction expansion
1255        // as the Thumb-2 path (R11 = function-pointer table base, R12 scratch):
1256        //   MOV r12, idx, LSL #2 ; LDR r12, [r11, r12] ; BLX r12
1257        if let ArmOp::CallIndirect {
1258            table_index_reg,
1259            table_size,
1260            table_byte_offset,
1261            null_check,
1262            type_check,
1263            ..
1264        } = op
1265        {
1266            return Ok(Self::encode_arm_call_indirect(
1267                table_index_reg,
1268                *table_size,
1269                *table_byte_offset,
1270                *null_check,
1271                *type_check,
1272            ));
1273        }
1274        let instr: u32 = match op {
1275            // Data processing instructions
1276            ArmOp::Add { rd, rn, op2 } => {
1277                let rd_bits = reg_to_bits(rd);
1278                let rn_bits = reg_to_bits(rn);
1279                let (op2_bits, i_flag) = encode_operand2(op2)?;
1280
1281                // ADD encoding: cond(4) | 00 | I(1) | 0100 | S(1) | Rn(4) | Rd(4) | operand2(12)
1282                0xE0800000 // condition=always(E), opcode=ADD(0100), S=0
1283                    | (i_flag << 25)
1284                    | (rn_bits << 16)
1285                    | (rd_bits << 12)
1286                    | op2_bits
1287            }
1288
1289            ArmOp::Sub { rd, rn, op2 } => {
1290                let rd_bits = reg_to_bits(rd);
1291                let rn_bits = reg_to_bits(rn);
1292                let (op2_bits, i_flag) = encode_operand2(op2)?;
1293
1294                // SUB encoding: opcode=0010
1295                0xE0400000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1296            }
1297
1298            // i64 support: ADDS, ADC, SUBS, SBC for ARM32
1299            ArmOp::Adds { rd, rn, op2 } => {
1300                let rd_bits = reg_to_bits(rd);
1301                let rn_bits = reg_to_bits(rn);
1302                let (op2_bits, i_flag) = encode_operand2(op2)?;
1303
1304                // ADDS encoding: opcode=0100, S=1
1305                0xE0900000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1306            }
1307
1308            ArmOp::Adc { rd, rn, op2 } => {
1309                let rd_bits = reg_to_bits(rd);
1310                let rn_bits = reg_to_bits(rn);
1311                let (op2_bits, i_flag) = encode_operand2(op2)?;
1312
1313                // ADC encoding: opcode=0101
1314                0xE0A00000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1315            }
1316
1317            ArmOp::Subs { rd, rn, op2 } => {
1318                let rd_bits = reg_to_bits(rd);
1319                let rn_bits = reg_to_bits(rn);
1320                let (op2_bits, i_flag) = encode_operand2(op2)?;
1321
1322                // SUBS encoding: opcode=0010, S=1
1323                0xE0500000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1324            }
1325
1326            ArmOp::Sbc { rd, rn, op2 } => {
1327                let rd_bits = reg_to_bits(rd);
1328                let rn_bits = reg_to_bits(rn);
1329                let (op2_bits, i_flag) = encode_operand2(op2)?;
1330
1331                // SBC encoding: opcode=0110
1332                0xE0C00000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1333            }
1334
1335            ArmOp::Mul { rd, rn, rm } => {
1336                let rd_bits = reg_to_bits(rd);
1337                let rn_bits = reg_to_bits(rn);
1338                let rm_bits = reg_to_bits(rm);
1339
1340                // MUL encoding: cond(4) | 000000 | A(1) | S(1) | Rd(4) | Rn(4) | Rs(4) | 1001 | Rm(4)
1341                0xE0000090 | (rd_bits << 16) | (rn_bits << 8) | rm_bits
1342            }
1343
1344            ArmOp::Umull { rdlo, rdhi, rn, rm } => {
1345                let rdlo_bits = reg_to_bits(rdlo);
1346                let rdhi_bits = reg_to_bits(rdhi);
1347                let rn_bits = reg_to_bits(rn);
1348                let rm_bits = reg_to_bits(rm);
1349
1350                // UMULL encoding: cond(4) | 0000 1000 | RdHi(4) | RdLo(4) | Rm(4) | 1001 | Rn(4)
1351                0xE0800090 | (rdhi_bits << 16) | (rdlo_bits << 12) | (rm_bits << 8) | rn_bits
1352            }
1353
1354            ArmOp::Sdiv { rd, rn, rm } => {
1355                let rd_bits = reg_to_bits(rd);
1356                let rn_bits = reg_to_bits(rn);
1357                let rm_bits = reg_to_bits(rm);
1358
1359                // SDIV encoding: cond(4) | 01110001 | Rd(4) | 1111 | Rm(4) | 0001 | Rn(4)
1360                // ARMv7-M and above
1361                0xE710F010 | (rd_bits << 16) | (rm_bits << 8) | rn_bits
1362            }
1363
1364            ArmOp::Udiv { rd, rn, rm } => {
1365                let rd_bits = reg_to_bits(rd);
1366                let rn_bits = reg_to_bits(rn);
1367                let rm_bits = reg_to_bits(rm);
1368
1369                // UDIV encoding: cond(4) | 01110011 | Rd(4) | 1111 | Rm(4) | 0001 | Rn(4)
1370                // ARMv7-M and above
1371                0xE730F010 | (rd_bits << 16) | (rm_bits << 8) | rn_bits
1372            }
1373
1374            ArmOp::Mls { rd, rn, rm, ra } => {
1375                let rd_bits = reg_to_bits(rd);
1376                let rn_bits = reg_to_bits(rn);
1377                let rm_bits = reg_to_bits(rm);
1378                let ra_bits = reg_to_bits(ra);
1379
1380                // MLS encoding: cond(4) | 00000110 | Rd(4) | Ra(4) | Rm(4) | 1001 | Rn(4)
1381                // Rd = Ra - (Rn * Rm)
1382                0xE0600090 | (rd_bits << 16) | (ra_bits << 12) | (rm_bits << 8) | rn_bits
1383            }
1384
1385            ArmOp::Mla { rd, rn, rm, ra } => {
1386                let rd_bits = reg_to_bits(rd);
1387                let rn_bits = reg_to_bits(rn);
1388                let rm_bits = reg_to_bits(rm);
1389                let ra_bits = reg_to_bits(ra);
1390
1391                // MLA encoding: cond(4) | 0000001 S | Rd(4) | Ra(4) | Rm(4) | 1001 | Rn(4)
1392                // Rd = Ra + (Rn * Rm). Base 0xE0200090 (S=0).
1393                0xE0200090 | (rd_bits << 16) | (ra_bits << 12) | (rm_bits << 8) | rn_bits
1394            }
1395
1396            ArmOp::And { rd, rn, op2 } => {
1397                let rd_bits = reg_to_bits(rd);
1398                let rn_bits = reg_to_bits(rn);
1399                let (op2_bits, i_flag) = encode_operand2(op2)?;
1400
1401                // AND encoding: opcode=0000
1402                0xE0000000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1403            }
1404
1405            ArmOp::Orr { rd, rn, op2 } => {
1406                let rd_bits = reg_to_bits(rd);
1407                let rn_bits = reg_to_bits(rn);
1408                let (op2_bits, i_flag) = encode_operand2(op2)?;
1409
1410                // ORR encoding: opcode=1100
1411                0xE1800000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1412            }
1413
1414            ArmOp::Eor { rd, rn, op2 } => {
1415                let rd_bits = reg_to_bits(rd);
1416                let rn_bits = reg_to_bits(rn);
1417                let (op2_bits, i_flag) = encode_operand2(op2)?;
1418
1419                // EOR encoding: opcode=0001
1420                0xE0200000 | (i_flag << 25) | (rn_bits << 16) | (rd_bits << 12) | op2_bits
1421            }
1422
1423            // Shift instructions
1424            ArmOp::Lsl { rd, rn, shift } => {
1425                let rd_bits = reg_to_bits(rd);
1426                let rn_bits = reg_to_bits(rn);
1427                let shift_bits = *shift & 0x1F;
1428
1429                // LSL encoding: MOV with shift
1430                0xE1A00000 | (rd_bits << 12) | (shift_bits << 7) | rn_bits
1431            }
1432
1433            ArmOp::Lsr { rd, rn, shift } => {
1434                let rd_bits = reg_to_bits(rd);
1435                let rn_bits = reg_to_bits(rn);
1436                let shift_bits = *shift & 0x1F;
1437
1438                // LSR encoding
1439                0xE1A00020 | (rd_bits << 12) | (shift_bits << 7) | rn_bits
1440            }
1441
1442            ArmOp::Asr { rd, rn, shift } => {
1443                let rd_bits = reg_to_bits(rd);
1444                let rn_bits = reg_to_bits(rn);
1445                let shift_bits = *shift & 0x1F;
1446
1447                // ASR encoding
1448                0xE1A00040 | (rd_bits << 12) | (shift_bits << 7) | rn_bits
1449            }
1450
1451            ArmOp::Ror { rd, rn, shift } => {
1452                let rd_bits = reg_to_bits(rd);
1453                let rn_bits = reg_to_bits(rn);
1454                let shift_bits = *shift & 0x1F;
1455
1456                // ROR encoding: MOV with ROR shift
1457                0xE1A00060 | (rd_bits << 12) | (shift_bits << 7) | rn_bits
1458            }
1459
1460            // Register-based shifts (ARM32)
1461            // LSL Rd, Rn, Rm: cond 0001101S 0000 Rd Rs 0001 Rn
1462            ArmOp::LslReg { rd, rn, rm } => {
1463                let rd_bits = reg_to_bits(rd);
1464                let rn_bits = reg_to_bits(rn);
1465                let rm_bits = reg_to_bits(rm);
1466                0xE1A00010 | (rd_bits << 12) | (rm_bits << 8) | rn_bits
1467            }
1468            ArmOp::LsrReg { rd, rn, rm } => {
1469                let rd_bits = reg_to_bits(rd);
1470                let rn_bits = reg_to_bits(rn);
1471                let rm_bits = reg_to_bits(rm);
1472                0xE1A00030 | (rd_bits << 12) | (rm_bits << 8) | rn_bits
1473            }
1474            ArmOp::AsrReg { rd, rn, rm } => {
1475                let rd_bits = reg_to_bits(rd);
1476                let rn_bits = reg_to_bits(rn);
1477                let rm_bits = reg_to_bits(rm);
1478                0xE1A00050 | (rd_bits << 12) | (rm_bits << 8) | rn_bits
1479            }
1480            ArmOp::RorReg { rd, rn, rm } => {
1481                let rd_bits = reg_to_bits(rd);
1482                let rn_bits = reg_to_bits(rn);
1483                let rm_bits = reg_to_bits(rm);
1484                0xE1A00070 | (rd_bits << 12) | (rm_bits << 8) | rn_bits
1485            }
1486
1487            // RSB (Reverse Subtract): Rd = imm - Rn
1488            ArmOp::Rsb { rd, rn, imm } => {
1489                let rd_bits = reg_to_bits(rd);
1490                let rn_bits = reg_to_bits(rn);
1491                // RSB encoding: cond(4) | 00 1 0011 S | Rn(4) | Rd(4) | imm12
1492                // Opcode for RSB = 0011, I=1 (immediate), S=0
1493                //
1494                // #681 class audit: the A32 imm12 is a rotate(4):imm8 modified
1495                // immediate; `*imm & 0xFF` silently encoded a WRONG constant
1496                // for imm > 0xFF (#378 masking class). All current emitters use
1497                // imm 32, so erroring here is byte-identical for real codegen.
1498                if *imm > 0xFF {
1499                    return Err(synth_core::Error::synthesis(
1500                        "A32 RSB immediate > 0xFF requires a rotated-immediate encoding \
1501                         (not supported) — materialize into a register",
1502                    ));
1503                }
1504                0xE2600000 | (rn_bits << 16) | (rd_bits << 12) | (*imm & 0xFF)
1505            }
1506
1507            // Bit manipulation instructions
1508            ArmOp::Clz { rd, rm } => {
1509                let rd_bits = reg_to_bits(rd);
1510                let rm_bits = reg_to_bits(rm);
1511
1512                // CLZ encoding: cond(4) | 00010110 | 1111 | Rd(4) | 1111 | 0001 | Rm(4)
1513                // ARMv5T and above
1514                0xE16F0F10 | (rd_bits << 12) | rm_bits
1515            }
1516
1517            ArmOp::Rbit { rd, rm } => {
1518                let rd_bits = reg_to_bits(rd);
1519                let rm_bits = reg_to_bits(rm);
1520
1521                // RBIT encoding: cond(4) | 01101111 | 1111 | Rd(4) | 1111 | 0011 | Rm(4)
1522                // ARMv6T2 and above
1523                0xE6FF0F30 | (rd_bits << 12) | rm_bits
1524            }
1525
1526            ArmOp::Sxtb { rd, rm } => {
1527                let rd_bits = reg_to_bits(rd);
1528                let rm_bits = reg_to_bits(rm);
1529
1530                // SXTB encoding: cond(4) | 01101010 | 1111 | Rd(4) | rotate(2) | 00 | 0111 | Rm(4)
1531                // ARMv6 and above. rotate=00 for no rotation
1532                0xE6AF0070 | (rd_bits << 12) | rm_bits
1533            }
1534
1535            ArmOp::Sxth { rd, rm } => {
1536                let rd_bits = reg_to_bits(rd);
1537                let rm_bits = reg_to_bits(rm);
1538
1539                // SXTH encoding: cond(4) | 01101011 | 1111 | Rd(4) | rotate(2) | 00 | 0111 | Rm(4)
1540                // ARMv6 and above. rotate=00 for no rotation
1541                0xE6BF0070 | (rd_bits << 12) | rm_bits
1542            }
1543
1544            ArmOp::Uxtb { rd, rm } => {
1545                let rd_bits = reg_to_bits(rd);
1546                let rm_bits = reg_to_bits(rm);
1547                // UXTB encoding: cond | 01101110 1111 Rd rotate 00 0111 Rm (rotate=00)
1548                0xE6EF0070 | (rd_bits << 12) | rm_bits
1549            }
1550
1551            ArmOp::Uxth { rd, rm } => {
1552                let rd_bits = reg_to_bits(rd);
1553                let rm_bits = reg_to_bits(rm);
1554                // UXTH encoding: cond | 01101111 1111 Rd rotate 00 0111 Rm (rotate=00)
1555                0xE6FF0070 | (rd_bits << 12) | rm_bits
1556            }
1557
1558            // Move instructions
1559            ArmOp::Mov { rd, op2 } => {
1560                let rd_bits = reg_to_bits(rd);
1561                let (op2_bits, i_flag) = encode_operand2(op2)?;
1562
1563                // MOV encoding: opcode=1101
1564                0xE1A00000 | (i_flag << 25) | (rd_bits << 12) | op2_bits
1565            }
1566
1567            ArmOp::Mvn { rd, op2 } => {
1568                let rd_bits = reg_to_bits(rd);
1569                let (op2_bits, i_flag) = encode_operand2(op2)?;
1570
1571                // MVN encoding: opcode=1111
1572                0xE1E00000 | (i_flag << 25) | (rd_bits << 12) | op2_bits
1573            }
1574
1575            // MOVW - Move Wide (ARM32)
1576            // Encoding: cond(4) | 0011 0000 | imm4(4) | Rd(4) | imm12(12)
1577            ArmOp::Movw { rd, imm16 } => {
1578                let rd_bits = reg_to_bits(rd);
1579                let imm4 = ((*imm16 as u32) >> 12) & 0xF;
1580                let imm12 = (*imm16 as u32) & 0xFFF;
1581                0xE3000000 | (imm4 << 16) | (rd_bits << 12) | imm12
1582            }
1583
1584            // MOVT - Move Top (ARM32)
1585            // Encoding: cond(4) | 0011 0100 | imm4(4) | Rd(4) | imm12(12)
1586            ArmOp::Movt { rd, imm16 } => {
1587                let rd_bits = reg_to_bits(rd);
1588                let imm4 = ((*imm16 as u32) >> 12) & 0xF;
1589                let imm12 = (*imm16 as u32) & 0xFFF;
1590                0xE3400000 | (imm4 << 16) | (rd_bits << 12) | imm12
1591            }
1592
1593            // #237: symbol-relative MOVW/MOVT (ARM mode) — addend in place, the
1594            // backend records the MOVW_ABS/MOVT_ABS relocation against `symbol`.
1595            ArmOp::MovwSym { rd, addend, .. } => {
1596                let rd_bits = reg_to_bits(rd);
1597                let v = (*addend as u32) & 0xffff;
1598                0xE3000000 | (((v >> 12) & 0xF) << 16) | (rd_bits << 12) | (v & 0xFFF)
1599            }
1600            ArmOp::MovtSym { rd, addend, .. } => {
1601                let rd_bits = reg_to_bits(rd);
1602                let v = ((*addend as u32) >> 16) & 0xffff;
1603                0xE3400000 | (((v >> 12) & 0xF) << 16) | (rd_bits << 12) | (v & 0xFFF)
1604            }
1605
1606            // #345: LdrSym is the Thumb-2 literal-pool address load. A32 mode is
1607            // not used for relocatable native-pointer objects; fail loudly rather
1608            // than miscompile if it is ever reached here.
1609            ArmOp::LdrSym { .. } => {
1610                return Err(synth_core::Error::synthesis(
1611                    "LdrSym (literal-pool address load) is Thumb-2-only",
1612                ));
1613            }
1614
1615            // Compare
1616            ArmOp::Cmp { rn, op2 } => {
1617                let rn_bits = reg_to_bits(rn);
1618                let (op2_bits, i_flag) = encode_operand2(op2)?;
1619
1620                // CMP encoding: opcode=1010, S=1
1621                0xE1500000 | (i_flag << 25) | (rn_bits << 16) | op2_bits
1622            }
1623
1624            // Compare Negative (CMN) - computes Rn + op2 and sets flags
1625            ArmOp::Cmn { rn, op2 } => {
1626                let rn_bits = reg_to_bits(rn);
1627                let (op2_bits, i_flag) = encode_operand2(op2)?;
1628
1629                // CMN encoding: opcode=1011, S=1
1630                0xE1700000 | (i_flag << 25) | (rn_bits << 16) | op2_bits
1631            }
1632
1633            // Load/Store
1634            ArmOp::Ldr { rd, addr } => {
1635                let rd_bits = reg_to_bits(rd);
1636                let (base_bits, offset_bits) = encode_mem_addr(addr);
1637
1638                // LDR encoding: cond(4) | 01 | I(1) | P(1) | U(1) | B(1) | W(1) | L(1) | Rn(4) | Rd(4) | offset(12)
1639                // P=1 (pre-indexed), U=1 (add offset), L=1 (load)
1640                0xE5900000 | (base_bits << 16) | (rd_bits << 12) | offset_bits
1641            }
1642
1643            ArmOp::Str { rd, addr } => {
1644                let rd_bits = reg_to_bits(rd);
1645                let (base_bits, offset_bits) = encode_mem_addr(addr);
1646
1647                // STR encoding: L=0 (store)
1648                0xE5800000 | (base_bits << 16) | (rd_bits << 12) | offset_bits
1649            }
1650
1651            // Sub-word loads (ARM32 encoding)
1652            ArmOp::Ldrb { rd, addr } => {
1653                let rd_bits = reg_to_bits(rd);
1654                let (base_bits, offset_bits) = encode_mem_addr(addr);
1655                // LDRB: LDR with B=1 (byte): cond|01|I|P|U|1|W|L|Rn|Rd|offset
1656                0xE5D00000 | (base_bits << 16) | (rd_bits << 12) | offset_bits
1657            }
1658
1659            ArmOp::Ldrsb { rd, addr } => {
1660                let rd_bits = reg_to_bits(rd);
1661                let (base_bits, offset_bits) = encode_mem_addr(addr);
1662                // LDRSB (misc load): cond|000|P|U|1|W|1|Rn|Rd|imm4H|1101|imm4L
1663                // Simplified with immediate offset
1664                let offset_val = offset_bits & 0xFF;
1665                let imm4h = (offset_val >> 4) & 0xF;
1666                let imm4l = offset_val & 0xF;
1667                0xE1D000D0 | (base_bits << 16) | (rd_bits << 12) | (imm4h << 8) | imm4l
1668            }
1669
1670            ArmOp::Ldrh { rd, addr } => {
1671                let rd_bits = reg_to_bits(rd);
1672                let (base_bits, offset_bits) = encode_mem_addr(addr);
1673                // LDRH (misc load): cond|000|P|U|1|W|1|Rn|Rd|imm4H|1011|imm4L
1674                let offset_val = offset_bits & 0xFF;
1675                let imm4h = (offset_val >> 4) & 0xF;
1676                let imm4l = offset_val & 0xF;
1677                0xE1D000B0 | (base_bits << 16) | (rd_bits << 12) | (imm4h << 8) | imm4l
1678            }
1679
1680            ArmOp::Ldrsh { rd, addr } => {
1681                let rd_bits = reg_to_bits(rd);
1682                let (base_bits, offset_bits) = encode_mem_addr(addr);
1683                // LDRSH (misc load): cond|000|P|U|1|W|1|Rn|Rd|imm4H|1111|imm4L
1684                let offset_val = offset_bits & 0xFF;
1685                let imm4h = (offset_val >> 4) & 0xF;
1686                let imm4l = offset_val & 0xF;
1687                0xE1D000F0 | (base_bits << 16) | (rd_bits << 12) | (imm4h << 8) | imm4l
1688            }
1689
1690            // Sub-word stores (ARM32 encoding)
1691            ArmOp::Strb { rd, addr } => {
1692                let rd_bits = reg_to_bits(rd);
1693                let (base_bits, offset_bits) = encode_mem_addr(addr);
1694                // STRB: STR with B=1 (byte): cond|01|I|P|U|1|W|0|Rn|Rd|offset
1695                0xE5C00000 | (base_bits << 16) | (rd_bits << 12) | offset_bits
1696            }
1697
1698            ArmOp::Strh { rd, addr } => {
1699                let rd_bits = reg_to_bits(rd);
1700                let (base_bits, offset_bits) = encode_mem_addr(addr);
1701                // STRH (misc store): cond|000|P|U|1|W|0|Rn|Rd|imm4H|1011|imm4L
1702                let offset_val = offset_bits & 0xFF;
1703                let imm4h = (offset_val >> 4) & 0xF;
1704                let imm4l = offset_val & 0xF;
1705                0xE1C000B0 | (base_bits << 16) | (rd_bits << 12) | (imm4h << 8) | imm4l
1706            }
1707
1708            // Memory management (ARM32 encoding)
1709            ArmOp::MemorySize { rd } => {
1710                let rd_bits = reg_to_bits(rd);
1711                // MOV rd, R10, LSR #16  (memory size in bytes / 65536 = pages)
1712                // cond|000|1101|S|0000|Rd|shift5|type|0|Rm
1713                // LSR #16: shift5=10000, type=01
1714                0xE1A00820 | (rd_bits << 12) | 0x0A // Rm=R10, shift=16, LSR
1715            }
1716
1717            ArmOp::MemoryGrow { rd, .. } => {
1718                let rd_bits = reg_to_bits(rd);
1719                // On embedded, always fail: MOV rd, #-1
1720                0xE3E00000 | (rd_bits << 12) // MVN rd, #0 = MOV rd, #-1
1721            }
1722
1723            // Label pseudo-instruction: emits no machine code
1724            ArmOp::Label { .. } => {
1725                return Ok(Vec::new());
1726            }
1727
1728            // Branch instructions
1729            ArmOp::B { label: _ } => {
1730                // B encoding: cond(4) | 1010 | offset(24)
1731                // Simplified: branch to offset 0 (will be patched by linker/resolver)
1732                0xEA000000
1733            }
1734
1735            // Conditional branch to label (generic)
1736            ArmOp::Bcc { cond, label: _ } => {
1737                use synth_synthesis::Condition;
1738                let cond_bits: u32 = match cond {
1739                    Condition::EQ => 0x0,
1740                    Condition::NE => 0x1,
1741                    Condition::HS => 0x2,
1742                    Condition::LO => 0x3,
1743                    Condition::HI => 0x8,
1744                    Condition::LS => 0x9,
1745                    Condition::GE => 0xA,
1746                    Condition::LT => 0xB,
1747                    Condition::GT => 0xC,
1748                    Condition::LE => 0xD,
1749                };
1750                // B<cond> with offset 0 (will be patched)
1751                (cond_bits << 28) | 0x0A000000
1752            }
1753
1754            // BHS (Branch if Higher or Same) - used for bounds checking
1755            ArmOp::Bhs { label: _ } => {
1756                // BHS encoding: cond(2=HS) | 1010 | offset(24)
1757                0x2A000000 // BHS with offset 0
1758            }
1759
1760            // BLO (Branch if Lower) - complementary to BHS
1761            ArmOp::Blo { label: _ } => {
1762                // BLO encoding: cond(3=LO) | 1010 | offset(24)
1763                0x3A000000 // BLO with offset 0
1764            }
1765
1766            // Branch with numeric offset (in instructions)
1767            // ARM32 B instruction: offset is in instructions, stored as words
1768            // The offset is relative to PC+8 (due to ARM pipeline)
1769            ArmOp::BOffset { offset } => {
1770                // B encoding: cond(4) | 1010 | offset(24)
1771                // Offset is signed, in words (4-byte units)
1772                // ARM adds PC+8 to the offset, so we need to adjust:
1773                // target = PC + 8 + (offset * 4)
1774                // For backward branch of N instructions: offset = -(N + 2)
1775                // wrapping_sub keeps the encoder total under fuzzing (#186): an
1776                // extreme i32::MIN offset would otherwise overflow-panic; for any
1777                // real branch offset this is identical to `- 2`.
1778                let adjusted_offset = offset.wrapping_sub(2); // Account for PC+8
1779                let offset_bits = (adjusted_offset as u32) & 0x00FFFFFF;
1780                0xEA000000 | offset_bits
1781            }
1782
1783            // Conditional branch with numeric offset
1784            ArmOp::BCondOffset { cond, offset } => {
1785                use synth_synthesis::Condition;
1786                let cond_bits: u32 = match cond {
1787                    Condition::EQ => 0x0,
1788                    Condition::NE => 0x1,
1789                    Condition::HS => 0x2,
1790                    Condition::LO => 0x3,
1791                    Condition::HI => 0x8,
1792                    Condition::LS => 0x9,
1793                    Condition::GE => 0xA,
1794                    Condition::LT => 0xB,
1795                    Condition::GT => 0xC,
1796                    Condition::LE => 0xD,
1797                };
1798                // B<cond> encoding: cond(4) | 1010 | offset(24)
1799                // wrapping_sub: total under fuzzing (#186), identical for real offsets.
1800                let adjusted_offset = offset.wrapping_sub(2); // Account for PC+8
1801                let offset_bits = (adjusted_offset as u32) & 0x00FFFFFF;
1802                (cond_bits << 28) | 0x0A000000 | offset_bits
1803            }
1804
1805            ArmOp::Bl { label: _ } => {
1806                // BL encoding: cond(4) | 1011 | offset(24)
1807                0xEB000000
1808            }
1809
1810            ArmOp::Bx { rm } => {
1811                let rm_bits = reg_to_bits(rm);
1812
1813                // BX encoding: cond(4) | 000100101111111111110001 | Rm(4)
1814                0xE12FFF10 | rm_bits
1815            }
1816
1817            ArmOp::Blx { rm } => {
1818                let rm_bits = reg_to_bits(rm);
1819
1820                // BLX (register) encoding: cond(4) | 000100101111111111110011 | Rm(4)
1821                0xE12FFF30 | rm_bits
1822            }
1823
1824            ArmOp::Push { regs } => {
1825                // STMDB SP!, {regs} encoding: cond(4) | 100100 | 10 | 1101 | register_list(16)
1826                let mut reg_list: u32 = 0;
1827                for r in regs {
1828                    reg_list |= 1 << reg_to_bits(r);
1829                }
1830                0xE92D0000 | reg_list
1831            }
1832
1833            ArmOp::Pop { regs } => {
1834                // LDMIA SP!, {regs} encoding: cond(4) | 100010 | 11 | 1101 | register_list(16)
1835                let mut reg_list: u32 = 0;
1836                for r in regs {
1837                    reg_list |= 1 << reg_to_bits(r);
1838                }
1839                0xE8BD0000 | reg_list
1840            }
1841
1842            ArmOp::Nop => {
1843                // NOP encoding: MOV R0, R0
1844                0xE1A00000
1845            }
1846
1847            ArmOp::Udf { imm } => {
1848                // UDF (Undefined) encoding in ARM: 0xE7F000F0 | (imm12_hi << 8) | imm4_lo
1849                // We only use imm8, so split into imm4_hi and imm4_lo
1850                let imm8 = *imm as u32;
1851                0xE7F000F0 | ((imm8 & 0xF0) << 4) | (imm8 & 0x0F)
1852            }
1853
1854            // #615: handled by the `encode_arm_expanded` early return at the
1855            // top of this function — a real MOV{cond}/MOV pair now, never a
1856            // silent NOP again.
1857            ArmOp::Popcnt { .. } | ArmOp::SetCond { .. } | ArmOp::SelectMove { .. } => {
1858                unreachable!("handled by encode_arm_expanded (#615)")
1859            }
1860
1861            // Verification-only pseudo-ops: `synth-verify`'s ArmSemantics
1862            // models these, but NO codegen path constructs them (the selector
1863            // lowers select/locals/globals/br_table/call to real instruction
1864            // sequences before the encoder). Encoding one as a NOP silently
1865            // dropped the operation (#615 class); a typed Err keeps the
1866            // encoder total (Ok-or-Err, the `encoder_no_panic` contract)
1867            // while making any future reachability LOUD.
1868            ArmOp::Select { .. }
1869            | ArmOp::LocalGet { .. }
1870            | ArmOp::LocalSet { .. }
1871            | ArmOp::LocalTee { .. }
1872            | ArmOp::GlobalGet { .. }
1873            | ArmOp::GlobalSet { .. }
1874            | ArmOp::BrTable { .. }
1875            | ArmOp::Call { .. } => {
1876                return Err(synth_core::Error::synthesis(format!(
1877                    "verification-only pseudo-op {op:?} reached the A32 encoder — \
1878                     codegen lowers it before encoding; refusing to emit a silent NOP (#615)"
1879                )));
1880            }
1881
1882            // #594: CallIndirect is expanded to a real multi-instruction
1883            // sequence by the early return at the top of this function —
1884            // it must NEVER fall through to a silent NOP again.
1885            ArmOp::CallIndirect { .. } => {
1886                unreachable!("CallIndirect handled by encode_arm_call_indirect (#594)")
1887            }
1888
1889            // #615: every i64 op (and I32WrapI64) is expanded to a real A32
1890            // multi-instruction sequence by `encode_arm_expanded` — the
1891            // "encode as NOP for now" era ended with the value silently
1892            // vanishing on `--target cortex-r5`.
1893            ArmOp::I64Add { .. }
1894            | ArmOp::I64Sub { .. }
1895            | ArmOp::I64DivS { .. }
1896            | ArmOp::I64DivU { .. }
1897            | ArmOp::I64RemS { .. }
1898            | ArmOp::I64RemU { .. }
1899            | ArmOp::I64Clz { .. }
1900            | ArmOp::I64Ctz { .. }
1901            | ArmOp::I64Popcnt { .. }
1902            | ArmOp::I64And { .. }
1903            | ArmOp::I64Or { .. }
1904            | ArmOp::I64Xor { .. }
1905            | ArmOp::I64Eqz { .. }
1906            | ArmOp::I64Eq { .. }
1907            | ArmOp::I64Ne { .. }
1908            | ArmOp::I64LtS { .. }
1909            | ArmOp::I64LtU { .. }
1910            | ArmOp::I64LeS { .. }
1911            | ArmOp::I64LeU { .. }
1912            | ArmOp::I64GtS { .. }
1913            | ArmOp::I64GtU { .. }
1914            | ArmOp::I64GeS { .. }
1915            | ArmOp::I64GeU { .. }
1916            | ArmOp::I64Const { .. }
1917            | ArmOp::I64Ldr { .. }
1918            | ArmOp::I64Str { .. }
1919            | ArmOp::I64ExtendI32S { .. }
1920            | ArmOp::I64ExtendI32U { .. }
1921            | ArmOp::I64Extend8S { .. }
1922            | ArmOp::I64Extend16S { .. }
1923            | ArmOp::I64Extend32S { .. }
1924            | ArmOp::I32WrapI64 { .. } => {
1925                unreachable!("handled by encode_arm_expanded (#615)")
1926            }
1927
1928            // f32 VFP single-precision instructions
1929            ArmOp::F32Add { sd, sn, sm } => encode_vfp_3reg(0xEE300A00, sd, sn, sm)?,
1930            ArmOp::F32Sub { sd, sn, sm } => encode_vfp_3reg(0xEE300A40, sd, sn, sm)?,
1931            ArmOp::F32Mul { sd, sn, sm } => encode_vfp_3reg(0xEE200A00, sd, sn, sm)?,
1932            ArmOp::F32Div { sd, sn, sm } => encode_vfp_3reg(0xEE800A00, sd, sn, sm)?,
1933            ArmOp::F32Abs { sd, sm } => encode_vfp_2reg(0xEEB00AC0, sd, sm)?,
1934            ArmOp::F32Neg { sd, sm } => encode_vfp_2reg(0xEEB10A40, sd, sm)?,
1935            ArmOp::F32Sqrt { sd, sm } => encode_vfp_2reg(0xEEB10AC0, sd, sm)?,
1936
1937            // f32 pseudo-ops — multi-instruction sequences
1938            // FPSCR RMode: 00=nearest, 01=+inf(ceil), 10=-inf(floor), 11=zero(trunc)
1939            ArmOp::F32Ceil { sd, sm } => {
1940                return self.encode_arm_f32_rounding(sd, sm, 0b01); // Round toward +Inf
1941            }
1942            ArmOp::F32Floor { sd, sm } => {
1943                return self.encode_arm_f32_rounding(sd, sm, 0b10); // Round toward -Inf
1944            }
1945            ArmOp::F32Trunc { sd, sm } => {
1946                return self.encode_arm_f32_rounding(sd, sm, 0b11); // VCVT toward zero
1947            }
1948            ArmOp::F32Nearest { sd, sm } => {
1949                return self.encode_arm_f32_rounding(sd, sm, 0b00); // VCVT to nearest
1950            }
1951            ArmOp::F32Min { sd, sn, sm } => {
1952                return self.encode_arm_f32_minmax(sd, sn, sm, true);
1953            }
1954            ArmOp::F32Max { sd, sn, sm } => {
1955                return self.encode_arm_f32_minmax(sd, sn, sm, false);
1956            }
1957            ArmOp::F32Copysign { sd, sn, sm } => {
1958                return self.encode_arm_f32_copysign(sd, sn, sm);
1959            }
1960
1961            // f32 comparisons — multi-instruction: VCMP + VMRS + conditional MOV
1962            ArmOp::F32Eq { rd, sn, sm } => {
1963                return self.encode_arm_f32_compare(rd, sn, sm, 0x0); // EQ
1964            }
1965            ArmOp::F32Ne { rd, sn, sm } => {
1966                return self.encode_arm_f32_compare(rd, sn, sm, 0x1); // NE
1967            }
1968            ArmOp::F32Lt { rd, sn, sm } => {
1969                return self.encode_arm_f32_compare(rd, sn, sm, 0x4); // MI (less than)
1970            }
1971            ArmOp::F32Le { rd, sn, sm } => {
1972                return self.encode_arm_f32_compare(rd, sn, sm, 0x9); // LS (less or same)
1973            }
1974            ArmOp::F32Gt { rd, sn, sm } => {
1975                return self.encode_arm_f32_compare(rd, sn, sm, 0xC); // GT
1976            }
1977            ArmOp::F32Ge { rd, sn, sm } => {
1978                return self.encode_arm_f32_compare(rd, sn, sm, 0xA); // GE
1979            }
1980
1981            // f32 const — multi-instruction: MOVW + MOVT + VMOV
1982            ArmOp::F32Const { sd, value } => {
1983                return self.encode_arm_f32_const(sd, *value);
1984            }
1985
1986            ArmOp::F32Load { sd, addr } => encode_vfp_ldst(0xED900A00, sd, addr)?,
1987            ArmOp::F32Store { sd, addr } => encode_vfp_ldst(0xED800A00, sd, addr)?,
1988
1989            // f32 conversions — multi-instruction sequences
1990            ArmOp::F32ConvertI32S { sd, rm } => {
1991                return self.encode_arm_f32_convert_i32(sd, rm, true);
1992            }
1993            ArmOp::F32ConvertI32U { sd, rm } => {
1994                return self.encode_arm_f32_convert_i32(sd, rm, false);
1995            }
1996            ArmOp::F32ConvertI64S { .. } | ArmOp::F32ConvertI64U { .. } => {
1997                return Err(synth_core::Error::synthesis(
1998                    "F32 i64 conversion not supported (requires register pairs on 32-bit ARM)",
1999                ));
2000            }
2001            ArmOp::F32ReinterpretI32 { sd, rm } => encode_vmov_core_sreg(true, sd, rm)?,
2002            ArmOp::I32ReinterpretF32 { rd, sm } => encode_vmov_core_sreg(false, sm, rd)?,
2003            ArmOp::I32TruncF32S { rd, sm } => {
2004                return self.encode_arm_i32_trunc_f32(rd, sm, true);
2005            }
2006            ArmOp::I32TruncF32U { rd, sm } => {
2007                return self.encode_arm_i32_trunc_f32(rd, sm, false);
2008            }
2009
2010            // f64 VFP double-precision instructions (ARM32)
2011            // F64 arithmetic: same as F32 but with sz=1 (bit 8 = 1, cp11 = 0xB)
2012            ArmOp::F64Add { dd, dn, dm } => encode_vfp_3reg_f64(0xEE300B00, dd, dn, dm)?,
2013            ArmOp::F64Sub { dd, dn, dm } => encode_vfp_3reg_f64(0xEE300B40, dd, dn, dm)?,
2014            ArmOp::F64Mul { dd, dn, dm } => encode_vfp_3reg_f64(0xEE200B00, dd, dn, dm)?,
2015            ArmOp::F64Div { dd, dn, dm } => encode_vfp_3reg_f64(0xEE800B00, dd, dn, dm)?,
2016            ArmOp::F64Abs { dd, dm } => encode_vfp_2reg_f64(0xEEB00BC0, dd, dm)?,
2017            ArmOp::F64Neg { dd, dm } => encode_vfp_2reg_f64(0xEEB10B40, dd, dm)?,
2018            ArmOp::F64Sqrt { dd, dm } => encode_vfp_2reg_f64(0xEEB10BC0, dd, dm)?,
2019
2020            // f64 pseudo-ops
2021            // FPSCR RMode: 00=nearest, 01=+inf(ceil), 10=-inf(floor), 11=zero(trunc)
2022            ArmOp::F64Ceil { dd, dm } => {
2023                return self.encode_arm_f64_rounding(dd, dm, 0b01);
2024            }
2025            ArmOp::F64Floor { dd, dm } => {
2026                return self.encode_arm_f64_rounding(dd, dm, 0b10);
2027            }
2028            ArmOp::F64Trunc { dd, dm } => {
2029                return self.encode_arm_f64_rounding(dd, dm, 0b11);
2030            }
2031            ArmOp::F64Nearest { dd, dm } => {
2032                return self.encode_arm_f64_rounding(dd, dm, 0b00);
2033            }
2034            ArmOp::F64Min { dd, dn, dm } => {
2035                return self.encode_arm_f64_minmax(dd, dn, dm, true);
2036            }
2037            ArmOp::F64Max { dd, dn, dm } => {
2038                return self.encode_arm_f64_minmax(dd, dn, dm, false);
2039            }
2040            ArmOp::F64Copysign { dd, dn, dm } => {
2041                return self.encode_arm_f64_copysign(dd, dn, dm);
2042            }
2043
2044            // f64 comparisons
2045            ArmOp::F64Eq { rd, dn, dm } => {
2046                return self.encode_arm_f64_compare(rd, dn, dm, 0x0);
2047            }
2048            ArmOp::F64Ne { rd, dn, dm } => {
2049                return self.encode_arm_f64_compare(rd, dn, dm, 0x1);
2050            }
2051            ArmOp::F64Lt { rd, dn, dm } => {
2052                return self.encode_arm_f64_compare(rd, dn, dm, 0x4);
2053            }
2054            ArmOp::F64Le { rd, dn, dm } => {
2055                return self.encode_arm_f64_compare(rd, dn, dm, 0x9);
2056            }
2057            ArmOp::F64Gt { rd, dn, dm } => {
2058                return self.encode_arm_f64_compare(rd, dn, dm, 0xC);
2059            }
2060            ArmOp::F64Ge { rd, dn, dm } => {
2061                return self.encode_arm_f64_compare(rd, dn, dm, 0xA);
2062            }
2063
2064            ArmOp::F64Const { dd, value } => {
2065                return self.encode_arm_f64_const(dd, *value);
2066            }
2067
2068            ArmOp::F64Load { dd, addr } => encode_vfp_ldst_f64(0xED900B00, dd, addr)?,
2069            ArmOp::F64Store { dd, addr } => encode_vfp_ldst_f64(0xED800B00, dd, addr)?,
2070
2071            ArmOp::F64ConvertI32S { dd, rm } => {
2072                return self.encode_arm_f64_convert_i32(dd, rm, true);
2073            }
2074            ArmOp::F64ConvertI32U { dd, rm } => {
2075                return self.encode_arm_f64_convert_i32(dd, rm, false);
2076            }
2077            ArmOp::F64ConvertI64S { .. } | ArmOp::F64ConvertI64U { .. } => {
2078                return Err(synth_core::Error::synthesis(
2079                    "F64 i64 conversion not supported (requires register pairs on 32-bit ARM)",
2080                ));
2081            }
2082            ArmOp::F64PromoteF32 { dd, sm } => {
2083                return self.encode_arm_f64_promote_f32(dd, sm);
2084            }
2085            ArmOp::F64ReinterpretI64 { dd, rmlo, rmhi } => {
2086                encode_vmov_core_dreg(true, dd, rmlo, rmhi)?
2087            }
2088            ArmOp::I64ReinterpretF64 { rdlo, rdhi, dm } => {
2089                encode_vmov_core_dreg(false, dm, rdlo, rdhi)?
2090            }
2091            ArmOp::I64TruncF64S { .. } | ArmOp::I64TruncF64U { .. } => {
2092                return Err(synth_core::Error::synthesis(
2093                    "i64 truncation from F64 not supported (requires i64 register pairs on 32-bit ARM)",
2094                ));
2095            }
2096            ArmOp::I32TruncF64S { rd, dm } => {
2097                return self.encode_arm_i32_trunc_f64(rd, dm, true);
2098            }
2099            ArmOp::I32TruncF64U { rd, dm } => {
2100                return self.encode_arm_i32_trunc_f64(rd, dm, false);
2101            }
2102            // #615: multi-instruction i64 sequences — expanded to real A32 by
2103            // `encode_arm_expanded`, no longer "Thumb-2 only" NOPs.
2104            ArmOp::I64SetCond { .. }
2105            | ArmOp::I64SetCondZ { .. }
2106            | ArmOp::I64Mul { .. }
2107            | ArmOp::I64Shl { .. }
2108            | ArmOp::I64ShrS { .. }
2109            | ArmOp::I64ShrU { .. }
2110            | ArmOp::I64Rotl { .. }
2111            | ArmOp::I64Rotr { .. } => {
2112                unreachable!("handled by encode_arm_expanded (#615)")
2113            }
2114
2115            // MVE instructions — Thumb-2 only (Cortex-M55 is always Thumb-2)
2116            ArmOp::MveLoad { .. }
2117            | ArmOp::MveStore { .. }
2118            | ArmOp::MveConst { .. }
2119            | ArmOp::MveAnd { .. }
2120            | ArmOp::MveOrr { .. }
2121            | ArmOp::MveEor { .. }
2122            | ArmOp::MveMvn { .. }
2123            | ArmOp::MveBic { .. }
2124            | ArmOp::MveAddI { .. }
2125            | ArmOp::MveSubI { .. }
2126            | ArmOp::MveMulI { .. }
2127            | ArmOp::MveNegI { .. }
2128            | ArmOp::MveCmpEqI { .. }
2129            | ArmOp::MveCmpNeI { .. }
2130            | ArmOp::MveCmpLtS { .. }
2131            | ArmOp::MveCmpLtU { .. }
2132            | ArmOp::MveCmpGtS { .. }
2133            | ArmOp::MveCmpGtU { .. }
2134            | ArmOp::MveCmpLeS { .. }
2135            | ArmOp::MveCmpLeU { .. }
2136            | ArmOp::MveCmpGeS { .. }
2137            | ArmOp::MveCmpGeU { .. }
2138            | ArmOp::MveDup { .. }
2139            | ArmOp::MveExtractLane { .. }
2140            | ArmOp::MveInsertLane { .. }
2141            | ArmOp::MveAddF32 { .. }
2142            | ArmOp::MveSubF32 { .. }
2143            | ArmOp::MveMulF32 { .. }
2144            | ArmOp::MveNegF32 { .. }
2145            | ArmOp::MveAbsF32 { .. }
2146            | ArmOp::MveCmpEqF32 { .. }
2147            | ArmOp::MveCmpNeF32 { .. }
2148            | ArmOp::MveCmpLtF32 { .. }
2149            | ArmOp::MveCmpLeF32 { .. }
2150            | ArmOp::MveCmpGtF32 { .. }
2151            | ArmOp::MveCmpGeF32 { .. }
2152            | ArmOp::MveDupF32 { .. }
2153            | ArmOp::MveExtractLaneF32 { .. }
2154            | ArmOp::MveReplaceLaneF32 { .. }
2155            | ArmOp::MveDivF32 { .. }
2156            | ArmOp::MveSqrtF32 { .. } => {
2157                // MVE (Helium) is a Thumb-2-only extension (Cortex-M55); there
2158                // is no A32 encoding. The selector only emits MVE ops for
2159                // Thumb targets — a NOP here silently dropped the vector op
2160                // if that invariant ever broke (#615 class). Err keeps the
2161                // encoder total and the failure loud.
2162                return Err(synth_core::Error::synthesis(format!(
2163                    "MVE op {op:?} has no A32 (ARM-mode) encoding — MVE is Thumb-2 only (#615)"
2164                )));
2165            }
2166        };
2167
2168        // ARM32 instructions are little-endian
2169        Ok(instr.to_le_bytes().to_vec())
2170    }
2171
2172    // === ARM32 VFP multi-instruction helpers ===
2173
2174    /// Encode F32 comparison as ARM32: VCMP.F32 + VMRS + MOV rd,#0 + MOVcond rd,#1
2175    fn encode_arm_f32_compare(
2176        &self,
2177        rd: &Reg,
2178        sn: &VfpReg,
2179        sm: &VfpReg,
2180        cond_code: u32,
2181    ) -> Result<Vec<u8>> {
2182        let mut bytes = Vec::new();
2183
2184        // VCMP.F32 Sn, Sm: 0xEEB40A40 with Sn in Vd position, Sm in Vm position
2185        let sn_num = vfp_sreg_to_num(sn)?;
2186        let sm_num = vfp_sreg_to_num(sm)?;
2187        let (vd, d) = encode_sreg(sn_num);
2188        let (vm, m) = encode_sreg(sm_num);
2189        let vcmp = 0xEEB40A40 | (d << 22) | (vd << 12) | (m << 5) | vm;
2190        bytes.extend_from_slice(&vcmp.to_le_bytes());
2191
2192        // VMRS APSR_nzcv, FPSCR: 0xEEF1FA10
2193        bytes.extend_from_slice(&0xEEF1FA10u32.to_le_bytes());
2194
2195        // MOV rd, #0: 0xE3A0_0000 | (rd << 12)
2196        let rd_bits = reg_to_bits(rd);
2197        let mov_zero = 0xE3A00000 | (rd_bits << 12);
2198        bytes.extend_from_slice(&mov_zero.to_le_bytes());
2199
2200        // MOVcond rd, #1: cond(4) | 0011 1010 0000 rd(4) 0000 0000 0001
2201        let mov_one = (cond_code << 28) | 0x03A00001 | (rd_bits << 12);
2202        bytes.extend_from_slice(&mov_one.to_le_bytes());
2203
2204        Ok(bytes)
2205    }
2206
2207    /// Encode F32 constant load as ARM32: MOVW Rt,#lo16 + MOVT Rt,#hi16 + VMOV Sd,Rt
2208    fn encode_arm_f32_const(&self, sd: &VfpReg, value: f32) -> Result<Vec<u8>> {
2209        let mut bytes = Vec::new();
2210        let bits = value.to_bits();
2211
2212        // Use R12 as temp register for constant loading
2213        let rt: u32 = 12; // R12/IP
2214
2215        // MOVW R12, #lo16: 0xE300_C000 | (imm4 << 16) | imm12
2216        let lo16 = bits & 0xFFFF;
2217        let movw = 0xE3000000 | (rt << 12) | ((lo16 >> 12) << 16) | (lo16 & 0xFFF);
2218        bytes.extend_from_slice(&movw.to_le_bytes());
2219
2220        // MOVT R12, #hi16: 0xE340_C000 | (imm4 << 16) | imm12
2221        let hi16 = (bits >> 16) & 0xFFFF;
2222        let movt = 0xE3400000 | (rt << 12) | ((hi16 >> 12) << 16) | (hi16 & 0xFFF);
2223        bytes.extend_from_slice(&movt.to_le_bytes());
2224
2225        // VMOV Sd, R12
2226        let vmov = encode_vmov_core_sreg(true, sd, &Reg::R12)?;
2227        bytes.extend_from_slice(&vmov.to_le_bytes());
2228
2229        Ok(bytes)
2230    }
2231
2232    /// Encode VMOV + VCVT.F32.S32/U32 as ARM32
2233    fn encode_arm_f32_convert_i32(&self, sd: &VfpReg, rm: &Reg, signed: bool) -> Result<Vec<u8>> {
2234        let mut bytes = Vec::new();
2235
2236        // VMOV Sd, Rm — move integer to VFP register
2237        let vmov = encode_vmov_core_sreg(true, sd, rm)?;
2238        bytes.extend_from_slice(&vmov.to_le_bytes());
2239
2240        // VCVT.F32.S32 Sd, Sd (signed) or VCVT.F32.U32 Sd, Sd (unsigned).
2241        // The "op" bit (bit 7) selects signedness: 1 = signed (S32), 0 =
2242        // unsigned (U32). So signed = 0xEEB80AC0, unsigned = 0xEEB80A40 —
2243        // objdump confirms 0xEEB80A40 decodes to `vcvt.f32.u32` (GI-FPU-002:
2244        // the two were previously swapped, silently making `convert_i32_s`
2245        // an unsigned conversion).
2246        let sd_num = vfp_sreg_to_num(sd)?;
2247        let (vd, d) = encode_sreg(sd_num);
2248        let (vm, m) = encode_sreg(sd_num); // same register as source
2249        let base = if signed { 0xEEB80AC0 } else { 0xEEB80A40 };
2250        let vcvt = base | (d << 22) | (vd << 12) | (m << 5) | vm;
2251        bytes.extend_from_slice(&vcvt.to_le_bytes());
2252
2253        Ok(bytes)
2254    }
2255
2256    /// Encode F32 rounding pseudo-op as ARM32 via VCVT to integer and back.
2257    /// mode: 0b00=nearest, 0b01=floor(-Inf), 0b10=ceil(+Inf), 0b11=trunc(zero)
2258    /// Strategy: VCVT.S32.F32 Sd, Sm (toward zero), then VCVT.F32.S32 Sd, Sd
2259    /// For ceil/floor/nearest, we use VCVTR (round toward mode) + convert back.
2260    /// Simplified: convert to int (toward zero for trunc) then back to float.
2261    /// Encode F32 rounding as ARM32.
2262    /// `mode`: FPSCR RMode — 0b00=nearest, 0b01=+inf(ceil), 0b10=-inf(floor), 0b11=zero(trunc)
2263    ///
2264    /// For trunc (mode=0b11): uses VCVTR.S32.F32 (always rounds toward zero).
2265    /// For ceil/floor/nearest: sets FPSCR rounding mode, uses VCVT.S32.F32 (non-R variant
2266    /// which honours FPSCR rmode), then restores FPSCR.
2267    fn encode_arm_f32_rounding(&self, sd: &VfpReg, sm: &VfpReg, mode: u8) -> Result<Vec<u8>> {
2268        let mut bytes = Vec::new();
2269        let sm_num = vfp_sreg_to_num(sm)?;
2270        let sd_num = vfp_sreg_to_num(sd)?;
2271        let (vd_s, d_s) = encode_sreg(sd_num);
2272        let (vm_s, m_s) = encode_sreg(sm_num);
2273
2274        if mode == 0b11 {
2275            // Trunc (toward zero): VCVTR.S32.F32 — the "R" variant always truncates.
2276            // 0xEEBD0AC0: bit[7]=1 => round toward zero regardless of FPSCR
2277            let vcvt_to_int = 0xEEBD0AC0 | (d_s << 22) | (vd_s << 12) | (m_s << 5) | vm_s;
2278            bytes.extend_from_slice(&vcvt_to_int.to_le_bytes());
2279        } else {
2280            // ceil/floor/nearest: manipulate FPSCR rounding mode
2281            let rt: u32 = 12; // R12/IP as temp
2282
2283            // VMRS R12, FPSCR
2284            let vmrs = 0xEEF10A10 | (rt << 12);
2285            bytes.extend_from_slice(&vmrs.to_le_bytes());
2286
2287            // BIC R12, R12, #(3 << 22) — clear RMode bits [23:22]
2288            // 3<<22 = 0x00C00000. ARM rotated imm: 0x03 ror 10 (rotation=5, imm8=0x03)
2289            let bic = 0xE3CC0000 | (rt << 12) | (0x05 << 8) | 0x03;
2290            bytes.extend_from_slice(&bic.to_le_bytes());
2291
2292            // ORR R12, R12, #(mode << 22) — set desired rounding mode
2293            if mode != 0 {
2294                // mode<<22: rotation=5, imm8=mode
2295                let orr = 0xE38C0000 | (rt << 12) | (0x05 << 8) | (mode as u32);
2296                bytes.extend_from_slice(&orr.to_le_bytes());
2297            }
2298
2299            // VMSR FPSCR, R12
2300            let vmsr = 0xEEE10A10 | (rt << 12);
2301            bytes.extend_from_slice(&vmsr.to_le_bytes());
2302
2303            // VCVT.S32.F32 Sd, Sm — non-R variant (bit[7]=0), uses FPSCR rounding mode
2304            let vcvt_to_int = 0xEEBD0A40 | (d_s << 22) | (vd_s << 12) | (m_s << 5) | vm_s;
2305            bytes.extend_from_slice(&vcvt_to_int.to_le_bytes());
2306
2307            // Restore FPSCR: clear rmode bits back to nearest (default)
2308            bytes.extend_from_slice(&vmrs.to_le_bytes());
2309            bytes.extend_from_slice(&bic.to_le_bytes());
2310            bytes.extend_from_slice(&vmsr.to_le_bytes());
2311        }
2312
2313        // VCVT.F32.S32 Sd, Sd (convert integer result back to float)
2314        let (vd2, d2) = encode_sreg(sd_num);
2315        let vcvt_to_float = 0xEEB80A40 | (d2 << 22) | (vd2 << 12) | (d_s << 5) | vd_s;
2316        bytes.extend_from_slice(&vcvt_to_float.to_le_bytes());
2317
2318        Ok(bytes)
2319    }
2320
2321    /// Encode F32 min/max as ARM32: VCMP + VMRS + conditional VMOV
2322    fn encode_arm_f32_minmax(
2323        &self,
2324        sd: &VfpReg,
2325        sn: &VfpReg,
2326        sm: &VfpReg,
2327        is_min: bool,
2328    ) -> Result<Vec<u8>> {
2329        let mut bytes = Vec::new();
2330        let sn_num = vfp_sreg_to_num(sn)?;
2331        let sm_num = vfp_sreg_to_num(sm)?;
2332        let sd_num = vfp_sreg_to_num(sd)?;
2333
2334        // VMOV Sd, Sn (start with first operand)
2335        let (vd, d) = encode_sreg(sd_num);
2336        let (vn, n) = encode_sreg(sn_num);
2337        let vmov_sn = 0xEEB00A40 | (d << 22) | (vd << 12) | (n << 5) | vn;
2338        bytes.extend_from_slice(&vmov_sn.to_le_bytes());
2339
2340        // VCMP.F32 Sn, Sm
2341        let (vm, m) = encode_sreg(sm_num);
2342        let vcmp = 0xEEB40A40 | (n << 22) | (vn << 12) | (m << 5) | vm;
2343        bytes.extend_from_slice(&vcmp.to_le_bytes());
2344
2345        // VMRS APSR_nzcv, FPSCR
2346        bytes.extend_from_slice(&0xEEF1FA10u32.to_le_bytes());
2347
2348        // For min: if Sn > Sm (GT), use Sm. Condition = GT (0xC)
2349        // For max: if Sn < Sm (MI/LT), use Sm. Condition = MI (0x4)
2350        let cond = if is_min { 0xCu32 } else { 0x4u32 };
2351
2352        // VMOV{cond} Sd, Sm — conditional VMOV
2353        let vmov_cond = (cond << 28) | 0x0EB00A40 | (d << 22) | (vd << 12) | (m << 5) | vm;
2354        bytes.extend_from_slice(&vmov_cond.to_le_bytes());
2355
2356        Ok(bytes)
2357    }
2358
2359    /// Encode F32 copysign as ARM32: extract sign from Sm, magnitude from Sn
2360    fn encode_arm_f32_copysign(&self, sd: &VfpReg, sn: &VfpReg, sm: &VfpReg) -> Result<Vec<u8>> {
2361        let mut bytes = Vec::new();
2362
2363        // VMOV R12, Sm (get sign source bits)
2364        let vmov_sm = encode_vmov_core_sreg(false, sm, &Reg::R12)?;
2365        bytes.extend_from_slice(&vmov_sm.to_le_bytes());
2366
2367        // VMOV R0, Sn (get magnitude source bits) — use R0 as temp
2368        let vmov_sn = encode_vmov_core_sreg(false, sn, &Reg::R0)?;
2369        bytes.extend_from_slice(&vmov_sn.to_le_bytes());
2370
2371        // AND R12, R12, #0x80000000 (keep only sign bit)
2372        // Thumb-2 constant 0x80000000 needs special encoding; in ARM32 use rotated imm
2373        // 0x80000000 = 0x02 rotated right by 2 (rotation=1, imm8=0x02)
2374        let and_sign = 0xE2000000u32 | (12 << 16) | (12 << 12) | (1 << 8) | 0x02;
2375        bytes.extend_from_slice(&and_sign.to_le_bytes());
2376
2377        // BIC R0, R0, #0x80000000 (clear sign bit from magnitude)
2378        // R0 = register 0, so Rn and Rd fields are 0
2379        let bic_sign = 0xE3C00000u32 | (1 << 8) | 0x02;
2380        bytes.extend_from_slice(&bic_sign.to_le_bytes());
2381
2382        // ORR R0, R0, R12 (combine sign + magnitude)
2383        // R0 = register 0, so Rn and Rd fields are 0
2384        let orr = 0xE1800000u32 | 12;
2385        bytes.extend_from_slice(&orr.to_le_bytes());
2386
2387        // VMOV Sd, R0
2388        let vmov_result = encode_vmov_core_sreg(true, sd, &Reg::R0)?;
2389        bytes.extend_from_slice(&vmov_result.to_le_bytes());
2390
2391        Ok(bytes)
2392    }
2393
2394    /// Encode F64 comparison as ARM32: VCMP.F64 + VMRS + MOV rd,#0 + MOVcond rd,#1
2395    fn encode_arm_f64_compare(
2396        &self,
2397        rd: &Reg,
2398        dn: &VfpReg,
2399        dm: &VfpReg,
2400        cond_code: u32,
2401    ) -> Result<Vec<u8>> {
2402        let mut bytes = Vec::new();
2403
2404        // VCMP.F64 Dn, Dm: 0xEEB40B40 with Dn in Vd position, Dm in Vm position
2405        let dn_num = vfp_dreg_to_num(dn)?;
2406        let dm_num = vfp_dreg_to_num(dm)?;
2407        let (vd, d) = encode_dreg(dn_num);
2408        let (vm, m) = encode_dreg(dm_num);
2409        let vcmp = 0xEEB40B40 | (d << 22) | (vd << 12) | (m << 5) | vm;
2410        bytes.extend_from_slice(&vcmp.to_le_bytes());
2411
2412        // VMRS APSR_nzcv, FPSCR
2413        bytes.extend_from_slice(&0xEEF1FA10u32.to_le_bytes());
2414
2415        // MOV rd, #0
2416        let rd_bits = reg_to_bits(rd);
2417        let mov_zero = 0xE3A00000 | (rd_bits << 12);
2418        bytes.extend_from_slice(&mov_zero.to_le_bytes());
2419
2420        // MOVcond rd, #1
2421        let mov_one = (cond_code << 28) | 0x03A00001 | (rd_bits << 12);
2422        bytes.extend_from_slice(&mov_one.to_le_bytes());
2423
2424        Ok(bytes)
2425    }
2426
2427    /// Encode F64 constant load as ARM32: MOVW + MOVT + MOVW + MOVT + VMOV
2428    fn encode_arm_f64_const(&self, dd: &VfpReg, value: f64) -> Result<Vec<u8>> {
2429        let mut bytes = Vec::new();
2430        let bits = value.to_bits();
2431        let lo32 = bits as u32;
2432        let hi32 = (bits >> 32) as u32;
2433
2434        // Load low 32 bits into R0 (Rd field = 0 for R0)
2435        let lo16 = lo32 & 0xFFFF;
2436        let movw_r0 = 0xE3000000 | ((lo16 >> 12) << 16) | (lo16 & 0xFFF);
2437        bytes.extend_from_slice(&movw_r0.to_le_bytes());
2438        let hi16 = (lo32 >> 16) & 0xFFFF;
2439        let movt_r0 = 0xE3400000 | ((hi16 >> 12) << 16) | (hi16 & 0xFFF);
2440        bytes.extend_from_slice(&movt_r0.to_le_bytes());
2441
2442        // Load high 32 bits into R12
2443        let lo16 = hi32 & 0xFFFF;
2444        let movw_r12 = 0xE3000000 | ((lo16 >> 12) << 16) | (12 << 12) | (lo16 & 0xFFF);
2445        bytes.extend_from_slice(&movw_r12.to_le_bytes());
2446        let hi16 = (hi32 >> 16) & 0xFFFF;
2447        let movt_r12 = 0xE3400000 | ((hi16 >> 12) << 16) | (12 << 12) | (hi16 & 0xFFF);
2448        bytes.extend_from_slice(&movt_r12.to_le_bytes());
2449
2450        // VMOV Dd, R0, R12
2451        let vmov = encode_vmov_core_dreg(true, dd, &Reg::R0, &Reg::R12)?;
2452        bytes.extend_from_slice(&vmov.to_le_bytes());
2453
2454        Ok(bytes)
2455    }
2456
2457    /// Encode VMOV Sd, Rm + VCVT.F64.S32/U32 Dd, Sd as ARM32
2458    fn encode_arm_f64_convert_i32(&self, dd: &VfpReg, rm: &Reg, signed: bool) -> Result<Vec<u8>> {
2459        let mut bytes = Vec::new();
2460
2461        // Use S0 as intermediate: VMOV S0, Rm
2462        let vmov = encode_vmov_core_sreg(true, &VfpReg::S0, rm)?;
2463        bytes.extend_from_slice(&vmov.to_le_bytes());
2464
2465        // VCVT.F64.S32 Dd, S0 (signed) or VCVT.F64.U32 Dd, S0 (unsigned)
2466        // Base: 0xEEB80B40 (signed) or 0xEEB80BC0 (unsigned)
2467        let dd_num = vfp_dreg_to_num(dd)?;
2468        let (vd, d) = encode_dreg(dd_num);
2469        let base = if signed { 0xEEB80B40 } else { 0xEEB80BC0 };
2470        // S0 is register 0: Vm=0, M=0
2471        let vcvt = base | (d << 22) | (vd << 12);
2472        bytes.extend_from_slice(&vcvt.to_le_bytes());
2473
2474        Ok(bytes)
2475    }
2476
2477    /// Encode VCVT.F64.F32 Dd, Sm as ARM32 (f32 to f64 promotion)
2478    fn encode_arm_f64_promote_f32(&self, dd: &VfpReg, sm: &VfpReg) -> Result<Vec<u8>> {
2479        let dd_num = vfp_dreg_to_num(dd)?;
2480        let sm_num = vfp_sreg_to_num(sm)?;
2481        let (vd, d) = encode_dreg(dd_num);
2482        let (vm, m) = encode_sreg(sm_num);
2483
2484        // VCVT.F64.F32 Dd, Sm: 0xEEB70AC0
2485        let vcvt = 0xEEB70AC0 | (d << 22) | (vd << 12) | (m << 5) | vm;
2486        Ok(vcvt.to_le_bytes().to_vec())
2487    }
2488
2489    /// Encode VCVT.S32/U32.F64 Sd, Dm + VMOV Rd, Sd as ARM32
2490    fn encode_arm_i32_trunc_f64(&self, rd: &Reg, dm: &VfpReg, signed: bool) -> Result<Vec<u8>> {
2491        let mut bytes = Vec::new();
2492        let dm_num = vfp_dreg_to_num(dm)?;
2493        let (vm, m) = encode_dreg(dm_num);
2494
2495        // VCVT.S32.F64 S0, Dm (toward zero) or VCVT.U32.F64 S0, Dm
2496        // S0: Vd=0, D=0
2497        let base = if signed { 0xEEBD0BC0 } else { 0xEEBC0BC0 };
2498        let vcvt = base | (m << 5) | vm;
2499        bytes.extend_from_slice(&vcvt.to_le_bytes());
2500
2501        // VMOV Rd, S0
2502        let vmov = encode_vmov_core_sreg(false, &VfpReg::S0, rd)?;
2503        bytes.extend_from_slice(&vmov.to_le_bytes());
2504
2505        Ok(bytes)
2506    }
2507
2508    /// Encode F64 rounding pseudo-op as ARM32 via VCVT to integer and back.
2509    /// Encode F64 rounding as ARM32.
2510    /// `mode`: FPSCR RMode — 0b00=nearest, 0b01=+inf(ceil), 0b10=-inf(floor), 0b11=zero(trunc)
2511    ///
2512    /// For trunc: uses VCVTR.S32.F64 (always truncates).
2513    /// For ceil/floor/nearest: sets FPSCR rounding mode, uses VCVT.S32.F64 (non-R variant),
2514    /// then restores FPSCR.
2515    fn encode_arm_f64_rounding(&self, dd: &VfpReg, dm: &VfpReg, mode: u8) -> Result<Vec<u8>> {
2516        let mut bytes = Vec::new();
2517        let dm_num = vfp_dreg_to_num(dm)?;
2518        let dd_num = vfp_dreg_to_num(dd)?;
2519        let (vm, m) = encode_dreg(dm_num);
2520        let (vd, d) = encode_dreg(dd_num);
2521
2522        if mode == 0b11 {
2523            // Trunc (toward zero): VCVTR.S32.F64 — bit[7]=1, always truncates
2524            let vcvt_to_int = 0xEEBD0BC0 | (m << 5) | vm;
2525            bytes.extend_from_slice(&vcvt_to_int.to_le_bytes());
2526        } else {
2527            // ceil/floor/nearest: manipulate FPSCR rounding mode
2528            let rt: u32 = 12;
2529
2530            // VMRS R12, FPSCR
2531            let vmrs = 0xEEF10A10 | (rt << 12);
2532            bytes.extend_from_slice(&vmrs.to_le_bytes());
2533
2534            // BIC R12, R12, #(3 << 22)
2535            let bic = 0xE3CC0000 | (rt << 12) | (0x05 << 8) | 0x03;
2536            bytes.extend_from_slice(&bic.to_le_bytes());
2537
2538            // ORR R12, R12, #(mode << 22)
2539            if mode != 0 {
2540                let orr = 0xE38C0000 | (rt << 12) | (0x05 << 8) | (mode as u32);
2541                bytes.extend_from_slice(&orr.to_le_bytes());
2542            }
2543
2544            // VMSR FPSCR, R12
2545            let vmsr = 0xEEE10A10 | (rt << 12);
2546            bytes.extend_from_slice(&vmsr.to_le_bytes());
2547
2548            // VCVT.S32.F64 S0, Dm — non-R variant (bit[7]=0), uses FPSCR rmode
2549            let vcvt_to_int = 0xEEBD0B40 | (m << 5) | vm;
2550            bytes.extend_from_slice(&vcvt_to_int.to_le_bytes());
2551
2552            // Restore FPSCR
2553            bytes.extend_from_slice(&vmrs.to_le_bytes());
2554            bytes.extend_from_slice(&bic.to_le_bytes());
2555            bytes.extend_from_slice(&vmsr.to_le_bytes());
2556        }
2557
2558        // VCVT.F64.S32 Dd, S0 (convert back to double)
2559        let vcvt_to_float = 0xEEB80B40 | (d << 22) | (vd << 12);
2560        bytes.extend_from_slice(&vcvt_to_float.to_le_bytes());
2561
2562        Ok(bytes)
2563    }
2564
2565    /// Encode F64 min/max as ARM32: VMOV + VCMP + VMRS + conditional VMOV
2566    fn encode_arm_f64_minmax(
2567        &self,
2568        dd: &VfpReg,
2569        dn: &VfpReg,
2570        dm: &VfpReg,
2571        is_min: bool,
2572    ) -> Result<Vec<u8>> {
2573        let mut bytes = Vec::new();
2574        let dn_num = vfp_dreg_to_num(dn)?;
2575        let dm_num = vfp_dreg_to_num(dm)?;
2576        let dd_num = vfp_dreg_to_num(dd)?;
2577
2578        // VMOV.F64 Dd, Dn (start with first operand)
2579        let (vd, d) = encode_dreg(dd_num);
2580        let (vn, n) = encode_dreg(dn_num);
2581        let vmov_dn = 0xEEB00B40 | (d << 22) | (vd << 12) | (n << 5) | vn;
2582        bytes.extend_from_slice(&vmov_dn.to_le_bytes());
2583
2584        // VCMP.F64 Dn, Dm
2585        let (vm, m) = encode_dreg(dm_num);
2586        let vcmp = 0xEEB40B40 | (n << 22) | (vn << 12) | (m << 5) | vm;
2587        bytes.extend_from_slice(&vcmp.to_le_bytes());
2588
2589        // VMRS APSR_nzcv, FPSCR
2590        bytes.extend_from_slice(&0xEEF1FA10u32.to_le_bytes());
2591
2592        let cond = if is_min { 0xCu32 } else { 0x4u32 };
2593        let vmov_cond = (cond << 28) | 0x0EB00B40 | (d << 22) | (vd << 12) | (m << 5) | vm;
2594        bytes.extend_from_slice(&vmov_cond.to_le_bytes());
2595
2596        Ok(bytes)
2597    }
2598
2599    /// Encode F64 copysign as ARM32
2600    fn encode_arm_f64_copysign(&self, dd: &VfpReg, dn: &VfpReg, dm: &VfpReg) -> Result<Vec<u8>> {
2601        let mut bytes = Vec::new();
2602
2603        // VMOV R0, R12, Dm (get sign source bits)
2604        let vmov_dm = encode_vmov_core_dreg(false, dm, &Reg::R0, &Reg::R12)?;
2605        bytes.extend_from_slice(&vmov_dm.to_le_bytes());
2606
2607        // VMOV R1, R2, Dn (get magnitude source bits)
2608        // We use R1 (lo) and R2 (hi) for the magnitude
2609        let vmov_dn = encode_vmov_core_dreg(false, dn, &Reg::R1, &Reg::R2)?;
2610        bytes.extend_from_slice(&vmov_dn.to_le_bytes());
2611
2612        // AND R12, R12, #0x80000000 (keep only sign bit from hi word)
2613        let and_sign = 0xE2000000u32 | (12 << 16) | (12 << 12) | (1 << 8) | 0x02;
2614        bytes.extend_from_slice(&and_sign.to_le_bytes());
2615
2616        // BIC R2, R2, #0x80000000 (clear sign bit from magnitude hi word)
2617        let bic_sign = 0xE3C00000u32 | (2 << 16) | (2 << 12) | (1 << 8) | 0x02;
2618        bytes.extend_from_slice(&bic_sign.to_le_bytes());
2619
2620        // ORR R2, R2, R12 (combine sign + magnitude)
2621        let orr = 0xE1800000u32 | (2 << 16) | (2 << 12) | 12;
2622        bytes.extend_from_slice(&orr.to_le_bytes());
2623
2624        // VMOV Dd, R1, R2
2625        let vmov_result = encode_vmov_core_dreg(true, dd, &Reg::R1, &Reg::R2)?;
2626        bytes.extend_from_slice(&vmov_result.to_le_bytes());
2627
2628        Ok(bytes)
2629    }
2630
2631    /// Encode VCVT.S32/U32.F32 + VMOV as ARM32
2632    fn encode_arm_i32_trunc_f32(&self, rd: &Reg, sm: &VfpReg, signed: bool) -> Result<Vec<u8>> {
2633        let mut bytes = Vec::new();
2634
2635        // VCVT.S32.F32 Sd, Sm (toward zero) or VCVT.U32.F32 Sd, Sm
2636        // We use Sm as both source and destination for the intermediate result
2637        let sm_num = vfp_sreg_to_num(sm)?;
2638        let (vd, d) = encode_sreg(sm_num);
2639        let (vm, m) = encode_sreg(sm_num);
2640        let base = if signed { 0xEEBD0AC0 } else { 0xEEBC0AC0 };
2641        let vcvt = base | (d << 22) | (vd << 12) | (m << 5) | vm;
2642        bytes.extend_from_slice(&vcvt.to_le_bytes());
2643
2644        // VMOV Rd, Sm — move result back to core register
2645        let vmov = encode_vmov_core_sreg(false, sm, rd)?;
2646        bytes.extend_from_slice(&vmov.to_le_bytes());
2647
2648        Ok(bytes)
2649    }
2650
2651    /// Encode an ARM instruction in Thumb-2 mode (16-bit or 32-bit instructions)
2652    fn encode_thumb(&self, op: &ArmOp) -> Result<Vec<u8>> {
2653        // Thumb-2 supports both 16-bit and 32-bit instructions
2654        // 32-bit instructions are encoded as two 16-bit halfwords (big-endian order)
2655        match op {
2656            // === 16-bit Thumb encodings ===
2657            ArmOp::Add { rd, rn, op2 } => {
2658                let rd_bits = reg_to_bits(rd) as u16;
2659                let rn_bits = reg_to_bits(rn) as u16;
2660
2661                if let Operand2::Reg(rm) = op2 {
2662                    let rm_bits = reg_to_bits(rm) as u16;
2663                    // 16-bit ADDS only has 3-bit register fields (R0-R7). For
2664                    // high registers (e.g. R12, the MemLoad/MemStore base
2665                    // scratch) the bits overflow into adjacent fields, silently
2666                    // corrupting the operands — issue #178/#180: `add ip,ip,r0`
2667                    // was emitted as `adds r4,r5,r1`. Guard on all three regs
2668                    // being low and fall back to 32-bit ADD.W otherwise, exactly
2669                    // as the Sub handler below does.
2670                    if rd_bits < 8 && rn_bits < 8 && rm_bits < 8 {
2671                        // ADDS Rd, Rn, Rm (16-bit): 0001 100 Rm Rn Rd
2672                        let instr: u16 = 0x1800 | (rm_bits << 6) | (rn_bits << 3) | rd_bits;
2673                        Ok(instr.to_le_bytes().to_vec())
2674                    } else {
2675                        // ADD.W Rd, Rn, Rm (32-bit) for high registers
2676                        self.encode_thumb32_add_reg_raw(
2677                            rd_bits as u32,
2678                            rn_bits as u32,
2679                            rm_bits as u32,
2680                        )
2681                    }
2682                } else if let Operand2::Imm(imm) = op2 {
2683                    if *imm <= 7 && rd_bits < 8 && rn_bits < 8 {
2684                        // ADDS Rd, Rn, #imm3 (16-bit): 0001 110 imm3 Rn Rd
2685                        let instr: u16 = 0x1C00 | ((*imm as u16) << 6) | (rn_bits << 3) | rd_bits;
2686                        Ok(instr.to_le_bytes().to_vec())
2687                    } else {
2688                        // Use 32-bit ADD for larger immediates
2689                        self.encode_thumb32_add(rd, rn, *imm as u32)
2690                    }
2691                } else {
2692                    // Fallback to 32-bit encoding
2693                    self.encode_thumb32_add(rd, rn, 0)
2694                }
2695            }
2696
2697            ArmOp::Sub { rd, rn, op2 } => {
2698                let rd_bits = reg_to_bits(rd) as u16;
2699                let rn_bits = reg_to_bits(rn) as u16;
2700
2701                if let Operand2::Reg(rm) = op2 {
2702                    let rm_bits = reg_to_bits(rm) as u16;
2703                    // 16-bit SUBS can only use low registers (R0-R7)
2704                    if rd_bits < 8 && rn_bits < 8 && rm_bits < 8 {
2705                        // SUBS Rd, Rn, Rm (16-bit): 0001 101 Rm Rn Rd
2706                        let instr: u16 = 0x1A00 | (rm_bits << 6) | (rn_bits << 3) | rd_bits;
2707                        Ok(instr.to_le_bytes().to_vec())
2708                    } else {
2709                        // Use 32-bit SUB.W for high registers
2710                        self.encode_thumb32_sub_reg_raw(
2711                            rd_bits as u32,
2712                            rn_bits as u32,
2713                            rm_bits as u32,
2714                        )
2715                    }
2716                } else if let Operand2::Imm(imm) = op2 {
2717                    if *imm <= 7 && rd_bits < 8 && rn_bits < 8 {
2718                        // SUBS Rd, Rn, #imm3 (16-bit): 0001 111 imm3 Rn Rd
2719                        let instr: u16 = 0x1E00 | ((*imm as u16) << 6) | (rn_bits << 3) | rd_bits;
2720                        Ok(instr.to_le_bytes().to_vec())
2721                    } else {
2722                        self.encode_thumb32_sub(rd, rn, *imm as u32)
2723                    }
2724                } else {
2725                    self.encode_thumb32_sub(rd, rn, 0)
2726                }
2727            }
2728
2729            ArmOp::Mov { rd, op2 } => {
2730                let rd_bits = reg_to_bits(rd) as u16;
2731
2732                if let Operand2::Imm(imm) = op2 {
2733                    // #498: the old test here was the SIGNED `*imm <= 255`,
2734                    // so a negative immediate (e.g. -1) fell into the 16-bit
2735                    // MOVS arm and encoded the wrong VALUE (#(imm & 0xFF) =
2736                    // #0xFF). A positive imm above 0xFFFF was equally wrong:
2737                    // MOVW truncates to 16 bits. Split on the UNSIGNED value:
2738                    // imm8 → MOVS, imm16 → MOVW, anything wider (negative or
2739                    // >0xFFFF) → the full-value MOVW+MOVT pair. No emitter
2740                    // produces the wide shape today (both selectors
2741                    // materialize wide constants as explicit Movw/Movt or
2742                    // Movw+Mvn), so this is byte-identical on shipped paths —
2743                    // it retires the latent wrong-value encodings the
2744                    // `estimator_encoder_agreement` oracle had pinned.
2745                    let uimm = *imm as u32;
2746                    if uimm <= 255 && rd_bits < 8 {
2747                        // MOVS Rd, #imm8 (16-bit): 0010 0 Rd imm8
2748                        let imm_bits = (*imm as u16) & 0xFF;
2749                        let instr: u16 = 0x2000 | (rd_bits << 8) | imm_bits;
2750                        Ok(instr.to_le_bytes().to_vec())
2751                    } else if uimm <= 0xFFFF {
2752                        // Use 32-bit MOVW for 16-bit immediates
2753                        self.encode_thumb32_movw(rd, uimm)
2754                    } else {
2755                        // Full 32-bit value: MOVW low16 + MOVT high16
2756                        let mut bytes = self.encode_thumb32_movw(rd, uimm & 0xFFFF)?;
2757                        bytes.extend(self.encode_thumb32_movt_raw(reg_to_bits(rd), uimm >> 16)?);
2758                        Ok(bytes)
2759                    }
2760                } else if let Operand2::Reg(rm) = op2 {
2761                    let rm_bits = reg_to_bits(rm) as u16;
2762                    // MOV Rd, Rm (16-bit): 0100 0110 D Rm Rd[2:0]
2763                    // D = Rd[3], Rd[2:0] in lower bits
2764                    let d_bit = (rd_bits >> 3) & 1;
2765                    let instr: u16 = 0x4600 | (d_bit << 7) | (rm_bits << 3) | (rd_bits & 0x7);
2766                    Ok(instr.to_le_bytes().to_vec())
2767                } else {
2768                    let instr: u16 = 0xBF00; // NOP fallback
2769                    Ok(instr.to_le_bytes().to_vec())
2770                }
2771            }
2772
2773            ArmOp::Push { regs } => {
2774                // Thumb-2 PUSH encoding:
2775                // If all regs in R0-R7 + LR, use 16-bit: 1011 010 M rrrrrrrr
2776                // Otherwise use 32-bit: STMDB SP!, {regs} = 1110 1001 0010 1101 | 0M0 reglist(13)
2777                let mut reg_list: u16 = 0;
2778                let mut need_32bit = false;
2779                for r in regs {
2780                    let bit = reg_to_bits(r);
2781                    if bit >= 8 && *r != Reg::LR {
2782                        need_32bit = true;
2783                    }
2784                    reg_list |= 1 << bit;
2785                }
2786                if !need_32bit {
2787                    // 16-bit PUSH: 1011 010 M rrrrrrrr
2788                    let m_bit = if reg_list & (1 << 14) != 0 {
2789                        1u16
2790                    } else {
2791                        0u16
2792                    };
2793                    let low_regs = reg_list & 0xFF;
2794                    let instr: u16 = 0xB400 | (m_bit << 8) | low_regs;
2795                    Ok(instr.to_le_bytes().to_vec())
2796                } else {
2797                    // 32-bit STMDB SP!, {regs}: E92D | reglist(16)
2798                    let hw1: u16 = 0xE92D;
2799                    let hw2: u16 = reg_list;
2800                    let mut bytes = hw1.to_le_bytes().to_vec();
2801                    bytes.extend_from_slice(&hw2.to_le_bytes());
2802                    Ok(bytes)
2803                }
2804            }
2805
2806            ArmOp::Pop { regs } => {
2807                // Thumb-2 POP encoding:
2808                // If all regs in R0-R7 + PC, use 16-bit: 1011 110 P rrrrrrrr
2809                // Otherwise use 32-bit: LDMIA SP!, {regs} = 1110 1000 1011 1101 | PM0 reglist(13)
2810                let mut reg_list: u16 = 0;
2811                let mut need_32bit = false;
2812                for r in regs {
2813                    let bit = reg_to_bits(r);
2814                    if bit >= 8 && *r != Reg::PC {
2815                        need_32bit = true;
2816                    }
2817                    reg_list |= 1 << bit;
2818                }
2819                if !need_32bit {
2820                    // 16-bit POP: 1011 110 P rrrrrrrr
2821                    let p_bit = if reg_list & (1 << 15) != 0 {
2822                        1u16
2823                    } else {
2824                        0u16
2825                    };
2826                    let low_regs = reg_list & 0xFF;
2827                    let instr: u16 = 0xBC00 | (p_bit << 8) | low_regs;
2828                    Ok(instr.to_le_bytes().to_vec())
2829                } else {
2830                    // 32-bit LDMIA SP!, {regs}: E8BD | reglist(16)
2831                    let hw1: u16 = 0xE8BD;
2832                    let hw2: u16 = reg_list;
2833                    let mut bytes = hw1.to_le_bytes().to_vec();
2834                    bytes.extend_from_slice(&hw2.to_le_bytes());
2835                    Ok(bytes)
2836                }
2837            }
2838
2839            ArmOp::Nop => {
2840                let instr: u16 = 0xBF00; // NOP in Thumb-2
2841                Ok(instr.to_le_bytes().to_vec())
2842            }
2843
2844            ArmOp::Udf { imm } => {
2845                // UDF (Undefined) in Thumb-2: 16-bit encoding is 0xDE00 | imm8
2846                // This triggers UsageFault/HardFault, used for WASM traps
2847                let instr: u16 = 0xDE00 | (*imm as u16);
2848                let bytes = instr.to_le_bytes().to_vec();
2849                encoding_contracts::verify_thumb16(&bytes);
2850                Ok(bytes)
2851            }
2852
2853            // i64 support: ADDS, ADC, SUBS, SBC for register pair arithmetic
2854            // ADDS sets flags (carry), ADC uses carry from previous ADDS
2855            ArmOp::Adds { rd, rn, op2 } => {
2856                let rd_bits = reg_to_bits(rd) as u16;
2857                let rn_bits = reg_to_bits(rn) as u16;
2858
2859                if let Operand2::Reg(rm) = op2 {
2860                    let rm_bits = reg_to_bits(rm) as u16;
2861                    // 16-bit ADDS is R0-R7 only; i64 pair allocation can place
2862                    // operands in R8-R11, which would overflow the 3-bit fields
2863                    // and corrupt the operands (#178/#180 class). Guard and fall
2864                    // back to 32-bit ADDS.W for high registers.
2865                    if rd_bits < 8 && rn_bits < 8 && rm_bits < 8 {
2866                        // ADDS Rd, Rn, Rm (16-bit): 0001 100 Rm Rn Rd
2867                        let instr: u16 = 0x1800 | (rm_bits << 6) | (rn_bits << 3) | rd_bits;
2868                        Ok(instr.to_le_bytes().to_vec())
2869                    } else {
2870                        self.encode_thumb32_adds_reg_raw(
2871                            rd_bits as u32,
2872                            rn_bits as u32,
2873                            rm_bits as u32,
2874                        )
2875                    }
2876                } else {
2877                    // 32-bit Thumb-2 ADDS with immediate
2878                    self.encode_thumb32_adds(rd, rn, 0)
2879                }
2880            }
2881
2882            // ADC: Add with Carry (Thumb-2 32-bit)
2883            // ADC.W Rd, Rn, Rm: EB40 Rn | 00 Rd 00 Rm
2884            ArmOp::Adc { rd, rn, op2 } => {
2885                let rd_bits = reg_to_bits(rd);
2886                let rn_bits = reg_to_bits(rn);
2887
2888                if let Operand2::Reg(rm) = op2 {
2889                    let rm_bits = reg_to_bits(rm);
2890                    // ADC.W Rd, Rn, Rm (T2): 1110 1011 0100 Rn | 0 000 Rd 00 00 Rm
2891                    let hw1: u16 = (0xEB40 | rn_bits) as u16;
2892                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
2893
2894                    let mut bytes = hw1.to_le_bytes().to_vec();
2895                    bytes.extend_from_slice(&hw2.to_le_bytes());
2896                    Ok(bytes)
2897                } else {
2898                    // ADC with immediate - use 32-bit encoding
2899                    let hw1: u16 = (0xF140 | rn_bits) as u16;
2900                    let hw2: u16 = (rd_bits << 8) as u16;
2901                    let mut bytes = hw1.to_le_bytes().to_vec();
2902                    bytes.extend_from_slice(&hw2.to_le_bytes());
2903                    Ok(bytes)
2904                }
2905            }
2906
2907            // SUBS sets flags (borrow), SBC uses borrow from previous SUBS
2908            ArmOp::Subs { rd, rn, op2 } => {
2909                let rd_bits = reg_to_bits(rd) as u16;
2910                let rn_bits = reg_to_bits(rn) as u16;
2911
2912                if let Operand2::Reg(rm) = op2 {
2913                    let rm_bits = reg_to_bits(rm) as u16;
2914                    // 16-bit SUBS is R0-R7 only; high-register i64 pair operands
2915                    // would overflow the 3-bit fields (#178/#180 class). Guard
2916                    // and fall back to 32-bit SUBS.W for high registers.
2917                    if rd_bits < 8 && rn_bits < 8 && rm_bits < 8 {
2918                        // SUBS Rd, Rn, Rm (16-bit): 0001 101 Rm Rn Rd
2919                        let instr: u16 = 0x1A00 | (rm_bits << 6) | (rn_bits << 3) | rd_bits;
2920                        Ok(instr.to_le_bytes().to_vec())
2921                    } else {
2922                        self.encode_thumb32_subs_reg_raw(
2923                            rd_bits as u32,
2924                            rn_bits as u32,
2925                            rm_bits as u32,
2926                        )
2927                    }
2928                } else {
2929                    // 32-bit Thumb-2 SUBS with immediate
2930                    self.encode_thumb32_subs(rd, rn, 0)
2931                }
2932            }
2933
2934            // SBC: Subtract with Carry (Thumb-2 32-bit)
2935            // SBC.W Rd, Rn, Rm: EB60 Rn | 00 Rd 00 Rm
2936            ArmOp::Sbc { rd, rn, op2 } => {
2937                let rd_bits = reg_to_bits(rd);
2938                let rn_bits = reg_to_bits(rn);
2939
2940                if let Operand2::Reg(rm) = op2 {
2941                    let rm_bits = reg_to_bits(rm);
2942                    // SBC.W Rd, Rn, Rm (T2): 1110 1011 0110 Rn | 0 000 Rd 00 00 Rm
2943                    let hw1: u16 = (0xEB60 | rn_bits) as u16;
2944                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
2945
2946                    let mut bytes = hw1.to_le_bytes().to_vec();
2947                    bytes.extend_from_slice(&hw2.to_le_bytes());
2948                    Ok(bytes)
2949                } else {
2950                    // SBC with immediate - use 32-bit encoding
2951                    let hw1: u16 = (0xF160 | rn_bits) as u16;
2952                    let hw2: u16 = (rd_bits << 8) as u16;
2953                    let mut bytes = hw1.to_le_bytes().to_vec();
2954                    bytes.extend_from_slice(&hw2.to_le_bytes());
2955                    Ok(bytes)
2956                }
2957            }
2958
2959            // === 32-bit Thumb-2 encodings ===
2960
2961            // SDIV: 11111011 1001 Rn 1111 Rd 1111 Rm
2962            ArmOp::Sdiv { rd, rn, rm } => {
2963                let rd_bits = reg_to_bits(rd);
2964                let rn_bits = reg_to_bits(rn);
2965                let rm_bits = reg_to_bits(rm);
2966                reg_bits_checked(rd_bits)?;
2967                reg_bits_checked(rn_bits)?;
2968                reg_bits_checked(rm_bits)?;
2969
2970                // Thumb-2 SDIV: FB90 F0F0 | Rn<<16 | Rd<<8 | Rm
2971                // First halfword: 1111 1011 1001 Rn = 0xFB90 | Rn
2972                // Second halfword: 1111 Rd 1111 Rm = 0xF0F0 | Rd<<8 | Rm
2973                let hw1: u16 = (0xFB90 | rn_bits) as u16;
2974                let hw2: u16 = (0xF0F0 | (rd_bits << 8) | rm_bits) as u16;
2975
2976                // Thumb-2 32-bit instructions: first halfword, then second halfword (little-endian each)
2977                let mut bytes = hw1.to_le_bytes().to_vec();
2978                bytes.extend_from_slice(&hw2.to_le_bytes());
2979                encoding_contracts::verify_thumb32(&bytes);
2980                Ok(bytes)
2981            }
2982
2983            // UDIV: 11111011 1011 Rn 1111 Rd 1111 Rm
2984            ArmOp::Udiv { rd, rn, rm } => {
2985                let rd_bits = reg_to_bits(rd);
2986                let rn_bits = reg_to_bits(rn);
2987                let rm_bits = reg_to_bits(rm);
2988                reg_bits_checked(rd_bits)?;
2989                reg_bits_checked(rn_bits)?;
2990                reg_bits_checked(rm_bits)?;
2991
2992                // Thumb-2 UDIV: FBB0 F0F0 | Rn<<16 | Rd<<8 | Rm
2993                let hw1: u16 = (0xFBB0 | rn_bits) as u16;
2994                let hw2: u16 = (0xF0F0 | (rd_bits << 8) | rm_bits) as u16;
2995
2996                let mut bytes = hw1.to_le_bytes().to_vec();
2997                bytes.extend_from_slice(&hw2.to_le_bytes());
2998                encoding_contracts::verify_thumb32(&bytes);
2999                Ok(bytes)
3000            }
3001
3002            ArmOp::Umull { rdlo, rdhi, rn, rm } => {
3003                let rdlo_bits = reg_to_bits(rdlo);
3004                let rdhi_bits = reg_to_bits(rdhi);
3005                let rn_bits = reg_to_bits(rn);
3006                let rm_bits = reg_to_bits(rm);
3007                reg_bits_checked(rdlo_bits)?;
3008                reg_bits_checked(rdhi_bits)?;
3009                reg_bits_checked(rn_bits)?;
3010                reg_bits_checked(rm_bits)?;
3011
3012                // Thumb-2 UMULL: 1111 1011 1010 Rn | RdLo RdHi 0000 Rm
3013                let hw1: u16 = (0xFBA0 | rn_bits) as u16;
3014                let hw2: u16 = ((rdlo_bits << 12) | (rdhi_bits << 8) | rm_bits) as u16;
3015
3016                let mut bytes = hw1.to_le_bytes().to_vec();
3017                bytes.extend_from_slice(&hw2.to_le_bytes());
3018                encoding_contracts::verify_thumb32(&bytes);
3019                Ok(bytes)
3020            }
3021
3022            // MUL (Thumb-2 32-bit): MUL Rd, Rn, Rm
3023            ArmOp::Mul { rd, rn, rm } => {
3024                let rd_bits = reg_to_bits(rd);
3025                let rn_bits = reg_to_bits(rn);
3026                let rm_bits = reg_to_bits(rm);
3027
3028                // Thumb-2 MUL: FB00 F000 | Rn | Rd<<8 | Rm
3029                // 11111011 0000 Rn | 1111 Rd 0000 Rm
3030                let hw1: u16 = (0xFB00 | rn_bits) as u16;
3031                let hw2: u16 = (0xF000 | (rd_bits << 8) | rm_bits) as u16;
3032
3033                let mut bytes = hw1.to_le_bytes().to_vec();
3034                bytes.extend_from_slice(&hw2.to_le_bytes());
3035                Ok(bytes)
3036            }
3037
3038            // MLS: Rd = Ra - Rn * Rm
3039            ArmOp::Mls { rd, rn, rm, ra } => {
3040                let rd_bits = reg_to_bits(rd);
3041                let rn_bits = reg_to_bits(rn);
3042                let rm_bits = reg_to_bits(rm);
3043                let ra_bits = reg_to_bits(ra);
3044
3045                // Thumb-2 MLS: FB00 Rn | Ra Rd 0001 Rm
3046                // 11111011 0000 Rn | Ra Rd 0001 Rm
3047                let hw1: u16 = (0xFB00 | rn_bits) as u16;
3048                let hw2: u16 = ((ra_bits << 12) | (rd_bits << 8) | 0x10 | rm_bits) as u16;
3049
3050                let mut bytes = hw1.to_le_bytes().to_vec();
3051                bytes.extend_from_slice(&hw2.to_le_bytes());
3052                Ok(bytes)
3053            }
3054
3055            ArmOp::Mla { rd, rn, rm, ra } => {
3056                let rd_bits = reg_to_bits(rd);
3057                let rn_bits = reg_to_bits(rn);
3058                let rm_bits = reg_to_bits(rm);
3059                let ra_bits = reg_to_bits(ra);
3060
3061                // Thumb-2 MLA: FB00 Rn | Ra Rd 0000 Rm — same as MLS without the
3062                // bit-4 (0x10) op flag. rd = ra + rn*rm.
3063                let hw1: u16 = (0xFB00 | rn_bits) as u16;
3064                let hw2: u16 = ((ra_bits << 12) | (rd_bits << 8) | rm_bits) as u16;
3065
3066                let mut bytes = hw1.to_le_bytes().to_vec();
3067                bytes.extend_from_slice(&hw2.to_le_bytes());
3068                Ok(bytes)
3069            }
3070
3071            // AND (Thumb-2 32-bit)
3072            ArmOp::And { rd, rn, op2 } => {
3073                if let Operand2::Reg(rm) = op2 {
3074                    let rd_bits = reg_to_bits(rd);
3075                    let rn_bits = reg_to_bits(rn);
3076                    let rm_bits = reg_to_bits(rm);
3077
3078                    // Thumb-2 AND register: EA00 Rn | 0 Rd 00 00 Rm
3079                    let hw1: u16 = (0xEA00 | rn_bits) as u16;
3080                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
3081
3082                    let mut bytes = hw1.to_le_bytes().to_vec();
3083                    bytes.extend_from_slice(&hw2.to_le_bytes());
3084                    Ok(bytes)
3085                } else if let Operand2::Imm(imm) = op2 {
3086                    let rd_bits = reg_to_bits(rd);
3087                    let rn_bits = reg_to_bits(rn);
3088
3089                    // Thumb-2 AND.W immediate T1: 11110 i 0 0000 S Rn | 0 imm3 Rd imm8.
3090                    // The i:imm3:imm8 field is a ThumbExpandImm modified immediate —
3091                    // encode it correctly (or error on an un-encodable value)
3092                    // rather than packing raw bits, closing the silent-miscompile
3093                    // class for AND alongside ORR/EOR (#251) / ADD/SUB (#253) /
3094                    // CMP (#255).
3095                    let field = try_thumb_expand_imm(*imm as u32).ok_or_else(|| {
3096                        synth_core::Error::synthesis(
3097                            "AND immediate is not a valid ThumbExpandImm — materialize into a register",
3098                        )
3099                    })?;
3100                    let i_bit = (field >> 11) & 1;
3101                    let imm3 = (field >> 8) & 0x7;
3102                    let imm8 = field & 0xFF;
3103
3104                    let hw1: u16 = (0xF000 | (i_bit << 10) | rn_bits) as u16;
3105                    let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
3106
3107                    let mut bytes = hw1.to_le_bytes().to_vec();
3108                    bytes.extend_from_slice(&hw2.to_le_bytes());
3109                    Ok(bytes)
3110                } else {
3111                    // RegShift variant - fallback to NOP
3112                    let instr: u16 = 0xBF00;
3113                    Ok(instr.to_le_bytes().to_vec())
3114                }
3115            }
3116
3117            // ORR (Thumb-2 32-bit)
3118            ArmOp::Orr { rd, rn, op2 } => {
3119                if let Operand2::Reg(rm) = op2 {
3120                    let rd_bits = reg_to_bits(rd);
3121                    let rn_bits = reg_to_bits(rn);
3122                    let rm_bits = reg_to_bits(rm);
3123
3124                    // Thumb-2 ORR: EA40 Rn | 0 Rd 00 00 Rm
3125                    let hw1: u16 = (0xEA40 | rn_bits) as u16;
3126                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
3127
3128                    let mut bytes = hw1.to_le_bytes().to_vec();
3129                    bytes.extend_from_slice(&hw2.to_le_bytes());
3130                    Ok(bytes)
3131                } else if let Operand2::Imm(imm) = op2 {
3132                    // ORR.W immediate T1: 11110 i 0 0010 S Rn | 0 imm3 Rd imm8.
3133                    // Only the zero-extended byte form (imm <= 0xFF) is encoded;
3134                    // larger modified immediates need ThumbExpandImm — return an
3135                    // error rather than silently emit a NOP (Ok-or-Err, #180/#185).
3136                    let imm_val = *imm as u32;
3137                    if imm_val > 0xFF {
3138                        return Err(synth_core::Error::synthesis(
3139                            "ORR immediate > 0xFF requires ThumbExpandImm (not yet implemented)",
3140                        ));
3141                    }
3142                    let rd_bits = reg_to_bits(rd);
3143                    let rn_bits = reg_to_bits(rn);
3144                    let hw1: u16 = (0xF040 | rn_bits) as u16;
3145                    let hw2: u16 = ((rd_bits << 8) | (imm_val & 0xFF)) as u16;
3146                    let mut bytes = hw1.to_le_bytes().to_vec();
3147                    bytes.extend_from_slice(&hw2.to_le_bytes());
3148                    Ok(bytes)
3149                } else {
3150                    let instr: u16 = 0xBF00;
3151                    Ok(instr.to_le_bytes().to_vec())
3152                }
3153            }
3154
3155            // EOR (Thumb-2 32-bit)
3156            ArmOp::Eor { rd, rn, op2 } => {
3157                if let Operand2::Reg(rm) = op2 {
3158                    let rd_bits = reg_to_bits(rd);
3159                    let rn_bits = reg_to_bits(rn);
3160                    let rm_bits = reg_to_bits(rm);
3161
3162                    // Thumb-2 EOR: EA80 Rn | 0 Rd 00 00 Rm
3163                    let hw1: u16 = (0xEA80 | rn_bits) as u16;
3164                    let hw2: u16 = ((rd_bits << 8) | rm_bits) as u16;
3165
3166                    let mut bytes = hw1.to_le_bytes().to_vec();
3167                    bytes.extend_from_slice(&hw2.to_le_bytes());
3168                    Ok(bytes)
3169                } else if let Operand2::Imm(imm) = op2 {
3170                    // EOR.W immediate T1: 11110 i 0 0100 S Rn | 0 imm3 Rd imm8.
3171                    // Byte form only (imm <= 0xFF); larger needs ThumbExpandImm —
3172                    // error, not a silent NOP (Ok-or-Err, #180/#185).
3173                    let imm_val = *imm as u32;
3174                    if imm_val > 0xFF {
3175                        return Err(synth_core::Error::synthesis(
3176                            "EOR immediate > 0xFF requires ThumbExpandImm (not yet implemented)",
3177                        ));
3178                    }
3179                    let rd_bits = reg_to_bits(rd);
3180                    let rn_bits = reg_to_bits(rn);
3181                    let hw1: u16 = (0xF080 | rn_bits) as u16;
3182                    let hw2: u16 = ((rd_bits << 8) | (imm_val & 0xFF)) as u16;
3183                    let mut bytes = hw1.to_le_bytes().to_vec();
3184                    bytes.extend_from_slice(&hw2.to_le_bytes());
3185                    Ok(bytes)
3186                } else {
3187                    let instr: u16 = 0xBF00;
3188                    Ok(instr.to_le_bytes().to_vec())
3189                }
3190            }
3191
3192            // Shift operations (16-bit for low registers)
3193            ArmOp::Lsl { rd, rn, shift } => {
3194                let rd_bits = reg_to_bits(rd) as u16;
3195                let rn_bits = reg_to_bits(rn) as u16;
3196                let shift_bits = (*shift as u16) & 0x1F;
3197
3198                if rd_bits < 8 && rn_bits < 8 {
3199                    // LSLS Rd, Rm, #imm5 (16-bit): 0000 0 imm5 Rm Rd
3200                    let instr: u16 = (shift_bits << 6) | (rn_bits << 3) | rd_bits;
3201                    Ok(instr.to_le_bytes().to_vec())
3202                } else {
3203                    // Use 32-bit encoding for high registers
3204                    self.encode_thumb32_shift(rd, rn, *shift, 0b00) // LSL type
3205                }
3206            }
3207
3208            ArmOp::Lsr { rd, rn, shift } => {
3209                let rd_bits = reg_to_bits(rd) as u16;
3210                let rn_bits = reg_to_bits(rn) as u16;
3211                let shift_bits = (*shift as u16) & 0x1F;
3212
3213                if rd_bits < 8 && rn_bits < 8 && shift_bits > 0 {
3214                    // LSRS Rd, Rm, #imm5 (16-bit): 0000 1 imm5 Rm Rd
3215                    let instr: u16 = 0x0800 | (shift_bits << 6) | (rn_bits << 3) | rd_bits;
3216                    Ok(instr.to_le_bytes().to_vec())
3217                } else {
3218                    self.encode_thumb32_shift(rd, rn, *shift, 0b01) // LSR type
3219                }
3220            }
3221
3222            ArmOp::Asr { rd, rn, shift } => {
3223                let rd_bits = reg_to_bits(rd) as u16;
3224                let rn_bits = reg_to_bits(rn) as u16;
3225                let shift_bits = (*shift as u16) & 0x1F;
3226
3227                if rd_bits < 8 && rn_bits < 8 && shift_bits > 0 {
3228                    // ASRS Rd, Rm, #imm5 (16-bit): 0001 0 imm5 Rm Rd
3229                    let instr: u16 = 0x1000 | (shift_bits << 6) | (rn_bits << 3) | rd_bits;
3230                    Ok(instr.to_le_bytes().to_vec())
3231                } else {
3232                    self.encode_thumb32_shift(rd, rn, *shift, 0b10) // ASR type
3233                }
3234            }
3235
3236            ArmOp::Ror { rd, rn, shift } => {
3237                // ROR doesn't have a 16-bit immediate form, use 32-bit
3238                self.encode_thumb32_shift(rd, rn, *shift, 0b11) // ROR type
3239            }
3240
3241            // Register-based shifts (Thumb-2 32-bit)
3242            // Encoding: 11111010 0xxS Rn 1111 Rd 0000 Rm
3243            // xx = shift type: 00=LSL, 01=LSR, 10=ASR, 11=ROR
3244            ArmOp::LslReg { rd, rn, rm } => self.encode_thumb32_shift_reg(rd, rn, rm, 0b00),
3245            ArmOp::LsrReg { rd, rn, rm } => self.encode_thumb32_shift_reg(rd, rn, rm, 0b01),
3246            ArmOp::AsrReg { rd, rn, rm } => self.encode_thumb32_shift_reg(rd, rn, rm, 0b10),
3247            ArmOp::RorReg { rd, rn, rm } => self.encode_thumb32_shift_reg(rd, rn, rm, 0b11),
3248
3249            // RSB (Reverse Subtract): Rd = imm - Rn
3250            // Thumb-2 T2 encoding: 11110 i 0 1110 S Rn | 0 imm3 Rd imm8
3251            ArmOp::Rsb { rd, rn, imm } => {
3252                let rd_bits = reg_to_bits(rd);
3253                let rn_bits = reg_to_bits(rn);
3254
3255                // #681 class audit: the T2 `i:imm3:imm8` field is a
3256                // ThumbExpandImm modified immediate and RSB has NO plain-imm12
3257                // (T4-style) form — packing a raw value > 0xFF silently encodes
3258                // a different constant (#253/#255 class). All current emitters
3259                // use imm 32 (shift complement), which expands to itself, so
3260                // this gate is byte-identical for existing codegen.
3261                let field = try_thumb_expand_imm(*imm).ok_or_else(|| {
3262                    synth_core::Error::synthesis(
3263                        "RSB immediate is not a valid ThumbExpandImm — materialize into a register",
3264                    )
3265                })?;
3266                let i_bit = (field >> 11) & 1;
3267                let imm3 = (field >> 8) & 0x7;
3268                let imm8 = field & 0xFF;
3269
3270                // hw1: 11110 i 01110 0 Rn  (S=0)
3271                let hw1: u16 = (0xF1C0 | (i_bit << 10) | rn_bits) as u16;
3272                // hw2: 0 imm3 Rd imm8
3273                let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
3274
3275                let mut bytes = hw1.to_le_bytes().to_vec();
3276                bytes.extend_from_slice(&hw2.to_le_bytes());
3277                Ok(bytes)
3278            }
3279
3280            // CLZ (Thumb-2 32-bit)
3281            ArmOp::Clz { rd, rm } => {
3282                let rd_bits = reg_to_bits(rd);
3283                let rm_bits = reg_to_bits(rm);
3284
3285                // Thumb-2 CLZ: FAB0 Rm | F8 Rd Rm
3286                // 11111010 1011 Rm | 1111 1000 Rd Rm
3287                let hw1: u16 = (0xFAB0 | rm_bits) as u16;
3288                let hw2: u16 = (0xF080 | (rd_bits << 8) | rm_bits) as u16;
3289
3290                let mut bytes = hw1.to_le_bytes().to_vec();
3291                bytes.extend_from_slice(&hw2.to_le_bytes());
3292                Ok(bytes)
3293            }
3294
3295            // RBIT (Thumb-2 32-bit)
3296            ArmOp::Rbit { rd, rm } => {
3297                let rd_bits = reg_to_bits(rd);
3298                let rm_bits = reg_to_bits(rm);
3299
3300                // Thumb-2 RBIT: FA90 Rm | F0 Rd A0 Rm
3301                // 11111010 1001 Rm | 1111 Rd 1010 Rm
3302                let hw1: u16 = (0xFA90 | rm_bits) as u16;
3303                let hw2: u16 = (0xF0A0 | (rd_bits << 8) | rm_bits) as u16;
3304
3305                let mut bytes = hw1.to_le_bytes().to_vec();
3306                bytes.extend_from_slice(&hw2.to_le_bytes());
3307                Ok(bytes)
3308            }
3309
3310            // SXTB (16-bit for low registers)
3311            ArmOp::Sxtb { rd, rm } => {
3312                let rd_bits = reg_to_bits(rd) as u16;
3313                let rm_bits = reg_to_bits(rm) as u16;
3314
3315                if rd_bits < 8 && rm_bits < 8 {
3316                    // SXTB Rd, Rm (16-bit): 1011 0010 01 Rm Rd
3317                    let instr: u16 = 0xB240 | (rm_bits << 3) | rd_bits;
3318                    Ok(instr.to_le_bytes().to_vec())
3319                } else {
3320                    // Thumb-2 SXTB.W: FA4F F(rd)80 (rm)
3321                    // 11111010 0100 1111 | 1111 Rd 10 rotate Rm
3322                    let rd_bits32 = rd_bits as u32;
3323                    let rm_bits32 = rm_bits as u32;
3324                    let hw1: u16 = 0xFA4F;
3325                    let hw2: u16 = (0xF080 | (rd_bits32 << 8) | rm_bits32) as u16;
3326                    let mut bytes = hw1.to_le_bytes().to_vec();
3327                    bytes.extend_from_slice(&hw2.to_le_bytes());
3328                    Ok(bytes)
3329                }
3330            }
3331
3332            // SXTH (16-bit for low registers)
3333            ArmOp::Sxth { rd, rm } => {
3334                let rd_bits = reg_to_bits(rd) as u16;
3335                let rm_bits = reg_to_bits(rm) as u16;
3336
3337                if rd_bits < 8 && rm_bits < 8 {
3338                    // SXTH Rd, Rm (16-bit): 1011 0010 00 Rm Rd
3339                    let instr: u16 = 0xB200 | (rm_bits << 3) | rd_bits;
3340                    Ok(instr.to_le_bytes().to_vec())
3341                } else {
3342                    // Thumb-2 SXTH.W: FA0F F(rd)80 (rm)
3343                    // 11111010 0000 1111 | 1111 Rd 10 rotate Rm
3344                    let rd_bits32 = rd_bits as u32;
3345                    let rm_bits32 = rm_bits as u32;
3346                    let hw1: u16 = 0xFA0F;
3347                    let hw2: u16 = (0xF080 | (rd_bits32 << 8) | rm_bits32) as u16;
3348                    let mut bytes = hw1.to_le_bytes().to_vec();
3349                    bytes.extend_from_slice(&hw2.to_le_bytes());
3350                    Ok(bytes)
3351                }
3352            }
3353
3354            // UXTB Rd,Rm — zero-extend byte (rd = rm & 0xff)
3355            ArmOp::Uxtb { rd, rm } => {
3356                let rd_bits = reg_to_bits(rd) as u16;
3357                let rm_bits = reg_to_bits(rm) as u16;
3358                if rd_bits < 8 && rm_bits < 8 {
3359                    // UXTB Rd, Rm (16-bit): 1011 0010 11 Rm Rd
3360                    let instr: u16 = 0xB2C0 | (rm_bits << 3) | rd_bits;
3361                    Ok(instr.to_le_bytes().to_vec())
3362                } else {
3363                    // Thumb-2 UXTB.W: FA5F F(rd)80 (rm)
3364                    let hw1: u16 = 0xFA5F;
3365                    let hw2: u16 = (0xF080 | ((rd_bits as u32) << 8) | rm_bits as u32) as u16;
3366                    let mut bytes = hw1.to_le_bytes().to_vec();
3367                    bytes.extend_from_slice(&hw2.to_le_bytes());
3368                    Ok(bytes)
3369                }
3370            }
3371
3372            // UXTH Rd,Rm — zero-extend halfword (rd = rm & 0xffff)
3373            ArmOp::Uxth { rd, rm } => {
3374                let rd_bits = reg_to_bits(rd) as u16;
3375                let rm_bits = reg_to_bits(rm) as u16;
3376                if rd_bits < 8 && rm_bits < 8 {
3377                    // UXTH Rd, Rm (16-bit): 1011 0010 10 Rm Rd
3378                    let instr: u16 = 0xB280 | (rm_bits << 3) | rd_bits;
3379                    Ok(instr.to_le_bytes().to_vec())
3380                } else {
3381                    // Thumb-2 UXTH.W: FA1F F(rd)80 (rm)
3382                    let hw1: u16 = 0xFA1F;
3383                    let hw2: u16 = (0xF080 | ((rd_bits as u32) << 8) | rm_bits as u32) as u16;
3384                    let mut bytes = hw1.to_le_bytes().to_vec();
3385                    bytes.extend_from_slice(&hw2.to_le_bytes());
3386                    Ok(bytes)
3387                }
3388            }
3389
3390            // CMP (can be 16-bit for low registers)
3391            ArmOp::Cmp { rn, op2 } => {
3392                let rn_bits = reg_to_bits(rn) as u16;
3393
3394                if let Operand2::Imm(imm) = op2 {
3395                    // Only use 16-bit encoding for non-negative immediates 0-255
3396                    // Negative immediates must use 32-bit encoding
3397                    if *imm >= 0 && *imm <= 255 && rn_bits < 8 {
3398                        // CMP Rn, #imm8 (16-bit): 0010 1 Rn imm8
3399                        let instr: u16 = 0x2800 | (rn_bits << 8) | (*imm as u16 & 0xFF);
3400                        Ok(instr.to_le_bytes().to_vec())
3401                    } else {
3402                        self.encode_thumb32_cmp_imm(rn, *imm as u32)
3403                    }
3404                } else if let Operand2::Reg(rm) = op2 {
3405                    let rm_bits = reg_to_bits(rm) as u16;
3406                    if rn_bits < 8 && rm_bits < 8 {
3407                        // CMP Rn, Rm (16-bit low): 0100 0010 10 Rm Rn
3408                        let instr: u16 = 0x4280 | (rm_bits << 3) | rn_bits;
3409                        Ok(instr.to_le_bytes().to_vec())
3410                    } else {
3411                        // CMP Rn, Rm (16-bit high): 0100 0101 N Rm Rn[2:0]
3412                        let n_bit = (rn_bits >> 3) & 1;
3413                        let instr: u16 = 0x4500 | (n_bit << 7) | (rm_bits << 3) | (rn_bits & 0x7);
3414                        Ok(instr.to_le_bytes().to_vec())
3415                    }
3416                } else {
3417                    let instr: u16 = 0xBF00;
3418                    Ok(instr.to_le_bytes().to_vec())
3419                }
3420            }
3421
3422            // CMN (Compare Negative) - computes Rn + op2 and sets flags
3423            // CMN Rn, #1 sets Z flag if Rn == -1 (since -1 + 1 = 0)
3424            ArmOp::Cmn { rn, op2 } => {
3425                let rn_bits = reg_to_bits(rn) as u16;
3426
3427                if let Operand2::Imm(imm) = op2 {
3428                    // CMN.W Rn, #imm (32-bit): i:imm3:imm8 is a ThumbExpandImm
3429                    // modified immediate (the field sits in imm3=hw2[14:12],
3430                    // imm8=hw2[7:0], i=hw1[10]). Encode it correctly, or error on
3431                    // an un-encodable value — replacing the old silent `0xBF00`
3432                    // NOP (the last of the silent-miscompile data-proc encoders).
3433                    let field = try_thumb_expand_imm(*imm as u32).ok_or_else(|| {
3434                        synth_core::Error::synthesis(
3435                            "CMN immediate is not a valid ThumbExpandImm — materialize into a register",
3436                        )
3437                    })?;
3438                    let i_bit = (field >> 11) & 1;
3439                    let imm3 = (field >> 8) & 0x7;
3440                    let imm8 = field & 0xFF;
3441                    let hw1: u16 = (0xF110 | (i_bit << 10) as u16) | rn_bits;
3442                    let hw2: u16 = (imm3 << 12) as u16 | 0x0F00 | imm8 as u16;
3443                    let mut bytes = hw1.to_le_bytes().to_vec();
3444                    bytes.extend_from_slice(&hw2.to_le_bytes());
3445                    Ok(bytes)
3446                } else if let Operand2::Reg(rm) = op2 {
3447                    let rm_bits = reg_to_bits(rm) as u16;
3448                    // 16-bit CMN (T1) only encodes R0-R7; high registers overflow
3449                    // the 3-bit fields and corrupt the operands (#184, the #180
3450                    // class). CMN has no high-register 16-bit form, so fall back
3451                    // to 32-bit CMN.W (T2): EB10 Rn | 0F00 Rm (ADD.W with S=1 and
3452                    // Rd discarded as PC/1111).
3453                    if rn_bits < 8 && rm_bits < 8 {
3454                        // CMN Rn, Rm (16-bit): 0100 0010 11 Rm Rn
3455                        let instr: u16 = 0x42C0 | (rm_bits << 3) | rn_bits;
3456                        Ok(instr.to_le_bytes().to_vec())
3457                    } else {
3458                        let hw1: u16 = 0xEB10 | rn_bits;
3459                        let hw2: u16 = 0x0F00 | rm_bits;
3460                        let mut bytes = hw1.to_le_bytes().to_vec();
3461                        bytes.extend_from_slice(&hw2.to_le_bytes());
3462                        Ok(bytes)
3463                    }
3464                } else {
3465                    Ok(vec![0xBF, 0x00])
3466                }
3467            }
3468
3469            // LDR (can be 16-bit for simple cases)
3470            ArmOp::Ldr { rd, addr } => {
3471                let rd_bits = reg_to_bits(rd);
3472                let base_bits = reg_to_bits(&addr.base);
3473
3474                // Handle register offset mode [base, Roff] or [base, Roff, #imm]
3475                if let Some(offset_reg) = &addr.offset_reg {
3476                    let rm_bits = reg_to_bits(offset_reg);
3477
3478                    // If there's also an immediate offset, we need to ADD it first
3479                    if addr.offset != 0 {
3480                        // Use R12 (IP) as scratch to avoid clobbering the address register
3481                        // ADD R12, Rm, #offset; LDR Rd, [base, R12]
3482                        let scratch = Reg::R12;
3483                        let mut bytes =
3484                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3485                        bytes.extend(self.encode_thumb32_ldr_reg(rd, &addr.base, &scratch)?);
3486                        return Ok(bytes);
3487                    }
3488
3489                    // Simple register offset: LDR Rd, [Rn, Rm]
3490                    // 16-bit: only if Rd, Rn, Rm < R8
3491                    if rd_bits < 8 && base_bits < 8 && rm_bits < 8 {
3492                        // LDR Rd, [Rn, Rm] (16-bit): 0101 100 Rm Rn Rd
3493                        let instr: u16 = 0x5800
3494                            | ((rm_bits as u16) << 6)
3495                            | ((base_bits as u16) << 3)
3496                            | (rd_bits as u16);
3497                        return Ok(instr.to_le_bytes().to_vec());
3498                    }
3499
3500                    // 32-bit register offset
3501                    return self.encode_thumb32_ldr_reg(rd, &addr.base, offset_reg);
3502                }
3503
3504                // Immediate offset mode [base, #imm]
3505                let offset = addr.offset as u32;
3506
3507                if rd_bits < 8 && base_bits < 8 && (offset & 0x3) == 0 && offset <= 124 {
3508                    // LDR Rd, [Rn, #imm5*4] (16-bit): 0110 1 imm5 Rn Rd
3509                    let imm5 = (offset >> 2) as u16;
3510                    let instr: u16 =
3511                        0x6800 | (imm5 << 6) | ((base_bits as u16) << 3) | (rd_bits as u16);
3512                    Ok(instr.to_le_bytes().to_vec())
3513                } else {
3514                    self.encode_thumb32_ldr(rd, &addr.base, offset)
3515                }
3516            }
3517
3518            // STR (can be 16-bit for simple cases)
3519            ArmOp::Str { rd, addr } => {
3520                let rd_bits = reg_to_bits(rd);
3521                let base_bits = reg_to_bits(&addr.base);
3522
3523                // Handle register offset mode [base, Roff] or [base, Roff, #imm]
3524                if let Some(offset_reg) = &addr.offset_reg {
3525                    let rm_bits = reg_to_bits(offset_reg);
3526
3527                    // If there's also an immediate offset, we need to ADD it first
3528                    if addr.offset != 0 {
3529                        // Use R12 (IP) as scratch to avoid clobbering the address register
3530                        // ADD R12, Rm, #offset; STR Rd, [base, R12]
3531                        let scratch = Reg::R12;
3532                        let mut bytes =
3533                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3534                        bytes.extend(self.encode_thumb32_str_reg(rd, &addr.base, &scratch)?);
3535                        return Ok(bytes);
3536                    }
3537
3538                    // Simple register offset: STR Rd, [Rn, Rm]
3539                    // 16-bit: only if Rd, Rn, Rm < R8
3540                    if rd_bits < 8 && base_bits < 8 && rm_bits < 8 {
3541                        // STR Rd, [Rn, Rm] (16-bit): 0101 000 Rm Rn Rd
3542                        let instr: u16 = 0x5000
3543                            | ((rm_bits as u16) << 6)
3544                            | ((base_bits as u16) << 3)
3545                            | (rd_bits as u16);
3546                        return Ok(instr.to_le_bytes().to_vec());
3547                    }
3548
3549                    // 32-bit register offset
3550                    return self.encode_thumb32_str_reg(rd, &addr.base, offset_reg);
3551                }
3552
3553                // Immediate offset mode [base, #imm]
3554                let offset = addr.offset as u32;
3555
3556                if rd_bits < 8 && base_bits < 8 && (offset & 0x3) == 0 && offset <= 124 {
3557                    // STR Rd, [Rn, #imm5*4] (16-bit): 0110 0 imm5 Rn Rd
3558                    let imm5 = (offset >> 2) as u16;
3559                    let instr: u16 =
3560                        0x6000 | (imm5 << 6) | ((base_bits as u16) << 3) | (rd_bits as u16);
3561                    Ok(instr.to_le_bytes().to_vec())
3562                } else {
3563                    self.encode_thumb32_str(rd, &addr.base, offset)
3564                }
3565            }
3566
3567            // LDRB (Thumb-2)
3568            ArmOp::Ldrb { rd, addr } => {
3569                let rd_bits = reg_to_bits(rd);
3570                let base_bits = reg_to_bits(&addr.base);
3571
3572                if let Some(offset_reg) = &addr.offset_reg {
3573                    if addr.offset != 0 {
3574                        let scratch = Reg::R12;
3575                        let mut bytes =
3576                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3577                        bytes.extend(self.encode_thumb32_ldrb_reg(rd, &addr.base, &scratch)?);
3578                        return Ok(bytes);
3579                    }
3580                    return self.encode_thumb32_ldrb_reg(rd, &addr.base, offset_reg);
3581                }
3582
3583                let offset = addr.offset as u32;
3584                if rd_bits < 8 && base_bits < 8 && offset <= 31 {
3585                    // LDRB Rd, [Rn, #imm5] (16-bit): 0111 1 imm5 Rn Rd
3586                    let instr: u16 = 0x7800
3587                        | ((offset as u16) << 6)
3588                        | ((base_bits as u16) << 3)
3589                        | (rd_bits as u16);
3590                    Ok(instr.to_le_bytes().to_vec())
3591                } else {
3592                    self.encode_thumb32_ldrb_imm(rd, &addr.base, offset)
3593                }
3594            }
3595
3596            // LDRSB (Thumb-2)
3597            ArmOp::Ldrsb { rd, addr } => {
3598                let rd_bits = reg_to_bits(rd);
3599                let base_bits = reg_to_bits(&addr.base);
3600
3601                if let Some(offset_reg) = &addr.offset_reg {
3602                    if addr.offset != 0 {
3603                        let scratch = Reg::R12;
3604                        let mut bytes =
3605                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3606                        bytes.extend(self.encode_thumb32_ldrsb_reg(rd, &addr.base, &scratch)?);
3607                        return Ok(bytes);
3608                    }
3609                    return self.encode_thumb32_ldrsb_reg(rd, &addr.base, offset_reg);
3610                }
3611
3612                let offset = addr.offset as u32;
3613                // LDRSB has no 16-bit immediate form (only register)
3614                // For 16-bit reg form: only if Rd, Rn, Rm < R8
3615                if rd_bits < 8 && base_bits < 8 && offset == 0 {
3616                    // No immediate 16-bit encoding for LDRSB; use 32-bit
3617                    self.encode_thumb32_ldrsb_imm(rd, &addr.base, offset)
3618                } else {
3619                    self.encode_thumb32_ldrsb_imm(rd, &addr.base, offset)
3620                }
3621            }
3622
3623            // LDRH (Thumb-2)
3624            ArmOp::Ldrh { rd, addr } => {
3625                let rd_bits = reg_to_bits(rd);
3626                let base_bits = reg_to_bits(&addr.base);
3627
3628                if let Some(offset_reg) = &addr.offset_reg {
3629                    if addr.offset != 0 {
3630                        let scratch = Reg::R12;
3631                        let mut bytes =
3632                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3633                        bytes.extend(self.encode_thumb32_ldrh_reg(rd, &addr.base, &scratch)?);
3634                        return Ok(bytes);
3635                    }
3636                    return self.encode_thumb32_ldrh_reg(rd, &addr.base, offset_reg);
3637                }
3638
3639                let offset = addr.offset as u32;
3640                if rd_bits < 8 && base_bits < 8 && (offset & 0x1) == 0 && offset <= 62 {
3641                    // LDRH Rd, [Rn, #imm5*2] (16-bit): 1000 1 imm5 Rn Rd
3642                    let imm5 = (offset >> 1) as u16;
3643                    let instr: u16 =
3644                        0x8800 | (imm5 << 6) | ((base_bits as u16) << 3) | (rd_bits as u16);
3645                    Ok(instr.to_le_bytes().to_vec())
3646                } else {
3647                    self.encode_thumb32_ldrh_imm(rd, &addr.base, offset)
3648                }
3649            }
3650
3651            // LDRSH (Thumb-2)
3652            ArmOp::Ldrsh { rd, addr } => {
3653                if let Some(offset_reg) = &addr.offset_reg {
3654                    if addr.offset != 0 {
3655                        let scratch = Reg::R12;
3656                        let mut bytes =
3657                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3658                        bytes.extend(self.encode_thumb32_ldrsh_reg(rd, &addr.base, &scratch)?);
3659                        return Ok(bytes);
3660                    }
3661                    return self.encode_thumb32_ldrsh_reg(rd, &addr.base, offset_reg);
3662                }
3663
3664                let offset = addr.offset as u32;
3665                self.encode_thumb32_ldrsh_imm(rd, &addr.base, offset)
3666            }
3667
3668            // STRB (Thumb-2)
3669            ArmOp::Strb { rd, addr } => {
3670                let rd_bits = reg_to_bits(rd);
3671                let base_bits = reg_to_bits(&addr.base);
3672
3673                if let Some(offset_reg) = &addr.offset_reg {
3674                    if addr.offset != 0 {
3675                        let scratch = Reg::R12;
3676                        let mut bytes =
3677                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3678                        bytes.extend(self.encode_thumb32_strb_reg(rd, &addr.base, &scratch)?);
3679                        return Ok(bytes);
3680                    }
3681                    return self.encode_thumb32_strb_reg(rd, &addr.base, offset_reg);
3682                }
3683
3684                let offset = addr.offset as u32;
3685                if rd_bits < 8 && base_bits < 8 && offset <= 31 {
3686                    // STRB Rd, [Rn, #imm5] (16-bit): 0111 0 imm5 Rn Rd
3687                    let instr: u16 = 0x7000
3688                        | ((offset as u16) << 6)
3689                        | ((base_bits as u16) << 3)
3690                        | (rd_bits as u16);
3691                    Ok(instr.to_le_bytes().to_vec())
3692                } else {
3693                    self.encode_thumb32_strb_imm(rd, &addr.base, offset)
3694                }
3695            }
3696
3697            // STRH (Thumb-2)
3698            ArmOp::Strh { rd, addr } => {
3699                let rd_bits = reg_to_bits(rd);
3700                let base_bits = reg_to_bits(&addr.base);
3701
3702                if let Some(offset_reg) = &addr.offset_reg {
3703                    if addr.offset != 0 {
3704                        let scratch = Reg::R12;
3705                        let mut bytes =
3706                            self.encode_thumb32_add_imm(&scratch, offset_reg, addr.offset as u32)?;
3707                        bytes.extend(self.encode_thumb32_strh_reg(rd, &addr.base, &scratch)?);
3708                        return Ok(bytes);
3709                    }
3710                    return self.encode_thumb32_strh_reg(rd, &addr.base, offset_reg);
3711                }
3712
3713                let offset = addr.offset as u32;
3714                if rd_bits < 8 && base_bits < 8 && (offset & 0x1) == 0 && offset <= 62 {
3715                    // STRH Rd, [Rn, #imm5*2] (16-bit): 1000 0 imm5 Rn Rd
3716                    let imm5 = (offset >> 1) as u16;
3717                    let instr: u16 =
3718                        0x8000 | (imm5 << 6) | ((base_bits as u16) << 3) | (rd_bits as u16);
3719                    Ok(instr.to_le_bytes().to_vec())
3720                } else {
3721                    self.encode_thumb32_strh_imm(rd, &addr.base, offset)
3722                }
3723            }
3724
3725            // MemorySize (Thumb-2)
3726            ArmOp::MemorySize { rd } => {
3727                // LSR rd, R10, #16 — memory size in bytes / 65536 = pages
3728                // Thumb-2 16-bit: LSRS Rd, Rm, #imm5 — 0000 1 imm5 Rm Rd
3729                let rd_bits = reg_to_bits(rd);
3730                let r10_bits = reg_to_bits(&Reg::R10);
3731                if rd_bits < 8 && r10_bits < 8 {
3732                    let instr: u16 =
3733                        0x0800 | (16u16 << 6) | ((r10_bits as u16) << 3) | (rd_bits as u16);
3734                    Ok(instr.to_le_bytes().to_vec())
3735                } else {
3736                    // Thumb-2 32-bit LSR: 1110 1010 010 0 1111 | 0 imm3 Rd imm2 01 Rm
3737                    let imm5: u32 = 16;
3738                    let imm3 = (imm5 >> 2) & 0x7;
3739                    let imm2 = imm5 & 0x3;
3740                    let hw1: u16 = 0xEA4F;
3741                    let hw2: u16 =
3742                        ((imm3 << 12) | (rd_bits << 8) | (imm2 << 6) | 0x10 | r10_bits) as u16;
3743                    let mut bytes = hw1.to_le_bytes().to_vec();
3744                    bytes.extend_from_slice(&hw2.to_le_bytes());
3745                    Ok(bytes)
3746                }
3747            }
3748
3749            // MemoryGrow (Thumb-2)
3750            ArmOp::MemoryGrow { rd, .. } => {
3751                // On embedded with fixed memory, always return -1 (failure)
3752                // MVN rd, #0 → MOV rd, #-1
3753                // Thumb-2 32-bit: MVN: 1111 0 i 0 0 0 1 1 0 1111 | 0 imm3 Rd imm8
3754                let rd_bits = reg_to_bits(rd);
3755                let hw1: u16 = 0xF06F; // MVN with i=0
3756                let hw2: u16 = (rd_bits << 8) as u16; // imm8=0 → ~0 = 0xFFFFFFFF = -1
3757                let mut bytes = hw1.to_le_bytes().to_vec();
3758                bytes.extend_from_slice(&hw2.to_le_bytes());
3759                Ok(bytes)
3760            }
3761
3762            // BX (16-bit)
3763            ArmOp::Bx { rm } => {
3764                let rm_bits = reg_to_bits(rm) as u16;
3765                // BX Rm (16-bit): 0100 0111 0 Rm 000
3766                let instr: u16 = 0x4700 | (rm_bits << 3);
3767                Ok(instr.to_le_bytes().to_vec())
3768            }
3769
3770            // BLX (16-bit) - Branch with Link and Exchange
3771            // BLX Rm: 0100 0111 1 Rm 000
3772            ArmOp::Blx { rm } => {
3773                let rm_bits = reg_to_bits(rm) as u16;
3774                let instr: u16 = 0x4780 | (rm_bits << 3);
3775                Ok(instr.to_le_bytes().to_vec())
3776            }
3777
3778            // CallIndirect - indirect function call via table lookup
3779            // table_index_reg contains the table index
3780            // Generates (#642): MOVW ip,#size [; MOVT]; CMP idx,ip; BLO +1;
3781            //                   UDF #0; LSL R12,idx,#2; LDR R12,[R11,R12]; BLX R12
3782            // #650, table_byte_offset != 0 (a non-zero table in the contiguous
3783            // R11 region): the pointer load becomes
3784            //                   ADD R12,R11,R12; LDR R12,[R12,#offset]
3785            // #664, null_check (the table has null slots, linked as ZERO
3786            // words): the loaded pointer is null-checked before the BLX —
3787            //                   CMP.W R12,#0; BNE +1; UDF #0
3788            // #676, type_check (heterogeneous table — runtime §4.4.8 type
3789            // check against the type-id sidecar at R11+off): after the
3790            // bounds guard —
3791            //                   LSL R12,idx,#2; ADD R12,R11,R12;
3792            //                   LDR R12,[R12,#type_off]; CMP.W R12,#id;
3793            //                   BEQ +1; UDF #0
3794            // (the dispatch tail then recomputes idx*4 — idx stays live).
3795            ArmOp::CallIndirect {
3796                rd: _,
3797                type_idx: _,
3798                table_index_reg,
3799                table_size,
3800                table_byte_offset,
3801                null_check,
3802                type_check,
3803            } => {
3804                let idx_reg = reg_to_bits(table_index_reg);
3805                let mut bytes = Vec::new();
3806
3807                // The expansion:
3808                // 1. Bounds guard (#642): trap (UDF #0, WASM Core §4.4.8) when
3809                //    index >= table size. Without it an out-of-bounds index
3810                //    reads past the table and BLXes whatever word lies there —
3811                //    an uncontrolled indirect branch instead of a trap.
3812                // 2. Multiplies index by 4 (function pointer size)
3813                // 3. Loads function pointer from table (table base in R11)
3814                // 4. Calls the function via BLX
3815                //
3816                // Table base setup must be done by caller/runtime. The type
3817                // check §4.4.8 also requires is discharged at COMPILE time:
3818                // the selector only emits this op after verifying the closed-
3819                // world property that every table entry's signature equals the
3820                // expected type (the raw code-pointer table carries no runtime
3821                // type ids to compare) — see the #642 selector guard.
3822
3823                // MOVW R12, #(size & 0xFFFF) — Thumb-2 T3:
3824                // 11110 i 100100 imm4 | 0 imm3 Rd imm8 (Rd=R12).
3825                let size_lo = *table_size & 0xFFFF;
3826                let hw1: u16 =
3827                    (0xF240 | (((size_lo >> 11) & 1) << 10) | ((size_lo >> 12) & 0xF)) as u16;
3828                let hw2: u16 =
3829                    ((((size_lo >> 8) & 0x7) << 12) | (12 << 8) | (size_lo & 0xFF)) as u16;
3830                bytes.extend_from_slice(&hw1.to_le_bytes());
3831                bytes.extend_from_slice(&hw2.to_le_bytes());
3832                // MOVT R12, #(size >> 16) — only when the table size exceeds
3833                // 16 bits (never in practice, but the guard must not compare
3834                // against a truncated size).
3835                let size_hi = *table_size >> 16;
3836                if size_hi != 0 {
3837                    let hw1: u16 =
3838                        (0xF2C0 | (((size_hi >> 11) & 1) << 10) | ((size_hi >> 12) & 0xF)) as u16;
3839                    let hw2: u16 =
3840                        ((((size_hi >> 8) & 0x7) << 12) | (12 << 8) | (size_hi & 0xFF)) as u16;
3841                    bytes.extend_from_slice(&hw1.to_le_bytes());
3842                    bytes.extend_from_slice(&hw2.to_le_bytes());
3843                }
3844                // CMP idx, R12 — 16-bit T2 (high-register capable):
3845                // 010001 01 N Rm(4) Rn(3), Rn full = N:Rn3.
3846                let cmp: u16 = (0x4500 | ((idx_reg & 8) << 4) | (12 << 3) | (idx_reg & 7)) as u16;
3847                bytes.extend_from_slice(&cmp.to_le_bytes());
3848                // BLO +1 insn (skip the UDF when index < size) — B<cond>.N
3849                // imm8=0: target = branch + 4. LO = unsigned lower.
3850                bytes.extend_from_slice(&0xD300u16.to_le_bytes());
3851                // UDF #0 — call_indirect out-of-bounds trap (same trap idiom as
3852                // the div-by-zero guards).
3853                bytes.extend_from_slice(&0xDE00u16.to_le_bytes());
3854
3855                // #676: runtime type check — ONLY for a heterogeneous table
3856                // (mixed signatures, closed-world verdict impossible). Load
3857                // the indexed slot's structural class id from the type-id
3858                // sidecar (`R11 + type_off + idx*4`; `type_off` = sidecar
3859                // base + this table's base offset, a compile-time constant)
3860                // and compare it against the expected type's class id — a
3861                // mismatch is the WASM Core §4.4.8 type trap. Null slots
3862                // carry the reserved id 0, so this compare subsumes the
3863                // #664 null trap (the selector passes `null_check: false`).
3864                // `None` emits NOTHING: every homogeneous table keeps the
3865                // pre-#676 bytes identical BY CONSTRUCTION. R12 stays the
3866                // only scratch (#212); the dispatch tail below recomputes
3867                // idx*4 — the index register is never clobbered here.
3868                if let Some((expected_id, type_off)) = type_check {
3869                    debug_assert!(*expected_id <= 255, "selector enforces the CMP imm8 range");
3870                    debug_assert!(*type_off <= 4095, "selector enforces the LDR imm12 range");
3871                    // MOV.W R12, idx, LSL #2 (same encoding as the dispatch
3872                    // tail's index scale below).
3873                    bytes.extend_from_slice(&0xEA4Fu16.to_le_bytes());
3874                    bytes.extend_from_slice(
3875                        &(((0x0C00 | (0b10 << 6)) | idx_reg) as u16).to_le_bytes(),
3876                    );
3877                    // ADD.W R12, R11, R12 (the #650 base-add form).
3878                    bytes.extend_from_slice(&0xEB0Bu16.to_le_bytes());
3879                    bytes.extend_from_slice(&0x0C0Cu16.to_le_bytes());
3880                    // LDR.W R12, [R12, #type_off] — T3 LDR (immediate):
3881                    // 1111 1000 1101 Rn=1100 | Rt=1100 imm12.
3882                    bytes.extend_from_slice(&0xF8DCu16.to_le_bytes());
3883                    bytes.extend_from_slice(
3884                        &(0xC000u16 | (*type_off as u16 & 0x0FFF)).to_le_bytes(),
3885                    );
3886                    // CMP.W R12, #expected_id — T2 CMP (immediate), imm8
3887                    // (same form as the #664 null check's CMP.W R12, #0).
3888                    bytes.extend_from_slice(&0xF1BCu16.to_le_bytes());
3889                    bytes.extend_from_slice(
3890                        &(0x0F00u16 | (*expected_id as u16 & 0xFF)).to_le_bytes(),
3891                    );
3892                    // BEQ +1 insn (skip the UDF when the class id matches) —
3893                    // B<cond>.N imm8=0: target = branch + 4. EQ.
3894                    bytes.extend_from_slice(&0xD000u16.to_le_bytes());
3895                    // UDF #0 — the §4.4.8 type-mismatch trap (same idiom as
3896                    // the bounds guard above).
3897                    bytes.extend_from_slice(&0xDE00u16.to_le_bytes());
3898                }
3899
3900                // LSL R12, idx_reg, #2 (multiply index by 4)
3901                // Thumb-2 MOV with shift: 11101010 010 S 1111 | 0 imm3 Rd imm2 type Rm
3902                // LSL: type=00 (bits 5:4), imm5=2 -> imm3=000, imm2=10 (bits 7:6)
3903                // #597: the shift amount was previously shifted into bits 5:4 —
3904                // the TYPE field — encoding `mov.w ip, rm, ASR #32`, which
3905                // destroyed the index and dispatched table entry 0 for every
3906                // call. imm2 lives at bits 7:6.
3907                let hw1: u16 = 0xEA4F_u16; // MOV.W R12, Rm, LSL #2
3908                let hw2: u16 = ((0x0C00 | (0b10 << 6)) | idx_reg) as u16;
3909                bytes.extend_from_slice(&hw1.to_le_bytes());
3910                bytes.extend_from_slice(&hw2.to_le_bytes());
3911
3912                if *table_byte_offset == 0 {
3913                    // Table 0 (base = R11 itself): the pre-#650 single-load
3914                    // form — a single-table module's bytes stay identical BY
3915                    // CONSTRUCTION.
3916                    // LDR R12, [R11, R12] - load function pointer
3917                    // Thumb-2 LDR (register): 1111 1000 0101 Rn | Rt 0000 00 imm2 Rm
3918                    // Rn=R11, Rt=R12, Rm=R12, imm2=00 (no shift)
3919                    let ldr_hw1: u16 = 0xF85B; // LDR.W Rt, [R11, Rm]
3920                    let ldr_hw2: u16 = 0xC00C; // Rt=R12, imm2=00, Rm=R12
3921                    bytes.extend_from_slice(&ldr_hw1.to_le_bytes());
3922                    bytes.extend_from_slice(&ldr_hw2.to_le_bytes());
3923                } else {
3924                    // #650: table N of the contiguous R11 region — fold the
3925                    // compile-time base offset into the pointer load via the
3926                    // LDR imm12 form (R12 stays the only scratch, per the
3927                    // #212 convention).
3928                    assert!(
3929                        *table_byte_offset <= 4095,
3930                        "call_indirect table base offset {table_byte_offset} exceeds \
3931                         LDR imm12 — the selector must have declined this (#650)"
3932                    );
3933                    // ADD.W R12, R11, R12 — T3 ADD (register):
3934                    // 11101011000 S=0 Rn=1011 | 0 imm3=000 Rd=1100 imm2=00 type=00 Rm=1100
3935                    bytes.extend_from_slice(&0xEB0Bu16.to_le_bytes());
3936                    bytes.extend_from_slice(&0x0C0Cu16.to_le_bytes());
3937                    // LDR.W R12, [R12, #offset] — T3 LDR (immediate):
3938                    // 1111 1000 1101 Rn=1100 | Rt=1100 imm12
3939                    bytes.extend_from_slice(&0xF8DCu16.to_le_bytes());
3940                    bytes.extend_from_slice(
3941                        &((0xC000u16) | (*table_byte_offset as u16 & 0x0FFF)).to_le_bytes(),
3942                    );
3943                }
3944
3945                // #664: null-slot trap — ONLY when the table image carries
3946                // null (uninitialized) slots, which the layout contract
3947                // requires to be linked as ZERO words. A fully-initialized
3948                // table skips this branch entirely, keeping the pre-#664
3949                // expansion byte-identical BY CONSTRUCTION (the #650
3950                // offset-0 trick).
3951                if *null_check {
3952                    // CMP.W R12, #0 — T2 CMP (immediate): 11110 i 0 1101 1
3953                    // Rn(4) | 0 imm3 1111 imm8, Rn=R12, imm=0.
3954                    bytes.extend_from_slice(&0xF1BCu16.to_le_bytes());
3955                    bytes.extend_from_slice(&0x0F00u16.to_le_bytes());
3956                    // BNE +1 insn (skip the UDF when the pointer is non-null)
3957                    // — B<cond>.N imm8=0: target = branch + 4. NE.
3958                    bytes.extend_from_slice(&0xD100u16.to_le_bytes());
3959                    // UDF #0 — call_indirect null-funcref trap (WASM Core
3960                    // §4.4.8: calling an uninitialized element traps; same
3961                    // trap idiom as the bounds guard above).
3962                    bytes.extend_from_slice(&0xDE00u16.to_le_bytes());
3963                }
3964
3965                // BLX R12 (call function indirectly)
3966                // BLX Rm (16-bit): 0100 0111 1 Rm 000
3967                let blx: u16 = 0x47E0; // BLX R12
3968                bytes.extend_from_slice(&blx.to_le_bytes());
3969
3970                Ok(bytes)
3971            }
3972
3973            // Label pseudo-instruction: emits no machine code
3974            ArmOp::Label { .. } => Ok(Vec::new()),
3975
3976            // Conditional branch to label (generic) - offset 0, will be patched
3977            ArmOp::Bcc { cond, label: _ } => {
3978                use synth_synthesis::Condition;
3979                let cond_bits: u16 = match cond {
3980                    Condition::EQ => 0x0,
3981                    Condition::NE => 0x1,
3982                    Condition::HS => 0x2,
3983                    Condition::LO => 0x3,
3984                    Condition::HI => 0x8,
3985                    Condition::LS => 0x9,
3986                    Condition::GE => 0xA,
3987                    Condition::LT => 0xB,
3988                    Condition::GT => 0xC,
3989                    Condition::LE => 0xD,
3990                };
3991                // 16-bit B<cond> with offset 0: 1101 cond imm8
3992                let instr: u16 = 0xD000 | (cond_bits << 8);
3993                Ok(instr.to_le_bytes().to_vec())
3994            }
3995
3996            // Branch instructions
3997            ArmOp::B { label: _ } => {
3998                // Simplified: B.N with offset 0
3999                // For real usage, would need label resolution
4000                let instr: u16 = 0xE000; // B.N #0
4001                Ok(instr.to_le_bytes().to_vec())
4002            }
4003
4004            // BHS (Branch if Higher or Same) - used for bounds checking
4005            // Condition code: 0x2 (C set)
4006            ArmOp::Bhs { label: _ } => {
4007                // 16-bit B<cond> with offset 0: 1101 cond imm8
4008                // cond = 0x2 (HS)
4009                let instr: u16 = 0xD200; // BHS.N #0
4010                Ok(instr.to_le_bytes().to_vec())
4011            }
4012
4013            // BLO (Branch if Lower) - complementary to BHS
4014            // Condition code: 0x3 (C clear)
4015            ArmOp::Blo { label: _ } => {
4016                // 16-bit B<cond> with offset 0: 1101 cond imm8
4017                // cond = 0x3 (LO)
4018                let instr: u16 = 0xD300; // BLO.N #0
4019                Ok(instr.to_le_bytes().to_vec())
4020            }
4021
4022            // Branch with numeric offset (Thumb-2)
4023            // Thumb-2 B.W instruction: 32-bit with +-16MB range
4024            ArmOp::BOffset { offset } => {
4025                // offset is already the halfword displacement: (target - branch - 4) / 2
4026                // This is the raw encoded value, accounting for variable-length instructions
4027                let halfword_offset = *offset;
4028
4029                // 16-bit B.N encoding: 1110 0 imm11 (11-bit signed halfword offset)
4030                // Range: -1024 to +1022 halfwords
4031                if (-1024..=1022).contains(&halfword_offset) {
4032                    // 16-bit B.N encoding: 1110 0 imm11
4033                    let imm11 = (halfword_offset as u16) & 0x7FF;
4034                    let instr: u16 = 0xE000 | imm11;
4035                    Ok(instr.to_le_bytes().to_vec())
4036                } else {
4037                    // 32-bit B.W encoding for larger offsets
4038                    // First halfword: 1111 0 S imm10
4039                    // Second halfword: 10 J1 0 J2 imm11
4040                    // Total offset = SignExtend(S:I1:I2:imm10:imm11:0)
4041                    // where I1 = NOT(J1 XOR S), I2 = NOT(J2 XOR S)
4042
4043                    // The B.W (T4) encoding packs the signed offset as:
4044                    //   S:I1:I2:imm10:imm11:0  (25-bit signed, halfword-aligned)
4045                    // where J1 = NOT(I1 XOR S), J2 = NOT(I2 XOR S)
4046                    // Input halfword_offset already equals (target - PC - 4) / 2,
4047                    // so the full byte offset = halfword_offset << 1.
4048                    // The encoding fields split that 25-bit signed value (including the
4049                    // implicit trailing zero) as: S | imm10 | imm11
4050                    // with I1 = bit 23 and I2 = bit 22 of the signed offset.
4051                    let signed_offset = halfword_offset << 1; // byte offset
4052                    let s = if signed_offset < 0 { 1u32 } else { 0u32 };
4053                    let uoffset = signed_offset as u32;
4054                    let imm10 = (uoffset >> 12) & 0x3FF; // bits [21:12]
4055                    let imm11 = (uoffset >> 1) & 0x7FF; // bits [11:1]
4056                    let i1 = (uoffset >> 23) & 1; // bit 23
4057                    let i2 = (uoffset >> 22) & 1; // bit 22
4058                    let j1 = (!(i1 ^ s)) & 1; // J1 = NOT(I1 XOR S)
4059                    let j2 = (!(i2 ^ s)) & 1; // J2 = NOT(I2 XOR S)
4060
4061                    let hw1: u16 = (0xF000 | (s << 10) | imm10) as u16;
4062                    let hw2: u16 = (0x9000 | (j1 << 13) | (j2 << 11) | imm11) as u16;
4063
4064                    let mut bytes = hw1.to_le_bytes().to_vec();
4065                    bytes.extend_from_slice(&hw2.to_le_bytes());
4066                    Ok(bytes)
4067                }
4068            }
4069
4070            // Conditional branch with numeric offset (Thumb-2)
4071            ArmOp::BCondOffset { cond, offset } => {
4072                use synth_synthesis::Condition;
4073                let cond_bits: u16 = match cond {
4074                    Condition::EQ => 0x0,
4075                    Condition::NE => 0x1,
4076                    Condition::HS => 0x2,
4077                    Condition::LO => 0x3,
4078                    Condition::HI => 0x8,
4079                    Condition::LS => 0x9,
4080                    Condition::GE => 0xA,
4081                    Condition::LT => 0xB,
4082                    Condition::GT => 0xC,
4083                    Condition::LE => 0xD,
4084                };
4085
4086                // offset is already the halfword displacement: (target - branch - 4) / 2
4087                // This is the raw imm8 value for 16-bit B<cond> encoding
4088                let halfword_offset = *offset;
4089
4090                // 16-bit B<cond> encoding: 1101 cond imm8
4091                // Range: -256 to +254 halfwords (imm8 is sign-extended and shifted left 1)
4092                if (-128..=127).contains(&halfword_offset) {
4093                    let imm8 = (halfword_offset as u16) & 0xFF;
4094                    let instr: u16 = 0xD000 | (cond_bits << 8) | imm8;
4095                    Ok(instr.to_le_bytes().to_vec())
4096                } else {
4097                    // 32-bit B<cond>.W for larger offsets
4098                    // First halfword: 1111 0 S cond imm6
4099                    // Second halfword: 10 J1 0 J2 imm11
4100                    let offset = halfword_offset >> 1;
4101                    let s = if offset < 0 { 1u32 } else { 0u32 };
4102                    let imm6 = ((offset >> 11) as u32) & 0x3F;
4103                    let imm11 = (offset as u32) & 0x7FF;
4104                    let j1 = if s == 1 { 1 } else { 0 };
4105                    let j2 = if s == 1 { 1 } else { 0 };
4106
4107                    let hw1: u16 = (0xF000 | (s << 10) | ((cond_bits as u32) << 6) | imm6) as u16;
4108                    let hw2: u16 = (0x8000 | (j1 << 13) | (j2 << 11) | imm11) as u16;
4109
4110                    let mut bytes = hw1.to_le_bytes().to_vec();
4111                    bytes.extend_from_slice(&hw2.to_le_bytes());
4112                    Ok(bytes)
4113                }
4114            }
4115
4116            ArmOp::Bl { label: _ } => {
4117                // BL is always 32-bit in Thumb-2, encoded here as a relocatable
4118                // placeholder; an R_ARM_THM_CALL relocation patches the target
4119                // (see arm_backend.rs). The placeholder must carry an embedded
4120                // addend of -4 so the relocation nets to exactly the symbol S.
4121                //
4122                // Thumb BL computes `target = (P + 4) + signed_offset`. Under
4123                // R_ARM_THM_CALL the linker resolves using the in-place addend;
4124                // a 0xF800 placeholder (addend 0) lands at S+4 — every call one
4125                // instruction past the callee entry (#174). The correct
4126                // placeholder is what `gas` emits for `bl <extern>`:
4127                //   f7ff fffe  ->  `bl <self>`  (S=1, J1=J2=1, imm = -4 addend),
4128                // i.e. hw1=0xF7FF, hw2=0xFFFE. This nets to S, not S+4.
4129                // (The earlier 0xD000 was worse still — a ~+0x600000 addend,
4130                // the garbage `bl c0000c` and "truncated to fit" of #167.)
4131                let hw1: u16 = 0xF7FF;
4132                let hw2: u16 = 0xFFFE;
4133                let mut bytes = hw1.to_le_bytes().to_vec();
4134                bytes.extend_from_slice(&hw2.to_le_bytes());
4135                Ok(bytes)
4136            }
4137
4138            // MVN
4139            ArmOp::Mvn { rd, op2 } => {
4140                if let Operand2::Reg(rm) = op2 {
4141                    let rd_bits = reg_to_bits(rd) as u16;
4142                    let rm_bits = reg_to_bits(rm) as u16;
4143
4144                    if rd_bits < 8 && rm_bits < 8 {
4145                        // MVNS Rd, Rm (16-bit): 0100 0011 11 Rm Rd
4146                        let instr: u16 = 0x43C0 | (rm_bits << 3) | rd_bits;
4147                        Ok(instr.to_le_bytes().to_vec())
4148                    } else {
4149                        // 32-bit MVN
4150                        let hw1: u16 = 0xEA6F_u16;
4151                        let hw2: u16 = ((reg_to_bits(rd) << 8) | reg_to_bits(rm)) as u16;
4152                        let mut bytes = hw1.to_le_bytes().to_vec();
4153                        bytes.extend_from_slice(&hw2.to_le_bytes());
4154                        Ok(bytes)
4155                    }
4156                } else {
4157                    let instr: u16 = 0xBF00;
4158                    Ok(instr.to_le_bytes().to_vec())
4159                }
4160            }
4161
4162            // MOVW - Move Wide (Thumb-2 32-bit)
4163            ArmOp::Movw { rd, imm16 } => {
4164                self.encode_thumb32_movw_raw(reg_to_bits(rd), *imm16 as u32)
4165            }
4166
4167            // MOVT - Move Top (Thumb-2 32-bit)
4168            ArmOp::Movt { rd, imm16 } => {
4169                self.encode_thumb32_movt_raw(reg_to_bits(rd), *imm16 as u32)
4170            }
4171
4172            // #237: symbol-relative MOVW/MOVT. Encode the addend's low/high 16
4173            // bits in place; the backend records an R_ARM_MOVW_ABS_NC /
4174            // R_ARM_MOVT_ABS relocation against `symbol`, so the linker adds the
4175            // symbol's final address to the in-place addend (REL semantics).
4176            ArmOp::MovwSym { rd, addend, .. } => {
4177                self.encode_thumb32_movw_raw(reg_to_bits(rd), (*addend as u32) & 0xffff)
4178            }
4179            ArmOp::MovtSym { rd, addend, .. } => {
4180                self.encode_thumb32_movt_raw(reg_to_bits(rd), ((*addend as u32) >> 16) & 0xffff)
4181            }
4182
4183            // #345: literal-pool address load — emit a PLACEHOLDER `LDR.W rd,
4184            // [pc, #0]` (U=1, imm12=0). The backend (arm_backend.rs) places the
4185            // 4-byte pool word at the end of the function, records the R_ARM_ABS32
4186            // relocation against `symbol+addend`, and patches the imm12 with the
4187            // real PC-relative distance once the pool offset is known.
4188            // Encoding T2: 1111 1000 1101 1111 | Rt(4) imm12(12), with the literal
4189            // base = Align(PC,4) and PC = address of this instruction + 4.
4190            ArmOp::LdrSym { rd, .. } => {
4191                let rt = reg_to_bits(rd) as u16;
4192                let hw1: u16 = 0xF8DF; // LDR.W (literal), U=1
4193                let hw2: u16 = rt << 12; // imm12 = 0 placeholder
4194                let mut bytes = Vec::with_capacity(4);
4195                bytes.extend_from_slice(&hw1.to_le_bytes());
4196                bytes.extend_from_slice(&hw2.to_le_bytes());
4197                Ok(bytes)
4198            }
4199
4200            // SetCond: Materialize condition flag into register (0 or 1)
4201            // Strategy: ITE <cond>; MOV Rd, #1; MOV Rd, #0
4202            // IMPORTANT: Must use ITE (If-Then-Else) because 16-bit Thumb MOV
4203            // always sets flags (MOVS). We need to evaluate the condition BEFORE
4204            // any MOV instruction clobbers the flags from CMP.
4205            ArmOp::SetCond { rd, cond } => {
4206                let rd_bits = reg_to_bits(rd) as u16;
4207
4208                // Condition code encoding for IT block
4209                use synth_synthesis::Condition;
4210                let cond_bits: u16 = match cond {
4211                    Condition::EQ => 0x0,
4212                    Condition::NE => 0x1,
4213                    Condition::LT => 0xB,
4214                    Condition::LE => 0xD,
4215                    Condition::GT => 0xC,
4216                    Condition::GE => 0xA,
4217                    Condition::LO => 0x3, // CC/LO (unsigned <)
4218                    Condition::LS => 0x9, // LS (unsigned <=)
4219                    Condition::HI => 0x8, // HI (unsigned >)
4220                    Condition::HS => 0x2, // CS/HS (unsigned >=)
4221                };
4222
4223                // ITE <cond>: encodes If-Then-Else block
4224                // The mask field depends on firstcond[0]:
4225                // - If firstcond[0] = 0: mask = 0xC for TE pattern (ITE EQ = BF0C)
4226                // - If firstcond[0] = 1: mask = 0x4 for TE pattern (ITE NE = BF14)
4227                let mask = if (cond_bits & 1) == 0 { 0xC } else { 0x4 };
4228                let ite_instr: u16 = 0xBF00 | (cond_bits << 4) | mask;
4229
4230                // Materialize 0/1 into Rd. The 16-bit MOVS (T1) encodes Rd in a
4231                // 3-bit field (bits[10:8]) — only R0–R7. For a high register
4232                // (R8–R12) `rd_bits << 8` overflows into bit 11 and silently
4233                // turns MOVS into CMP (00100 → 00101), corrupting the result
4234                // (this mis-materialized gale's `has_waiter`, so its `local.set`
4235                // stored a stale register → the binary-sem WAKE dispatch read
4236                // garbage). Use the 32-bit MOV.W (T2) for high registers, which
4237                // has a 4-bit Rd field. MOV.W with S=0 doesn't set flags, which
4238                // is fine inside the ITE (the materialized value is the result;
4239                // the flags are not consumed afterwards).
4240                let mut bytes = ite_instr.to_le_bytes().to_vec();
4241                let push_mov = |bytes: &mut Vec<u8>, imm: u16| {
4242                    if rd_bits <= 7 {
4243                        let m: u16 = 0x2000 | (rd_bits << 8) | imm; // 16-bit MOVS Rd,#imm
4244                        bytes.extend_from_slice(&m.to_le_bytes());
4245                    } else {
4246                        // 32-bit MOV.W Rd, #imm (T2): F04F | (Rd<<8) | imm8
4247                        let hw1: u16 = 0xF04F;
4248                        let hw2: u16 = (rd_bits << 8) | imm;
4249                        bytes.extend_from_slice(&hw1.to_le_bytes());
4250                        bytes.extend_from_slice(&hw2.to_le_bytes());
4251                    }
4252                };
4253                push_mov(&mut bytes, 1); // Then branch (condition true)  → 1
4254                push_mov(&mut bytes, 0); // Else branch (condition false) → 0
4255                Ok(bytes)
4256            }
4257
4258            // I64SetCond: Compare two i64 register pairs, result 0/1 in rd
4259            // EQ/NE: CMP lo,lo; IT EQ; CMPEQ hi,hi; ITE <cond>; MOV 1; MOV 0
4260            // LT: CMP lo,lo; SBCS rd,hi,hi; ITE LT; MOV 1; MOV 0
4261            // GT: CMP lo,lo (swapped); SBCS rd,hi,hi (swapped); ITE LT; MOV 1; MOV 0
4262            ArmOp::I64SetCond {
4263                rd,
4264                rn_lo,
4265                rn_hi,
4266                rm_lo,
4267                rm_hi,
4268                cond,
4269            } => {
4270                use synth_synthesis::Condition;
4271                let rd_bits = reg_to_bits(rd) as u16;
4272                let mut bytes = Vec::new();
4273
4274                // Helper: encode CMP Rn, Rm (16-bit)
4275                let encode_cmp_reg = |rn: &synth_synthesis::Reg,
4276                                      rm: &synth_synthesis::Reg|
4277                 -> Vec<u8> {
4278                    let rn_bits = reg_to_bits(rn) as u16;
4279                    let rm_bits = reg_to_bits(rm) as u16;
4280                    if rn_bits < 8 && rm_bits < 8 {
4281                        let instr: u16 = 0x4280 | (rm_bits << 3) | rn_bits;
4282                        instr.to_le_bytes().to_vec()
4283                    } else {
4284                        let n_bit = (rn_bits >> 3) & 1;
4285                        let instr: u16 = 0x4500 | (n_bit << 7) | (rm_bits << 3) | (rn_bits & 0x7);
4286                        instr.to_le_bytes().to_vec()
4287                    }
4288                };
4289
4290                // Helper: encode ITE <cond> (2 bytes)
4291                let encode_ite = |cond_bits: u16| -> Vec<u8> {
4292                    let mask = if (cond_bits & 1) == 0 { 0xC } else { 0x4 };
4293                    let ite_instr: u16 = 0xBF00 | (cond_bits << 4) | mask;
4294                    ite_instr.to_le_bytes().to_vec()
4295                };
4296
4297                // Helper: encode SetCond (ITE + MOV #1 + MOV #0) for given condition
4298                let encode_setcond = |cond_bits: u16, rd_bits: u16| -> Vec<u8> {
4299                    let mut b = encode_ite(cond_bits);
4300                    if rd_bits < 8 {
4301                        let mov_one: u16 = 0x2001 | (rd_bits << 8);
4302                        let mov_zero: u16 = 0x2000 | (rd_bits << 8);
4303                        b.extend_from_slice(&mov_one.to_le_bytes());
4304                        b.extend_from_slice(&mov_zero.to_le_bytes());
4305                    } else {
4306                        // #311: rd >= R8 — the 16-bit MOV imm8 form has a 3-bit
4307                        // rd field; rd_bits<<8 overflows into bit 11 and
4308                        // TRANSMUTES the MOV into CMP (0x2001|0x0800 = 0x2801 =
4309                        // CMP r0,#1): the boolean dies in the flags and the
4310                        // consumer reads a stale register. Use the 32-bit
4311                        // MOV.W (T2: F04F 0000|rd<<8|imm8) — IT-legal,
4312                        // flag-preserving. Same class as H-CODE-9 / #180.
4313                        for imm in [1u16, 0u16] {
4314                            let hw1: u16 = 0xF04F;
4315                            let hw2: u16 = (rd_bits << 8) | imm;
4316                            b.extend_from_slice(&hw1.to_le_bytes());
4317                            b.extend_from_slice(&hw2.to_le_bytes());
4318                        }
4319                    }
4320                    b
4321                };
4322
4323                match cond {
4324                    Condition::EQ | Condition::NE => {
4325                        // CMP rn_lo, rm_lo (compare low words)
4326                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4327
4328                        // IT EQ (execute next instruction only if Z=1)
4329                        let it_eq: u16 = 0xBF08; // IT EQ: cond=0000, mask=1000
4330                        bytes.extend_from_slice(&it_eq.to_le_bytes());
4331
4332                        // CMPEQ rn_hi, rm_hi (compare high words, only if low equal)
4333                        bytes.extend_from_slice(&encode_cmp_reg(rn_hi, rm_hi));
4334
4335                        // ITE <cond>; MOV rd, #1; MOV rd, #0
4336                        let cond_bits: u16 = match cond {
4337                            Condition::EQ => 0x0,
4338                            Condition::NE => 0x1,
4339                            _ => unreachable!(),
4340                        };
4341                        bytes.extend_from_slice(&encode_setcond(cond_bits, rd_bits));
4342                    }
4343
4344                    Condition::LT => {
4345                        // CMP rn_lo, rm_lo (sets C flag for borrow)
4346                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4347
4348                        // SBCS rd, rn_hi, rm_hi (subtract with carry, sets N,V flags)
4349                        // SBCS.W Rd, Rn, Rm: EB70 Rn | 0000 Rd 0000 Rm
4350                        let rn_hi_bits = reg_to_bits(rn_hi);
4351                        let rm_hi_bits = reg_to_bits(rm_hi);
4352                        let hw1: u16 = (0xEB70 | rn_hi_bits) as u16;
4353                        let hw2: u16 = ((rd_bits as u32) << 8 | rm_hi_bits) as u16;
4354                        bytes.extend_from_slice(&hw1.to_le_bytes());
4355                        bytes.extend_from_slice(&hw2.to_le_bytes());
4356
4357                        // ITE LT; MOV rd, #1; MOV rd, #0
4358                        bytes.extend_from_slice(&encode_setcond(0xB, rd_bits)); // LT = 0xB
4359                    }
4360
4361                    Condition::GT => {
4362                        // GT(a,b) = LT(b,a): swap operands
4363                        // CMP rm_lo, rn_lo (swapped)
4364                        bytes.extend_from_slice(&encode_cmp_reg(rm_lo, rn_lo));
4365
4366                        // SBCS rd, rm_hi, rn_hi (swapped)
4367                        let rm_hi_bits = reg_to_bits(rm_hi);
4368                        let rn_hi_bits = reg_to_bits(rn_hi);
4369                        let hw1: u16 = (0xEB70 | rm_hi_bits) as u16;
4370                        let hw2: u16 = ((rd_bits as u32) << 8 | rn_hi_bits) as u16;
4371                        bytes.extend_from_slice(&hw1.to_le_bytes());
4372                        bytes.extend_from_slice(&hw2.to_le_bytes());
4373
4374                        // ITE LT; MOV rd, #1; MOV rd, #0
4375                        bytes.extend_from_slice(&encode_setcond(0xB, rd_bits)); // LT = 0xB
4376                    }
4377
4378                    Condition::LE => {
4379                        // LE(a,b) = !GT(a,b): use GT logic but invert result
4380                        // GT(a,b) = LT(b,a): so we do CMP(b,a) and check LT, then invert
4381                        // CMP rm_lo, rn_lo (swapped, same as GT)
4382                        bytes.extend_from_slice(&encode_cmp_reg(rm_lo, rn_lo));
4383
4384                        // SBCS rd, rm_hi, rn_hi (swapped)
4385                        let rm_hi_bits = reg_to_bits(rm_hi);
4386                        let rn_hi_bits = reg_to_bits(rn_hi);
4387                        let hw1: u16 = (0xEB70 | rm_hi_bits) as u16;
4388                        let hw2: u16 = ((rd_bits as u32) << 8 | rn_hi_bits) as u16;
4389                        bytes.extend_from_slice(&hw1.to_le_bytes());
4390                        bytes.extend_from_slice(&hw2.to_le_bytes());
4391
4392                        // ITE GE; MOV rd, #1; MOV rd, #0 (GE is !LT, so inverting GT result)
4393                        bytes.extend_from_slice(&encode_setcond(0xA, rd_bits)); // GE = 0xA
4394                    }
4395
4396                    Condition::GE => {
4397                        // GE(a,b) = !LT(a,b): use LT logic but invert result
4398                        // CMP rn_lo, rm_lo (same as LT)
4399                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4400
4401                        // SBCS rd, rn_hi, rm_hi (same as LT)
4402                        let rn_hi_bits = reg_to_bits(rn_hi);
4403                        let rm_hi_bits = reg_to_bits(rm_hi);
4404                        let hw1: u16 = (0xEB70 | rn_hi_bits) as u16;
4405                        let hw2: u16 = ((rd_bits as u32) << 8 | rm_hi_bits) as u16;
4406                        bytes.extend_from_slice(&hw1.to_le_bytes());
4407                        bytes.extend_from_slice(&hw2.to_le_bytes());
4408
4409                        // ITE GE; MOV rd, #1; MOV rd, #0 (GE is !LT)
4410                        bytes.extend_from_slice(&encode_setcond(0xA, rd_bits)); // GE = 0xA
4411                    }
4412
4413                    // Unsigned comparisons - same instruction sequence, different conditions
4414                    Condition::LO => {
4415                        // LO (unsigned LT): CMP lo, SBCS hi, check C=0
4416                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4417                        let rn_hi_bits = reg_to_bits(rn_hi);
4418                        let rm_hi_bits = reg_to_bits(rm_hi);
4419                        let hw1: u16 = (0xEB70 | rn_hi_bits) as u16;
4420                        let hw2: u16 = ((rd_bits as u32) << 8 | rm_hi_bits) as u16;
4421                        bytes.extend_from_slice(&hw1.to_le_bytes());
4422                        bytes.extend_from_slice(&hw2.to_le_bytes());
4423                        bytes.extend_from_slice(&encode_setcond(0x3, rd_bits)); // LO = 0x3 (CC)
4424                    }
4425
4426                    Condition::HI => {
4427                        // HI (unsigned GT): swap operands and check LO
4428                        bytes.extend_from_slice(&encode_cmp_reg(rm_lo, rn_lo));
4429                        let rm_hi_bits = reg_to_bits(rm_hi);
4430                        let rn_hi_bits = reg_to_bits(rn_hi);
4431                        let hw1: u16 = (0xEB70 | rm_hi_bits) as u16;
4432                        let hw2: u16 = ((rd_bits as u32) << 8 | rn_hi_bits) as u16;
4433                        bytes.extend_from_slice(&hw1.to_le_bytes());
4434                        bytes.extend_from_slice(&hw2.to_le_bytes());
4435                        bytes.extend_from_slice(&encode_setcond(0x3, rd_bits)); // LO = 0x3 (CC)
4436                    }
4437
4438                    Condition::LS => {
4439                        // LS (unsigned LE): !(a > b) = !(HI), so do HI and invert
4440                        bytes.extend_from_slice(&encode_cmp_reg(rm_lo, rn_lo));
4441                        let rm_hi_bits = reg_to_bits(rm_hi);
4442                        let rn_hi_bits = reg_to_bits(rn_hi);
4443                        let hw1: u16 = (0xEB70 | rm_hi_bits) as u16;
4444                        let hw2: u16 = ((rd_bits as u32) << 8 | rn_hi_bits) as u16;
4445                        bytes.extend_from_slice(&hw1.to_le_bytes());
4446                        bytes.extend_from_slice(&hw2.to_le_bytes());
4447                        bytes.extend_from_slice(&encode_setcond(0x2, rd_bits)); // HS = 0x2 (CS) = !LO
4448                    }
4449
4450                    Condition::HS => {
4451                        // HS (unsigned GE): !(a < b) = !(LO)
4452                        bytes.extend_from_slice(&encode_cmp_reg(rn_lo, rm_lo));
4453                        let rn_hi_bits = reg_to_bits(rn_hi);
4454                        let rm_hi_bits = reg_to_bits(rm_hi);
4455                        let hw1: u16 = (0xEB70 | rn_hi_bits) as u16;
4456                        let hw2: u16 = ((rd_bits as u32) << 8 | rm_hi_bits) as u16;
4457                        bytes.extend_from_slice(&hw1.to_le_bytes());
4458                        bytes.extend_from_slice(&hw2.to_le_bytes());
4459                        bytes.extend_from_slice(&encode_setcond(0x2, rd_bits)); // HS = 0x2 (CS) = !LO
4460                    }
4461                }
4462
4463                Ok(bytes)
4464            }
4465
4466            // I64SetCondZ: Test if i64 register pair is zero, result 0/1 in rd
4467            // ORR.W rd, rn_lo, rn_hi; CMP rd, #0; ITE EQ; MOV 1; MOV 0
4468            ArmOp::I64SetCondZ { rd, rn_lo, rn_hi } => {
4469                let rd_bits = reg_to_bits(rd);
4470                let rn_lo_bits = reg_to_bits(rn_lo);
4471                let rn_hi_bits = reg_to_bits(rn_hi);
4472                let mut bytes = Vec::new();
4473
4474                // ORR.W rd, rn_lo, rn_hi: EA40 rn_lo | 0000 rd 0000 rn_hi
4475                let hw1: u16 = (0xEA40 | rn_lo_bits) as u16;
4476                let hw2: u16 = ((rd_bits << 8) | rn_hi_bits) as u16;
4477                bytes.extend_from_slice(&hw1.to_le_bytes());
4478                bytes.extend_from_slice(&hw2.to_le_bytes());
4479
4480                // CMP rd, #0 — 16-bit form only for r0-r7 (3-bit rd field);
4481                // high registers take CMP.W (T2: F1B0|rn 0F00|imm8). This was
4482                // H-CODE-9: rd_bits<<8 overflowing the field compared the
4483                // WRONG register. Same hardening as the #311 SetCond fix.
4484                if rd_bits < 8 {
4485                    let cmp_instr: u16 = 0x2800 | ((rd_bits as u16) << 8);
4486                    bytes.extend_from_slice(&cmp_instr.to_le_bytes());
4487                } else {
4488                    let hw1: u16 = 0xF1B0 | (rd_bits as u16);
4489                    let hw2: u16 = 0x0F00;
4490                    bytes.extend_from_slice(&hw1.to_le_bytes());
4491                    bytes.extend_from_slice(&hw2.to_le_bytes());
4492                }
4493
4494                // ITE EQ; MOV rd, #1; MOV rd, #0 (32-bit MOV.W for rd >= R8,
4495                // #311 — see I64SetCond)
4496                let mask = 0xC_u16; // ITE EQ mask: firstcond[0]=0, mask=0xC
4497                let ite_instr: u16 = 0xBF00 | mask;
4498                bytes.extend_from_slice(&ite_instr.to_le_bytes());
4499                if rd_bits < 8 {
4500                    let mov_one: u16 = 0x2001 | ((rd_bits as u16) << 8);
4501                    let mov_zero: u16 = 0x2000 | ((rd_bits as u16) << 8);
4502                    bytes.extend_from_slice(&mov_one.to_le_bytes());
4503                    bytes.extend_from_slice(&mov_zero.to_le_bytes());
4504                } else {
4505                    for imm in [1u16, 0u16] {
4506                        let hw1: u16 = 0xF04F;
4507                        let hw2: u16 = ((rd_bits as u16) << 8) | imm;
4508                        bytes.extend_from_slice(&hw1.to_le_bytes());
4509                        bytes.extend_from_slice(&hw2.to_le_bytes());
4510                    }
4511                }
4512
4513                Ok(bytes)
4514            }
4515
4516            // I64Mul: 64-bit multiply using UMULL + MLA cross products
4517            // Formula: result = (a_lo * b_lo) + ((a_lo * b_hi + a_hi * b_lo) << 32)
4518            // Uses R12 as scratch register
4519            ArmOp::I64Mul {
4520                rd_lo,
4521                rd_hi,
4522                rn_lo,
4523                rn_hi,
4524                rm_lo,
4525                rm_hi,
4526            } => {
4527                let rd_lo_bits = reg_to_bits(rd_lo);
4528                let rd_hi_bits = reg_to_bits(rd_hi);
4529                let rn_lo_bits = reg_to_bits(rn_lo);
4530                let rn_hi_bits = reg_to_bits(rn_hi);
4531                let rm_lo_bits = reg_to_bits(rm_lo);
4532                let rm_hi_bits = reg_to_bits(rm_hi);
4533                let r12: u32 = 12; // IP scratch register
4534                let mut bytes = Vec::new();
4535
4536                // 1. MUL R12, rn_lo, rm_hi  (R12 = a_lo * b_hi)
4537                // Thumb-2 MUL: hw1=0xFB00|Rn, hw2=0xF000|(Rd<<8)|Rm
4538                let hw1: u16 = (0xFB00 | rn_lo_bits) as u16;
4539                let hw2: u16 = (0xF000 | (r12 << 8) | rm_hi_bits) as u16;
4540                bytes.extend_from_slice(&hw1.to_le_bytes());
4541                bytes.extend_from_slice(&hw2.to_le_bytes());
4542
4543                // 2. MLA R12, rn_hi, rm_lo, R12  (R12 += a_hi * b_lo)
4544                // Thumb-2 MLA: hw1=0xFB00|Rn, hw2=(Ra<<12)|(Rd<<8)|Rm
4545                let hw1: u16 = (0xFB00 | rn_hi_bits) as u16;
4546                let hw2: u16 = ((r12 << 12) | (r12 << 8) | rm_lo_bits) as u16;
4547                bytes.extend_from_slice(&hw1.to_le_bytes());
4548                bytes.extend_from_slice(&hw2.to_le_bytes());
4549
4550                // 3. UMULL rd_lo, rd_hi, rn_lo, rm_lo  (rd_lo:rd_hi = a_lo * b_lo)
4551                // Thumb-2 UMULL: hw1=0xFBA0|Rn, hw2=(RdLo<<12)|(RdHi<<8)|Rm
4552                let hw1: u16 = (0xFBA0 | rn_lo_bits) as u16;
4553                let hw2: u16 = ((rd_lo_bits << 12) | (rd_hi_bits << 8) | rm_lo_bits) as u16;
4554                bytes.extend_from_slice(&hw1.to_le_bytes());
4555                bytes.extend_from_slice(&hw2.to_le_bytes());
4556
4557                // 4. ADD rd_hi, R12  (rd_hi += cross products)
4558                // 16-bit high reg ADD: 01000100 D Rm Rdn[2:0]
4559                let d_bit = (rd_hi_bits >> 3) & 1;
4560                let add_instr: u16 =
4561                    (0x4400 | (d_bit << 7) | (r12 << 3) | (rd_hi_bits & 0x7)) as u16;
4562                bytes.extend_from_slice(&add_instr.to_le_bytes());
4563
4564                Ok(bytes)
4565            }
4566
4567            // I64Shl: 64-bit shift left with branch for n<32 vs n>=32
4568            // rm_hi (R3) is used as temp register
4569            ArmOp::I64Shl {
4570                rd_lo,
4571                rd_hi,
4572                rn_lo,
4573                rn_hi,
4574                rm_lo,
4575                rm_hi,
4576            } => {
4577                let rd_lo_bits = reg_to_bits(rd_lo);
4578                let rd_hi_bits = reg_to_bits(rd_hi);
4579                let rn_lo_bits = reg_to_bits(rn_lo);
4580                let rn_hi_bits = reg_to_bits(rn_hi);
4581                let rm_lo_bits = reg_to_bits(rm_lo);
4582                let rm_hi_bits = reg_to_bits(rm_hi); // temp
4583                let mut bytes = Vec::new();
4584
4585                // AND.W rm_lo, rm_lo, #63  (mask shift amount to 6 bits)
4586                let hw1: u16 = (0xF000 | rm_lo_bits) as u16;
4587                let hw2: u16 = ((rm_lo_bits << 8) | 0x3F) as u16;
4588                bytes.extend_from_slice(&hw1.to_le_bytes());
4589                bytes.extend_from_slice(&hw2.to_le_bytes());
4590
4591                // SUBS.W rm_hi, rm_lo, #32  (rm_hi = n-32, sets flags)
4592                let hw1: u16 = (0xF1B0 | rm_lo_bits) as u16;
4593                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4594                bytes.extend_from_slice(&hw1.to_le_bytes());
4595                bytes.extend_from_slice(&hw2.to_le_bytes());
4596
4597                // BPL .large (branch if n >= 32, offset = +10 halfwords)
4598                let bpl: u16 = 0xD50A;
4599                bytes.extend_from_slice(&bpl.to_le_bytes());
4600
4601                // --- Small shift (n < 32) ---
4602                // RSB.W rm_hi, rm_lo, #32  (rm_hi = 32-n)
4603                let hw1: u16 = (0xF1C0 | rm_lo_bits) as u16;
4604                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4605                bytes.extend_from_slice(&hw1.to_le_bytes());
4606                bytes.extend_from_slice(&hw2.to_le_bytes());
4607
4608                // LSR.W rm_hi, rn_lo, rm_hi  (rm_hi = lo >> (32-n), overflow bits)
4609                let hw1: u16 = (0xFA20 | rn_lo_bits) as u16;
4610                let hw2: u16 = (0xF000 | (rm_hi_bits << 8) | rm_hi_bits) as u16;
4611                bytes.extend_from_slice(&hw1.to_le_bytes());
4612                bytes.extend_from_slice(&hw2.to_le_bytes());
4613
4614                // LSL.W rd_hi, rn_hi, rm_lo  (hi <<= n)
4615                let hw1: u16 = (0xFA00 | rn_hi_bits) as u16;
4616                let hw2: u16 = (0xF000 | (rd_hi_bits << 8) | rm_lo_bits) as u16;
4617                bytes.extend_from_slice(&hw1.to_le_bytes());
4618                bytes.extend_from_slice(&hw2.to_le_bytes());
4619
4620                // ORR.W rd_hi, rd_hi, rm_hi  (hi |= overflow bits from lo)
4621                let hw1: u16 = (0xEA40 | rd_hi_bits) as u16;
4622                let hw2: u16 = ((rd_hi_bits << 8) | rm_hi_bits) as u16;
4623                bytes.extend_from_slice(&hw1.to_le_bytes());
4624                bytes.extend_from_slice(&hw2.to_le_bytes());
4625
4626                // LSL.W rd_lo, rn_lo, rm_lo  (lo <<= n)
4627                let hw1: u16 = (0xFA00 | rn_lo_bits) as u16;
4628                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_lo_bits) as u16;
4629                bytes.extend_from_slice(&hw1.to_le_bytes());
4630                bytes.extend_from_slice(&hw2.to_le_bytes());
4631
4632                // B .done (skip large shift: +2 halfwords)
4633                let b_done: u16 = 0xE002;
4634                bytes.extend_from_slice(&b_done.to_le_bytes());
4635
4636                // --- Large shift (n >= 32) ---
4637                // LSL.W rd_hi, rn_lo, rm_hi  (hi = lo << (n-32))
4638                let hw1: u16 = (0xFA00 | rn_lo_bits) as u16;
4639                let hw2: u16 = (0xF000 | (rd_hi_bits << 8) | rm_hi_bits) as u16;
4640                bytes.extend_from_slice(&hw1.to_le_bytes());
4641                bytes.extend_from_slice(&hw2.to_le_bytes());
4642
4643                // MOV rd_lo, #0
4644                let mov_zero: u16 = 0x2000 | ((rd_lo_bits as u16) << 8);
4645                bytes.extend_from_slice(&mov_zero.to_le_bytes());
4646
4647                Ok(bytes) // Total: 38 bytes
4648            }
4649
4650            // I64ShrU: 64-bit logical shift right with branch for n<32 vs n>=32
4651            ArmOp::I64ShrU {
4652                rd_lo,
4653                rd_hi,
4654                rn_lo,
4655                rn_hi,
4656                rm_lo,
4657                rm_hi,
4658            } => {
4659                let rd_lo_bits = reg_to_bits(rd_lo);
4660                let rd_hi_bits = reg_to_bits(rd_hi);
4661                let rn_lo_bits = reg_to_bits(rn_lo);
4662                let rn_hi_bits = reg_to_bits(rn_hi);
4663                let rm_lo_bits = reg_to_bits(rm_lo);
4664                let rm_hi_bits = reg_to_bits(rm_hi); // temp
4665                let mut bytes = Vec::new();
4666
4667                // AND.W rm_lo, rm_lo, #63
4668                let hw1: u16 = (0xF000 | rm_lo_bits) as u16;
4669                let hw2: u16 = ((rm_lo_bits << 8) | 0x3F) as u16;
4670                bytes.extend_from_slice(&hw1.to_le_bytes());
4671                bytes.extend_from_slice(&hw2.to_le_bytes());
4672
4673                // SUBS.W rm_hi, rm_lo, #32
4674                let hw1: u16 = (0xF1B0 | rm_lo_bits) as u16;
4675                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4676                bytes.extend_from_slice(&hw1.to_le_bytes());
4677                bytes.extend_from_slice(&hw2.to_le_bytes());
4678
4679                // BPL .large (+10 halfwords)
4680                let bpl: u16 = 0xD50A;
4681                bytes.extend_from_slice(&bpl.to_le_bytes());
4682
4683                // --- Small shift (n < 32) ---
4684                // RSB.W rm_hi, rm_lo, #32  (rm_hi = 32-n)
4685                let hw1: u16 = (0xF1C0 | rm_lo_bits) as u16;
4686                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4687                bytes.extend_from_slice(&hw1.to_le_bytes());
4688                bytes.extend_from_slice(&hw2.to_le_bytes());
4689
4690                // LSL.W rm_hi, rn_hi, rm_hi  (rm_hi = hi << (32-n), bits flowing to lo)
4691                let hw1: u16 = (0xFA00 | rn_hi_bits) as u16;
4692                let hw2: u16 = (0xF000 | (rm_hi_bits << 8) | rm_hi_bits) as u16;
4693                bytes.extend_from_slice(&hw1.to_le_bytes());
4694                bytes.extend_from_slice(&hw2.to_le_bytes());
4695
4696                // LSR.W rd_lo, rn_lo, rm_lo  (lo >>= n)
4697                let hw1: u16 = (0xFA20 | rn_lo_bits) as u16;
4698                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_lo_bits) as u16;
4699                bytes.extend_from_slice(&hw1.to_le_bytes());
4700                bytes.extend_from_slice(&hw2.to_le_bytes());
4701
4702                // ORR.W rd_lo, rd_lo, rm_hi  (lo |= overflow from hi)
4703                let hw1: u16 = (0xEA40 | rd_lo_bits) as u16;
4704                let hw2: u16 = ((rd_lo_bits << 8) | rm_hi_bits) as u16;
4705                bytes.extend_from_slice(&hw1.to_le_bytes());
4706                bytes.extend_from_slice(&hw2.to_le_bytes());
4707
4708                // LSR.W rd_hi, rn_hi, rm_lo  (hi >>= n, logical)
4709                let hw1: u16 = (0xFA20 | rn_hi_bits) as u16;
4710                let hw2: u16 = (0xF000 | (rd_hi_bits << 8) | rm_lo_bits) as u16;
4711                bytes.extend_from_slice(&hw1.to_le_bytes());
4712                bytes.extend_from_slice(&hw2.to_le_bytes());
4713
4714                // B .done (+2 halfwords)
4715                let b_done: u16 = 0xE002;
4716                bytes.extend_from_slice(&b_done.to_le_bytes());
4717
4718                // --- Large shift (n >= 32) ---
4719                // LSR.W rd_lo, rn_hi, rm_hi  (lo = hi >> (n-32))
4720                let hw1: u16 = (0xFA20 | rn_hi_bits) as u16;
4721                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_hi_bits) as u16;
4722                bytes.extend_from_slice(&hw1.to_le_bytes());
4723                bytes.extend_from_slice(&hw2.to_le_bytes());
4724
4725                // MOV rd_hi, #0
4726                let mov_zero: u16 = 0x2000 | ((rd_hi_bits as u16) << 8);
4727                bytes.extend_from_slice(&mov_zero.to_le_bytes());
4728
4729                Ok(bytes) // Total: 38 bytes
4730            }
4731
4732            // I64ShrS: 64-bit arithmetic shift right with branch for n<32 vs n>=32
4733            ArmOp::I64ShrS {
4734                rd_lo,
4735                rd_hi,
4736                rn_lo,
4737                rn_hi,
4738                rm_lo,
4739                rm_hi,
4740            } => {
4741                let rd_lo_bits = reg_to_bits(rd_lo);
4742                let rd_hi_bits = reg_to_bits(rd_hi);
4743                let rn_lo_bits = reg_to_bits(rn_lo);
4744                let rn_hi_bits = reg_to_bits(rn_hi);
4745                let rm_lo_bits = reg_to_bits(rm_lo);
4746                let rm_hi_bits = reg_to_bits(rm_hi); // temp
4747                let mut bytes = Vec::new();
4748
4749                // AND.W rm_lo, rm_lo, #63
4750                let hw1: u16 = (0xF000 | rm_lo_bits) as u16;
4751                let hw2: u16 = ((rm_lo_bits << 8) | 0x3F) as u16;
4752                bytes.extend_from_slice(&hw1.to_le_bytes());
4753                bytes.extend_from_slice(&hw2.to_le_bytes());
4754
4755                // SUBS.W rm_hi, rm_lo, #32
4756                let hw1: u16 = (0xF1B0 | rm_lo_bits) as u16;
4757                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4758                bytes.extend_from_slice(&hw1.to_le_bytes());
4759                bytes.extend_from_slice(&hw2.to_le_bytes());
4760
4761                // BPL .large (+10 halfwords)
4762                let bpl: u16 = 0xD50A;
4763                bytes.extend_from_slice(&bpl.to_le_bytes());
4764
4765                // --- Small shift (n < 32) ---
4766                // RSB.W rm_hi, rm_lo, #32
4767                let hw1: u16 = (0xF1C0 | rm_lo_bits) as u16;
4768                let hw2: u16 = ((rm_hi_bits << 8) | 0x20) as u16;
4769                bytes.extend_from_slice(&hw1.to_le_bytes());
4770                bytes.extend_from_slice(&hw2.to_le_bytes());
4771
4772                // LSL.W rm_hi, rn_hi, rm_hi  (rm_hi = hi << (32-n), bits flowing to lo)
4773                let hw1: u16 = (0xFA00 | rn_hi_bits) as u16;
4774                let hw2: u16 = (0xF000 | (rm_hi_bits << 8) | rm_hi_bits) as u16;
4775                bytes.extend_from_slice(&hw1.to_le_bytes());
4776                bytes.extend_from_slice(&hw2.to_le_bytes());
4777
4778                // LSR.W rd_lo, rn_lo, rm_lo  (lo >>= n, logical for lo word)
4779                let hw1: u16 = (0xFA20 | rn_lo_bits) as u16;
4780                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_lo_bits) as u16;
4781                bytes.extend_from_slice(&hw1.to_le_bytes());
4782                bytes.extend_from_slice(&hw2.to_le_bytes());
4783
4784                // ORR.W rd_lo, rd_lo, rm_hi  (lo |= overflow from hi)
4785                let hw1: u16 = (0xEA40 | rd_lo_bits) as u16;
4786                let hw2: u16 = ((rd_lo_bits << 8) | rm_hi_bits) as u16;
4787                bytes.extend_from_slice(&hw1.to_le_bytes());
4788                bytes.extend_from_slice(&hw2.to_le_bytes());
4789
4790                // ASR.W rd_hi, rn_hi, rm_lo  (hi >>= n, arithmetic/sign-extending)
4791                let hw1: u16 = (0xFA40 | rn_hi_bits) as u16;
4792                let hw2: u16 = (0xF000 | (rd_hi_bits << 8) | rm_lo_bits) as u16;
4793                bytes.extend_from_slice(&hw1.to_le_bytes());
4794                bytes.extend_from_slice(&hw2.to_le_bytes());
4795
4796                // B .done (+3 halfwords, large shift is 8 bytes)
4797                let b_done: u16 = 0xE003;
4798                bytes.extend_from_slice(&b_done.to_le_bytes());
4799
4800                // --- Large shift (n >= 32) ---
4801                // ASR.W rd_lo, rn_hi, rm_hi  (lo = hi >>> (n-32))
4802                let hw1: u16 = (0xFA40 | rn_hi_bits) as u16;
4803                let hw2: u16 = (0xF000 | (rd_lo_bits << 8) | rm_hi_bits) as u16;
4804                bytes.extend_from_slice(&hw1.to_le_bytes());
4805                bytes.extend_from_slice(&hw2.to_le_bytes());
4806
4807                // ASR.W rd_hi, rn_hi, #31  (hi = sign extension, all 0s or all 1s)
4808                // Thumb-2 ASR immediate: hw1=0xEA4F, hw2=imm3:Rd:imm2:10:Rm
4809                // imm5=31=11111 → imm3=111, imm2=11
4810                let hw1: u16 = 0xEA4F;
4811                let hw2: u16 = (0x7000 | (rd_hi_bits << 8) | 0x00E0 | rn_hi_bits) as u16;
4812                bytes.extend_from_slice(&hw1.to_le_bytes());
4813                bytes.extend_from_slice(&hw2.to_le_bytes());
4814
4815                Ok(bytes) // Total: 40 bytes
4816            }
4817
4818            // I64Rotl: 64-bit rotate left (#610 rewrite).
4819            // For n < 32: new_hi = (hi << n) | (lo >> (32-n)), new_lo = (lo << n) | (hi >> (32-n))
4820            // For n >= 32: same formula with lo/hi swapped, shift by m = n-32.
4821            //
4822            // Fixed-reg core: value in R0:R1, amount in R2, scratch R3 + R12
4823            // (all four saved/marshaled by the #610 fixed-ABI wrapper; the
4824            // pre-#610 expansion wrote through the selector's registers with
4825            // colliding R3/R4 scratch and restored the saved R4 OVER the
4826            // result). Relies on ARM register-shift semantics: amounts >= 32
4827            // yield 0 for LSL/LSR, which makes n = 0 and n = 32 exact.
4828            ArmOp::I64Rotl {
4829                rdlo,
4830                rdhi,
4831                rnlo,
4832                rnhi,
4833                shift,
4834            } => {
4835                let mut bytes = Vec::new();
4836                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, shift]);
4837
4838                let core: [u16; 35] = [
4839                    0xF002, 0x023F, // AND.W  R2, R2, #63   (mask amount mod 64)
4840                    0xF1B2, 0x0320, // SUBS.W R3, R2, #32   (R3 = n-32, sets N)
4841                    0xD50E, //         BPL    .large        (n >= 32)
4842                    // --- small rotation (n < 32) ---
4843                    0xF1C2, 0x0320, // RSB.W  R3, R2, #32   (R3 = 32-n)
4844                    0xFA20, 0xFC03, // LSR.W  R12, R0, R3   (lo >> (32-n))
4845                    0xFA21, 0xF303, // LSR.W  R3, R1, R3    (hi >> (32-n))
4846                    0xFA01, 0xF102, // LSL.W  R1, R1, R2    (hi << n)
4847                    0xEA41, 0x010C, // ORR.W  R1, R1, R12   (new_hi)
4848                    0xFA00, 0xF002, // LSL.W  R0, R0, R2    (lo << n)
4849                    0xEA40, 0x0003, // ORR.W  R0, R0, R3    (new_lo)
4850                    0xE00E, //         B      .done
4851                    // --- large rotation (n >= 32), R3 = m = n-32 ---
4852                    0xF1C3, 0x0220, // RSB.W  R2, R3, #32   (R2 = 32-m = 64-n)
4853                    0xFA21, 0xFC02, // LSR.W  R12, R1, R2   (hi >> (64-n))
4854                    0xFA20, 0xF202, // LSR.W  R2, R0, R2    (lo >> (64-n))
4855                    0xFA00, 0xF003, // LSL.W  R0, R0, R3    (lo << m)
4856                    0xFA01, 0xF103, // LSL.W  R1, R1, R3    (hi << m)
4857                    0xEA40, 0x0C0C, // ORR.W  R12, R0, R12  (new_hi = (lo<<m)|(hi>>(64-n)))
4858                    0xEA41, 0x0002, // ORR.W  R0, R1, R2    (new_lo = (hi<<m)|(lo>>(64-n)))
4859                    0x4661, //         MOV    R1, R12       (new_hi into place)
4860                            // .done: result in R0:R1
4861                ];
4862                for hw in core {
4863                    bytes.extend_from_slice(&hw.to_le_bytes());
4864                }
4865
4866                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
4867                Ok(bytes) // Total: 102 bytes
4868            }
4869
4870            // I64Rotr: 64-bit rotate right (#610 rewrite).
4871            // For n < 32: new_lo = (lo >> n) | (hi << (32-n)), new_hi = (hi >> n) | (lo << (32-n))
4872            // For n >= 32: same formula with lo/hi swapped, shift by m = n-32.
4873            //
4874            // Same fixed-reg core contract as I64Rotl: value in R0:R1, amount
4875            // in R2, scratch R3 + R12, all covered by the fixed-ABI wrapper.
4876            ArmOp::I64Rotr {
4877                rdlo,
4878                rdhi,
4879                rnlo,
4880                rnhi,
4881                shift,
4882            } => {
4883                let mut bytes = Vec::new();
4884                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, shift]);
4885
4886                let core: [u16; 35] = [
4887                    0xF002, 0x023F, // AND.W  R2, R2, #63   (mask amount mod 64)
4888                    0xF1B2, 0x0320, // SUBS.W R3, R2, #32   (R3 = n-32, sets N)
4889                    0xD50E, //         BPL    .large        (n >= 32)
4890                    // --- small rotation (n < 32) ---
4891                    0xF1C2, 0x0320, // RSB.W  R3, R2, #32   (R3 = 32-n)
4892                    0xFA01, 0xFC03, // LSL.W  R12, R1, R3   (hi << (32-n))
4893                    0xFA00, 0xF303, // LSL.W  R3, R0, R3    (lo << (32-n))
4894                    0xFA20, 0xF002, // LSR.W  R0, R0, R2    (lo >> n)
4895                    0xEA40, 0x000C, // ORR.W  R0, R0, R12   (new_lo)
4896                    0xFA21, 0xF102, // LSR.W  R1, R1, R2    (hi >> n)
4897                    0xEA41, 0x0103, // ORR.W  R1, R1, R3    (new_hi)
4898                    0xE00E, //         B      .done
4899                    // --- large rotation (n >= 32), R3 = m = n-32 ---
4900                    0xF1C3, 0x0220, // RSB.W  R2, R3, #32   (R2 = 32-m = 64-n)
4901                    0xFA00, 0xFC02, // LSL.W  R12, R0, R2   (lo << (64-n))
4902                    0xFA01, 0xF202, // LSL.W  R2, R1, R2    (hi << (64-n))
4903                    0xFA21, 0xF103, // LSR.W  R1, R1, R3    (hi >> m)
4904                    0xEA41, 0x0C0C, // ORR.W  R12, R1, R12  (new_lo = (hi>>m)|(lo<<(64-n)))
4905                    0xFA20, 0xF103, // LSR.W  R1, R0, R3    (lo >> m)
4906                    0xEA41, 0x0102, // ORR.W  R1, R1, R2    (new_hi = (lo>>m)|(hi<<(64-n)))
4907                    0x4660, //         MOV    R0, R12       (new_lo into place)
4908                            // .done: result in R0:R1
4909                ];
4910                for hw in core {
4911                    bytes.extend_from_slice(&hw.to_le_bytes());
4912                }
4913
4914                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
4915                Ok(bytes) // Total: 102 bytes
4916            }
4917
4918            // I64Clz: Count leading zeros in 64-bit value
4919            // If hi != 0: result = CLZ(hi)
4920            // If hi == 0: result = 32 + CLZ(lo)
4921            //
4922            // Layout (using CMP+BNE approach for consistency):
4923            // 0: CMP.W rnhi, #0 (4 bytes)
4924            // 4: BEQ .hi_zero (2 bytes) - branch forward to offset 14
4925            // 6: CLZ.W rd, rnhi (4 bytes)
4926            // 10: B .done (2 bytes) - branch forward to offset 22
4927            // 12: NOP (2 bytes) - padding for alignment
4928            // 14: .hi_zero: CLZ.W rd, rnlo (4 bytes)
4929            // 18: ADD.W rd, rd, #32 (4 bytes)
4930            // 22: .done
4931            ArmOp::I64Clz { rd, rnlo, rnhi } => {
4932                let rd_bits = reg_to_bits(rd);
4933                let rn_lo_bits = reg_to_bits(rnlo);
4934                let rn_hi_bits = reg_to_bits(rnhi);
4935                let mut bytes = Vec::new();
4936
4937                // CMP.W rnhi, #0 (4 bytes at offset 0)
4938                let hw1: u16 = (0xF1B0 | rn_hi_bits) as u16;
4939                let hw2: u16 = 0x0F00;
4940                bytes.extend_from_slice(&hw1.to_le_bytes());
4941                bytes.extend_from_slice(&hw2.to_le_bytes());
4942
4943                // BEQ .hi_zero (2 bytes at offset 4)
4944                // PC = 4 + 4 = 8, target = 14, offset = 6, imm8 = 3
4945                let beq: u16 = 0xD003;
4946                bytes.extend_from_slice(&beq.to_le_bytes());
4947
4948                // CLZ.W rd, rnhi (4 bytes at offset 6)
4949                // CLZ T1: hw1 = 0xFAB<Rm>, hw2 = 0xF<Rd>8<Rm>
4950                let hw1: u16 = (0xFAB0 | rn_hi_bits) as u16;
4951                let hw2: u16 = (0xF080 | (rd_bits << 8) | rn_hi_bits) as u16;
4952                bytes.extend_from_slice(&hw1.to_le_bytes());
4953                bytes.extend_from_slice(&hw2.to_le_bytes());
4954
4955                // B .done (2 bytes at offset 10)
4956                // PC = 10 + 4 = 14, target = 22, offset = 8, imm11 = 4
4957                let b_done: u16 = 0xE004;
4958                bytes.extend_from_slice(&b_done.to_le_bytes());
4959
4960                // NOP (2 bytes at offset 12) - padding
4961                bytes.extend_from_slice(&0xBF00u16.to_le_bytes());
4962
4963                // .hi_zero: (offset 14)
4964                // CLZ.W rd, rnlo (4 bytes)
4965                // CLZ T1: hw1 = 0xFAB<Rm>, hw2 = 0xF<Rd>8<Rm>
4966                let hw1: u16 = (0xFAB0 | rn_lo_bits) as u16;
4967                let hw2: u16 = (0xF080 | (rd_bits << 8) | rn_lo_bits) as u16;
4968                bytes.extend_from_slice(&hw1.to_le_bytes());
4969                bytes.extend_from_slice(&hw2.to_le_bytes());
4970
4971                // ADD.W rd, rd, #32 (4 bytes at offset 18)
4972                let hw1: u16 = (0xF100 | rd_bits) as u16;
4973                let hw2: u16 = ((rd_bits << 8) | 0x20) as u16;
4974                bytes.extend_from_slice(&hw1.to_le_bytes());
4975                bytes.extend_from_slice(&hw2.to_le_bytes());
4976
4977                // .done: (offset 22)
4978                // i64.clz returns i64, so clear high word: MOV rnhi, #0 (2 bytes)
4979                // MOVS Rn, #0: 0010 0 Rn 00000000
4980                let mov0: u16 = (0x2000 | (rn_hi_bits << 8)) as u16;
4981                bytes.extend_from_slice(&mov0.to_le_bytes());
4982
4983                Ok(bytes)
4984            }
4985
4986            // I64Ctz: Count trailing zeros in 64-bit value
4987            // If lo != 0: result = CTZ(lo) = CLZ(RBIT(lo))
4988            // If lo == 0: result = 32 + CTZ(hi) = 32 + CLZ(RBIT(hi))
4989            //
4990            // Layout:
4991            // 0: CMP.W rnlo, #0 (4 bytes)
4992            // 4: BEQ .lo_zero (2 bytes) - branch to offset 18
4993            // 6: RBIT.W rd, rnlo (4 bytes)
4994            // 10: CLZ.W rd, rd (4 bytes)
4995            // 14: B .done (2 bytes) - branch to offset 30
4996            // 16: NOP (2 bytes) - padding
4997            // 18: .lo_zero: RBIT.W rd, rnhi (4 bytes)
4998            // 22: CLZ.W rd, rd (4 bytes)
4999            // 26: ADD.W rd, rd, #32 (4 bytes)
5000            // 30: .done
5001            ArmOp::I64Ctz { rd, rnlo, rnhi } => {
5002                let rd_bits = reg_to_bits(rd);
5003                let rn_lo_bits = reg_to_bits(rnlo);
5004                let rn_hi_bits = reg_to_bits(rnhi);
5005                let mut bytes = Vec::new();
5006
5007                // CMP.W rnlo, #0 (4 bytes at offset 0)
5008                let hw1: u16 = (0xF1B0 | rn_lo_bits) as u16;
5009                let hw2: u16 = 0x0F00;
5010                bytes.extend_from_slice(&hw1.to_le_bytes());
5011                bytes.extend_from_slice(&hw2.to_le_bytes());
5012
5013                // BEQ .lo_zero (2 bytes at offset 4)
5014                // PC = 4 + 4 = 8, target = 18, offset = 10, imm8 = 5
5015                let beq: u16 = 0xD005;
5016                bytes.extend_from_slice(&beq.to_le_bytes());
5017
5018                // RBIT.W rd, rnlo (4 bytes at offset 6)
5019                // RBIT T1: hw1 = 0xFA9<Rm>, hw2 = 0xF<Rd>A<Rm>
5020                let hw1: u16 = (0xFA90 | rn_lo_bits) as u16;
5021                let hw2: u16 = (0xF0A0 | (rd_bits << 8) | rn_lo_bits) as u16;
5022                bytes.extend_from_slice(&hw1.to_le_bytes());
5023                bytes.extend_from_slice(&hw2.to_le_bytes());
5024
5025                // CLZ.W rd, rd (4 bytes at offset 10)
5026                // CLZ T1: hw1 = 0xFAB<Rm>, hw2 = 0xF<Rd>8<Rm>
5027                let hw1: u16 = (0xFAB0 | rd_bits) as u16;
5028                let hw2: u16 = (0xF080 | (rd_bits << 8) | rd_bits) as u16;
5029                bytes.extend_from_slice(&hw1.to_le_bytes());
5030                bytes.extend_from_slice(&hw2.to_le_bytes());
5031
5032                // B .done (2 bytes at offset 14)
5033                // PC = 14 + 4 = 18, target = 30, offset = 12, imm11 = 6
5034                let b_done: u16 = 0xE006;
5035                bytes.extend_from_slice(&b_done.to_le_bytes());
5036
5037                // NOP (2 bytes at offset 16) - padding
5038                bytes.extend_from_slice(&0xBF00u16.to_le_bytes());
5039
5040                // .lo_zero: (offset 18)
5041                // RBIT.W rd, rnhi (4 bytes)
5042                // RBIT T1: hw1 = 0xFA9<Rm>, hw2 = 0xF<Rd>A<Rm>
5043                let hw1: u16 = (0xFA90 | rn_hi_bits) as u16;
5044                let hw2: u16 = (0xF0A0 | (rd_bits << 8) | rn_hi_bits) as u16;
5045                bytes.extend_from_slice(&hw1.to_le_bytes());
5046                bytes.extend_from_slice(&hw2.to_le_bytes());
5047
5048                // CLZ.W rd, rd (4 bytes at offset 22)
5049                // CLZ T1: hw1 = 0xFAB<Rm>, hw2 = 0xF<Rd>8<Rm>
5050                let hw1: u16 = (0xFAB0 | rd_bits) as u16;
5051                let hw2: u16 = (0xF080 | (rd_bits << 8) | rd_bits) as u16;
5052                bytes.extend_from_slice(&hw1.to_le_bytes());
5053                bytes.extend_from_slice(&hw2.to_le_bytes());
5054
5055                // ADD.W rd, rd, #32 (4 bytes at offset 26)
5056                let hw1: u16 = (0xF100 | rd_bits) as u16;
5057                let hw2: u16 = ((rd_bits << 8) | 0x20) as u16;
5058                bytes.extend_from_slice(&hw1.to_le_bytes());
5059                bytes.extend_from_slice(&hw2.to_le_bytes());
5060
5061                // .done: (offset 30)
5062                // i64.ctz returns i64, so clear high word: MOV rnhi, #0 (2 bytes)
5063                let mov0: u16 = (0x2000 | (rn_hi_bits << 8)) as u16;
5064                bytes.extend_from_slice(&mov0.to_le_bytes());
5065
5066                Ok(bytes)
5067            }
5068
5069            // I64Popcnt: Population count of 64-bit value
5070            // result = POPCNT(lo) + POPCNT(hi)
5071            // Using SIMD-style parallel bit counting algorithm
5072            ArmOp::I64Popcnt { rd, rnlo, rnhi } => {
5073                let rd_bits = reg_to_bits(rd);
5074                let rn_lo_bits = reg_to_bits(rnlo);
5075                let rn_hi_bits = reg_to_bits(rnhi);
5076                let r12: u32 = 12; // IP scratch
5077                let r3: u32 = 3; // Scratch for hi popcnt result
5078                let mut bytes = Vec::new();
5079
5080                // PUSH {R3, R4, R5} - save scratch registers
5081                bytes.extend_from_slice(&0xB438u16.to_le_bytes());
5082
5083                // Strategy: compute popcnt(lo) -> R4, popcnt(hi) -> R5, add them -> rd
5084                // Using lookup table approach for each byte would be too large
5085                // Using shift-and-add approach instead
5086
5087                // For simplicity and correctness, use the efficient parallel algorithm
5088                // but implement it as a series of inline operations
5089
5090                // Marshal the operand pair into the fixed scratch regs, routing
5091                // rnlo through R12 (#632 audit): writing R4 first corrupted the
5092                // rnhi read for a pair living at (R3,R4) — every source is read
5093                // before any scratch register it could occupy is written.
5094                // MOV R12, rnlo
5095                let mov: u16 = (0x4600 | (1 << 7) | (rn_lo_bits << 3) | 4) as u16;
5096                bytes.extend_from_slice(&mov.to_le_bytes());
5097                // MOV R5, rnhi (R4 untouched so far; rnhi == R5 is a no-op)
5098                let mov: u16 = (0x4600 | (rn_hi_bits << 3) | 5) as u16;
5099                bytes.extend_from_slice(&mov.to_le_bytes());
5100                // MOV R4, R12
5101                bytes.extend_from_slice(&0x4664u16.to_le_bytes());
5102
5103                // --- POPCNT for R4 (lo word) ---
5104                // Step 1: x = x - ((x >> 1) & 0x55555555)
5105                // LSR.W R12, R4, #1
5106                let hw1: u16 = 0xEA4F;
5107                let hw2: u16 = ((r12 << 8) | 0x50 | 4) as u16;
5108                bytes.extend_from_slice(&hw1.to_le_bytes());
5109                bytes.extend_from_slice(&hw2.to_le_bytes());
5110
5111                // Load 0x55555555 into R3 using MOVW/MOVT
5112                // MOVW R3, #0x5555
5113                bytes.extend_from_slice(&0xF245u16.to_le_bytes());
5114                bytes.extend_from_slice(&0x5355u16.to_le_bytes());
5115                // MOVT R3, #0x5555
5116                bytes.extend_from_slice(&0xF2C5u16.to_le_bytes());
5117                bytes.extend_from_slice(&0x5355u16.to_le_bytes());
5118
5119                // AND.W R12, R12, R3
5120                let hw1: u16 = (0xEA00 | r12) as u16;
5121                let hw2: u16 = ((r12 << 8) | r3) as u16;
5122                bytes.extend_from_slice(&hw1.to_le_bytes());
5123                bytes.extend_from_slice(&hw2.to_le_bytes());
5124
5125                // SUB.W R4, R4, R12
5126                let hw1: u16 = (0xEBA0 | 4) as u16;
5127                let hw2: u16 = ((4 << 8) | r12) as u16;
5128                bytes.extend_from_slice(&hw1.to_le_bytes());
5129                bytes.extend_from_slice(&hw2.to_le_bytes());
5130
5131                // Step 2: x = (x & 0x33333333) + ((x >> 2) & 0x33333333)
5132                // Load 0x33333333 into R3
5133                // MOVW R3, #0x3333
5134                bytes.extend_from_slice(&0xF243u16.to_le_bytes());
5135                bytes.extend_from_slice(&0x3333u16.to_le_bytes());
5136                // MOVT R3, #0x3333
5137                bytes.extend_from_slice(&0xF2C3u16.to_le_bytes());
5138                bytes.extend_from_slice(&0x3333u16.to_le_bytes());
5139
5140                // AND.W R12, R4, R3
5141                let hw1: u16 = (0xEA00 | 4) as u16;
5142                let hw2: u16 = ((r12 << 8) | r3) as u16;
5143                bytes.extend_from_slice(&hw1.to_le_bytes());
5144                bytes.extend_from_slice(&hw2.to_le_bytes());
5145
5146                // LSR.W R4, R4, #2
5147                let hw1: u16 = 0xEA4F;
5148                let hw2: u16 = ((4 << 8) | 0x90 | 4) as u16;
5149                bytes.extend_from_slice(&hw1.to_le_bytes());
5150                bytes.extend_from_slice(&hw2.to_le_bytes());
5151
5152                // AND.W R4, R4, R3
5153                let hw1: u16 = (0xEA00 | 4) as u16;
5154                let hw2: u16 = ((4 << 8) | r3) as u16;
5155                bytes.extend_from_slice(&hw1.to_le_bytes());
5156                bytes.extend_from_slice(&hw2.to_le_bytes());
5157
5158                // ADD.W R4, R4, R12
5159                let hw1: u16 = (0xEB00 | 4) as u16;
5160                let hw2: u16 = ((4 << 8) | r12) as u16;
5161                bytes.extend_from_slice(&hw1.to_le_bytes());
5162                bytes.extend_from_slice(&hw2.to_le_bytes());
5163
5164                // Step 3: x = (x + (x >> 4)) & 0x0F0F0F0F
5165                // LSR.W R12, R4, #4
5166                // hw2 = (imm3 << 12) | (Rd << 8) | (imm2 << 6) | (type << 4) | Rm
5167                // imm5=4=00100 → imm3=1, imm2=0, type=01(LSR)
5168                let hw1: u16 = 0xEA4F;
5169                let hw2: u16 = (0x1000 | (r12 << 8) | 0x10 | 4) as u16;
5170                bytes.extend_from_slice(&hw1.to_le_bytes());
5171                bytes.extend_from_slice(&hw2.to_le_bytes());
5172
5173                // ADD.W R4, R4, R12
5174                let hw1: u16 = (0xEB00 | 4) as u16;
5175                let hw2: u16 = ((4 << 8) | r12) as u16;
5176                bytes.extend_from_slice(&hw1.to_le_bytes());
5177                bytes.extend_from_slice(&hw2.to_le_bytes());
5178
5179                // Load 0x0F0F0F0F into R3
5180                // MOVW R3, #0x0F0F (imm4=0, i=1, imm3=7, imm8=0x0F)
5181                // hw1 = 11110 1 10 0100 0000 = 0xF640
5182                // hw2 = 0 111 0011 00001111 = 0x730F
5183                bytes.extend_from_slice(&0xF640u16.to_le_bytes());
5184                bytes.extend_from_slice(&0x730Fu16.to_le_bytes());
5185                // MOVT R3, #0x0F0F
5186                bytes.extend_from_slice(&0xF6C0u16.to_le_bytes());
5187                bytes.extend_from_slice(&0x730Fu16.to_le_bytes());
5188
5189                // AND.W R4, R4, R3
5190                let hw1: u16 = (0xEA00 | 4) as u16;
5191                let hw2: u16 = ((4 << 8) | r3) as u16;
5192                bytes.extend_from_slice(&hw1.to_le_bytes());
5193                bytes.extend_from_slice(&hw2.to_le_bytes());
5194
5195                // Step 4: x = x * 0x01010101 >> 24
5196                // Load 0x01010101 into R3
5197                // MOVW R3, #0x0101
5198                bytes.extend_from_slice(&0xF240u16.to_le_bytes());
5199                bytes.extend_from_slice(&0x1301u16.to_le_bytes());
5200                // MOVT R3, #0x0101
5201                bytes.extend_from_slice(&0xF2C0u16.to_le_bytes());
5202                bytes.extend_from_slice(&0x1301u16.to_le_bytes());
5203
5204                // MUL R4, R4, R3
5205                // MUL T2: hw1 = 0xFB00|Rn, hw2 = 0xF000|(Rd<<8)|Rm
5206                let hw1: u16 = (0xFB00 | 4) as u16;
5207                let hw2: u16 = (0xF000 | (4 << 8) | r3) as u16;
5208                bytes.extend_from_slice(&hw1.to_le_bytes());
5209                bytes.extend_from_slice(&hw2.to_le_bytes());
5210
5211                // LSR.W R4, R4, #24
5212                // imm5=24=11000 → imm3=6, imm2=0, type=01(LSR)
5213                let hw1: u16 = 0xEA4F;
5214                let hw2: u16 = (0x6000 | (4 << 8) | 0x10 | 4) as u16;
5215                bytes.extend_from_slice(&hw1.to_le_bytes());
5216                bytes.extend_from_slice(&hw2.to_le_bytes());
5217
5218                // --- POPCNT for R5 (hi word) - same algorithm ---
5219                // Step 1
5220                let hw1: u16 = 0xEA4F;
5221                let hw2: u16 = ((r12 << 8) | 0x50 | 5) as u16;
5222                bytes.extend_from_slice(&hw1.to_le_bytes());
5223                bytes.extend_from_slice(&hw2.to_le_bytes());
5224
5225                // Load 0x55555555 into R3
5226                bytes.extend_from_slice(&0xF245u16.to_le_bytes());
5227                bytes.extend_from_slice(&0x5355u16.to_le_bytes());
5228                bytes.extend_from_slice(&0xF2C5u16.to_le_bytes());
5229                bytes.extend_from_slice(&0x5355u16.to_le_bytes());
5230
5231                let hw1: u16 = (0xEA00 | r12) as u16;
5232                let hw2: u16 = ((r12 << 8) | r3) as u16;
5233                bytes.extend_from_slice(&hw1.to_le_bytes());
5234                bytes.extend_from_slice(&hw2.to_le_bytes());
5235
5236                let hw1: u16 = (0xEBA0 | 5) as u16;
5237                let hw2: u16 = ((5 << 8) | r12) as u16;
5238                bytes.extend_from_slice(&hw1.to_le_bytes());
5239                bytes.extend_from_slice(&hw2.to_le_bytes());
5240
5241                // Step 2
5242                bytes.extend_from_slice(&0xF243u16.to_le_bytes());
5243                bytes.extend_from_slice(&0x3333u16.to_le_bytes());
5244                bytes.extend_from_slice(&0xF2C3u16.to_le_bytes());
5245                bytes.extend_from_slice(&0x3333u16.to_le_bytes());
5246
5247                let hw1: u16 = (0xEA00 | 5) as u16;
5248                let hw2: u16 = ((r12 << 8) | r3) as u16;
5249                bytes.extend_from_slice(&hw1.to_le_bytes());
5250                bytes.extend_from_slice(&hw2.to_le_bytes());
5251
5252                let hw1: u16 = 0xEA4F;
5253                let hw2: u16 = ((5 << 8) | 0x90 | 5) as u16;
5254                bytes.extend_from_slice(&hw1.to_le_bytes());
5255                bytes.extend_from_slice(&hw2.to_le_bytes());
5256
5257                let hw1: u16 = (0xEA00 | 5) as u16;
5258                let hw2: u16 = ((5 << 8) | r3) as u16;
5259                bytes.extend_from_slice(&hw1.to_le_bytes());
5260                bytes.extend_from_slice(&hw2.to_le_bytes());
5261
5262                let hw1: u16 = (0xEB00 | 5) as u16;
5263                let hw2: u16 = ((5 << 8) | r12) as u16;
5264                bytes.extend_from_slice(&hw1.to_le_bytes());
5265                bytes.extend_from_slice(&hw2.to_le_bytes());
5266
5267                // Step 3: LSR.W R12, R5, #4
5268                // imm5=4=00100 → imm3=1, imm2=0, type=01(LSR)
5269                let hw1: u16 = 0xEA4F;
5270                let hw2: u16 = (0x1000 | (r12 << 8) | 0x10 | 5) as u16;
5271                bytes.extend_from_slice(&hw1.to_le_bytes());
5272                bytes.extend_from_slice(&hw2.to_le_bytes());
5273
5274                let hw1: u16 = (0xEB00 | 5) as u16;
5275                let hw2: u16 = ((5 << 8) | r12) as u16;
5276                bytes.extend_from_slice(&hw1.to_le_bytes());
5277                bytes.extend_from_slice(&hw2.to_le_bytes());
5278
5279                // Load 0x0F0F0F0F into R3 (for hi-word)
5280                bytes.extend_from_slice(&0xF640u16.to_le_bytes());
5281                bytes.extend_from_slice(&0x730Fu16.to_le_bytes());
5282                bytes.extend_from_slice(&0xF6C0u16.to_le_bytes());
5283                bytes.extend_from_slice(&0x730Fu16.to_le_bytes());
5284
5285                let hw1: u16 = (0xEA00 | 5) as u16;
5286                let hw2: u16 = ((5 << 8) | r3) as u16;
5287                bytes.extend_from_slice(&hw1.to_le_bytes());
5288                bytes.extend_from_slice(&hw2.to_le_bytes());
5289
5290                // Step 4
5291                bytes.extend_from_slice(&0xF240u16.to_le_bytes());
5292                bytes.extend_from_slice(&0x1301u16.to_le_bytes());
5293                bytes.extend_from_slice(&0xF2C0u16.to_le_bytes());
5294                bytes.extend_from_slice(&0x1301u16.to_le_bytes());
5295
5296                // MUL R5, R5, R3
5297                // MUL T2: hw1 = 0xFB00|Rn, hw2 = 0xF000|(Rd<<8)|Rm
5298                let hw1: u16 = (0xFB00 | 5) as u16;
5299                let hw2: u16 = (0xF000 | (5 << 8) | r3) as u16;
5300                bytes.extend_from_slice(&hw1.to_le_bytes());
5301                bytes.extend_from_slice(&hw2.to_le_bytes());
5302
5303                // LSR.W R5, R5, #24
5304                // imm5=24=11000 → imm3=6, imm2=0, type=01(LSR)
5305                let hw1: u16 = 0xEA4F;
5306                let hw2: u16 = (0x6000 | (5 << 8) | 0x10 | 5) as u16;
5307                bytes.extend_from_slice(&hw1.to_le_bytes());
5308                bytes.extend_from_slice(&hw2.to_le_bytes());
5309
5310                // #632: the count must be carried ACROSS the scratch restore
5311                // in a register the POP cannot touch. rd is allocator-assigned
5312                // (any of R0-R8) and can land inside the {R3,R4,R5} restore set
5313                // — the old `ADDS rd, R4, R5; POP {R3,R4,R5}` destroyed the
5314                // result one instruction after computing it (0 for every input
5315                // under qemu). R12 is encoder scratch: never allocatable (#212)
5316                // and never in a restore set, so no choice of rd can collide.
5317                // ADD.W R12, R4, R5
5318                bytes.extend_from_slice(&0xEB04u16.to_le_bytes());
5319                bytes.extend_from_slice(&0x0C05u16.to_le_bytes());
5320
5321                // POP {R3, R4, R5}
5322                bytes.extend_from_slice(&0xBC38u16.to_le_bytes());
5323
5324                // MOV rd, R12 — after the restore. The 4-bit Rd (D:rd) form is
5325                // also total over rd = R8, where the old ADDS T1 3-bit field
5326                // silently corrupted the encoding (#178/#180 class).
5327                let mov: u16 =
5328                    (0x4600 | (((rd_bits >> 3) & 1) << 7) | (12 << 3) | (rd_bits & 7)) as u16;
5329                bytes.extend_from_slice(&mov.to_le_bytes());
5330
5331                // i64.popcnt returns i64, so clear high word: MOV.W rnhi, #0
5332                // (T2, 4 bytes — total over rnhi = R8, where the old 16-bit
5333                // MOVS encoding overflowed its 3-bit field into CMP R0, #0).
5334                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
5335                bytes.extend_from_slice(&(((rn_hi_bits & 0xF) << 8) as u16).to_le_bytes());
5336
5337                Ok(bytes)
5338            }
5339
5340            // I64Extend8S: Sign-extend low 8 bits to 64 bits
5341            // Result: rdlo = sign_extend_8(rnlo), rdhi = rdlo >> 31
5342            ArmOp::I64Extend8S { rdlo, rdhi, rnlo } => {
5343                let rdlo_bits = reg_to_bits(rdlo);
5344                let rdhi_bits = reg_to_bits(rdhi);
5345                let rnlo_bits = reg_to_bits(rnlo);
5346                let mut bytes = Vec::new();
5347
5348                // SXTB.W rdlo, rnlo (sign-extend byte to 32-bit)
5349                // SXTB T2: hw1 = 0xFA4F, hw2 = 0xF0<Rd><Rm>
5350                let hw1: u16 = 0xFA4F_u16;
5351                let hw2: u16 = (0xF080 | (rdlo_bits << 8) | rnlo_bits) as u16;
5352                bytes.extend_from_slice(&hw1.to_le_bytes());
5353                bytes.extend_from_slice(&hw2.to_le_bytes());
5354
5355                // ASR.W rdhi, rdlo, #31 (sign-extend to high word)
5356                // ASR (immediate): hw1 = 0xEA4F, hw2 = imm3:Rd:imm2:type:Rm
5357                // For imm5=31: imm3=111, imm2=11, type=10 (ASR)
5358                // hw2 = (7 << 12) | (rdhi << 8) | (3 << 6) | (2 << 4) | rdlo
5359                let hw1: u16 = 0xEA4F;
5360                let hw2: u16 = (0x70E0 | (rdhi_bits << 8) | rdlo_bits) as u16;
5361                bytes.extend_from_slice(&hw1.to_le_bytes());
5362                bytes.extend_from_slice(&hw2.to_le_bytes());
5363
5364                Ok(bytes)
5365            }
5366
5367            // I64Extend16S: Sign-extend low 16 bits to 64 bits
5368            // Result: rdlo = sign_extend_16(rnlo), rdhi = rdlo >> 31
5369            ArmOp::I64Extend16S { rdlo, rdhi, rnlo } => {
5370                let rdlo_bits = reg_to_bits(rdlo);
5371                let rdhi_bits = reg_to_bits(rdhi);
5372                let rnlo_bits = reg_to_bits(rnlo);
5373                let mut bytes = Vec::new();
5374
5375                // SXTH.W rdlo, rnlo (sign-extend halfword to 32-bit)
5376                // SXTH T2: hw1 = 0xFA0F, hw2 = 0xF0<Rd><Rm>
5377                let hw1: u16 = 0xFA0F_u16;
5378                let hw2: u16 = (0xF080 | (rdlo_bits << 8) | rnlo_bits) as u16;
5379                bytes.extend_from_slice(&hw1.to_le_bytes());
5380                bytes.extend_from_slice(&hw2.to_le_bytes());
5381
5382                // ASR.W rdhi, rdlo, #31 (sign-extend to high word)
5383                let hw1: u16 = 0xEA4F;
5384                let hw2: u16 = (0x70E0 | (rdhi_bits << 8) | rdlo_bits) as u16;
5385                bytes.extend_from_slice(&hw1.to_le_bytes());
5386                bytes.extend_from_slice(&hw2.to_le_bytes());
5387
5388                Ok(bytes)
5389            }
5390
5391            // I64Extend32S: Sign-extend low 32 bits to 64 bits
5392            // Result: rdlo = rnlo, rdhi = rnlo >> 31
5393            ArmOp::I64Extend32S { rdlo, rdhi, rnlo } => {
5394                let rdlo_bits = reg_to_bits(rdlo);
5395                let rdhi_bits = reg_to_bits(rdhi);
5396                let rnlo_bits = reg_to_bits(rnlo);
5397                let mut bytes = Vec::new();
5398
5399                // MOV rdlo, rnlo (if different)
5400                if rdlo_bits != rnlo_bits {
5401                    // MOV Rd, Rm (16-bit): 0100 0110 D Rm Rd[2:0]
5402                    let d_bit = ((rdlo_bits >> 3) & 1) as u16;
5403                    let mov: u16 = 0x4600
5404                        | (d_bit << 7)
5405                        | ((rnlo_bits as u16) << 3)
5406                        | ((rdlo_bits & 0x7) as u16);
5407                    bytes.extend_from_slice(&mov.to_le_bytes());
5408                }
5409
5410                // ASR.W rdhi, rnlo, #31 (sign-extend to high word)
5411                let hw1: u16 = 0xEA4F;
5412                let hw2: u16 = (0x70E0 | (rdhi_bits << 8) | rnlo_bits) as u16;
5413                bytes.extend_from_slice(&hw1.to_le_bytes());
5414                bytes.extend_from_slice(&hw2.to_le_bytes());
5415
5416                Ok(bytes)
5417            }
5418
5419            // SelectMove: IT <cond>; MOV{cond} rd, rm
5420            // Conditional move: only execute MOV if condition is true
5421            ArmOp::SelectMove { rd, rm, cond } => {
5422                let rd_bits = reg_to_bits(rd) as u16;
5423                let rm_bits = reg_to_bits(rm) as u16;
5424
5425                // Condition code encoding for IT block
5426                use synth_synthesis::Condition;
5427                let cond_bits: u16 = match cond {
5428                    Condition::EQ => 0x0, // Equal
5429                    Condition::NE => 0x1, // Not equal
5430                    Condition::HS => 0x2, // Higher or same (unsigned >=)
5431                    Condition::LO => 0x3, // Lower (unsigned <)
5432                    Condition::HI => 0x8, // Higher (unsigned >)
5433                    Condition::LS => 0x9, // Lower or same (unsigned <=)
5434                    Condition::GE => 0xA, // Greater or equal (signed)
5435                    Condition::LT => 0xB, // Less than (signed)
5436                    Condition::GT => 0xC, // Greater than (signed)
5437                    Condition::LE => 0xD, // Less or equal (signed)
5438                };
5439
5440                // IT <cond>: single Then block (mask = 0x8 for T only)
5441                // IT instruction: 1011 1111 firstcond mask
5442                let it_instr: u16 = 0xBF00 | (cond_bits << 4) | 0x8;
5443
5444                // MOV Rd, Rm (16-bit): 0100 0110 D Rm Rd[2:0]
5445                // This MOV will only execute if condition is true due to IT block
5446                let d_bit = (rd_bits >> 3) & 1;
5447                let mov_instr: u16 = 0x4600 | (d_bit << 7) | (rm_bits << 3) | (rd_bits & 0x7);
5448
5449                // Emit: IT <cond>, MOV rd, rm
5450                let mut bytes = it_instr.to_le_bytes().to_vec();
5451                bytes.extend_from_slice(&mov_instr.to_le_bytes());
5452                Ok(bytes)
5453            }
5454
5455            // Popcnt: Population count (count set bits)
5456            // ARM Cortex-M has no native POPCNT, so we implement the bit manipulation algorithm:
5457            // x = x - ((x >> 1) & 0x55555555);
5458            // x = (x & 0x33333333) + ((x >> 2) & 0x33333333);
5459            // x = (x + (x >> 4)) & 0x0F0F0F0F;
5460            // x = x + (x >> 8);
5461            // x = x + (x >> 16);
5462            // return x & 0x3F;
5463            //
5464            // Uses rd as working register and R12 as scratch for constants
5465            ArmOp::Popcnt { rd, rm } => {
5466                let mut bytes = Vec::new();
5467
5468                // First, move rm to rd if they're different
5469                if rd != rm {
5470                    let rd_bits = reg_to_bits(rd) as u16;
5471                    let rm_bits = reg_to_bits(rm) as u16;
5472                    // MOV Rd, Rm (16-bit): 0100 0110 D Rm Rd[2:0]
5473                    let d_bit = (rd_bits >> 3) & 1;
5474                    let mov_instr: u16 = 0x4600 | (d_bit << 7) | (rm_bits << 3) | (rd_bits & 0x7);
5475                    bytes.extend_from_slice(&mov_instr.to_le_bytes());
5476                }
5477
5478                // Step 1: x = x - ((x >> 1) & 0x55555555)
5479                // Load 0x55555555 into R12
5480                bytes.extend_from_slice(&self.encode_thumb32_movw_raw(12, 0x5555)?);
5481                bytes.extend_from_slice(&self.encode_thumb32_movt_raw(12, 0x5555)?);
5482
5483                // R12_temp = rd >> 1
5484                // We need a second scratch register. Use R11.
5485                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(11, reg_to_bits(rd), 1)?);
5486
5487                // R11 = R11 & R12 (R11 = (x >> 1) & 0x55555555)
5488                bytes.extend_from_slice(&self.encode_thumb32_and_reg_raw(11, 11, 12)?);
5489
5490                // rd = rd - R11
5491                bytes.extend_from_slice(&self.encode_thumb32_sub_reg_raw(
5492                    reg_to_bits(rd),
5493                    reg_to_bits(rd),
5494                    11,
5495                )?);
5496
5497                // Step 2: x = (x & 0x33333333) + ((x >> 2) & 0x33333333)
5498                // Load 0x33333333 into R12
5499                bytes.extend_from_slice(&self.encode_thumb32_movw_raw(12, 0x3333)?);
5500                bytes.extend_from_slice(&self.encode_thumb32_movt_raw(12, 0x3333)?);
5501
5502                // R11 = rd & R12
5503                bytes.extend_from_slice(&self.encode_thumb32_and_reg_raw(
5504                    11,
5505                    reg_to_bits(rd),
5506                    12,
5507                )?);
5508
5509                // rd = rd >> 2
5510                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(
5511                    reg_to_bits(rd),
5512                    reg_to_bits(rd),
5513                    2,
5514                )?);
5515
5516                // rd = rd & R12
5517                bytes.extend_from_slice(&self.encode_thumb32_and_reg_raw(
5518                    reg_to_bits(rd),
5519                    reg_to_bits(rd),
5520                    12,
5521                )?);
5522
5523                // rd = rd + R11
5524                bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
5525                    reg_to_bits(rd),
5526                    reg_to_bits(rd),
5527                    11,
5528                )?);
5529
5530                // Step 3: x = (x + (x >> 4)) & 0x0F0F0F0F
5531                // R11 = rd >> 4
5532                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(11, reg_to_bits(rd), 4)?);
5533
5534                // rd = rd + R11
5535                bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
5536                    reg_to_bits(rd),
5537                    reg_to_bits(rd),
5538                    11,
5539                )?);
5540
5541                // Load 0x0F0F0F0F into R12
5542                bytes.extend_from_slice(&self.encode_thumb32_movw_raw(12, 0x0F0F)?);
5543                bytes.extend_from_slice(&self.encode_thumb32_movt_raw(12, 0x0F0F)?);
5544
5545                // rd = rd & R12
5546                bytes.extend_from_slice(&self.encode_thumb32_and_reg_raw(
5547                    reg_to_bits(rd),
5548                    reg_to_bits(rd),
5549                    12,
5550                )?);
5551
5552                // Step 4: x = x + (x >> 8)
5553                // R11 = rd >> 8
5554                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(11, reg_to_bits(rd), 8)?);
5555
5556                // rd = rd + R11
5557                bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
5558                    reg_to_bits(rd),
5559                    reg_to_bits(rd),
5560                    11,
5561                )?);
5562
5563                // Step 5: x = x + (x >> 16)
5564                // R11 = rd >> 16
5565                bytes.extend_from_slice(&self.encode_thumb32_lsr_raw(11, reg_to_bits(rd), 16)?);
5566
5567                // rd = rd + R11
5568                bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
5569                    reg_to_bits(rd),
5570                    reg_to_bits(rd),
5571                    11,
5572                )?);
5573
5574                // Step 6: return x & 0x3F
5575                // AND with 0x3F (small immediate, can use BIC or AND with immediate)
5576                bytes.extend_from_slice(&self.encode_thumb32_and_imm_raw(
5577                    reg_to_bits(rd),
5578                    reg_to_bits(rd),
5579                    0x3F,
5580                )?);
5581
5582                Ok(bytes)
5583            }
5584
5585            // I64DivU: 64-bit unsigned division using binary long division
5586            // Core: R0:R1 = dividend, R2:R3 = divisor -> R0:R1 = quotient
5587            // Uses: R4-R7, R12 as loop counter (avoid R8 for Renode compatibility)
5588            //
5589            // #610: the fixed-ABI wrapper marshals the selector-assigned
5590            // operand registers into the core's fixed regs and lands the
5591            // result in rd — pre-#610 this arm IGNORED its register fields,
5592            // so the selector read its rd pair (e.g. R4:R5) after the core's
5593            // own POP restored the stale caller values over it: 0 for every
5594            // input. A zero divisor now traps (UDF #0), per WASM semantics.
5595            ArmOp::I64DivU {
5596                rdlo,
5597                rdhi,
5598                rnlo,
5599                rnhi,
5600                rmlo,
5601                rmhi,
5602                elide_zero_guard,
5603            } => {
5604                let mut bytes = Vec::new();
5605                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, rmlo, rmhi]);
5606                // #494 phase 2b: elided only under a certificate-discharged
5607                // UNSAT(P ∧ divisor == 0) obligation (fact-spec pass).
5608                if !elide_zero_guard {
5609                    emit_i64_divisor_zero_trap(&mut bytes);
5610                }
5611
5612                // PUSH {R4-R7} - save scratch registers (NO LR — this is inline code)
5613                // 16-bit PUSH: 1011 010 M rrrrrrrr where M=0 (no LR), r=R4-R7 = 0xF0
5614                // Encoding: 1011 0100 1111 0000 = 0xB4F0
5615                bytes.extend_from_slice(&0xB4F0u16.to_le_bytes());
5616
5617                // Initialize quotient (R4:R5) = 0
5618                bytes.extend_from_slice(&0x2400u16.to_le_bytes()); // MOV R4, #0
5619                bytes.extend_from_slice(&0x2500u16.to_le_bytes()); // MOV R5, #0
5620
5621                // Initialize remainder (R6:R7) = 0
5622                bytes.extend_from_slice(&0x2600u16.to_le_bytes()); // MOV R6, #0
5623                bytes.extend_from_slice(&0x2700u16.to_le_bytes()); // MOV R7, #0
5624
5625                // Initialize loop counter R12 = 64 (use R12 scratch instead of R8)
5626                // MOV.W R12, #64: F04F 0C40
5627                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
5628                bytes.extend_from_slice(&0x0C40u16.to_le_bytes());
5629
5630                // Loop start
5631                let loop_start = bytes.len();
5632
5633                // === Loop body: process one bit ===
5634
5635                // 1. Shift quotient R4:R5 left by 1
5636                // LSLS R5, R5, #1 (16-bit: 0000 0010 1010 1101 = 0x006D -> actually 0x002D for LSL R5,R5,#1)
5637                // LSL Rd, Rm, #imm5: 000 00 imm5 Rm Rd = 000 00 00001 101 101 = 0x006D
5638                bytes.extend_from_slice(&0x006Du16.to_le_bytes()); // LSLS R5, R5, #1
5639                // Get carry from R4 into R5: ORR R5, R5, R4 LSR #31
5640                // Thumb-2 ORR with shifted register: EA45 75D4 = ORR.W R5, R5, R4, LSR #31
5641                // 11101010 010 S Rn | 0 imm3 Rd imm2 type Rm
5642                // type=01 (LSR), imm5=31 (imm3=111, imm2=11)
5643                bytes.extend_from_slice(&0xEA45u16.to_le_bytes());
5644                bytes.extend_from_slice(&0x75D4u16.to_le_bytes()); // ORR.W R5, R5, R4, LSR #31
5645                // LSLS R4, R4, #1: 000 00 00001 100 100 = 0x0064
5646                bytes.extend_from_slice(&0x0064u16.to_le_bytes()); // LSLS R4, R4, #1
5647
5648                // 2. Shift remainder R6:R7 left by 1, OR in MSB of dividend R1
5649                // LSLS R7, R7, #1
5650                bytes.extend_from_slice(&0x007Fu16.to_le_bytes()); // LSLS R7, R7, #1
5651                // ORR.W R7, R7, R6, LSR #31
5652                bytes.extend_from_slice(&0xEA47u16.to_le_bytes());
5653                bytes.extend_from_slice(&0x77D6u16.to_le_bytes());
5654                // LSLS R6, R6, #1
5655                bytes.extend_from_slice(&0x0076u16.to_le_bytes()); // LSLS R6, R6, #1
5656                // ORR.W R6, R6, R1, LSR #31 (bring in MSB of dividend high)
5657                bytes.extend_from_slice(&0xEA46u16.to_le_bytes());
5658                bytes.extend_from_slice(&0x76D1u16.to_le_bytes());
5659
5660                // 3. Shift dividend R0:R1 left by 1
5661                // LSLS R1, R1, #1
5662                bytes.extend_from_slice(&0x0049u16.to_le_bytes()); // LSLS R1, R1, #1
5663                // ORR.W R1, R1, R0, LSR #31
5664                bytes.extend_from_slice(&0xEA41u16.to_le_bytes());
5665                bytes.extend_from_slice(&0x71D0u16.to_le_bytes());
5666                // LSLS R0, R0, #1
5667                bytes.extend_from_slice(&0x0040u16.to_le_bytes()); // LSLS R0, R0, #1
5668
5669                // 4. Compare remainder >= divisor (64-bit unsigned comparison)
5670                // Compare high words first: CMP R7, R3
5671                // CMP Rn, Rm encoding: 0x4280 | (Rm << 3) | Rn
5672                bytes.extend_from_slice(&0x429Fu16.to_le_bytes()); // CMP R7, R3 (16-bit)
5673                // BHI means R7 > R3 (unsigned) - definitely subtract
5674                // BLO means R7 < R3 - definitely don't subtract
5675                // BEQ means need to check low words
5676
5677                // If high > divisor high: branch to subtract (forward +offset)
5678                // BHI.N +6 (skip CMP, skip BLO, do subtract)
5679                // BHI: 1101 1000 offset8 where cond=1000 (HI)
5680                bytes.extend_from_slice(&0xD802u16.to_le_bytes()); // BHI +4 (to subtract block)
5681
5682                // If high < divisor high: branch past subtract
5683                // BLO.N +10 (skip to decrement)
5684                bytes.extend_from_slice(&0xD306u16.to_le_bytes()); // BLO/BCC +12 (past subtract)
5685
5686                // High words equal, compare low: CMP R6, R2
5687                bytes.extend_from_slice(&0x4296u16.to_le_bytes()); // CMP R6, R2 (16-bit)
5688                // BLO/BCC past subtract (skip SUBS+SBC.W+ORR.W = 10 bytes = 4 halfwords from PC+4)
5689                bytes.extend_from_slice(&0xD304u16.to_le_bytes()); // BCC +4 halfwords (past subtract)
5690
5691                // === Subtract block: remainder -= divisor, quotient |= 1 ===
5692                // SUBS R6, R6, R2
5693                bytes.extend_from_slice(&0x1AB6u16.to_le_bytes()); // SUBS R6, R6, R2 (16-bit)
5694                // SBC R7, R7, R3 (with borrow)
5695                // Thumb-2 SBC.W: EB67 0703 = SBC.W R7, R7, R3
5696                bytes.extend_from_slice(&0xEB67u16.to_le_bytes());
5697                bytes.extend_from_slice(&0x0703u16.to_le_bytes());
5698                // ORR R4, R4, #1 (set bit 0 of quotient low)
5699                bytes.extend_from_slice(&0xF044u16.to_le_bytes()); // ORR.W R4, R4, #1
5700                bytes.extend_from_slice(&0x0401u16.to_le_bytes());
5701
5702                // === Decrement counter and loop ===
5703                // SUBS.W R12, R12, #1 (decrement loop counter)
5704                // SUBS.W R12, R12, #1: F1BC 0C01
5705                bytes.extend_from_slice(&0xF1BCu16.to_le_bytes());
5706                bytes.extend_from_slice(&0x0C01u16.to_le_bytes());
5707
5708                // BNE back to loop_start
5709                let branch_offset_bytes = bytes.len() - loop_start + 4; // +4 for pipeline
5710                let offset_halfwords = -((branch_offset_bytes / 2) as i16);
5711                let bne_encoding = 0xD100u16 | ((offset_halfwords as u16) & 0xFF);
5712                bytes.extend_from_slice(&bne_encoding.to_le_bytes());
5713
5714                // === Loop done, move quotient to R0:R1 ===
5715                bytes.extend_from_slice(&0x4620u16.to_le_bytes()); // MOV R0, R4
5716                bytes.extend_from_slice(&0x4629u16.to_le_bytes()); // MOV R1, R5
5717
5718                // POP {R4-R7} - restore scratch registers (NO PC — inline code continues)
5719                // 16-bit POP: 1011 110 P rrrrrrrr where P=0 (no PC), r=R4-R7 = 0xF0
5720                // Encoding: 1011 1100 1111 0000 = 0xBCF0
5721                bytes.extend_from_slice(&0xBCF0u16.to_le_bytes());
5722
5723                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
5724                Ok(bytes)
5725            }
5726
5727            // I64DivS: 64-bit signed division
5728            // Converts to unsigned, divides, then applies sign
5729            // Core: R0:R1 = dividend (signed), R2:R3 = divisor (signed)
5730            //   ->  R0:R1 = quotient (signed)
5731            // #610: fixed-ABI wrapper + zero-divisor trap (see I64DivU).
5732            ArmOp::I64DivS {
5733                rdlo,
5734                rdhi,
5735                rnlo,
5736                rnhi,
5737                rmlo,
5738                rmhi,
5739                elide_zero_guard,
5740                elide_overflow_guard,
5741            } => {
5742                let mut bytes = Vec::new();
5743                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, rmlo, rmhi]);
5744                // #494 phase 2b: two INDEPENDENT guards, two INDEPENDENT
5745                // obligations. The zero guard falls to UNSAT(P ∧ divisor == 0);
5746                // the #633 overflow guard falls ONLY to
5747                // UNSAT(P ∧ dividend == INT64_MIN ∧ divisor == -1) — a
5748                // divisor-nonzero fact alone must keep it.
5749                if !elide_zero_guard {
5750                    emit_i64_divisor_zero_trap(&mut bytes);
5751                }
5752                if !elide_overflow_guard {
5753                    // #633: INT64_MIN / -1 overflows — trap like the i32 path
5754                    // (rem_s stays guard-free: rem_s(INT64_MIN, -1) == 0).
5755                    emit_i64_divs_overflow_trap(&mut bytes);
5756                }
5757
5758                // PUSH {R4-R11} - save scratch registers (NO LR — inline code)
5759                bytes.extend_from_slice(&0xE92Du16.to_le_bytes());
5760                bytes.extend_from_slice(&0x0FF0u16.to_le_bytes());
5761
5762                // Save result sign in R9: R9 = R1 XOR R3 (sign bit = MSB)
5763                // EOR.W R9, R1, R3
5764                bytes.extend_from_slice(&0xEA81u16.to_le_bytes());
5765                bytes.extend_from_slice(&0x0903u16.to_le_bytes());
5766
5767                // If dividend negative (R1 MSB set), negate it
5768                // TST R1, R1 (check sign)
5769                bytes.extend_from_slice(&0x4209u16.to_le_bytes()); // TST R1, R1
5770                // BPL skip_neg_dividend (+10 bytes = 5 halfwords)
5771                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
5772
5773                // Negate R0:R1 (64-bit): RSBS R0, R0, #0; SBC R1, R1, R1 LSL #1
5774                // Actually: MVN R0, R0; MVN R1, R1; ADDS R0, R0, #1; ADC R1, R1, #0
5775                bytes.extend_from_slice(&0x43C0u16.to_le_bytes()); // MVNS R0, R0
5776                bytes.extend_from_slice(&0x43C9u16.to_le_bytes()); // MVNS R1, R1
5777                bytes.extend_from_slice(&0x1C40u16.to_le_bytes()); // ADDS R0, R0, #1
5778                bytes.extend_from_slice(&0xF141u16.to_le_bytes()); // ADC.W R1, R1, #0
5779                bytes.extend_from_slice(&0x0100u16.to_le_bytes());
5780
5781                // If divisor negative (R3 MSB set), negate it
5782                bytes.extend_from_slice(&0x421Bu16.to_le_bytes()); // TST R3, R3
5783                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
5784
5785                // Negate R2:R3
5786                bytes.extend_from_slice(&0x43D2u16.to_le_bytes()); // MVNS R2, R2
5787                bytes.extend_from_slice(&0x43DBu16.to_le_bytes()); // MVNS R3, R3
5788                bytes.extend_from_slice(&0x1C52u16.to_le_bytes()); // ADDS R2, R2, #1
5789                bytes.extend_from_slice(&0xF143u16.to_le_bytes()); // ADC.W R3, R3, #0
5790                bytes.extend_from_slice(&0x0300u16.to_le_bytes());
5791
5792                // === Now do unsigned division (same as I64DivU) ===
5793                // Initialize quotient (R4:R5) = 0
5794                bytes.extend_from_slice(&0x2400u16.to_le_bytes());
5795                bytes.extend_from_slice(&0x2500u16.to_le_bytes());
5796                // Initialize remainder (R6:R7) = 0
5797                bytes.extend_from_slice(&0x2600u16.to_le_bytes());
5798                bytes.extend_from_slice(&0x2700u16.to_le_bytes());
5799                // Initialize loop counter R8 = 64
5800                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
5801                bytes.extend_from_slice(&0x0840u16.to_le_bytes());
5802
5803                let loop_start = bytes.len();
5804
5805                // Shift quotient left
5806                bytes.extend_from_slice(&0x006Du16.to_le_bytes()); // LSLS R5, R5, #1
5807                bytes.extend_from_slice(&0xEA45u16.to_le_bytes()); // ORR.W R5, R5, R4, LSR #31
5808                bytes.extend_from_slice(&0x75D4u16.to_le_bytes());
5809                bytes.extend_from_slice(&0x0064u16.to_le_bytes()); // LSLS R4, R4, #1
5810
5811                // Shift remainder left, OR in MSB of dividend
5812                bytes.extend_from_slice(&0x007Fu16.to_le_bytes()); // LSLS R7, R7, #1
5813                bytes.extend_from_slice(&0xEA47u16.to_le_bytes()); // ORR.W R7, R7, R6, LSR #31
5814                bytes.extend_from_slice(&0x77D6u16.to_le_bytes());
5815                bytes.extend_from_slice(&0x0076u16.to_le_bytes()); // LSLS R6, R6, #1
5816                bytes.extend_from_slice(&0xEA46u16.to_le_bytes()); // ORR.W R6, R6, R1, LSR #31
5817                bytes.extend_from_slice(&0x76D1u16.to_le_bytes());
5818
5819                // Shift dividend left
5820                bytes.extend_from_slice(&0x0049u16.to_le_bytes()); // LSLS R1, R1, #1
5821                bytes.extend_from_slice(&0xEA41u16.to_le_bytes()); // ORR.W R1, R1, R0, LSR #31
5822                bytes.extend_from_slice(&0x71D0u16.to_le_bytes());
5823                bytes.extend_from_slice(&0x0040u16.to_le_bytes()); // LSLS R0, R0, #1
5824
5825                // Compare and conditionally subtract
5826                bytes.extend_from_slice(&0x429Fu16.to_le_bytes()); // CMP R7, R3
5827                bytes.extend_from_slice(&0xD802u16.to_le_bytes()); // BHI +4
5828                bytes.extend_from_slice(&0xD306u16.to_le_bytes()); // BCC +12
5829                bytes.extend_from_slice(&0x4296u16.to_le_bytes()); // CMP R6, R2
5830                bytes.extend_from_slice(&0xD304u16.to_le_bytes()); // BCC +4 halfwords
5831
5832                // Subtract and set quotient bit
5833                bytes.extend_from_slice(&0x1AB6u16.to_le_bytes()); // SUBS R6, R6, R2
5834                bytes.extend_from_slice(&0xEB67u16.to_le_bytes()); // SBC.W R7, R7, R3
5835                bytes.extend_from_slice(&0x0703u16.to_le_bytes());
5836                bytes.extend_from_slice(&0xF044u16.to_le_bytes()); // ORR.W R4, R4, #1
5837                bytes.extend_from_slice(&0x0401u16.to_le_bytes());
5838
5839                // Decrement and loop
5840                bytes.extend_from_slice(&0xF1B8u16.to_le_bytes()); // SUB.W R8, R8, #1
5841                bytes.extend_from_slice(&0x0801u16.to_le_bytes());
5842
5843                let branch_offset_bytes = bytes.len() - loop_start + 4;
5844                let offset_halfwords = -((branch_offset_bytes / 2) as i16);
5845                let bne_encoding = 0xD100u16 | ((offset_halfwords as u16) & 0xFF);
5846                bytes.extend_from_slice(&bne_encoding.to_le_bytes());
5847
5848                // Move quotient to R0:R1
5849                bytes.extend_from_slice(&0x4620u16.to_le_bytes()); // MOV R0, R4
5850                bytes.extend_from_slice(&0x4629u16.to_le_bytes()); // MOV R1, R5
5851
5852                // If result should be negative (R9 MSB set), negate R0:R1
5853                bytes.extend_from_slice(&0xF1B9u16.to_le_bytes()); // TST.W R9, R9 (check MSB)
5854                bytes.extend_from_slice(&0x0F00u16.to_le_bytes());
5855                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8 (skip negation)
5856
5857                // Negate result R0:R1
5858                bytes.extend_from_slice(&0x43C0u16.to_le_bytes()); // MVNS R0, R0
5859                bytes.extend_from_slice(&0x43C9u16.to_le_bytes()); // MVNS R1, R1
5860                bytes.extend_from_slice(&0x1C40u16.to_le_bytes()); // ADDS R0, R0, #1
5861                bytes.extend_from_slice(&0xF141u16.to_le_bytes()); // ADC.W R1, R1, #0
5862                bytes.extend_from_slice(&0x0100u16.to_le_bytes());
5863
5864                // POP {R4-R11} - restore scratch registers (NO PC — inline code continues)
5865                bytes.extend_from_slice(&0xE8BDu16.to_le_bytes());
5866                bytes.extend_from_slice(&0x0FF0u16.to_le_bytes());
5867
5868                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
5869                Ok(bytes)
5870            }
5871
5872            // I64RemU: 64-bit unsigned remainder using binary long division
5873            // Same algorithm as I64DivU but returns remainder instead of quotient
5874            // Core: R0:R1 = dividend, R2:R3 = divisor -> R0:R1 = remainder
5875            // #610: fixed-ABI wrapper + zero-divisor trap (see I64DivU).
5876            ArmOp::I64RemU {
5877                rdlo,
5878                rdhi,
5879                rnlo,
5880                rnhi,
5881                rmlo,
5882                rmhi,
5883                elide_zero_guard,
5884            } => {
5885                let mut bytes = Vec::new();
5886                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, rmlo, rmhi]);
5887                if !elide_zero_guard {
5888                    emit_i64_divisor_zero_trap(&mut bytes);
5889                }
5890
5891                // PUSH {R4-R8} - save scratch registers (NO LR — inline code)
5892                bytes.extend_from_slice(&0xE92Du16.to_le_bytes());
5893                bytes.extend_from_slice(&0x01F0u16.to_le_bytes());
5894
5895                // Initialize quotient (R4:R5) = 0 (computed but not returned)
5896                bytes.extend_from_slice(&0x2400u16.to_le_bytes());
5897                bytes.extend_from_slice(&0x2500u16.to_le_bytes());
5898                // Initialize remainder (R6:R7) = 0
5899                bytes.extend_from_slice(&0x2600u16.to_le_bytes());
5900                bytes.extend_from_slice(&0x2700u16.to_le_bytes());
5901                // Initialize loop counter R8 = 64
5902                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
5903                bytes.extend_from_slice(&0x0840u16.to_le_bytes());
5904
5905                let loop_start = bytes.len();
5906
5907                // Shift quotient left (not needed for result, but keeps algorithm same)
5908                bytes.extend_from_slice(&0x006Du16.to_le_bytes()); // LSLS R5, R5, #1
5909                bytes.extend_from_slice(&0xEA45u16.to_le_bytes()); // ORR.W R5, R5, R4, LSR #31
5910                bytes.extend_from_slice(&0x75D4u16.to_le_bytes());
5911                bytes.extend_from_slice(&0x0064u16.to_le_bytes()); // LSLS R4, R4, #1
5912
5913                // Shift remainder left, OR in MSB of dividend
5914                bytes.extend_from_slice(&0x007Fu16.to_le_bytes()); // LSLS R7, R7, #1
5915                bytes.extend_from_slice(&0xEA47u16.to_le_bytes()); // ORR.W R7, R7, R6, LSR #31
5916                bytes.extend_from_slice(&0x77D6u16.to_le_bytes());
5917                bytes.extend_from_slice(&0x0076u16.to_le_bytes()); // LSLS R6, R6, #1
5918                bytes.extend_from_slice(&0xEA46u16.to_le_bytes()); // ORR.W R6, R6, R1, LSR #31
5919                bytes.extend_from_slice(&0x76D1u16.to_le_bytes());
5920
5921                // Shift dividend left
5922                bytes.extend_from_slice(&0x0049u16.to_le_bytes()); // LSLS R1, R1, #1
5923                bytes.extend_from_slice(&0xEA41u16.to_le_bytes()); // ORR.W R1, R1, R0, LSR #31
5924                bytes.extend_from_slice(&0x71D0u16.to_le_bytes());
5925                bytes.extend_from_slice(&0x0040u16.to_le_bytes()); // LSLS R0, R0, #1
5926
5927                // Compare and conditionally subtract
5928                bytes.extend_from_slice(&0x429Fu16.to_le_bytes()); // CMP R7, R3
5929                bytes.extend_from_slice(&0xD802u16.to_le_bytes()); // BHI +4
5930                bytes.extend_from_slice(&0xD306u16.to_le_bytes()); // BCC +12
5931                bytes.extend_from_slice(&0x4296u16.to_le_bytes()); // CMP R6, R2
5932                bytes.extend_from_slice(&0xD304u16.to_le_bytes()); // BCC +4 halfwords
5933
5934                // Subtract and set quotient bit
5935                bytes.extend_from_slice(&0x1AB6u16.to_le_bytes()); // SUBS R6, R6, R2
5936                bytes.extend_from_slice(&0xEB67u16.to_le_bytes()); // SBC.W R7, R7, R3
5937                bytes.extend_from_slice(&0x0703u16.to_le_bytes());
5938                bytes.extend_from_slice(&0xF044u16.to_le_bytes()); // ORR.W R4, R4, #1
5939                bytes.extend_from_slice(&0x0401u16.to_le_bytes());
5940
5941                // Decrement and loop
5942                bytes.extend_from_slice(&0xF1B8u16.to_le_bytes()); // SUB.W R8, R8, #1
5943                bytes.extend_from_slice(&0x0801u16.to_le_bytes());
5944
5945                let branch_offset_bytes = bytes.len() - loop_start + 4;
5946                let offset_halfwords = -((branch_offset_bytes / 2) as i16);
5947                let bne_encoding = 0xD100u16 | ((offset_halfwords as u16) & 0xFF);
5948                bytes.extend_from_slice(&bne_encoding.to_le_bytes());
5949
5950                // Move REMAINDER to R0:R1 (difference from I64DivU)
5951                bytes.extend_from_slice(&0x4630u16.to_le_bytes()); // MOV R0, R6
5952                bytes.extend_from_slice(&0x4639u16.to_le_bytes()); // MOV R1, R7
5953
5954                // POP {R4-R8} - restore scratch registers (NO PC — inline code continues)
5955                bytes.extend_from_slice(&0xE8BDu16.to_le_bytes());
5956                bytes.extend_from_slice(&0x01F0u16.to_le_bytes());
5957
5958                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
5959                Ok(bytes)
5960            }
5961
5962            // I64RemS: 64-bit signed remainder
5963            // Remainder sign follows dividend sign (not quotient rule)
5964            // Core: R0:R1 = dividend (signed), R2:R3 = divisor (signed)
5965            //   ->  R0:R1 = remainder (signed, same sign as dividend)
5966            // #610: fixed-ABI wrapper + zero-divisor trap (see I64DivU).
5967            ArmOp::I64RemS {
5968                rdlo,
5969                rdhi,
5970                rnlo,
5971                rnhi,
5972                rmlo,
5973                rmhi,
5974                elide_zero_guard,
5975            } => {
5976                let mut bytes = Vec::new();
5977                emit_i64_fixed_abi_entry(&mut bytes, &[rnlo, rnhi, rmlo, rmhi]);
5978                if !elide_zero_guard {
5979                    emit_i64_divisor_zero_trap(&mut bytes);
5980                }
5981
5982                // PUSH {R4-R11} - save scratch registers (NO LR — inline code)
5983                bytes.extend_from_slice(&0xE92Du16.to_le_bytes());
5984                bytes.extend_from_slice(&0x0FF0u16.to_le_bytes());
5985
5986                // Save dividend sign in R9 (remainder sign = dividend sign)
5987                // MOV R9, R1 (just need the sign bit)
5988                bytes.extend_from_slice(&0x4689u16.to_le_bytes()); // MOV R9, R1
5989
5990                // If dividend negative (R1 MSB set), negate it
5991                bytes.extend_from_slice(&0x4209u16.to_le_bytes()); // TST R1, R1
5992                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
5993
5994                // Negate R0:R1
5995                bytes.extend_from_slice(&0x43C0u16.to_le_bytes()); // MVNS R0, R0
5996                bytes.extend_from_slice(&0x43C9u16.to_le_bytes()); // MVNS R1, R1
5997                bytes.extend_from_slice(&0x1C40u16.to_le_bytes()); // ADDS R0, R0, #1
5998                bytes.extend_from_slice(&0xF141u16.to_le_bytes()); // ADC.W R1, R1, #0
5999                bytes.extend_from_slice(&0x0100u16.to_le_bytes());
6000
6001                // If divisor negative (R3 MSB set), negate it
6002                bytes.extend_from_slice(&0x421Bu16.to_le_bytes()); // TST R3, R3
6003                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
6004
6005                // Negate R2:R3
6006                bytes.extend_from_slice(&0x43D2u16.to_le_bytes()); // MVNS R2, R2
6007                bytes.extend_from_slice(&0x43DBu16.to_le_bytes()); // MVNS R3, R3
6008                bytes.extend_from_slice(&0x1C52u16.to_le_bytes()); // ADDS R2, R2, #1
6009                bytes.extend_from_slice(&0xF143u16.to_le_bytes()); // ADC.W R3, R3, #0
6010                bytes.extend_from_slice(&0x0300u16.to_le_bytes());
6011
6012                // === Unsigned division algorithm ===
6013                // Initialize quotient (R4:R5) = 0
6014                bytes.extend_from_slice(&0x2400u16.to_le_bytes());
6015                bytes.extend_from_slice(&0x2500u16.to_le_bytes());
6016                // Initialize remainder (R6:R7) = 0
6017                bytes.extend_from_slice(&0x2600u16.to_le_bytes());
6018                bytes.extend_from_slice(&0x2700u16.to_le_bytes());
6019                // Initialize loop counter R8 = 64
6020                bytes.extend_from_slice(&0xF04Fu16.to_le_bytes());
6021                bytes.extend_from_slice(&0x0840u16.to_le_bytes());
6022
6023                let loop_start = bytes.len();
6024
6025                // Shift quotient left
6026                bytes.extend_from_slice(&0x006Du16.to_le_bytes()); // LSLS R5, R5, #1
6027                bytes.extend_from_slice(&0xEA45u16.to_le_bytes()); // ORR.W R5, R5, R4, LSR #31
6028                bytes.extend_from_slice(&0x75D4u16.to_le_bytes());
6029                bytes.extend_from_slice(&0x0064u16.to_le_bytes()); // LSLS R4, R4, #1
6030
6031                // Shift remainder left, OR in MSB of dividend
6032                bytes.extend_from_slice(&0x007Fu16.to_le_bytes()); // LSLS R7, R7, #1
6033                bytes.extend_from_slice(&0xEA47u16.to_le_bytes()); // ORR.W R7, R7, R6, LSR #31
6034                bytes.extend_from_slice(&0x77D6u16.to_le_bytes());
6035                bytes.extend_from_slice(&0x0076u16.to_le_bytes()); // LSLS R6, R6, #1
6036                bytes.extend_from_slice(&0xEA46u16.to_le_bytes()); // ORR.W R6, R6, R1, LSR #31
6037                bytes.extend_from_slice(&0x76D1u16.to_le_bytes());
6038
6039                // Shift dividend left
6040                bytes.extend_from_slice(&0x0049u16.to_le_bytes()); // LSLS R1, R1, #1
6041                bytes.extend_from_slice(&0xEA41u16.to_le_bytes()); // ORR.W R1, R1, R0, LSR #31
6042                bytes.extend_from_slice(&0x71D0u16.to_le_bytes());
6043                bytes.extend_from_slice(&0x0040u16.to_le_bytes()); // LSLS R0, R0, #1
6044
6045                // Compare and conditionally subtract
6046                bytes.extend_from_slice(&0x429Fu16.to_le_bytes()); // CMP R7, R3
6047                bytes.extend_from_slice(&0xD802u16.to_le_bytes()); // BHI +4
6048                bytes.extend_from_slice(&0xD306u16.to_le_bytes()); // BCC +12
6049                bytes.extend_from_slice(&0x4296u16.to_le_bytes()); // CMP R6, R2
6050                bytes.extend_from_slice(&0xD304u16.to_le_bytes()); // BCC +4 halfwords
6051
6052                // Subtract and set quotient bit
6053                bytes.extend_from_slice(&0x1AB6u16.to_le_bytes()); // SUBS R6, R6, R2
6054                bytes.extend_from_slice(&0xEB67u16.to_le_bytes()); // SBC.W R7, R7, R3
6055                bytes.extend_from_slice(&0x0703u16.to_le_bytes());
6056                bytes.extend_from_slice(&0xF044u16.to_le_bytes()); // ORR.W R4, R4, #1
6057                bytes.extend_from_slice(&0x0401u16.to_le_bytes());
6058
6059                // Decrement and loop
6060                bytes.extend_from_slice(&0xF1B8u16.to_le_bytes()); // SUB.W R8, R8, #1
6061                bytes.extend_from_slice(&0x0801u16.to_le_bytes());
6062
6063                let branch_offset_bytes = bytes.len() - loop_start + 4;
6064                let offset_halfwords = -((branch_offset_bytes / 2) as i16);
6065                let bne_encoding = 0xD100u16 | ((offset_halfwords as u16) & 0xFF);
6066                bytes.extend_from_slice(&bne_encoding.to_le_bytes());
6067
6068                // Move remainder to R0:R1
6069                bytes.extend_from_slice(&0x4630u16.to_le_bytes()); // MOV R0, R6
6070                bytes.extend_from_slice(&0x4639u16.to_le_bytes()); // MOV R1, R7
6071
6072                // If original dividend was negative (R9 MSB set), negate remainder
6073                bytes.extend_from_slice(&0xF1B9u16.to_le_bytes()); // TST.W R9, R9
6074                bytes.extend_from_slice(&0x0F00u16.to_le_bytes());
6075                bytes.extend_from_slice(&0xD504u16.to_le_bytes()); // BPL +8
6076
6077                // Negate result R0:R1
6078                bytes.extend_from_slice(&0x43C0u16.to_le_bytes()); // MVNS R0, R0
6079                bytes.extend_from_slice(&0x43C9u16.to_le_bytes()); // MVNS R1, R1
6080                bytes.extend_from_slice(&0x1C40u16.to_le_bytes()); // ADDS R0, R0, #1
6081                bytes.extend_from_slice(&0xF141u16.to_le_bytes()); // ADC.W R1, R1, #0
6082                bytes.extend_from_slice(&0x0100u16.to_le_bytes());
6083
6084                // POP {R4-R11} - restore scratch registers (NO PC — inline code continues)
6085                bytes.extend_from_slice(&0xE8BDu16.to_le_bytes());
6086                bytes.extend_from_slice(&0x0FF0u16.to_le_bytes());
6087
6088                emit_i64_fixed_abi_exit(&mut bytes, rdlo, rdhi)?;
6089                Ok(bytes)
6090            }
6091
6092            // === F32 VFP single-precision Thumb-2 encodings ===
6093            // VFP instruction words are identical to ARM32; emit as two LE halfwords.
6094            ArmOp::F32Add { sd, sn, sm } => {
6095                Ok(vfp_to_thumb_bytes(encode_vfp_3reg(0xEE300A00, sd, sn, sm)?))
6096            }
6097            ArmOp::F32Sub { sd, sn, sm } => {
6098                Ok(vfp_to_thumb_bytes(encode_vfp_3reg(0xEE300A40, sd, sn, sm)?))
6099            }
6100            ArmOp::F32Mul { sd, sn, sm } => {
6101                Ok(vfp_to_thumb_bytes(encode_vfp_3reg(0xEE200A00, sd, sn, sm)?))
6102            }
6103            ArmOp::F32Div { sd, sn, sm } => {
6104                Ok(vfp_to_thumb_bytes(encode_vfp_3reg(0xEE800A00, sd, sn, sm)?))
6105            }
6106            ArmOp::F32Abs { sd, sm } => {
6107                Ok(vfp_to_thumb_bytes(encode_vfp_2reg(0xEEB00AC0, sd, sm)?))
6108            }
6109            ArmOp::F32Neg { sd, sm } => {
6110                Ok(vfp_to_thumb_bytes(encode_vfp_2reg(0xEEB10A40, sd, sm)?))
6111            }
6112            ArmOp::F32Sqrt { sd, sm } => {
6113                Ok(vfp_to_thumb_bytes(encode_vfp_2reg(0xEEB10AC0, sd, sm)?))
6114            }
6115
6116            // f32 pseudo-ops — multi-instruction sequences
6117            // FPSCR RMode: 00=nearest, 01=+inf(ceil), 10=-inf(floor), 11=zero(trunc)
6118            ArmOp::F32Ceil { sd, sm } => self.encode_thumb_f32_rounding(sd, sm, 0b01),
6119            ArmOp::F32Floor { sd, sm } => self.encode_thumb_f32_rounding(sd, sm, 0b10),
6120            ArmOp::F32Trunc { sd, sm } => self.encode_thumb_f32_rounding(sd, sm, 0b11),
6121            ArmOp::F32Nearest { sd, sm } => self.encode_thumb_f32_rounding(sd, sm, 0b00),
6122            ArmOp::F32Min { sd, sn, sm } => self.encode_thumb_f32_minmax(sd, sn, sm, true),
6123            ArmOp::F32Max { sd, sn, sm } => self.encode_thumb_f32_minmax(sd, sn, sm, false),
6124            ArmOp::F32Copysign { sd, sn, sm } => self.encode_thumb_f32_copysign(sd, sn, sm),
6125
6126            // f32 comparisons — VCMP + VMRS + MOV #0 + IT + MOV #1
6127            ArmOp::F32Eq { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0x0),
6128            ArmOp::F32Ne { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0x1),
6129            ArmOp::F32Lt { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0x4),
6130            ArmOp::F32Le { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0x9),
6131            ArmOp::F32Gt { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0xC),
6132            ArmOp::F32Ge { rd, sn, sm } => self.encode_thumb_f32_compare(rd, sn, sm, 0xA),
6133
6134            ArmOp::F32Const { sd, value } => self.encode_thumb_f32_const(sd, *value),
6135
6136            ArmOp::F32Load { sd, addr } => {
6137                Ok(vfp_to_thumb_bytes(encode_vfp_ldst(0xED900A00, sd, addr)?))
6138            }
6139            ArmOp::F32Store { sd, addr } => {
6140                Ok(vfp_to_thumb_bytes(encode_vfp_ldst(0xED800A00, sd, addr)?))
6141            }
6142
6143            ArmOp::F32ConvertI32S { sd, rm } => self.encode_thumb_f32_convert_i32(sd, rm, true),
6144            ArmOp::F32ConvertI32U { sd, rm } => self.encode_thumb_f32_convert_i32(sd, rm, false),
6145            ArmOp::F32ConvertI64S { .. } | ArmOp::F32ConvertI64U { .. } => {
6146                Err(synth_core::Error::synthesis(
6147                    "F32 i64 conversion not supported (requires register pairs on 32-bit ARM)",
6148                ))
6149            }
6150            ArmOp::F32ReinterpretI32 { sd, rm } => {
6151                Ok(vfp_to_thumb_bytes(encode_vmov_core_sreg(true, sd, rm)?))
6152            }
6153            ArmOp::I32ReinterpretF32 { rd, sm } => {
6154                Ok(vfp_to_thumb_bytes(encode_vmov_core_sreg(false, sm, rd)?))
6155            }
6156            ArmOp::I32TruncF32S { rd, sm } => self.encode_thumb_i32_trunc_f32(rd, sm, true),
6157            ArmOp::I32TruncF32U { rd, sm } => self.encode_thumb_i32_trunc_f32(rd, sm, false),
6158
6159            // === F64 VFP double-precision Thumb-2 encodings ===
6160            // VFP instruction words are identical to ARM32; emit as two LE halfwords.
6161            ArmOp::F64Add { dd, dn, dm } => Ok(vfp_to_thumb_bytes(encode_vfp_3reg_f64(
6162                0xEE300B00, dd, dn, dm,
6163            )?)),
6164            ArmOp::F64Sub { dd, dn, dm } => Ok(vfp_to_thumb_bytes(encode_vfp_3reg_f64(
6165                0xEE300B40, dd, dn, dm,
6166            )?)),
6167            ArmOp::F64Mul { dd, dn, dm } => Ok(vfp_to_thumb_bytes(encode_vfp_3reg_f64(
6168                0xEE200B00, dd, dn, dm,
6169            )?)),
6170            ArmOp::F64Div { dd, dn, dm } => Ok(vfp_to_thumb_bytes(encode_vfp_3reg_f64(
6171                0xEE800B00, dd, dn, dm,
6172            )?)),
6173            ArmOp::F64Abs { dd, dm } => {
6174                Ok(vfp_to_thumb_bytes(encode_vfp_2reg_f64(0xEEB00BC0, dd, dm)?))
6175            }
6176            ArmOp::F64Neg { dd, dm } => {
6177                Ok(vfp_to_thumb_bytes(encode_vfp_2reg_f64(0xEEB10B40, dd, dm)?))
6178            }
6179            ArmOp::F64Sqrt { dd, dm } => {
6180                Ok(vfp_to_thumb_bytes(encode_vfp_2reg_f64(0xEEB10BC0, dd, dm)?))
6181            }
6182
6183            // f64 pseudo-ops
6184            // FPSCR RMode: 00=nearest, 01=+inf(ceil), 10=-inf(floor), 11=zero(trunc)
6185            ArmOp::F64Ceil { dd, dm } => self.encode_thumb_f64_rounding(dd, dm, 0b01),
6186            ArmOp::F64Floor { dd, dm } => self.encode_thumb_f64_rounding(dd, dm, 0b10),
6187            ArmOp::F64Trunc { dd, dm } => self.encode_thumb_f64_rounding(dd, dm, 0b11),
6188            ArmOp::F64Nearest { dd, dm } => self.encode_thumb_f64_rounding(dd, dm, 0b00),
6189            ArmOp::F64Min { dd, dn, dm } => self.encode_thumb_f64_minmax(dd, dn, dm, true),
6190            ArmOp::F64Max { dd, dn, dm } => self.encode_thumb_f64_minmax(dd, dn, dm, false),
6191            ArmOp::F64Copysign { dd, dn, dm } => self.encode_thumb_f64_copysign(dd, dn, dm),
6192
6193            // f64 comparisons
6194            ArmOp::F64Eq { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0x0),
6195            ArmOp::F64Ne { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0x1),
6196            ArmOp::F64Lt { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0x4),
6197            ArmOp::F64Le { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0x9),
6198            ArmOp::F64Gt { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0xC),
6199            ArmOp::F64Ge { rd, dn, dm } => self.encode_thumb_f64_compare(rd, dn, dm, 0xA),
6200
6201            ArmOp::F64Const { dd, value } => self.encode_thumb_f64_const(dd, *value),
6202
6203            ArmOp::F64Load { dd, addr } => Ok(vfp_to_thumb_bytes(encode_vfp_ldst_f64(
6204                0xED900B00, dd, addr,
6205            )?)),
6206            ArmOp::F64Store { dd, addr } => Ok(vfp_to_thumb_bytes(encode_vfp_ldst_f64(
6207                0xED800B00, dd, addr,
6208            )?)),
6209
6210            ArmOp::F64ConvertI32S { dd, rm } => self.encode_thumb_f64_convert_i32(dd, rm, true),
6211            ArmOp::F64ConvertI32U { dd, rm } => self.encode_thumb_f64_convert_i32(dd, rm, false),
6212            ArmOp::F64ConvertI64S { .. } | ArmOp::F64ConvertI64U { .. } => {
6213                Err(synth_core::Error::synthesis(
6214                    "F64 i64 conversion not supported (requires register pairs on 32-bit ARM)",
6215                ))
6216            }
6217            ArmOp::F64PromoteF32 { dd, sm } => self.encode_thumb_f64_promote_f32(dd, sm),
6218            ArmOp::F64ReinterpretI64 { dd, rmlo, rmhi } => Ok(vfp_to_thumb_bytes(
6219                encode_vmov_core_dreg(true, dd, rmlo, rmhi)?,
6220            )),
6221            ArmOp::I64ReinterpretF64 { rdlo, rdhi, dm } => Ok(vfp_to_thumb_bytes(
6222                encode_vmov_core_dreg(false, dm, rdlo, rdhi)?,
6223            )),
6224            ArmOp::I64TruncF64S { .. } | ArmOp::I64TruncF64U { .. } => {
6225                Err(synth_core::Error::synthesis(
6226                    "i64 truncation from F64 not supported (requires i64 register pairs on 32-bit ARM)",
6227                ))
6228            }
6229            ArmOp::I32TruncF64S { rd, dm } => self.encode_thumb_i32_trunc_f64(rd, dm, true),
6230            ArmOp::I32TruncF64U { rd, dm } => self.encode_thumb_i32_trunc_f64(rd, dm, false),
6231
6232            // ===== i64 operations: encode as multi-instruction Thumb-2 sequences =====
6233
6234            // I64Add: ADDS rdlo, rnlo, rmlo; ADC.W rdhi, rnhi, rmhi
6235            ArmOp::I64Add {
6236                rdlo,
6237                rdhi,
6238                rnlo,
6239                rnhi,
6240                rmlo,
6241                rmhi,
6242            } => {
6243                let mut bytes = Vec::new();
6244                // ADDS rdlo, rnlo, rmlo (16-bit)
6245                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Adds {
6246                    rd: *rdlo,
6247                    rn: *rnlo,
6248                    op2: Operand2::Reg(*rmlo),
6249                })?);
6250                // ADC.W rdhi, rnhi, rmhi (32-bit)
6251                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Adc {
6252                    rd: *rdhi,
6253                    rn: *rnhi,
6254                    op2: Operand2::Reg(*rmhi),
6255                })?);
6256                Ok(bytes)
6257            }
6258
6259            // I64Sub: SUBS rdlo, rnlo, rmlo; SBC.W rdhi, rnhi, rmhi
6260            ArmOp::I64Sub {
6261                rdlo,
6262                rdhi,
6263                rnlo,
6264                rnhi,
6265                rmlo,
6266                rmhi,
6267            } => {
6268                let mut bytes = Vec::new();
6269                // SUBS rdlo, rnlo, rmlo (16-bit)
6270                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Subs {
6271                    rd: *rdlo,
6272                    rn: *rnlo,
6273                    op2: Operand2::Reg(*rmlo),
6274                })?);
6275                // SBC.W rdhi, rnhi, rmhi (32-bit)
6276                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Sbc {
6277                    rd: *rdhi,
6278                    rn: *rnhi,
6279                    op2: Operand2::Reg(*rmhi),
6280                })?);
6281                Ok(bytes)
6282            }
6283
6284            // I64And: AND rdlo, rnlo, rmlo; AND rdhi, rnhi, rmhi
6285            ArmOp::I64And {
6286                rdlo,
6287                rdhi,
6288                rnlo,
6289                rnhi,
6290                rmlo,
6291                rmhi,
6292            } => {
6293                let mut bytes = Vec::new();
6294                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::And {
6295                    rd: *rdlo,
6296                    rn: *rnlo,
6297                    op2: Operand2::Reg(*rmlo),
6298                })?);
6299                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::And {
6300                    rd: *rdhi,
6301                    rn: *rnhi,
6302                    op2: Operand2::Reg(*rmhi),
6303                })?);
6304                Ok(bytes)
6305            }
6306
6307            // I64Or: ORR rdlo, rnlo, rmlo; ORR rdhi, rnhi, rmhi
6308            ArmOp::I64Or {
6309                rdlo,
6310                rdhi,
6311                rnlo,
6312                rnhi,
6313                rmlo,
6314                rmhi,
6315            } => {
6316                let mut bytes = Vec::new();
6317                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Orr {
6318                    rd: *rdlo,
6319                    rn: *rnlo,
6320                    op2: Operand2::Reg(*rmlo),
6321                })?);
6322                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Orr {
6323                    rd: *rdhi,
6324                    rn: *rnhi,
6325                    op2: Operand2::Reg(*rmhi),
6326                })?);
6327                Ok(bytes)
6328            }
6329
6330            // I64Xor: EOR rdlo, rnlo, rmlo; EOR rdhi, rnhi, rmhi
6331            ArmOp::I64Xor {
6332                rdlo,
6333                rdhi,
6334                rnlo,
6335                rnhi,
6336                rmlo,
6337                rmhi,
6338            } => {
6339                let mut bytes = Vec::new();
6340                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Eor {
6341                    rd: *rdlo,
6342                    rn: *rnlo,
6343                    op2: Operand2::Reg(*rmlo),
6344                })?);
6345                bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Eor {
6346                    rd: *rdhi,
6347                    rn: *rnhi,
6348                    op2: Operand2::Reg(*rmhi),
6349                })?);
6350                Ok(bytes)
6351            }
6352
6353            // I64Eqz: ORR scratch, lo, hi; ITE EQ; MOV rd, #1; MOV rd, #0
6354            ArmOp::I64Eqz { rd, rnlo, rnhi } => self.encode_thumb(&ArmOp::I64SetCondZ {
6355                rd: *rd,
6356                rn_lo: *rnlo,
6357                rn_hi: *rnhi,
6358            }),
6359
6360            // I64 comparisons: delegate to I64SetCond
6361            ArmOp::I64Eq {
6362                rd,
6363                rnlo,
6364                rnhi,
6365                rmlo,
6366                rmhi,
6367            } => self.encode_thumb(&ArmOp::I64SetCond {
6368                rd: *rd,
6369                rn_lo: *rnlo,
6370                rn_hi: *rnhi,
6371                rm_lo: *rmlo,
6372                rm_hi: *rmhi,
6373                cond: synth_synthesis::Condition::EQ,
6374            }),
6375
6376            ArmOp::I64Ne {
6377                rd,
6378                rnlo,
6379                rnhi,
6380                rmlo,
6381                rmhi,
6382            } => self.encode_thumb(&ArmOp::I64SetCond {
6383                rd: *rd,
6384                rn_lo: *rnlo,
6385                rn_hi: *rnhi,
6386                rm_lo: *rmlo,
6387                rm_hi: *rmhi,
6388                cond: synth_synthesis::Condition::NE,
6389            }),
6390
6391            ArmOp::I64LtS {
6392                rd,
6393                rnlo,
6394                rnhi,
6395                rmlo,
6396                rmhi,
6397            } => self.encode_thumb(&ArmOp::I64SetCond {
6398                rd: *rd,
6399                rn_lo: *rnlo,
6400                rn_hi: *rnhi,
6401                rm_lo: *rmlo,
6402                rm_hi: *rmhi,
6403                cond: synth_synthesis::Condition::LT,
6404            }),
6405
6406            ArmOp::I64LtU {
6407                rd,
6408                rnlo,
6409                rnhi,
6410                rmlo,
6411                rmhi,
6412            } => self.encode_thumb(&ArmOp::I64SetCond {
6413                rd: *rd,
6414                rn_lo: *rnlo,
6415                rn_hi: *rnhi,
6416                rm_lo: *rmlo,
6417                rm_hi: *rmhi,
6418                cond: synth_synthesis::Condition::LO,
6419            }),
6420
6421            ArmOp::I64LeS {
6422                rd,
6423                rnlo,
6424                rnhi,
6425                rmlo,
6426                rmhi,
6427            } => self.encode_thumb(&ArmOp::I64SetCond {
6428                rd: *rd,
6429                rn_lo: *rnlo,
6430                rn_hi: *rnhi,
6431                rm_lo: *rmlo,
6432                rm_hi: *rmhi,
6433                cond: synth_synthesis::Condition::LE,
6434            }),
6435
6436            ArmOp::I64LeU {
6437                rd,
6438                rnlo,
6439                rnhi,
6440                rmlo,
6441                rmhi,
6442            } => self.encode_thumb(&ArmOp::I64SetCond {
6443                rd: *rd,
6444                rn_lo: *rnlo,
6445                rn_hi: *rnhi,
6446                rm_lo: *rmlo,
6447                rm_hi: *rmhi,
6448                cond: synth_synthesis::Condition::LS,
6449            }),
6450
6451            ArmOp::I64GtS {
6452                rd,
6453                rnlo,
6454                rnhi,
6455                rmlo,
6456                rmhi,
6457            } => self.encode_thumb(&ArmOp::I64SetCond {
6458                rd: *rd,
6459                rn_lo: *rnlo,
6460                rn_hi: *rnhi,
6461                rm_lo: *rmlo,
6462                rm_hi: *rmhi,
6463                cond: synth_synthesis::Condition::GT,
6464            }),
6465
6466            ArmOp::I64GtU {
6467                rd,
6468                rnlo,
6469                rnhi,
6470                rmlo,
6471                rmhi,
6472            } => self.encode_thumb(&ArmOp::I64SetCond {
6473                rd: *rd,
6474                rn_lo: *rnlo,
6475                rn_hi: *rnhi,
6476                rm_lo: *rmlo,
6477                rm_hi: *rmhi,
6478                cond: synth_synthesis::Condition::HI,
6479            }),
6480
6481            ArmOp::I64GeS {
6482                rd,
6483                rnlo,
6484                rnhi,
6485                rmlo,
6486                rmhi,
6487            } => self.encode_thumb(&ArmOp::I64SetCond {
6488                rd: *rd,
6489                rn_lo: *rnlo,
6490                rn_hi: *rnhi,
6491                rm_lo: *rmlo,
6492                rm_hi: *rmhi,
6493                cond: synth_synthesis::Condition::GE,
6494            }),
6495
6496            ArmOp::I64GeU {
6497                rd,
6498                rnlo,
6499                rnhi,
6500                rmlo,
6501                rmhi,
6502            } => self.encode_thumb(&ArmOp::I64SetCond {
6503                rd: *rd,
6504                rn_lo: *rnlo,
6505                rn_hi: *rnhi,
6506                rm_lo: *rmlo,
6507                rm_hi: *rmhi,
6508                cond: synth_synthesis::Condition::HS,
6509            }),
6510
6511            // I64Const: MOVW rdlo, lo16; MOVT rdlo, hi16; MOVW rdhi, lo16_hi; MOVT rdhi, hi16_hi
6512            ArmOp::I64Const { rdlo, rdhi, value } => {
6513                let lo32 = *value as u32;
6514                let hi32 = (*value >> 32) as u32;
6515                let mut bytes = Vec::new();
6516                // Load low 32 bits into rdlo
6517                bytes.extend_from_slice(
6518                    &self.encode_thumb32_movw_raw(reg_to_bits(rdlo), lo32 & 0xFFFF)?,
6519                );
6520                if lo32 > 0xFFFF {
6521                    bytes.extend_from_slice(
6522                        &self.encode_thumb32_movt_raw(reg_to_bits(rdlo), lo32 >> 16)?,
6523                    );
6524                }
6525                // Load high 32 bits into rdhi
6526                bytes.extend_from_slice(
6527                    &self.encode_thumb32_movw_raw(reg_to_bits(rdhi), hi32 & 0xFFFF)?,
6528                );
6529                if hi32 > 0xFFFF {
6530                    bytes.extend_from_slice(
6531                        &self.encode_thumb32_movt_raw(reg_to_bits(rdhi), hi32 >> 16)?,
6532                    );
6533                }
6534                Ok(bytes)
6535            }
6536
6537            // I64Ldr: LDR rdlo, [base, offset]; LDR rdhi, [base, offset+4]
6538            ArmOp::I64Ldr { rdlo, rdhi, addr } => {
6539                let mut bytes = Vec::new();
6540                // #372/#382: a memory `i64.load` carries an index register
6541                // (`reg_imm(R11, addr_reg, offset)` = R11 + addr + offset). The
6542                // immediate `encode_thumb32_ldr` below uses only base+offset and
6543                // would SILENTLY DROP `offset_reg` — the #206 defect, here for
6544                // i64. `i64_effective_base` materializes the effective base into
6545                // `ip` (and, when `offset+4 > 0xFFF`, folds the offset in too so
6546                // the function is NOT skipped — #382), returning the residual
6547                // imm12 for the two halves. Frame i64 loads (no `offset_reg`, e.g.
6548                // a spilled local at `[SP, #off]`) keep the plain `[base,#off]`
6549                // form unchanged — so existing output is byte-identical.
6550                let (base, offset) = self.i64_effective_base(&mut bytes, addr)?;
6551                bytes.extend_from_slice(&self.encode_thumb32_ldr(rdlo, &base, offset)?);
6552                bytes.extend_from_slice(&self.encode_thumb32_ldr(
6553                    rdhi,
6554                    &base,
6555                    offset.wrapping_add(4),
6556                )?);
6557                Ok(bytes)
6558            }
6559
6560            // I64Str: STR rdlo, [base, offset]; STR rdhi, [base, offset+4]
6561            ArmOp::I64Str { rdlo, rdhi, addr } => {
6562                let mut bytes = Vec::new();
6563                // #372/#382: same index-materialization + large-offset fold as
6564                // I64Ldr (see above).
6565                let (base, offset) = self.i64_effective_base(&mut bytes, addr)?;
6566                bytes.extend_from_slice(&self.encode_thumb32_str(rdlo, &base, offset)?);
6567                bytes.extend_from_slice(&self.encode_thumb32_str(
6568                    rdhi,
6569                    &base,
6570                    offset.wrapping_add(4),
6571                )?);
6572                Ok(bytes)
6573            }
6574
6575            // I64ExtendI32S: MOV rdlo, rn; ASR rdhi, rdlo, #31 (sign-extend)
6576            ArmOp::I64ExtendI32S { rdlo, rdhi, rn } => {
6577                let mut bytes = Vec::new();
6578                if rdlo != rn {
6579                    // MOV rdlo, rn (16-bit)
6580                    bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Mov {
6581                        rd: *rdlo,
6582                        op2: Operand2::Reg(*rn),
6583                    })?);
6584                }
6585                // ASR rdhi, rdlo, #31 (sign-extend: fill high word with sign bit)
6586                bytes.extend_from_slice(
6587                    &self.encode_thumb32_shift(rdhi, rdlo, 31, 0b10)?, // ASR type
6588                );
6589                Ok(bytes)
6590            }
6591
6592            // I64ExtendI32U: MOV rdlo, rn; MOV rdhi, #0
6593            ArmOp::I64ExtendI32U { rdlo, rdhi, rn } => {
6594                let mut bytes = Vec::new();
6595                if rdlo != rn {
6596                    // MOV rdlo, rn
6597                    bytes.extend_from_slice(&self.encode_thumb(&ArmOp::Mov {
6598                        rd: *rdlo,
6599                        op2: Operand2::Reg(*rn),
6600                    })?);
6601                }
6602                // MOV rdhi, #0 (16-bit: MOVS Rd, #0)
6603                let rdhi_bits = reg_to_bits(rdhi) as u16;
6604                let instr: u16 = 0x2000 | (rdhi_bits << 8);
6605                bytes.extend_from_slice(&instr.to_le_bytes());
6606                Ok(bytes)
6607            }
6608
6609            // I32WrapI64: MOV rd, rnlo (just take low 32 bits)
6610            ArmOp::I32WrapI64 { rd, rnlo } => {
6611                if rd == rnlo {
6612                    // No-op: already in the right register
6613                    let instr: u16 = 0xBF00; // NOP
6614                    Ok(instr.to_le_bytes().to_vec())
6615                } else {
6616                    // MOV rd, rnlo
6617                    self.encode_thumb(&ArmOp::Mov {
6618                        rd: *rd,
6619                        op2: Operand2::Reg(*rnlo),
6620                    })
6621                }
6622            }
6623
6624            // ===== Helium MVE operations (Thumb-2 encoding) =====
6625            ArmOp::MveLoad { qd, addr } => Ok(vfp_to_thumb_bytes(encode_mve_vldrw(qd, addr))),
6626            ArmOp::MveStore { qd, addr } => Ok(vfp_to_thumb_bytes(encode_mve_vstrw(qd, addr))),
6627            ArmOp::MveConst { qd, bytes } => self.encode_thumb_mve_const(qd, bytes),
6628            ArmOp::MveAnd { qd, qn, qm } => Ok(vfp_to_thumb_bytes(encode_mve_3reg_bitwise(
6629                0xEF000150, qd, qn, qm,
6630            ))),
6631            ArmOp::MveOrr { qd, qn, qm } => Ok(vfp_to_thumb_bytes(encode_mve_3reg_bitwise(
6632                0xEF200150, qd, qn, qm,
6633            ))),
6634            ArmOp::MveEor { qd, qn, qm } => Ok(vfp_to_thumb_bytes(encode_mve_3reg_bitwise(
6635                0xFF000150, qd, qn, qm,
6636            ))),
6637            ArmOp::MveMvn { qd, qm } => {
6638                // VMVN Qd, Qm: 0xFFB005C0 | Qd<<12 | Qm
6639                let qd_enc = qreg_to_num(qd);
6640                let qm_enc = qreg_to_num(qm);
6641                let instr: u32 = 0xFFB005C0 | ((qd_enc * 2) << 12) | (qm_enc * 2);
6642                Ok(vfp_to_thumb_bytes(instr))
6643            }
6644            ArmOp::MveBic { qd, qn, qm } => Ok(vfp_to_thumb_bytes(encode_mve_3reg_bitwise(
6645                0xEF100150, qd, qn, qm,
6646            ))),
6647            ArmOp::MveAddI { qd, qn, qm, size } => {
6648                let sz = mve_size_bits(size);
6649                let base: u32 = 0xEF000840 | (sz << 20);
6650                Ok(vfp_to_thumb_bytes(encode_mve_3reg(base, qd, qn, qm)))
6651            }
6652            ArmOp::MveSubI { qd, qn, qm, size } => {
6653                let sz = mve_size_bits(size);
6654                let base: u32 = 0xFF000840 | (sz << 20);
6655                Ok(vfp_to_thumb_bytes(encode_mve_3reg(base, qd, qn, qm)))
6656            }
6657            ArmOp::MveMulI { qd, qn, qm, size } => {
6658                let sz = mve_size_bits(size);
6659                let base: u32 = 0xEF000950 | (sz << 20);
6660                Ok(vfp_to_thumb_bytes(encode_mve_3reg(base, qd, qn, qm)))
6661            }
6662            ArmOp::MveNegI { qd, qm, size } => {
6663                let sz = mve_size_bits(size);
6664                // VNEG.Sx Qd, Qm
6665                let qd_enc = qreg_to_num(qd);
6666                let qm_enc = qreg_to_num(qm);
6667                let base: u32 = 0xFFB103C0 | (sz << 18);
6668                let instr = base | ((qd_enc * 2) << 12) | (qm_enc * 2);
6669                Ok(vfp_to_thumb_bytes(instr))
6670            }
6671            ArmOp::MveDup { qd, rn, size } => {
6672                let sz = mve_size_bits(size);
6673                let qd_enc = qreg_to_num(qd);
6674                let rn_bits = reg_to_bits(rn);
6675                // VDUP.sz Qd, Rn: EEA0 0B10 variant
6676                // size encoding: 00=32, 01=16, 10=8
6677                let be = match sz {
6678                    0 => 0b00u32, // 8-bit
6679                    1 => 0b01,    // 16-bit
6680                    _ => 0b00,    // 32-bit (default)
6681                };
6682                let instr: u32 = 0xEEA00B10 | ((qd_enc * 2) << 16) | (rn_bits << 12) | (be << 5);
6683                Ok(vfp_to_thumb_bytes(instr))
6684            }
6685            ArmOp::MveExtractLane { rd, qn, lane, size } => {
6686                let qn_enc = qreg_to_num(qn);
6687                let rd_bits = reg_to_bits(rd);
6688                // VMOV.sz Rd, Dn[x] — extract from Q-register lane
6689                // For 32-bit: VMOV Rd, Dn — where Dn is the appropriate D-register
6690                let d_reg = qn_enc * 2 + ((*lane as u32) >> 1);
6691                let lane_in_d = (*lane as u32) & 1;
6692                let _sz = mve_size_bits(size);
6693                // VMOV Rd, Dn[x]: EE10 0B10 for 32-bit
6694                let instr: u32 = 0xEE100B10 | (d_reg << 16) | (rd_bits << 12) | (lane_in_d << 21);
6695                Ok(vfp_to_thumb_bytes(instr))
6696            }
6697            ArmOp::MveInsertLane { qd, rn, lane, size } => {
6698                let qd_enc = qreg_to_num(qd);
6699                let rn_bits = reg_to_bits(rn);
6700                let d_reg = qd_enc * 2 + ((*lane as u32) >> 1);
6701                let lane_in_d = (*lane as u32) & 1;
6702                let _sz = mve_size_bits(size);
6703                // VMOV Dn[x], Rn: EE00 0B10 for 32-bit
6704                let instr: u32 = 0xEE000B10 | (d_reg << 16) | (rn_bits << 12) | (lane_in_d << 21);
6705                Ok(vfp_to_thumb_bytes(instr))
6706            }
6707
6708            // MVE float comparisons — emit VCMP + VPSEL sequence (simplified: just VCMP)
6709            ArmOp::MveCmpEqI { qd, qn, qm, size }
6710            | ArmOp::MveCmpNeI { qd, qn, qm, size }
6711            | ArmOp::MveCmpLtS { qd, qn, qm, size }
6712            | ArmOp::MveCmpLtU { qd, qn, qm, size }
6713            | ArmOp::MveCmpGtS { qd, qn, qm, size }
6714            | ArmOp::MveCmpGtU { qd, qn, qm, size }
6715            | ArmOp::MveCmpLeS { qd, qn, qm, size }
6716            | ArmOp::MveCmpLeU { qd, qn, qm, size }
6717            | ArmOp::MveCmpGeS { qd, qn, qm, size }
6718            | ArmOp::MveCmpGeU { qd, qn, qm, size } => {
6719                // Encode as VADD (placeholder encoding — real implementation
6720                // would use VCMP + VPSEL pair)
6721                let sz = mve_size_bits(size);
6722                let base: u32 = 0xEF000840 | (sz << 20);
6723                Ok(vfp_to_thumb_bytes(encode_mve_3reg(base, qd, qn, qm)))
6724            }
6725
6726            // f32x4 MVE arithmetic
6727            ArmOp::MveAddF32 { qd, qn, qm } => {
6728                // VADD.F32 Qd, Qn, Qm (MVE): 0xEF000D40
6729                Ok(vfp_to_thumb_bytes(encode_mve_3reg(0xEF000D40, qd, qn, qm)))
6730            }
6731            ArmOp::MveSubF32 { qd, qn, qm } => {
6732                // VSUB.F32 Qd, Qn, Qm (MVE): 0xEF200D40
6733                Ok(vfp_to_thumb_bytes(encode_mve_3reg(0xEF200D40, qd, qn, qm)))
6734            }
6735            ArmOp::MveMulF32 { qd, qn, qm } => {
6736                // VMUL.F32 Qd, Qn, Qm (MVE): 0xFF000D50
6737                Ok(vfp_to_thumb_bytes(encode_mve_3reg(0xFF000D50, qd, qn, qm)))
6738            }
6739            ArmOp::MveNegF32 { qd, qm } => {
6740                let qd_enc = qreg_to_num(qd);
6741                let qm_enc = qreg_to_num(qm);
6742                // VNEG.F32 Qd, Qm: FFB907C0
6743                let instr: u32 = 0xFFB907C0 | ((qd_enc * 2) << 12) | (qm_enc * 2);
6744                Ok(vfp_to_thumb_bytes(instr))
6745            }
6746            ArmOp::MveAbsF32 { qd, qm } => {
6747                let qd_enc = qreg_to_num(qd);
6748                let qm_enc = qreg_to_num(qm);
6749                // VABS.F32 Qd, Qm: FFB90740
6750                let instr: u32 = 0xFFB90740 | ((qd_enc * 2) << 12) | (qm_enc * 2);
6751                Ok(vfp_to_thumb_bytes(instr))
6752            }
6753            ArmOp::MveCmpEqF32 { qd, qn, qm }
6754            | ArmOp::MveCmpNeF32 { qd, qn, qm }
6755            | ArmOp::MveCmpLtF32 { qd, qn, qm }
6756            | ArmOp::MveCmpLeF32 { qd, qn, qm }
6757            | ArmOp::MveCmpGtF32 { qd, qn, qm }
6758            | ArmOp::MveCmpGeF32 { qd, qn, qm } => {
6759                // Placeholder: encode as VADD.F32 (real impl needs VCMP.F32 + VPSEL)
6760                Ok(vfp_to_thumb_bytes(encode_mve_3reg(0xEF000D40, qd, qn, qm)))
6761            }
6762            ArmOp::MveDupF32 { qd, rn } => {
6763                let qd_enc = qreg_to_num(qd);
6764                let rn_bits = reg_to_bits(rn);
6765                // VDUP.32 Qd, Rn (same encoding as integer VDUP.32)
6766                let instr: u32 = 0xEEA00B10 | ((qd_enc * 2) << 16) | (rn_bits << 12);
6767                Ok(vfp_to_thumb_bytes(instr))
6768            }
6769            ArmOp::MveExtractLaneF32 { rd, qn, lane } => {
6770                let qn_enc = qreg_to_num(qn);
6771                let rd_bits = reg_to_bits(rd);
6772                // VMOV Rd, Sn where Sn = Q*4 + lane
6773                let s_num = qn_enc * 4 + (*lane as u32);
6774                let (vn, n) = encode_sreg(s_num);
6775                let instr: u32 = 0xEE100A10 | (vn << 16) | (rd_bits << 12) | (n << 7);
6776                Ok(vfp_to_thumb_bytes(instr))
6777            }
6778            ArmOp::MveReplaceLaneF32 { qd, rn, lane } => {
6779                let qd_enc = qreg_to_num(qd);
6780                let rn_bits = reg_to_bits(rn);
6781                // VMOV Sn, Rn where Sn = Q*4 + lane
6782                let s_num = qd_enc * 4 + (*lane as u32);
6783                let (vn, n) = encode_sreg(s_num);
6784                let instr: u32 = 0xEE000A10 | (vn << 16) | (rn_bits << 12) | (n << 7);
6785                Ok(vfp_to_thumb_bytes(instr))
6786            }
6787            ArmOp::MveDivF32 { qd, qn, qm } => {
6788                // Lane-wise: extract 4 S-regs, VDIV, insert back
6789                self.encode_thumb_mve_lane_wise_f32_binop(qd, qn, qm, 0xEE800A00)
6790            }
6791            ArmOp::MveSqrtF32 { qd, qm } => {
6792                // Lane-wise: extract 4 S-regs, VSQRT, insert back
6793                self.encode_thumb_mve_lane_wise_f32_sqrt(qd, qm)
6794            }
6795
6796            // Catch-all for any remaining ops
6797            _ => {
6798                let instr: u16 = 0xBF00; // NOP
6799                Ok(instr.to_le_bytes().to_vec())
6800            }
6801        }
6802    }
6803
6804    // === Thumb-2 VFP multi-instruction helpers ===
6805
6806    /// Encode F32 comparison as Thumb-2: VCMP.F32 + VMRS + MOVS rd,#0 + IT + MOV rd,#1
6807    fn encode_thumb_f32_compare(
6808        &self,
6809        rd: &Reg,
6810        sn: &VfpReg,
6811        sm: &VfpReg,
6812        cond_code: u32,
6813    ) -> Result<Vec<u8>> {
6814        let mut bytes = Vec::new();
6815        let rd_bits = reg_to_bits(rd);
6816
6817        // #709 (bug found under #708/#709): the `MOVS Rd,#0` below is a
6818        // FLAG-SETTING 16-bit move. Emitting it AFTER `VMRS APSR_nzcv, FPSCR`
6819        // (as the original code did) clobbered the N/Z/C/V flags the VMRS just
6820        // transferred from the VFP compare, so the following `IT<cond>` read
6821        // stale flags and every f32 comparison silently returned 0 (verified:
6822        // `flt(1.0,2.0)` → 0 on Cortex-M4F). The 619 harness never caught it
6823        // because it deliberately skipped compare EXECUTION on a false premise
6824        // (unicorn DOES model VMRS→APSR). Fix: materialize the `#0` FIRST, then
6825        // VCMP+VMRS set the flags the `IT` consumes. Instruction sizes are
6826        // unchanged (pure reorder), so the estimator↔encoder oracle (#511) is
6827        // untouched — only the byte ORDER differs.
6828
6829        // MOVS Rd, #0 (16-bit): 0010 0 Rd(3) 0000 0000 — its flag side effect
6830        // is immediately overwritten by the VMRS below.
6831        if rd_bits < 8 {
6832            let movs_zero: u16 = 0x2000 | ((rd_bits as u16) << 8);
6833            bytes.extend_from_slice(&movs_zero.to_le_bytes());
6834        } else {
6835            // MOV.W Rd, #0 (32-bit Thumb-2)
6836            let hw1: u16 = 0xF04F;
6837            let hw2: u16 = (rd_bits as u16) << 8;
6838            bytes.extend_from_slice(&hw1.to_le_bytes());
6839            bytes.extend_from_slice(&hw2.to_le_bytes());
6840        }
6841
6842        // VCMP.F32 Sn, Sm
6843        let sn_num = vfp_sreg_to_num(sn)?;
6844        let sm_num = vfp_sreg_to_num(sm)?;
6845        let (vd, d) = encode_sreg(sn_num);
6846        let (vm, m) = encode_sreg(sm_num);
6847        let vcmp = 0xEEB40A40 | (d << 22) | (vd << 12) | (m << 5) | vm;
6848        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcmp));
6849
6850        // VMRS APSR_nzcv, FPSCR: 0xEEF1FA10 (sets the flags IT consumes)
6851        bytes.extend_from_slice(&vfp_to_thumb_bytes(0xEEF1FA10));
6852
6853        // IT<cond> — If-Then for conditional MOV
6854        // IT encoding: 1011 1111 cond(4) mask(4)
6855        // mask = 0x8 for single "then" (IT)
6856        let it: u16 = 0xBF00 | ((cond_code as u16) << 4) | 0x8;
6857        bytes.extend_from_slice(&it.to_le_bytes());
6858
6859        // MOV Rd, #1 (16-bit, conditional due to IT): 0010 0 Rd(3) 0000 0001
6860        if rd_bits < 8 {
6861            let mov_one: u16 = 0x2001 | ((rd_bits as u16) << 8);
6862            bytes.extend_from_slice(&mov_one.to_le_bytes());
6863        } else {
6864            // MOV.W Rd, #1 (32-bit)
6865            let hw1: u16 = 0xF04F;
6866            let hw2: u16 = ((rd_bits as u16) << 8) | 0x01;
6867            bytes.extend_from_slice(&hw1.to_le_bytes());
6868            bytes.extend_from_slice(&hw2.to_le_bytes());
6869        }
6870
6871        Ok(bytes)
6872    }
6873
6874    /// Encode F32 constant load as Thumb-2: MOVW + MOVT + VMOV
6875    fn encode_thumb_f32_const(&self, sd: &VfpReg, value: f32) -> Result<Vec<u8>> {
6876        let mut bytes = Vec::new();
6877        let bits = value.to_bits();
6878        let rt: u32 = 12; // R12/IP as temp
6879
6880        // MOVW R12, #lo16
6881        // Thumb-2 MOVW: 11110 i 10 0100 imm4 | 0 imm3 Rd imm8
6882        let lo16 = bits & 0xFFFF;
6883        let imm4 = (lo16 >> 12) & 0xF;
6884        let i_bit = (lo16 >> 11) & 1;
6885        let imm3 = (lo16 >> 8) & 0x7;
6886        let imm8 = lo16 & 0xFF;
6887        let hw1: u16 = (0xF240 | (i_bit << 10) | imm4) as u16;
6888        let hw2: u16 = ((imm3 << 12) | (rt << 8) | imm8) as u16;
6889        bytes.extend_from_slice(&hw1.to_le_bytes());
6890        bytes.extend_from_slice(&hw2.to_le_bytes());
6891
6892        // MOVT R12, #hi16
6893        let hi16 = (bits >> 16) & 0xFFFF;
6894        let imm4 = (hi16 >> 12) & 0xF;
6895        let i_bit = (hi16 >> 11) & 1;
6896        let imm3 = (hi16 >> 8) & 0x7;
6897        let imm8 = hi16 & 0xFF;
6898        let hw1: u16 = (0xF2C0 | (i_bit << 10) | imm4) as u16;
6899        let hw2: u16 = ((imm3 << 12) | (rt << 8) | imm8) as u16;
6900        bytes.extend_from_slice(&hw1.to_le_bytes());
6901        bytes.extend_from_slice(&hw2.to_le_bytes());
6902
6903        // VMOV Sd, R12
6904        let vmov = encode_vmov_core_sreg(true, sd, &Reg::R12)?;
6905        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
6906
6907        Ok(bytes)
6908    }
6909
6910    /// Encode VMOV + VCVT.F32.xS32 as Thumb-2
6911    fn encode_thumb_f32_convert_i32(&self, sd: &VfpReg, rm: &Reg, signed: bool) -> Result<Vec<u8>> {
6912        let mut bytes = Vec::new();
6913
6914        // VMOV Sd, Rm
6915        let vmov = encode_vmov_core_sreg(true, sd, rm)?;
6916        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
6917
6918        // VCVT.F32.S32/U32 Sd, Sd. Bit 7 (op) = 1 for signed (S32), 0 for
6919        // unsigned (U32): signed = 0xEEB80AC0, unsigned = 0xEEB80A40
6920        // (GI-FPU-002: previously swapped — see the ARM32 twin).
6921        let sd_num = vfp_sreg_to_num(sd)?;
6922        let (vd, d) = encode_sreg(sd_num);
6923        let (vm, m) = encode_sreg(sd_num);
6924        let base = if signed { 0xEEB80AC0 } else { 0xEEB80A40 };
6925        let vcvt = base | (d << 22) | (vd << 12) | (m << 5) | vm;
6926        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt));
6927
6928        Ok(bytes)
6929    }
6930
6931    /// Encode F32 rounding pseudo-op as Thumb-2 via VCVT to integer and back
6932    /// Encode F32 rounding as Thumb-2.
6933    /// `mode`: FPSCR RMode — 0b00=nearest, 0b01=+inf(ceil), 0b10=-inf(floor), 0b11=zero(trunc)
6934    ///
6935    /// For trunc: uses VCVTR.S32.F32 (always truncates).
6936    /// For ceil/floor/nearest: sets FPSCR rounding mode, uses VCVT.S32.F32 (non-R variant),
6937    /// then restores FPSCR.
6938    fn encode_thumb_f32_rounding(&self, sd: &VfpReg, sm: &VfpReg, mode: u8) -> Result<Vec<u8>> {
6939        let mut bytes = Vec::new();
6940        let sm_num = vfp_sreg_to_num(sm)?;
6941        let sd_num = vfp_sreg_to_num(sd)?;
6942        let (vd_s, d_s) = encode_sreg(sd_num);
6943        let (vm_s, m_s) = encode_sreg(sm_num);
6944
6945        if mode == 0b11 {
6946            // Trunc (toward zero): VCVTR.S32.F32 — bit[7]=1, always truncates
6947            let vcvt_to_int = 0xEEBD0AC0 | (d_s << 22) | (vd_s << 12) | (m_s << 5) | vm_s;
6948            bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt_to_int));
6949        } else {
6950            // ceil/floor/nearest: manipulate FPSCR rounding mode
6951            let rt: u32 = 12; // R12/IP as temp
6952
6953            // VMRS R12, FPSCR
6954            let vmrs = 0xEEF10A10 | (rt << 12);
6955            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmrs));
6956
6957            // BIC.W R12, R12, #(3 << 22) — clear RMode bits [23:22]
6958            // Thumb-2 modified immediate for 3<<22 = 0x00C00000:
6959            // BIC.W encoding: 11110 i 0 0001 S Rn | 0 imm3 Rd imm8
6960            // 0x00C00000 = 0x03 shifted left by 22 => Thumb mod-imm: i=0, imm3=0b101, imm8=0x03
6961            let bic_hw1: u16 = 0xF020 | ((rt as u16) & 0xF); // BIC, Rn=R12
6962            let bic_hw2: u16 = (0x05 << 12) | ((rt as u16) << 8) | 0x03;
6963            bytes.extend_from_slice(&bic_hw1.to_le_bytes());
6964            bytes.extend_from_slice(&bic_hw2.to_le_bytes());
6965
6966            // ORR.W R12, R12, #(mode << 22)
6967            if mode != 0 {
6968                let orr_hw1: u16 = 0xF040 | ((rt as u16) & 0xF); // ORR, Rn=R12
6969                let orr_hw2: u16 = (0x05 << 12) | ((rt as u16) << 8) | (mode as u16);
6970                bytes.extend_from_slice(&orr_hw1.to_le_bytes());
6971                bytes.extend_from_slice(&orr_hw2.to_le_bytes());
6972            }
6973
6974            // VMSR FPSCR, R12
6975            let vmsr = 0xEEE10A10 | (rt << 12);
6976            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmsr));
6977
6978            // VCVT.S32.F32 Sd, Sm — non-R variant (bit[7]=0), uses FPSCR rmode
6979            let vcvt_to_int = 0xEEBD0A40 | (d_s << 22) | (vd_s << 12) | (m_s << 5) | vm_s;
6980            bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt_to_int));
6981
6982            // Restore FPSCR: clear rmode bits back to nearest (default)
6983            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmrs));
6984            bytes.extend_from_slice(&bic_hw1.to_le_bytes());
6985            bytes.extend_from_slice(&bic_hw2.to_le_bytes());
6986            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmsr));
6987        }
6988
6989        // VCVT.F32.S32 Sd, Sd (convert integer result back to float)
6990        let (vd2, d2) = encode_sreg(sd_num);
6991        let vcvt_to_float = 0xEEB80A40 | (d2 << 22) | (vd2 << 12) | (d_s << 5) | vd_s;
6992        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt_to_float));
6993
6994        Ok(bytes)
6995    }
6996
6997    /// Encode F32 min/max as Thumb-2: VMOV + VCMP + VMRS + IT + VMOV
6998    fn encode_thumb_f32_minmax(
6999        &self,
7000        sd: &VfpReg,
7001        sn: &VfpReg,
7002        sm: &VfpReg,
7003        is_min: bool,
7004    ) -> Result<Vec<u8>> {
7005        let mut bytes = Vec::new();
7006        let sn_num = vfp_sreg_to_num(sn)?;
7007        let sm_num = vfp_sreg_to_num(sm)?;
7008        let sd_num = vfp_sreg_to_num(sd)?;
7009
7010        // VMOV.F32 Sd, Sn
7011        let (vd, d) = encode_sreg(sd_num);
7012        let (vn, n) = encode_sreg(sn_num);
7013        let vmov_sn = 0xEEB00A40 | (d << 22) | (vd << 12) | (n << 5) | vn;
7014        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov_sn));
7015
7016        // VCMP.F32 Sn, Sm
7017        let (vm, m) = encode_sreg(sm_num);
7018        let vcmp = 0xEEB40A40 | (n << 22) | (vn << 12) | (m << 5) | vm;
7019        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcmp));
7020
7021        // VMRS APSR_nzcv, FPSCR
7022        bytes.extend_from_slice(&vfp_to_thumb_bytes(0xEEF1FA10));
7023
7024        // IT GT (for min) or IT MI (for max)
7025        let cond: u16 = if is_min { 0xC } else { 0x4 };
7026        let it: u16 = 0xBF00 | (cond << 4) | 0x8;
7027        bytes.extend_from_slice(&it.to_le_bytes());
7028
7029        // VMOV{cond}.F32 Sd, Sm — conditional VMOV in IT block
7030        let vmov_sm = 0xEEB00A40 | (d << 22) | (vd << 12) | (m << 5) | vm;
7031        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov_sm));
7032
7033        Ok(bytes)
7034    }
7035
7036    /// Encode F32 copysign as Thumb-2
7037    fn encode_thumb_f32_copysign(&self, sd: &VfpReg, sn: &VfpReg, sm: &VfpReg) -> Result<Vec<u8>> {
7038        let mut bytes = Vec::new();
7039
7040        // VMOV R12, Sm (get sign source bits)
7041        bytes.extend_from_slice(&vfp_to_thumb_bytes(encode_vmov_core_sreg(
7042            false,
7043            sm,
7044            &Reg::R12,
7045        )?));
7046
7047        // VMOV R0, Sn (get magnitude source bits)
7048        bytes.extend_from_slice(&vfp_to_thumb_bytes(encode_vmov_core_sreg(
7049            false,
7050            sn,
7051            &Reg::R0,
7052        )?));
7053
7054        // AND.W R12, R12, #0x80000000  (isolate the sign bit of the sign source)
7055        // Thumb-2 T1 data-processing modified immediate: 11110 i 0 0000 S Rn |
7056        // 0 imm3 Rd imm8, where the 12-bit constant is i:imm3:imm8. When the
7057        // 5-bit rotation `rot = i:imm3:imm8[7]` is >= 8, the value is
7058        // `(0x80 | imm8[6:0]) ROR rot`. For 0x80000000: 0x80 ROR 8 = 0x80000000,
7059        // so rot=8 (i=0, imm3=0b100), imm8=0x00. (#719: the previous encoding
7060        // used imm3=1/imm8=0x02, which decodes to #0x00020002 — a wrong mask that
7061        // spliced bits 17 and 1 instead of the sign bit; copysign was never
7062        // execution-differentiated until #719 caught it.)
7063        let hw1: u16 = 0xF000 | 12; // AND.W R12, R12, #imm (i=0, S=0, Rn=R12)
7064        let hw2: u16 = (0x4 << 12) | (12 << 8); // imm3=4, Rd=R12, imm8=0 → #0x80000000
7065        bytes.extend_from_slice(&hw1.to_le_bytes());
7066        bytes.extend_from_slice(&hw2.to_le_bytes());
7067
7068        // BIC.W R0, R0, #0x80000000  (clear the sign bit of the magnitude source)
7069        let hw1: u16 = 0xF020; // BIC.W R0, R0, #imm (i=0, S=0, Rn=R0)
7070        let hw2: u16 = 0x4 << 12; // imm3=4, Rd=R0, imm8=0 → #0x80000000
7071        bytes.extend_from_slice(&hw1.to_le_bytes());
7072        bytes.extend_from_slice(&hw2.to_le_bytes());
7073
7074        // ORR.W R0, R0, R12 (R0 = register 0)
7075        let hw1: u16 = 0xEA40; // ORR.W R0, R0, R12 (Rn=R0)
7076        let hw2: u16 = 12; // Rd=R0, Rm=R12
7077        bytes.extend_from_slice(&hw1.to_le_bytes());
7078        bytes.extend_from_slice(&hw2.to_le_bytes());
7079
7080        // VMOV Sd, R0
7081        bytes.extend_from_slice(&vfp_to_thumb_bytes(encode_vmov_core_sreg(
7082            true,
7083            sd,
7084            &Reg::R0,
7085        )?));
7086
7087        Ok(bytes)
7088    }
7089
7090    /// Encode F64 comparison as Thumb-2: VCMP.F64 + VMRS + MOV #0 + IT + MOV #1
7091    fn encode_thumb_f64_compare(
7092        &self,
7093        rd: &Reg,
7094        dn: &VfpReg,
7095        dm: &VfpReg,
7096        cond_code: u32,
7097    ) -> Result<Vec<u8>> {
7098        let mut bytes = Vec::new();
7099        let rd_bits = reg_to_bits(rd);
7100
7101        // #712-class fix (found at f64-phase-2 wiring, #369): the 16-bit
7102        // `MOVS Rd,#0` is FLAG-SETTING. The original order emitted it AFTER
7103        // `VMRS APSR_nzcv, FPSCR`, clobbering the N/Z/C/V flags the VMRS just
7104        // transferred, so the following `IT<cond>` read stale flags and every
7105        // f64 comparison silently returned 0 — the exact bug the f32 compare
7106        // encoder shipped with and #712 fixed. Same fix: materialize the `#0`
7107        // FIRST (its flag side effect is overwritten by the VMRS), then
7108        // VCMP+VMRS set the flags the IT consumes. Pure reorder — sizes
7109        // unchanged.
7110
7111        // MOVS Rd, #0
7112        if rd_bits < 8 {
7113            let movs_zero: u16 = 0x2000 | ((rd_bits as u16) << 8);
7114            bytes.extend_from_slice(&movs_zero.to_le_bytes());
7115        } else {
7116            let hw1: u16 = 0xF04F;
7117            let hw2: u16 = (rd_bits as u16) << 8;
7118            bytes.extend_from_slice(&hw1.to_le_bytes());
7119            bytes.extend_from_slice(&hw2.to_le_bytes());
7120        }
7121
7122        // VCMP.F64 Dn, Dm
7123        let dn_num = vfp_dreg_to_num(dn)?;
7124        let dm_num = vfp_dreg_to_num(dm)?;
7125        let (vd, d) = encode_dreg(dn_num);
7126        let (vm, m) = encode_dreg(dm_num);
7127        let vcmp = 0xEEB40B40 | (d << 22) | (vd << 12) | (m << 5) | vm;
7128        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcmp));
7129
7130        // VMRS APSR_nzcv, FPSCR (sets the flags the IT consumes)
7131        bytes.extend_from_slice(&vfp_to_thumb_bytes(0xEEF1FA10));
7132
7133        // IT<cond>
7134        let it: u16 = 0xBF00 | ((cond_code as u16) << 4) | 0x8;
7135        bytes.extend_from_slice(&it.to_le_bytes());
7136
7137        // MOV Rd, #1
7138        if rd_bits < 8 {
7139            let mov_one: u16 = 0x2001 | ((rd_bits as u16) << 8);
7140            bytes.extend_from_slice(&mov_one.to_le_bytes());
7141        } else {
7142            let hw1: u16 = 0xF04F;
7143            let hw2: u16 = ((rd_bits as u16) << 8) | 0x01;
7144            bytes.extend_from_slice(&hw1.to_le_bytes());
7145            bytes.extend_from_slice(&hw2.to_le_bytes());
7146        }
7147
7148        Ok(bytes)
7149    }
7150
7151    /// Encode F64 constant load as Thumb-2: MOVW+MOVT (lo32 into R0) + MOVW+MOVT (hi32 into R12) + VMOV Dd, R0, R12
7152    fn encode_thumb_f64_const(&self, dd: &VfpReg, value: f64) -> Result<Vec<u8>> {
7153        let mut bytes = Vec::new();
7154        let bits = value.to_bits();
7155        let lo32 = bits as u32;
7156        let hi32 = (bits >> 32) as u32;
7157
7158        // MOVW R0, #lo16(lo32)
7159        let lo16 = lo32 & 0xFFFF;
7160        bytes.extend_from_slice(&self.encode_thumb32_movw_raw(0, lo16)?);
7161
7162        // MOVT R0, #hi16(lo32)
7163        let hi16 = (lo32 >> 16) & 0xFFFF;
7164        bytes.extend_from_slice(&self.encode_thumb32_movt_raw(0, hi16)?);
7165
7166        // MOVW R12, #lo16(hi32)
7167        let lo16 = hi32 & 0xFFFF;
7168        bytes.extend_from_slice(&self.encode_thumb32_movw_raw(12, lo16)?);
7169
7170        // MOVT R12, #hi16(hi32)
7171        let hi16 = (hi32 >> 16) & 0xFFFF;
7172        bytes.extend_from_slice(&self.encode_thumb32_movt_raw(12, hi16)?);
7173
7174        // VMOV Dd, R0, R12
7175        let vmov = encode_vmov_core_dreg(true, dd, &Reg::R0, &Reg::R12)?;
7176        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
7177
7178        Ok(bytes)
7179    }
7180
7181    /// Encode VMOV Sd, Rm + VCVT.F64.S32/U32 Dd, Sd as Thumb-2
7182    fn encode_thumb_f64_convert_i32(&self, dd: &VfpReg, rm: &Reg, signed: bool) -> Result<Vec<u8>> {
7183        let mut bytes = Vec::new();
7184
7185        // VMOV S0, Rm
7186        let vmov = encode_vmov_core_sreg(true, &VfpReg::S0, rm)?;
7187        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
7188
7189        // VCVT.F64.S32 Dd, S0 or VCVT.F64.U32 Dd, S0
7190        let dd_num = vfp_dreg_to_num(dd)?;
7191        let (vd, d) = encode_dreg(dd_num);
7192        let base = if signed { 0xEEB80B40 } else { 0xEEB80BC0 };
7193        let vcvt = base | (d << 22) | (vd << 12);
7194        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt));
7195
7196        Ok(bytes)
7197    }
7198
7199    /// Encode VCVT.F64.F32 Dd, Sm as Thumb-2
7200    fn encode_thumb_f64_promote_f32(&self, dd: &VfpReg, sm: &VfpReg) -> Result<Vec<u8>> {
7201        let dd_num = vfp_dreg_to_num(dd)?;
7202        let sm_num = vfp_sreg_to_num(sm)?;
7203        let (vd, d) = encode_dreg(dd_num);
7204        let (vm, m) = encode_sreg(sm_num);
7205
7206        let vcvt = 0xEEB70AC0 | (d << 22) | (vd << 12) | (m << 5) | vm;
7207        Ok(vfp_to_thumb_bytes(vcvt))
7208    }
7209
7210    /// Encode VCVT.S32/U32.F64 S0, Dm + VMOV Rd, S0 as Thumb-2
7211    fn encode_thumb_i32_trunc_f64(&self, rd: &Reg, dm: &VfpReg, signed: bool) -> Result<Vec<u8>> {
7212        let mut bytes = Vec::new();
7213        let dm_num = vfp_dreg_to_num(dm)?;
7214        let (vm, m) = encode_dreg(dm_num);
7215
7216        // VCVT.S32.F64 S0, Dm or VCVT.U32.F64 S0, Dm
7217        let base = if signed { 0xEEBD0BC0 } else { 0xEEBC0BC0 };
7218        let vcvt = base | (m << 5) | vm;
7219        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt));
7220
7221        // VMOV Rd, S0
7222        let vmov = encode_vmov_core_sreg(false, &VfpReg::S0, rd)?;
7223        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
7224
7225        Ok(bytes)
7226    }
7227
7228    /// Encode F64 rounding pseudo-op as Thumb-2 via VCVT to integer and back
7229    /// Encode F64 rounding as Thumb-2.
7230    /// `mode`: FPSCR RMode — 0b00=nearest, 0b01=+inf(ceil), 0b10=-inf(floor), 0b11=zero(trunc)
7231    fn encode_thumb_f64_rounding(&self, dd: &VfpReg, dm: &VfpReg, mode: u8) -> Result<Vec<u8>> {
7232        let mut bytes = Vec::new();
7233        let dm_num = vfp_dreg_to_num(dm)?;
7234        let dd_num = vfp_dreg_to_num(dd)?;
7235        let (vm, m) = encode_dreg(dm_num);
7236        let (vd, d) = encode_dreg(dd_num);
7237
7238        if mode == 0b11 {
7239            // Trunc: VCVTR.S32.F64 — bit[7]=1, always truncates
7240            let vcvt_to_int = 0xEEBD0BC0 | (m << 5) | vm;
7241            bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt_to_int));
7242        } else {
7243            let rt: u32 = 12;
7244
7245            // VMRS R12, FPSCR
7246            let vmrs = 0xEEF10A10 | (rt << 12);
7247            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmrs));
7248
7249            // BIC.W R12, R12, #(3 << 22)
7250            let bic_hw1: u16 = 0xF020 | ((rt as u16) & 0xF);
7251            let bic_hw2: u16 = (0x05 << 12) | ((rt as u16) << 8) | 0x03;
7252            bytes.extend_from_slice(&bic_hw1.to_le_bytes());
7253            bytes.extend_from_slice(&bic_hw2.to_le_bytes());
7254
7255            // ORR.W R12, R12, #(mode << 22)
7256            if mode != 0 {
7257                let orr_hw1: u16 = 0xF040 | ((rt as u16) & 0xF);
7258                let orr_hw2: u16 = (0x05 << 12) | ((rt as u16) << 8) | (mode as u16);
7259                bytes.extend_from_slice(&orr_hw1.to_le_bytes());
7260                bytes.extend_from_slice(&orr_hw2.to_le_bytes());
7261            }
7262
7263            // VMSR FPSCR, R12
7264            let vmsr = 0xEEE10A10 | (rt << 12);
7265            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmsr));
7266
7267            // VCVT.S32.F64 S0, Dm — non-R variant (bit[7]=0)
7268            let vcvt_to_int = 0xEEBD0B40 | (m << 5) | vm;
7269            bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt_to_int));
7270
7271            // Restore FPSCR
7272            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmrs));
7273            bytes.extend_from_slice(&bic_hw1.to_le_bytes());
7274            bytes.extend_from_slice(&bic_hw2.to_le_bytes());
7275            bytes.extend_from_slice(&vfp_to_thumb_bytes(vmsr));
7276        }
7277
7278        // VCVT.F64.S32 Dd, S0
7279        let vcvt_to_float = 0xEEB80B40 | (d << 22) | (vd << 12);
7280        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt_to_float));
7281
7282        Ok(bytes)
7283    }
7284
7285    /// Encode F64 min/max as Thumb-2
7286    fn encode_thumb_f64_minmax(
7287        &self,
7288        dd: &VfpReg,
7289        dn: &VfpReg,
7290        dm: &VfpReg,
7291        is_min: bool,
7292    ) -> Result<Vec<u8>> {
7293        let mut bytes = Vec::new();
7294        let dn_num = vfp_dreg_to_num(dn)?;
7295        let dm_num = vfp_dreg_to_num(dm)?;
7296        let dd_num = vfp_dreg_to_num(dd)?;
7297
7298        // VMOV.F64 Dd, Dn
7299        let (vd, d) = encode_dreg(dd_num);
7300        let (vn, n) = encode_dreg(dn_num);
7301        let vmov_dn = 0xEEB00B40 | (d << 22) | (vd << 12) | (n << 5) | vn;
7302        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov_dn));
7303
7304        // VCMP.F64 Dn, Dm
7305        let (vm, m) = encode_dreg(dm_num);
7306        let vcmp = 0xEEB40B40 | (n << 22) | (vn << 12) | (m << 5) | vm;
7307        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcmp));
7308
7309        // VMRS APSR_nzcv, FPSCR
7310        bytes.extend_from_slice(&vfp_to_thumb_bytes(0xEEF1FA10));
7311
7312        // IT GT (for min) or IT MI (for max)
7313        let cond: u16 = if is_min { 0xC } else { 0x4 };
7314        let it: u16 = 0xBF00 | (cond << 4) | 0x8;
7315        bytes.extend_from_slice(&it.to_le_bytes());
7316
7317        // VMOV{cond}.F64 Dd, Dm
7318        let vmov_dm = 0xEEB00B40 | (d << 22) | (vd << 12) | (m << 5) | vm;
7319        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov_dm));
7320
7321        Ok(bytes)
7322    }
7323
7324    /// Encode F64 copysign as Thumb-2
7325    fn encode_thumb_f64_copysign(&self, dd: &VfpReg, dn: &VfpReg, dm: &VfpReg) -> Result<Vec<u8>> {
7326        let mut bytes = Vec::new();
7327
7328        // VMOV R0, R12, Dm (get sign source)
7329        bytes.extend_from_slice(&vfp_to_thumb_bytes(encode_vmov_core_dreg(
7330            false,
7331            dm,
7332            &Reg::R0,
7333            &Reg::R12,
7334        )?));
7335
7336        // VMOV R1, R2, Dn (get magnitude source)
7337        bytes.extend_from_slice(&vfp_to_thumb_bytes(encode_vmov_core_dreg(
7338            false,
7339            dn,
7340            &Reg::R1,
7341            &Reg::R2,
7342        )?));
7343
7344        // AND.W R12, R12, #0x80000000 (i=0, Rn=R12)
7345        let hw1: u16 = 0xF000 | 12;
7346        let hw2: u16 = (0x1 << 12) | (12 << 8) | 0x02;
7347        bytes.extend_from_slice(&hw1.to_le_bytes());
7348        bytes.extend_from_slice(&hw2.to_le_bytes());
7349
7350        // BIC.W R2, R2, #0x80000000 (i=0, Rn=R2)
7351        let hw1: u16 = 0xF020 | 2;
7352        let hw2: u16 = (0x1 << 12) | (2 << 8) | 0x02;
7353        bytes.extend_from_slice(&hw1.to_le_bytes());
7354        bytes.extend_from_slice(&hw2.to_le_bytes());
7355
7356        // ORR.W R2, R2, R12
7357        let hw1: u16 = 0xEA40 | 2;
7358        let hw2: u16 = (2 << 8) | 12;
7359        bytes.extend_from_slice(&hw1.to_le_bytes());
7360        bytes.extend_from_slice(&hw2.to_le_bytes());
7361
7362        // VMOV Dd, R1, R2
7363        bytes.extend_from_slice(&vfp_to_thumb_bytes(encode_vmov_core_dreg(
7364            true,
7365            dd,
7366            &Reg::R1,
7367            &Reg::R2,
7368        )?));
7369
7370        Ok(bytes)
7371    }
7372
7373    /// Encode VCVT.S32/U32.F32 + VMOV as Thumb-2
7374    fn encode_thumb_i32_trunc_f32(&self, rd: &Reg, sm: &VfpReg, signed: bool) -> Result<Vec<u8>> {
7375        let mut bytes = Vec::new();
7376
7377        let sm_num = vfp_sreg_to_num(sm)?;
7378        let (vd, d) = encode_sreg(sm_num);
7379        let (vm, m) = encode_sreg(sm_num);
7380        let base = if signed { 0xEEBD0AC0 } else { 0xEEBC0AC0 };
7381        let vcvt = base | (d << 22) | (vd << 12) | (m << 5) | vm;
7382        bytes.extend_from_slice(&vfp_to_thumb_bytes(vcvt));
7383
7384        // VMOV Rd, Sm
7385        let vmov = encode_vmov_core_sreg(false, sm, rd)?;
7386        bytes.extend_from_slice(&vfp_to_thumb_bytes(vmov));
7387
7388        Ok(bytes)
7389    }
7390
7391    // === Thumb-2 32-bit encoding helpers ===
7392
7393    /// Encode Thumb-2 32-bit ADD with immediate
7394    fn encode_thumb32_add(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7395        let rd_bits = reg_to_bits(rd);
7396        let rn_bits = reg_to_bits(rn);
7397
7398        // The `i:imm3:imm8` field is split the same way for both forms.
7399        let i_bit = (imm >> 11) & 1;
7400        let imm3 = (imm >> 8) & 0x7;
7401        let imm8 = imm & 0xFF;
7402
7403        let hw1_base = if imm <= 0xFF {
7404            // ADD.W (T3): the field is a ThumbExpandImm modified immediate. For
7405            // imm <= 0xFF (i:imm3 = 0000) it is the zero-extended byte, which is
7406            // correct — keep this form so existing encodings stay bit-identical.
7407            0xF100
7408        } else if imm <= 0xFFF {
7409            // ADDW (T4): a PLAIN 12-bit immediate (0..4095) — no ThumbExpandImm.
7410            // This is what makes `add sp, sp, #frame` correct for frame sizes
7411            // >= 256, which ADD.W (T3) would silently mis-encode (e.g. #256 -> #0).
7412            0xF200
7413        } else {
7414            return Err(synth_core::Error::synthesis(
7415                "ADD immediate > 0xFFF (4095) requires a multi-instruction sequence (not supported)",
7416            ));
7417        };
7418
7419        let hw1: u16 = (hw1_base | (i_bit << 10) | rn_bits) as u16;
7420        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7421
7422        let mut bytes = hw1.to_le_bytes().to_vec();
7423        bytes.extend_from_slice(&hw2.to_le_bytes());
7424        Ok(bytes)
7425    }
7426
7427    /// Encode Thumb-2 32-bit SUB with immediate
7428    fn encode_thumb32_sub(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7429        let rd_bits = reg_to_bits(rd);
7430        let rn_bits = reg_to_bits(rn);
7431
7432        let i_bit = (imm >> 11) & 1;
7433        let imm3 = (imm >> 8) & 0x7;
7434        let imm8 = imm & 0xFF;
7435
7436        let hw1_base = if imm <= 0xFF {
7437            // SUB.W (T3) modified immediate — correct for the zero-extended byte
7438            // (imm <= 0xFF). Kept bit-identical for existing encodings.
7439            0xF1A0
7440        } else if imm <= 0xFFF {
7441            // SUBW (T4): plain 12-bit immediate (0..4095). Makes
7442            // `sub sp, sp, #frame` correct for frame sizes >= 256.
7443            0xF2A0
7444        } else {
7445            return Err(synth_core::Error::synthesis(
7446                "SUB immediate > 0xFFF (4095) requires a multi-instruction sequence (not supported)",
7447            ));
7448        };
7449
7450        let hw1: u16 = (hw1_base | (i_bit << 10) | rn_bits) as u16;
7451        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7452
7453        let mut bytes = hw1.to_le_bytes().to_vec();
7454        bytes.extend_from_slice(&hw2.to_le_bytes());
7455        Ok(bytes)
7456    }
7457
7458    /// Encode Thumb-2 32-bit ADDS with immediate (sets flags)
7459    fn encode_thumb32_adds(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7460        let rd_bits = reg_to_bits(rd);
7461        let rn_bits = reg_to_bits(rn);
7462
7463        // ADDS.W (flag-setting) has only the modified-immediate form — error on
7464        // an un-encodable value rather than silently add the wrong constant.
7465        let field = try_thumb_expand_imm(imm).ok_or_else(|| {
7466            synth_core::Error::synthesis(
7467                "ADDS immediate is not a valid ThumbExpandImm — materialize into a register",
7468            )
7469        })?;
7470        let i_bit = (field >> 11) & 1;
7471        let imm3 = (field >> 8) & 0x7;
7472        let imm8 = field & 0xFF;
7473
7474        // ADDS.W Rd, Rn, #imm (with S=1)
7475        // First halfword: 1111 0 i 0 1000 1 Rn = F110 | i<<10 | Rn
7476        let hw1: u16 = (0xF110 | (i_bit << 10) | rn_bits) as u16;
7477        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7478
7479        let mut bytes = hw1.to_le_bytes().to_vec();
7480        bytes.extend_from_slice(&hw2.to_le_bytes());
7481        Ok(bytes)
7482    }
7483
7484    /// Encode Thumb-2 32-bit SUBS with immediate (sets flags)
7485    fn encode_thumb32_subs(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7486        let rd_bits = reg_to_bits(rd);
7487        let rn_bits = reg_to_bits(rn);
7488
7489        // SUBS.W (flag-setting) has only the modified-immediate form — error on
7490        // an un-encodable value rather than silently subtract the wrong constant.
7491        let field = try_thumb_expand_imm(imm).ok_or_else(|| {
7492            synth_core::Error::synthesis(
7493                "SUBS immediate is not a valid ThumbExpandImm — materialize into a register",
7494            )
7495        })?;
7496        let i_bit = (field >> 11) & 1;
7497        let imm3 = (field >> 8) & 0x7;
7498        let imm8 = field & 0xFF;
7499
7500        // SUBS.W Rd, Rn, #imm (with S=1)
7501        // First halfword: 1111 0 i 0 1101 1 Rn = F1B0 | i<<10 | Rn
7502        let hw1: u16 = (0xF1B0 | (i_bit << 10) | rn_bits) as u16;
7503        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7504
7505        let mut bytes = hw1.to_le_bytes().to_vec();
7506        bytes.extend_from_slice(&hw2.to_le_bytes());
7507        Ok(bytes)
7508    }
7509
7510    /// Encode Thumb-2 32-bit MOVW (16-bit immediate)
7511    ///
7512    /// # Contract (Verus-style)
7513    /// ```text
7514    /// requires rd <= R14
7515    /// ensures result.len() == 4
7516    /// ensures (imm & 0xFFFF) can be reconstructed from the encoding
7517    /// ```
7518    fn encode_thumb32_movw(&self, rd: &Reg, imm: u32) -> Result<Vec<u8>> {
7519        let rd_bits = reg_to_bits(rd);
7520        reg_bits_checked(rd_bits)?;
7521        let imm16 = imm & 0xFFFF;
7522
7523        // MOVW Rd, #imm16
7524        // 1111 0 i 10 0 1 0 0 imm4 | 0 imm3 Rd imm8
7525        let imm4 = (imm16 >> 12) & 0xF;
7526        let i_bit = (imm16 >> 11) & 1;
7527        let imm3 = (imm16 >> 8) & 0x7;
7528        let imm8 = imm16 & 0xFF;
7529
7530        let hw1: u16 = (0xF240 | (i_bit << 10) | imm4) as u16;
7531        let hw2: u16 = ((imm3 << 12) | (rd_bits << 8) | imm8) as u16;
7532
7533        let mut bytes = hw1.to_le_bytes().to_vec();
7534        bytes.extend_from_slice(&hw2.to_le_bytes());
7535        encoding_contracts::verify_thumb32(&bytes);
7536        Ok(bytes)
7537    }
7538
7539    /// Encode Thumb-2 32-bit shift with immediate
7540    ///
7541    /// # Contract (Verus-style)
7542    /// ```text
7543    /// requires rd <= R14, rm <= R14
7544    /// ensures result.len() == 4
7545    /// ```
7546    fn encode_thumb32_shift(
7547        &self,
7548        rd: &Reg,
7549        rm: &Reg,
7550        shift: u32,
7551        shift_type: u8,
7552    ) -> Result<Vec<u8>> {
7553        let rd_bits = reg_to_bits(rd);
7554        let rm_bits = reg_to_bits(rm);
7555        reg_bits_checked(rd_bits)?;
7556        reg_bits_checked(rm_bits)?;
7557        let imm5 = shift & 0x1F;
7558        let imm2 = imm5 & 0x3;
7559        let imm3 = (imm5 >> 2) & 0x7;
7560
7561        // MOV.W Rd, Rm, <shift> #imm
7562        // EA4F 0 imm3 Rd imm2 type Rm
7563        let hw1: u16 = 0xEA4F;
7564        let hw2: u16 =
7565            ((imm3 << 12) | (rd_bits << 8) | (imm2 << 6) | ((shift_type as u32) << 4) | rm_bits)
7566                as u16;
7567
7568        let mut bytes = hw1.to_le_bytes().to_vec();
7569        bytes.extend_from_slice(&hw2.to_le_bytes());
7570        Ok(bytes)
7571    }
7572
7573    /// Encode Thumb-2 32-bit shift by register
7574    /// Encoding: 11111010 0xx0 Rn | 1111 Rd 0000 Rm
7575    /// shift_type: 00=LSL, 01=LSR, 10=ASR, 11=ROR
7576    fn encode_thumb32_shift_reg(
7577        &self,
7578        rd: &Reg,
7579        rn: &Reg,
7580        rm: &Reg,
7581        shift_type: u8,
7582    ) -> Result<Vec<u8>> {
7583        let rd_bits = reg_to_bits(rd);
7584        let rn_bits = reg_to_bits(rn);
7585        let rm_bits = reg_to_bits(rm);
7586
7587        // hw1: 1111 1010 0xx0 Rn
7588        let hw1: u16 = (0xFA00 | ((shift_type as u32) << 5) | rn_bits) as u16;
7589        // hw2: 1111 Rd 0000 Rm
7590        let hw2: u16 = (0xF000 | (rd_bits << 8) | rm_bits) as u16;
7591
7592        let mut bytes = hw1.to_le_bytes().to_vec();
7593        bytes.extend_from_slice(&hw2.to_le_bytes());
7594        Ok(bytes)
7595    }
7596
7597    /// Encode Thumb-2 32-bit CMP with immediate
7598    fn encode_thumb32_cmp_imm(&self, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7599        let rn_bits = reg_to_bits(rn);
7600
7601        // CMP.W has only the modified-immediate form (no plain-imm12 like ADDW),
7602        // so an un-encodable immediate MUST be materialized into a register by
7603        // the selector. Error rather than silently compare the wrong constant.
7604        let field = try_thumb_expand_imm(imm).ok_or_else(|| {
7605            synth_core::Error::synthesis(
7606                "CMP immediate is not a valid ThumbExpandImm — materialize into a register",
7607            )
7608        })?;
7609        let i_bit = (field >> 11) & 1;
7610        let imm3 = (field >> 8) & 0x7;
7611        let imm8 = field & 0xFF;
7612
7613        // CMP.W Rn, #imm
7614        let hw1: u16 = (0xF1B0 | (i_bit << 10) | rn_bits) as u16;
7615        let hw2: u16 = ((imm3 << 12) | 0x0F00 | imm8) as u16;
7616
7617        let mut bytes = hw1.to_le_bytes().to_vec();
7618        bytes.extend_from_slice(&hw2.to_le_bytes());
7619        Ok(bytes)
7620    }
7621
7622    /// #372/#382: resolve the base register AND residual immediate offset for an
7623    /// `I64Ldr`/`I64Str` whose address may carry an index register. Returns
7624    /// `(base, low_offset)`; the caller accesses the halves at `[base,
7625    /// #low_offset]` and `[base, #low_offset + 4]`.
7626    ///
7627    /// - Frame access (no `offset_reg`, e.g. a spilled local at `[SP, #off]`):
7628    ///   returns `(addr.base, off)` and emits NOTHING — byte-identical.
7629    /// - Memory access (`reg_imm(R11, addr, offset)` = `R11 + addr + offset`)
7630    ///   with `offset + 4 <= 0xFFF`: emits `ADD.W ip, base, index` and returns
7631    ///   `(ip, offset)`, folding `offset`/`offset+4` into the halves' imm12.
7632    ///   Byte-identical to the pre-#382 (#372) behavior.
7633    /// - Memory access with `offset + 4 > 0xFFF`: the imm12 form cannot hold the
7634    ///   high half's offset, so `encode_thumb32_ldr`'s `check_ldst_imm12` (#259)
7635    ///   rightly refused it and the WHOLE function was skipped (#382). Instead
7636    ///   MATERIALIZE the offset into the base: `ADD ip, index, #offset` (against
7637    ///   the read-only INDEX register, so `encode_thumb32_add_imm` never trips its
7638    ///   `rd==rn==R12` alias trap), then `ADD.W ip, ip, base` (+ R11), and return
7639    ///   `(ip, 0)` so the halves use `[ip, #0]` / `[ip, #4]`.
7640    ///
7641    /// The effective address is fully materialized into `ip` BEFORE the halves
7642    /// are accessed, so an `rdlo` aliasing the index register is safe.
7643    fn i64_effective_base(&self, bytes: &mut Vec<u8>, addr: &MemAddr) -> Result<(Reg, u32)> {
7644        let offset = if addr.offset < 0 {
7645            0u32
7646        } else {
7647            addr.offset as u32
7648        };
7649        match addr.offset_reg {
7650            Some(idx) => {
7651                let ip = Reg::R12;
7652                if offset.wrapping_add(4) > 0xFFF {
7653                    // Large static offset (#382): fold it (and R11) into ip so the
7654                    // imm12 halves stay in range instead of skipping the function.
7655                    // ADD ip, index, #offset  (index != ip → no add_imm alias trap)
7656                    bytes.extend_from_slice(&self.encode_thumb32_add_imm(&ip, &idx, offset)?);
7657                    // ADD.W ip, ip, base  (+ R11)
7658                    bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(
7659                        reg_to_bits(&ip),
7660                        reg_to_bits(&ip),
7661                        reg_to_bits(&addr.base),
7662                    )?);
7663                    Ok((ip, 0))
7664                } else {
7665                    // ADD.W ip, addr.base, idx  (Thumb-2, byte-verified vs as)
7666                    let hw1: u16 = 0xEB00 | reg_to_bits(&addr.base) as u16;
7667                    let hw2: u16 = 0x0C00 | reg_to_bits(&idx) as u16;
7668                    bytes.extend_from_slice(&hw1.to_le_bytes());
7669                    bytes.extend_from_slice(&hw2.to_le_bytes());
7670                    Ok((ip, offset))
7671                }
7672            }
7673            None => Ok((addr.base, offset)),
7674        }
7675    }
7676
7677    /// Encode Thumb-2 32-bit LDR
7678    fn encode_thumb32_ldr(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7679        let rd_bits = reg_to_bits(rd);
7680        let base_bits = reg_to_bits(base);
7681
7682        // LDR.W Rd, [Rn, #imm12]
7683        check_ldst_imm12(offset)?;
7684        let hw1: u16 = (0xF8D0 | base_bits) as u16;
7685        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7686
7687        let mut bytes = hw1.to_le_bytes().to_vec();
7688        bytes.extend_from_slice(&hw2.to_le_bytes());
7689        Ok(bytes)
7690    }
7691
7692    /// Encode Thumb-2 32-bit STR
7693    fn encode_thumb32_str(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7694        let rd_bits = reg_to_bits(rd);
7695        let base_bits = reg_to_bits(base);
7696
7697        // STR.W Rd, [Rn, #imm12]
7698        check_ldst_imm12(offset)?;
7699        let hw1: u16 = (0xF8C0 | base_bits) as u16;
7700        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7701
7702        let mut bytes = hw1.to_le_bytes().to_vec();
7703        bytes.extend_from_slice(&hw2.to_le_bytes());
7704        Ok(bytes)
7705    }
7706
7707    /// Encode Thumb-2 32-bit LDR with register offset: LDR.W Rd, [Rn, Rm]
7708    fn encode_thumb32_ldr_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7709        let rd_bits = reg_to_bits(rd);
7710        let base_bits = reg_to_bits(base);
7711        let rm_bits = reg_to_bits(offset_reg);
7712
7713        // LDR.W Rd, [Rn, Rm, LSL #0]
7714        // Encoding: 1111 1000 0101 Rn | Rt 0000 00 imm2 Rm
7715        // imm2 = 00 for no shift (LSL #0)
7716        let hw1: u16 = (0xF850 | base_bits) as u16;
7717        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7718
7719        let mut bytes = hw1.to_le_bytes().to_vec();
7720        bytes.extend_from_slice(&hw2.to_le_bytes());
7721        Ok(bytes)
7722    }
7723
7724    /// Encode Thumb-2 32-bit STR with register offset: STR.W Rd, [Rn, Rm]
7725    fn encode_thumb32_str_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7726        let rd_bits = reg_to_bits(rd);
7727        let base_bits = reg_to_bits(base);
7728        let rm_bits = reg_to_bits(offset_reg);
7729
7730        // STR.W Rd, [Rn, Rm, LSL #0]
7731        // Encoding: 1111 1000 0100 Rn | Rt 0000 00 imm2 Rm
7732        // imm2 = 00 for no shift (LSL #0)
7733        let hw1: u16 = (0xF840 | base_bits) as u16;
7734        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7735
7736        let mut bytes = hw1.to_le_bytes().to_vec();
7737        bytes.extend_from_slice(&hw2.to_le_bytes());
7738        Ok(bytes)
7739    }
7740
7741    // === Sub-word load/store Thumb-2 encoding helpers ===
7742
7743    /// Encode Thumb-2 32-bit LDRB with immediate: LDRB.W Rd, [Rn, #imm12]
7744    fn encode_thumb32_ldrb_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7745        let rd_bits = reg_to_bits(rd);
7746        let base_bits = reg_to_bits(base);
7747        // LDRB.W Rd, [Rn, #imm12]: 1111 1000 1001 Rn | Rt imm12
7748        check_ldst_imm12(offset)?;
7749        let hw1: u16 = (0xF890 | base_bits) as u16;
7750        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7751        let mut bytes = hw1.to_le_bytes().to_vec();
7752        bytes.extend_from_slice(&hw2.to_le_bytes());
7753        Ok(bytes)
7754    }
7755
7756    /// Encode Thumb-2 32-bit LDRB with register: LDRB.W Rd, [Rn, Rm]
7757    fn encode_thumb32_ldrb_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7758        let rd_bits = reg_to_bits(rd);
7759        let base_bits = reg_to_bits(base);
7760        let rm_bits = reg_to_bits(offset_reg);
7761        // LDRB.W Rd, [Rn, Rm, LSL #0]: 1111 1000 0001 Rn | Rt 0000 00 imm2 Rm
7762        let hw1: u16 = (0xF810 | base_bits) as u16;
7763        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7764        let mut bytes = hw1.to_le_bytes().to_vec();
7765        bytes.extend_from_slice(&hw2.to_le_bytes());
7766        Ok(bytes)
7767    }
7768
7769    /// Encode Thumb-2 32-bit LDRSB with immediate: LDRSB.W Rd, [Rn, #imm12]
7770    fn encode_thumb32_ldrsb_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7771        let rd_bits = reg_to_bits(rd);
7772        let base_bits = reg_to_bits(base);
7773        // LDRSB.W Rd, [Rn, #imm12]: 1111 1001 1001 Rn | Rt imm12
7774        check_ldst_imm12(offset)?;
7775        let hw1: u16 = (0xF990 | base_bits) as u16;
7776        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7777        let mut bytes = hw1.to_le_bytes().to_vec();
7778        bytes.extend_from_slice(&hw2.to_le_bytes());
7779        Ok(bytes)
7780    }
7781
7782    /// Encode Thumb-2 32-bit LDRSB with register: LDRSB.W Rd, [Rn, Rm]
7783    fn encode_thumb32_ldrsb_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7784        let rd_bits = reg_to_bits(rd);
7785        let base_bits = reg_to_bits(base);
7786        let rm_bits = reg_to_bits(offset_reg);
7787        // LDRSB.W Rd, [Rn, Rm, LSL #0]: 1111 1001 0001 Rn | Rt 0000 00 imm2 Rm
7788        let hw1: u16 = (0xF910 | base_bits) as u16;
7789        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7790        let mut bytes = hw1.to_le_bytes().to_vec();
7791        bytes.extend_from_slice(&hw2.to_le_bytes());
7792        Ok(bytes)
7793    }
7794
7795    /// Encode Thumb-2 32-bit LDRH with immediate: LDRH.W Rd, [Rn, #imm12]
7796    fn encode_thumb32_ldrh_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7797        let rd_bits = reg_to_bits(rd);
7798        let base_bits = reg_to_bits(base);
7799        // LDRH.W Rd, [Rn, #imm12]: 1111 1000 1011 Rn | Rt imm12
7800        check_ldst_imm12(offset)?;
7801        let hw1: u16 = (0xF8B0 | base_bits) as u16;
7802        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7803        let mut bytes = hw1.to_le_bytes().to_vec();
7804        bytes.extend_from_slice(&hw2.to_le_bytes());
7805        Ok(bytes)
7806    }
7807
7808    /// Encode Thumb-2 32-bit LDRH with register: LDRH.W Rd, [Rn, Rm]
7809    fn encode_thumb32_ldrh_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7810        let rd_bits = reg_to_bits(rd);
7811        let base_bits = reg_to_bits(base);
7812        let rm_bits = reg_to_bits(offset_reg);
7813        // LDRH.W Rd, [Rn, Rm, LSL #0]: 1111 1000 0011 Rn | Rt 0000 00 imm2 Rm
7814        let hw1: u16 = (0xF830 | base_bits) as u16;
7815        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7816        let mut bytes = hw1.to_le_bytes().to_vec();
7817        bytes.extend_from_slice(&hw2.to_le_bytes());
7818        Ok(bytes)
7819    }
7820
7821    /// Encode Thumb-2 32-bit LDRSH with immediate: LDRSH.W Rd, [Rn, #imm12]
7822    fn encode_thumb32_ldrsh_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7823        let rd_bits = reg_to_bits(rd);
7824        let base_bits = reg_to_bits(base);
7825        // LDRSH.W Rd, [Rn, #imm12]: 1111 1001 1011 Rn | Rt imm12
7826        check_ldst_imm12(offset)?;
7827        let hw1: u16 = (0xF9B0 | base_bits) as u16;
7828        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7829        let mut bytes = hw1.to_le_bytes().to_vec();
7830        bytes.extend_from_slice(&hw2.to_le_bytes());
7831        Ok(bytes)
7832    }
7833
7834    /// Encode Thumb-2 32-bit LDRSH with register: LDRSH.W Rd, [Rn, Rm]
7835    fn encode_thumb32_ldrsh_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7836        let rd_bits = reg_to_bits(rd);
7837        let base_bits = reg_to_bits(base);
7838        let rm_bits = reg_to_bits(offset_reg);
7839        // LDRSH.W Rd, [Rn, Rm, LSL #0]: 1111 1001 0011 Rn | Rt 0000 00 imm2 Rm
7840        let hw1: u16 = (0xF930 | base_bits) as u16;
7841        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7842        let mut bytes = hw1.to_le_bytes().to_vec();
7843        bytes.extend_from_slice(&hw2.to_le_bytes());
7844        Ok(bytes)
7845    }
7846
7847    /// Encode Thumb-2 32-bit STRB with immediate: STRB.W Rd, [Rn, #imm12]
7848    fn encode_thumb32_strb_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7849        let rd_bits = reg_to_bits(rd);
7850        let base_bits = reg_to_bits(base);
7851        // STRB.W Rd, [Rn, #imm12]: 1111 1000 1000 Rn | Rt imm12
7852        check_ldst_imm12(offset)?;
7853        let hw1: u16 = (0xF880 | base_bits) as u16;
7854        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7855        let mut bytes = hw1.to_le_bytes().to_vec();
7856        bytes.extend_from_slice(&hw2.to_le_bytes());
7857        Ok(bytes)
7858    }
7859
7860    /// Encode Thumb-2 32-bit STRB with register: STRB.W Rd, [Rn, Rm]
7861    fn encode_thumb32_strb_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7862        let rd_bits = reg_to_bits(rd);
7863        let base_bits = reg_to_bits(base);
7864        let rm_bits = reg_to_bits(offset_reg);
7865        // STRB.W Rd, [Rn, Rm, LSL #0]: 1111 1000 0000 Rn | Rt 0000 00 imm2 Rm
7866        let hw1: u16 = (0xF800 | base_bits) as u16;
7867        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7868        let mut bytes = hw1.to_le_bytes().to_vec();
7869        bytes.extend_from_slice(&hw2.to_le_bytes());
7870        Ok(bytes)
7871    }
7872
7873    /// Encode Thumb-2 32-bit STRH with immediate: STRH.W Rd, [Rn, #imm12]
7874    fn encode_thumb32_strh_imm(&self, rd: &Reg, base: &Reg, offset: u32) -> Result<Vec<u8>> {
7875        let rd_bits = reg_to_bits(rd);
7876        let base_bits = reg_to_bits(base);
7877        // STRH.W Rd, [Rn, #imm12]: 1111 1000 1010 Rn | Rt imm12
7878        check_ldst_imm12(offset)?;
7879        let hw1: u16 = (0xF8A0 | base_bits) as u16;
7880        let hw2: u16 = ((rd_bits << 12) | (offset & 0xFFF)) as u16;
7881        let mut bytes = hw1.to_le_bytes().to_vec();
7882        bytes.extend_from_slice(&hw2.to_le_bytes());
7883        Ok(bytes)
7884    }
7885
7886    /// Encode Thumb-2 32-bit STRH with register: STRH.W Rd, [Rn, Rm]
7887    fn encode_thumb32_strh_reg(&self, rd: &Reg, base: &Reg, offset_reg: &Reg) -> Result<Vec<u8>> {
7888        let rd_bits = reg_to_bits(rd);
7889        let base_bits = reg_to_bits(base);
7890        let rm_bits = reg_to_bits(offset_reg);
7891        // STRH.W Rd, [Rn, Rm, LSL #0]: 1111 1000 0010 Rn | Rt 0000 00 imm2 Rm
7892        let hw1: u16 = (0xF820 | base_bits) as u16;
7893        let hw2: u16 = ((rd_bits << 12) | rm_bits) as u16;
7894        let mut bytes = hw1.to_le_bytes().to_vec();
7895        bytes.extend_from_slice(&hw2.to_le_bytes());
7896        Ok(bytes)
7897    }
7898
7899    /// Encode Thumb-2 32-bit ADD with immediate: ADD.W Rd, Rn, #imm
7900    fn encode_thumb32_add_imm(&self, rd: &Reg, rn: &Reg, imm: u32) -> Result<Vec<u8>> {
7901        let rd_bits = reg_to_bits(rd);
7902        let rn_bits = reg_to_bits(rn);
7903
7904        // In-range immediates (<= 0xFFF) delegate to `encode_thumb32_add`,
7905        // which picks the correct form per value:
7906        //   - imm <= 0xFF  -> ADD.W (T3). Its `i:imm3:imm8` field is a
7907        //     ThumbExpandImm MODIFIED immediate — raw == expanded only here.
7908        //   - 0x100..=0xFFF -> ADDW (T4, 0xF200): a PLAIN 12-bit immediate.
7909        //
7910        // #681: this function used to pack the raw value into the T3 field for
7911        // ALL imm <= 0xFFF. ThumbExpandImm(0x200) = 0 and ThumbExpandImm(0x400)
7912        // = 0x8000_0000, so every dynamic-address load/store with a static
7913        // offset in 0x100..=0xFFF silently computed a WRONG address — and in
7914        // --safety-bounds software the guard checked the intended address while
7915        // the access used the mis-encoded one (bounds bypass). Same
7916        // ThumbExpandImm raw-packing class as #253/#255, reached via #382.
7917        if imm <= 0xFFF {
7918            self.encode_thumb32_add(rd, rn, imm)
7919        } else {
7920            // Out-of-range immediate (> 0xFFF): materialize it into a scratch
7921            // register, then ADD.W Rd, Rn, scratch. This is the #180/#185
7922            // "encoder must produce a legal sequence, not assert" class — see #350.
7923            //
7924            // Scratch choice (must NEVER equal Rn, or Rn would be clobbered before
7925            // the ADD reads it):
7926            //   - rd != rn  => use rd itself (rn is untouched, since rd != rn).
7927            //   - rd == rn  => use R12/IP (the reserved encoder scratch). rd/rn are
7928            //                  never R12 (R12 is non-allocatable), so it can't alias.
7929            //
7930            // The materialized value is the same whether or not MOVT is emitted, so
7931            // the byte length depends only on `imm` (and rd==rn) — the size probe and
7932            // the final emit therefore agree (mandatory: the function is encoded twice).
7933            let scratch: u32 = if rd_bits == rn_bits {
7934                12 // R12/IP — in-place add, can't use rd because rd == rn
7935            } else {
7936                rd_bits // rn is preserved because rd != rn
7937            };
7938            // Invariant: the scratch must never alias Rn (would clobber it before
7939            // the ADD reads it). Unreachable in real codegen (rd/rn are never R12,
7940            // which is reserved encoder scratch), but the encoder is also driven by
7941            // the `encoder_no_panic` fuzz harness with ARBITRARY registers — incl.
7942            // rd==rn==R12, which makes scratch (R12) alias Rn. The encoder contract
7943            // (#180/#185) is Ok-or-Err, never a panic, so return a typed error
7944            // instead of asserting. #350 follow-up.
7945            if scratch == rn_bits {
7946                return Err(synth_core::Error::synthesis(format!(
7947                    "ADD #imm: cannot lower #{imm:#x} for Rd==Rn==R12 — no free scratch \
7948                     register (R12 is the reserved encoder scratch and aliases Rn here)"
7949                )));
7950            }
7951
7952            let lo16 = imm & 0xFFFF;
7953            let hi16 = (imm >> 16) & 0xFFFF;
7954
7955            let mut bytes = self.encode_thumb32_movw_raw(scratch, lo16)?;
7956            if hi16 != 0 {
7957                bytes.extend_from_slice(&self.encode_thumb32_movt_raw(scratch, hi16)?);
7958            }
7959            bytes.extend_from_slice(&self.encode_thumb32_add_reg_raw(rd_bits, rn_bits, scratch)?);
7960            Ok(bytes)
7961        }
7962    }
7963
7964    // === Raw encoding helpers for POPCNT (take register numbers directly) ===
7965
7966    /// Encode Thumb-2 32-bit MOVW (16-bit immediate) - raw version
7967    ///
7968    /// # Contract (Verus-style)
7969    /// ```text
7970    /// requires rd <= 14, imm16 <= 0xFFFF
7971    /// ensures result.len() == 4
7972    /// ```
7973    fn encode_thumb32_movw_raw(&self, rd: u32, imm16: u32) -> Result<Vec<u8>> {
7974        reg_bits_checked(rd)?;
7975        encoding_contracts::verify_imm16(imm16);
7976        // MOVW Rd, #imm16
7977        // 1111 0 i 10 0 1 0 0 imm4 | 0 imm3 Rd imm8
7978        let imm16 = imm16 & 0xFFFF;
7979        let imm4 = (imm16 >> 12) & 0xF;
7980        let i_bit = (imm16 >> 11) & 1;
7981        let imm3 = (imm16 >> 8) & 0x7;
7982        let imm8 = imm16 & 0xFF;
7983
7984        let hw1: u16 = (0xF240 | (i_bit << 10) | imm4) as u16;
7985        let hw2: u16 = ((imm3 << 12) | (rd << 8) | imm8) as u16;
7986
7987        let mut bytes = hw1.to_le_bytes().to_vec();
7988        bytes.extend_from_slice(&hw2.to_le_bytes());
7989        encoding_contracts::verify_thumb32(&bytes);
7990        Ok(bytes)
7991    }
7992
7993    /// Encode Thumb-2 32-bit MOVT (move top 16 bits) - raw version
7994    ///
7995    /// # Contract (Verus-style)
7996    /// ```text
7997    /// requires rd <= 14, imm16 <= 0xFFFF
7998    /// ensures result.len() == 4
7999    /// ```
8000    fn encode_thumb32_movt_raw(&self, rd: u32, imm16: u32) -> Result<Vec<u8>> {
8001        reg_bits_checked(rd)?;
8002        encoding_contracts::verify_imm16(imm16);
8003        // MOVT Rd, #imm16
8004        // 1111 0 i 10 1 1 0 0 imm4 | 0 imm3 Rd imm8
8005        let imm16 = imm16 & 0xFFFF;
8006        let imm4 = (imm16 >> 12) & 0xF;
8007        let i_bit = (imm16 >> 11) & 1;
8008        let imm3 = (imm16 >> 8) & 0x7;
8009        let imm8 = imm16 & 0xFF;
8010
8011        let hw1: u16 = (0xF2C0 | (i_bit << 10) | imm4) as u16;
8012        let hw2: u16 = ((imm3 << 12) | (rd << 8) | imm8) as u16;
8013
8014        let mut bytes = hw1.to_le_bytes().to_vec();
8015        bytes.extend_from_slice(&hw2.to_le_bytes());
8016        encoding_contracts::verify_thumb32(&bytes);
8017        Ok(bytes)
8018    }
8019
8020    /// Encode Thumb-2 32-bit LSR (logical shift right) with immediate - raw version
8021    fn encode_thumb32_lsr_raw(&self, rd: u32, rm: u32, shift: u32) -> Result<Vec<u8>> {
8022        // MOV.W Rd, Rm, LSR #imm
8023        // EA4F 0 imm3 Rd imm2 01 Rm
8024        let imm5 = shift & 0x1F;
8025        let imm2 = imm5 & 0x3;
8026        let imm3 = (imm5 >> 2) & 0x7;
8027
8028        let hw1: u16 = 0xEA4F;
8029        let hw2: u16 = ((imm3 << 12) | (rd << 8) | (imm2 << 6) | (0b01 << 4) | rm) as u16;
8030
8031        let mut bytes = hw1.to_le_bytes().to_vec();
8032        bytes.extend_from_slice(&hw2.to_le_bytes());
8033        Ok(bytes)
8034    }
8035
8036    /// Encode Thumb-2 32-bit AND (register) - raw version
8037    fn encode_thumb32_and_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8038        // AND.W Rd, Rn, Rm
8039        // EA00 Rn | 0 Rd 00 00 Rm
8040        let hw1: u16 = (0xEA00 | rn) as u16;
8041        let hw2: u16 = ((rd << 8) | rm) as u16;
8042
8043        let mut bytes = hw1.to_le_bytes().to_vec();
8044        bytes.extend_from_slice(&hw2.to_le_bytes());
8045        Ok(bytes)
8046    }
8047
8048    /// Encode Thumb-2 32-bit AND with immediate - raw version
8049    fn encode_thumb32_and_imm_raw(&self, rd: u32, rn: u32, imm: u32) -> Result<Vec<u8>> {
8050        // AND.W Rd, Rn, #<modified_immediate>
8051        // F0 00 Rn | 0 imm3 Rd imm8
8052        //
8053        // #681 class audit: the field is a ThumbExpandImm modified immediate,
8054        // not a raw value. The only current caller (POPCNT final mask) passes
8055        // 0x3F, which expands to itself — the gate is byte-identical today and
8056        // closes the raw-packing landmine for any future caller.
8057        let field = try_thumb_expand_imm(imm).ok_or_else(|| {
8058            synth_core::Error::synthesis(
8059                "AND immediate is not a valid ThumbExpandImm — materialize into a register",
8060            )
8061        })?;
8062        let i_bit = (field >> 11) & 1;
8063        let imm3 = (field >> 8) & 0x7;
8064        let imm8 = field & 0xFF;
8065
8066        let hw1: u16 = (0xF000 | (i_bit << 10) | rn) as u16;
8067        let hw2: u16 = ((imm3 << 12) | (rd << 8) | imm8) as u16;
8068
8069        let mut bytes = hw1.to_le_bytes().to_vec();
8070        bytes.extend_from_slice(&hw2.to_le_bytes());
8071        Ok(bytes)
8072    }
8073
8074    /// Encode Thumb-2 32-bit SUB (register) - raw version
8075    fn encode_thumb32_sub_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8076        // SUB.W Rd, Rn, Rm
8077        // EBA0 Rn | 0 Rd 00 00 Rm
8078        let hw1: u16 = (0xEBA0 | rn) as u16;
8079        let hw2: u16 = ((rd << 8) | rm) as u16;
8080
8081        let mut bytes = hw1.to_le_bytes().to_vec();
8082        bytes.extend_from_slice(&hw2.to_le_bytes());
8083        Ok(bytes)
8084    }
8085
8086    /// Encode Thumb-2 32-bit ADD (register) - raw version
8087    fn encode_thumb32_add_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8088        // ADD.W Rd, Rn, Rm
8089        // EB00 Rn | 0 Rd 00 00 Rm
8090        let hw1: u16 = (0xEB00 | rn) as u16;
8091        let hw2: u16 = ((rd << 8) | rm) as u16;
8092
8093        let mut bytes = hw1.to_le_bytes().to_vec();
8094        bytes.extend_from_slice(&hw2.to_le_bytes());
8095        Ok(bytes)
8096    }
8097
8098    /// Encode Thumb-2 32-bit ADDS (register, flag-setting) - raw version.
8099    /// Used as the high-register fallback for `ArmOp::Adds` (i64 low-word add)
8100    /// so R8-R11 pair operands don't overflow the 16-bit field — #178/#180.
8101    fn encode_thumb32_adds_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8102        // ADDS.W Rd, Rn, Rm (T3, S=1): EB10 Rn | 0 Rd 00 00 Rm
8103        let hw1: u16 = (0xEB10 | rn) as u16;
8104        let hw2: u16 = ((rd << 8) | rm) as u16;
8105        let mut bytes = hw1.to_le_bytes().to_vec();
8106        bytes.extend_from_slice(&hw2.to_le_bytes());
8107        Ok(bytes)
8108    }
8109
8110    /// Encode Thumb-2 32-bit SUBS (register, flag-setting) - raw version.
8111    /// High-register fallback for `ArmOp::Subs` (i64 low-word subtract) — #178/#180.
8112    fn encode_thumb32_subs_reg_raw(&self, rd: u32, rn: u32, rm: u32) -> Result<Vec<u8>> {
8113        // SUBS.W Rd, Rn, Rm (T3, S=1): EBB0 Rn | 0 Rd 00 00 Rm
8114        let hw1: u16 = (0xEBB0 | rn) as u16;
8115        let hw2: u16 = ((rd << 8) | rm) as u16;
8116        let mut bytes = hw1.to_le_bytes().to_vec();
8117        bytes.extend_from_slice(&hw2.to_le_bytes());
8118        Ok(bytes)
8119    }
8120
8121    /// Encode a sequence of ARM instructions
8122    pub fn encode_sequence(&self, ops: &[ArmOp]) -> Result<Vec<u8>> {
8123        let mut code = Vec::new();
8124
8125        for op in ops {
8126            let encoded = self.encode(op)?;
8127            code.extend_from_slice(&encoded);
8128        }
8129
8130        Ok(code)
8131    }
8132}
8133
8134/// Convert register to bit encoding (0-15)
8135/// Reverse of the ARMv7-M `ThumbExpandImm`: given a 32-bit immediate, return the
8136/// 12-bit `i:imm3:imm8` field if it is a representable modified immediate, else
8137/// `None` (the caller must materialize the value into a register). This is the
8138/// shared correct path for the data-processing immediate encoders — without it
8139/// they pack raw bits and silently mis-encode any value `> 0xFF` that isn't a
8140/// modified immediate (the silent-miscompile class behind #251/#253/#255).
8141fn try_thumb_expand_imm(value: u32) -> Option<u32> {
8142    // i:imm3 = 0000 → 8-bit value, zero-extended (00000000 00000000 00000000 XY).
8143    if value <= 0xFF {
8144        return Some(value);
8145    }
8146    let b0 = value & 0xFF; // byte 0
8147    let b1 = (value >> 8) & 0xFF; // byte 1
8148    // 0x00XY00XY (i:imm3 = 0001) — XY in bytes 0 and 2
8149    if value == (b0 << 16) | b0 {
8150        return Some(0x100 | b0);
8151    }
8152    // 0xXY00XY00 (i:imm3 = 0010) — XY in bytes 1 and 3
8153    if value == (b1 << 24) | (b1 << 8) {
8154        return Some(0x200 | b1);
8155    }
8156    // 0xXYXYXYXY (i:imm3 = 0011) — XY in all four bytes
8157    if value == (b0 << 24) | (b0 << 16) | (b0 << 8) | b0 {
8158        return Some(0x300 | b0);
8159    }
8160    // An 8-bit value with bit 7 set, rotated right by 8..=31. `rotate_left(rot)`
8161    // undoes the encoded right rotation; if the result is `1bbbbbbb` (0x80..=0xFF)
8162    // the value is representable. imm12[11:7] = rot, imm12[6:0] = low 7 bits.
8163    for rot in 8..=31u32 {
8164        let unrot = value.rotate_left(rot);
8165        if (0x80..=0xFF).contains(&unrot) {
8166            return Some((rot << 7) | (unrot & 0x7F));
8167        }
8168    }
8169    None
8170}
8171
8172/// Guard a Thumb-2 `LDR/STR Rd, [Rn, #imm12]` offset. The imm12 form supports
8173/// `0..=4095`; a larger offset must be materialized into a register by the
8174/// selector (register-offset addressing). Returning `Err` rather than silently
8175/// masking `offset & 0xFFF` closes the wrong-address miscompile class (#259,
8176/// the load/store sibling of #253/#255).
8177fn check_ldst_imm12(offset: u32) -> Result<()> {
8178    if offset > 0xFFF {
8179        Err(synth_core::Error::synthesis(
8180            "load/store immediate offset > 0xFFF (4095) — materialize the offset into a register",
8181        ))
8182    } else {
8183        Ok(())
8184    }
8185}
8186
8187fn reg_to_bits(reg: &Reg) -> u32 {
8188    match reg {
8189        Reg::R0 => 0,
8190        Reg::R1 => 1,
8191        Reg::R2 => 2,
8192        Reg::R3 => 3,
8193        Reg::R4 => 4,
8194        Reg::R5 => 5,
8195        Reg::R6 => 6,
8196        Reg::R7 => 7,
8197        Reg::R8 => 8,
8198        Reg::R9 => 9,
8199        Reg::R10 => 10,
8200        Reg::R11 => 11,
8201        Reg::R12 => 12,
8202        Reg::SP => 13,
8203        Reg::LR => 14,
8204        Reg::PC => 15,
8205    }
8206}
8207
8208// ======================================================================
8209// #610 — i64 fixed-ABI expansion wrappers.
8210//
8211// The hand-written multi-instruction i64 cores (rotl/rotr and the div/rem
8212// shift-subtract loops) compute in FIXED low registers. Before #610 the
8213// div/rem arms ignored their operand fields outright (hardcoded R0:R1 /
8214// R2:R3 in, result to R0:R1) and the rot arms used R3/R4 scratch that
8215// collided with selector-assigned registers — then restored the saved
8216// scratch OVER the result (`POP {R4}` with rd_lo == R4), so the op
8217// returned the caller's stale register: 0 for every input under qemu.
8218//
8219// These wrappers make each core honor its register parameters:
8220//   1. save R0-R3,
8221//   2. marshal the operand registers into the core's fixed input regs via
8222//      the stack (permutation-safe: every source is read before any fixed
8223//      register is written),
8224//   3. run the fixed-reg core (self-preserving for R4+; R12 is encoder
8225//      scratch and never allocatable, #212),
8226//   4. MOV the result pair from R0:R1 into the selector's rd pair,
8227//   5. restore R0-R3, skipping any register the result now occupies.
8228//
8229// All emitted lengths are register-independent so the optimized path's
8230// byte-size estimator (`estimate_arm_byte_size`, pinned by the
8231// estimator↔encoder agreement oracle #498/#511) stays a constant per op.
8232// ======================================================================
8233
8234/// Steps 1+2: `PUSH {R0-R3}`, then marshal `srcs` (operand registers, any of
8235/// R0-R12) into `R0..R<n>` via individual stack pushes. Sources are all read
8236/// before any destination register is written, so arbitrary source/target
8237/// permutations (including operands living in R0-R3) are safe.
8238fn emit_i64_fixed_abi_entry(bytes: &mut Vec<u8>, srcs: &[&Reg]) {
8239    debug_assert!(srcs.len() <= 4);
8240    // PUSH {R0-R3} — save the caller-visible low registers.
8241    bytes.extend_from_slice(&0xB40Fu16.to_le_bytes());
8242    // STR src, [SP, #-4]! — push in reverse so srcs[0] ends up on top.
8243    for src in srcs.iter().rev() {
8244        let rt = reg_to_bits(src) as u16;
8245        bytes.extend_from_slice(&0xF84Du16.to_le_bytes());
8246        bytes.extend_from_slice(&((rt << 12) | 0x0D04).to_le_bytes());
8247    }
8248    // POP {Ri} — Ri := srcs[i].
8249    for i in 0..srcs.len() as u16 {
8250        bytes.extend_from_slice(&(0xBC00u16 | (1u16 << i)).to_le_bytes());
8251    }
8252}
8253
8254/// Steps 4+5: move the core's R0:R1 result into the selector's rd pair, then
8255/// restore the R0-R3 saved by [`emit_i64_fixed_abi_entry`], skipping any
8256/// register the result now lives in (its saved caller word is discarded).
8257fn emit_i64_fixed_abi_exit(bytes: &mut Vec<u8>, rdlo: &Reg, rdhi: &Reg) -> Result<()> {
8258    let lo = reg_to_bits(rdlo);
8259    let hi = reg_to_bits(rdhi);
8260    if lo == 1 && hi == 0 {
8261        // A fully swapped pair would clobber one half in either MOV order.
8262        // Selector pairs are consecutive (lo, lo+1), so this cannot occur.
8263        return Err(synth_core::Error::synthesis(
8264            "i64 expansion: swapped result pair (rd_lo=R1, rd_hi=R0) is unsupported (#610)",
8265        ));
8266    }
8267    let mov16 = |bytes: &mut Vec<u8>, rd: u32, rm: u32| {
8268        let d = ((rd >> 3) & 1) as u16;
8269        bytes.extend_from_slice(
8270            &(0x4600u16 | (d << 7) | ((rm as u16) << 3) | ((rd & 7) as u16)).to_le_bytes(),
8271        );
8272    };
8273    if hi == 0 {
8274        // rd_hi is R0: read R0 into rd_lo BEFORE overwriting R0 with R1.
8275        mov16(bytes, lo, 0);
8276        mov16(bytes, hi, 1);
8277    } else {
8278        // rd_lo may be R1: read R1 into rd_hi BEFORE overwriting R1 with R0.
8279        mov16(bytes, hi, 1);
8280        mov16(bytes, lo, 0);
8281    }
8282    for i in 0..4u32 {
8283        if i == lo || i == hi {
8284            // The result lives here — drop the saved caller word.
8285            bytes.extend_from_slice(&0xB001u16.to_le_bytes()); // ADD SP, #4
8286        } else {
8287            bytes.extend_from_slice(&(0xBC00u16 | (1u16 << i)).to_le_bytes()); // POP {Ri}
8288        }
8289    }
8290    Ok(())
8291}
8292
8293/// WASM `i64.div_*` / `i64.rem_*` by zero must trap, matching the i32 path's
8294/// cmp/bne/udf guard. Emitted after marshaling, when the divisor pair is in
8295/// R2:R3: `ORRS R12, R2, R3` — `BNE` over a `UDF #0` when nonzero.
8296fn emit_i64_divisor_zero_trap(bytes: &mut Vec<u8>) {
8297    bytes.extend_from_slice(&0xEA52u16.to_le_bytes()); // ORRS.W R12, R2, R3
8298    bytes.extend_from_slice(&0x0C03u16.to_le_bytes());
8299    bytes.extend_from_slice(&0xD100u16.to_le_bytes()); // BNE.N +0 (skip the UDF)
8300    bytes.extend_from_slice(&0xDE00u16.to_le_bytes()); // UDF #0 — divide by zero
8301}
8302
8303/// WASM `i64.div_s(INT64_MIN, -1)` must trap (Core §4.3.2 `idiv_s`: the
8304/// quotient +2^63 is unrepresentable), matching the i32 path's overflow
8305/// guard — #633: without it the core negated INT64_MIN onto itself and
8306/// silently returned INT64_MIN. Emitted after marshaling, when the dividend
8307/// pair is in R0:R1 and the divisor pair in R2:R3; R12 is encoder scratch.
8308///
8309/// div_s ONLY — `i64.rem_s(INT64_MIN, -1)` is defined as 0 and must NOT
8310/// trap (`irem_s`), so the I64RemS arm never calls this. 22 bytes,
8311/// register-independent (estimator contract, #498/#511).
8312fn emit_i64_divs_overflow_trap(bytes: &mut Vec<u8>) {
8313    // AND.W R12, R2, R3 — R12 == 0xFFFFFFFF iff divisor == -1
8314    bytes.extend_from_slice(&0xEA02u16.to_le_bytes());
8315    bytes.extend_from_slice(&0x0C03u16.to_le_bytes());
8316    // CMN.W R12, #1 — EQ iff both divisor words are all-ones
8317    bytes.extend_from_slice(&0xF11Cu16.to_le_bytes());
8318    bytes.extend_from_slice(&0x0F01u16.to_le_bytes());
8319    // BNE .no_trap
8320    bytes.extend_from_slice(&0xD105u16.to_le_bytes());
8321    // CMP R0, #0 — dividend lo word of INT64_MIN
8322    bytes.extend_from_slice(&0x2800u16.to_le_bytes());
8323    // BNE .no_trap
8324    bytes.extend_from_slice(&0xD103u16.to_le_bytes());
8325    // CMP.W R1, #0x80000000 — dividend hi word of INT64_MIN
8326    bytes.extend_from_slice(&0xF1B1u16.to_le_bytes());
8327    bytes.extend_from_slice(&0x4F00u16.to_le_bytes());
8328    // BNE .no_trap
8329    bytes.extend_from_slice(&0xD100u16.to_le_bytes());
8330    // UDF #0 — signed-division overflow
8331    bytes.extend_from_slice(&0xDE00u16.to_le_bytes());
8332    // .no_trap:
8333}
8334
8335// ======================================================================
8336// #615 — A32 (ARM-mode) twins of the #610 i64 fixed-ABI wrappers above.
8337// Identical register contract, A32 encodings: the multi-instruction i64
8338// cores (rotl/rotr, div/rem) compute in fixed low registers (value/dividend
8339// R0:R1, amount R2 / divisor R2:R3, result to R0:R1); the wrappers marshal
8340// the selector-assigned operand registers in and the result out, saving and
8341// restoring the caller-visible R0-R3 around the core.
8342// ======================================================================
8343
8344/// A32 steps 1+2: `STMDB SP!, {R0-R3}`, then marshal `srcs` into `R0..R<n>`
8345/// via individual stack pushes (`STR src, [SP, #-4]!` in reverse order, then
8346/// `LDR Ri, [SP], #4`). Every source is read before any fixed register is
8347/// written, so arbitrary source/target permutations are safe.
8348fn emit_a32_i64_fixed_abi_entry(bytes: &mut Vec<u8>, srcs: &[&Reg]) {
8349    debug_assert!(srcs.len() <= 4);
8350    let w = |bytes: &mut Vec<u8>, word: u32| bytes.extend_from_slice(&word.to_le_bytes());
8351    // PUSH {R0-R3} — save the caller-visible low registers.
8352    w(bytes, 0xE92D_000F);
8353    // STR src, [SP, #-4]! — push in reverse so srcs[0] ends up on top.
8354    for src in srcs.iter().rev() {
8355        w(bytes, 0xE52D_0004 | (reg_to_bits(src) << 12));
8356    }
8357    // LDR Ri, [SP], #4 — Ri := srcs[i].
8358    for i in 0..srcs.len() as u32 {
8359        w(bytes, 0xE49D_0004 | (i << 12));
8360    }
8361}
8362
8363/// A32 steps 4+5: move the core's R0:R1 result into the selector's rd pair,
8364/// then restore the R0-R3 saved by [`emit_a32_i64_fixed_abi_entry`], skipping
8365/// any register the result now lives in (its saved caller word is discarded).
8366fn emit_a32_i64_fixed_abi_exit(bytes: &mut Vec<u8>, rdlo: &Reg, rdhi: &Reg) -> Result<()> {
8367    let lo = reg_to_bits(rdlo);
8368    let hi = reg_to_bits(rdhi);
8369    if lo == 1 && hi == 0 {
8370        // A fully swapped pair would clobber one half in either MOV order.
8371        // Selector pairs are consecutive (lo, lo+1), so this cannot occur.
8372        return Err(synth_core::Error::synthesis(
8373            "i64 expansion: swapped result pair (rd_lo=R1, rd_hi=R0) is unsupported (#610)",
8374        ));
8375    }
8376    let w = |bytes: &mut Vec<u8>, word: u32| bytes.extend_from_slice(&word.to_le_bytes());
8377    let mov = |bytes: &mut Vec<u8>, rd: u32, rm: u32| w(bytes, 0xE1A0_0000 | (rd << 12) | rm);
8378    if hi == 0 {
8379        // rd_hi is R0: read R0 into rd_lo BEFORE overwriting R0 with R1.
8380        mov(bytes, lo, 0);
8381        mov(bytes, hi, 1);
8382    } else {
8383        // rd_lo may be R1: read R1 into rd_hi BEFORE overwriting R1 with R0.
8384        mov(bytes, hi, 1);
8385        mov(bytes, lo, 0);
8386    }
8387    for i in 0..4u32 {
8388        if i == lo || i == hi {
8389            // The result lives here — drop the saved caller word.
8390            w(bytes, 0xE28D_D004); // ADD SP, SP, #4
8391        } else {
8392            w(bytes, 0xE49D_0004 | (i << 12)); // LDR Ri, [SP], #4
8393        }
8394    }
8395    Ok(())
8396}
8397
8398/// A32 zero-divisor trap, emitted after marshaling when the divisor pair is
8399/// in R2:R3: `ORRS R12, R2, R3` sets Z iff the divisor is zero; `BNE` skips a
8400/// `UDF #0` (WASM div/rem-by-zero must trap, matching the Thumb-2 twin).
8401fn emit_a32_i64_divisor_zero_trap(bytes: &mut Vec<u8>) {
8402    let w = |bytes: &mut Vec<u8>, word: u32| bytes.extend_from_slice(&word.to_le_bytes());
8403    w(bytes, 0xE192_C003); // ORRS R12, R2, R3
8404    w(bytes, 0x1A00_0000); // BNE +1 insn (skip the UDF)
8405    w(bytes, 0xE7F0_00F0); // UDF #0 — divide by zero
8406}
8407
8408/// A32 twin of [`emit_i64_divs_overflow_trap`] (#633): trap on
8409/// `i64.div_s(INT64_MIN, -1)`. Conditional execution replaces the Thumb
8410/// branches — the CMPEQ chain leaves EQ set only when divisor == -1 AND
8411/// dividend == INT64_MIN. div_s only; rem_s must keep returning 0.
8412fn emit_a32_i64_divs_overflow_trap(bytes: &mut Vec<u8>) {
8413    let w = |bytes: &mut Vec<u8>, word: u32| bytes.extend_from_slice(&word.to_le_bytes());
8414    w(bytes, 0xE002_C003); // AND   R12, R2, R3 (== 0xFFFFFFFF iff divisor == -1)
8415    w(bytes, 0xE37C_0001); // CMN   R12, #1     (EQ iff divisor == -1)
8416    w(bytes, 0x0350_0000); // CMPEQ R0, #0      (EQ iff also dividend lo == 0)
8417    w(bytes, 0x0351_0102); // CMPEQ R1, #0x80000000 (EQ iff dividend == INT64_MIN)
8418    w(bytes, 0x1A00_0000); // BNE +1 insn (skip the UDF)
8419    w(bytes, 0xE7F0_00F0); // UDF #0 — signed-division overflow
8420}
8421
8422/// Fallible form of the `verify_reg_bits` contract. PC (R15) is not a valid
8423/// data operand for the Thumb-2 encodings that use this guard (SDIV/UDIV/MLS/…
8424/// are UNPREDICTABLE with PC). Synth's own codegen never emits PC there, but
8425/// the encoder must stay *total* over arbitrary `ArmOp` inputs — the fuzz
8426/// harness (`encoder_no_panic`) requires Ok-or-Err, never a panic. Pre-fix, the
8427/// `debug_assert` in `verify_reg_bits` aborted under `-Cdebug-assertions`.
8428/// Returns a typed Err instead. See #185.
8429fn reg_bits_checked(bits: u32) -> Result<()> {
8430    if bits > 14 {
8431        return Err(synth_core::Error::synthesis(format!(
8432            "register bits {bits} (PC/R15) is not a valid operand for this Thumb-2 encoding"
8433        )));
8434    }
8435    Ok(())
8436}
8437
8438/// Try to encode a 32-bit value as an ARM rotated immediate (imm8 ROR 2*rot4).
8439/// Returns Some((encoded_bits, 1)) if representable, None otherwise.
8440fn try_encode_rotated_imm(val: u32) -> Option<(u32, u32)> {
8441    if val == 0 {
8442        return Some((0, 1));
8443    }
8444    for rot in 0..16u32 {
8445        let shift = rot * 2;
8446        // Rotate left by shift (undo the ROR) to see if result fits in 8 bits
8447        let unrotated = val.rotate_left(shift);
8448        if unrotated <= 0xFF {
8449            // Encoded as: rot4(4 bits) | imm8(8 bits) = rotate_imm << 8 | imm8
8450            return Some(((rot << 8) | unrotated, 1));
8451        }
8452    }
8453    None
8454}
8455
8456/// Encode operand2 field and return (bits, immediate_flag).
8457/// For ARM32 mode, immediates use the rotated-immediate encoding (imm8 ROR 2*rot4).
8458/// Panics if an immediate value cannot be represented. Callers that need large
8459/// immediates should use MOVW/MOVT instead of Operand2::Imm.
8460fn encode_operand2(op2: &Operand2) -> Result<(u32, u32)> {
8461    match op2 {
8462        Operand2::Imm(val) => {
8463            let uval = *val as u32;
8464            // Attempt rotated-immediate encoding (ARM32 Operand2)
8465            if let Some(encoded) = try_encode_rotated_imm(uval) {
8466                Ok(encoded)
8467            } else {
8468                // #378-class honesty: an immediate that can't be expressed as an
8469                // ARM32 rotated immediate is an INTERNAL selector bug — large
8470                // constants must be materialized via MOVW/MOVT, not passed here.
8471                // FAIL HONESTLY with an Err rather than silently masking to
8472                // `uval & 0xFF` and emitting a WRONG immediate. The encoder is
8473                // Ok-or-Err, never corrupt (#180/#185); a loud Err is also why
8474                // this is an Err and not a panic (the `encoder_no_panic` fuzz
8475                // contract — malformed/oversized input must degrade, not crash).
8476                Err(synth_core::Error::synthesis(format!(
8477                    "encode_operand2: immediate {uval:#x} ({val}) is not an ARM32 \
8478                     rotated immediate — the selector must materialize large \
8479                     constants via MOVW/MOVT"
8480                )))
8481            }
8482        }
8483
8484        Operand2::Reg(reg) => {
8485            let reg_bits = reg_to_bits(reg);
8486            Ok((reg_bits, 0)) // I=0 for register
8487        }
8488
8489        Operand2::RegShift {
8490            rm,
8491            shift: _,
8492            amount,
8493        } => {
8494            // Simplified encoding with shift
8495            let rm_bits = reg_to_bits(rm);
8496            let shift_bits = (*amount & 0x1F) << 7;
8497            Ok((shift_bits | rm_bits, 0))
8498        }
8499    }
8500}
8501
8502/// Encode memory address to (base_reg, offset)
8503fn encode_mem_addr(addr: &MemAddr) -> (u32, u32) {
8504    let base_bits = reg_to_bits(&addr.base);
8505    let offset_bits = (addr.offset as u32) & 0xFFF; // 12-bit offset
8506    (base_bits, offset_bits)
8507}
8508
8509/// S-register number: S0=0, S1=1, ..., S31=31
8510fn vfp_sreg_to_num(reg: &VfpReg) -> Result<u32> {
8511    match reg {
8512        VfpReg::S0 => Ok(0),
8513        VfpReg::S1 => Ok(1),
8514        VfpReg::S2 => Ok(2),
8515        VfpReg::S3 => Ok(3),
8516        VfpReg::S4 => Ok(4),
8517        VfpReg::S5 => Ok(5),
8518        VfpReg::S6 => Ok(6),
8519        VfpReg::S7 => Ok(7),
8520        VfpReg::S8 => Ok(8),
8521        VfpReg::S9 => Ok(9),
8522        VfpReg::S10 => Ok(10),
8523        VfpReg::S11 => Ok(11),
8524        VfpReg::S12 => Ok(12),
8525        VfpReg::S13 => Ok(13),
8526        VfpReg::S14 => Ok(14),
8527        VfpReg::S15 => Ok(15),
8528        VfpReg::S16 => Ok(16),
8529        VfpReg::S17 => Ok(17),
8530        VfpReg::S18 => Ok(18),
8531        VfpReg::S19 => Ok(19),
8532        VfpReg::S20 => Ok(20),
8533        VfpReg::S21 => Ok(21),
8534        VfpReg::S22 => Ok(22),
8535        VfpReg::S23 => Ok(23),
8536        VfpReg::S24 => Ok(24),
8537        VfpReg::S25 => Ok(25),
8538        VfpReg::S26 => Ok(26),
8539        VfpReg::S27 => Ok(27),
8540        VfpReg::S28 => Ok(28),
8541        VfpReg::S29 => Ok(29),
8542        VfpReg::S30 => Ok(30),
8543        VfpReg::S31 => Ok(31),
8544        // D-registers are not used in F32 single-precision encodings
8545        _ => Err(synth_core::Error::SynthesisError(
8546            "D-register not supported in single-precision VFP encoding".to_string(),
8547        )),
8548    }
8549}
8550
8551/// D-register number: D0=0, D1=1, ..., D15=15
8552fn vfp_dreg_to_num(reg: &VfpReg) -> Result<u32> {
8553    match reg {
8554        VfpReg::D0 => Ok(0),
8555        VfpReg::D1 => Ok(1),
8556        VfpReg::D2 => Ok(2),
8557        VfpReg::D3 => Ok(3),
8558        VfpReg::D4 => Ok(4),
8559        VfpReg::D5 => Ok(5),
8560        VfpReg::D6 => Ok(6),
8561        VfpReg::D7 => Ok(7),
8562        VfpReg::D8 => Ok(8),
8563        VfpReg::D9 => Ok(9),
8564        VfpReg::D10 => Ok(10),
8565        VfpReg::D11 => Ok(11),
8566        VfpReg::D12 => Ok(12),
8567        VfpReg::D13 => Ok(13),
8568        VfpReg::D14 => Ok(14),
8569        VfpReg::D15 => Ok(15),
8570        // S-registers are not used in F64 double-precision encodings
8571        _ => Err(synth_core::Error::SynthesisError(
8572            "S-register not supported in double-precision VFP encoding".to_string(),
8573        )),
8574    }
8575}
8576
8577/// Split S-register into (Vx[3:0], qualifier_bit) for VFP encoding.
8578/// For an S-register number s: Vx = s >> 1, qualifier = s & 1.
8579/// The qualifier bit goes to D (bit 22), N (bit 7), or M (bit 5) depending on role.
8580fn encode_sreg(s: u32) -> (u32, u32) {
8581    (s >> 1, s & 1)
8582}
8583
8584/// Split D-register into (Vx[3:0], qualifier_bit) for VFP double-precision encoding.
8585/// For a D-register number d: Vx = d & 0xF, qualifier = (d >> 4) & 1.
8586/// For D0-D15, qualifier is always 0.
8587fn encode_dreg(d: u32) -> (u32, u32) {
8588    (d & 0xF, (d >> 4) & 1)
8589}
8590
8591/// Encode a VFP 3-register arithmetic instruction (VADD.F32, VSUB.F32, VMUL.F32, VDIV.F32).
8592/// Returns the full 32-bit instruction word.
8593///
8594/// VFP encoding: [cond 1110] [D opc1 Vn] [Vd 101 sz] [N opc2 M 0 Vm]
8595/// For single-precision (sz=0), coprocessor = 0xA (bits[11:8]).
8596fn encode_vfp_3reg(base: u32, sd: &VfpReg, sn: &VfpReg, sm: &VfpReg) -> Result<u32> {
8597    let sd_num = vfp_sreg_to_num(sd)?;
8598    let sn_num = vfp_sreg_to_num(sn)?;
8599    let sm_num = vfp_sreg_to_num(sm)?;
8600    let (vd, d) = encode_sreg(sd_num);
8601    let (vn, n) = encode_sreg(sn_num);
8602    let (vm, m) = encode_sreg(sm_num);
8603
8604    Ok(base | (d << 22) | (vn << 16) | (vd << 12) | (n << 7) | (m << 5) | vm)
8605}
8606
8607/// Encode a VFP 2-register instruction (VNEG.F32, VABS.F32, VSQRT.F32).
8608/// Returns the full 32-bit instruction word.
8609fn encode_vfp_2reg(base: u32, sd: &VfpReg, sm: &VfpReg) -> Result<u32> {
8610    let sd_num = vfp_sreg_to_num(sd)?;
8611    let sm_num = vfp_sreg_to_num(sm)?;
8612    let (vd, d) = encode_sreg(sd_num);
8613    let (vm, m) = encode_sreg(sm_num);
8614
8615    Ok(base | (d << 22) | (vd << 12) | (m << 5) | vm)
8616}
8617
8618/// Encode a VFP load/store (VLDR.F32 / VSTR.F32).
8619/// offset is in bytes and must be word-aligned; encoded as imm8 = offset/4.
8620/// U bit (bit 23) controls add/subtract offset.
8621fn encode_vfp_ldst(base: u32, sd: &VfpReg, addr: &MemAddr) -> Result<u32> {
8622    let sd_num = vfp_sreg_to_num(sd)?;
8623    let (vd, d) = encode_sreg(sd_num);
8624    let rn = reg_to_bits(&addr.base);
8625
8626    let offset = addr.offset;
8627    let u_bit = if offset >= 0 { 1u32 } else { 0u32 };
8628    let abs_offset = offset.unsigned_abs();
8629    let imm8 = (abs_offset / 4) & 0xFF;
8630
8631    Ok(base | (u_bit << 23) | (d << 22) | (rn << 16) | (vd << 12) | imm8)
8632}
8633
8634/// Encode VMOV between core register and S-register.
8635/// VMOV Sn, Rt: 0xEE00_0A10 | (Vn << 16) | (N << 7) | (Rt << 12)
8636/// VMOV Rt, Sn: 0xEE10_0A10 | (Vn << 16) | (N << 7) | (Rt << 12)
8637fn encode_vmov_core_sreg(to_sreg: bool, sreg: &VfpReg, core: &Reg) -> Result<u32> {
8638    let s_num = vfp_sreg_to_num(sreg)?;
8639    let (vn, n) = encode_sreg(s_num);
8640    let rt = reg_to_bits(core);
8641
8642    let base = if to_sreg { 0xEE000A10 } else { 0xEE100A10 };
8643    Ok(base | (vn << 16) | (rt << 12) | (n << 7))
8644}
8645
8646/// Encode a VFP 3-register double-precision instruction (VADD.F64, VSUB.F64, etc.).
8647/// For double-precision (sz=1), coprocessor = 0xB (bits[11:8]).
8648/// The base should have bit 8 = 1 for F64 (0xB suffix instead of 0xA).
8649fn encode_vfp_3reg_f64(base: u32, dd: &VfpReg, dn: &VfpReg, dm: &VfpReg) -> Result<u32> {
8650    let dd_num = vfp_dreg_to_num(dd)?;
8651    let dn_num = vfp_dreg_to_num(dn)?;
8652    let dm_num = vfp_dreg_to_num(dm)?;
8653    let (vd, d) = encode_dreg(dd_num);
8654    let (vn, n) = encode_dreg(dn_num);
8655    let (vm, m) = encode_dreg(dm_num);
8656
8657    Ok(base | (d << 22) | (vn << 16) | (vd << 12) | (n << 7) | (m << 5) | vm)
8658}
8659
8660/// Encode a VFP 2-register double-precision instruction (VNEG.F64, VABS.F64, VSQRT.F64).
8661fn encode_vfp_2reg_f64(base: u32, dd: &VfpReg, dm: &VfpReg) -> Result<u32> {
8662    let dd_num = vfp_dreg_to_num(dd)?;
8663    let dm_num = vfp_dreg_to_num(dm)?;
8664    let (vd, d) = encode_dreg(dd_num);
8665    let (vm, m) = encode_dreg(dm_num);
8666
8667    Ok(base | (d << 22) | (vd << 12) | (m << 5) | vm)
8668}
8669
8670/// Encode a VFP load/store for double-precision (VLDR.64 / VSTR.64).
8671/// offset is in bytes and must be word-aligned; encoded as imm8 = offset/4.
8672fn encode_vfp_ldst_f64(base: u32, dd: &VfpReg, addr: &MemAddr) -> Result<u32> {
8673    let dd_num = vfp_dreg_to_num(dd)?;
8674    let (vd, d) = encode_dreg(dd_num);
8675    let rn = reg_to_bits(&addr.base);
8676
8677    let offset = addr.offset;
8678    let u_bit = if offset >= 0 { 1u32 } else { 0u32 };
8679    let abs_offset = offset.unsigned_abs();
8680    let imm8 = (abs_offset / 4) & 0xFF;
8681
8682    Ok(base | (u_bit << 23) | (d << 22) | (rn << 16) | (vd << 12) | imm8)
8683}
8684
8685/// Encode VMOV between two core registers and a D-register.
8686/// VMOV Dm, Rt, Rt2: 0xEC40_0B10 | (Rt2 << 16) | (Rt << 12) | (M << 5) | Vm
8687/// VMOV Rt, Rt2, Dm: 0xEC50_0B10 | (Rt2 << 16) | (Rt << 12) | (M << 5) | Vm
8688fn encode_vmov_core_dreg(
8689    to_dreg: bool,
8690    dreg: &VfpReg,
8691    core_lo: &Reg,
8692    core_hi: &Reg,
8693) -> Result<u32> {
8694    let d_num = vfp_dreg_to_num(dreg)?;
8695    let (vm, m) = encode_dreg(d_num);
8696    let rt = reg_to_bits(core_lo);
8697    let rt2 = reg_to_bits(core_hi);
8698
8699    let base = if to_dreg { 0xEC400B10 } else { 0xEC500B10 };
8700    Ok(base | (rt2 << 16) | (rt << 12) | (m << 5) | vm)
8701}
8702
8703/// Emit a VFP 32-bit instruction as Thumb-2 bytes (two LE halfwords).
8704fn vfp_to_thumb_bytes(instr: u32) -> Vec<u8> {
8705    let hw1 = ((instr >> 16) & 0xFFFF) as u16;
8706    let hw2 = (instr & 0xFFFF) as u16;
8707    let mut bytes = hw1.to_le_bytes().to_vec();
8708    bytes.extend_from_slice(&hw2.to_le_bytes());
8709    bytes
8710}
8711
8712// ============================================================================
8713// Helium MVE encoding helpers
8714// ============================================================================
8715
8716/// Q-register number: Q0=0, Q1=1, ..., Q7=7
8717fn qreg_to_num(reg: &QReg) -> u32 {
8718    match reg {
8719        QReg::Q0 => 0,
8720        QReg::Q1 => 1,
8721        QReg::Q2 => 2,
8722        QReg::Q3 => 3,
8723        QReg::Q4 => 4,
8724        QReg::Q5 => 5,
8725        QReg::Q6 => 6,
8726        QReg::Q7 => 7,
8727    }
8728}
8729
8730/// MVE element size to encoding bits: S8=0b00, S16=0b01, S32=0b10
8731fn mve_size_bits(size: &MveSize) -> u32 {
8732    match size {
8733        MveSize::S8 => 0b00,
8734        MveSize::S16 => 0b01,
8735        MveSize::S32 => 0b10,
8736    }
8737}
8738
8739/// Encode MVE 3-register instruction.
8740/// Q-registers are encoded as D-register pairs: Q0=D0:D1, Q1=D2:D3, etc.
8741/// In NEON/MVE encoding, the Q-register uses D-register number = Qn * 2.
8742fn encode_mve_3reg(base: u32, qd: &QReg, qn: &QReg, qm: &QReg) -> u32 {
8743    let d = qreg_to_num(qd) * 2;
8744    let n = qreg_to_num(qn) * 2;
8745    let m = qreg_to_num(qm) * 2;
8746
8747    // Standard NEON/MVE 3-register encoding:
8748    // D bit (bit 22) = Vd[4], Vd[3:0] = bits [15:12]
8749    // N bit (bit 7)  = Vn[4], Vn[3:0] = bits [19:16]
8750    // M bit (bit 5)  = Vm[4], Vm[3:0] = bits [3:0]
8751    let vd = d & 0xF;
8752    let d_bit = (d >> 4) & 1;
8753    let vn = n & 0xF;
8754    let n_bit = (n >> 4) & 1;
8755    let vm = m & 0xF;
8756    let m_bit = (m >> 4) & 1;
8757
8758    base | (d_bit << 22) | (vn << 16) | (vd << 12) | (n_bit << 7) | (m_bit << 5) | vm
8759}
8760
8761/// Encode MVE 3-register bitwise instruction (VAND, VORR, VEOR, VBIC).
8762fn encode_mve_3reg_bitwise(base: u32, qd: &QReg, qn: &QReg, qm: &QReg) -> u32 {
8763    encode_mve_3reg(base, qd, qn, qm)
8764}
8765
8766/// Encode MVE VLDRW.32 Qd, [Rn, #offset]
8767/// Format: EC9x xxxx - contiguous load, word-sized elements
8768fn encode_mve_vldrw(qd: &QReg, addr: &MemAddr) -> u32 {
8769    let qd_enc = qreg_to_num(qd) * 2;
8770    let rn = reg_to_bits(&addr.base);
8771    let offset = addr.offset;
8772    let u_bit = if offset >= 0 { 1u32 } else { 0u32 };
8773    let abs_offset = offset.unsigned_abs();
8774    let imm7 = (abs_offset / 4) & 0x7F; // 7-bit word-aligned offset
8775
8776    // VLDRW.32 Qd, [Rn, #imm]: ED10 xx80 variant
8777    0xED100E80
8778        | (u_bit << 23)
8779        | ((qd_enc >> 4) << 22)
8780        | (rn << 16)
8781        | ((qd_enc & 0xF) << 12)
8782        | (imm7 & 0x7F)
8783}
8784
8785/// Encode MVE VSTRW.32 Qd, [Rn, #offset]
8786fn encode_mve_vstrw(qd: &QReg, addr: &MemAddr) -> u32 {
8787    let qd_enc = qreg_to_num(qd) * 2;
8788    let rn = reg_to_bits(&addr.base);
8789    let offset = addr.offset;
8790    let u_bit = if offset >= 0 { 1u32 } else { 0u32 };
8791    let abs_offset = offset.unsigned_abs();
8792    let imm7 = (abs_offset / 4) & 0x7F;
8793
8794    0xED000E80
8795        | (u_bit << 23)
8796        | ((qd_enc >> 4) << 22)
8797        | (rn << 16)
8798        | ((qd_enc & 0xF) << 12)
8799        | (imm7 & 0x7F)
8800}
8801
8802impl ArmEncoder {
8803    /// Encode MVE constant load: MOVW+MOVT+VMOV for each 32-bit word, then assemble Q-register
8804    fn encode_thumb_mve_const(&self, qd: &QReg, bytes: &[u8; 16]) -> Result<Vec<u8>> {
8805        let mut result = Vec::new();
8806        let qd_num = qreg_to_num(qd);
8807
8808        // Load each 32-bit word into R12 (temp) then VMOV into S-register
8809        for i in 0..4 {
8810            let word = u32::from_le_bytes([
8811                bytes[i * 4],
8812                bytes[i * 4 + 1],
8813                bytes[i * 4 + 2],
8814                bytes[i * 4 + 3],
8815            ]);
8816            let lo16 = word & 0xFFFF;
8817            let hi16 = (word >> 16) & 0xFFFF;
8818
8819            // MOVW R12, #lo16
8820            result.extend_from_slice(&self.encode_thumb32_movw_raw(12, lo16)?);
8821            // MOVT R12, #hi16
8822            if hi16 != 0 {
8823                result.extend_from_slice(&self.encode_thumb32_movt_raw(12, hi16)?);
8824            }
8825
8826            // VMOV Sn, R12 where Sn = Qd*4 + i
8827            let s_num = qd_num * 4 + i as u32;
8828            let (vn, n) = encode_sreg(s_num);
8829            let vmov: u32 = 0xEE000A10 | (vn << 16) | (12 << 12) | (n << 7);
8830            result.extend_from_slice(&vfp_to_thumb_bytes(vmov));
8831        }
8832
8833        Ok(result)
8834    }
8835
8836    /// Encode lane-wise f32 binary operation (VDIV, etc.) via S-register extraction
8837    fn encode_thumb_mve_lane_wise_f32_binop(
8838        &self,
8839        qd: &QReg,
8840        qn: &QReg,
8841        qm: &QReg,
8842        vfp_base: u32,
8843    ) -> Result<Vec<u8>> {
8844        let mut result = Vec::new();
8845        let qd_num = qreg_to_num(qd);
8846        let qn_num = qreg_to_num(qn);
8847        let qm_num = qreg_to_num(qm);
8848
8849        // For each lane 0..3: use S-registers directly (Q aliasing)
8850        for i in 0..4u32 {
8851            let sd = qd_num * 4 + i;
8852            let sn = qn_num * 4 + i;
8853            let sm = qm_num * 4 + i;
8854
8855            let (vd, d) = encode_sreg(sd);
8856            let (vn, n) = encode_sreg(sn);
8857            let (vm, m) = encode_sreg(sm);
8858
8859            let instr = vfp_base | (d << 22) | (vn << 16) | (vd << 12) | (n << 7) | (m << 5) | vm;
8860            result.extend_from_slice(&vfp_to_thumb_bytes(instr));
8861        }
8862
8863        Ok(result)
8864    }
8865
8866    /// Encode lane-wise f32 VSQRT via S-register extraction
8867    fn encode_thumb_mve_lane_wise_f32_sqrt(&self, qd: &QReg, qm: &QReg) -> Result<Vec<u8>> {
8868        let mut result = Vec::new();
8869        let qd_num = qreg_to_num(qd);
8870        let qm_num = qreg_to_num(qm);
8871
8872        // VSQRT.F32 base: 0xEEB10AC0
8873        for i in 0..4u32 {
8874            let sd = qd_num * 4 + i;
8875            let sm = qm_num * 4 + i;
8876
8877            let (vd, d) = encode_sreg(sd);
8878            let (vm, m) = encode_sreg(sm);
8879
8880            let instr: u32 = 0xEEB10AC0 | (d << 22) | (vd << 12) | (m << 5) | vm;
8881            result.extend_from_slice(&vfp_to_thumb_bytes(instr));
8882        }
8883
8884        Ok(result)
8885    }
8886}
8887
8888#[cfg(test)]
8889mod tests {
8890    use super::*;
8891
8892    #[test]
8893    fn test_encoder_creation() {
8894        let encoder_arm = ArmEncoder::new_arm32();
8895        assert!(!encoder_arm.thumb_mode);
8896
8897        let encoder_thumb = ArmEncoder::new_thumb2();
8898        assert!(encoder_thumb.thumb_mode);
8899    }
8900
8901    /// #204 WAKE-path regression: `SetCond` materialized 0/1 with the 16-bit
8902    /// `MOVS Rd,#imm` (T1), whose Rd field is 3 bits (R0–R7). For a high Rd
8903    /// (R8–R12) `rd_bits << 8` overflows bit 11, flipping the opcode MOVS→CMP
8904    /// (`0x2c00`), so the boolean was never written — gale's `has_waiter` kept a
8905    /// stale value and the binary-sem WAKE dispatch read garbage. High Rd must
8906    /// use the 32-bit `MOV.W` (T2). Verify the bytes, not the IR.
8907    /// #311: the SAME high-Rd MOVS→CMP transmutation as #204, but in the
8908    /// i64 comparison expansions (I64SetCond / I64SetCondZ) — missed by the
8909    /// #204 hardening. With rd=R8 the boolean died in the flags
8910    /// (`ite eq; cmpeq r0,#1; cmpne r0,#0`), so gale's packed-u64 select
8911    /// read a stale register on silicon. High Rd must take MOV.W / CMP.W.
8912    #[test]
8913    fn test_encode_i64setcond_high_reg_uses_mov_w_311() {
8914        use synth_synthesis::{ArmOp, Condition, Reg};
8915        let enc = ArmEncoder::new_thumb2();
8916        let bytes = enc
8917            .encode(&ArmOp::I64SetCond {
8918                rd: Reg::R8,
8919                rn_lo: Reg::R2,
8920                rn_hi: Reg::R3,
8921                rm_lo: Reg::R6,
8922                rm_hi: Reg::R7,
8923                cond: Condition::EQ,
8924            })
8925            .unwrap();
8926        // The 32-bit MOV.W immediate (T2) first halfword is 0xF04F; the
8927        // 16-bit transmuted forms would contain 0x2801/0x2800 (CMP r0,#1/#0).
8928        let halfwords: Vec<u16> = bytes
8929            .chunks(2)
8930            .map(|c| u16::from_le_bytes([c[0], c[1]]))
8931            .collect();
8932        assert!(
8933            halfwords.iter().filter(|&&h| h == 0xF04F).count() == 2,
8934            "high rd must use two MOV.W (T2) encodings, got {halfwords:04x?}"
8935        );
8936        assert!(
8937            !halfwords.contains(&0x2801) && !halfwords.contains(&0x2800),
8938            "no transmuted 16-bit CMP imm: {halfwords:04x?}"
8939        );
8940
8941        let bytes_z = enc
8942            .encode(&ArmOp::I64SetCondZ {
8943                rd: Reg::R8,
8944                rn_lo: Reg::R2,
8945                rn_hi: Reg::R3,
8946            })
8947            .unwrap();
8948        let hw_z: Vec<u16> = bytes_z
8949            .chunks(2)
8950            .map(|c| u16::from_le_bytes([c[0], c[1]]))
8951            .collect();
8952        assert!(
8953            hw_z.iter().filter(|&&h| h == 0xF04F).count() == 2,
8954            "SetCondZ high rd MOV.W: {hw_z:04x?}"
8955        );
8956        // CMP.W rd,#0 (T2) first halfword: 0xF1B0 | rd
8957        assert!(
8958            hw_z.contains(&(0xF1B0 | 8)),
8959            "SetCondZ high rd must use CMP.W: {hw_z:04x?}"
8960        );
8961    }
8962
8963    #[test]
8964    fn test_encode_setcond_high_reg_uses_mov_w_204() {
8965        use synth_synthesis::{ArmOp, Condition, Reg};
8966        let enc = ArmEncoder::new_thumb2();
8967        // R12 (high): must be ITE + MOV.W #1 + MOV.W #0, never a 16-bit MOVS/CMP.
8968        let hi = enc
8969            .encode(&ArmOp::SetCond {
8970                rd: Reg::R12,
8971                cond: Condition::NE,
8972            })
8973            .unwrap();
8974        assert_eq!(hi.len(), 10, "ITE(2) + MOV.W(4) + MOV.W(4): {hi:02x?}");
8975        // both value halfwords are MOV.W (0xF04F) — NOT the corrupt CMP (0x2c..).
8976        assert_eq!(&hi[2..4], &[0x4F, 0xF0], "then = MOV.W: {hi:02x?}");
8977        assert_eq!(&hi[6..8], &[0x4F, 0xF0], "else = MOV.W: {hi:02x?}");
8978        assert_eq!(hi[4] & 0x0F, 0x01, "then imm = #1");
8979        assert_eq!(hi[8] & 0x0F, 0x00, "else imm = #0");
8980        // Low Rd keeps the compact 16-bit MOVS form.
8981        let lo = enc
8982            .encode(&ArmOp::SetCond {
8983                rd: Reg::R0,
8984                cond: Condition::NE,
8985            })
8986            .unwrap();
8987        assert_eq!(lo.len(), 6, "ITE(2) + MOVS(2) + MOVS(2): {lo:02x?}");
8988        assert_eq!(lo[2..4], [0x01, 0x20], "then = MOVS R0,#1");
8989        assert_eq!(lo[4..6], [0x00, 0x20], "else = MOVS R0,#0");
8990    }
8991
8992    /// #209 Opt 1b: UMULL RdLo, RdHi, Rn, Rm encodes correctly on both ISAs.
8993    /// Thumb-2 T1: 1111 1011 1010 Rn | RdLo RdHi 0000 Rm.
8994    /// A32:        cond 0000 1000 RdHi RdLo Rm 1001 Rn.
8995    #[test]
8996    fn test_encode_umull_209b() {
8997        use synth_synthesis::{ArmOp, Reg};
8998        let op = ArmOp::Umull {
8999            rdlo: Reg::R4,
9000            rdhi: Reg::R5,
9001            rn: Reg::R0,
9002            rm: Reg::R3,
9003        };
9004        // Thumb-2: hw1 = 0xFBA0 | 0 = 0xFBA0; hw2 = (4<<12)|(5<<8)|3 = 0x4503.
9005        let t = ArmEncoder::new_thumb2().encode(&op).unwrap();
9006        assert_eq!(
9007            t,
9008            vec![0xA0, 0xFB, 0x03, 0x45],
9009            "umull r4,r5,r0,r3 (T2): {t:02x?}"
9010        );
9011        // A32: 0xE0800090 | (5<<16) | (4<<12) | (3<<8) | 0 = 0xE0854390.
9012        let a = ArmEncoder::new_arm32().encode(&op).unwrap();
9013        assert_eq!(
9014            a,
9015            0xE085_4390u32.to_le_bytes().to_vec(),
9016            "umull (A32): {a:02x?}"
9017        );
9018    }
9019
9020    /// #206 regression: the ARM32 (A32) `Ldr`/`Str` encoders fed `addr` through
9021    /// `encode_mem_addr`, which returns only the 12-bit immediate — so a register
9022    /// offset (`[rn, rm, #off]`) was silently dropped to `[rn, #off]`, sending
9023    /// the access to the wrong runtime address (silent miscompile on the default
9024    /// `--target arm`). A register offset must materialize `ip = rn + rm` and
9025    /// load from `[ip, #off]`. Verify the bytes.
9026    #[test]
9027    fn test_encode_arm32_indexed_load_keeps_index_206() {
9028        use synth_synthesis::{ArmOp, MemAddr, Reg};
9029        let enc = ArmEncoder::new_arm32();
9030        // ldr r0, [r11, r1, #8]  must NOT collapse to a single immediate ldr.
9031        let bytes = enc
9032            .encode(&ArmOp::Ldr {
9033                rd: Reg::R0,
9034                addr: MemAddr::reg_imm(Reg::R11, Reg::R1, 8),
9035            })
9036            .unwrap();
9037        assert_eq!(
9038            bytes.len(),
9039            8,
9040            "expected ADD ip + LDR (2 words): {bytes:02x?}"
9041        );
9042        let add = u32::from_le_bytes(bytes[0..4].try_into().unwrap());
9043        let ldr = u32::from_le_bytes(bytes[4..8].try_into().unwrap());
9044        // ADD ip, r11, r1  = 0xE08BC001
9045        assert_eq!(add, 0xE08B_C001, "ADD ip,r11,r1: {add:#010x}");
9046        // LDR r0, [ip, #8] = 0xE59C0008
9047        assert_eq!(ldr, 0xE59C_0008, "LDR r0,[ip,#8]: {ldr:#010x}");
9048        // A bare immediate ldr (the bug) would be 0xE59B0008 (base=r11) — reject.
9049        assert_ne!(ldr, 0xE59B_0008, "index must not be dropped");
9050    }
9051
9052    /// #594 regression: `call_indirect` on the A32 path (`--target cortex-r5`)
9053    /// was encoded as a literal NOP (0xE1A00000) — the call never happened and
9054    /// the function silently returned the leftover table-index value. The A32
9055    /// encoder must emit a real dispatch expansion, since #642 guarded by an
9056    /// inline bounds check:
9057    /// `MOVW r12, #size; CMP idx, r12; BLO +1; UDF;
9058    ///  MOV r12, idx, LSL #2; LDR r12, [r11, r12]; BLX r12`.
9059    #[test]
9060    fn test_encode_arm32_call_indirect_is_real_call_594() {
9061        use synth_synthesis::{ArmOp, Reg};
9062        let enc = ArmEncoder::new_arm32();
9063        let bytes = enc
9064            .encode(&ArmOp::CallIndirect {
9065                rd: Reg::R0,
9066                type_idx: 0,
9067                table_index_reg: Reg::R0,
9068                table_size: 4,
9069                table_byte_offset: 0,
9070                null_check: false,
9071                type_check: None,
9072            })
9073            .unwrap();
9074        assert_eq!(
9075            bytes.len(),
9076            28,
9077            "expected MOVW + CMP + BLO + UDF + MOV + LDR + BLX (7 words): {bytes:02x?}"
9078        );
9079        let words: Vec<u32> = bytes
9080            .chunks_exact(4)
9081            .map(|w| u32::from_le_bytes(w.try_into().unwrap()))
9082            .collect();
9083        // #642 bounds guard: MOVW r12, #4; CMP r0, r12; BLO +1; UDF
9084        assert_eq!(words[0], 0xE300_C004, "MOVW r12,#4: {:#010x}", words[0]);
9085        assert_eq!(words[1], 0xE150_000C, "CMP r0,r12: {:#010x}", words[1]);
9086        assert_eq!(words[2], 0x3A00_0000, "BLO +1 insn: {:#010x}", words[2]);
9087        assert_eq!(words[3], 0xE7F0_00F0, "UDF: {:#010x}", words[3]);
9088        // MOV r12, r0, LSL #2 = 0xE1A0C100
9089        assert_eq!(
9090            words[4], 0xE1A0_C100,
9091            "MOV r12,r0,LSL#2: {:#010x}",
9092            words[4]
9093        );
9094        // LDR r12, [r11, r12] = 0xE79BC00C
9095        assert_eq!(
9096            words[5], 0xE79B_C00C,
9097            "LDR r12,[r11,r12]: {:#010x}",
9098            words[5]
9099        );
9100        // BLX r12 = 0xE12FFF3C
9101        assert_eq!(words[6], 0xE12F_FF3C, "BLX r12: {:#010x}", words[6]);
9102        // The bug: a single NOP word. Must never come back.
9103        assert!(
9104            !bytes
9105                .chunks_exact(4)
9106                .any(|w| w == 0xE1A0_0000u32.to_le_bytes()),
9107            "call_indirect must not contain a NOP (#594): {bytes:02x?}"
9108        );
9109
9110        // A non-R0 index register lands in the MOV's Rm and CMP's Rn fields.
9111        let bytes = enc
9112            .encode(&ArmOp::CallIndirect {
9113                rd: Reg::R0,
9114                type_idx: 0,
9115                table_index_reg: Reg::R4,
9116                table_size: 4,
9117                table_byte_offset: 0,
9118                null_check: false,
9119                type_check: None,
9120            })
9121            .unwrap();
9122        let cmp = u32::from_le_bytes(bytes[4..8].try_into().unwrap());
9123        assert_eq!(cmp, 0xE154_000C, "CMP r4,r12: {cmp:#010x}");
9124        let mov = u32::from_le_bytes(bytes[16..20].try_into().unwrap());
9125        assert_eq!(mov, 0xE1A0_C104, "MOV r12,r4,LSL#2: {mov:#010x}");
9126    }
9127
9128    /// #642: a table size above 16 bits must not be silently truncated by the
9129    /// MOVW — the A32 guard adds a MOVT for the high half.
9130    #[test]
9131    fn test_encode_arm32_call_indirect_wide_table_size_642() {
9132        use synth_synthesis::{ArmOp, Reg};
9133        let enc = ArmEncoder::new_arm32();
9134        let bytes = enc
9135            .encode(&ArmOp::CallIndirect {
9136                rd: Reg::R0,
9137                type_idx: 0,
9138                table_index_reg: Reg::R0,
9139                table_size: 0x0002_0003,
9140                table_byte_offset: 0,
9141                null_check: false,
9142                type_check: None,
9143            })
9144            .unwrap();
9145        assert_eq!(bytes.len(), 32, "MOVT arm adds one word: {bytes:02x?}");
9146        let movw = u32::from_le_bytes(bytes[0..4].try_into().unwrap());
9147        let movt = u32::from_le_bytes(bytes[4..8].try_into().unwrap());
9148        assert_eq!(movw, 0xE300_C003, "MOVW r12,#3: {movw:#010x}");
9149        assert_eq!(movt, 0xE340_C002, "MOVT r12,#2: {movt:#010x}");
9150    }
9151
9152    /// #597 anchor (justified correctness RE-PIN of the #594-era freeze): the
9153    /// Thumb-2 `CallIndirect` expansion is `mov.w ip, rm, LSL #2; ldr.w ip,
9154    /// [r11, ip]; blx ip`.
9155    ///
9156    /// The #594 PR froze the then-current bytes `4F EA 20 0C ...` whose first
9157    /// word decodes as `mov.w ip, rm, ASR #32` — the intended `LSL #2` had
9158    /// its shift amount in the TYPE field (bits 5:4) instead of imm2 (bits
9159    /// 7:6), so the index was destroyed and every call_indirect dispatched
9160    /// table entry 0 (shipped miscompile, masked by index-0 probes). #597
9161    /// corrects the encoding; new bytes `4F EA 80 0C ...` were
9162    /// execution-validated under unicorn against the wasmtime oracle on a
9163    /// multi-entry table (indexes 0, 1, 3 —
9164    /// scripts/repro/call_indirect_597_differential.py) before this pin was
9165    /// replaced. Old pin: [4F EA 20 0C, 5B F8 0C C0, E0 47] (ASR #32 — must
9166    /// never come back).
9167    #[test]
9168    fn test_encode_thumb_call_indirect_lsl2_597() {
9169        use synth_synthesis::{ArmOp, Reg};
9170        let enc = ArmEncoder::new_thumb2();
9171        let bytes = enc
9172            .encode(&ArmOp::CallIndirect {
9173                rd: Reg::R0,
9174                type_idx: 0,
9175                table_index_reg: Reg::R0,
9176                table_size: 4,
9177                table_byte_offset: 0,
9178                null_check: false,
9179                type_check: None,
9180            })
9181            .unwrap();
9182        assert_eq!(
9183            bytes,
9184            vec![
9185                // #642 bounds guard: movw ip,#4; cmp r0,ip; blo +1; udf #0
9186                0x40, 0xF2, 0x04, 0x0C, // movw ip, #4
9187                0x60, 0x45, // cmp r0, ip
9188                0x00, 0xD3, // blo .+4 (skip the udf)
9189                0x00, 0xDE, // udf #0 — OOB index trap (WASM §4.4.8)
9190                // #597-pinned dispatch
9191                0x4F, 0xEA, 0x80, 0x0C, // mov.w ip, r0, lsl #2
9192                0x5B, 0xF8, 0x0C, 0xC0, // ldr.w ip, [r11, ip]
9193                0xE0, 0x47, // blx ip
9194            ],
9195            "Thumb-2 CallIndirect: bounds guard + mov.w/ldr.w/blx dispatch: {bytes:02x?}"
9196        );
9197        // The #597 bug bytes (ASR #32 dispatch first word) must never come back.
9198        assert!(
9199            !bytes.windows(4).any(|w| w == [0x4F, 0xEA, 0x20, 0x0C]),
9200            "mov.w ip, rm, ASR #32 — the #597 type-field bug"
9201        );
9202
9203        // A non-R0 index register lands in the mov.w's Rm field (hw2 bits 3:0)
9204        // and the cmp's Rn field.
9205        let bytes = enc
9206            .encode(&ArmOp::CallIndirect {
9207                rd: Reg::R0,
9208                type_idx: 0,
9209                table_index_reg: Reg::R4,
9210                table_size: 4,
9211                table_byte_offset: 0,
9212                null_check: false,
9213                type_check: None,
9214            })
9215            .unwrap();
9216        assert_eq!(&bytes[4..6], &[0x64, 0x45], "cmp r4, ip: {bytes:02x?}");
9217        assert_eq!(
9218            &bytes[10..14],
9219            &[0x4F, 0xEA, 0x84, 0x0C],
9220            "mov.w ip, r4, LSL #2: {bytes:02x?}"
9221        );
9222    }
9223
9224    /// #642: the Thumb-2 bounds guard for a high-register index (R8 — the top
9225    /// of the allocatable pool) uses the high-reg-capable 16-bit CMP (T2) with
9226    /// the N bit set; a table size above 16 bits adds a MOVT.
9227    #[test]
9228    fn test_encode_thumb_call_indirect_guard_shapes_642() {
9229        use synth_synthesis::{ArmOp, Reg};
9230        let enc = ArmEncoder::new_thumb2();
9231        let bytes = enc
9232            .encode(&ArmOp::CallIndirect {
9233                rd: Reg::R0,
9234                type_idx: 0,
9235                table_index_reg: Reg::R8,
9236                table_size: 3,
9237                table_byte_offset: 0,
9238                null_check: false,
9239                type_check: None,
9240            })
9241            .unwrap();
9242        // cmp r8, ip — T2: 0x4500 | N(1)<<7 | Rm(12)<<3 | Rn(0) = 0x45E0
9243        assert_eq!(&bytes[4..6], &[0xE0, 0x45], "cmp r8, ip: {bytes:02x?}");
9244
9245        let bytes = enc
9246            .encode(&ArmOp::CallIndirect {
9247                rd: Reg::R0,
9248                type_idx: 0,
9249                table_index_reg: Reg::R0,
9250                table_size: 0x0002_0003,
9251                table_byte_offset: 0,
9252                null_check: false,
9253                type_check: None,
9254            })
9255            .unwrap();
9256        // movw ip,#3 then movt ip,#2 — the size must not be truncated.
9257        assert_eq!(
9258            &bytes[0..8],
9259            &[0x40, 0xF2, 0x03, 0x0C, 0xC0, 0xF2, 0x02, 0x0C],
9260            "movw ip,#3; movt ip,#2: {bytes:02x?}"
9261        );
9262    }
9263
9264    /// #650: a non-zero table base offset (table N of the contiguous R11
9265    /// region) routes the Thumb-2 pointer load through
9266    /// `add.w ip, r11, ip; ldr.w ip, [ip, #offset]` — and offset 0 keeps the
9267    /// pre-#650 single-load bytes IDENTICAL (the by-construction pin).
9268    #[test]
9269    fn test_encode_thumb_call_indirect_table_offset_650() {
9270        use synth_synthesis::{ArmOp, Reg};
9271        let enc = ArmEncoder::new_thumb2();
9272        // falcon's fused-component shape: table 0 has 7 entries, so table 1
9273        // sits at byte offset 28.
9274        let bytes = enc
9275            .encode(&ArmOp::CallIndirect {
9276                rd: Reg::R0,
9277                type_idx: 0,
9278                table_index_reg: Reg::R1,
9279                table_size: 41,
9280                table_byte_offset: 28,
9281                null_check: false,
9282                type_check: None,
9283            })
9284            .unwrap();
9285        assert_eq!(
9286            bytes,
9287            vec![
9288                // #642 bounds guard against TABLE 1's OWN size (41)
9289                0x40, 0xF2, 0x29, 0x0C, // movw ip, #41
9290                0x61, 0x45, // cmp r1, ip
9291                0x00, 0xD3, // blo .+4 (skip the udf)
9292                0x00, 0xDE, // udf #0 — OOB trap (WASM §4.4.8)
9293                // dispatch through table 1's base (R11 + 28)
9294                0x4F, 0xEA, 0x81, 0x0C, // mov.w ip, r1, lsl #2
9295                0x0B, 0xEB, 0x0C, 0x0C, // add.w ip, r11, ip
9296                0xDC, 0xF8, 0x1C, 0xC0, // ldr.w ip, [ip, #28]
9297                0xE0, 0x47, // blx ip
9298            ],
9299            "Thumb-2 table-1 dispatch (#650): {bytes:02x?}"
9300        );
9301
9302        // Offset 0 must stay the #597-pinned single-load form (no add.w, no
9303        // imm-form ldr) — single-table byte identity by construction.
9304        let zero = enc
9305            .encode(&ArmOp::CallIndirect {
9306                rd: Reg::R0,
9307                type_idx: 0,
9308                table_index_reg: Reg::R1,
9309                table_size: 41,
9310                table_byte_offset: 0,
9311                null_check: false,
9312                type_check: None,
9313            })
9314            .unwrap();
9315        assert_eq!(
9316            &zero[10..],
9317            &[
9318                0x4F, 0xEA, 0x81, 0x0C, // mov.w ip, r1, lsl #2
9319                0x5B, 0xF8, 0x0C, 0xC0, // ldr.w ip, [r11, ip]
9320                0xE0, 0x47, // blx ip
9321            ],
9322            "offset 0 keeps the pre-#650 dispatch bytes: {zero:02x?}"
9323        );
9324    }
9325
9326    /// #650: the A32 twin — `add r12, r11, r12; ldr r12, [r12, #offset]` for
9327    /// a non-zero table base offset; offset 0 keeps the #594/#642 form.
9328    #[test]
9329    fn test_encode_arm32_call_indirect_table_offset_650() {
9330        use synth_synthesis::{ArmOp, Reg};
9331        let enc = ArmEncoder::new_arm32();
9332        let bytes = enc
9333            .encode(&ArmOp::CallIndirect {
9334                rd: Reg::R0,
9335                type_idx: 0,
9336                table_index_reg: Reg::R1,
9337                table_size: 41,
9338                table_byte_offset: 28,
9339                null_check: false,
9340                type_check: None,
9341            })
9342            .unwrap();
9343        let words: Vec<u32> = bytes
9344            .chunks_exact(4)
9345            .map(|w| u32::from_le_bytes(w.try_into().unwrap()))
9346            .collect();
9347        assert_eq!(words[0], 0xE300_C029, "MOVW r12,#41: {:#010x}", words[0]);
9348        assert_eq!(words[1], 0xE151_000C, "CMP r1,r12: {:#010x}", words[1]);
9349        assert_eq!(words[2], 0x3A00_0000, "BLO +1 insn: {:#010x}", words[2]);
9350        assert_eq!(words[3], 0xE7F0_00F0, "UDF: {:#010x}", words[3]);
9351        assert_eq!(
9352            words[4], 0xE1A0_C101,
9353            "MOV r12,r1,LSL#2: {:#010x}",
9354            words[4]
9355        );
9356        assert_eq!(
9357            words[5], 0xE08B_C00C,
9358            "ADD r12,r11,r12 (#650): {:#010x}",
9359            words[5]
9360        );
9361        assert_eq!(
9362            words[6], 0xE59C_C01C,
9363            "LDR r12,[r12,#28] (#650): {:#010x}",
9364            words[6]
9365        );
9366        assert_eq!(words[7], 0xE12F_FF3C, "BLX r12: {:#010x}", words[7]);
9367    }
9368
9369    /// #664: `null_check` inserts a null-funcref trap between the Thumb-2
9370    /// pointer load and the `BLX` (`cmp.w ip, #0; bne .+4; udf #0`) — a
9371    /// zero-linked (uninitialized) slot must TRAP (WASM §4.4.8), never
9372    /// branch to address 0. `null_check: false` keeps the expansion
9373    /// byte-identical to the pre-#664 form (by-construction pin).
9374    #[test]
9375    fn test_encode_thumb_call_indirect_null_check_664() {
9376        use synth_synthesis::{ArmOp, Reg};
9377        let enc = ArmEncoder::new_thumb2();
9378        let op = |null_check| ArmOp::CallIndirect {
9379            rd: Reg::R0,
9380            type_idx: 0,
9381            table_index_reg: Reg::R1,
9382            table_size: 4,
9383            table_byte_offset: 0,
9384            null_check,
9385            type_check: None,
9386        };
9387        let with = enc.encode(&op(true)).unwrap();
9388        let without = enc.encode(&op(false)).unwrap();
9389        // The checked form = the unchecked form with EXACTLY the three-insn
9390        // null check spliced in before the final BLX (byte identity of the
9391        // shared prefix/suffix — nothing else may move).
9392        assert_eq!(
9393            with.len(),
9394            without.len() + 8,
9395            "cmp.w (4) + bne (2) + udf (2): {with:02x?}"
9396        );
9397        let blx_at = without.len() - 2;
9398        assert_eq!(&with[..blx_at], &without[..blx_at], "shared prefix");
9399        assert_eq!(
9400            &with[blx_at..],
9401            &[
9402                0xBC, 0xF1, 0x00, 0x0F, // cmp.w ip, #0
9403                0x00, 0xD1, // bne .+4 (skip the udf)
9404                0x00, 0xDE, // udf #0 — null-funcref trap (#664)
9405                0xE0, 0x47, // blx ip
9406            ],
9407            "null check precedes the BLX: {with:02x?}"
9408        );
9409        assert_eq!(&with[with.len() - 2..], &without[blx_at..], "same BLX");
9410    }
9411
9412    /// #664: the A32 twin — `cmp r12, #0; bne .+8; udf` before the `BLX`;
9413    /// `null_check: false` keeps the #594/#642/#650 bytes identical.
9414    #[test]
9415    fn test_encode_arm32_call_indirect_null_check_664() {
9416        use synth_synthesis::{ArmOp, Reg};
9417        let enc = ArmEncoder::new_arm32();
9418        let op = |null_check| ArmOp::CallIndirect {
9419            rd: Reg::R0,
9420            type_idx: 0,
9421            table_index_reg: Reg::R1,
9422            table_size: 4,
9423            table_byte_offset: 0,
9424            null_check,
9425            type_check: None,
9426        };
9427        let with = enc.encode(&op(true)).unwrap();
9428        let without = enc.encode(&op(false)).unwrap();
9429        assert_eq!(with.len(), without.len() + 12, "3 A32 words: {with:02x?}");
9430        let blx_at = without.len() - 4;
9431        assert_eq!(&with[..blx_at], &without[..blx_at], "shared prefix");
9432        let words: Vec<u32> = with[blx_at..]
9433            .chunks_exact(4)
9434            .map(|w| u32::from_le_bytes(w.try_into().unwrap()))
9435            .collect();
9436        assert_eq!(words[0], 0xE35C_0000, "CMP r12,#0: {:#010x}", words[0]);
9437        assert_eq!(words[1], 0x1A00_0000, "BNE +1 insn: {:#010x}", words[1]);
9438        assert_eq!(words[2], 0xE7F0_00F0, "UDF (null trap): {:#010x}", words[2]);
9439        assert_eq!(words[3], 0xE12F_FF3C, "BLX r12: {:#010x}", words[3]);
9440    }
9441
9442    /// #676: `type_check` splices the runtime type check — scale the index,
9443    /// load the slot's structural class id from the type-id sidecar
9444    /// (`ldr.w ip, [ip, #type_off]`), compare against the expected class id
9445    /// and trap on mismatch (WASM §4.4.8) — between the bounds guard and
9446    /// the dispatch tail. `type_check: None` keeps the expansion
9447    /// byte-identical to the pre-#676 form (by-construction pin, the same
9448    /// trick as #650 offset-0 / #664 `null_check: false`).
9449    #[test]
9450    fn test_encode_thumb_call_indirect_type_check_676() {
9451        use synth_synthesis::{ArmOp, Reg};
9452        let enc = ArmEncoder::new_thumb2();
9453        let op = |type_check| ArmOp::CallIndirect {
9454            rd: Reg::R0,
9455            type_idx: 1,
9456            table_index_reg: Reg::R1,
9457            table_size: 5,
9458            table_byte_offset: 0,
9459            null_check: false,
9460            type_check,
9461        };
9462        let with = enc.encode(&op(Some((2, 20)))).unwrap();
9463        let without = enc.encode(&op(None)).unwrap();
9464        // The checked form = the unchecked form with EXACTLY the six-insn
9465        // type check spliced in after the bounds guard (byte identity of
9466        // the shared prefix/suffix — nothing else may move).
9467        assert_eq!(
9468            with.len(),
9469            without.len() + 20,
9470            "lsl.w(4)+add.w(4)+ldr.w(4)+cmp.w(4)+beq(2)+udf(2): {with:02x?}"
9471        );
9472        // Bounds guard: movw(4) + cmp(2) + blo(2) + udf(2) = 10 bytes.
9473        let guard_end = 10;
9474        assert_eq!(&with[..guard_end], &without[..guard_end], "shared guard");
9475        assert_eq!(
9476            &with[guard_end..guard_end + 20],
9477            &[
9478                0x4F, 0xEA, 0x81, 0x0C, // mov.w ip, r1, lsl #2
9479                0x0B, 0xEB, 0x0C, 0x0C, // add.w ip, r11, ip
9480                0xDC, 0xF8, 0x14, 0xC0, // ldr.w ip, [ip, #20] — sidecar slot id
9481                0xBC, 0xF1, 0x02, 0x0F, // cmp.w ip, #2 — expected class id
9482                0x00, 0xD0, // beq .+4 (skip the udf on a match)
9483                0x00, 0xDE, // udf #0 — §4.4.8 type-mismatch trap (#676)
9484            ],
9485            "type check follows the bounds guard: {with:02x?}"
9486        );
9487        assert_eq!(
9488            &with[guard_end + 20..],
9489            &without[guard_end..],
9490            "dispatch tail unchanged (idx*4 recomputed)"
9491        );
9492    }
9493
9494    /// #676: the A32 twin — `mov r12, idx, lsl #2; add r12, r11, r12;
9495    /// ldr r12, [r12, #type_off]; cmp r12, #id; beq .+8; udf` after the
9496    /// bounds guard; `type_check: None` keeps the #594/#642/#650/#664
9497    /// bytes identical.
9498    #[test]
9499    fn test_encode_arm32_call_indirect_type_check_676() {
9500        use synth_synthesis::{ArmOp, Reg};
9501        let enc = ArmEncoder::new_arm32();
9502        let op = |type_check| ArmOp::CallIndirect {
9503            rd: Reg::R0,
9504            type_idx: 1,
9505            table_index_reg: Reg::R1,
9506            table_size: 5,
9507            table_byte_offset: 0,
9508            null_check: false,
9509            type_check,
9510        };
9511        let with = enc.encode(&op(Some((2, 20)))).unwrap();
9512        let without = enc.encode(&op(None)).unwrap();
9513        assert_eq!(with.len(), without.len() + 24, "6 A32 words: {with:02x?}");
9514        // Bounds guard: movw + cmp + blo + udf = 4 words = 16 bytes.
9515        let guard_end = 16;
9516        assert_eq!(&with[..guard_end], &without[..guard_end], "shared guard");
9517        let words: Vec<u32> = with[guard_end..guard_end + 24]
9518            .chunks_exact(4)
9519            .map(|w| u32::from_le_bytes(w.try_into().unwrap()))
9520            .collect();
9521        assert_eq!(
9522            words[0], 0xE1A0_C101,
9523            "MOV r12,r1,LSL#2: {:#010x}",
9524            words[0]
9525        );
9526        assert_eq!(words[1], 0xE08B_C00C, "ADD r12,r11,r12: {:#010x}", words[1]);
9527        assert_eq!(
9528            words[2], 0xE59C_C014,
9529            "LDR r12,[r12,#20] (sidecar): {:#010x}",
9530            words[2]
9531        );
9532        assert_eq!(
9533            words[3], 0xE35C_0002,
9534            "CMP r12,#2 (expected class id): {:#010x}",
9535            words[3]
9536        );
9537        assert_eq!(words[4], 0x0A00_0000, "BEQ +1 insn: {:#010x}", words[4]);
9538        assert_eq!(
9539            words[5], 0xE7F0_00F0,
9540            "UDF (type-mismatch trap): {:#010x}",
9541            words[5]
9542        );
9543        assert_eq!(
9544            &with[guard_end + 24..],
9545            &without[guard_end..],
9546            "dispatch tail unchanged"
9547        );
9548    }
9549
9550    /// #178/#180 regression: the Thumb `Add`/`Adds`/`Subs` reg-forms used the
9551    /// 16-bit encoding unconditionally. For high registers (R12 base scratch,
9552    /// R8-R11 i64 pairs) the 3-bit register fields overflow and corrupt the
9553    /// operands — `add ip,ip,r0` came out as `adds r4,r5,r1` (0x186C), silently
9554    /// dropping the address operand and miscompiling every optimized memory
9555    /// access. High registers must use the 32-bit `.W` forms.
9556    #[test]
9557    fn test_encode_thumb_add_high_reg_uses_add_w_178_180() {
9558        let encoder = ArmEncoder::new_thumb2();
9559
9560        // add ip, ip, r0  — the exact MemLoad/MemStore base+addr op.
9561        let code = encoder
9562            .encode(&ArmOp::Add {
9563                rd: Reg::R12,
9564                rn: Reg::R12,
9565                op2: Operand2::Reg(Reg::R0),
9566            })
9567            .unwrap();
9568        // ADD.W ip, ip, r0 = EB0C 0C00 (little-endian halfwords).
9569        assert_eq!(
9570            code,
9571            vec![0x0C, 0xEB, 0x00, 0x0C],
9572            "high-reg Thumb ADD must be 32-bit ADD.W (EB0C 0C00), not corrupt 16-bit; got {code:02X?}"
9573        );
9574        // Must NOT be the buggy 16-bit 0x186C (`adds r4,r5,r1`).
9575        assert_ne!(code, vec![0x6C, 0x18], "regressed to corrupt 16-bit ADDS");
9576
9577        // Low-register add stays 16-bit (no regression for the common case).
9578        let lo = encoder
9579            .encode(&ArmOp::Add {
9580                rd: Reg::R1,
9581                rn: Reg::R2,
9582                op2: Operand2::Reg(Reg::R3),
9583            })
9584            .unwrap();
9585        assert_eq!(
9586            lo.len(),
9587            2,
9588            "low-reg ADD should remain 16-bit, got {lo:02X?}"
9589        );
9590    }
9591
9592    /// #178/#180 sibling: i64 low-word `Adds`/`Subs` can land in R8-R11 pairs;
9593    /// those must fall back to 32-bit ADDS.W/SUBS.W (flag-setting preserved).
9594    #[test]
9595    fn test_encode_thumb_adds_subs_high_reg_use_32bit_178_180() {
9596        let encoder = ArmEncoder::new_thumb2();
9597
9598        // adds r10, r10, r8  → ADDS.W = EB1A 0A08
9599        let adds = encoder
9600            .encode(&ArmOp::Adds {
9601                rd: Reg::R10,
9602                rn: Reg::R10,
9603                op2: Operand2::Reg(Reg::R8),
9604            })
9605            .unwrap();
9606        assert_eq!(
9607            adds,
9608            vec![0x1A, 0xEB, 0x08, 0x0A],
9609            "high-reg ADDS must be 32-bit ADDS.W (EB1A 0A08); got {adds:02X?}"
9610        );
9611
9612        // subs r10, r10, r8  → SUBS.W = EBBA 0A08
9613        let subs = encoder
9614            .encode(&ArmOp::Subs {
9615                rd: Reg::R10,
9616                rn: Reg::R10,
9617                op2: Operand2::Reg(Reg::R8),
9618            })
9619            .unwrap();
9620        assert_eq!(
9621            subs,
9622            vec![0xBA, 0xEB, 0x08, 0x0A],
9623            "high-reg SUBS must be 32-bit SUBS.W (EBBA 0A08); got {subs:02X?}"
9624        );
9625    }
9626
9627    /// #184 (sibling of #180): 16-bit CMN (T1) only encodes R0-R7. High registers
9628    /// must use 32-bit CMN.W, not the corrupt truncated 16-bit form.
9629    #[test]
9630    fn test_encode_thumb_cmn_high_reg_uses_cmn_w_184() {
9631        let encoder = ArmEncoder::new_thumb2();
9632
9633        // cmn r10, r8  → CMN.W = EB1A 0F08 (ADD.W S=1, Rd=PC discarded).
9634        let cmn = encoder
9635            .encode(&ArmOp::Cmn {
9636                rn: Reg::R10,
9637                op2: Operand2::Reg(Reg::R8),
9638            })
9639            .unwrap();
9640        assert_eq!(
9641            cmn,
9642            vec![0x1A, 0xEB, 0x08, 0x0F],
9643            "high-reg CMN must be 32-bit CMN.W (EB1A 0F08); got {cmn:02X?}"
9644        );
9645
9646        // Low registers stay 16-bit: cmn r1, r2 = 0x42D1.
9647        let lo = encoder
9648            .encode(&ArmOp::Cmn {
9649                rn: Reg::R1,
9650                op2: Operand2::Reg(Reg::R2),
9651            })
9652            .unwrap();
9653        assert_eq!(
9654            lo.len(),
9655            2,
9656            "low-reg CMN should remain 16-bit, got {lo:02X?}"
9657        );
9658        assert_eq!(lo, vec![0xD1, 0x42], "low-reg CMN bytes wrong: {lo:02X?}");
9659    }
9660
9661    /// #185 regression: feeding PC (R15) as a data operand to a Thumb-2 op that
9662    /// guards its registers must return Err, not panic under debug-assertions.
9663    /// (Synth never emits PC here; the fuzz harness requires encode() be total.)
9664    #[test]
9665    fn test_encode_pc_operand_returns_err_not_panic_185() {
9666        let encoder = ArmEncoder::new_thumb2();
9667        for op in [
9668            ArmOp::Sdiv {
9669                rd: Reg::PC,
9670                rn: Reg::R0,
9671                rm: Reg::R1,
9672            },
9673            ArmOp::Udiv {
9674                rd: Reg::R0,
9675                rn: Reg::PC,
9676                rm: Reg::R1,
9677            },
9678            ArmOp::Sdiv {
9679                rd: Reg::R0,
9680                rn: Reg::R1,
9681                rm: Reg::PC,
9682            },
9683        ] {
9684            let r = encoder.encode(&op);
9685            assert!(
9686                r.is_err(),
9687                "encode({op:?}) must return Err for a PC operand, got {r:?}"
9688            );
9689        }
9690        // Valid registers still encode fine (no false rejection).
9691        assert!(
9692            encoder
9693                .encode(&ArmOp::Sdiv {
9694                    rd: Reg::R0,
9695                    rn: Reg::R1,
9696                    rm: Reg::R2
9697                })
9698                .is_ok()
9699        );
9700    }
9701
9702    #[test]
9703    fn test_encode_nop_arm32() {
9704        let encoder = ArmEncoder::new_arm32();
9705        let code = encoder.encode(&ArmOp::Nop).unwrap();
9706
9707        assert_eq!(code.len(), 4); // ARM32 instructions are 4 bytes
9708        assert_eq!(code, vec![0x00, 0x00, 0xA0, 0xE1]); // MOV R0, R0
9709    }
9710
9711    #[test]
9712    fn test_encode_nop_thumb() {
9713        let encoder = ArmEncoder::new_thumb2();
9714        let code = encoder.encode(&ArmOp::Nop).unwrap();
9715
9716        assert_eq!(code.len(), 2); // Thumb instructions are 2 bytes
9717        assert_eq!(code, vec![0x00, 0xBF]); // NOP
9718    }
9719
9720    #[test]
9721    fn test_encode_mov_immediate_arm32() {
9722        let encoder = ArmEncoder::new_arm32();
9723        let op = ArmOp::Mov {
9724            rd: Reg::R0,
9725            op2: Operand2::Imm(42),
9726        };
9727
9728        let code = encoder.encode(&op).unwrap();
9729        assert_eq!(code.len(), 4);
9730
9731        // Verify it's a MOV instruction (bits should have immediate flag set)
9732        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
9733        assert_eq!(instr & 0x0E000000, 0x02000000); // Check I bit is set
9734    }
9735
9736    #[test]
9737    fn test_encode_add_registers_arm32() {
9738        let encoder = ArmEncoder::new_arm32();
9739        let op = ArmOp::Add {
9740            rd: Reg::R0,
9741            rn: Reg::R1,
9742            op2: Operand2::Reg(Reg::R2),
9743        };
9744
9745        let code = encoder.encode(&op).unwrap();
9746        assert_eq!(code.len(), 4);
9747
9748        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
9749        // Verify it's an ADD instruction with correct opcode
9750        assert_eq!(instr & 0x0FE00000, 0x00800000);
9751    }
9752
9753    /// #350 — `encode_thumb32_add_imm` must lower an out-of-range immediate
9754    /// (> 0xFFF) to a legal MOVW(/MOVT) + ADD.W-register sequence instead of
9755    /// erroring. The small-imm fast path (imm <= 0xFFF) stays byte-identical.
9756    #[test]
9757    fn test_encode_add_imm_large_350() {
9758        let enc = ArmEncoder::new_thumb2();
9759
9760        // --- Fast path: imm <= 0xFFF is a single 4-byte instruction, and the
9761        // VALUE must be right (#681: this test used to assert only the length,
9762        // letting the raw-packed T3 mis-encoding of 0x123 pass CI). 0x123 is
9763        // not ThumbExpandImm-representable, so it must be ADDW (T4, plain
9764        // imm12): clang `addw r0, r1, #0x123` = f201 0023.
9765        let small = enc
9766            .encode_thumb32_add_imm(&Reg::R0, &Reg::R1, 0x123)
9767            .unwrap();
9768        assert_eq!(small, vec![0x01, 0xF2, 0x23, 0x10], "ADDW r0, r1, #0x123");
9769
9770        // helper: decode a Thumb-2 MOVW/MOVT halfword pair back to its imm16
9771        fn movx_imm16(b: &[u8]) -> u32 {
9772            let hw1 = u16::from_le_bytes([b[0], b[1]]) as u32;
9773            let hw2 = u16::from_le_bytes([b[2], b[3]]) as u32;
9774            let imm4 = hw1 & 0xF;
9775            let i = (hw1 >> 10) & 1;
9776            let imm3 = (hw2 >> 12) & 0x7;
9777            let imm8 = hw2 & 0xFF;
9778            (imm4 << 12) | (i << 11) | (imm3 << 8) | imm8
9779        }
9780        fn movx_rd(b: &[u8]) -> u32 {
9781            (u16::from_le_bytes([b[2], b[3]]) as u32 >> 8) & 0xF
9782        }
9783
9784        // --- rd != rn: scratch is rd. imm = 70000 = 0x11170 needs MOVW+MOVT. ---
9785        // 0x11170: lo16 = 0x1170, hi16 = 0x0001
9786        let seq = enc
9787            .encode_thumb32_add_imm(&Reg::R12, &Reg::R0, 70000)
9788            .unwrap();
9789        assert_eq!(seq.len(), 12, "MOVW + MOVT + ADD = 12 bytes");
9790        // MOVW r12, #0x1170
9791        assert_eq!(u16::from_le_bytes([seq[0], seq[1]]) & 0xFBF0, 0xF240);
9792        assert_eq!(movx_rd(&seq[0..4]), 12);
9793        assert_eq!(movx_imm16(&seq[0..4]), 0x1170);
9794        // MOVT r12, #0x0001
9795        assert_eq!(u16::from_le_bytes([seq[4], seq[5]]) & 0xFBF0, 0xF2C0);
9796        assert_eq!(movx_rd(&seq[4..8]), 12);
9797        assert_eq!(movx_imm16(&seq[4..8]), 0x0001);
9798        // ADD.W r12, r0, r12  (EB00 | rn=0 ; rd=12, rm=12)
9799        let add1 = u16::from_le_bytes([seq[8], seq[9]]) as u32;
9800        let add2 = u16::from_le_bytes([seq[10], seq[11]]) as u32;
9801        assert_eq!(add1 & 0xFFF0, 0xEB00);
9802        assert_eq!(add1 & 0xF, 0); // rn = r0
9803        assert_eq!((add2 >> 8) & 0xF, 12); // rd = r12
9804        assert_eq!(add2 & 0xF, 12); // rm = scratch = r12
9805        // The materialized scratch must reconstruct exactly 70000.
9806        assert_eq!(
9807            (movx_imm16(&seq[4..8]) << 16) | movx_imm16(&seq[0..4]),
9808            70000
9809        );
9810
9811        // --- imm <= 0xFFFF: MOVT is skipped (MOVW + ADD = 8 bytes). ---
9812        let seq16 = enc
9813            .encode_thumb32_add_imm(&Reg::R3, &Reg::R0, 0xABCD)
9814            .unwrap();
9815        assert_eq!(seq16.len(), 8, "imm <= 0xFFFF skips MOVT");
9816        assert_eq!(movx_imm16(&seq16[0..4]), 0xABCD);
9817        assert_eq!(movx_rd(&seq16[0..4]), 3); // scratch = rd = r3
9818
9819        // --- rd == rn (in-place add): scratch must be R12, not rd. ---
9820        // imm = 0x12345: lo16 = 0x2345, hi16 = 0x0001
9821        let inplace = enc
9822            .encode_thumb32_add_imm(&Reg::R5, &Reg::R5, 0x12345)
9823            .unwrap();
9824        assert_eq!(inplace.len(), 12);
9825        assert_eq!(movx_rd(&inplace[0..4]), 12, "rd==rn must use R12 scratch");
9826        assert_eq!(
9827            (movx_imm16(&inplace[4..8]) << 16) | movx_imm16(&inplace[0..4]),
9828            0x12345
9829        );
9830        // ADD.W r5, r5, r12 — rm must be the scratch (12), never rn.
9831        let ip_add2 = u16::from_le_bytes([inplace[10], inplace[11]]) as u32;
9832        assert_eq!(ip_add2 & 0xF, 12);
9833        assert_eq!((ip_add2 >> 8) & 0xF, 5);
9834    }
9835
9836    /// #681 — `encode_thumb32_add_imm` packed a RAW immediate into the T3
9837    /// ADD.W `i:imm3:imm8` field, which is a ThumbExpandImm MODIFIED immediate:
9838    /// ThumbExpandImm(0x200) = 0, ThumbExpandImm(0x400) = 0x8000_0000. Every
9839    /// dynamic-address load/store with a static offset in 0x100..=0xFFF
9840    /// computed a wrong address (and bypassed --safety-bounds software: the
9841    /// guard checked the intended address, the access used the mis-encoded
9842    /// one). Fix: imm <= 0xFF keeps T3 (raw == expanded there, bit-identical);
9843    /// 0x100..=0xFFF uses ADDW (T4, plain imm12) — same lowering
9844    /// `encode_thumb32_add` already uses per #253.
9845    ///
9846    /// Every expected byte sequence below is pinned against clang
9847    /// (`-target thumbv7m-none-eabi`) output, bit-for-bit (#544 pattern).
9848    #[test]
9849    fn test_encode_add_imm_thumb_expand_681() {
9850        let enc = ArmEncoder::new_thumb2();
9851        let add = |rd: &Reg, rn: &Reg, imm: u32| enc.encode_thumb32_add_imm(rd, rn, imm).unwrap();
9852
9853        // imm <= 0xFF stays T3 ADD.W (raw == ThumbExpandImm-expanded):
9854        // clang: add.w r12, r0, #0xff  = f100 0cff
9855        assert_eq!(add(&Reg::R12, &Reg::R0, 0xFF), vec![0x00, 0xF1, 0xFF, 0x0C]);
9856
9857        // 0x100..=0xFFF must be ADDW (T4, plain imm12). The old T3 raw packing
9858        // decoded as +0 (0x100/0x200), +0x80000000 (0x400), etc.
9859        // clang: addw r12, r0, #0x100 = f200 1c00
9860        assert_eq!(
9861            add(&Reg::R12, &Reg::R0, 0x100),
9862            vec![0x00, 0xF2, 0x00, 0x1C]
9863        );
9864        // clang: addw r12, r0, #0x104 = f200 1c04
9865        assert_eq!(
9866            add(&Reg::R12, &Reg::R0, 0x104),
9867            vec![0x00, 0xF2, 0x04, 0x1C]
9868        );
9869        // clang: addw r12, r0, #0x200 = f200 2c00
9870        assert_eq!(
9871            add(&Reg::R12, &Reg::R0, 0x200),
9872            vec![0x00, 0xF2, 0x00, 0x2C]
9873        );
9874        // clang: addw r12, r0, #0x3fc = f200 3cfc
9875        assert_eq!(
9876            add(&Reg::R12, &Reg::R0, 0x3FC),
9877            vec![0x00, 0xF2, 0xFC, 0x3C]
9878        );
9879        // clang: addw r12, r0, #0x400 = f200 4c00
9880        assert_eq!(
9881            add(&Reg::R12, &Reg::R0, 0x400),
9882            vec![0x00, 0xF2, 0x00, 0x4C]
9883        );
9884        // clang: addw r12, r0, #0xfff = f600 7cff
9885        assert_eq!(
9886            add(&Reg::R12, &Reg::R0, 0xFFF),
9887            vec![0x00, 0xF6, 0xFF, 0x7C]
9888        );
9889        // Non-scratch rd/rn — clang: addw r1, r2, #0x104 = f202 1104
9890        assert_eq!(add(&Reg::R1, &Reg::R2, 0x104), vec![0x02, 0xF2, 0x04, 0x11]);
9891    }
9892
9893    /// #681 class audit — the T2 RSB and AND.W immediate fields are also
9894    /// ThumbExpandImm-coded and were raw-packed. Neither has a plain-imm12
9895    /// (T4-style) form, so a non-representable immediate must Err loudly
9896    /// (#253/#255/#378 class: never silently encode a different constant).
9897    /// Existing emitters only use representable values (RSB #32, AND #0x3F),
9898    /// pinned here bit-for-bit against clang.
9899    #[test]
9900    fn test_rsb_and_imm_thumb_expand_gate_681() {
9901        let enc = ArmEncoder::new_thumb2();
9902
9903        // clang: rsb.w r3, r2, #0x20 = f1c2 0320 — byte-identical to before.
9904        let rsb = enc
9905            .encode(&ArmOp::Rsb {
9906                rd: Reg::R3,
9907                rn: Reg::R2,
9908                imm: 32,
9909            })
9910            .unwrap();
9911        assert_eq!(rsb, vec![0xC2, 0xF1, 0x20, 0x03]);
9912
9913        // 0x101 is not ThumbExpandImm-representable -> must Err, not mis-encode.
9914        assert!(
9915            enc.encode(&ArmOp::Rsb {
9916                rd: Reg::R3,
9917                rn: Reg::R2,
9918                imm: 0x101,
9919            })
9920            .is_err(),
9921            "non-ThumbExpandImm RSB immediate must Err"
9922        );
9923
9924        // clang: and r4, r4, #0x3f = f004 043f — byte-identical to before.
9925        let and = enc.encode_thumb32_and_imm_raw(4, 4, 0x3F).unwrap();
9926        assert_eq!(and, vec![0x04, 0xF0, 0x3F, 0x04]);
9927        assert!(
9928            enc.encode_thumb32_and_imm_raw(4, 4, 0x101).is_err(),
9929            "non-ThumbExpandImm AND immediate must Err"
9930        );
9931
9932        // A32 RSB: imm12 is a rotate:imm8 modified immediate; > 0xFF used to be
9933        // silently masked to `imm & 0xFF` (#378 masking class) -> must Err.
9934        let a32 = ArmEncoder::new_arm32();
9935        assert!(
9936            a32.encode(&ArmOp::Rsb {
9937                rd: Reg::R3,
9938                rn: Reg::R2,
9939                imm: 0x120,
9940            })
9941            .is_err(),
9942            "A32 RSB immediate > 0xFF must Err, not mask"
9943        );
9944        // imm 32 (the only value real codegen emits) still encodes.
9945        assert!(
9946            a32.encode(&ArmOp::Rsb {
9947                rd: Reg::R3,
9948                rn: Reg::R2,
9949                imm: 32,
9950            })
9951            .is_ok()
9952        );
9953    }
9954
9955    /// #350 follow-up — the `encoder_no_panic` fuzz harness drives the encoder
9956    /// with ARBITRARY registers, including the one case the in-place lowering
9957    /// cannot serve: rd==rn==R12. There the scratch (R12, the reserved encoder
9958    /// register) would alias Rn and clobber it before the ADD reads it. The
9959    /// encoder contract (#180/#185) is Ok-or-Err, never a panic — so this must
9960    /// return Err, not assert. (Real codegen never emits rd==rn==R12 because R12
9961    /// is non-allocatable; this guards only the fuzz/adversarial path.)
9962    #[test]
9963    fn test_encode_add_imm_large_rd_rn_r12_errs_not_panics_350() {
9964        let enc = ArmEncoder::new_thumb2();
9965        // Out-of-range imm with rd==rn==R12: no free scratch -> Err.
9966        let r = enc.encode_thumb32_add_imm(&Reg::R12, &Reg::R12, 70000);
9967        assert!(
9968            r.is_err(),
9969            "rd==rn==R12 with out-of-range imm must Err (no free scratch), got {r:?}"
9970        );
9971        // Small imm with rd==rn==R12 still takes the single-instruction fast path
9972        // (no scratch needed) and must succeed — the guard is scoped to the
9973        // out-of-range lowering only.
9974        let small = enc.encode_thumb32_add_imm(&Reg::R12, &Reg::R12, 0x10);
9975        assert!(small.is_ok(), "small imm needs no scratch, must stay Ok");
9976    }
9977
9978    /// #378 — `encode_operand2` (ARM32 data-processing operand) must FAIL
9979    /// HONESTLY on an immediate that is not a valid rotated immediate, rather
9980    /// than silently masking it to `imm & 0xFF` and emitting a WRONG
9981    /// instruction. `0x1FF` has 9 set bits, so it cannot come from rotating an
9982    /// 8-bit imm8 — non-encodable. Real codegen materializes large constants via
9983    /// MOVW/MOVT; this guards the encoder's Ok-or-Err contract (#180/#185)
9984    /// directly. It is an Err (not a panic) so the `encoder_no_panic` fuzz
9985    /// harness — which drives arbitrary operands — still passes.
9986    #[test]
9987    fn test_encode_operand2_non_rotatable_imm_errs_not_masks_378() {
9988        let enc = ArmEncoder::new_arm32();
9989        let bad = enc.encode(&ArmOp::Add {
9990            rd: Reg::R0,
9991            rn: Reg::R1,
9992            op2: Operand2::Imm(0x1FF),
9993        });
9994        assert!(
9995            bad.is_err(),
9996            "non-rotatable ARM32 immediate 0x1FF must Err (was silently masked \
9997             to 0xFF), got {bad:?}"
9998        );
9999        // A representable rotated immediate still encodes fine (regression guard).
10000        let ok = enc.encode(&ArmOp::Add {
10001            rd: Reg::R0,
10002            rn: Reg::R1,
10003            op2: Operand2::Imm(0xFF),
10004        });
10005        assert!(
10006            ok.is_ok(),
10007            "0xFF is a valid rotated immediate, must stay Ok"
10008        );
10009    }
10010
10011    #[test]
10012    fn test_encode_ldr_arm32() {
10013        let encoder = ArmEncoder::new_arm32();
10014        let op = ArmOp::Ldr {
10015            rd: Reg::R0,
10016            addr: MemAddr::imm(Reg::R1, 4),
10017        };
10018
10019        let code = encoder.encode(&op).unwrap();
10020        assert_eq!(code.len(), 4);
10021
10022        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10023        // Verify load bit is set
10024        assert_eq!(instr & 0x00100000, 0x00100000);
10025    }
10026
10027    #[test]
10028    fn test_encode_str_arm32() {
10029        let encoder = ArmEncoder::new_arm32();
10030        let op = ArmOp::Str {
10031            rd: Reg::R0,
10032            addr: MemAddr::imm(Reg::SP, 0),
10033        };
10034
10035        let code = encoder.encode(&op).unwrap();
10036        assert_eq!(code.len(), 4);
10037    }
10038
10039    #[test]
10040    fn test_encode_branch_arm32() {
10041        let encoder = ArmEncoder::new_arm32();
10042        let op = ArmOp::Bl {
10043            label: "main".to_string(),
10044        };
10045
10046        let code = encoder.encode(&op).unwrap();
10047        assert_eq!(code.len(), 4);
10048
10049        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10050        // Verify BL opcode
10051        assert_eq!(instr & 0x0F000000, 0x0B000000);
10052    }
10053
10054    /// Regression test for #167 + #174: the Thumb-2 BL relocatable placeholder
10055    /// must carry a -4 addend so an R_ARM_THM_CALL nets to exactly the symbol S.
10056    /// The correct encoding is what `gas` emits for `bl <extern>`: f7ff fffe
10057    /// (hw1=0xF7FF, hw2=0xFFFE), little-endian bytes FF F7 FE FF.
10058    ///   - 0xD000 (J1=J2=0) → ~+0x600000 garbage addend: `bl c0000c` / truncated
10059    ///     to fit (#167).
10060    ///   - 0xF800 (addend 0) → lands at S+4, one instruction past the callee
10061    ///     entry (#174).
10062    ///   - 0xFFFE (addend -4) → lands at S. Correct.
10063    #[test]
10064    fn test_encode_thumb_bl_placeholder_addend_167_174() {
10065        let encoder = ArmEncoder::new_thumb2();
10066        let op = ArmOp::Bl {
10067            label: "callee".to_string(),
10068        };
10069
10070        let code = encoder.encode(&op).unwrap();
10071        assert_eq!(code.len(), 4, "Thumb-2 BL is 32-bit");
10072
10073        let hw1 = u16::from_le_bytes([code[0], code[1]]);
10074        let hw2 = u16::from_le_bytes([code[2], code[3]]);
10075        assert_eq!(hw1, 0xF7FF, "BL first halfword (matches gas `bl <extern>`)");
10076        assert_eq!(
10077            hw2, 0xFFFE,
10078            "BL second halfword must be 0xFFFE (-4 addend → nets to S), not 0xF800 (→ S+4, #174) or 0xD000 (#167)"
10079        );
10080        assert_ne!(hw2, 0xF800, "0xF800 (addend 0) lands at S+4 (#174)");
10081        assert_ne!(hw2, 0xD000, "0xD000 bakes in a ~+0x600000 addend (#167)");
10082    }
10083
10084    #[test]
10085    fn test_encode_sequence() {
10086        let encoder = ArmEncoder::new_arm32();
10087        let ops = vec![
10088            ArmOp::Mov {
10089                rd: Reg::R0,
10090                op2: Operand2::Imm(42),
10091            },
10092            ArmOp::Mov {
10093                rd: Reg::R1,
10094                op2: Operand2::Imm(10),
10095            },
10096            ArmOp::Add {
10097                rd: Reg::R2,
10098                rn: Reg::R0,
10099                op2: Operand2::Reg(Reg::R1),
10100            },
10101        ];
10102
10103        let code = encoder.encode_sequence(&ops).unwrap();
10104        assert_eq!(code.len(), 12); // 3 instructions * 4 bytes
10105    }
10106
10107    #[test]
10108    fn test_reg_to_bits() {
10109        assert_eq!(reg_to_bits(&Reg::R0), 0);
10110        assert_eq!(reg_to_bits(&Reg::R7), 7);
10111        assert_eq!(reg_to_bits(&Reg::SP), 13);
10112        assert_eq!(reg_to_bits(&Reg::LR), 14);
10113        assert_eq!(reg_to_bits(&Reg::PC), 15);
10114    }
10115
10116    #[test]
10117    fn test_encode_bitwise_operations() {
10118        let encoder = ArmEncoder::new_arm32();
10119
10120        let and_op = ArmOp::And {
10121            rd: Reg::R0,
10122            rn: Reg::R1,
10123            op2: Operand2::Reg(Reg::R2),
10124        };
10125        let and_code = encoder.encode(&and_op).unwrap();
10126        assert_eq!(and_code.len(), 4);
10127
10128        let orr_op = ArmOp::Orr {
10129            rd: Reg::R0,
10130            rn: Reg::R1,
10131            op2: Operand2::Reg(Reg::R2),
10132        };
10133        let orr_code = encoder.encode(&orr_op).unwrap();
10134        assert_eq!(orr_code.len(), 4);
10135
10136        let eor_op = ArmOp::Eor {
10137            rd: Reg::R0,
10138            rn: Reg::R1,
10139            op2: Operand2::Reg(Reg::R2),
10140        };
10141        let eor_code = encoder.encode(&eor_op).unwrap();
10142        assert_eq!(eor_code.len(), 4);
10143    }
10144
10145    // === Thumb-2 32-bit encoding tests ===
10146
10147    #[test]
10148    fn test_encode_sdiv_thumb2() {
10149        let encoder = ArmEncoder::new_thumb2();
10150        let op = ArmOp::Sdiv {
10151            rd: Reg::R0,
10152            rn: Reg::R1,
10153            rm: Reg::R2,
10154        };
10155
10156        let code = encoder.encode(&op).unwrap();
10157        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10158
10159        // SDIV R0, R1, R2: 0xFB91 0xF0F2
10160        // First halfword: 0xFB90 | Rn(1) = 0xFB91
10161        // Second halfword: 0xF0F0 | Rd(0)<<8 | Rm(2) = 0xF0F2
10162        // Little-endian: [0x91, 0xFB, 0xF2, 0xF0]
10163        assert_eq!(code[0], 0x91);
10164        assert_eq!(code[1], 0xFB);
10165        assert_eq!(code[2], 0xF2);
10166        assert_eq!(code[3], 0xF0);
10167    }
10168
10169    #[test]
10170    fn test_encode_udiv_thumb2() {
10171        let encoder = ArmEncoder::new_thumb2();
10172        let op = ArmOp::Udiv {
10173            rd: Reg::R0,
10174            rn: Reg::R1,
10175            rm: Reg::R2,
10176        };
10177
10178        let code = encoder.encode(&op).unwrap();
10179        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10180
10181        // UDIV R0, R1, R2: 0xFBB1 0xF0F2
10182        // Little-endian: [0xB1, 0xFB, 0xF2, 0xF0]
10183        assert_eq!(code[0], 0xB1);
10184        assert_eq!(code[1], 0xFB);
10185        assert_eq!(code[2], 0xF2);
10186        assert_eq!(code[3], 0xF0);
10187    }
10188
10189    #[test]
10190    fn test_encode_mul_thumb2() {
10191        let encoder = ArmEncoder::new_thumb2();
10192        let op = ArmOp::Mul {
10193            rd: Reg::R0,
10194            rn: Reg::R1,
10195            rm: Reg::R2,
10196        };
10197
10198        let code = encoder.encode(&op).unwrap();
10199        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10200    }
10201
10202    #[test]
10203    fn test_encode_and_thumb2() {
10204        let encoder = ArmEncoder::new_thumb2();
10205        let op = ArmOp::And {
10206            rd: Reg::R0,
10207            rn: Reg::R1,
10208            op2: Operand2::Reg(Reg::R2),
10209        };
10210
10211        let code = encoder.encode(&op).unwrap();
10212        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10213    }
10214
10215    #[test]
10216    fn test_encode_lsl_thumb2_low_regs() {
10217        let encoder = ArmEncoder::new_thumb2();
10218        let op = ArmOp::Lsl {
10219            rd: Reg::R0,
10220            rn: Reg::R1,
10221            shift: 5,
10222        };
10223
10224        let code = encoder.encode(&op).unwrap();
10225        assert_eq!(code.len(), 2); // 16-bit for low registers
10226    }
10227
10228    #[test]
10229    fn test_encode_clz_thumb2() {
10230        let encoder = ArmEncoder::new_thumb2();
10231        let op = ArmOp::Clz {
10232            rd: Reg::R0,
10233            rm: Reg::R1,
10234        };
10235
10236        let code = encoder.encode(&op).unwrap();
10237        assert_eq!(code.len(), 4); // 32-bit Thumb-2 instruction
10238    }
10239
10240    #[test]
10241    fn test_encode_bx_thumb2() {
10242        let encoder = ArmEncoder::new_thumb2();
10243        let op = ArmOp::Bx { rm: Reg::LR };
10244
10245        let code = encoder.encode(&op).unwrap();
10246        assert_eq!(code.len(), 2); // 16-bit instruction
10247
10248        // BX LR: 0x4770
10249        assert_eq!(code, vec![0x70, 0x47]);
10250    }
10251
10252    // ========================================================================
10253    // f32 pseudo-op encoding tests
10254    // ========================================================================
10255
10256    #[test]
10257    fn test_encode_f32_abs_arm32() {
10258        let encoder = ArmEncoder::new_arm32();
10259        let op = ArmOp::F32Abs {
10260            sd: VfpReg::S0,
10261            sm: VfpReg::S2,
10262        };
10263        let code = encoder.encode(&op).unwrap();
10264        assert_eq!(code.len(), 4); // Single VFP instruction
10265    }
10266
10267    #[test]
10268    fn test_encode_f32_neg_arm32() {
10269        let encoder = ArmEncoder::new_arm32();
10270        let op = ArmOp::F32Neg {
10271            sd: VfpReg::S0,
10272            sm: VfpReg::S2,
10273        };
10274        let code = encoder.encode(&op).unwrap();
10275        assert_eq!(code.len(), 4);
10276    }
10277
10278    #[test]
10279    fn test_encode_f32_sqrt_arm32() {
10280        let encoder = ArmEncoder::new_arm32();
10281        let op = ArmOp::F32Sqrt {
10282            sd: VfpReg::S0,
10283            sm: VfpReg::S2,
10284        };
10285        let code = encoder.encode(&op).unwrap();
10286        assert_eq!(code.len(), 4);
10287    }
10288
10289    #[test]
10290    fn test_encode_f32_ceil_arm32() {
10291        let encoder = ArmEncoder::new_arm32();
10292        let op = ArmOp::F32Ceil {
10293            sd: VfpReg::S0,
10294            sm: VfpReg::S2,
10295        };
10296        let code = encoder.encode(&op).unwrap();
10297        // VMRS + BIC + ORR + VMSR + VCVT.S32.F32 + VMRS + BIC + VMSR + VCVT.F32.S32
10298        assert_eq!(code.len(), 36);
10299    }
10300
10301    #[test]
10302    fn test_encode_f32_floor_thumb2() {
10303        let encoder = ArmEncoder::new_thumb2();
10304        let op = ArmOp::F32Floor {
10305            sd: VfpReg::S0,
10306            sm: VfpReg::S2,
10307        };
10308        let code = encoder.encode(&op).unwrap();
10309        // VMRS + BIC.W + ORR.W + VMSR + VCVT + VMRS + BIC.W + VMSR + VCVT.F32.S32
10310        assert_eq!(code.len(), 36);
10311    }
10312
10313    #[test]
10314    fn test_encode_f32_min_arm32() {
10315        let encoder = ArmEncoder::new_arm32();
10316        let op = ArmOp::F32Min {
10317            sd: VfpReg::S0,
10318            sn: VfpReg::S2,
10319            sm: VfpReg::S4,
10320        };
10321        let code = encoder.encode(&op).unwrap();
10322        assert_eq!(code.len(), 16); // VMOV + VCMP + VMRS + conditional VMOV
10323    }
10324
10325    #[test]
10326    fn test_encode_f32_max_thumb2() {
10327        let encoder = ArmEncoder::new_thumb2();
10328        let op = ArmOp::F32Max {
10329            sd: VfpReg::S0,
10330            sn: VfpReg::S2,
10331            sm: VfpReg::S4,
10332        };
10333        let code = encoder.encode(&op).unwrap();
10334        // VMOV(4) + VCMP(4) + VMRS(4) + IT(2) + VMOV(4) = 18
10335        assert_eq!(code.len(), 18);
10336    }
10337
10338    #[test]
10339    fn test_encode_f32_copysign_arm32() {
10340        let encoder = ArmEncoder::new_arm32();
10341        let op = ArmOp::F32Copysign {
10342            sd: VfpReg::S0,
10343            sn: VfpReg::S2,
10344            sm: VfpReg::S4,
10345        };
10346        let code = encoder.encode(&op).unwrap();
10347        // VMOV + VMOV + AND + BIC + ORR + VMOV = 6 * 4 = 24
10348        assert_eq!(code.len(), 24);
10349    }
10350
10351    // ========================================================================
10352    // f64 encoding tests
10353    // ========================================================================
10354
10355    #[test]
10356    fn test_encode_f64_add_arm32() {
10357        let encoder = ArmEncoder::new_arm32();
10358        let op = ArmOp::F64Add {
10359            dd: VfpReg::D0,
10360            dn: VfpReg::D1,
10361            dm: VfpReg::D2,
10362        };
10363        let code = encoder.encode(&op).unwrap();
10364        assert_eq!(code.len(), 4);
10365        // VADD.F64 D0, D1, D2: check coprocessor is cp11 (0xB)
10366        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10367        assert_eq!((instr >> 8) & 0xF, 0xB); // cp11
10368    }
10369
10370    #[test]
10371    fn test_encode_f64_sub_thumb2() {
10372        let encoder = ArmEncoder::new_thumb2();
10373        let op = ArmOp::F64Sub {
10374            dd: VfpReg::D0,
10375            dn: VfpReg::D1,
10376            dm: VfpReg::D2,
10377        };
10378        let code = encoder.encode(&op).unwrap();
10379        assert_eq!(code.len(), 4); // 32-bit VFP as two Thumb halfwords
10380    }
10381
10382    #[test]
10383    fn test_encode_f64_mul_arm32() {
10384        let encoder = ArmEncoder::new_arm32();
10385        let op = ArmOp::F64Mul {
10386            dd: VfpReg::D0,
10387            dn: VfpReg::D1,
10388            dm: VfpReg::D2,
10389        };
10390        let code = encoder.encode(&op).unwrap();
10391        assert_eq!(code.len(), 4);
10392    }
10393
10394    #[test]
10395    fn test_encode_f64_div_arm32() {
10396        let encoder = ArmEncoder::new_arm32();
10397        let op = ArmOp::F64Div {
10398            dd: VfpReg::D0,
10399            dn: VfpReg::D1,
10400            dm: VfpReg::D2,
10401        };
10402        let code = encoder.encode(&op).unwrap();
10403        assert_eq!(code.len(), 4);
10404    }
10405
10406    #[test]
10407    fn test_encode_f64_abs_arm32() {
10408        let encoder = ArmEncoder::new_arm32();
10409        let op = ArmOp::F64Abs {
10410            dd: VfpReg::D0,
10411            dm: VfpReg::D2,
10412        };
10413        let code = encoder.encode(&op).unwrap();
10414        assert_eq!(code.len(), 4);
10415    }
10416
10417    #[test]
10418    fn test_encode_f64_neg_arm32() {
10419        let encoder = ArmEncoder::new_arm32();
10420        let op = ArmOp::F64Neg {
10421            dd: VfpReg::D0,
10422            dm: VfpReg::D2,
10423        };
10424        let code = encoder.encode(&op).unwrap();
10425        assert_eq!(code.len(), 4);
10426    }
10427
10428    #[test]
10429    fn test_encode_f64_sqrt_arm32() {
10430        let encoder = ArmEncoder::new_arm32();
10431        let op = ArmOp::F64Sqrt {
10432            dd: VfpReg::D0,
10433            dm: VfpReg::D2,
10434        };
10435        let code = encoder.encode(&op).unwrap();
10436        assert_eq!(code.len(), 4);
10437    }
10438
10439    #[test]
10440    fn test_encode_f64_load_arm32() {
10441        let encoder = ArmEncoder::new_arm32();
10442        let op = ArmOp::F64Load {
10443            dd: VfpReg::D0,
10444            addr: MemAddr::imm(Reg::R0, 8),
10445        };
10446        let code = encoder.encode(&op).unwrap();
10447        assert_eq!(code.len(), 4);
10448        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10449        assert_eq!((instr >> 8) & 0xF, 0xB); // cp11 for F64
10450        assert_eq!(instr & 0xFF, 2); // offset 8 / 4 = 2
10451    }
10452
10453    #[test]
10454    fn test_encode_f64_store_thumb2() {
10455        let encoder = ArmEncoder::new_thumb2();
10456        let op = ArmOp::F64Store {
10457            dd: VfpReg::D0,
10458            addr: MemAddr::imm(Reg::SP, 0),
10459        };
10460        let code = encoder.encode(&op).unwrap();
10461        assert_eq!(code.len(), 4);
10462    }
10463
10464    #[test]
10465    fn test_encode_f64_compare_arm32() {
10466        let encoder = ArmEncoder::new_arm32();
10467        let op = ArmOp::F64Eq {
10468            rd: Reg::R0,
10469            dn: VfpReg::D0,
10470            dm: VfpReg::D1,
10471        };
10472        let code = encoder.encode(&op).unwrap();
10473        assert_eq!(code.len(), 16); // VCMP + VMRS + MOV #0 + MOVcond #1
10474    }
10475
10476    #[test]
10477    fn test_encode_f64_compare_thumb2() {
10478        let encoder = ArmEncoder::new_thumb2();
10479        let op = ArmOp::F64Lt {
10480            rd: Reg::R0,
10481            dn: VfpReg::D0,
10482            dm: VfpReg::D1,
10483        };
10484        let code = encoder.encode(&op).unwrap();
10485        // VCMP(4) + VMRS(4) + MOVS(2) + IT(2) + MOV(2) = 14
10486        assert_eq!(code.len(), 14);
10487    }
10488
10489    #[test]
10490    fn test_encode_f64_const_arm32() {
10491        let encoder = ArmEncoder::new_arm32();
10492        let op = ArmOp::F64Const {
10493            dd: VfpReg::D0,
10494            value: 3.125,
10495        };
10496        let code = encoder.encode(&op).unwrap();
10497        // MOVW(4) + MOVT(4) + MOVW(4) + MOVT(4) + VMOV(4) = 20
10498        assert_eq!(code.len(), 20);
10499    }
10500
10501    #[test]
10502    fn test_encode_f64_const_thumb2() {
10503        let encoder = ArmEncoder::new_thumb2();
10504        let op = ArmOp::F64Const {
10505            dd: VfpReg::D0,
10506            value: 2.5,
10507        };
10508        let code = encoder.encode(&op).unwrap();
10509        // MOVW(4) + MOVT(4) + MOVW(4) + MOVT(4) + VMOV(4) = 20
10510        assert_eq!(code.len(), 20);
10511    }
10512
10513    #[test]
10514    fn test_encode_f64_convert_i32s_arm32() {
10515        let encoder = ArmEncoder::new_arm32();
10516        let op = ArmOp::F64ConvertI32S {
10517            dd: VfpReg::D0,
10518            rm: Reg::R0,
10519        };
10520        let code = encoder.encode(&op).unwrap();
10521        // VMOV(4) + VCVT(4) = 8
10522        assert_eq!(code.len(), 8);
10523    }
10524
10525    #[test]
10526    fn test_encode_f64_promote_f32_arm32() {
10527        let encoder = ArmEncoder::new_arm32();
10528        let op = ArmOp::F64PromoteF32 {
10529            dd: VfpReg::D0,
10530            sm: VfpReg::S0,
10531        };
10532        let code = encoder.encode(&op).unwrap();
10533        assert_eq!(code.len(), 4); // Single VCVT.F64.F32 instruction
10534    }
10535
10536    #[test]
10537    fn test_encode_f64_promote_f32_thumb2() {
10538        let encoder = ArmEncoder::new_thumb2();
10539        let op = ArmOp::F64PromoteF32 {
10540            dd: VfpReg::D0,
10541            sm: VfpReg::S0,
10542        };
10543        let code = encoder.encode(&op).unwrap();
10544        assert_eq!(code.len(), 4);
10545    }
10546
10547    #[test]
10548    fn test_encode_i32_trunc_f64s_arm32() {
10549        let encoder = ArmEncoder::new_arm32();
10550        let op = ArmOp::I32TruncF64S {
10551            rd: Reg::R0,
10552            dm: VfpReg::D0,
10553        };
10554        let code = encoder.encode(&op).unwrap();
10555        // VCVT(4) + VMOV(4) = 8
10556        assert_eq!(code.len(), 8);
10557    }
10558
10559    #[test]
10560    fn test_encode_f64_reinterpret_i64_arm32() {
10561        let encoder = ArmEncoder::new_arm32();
10562        let op = ArmOp::F64ReinterpretI64 {
10563            dd: VfpReg::D0,
10564            rmlo: Reg::R0,
10565            rmhi: Reg::R1,
10566        };
10567        let code = encoder.encode(&op).unwrap();
10568        assert_eq!(code.len(), 4); // Single VMOV instruction
10569    }
10570
10571    #[test]
10572    fn test_encode_i64_reinterpret_f64_thumb2() {
10573        let encoder = ArmEncoder::new_thumb2();
10574        let op = ArmOp::I64ReinterpretF64 {
10575            rdlo: Reg::R0,
10576            rdhi: Reg::R1,
10577            dm: VfpReg::D0,
10578        };
10579        let code = encoder.encode(&op).unwrap();
10580        assert_eq!(code.len(), 4);
10581    }
10582
10583    #[test]
10584    fn test_encode_f64_trunc_thumb2() {
10585        let encoder = ArmEncoder::new_thumb2();
10586        let op = ArmOp::F64Trunc {
10587            dd: VfpReg::D0,
10588            dm: VfpReg::D1,
10589        };
10590        let code = encoder.encode(&op).unwrap();
10591        // Two VFP instructions via Thumb encoding
10592        assert_eq!(code.len(), 8);
10593    }
10594
10595    #[test]
10596    fn test_encode_f64_min_arm32() {
10597        let encoder = ArmEncoder::new_arm32();
10598        let op = ArmOp::F64Min {
10599            dd: VfpReg::D0,
10600            dn: VfpReg::D1,
10601            dm: VfpReg::D2,
10602        };
10603        let code = encoder.encode(&op).unwrap();
10604        // VMOV + VCMP + VMRS + conditional VMOV = 16
10605        assert_eq!(code.len(), 16);
10606    }
10607
10608    #[test]
10609    fn test_f64_cp11_encoding() {
10610        // Verify that F64 instructions use coprocessor 11 (0xB), not 10 (0xA)
10611        let encoder = ArmEncoder::new_arm32();
10612
10613        // F64Add
10614        let code = encoder
10615            .encode(&ArmOp::F64Add {
10616                dd: VfpReg::D0,
10617                dn: VfpReg::D0,
10618                dm: VfpReg::D0,
10619            })
10620            .unwrap();
10621        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10622        assert_eq!((instr >> 8) & 0xF, 0xB, "F64 should use cp11");
10623
10624        // F32Add for comparison
10625        let code = encoder
10626            .encode(&ArmOp::F32Add {
10627                sd: VfpReg::S0,
10628                sn: VfpReg::S0,
10629                sm: VfpReg::S0,
10630            })
10631            .unwrap();
10632        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10633        assert_eq!((instr >> 8) & 0xF, 0xA, "F32 should use cp10");
10634    }
10635
10636    #[test]
10637    fn test_dreg_encoding_higher_registers() {
10638        let encoder = ArmEncoder::new_arm32();
10639
10640        // Test with D15 (highest register)
10641        let op = ArmOp::F64Add {
10642            dd: VfpReg::D15,
10643            dn: VfpReg::D14,
10644            dm: VfpReg::D13,
10645        };
10646        let code = encoder.encode(&op).unwrap();
10647        assert_eq!(code.len(), 4);
10648
10649        // Verify the register encoding worked (instruction is valid)
10650        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10651        assert_eq!((instr >> 8) & 0xF, 0xB); // cp11
10652    }
10653
10654    // ========================================================================
10655    // Control flow encoding tests
10656    // ========================================================================
10657
10658    #[test]
10659    fn test_encode_label_emits_no_bytes() {
10660        let encoder = ArmEncoder::new_thumb2();
10661        let op = ArmOp::Label {
10662            name: ".Lblock_end_0".to_string(),
10663        };
10664        let code = encoder.encode(&op).unwrap();
10665        assert!(code.is_empty(), "Label should emit zero bytes");
10666
10667        let encoder32 = ArmEncoder::new_arm32();
10668        let code32 = encoder32.encode(&op).unwrap();
10669        assert!(
10670            code32.is_empty(),
10671            "Label should emit zero bytes in ARM32 too"
10672        );
10673    }
10674
10675    #[test]
10676    fn test_encode_bcc_eq_thumb2() {
10677        use synth_synthesis::Condition;
10678        let encoder = ArmEncoder::new_thumb2();
10679        let op = ArmOp::Bcc {
10680            cond: Condition::EQ,
10681            label: "target".to_string(),
10682        };
10683        let code = encoder.encode(&op).unwrap();
10684        assert_eq!(code.len(), 2); // 16-bit conditional branch
10685
10686        // BEQ with offset 0: 0xD000 in little-endian
10687        assert_eq!(code, vec![0x00, 0xD0]);
10688    }
10689
10690    #[test]
10691    fn test_encode_bcc_ne_thumb2() {
10692        use synth_synthesis::Condition;
10693        let encoder = ArmEncoder::new_thumb2();
10694        let op = ArmOp::Bcc {
10695            cond: Condition::NE,
10696            label: "target".to_string(),
10697        };
10698        let code = encoder.encode(&op).unwrap();
10699        assert_eq!(code.len(), 2);
10700
10701        // BNE with offset 0: 0xD100 in little-endian
10702        assert_eq!(code, vec![0x00, 0xD1]);
10703    }
10704
10705    #[test]
10706    fn test_encode_bcc_arm32() {
10707        use synth_synthesis::Condition;
10708        let encoder = ArmEncoder::new_arm32();
10709        let op = ArmOp::Bcc {
10710            cond: Condition::EQ,
10711            label: "target".to_string(),
10712        };
10713        let code = encoder.encode(&op).unwrap();
10714        assert_eq!(code.len(), 4); // 32-bit ARM instruction
10715
10716        let instr = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
10717        // BEQ: cond=0x0, opcode=0xA, offset=0
10718        assert_eq!(instr & 0xF0000000, 0x00000000); // EQ condition
10719        assert_eq!(instr & 0x0F000000, 0x0A000000); // Branch opcode
10720    }
10721
10722    #[test]
10723    fn test_encode_udf_thumb2() {
10724        let encoder = ArmEncoder::new_thumb2();
10725        let op = ArmOp::Udf { imm: 0 };
10726        let code = encoder.encode(&op).unwrap();
10727        assert_eq!(code.len(), 2); // 16-bit
10728
10729        // UDF #0: 0xDE00 in little-endian
10730        assert_eq!(code, vec![0x00, 0xDE]);
10731    }
10732
10733    /// #610: the i64 rot/div/rem expansions must land the result in the
10734    /// selector-assigned rd pair and leave R0-R3 preserved (restored from the
10735    /// fixed-ABI wrapper's save area) — pre-#610 the rot expansion's own
10736    /// `POP {R4}` restored stale scratch OVER the result (rd_lo == R4) and
10737    /// the div/rem expansions ignored their register fields outright.
10738    #[test]
10739    fn test_610_i64_rot_expansion_ends_with_rd_movs_and_restore() {
10740        let encoder = ArmEncoder::new_thumb2();
10741        for op in [
10742            ArmOp::I64Rotl {
10743                rdlo: Reg::R4,
10744                rdhi: Reg::R5,
10745                rnlo: Reg::R0,
10746                rnhi: Reg::R1,
10747                shift: Reg::R2,
10748            },
10749            ArmOp::I64Rotr {
10750                rdlo: Reg::R4,
10751                rdhi: Reg::R5,
10752                rnlo: Reg::R0,
10753                rnhi: Reg::R1,
10754                shift: Reg::R2,
10755            },
10756        ] {
10757            let code = encoder.encode(&op).unwrap();
10758            assert_eq!(code.len(), 102, "register-independent size (estimator pin)");
10759            // Tail: MOV r5, r1 (0x460D); MOV r4, r0 (0x4604); POP {r0..r3}
10760            // (rd pair r4:r5 does not overlap the save area — all 4 restored).
10761            let tail: Vec<u16> = code[code.len() - 12..]
10762                .chunks(2)
10763                .map(|c| u16::from_le_bytes([c[0], c[1]]))
10764                .collect();
10765            assert_eq!(tail, vec![0x460D, 0x4604, 0xBC01, 0xBC02, 0xBC04, 0xBC08]);
10766        }
10767    }
10768
10769    /// #610: div/rem expansions honor rd and carry the divide-by-zero trap
10770    /// guard (`ORRS R12, R2, R3; BNE +0; UDF #0`) after operand marshaling.
10771    #[test]
10772    fn test_610_i64_div_rem_expansion_guard_and_rd() {
10773        let encoder = ArmEncoder::new_thumb2();
10774        let mk = |which: u8| {
10775            let (rdlo, rdhi, rnlo, rnhi, rmlo, rmhi) =
10776                (Reg::R4, Reg::R5, Reg::R0, Reg::R1, Reg::R2, Reg::R3);
10777            match which {
10778                0 => ArmOp::I64DivU {
10779                    rdlo,
10780                    rdhi,
10781                    rnlo,
10782                    rnhi,
10783                    rmlo,
10784                    rmhi,
10785                    elide_zero_guard: false,
10786                },
10787                1 => ArmOp::I64RemU {
10788                    rdlo,
10789                    rdhi,
10790                    rnlo,
10791                    rnhi,
10792                    rmlo,
10793                    rmhi,
10794                    elide_zero_guard: false,
10795                },
10796                2 => ArmOp::I64DivS {
10797                    rdlo,
10798                    rdhi,
10799                    rnlo,
10800                    rnhi,
10801                    rmlo,
10802                    rmhi,
10803                    elide_zero_guard: false,
10804                    elide_overflow_guard: false,
10805                },
10806                _ => ArmOp::I64RemS {
10807                    rdlo,
10808                    rdhi,
10809                    rnlo,
10810                    rnhi,
10811                    rmlo,
10812                    rmhi,
10813                    elide_zero_guard: false,
10814                },
10815            }
10816        };
10817        for which in 0..4u8 {
10818            let code = encoder.encode(&mk(which)).unwrap();
10819            // Zero-divisor trap guard right after the 26-byte marshal prologue.
10820            let guard: Vec<u16> = code[26..34]
10821                .chunks(2)
10822                .map(|c| u16::from_le_bytes([c[0], c[1]]))
10823                .collect();
10824            assert_eq!(
10825                guard,
10826                vec![0xEA52, 0x0C03, 0xD100, 0xDE00],
10827                "ORRS R12,R2,R3; BNE +0; UDF #0"
10828            );
10829            // Tail: result into rd pair (r5:r4), then restore all of R0-R3.
10830            let tail: Vec<u16> = code[code.len() - 12..]
10831                .chunks(2)
10832                .map(|c| u16::from_le_bytes([c[0], c[1]]))
10833                .collect();
10834            assert_eq!(tail, vec![0x460D, 0x4604, 0xBC01, 0xBC02, 0xBC04, 0xBC08]);
10835        }
10836    }
10837
10838    /// #610: when rd overlaps R0-R3 the restore must SKIP the result
10839    /// registers (drop the saved caller word) instead of popping over them.
10840    #[test]
10841    fn test_610_i64_divu_rd_in_r0_r1_skips_restore() {
10842        let encoder = ArmEncoder::new_thumb2();
10843        let code = encoder
10844            .encode(&ArmOp::I64DivU {
10845                rdlo: Reg::R0,
10846                rdhi: Reg::R1,
10847                rnlo: Reg::R0,
10848                rnhi: Reg::R1,
10849                rmlo: Reg::R2,
10850                rmhi: Reg::R3,
10851                elide_zero_guard: false,
10852            })
10853            .unwrap();
10854        let tail: Vec<u16> = code[code.len() - 12..]
10855            .chunks(2)
10856            .map(|c| u16::from_le_bytes([c[0], c[1]]))
10857            .collect();
10858        // MOV r1,r1 / MOV r0,r0 (no-ops, size-stable), ADD SP,#4 twice
10859        // (discard saved r0/r1 — the result lives there), POP {r2}, POP {r3}.
10860        assert_eq!(tail, vec![0x4609, 0x4600, 0xB001, 0xB001, 0xBC04, 0xBC08]);
10861    }
10862
10863    /// #610: a fully swapped rd pair (rd_lo=R1, rd_hi=R0) cannot be
10864    /// materialized by two MOVs in either order — must be a loud Err, never
10865    /// silent corruption. (Selector pairs are consecutive, so unreachable.)
10866    #[test]
10867    fn test_610_i64_swapped_rd_pair_rejected() {
10868        let encoder = ArmEncoder::new_thumb2();
10869        let result = encoder.encode(&ArmOp::I64RemU {
10870            rdlo: Reg::R1,
10871            rdhi: Reg::R0,
10872            rnlo: Reg::R2,
10873            rnhi: Reg::R3,
10874            rmlo: Reg::R4,
10875            rmhi: Reg::R5,
10876            elide_zero_guard: false,
10877        });
10878        assert!(result.is_err(), "swapped rd pair must be rejected loudly");
10879    }
10880
10881    /// #632: the I64Popcnt expansion's own scratch restore (`POP {R3,R4,R5}`)
10882    /// must not clobber the result. Pre-fix the total was materialized with
10883    /// `ADDS rd, R4, R5` BEFORE the pop, so any allocator-assigned
10884    /// rd ∈ {R3,R4,R5} received stale stack garbage. Post-fix the count is
10885    /// carried across the restore in R12 (never allocatable, never restored)
10886    /// and moved into rd only after the pop — structurally rd-independent.
10887    #[test]
10888    fn test_632_i64_popcnt_result_survives_scratch_restore() {
10889        let encoder = ArmEncoder::new_thumb2();
10890        // Every allocatable rd, including the restore set {R3,R4,R5} and R8.
10891        for rd in [
10892            Reg::R0,
10893            Reg::R2,
10894            Reg::R3,
10895            Reg::R4,
10896            Reg::R5,
10897            Reg::R6,
10898            Reg::R8,
10899        ] {
10900            let code = encoder
10901                .encode(&ArmOp::I64Popcnt {
10902                    rd,
10903                    rnlo: Reg::R6,
10904                    rnhi: Reg::R7,
10905                })
10906                .unwrap();
10907            assert_eq!(code.len(), 180, "register-independent size (estimator pin)");
10908            let hw: Vec<u16> = code
10909                .chunks(2)
10910                .map(|c| u16::from_le_bytes([c[0], c[1]]))
10911                .collect();
10912            let pop = hw
10913                .iter()
10914                .position(|&h| h == 0xBC38)
10915                .expect("POP {R3,R4,R5} present");
10916            // Immediately before the POP: ADD.W R12, R4, R5 (the total lives
10917            // in R12, which the POP cannot touch).
10918            assert_eq!(
10919                &hw[pop - 2..pop],
10920                &[0xEB04, 0x0C05],
10921                "total must be carried in R12 across the restore"
10922            );
10923            // Immediately after the POP: MOV rd, R12.
10924            let rd_bits = match rd {
10925                Reg::R8 => 8u16,
10926                Reg::R6 => 6,
10927                Reg::R5 => 5,
10928                Reg::R4 => 4,
10929                Reg::R3 => 3,
10930                Reg::R2 => 2,
10931                _ => 0,
10932            };
10933            let expect_mov = 0x4600 | (((rd_bits >> 3) & 1) << 7) | (12 << 3) | (rd_bits & 7);
10934            assert_eq!(hw[pop + 1], expect_mov, "MOV rd, R12 after the restore");
10935            // No write into rd between the PUSH and the POP (the old
10936            // pre-restore ADDS is gone).
10937            assert!(
10938                !hw[..pop].contains(&(0x1800 | (5 << 6) | (4 << 3) | rd_bits)),
10939                "no ADDS rd, R4, R5 before the restore pop"
10940            );
10941        }
10942    }
10943
10944    /// #632 audit: the entry marshal must be permutation-safe. Pre-fix
10945    /// `MOV R4, rnlo; MOV R5, rnhi` read a clobbered R4 when the operand
10946    /// pair lived at (R3, R4). Post-fix rnlo routes through R12.
10947    #[test]
10948    fn test_632_i64_popcnt_marshal_pair_at_r3_r4() {
10949        let encoder = ArmEncoder::new_thumb2();
10950        let code = encoder
10951            .encode(&ArmOp::I64Popcnt {
10952                rd: Reg::R0,
10953                rnlo: Reg::R3,
10954                rnhi: Reg::R4,
10955            })
10956            .unwrap();
10957        let hw: Vec<u16> = code
10958            .chunks(2)
10959            .map(|c| u16::from_le_bytes([c[0], c[1]]))
10960            .collect();
10961        // PUSH {R3,R4,R5}; MOV R12, R3; MOV R5, R4 (rnhi read BEFORE any
10962        // write to R4); MOV R4, R12.
10963        assert_eq!(hw[0], 0xB438);
10964        assert_eq!(hw[1], 0x4600 | (1 << 7) | (3 << 3) | 4, "MOV R12, rnlo");
10965        assert_eq!(hw[2], 0x4600 | (4 << 3) | 5, "MOV R5, rnhi");
10966        assert_eq!(hw[3], 0x4664, "MOV R4, R12");
10967    }
10968
10969    /// #632: A32 twin — same structural fix on the ARM-mode path
10970    /// (`--target cortex-r5`): total carried in R12 across the restore.
10971    #[test]
10972    fn test_632_a32_i64_popcnt_result_survives_scratch_restore() {
10973        let encoder = ArmEncoder::new_arm32();
10974        for rd in [Reg::R0, Reg::R3, Reg::R4, Reg::R5, Reg::R8] {
10975            let code = encoder
10976                .encode(&ArmOp::I64Popcnt {
10977                    rd,
10978                    rnlo: Reg::R6,
10979                    rnhi: Reg::R7,
10980                })
10981                .unwrap();
10982            let words: Vec<u32> = code
10983                .chunks(4)
10984                .map(|c| u32::from_le_bytes([c[0], c[1], c[2], c[3]]))
10985                .collect();
10986            let pop = words
10987                .iter()
10988                .position(|&w| w == 0xE8BD_0038)
10989                .expect("POP {R3,R4,R5} present");
10990            assert_eq!(words[pop - 1], 0xE084_C005, "ADD R12, R4, R5 before POP");
10991            let rd_bits = match rd {
10992                Reg::R8 => 8u32,
10993                Reg::R5 => 5,
10994                Reg::R4 => 4,
10995                Reg::R3 => 3,
10996                _ => 0,
10997            };
10998            assert_eq!(
10999                words[pop + 1],
11000                0xE1A0_0000 | (rd_bits << 12) | 12,
11001                "MOV rd, R12 after the restore"
11002            );
11003        }
11004    }
11005
11006    /// #633: I64DivS must carry the INT64_MIN/-1 overflow guard (mirroring
11007    /// the i32 path) right after the zero-divisor guard — dividend in R0:R1,
11008    /// divisor in R2:R3 on the #610/#613 fixed-ABI wrapper path.
11009    #[test]
11010    fn test_633_i64_divs_overflow_guard_emitted() {
11011        let encoder = ArmEncoder::new_thumb2();
11012        let code = encoder
11013            .encode(&ArmOp::I64DivS {
11014                rdlo: Reg::R4,
11015                rdhi: Reg::R5,
11016                rnlo: Reg::R0,
11017                rnhi: Reg::R1,
11018                rmlo: Reg::R2,
11019                rmhi: Reg::R3,
11020                elide_zero_guard: false,
11021                elide_overflow_guard: false,
11022            })
11023            .unwrap();
11024        // 26-byte marshal + 8-byte zero-trap, then the 22-byte overflow guard.
11025        let guard: Vec<u16> = code[34..56]
11026            .chunks(2)
11027            .map(|c| u16::from_le_bytes([c[0], c[1]]))
11028            .collect();
11029        assert_eq!(
11030            guard,
11031            vec![
11032                0xEA02, 0x0C03, // AND.W R12, R2, R3
11033                0xF11C, 0x0F01, // CMN.W R12, #1
11034                0xD105, // BNE .no_trap
11035                0x2800, // CMP R0, #0
11036                0xD103, // BNE .no_trap
11037                0xF1B1, 0x4F00, // CMP.W R1, #0x80000000
11038                0xD100, // BNE .no_trap
11039                0xDE00, // UDF #0 — signed-division overflow
11040            ],
11041            "INT64_MIN/-1 overflow guard after the zero-divisor guard"
11042        );
11043    }
11044
11045    /// #633 fix-guard twin: I64RemS must NOT carry the overflow guard —
11046    /// rem_s(INT64_MIN, -1) is defined as 0 and must not trap. Exactly one
11047    /// UDF (the zero-divisor trap) in the whole expansion.
11048    #[test]
11049    fn test_633_i64_rems_has_no_overflow_guard() {
11050        let encoder = ArmEncoder::new_thumb2();
11051        for (is_rem_s, op) in [
11052            (
11053                true,
11054                ArmOp::I64RemS {
11055                    rdlo: Reg::R4,
11056                    rdhi: Reg::R5,
11057                    rnlo: Reg::R0,
11058                    rnhi: Reg::R1,
11059                    rmlo: Reg::R2,
11060                    rmhi: Reg::R3,
11061                    elide_zero_guard: false,
11062                },
11063            ),
11064            (
11065                false,
11066                ArmOp::I64DivS {
11067                    rdlo: Reg::R4,
11068                    rdhi: Reg::R5,
11069                    rnlo: Reg::R0,
11070                    rnhi: Reg::R1,
11071                    rmlo: Reg::R2,
11072                    rmhi: Reg::R3,
11073                    elide_zero_guard: false,
11074                    elide_overflow_guard: false,
11075                },
11076            ),
11077        ] {
11078            let code = encoder.encode(&op).unwrap();
11079            let udfs = code
11080                .chunks(2)
11081                .filter(|c| u16::from_le_bytes([c[0], c[1]]) == 0xDE00)
11082                .count();
11083            let want = if is_rem_s { 1 } else { 2 };
11084            assert_eq!(
11085                udfs, want,
11086                "rem_s: zero-trap only; div_s: zero-trap + overflow trap"
11087            );
11088        }
11089    }
11090
11091    /// #494 phase 2b: `elide_zero_guard` drops EXACTLY the 8-byte fused
11092    /// zero-trap (`ORRS.W R12,R2,R3; BNE; UDF #0`) and nothing else — the
11093    /// rest of the expansion is byte-identical (splice check).
11094    #[test]
11095    fn test_494_i64_zero_guard_elision_is_exact_splice() {
11096        let encoder = ArmEncoder::new_thumb2();
11097        let mk = |elide_zero_guard: bool| {
11098            encoder
11099                .encode(&ArmOp::I64DivU {
11100                    rdlo: Reg::R4,
11101                    rdhi: Reg::R5,
11102                    rnlo: Reg::R0,
11103                    rnhi: Reg::R1,
11104                    rmlo: Reg::R2,
11105                    rmhi: Reg::R3,
11106                    elide_zero_guard,
11107                })
11108                .unwrap()
11109        };
11110        let full = mk(false);
11111        let elided = mk(true);
11112        assert_eq!(full.len(), elided.len() + 8, "zero guard is 8 bytes");
11113        // Marshal prologue (26 B) unchanged, guard (8 B) gone, tail identical.
11114        assert_eq!(&full[..26], &elided[..26]);
11115        assert_eq!(
11116            &full[26..34],
11117            &[0x52, 0xEA, 0x03, 0x0C, 0x00, 0xD1, 0x00, 0xDE],
11118            "the spliced-out bytes are exactly ORRS.W; BNE; UDF #0"
11119        );
11120        assert_eq!(&full[34..], &elided[26..]);
11121    }
11122
11123    /// #494 phase 2b two-guard distinction (the #633/#634 synergy): a
11124    /// divisor-nonzero fact elides ONLY the zero guard — the INT64_MIN/-1
11125    /// OVERFLOW guard is a separate obligation and must survive
11126    /// `elide_zero_guard: true`. Pinned on div_s in all flag states.
11127    #[test]
11128    fn test_494_i64_divs_overflow_guard_retained_when_only_zero_elided() {
11129        let encoder = ArmEncoder::new_thumb2();
11130        let mk = |zero: bool, ovf: bool| {
11131            encoder
11132                .encode(&ArmOp::I64DivS {
11133                    rdlo: Reg::R4,
11134                    rdhi: Reg::R5,
11135                    rnlo: Reg::R0,
11136                    rnhi: Reg::R1,
11137                    rmlo: Reg::R2,
11138                    rmhi: Reg::R3,
11139                    elide_zero_guard: zero,
11140                    elide_overflow_guard: ovf,
11141                })
11142                .unwrap()
11143        };
11144        let udf_count = |code: &[u8]| {
11145            code.chunks(2)
11146                .filter(|c| u16::from_le_bytes([c[0], c[1]]) == 0xDE00)
11147                .count()
11148        };
11149        let full = mk(false, false);
11150        let zero_only = mk(true, false);
11151        let both = mk(true, true);
11152        assert_eq!(udf_count(&full), 2, "baseline: zero trap + overflow trap");
11153        assert_eq!(
11154            udf_count(&zero_only),
11155            1,
11156            "divisor-nonzero elides the zero trap ONLY — the #633 overflow \
11157             guard must be retained"
11158        );
11159        // The retained guard is the 22-byte overflow sequence, now right
11160        // after the 26-byte marshal prologue.
11161        let guard: Vec<u16> = zero_only[26..48]
11162            .chunks(2)
11163            .map(|c| u16::from_le_bytes([c[0], c[1]]))
11164            .collect();
11165        assert_eq!(
11166            guard,
11167            vec![
11168                0xEA02, 0x0C03, 0xF11C, 0x0F01, 0xD105, 0x2800, 0xD103, 0xF1B1, 0x4F00, 0xD100,
11169                0xDE00,
11170            ],
11171            "the surviving guard is the INT64_MIN/-1 overflow trap"
11172        );
11173        assert_eq!(full.len(), zero_only.len() + 8);
11174        assert_eq!(zero_only.len(), both.len() + 22);
11175        assert_eq!(udf_count(&both), 0, "both obligations discharged ⇒ no UDF");
11176    }
11177
11178    /// #494 phase 2b A32 twin: zero-guard elision is an exact 12-byte splice
11179    /// and the A32 overflow guard survives a zero-only elision.
11180    #[test]
11181    fn test_494_a32_i64_guard_elision() {
11182        let encoder = ArmEncoder::new_arm32();
11183        let mk = |zero: bool, ovf: bool| {
11184            encoder
11185                .encode(&ArmOp::I64DivS {
11186                    rdlo: Reg::R4,
11187                    rdhi: Reg::R5,
11188                    rnlo: Reg::R0,
11189                    rnhi: Reg::R1,
11190                    rmlo: Reg::R2,
11191                    rmhi: Reg::R3,
11192                    elide_zero_guard: zero,
11193                    elide_overflow_guard: ovf,
11194                })
11195                .unwrap()
11196        };
11197        let full = mk(false, false);
11198        let zero_only = mk(true, false);
11199        let both = mk(true, true);
11200        // A32 zero guard = 3 words (ORRS/BNE/UDF), overflow guard = 6 words.
11201        assert_eq!(full.len(), zero_only.len() + 12);
11202        assert_eq!(zero_only.len(), both.len() + 24);
11203        let udf_count = |code: &[u8]| {
11204            code.chunks(4)
11205                .filter(|c| u32::from_le_bytes([c[0], c[1], c[2], c[3]]) == 0xE7F0_00F0)
11206                .count()
11207        };
11208        assert_eq!(udf_count(&full), 2);
11209        assert_eq!(
11210            udf_count(&zero_only),
11211            1,
11212            "A32: overflow guard retained under zero-only elision"
11213        );
11214        assert_eq!(udf_count(&both), 0);
11215    }
11216
11217    /// #633: A32 twin — the conditional-execution overflow guard on the
11218    /// ARM-mode I64DivS, and its absence from I64RemS.
11219    #[test]
11220    fn test_633_a32_i64_divs_overflow_guard() {
11221        let encoder = ArmEncoder::new_arm32();
11222        let mk_divs = ArmOp::I64DivS {
11223            rdlo: Reg::R4,
11224            rdhi: Reg::R5,
11225            rnlo: Reg::R0,
11226            rnhi: Reg::R1,
11227            rmlo: Reg::R2,
11228            rmhi: Reg::R3,
11229            elide_zero_guard: false,
11230            elide_overflow_guard: false,
11231        };
11232        let code = encoder.encode(&mk_divs).unwrap();
11233        let words: Vec<u32> = code
11234            .chunks(4)
11235            .map(|c| u32::from_le_bytes([c[0], c[1], c[2], c[3]]))
11236            .collect();
11237        let guard = [
11238            0xE002_C003u32, // AND   R12, R2, R3
11239            0xE37C_0001,    // CMN   R12, #1
11240            0x0350_0000,    // CMPEQ R0, #0
11241            0x0351_0102,    // CMPEQ R1, #0x80000000
11242            0x1A00_0000,    // BNE +1 insn
11243            0xE7F0_00F0,    // UDF #0
11244        ];
11245        assert!(
11246            words.windows(6).any(|w| w == guard),
11247            "A32 I64DivS carries the INT64_MIN/-1 overflow guard"
11248        );
11249        let rems = encoder
11250            .encode(&ArmOp::I64RemS {
11251                rdlo: Reg::R4,
11252                rdhi: Reg::R5,
11253                rnlo: Reg::R0,
11254                rnhi: Reg::R1,
11255                rmlo: Reg::R2,
11256                rmhi: Reg::R3,
11257                elide_zero_guard: false,
11258            })
11259            .unwrap();
11260        let rems_udfs = rems
11261            .chunks(4)
11262            .filter(|c| u32::from_le_bytes([c[0], c[1], c[2], c[3]]) == 0xE7F0_00F0)
11263            .count();
11264        assert_eq!(rems_udfs, 1, "A32 I64RemS keeps only the zero-divisor trap");
11265    }
11266
11267    #[test]
11268    fn test_encode_nop_thumb2() {
11269        let encoder = ArmEncoder::new_thumb2();
11270        let op = ArmOp::Nop;
11271        let code = encoder.encode(&op).unwrap();
11272        assert_eq!(code.len(), 2); // 16-bit
11273
11274        // NOP: 0xBF00 in little-endian
11275        assert_eq!(code, vec![0x00, 0xBF]);
11276    }
11277
11278    // =========================================================================
11279    // i64 Thumb-2 encoding tests
11280    // =========================================================================
11281
11282    #[test]
11283    fn test_encode_i64_add_thumb2() {
11284        let encoder = ArmEncoder::new_thumb2();
11285        let op = ArmOp::I64Add {
11286            rdlo: Reg::R0,
11287            rdhi: Reg::R1,
11288            rnlo: Reg::R0,
11289            rnhi: Reg::R1,
11290            rmlo: Reg::R2,
11291            rmhi: Reg::R3,
11292        };
11293        let code = encoder.encode(&op).unwrap();
11294        // Should emit ADDS (2 bytes) + ADC.W (4 bytes) = 6 bytes
11295        assert_eq!(code.len(), 6, "I64Add should be 6 bytes (ADDS + ADC.W)");
11296    }
11297
11298    #[test]
11299    fn test_encode_i64_sub_thumb2() {
11300        let encoder = ArmEncoder::new_thumb2();
11301        let op = ArmOp::I64Sub {
11302            rdlo: Reg::R0,
11303            rdhi: Reg::R1,
11304            rnlo: Reg::R0,
11305            rnhi: Reg::R1,
11306            rmlo: Reg::R2,
11307            rmhi: Reg::R3,
11308        };
11309        let code = encoder.encode(&op).unwrap();
11310        // Should emit SUBS (2 bytes) + SBC.W (4 bytes) = 6 bytes
11311        assert_eq!(code.len(), 6, "I64Sub should be 6 bytes (SUBS + SBC.W)");
11312    }
11313
11314    #[test]
11315    fn test_encode_i64_and_thumb2() {
11316        let encoder = ArmEncoder::new_thumb2();
11317        let op = ArmOp::I64And {
11318            rdlo: Reg::R0,
11319            rdhi: Reg::R1,
11320            rnlo: Reg::R0,
11321            rnhi: Reg::R1,
11322            rmlo: Reg::R2,
11323            rmhi: Reg::R3,
11324        };
11325        let code = encoder.encode(&op).unwrap();
11326        // AND.W (4 bytes) + AND.W (4 bytes) = 8 bytes
11327        assert!(code.len() >= 4, "I64And should emit at least 4 bytes");
11328    }
11329
11330    #[test]
11331    fn test_encode_i64_or_thumb2() {
11332        let encoder = ArmEncoder::new_thumb2();
11333        let op = ArmOp::I64Or {
11334            rdlo: Reg::R0,
11335            rdhi: Reg::R1,
11336            rnlo: Reg::R0,
11337            rnhi: Reg::R1,
11338            rmlo: Reg::R2,
11339            rmhi: Reg::R3,
11340        };
11341        let code = encoder.encode(&op).unwrap();
11342        assert!(code.len() >= 4, "I64Or should emit at least 4 bytes");
11343    }
11344
11345    #[test]
11346    fn test_encode_i64_xor_thumb2() {
11347        let encoder = ArmEncoder::new_thumb2();
11348        let op = ArmOp::I64Xor {
11349            rdlo: Reg::R0,
11350            rdhi: Reg::R1,
11351            rnlo: Reg::R0,
11352            rnhi: Reg::R1,
11353            rmlo: Reg::R2,
11354            rmhi: Reg::R3,
11355        };
11356        let code = encoder.encode(&op).unwrap();
11357        assert!(code.len() >= 4, "I64Xor should emit at least 4 bytes");
11358    }
11359
11360    #[test]
11361    fn test_encode_i64_const_small_thumb2() {
11362        let encoder = ArmEncoder::new_thumb2();
11363        // Small constant: only needs MOVW for each half
11364        let op = ArmOp::I64Const {
11365            rdlo: Reg::R0,
11366            rdhi: Reg::R1,
11367            value: 42,
11368        };
11369        let code = encoder.encode(&op).unwrap();
11370        // MOVW R0, #42 (4 bytes) + MOVW R1, #0 (4 bytes) = 8 bytes minimum
11371        assert!(code.len() >= 8, "I64Const should emit at least 8 bytes");
11372    }
11373
11374    #[test]
11375    fn test_encode_i64_const_large_thumb2() {
11376        let encoder = ArmEncoder::new_thumb2();
11377        // Large constant: needs MOVW+MOVT for each half
11378        let op = ArmOp::I64Const {
11379            rdlo: Reg::R0,
11380            rdhi: Reg::R1,
11381            value: 0x1234_5678_9ABC_DEF0_u64 as i64,
11382        };
11383        let code = encoder.encode(&op).unwrap();
11384        // MOVW + MOVT for lo (8 bytes) + MOVW + MOVT for hi (8 bytes) = 16 bytes
11385        assert_eq!(
11386            code.len(),
11387            16,
11388            "I64Const with large value should be 16 bytes"
11389        );
11390    }
11391
11392    #[test]
11393    fn test_encode_i64_extend_i32_s_thumb2() {
11394        let encoder = ArmEncoder::new_thumb2();
11395        let op = ArmOp::I64ExtendI32S {
11396            rdlo: Reg::R0,
11397            rdhi: Reg::R1,
11398            rn: Reg::R0,
11399        };
11400        let code = encoder.encode(&op).unwrap();
11401        // When rdlo == rn, only ASR (4 bytes) is emitted
11402        assert_eq!(
11403            code.len(),
11404            4,
11405            "I64ExtendI32S (same reg) should be 4 bytes (ASR only)"
11406        );
11407    }
11408
11409    #[test]
11410    fn test_encode_i64_extend_i32_s_diff_reg_thumb2() {
11411        let encoder = ArmEncoder::new_thumb2();
11412        let op = ArmOp::I64ExtendI32S {
11413            rdlo: Reg::R0,
11414            rdhi: Reg::R1,
11415            rn: Reg::R2,
11416        };
11417        let code = encoder.encode(&op).unwrap();
11418        // MOV rdlo, rn (2 bytes for low regs) + ASR rdhi, rdlo, #31 (4 bytes) = 6 bytes
11419        assert!(
11420            code.len() >= 6,
11421            "I64ExtendI32S (diff reg) should be at least 6 bytes"
11422        );
11423    }
11424
11425    #[test]
11426    fn test_encode_i64_extend_i32_u_thumb2() {
11427        let encoder = ArmEncoder::new_thumb2();
11428        let op = ArmOp::I64ExtendI32U {
11429            rdlo: Reg::R0,
11430            rdhi: Reg::R1,
11431            rn: Reg::R0,
11432        };
11433        let code = encoder.encode(&op).unwrap();
11434        // When rdlo == rn, only MOV rdhi, #0 (2 bytes) is emitted
11435        assert_eq!(
11436            code.len(),
11437            2,
11438            "I64ExtendI32U (same reg) should be 2 bytes (MOV #0 only)"
11439        );
11440    }
11441
11442    #[test]
11443    fn test_encode_i32_wrap_i64_nop_thumb2() {
11444        let encoder = ArmEncoder::new_thumb2();
11445        // When rd == rnlo, should be a NOP
11446        let op = ArmOp::I32WrapI64 {
11447            rd: Reg::R0,
11448            rnlo: Reg::R0,
11449        };
11450        let code = encoder.encode(&op).unwrap();
11451        assert_eq!(code.len(), 2, "I32WrapI64 same reg should be NOP (2 bytes)");
11452        assert_eq!(code, vec![0x00, 0xBF]); // NOP
11453    }
11454
11455    #[test]
11456    fn test_encode_i32_wrap_i64_diff_reg_thumb2() {
11457        let encoder = ArmEncoder::new_thumb2();
11458        let op = ArmOp::I32WrapI64 {
11459            rd: Reg::R2,
11460            rnlo: Reg::R0,
11461        };
11462        let code = encoder.encode(&op).unwrap();
11463        // MOV R2, R0 (2 or 4 bytes)
11464        assert!(
11465            code.len() >= 2,
11466            "I32WrapI64 diff reg should emit at least 2 bytes"
11467        );
11468    }
11469
11470    #[test]
11471    fn test_encode_i64_eqz_thumb2() {
11472        let encoder = ArmEncoder::new_thumb2();
11473        let op = ArmOp::I64Eqz {
11474            rd: Reg::R0,
11475            rnlo: Reg::R0,
11476            rnhi: Reg::R1,
11477        };
11478        let code = encoder.encode(&op).unwrap();
11479        // Delegates to I64SetCondZ which is already encoded
11480        assert!(
11481            code.len() >= 6,
11482            "I64Eqz should emit at least 6 bytes for ORR+ITE+MOV+MOV"
11483        );
11484    }
11485
11486    #[test]
11487    fn test_encode_i64_eq_thumb2() {
11488        let encoder = ArmEncoder::new_thumb2();
11489        let op = ArmOp::I64Eq {
11490            rd: Reg::R0,
11491            rnlo: Reg::R0,
11492            rnhi: Reg::R1,
11493            rmlo: Reg::R2,
11494            rmhi: Reg::R3,
11495        };
11496        let code = encoder.encode(&op).unwrap();
11497        // Delegates to I64SetCond EQ: CMP lo + IT EQ + CMPEQ hi + ITE EQ + MOV 1 + MOV 0
11498        assert!(code.len() >= 10, "I64Eq should emit at least 10 bytes");
11499    }
11500
11501    #[test]
11502    fn test_encode_i64_ldr_thumb2() {
11503        let encoder = ArmEncoder::new_thumb2();
11504        let op = ArmOp::I64Ldr {
11505            rdlo: Reg::R0,
11506            rdhi: Reg::R1,
11507            addr: MemAddr::imm(Reg::SP, 0),
11508        };
11509        let code = encoder.encode(&op).unwrap();
11510        // Two LDR instructions (lo at offset, hi at offset+4)
11511        assert!(code.len() >= 4, "I64Ldr should emit at least 4 bytes");
11512    }
11513
11514    #[test]
11515    fn test_372_i64_ldr_indexed_materializes_address() {
11516        // #372: a memory i64.load carries an index register (R11 + addr + off).
11517        // The encoder must materialize `ip = base + index` (ADD.W) and load via
11518        // `[ip,#off]` — NOT drop the index. A frame (non-indexed) i64.load must
11519        // stay byte-identical (plain `[base,#off]`, no ADD).
11520        let encoder = ArmEncoder::new_thumb2();
11521        let indexed = encoder
11522            .encode(&ArmOp::I64Ldr {
11523                rdlo: Reg::R0,
11524                rdhi: Reg::R1,
11525                addr: MemAddr::reg_imm(Reg::R11, Reg::R0, 0),
11526            })
11527            .unwrap();
11528        // ADD.W ip, fp, r0 = eb0b 0c00 (byte-verified vs arm-none-eabi-as).
11529        assert_eq!(
11530            &indexed[0..4],
11531            &[0x0b, 0xeb, 0x00, 0x0c],
11532            "indexed I64Ldr must start with ADD.W ip, base, index"
11533        );
11534        let frame = encoder
11535            .encode(&ArmOp::I64Ldr {
11536                rdlo: Reg::R0,
11537                rdhi: Reg::R1,
11538                addr: MemAddr::imm(Reg::SP, 8),
11539            })
11540            .unwrap();
11541        // No index -> no ADD.W prefix (byte-identical frame access).
11542        assert_ne!(
11543            &frame[0..2],
11544            &[0x0b, 0xeb],
11545            "frame (non-indexed) I64Ldr must NOT emit an ADD.W"
11546        );
11547    }
11548
11549    #[test]
11550    fn test_382_i64_ldst_large_offset_materializes_not_skips() {
11551        // #382: an indexed i64.load/store whose static offset > 0xFFF must
11552        // MATERIALIZE the offset into the base — NOT return Err (skip the fn).
11553        // Sequence for reg_imm(R11, R0, 5000): MOVW ip,#5000 ; ADD ip,r0,ip ;
11554        // ADD ip,ip,fp ; LDR/STR halves at [ip,#0] / [ip,#4]. Byte-verified tail
11555        // vs arm-none-eabi-as.
11556        let encoder = ArmEncoder::new_thumb2();
11557        // 0x1388 > 0xFFF (MemAddr is not Copy, so build it per use).
11558
11559        let ld = encoder
11560            .encode(&ArmOp::I64Ldr {
11561                rdlo: Reg::R0,
11562                rdhi: Reg::R1,
11563                addr: MemAddr::reg_imm(Reg::R11, Reg::R0, 5000),
11564            })
11565            .expect("large-offset i64.load must lower, not skip");
11566        // MOVW ip,#0x1388 (4) + ADD ip,r0,ip (4) + ADD ip,ip,fp (4) + 2 LDR (8).
11567        assert_eq!(ld.len(), 20, "expected MOVW + 2×ADD + 2×LDR");
11568        // Must NOT be the small-offset `ADD.W ip, fp, r0` (0x0b 0xeb) prefix —
11569        // that path can only reach imm12 offsets.
11570        assert_ne!(
11571            &ld[0..2],
11572            &[0x0b, 0xeb],
11573            "must materialize the large offset"
11574        );
11575        // Effective base built in ip, then halves at [ip,#0] / [ip,#4].
11576        assert_eq!(
11577            &ld[4..20],
11578            &[
11579                0x00, 0xeb, 0x0c, 0x0c, // ADD.W ip, r0, ip
11580                0x0c, 0xeb, 0x0b, 0x0c, // ADD.W ip, ip, fp
11581                0xdc, 0xf8, 0x00, 0x00, // LDR.W r0, [ip, #0]
11582                0xdc, 0xf8, 0x04, 0x10, // LDR.W r1, [ip, #4]
11583            ],
11584            "large-offset i64.load must fold offset into ip and access [ip,#0]/[ip,#4]"
11585        );
11586
11587        // Store: same base materialization, STR halves.
11588        let st = encoder
11589            .encode(&ArmOp::I64Str {
11590                rdlo: Reg::R2,
11591                rdhi: Reg::R3,
11592                addr: MemAddr::reg_imm(Reg::R11, Reg::R0, 5000),
11593            })
11594            .expect("large-offset i64.store must lower, not skip");
11595        assert_eq!(st.len(), 20);
11596        assert_eq!(
11597            &st[4..20],
11598            &[
11599                0x00, 0xeb, 0x0c, 0x0c, // ADD.W ip, r0, ip
11600                0x0c, 0xeb, 0x0b, 0x0c, // ADD.W ip, ip, fp
11601                0xcc, 0xf8, 0x00, 0x20, // STR.W r2, [ip, #0]
11602                0xcc, 0xf8, 0x04, 0x30, // STR.W r3, [ip, #4]
11603            ],
11604            "large-offset i64.store must fold offset into ip and access [ip,#0]/[ip,#4]"
11605        );
11606
11607        // Small-offset (imm12) indexed access stays byte-identical (#372): the
11608        // effective base is a single `ADD.W ip, fp, r0` and the halves keep the
11609        // folded immediates — NO extra MOVW/ADD.
11610        let small = encoder
11611            .encode(&ArmOp::I64Ldr {
11612                rdlo: Reg::R0,
11613                rdhi: Reg::R1,
11614                addr: MemAddr::reg_imm(Reg::R11, Reg::R0, 8),
11615            })
11616            .unwrap();
11617        assert_eq!(
11618            &small[0..4],
11619            &[0x0b, 0xeb, 0x00, 0x0c],
11620            "small-offset indexed i64 must keep the single ADD.W ip, fp, r0"
11621        );
11622        assert_eq!(small.len(), 12, "ADD.W + 2×LDR.W (offset folded in imm12)");
11623    }
11624
11625    #[test]
11626    fn test_encode_i64_str_thumb2() {
11627        let encoder = ArmEncoder::new_thumb2();
11628        let op = ArmOp::I64Str {
11629            rdlo: Reg::R0,
11630            rdhi: Reg::R1,
11631            addr: MemAddr::imm(Reg::SP, 0),
11632        };
11633        let code = encoder.encode(&op).unwrap();
11634        // Two STR instructions (lo at offset, hi at offset+4)
11635        assert!(code.len() >= 4, "I64Str should emit at least 4 bytes");
11636    }
11637
11638    #[test]
11639    fn test_encode_i64_all_comparisons_thumb2() {
11640        let encoder = ArmEncoder::new_thumb2();
11641
11642        let ops = vec![
11643            ArmOp::I64Ne {
11644                rd: Reg::R0,
11645                rnlo: Reg::R0,
11646                rnhi: Reg::R1,
11647                rmlo: Reg::R2,
11648                rmhi: Reg::R3,
11649            },
11650            ArmOp::I64LtS {
11651                rd: Reg::R0,
11652                rnlo: Reg::R0,
11653                rnhi: Reg::R1,
11654                rmlo: Reg::R2,
11655                rmhi: Reg::R3,
11656            },
11657            ArmOp::I64LtU {
11658                rd: Reg::R0,
11659                rnlo: Reg::R0,
11660                rnhi: Reg::R1,
11661                rmlo: Reg::R2,
11662                rmhi: Reg::R3,
11663            },
11664            ArmOp::I64LeS {
11665                rd: Reg::R0,
11666                rnlo: Reg::R0,
11667                rnhi: Reg::R1,
11668                rmlo: Reg::R2,
11669                rmhi: Reg::R3,
11670            },
11671            ArmOp::I64LeU {
11672                rd: Reg::R0,
11673                rnlo: Reg::R0,
11674                rnhi: Reg::R1,
11675                rmlo: Reg::R2,
11676                rmhi: Reg::R3,
11677            },
11678            ArmOp::I64GtS {
11679                rd: Reg::R0,
11680                rnlo: Reg::R0,
11681                rnhi: Reg::R1,
11682                rmlo: Reg::R2,
11683                rmhi: Reg::R3,
11684            },
11685            ArmOp::I64GtU {
11686                rd: Reg::R0,
11687                rnlo: Reg::R0,
11688                rnhi: Reg::R1,
11689                rmlo: Reg::R2,
11690                rmhi: Reg::R3,
11691            },
11692            ArmOp::I64GeS {
11693                rd: Reg::R0,
11694                rnlo: Reg::R0,
11695                rnhi: Reg::R1,
11696                rmlo: Reg::R2,
11697                rmhi: Reg::R3,
11698            },
11699            ArmOp::I64GeU {
11700                rd: Reg::R0,
11701                rnlo: Reg::R0,
11702                rnhi: Reg::R1,
11703                rmlo: Reg::R2,
11704                rmhi: Reg::R3,
11705            },
11706        ];
11707
11708        for op in &ops {
11709            let code = encoder.encode(op).unwrap();
11710            assert!(
11711                code.len() >= 8,
11712                "i64 comparison {:?} should emit at least 8 bytes, got {}",
11713                op,
11714                code.len()
11715            );
11716        }
11717    }
11718
11719    #[test]
11720    fn test_encode_i64_const_zero_thumb2() {
11721        let encoder = ArmEncoder::new_thumb2();
11722        let op = ArmOp::I64Const {
11723            rdlo: Reg::R0,
11724            rdhi: Reg::R1,
11725            value: 0,
11726        };
11727        let code = encoder.encode(&op).unwrap();
11728        // MOVW R0, #0 (4 bytes) + MOVW R1, #0 (4 bytes) = 8 bytes
11729        assert_eq!(code.len(), 8, "I64Const(0) should be 8 bytes");
11730    }
11731
11732    #[test]
11733    fn test_encode_i64_const_negative_one_thumb2() {
11734        let encoder = ArmEncoder::new_thumb2();
11735        let op = ArmOp::I64Const {
11736            rdlo: Reg::R0,
11737            rdhi: Reg::R1,
11738            value: -1, // 0xFFFF_FFFF_FFFF_FFFF
11739        };
11740        let code = encoder.encode(&op).unwrap();
11741        // MOVW + MOVT for lo (8 bytes) + MOVW + MOVT for hi (8 bytes) = 16 bytes
11742        assert_eq!(code.len(), 16, "I64Const(-1) should be 16 bytes");
11743    }
11744
11745    // =========================================================================
11746    // Sub-word load/store encoding tests
11747    // =========================================================================
11748
11749    #[test]
11750    fn test_encode_ldrb_arm32() {
11751        let encoder = ArmEncoder::new_arm32();
11752        let op = ArmOp::Ldrb {
11753            rd: Reg::R0,
11754            addr: MemAddr::imm(Reg::R1, 4),
11755        };
11756        let code = encoder.encode(&op).unwrap();
11757        assert_eq!(code.len(), 4, "ARM32 LDRB should be 4 bytes");
11758        // LDRB R0, [R1, #4] = 0xE5D10004
11759        let encoded = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
11760        assert_eq!(encoded, 0xE5D10004, "Should encode LDRB R0, [R1, #4]");
11761    }
11762
11763    #[test]
11764    fn test_encode_strb_arm32() {
11765        let encoder = ArmEncoder::new_arm32();
11766        let op = ArmOp::Strb {
11767            rd: Reg::R0,
11768            addr: MemAddr::imm(Reg::R1, 0),
11769        };
11770        let code = encoder.encode(&op).unwrap();
11771        assert_eq!(code.len(), 4, "ARM32 STRB should be 4 bytes");
11772        // STRB R0, [R1, #0] = 0xE5C10000
11773        let encoded = u32::from_le_bytes([code[0], code[1], code[2], code[3]]);
11774        assert_eq!(encoded, 0xE5C10000, "Should encode STRB R0, [R1, #0]");
11775    }
11776
11777    #[test]
11778    fn test_encode_ldrh_arm32() {
11779        let encoder = ArmEncoder::new_arm32();
11780        let op = ArmOp::Ldrh {
11781            rd: Reg::R0,
11782            addr: MemAddr::imm(Reg::R1, 2),
11783        };
11784        let code = encoder.encode(&op).unwrap();
11785        assert_eq!(code.len(), 4, "ARM32 LDRH should be 4 bytes");
11786    }
11787
11788    #[test]
11789    fn test_encode_strh_arm32() {
11790        let encoder = ArmEncoder::new_arm32();
11791        let op = ArmOp::Strh {
11792            rd: Reg::R0,
11793            addr: MemAddr::imm(Reg::R1, 0),
11794        };
11795        let code = encoder.encode(&op).unwrap();
11796        assert_eq!(code.len(), 4, "ARM32 STRH should be 4 bytes");
11797    }
11798
11799    #[test]
11800    fn test_encode_ldrsb_arm32() {
11801        let encoder = ArmEncoder::new_arm32();
11802        let op = ArmOp::Ldrsb {
11803            rd: Reg::R0,
11804            addr: MemAddr::imm(Reg::R1, 0),
11805        };
11806        let code = encoder.encode(&op).unwrap();
11807        assert_eq!(code.len(), 4, "ARM32 LDRSB should be 4 bytes");
11808    }
11809
11810    #[test]
11811    fn test_encode_ldrsh_arm32() {
11812        let encoder = ArmEncoder::new_arm32();
11813        let op = ArmOp::Ldrsh {
11814            rd: Reg::R0,
11815            addr: MemAddr::imm(Reg::R1, 0),
11816        };
11817        let code = encoder.encode(&op).unwrap();
11818        assert_eq!(code.len(), 4, "ARM32 LDRSH should be 4 bytes");
11819    }
11820
11821    #[test]
11822    fn test_encode_ldrb_thumb2_16bit() {
11823        let encoder = ArmEncoder::new_thumb2();
11824        let op = ArmOp::Ldrb {
11825            rd: Reg::R0,
11826            addr: MemAddr::imm(Reg::R1, 4),
11827        };
11828        let code = encoder.encode(&op).unwrap();
11829        // Low registers + small offset -> 16-bit encoding
11830        assert_eq!(
11831            code.len(),
11832            2,
11833            "Thumb-2 LDRB with small offset should be 16-bit"
11834        );
11835    }
11836
11837    #[test]
11838    fn test_encode_ldrb_thumb2_32bit() {
11839        let encoder = ArmEncoder::new_thumb2();
11840        let op = ArmOp::Ldrb {
11841            rd: Reg::R0,
11842            addr: MemAddr::imm(Reg::R1, 100), // offset > 31 needs 32-bit
11843        };
11844        let code = encoder.encode(&op).unwrap();
11845        assert_eq!(
11846            code.len(),
11847            4,
11848            "Thumb-2 LDRB with large offset should be 32-bit"
11849        );
11850    }
11851
11852    #[test]
11853    fn test_encode_strb_thumb2_16bit() {
11854        let encoder = ArmEncoder::new_thumb2();
11855        let op = ArmOp::Strb {
11856            rd: Reg::R0,
11857            addr: MemAddr::imm(Reg::R1, 10),
11858        };
11859        let code = encoder.encode(&op).unwrap();
11860        assert_eq!(
11861            code.len(),
11862            2,
11863            "Thumb-2 STRB with small offset should be 16-bit"
11864        );
11865    }
11866
11867    #[test]
11868    fn test_encode_ldrh_thumb2_16bit() {
11869        let encoder = ArmEncoder::new_thumb2();
11870        let op = ArmOp::Ldrh {
11871            rd: Reg::R0,
11872            addr: MemAddr::imm(Reg::R1, 4), // offset aligned to 2, <= 62
11873        };
11874        let code = encoder.encode(&op).unwrap();
11875        assert_eq!(
11876            code.len(),
11877            2,
11878            "Thumb-2 LDRH with small aligned offset should be 16-bit"
11879        );
11880    }
11881
11882    #[test]
11883    fn test_encode_strh_thumb2_16bit() {
11884        let encoder = ArmEncoder::new_thumb2();
11885        let op = ArmOp::Strh {
11886            rd: Reg::R0,
11887            addr: MemAddr::imm(Reg::R1, 4),
11888        };
11889        let code = encoder.encode(&op).unwrap();
11890        assert_eq!(
11891            code.len(),
11892            2,
11893            "Thumb-2 STRH with small aligned offset should be 16-bit"
11894        );
11895    }
11896
11897    #[test]
11898    fn test_encode_ldrsb_thumb2() {
11899        let encoder = ArmEncoder::new_thumb2();
11900        let op = ArmOp::Ldrsb {
11901            rd: Reg::R0,
11902            addr: MemAddr::imm(Reg::R1, 0),
11903        };
11904        let code = encoder.encode(&op).unwrap();
11905        // LDRSB has no 16-bit immediate form, always 32-bit
11906        assert_eq!(code.len(), 4, "Thumb-2 LDRSB should be 32-bit");
11907    }
11908
11909    #[test]
11910    fn test_encode_ldrsh_thumb2() {
11911        let encoder = ArmEncoder::new_thumb2();
11912        let op = ArmOp::Ldrsh {
11913            rd: Reg::R0,
11914            addr: MemAddr::imm(Reg::R1, 0),
11915        };
11916        let code = encoder.encode(&op).unwrap();
11917        assert_eq!(code.len(), 4, "Thumb-2 LDRSH should be 32-bit");
11918    }
11919
11920    #[test]
11921    fn test_encode_memory_size_thumb2() {
11922        let encoder = ArmEncoder::new_thumb2();
11923        let op = ArmOp::MemorySize { rd: Reg::R0 };
11924        let code = encoder.encode(&op).unwrap();
11925        // R0 and R10 are not both low registers, so this needs careful handling
11926        assert!(!code.is_empty(), "MemorySize should produce code");
11927    }
11928
11929    #[test]
11930    fn test_encode_memory_grow_thumb2() {
11931        let encoder = ArmEncoder::new_thumb2();
11932        let op = ArmOp::MemoryGrow {
11933            rd: Reg::R0,
11934            rn: Reg::R0,
11935        };
11936        let code = encoder.encode(&op).unwrap();
11937        assert_eq!(code.len(), 4, "MemoryGrow (MVN) should be 32-bit Thumb-2");
11938    }
11939
11940    #[test]
11941    fn test_encode_subword_reg_offset_thumb2() {
11942        let encoder = ArmEncoder::new_thumb2();
11943
11944        // LDRB with register offset
11945        let op = ArmOp::Ldrb {
11946            rd: Reg::R0,
11947            addr: MemAddr::reg(Reg::R1, Reg::R2),
11948        };
11949        let code = encoder.encode(&op).unwrap();
11950        assert_eq!(
11951            code.len(),
11952            4,
11953            "Thumb-2 LDRB with reg offset should be 32-bit"
11954        );
11955
11956        // STRB with register offset
11957        let op = ArmOp::Strb {
11958            rd: Reg::R0,
11959            addr: MemAddr::reg(Reg::R1, Reg::R2),
11960        };
11961        let code = encoder.encode(&op).unwrap();
11962        assert_eq!(
11963            code.len(),
11964            4,
11965            "Thumb-2 STRB with reg offset should be 32-bit"
11966        );
11967
11968        // LDRH with register offset
11969        let op = ArmOp::Ldrh {
11970            rd: Reg::R0,
11971            addr: MemAddr::reg(Reg::R1, Reg::R2),
11972        };
11973        let code = encoder.encode(&op).unwrap();
11974        assert_eq!(
11975            code.len(),
11976            4,
11977            "Thumb-2 LDRH with reg offset should be 32-bit"
11978        );
11979
11980        // STRH with register offset
11981        let op = ArmOp::Strh {
11982            rd: Reg::R0,
11983            addr: MemAddr::reg(Reg::R1, Reg::R2),
11984        };
11985        let code = encoder.encode(&op).unwrap();
11986        assert_eq!(
11987            code.len(),
11988            4,
11989            "Thumb-2 STRH with reg offset should be 32-bit"
11990        );
11991    }
11992
11993    #[test]
11994    fn test_encode_subword_reg_imm_offset_thumb2() {
11995        let encoder = ArmEncoder::new_thumb2();
11996
11997        // LDRB with both register and immediate offset
11998        let op = ArmOp::Ldrb {
11999            rd: Reg::R0,
12000            addr: MemAddr::reg_imm(Reg::R1, Reg::R2, 4),
12001        };
12002        let code = encoder.encode(&op).unwrap();
12003        // ADD R12, R2, #4 (4 bytes) + LDRB R0, [R1, R12] (4 bytes) = 8 bytes
12004        assert_eq!(
12005            code.len(),
12006            8,
12007            "Thumb-2 LDRB with reg+imm offset should be 8 bytes"
12008        );
12009    }
12010
12011    // ========================================================================
12012    // Helium MVE encoding tests
12013    // ========================================================================
12014
12015    #[test]
12016    fn test_encode_mve_addi32_thumb2() {
12017        let encoder = ArmEncoder::new_thumb2();
12018        let op = ArmOp::MveAddI {
12019            qd: QReg::Q0,
12020            qn: QReg::Q1,
12021            qm: QReg::Q2,
12022            size: MveSize::S32,
12023        };
12024        let code = encoder.encode(&op).unwrap();
12025        assert_eq!(
12026            code.len(),
12027            4,
12028            "MVE VADD.I32 should be 4 bytes (Thumb-2 32-bit)"
12029        );
12030    }
12031
12032    #[test]
12033    fn test_encode_mve_subi16_thumb2() {
12034        let encoder = ArmEncoder::new_thumb2();
12035        let op = ArmOp::MveSubI {
12036            qd: QReg::Q0,
12037            qn: QReg::Q1,
12038            qm: QReg::Q2,
12039            size: MveSize::S16,
12040        };
12041        let code = encoder.encode(&op).unwrap();
12042        assert_eq!(code.len(), 4, "MVE VSUB.I16 should be 4 bytes");
12043    }
12044
12045    #[test]
12046    fn test_encode_mve_muli8_thumb2() {
12047        let encoder = ArmEncoder::new_thumb2();
12048        let op = ArmOp::MveMulI {
12049            qd: QReg::Q0,
12050            qn: QReg::Q1,
12051            qm: QReg::Q2,
12052            size: MveSize::S8,
12053        };
12054        let code = encoder.encode(&op).unwrap();
12055        assert_eq!(code.len(), 4, "MVE VMUL.I8 should be 4 bytes");
12056    }
12057
12058    #[test]
12059    fn test_encode_mve_bitwise_thumb2() {
12060        let encoder = ArmEncoder::new_thumb2();
12061
12062        let ops = vec![
12063            ArmOp::MveAnd {
12064                qd: QReg::Q0,
12065                qn: QReg::Q1,
12066                qm: QReg::Q2,
12067            },
12068            ArmOp::MveOrr {
12069                qd: QReg::Q0,
12070                qn: QReg::Q1,
12071                qm: QReg::Q2,
12072            },
12073            ArmOp::MveEor {
12074                qd: QReg::Q0,
12075                qn: QReg::Q1,
12076                qm: QReg::Q2,
12077            },
12078            ArmOp::MveBic {
12079                qd: QReg::Q0,
12080                qn: QReg::Q1,
12081                qm: QReg::Q2,
12082            },
12083        ];
12084        for op in ops {
12085            let code = encoder.encode(&op).unwrap();
12086            assert_eq!(code.len(), 4, "MVE bitwise op should be 4 bytes");
12087        }
12088    }
12089
12090    #[test]
12091    fn test_encode_mve_mvn_thumb2() {
12092        let encoder = ArmEncoder::new_thumb2();
12093        let op = ArmOp::MveMvn {
12094            qd: QReg::Q0,
12095            qm: QReg::Q1,
12096        };
12097        let code = encoder.encode(&op).unwrap();
12098        assert_eq!(code.len(), 4, "MVE VMVN should be 4 bytes");
12099    }
12100
12101    #[test]
12102    fn test_encode_mve_load_store_thumb2() {
12103        let encoder = ArmEncoder::new_thumb2();
12104
12105        let load = ArmOp::MveLoad {
12106            qd: QReg::Q0,
12107            addr: MemAddr::imm(Reg::R0, 16),
12108        };
12109        let code = encoder.encode(&load).unwrap();
12110        assert_eq!(code.len(), 4, "MVE VLDRW.32 should be 4 bytes");
12111
12112        let store = ArmOp::MveStore {
12113            qd: QReg::Q1,
12114            addr: MemAddr::imm(Reg::R1, 0),
12115        };
12116        let code = encoder.encode(&store).unwrap();
12117        assert_eq!(code.len(), 4, "MVE VSTRW.32 should be 4 bytes");
12118    }
12119
12120    #[test]
12121    fn test_encode_mve_const_thumb2() {
12122        let encoder = ArmEncoder::new_thumb2();
12123        let op = ArmOp::MveConst {
12124            qd: QReg::Q0,
12125            bytes: [1, 0, 0, 0, 2, 0, 0, 0, 3, 0, 0, 0, 4, 0, 0, 0],
12126        };
12127        let code = encoder.encode(&op).unwrap();
12128        // Should be 4 words of (MOVW R12 + VMOV Sn) = 4 * (4+4) = 32 bytes min
12129        // Some words with hi16=0 skip MOVT, so length varies
12130        assert!(
12131            code.len() >= 24,
12132            "MVE const should produce multiple instructions"
12133        );
12134    }
12135
12136    #[test]
12137    fn test_encode_mve_dup_thumb2() {
12138        let encoder = ArmEncoder::new_thumb2();
12139        let op = ArmOp::MveDup {
12140            qd: QReg::Q0,
12141            rn: Reg::R0,
12142            size: MveSize::S32,
12143        };
12144        let code = encoder.encode(&op).unwrap();
12145        assert_eq!(code.len(), 4, "MVE VDUP.32 should be 4 bytes");
12146    }
12147
12148    #[test]
12149    fn test_encode_mve_extract_lane_thumb2() {
12150        let encoder = ArmEncoder::new_thumb2();
12151        let op = ArmOp::MveExtractLane {
12152            rd: Reg::R0,
12153            qn: QReg::Q1,
12154            lane: 2,
12155            size: MveSize::S32,
12156        };
12157        let code = encoder.encode(&op).unwrap();
12158        assert_eq!(code.len(), 4, "MVE extract lane should be 4 bytes");
12159    }
12160
12161    #[test]
12162    fn test_encode_mve_insert_lane_thumb2() {
12163        let encoder = ArmEncoder::new_thumb2();
12164        let op = ArmOp::MveInsertLane {
12165            qd: QReg::Q0,
12166            rn: Reg::R1,
12167            lane: 3,
12168            size: MveSize::S32,
12169        };
12170        let code = encoder.encode(&op).unwrap();
12171        assert_eq!(code.len(), 4, "MVE insert lane should be 4 bytes");
12172    }
12173
12174    #[test]
12175    fn test_encode_mve_addf32_thumb2() {
12176        let encoder = ArmEncoder::new_thumb2();
12177        let op = ArmOp::MveAddF32 {
12178            qd: QReg::Q0,
12179            qn: QReg::Q1,
12180            qm: QReg::Q2,
12181        };
12182        let code = encoder.encode(&op).unwrap();
12183        assert_eq!(code.len(), 4, "MVE VADD.F32 should be 4 bytes");
12184    }
12185
12186    #[test]
12187    fn test_encode_mve_divf32_thumb2() {
12188        let encoder = ArmEncoder::new_thumb2();
12189        let op = ArmOp::MveDivF32 {
12190            qd: QReg::Q0,
12191            qn: QReg::Q1,
12192            qm: QReg::Q2,
12193        };
12194        let code = encoder.encode(&op).unwrap();
12195        // Lane-wise: 4 x VDIV.F32 = 4 x 4 = 16 bytes
12196        assert_eq!(
12197            code.len(),
12198            16,
12199            "MVE VDIV.F32 (lane-wise) should be 16 bytes"
12200        );
12201    }
12202
12203    #[test]
12204    fn test_encode_mve_sqrtf32_thumb2() {
12205        let encoder = ArmEncoder::new_thumb2();
12206        let op = ArmOp::MveSqrtF32 {
12207            qd: QReg::Q0,
12208            qm: QReg::Q1,
12209        };
12210        let code = encoder.encode(&op).unwrap();
12211        // Lane-wise: 4 x VSQRT.F32 = 4 x 4 = 16 bytes
12212        assert_eq!(
12213            code.len(),
12214            16,
12215            "MVE VSQRT.F32 (lane-wise) should be 16 bytes"
12216        );
12217    }
12218
12219    #[test]
12220    fn test_encode_mve_negf32_thumb2() {
12221        let encoder = ArmEncoder::new_thumb2();
12222        let op = ArmOp::MveNegF32 {
12223            qd: QReg::Q0,
12224            qm: QReg::Q1,
12225        };
12226        let code = encoder.encode(&op).unwrap();
12227        assert_eq!(code.len(), 4, "MVE VNEG.F32 should be 4 bytes");
12228    }
12229
12230    #[test]
12231    fn test_encode_mve_absf32_thumb2() {
12232        let encoder = ArmEncoder::new_thumb2();
12233        let op = ArmOp::MveAbsF32 {
12234            qd: QReg::Q0,
12235            qm: QReg::Q1,
12236        };
12237        let code = encoder.encode(&op).unwrap();
12238        assert_eq!(code.len(), 4, "MVE VABS.F32 should be 4 bytes");
12239    }
12240
12241    /// VCR-RA-001 / immediate-folding precondition: pins the Thumb-2 `AND`
12242    /// immediate encoding for the byte range and documents its bound.
12243    ///
12244    /// The `And { Operand2::Imm }` encoder packs the low 12 bits straight into
12245    /// the `i:imm3:imm8` field WITHOUT applying ThumbExpandImm (the modified-
12246    /// immediate expansion). For `imm <= 0xFF` (e.g. gale's int8 clamps
12247    /// `#0x7e` / `#0x7f`) that is correct — `i:imm3 = 0000` means "imm8
12248    /// zero-extended". So `and r2, r0, #0x7e` encodes to the canonical
12249    /// `00 f0 7e 02`. For `imm >= 0x100` the field would need a true
12250    /// ThumbExpandImm pattern (rotation / replication), which is NOT
12251    /// implemented here — so **immediate folding must gate on `imm <= 0xFF`**
12252    /// until the encoder is hardened to ThumbExpandImm/Ok-or-Err (the
12253    /// "encoder must be Ok-or-Err, never silently wrong" principle, #180/#185).
12254    /// This bound covers the measured `flat_flight` waste (#209).
12255    #[test]
12256    fn and_immediate_encodes_correctly_in_byte_range_documents_fold_bound() {
12257        let encoder = ArmEncoder::new_thumb2();
12258        let op = ArmOp::And {
12259            rd: Reg::R2,
12260            rn: Reg::R0,
12261            op2: Operand2::Imm(0x7e),
12262        };
12263        let code = encoder.encode(&op).unwrap();
12264        assert_eq!(
12265            code,
12266            vec![0x00, 0xf0, 0x7e, 0x02],
12267            "and r2, r0, #0x7e must encode to the canonical AND.W T1 (imm8=0x7e)"
12268        );
12269    }
12270
12271    /// #255: the shared ThumbExpandImm reverse-encoder underpinning the
12272    /// data-processing immediate fix. Encodable modified immediates round-trip to
12273    /// the expected `i:imm3:imm8` field; a genuinely non-modified value is `None`
12274    /// (caller must materialize into a register). Note `1000 = 0xFA ror 30` *is*
12275    /// representable (field 0xF7A) — the old encoder mis-encoded it (raw 0x3E8);
12276    /// this encodes it correctly.
12277    #[test]
12278    fn try_thumb_expand_imm_encodes_modified_immediates() {
12279        assert_eq!(try_thumb_expand_imm(0x7e), Some(0x07e)); // zero-extended byte
12280        assert_eq!(try_thumb_expand_imm(0xff), Some(0x0ff));
12281        assert_eq!(try_thumb_expand_imm(0x0001_0001), Some(0x101)); // 0x00XY00XY
12282        assert_eq!(try_thumb_expand_imm(0xff00_ff00), Some(0x2ff)); // 0xXY00XY00
12283        assert_eq!(try_thumb_expand_imm(0xffff_ffff), Some(0x3ff)); // 0xXYXYXYXY
12284        assert_eq!(try_thumb_expand_imm(0x100), Some(0xf80)); // 0x80 ror 31
12285        assert_eq!(try_thumb_expand_imm(0x8000_0000), Some(0x400)); // 0x80 ror 8
12286        assert_eq!(try_thumb_expand_imm(1000), Some(0xf7a)); // 0xFA ror 30
12287        // Genuinely unrepresentable (bits too far apart for an 8-bit window).
12288        assert_eq!(try_thumb_expand_imm(0x101), None);
12289        assert_eq!(try_thumb_expand_imm(0x12345), None);
12290    }
12291
12292    /// #255: CMP/ADDS/SUBS encode any valid modified immediate correctly, and
12293    /// ERROR (not silently mis-encode) on a genuinely unrepresentable one,
12294    /// forcing the selector to materialize into a register — closing the
12295    /// silent-miscompile class of #251/#253.
12296    #[test]
12297    fn cmp_adds_subs_immediate_error_on_non_modified_imm() {
12298        let encoder = ArmEncoder::new_thumb2();
12299        // cmp r0, #0xff → valid → Ok; cmp r0, #1000 → valid (0xFA ror 30) → Ok.
12300        assert!(encoder.encode_thumb32_cmp_imm(&Reg::R0, 0xff).is_ok());
12301        assert!(encoder.encode_thumb32_cmp_imm(&Reg::R0, 1000).is_ok());
12302        // cmp r0, #0x101 → NOT a modified immediate → Err (materialize-reg).
12303        assert!(
12304            encoder.encode_thumb32_cmp_imm(&Reg::R0, 0x101).is_err(),
12305            "cmp #0x101 must error, not compare the wrong constant"
12306        );
12307        assert!(
12308            encoder
12309                .encode_thumb32_adds(&Reg::R0, &Reg::R0, 0x101)
12310                .is_err()
12311        );
12312        assert!(
12313            encoder
12314                .encode_thumb32_subs(&Reg::R0, &Reg::R0, 0x101)
12315                .is_err()
12316        );
12317        // ...but a valid modified immediate still encodes.
12318        assert!(
12319            encoder
12320                .encode_thumb32_adds(&Reg::R0, &Reg::R0, 0x80)
12321                .is_ok()
12322        );
12323    }
12324
12325    /// #257: MLA (multiply-accumulate) encodes as MLS without the bit-4 op flag.
12326    /// `mla r2, r3, r4, r8` (rd=r2, rn=r3, rm=r4, ra=r8) → Thumb-2 `03 fb 04 82`.
12327    #[test]
12328    fn mla_thumb2_encodes_correctly() {
12329        let encoder = ArmEncoder::new_thumb2();
12330        let code = encoder
12331            .encode(&ArmOp::Mla {
12332                rd: Reg::R2,
12333                rn: Reg::R3,
12334                rm: Reg::R4,
12335                ra: Reg::R8,
12336            })
12337            .unwrap();
12338        // hw1 = 0xFB03, hw2 = (8<<12)|(2<<8)|4 = 0x8204
12339        assert_eq!(code, vec![0x03, 0xfb, 0x04, 0x82]);
12340    }
12341
12342    /// #259: LDR/STR (and sub-word) immediate-offset encoders truncated
12343    /// `offset & 0xFFF`, silently targeting the wrong address for offset >= 4096.
12344    /// They now error (the selector must use register-offset addressing) — the
12345    /// load/store sibling of the #253/#255 class. Offsets <= 4095 still encode.
12346    #[test]
12347    fn ldst_imm12_offset_errors_when_out_of_range() {
12348        let encoder = ArmEncoder::new_thumb2();
12349        // offset 0xFFF (4095): valid → Ok; ldr r0, [r1, #4095].
12350        assert!(
12351            encoder
12352                .encode_thumb32_ldr(&Reg::R0, &Reg::R1, 0xFFF)
12353                .is_ok()
12354        );
12355        // offset 0x1000 (4096): out of imm12 range → Err (not & 0xFFF → #0).
12356        assert!(
12357            encoder
12358                .encode_thumb32_ldr(&Reg::R0, &Reg::R1, 0x1000)
12359                .is_err(),
12360            "ldr offset 4096 must error, not wrap to 0"
12361        );
12362        assert!(
12363            encoder
12364                .encode_thumb32_str(&Reg::R0, &Reg::R1, 0x1000)
12365                .is_err()
12366        );
12367        assert!(
12368            encoder
12369                .encode_thumb32_ldrb_imm(&Reg::R0, &Reg::R1, 5000)
12370                .is_err()
12371        );
12372        assert!(
12373            encoder
12374                .encode_thumb32_strh_imm(&Reg::R0, &Reg::R1, 5000)
12375                .is_err()
12376        );
12377    }
12378
12379    /// Latent miscompile fix: ADD/SUB with a >0xFF immediate (e.g.
12380    /// `add sp, sp, #frame` for a >=256-byte frame) used ADD.W (T3), whose
12381    /// `i:imm3:imm8` is a ThumbExpandImm modified immediate — so `#256` silently
12382    /// encoded as `#0` (stack corruption). Use ADDW/SUBW (T4), a PLAIN 12-bit
12383    /// immediate, for 0x100..=0xFFF; keep T3 for <=0xFF (bit-identical); error
12384    /// beyond 4095.
12385    #[test]
12386    fn add_sub_large_immediate_use_addw_subw_not_misencoded() {
12387        let encoder = ArmEncoder::new_thumb2();
12388        // add sp, sp, #256  →  ADDW (T4) SP, SP, #256  =  0d f2 00 1d
12389        assert_eq!(
12390            encoder
12391                .encode(&ArmOp::Add {
12392                    rd: Reg::SP,
12393                    rn: Reg::SP,
12394                    op2: Operand2::Imm(256),
12395                })
12396                .unwrap(),
12397            vec![0x0d, 0xf2, 0x00, 0x1d],
12398            "add sp,sp,#256 must be ADDW (plain imm12), not a mis-encoded ADD.W"
12399        );
12400        // sub sp, sp, #256  →  SUBW (T4) SP, SP, #256  =  ad f2 00 1d
12401        assert_eq!(
12402            encoder
12403                .encode(&ArmOp::Sub {
12404                    rd: Reg::SP,
12405                    rn: Reg::SP,
12406                    op2: Operand2::Imm(256),
12407                })
12408                .unwrap(),
12409            vec![0xad, 0xf2, 0x00, 0x1d],
12410        );
12411        // > 4095 has no single-instruction encoding → error, not silent wrong.
12412        assert!(
12413            encoder
12414                .encode(&ArmOp::Add {
12415                    rd: Reg::SP,
12416                    rn: Reg::SP,
12417                    op2: Operand2::Imm(5000),
12418                })
12419                .is_err(),
12420            "add #5000 must error (no single ADDW), not mis-encode"
12421        );
12422    }
12423
12424    /// Closes the data-proc immediate class: AND and CMN now go through
12425    /// `try_thumb_expand_imm` like ORR/EOR/CMP — correct for any modified
12426    /// immediate, `Err` (not raw-pack / NOP) on an un-encodable one. The byte
12427    /// range stays bit-identical (`and r2,r0,#0x7e` is unchanged).
12428    #[test]
12429    fn and_cmn_immediate_thumb_expand_else_error() {
12430        let encoder = ArmEncoder::new_thumb2();
12431        // byte range unchanged (bit-identical with the pre-retrofit encoding)
12432        assert_eq!(
12433            encoder
12434                .encode(&ArmOp::And {
12435                    rd: Reg::R2,
12436                    rn: Reg::R0,
12437                    op2: Operand2::Imm(0x7e),
12438                })
12439                .unwrap(),
12440            vec![0x00, 0xf0, 0x7e, 0x02],
12441        );
12442        // a valid replicated modified immediate now encodes (was silently wrong)
12443        assert!(
12444            encoder
12445                .encode(&ArmOp::And {
12446                    rd: Reg::R2,
12447                    rn: Reg::R0,
12448                    op2: Operand2::Imm(0xff00ff00u32 as i32),
12449                })
12450                .is_ok()
12451        );
12452        // a genuinely un-encodable immediate errors (AND was raw-pack; CMN NOP)
12453        assert!(
12454            encoder
12455                .encode(&ArmOp::And {
12456                    rd: Reg::R2,
12457                    rn: Reg::R0,
12458                    op2: Operand2::Imm(0x101),
12459                })
12460                .is_err()
12461        );
12462        assert!(
12463            encoder
12464                .encode(&ArmOp::Cmn {
12465                    rn: Reg::R0,
12466                    op2: Operand2::Imm(0x101),
12467                })
12468                .is_err(),
12469            "CMN #0x101 must error, not emit a NOP"
12470        );
12471    }
12472
12473    /// VCR-RA-001: ORR/EOR with a small immediate must encode the real
12474    /// instruction (not a silent `0xBF00` NOP). Pins the byte range and the
12475    /// Ok-or-Err bound that makes future Or/Eor immediate folding safe.
12476    #[test]
12477    fn orr_eor_immediate_encode_in_byte_range_else_error() {
12478        let encoder = ArmEncoder::new_thumb2();
12479        // orr r2, r0, #0x7e  →  ORR.W T1, imm8=0x7e
12480        assert_eq!(
12481            encoder
12482                .encode(&ArmOp::Orr {
12483                    rd: Reg::R2,
12484                    rn: Reg::R0,
12485                    op2: Operand2::Imm(0x7e),
12486                })
12487                .unwrap(),
12488            vec![0x40, 0xf0, 0x7e, 0x02],
12489        );
12490        // eor r2, r0, #0x7e  →  EOR.W T1, imm8=0x7e
12491        assert_eq!(
12492            encoder
12493                .encode(&ArmOp::Eor {
12494                    rd: Reg::R2,
12495                    rn: Reg::R0,
12496                    op2: Operand2::Imm(0x7e),
12497                })
12498                .unwrap(),
12499            vec![0x80, 0xf0, 0x7e, 0x02],
12500        );
12501        // Out-of-range immediates error rather than silently mis-encode / NOP.
12502        assert!(
12503            encoder
12504                .encode(&ArmOp::Orr {
12505                    rd: Reg::R2,
12506                    rn: Reg::R0,
12507                    op2: Operand2::Imm(0x140),
12508                })
12509                .is_err(),
12510            "ORR #0x140 must error, not emit a NOP"
12511        );
12512    }
12513
12514    #[test]
12515    fn test_encode_mve_different_qregs() {
12516        let encoder = ArmEncoder::new_thumb2();
12517
12518        // Test that different Q-register numbers produce different encodings
12519        let op1 = ArmOp::MveAddI {
12520            qd: QReg::Q0,
12521            qn: QReg::Q0,
12522            qm: QReg::Q0,
12523            size: MveSize::S32,
12524        };
12525        let op2 = ArmOp::MveAddI {
12526            qd: QReg::Q3,
12527            qn: QReg::Q5,
12528            qm: QReg::Q7,
12529            size: MveSize::S32,
12530        };
12531        let code1 = encoder.encode(&op1).unwrap();
12532        let code2 = encoder.encode(&op2).unwrap();
12533        assert_ne!(
12534            code1, code2,
12535            "Different Q-registers should produce different encodings"
12536        );
12537    }
12538
12539    #[test]
12540    fn test_encode_mve_arm32_loud_err() {
12541        // #615: MVE (Helium) is Thumb-2-only. The ARM32 encoder used to emit
12542        // a silent NOP here (dropping the vector op); it must now be a typed
12543        // Err so a broken "MVE implies Thumb" invariant fails loudly.
12544        let encoder = ArmEncoder::new_arm32();
12545        let op = ArmOp::MveAddI {
12546            qd: QReg::Q0,
12547            qn: QReg::Q1,
12548            qm: QReg::Q2,
12549            size: MveSize::S32,
12550        };
12551        let err = encoder
12552            .encode(&op)
12553            .expect_err("ARM32 MVE must be a loud Err, not a silent NOP (#615)");
12554        assert!(
12555            err.to_string().contains("Thumb-2 only"),
12556            "unexpected error message: {err}"
12557        );
12558    }
12559}