Skip to main content

fsqlite_parser/
lexer.rs

1// bd-2tu6: §10.1 SQL Lexer
2//
3// Converts SQL text into a stream of tokens. Uses memchr for accelerated
4// string scanning. Tracks line/column for error reporting.
5
6use fsqlite_ast::Span;
7use fsqlite_types::limits::MAX_VARIABLE_NUMBER;
8use hashbrown::HashSet;
9use memchr::memchr;
10use std::sync::Arc;
11use std::sync::atomic::{AtomicBool, AtomicU64, Ordering};
12use std::time::Instant;
13use tracing::Level;
14
15use crate::token::{Token, TokenKind};
16
17/// Histogram buckets for `fsqlite_tokenize_duration_seconds`.
18#[derive(Debug, Clone, Copy, PartialEq, Eq, Default)]
19pub struct TokenizeDurationSecondsHistogram {
20    /// Duration <= 100 µs.
21    pub le_100us: u64,
22    /// Duration <= 250 µs.
23    pub le_250us: u64,
24    /// Duration <= 500 µs.
25    pub le_500us: u64,
26    /// Duration <= 1 ms.
27    pub le_1ms: u64,
28    /// Duration <= 5 ms.
29    pub le_5ms: u64,
30    /// Duration > 5 ms.
31    pub gt_5ms: u64,
32}
33
34/// Point-in-time tokenize metric snapshot.
35#[derive(Debug, Clone, Copy, PartialEq, Eq, Default)]
36pub struct TokenizeMetricsSnapshot {
37    /// Monotonic token counter across all tokenize calls.
38    pub fsqlite_tokenize_tokens_total: u64,
39    /// Histogram buckets for tokenize runtime.
40    pub fsqlite_tokenize_duration_seconds: TokenizeDurationSecondsHistogram,
41    /// Total tokenize observations recorded in histogram.
42    pub fsqlite_tokenize_duration_seconds_count: u64,
43    /// Sum of tokenize durations in microseconds.
44    pub fsqlite_tokenize_duration_seconds_sum_micros: u64,
45}
46
47static FSQLITE_TOKENIZE_TOKENS_TOTAL: AtomicU64 = AtomicU64::new(0);
48static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US: AtomicU64 = AtomicU64::new(0);
49static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US: AtomicU64 = AtomicU64::new(0);
50static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US: AtomicU64 = AtomicU64::new(0);
51static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS: AtomicU64 = AtomicU64::new(0);
52static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS: AtomicU64 = AtomicU64::new(0);
53static FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS: AtomicU64 = AtomicU64::new(0);
54static FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT: AtomicU64 = AtomicU64::new(0);
55static FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS: AtomicU64 = AtomicU64::new(0);
56static FSQLITE_TOKENIZE_METRICS_ENABLED: AtomicBool = AtomicBool::new(false);
57
58fn saturating_u64_from_usize(value: usize) -> u64 {
59    u64::try_from(value).unwrap_or(u64::MAX)
60}
61
62fn saturating_u64_from_u128(value: u128) -> u64 {
63    u64::try_from(value).unwrap_or(u64::MAX)
64}
65
66fn record_tokenize_metrics(token_count: usize, elapsed_micros: u64) {
67    FSQLITE_TOKENIZE_TOKENS_TOTAL
68        .fetch_add(saturating_u64_from_usize(token_count), Ordering::Relaxed);
69    FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT.fetch_add(1, Ordering::Relaxed);
70    FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS.fetch_add(elapsed_micros, Ordering::Relaxed);
71
72    let bucket = match elapsed_micros {
73        0..=100 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US,
74        101..=250 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US,
75        251..=500 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US,
76        501..=1_000 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS,
77        1_001..=5_000 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS,
78        _ => &FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS,
79    };
80    bucket.fetch_add(1, Ordering::Relaxed);
81}
82
83/// Point-in-time snapshot of tokenize metrics.
84#[must_use]
85pub fn tokenize_metrics_snapshot() -> TokenizeMetricsSnapshot {
86    TokenizeMetricsSnapshot {
87        fsqlite_tokenize_tokens_total: FSQLITE_TOKENIZE_TOKENS_TOTAL.load(Ordering::Relaxed),
88        fsqlite_tokenize_duration_seconds: TokenizeDurationSecondsHistogram {
89            le_100us: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US.load(Ordering::Relaxed),
90            le_250us: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US.load(Ordering::Relaxed),
91            le_500us: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US.load(Ordering::Relaxed),
92            le_1ms: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS.load(Ordering::Relaxed),
93            le_5ms: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS.load(Ordering::Relaxed),
94            gt_5ms: FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS.load(Ordering::Relaxed),
95        },
96        fsqlite_tokenize_duration_seconds_count: FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT
97            .load(Ordering::Relaxed),
98        fsqlite_tokenize_duration_seconds_sum_micros: FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS
99            .load(Ordering::Relaxed),
100    }
101}
102
103/// Enable or disable tokenize metrics collection on the hot path.
104pub fn set_tokenize_metrics_enabled(enabled: bool) {
105    FSQLITE_TOKENIZE_METRICS_ENABLED.store(enabled, Ordering::Relaxed);
106}
107
108/// Return whether tokenize metrics collection is enabled.
109#[must_use]
110pub fn tokenize_metrics_enabled() -> bool {
111    FSQLITE_TOKENIZE_METRICS_ENABLED.load(Ordering::Relaxed)
112}
113
114/// Reset tokenize metrics (used by tests/diagnostics).
115pub fn reset_tokenize_metrics() {
116    FSQLITE_TOKENIZE_TOKENS_TOTAL.store(0, Ordering::Relaxed);
117    FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US.store(0, Ordering::Relaxed);
118    FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US.store(0, Ordering::Relaxed);
119    FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US.store(0, Ordering::Relaxed);
120    FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS.store(0, Ordering::Relaxed);
121    FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS.store(0, Ordering::Relaxed);
122    FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS.store(0, Ordering::Relaxed);
123    FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT.store(0, Ordering::Relaxed);
124    FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS.store(0, Ordering::Relaxed);
125}
126
127/// Bound retained identifier interners so scratch reuse does not grow without limit.
128const MAX_RETAINED_IDENTIFIER_INTERNER_ENTRIES: usize = 256;
129const MAX_RETAINED_IDENTIFIER_INTERNER_BYTES: usize = 16 * 1024;
130
131thread_local! {
132    /// bd-5310l benchmark knob: force `retained_bytes` to recompute via the O(entries) fold instead
133    /// of the incremental running sum, so an A/B harness can measure the fold cost within one build.
134    /// Off by default; zero cost when off.
135    static FSQLITE_FORCE_INTERNER_SCAN_BENCH: std::cell::Cell<bool> =
136        const { std::cell::Cell::new(false) };
137}
138
139/// Force the O(entries) `retained_bytes` fold on the current thread (bd-5310l bench A/B only).
140///
141/// When `true`, the interner recomputes its retained byte count by scanning every entry instead of
142/// using the incrementally-maintained sum, so the two can be compared in one process.
143pub fn set_force_interner_scan_bench(enabled: bool) {
144    FSQLITE_FORCE_INTERNER_SCAN_BENCH.with(|c| c.set(enabled));
145}
146
147/// SQL lexer that produces a stream of tokens from source text.
148#[derive(Debug, Default)]
149pub(crate) struct IdentifierInterner {
150    values: HashSet<Arc<str>>,
151    /// bd-5310l: running sum of `value.len()` over all interned entries, kept incrementally so
152    /// `retained_bytes` (called on EVERY parse by `prepare_for_next_parse`) is O(1) instead of an
153    /// O(entries) fold. Entries are only added (`intern`) or bulk-cleared (`reset`), so the running
154    /// sum stays exactly equal to the fold. Byte-identical: only the threshold computation changes.
155    interned_bytes: usize,
156}
157
158impl IdentifierInterner {
159    fn intern(&mut self, value: &str) -> Arc<str> {
160        if let Some(existing) = self.values.get(value) {
161            return Arc::clone(existing);
162        }
163
164        let interned: Arc<str> = Arc::from(value);
165        let inserted = Arc::clone(&interned);
166        self.values.insert(interned);
167        self.interned_bytes = self.interned_bytes.saturating_add(value.len());
168        inserted
169    }
170
171    pub(crate) fn reset(&mut self) {
172        self.values = HashSet::new();
173        self.interned_bytes = 0;
174    }
175
176    pub(crate) fn retained_bytes(&self) -> usize {
177        // bd-5310l: use the incrementally-maintained `interned_bytes` (O(1)) rather than folding
178        // over every entry (O(entries)) on the per-parse hot path. A bench force-flag reinstates the
179        // fold so the two can be A/B-compared within one build.
180        let interned_value_bytes = if FSQLITE_FORCE_INTERNER_SCAN_BENCH.with(std::cell::Cell::get) {
181            self.values
182                .iter()
183                .fold(0usize, |sum, value| sum.saturating_add(value.len()))
184        } else {
185            self.interned_bytes
186        };
187        self.values
188            .capacity()
189            .saturating_mul(std::mem::size_of::<Arc<str>>())
190            .saturating_add(interned_value_bytes)
191    }
192
193    pub(crate) fn prepare_for_next_parse(&mut self) {
194        if self.values.len() > MAX_RETAINED_IDENTIFIER_INTERNER_ENTRIES
195            || self.retained_bytes() > MAX_RETAINED_IDENTIFIER_INTERNER_BYTES
196        {
197            self.reset();
198        }
199    }
200
201    #[cfg(test)]
202    pub(crate) fn is_empty(&self) -> bool {
203        self.values.is_empty()
204    }
205
206    #[cfg(test)]
207    pub(crate) fn len(&self) -> usize {
208        self.values.len()
209    }
210}
211
212/// SQL lexer that produces a stream of tokens from source text.
213pub struct Lexer<'a> {
214    /// The source bytes (UTF-8).
215    src: &'a [u8],
216    /// Current byte offset into src.
217    pos: usize,
218    /// Current line number (1-based).
219    line: u32,
220    /// Current column number (1-based).
221    col: u32,
222    /// Whether TRACE character-level logging is enabled.
223    trace_chars: bool,
224    /// Per-parse identifier interner reused by scratch callers.
225    interner: IdentifierInterner,
226}
227
228impl<'a> Lexer<'a> {
229    fn log_token(token: &Token) {
230        tracing::debug!(
231            target: "fsqlite.parse",
232            token = ?token.kind,
233            start = token.span.start,
234            end = token.span.end,
235            line = token.line,
236            col = token.col,
237            "tokenized token"
238        );
239    }
240
241    /// Create a new lexer for the given SQL source text.
242    #[must_use]
243    pub fn new(source: &'a str) -> Self {
244        Self {
245            src: source.as_bytes(),
246            pos: 0,
247            line: 1,
248            col: 1,
249            trace_chars: tracing::enabled!(target: "fsqlite.parse", Level::TRACE),
250            interner: IdentifierInterner::default(),
251        }
252    }
253
254    /// Tokenize the entire input into a Vec of tokens.
255    #[must_use]
256    pub fn tokenize(source: &'a str) -> Vec<Token> {
257        let mut tokens = Vec::new();
258        Self::tokenize_into(source, &mut tokens);
259        tokens
260    }
261
262    fn new_with_interner(source: &'a str, interner: IdentifierInterner) -> Self {
263        Self {
264            src: source.as_bytes(),
265            pos: 0,
266            line: 1,
267            col: 1,
268            trace_chars: tracing::enabled!(target: "fsqlite.parse", Level::TRACE),
269            interner,
270        }
271    }
272
273    /// Tokenize the entire input into a caller-owned buffer.
274    ///
275    /// This preserves the buffer's existing heap allocation across repeated
276    /// parses so statement-level callers can treat token storage as lookaside
277    /// scratch instead of rebuilding a fresh `Vec<Token>` on every miss.
278    pub fn tokenize_into(source: &'a str, tokens: &mut Vec<Token>) {
279        let mut interner = IdentifierInterner::default();
280        Self::tokenize_into_with_interner(source, tokens, &mut interner);
281    }
282
283    pub(crate) fn tokenize_into_with_interner(
284        source: &'a str,
285        tokens: &mut Vec<Token>,
286        interner: &mut IdentifierInterner,
287    ) {
288        let input_bytes = source.len();
289        let collect_tokenize_metrics = tokenize_metrics_enabled();
290        let trace_tokenize = tracing::enabled!(target: "fsqlite.parse", Level::TRACE);
291        let span = trace_tokenize.then(|| {
292            tracing::span!(
293                target: "fsqlite.parse",
294                Level::TRACE,
295                "tokenize",
296                token_count = tracing::field::Empty,
297                input_bytes,
298                elapsed_us = tracing::field::Empty,
299            )
300        });
301        let _guard = span.as_ref().map(|span| span.enter());
302        let started = (collect_tokenize_metrics || trace_tokenize).then(Instant::now);
303
304        let mut lexer = Self::new_with_interner(source, std::mem::take(interner));
305        let target_capacity = input_bytes / 4 + 1;
306        tokens.clear();
307        if target_capacity > tokens.capacity() {
308            tokens.reserve(target_capacity - tokens.capacity());
309        }
310        loop {
311            let tok = lexer.next_token();
312            let is_eof = tok.kind == TokenKind::Eof;
313            tokens.push(tok);
314            if is_eof {
315                break;
316            }
317        }
318
319        *interner = lexer.interner;
320
321        if let Some(started) = started {
322            let elapsed_us = saturating_u64_from_u128(started.elapsed().as_micros());
323            if let Some(span) = span.as_ref() {
324                span.record("token_count", saturating_u64_from_usize(tokens.len()));
325                span.record("elapsed_us", elapsed_us);
326            }
327            if collect_tokenize_metrics {
328                record_tokenize_metrics(tokens.len(), elapsed_us);
329            }
330        }
331    }
332
333    /// Expose tokenize metrics as a snapshot.
334    #[must_use]
335    pub fn metrics_snapshot() -> TokenizeMetricsSnapshot {
336        tokenize_metrics_snapshot()
337    }
338
339    /// Reset tokenize metrics.
340    pub fn reset_metrics() {
341        reset_tokenize_metrics();
342    }
343
344    /// Produce the next token.
345    pub fn next_token(&mut self) -> Token {
346        self.skip_whitespace_and_comments();
347
348        if self.pos >= self.src.len() {
349            let token = self.make_token(TokenKind::Eof, self.pos, self.pos);
350            Self::log_token(&token);
351            return token;
352        }
353
354        let start = self.pos;
355        let start_line = self.line;
356        let start_col = self.col;
357        let ch = self.src[self.pos];
358
359        let kind = match ch {
360            // String literal (single-quoted)
361            b'\'' => self.lex_string(),
362
363            // Double-quoted identifier
364            b'"' => self.lex_double_quoted_id(),
365
366            // Backtick-quoted identifier
367            b'`' => self.lex_backtick_id(),
368
369            // Bracket-quoted identifier
370            b'[' => self.lex_bracket_id(),
371
372            // Blob literal or hex
373            b'X' | b'x' if self.peek_at(1) == Some(b'\'') => self.lex_blob(),
374
375            // Numbers
376            b'0'..=b'9' => self.lex_number(),
377            b'.' if self.peek_at(1).is_some_and(|c| c.is_ascii_digit()) => self.lex_number(),
378
379            // Identifiers and keywords
380            b'a'..=b'z' | b'A'..=b'Z' | b'_' | 0x80..=0xFF => self.lex_identifier(),
381
382            // Bind parameters
383            b'?' => self.lex_question(),
384            b':' => self.lex_colon_param(),
385            b'@' => self.lex_at_param(),
386            b'$' => self.lex_dollar_param(),
387
388            // Operators and punctuation
389            b'+' => {
390                self.advance();
391                TokenKind::Plus
392            }
393            b'*' => {
394                self.advance();
395                TokenKind::Star
396            }
397            b'/' => {
398                self.advance();
399                TokenKind::Slash
400            }
401            b'%' => {
402                self.advance();
403                TokenKind::Percent
404            }
405            b'&' => {
406                self.advance();
407                TokenKind::Ampersand
408            }
409            b'~' => {
410                self.advance();
411                TokenKind::Tilde
412            }
413            b',' => {
414                self.advance();
415                TokenKind::Comma
416            }
417            b';' => {
418                self.advance();
419                TokenKind::Semicolon
420            }
421            b'(' => {
422                self.advance();
423                TokenKind::LeftParen
424            }
425            b')' => {
426                self.advance();
427                TokenKind::RightParen
428            }
429            b'.' => {
430                self.advance();
431                TokenKind::Dot
432            }
433
434            // Multi-character operators
435            b'-' => self.lex_minus_or_arrow(),
436            b'<' => self.lex_lt(),
437            b'>' => self.lex_gt(),
438            b'=' => self.lex_eq(),
439            b'!' => self.lex_bang(),
440            b'|' => self.lex_pipe(),
441
442            _ => {
443                self.advance();
444                let s = String::from_utf8_lossy(&self.src[start..self.pos]).into_owned();
445                TokenKind::Error(format!("unexpected character: {s}"))
446            }
447        };
448
449        let token = Token {
450            kind,
451            #[allow(clippy::cast_possible_truncation)]
452            span: Span::new(start as u32, self.pos as u32),
453            line: start_line,
454            col: start_col,
455        };
456
457        Self::log_token(&token);
458        token
459    }
460
461    // -----------------------------------------------------------------------
462    // Helpers
463    // -----------------------------------------------------------------------
464
465    #[allow(clippy::cast_possible_truncation)]
466    fn advance_by(&mut self, n: usize) {
467        if n == 0 {
468            return;
469        }
470        let end = self.pos + n;
471        let slice = &self.src[self.pos..end];
472        #[allow(clippy::naive_bytecount)]
473        let newlines = slice.iter().filter(|&&b| b == b'\n').count();
474        if newlines > 0 {
475            self.line += newlines as u32;
476            let last_nl = slice.iter().rposition(|&b| b == b'\n').unwrap_or(0);
477            self.col = (n - last_nl) as u32;
478        } else {
479            self.col += n as u32;
480        }
481        self.pos = end;
482    }
483
484    fn advance(&mut self) -> u8 {
485        let pos = self.pos;
486        let line = self.line;
487        let col = self.col;
488        let ch = self.src[self.pos];
489        self.pos += 1;
490        if ch == b'\n' {
491            self.line += 1;
492            self.col = 1;
493        } else {
494            self.col += 1;
495        }
496        if self.trace_chars {
497            tracing::trace!(
498                target: "fsqlite.parse",
499                byte = ch,
500                pos,
501                line,
502                col,
503                "tokenize char"
504            );
505        }
506        ch
507    }
508
509    fn peek(&self) -> Option<u8> {
510        self.src.get(self.pos).copied()
511    }
512
513    fn peek_at(&self, offset: usize) -> Option<u8> {
514        self.src.get(self.pos + offset).copied()
515    }
516
517    #[allow(clippy::cast_possible_truncation)]
518    fn make_token(&self, kind: TokenKind, start: usize, end: usize) -> Token {
519        Token {
520            kind,
521            span: Span::new(start as u32, end as u32),
522            line: self.line,
523            col: self.col,
524        }
525    }
526
527    /// Skip whitespace, line comments (`--`), and block comments (`/* */`).
528    fn skip_whitespace_and_comments(&mut self) {
529        loop {
530            // Skip whitespace
531            let mut ws_len = 0;
532            while self.pos + ws_len < self.src.len()
533                && self.src[self.pos + ws_len].is_ascii_whitespace()
534            {
535                ws_len += 1;
536            }
537            if ws_len > 0 {
538                self.advance_by(ws_len);
539            }
540
541            if self.pos >= self.src.len() {
542                break;
543            }
544
545            // Line comment: `-- ...`
546            if self.src[self.pos] == b'-' && self.peek_at(1) == Some(b'-') {
547                self.advance(); // skip -
548                self.advance(); // skip -
549                while self.pos < self.src.len() && self.src[self.pos] != b'\n' {
550                    self.advance();
551                }
552                continue;
553            }
554
555            // Block comment: `/* ... */` (SQLite does NOT support nesting)
556            if self.src[self.pos] == b'/' && self.peek_at(1) == Some(b'*') {
557                self.advance(); // skip /
558                self.advance(); // skip *
559                let closed = loop {
560                    if self.pos >= self.src.len() {
561                        break false;
562                    }
563                    if self.src[self.pos] == b'*' && self.peek_at(1) == Some(b'/') {
564                        self.advance();
565                        self.advance();
566                        break true;
567                    }
568                    self.advance();
569                };
570                if !closed {
571                    // Unclosed block comment consumes to EOF
572                    self.pos = self.src.len();
573                }
574                continue;
575            }
576
577            break;
578        }
579    }
580
581    // -----------------------------------------------------------------------
582    // Literal tokenizers
583    // -----------------------------------------------------------------------
584
585    fn lex_string(&mut self) -> TokenKind {
586        let start = self.pos;
587        self.advance(); // skip opening quote
588
589        let mut value = String::new();
590        loop {
591            // Use memchr to find the next single quote quickly
592            let remaining = &self.src[self.pos..];
593            if let Some(offset) = memchr(b'\'', remaining) {
594                // Append bytes up to the quote
595                value.push_str(&String::from_utf8_lossy(
596                    &self.src[self.pos..self.pos + offset],
597                ));
598                // Advance past the accumulated bytes and the quote
599                self.advance_by(offset);
600                self.advance(); // the quote itself
601
602                // Check for escaped quote ('')
603                if self.peek() == Some(b'\'') {
604                    value.push('\'');
605                    self.advance();
606                } else {
607                    return TokenKind::String(value);
608                }
609            } else {
610                // Unterminated string
611                self.pos = self.src.len();
612                return TokenKind::Error(format!(
613                    "unterminated string literal starting at byte {}",
614                    start
615                ));
616            }
617        }
618    }
619
620    /// Lex a double-quoted identifier. Sets the EP_DblQuoted flag.
621    fn lex_double_quoted_id(&mut self) -> TokenKind {
622        let start = self.pos;
623        self.advance(); // skip opening "
624
625        let mut value = String::new();
626        loop {
627            let remaining = &self.src[self.pos..];
628            if let Some(offset) = memchr(b'"', remaining) {
629                value.push_str(&String::from_utf8_lossy(
630                    &self.src[self.pos..self.pos + offset],
631                ));
632                self.advance_by(offset);
633                self.advance(); // the quote
634
635                // Doubled-quote escape: "" -> "
636                if self.peek() == Some(b'"') {
637                    value.push('"');
638                    self.advance();
639                } else {
640                    return TokenKind::QuotedId(self.interner.intern(&value), true);
641                }
642            } else {
643                self.pos = self.src.len();
644                return TokenKind::Error(format!(
645                    "unterminated double-quoted identifier at byte {}",
646                    start
647                ));
648            }
649        }
650    }
651
652    /// Lex a backtick-quoted identifier.
653    fn lex_backtick_id(&mut self) -> TokenKind {
654        let start = self.pos;
655        self.advance(); // skip `
656
657        let mut value = String::new();
658        loop {
659            let remaining = &self.src[self.pos..];
660            if let Some(offset) = memchr(b'`', remaining) {
661                value.push_str(&String::from_utf8_lossy(
662                    &self.src[self.pos..self.pos + offset],
663                ));
664                self.advance_by(offset);
665                self.advance(); // the backtick
666
667                if self.peek() == Some(b'`') {
668                    value.push('`');
669                    self.advance();
670                } else {
671                    return TokenKind::QuotedId(self.interner.intern(&value), false);
672                }
673            } else {
674                self.pos = self.src.len();
675                return TokenKind::Error(format!(
676                    "unterminated backtick identifier at byte {}",
677                    start
678                ));
679            }
680        }
681    }
682
683    /// Lex a bracket-quoted identifier `[name]`.
684    fn lex_bracket_id(&mut self) -> TokenKind {
685        let start = self.pos;
686        self.advance(); // skip [
687
688        let mut value = String::new();
689        let remaining = &self.src[self.pos..];
690        if let Some(offset) = memchr(b']', remaining) {
691            value.push_str(&String::from_utf8_lossy(
692                &self.src[self.pos..self.pos + offset],
693            ));
694            self.advance_by(offset);
695            self.advance(); // skip ]
696            TokenKind::QuotedId(self.interner.intern(&value), false)
697        } else {
698            self.pos = self.src.len();
699            TokenKind::Error(format!("unterminated bracket identifier at byte {}", start))
700        }
701    }
702
703    /// Lex a blob literal `X'...'` / `x'...'`.
704    fn lex_blob(&mut self) -> TokenKind {
705        let start = self.pos;
706        self.advance(); // skip X/x
707        self.advance(); // skip '
708
709        let hex_start = self.pos;
710        let remaining = &self.src[self.pos..];
711        if let Some(offset) = memchr(b'\'', remaining) {
712            let hex_bytes = &self.src[hex_start..hex_start + offset];
713            self.advance_by(offset);
714            self.advance(); // skip closing '
715
716            // Validate hex content
717            if hex_bytes.len() % 2 != 0 {
718                return TokenKind::Error(format!(
719                    "blob literal has odd number of hex digits at byte {}",
720                    start
721                ));
722            }
723
724            // Work directly on raw bytes to avoid panics from
725            // string-slicing multi-byte UTF-8 sequences.
726            let mut bytes = Vec::with_capacity(hex_bytes.len() / 2);
727            for pair in hex_bytes.chunks_exact(2) {
728                let hi = hex_digit(pair[0]);
729                let lo = hex_digit(pair[1]);
730                match (hi, lo) {
731                    (Some(h), Some(l)) => bytes.push((h << 4) | l),
732                    _ => {
733                        return TokenKind::Error(format!(
734                            "invalid hex in blob literal at byte {start}"
735                        ));
736                    }
737                }
738            }
739            TokenKind::Blob(bytes)
740        } else {
741            self.pos = self.src.len();
742            TokenKind::Error(format!("unterminated blob literal at byte {}", start))
743        }
744    }
745
746    /// Lex a number: integer, hex integer, or float.
747    fn lex_number(&mut self) -> TokenKind {
748        let start = self.pos;
749
750        // Check for hex prefix
751        if self.src[self.pos] == b'0' && self.peek_at(1).is_some_and(|c| c == b'x' || c == b'X') {
752            self.advance(); // 0
753            self.advance(); // x
754            let hex_start = self.pos;
755            // Consume hex digits, allowing a single `_` digit separator that is
756            // surrounded on both sides by a hex digit (SQLite 3.46+ digit
757            // separators). `0x_1F`, `0x1__F`, and a trailing `0x1F_` are
758            // rejected because the underscore is not between two hex digits.
759            while self.pos < self.src.len() {
760                let c = self.src[self.pos];
761                let is_separator = c == b'_'
762                    && self.pos > hex_start
763                    && self.src[self.pos - 1].is_ascii_hexdigit()
764                    && self.peek_at(1).is_some_and(|n| n.is_ascii_hexdigit());
765                if c.is_ascii_hexdigit() || is_separator {
766                    self.advance();
767                } else {
768                    break;
769                }
770            }
771            if self.pos == hex_start {
772                return TokenKind::Error("empty hex literal".to_owned());
773            }
774            // A hex literal cannot be immediately followed by an alphanumeric or
775            // `_` (e.g. `0x1F_` or `0xFFg`) — that is an unrecognized token, the
776            // same rule the decimal path enforces below.
777            if self
778                .peek()
779                .is_some_and(|n| n.is_ascii_alphanumeric() || n == b'_')
780            {
781                let err_start = start;
782                while self.pos < self.src.len()
783                    && (self.src[self.pos].is_ascii_alphanumeric() || self.src[self.pos] == b'_')
784                {
785                    self.advance();
786                }
787                let err_text = String::from_utf8_lossy(&self.src[err_start..self.pos]);
788                return TokenKind::Error(format!("unrecognized token: \"{err_text}\""));
789            }
790            let hex_str = String::from_utf8_lossy(&self.src[hex_start..self.pos]).replace('_', "");
791            // Strip leading zeros then check significant digit count,
792            // matching C SQLite's sqlite3DecOrHexToI64 which rejects
793            // hex literals with >16 significant digits.
794            let significant = hex_str.trim_start_matches('0');
795            if significant.len() > 16 {
796                return TokenKind::Error(format!("hex literal out of range at byte {start}"));
797            }
798            let parse_str = if significant.is_empty() {
799                "0"
800            } else {
801                significant
802            };
803            // Parse as u64 and bitwise-cast to i64 — matching C SQLite's
804            // sqlite3DecOrHexToI64 which uses memcpy(pOut, &u, 8).
805            return match u64::from_str_radix(parse_str, 16) {
806                Ok(v) => {
807                    #[allow(clippy::cast_possible_wrap)]
808                    let i = v as i64;
809                    TokenKind::Integer(i)
810                }
811                Err(_) => TokenKind::Error(format!("hex literal out of range at byte {start}")),
812            };
813        }
814
815        // Decimal integer or float
816        let mut is_float = false;
817
818        // Integer part (may be empty for `.5` style). Allow `_` digit
819        // separators that are surrounded on both sides by a decimal digit.
820        self.consume_decimal_digit_run();
821
822        // Helper to check if the current position (+ offset) starts a valid exponent.
823        let is_valid_exponent = |lexer: &Self, mut offset: usize| -> bool {
824            if let Some(c) = lexer.peek_at(offset) {
825                if c == b'e' || c == b'E' {
826                    offset += 1;
827                    if let Some(s) = lexer.peek_at(offset) {
828                        if s == b'+' || s == b'-' {
829                            offset += 1;
830                        }
831                    }
832                    if let Some(d) = lexer.peek_at(offset) {
833                        return d.is_ascii_digit();
834                    }
835                }
836            }
837            false
838        };
839
840        // Fractional part
841        if self.pos < self.src.len()
842            && self.src[self.pos] == b'.'
843            && (self.peek_at(1).is_some_and(|c| c.is_ascii_digit()) || is_valid_exponent(self, 1))
844        {
845            is_float = true;
846            self.advance(); // skip dot
847            self.consume_decimal_digit_run();
848        } else if self.pos < self.src.len()
849            && self.src[self.pos] == b'.'
850            && start < self.pos // we had digits before the dot
851            && !self.peek_at(1).is_some_and(|c| c.is_ascii_alphanumeric() || c == b'_')
852        {
853            // e.g. `123.` with nothing meaningful after -- still a float
854            is_float = true;
855            self.advance(); // skip dot
856        }
857
858        // Handle case where input starts with '.'
859        if self.src[start] == b'.' {
860            is_float = true;
861        }
862
863        // Exponent
864        if is_valid_exponent(self, 0) {
865            is_float = true;
866            self.advance(); // skip e/E
867            if self.pos < self.src.len()
868                && (self.src[self.pos] == b'+' || self.src[self.pos] == b'-')
869            {
870                self.advance();
871            }
872            self.consume_decimal_digit_run();
873        }
874
875        // SQLite strictness: a number cannot be immediately followed by an alphabetical character or underscore.
876        // Doing so produces an "unrecognized token" error.
877        if let Some(c) = self.peek() {
878            if c.is_ascii_alphabetic()
879                || c == b'_'
880                || (c == b'.'
881                    && self
882                        .peek_at(1)
883                        .is_some_and(|n| n.is_ascii_alphabetic() || n == b'_'))
884            {
885                let err_start = start;
886                while self.pos < self.src.len() {
887                    let ch = self.src[self.pos];
888                    if ch.is_ascii_alphanumeric() || ch == b'_' || ch == b'.' {
889                        self.advance();
890                    } else {
891                        break;
892                    }
893                }
894                let err_text = String::from_utf8_lossy(&self.src[err_start..self.pos]);
895                return TokenKind::Error(format!("unrecognized token: \"{err_text}\""));
896            }
897        }
898
899        let text_raw = String::from_utf8_lossy(&self.src[start..self.pos]);
900        // Strip `_` digit separators before numeric parsing; they were only
901        // consumed when validly placed between two digits above.
902        let text: std::borrow::Cow<'_, str> = if text_raw.as_ref().contains('_') {
903            std::borrow::Cow::Owned(text_raw.replace('_', ""))
904        } else {
905            text_raw
906        };
907        if is_float {
908            // Overflowing literals (e.g. 9e999) become ±Infinity, exactly like
909            // C SQLite's text-to-real conversion; do NOT clamp to f64::MAX.
910            match text.parse::<f64>() {
911                Ok(v) => TokenKind::Float(v),
912                Err(_) => {
913                    // Rust's f64 parser rejects `.e4` but SQLite accepts it as 0.0.
914                    let mut text_fixed = text.clone().into_owned();
915                    if text_fixed.starts_with(".e") || text_fixed.starts_with(".E") {
916                        text_fixed.insert(0, '0');
917                    }
918                    match text_fixed.parse::<f64>() {
919                        Ok(v) => TokenKind::Float(v),
920                        Err(_) => TokenKind::Error(format!("invalid float: {text}")),
921                    }
922                }
923            }
924        } else {
925            match text.parse::<i64>() {
926                Ok(v) => TokenKind::Integer(v),
927                Err(_) => {
928                    // SQLite promotes oversized integers to REAL. We emit a special
929                    // token to allow the parser to fold `-9223372036854775808` correctly.
930                    TokenKind::OversizedInt(text.into_owned())
931                }
932            }
933        }
934    }
935
936    /// Consume a run of decimal digits, allowing single `_` digit separators
937    /// (SQLite 3.46+) that are surrounded on both sides by a decimal digit. An
938    /// underscore that is leading, trailing, doubled, or adjacent to a non-digit
939    /// (`.`, `e`, sign) terminates the run, leaving it to be flagged as an
940    /// unrecognized token by the trailing-character check in `lex_number`.
941    fn consume_decimal_digit_run(&mut self) {
942        while self.pos < self.src.len() {
943            let c = self.src[self.pos];
944            let is_separator = c == b'_'
945                && self.pos > 0
946                && self.src[self.pos - 1].is_ascii_digit()
947                && self.peek_at(1).is_some_and(|n| n.is_ascii_digit());
948            if c.is_ascii_digit() || is_separator {
949                self.advance();
950            } else {
951                break;
952            }
953        }
954    }
955
956    /// Lex an identifier or keyword.
957    fn lex_identifier(&mut self) -> TokenKind {
958        let start = self.pos;
959        self.advance(); // first character already validated
960
961        while self.pos < self.src.len() {
962            let ch = self.src[self.pos];
963            if ch.is_ascii_alphanumeric() || ch == b'_' || ch >= 0x80 {
964                self.advance();
965            } else {
966                break;
967            }
968        }
969
970        let ident_bytes = &self.src[start..self.pos];
971
972        // Check for keyword
973        if let Some(kw) = TokenKind::lookup_keyword_bytes(ident_bytes) {
974            kw
975        } else {
976            let text = String::from_utf8_lossy(ident_bytes);
977            TokenKind::Id(self.interner.intern(&text))
978        }
979    }
980
981    /// Lex `?` or `?NNN`.
982    fn lex_question(&mut self) -> TokenKind {
983        self.advance(); // skip ?
984        if self.pos < self.src.len() && self.src[self.pos].is_ascii_digit() {
985            let num_start = self.pos;
986            while self.pos < self.src.len() && self.src[self.pos].is_ascii_digit() {
987                self.advance();
988            }
989            let text = String::from_utf8_lossy(&self.src[num_start..self.pos]);
990            match text.parse::<u32>() {
991                Ok(n) if (1..=MAX_VARIABLE_NUMBER).contains(&n) => TokenKind::QuestionNum(n),
992                Ok(n) => TokenKind::Error(format!(
993                    "variable number must be between ?1 and ?{MAX_VARIABLE_NUMBER}, got ?{n}"
994                )),
995                Err(_) => TokenKind::Error("invalid parameter number".to_owned()),
996            }
997        } else {
998            TokenKind::Question
999        }
1000    }
1001
1002    fn lex_alpha_param(&mut self, prefix: char, constructor: fn(String) -> TokenKind) -> TokenKind {
1003        self.advance(); // skip prefix
1004        let name_start = self.pos;
1005        while self.pos < self.src.len() {
1006            let ch = self.src[self.pos];
1007            if ch.is_ascii_alphanumeric() || ch == b'_' || ch >= 0x80 {
1008                self.advance();
1009            } else if ch == b':' && self.peek_at(1) == Some(b':') {
1010                self.advance();
1011                self.advance();
1012            } else if ch == b'(' {
1013                self.advance();
1014                while self.pos < self.src.len() && self.src[self.pos] != b')' {
1015                    self.advance();
1016                }
1017                if self.pos >= self.src.len() || self.src[self.pos] != b')' {
1018                    let name = String::from_utf8_lossy(&self.src[name_start..self.pos]);
1019                    return TokenKind::Error(format!("unrecognized token: \"{prefix}{name}\""));
1020                }
1021                self.advance();
1022                break; // Tcl array variable parameters end after the closing paren.
1023            } else {
1024                break;
1025            }
1026        }
1027        if self.pos == name_start {
1028            return TokenKind::Error(format!("empty parameter name after '{prefix}'"));
1029        }
1030        let name = String::from_utf8_lossy(&self.src[name_start..self.pos]).into_owned();
1031        constructor(name)
1032    }
1033
1034    /// Lex `:name`.
1035    fn lex_colon_param(&mut self) -> TokenKind {
1036        self.lex_alpha_param(':', TokenKind::ColonParam)
1037    }
1038
1039    /// Lex `@name`.
1040    fn lex_at_param(&mut self) -> TokenKind {
1041        self.lex_alpha_param('@', TokenKind::AtParam)
1042    }
1043
1044    /// Lex `$name`.
1045    fn lex_dollar_param(&mut self) -> TokenKind {
1046        self.lex_alpha_param('$', TokenKind::DollarParam)
1047    }
1048
1049    // -----------------------------------------------------------------------
1050    // Multi-character operator tokenizers
1051    // -----------------------------------------------------------------------
1052
1053    /// Lex `-`, `->`, or `->>`.
1054    fn lex_minus_or_arrow(&mut self) -> TokenKind {
1055        self.advance(); // skip -
1056        if self.peek() == Some(b'>') {
1057            self.advance(); // skip >
1058            if self.peek() == Some(b'>') {
1059                self.advance(); // skip >
1060                TokenKind::DoubleArrow
1061            } else {
1062                TokenKind::Arrow
1063            }
1064        } else {
1065            TokenKind::Minus
1066        }
1067    }
1068
1069    /// Lex `<`, `<=`, `<>`, or `<<`.
1070    fn lex_lt(&mut self) -> TokenKind {
1071        self.advance(); // skip <
1072        match self.peek() {
1073            Some(b'=') => {
1074                self.advance();
1075                TokenKind::Le
1076            }
1077            Some(b'>') => {
1078                self.advance();
1079                TokenKind::LtGt
1080            }
1081            Some(b'<') => {
1082                self.advance();
1083                TokenKind::ShiftLeft
1084            }
1085            _ => TokenKind::Lt,
1086        }
1087    }
1088
1089    /// Lex `>`, `>=`, or `>>`.
1090    fn lex_gt(&mut self) -> TokenKind {
1091        self.advance(); // skip >
1092        match self.peek() {
1093            Some(b'=') => {
1094                self.advance();
1095                TokenKind::Ge
1096            }
1097            Some(b'>') => {
1098                self.advance();
1099                TokenKind::ShiftRight
1100            }
1101            _ => TokenKind::Gt,
1102        }
1103    }
1104
1105    /// Lex `=` or `==`.
1106    fn lex_eq(&mut self) -> TokenKind {
1107        self.advance(); // skip =
1108        if self.peek() == Some(b'=') {
1109            self.advance();
1110            TokenKind::EqEq
1111        } else {
1112            TokenKind::Eq
1113        }
1114    }
1115
1116    /// Lex `!=`.
1117    fn lex_bang(&mut self) -> TokenKind {
1118        self.advance(); // skip !
1119        if self.peek() == Some(b'=') {
1120            self.advance();
1121            TokenKind::Ne
1122        } else {
1123            TokenKind::Error("unexpected '!', did you mean '!='?".to_owned())
1124        }
1125    }
1126
1127    /// Lex `|` or `||`.
1128    fn lex_pipe(&mut self) -> TokenKind {
1129        self.advance(); // skip |
1130        if self.peek() == Some(b'|') {
1131            self.advance();
1132            TokenKind::Concat
1133        } else {
1134            TokenKind::Pipe
1135        }
1136    }
1137}
1138
1139/// Convert an ASCII hex digit byte to its numeric value (0-15).
1140/// Returns `None` for non-hex bytes.
1141const fn hex_digit(b: u8) -> Option<u8> {
1142    match b {
1143        b'0'..=b'9' => Some(b - b'0'),
1144        b'a'..=b'f' => Some(b - b'a' + 10),
1145        b'A'..=b'F' => Some(b - b'A' + 10),
1146        _ => None,
1147    }
1148}
1149
1150#[cfg(test)]
1151mod tests {
1152    use super::*;
1153
1154    #[test]
1155    fn interner_incremental_bytes_equals_fold() {
1156        // bd-5310l: the incrementally-maintained `interned_bytes` must exactly equal the O(N) fold
1157        // over entries, for every intern/reset sequence, so `retained_bytes` (and thus the
1158        // reset-threshold behaviour) is byte-identical whichever path computes it.
1159        let mut interner = IdentifierInterner::default();
1160        for v in ["alpha", "beta", "gamma", "alpha", "delta", "beta"] {
1161            interner.intern(v);
1162        }
1163        // Deduped distinct set {alpha(5), beta(4), gamma(5), delta(5)} -> 19 bytes.
1164        assert_eq!(interner.interned_bytes, 19);
1165        set_force_interner_scan_bench(false);
1166        let incremental = interner.retained_bytes();
1167        set_force_interner_scan_bench(true);
1168        let folded = interner.retained_bytes();
1169        set_force_interner_scan_bench(false);
1170        assert_eq!(
1171            incremental, folded,
1172            "incremental retained_bytes must equal the O(N) fold"
1173        );
1174        interner.reset();
1175        assert_eq!(interner.interned_bytes, 0);
1176        assert_eq!(interner.retained_bytes(), 0);
1177    }
1178
1179    fn lex(src: &str) -> Vec<Token> {
1180        Lexer::tokenize(src)
1181    }
1182
1183    fn kinds(src: &str) -> Vec<TokenKind> {
1184        lex(src).into_iter().map(|t| t.kind).collect()
1185    }
1186
1187    #[test]
1188    fn test_lex_integer_literals() {
1189        let tokens = kinds("42 0 0xFF");
1190        assert_eq!(
1191            tokens,
1192            vec![
1193                TokenKind::Integer(42),
1194                TokenKind::Integer(0),
1195                TokenKind::Integer(255),
1196                TokenKind::Eof,
1197            ]
1198        );
1199    }
1200
1201    #[test]
1202    fn test_tokenize_into_reuses_caller_owned_capacity() {
1203        let mut scratch = Vec::new();
1204        Lexer::tokenize_into(
1205            "SELECT 'abcdefghijklmnopqrstuvwxyzabcdefghijklmnopqrstuvwxyz';",
1206            &mut scratch,
1207        );
1208        let warmed_capacity = scratch.capacity();
1209        assert!(
1210            warmed_capacity > 0,
1211            "warm parse should allocate token scratch"
1212        );
1213
1214        Lexer::tokenize_into("SELECT 1;", &mut scratch);
1215        assert_eq!(
1216            scratch.capacity(),
1217            warmed_capacity,
1218            "smaller follow-up parse should reuse the warmed token buffer",
1219        );
1220        assert_eq!(
1221            scratch.last().map(|token| &token.kind),
1222            Some(&TokenKind::Eof),
1223            "tokenize_into should still terminate with EOF in reused scratch",
1224        );
1225    }
1226
1227    #[test]
1228    fn test_lex_float_literals() {
1229        let tokens = kinds("3.14 1e10 .5 1.0e-3 0.0");
1230        // Avoid clippy::approx_constant (3.14 is interpreted as an approximation of PI),
1231        // but keep the test input string stable.
1232        let expected = 3.0 + 0.14;
1233        assert!(matches!(
1234            tokens[0],
1235            TokenKind::Float(v) if (v - expected).abs() < 1e-10
1236        ));
1237        assert!(matches!(tokens[1], TokenKind::Float(v) if (v - 1e10).abs() < 1.0));
1238        assert!(matches!(tokens[2], TokenKind::Float(v) if (v - 0.5).abs() < 1e-10));
1239        assert!(matches!(tokens[3], TokenKind::Float(v) if (v - 0.001).abs() < 1e-10));
1240        assert!(matches!(tokens[4], TokenKind::Float(v) if v.abs() < 1e-10));
1241        assert_eq!(tokens[5], TokenKind::Eof);
1242    }
1243
1244    #[test]
1245    fn test_lex_string_literals() {
1246        let tokens = kinds("'hello' 'it''s' ''");
1247        assert_eq!(tokens[0], TokenKind::String("hello".to_owned()));
1248        assert_eq!(tokens[1], TokenKind::String("it's".to_owned()));
1249        assert_eq!(tokens[2], TokenKind::String(String::new()));
1250        assert_eq!(tokens[3], TokenKind::Eof);
1251    }
1252
1253    #[test]
1254    fn test_lex_blob_literals() {
1255        let tokens = kinds("X'CAFE' x'00ff' X''");
1256        assert_eq!(tokens[0], TokenKind::Blob(vec![0xCA, 0xFE]));
1257        assert_eq!(tokens[1], TokenKind::Blob(vec![0x00, 0xFF]));
1258        assert_eq!(tokens[2], TokenKind::Blob(vec![]));
1259        assert_eq!(tokens[3], TokenKind::Eof);
1260    }
1261
1262    #[test]
1263    fn test_lex_blob_odd_hex_error() {
1264        let tokens = kinds("X'CAF'");
1265        assert!(matches!(tokens[0], TokenKind::Error(_)));
1266    }
1267
1268    #[test]
1269    fn test_lex_blob_non_ascii_no_panic() {
1270        // bd-20gf regression: multi-byte UTF-8 inside a blob literal must
1271        // produce an error, not panic on string-slice boundary.
1272        let tokens = kinds("X'U\u{05fc} '");
1273        assert!(matches!(tokens[0], TokenKind::Error(_)));
1274
1275        // Also test with raw non-hex ASCII chars.
1276        let tokens2 = kinds("X'GG'");
1277        assert!(matches!(tokens2[0], TokenKind::Error(_)));
1278    }
1279
1280    #[test]
1281    fn test_lex_variables() {
1282        let tokens = kinds("?1 :name @param $var ?");
1283        assert_eq!(tokens[0], TokenKind::QuestionNum(1));
1284        assert_eq!(tokens[1], TokenKind::ColonParam("name".to_owned()));
1285        assert_eq!(tokens[2], TokenKind::AtParam("param".to_owned()));
1286        assert_eq!(tokens[3], TokenKind::DollarParam("var".to_owned()));
1287        assert_eq!(tokens[4], TokenKind::Question);
1288        assert_eq!(tokens[5], TokenKind::Eof);
1289    }
1290
1291    #[test]
1292    fn test_lex_quoted_identifiers() {
1293        let tokens = kinds("\"table_name\" [column] `backtick`");
1294        assert_eq!(tokens[0], TokenKind::QuotedId("table_name".into(), true));
1295        assert_eq!(tokens[1], TokenKind::QuotedId("column".into(), false));
1296        assert_eq!(tokens[2], TokenKind::QuotedId("backtick".into(), false));
1297    }
1298
1299    #[test]
1300    fn test_lex_dqs_flag() {
1301        let tokens = kinds("\"hello\"");
1302        // Double-quoted strings produce QuotedId with EP_DblQuoted=true
1303        assert_eq!(tokens[0], TokenKind::QuotedId("hello".into(), true));
1304    }
1305
1306    #[test]
1307    fn test_lex_keywords() {
1308        let tokens = kinds("SELECT FROM WHERE INSERT CREATE TABLE CONCURRENT");
1309        assert_eq!(tokens[0], TokenKind::KwSelect);
1310        assert_eq!(tokens[1], TokenKind::KwFrom);
1311        assert_eq!(tokens[2], TokenKind::KwWhere);
1312        assert_eq!(tokens[3], TokenKind::KwInsert);
1313        assert_eq!(tokens[4], TokenKind::KwCreate);
1314        assert_eq!(tokens[5], TokenKind::KwTable);
1315        assert_eq!(tokens[6], TokenKind::KwConcurrent);
1316
1317        // Case insensitivity
1318        let tokens2 = kinds("select from where");
1319        assert_eq!(tokens2[0], TokenKind::KwSelect);
1320        assert_eq!(tokens2[1], TokenKind::KwFrom);
1321        assert_eq!(tokens2[2], TokenKind::KwWhere);
1322    }
1323
1324    #[test]
1325    fn test_lex_operators() {
1326        let tokens = kinds("+ - * / % & | ~ << >> = < <= > >= == != <> || -> ->>");
1327        let expected = vec![
1328            TokenKind::Plus,
1329            TokenKind::Minus,
1330            TokenKind::Star,
1331            TokenKind::Slash,
1332            TokenKind::Percent,
1333            TokenKind::Ampersand,
1334            TokenKind::Pipe,
1335            TokenKind::Tilde,
1336            TokenKind::ShiftLeft,
1337            TokenKind::ShiftRight,
1338            TokenKind::Eq,
1339            TokenKind::Lt,
1340            TokenKind::Le,
1341            TokenKind::Gt,
1342            TokenKind::Ge,
1343            TokenKind::EqEq,
1344            TokenKind::Ne,
1345            TokenKind::LtGt,
1346            TokenKind::Concat,
1347            TokenKind::Arrow,
1348            TokenKind::DoubleArrow,
1349            TokenKind::Eof,
1350        ];
1351        assert_eq!(tokens, expected);
1352    }
1353
1354    #[test]
1355    fn test_lex_eq_vs_eqeq() {
1356        let tokens = kinds("= ==");
1357        assert_eq!(tokens[0], TokenKind::Eq);
1358        assert_eq!(tokens[1], TokenKind::EqEq);
1359    }
1360
1361    #[test]
1362    fn test_lex_ne_vs_ltgt() {
1363        let tokens = kinds("!= <>");
1364        assert_eq!(tokens[0], TokenKind::Ne);
1365        assert_eq!(tokens[1], TokenKind::LtGt);
1366    }
1367
1368    #[test]
1369    fn test_lex_error_unterminated_string() {
1370        let tokens = kinds("'hello");
1371        assert!(matches!(tokens[0], TokenKind::Error(_)));
1372    }
1373
1374    #[test]
1375    fn test_lex_line_column_tracking() {
1376        let tokens = lex("SELECT\n  a,\n  b");
1377        assert_eq!(tokens[0].line, 1);
1378        assert_eq!(tokens[0].col, 1);
1379        // 'a' is on line 2, col 3
1380        assert_eq!(tokens[1].line, 2);
1381        assert_eq!(tokens[1].col, 3);
1382        // ',' is on line 2, col 4
1383        assert_eq!(tokens[2].line, 2);
1384        assert_eq!(tokens[2].col, 4);
1385        // 'b' is on line 3, col 3
1386        assert_eq!(tokens[3].line, 3);
1387        assert_eq!(tokens[3].col, 3);
1388    }
1389
1390    #[test]
1391    fn test_lex_whitespace_and_comments_skipped() {
1392        let tokens = kinds("SELECT -- this is a comment\n  a /* block */ FROM b");
1393        assert_eq!(tokens[0], TokenKind::KwSelect);
1394        assert_eq!(tokens[1], TokenKind::Id("a".into()));
1395        assert_eq!(tokens[2], TokenKind::KwFrom);
1396        assert_eq!(tokens[3], TokenKind::Id("b".into()));
1397        assert_eq!(tokens[4], TokenKind::Eof);
1398    }
1399
1400    #[test]
1401    fn test_lex_hex_large_values() {
1402        // C SQLite parses hex as u64 and memcpy to i64.
1403        // 0xFFFFFFFFFFFFFFFF = u64::MAX → i64 -1.
1404        let tokens = kinds("0xFFFFFFFFFFFFFFFF");
1405        assert_eq!(tokens[0], TokenKind::Integer(-1));
1406
1407        // 0x8000000000000000 = i64::MIN.
1408        let tokens = kinds("0x8000000000000000");
1409        assert_eq!(tokens[0], TokenKind::Integer(i64::MIN));
1410
1411        // 0x7FFFFFFFFFFFFFFF = i64::MAX.
1412        let tokens = kinds("0x7FFFFFFFFFFFFFFF");
1413        assert_eq!(tokens[0], TokenKind::Integer(i64::MAX));
1414    }
1415
1416    #[test]
1417    fn test_lex_hex_overflow_17_digits_rejects() {
1418        // 0x10000000000000000 has 17 significant hex digits → must error,
1419        // not silently truncate to 0.
1420        let tokens = kinds("0x10000000000000000");
1421        assert!(
1422            matches!(&tokens[0], TokenKind::Error(msg) if msg.contains("out of range")),
1423            "expected error for 17-digit hex, got {:?}",
1424            tokens[0]
1425        );
1426    }
1427
1428    #[test]
1429    fn test_lex_hex_leading_zeros_accepted() {
1430        // Leading zeros are stripped before the length check, so
1431        // 0x00000000000000001 (17 chars, 1 significant) is valid.
1432        let tokens = kinds("0x00000000000000001");
1433        assert_eq!(tokens[0], TokenKind::Integer(1));
1434    }
1435
1436    #[test]
1437    fn test_lex_number_hex() {
1438        let tokens = kinds("0x1A 0Xff 0x0");
1439        assert_eq!(tokens[0], TokenKind::Integer(26));
1440        assert_eq!(tokens[1], TokenKind::Integer(255));
1441        assert_eq!(tokens[2], TokenKind::Integer(0));
1442        assert_eq!(tokens[3], TokenKind::Eof);
1443    }
1444
1445    #[test]
1446    fn test_lex_number_unrecognized() {
1447        let tokens = kinds("123a 123.a");
1448        assert!(
1449            matches!(tokens[0], TokenKind::Error(ref e) if e.contains("unrecognized token: \"123a\""))
1450        );
1451        assert!(
1452            matches!(tokens[1], TokenKind::Error(ref e) if e.contains("unrecognized token: \"123.a\""))
1453        );
1454    }
1455
1456    #[test]
1457    fn test_lex_number_hex_invalid() {
1458        let tokens = kinds("0x");
1459        assert!(matches!(tokens[0], TokenKind::Error(_)));
1460    }
1461
1462    #[test]
1463    fn test_lex_positional_params() {
1464        let tokens = kinds("? ?123");
1465        assert_eq!(tokens[0], TokenKind::Question);
1466        assert_eq!(tokens[1], TokenKind::QuestionNum(123));
1467        assert_eq!(tokens[2], TokenKind::Eof);
1468    }
1469
1470    #[test]
1471    fn test_lex_positional_params_reject_zero_and_out_of_range() {
1472        let tokens = kinds("?0 ?32767");
1473        assert!(
1474            matches!(tokens[0], TokenKind::Error(ref e) if e.contains("between ?1 and ?32766")),
1475            "expected ?0 to be rejected, got {:?}",
1476            tokens[0]
1477        );
1478        assert!(
1479            matches!(tokens[1], TokenKind::Error(ref e) if e.contains("between ?1 and ?32766")),
1480            "expected ?32767 to be rejected, got {:?}",
1481            tokens[1]
1482        );
1483        assert_eq!(tokens[2], TokenKind::Eof);
1484    }
1485
1486    #[test]
1487    fn test_lex_named_params() {
1488        let tokens = kinds(":foo @bar $baz_123");
1489        assert_eq!(tokens[0], TokenKind::ColonParam("foo".to_owned()));
1490        assert_eq!(tokens[1], TokenKind::AtParam("bar".to_owned()));
1491        assert_eq!(tokens[2], TokenKind::DollarParam("baz_123".to_owned()));
1492        assert_eq!(tokens[3], TokenKind::Eof);
1493    }
1494
1495    #[test]
1496    fn test_lex_named_params_with_tcl_syntax() {
1497        let tokens = kinds("$::foo(bar) :a::b");
1498        assert_eq!(tokens[0], TokenKind::DollarParam("::foo(bar)".to_owned()));
1499        assert_eq!(tokens[1], TokenKind::ColonParam("a::b".to_owned()));
1500        assert_eq!(tokens[2], TokenKind::Eof);
1501    }
1502
1503    #[test]
1504    fn test_lex_named_params_with_unclosed_tcl_array_syntax() {
1505        let tokens = kinds("$::foo(bar");
1506        assert!(
1507            matches!(tokens[0], TokenKind::Error(ref e) if e.contains("unrecognized token")),
1508            "expected unterminated Tcl-style parameter to be rejected, got {:?}",
1509            tokens[0]
1510        );
1511        assert_eq!(tokens[1], TokenKind::Eof);
1512    }
1513
1514    fn histogram_total(hist: &TokenizeDurationSecondsHistogram) -> u64 {
1515        hist.le_100us + hist.le_250us + hist.le_500us + hist.le_1ms + hist.le_5ms + hist.gt_5ms
1516    }
1517
1518    #[test]
1519    fn test_tokenize_metrics_accumulate_tokens_and_histogram_samples() {
1520        let prev_metrics_enabled = tokenize_metrics_enabled();
1521        reset_tokenize_metrics();
1522        set_tokenize_metrics_enabled(true);
1523
1524        let first = lex("SELECT 1;");
1525        let second = lex("SELECT 2;");
1526
1527        let expected_total_tokens = u64::try_from(first.len() + second.len()).unwrap_or(u64::MAX);
1528        let snap = tokenize_metrics_snapshot();
1529        assert_eq!(snap.fsqlite_tokenize_tokens_total, expected_total_tokens);
1530        assert_eq!(snap.fsqlite_tokenize_duration_seconds_count, 2);
1531        assert_eq!(
1532            histogram_total(&snap.fsqlite_tokenize_duration_seconds),
1533            snap.fsqlite_tokenize_duration_seconds_count
1534        );
1535
1536        set_tokenize_metrics_enabled(prev_metrics_enabled);
1537        reset_tokenize_metrics();
1538    }
1539
1540    #[test]
1541    fn test_tokenize_metrics_reset_clears_all_fields() {
1542        let prev_metrics_enabled = tokenize_metrics_enabled();
1543        reset_tokenize_metrics();
1544        set_tokenize_metrics_enabled(true);
1545        let _ = lex("SELECT 42;");
1546
1547        let before = tokenize_metrics_snapshot();
1548        assert!(before.fsqlite_tokenize_tokens_total > 0);
1549        assert!(before.fsqlite_tokenize_duration_seconds_count > 0);
1550
1551        reset_tokenize_metrics();
1552        let after = tokenize_metrics_snapshot();
1553        assert_eq!(after.fsqlite_tokenize_tokens_total, 0);
1554        assert_eq!(after.fsqlite_tokenize_duration_seconds_count, 0);
1555        assert_eq!(after.fsqlite_tokenize_duration_seconds_sum_micros, 0);
1556        assert_eq!(histogram_total(&after.fsqlite_tokenize_duration_seconds), 0);
1557
1558        set_tokenize_metrics_enabled(prev_metrics_enabled);
1559    }
1560
1561    #[test]
1562    fn test_tokenize_metrics_can_be_disabled_off_hot_path() {
1563        let prev_metrics_enabled = tokenize_metrics_enabled();
1564        reset_tokenize_metrics();
1565        set_tokenize_metrics_enabled(false);
1566
1567        let _ = lex("SELECT 99;");
1568
1569        let snap = tokenize_metrics_snapshot();
1570        assert_eq!(snap.fsqlite_tokenize_tokens_total, 0);
1571        assert_eq!(snap.fsqlite_tokenize_duration_seconds_count, 0);
1572        assert_eq!(snap.fsqlite_tokenize_duration_seconds_sum_micros, 0);
1573        assert_eq!(histogram_total(&snap.fsqlite_tokenize_duration_seconds), 0);
1574
1575        set_tokenize_metrics_enabled(prev_metrics_enabled);
1576        reset_tokenize_metrics();
1577    }
1578}