Skip to main content

fsqlite_parser/
lexer.rs

1// bd-2tu6: §10.1 SQL Lexer
2//
3// Converts SQL text into a stream of tokens. Uses memchr for accelerated
4// string scanning. Tracks line/column for error reporting.
5
6use fsqlite_ast::Span;
7use fsqlite_types::limits::MAX_VARIABLE_NUMBER;
8use fsqlite_types::sync_primitives::Instant;
9use hashbrown::HashSet;
10use memchr::memchr;
11use std::sync::Arc;
12use std::sync::atomic::{AtomicBool, AtomicU64, Ordering};
13use tracing::Level;
14
15use crate::token::{Token, TokenKind};
16
17/// Histogram buckets for `fsqlite_tokenize_duration_seconds`.
18#[derive(Debug, Clone, Copy, PartialEq, Eq, Default)]
19pub struct TokenizeDurationSecondsHistogram {
20    /// Duration <= 100 µs.
21    pub le_100us: u64,
22    /// Duration <= 250 µs.
23    pub le_250us: u64,
24    /// Duration <= 500 µs.
25    pub le_500us: u64,
26    /// Duration <= 1 ms.
27    pub le_1ms: u64,
28    /// Duration <= 5 ms.
29    pub le_5ms: u64,
30    /// Duration > 5 ms.
31    pub gt_5ms: u64,
32}
33
34/// Point-in-time tokenize metric snapshot.
35#[derive(Debug, Clone, Copy, PartialEq, Eq, Default)]
36pub struct TokenizeMetricsSnapshot {
37    /// Monotonic token counter across all tokenize calls.
38    pub fsqlite_tokenize_tokens_total: u64,
39    /// Histogram buckets for tokenize runtime.
40    pub fsqlite_tokenize_duration_seconds: TokenizeDurationSecondsHistogram,
41    /// Total tokenize observations recorded in histogram.
42    pub fsqlite_tokenize_duration_seconds_count: u64,
43    /// Sum of tokenize durations in microseconds.
44    pub fsqlite_tokenize_duration_seconds_sum_micros: u64,
45}
46
47static FSQLITE_TOKENIZE_TOKENS_TOTAL: AtomicU64 = AtomicU64::new(0);
48static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US: AtomicU64 = AtomicU64::new(0);
49static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US: AtomicU64 = AtomicU64::new(0);
50static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US: AtomicU64 = AtomicU64::new(0);
51static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS: AtomicU64 = AtomicU64::new(0);
52static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS: AtomicU64 = AtomicU64::new(0);
53static FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS: AtomicU64 = AtomicU64::new(0);
54static FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT: AtomicU64 = AtomicU64::new(0);
55static FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS: AtomicU64 = AtomicU64::new(0);
56static FSQLITE_TOKENIZE_METRICS_ENABLED: AtomicBool = AtomicBool::new(false);
57
58fn saturating_u64_from_usize(value: usize) -> u64 {
59    u64::try_from(value).unwrap_or(u64::MAX)
60}
61
62fn saturating_u64_from_u128(value: u128) -> u64 {
63    u64::try_from(value).unwrap_or(u64::MAX)
64}
65
66fn record_tokenize_metrics(token_count: usize, elapsed_micros: u64) {
67    FSQLITE_TOKENIZE_TOKENS_TOTAL
68        .fetch_add(saturating_u64_from_usize(token_count), Ordering::Relaxed);
69    FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT.fetch_add(1, Ordering::Relaxed);
70    FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS.fetch_add(elapsed_micros, Ordering::Relaxed);
71
72    let bucket = match elapsed_micros {
73        0..=100 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US,
74        101..=250 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US,
75        251..=500 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US,
76        501..=1_000 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS,
77        1_001..=5_000 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS,
78        _ => &FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS,
79    };
80    bucket.fetch_add(1, Ordering::Relaxed);
81}
82
83/// Point-in-time snapshot of tokenize metrics.
84#[must_use]
85pub fn tokenize_metrics_snapshot() -> TokenizeMetricsSnapshot {
86    TokenizeMetricsSnapshot {
87        fsqlite_tokenize_tokens_total: FSQLITE_TOKENIZE_TOKENS_TOTAL.load(Ordering::Relaxed),
88        fsqlite_tokenize_duration_seconds: TokenizeDurationSecondsHistogram {
89            le_100us: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US.load(Ordering::Relaxed),
90            le_250us: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US.load(Ordering::Relaxed),
91            le_500us: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US.load(Ordering::Relaxed),
92            le_1ms: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS.load(Ordering::Relaxed),
93            le_5ms: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS.load(Ordering::Relaxed),
94            gt_5ms: FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS.load(Ordering::Relaxed),
95        },
96        fsqlite_tokenize_duration_seconds_count: FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT
97            .load(Ordering::Relaxed),
98        fsqlite_tokenize_duration_seconds_sum_micros: FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS
99            .load(Ordering::Relaxed),
100    }
101}
102
103/// Enable or disable tokenize metrics collection on the hot path.
104pub fn set_tokenize_metrics_enabled(enabled: bool) {
105    FSQLITE_TOKENIZE_METRICS_ENABLED.store(enabled, Ordering::Relaxed);
106}
107
108/// Return whether tokenize metrics collection is enabled.
109#[must_use]
110pub fn tokenize_metrics_enabled() -> bool {
111    FSQLITE_TOKENIZE_METRICS_ENABLED.load(Ordering::Relaxed)
112}
113
114/// Reset tokenize metrics (used by tests/diagnostics).
115pub fn reset_tokenize_metrics() {
116    FSQLITE_TOKENIZE_TOKENS_TOTAL.store(0, Ordering::Relaxed);
117    FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US.store(0, Ordering::Relaxed);
118    FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US.store(0, Ordering::Relaxed);
119    FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US.store(0, Ordering::Relaxed);
120    FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS.store(0, Ordering::Relaxed);
121    FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS.store(0, Ordering::Relaxed);
122    FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS.store(0, Ordering::Relaxed);
123    FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT.store(0, Ordering::Relaxed);
124    FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS.store(0, Ordering::Relaxed);
125}
126
127/// Bound retained identifier interners so scratch reuse does not grow without limit.
128const MAX_RETAINED_IDENTIFIER_INTERNER_ENTRIES: usize = 256;
129const MAX_RETAINED_IDENTIFIER_INTERNER_BYTES: usize = 16 * 1024;
130
131thread_local! {
132    /// bd-5310l benchmark knob: force `retained_bytes` to recompute via the O(entries) fold instead
133    /// of the incremental running sum, so an A/B harness can measure the fold cost within one build.
134    /// Off by default; zero cost when off.
135    static FSQLITE_FORCE_INTERNER_SCAN_BENCH: std::cell::Cell<bool> =
136        const { std::cell::Cell::new(false) };
137}
138
139/// Force the O(entries) `retained_bytes` fold on the current thread (bd-5310l bench A/B only).
140///
141/// When `true`, the interner recomputes its retained byte count by scanning every entry instead of
142/// using the incrementally-maintained sum, so the two can be compared in one process.
143pub fn set_force_interner_scan_bench(enabled: bool) {
144    FSQLITE_FORCE_INTERNER_SCAN_BENCH.with(|c| c.set(enabled));
145}
146
147/// SQL lexer that produces a stream of tokens from source text.
148#[derive(Debug, Default)]
149pub(crate) struct IdentifierInterner {
150    values: HashSet<Arc<str>>,
151    /// bd-5310l: running sum of `value.len()` over all interned entries, kept incrementally so
152    /// `retained_bytes` (called on EVERY parse by `prepare_for_next_parse`) is O(1) instead of an
153    /// O(entries) fold. Entries are only added (`intern`) or bulk-cleared (`reset`), so the running
154    /// sum stays exactly equal to the fold. Byte-identical: only the threshold computation changes.
155    interned_bytes: usize,
156}
157
158impl IdentifierInterner {
159    fn intern(&mut self, value: &str) -> Arc<str> {
160        if let Some(existing) = self.values.get(value) {
161            return Arc::clone(existing);
162        }
163
164        let interned: Arc<str> = Arc::from(value);
165        let inserted = Arc::clone(&interned);
166        self.values.insert(interned);
167        self.interned_bytes = self.interned_bytes.saturating_add(value.len());
168        inserted
169    }
170
171    pub(crate) fn reset(&mut self) {
172        self.values = HashSet::new();
173        self.interned_bytes = 0;
174    }
175
176    pub(crate) fn retained_bytes(&self) -> usize {
177        // bd-5310l: use the incrementally-maintained `interned_bytes` (O(1)) rather than folding
178        // over every entry (O(entries)) on the per-parse hot path. A bench force-flag reinstates the
179        // fold so the two can be A/B-compared within one build.
180        let interned_value_bytes = if FSQLITE_FORCE_INTERNER_SCAN_BENCH.with(std::cell::Cell::get) {
181            self.values
182                .iter()
183                .fold(0usize, |sum, value| sum.saturating_add(value.len()))
184        } else {
185            self.interned_bytes
186        };
187        self.values
188            .capacity()
189            .saturating_mul(std::mem::size_of::<Arc<str>>())
190            .saturating_add(interned_value_bytes)
191    }
192
193    pub(crate) fn prepare_for_next_parse(&mut self) {
194        if self.values.len() > MAX_RETAINED_IDENTIFIER_INTERNER_ENTRIES
195            || self.retained_bytes() > MAX_RETAINED_IDENTIFIER_INTERNER_BYTES
196        {
197            self.reset();
198        }
199    }
200
201    #[cfg(test)]
202    pub(crate) fn is_empty(&self) -> bool {
203        self.values.is_empty()
204    }
205
206    #[cfg(test)]
207    pub(crate) fn len(&self) -> usize {
208        self.values.len()
209    }
210}
211
212/// SQL lexer that produces a stream of tokens from source text.
213pub struct Lexer<'a> {
214    /// The source bytes (UTF-8).
215    src: &'a [u8],
216    /// Current byte offset into src.
217    pos: usize,
218    /// Current line number (1-based).
219    line: u32,
220    /// Current column number (1-based).
221    col: u32,
222    /// Whether TRACE character-level logging is enabled.
223    trace_chars: bool,
224    /// Per-parse identifier interner reused by scratch callers.
225    interner: IdentifierInterner,
226}
227
228impl<'a> Lexer<'a> {
229    fn log_token(token: &Token) {
230        tracing::debug!(
231            target: "fsqlite.parse",
232            token = ?token.kind,
233            start = token.span.start,
234            end = token.span.end,
235            line = token.line,
236            col = token.col,
237            "tokenized token"
238        );
239    }
240
241    /// Create a new lexer for the given SQL source text.
242    #[must_use]
243    pub fn new(source: &'a str) -> Self {
244        Self {
245            src: source.as_bytes(),
246            pos: 0,
247            line: 1,
248            col: 1,
249            trace_chars: tracing::enabled!(target: "fsqlite.parse", Level::TRACE),
250            interner: IdentifierInterner::default(),
251        }
252    }
253
254    /// Tokenize the entire input into a Vec of tokens.
255    #[must_use]
256    pub fn tokenize(source: &'a str) -> Vec<Token> {
257        let mut tokens = Vec::new();
258        Self::tokenize_into(source, &mut tokens);
259        tokens
260    }
261
262    fn new_with_interner(source: &'a str, interner: IdentifierInterner) -> Self {
263        Self {
264            src: source.as_bytes(),
265            pos: 0,
266            line: 1,
267            col: 1,
268            trace_chars: tracing::enabled!(target: "fsqlite.parse", Level::TRACE),
269            interner,
270        }
271    }
272
273    /// Tokenize the entire input into a caller-owned buffer.
274    ///
275    /// This preserves the buffer's existing heap allocation across repeated
276    /// parses so statement-level callers can treat token storage as lookaside
277    /// scratch instead of rebuilding a fresh `Vec<Token>` on every miss.
278    pub fn tokenize_into(source: &'a str, tokens: &mut Vec<Token>) {
279        let mut interner = IdentifierInterner::default();
280        Self::tokenize_into_with_interner(source, tokens, &mut interner);
281    }
282
283    pub(crate) fn tokenize_into_with_interner(
284        source: &'a str,
285        tokens: &mut Vec<Token>,
286        interner: &mut IdentifierInterner,
287    ) {
288        let input_bytes = source.len();
289        let collect_tokenize_metrics = tokenize_metrics_enabled();
290        let trace_tokenize = tracing::enabled!(target: "fsqlite.parse", Level::TRACE);
291        let span = trace_tokenize.then(|| {
292            tracing::span!(
293                target: "fsqlite.parse",
294                Level::TRACE,
295                "tokenize",
296                token_count = tracing::field::Empty,
297                input_bytes,
298                elapsed_us = tracing::field::Empty,
299            )
300        });
301        let _guard = span.as_ref().map(|span| span.enter());
302        let started = (collect_tokenize_metrics || trace_tokenize).then(Instant::now);
303
304        let mut lexer = Self::new_with_interner(source, std::mem::take(interner));
305        let target_capacity = input_bytes / 4 + 1;
306        tokens.clear();
307        if target_capacity > tokens.capacity() {
308            tokens.reserve(target_capacity - tokens.capacity());
309        }
310        loop {
311            let tok = lexer.next_token();
312            let is_eof = tok.kind == TokenKind::Eof;
313            tokens.push(tok);
314            if is_eof {
315                break;
316            }
317        }
318
319        *interner = lexer.interner;
320
321        if let Some(started) = started {
322            let elapsed_us = saturating_u64_from_u128(started.elapsed().as_micros());
323            if let Some(span) = span.as_ref() {
324                span.record("token_count", saturating_u64_from_usize(tokens.len()));
325                span.record("elapsed_us", elapsed_us);
326            }
327            if collect_tokenize_metrics {
328                record_tokenize_metrics(tokens.len(), elapsed_us);
329            }
330        }
331    }
332
333    /// Expose tokenize metrics as a snapshot.
334    #[must_use]
335    pub fn metrics_snapshot() -> TokenizeMetricsSnapshot {
336        tokenize_metrics_snapshot()
337    }
338
339    /// Reset tokenize metrics.
340    pub fn reset_metrics() {
341        reset_tokenize_metrics();
342    }
343
344    /// Produce the next token.
345    pub fn next_token(&mut self) -> Token {
346        self.skip_whitespace_and_comments();
347
348        if self.pos >= self.src.len() {
349            let token = self.make_token(TokenKind::Eof, self.pos, self.pos);
350            Self::log_token(&token);
351            return token;
352        }
353
354        let start = self.pos;
355        let start_line = self.line;
356        let start_col = self.col;
357        let ch = self.src[self.pos];
358
359        let kind = match ch {
360            // String literal (single-quoted)
361            b'\'' => self.lex_string(),
362
363            // Double-quoted identifier
364            b'"' => self.lex_double_quoted_id(),
365
366            // Backtick-quoted identifier
367            b'`' => self.lex_backtick_id(),
368
369            // Bracket-quoted identifier
370            b'[' => self.lex_bracket_id(),
371
372            // Blob literal or hex
373            b'X' | b'x' if self.peek_at(1) == Some(b'\'') => self.lex_blob(),
374
375            // Numbers
376            b'0'..=b'9' => self.lex_number(),
377            b'.' if self.peek_at(1).is_some_and(|c| c.is_ascii_digit()) => self.lex_number(),
378
379            // Identifiers and keywords
380            b'a'..=b'z' | b'A'..=b'Z' | b'_' | 0x80..=0xFF => self.lex_identifier(),
381
382            // Bind parameters
383            b'?' => self.lex_question(),
384            b':' => self.lex_colon_param(),
385            b'@' => self.lex_at_param(),
386            b'$' => self.lex_dollar_param(),
387
388            // Operators and punctuation
389            b'+' => {
390                self.advance();
391                TokenKind::Plus
392            }
393            b'*' => {
394                self.advance();
395                TokenKind::Star
396            }
397            b'/' => {
398                self.advance();
399                TokenKind::Slash
400            }
401            b'%' => {
402                self.advance();
403                TokenKind::Percent
404            }
405            b'&' => {
406                self.advance();
407                TokenKind::Ampersand
408            }
409            b'~' => {
410                self.advance();
411                TokenKind::Tilde
412            }
413            b',' => {
414                self.advance();
415                TokenKind::Comma
416            }
417            b';' => {
418                self.advance();
419                TokenKind::Semicolon
420            }
421            b'(' => {
422                self.advance();
423                TokenKind::LeftParen
424            }
425            b')' => {
426                self.advance();
427                TokenKind::RightParen
428            }
429            b'.' => {
430                self.advance();
431                TokenKind::Dot
432            }
433
434            // Multi-character operators
435            b'-' => self.lex_minus_or_arrow(),
436            b'<' => self.lex_lt(),
437            b'>' => self.lex_gt(),
438            b'=' => self.lex_eq(),
439            b'!' => self.lex_bang(),
440            b'|' => self.lex_pipe(),
441
442            _ => {
443                self.advance();
444                let s = String::from_utf8_lossy(&self.src[start..self.pos]).into_owned();
445                TokenKind::Error(format!("unexpected character: {s}"))
446            }
447        };
448
449        let token = Token {
450            kind,
451            #[allow(clippy::cast_possible_truncation)]
452            span: Span::new(start as u32, self.pos as u32),
453            line: start_line,
454            col: start_col,
455        };
456
457        Self::log_token(&token);
458        token
459    }
460
461    // -----------------------------------------------------------------------
462    // Helpers
463    // -----------------------------------------------------------------------
464
465    #[allow(clippy::cast_possible_truncation)]
466    fn advance_by(&mut self, n: usize) {
467        if n == 0 {
468            return;
469        }
470        let end = self.pos + n;
471        let slice = &self.src[self.pos..end];
472        #[allow(clippy::naive_bytecount)]
473        let newlines = slice.iter().filter(|&&b| b == b'\n').count();
474        if newlines > 0 {
475            self.line += newlines as u32;
476            let last_nl = slice.iter().rposition(|&b| b == b'\n').unwrap_or(0);
477            self.col = (n - last_nl) as u32;
478        } else {
479            self.col += n as u32;
480        }
481        self.pos = end;
482    }
483
484    fn advance(&mut self) -> u8 {
485        let pos = self.pos;
486        let line = self.line;
487        let col = self.col;
488        let ch = self.src[self.pos];
489        self.pos += 1;
490        if ch == b'\n' {
491            self.line += 1;
492            self.col = 1;
493        } else {
494            self.col += 1;
495        }
496        if self.trace_chars {
497            tracing::trace!(
498                target: "fsqlite.parse",
499                byte = ch,
500                pos,
501                line,
502                col,
503                "tokenize char"
504            );
505        }
506        ch
507    }
508
509    fn peek(&self) -> Option<u8> {
510        self.src.get(self.pos).copied()
511    }
512
513    fn peek_at(&self, offset: usize) -> Option<u8> {
514        self.src.get(self.pos + offset).copied()
515    }
516
517    #[allow(clippy::cast_possible_truncation)]
518    fn make_token(&self, kind: TokenKind, start: usize, end: usize) -> Token {
519        Token {
520            kind,
521            span: Span::new(start as u32, end as u32),
522            line: self.line,
523            col: self.col,
524        }
525    }
526
527    /// Skip whitespace, line comments (`--`), and block comments (`/* */`).
528    fn skip_whitespace_and_comments(&mut self) {
529        loop {
530            // Skip whitespace
531            let mut ws_len = 0;
532            while self.pos + ws_len < self.src.len()
533                && self.src[self.pos + ws_len].is_ascii_whitespace()
534            {
535                ws_len += 1;
536            }
537            if ws_len > 0 {
538                self.advance_by(ws_len);
539            }
540
541            if self.pos >= self.src.len() {
542                break;
543            }
544
545            // Line comment: `-- ...`
546            if self.src[self.pos] == b'-' && self.peek_at(1) == Some(b'-') {
547                self.advance(); // skip -
548                self.advance(); // skip -
549                while self.pos < self.src.len() && self.src[self.pos] != b'\n' {
550                    self.advance();
551                }
552                continue;
553            }
554
555            // Block comment: `/* ... */` (SQLite does NOT support nesting)
556            if self.src[self.pos] == b'/' && self.peek_at(1) == Some(b'*') {
557                self.advance(); // skip /
558                self.advance(); // skip *
559                let closed = loop {
560                    if self.pos >= self.src.len() {
561                        break false;
562                    }
563                    if self.src[self.pos] == b'*' && self.peek_at(1) == Some(b'/') {
564                        self.advance();
565                        self.advance();
566                        break true;
567                    }
568                    self.advance();
569                };
570                if !closed {
571                    // Unclosed block comment consumes to EOF
572                    self.pos = self.src.len();
573                }
574                continue;
575            }
576
577            break;
578        }
579    }
580
581    // -----------------------------------------------------------------------
582    // Literal tokenizers
583    // -----------------------------------------------------------------------
584
585    fn lex_string(&mut self) -> TokenKind {
586        let start = self.pos;
587        self.advance(); // skip opening quote
588
589        let mut value = String::new();
590        loop {
591            // Use memchr to find the next single quote quickly
592            let remaining = &self.src[self.pos..];
593            if let Some(offset) = memchr(b'\'', remaining) {
594                // Append bytes up to the quote
595                value.push_str(&String::from_utf8_lossy(
596                    &self.src[self.pos..self.pos + offset],
597                ));
598                // Advance past the accumulated bytes and the quote
599                self.advance_by(offset);
600                self.advance(); // the quote itself
601
602                // Check for escaped quote ('')
603                if self.peek() == Some(b'\'') {
604                    value.push('\'');
605                    self.advance();
606                } else {
607                    return TokenKind::String(value);
608                }
609            } else {
610                // Unterminated string
611                self.pos = self.src.len();
612                return TokenKind::Error(format!(
613                    "unterminated string literal starting at byte {}",
614                    start
615                ));
616            }
617        }
618    }
619
620    /// Lex a double-quoted identifier. Sets the EP_DblQuoted flag.
621    fn lex_double_quoted_id(&mut self) -> TokenKind {
622        let start = self.pos;
623        self.advance(); // skip opening "
624
625        let mut value = String::new();
626        loop {
627            let remaining = &self.src[self.pos..];
628            if let Some(offset) = memchr(b'"', remaining) {
629                value.push_str(&String::from_utf8_lossy(
630                    &self.src[self.pos..self.pos + offset],
631                ));
632                self.advance_by(offset);
633                self.advance(); // the quote
634
635                // Doubled-quote escape: "" -> "
636                if self.peek() == Some(b'"') {
637                    value.push('"');
638                    self.advance();
639                } else {
640                    return TokenKind::QuotedId(self.interner.intern(&value), true);
641                }
642            } else {
643                self.pos = self.src.len();
644                return TokenKind::Error(format!(
645                    "unterminated double-quoted identifier at byte {}",
646                    start
647                ));
648            }
649        }
650    }
651
652    /// Lex a backtick-quoted identifier.
653    fn lex_backtick_id(&mut self) -> TokenKind {
654        let start = self.pos;
655        self.advance(); // skip `
656
657        let mut value = String::new();
658        loop {
659            let remaining = &self.src[self.pos..];
660            if let Some(offset) = memchr(b'`', remaining) {
661                value.push_str(&String::from_utf8_lossy(
662                    &self.src[self.pos..self.pos + offset],
663                ));
664                self.advance_by(offset);
665                self.advance(); // the backtick
666
667                if self.peek() == Some(b'`') {
668                    value.push('`');
669                    self.advance();
670                } else {
671                    return TokenKind::QuotedId(self.interner.intern(&value), false);
672                }
673            } else {
674                self.pos = self.src.len();
675                return TokenKind::Error(format!(
676                    "unterminated backtick identifier at byte {}",
677                    start
678                ));
679            }
680        }
681    }
682
683    /// Lex a bracket-quoted identifier `[name]`.
684    fn lex_bracket_id(&mut self) -> TokenKind {
685        let start = self.pos;
686        self.advance(); // skip [
687
688        let mut value = String::new();
689        let remaining = &self.src[self.pos..];
690        if let Some(offset) = memchr(b']', remaining) {
691            value.push_str(&String::from_utf8_lossy(
692                &self.src[self.pos..self.pos + offset],
693            ));
694            self.advance_by(offset);
695            self.advance(); // skip ]
696            TokenKind::QuotedId(self.interner.intern(&value), false)
697        } else {
698            self.pos = self.src.len();
699            TokenKind::Error(format!("unterminated bracket identifier at byte {}", start))
700        }
701    }
702
703    /// Lex a blob literal `X'...'` / `x'...'`.
704    fn lex_blob(&mut self) -> TokenKind {
705        let start = self.pos;
706        self.advance(); // skip X/x
707        self.advance(); // skip '
708
709        let hex_start = self.pos;
710        let remaining = &self.src[self.pos..];
711        if let Some(offset) = memchr(b'\'', remaining) {
712            let hex_bytes = &self.src[hex_start..hex_start + offset];
713            self.advance_by(offset);
714            self.advance(); // skip closing '
715
716            // Validate hex content
717            if !hex_bytes.len().is_multiple_of(2) {
718                return TokenKind::Error(format!(
719                    "blob literal has odd number of hex digits at byte {}",
720                    start
721                ));
722            }
723
724            // Work directly on raw bytes to avoid panics from
725            // string-slicing multi-byte UTF-8 sequences.
726            let mut bytes = Vec::with_capacity(hex_bytes.len() / 2);
727            for &[hi, lo] in hex_bytes.as_chunks::<2>().0 {
728                let hi = hex_digit(hi);
729                let lo = hex_digit(lo);
730                match (hi, lo) {
731                    (Some(h), Some(l)) => bytes.push((h << 4) | l),
732                    _ => {
733                        return TokenKind::Error(format!(
734                            "invalid hex in blob literal at byte {start}"
735                        ));
736                    }
737                }
738            }
739            TokenKind::Blob(bytes)
740        } else {
741            self.pos = self.src.len();
742            TokenKind::Error(format!("unterminated blob literal at byte {}", start))
743        }
744    }
745
746    /// Lex a number: integer, hex integer, or float.
747    fn lex_number(&mut self) -> TokenKind {
748        let start = self.pos;
749
750        // Check for hex prefix
751        if self.src[self.pos] == b'0' && self.peek_at(1).is_some_and(|c| c == b'x' || c == b'X') {
752            self.advance(); // 0
753            self.advance(); // x
754            let hex_start = self.pos;
755            // Consume hex digits, allowing a single `_` digit separator that is
756            // surrounded on both sides by a hex digit (SQLite 3.46+ digit
757            // separators). `0x_1F`, `0x1__F`, and a trailing `0x1F_` are
758            // rejected because the underscore is not between two hex digits.
759            while self.pos < self.src.len() {
760                let c = self.src[self.pos];
761                let is_separator = c == b'_'
762                    && self.pos > hex_start
763                    && self.src[self.pos - 1].is_ascii_hexdigit()
764                    && self.peek_at(1).is_some_and(|n| n.is_ascii_hexdigit());
765                if c.is_ascii_hexdigit() || is_separator {
766                    self.advance();
767                } else {
768                    break;
769                }
770            }
771            if self.pos == hex_start {
772                return TokenKind::Error("empty hex literal".to_owned());
773            }
774            // A hex literal cannot be immediately followed by an alphanumeric or
775            // `_` (e.g. `0x1F_` or `0xFFg`) — that is an unrecognized token, the
776            // same rule the decimal path enforces below.
777            if self
778                .peek()
779                .is_some_and(|n| n.is_ascii_alphanumeric() || n == b'_')
780            {
781                let err_start = start;
782                while self.pos < self.src.len()
783                    && (self.src[self.pos].is_ascii_alphanumeric() || self.src[self.pos] == b'_')
784                {
785                    self.advance();
786                }
787                let err_text = String::from_utf8_lossy(&self.src[err_start..self.pos]);
788                return TokenKind::Error(format!("unrecognized token: \"{err_text}\""));
789            }
790            let hex_str = String::from_utf8_lossy(&self.src[hex_start..self.pos]).replace('_', "");
791            // Strip leading zeros then check significant digit count,
792            // matching C SQLite's sqlite3DecOrHexToI64 which rejects
793            // hex literals with >16 significant digits.
794            let significant = hex_str.trim_start_matches('0');
795            if significant.len() > 16 {
796                return TokenKind::Error(format!("hex literal out of range at byte {start}"));
797            }
798            let parse_str = if significant.is_empty() {
799                "0"
800            } else {
801                significant
802            };
803            // Parse as u64 and bitwise-cast to i64 — matching C SQLite's
804            // sqlite3DecOrHexToI64 which uses memcpy(pOut, &u, 8).
805            return match u64::from_str_radix(parse_str, 16) {
806                Ok(v) => {
807                    #[allow(clippy::cast_possible_wrap)]
808                    let i = v as i64;
809                    TokenKind::Integer(i)
810                }
811                Err(_) => TokenKind::Error(format!("hex literal out of range at byte {start}")),
812            };
813        }
814
815        // Decimal integer or float
816        let mut is_float = false;
817
818        // Integer part (may be empty for `.5` style). Allow `_` digit
819        // separators that are surrounded on both sides by a decimal digit.
820        self.consume_decimal_digit_run();
821
822        // Helper to check if the current position (+ offset) starts a valid exponent.
823        let is_valid_exponent = |lexer: &Self, mut offset: usize| -> bool {
824            if let Some(c) = lexer.peek_at(offset)
825                && (c == b'e' || c == b'E')
826            {
827                offset += 1;
828                if let Some(s) = lexer.peek_at(offset)
829                    && (s == b'+' || s == b'-')
830                {
831                    offset += 1;
832                }
833                if let Some(d) = lexer.peek_at(offset) {
834                    return d.is_ascii_digit();
835                }
836            }
837            false
838        };
839
840        // Fractional part
841        if self.pos < self.src.len()
842            && self.src[self.pos] == b'.'
843            && (self.peek_at(1).is_some_and(|c| c.is_ascii_digit()) || is_valid_exponent(self, 1))
844        {
845            is_float = true;
846            self.advance(); // skip dot
847            self.consume_decimal_digit_run();
848        } else if self.pos < self.src.len()
849            && self.src[self.pos] == b'.'
850            && start < self.pos // we had digits before the dot
851            && !self.peek_at(1).is_some_and(|c| c.is_ascii_alphanumeric() || c == b'_')
852        {
853            // e.g. `123.` with nothing meaningful after -- still a float
854            is_float = true;
855            self.advance(); // skip dot
856        }
857
858        // Handle case where input starts with '.'
859        if self.src[start] == b'.' {
860            is_float = true;
861        }
862
863        // Exponent
864        if is_valid_exponent(self, 0) {
865            is_float = true;
866            self.advance(); // skip e/E
867            if self.pos < self.src.len()
868                && (self.src[self.pos] == b'+' || self.src[self.pos] == b'-')
869            {
870                self.advance();
871            }
872            self.consume_decimal_digit_run();
873        }
874
875        // SQLite strictness: a number cannot be immediately followed by an alphabetical character or underscore.
876        // Doing so produces an "unrecognized token" error.
877        if let Some(c) = self.peek()
878            && (c.is_ascii_alphabetic()
879                || c == b'_'
880                || (c == b'.'
881                    && self
882                        .peek_at(1)
883                        .is_some_and(|n| n.is_ascii_alphabetic() || n == b'_')))
884        {
885            let err_start = start;
886            while self.pos < self.src.len() {
887                let ch = self.src[self.pos];
888                if ch.is_ascii_alphanumeric() || ch == b'_' || ch == b'.' {
889                    self.advance();
890                } else {
891                    break;
892                }
893            }
894            let err_text = String::from_utf8_lossy(&self.src[err_start..self.pos]);
895            return TokenKind::Error(format!("unrecognized token: \"{err_text}\""));
896        }
897
898        let text_raw = String::from_utf8_lossy(&self.src[start..self.pos]);
899        // Strip `_` digit separators before numeric parsing; they were only
900        // consumed when validly placed between two digits above.
901        let text: std::borrow::Cow<'_, str> = if text_raw.as_ref().contains('_') {
902            std::borrow::Cow::Owned(text_raw.replace('_', ""))
903        } else {
904            text_raw
905        };
906        if is_float {
907            // Overflowing literals (e.g. 9e999) become ±Infinity, exactly like
908            // C SQLite's text-to-real conversion; do NOT clamp to f64::MAX.
909            match text.parse::<f64>() {
910                Ok(v) => TokenKind::Float(v),
911                Err(_) => {
912                    // Rust's f64 parser rejects `.e4` but SQLite accepts it as 0.0.
913                    let mut text_fixed = text.clone().into_owned();
914                    if text_fixed.starts_with(".e") || text_fixed.starts_with(".E") {
915                        text_fixed.insert(0, '0');
916                    }
917                    match text_fixed.parse::<f64>() {
918                        Ok(v) => TokenKind::Float(v),
919                        Err(_) => TokenKind::Error(format!("invalid float: {text}")),
920                    }
921                }
922            }
923        } else {
924            match text.parse::<i64>() {
925                Ok(v) => TokenKind::Integer(v),
926                Err(_) => {
927                    // SQLite promotes oversized integers to REAL. We emit a special
928                    // token to allow the parser to fold `-9223372036854775808` correctly.
929                    TokenKind::OversizedInt(text.into_owned())
930                }
931            }
932        }
933    }
934
935    /// Consume a run of decimal digits, allowing single `_` digit separators
936    /// (SQLite 3.46+) that are surrounded on both sides by a decimal digit. An
937    /// underscore that is leading, trailing, doubled, or adjacent to a non-digit
938    /// (`.`, `e`, sign) terminates the run, leaving it to be flagged as an
939    /// unrecognized token by the trailing-character check in `lex_number`.
940    fn consume_decimal_digit_run(&mut self) {
941        while self.pos < self.src.len() {
942            let c = self.src[self.pos];
943            let is_separator = c == b'_'
944                && self.pos > 0
945                && self.src[self.pos - 1].is_ascii_digit()
946                && self.peek_at(1).is_some_and(|n| n.is_ascii_digit());
947            if c.is_ascii_digit() || is_separator {
948                self.advance();
949            } else {
950                break;
951            }
952        }
953    }
954
955    /// Lex an identifier or keyword.
956    fn lex_identifier(&mut self) -> TokenKind {
957        let start = self.pos;
958        self.advance(); // first character already validated
959
960        while self.pos < self.src.len() {
961            let ch = self.src[self.pos];
962            if ch.is_ascii_alphanumeric() || ch == b'_' || ch >= 0x80 {
963                self.advance();
964            } else {
965                break;
966            }
967        }
968
969        let ident_bytes = &self.src[start..self.pos];
970
971        // Check for keyword
972        if let Some(kw) = TokenKind::lookup_keyword_bytes(ident_bytes) {
973            kw
974        } else {
975            let text = String::from_utf8_lossy(ident_bytes);
976            TokenKind::Id(self.interner.intern(&text))
977        }
978    }
979
980    /// Lex `?` or `?NNN`.
981    fn lex_question(&mut self) -> TokenKind {
982        self.advance(); // skip ?
983        if self.pos < self.src.len() && self.src[self.pos].is_ascii_digit() {
984            let num_start = self.pos;
985            while self.pos < self.src.len() && self.src[self.pos].is_ascii_digit() {
986                self.advance();
987            }
988            let text = String::from_utf8_lossy(&self.src[num_start..self.pos]);
989            match text.parse::<u32>() {
990                Ok(n) if (1..=MAX_VARIABLE_NUMBER).contains(&n) => TokenKind::QuestionNum(n),
991                Ok(n) => TokenKind::Error(format!(
992                    "variable number must be between ?1 and ?{MAX_VARIABLE_NUMBER}, got ?{n}"
993                )),
994                Err(_) => TokenKind::Error("invalid parameter number".to_owned()),
995            }
996        } else {
997            TokenKind::Question
998        }
999    }
1000
1001    fn lex_alpha_param(&mut self, prefix: char, constructor: fn(String) -> TokenKind) -> TokenKind {
1002        self.advance(); // skip prefix
1003        let name_start = self.pos;
1004        while self.pos < self.src.len() {
1005            let ch = self.src[self.pos];
1006            if ch.is_ascii_alphanumeric() || ch == b'_' || ch >= 0x80 {
1007                self.advance();
1008            } else if ch == b':' && self.peek_at(1) == Some(b':') {
1009                self.advance();
1010                self.advance();
1011            } else if ch == b'(' {
1012                self.advance();
1013                while self.pos < self.src.len() && self.src[self.pos] != b')' {
1014                    self.advance();
1015                }
1016                if self.pos >= self.src.len() || self.src[self.pos] != b')' {
1017                    let name = String::from_utf8_lossy(&self.src[name_start..self.pos]);
1018                    return TokenKind::Error(format!("unrecognized token: \"{prefix}{name}\""));
1019                }
1020                self.advance();
1021                break; // Tcl array variable parameters end after the closing paren.
1022            } else {
1023                break;
1024            }
1025        }
1026        if self.pos == name_start {
1027            return TokenKind::Error(format!("empty parameter name after '{prefix}'"));
1028        }
1029        let name = String::from_utf8_lossy(&self.src[name_start..self.pos]).into_owned();
1030        constructor(name)
1031    }
1032
1033    /// Lex `:name`.
1034    fn lex_colon_param(&mut self) -> TokenKind {
1035        self.lex_alpha_param(':', TokenKind::ColonParam)
1036    }
1037
1038    /// Lex `@name`.
1039    fn lex_at_param(&mut self) -> TokenKind {
1040        self.lex_alpha_param('@', TokenKind::AtParam)
1041    }
1042
1043    /// Lex `$name`.
1044    fn lex_dollar_param(&mut self) -> TokenKind {
1045        self.lex_alpha_param('$', TokenKind::DollarParam)
1046    }
1047
1048    // -----------------------------------------------------------------------
1049    // Multi-character operator tokenizers
1050    // -----------------------------------------------------------------------
1051
1052    /// Lex `-`, `->`, or `->>`.
1053    fn lex_minus_or_arrow(&mut self) -> TokenKind {
1054        self.advance(); // skip -
1055        if self.peek() == Some(b'>') {
1056            self.advance(); // skip >
1057            if self.peek() == Some(b'>') {
1058                self.advance(); // skip >
1059                TokenKind::DoubleArrow
1060            } else {
1061                TokenKind::Arrow
1062            }
1063        } else {
1064            TokenKind::Minus
1065        }
1066    }
1067
1068    /// Lex `<`, `<=`, `<>`, or `<<`.
1069    fn lex_lt(&mut self) -> TokenKind {
1070        self.advance(); // skip <
1071        match self.peek() {
1072            Some(b'=') => {
1073                self.advance();
1074                TokenKind::Le
1075            }
1076            Some(b'>') => {
1077                self.advance();
1078                TokenKind::LtGt
1079            }
1080            Some(b'<') => {
1081                self.advance();
1082                TokenKind::ShiftLeft
1083            }
1084            _ => TokenKind::Lt,
1085        }
1086    }
1087
1088    /// Lex `>`, `>=`, or `>>`.
1089    fn lex_gt(&mut self) -> TokenKind {
1090        self.advance(); // skip >
1091        match self.peek() {
1092            Some(b'=') => {
1093                self.advance();
1094                TokenKind::Ge
1095            }
1096            Some(b'>') => {
1097                self.advance();
1098                TokenKind::ShiftRight
1099            }
1100            _ => TokenKind::Gt,
1101        }
1102    }
1103
1104    /// Lex `=` or `==`.
1105    fn lex_eq(&mut self) -> TokenKind {
1106        self.advance(); // skip =
1107        if self.peek() == Some(b'=') {
1108            self.advance();
1109            TokenKind::EqEq
1110        } else {
1111            TokenKind::Eq
1112        }
1113    }
1114
1115    /// Lex `!=`.
1116    fn lex_bang(&mut self) -> TokenKind {
1117        self.advance(); // skip !
1118        if self.peek() == Some(b'=') {
1119            self.advance();
1120            TokenKind::Ne
1121        } else {
1122            TokenKind::Error("unexpected '!', did you mean '!='?".to_owned())
1123        }
1124    }
1125
1126    /// Lex `|` or `||`.
1127    fn lex_pipe(&mut self) -> TokenKind {
1128        self.advance(); // skip |
1129        if self.peek() == Some(b'|') {
1130            self.advance();
1131            TokenKind::Concat
1132        } else {
1133            TokenKind::Pipe
1134        }
1135    }
1136}
1137
1138/// Convert an ASCII hex digit byte to its numeric value (0-15).
1139/// Returns `None` for non-hex bytes.
1140const fn hex_digit(b: u8) -> Option<u8> {
1141    match b {
1142        b'0'..=b'9' => Some(b - b'0'),
1143        b'a'..=b'f' => Some(b - b'a' + 10),
1144        b'A'..=b'F' => Some(b - b'A' + 10),
1145        _ => None,
1146    }
1147}
1148
1149#[cfg(test)]
1150mod tests {
1151    use super::*;
1152
1153    #[test]
1154    fn interner_incremental_bytes_equals_fold() {
1155        // bd-5310l: the incrementally-maintained `interned_bytes` must exactly equal the O(N) fold
1156        // over entries, for every intern/reset sequence, so `retained_bytes` (and thus the
1157        // reset-threshold behaviour) is byte-identical whichever path computes it.
1158        let mut interner = IdentifierInterner::default();
1159        for v in ["alpha", "beta", "gamma", "alpha", "delta", "beta"] {
1160            interner.intern(v);
1161        }
1162        // Deduped distinct set {alpha(5), beta(4), gamma(5), delta(5)} -> 19 bytes.
1163        assert_eq!(interner.interned_bytes, 19);
1164        set_force_interner_scan_bench(false);
1165        let incremental = interner.retained_bytes();
1166        set_force_interner_scan_bench(true);
1167        let folded = interner.retained_bytes();
1168        set_force_interner_scan_bench(false);
1169        assert_eq!(
1170            incremental, folded,
1171            "incremental retained_bytes must equal the O(N) fold"
1172        );
1173        interner.reset();
1174        assert_eq!(interner.interned_bytes, 0);
1175        assert_eq!(interner.retained_bytes(), 0);
1176    }
1177
1178    fn lex(src: &str) -> Vec<Token> {
1179        Lexer::tokenize(src)
1180    }
1181
1182    fn kinds(src: &str) -> Vec<TokenKind> {
1183        lex(src).into_iter().map(|t| t.kind).collect()
1184    }
1185
1186    #[test]
1187    fn test_lex_integer_literals() {
1188        let tokens = kinds("42 0 0xFF");
1189        assert_eq!(
1190            tokens,
1191            vec![
1192                TokenKind::Integer(42),
1193                TokenKind::Integer(0),
1194                TokenKind::Integer(255),
1195                TokenKind::Eof,
1196            ]
1197        );
1198    }
1199
1200    #[test]
1201    fn test_tokenize_into_reuses_caller_owned_capacity() {
1202        let mut scratch = Vec::new();
1203        Lexer::tokenize_into(
1204            "SELECT 'abcdefghijklmnopqrstuvwxyzabcdefghijklmnopqrstuvwxyz';",
1205            &mut scratch,
1206        );
1207        let warmed_capacity = scratch.capacity();
1208        assert!(
1209            warmed_capacity > 0,
1210            "warm parse should allocate token scratch"
1211        );
1212
1213        Lexer::tokenize_into("SELECT 1;", &mut scratch);
1214        assert_eq!(
1215            scratch.capacity(),
1216            warmed_capacity,
1217            "smaller follow-up parse should reuse the warmed token buffer",
1218        );
1219        assert_eq!(
1220            scratch.last().map(|token| &token.kind),
1221            Some(&TokenKind::Eof),
1222            "tokenize_into should still terminate with EOF in reused scratch",
1223        );
1224    }
1225
1226    #[test]
1227    fn test_lex_float_literals() {
1228        let tokens = kinds("3.14 1e10 .5 1.0e-3 0.0");
1229        // Avoid clippy::approx_constant (3.14 is interpreted as an approximation of PI),
1230        // but keep the test input string stable.
1231        let expected = 3.0 + 0.14;
1232        assert!(matches!(
1233            tokens[0],
1234            TokenKind::Float(v) if (v - expected).abs() < 1e-10
1235        ));
1236        assert!(matches!(tokens[1], TokenKind::Float(v) if (v - 1e10).abs() < 1.0));
1237        assert!(matches!(tokens[2], TokenKind::Float(v) if (v - 0.5).abs() < 1e-10));
1238        assert!(matches!(tokens[3], TokenKind::Float(v) if (v - 0.001).abs() < 1e-10));
1239        assert!(matches!(tokens[4], TokenKind::Float(v) if v.abs() < 1e-10));
1240        assert_eq!(tokens[5], TokenKind::Eof);
1241    }
1242
1243    #[test]
1244    fn test_lex_string_literals() {
1245        let tokens = kinds("'hello' 'it''s' ''");
1246        assert_eq!(tokens[0], TokenKind::String("hello".to_owned()));
1247        assert_eq!(tokens[1], TokenKind::String("it's".to_owned()));
1248        assert_eq!(tokens[2], TokenKind::String(String::new()));
1249        assert_eq!(tokens[3], TokenKind::Eof);
1250    }
1251
1252    #[test]
1253    fn test_lex_blob_literals() {
1254        let tokens = kinds("X'CAFE' x'00ff' X''");
1255        assert_eq!(tokens[0], TokenKind::Blob(vec![0xCA, 0xFE]));
1256        assert_eq!(tokens[1], TokenKind::Blob(vec![0x00, 0xFF]));
1257        assert_eq!(tokens[2], TokenKind::Blob(vec![]));
1258        assert_eq!(tokens[3], TokenKind::Eof);
1259    }
1260
1261    #[test]
1262    fn test_lex_blob_odd_hex_error() {
1263        let tokens = kinds("X'CAF'");
1264        assert!(matches!(tokens[0], TokenKind::Error(_)));
1265    }
1266
1267    #[test]
1268    fn test_lex_blob_non_ascii_no_panic() {
1269        // bd-20gf regression: multi-byte UTF-8 inside a blob literal must
1270        // produce an error, not panic on string-slice boundary.
1271        let tokens = kinds("X'U\u{05fc} '");
1272        assert!(matches!(tokens[0], TokenKind::Error(_)));
1273
1274        // Also test with raw non-hex ASCII chars.
1275        let tokens2 = kinds("X'GG'");
1276        assert!(matches!(tokens2[0], TokenKind::Error(_)));
1277    }
1278
1279    #[test]
1280    fn test_lex_variables() {
1281        let tokens = kinds("?1 :name @param $var ?");
1282        assert_eq!(tokens[0], TokenKind::QuestionNum(1));
1283        assert_eq!(tokens[1], TokenKind::ColonParam("name".to_owned()));
1284        assert_eq!(tokens[2], TokenKind::AtParam("param".to_owned()));
1285        assert_eq!(tokens[3], TokenKind::DollarParam("var".to_owned()));
1286        assert_eq!(tokens[4], TokenKind::Question);
1287        assert_eq!(tokens[5], TokenKind::Eof);
1288    }
1289
1290    #[test]
1291    fn test_lex_quoted_identifiers() {
1292        let tokens = kinds("\"table_name\" [column] `backtick`");
1293        assert_eq!(tokens[0], TokenKind::QuotedId("table_name".into(), true));
1294        assert_eq!(tokens[1], TokenKind::QuotedId("column".into(), false));
1295        assert_eq!(tokens[2], TokenKind::QuotedId("backtick".into(), false));
1296    }
1297
1298    #[test]
1299    fn test_lex_dqs_flag() {
1300        let tokens = kinds("\"hello\"");
1301        // Double-quoted strings produce QuotedId with EP_DblQuoted=true
1302        assert_eq!(tokens[0], TokenKind::QuotedId("hello".into(), true));
1303    }
1304
1305    #[test]
1306    fn test_lex_keywords() {
1307        let tokens = kinds("SELECT FROM WHERE INSERT CREATE TABLE CONCURRENT");
1308        assert_eq!(tokens[0], TokenKind::KwSelect);
1309        assert_eq!(tokens[1], TokenKind::KwFrom);
1310        assert_eq!(tokens[2], TokenKind::KwWhere);
1311        assert_eq!(tokens[3], TokenKind::KwInsert);
1312        assert_eq!(tokens[4], TokenKind::KwCreate);
1313        assert_eq!(tokens[5], TokenKind::KwTable);
1314        assert_eq!(tokens[6], TokenKind::KwConcurrent);
1315
1316        // Case insensitivity
1317        let tokens2 = kinds("select from where");
1318        assert_eq!(tokens2[0], TokenKind::KwSelect);
1319        assert_eq!(tokens2[1], TokenKind::KwFrom);
1320        assert_eq!(tokens2[2], TokenKind::KwWhere);
1321    }
1322
1323    #[test]
1324    fn test_lex_operators() {
1325        let tokens = kinds("+ - * / % & | ~ << >> = < <= > >= == != <> || -> ->>");
1326        let expected = vec![
1327            TokenKind::Plus,
1328            TokenKind::Minus,
1329            TokenKind::Star,
1330            TokenKind::Slash,
1331            TokenKind::Percent,
1332            TokenKind::Ampersand,
1333            TokenKind::Pipe,
1334            TokenKind::Tilde,
1335            TokenKind::ShiftLeft,
1336            TokenKind::ShiftRight,
1337            TokenKind::Eq,
1338            TokenKind::Lt,
1339            TokenKind::Le,
1340            TokenKind::Gt,
1341            TokenKind::Ge,
1342            TokenKind::EqEq,
1343            TokenKind::Ne,
1344            TokenKind::LtGt,
1345            TokenKind::Concat,
1346            TokenKind::Arrow,
1347            TokenKind::DoubleArrow,
1348            TokenKind::Eof,
1349        ];
1350        assert_eq!(tokens, expected);
1351    }
1352
1353    #[test]
1354    fn test_lex_eq_vs_eqeq() {
1355        let tokens = kinds("= ==");
1356        assert_eq!(tokens[0], TokenKind::Eq);
1357        assert_eq!(tokens[1], TokenKind::EqEq);
1358    }
1359
1360    #[test]
1361    fn test_lex_ne_vs_ltgt() {
1362        let tokens = kinds("!= <>");
1363        assert_eq!(tokens[0], TokenKind::Ne);
1364        assert_eq!(tokens[1], TokenKind::LtGt);
1365    }
1366
1367    #[test]
1368    fn test_lex_error_unterminated_string() {
1369        let tokens = kinds("'hello");
1370        assert!(matches!(tokens[0], TokenKind::Error(_)));
1371    }
1372
1373    #[test]
1374    fn test_lex_line_column_tracking() {
1375        let tokens = lex("SELECT\n  a,\n  b");
1376        assert_eq!(tokens[0].line, 1);
1377        assert_eq!(tokens[0].col, 1);
1378        // 'a' is on line 2, col 3
1379        assert_eq!(tokens[1].line, 2);
1380        assert_eq!(tokens[1].col, 3);
1381        // ',' is on line 2, col 4
1382        assert_eq!(tokens[2].line, 2);
1383        assert_eq!(tokens[2].col, 4);
1384        // 'b' is on line 3, col 3
1385        assert_eq!(tokens[3].line, 3);
1386        assert_eq!(tokens[3].col, 3);
1387    }
1388
1389    #[test]
1390    fn test_lex_whitespace_and_comments_skipped() {
1391        let tokens = kinds("SELECT -- this is a comment\n  a /* block */ FROM b");
1392        assert_eq!(tokens[0], TokenKind::KwSelect);
1393        assert_eq!(tokens[1], TokenKind::Id("a".into()));
1394        assert_eq!(tokens[2], TokenKind::KwFrom);
1395        assert_eq!(tokens[3], TokenKind::Id("b".into()));
1396        assert_eq!(tokens[4], TokenKind::Eof);
1397    }
1398
1399    #[test]
1400    fn test_lex_hex_large_values() {
1401        // C SQLite parses hex as u64 and memcpy to i64.
1402        // 0xFFFFFFFFFFFFFFFF = u64::MAX → i64 -1.
1403        let tokens = kinds("0xFFFFFFFFFFFFFFFF");
1404        assert_eq!(tokens[0], TokenKind::Integer(-1));
1405
1406        // 0x8000000000000000 = i64::MIN.
1407        let tokens = kinds("0x8000000000000000");
1408        assert_eq!(tokens[0], TokenKind::Integer(i64::MIN));
1409
1410        // 0x7FFFFFFFFFFFFFFF = i64::MAX.
1411        let tokens = kinds("0x7FFFFFFFFFFFFFFF");
1412        assert_eq!(tokens[0], TokenKind::Integer(i64::MAX));
1413    }
1414
1415    #[test]
1416    fn test_lex_hex_overflow_17_digits_rejects() {
1417        // 0x10000000000000000 has 17 significant hex digits → must error,
1418        // not silently truncate to 0.
1419        let tokens = kinds("0x10000000000000000");
1420        assert!(
1421            matches!(&tokens[0], TokenKind::Error(msg) if msg.contains("out of range")),
1422            "expected error for 17-digit hex, got {:?}",
1423            tokens[0]
1424        );
1425    }
1426
1427    #[test]
1428    fn test_lex_hex_leading_zeros_accepted() {
1429        // Leading zeros are stripped before the length check, so
1430        // 0x00000000000000001 (17 chars, 1 significant) is valid.
1431        let tokens = kinds("0x00000000000000001");
1432        assert_eq!(tokens[0], TokenKind::Integer(1));
1433    }
1434
1435    #[test]
1436    fn test_lex_number_hex() {
1437        let tokens = kinds("0x1A 0Xff 0x0");
1438        assert_eq!(tokens[0], TokenKind::Integer(26));
1439        assert_eq!(tokens[1], TokenKind::Integer(255));
1440        assert_eq!(tokens[2], TokenKind::Integer(0));
1441        assert_eq!(tokens[3], TokenKind::Eof);
1442    }
1443
1444    #[test]
1445    fn test_lex_number_unrecognized() {
1446        let tokens = kinds("123a 123.a");
1447        assert!(
1448            matches!(tokens[0], TokenKind::Error(ref e) if e.contains("unrecognized token: \"123a\""))
1449        );
1450        assert!(
1451            matches!(tokens[1], TokenKind::Error(ref e) if e.contains("unrecognized token: \"123.a\""))
1452        );
1453    }
1454
1455    #[test]
1456    fn test_lex_number_hex_invalid() {
1457        let tokens = kinds("0x");
1458        assert!(matches!(tokens[0], TokenKind::Error(_)));
1459    }
1460
1461    #[test]
1462    fn test_lex_positional_params() {
1463        let tokens = kinds("? ?123");
1464        assert_eq!(tokens[0], TokenKind::Question);
1465        assert_eq!(tokens[1], TokenKind::QuestionNum(123));
1466        assert_eq!(tokens[2], TokenKind::Eof);
1467    }
1468
1469    #[test]
1470    fn test_lex_positional_params_reject_zero_and_out_of_range() {
1471        let tokens = kinds("?0 ?32767");
1472        assert!(
1473            matches!(tokens[0], TokenKind::Error(ref e) if e.contains("between ?1 and ?32766")),
1474            "expected ?0 to be rejected, got {:?}",
1475            tokens[0]
1476        );
1477        assert!(
1478            matches!(tokens[1], TokenKind::Error(ref e) if e.contains("between ?1 and ?32766")),
1479            "expected ?32767 to be rejected, got {:?}",
1480            tokens[1]
1481        );
1482        assert_eq!(tokens[2], TokenKind::Eof);
1483    }
1484
1485    #[test]
1486    fn test_lex_named_params() {
1487        let tokens = kinds(":foo @bar $baz_123");
1488        assert_eq!(tokens[0], TokenKind::ColonParam("foo".to_owned()));
1489        assert_eq!(tokens[1], TokenKind::AtParam("bar".to_owned()));
1490        assert_eq!(tokens[2], TokenKind::DollarParam("baz_123".to_owned()));
1491        assert_eq!(tokens[3], TokenKind::Eof);
1492    }
1493
1494    #[test]
1495    fn test_lex_named_params_with_tcl_syntax() {
1496        let tokens = kinds("$::foo(bar) :a::b");
1497        assert_eq!(tokens[0], TokenKind::DollarParam("::foo(bar)".to_owned()));
1498        assert_eq!(tokens[1], TokenKind::ColonParam("a::b".to_owned()));
1499        assert_eq!(tokens[2], TokenKind::Eof);
1500    }
1501
1502    #[test]
1503    fn test_lex_named_params_with_unclosed_tcl_array_syntax() {
1504        let tokens = kinds("$::foo(bar");
1505        assert!(
1506            matches!(tokens[0], TokenKind::Error(ref e) if e.contains("unrecognized token")),
1507            "expected unterminated Tcl-style parameter to be rejected, got {:?}",
1508            tokens[0]
1509        );
1510        assert_eq!(tokens[1], TokenKind::Eof);
1511    }
1512
1513    fn histogram_total(hist: &TokenizeDurationSecondsHistogram) -> u64 {
1514        hist.le_100us + hist.le_250us + hist.le_500us + hist.le_1ms + hist.le_5ms + hist.gt_5ms
1515    }
1516
1517    #[test]
1518    fn test_tokenize_metrics_accumulate_tokens_and_histogram_samples() {
1519        let prev_metrics_enabled = tokenize_metrics_enabled();
1520        reset_tokenize_metrics();
1521        set_tokenize_metrics_enabled(true);
1522
1523        let first = lex("SELECT 1;");
1524        let second = lex("SELECT 2;");
1525
1526        let expected_total_tokens = u64::try_from(first.len() + second.len()).unwrap_or(u64::MAX);
1527        let snap = tokenize_metrics_snapshot();
1528        assert_eq!(snap.fsqlite_tokenize_tokens_total, expected_total_tokens);
1529        assert_eq!(snap.fsqlite_tokenize_duration_seconds_count, 2);
1530        assert_eq!(
1531            histogram_total(&snap.fsqlite_tokenize_duration_seconds),
1532            snap.fsqlite_tokenize_duration_seconds_count
1533        );
1534
1535        set_tokenize_metrics_enabled(prev_metrics_enabled);
1536        reset_tokenize_metrics();
1537    }
1538
1539    #[test]
1540    fn test_tokenize_metrics_reset_clears_all_fields() {
1541        let prev_metrics_enabled = tokenize_metrics_enabled();
1542        reset_tokenize_metrics();
1543        set_tokenize_metrics_enabled(true);
1544        let _ = lex("SELECT 42;");
1545
1546        let before = tokenize_metrics_snapshot();
1547        assert!(before.fsqlite_tokenize_tokens_total > 0);
1548        assert!(before.fsqlite_tokenize_duration_seconds_count > 0);
1549
1550        reset_tokenize_metrics();
1551        let after = tokenize_metrics_snapshot();
1552        assert_eq!(after.fsqlite_tokenize_tokens_total, 0);
1553        assert_eq!(after.fsqlite_tokenize_duration_seconds_count, 0);
1554        assert_eq!(after.fsqlite_tokenize_duration_seconds_sum_micros, 0);
1555        assert_eq!(histogram_total(&after.fsqlite_tokenize_duration_seconds), 0);
1556
1557        set_tokenize_metrics_enabled(prev_metrics_enabled);
1558    }
1559
1560    #[test]
1561    fn test_tokenize_metrics_can_be_disabled_off_hot_path() {
1562        let prev_metrics_enabled = tokenize_metrics_enabled();
1563        reset_tokenize_metrics();
1564        set_tokenize_metrics_enabled(false);
1565
1566        let _ = lex("SELECT 99;");
1567
1568        let snap = tokenize_metrics_snapshot();
1569        assert_eq!(snap.fsqlite_tokenize_tokens_total, 0);
1570        assert_eq!(snap.fsqlite_tokenize_duration_seconds_count, 0);
1571        assert_eq!(snap.fsqlite_tokenize_duration_seconds_sum_micros, 0);
1572        assert_eq!(histogram_total(&snap.fsqlite_tokenize_duration_seconds), 0);
1573
1574        set_tokenize_metrics_enabled(prev_metrics_enabled);
1575        reset_tokenize_metrics();
1576    }
1577}