1use fsqlite_ast::Span;
7use fsqlite_types::limits::MAX_VARIABLE_NUMBER;
8use fsqlite_types::sync_primitives::Instant;
9use hashbrown::HashSet;
10use memchr::memchr;
11use std::sync::Arc;
12use std::sync::atomic::{AtomicBool, AtomicU64, Ordering};
13use tracing::Level;
14
15use crate::token::{Token, TokenKind};
16
17#[derive(Debug, Clone, Copy, PartialEq, Eq, Default)]
19pub struct TokenizeDurationSecondsHistogram {
20 pub le_100us: u64,
22 pub le_250us: u64,
24 pub le_500us: u64,
26 pub le_1ms: u64,
28 pub le_5ms: u64,
30 pub gt_5ms: u64,
32}
33
34#[derive(Debug, Clone, Copy, PartialEq, Eq, Default)]
36pub struct TokenizeMetricsSnapshot {
37 pub fsqlite_tokenize_tokens_total: u64,
39 pub fsqlite_tokenize_duration_seconds: TokenizeDurationSecondsHistogram,
41 pub fsqlite_tokenize_duration_seconds_count: u64,
43 pub fsqlite_tokenize_duration_seconds_sum_micros: u64,
45}
46
47static FSQLITE_TOKENIZE_TOKENS_TOTAL: AtomicU64 = AtomicU64::new(0);
48static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US: AtomicU64 = AtomicU64::new(0);
49static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US: AtomicU64 = AtomicU64::new(0);
50static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US: AtomicU64 = AtomicU64::new(0);
51static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS: AtomicU64 = AtomicU64::new(0);
52static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS: AtomicU64 = AtomicU64::new(0);
53static FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS: AtomicU64 = AtomicU64::new(0);
54static FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT: AtomicU64 = AtomicU64::new(0);
55static FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS: AtomicU64 = AtomicU64::new(0);
56static FSQLITE_TOKENIZE_METRICS_ENABLED: AtomicBool = AtomicBool::new(false);
57
58fn saturating_u64_from_usize(value: usize) -> u64 {
59 u64::try_from(value).unwrap_or(u64::MAX)
60}
61
62fn saturating_u64_from_u128(value: u128) -> u64 {
63 u64::try_from(value).unwrap_or(u64::MAX)
64}
65
66fn record_tokenize_metrics(token_count: usize, elapsed_micros: u64) {
67 FSQLITE_TOKENIZE_TOKENS_TOTAL
68 .fetch_add(saturating_u64_from_usize(token_count), Ordering::Relaxed);
69 FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT.fetch_add(1, Ordering::Relaxed);
70 FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS.fetch_add(elapsed_micros, Ordering::Relaxed);
71
72 let bucket = match elapsed_micros {
73 0..=100 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US,
74 101..=250 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US,
75 251..=500 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US,
76 501..=1_000 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS,
77 1_001..=5_000 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS,
78 _ => &FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS,
79 };
80 bucket.fetch_add(1, Ordering::Relaxed);
81}
82
83#[must_use]
85pub fn tokenize_metrics_snapshot() -> TokenizeMetricsSnapshot {
86 TokenizeMetricsSnapshot {
87 fsqlite_tokenize_tokens_total: FSQLITE_TOKENIZE_TOKENS_TOTAL.load(Ordering::Relaxed),
88 fsqlite_tokenize_duration_seconds: TokenizeDurationSecondsHistogram {
89 le_100us: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US.load(Ordering::Relaxed),
90 le_250us: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US.load(Ordering::Relaxed),
91 le_500us: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US.load(Ordering::Relaxed),
92 le_1ms: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS.load(Ordering::Relaxed),
93 le_5ms: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS.load(Ordering::Relaxed),
94 gt_5ms: FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS.load(Ordering::Relaxed),
95 },
96 fsqlite_tokenize_duration_seconds_count: FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT
97 .load(Ordering::Relaxed),
98 fsqlite_tokenize_duration_seconds_sum_micros: FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS
99 .load(Ordering::Relaxed),
100 }
101}
102
103pub fn set_tokenize_metrics_enabled(enabled: bool) {
105 FSQLITE_TOKENIZE_METRICS_ENABLED.store(enabled, Ordering::Relaxed);
106}
107
108#[must_use]
110pub fn tokenize_metrics_enabled() -> bool {
111 FSQLITE_TOKENIZE_METRICS_ENABLED.load(Ordering::Relaxed)
112}
113
114pub fn reset_tokenize_metrics() {
116 FSQLITE_TOKENIZE_TOKENS_TOTAL.store(0, Ordering::Relaxed);
117 FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US.store(0, Ordering::Relaxed);
118 FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US.store(0, Ordering::Relaxed);
119 FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US.store(0, Ordering::Relaxed);
120 FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS.store(0, Ordering::Relaxed);
121 FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS.store(0, Ordering::Relaxed);
122 FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS.store(0, Ordering::Relaxed);
123 FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT.store(0, Ordering::Relaxed);
124 FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS.store(0, Ordering::Relaxed);
125}
126
127const MAX_RETAINED_IDENTIFIER_INTERNER_ENTRIES: usize = 256;
129const MAX_RETAINED_IDENTIFIER_INTERNER_BYTES: usize = 16 * 1024;
130
131thread_local! {
132 static FSQLITE_FORCE_INTERNER_SCAN_BENCH: std::cell::Cell<bool> =
136 const { std::cell::Cell::new(false) };
137}
138
139pub fn set_force_interner_scan_bench(enabled: bool) {
144 FSQLITE_FORCE_INTERNER_SCAN_BENCH.with(|c| c.set(enabled));
145}
146
147#[derive(Debug, Default)]
149pub(crate) struct IdentifierInterner {
150 values: HashSet<Arc<str>>,
151 interned_bytes: usize,
156}
157
158impl IdentifierInterner {
159 fn intern(&mut self, value: &str) -> Arc<str> {
160 if let Some(existing) = self.values.get(value) {
161 return Arc::clone(existing);
162 }
163
164 let interned: Arc<str> = Arc::from(value);
165 let inserted = Arc::clone(&interned);
166 self.values.insert(interned);
167 self.interned_bytes = self.interned_bytes.saturating_add(value.len());
168 inserted
169 }
170
171 pub(crate) fn reset(&mut self) {
172 self.values = HashSet::new();
173 self.interned_bytes = 0;
174 }
175
176 pub(crate) fn retained_bytes(&self) -> usize {
177 let interned_value_bytes = if FSQLITE_FORCE_INTERNER_SCAN_BENCH.with(std::cell::Cell::get) {
181 self.values
182 .iter()
183 .fold(0usize, |sum, value| sum.saturating_add(value.len()))
184 } else {
185 self.interned_bytes
186 };
187 self.values
188 .capacity()
189 .saturating_mul(std::mem::size_of::<Arc<str>>())
190 .saturating_add(interned_value_bytes)
191 }
192
193 pub(crate) fn prepare_for_next_parse(&mut self) {
194 if self.values.len() > MAX_RETAINED_IDENTIFIER_INTERNER_ENTRIES
195 || self.retained_bytes() > MAX_RETAINED_IDENTIFIER_INTERNER_BYTES
196 {
197 self.reset();
198 }
199 }
200
201 #[cfg(test)]
202 pub(crate) fn is_empty(&self) -> bool {
203 self.values.is_empty()
204 }
205
206 #[cfg(test)]
207 pub(crate) fn len(&self) -> usize {
208 self.values.len()
209 }
210}
211
212pub struct Lexer<'a> {
214 src: &'a [u8],
216 pos: usize,
218 line: u32,
220 col: u32,
222 trace_chars: bool,
224 interner: IdentifierInterner,
226}
227
228impl<'a> Lexer<'a> {
229 fn log_token(token: &Token) {
230 tracing::debug!(
231 target: "fsqlite.parse",
232 token = ?token.kind,
233 start = token.span.start,
234 end = token.span.end,
235 line = token.line,
236 col = token.col,
237 "tokenized token"
238 );
239 }
240
241 #[must_use]
243 pub fn new(source: &'a str) -> Self {
244 Self {
245 src: source.as_bytes(),
246 pos: 0,
247 line: 1,
248 col: 1,
249 trace_chars: tracing::enabled!(target: "fsqlite.parse", Level::TRACE),
250 interner: IdentifierInterner::default(),
251 }
252 }
253
254 #[must_use]
256 pub fn tokenize(source: &'a str) -> Vec<Token> {
257 let mut tokens = Vec::new();
258 Self::tokenize_into(source, &mut tokens);
259 tokens
260 }
261
262 fn new_with_interner(source: &'a str, interner: IdentifierInterner) -> Self {
263 Self {
264 src: source.as_bytes(),
265 pos: 0,
266 line: 1,
267 col: 1,
268 trace_chars: tracing::enabled!(target: "fsqlite.parse", Level::TRACE),
269 interner,
270 }
271 }
272
273 pub fn tokenize_into(source: &'a str, tokens: &mut Vec<Token>) {
279 let mut interner = IdentifierInterner::default();
280 Self::tokenize_into_with_interner(source, tokens, &mut interner);
281 }
282
283 pub(crate) fn tokenize_into_with_interner(
284 source: &'a str,
285 tokens: &mut Vec<Token>,
286 interner: &mut IdentifierInterner,
287 ) {
288 let input_bytes = source.len();
289 let collect_tokenize_metrics = tokenize_metrics_enabled();
290 let trace_tokenize = tracing::enabled!(target: "fsqlite.parse", Level::TRACE);
291 let span = trace_tokenize.then(|| {
292 tracing::span!(
293 target: "fsqlite.parse",
294 Level::TRACE,
295 "tokenize",
296 token_count = tracing::field::Empty,
297 input_bytes,
298 elapsed_us = tracing::field::Empty,
299 )
300 });
301 let _guard = span.as_ref().map(|span| span.enter());
302 let started = (collect_tokenize_metrics || trace_tokenize).then(Instant::now);
303
304 let mut lexer = Self::new_with_interner(source, std::mem::take(interner));
305 let target_capacity = input_bytes / 4 + 1;
306 tokens.clear();
307 if target_capacity > tokens.capacity() {
308 tokens.reserve(target_capacity - tokens.capacity());
309 }
310 loop {
311 let tok = lexer.next_token();
312 let is_eof = tok.kind == TokenKind::Eof;
313 tokens.push(tok);
314 if is_eof {
315 break;
316 }
317 }
318
319 *interner = lexer.interner;
320
321 if let Some(started) = started {
322 let elapsed_us = saturating_u64_from_u128(started.elapsed().as_micros());
323 if let Some(span) = span.as_ref() {
324 span.record("token_count", saturating_u64_from_usize(tokens.len()));
325 span.record("elapsed_us", elapsed_us);
326 }
327 if collect_tokenize_metrics {
328 record_tokenize_metrics(tokens.len(), elapsed_us);
329 }
330 }
331 }
332
333 #[must_use]
335 pub fn metrics_snapshot() -> TokenizeMetricsSnapshot {
336 tokenize_metrics_snapshot()
337 }
338
339 pub fn reset_metrics() {
341 reset_tokenize_metrics();
342 }
343
344 pub fn next_token(&mut self) -> Token {
346 self.skip_whitespace_and_comments();
347
348 if self.pos >= self.src.len() {
349 let token = self.make_token(TokenKind::Eof, self.pos, self.pos);
350 Self::log_token(&token);
351 return token;
352 }
353
354 let start = self.pos;
355 let start_line = self.line;
356 let start_col = self.col;
357 let ch = self.src[self.pos];
358
359 let kind = match ch {
360 b'\'' => self.lex_string(),
362
363 b'"' => self.lex_double_quoted_id(),
365
366 b'`' => self.lex_backtick_id(),
368
369 b'[' => self.lex_bracket_id(),
371
372 b'X' | b'x' if self.peek_at(1) == Some(b'\'') => self.lex_blob(),
374
375 b'0'..=b'9' => self.lex_number(),
377 b'.' if self.peek_at(1).is_some_and(|c| c.is_ascii_digit()) => self.lex_number(),
378
379 b'a'..=b'z' | b'A'..=b'Z' | b'_' | 0x80..=0xFF => self.lex_identifier(),
381
382 b'?' => self.lex_question(),
384 b':' => self.lex_colon_param(),
385 b'@' => self.lex_at_param(),
386 b'$' => self.lex_dollar_param(),
387
388 b'+' => {
390 self.advance();
391 TokenKind::Plus
392 }
393 b'*' => {
394 self.advance();
395 TokenKind::Star
396 }
397 b'/' => {
398 self.advance();
399 TokenKind::Slash
400 }
401 b'%' => {
402 self.advance();
403 TokenKind::Percent
404 }
405 b'&' => {
406 self.advance();
407 TokenKind::Ampersand
408 }
409 b'~' => {
410 self.advance();
411 TokenKind::Tilde
412 }
413 b',' => {
414 self.advance();
415 TokenKind::Comma
416 }
417 b';' => {
418 self.advance();
419 TokenKind::Semicolon
420 }
421 b'(' => {
422 self.advance();
423 TokenKind::LeftParen
424 }
425 b')' => {
426 self.advance();
427 TokenKind::RightParen
428 }
429 b'.' => {
430 self.advance();
431 TokenKind::Dot
432 }
433
434 b'-' => self.lex_minus_or_arrow(),
436 b'<' => self.lex_lt(),
437 b'>' => self.lex_gt(),
438 b'=' => self.lex_eq(),
439 b'!' => self.lex_bang(),
440 b'|' => self.lex_pipe(),
441
442 _ => {
443 self.advance();
444 let s = String::from_utf8_lossy(&self.src[start..self.pos]).into_owned();
445 TokenKind::Error(format!("unexpected character: {s}"))
446 }
447 };
448
449 let token = Token {
450 kind,
451 #[allow(clippy::cast_possible_truncation)]
452 span: Span::new(start as u32, self.pos as u32),
453 line: start_line,
454 col: start_col,
455 };
456
457 Self::log_token(&token);
458 token
459 }
460
461 #[allow(clippy::cast_possible_truncation)]
466 fn advance_by(&mut self, n: usize) {
467 if n == 0 {
468 return;
469 }
470 let end = self.pos + n;
471 let slice = &self.src[self.pos..end];
472 #[allow(clippy::naive_bytecount)]
473 let newlines = slice.iter().filter(|&&b| b == b'\n').count();
474 if newlines > 0 {
475 self.line += newlines as u32;
476 let last_nl = slice.iter().rposition(|&b| b == b'\n').unwrap_or(0);
477 self.col = (n - last_nl) as u32;
478 } else {
479 self.col += n as u32;
480 }
481 self.pos = end;
482 }
483
484 fn advance(&mut self) -> u8 {
485 let pos = self.pos;
486 let line = self.line;
487 let col = self.col;
488 let ch = self.src[self.pos];
489 self.pos += 1;
490 if ch == b'\n' {
491 self.line += 1;
492 self.col = 1;
493 } else {
494 self.col += 1;
495 }
496 if self.trace_chars {
497 tracing::trace!(
498 target: "fsqlite.parse",
499 byte = ch,
500 pos,
501 line,
502 col,
503 "tokenize char"
504 );
505 }
506 ch
507 }
508
509 fn peek(&self) -> Option<u8> {
510 self.src.get(self.pos).copied()
511 }
512
513 fn peek_at(&self, offset: usize) -> Option<u8> {
514 self.src.get(self.pos + offset).copied()
515 }
516
517 #[allow(clippy::cast_possible_truncation)]
518 fn make_token(&self, kind: TokenKind, start: usize, end: usize) -> Token {
519 Token {
520 kind,
521 span: Span::new(start as u32, end as u32),
522 line: self.line,
523 col: self.col,
524 }
525 }
526
527 fn skip_whitespace_and_comments(&mut self) {
529 loop {
530 let mut ws_len = 0;
532 while self.pos + ws_len < self.src.len()
533 && self.src[self.pos + ws_len].is_ascii_whitespace()
534 {
535 ws_len += 1;
536 }
537 if ws_len > 0 {
538 self.advance_by(ws_len);
539 }
540
541 if self.pos >= self.src.len() {
542 break;
543 }
544
545 if self.src[self.pos] == b'-' && self.peek_at(1) == Some(b'-') {
547 self.advance(); self.advance(); while self.pos < self.src.len() && self.src[self.pos] != b'\n' {
550 self.advance();
551 }
552 continue;
553 }
554
555 if self.src[self.pos] == b'/' && self.peek_at(1) == Some(b'*') {
557 self.advance(); self.advance(); let closed = loop {
560 if self.pos >= self.src.len() {
561 break false;
562 }
563 if self.src[self.pos] == b'*' && self.peek_at(1) == Some(b'/') {
564 self.advance();
565 self.advance();
566 break true;
567 }
568 self.advance();
569 };
570 if !closed {
571 self.pos = self.src.len();
573 }
574 continue;
575 }
576
577 break;
578 }
579 }
580
581 fn lex_string(&mut self) -> TokenKind {
586 let start = self.pos;
587 self.advance(); let mut value = String::new();
590 loop {
591 let remaining = &self.src[self.pos..];
593 if let Some(offset) = memchr(b'\'', remaining) {
594 value.push_str(&String::from_utf8_lossy(
596 &self.src[self.pos..self.pos + offset],
597 ));
598 self.advance_by(offset);
600 self.advance(); if self.peek() == Some(b'\'') {
604 value.push('\'');
605 self.advance();
606 } else {
607 return TokenKind::String(value);
608 }
609 } else {
610 self.pos = self.src.len();
612 return TokenKind::Error(format!(
613 "unterminated string literal starting at byte {}",
614 start
615 ));
616 }
617 }
618 }
619
620 fn lex_double_quoted_id(&mut self) -> TokenKind {
622 let start = self.pos;
623 self.advance(); let mut value = String::new();
626 loop {
627 let remaining = &self.src[self.pos..];
628 if let Some(offset) = memchr(b'"', remaining) {
629 value.push_str(&String::from_utf8_lossy(
630 &self.src[self.pos..self.pos + offset],
631 ));
632 self.advance_by(offset);
633 self.advance(); if self.peek() == Some(b'"') {
637 value.push('"');
638 self.advance();
639 } else {
640 return TokenKind::QuotedId(self.interner.intern(&value), true);
641 }
642 } else {
643 self.pos = self.src.len();
644 return TokenKind::Error(format!(
645 "unterminated double-quoted identifier at byte {}",
646 start
647 ));
648 }
649 }
650 }
651
652 fn lex_backtick_id(&mut self) -> TokenKind {
654 let start = self.pos;
655 self.advance(); let mut value = String::new();
658 loop {
659 let remaining = &self.src[self.pos..];
660 if let Some(offset) = memchr(b'`', remaining) {
661 value.push_str(&String::from_utf8_lossy(
662 &self.src[self.pos..self.pos + offset],
663 ));
664 self.advance_by(offset);
665 self.advance(); if self.peek() == Some(b'`') {
668 value.push('`');
669 self.advance();
670 } else {
671 return TokenKind::QuotedId(self.interner.intern(&value), false);
672 }
673 } else {
674 self.pos = self.src.len();
675 return TokenKind::Error(format!(
676 "unterminated backtick identifier at byte {}",
677 start
678 ));
679 }
680 }
681 }
682
683 fn lex_bracket_id(&mut self) -> TokenKind {
685 let start = self.pos;
686 self.advance(); let mut value = String::new();
689 let remaining = &self.src[self.pos..];
690 if let Some(offset) = memchr(b']', remaining) {
691 value.push_str(&String::from_utf8_lossy(
692 &self.src[self.pos..self.pos + offset],
693 ));
694 self.advance_by(offset);
695 self.advance(); TokenKind::QuotedId(self.interner.intern(&value), false)
697 } else {
698 self.pos = self.src.len();
699 TokenKind::Error(format!("unterminated bracket identifier at byte {}", start))
700 }
701 }
702
703 fn lex_blob(&mut self) -> TokenKind {
705 let start = self.pos;
706 self.advance(); self.advance(); let hex_start = self.pos;
710 let remaining = &self.src[self.pos..];
711 if let Some(offset) = memchr(b'\'', remaining) {
712 let hex_bytes = &self.src[hex_start..hex_start + offset];
713 self.advance_by(offset);
714 self.advance(); if !hex_bytes.len().is_multiple_of(2) {
718 return TokenKind::Error(format!(
719 "blob literal has odd number of hex digits at byte {}",
720 start
721 ));
722 }
723
724 let mut bytes = Vec::with_capacity(hex_bytes.len() / 2);
727 for &[hi, lo] in hex_bytes.as_chunks::<2>().0 {
728 let hi = hex_digit(hi);
729 let lo = hex_digit(lo);
730 match (hi, lo) {
731 (Some(h), Some(l)) => bytes.push((h << 4) | l),
732 _ => {
733 return TokenKind::Error(format!(
734 "invalid hex in blob literal at byte {start}"
735 ));
736 }
737 }
738 }
739 TokenKind::Blob(bytes)
740 } else {
741 self.pos = self.src.len();
742 TokenKind::Error(format!("unterminated blob literal at byte {}", start))
743 }
744 }
745
746 fn lex_number(&mut self) -> TokenKind {
748 let start = self.pos;
749
750 if self.src[self.pos] == b'0' && self.peek_at(1).is_some_and(|c| c == b'x' || c == b'X') {
752 self.advance(); self.advance(); let hex_start = self.pos;
755 while self.pos < self.src.len() {
760 let c = self.src[self.pos];
761 let is_separator = c == b'_'
762 && self.pos > hex_start
763 && self.src[self.pos - 1].is_ascii_hexdigit()
764 && self.peek_at(1).is_some_and(|n| n.is_ascii_hexdigit());
765 if c.is_ascii_hexdigit() || is_separator {
766 self.advance();
767 } else {
768 break;
769 }
770 }
771 if self.pos == hex_start {
772 return TokenKind::Error("empty hex literal".to_owned());
773 }
774 if self
778 .peek()
779 .is_some_and(|n| n.is_ascii_alphanumeric() || n == b'_')
780 {
781 let err_start = start;
782 while self.pos < self.src.len()
783 && (self.src[self.pos].is_ascii_alphanumeric() || self.src[self.pos] == b'_')
784 {
785 self.advance();
786 }
787 let err_text = String::from_utf8_lossy(&self.src[err_start..self.pos]);
788 return TokenKind::Error(format!("unrecognized token: \"{err_text}\""));
789 }
790 let hex_str = String::from_utf8_lossy(&self.src[hex_start..self.pos]).replace('_', "");
791 let significant = hex_str.trim_start_matches('0');
795 if significant.len() > 16 {
796 return TokenKind::Error(format!("hex literal out of range at byte {start}"));
797 }
798 let parse_str = if significant.is_empty() {
799 "0"
800 } else {
801 significant
802 };
803 return match u64::from_str_radix(parse_str, 16) {
806 Ok(v) => {
807 #[allow(clippy::cast_possible_wrap)]
808 let i = v as i64;
809 TokenKind::Integer(i)
810 }
811 Err(_) => TokenKind::Error(format!("hex literal out of range at byte {start}")),
812 };
813 }
814
815 let mut is_float = false;
817
818 self.consume_decimal_digit_run();
821
822 let is_valid_exponent = |lexer: &Self, mut offset: usize| -> bool {
824 if let Some(c) = lexer.peek_at(offset)
825 && (c == b'e' || c == b'E')
826 {
827 offset += 1;
828 if let Some(s) = lexer.peek_at(offset)
829 && (s == b'+' || s == b'-')
830 {
831 offset += 1;
832 }
833 if let Some(d) = lexer.peek_at(offset) {
834 return d.is_ascii_digit();
835 }
836 }
837 false
838 };
839
840 if self.pos < self.src.len()
842 && self.src[self.pos] == b'.'
843 && (self.peek_at(1).is_some_and(|c| c.is_ascii_digit()) || is_valid_exponent(self, 1))
844 {
845 is_float = true;
846 self.advance(); self.consume_decimal_digit_run();
848 } else if self.pos < self.src.len()
849 && self.src[self.pos] == b'.'
850 && start < self.pos && !self.peek_at(1).is_some_and(|c| c.is_ascii_alphanumeric() || c == b'_')
852 {
853 is_float = true;
855 self.advance(); }
857
858 if self.src[start] == b'.' {
860 is_float = true;
861 }
862
863 if is_valid_exponent(self, 0) {
865 is_float = true;
866 self.advance(); if self.pos < self.src.len()
868 && (self.src[self.pos] == b'+' || self.src[self.pos] == b'-')
869 {
870 self.advance();
871 }
872 self.consume_decimal_digit_run();
873 }
874
875 if let Some(c) = self.peek()
878 && (c.is_ascii_alphabetic()
879 || c == b'_'
880 || (c == b'.'
881 && self
882 .peek_at(1)
883 .is_some_and(|n| n.is_ascii_alphabetic() || n == b'_')))
884 {
885 let err_start = start;
886 while self.pos < self.src.len() {
887 let ch = self.src[self.pos];
888 if ch.is_ascii_alphanumeric() || ch == b'_' || ch == b'.' {
889 self.advance();
890 } else {
891 break;
892 }
893 }
894 let err_text = String::from_utf8_lossy(&self.src[err_start..self.pos]);
895 return TokenKind::Error(format!("unrecognized token: \"{err_text}\""));
896 }
897
898 let text_raw = String::from_utf8_lossy(&self.src[start..self.pos]);
899 let text: std::borrow::Cow<'_, str> = if text_raw.as_ref().contains('_') {
902 std::borrow::Cow::Owned(text_raw.replace('_', ""))
903 } else {
904 text_raw
905 };
906 if is_float {
907 match text.parse::<f64>() {
910 Ok(v) => TokenKind::Float(v),
911 Err(_) => {
912 let mut text_fixed = text.clone().into_owned();
914 if text_fixed.starts_with(".e") || text_fixed.starts_with(".E") {
915 text_fixed.insert(0, '0');
916 }
917 match text_fixed.parse::<f64>() {
918 Ok(v) => TokenKind::Float(v),
919 Err(_) => TokenKind::Error(format!("invalid float: {text}")),
920 }
921 }
922 }
923 } else {
924 match text.parse::<i64>() {
925 Ok(v) => TokenKind::Integer(v),
926 Err(_) => {
927 TokenKind::OversizedInt(text.into_owned())
930 }
931 }
932 }
933 }
934
935 fn consume_decimal_digit_run(&mut self) {
941 while self.pos < self.src.len() {
942 let c = self.src[self.pos];
943 let is_separator = c == b'_'
944 && self.pos > 0
945 && self.src[self.pos - 1].is_ascii_digit()
946 && self.peek_at(1).is_some_and(|n| n.is_ascii_digit());
947 if c.is_ascii_digit() || is_separator {
948 self.advance();
949 } else {
950 break;
951 }
952 }
953 }
954
955 fn lex_identifier(&mut self) -> TokenKind {
957 let start = self.pos;
958 self.advance(); while self.pos < self.src.len() {
961 let ch = self.src[self.pos];
962 if ch.is_ascii_alphanumeric() || ch == b'_' || ch >= 0x80 {
963 self.advance();
964 } else {
965 break;
966 }
967 }
968
969 let ident_bytes = &self.src[start..self.pos];
970
971 if let Some(kw) = TokenKind::lookup_keyword_bytes(ident_bytes) {
973 kw
974 } else {
975 let text = String::from_utf8_lossy(ident_bytes);
976 TokenKind::Id(self.interner.intern(&text))
977 }
978 }
979
980 fn lex_question(&mut self) -> TokenKind {
982 self.advance(); if self.pos < self.src.len() && self.src[self.pos].is_ascii_digit() {
984 let num_start = self.pos;
985 while self.pos < self.src.len() && self.src[self.pos].is_ascii_digit() {
986 self.advance();
987 }
988 let text = String::from_utf8_lossy(&self.src[num_start..self.pos]);
989 match text.parse::<u32>() {
990 Ok(n) if (1..=MAX_VARIABLE_NUMBER).contains(&n) => TokenKind::QuestionNum(n),
991 Ok(n) => TokenKind::Error(format!(
992 "variable number must be between ?1 and ?{MAX_VARIABLE_NUMBER}, got ?{n}"
993 )),
994 Err(_) => TokenKind::Error("invalid parameter number".to_owned()),
995 }
996 } else {
997 TokenKind::Question
998 }
999 }
1000
1001 fn lex_alpha_param(&mut self, prefix: char, constructor: fn(String) -> TokenKind) -> TokenKind {
1002 self.advance(); let name_start = self.pos;
1004 while self.pos < self.src.len() {
1005 let ch = self.src[self.pos];
1006 if ch.is_ascii_alphanumeric() || ch == b'_' || ch >= 0x80 {
1007 self.advance();
1008 } else if ch == b':' && self.peek_at(1) == Some(b':') {
1009 self.advance();
1010 self.advance();
1011 } else if ch == b'(' {
1012 self.advance();
1013 while self.pos < self.src.len() && self.src[self.pos] != b')' {
1014 self.advance();
1015 }
1016 if self.pos >= self.src.len() || self.src[self.pos] != b')' {
1017 let name = String::from_utf8_lossy(&self.src[name_start..self.pos]);
1018 return TokenKind::Error(format!("unrecognized token: \"{prefix}{name}\""));
1019 }
1020 self.advance();
1021 break; } else {
1023 break;
1024 }
1025 }
1026 if self.pos == name_start {
1027 return TokenKind::Error(format!("empty parameter name after '{prefix}'"));
1028 }
1029 let name = String::from_utf8_lossy(&self.src[name_start..self.pos]).into_owned();
1030 constructor(name)
1031 }
1032
1033 fn lex_colon_param(&mut self) -> TokenKind {
1035 self.lex_alpha_param(':', TokenKind::ColonParam)
1036 }
1037
1038 fn lex_at_param(&mut self) -> TokenKind {
1040 self.lex_alpha_param('@', TokenKind::AtParam)
1041 }
1042
1043 fn lex_dollar_param(&mut self) -> TokenKind {
1045 self.lex_alpha_param('$', TokenKind::DollarParam)
1046 }
1047
1048 fn lex_minus_or_arrow(&mut self) -> TokenKind {
1054 self.advance(); if self.peek() == Some(b'>') {
1056 self.advance(); if self.peek() == Some(b'>') {
1058 self.advance(); TokenKind::DoubleArrow
1060 } else {
1061 TokenKind::Arrow
1062 }
1063 } else {
1064 TokenKind::Minus
1065 }
1066 }
1067
1068 fn lex_lt(&mut self) -> TokenKind {
1070 self.advance(); match self.peek() {
1072 Some(b'=') => {
1073 self.advance();
1074 TokenKind::Le
1075 }
1076 Some(b'>') => {
1077 self.advance();
1078 TokenKind::LtGt
1079 }
1080 Some(b'<') => {
1081 self.advance();
1082 TokenKind::ShiftLeft
1083 }
1084 _ => TokenKind::Lt,
1085 }
1086 }
1087
1088 fn lex_gt(&mut self) -> TokenKind {
1090 self.advance(); match self.peek() {
1092 Some(b'=') => {
1093 self.advance();
1094 TokenKind::Ge
1095 }
1096 Some(b'>') => {
1097 self.advance();
1098 TokenKind::ShiftRight
1099 }
1100 _ => TokenKind::Gt,
1101 }
1102 }
1103
1104 fn lex_eq(&mut self) -> TokenKind {
1106 self.advance(); if self.peek() == Some(b'=') {
1108 self.advance();
1109 TokenKind::EqEq
1110 } else {
1111 TokenKind::Eq
1112 }
1113 }
1114
1115 fn lex_bang(&mut self) -> TokenKind {
1117 self.advance(); if self.peek() == Some(b'=') {
1119 self.advance();
1120 TokenKind::Ne
1121 } else {
1122 TokenKind::Error("unexpected '!', did you mean '!='?".to_owned())
1123 }
1124 }
1125
1126 fn lex_pipe(&mut self) -> TokenKind {
1128 self.advance(); if self.peek() == Some(b'|') {
1130 self.advance();
1131 TokenKind::Concat
1132 } else {
1133 TokenKind::Pipe
1134 }
1135 }
1136}
1137
1138const fn hex_digit(b: u8) -> Option<u8> {
1141 match b {
1142 b'0'..=b'9' => Some(b - b'0'),
1143 b'a'..=b'f' => Some(b - b'a' + 10),
1144 b'A'..=b'F' => Some(b - b'A' + 10),
1145 _ => None,
1146 }
1147}
1148
1149#[cfg(test)]
1150mod tests {
1151 use super::*;
1152
1153 #[test]
1154 fn interner_incremental_bytes_equals_fold() {
1155 let mut interner = IdentifierInterner::default();
1159 for v in ["alpha", "beta", "gamma", "alpha", "delta", "beta"] {
1160 interner.intern(v);
1161 }
1162 assert_eq!(interner.interned_bytes, 19);
1164 set_force_interner_scan_bench(false);
1165 let incremental = interner.retained_bytes();
1166 set_force_interner_scan_bench(true);
1167 let folded = interner.retained_bytes();
1168 set_force_interner_scan_bench(false);
1169 assert_eq!(
1170 incremental, folded,
1171 "incremental retained_bytes must equal the O(N) fold"
1172 );
1173 interner.reset();
1174 assert_eq!(interner.interned_bytes, 0);
1175 assert_eq!(interner.retained_bytes(), 0);
1176 }
1177
1178 fn lex(src: &str) -> Vec<Token> {
1179 Lexer::tokenize(src)
1180 }
1181
1182 fn kinds(src: &str) -> Vec<TokenKind> {
1183 lex(src).into_iter().map(|t| t.kind).collect()
1184 }
1185
1186 #[test]
1187 fn test_lex_integer_literals() {
1188 let tokens = kinds("42 0 0xFF");
1189 assert_eq!(
1190 tokens,
1191 vec![
1192 TokenKind::Integer(42),
1193 TokenKind::Integer(0),
1194 TokenKind::Integer(255),
1195 TokenKind::Eof,
1196 ]
1197 );
1198 }
1199
1200 #[test]
1201 fn test_tokenize_into_reuses_caller_owned_capacity() {
1202 let mut scratch = Vec::new();
1203 Lexer::tokenize_into(
1204 "SELECT 'abcdefghijklmnopqrstuvwxyzabcdefghijklmnopqrstuvwxyz';",
1205 &mut scratch,
1206 );
1207 let warmed_capacity = scratch.capacity();
1208 assert!(
1209 warmed_capacity > 0,
1210 "warm parse should allocate token scratch"
1211 );
1212
1213 Lexer::tokenize_into("SELECT 1;", &mut scratch);
1214 assert_eq!(
1215 scratch.capacity(),
1216 warmed_capacity,
1217 "smaller follow-up parse should reuse the warmed token buffer",
1218 );
1219 assert_eq!(
1220 scratch.last().map(|token| &token.kind),
1221 Some(&TokenKind::Eof),
1222 "tokenize_into should still terminate with EOF in reused scratch",
1223 );
1224 }
1225
1226 #[test]
1227 fn test_lex_float_literals() {
1228 let tokens = kinds("3.14 1e10 .5 1.0e-3 0.0");
1229 let expected = 3.0 + 0.14;
1232 assert!(matches!(
1233 tokens[0],
1234 TokenKind::Float(v) if (v - expected).abs() < 1e-10
1235 ));
1236 assert!(matches!(tokens[1], TokenKind::Float(v) if (v - 1e10).abs() < 1.0));
1237 assert!(matches!(tokens[2], TokenKind::Float(v) if (v - 0.5).abs() < 1e-10));
1238 assert!(matches!(tokens[3], TokenKind::Float(v) if (v - 0.001).abs() < 1e-10));
1239 assert!(matches!(tokens[4], TokenKind::Float(v) if v.abs() < 1e-10));
1240 assert_eq!(tokens[5], TokenKind::Eof);
1241 }
1242
1243 #[test]
1244 fn test_lex_string_literals() {
1245 let tokens = kinds("'hello' 'it''s' ''");
1246 assert_eq!(tokens[0], TokenKind::String("hello".to_owned()));
1247 assert_eq!(tokens[1], TokenKind::String("it's".to_owned()));
1248 assert_eq!(tokens[2], TokenKind::String(String::new()));
1249 assert_eq!(tokens[3], TokenKind::Eof);
1250 }
1251
1252 #[test]
1253 fn test_lex_blob_literals() {
1254 let tokens = kinds("X'CAFE' x'00ff' X''");
1255 assert_eq!(tokens[0], TokenKind::Blob(vec![0xCA, 0xFE]));
1256 assert_eq!(tokens[1], TokenKind::Blob(vec![0x00, 0xFF]));
1257 assert_eq!(tokens[2], TokenKind::Blob(vec![]));
1258 assert_eq!(tokens[3], TokenKind::Eof);
1259 }
1260
1261 #[test]
1262 fn test_lex_blob_odd_hex_error() {
1263 let tokens = kinds("X'CAF'");
1264 assert!(matches!(tokens[0], TokenKind::Error(_)));
1265 }
1266
1267 #[test]
1268 fn test_lex_blob_non_ascii_no_panic() {
1269 let tokens = kinds("X'U\u{05fc} '");
1272 assert!(matches!(tokens[0], TokenKind::Error(_)));
1273
1274 let tokens2 = kinds("X'GG'");
1276 assert!(matches!(tokens2[0], TokenKind::Error(_)));
1277 }
1278
1279 #[test]
1280 fn test_lex_variables() {
1281 let tokens = kinds("?1 :name @param $var ?");
1282 assert_eq!(tokens[0], TokenKind::QuestionNum(1));
1283 assert_eq!(tokens[1], TokenKind::ColonParam("name".to_owned()));
1284 assert_eq!(tokens[2], TokenKind::AtParam("param".to_owned()));
1285 assert_eq!(tokens[3], TokenKind::DollarParam("var".to_owned()));
1286 assert_eq!(tokens[4], TokenKind::Question);
1287 assert_eq!(tokens[5], TokenKind::Eof);
1288 }
1289
1290 #[test]
1291 fn test_lex_quoted_identifiers() {
1292 let tokens = kinds("\"table_name\" [column] `backtick`");
1293 assert_eq!(tokens[0], TokenKind::QuotedId("table_name".into(), true));
1294 assert_eq!(tokens[1], TokenKind::QuotedId("column".into(), false));
1295 assert_eq!(tokens[2], TokenKind::QuotedId("backtick".into(), false));
1296 }
1297
1298 #[test]
1299 fn test_lex_dqs_flag() {
1300 let tokens = kinds("\"hello\"");
1301 assert_eq!(tokens[0], TokenKind::QuotedId("hello".into(), true));
1303 }
1304
1305 #[test]
1306 fn test_lex_keywords() {
1307 let tokens = kinds("SELECT FROM WHERE INSERT CREATE TABLE CONCURRENT");
1308 assert_eq!(tokens[0], TokenKind::KwSelect);
1309 assert_eq!(tokens[1], TokenKind::KwFrom);
1310 assert_eq!(tokens[2], TokenKind::KwWhere);
1311 assert_eq!(tokens[3], TokenKind::KwInsert);
1312 assert_eq!(tokens[4], TokenKind::KwCreate);
1313 assert_eq!(tokens[5], TokenKind::KwTable);
1314 assert_eq!(tokens[6], TokenKind::KwConcurrent);
1315
1316 let tokens2 = kinds("select from where");
1318 assert_eq!(tokens2[0], TokenKind::KwSelect);
1319 assert_eq!(tokens2[1], TokenKind::KwFrom);
1320 assert_eq!(tokens2[2], TokenKind::KwWhere);
1321 }
1322
1323 #[test]
1324 fn test_lex_operators() {
1325 let tokens = kinds("+ - * / % & | ~ << >> = < <= > >= == != <> || -> ->>");
1326 let expected = vec![
1327 TokenKind::Plus,
1328 TokenKind::Minus,
1329 TokenKind::Star,
1330 TokenKind::Slash,
1331 TokenKind::Percent,
1332 TokenKind::Ampersand,
1333 TokenKind::Pipe,
1334 TokenKind::Tilde,
1335 TokenKind::ShiftLeft,
1336 TokenKind::ShiftRight,
1337 TokenKind::Eq,
1338 TokenKind::Lt,
1339 TokenKind::Le,
1340 TokenKind::Gt,
1341 TokenKind::Ge,
1342 TokenKind::EqEq,
1343 TokenKind::Ne,
1344 TokenKind::LtGt,
1345 TokenKind::Concat,
1346 TokenKind::Arrow,
1347 TokenKind::DoubleArrow,
1348 TokenKind::Eof,
1349 ];
1350 assert_eq!(tokens, expected);
1351 }
1352
1353 #[test]
1354 fn test_lex_eq_vs_eqeq() {
1355 let tokens = kinds("= ==");
1356 assert_eq!(tokens[0], TokenKind::Eq);
1357 assert_eq!(tokens[1], TokenKind::EqEq);
1358 }
1359
1360 #[test]
1361 fn test_lex_ne_vs_ltgt() {
1362 let tokens = kinds("!= <>");
1363 assert_eq!(tokens[0], TokenKind::Ne);
1364 assert_eq!(tokens[1], TokenKind::LtGt);
1365 }
1366
1367 #[test]
1368 fn test_lex_error_unterminated_string() {
1369 let tokens = kinds("'hello");
1370 assert!(matches!(tokens[0], TokenKind::Error(_)));
1371 }
1372
1373 #[test]
1374 fn test_lex_line_column_tracking() {
1375 let tokens = lex("SELECT\n a,\n b");
1376 assert_eq!(tokens[0].line, 1);
1377 assert_eq!(tokens[0].col, 1);
1378 assert_eq!(tokens[1].line, 2);
1380 assert_eq!(tokens[1].col, 3);
1381 assert_eq!(tokens[2].line, 2);
1383 assert_eq!(tokens[2].col, 4);
1384 assert_eq!(tokens[3].line, 3);
1386 assert_eq!(tokens[3].col, 3);
1387 }
1388
1389 #[test]
1390 fn test_lex_whitespace_and_comments_skipped() {
1391 let tokens = kinds("SELECT -- this is a comment\n a /* block */ FROM b");
1392 assert_eq!(tokens[0], TokenKind::KwSelect);
1393 assert_eq!(tokens[1], TokenKind::Id("a".into()));
1394 assert_eq!(tokens[2], TokenKind::KwFrom);
1395 assert_eq!(tokens[3], TokenKind::Id("b".into()));
1396 assert_eq!(tokens[4], TokenKind::Eof);
1397 }
1398
1399 #[test]
1400 fn test_lex_hex_large_values() {
1401 let tokens = kinds("0xFFFFFFFFFFFFFFFF");
1404 assert_eq!(tokens[0], TokenKind::Integer(-1));
1405
1406 let tokens = kinds("0x8000000000000000");
1408 assert_eq!(tokens[0], TokenKind::Integer(i64::MIN));
1409
1410 let tokens = kinds("0x7FFFFFFFFFFFFFFF");
1412 assert_eq!(tokens[0], TokenKind::Integer(i64::MAX));
1413 }
1414
1415 #[test]
1416 fn test_lex_hex_overflow_17_digits_rejects() {
1417 let tokens = kinds("0x10000000000000000");
1420 assert!(
1421 matches!(&tokens[0], TokenKind::Error(msg) if msg.contains("out of range")),
1422 "expected error for 17-digit hex, got {:?}",
1423 tokens[0]
1424 );
1425 }
1426
1427 #[test]
1428 fn test_lex_hex_leading_zeros_accepted() {
1429 let tokens = kinds("0x00000000000000001");
1432 assert_eq!(tokens[0], TokenKind::Integer(1));
1433 }
1434
1435 #[test]
1436 fn test_lex_number_hex() {
1437 let tokens = kinds("0x1A 0Xff 0x0");
1438 assert_eq!(tokens[0], TokenKind::Integer(26));
1439 assert_eq!(tokens[1], TokenKind::Integer(255));
1440 assert_eq!(tokens[2], TokenKind::Integer(0));
1441 assert_eq!(tokens[3], TokenKind::Eof);
1442 }
1443
1444 #[test]
1445 fn test_lex_number_unrecognized() {
1446 let tokens = kinds("123a 123.a");
1447 assert!(
1448 matches!(tokens[0], TokenKind::Error(ref e) if e.contains("unrecognized token: \"123a\""))
1449 );
1450 assert!(
1451 matches!(tokens[1], TokenKind::Error(ref e) if e.contains("unrecognized token: \"123.a\""))
1452 );
1453 }
1454
1455 #[test]
1456 fn test_lex_number_hex_invalid() {
1457 let tokens = kinds("0x");
1458 assert!(matches!(tokens[0], TokenKind::Error(_)));
1459 }
1460
1461 #[test]
1462 fn test_lex_positional_params() {
1463 let tokens = kinds("? ?123");
1464 assert_eq!(tokens[0], TokenKind::Question);
1465 assert_eq!(tokens[1], TokenKind::QuestionNum(123));
1466 assert_eq!(tokens[2], TokenKind::Eof);
1467 }
1468
1469 #[test]
1470 fn test_lex_positional_params_reject_zero_and_out_of_range() {
1471 let tokens = kinds("?0 ?32767");
1472 assert!(
1473 matches!(tokens[0], TokenKind::Error(ref e) if e.contains("between ?1 and ?32766")),
1474 "expected ?0 to be rejected, got {:?}",
1475 tokens[0]
1476 );
1477 assert!(
1478 matches!(tokens[1], TokenKind::Error(ref e) if e.contains("between ?1 and ?32766")),
1479 "expected ?32767 to be rejected, got {:?}",
1480 tokens[1]
1481 );
1482 assert_eq!(tokens[2], TokenKind::Eof);
1483 }
1484
1485 #[test]
1486 fn test_lex_named_params() {
1487 let tokens = kinds(":foo @bar $baz_123");
1488 assert_eq!(tokens[0], TokenKind::ColonParam("foo".to_owned()));
1489 assert_eq!(tokens[1], TokenKind::AtParam("bar".to_owned()));
1490 assert_eq!(tokens[2], TokenKind::DollarParam("baz_123".to_owned()));
1491 assert_eq!(tokens[3], TokenKind::Eof);
1492 }
1493
1494 #[test]
1495 fn test_lex_named_params_with_tcl_syntax() {
1496 let tokens = kinds("$::foo(bar) :a::b");
1497 assert_eq!(tokens[0], TokenKind::DollarParam("::foo(bar)".to_owned()));
1498 assert_eq!(tokens[1], TokenKind::ColonParam("a::b".to_owned()));
1499 assert_eq!(tokens[2], TokenKind::Eof);
1500 }
1501
1502 #[test]
1503 fn test_lex_named_params_with_unclosed_tcl_array_syntax() {
1504 let tokens = kinds("$::foo(bar");
1505 assert!(
1506 matches!(tokens[0], TokenKind::Error(ref e) if e.contains("unrecognized token")),
1507 "expected unterminated Tcl-style parameter to be rejected, got {:?}",
1508 tokens[0]
1509 );
1510 assert_eq!(tokens[1], TokenKind::Eof);
1511 }
1512
1513 fn histogram_total(hist: &TokenizeDurationSecondsHistogram) -> u64 {
1514 hist.le_100us + hist.le_250us + hist.le_500us + hist.le_1ms + hist.le_5ms + hist.gt_5ms
1515 }
1516
1517 #[test]
1518 fn test_tokenize_metrics_accumulate_tokens_and_histogram_samples() {
1519 let prev_metrics_enabled = tokenize_metrics_enabled();
1520 reset_tokenize_metrics();
1521 set_tokenize_metrics_enabled(true);
1522
1523 let first = lex("SELECT 1;");
1524 let second = lex("SELECT 2;");
1525
1526 let expected_total_tokens = u64::try_from(first.len() + second.len()).unwrap_or(u64::MAX);
1527 let snap = tokenize_metrics_snapshot();
1528 assert_eq!(snap.fsqlite_tokenize_tokens_total, expected_total_tokens);
1529 assert_eq!(snap.fsqlite_tokenize_duration_seconds_count, 2);
1530 assert_eq!(
1531 histogram_total(&snap.fsqlite_tokenize_duration_seconds),
1532 snap.fsqlite_tokenize_duration_seconds_count
1533 );
1534
1535 set_tokenize_metrics_enabled(prev_metrics_enabled);
1536 reset_tokenize_metrics();
1537 }
1538
1539 #[test]
1540 fn test_tokenize_metrics_reset_clears_all_fields() {
1541 let prev_metrics_enabled = tokenize_metrics_enabled();
1542 reset_tokenize_metrics();
1543 set_tokenize_metrics_enabled(true);
1544 let _ = lex("SELECT 42;");
1545
1546 let before = tokenize_metrics_snapshot();
1547 assert!(before.fsqlite_tokenize_tokens_total > 0);
1548 assert!(before.fsqlite_tokenize_duration_seconds_count > 0);
1549
1550 reset_tokenize_metrics();
1551 let after = tokenize_metrics_snapshot();
1552 assert_eq!(after.fsqlite_tokenize_tokens_total, 0);
1553 assert_eq!(after.fsqlite_tokenize_duration_seconds_count, 0);
1554 assert_eq!(after.fsqlite_tokenize_duration_seconds_sum_micros, 0);
1555 assert_eq!(histogram_total(&after.fsqlite_tokenize_duration_seconds), 0);
1556
1557 set_tokenize_metrics_enabled(prev_metrics_enabled);
1558 }
1559
1560 #[test]
1561 fn test_tokenize_metrics_can_be_disabled_off_hot_path() {
1562 let prev_metrics_enabled = tokenize_metrics_enabled();
1563 reset_tokenize_metrics();
1564 set_tokenize_metrics_enabled(false);
1565
1566 let _ = lex("SELECT 99;");
1567
1568 let snap = tokenize_metrics_snapshot();
1569 assert_eq!(snap.fsqlite_tokenize_tokens_total, 0);
1570 assert_eq!(snap.fsqlite_tokenize_duration_seconds_count, 0);
1571 assert_eq!(snap.fsqlite_tokenize_duration_seconds_sum_micros, 0);
1572 assert_eq!(histogram_total(&snap.fsqlite_tokenize_duration_seconds), 0);
1573
1574 set_tokenize_metrics_enabled(prev_metrics_enabled);
1575 reset_tokenize_metrics();
1576 }
1577}