1use fsqlite_ast::Span;
7use fsqlite_types::limits::MAX_VARIABLE_NUMBER;
8use hashbrown::HashSet;
9use memchr::memchr;
10use std::sync::Arc;
11use std::sync::atomic::{AtomicBool, AtomicU64, Ordering};
12use std::time::Instant;
13use tracing::Level;
14
15use crate::token::{Token, TokenKind};
16
17#[derive(Debug, Clone, Copy, PartialEq, Eq, Default)]
19pub struct TokenizeDurationSecondsHistogram {
20 pub le_100us: u64,
22 pub le_250us: u64,
24 pub le_500us: u64,
26 pub le_1ms: u64,
28 pub le_5ms: u64,
30 pub gt_5ms: u64,
32}
33
34#[derive(Debug, Clone, Copy, PartialEq, Eq, Default)]
36pub struct TokenizeMetricsSnapshot {
37 pub fsqlite_tokenize_tokens_total: u64,
39 pub fsqlite_tokenize_duration_seconds: TokenizeDurationSecondsHistogram,
41 pub fsqlite_tokenize_duration_seconds_count: u64,
43 pub fsqlite_tokenize_duration_seconds_sum_micros: u64,
45}
46
47static FSQLITE_TOKENIZE_TOKENS_TOTAL: AtomicU64 = AtomicU64::new(0);
48static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US: AtomicU64 = AtomicU64::new(0);
49static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US: AtomicU64 = AtomicU64::new(0);
50static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US: AtomicU64 = AtomicU64::new(0);
51static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS: AtomicU64 = AtomicU64::new(0);
52static FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS: AtomicU64 = AtomicU64::new(0);
53static FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS: AtomicU64 = AtomicU64::new(0);
54static FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT: AtomicU64 = AtomicU64::new(0);
55static FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS: AtomicU64 = AtomicU64::new(0);
56static FSQLITE_TOKENIZE_METRICS_ENABLED: AtomicBool = AtomicBool::new(false);
57
58fn saturating_u64_from_usize(value: usize) -> u64 {
59 u64::try_from(value).unwrap_or(u64::MAX)
60}
61
62fn saturating_u64_from_u128(value: u128) -> u64 {
63 u64::try_from(value).unwrap_or(u64::MAX)
64}
65
66fn record_tokenize_metrics(token_count: usize, elapsed_micros: u64) {
67 FSQLITE_TOKENIZE_TOKENS_TOTAL
68 .fetch_add(saturating_u64_from_usize(token_count), Ordering::Relaxed);
69 FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT.fetch_add(1, Ordering::Relaxed);
70 FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS.fetch_add(elapsed_micros, Ordering::Relaxed);
71
72 let bucket = match elapsed_micros {
73 0..=100 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US,
74 101..=250 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US,
75 251..=500 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US,
76 501..=1_000 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS,
77 1_001..=5_000 => &FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS,
78 _ => &FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS,
79 };
80 bucket.fetch_add(1, Ordering::Relaxed);
81}
82
83#[must_use]
85pub fn tokenize_metrics_snapshot() -> TokenizeMetricsSnapshot {
86 TokenizeMetricsSnapshot {
87 fsqlite_tokenize_tokens_total: FSQLITE_TOKENIZE_TOKENS_TOTAL.load(Ordering::Relaxed),
88 fsqlite_tokenize_duration_seconds: TokenizeDurationSecondsHistogram {
89 le_100us: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US.load(Ordering::Relaxed),
90 le_250us: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US.load(Ordering::Relaxed),
91 le_500us: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US.load(Ordering::Relaxed),
92 le_1ms: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS.load(Ordering::Relaxed),
93 le_5ms: FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS.load(Ordering::Relaxed),
94 gt_5ms: FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS.load(Ordering::Relaxed),
95 },
96 fsqlite_tokenize_duration_seconds_count: FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT
97 .load(Ordering::Relaxed),
98 fsqlite_tokenize_duration_seconds_sum_micros: FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS
99 .load(Ordering::Relaxed),
100 }
101}
102
103pub fn set_tokenize_metrics_enabled(enabled: bool) {
105 FSQLITE_TOKENIZE_METRICS_ENABLED.store(enabled, Ordering::Relaxed);
106}
107
108#[must_use]
110pub fn tokenize_metrics_enabled() -> bool {
111 FSQLITE_TOKENIZE_METRICS_ENABLED.load(Ordering::Relaxed)
112}
113
114pub fn reset_tokenize_metrics() {
116 FSQLITE_TOKENIZE_TOKENS_TOTAL.store(0, Ordering::Relaxed);
117 FSQLITE_TOKENIZE_DURATION_SECONDS_LE_100US.store(0, Ordering::Relaxed);
118 FSQLITE_TOKENIZE_DURATION_SECONDS_LE_250US.store(0, Ordering::Relaxed);
119 FSQLITE_TOKENIZE_DURATION_SECONDS_LE_500US.store(0, Ordering::Relaxed);
120 FSQLITE_TOKENIZE_DURATION_SECONDS_LE_1MS.store(0, Ordering::Relaxed);
121 FSQLITE_TOKENIZE_DURATION_SECONDS_LE_5MS.store(0, Ordering::Relaxed);
122 FSQLITE_TOKENIZE_DURATION_SECONDS_GT_5MS.store(0, Ordering::Relaxed);
123 FSQLITE_TOKENIZE_DURATION_SECONDS_COUNT.store(0, Ordering::Relaxed);
124 FSQLITE_TOKENIZE_DURATION_SECONDS_SUM_MICROS.store(0, Ordering::Relaxed);
125}
126
127const MAX_RETAINED_IDENTIFIER_INTERNER_ENTRIES: usize = 256;
129const MAX_RETAINED_IDENTIFIER_INTERNER_BYTES: usize = 16 * 1024;
130
131thread_local! {
132 static FSQLITE_FORCE_INTERNER_SCAN_BENCH: std::cell::Cell<bool> =
136 const { std::cell::Cell::new(false) };
137}
138
139pub fn set_force_interner_scan_bench(enabled: bool) {
144 FSQLITE_FORCE_INTERNER_SCAN_BENCH.with(|c| c.set(enabled));
145}
146
147#[derive(Debug, Default)]
149pub(crate) struct IdentifierInterner {
150 values: HashSet<Arc<str>>,
151 interned_bytes: usize,
156}
157
158impl IdentifierInterner {
159 fn intern(&mut self, value: &str) -> Arc<str> {
160 if let Some(existing) = self.values.get(value) {
161 return Arc::clone(existing);
162 }
163
164 let interned: Arc<str> = Arc::from(value);
165 let inserted = Arc::clone(&interned);
166 self.values.insert(interned);
167 self.interned_bytes = self.interned_bytes.saturating_add(value.len());
168 inserted
169 }
170
171 pub(crate) fn reset(&mut self) {
172 self.values = HashSet::new();
173 self.interned_bytes = 0;
174 }
175
176 pub(crate) fn retained_bytes(&self) -> usize {
177 let interned_value_bytes = if FSQLITE_FORCE_INTERNER_SCAN_BENCH.with(std::cell::Cell::get) {
181 self.values
182 .iter()
183 .fold(0usize, |sum, value| sum.saturating_add(value.len()))
184 } else {
185 self.interned_bytes
186 };
187 self.values
188 .capacity()
189 .saturating_mul(std::mem::size_of::<Arc<str>>())
190 .saturating_add(interned_value_bytes)
191 }
192
193 pub(crate) fn prepare_for_next_parse(&mut self) {
194 if self.values.len() > MAX_RETAINED_IDENTIFIER_INTERNER_ENTRIES
195 || self.retained_bytes() > MAX_RETAINED_IDENTIFIER_INTERNER_BYTES
196 {
197 self.reset();
198 }
199 }
200
201 #[cfg(test)]
202 pub(crate) fn is_empty(&self) -> bool {
203 self.values.is_empty()
204 }
205
206 #[cfg(test)]
207 pub(crate) fn len(&self) -> usize {
208 self.values.len()
209 }
210}
211
212pub struct Lexer<'a> {
214 src: &'a [u8],
216 pos: usize,
218 line: u32,
220 col: u32,
222 trace_chars: bool,
224 interner: IdentifierInterner,
226}
227
228impl<'a> Lexer<'a> {
229 fn log_token(token: &Token) {
230 tracing::debug!(
231 target: "fsqlite.parse",
232 token = ?token.kind,
233 start = token.span.start,
234 end = token.span.end,
235 line = token.line,
236 col = token.col,
237 "tokenized token"
238 );
239 }
240
241 #[must_use]
243 pub fn new(source: &'a str) -> Self {
244 Self {
245 src: source.as_bytes(),
246 pos: 0,
247 line: 1,
248 col: 1,
249 trace_chars: tracing::enabled!(target: "fsqlite.parse", Level::TRACE),
250 interner: IdentifierInterner::default(),
251 }
252 }
253
254 #[must_use]
256 pub fn tokenize(source: &'a str) -> Vec<Token> {
257 let mut tokens = Vec::new();
258 Self::tokenize_into(source, &mut tokens);
259 tokens
260 }
261
262 fn new_with_interner(source: &'a str, interner: IdentifierInterner) -> Self {
263 Self {
264 src: source.as_bytes(),
265 pos: 0,
266 line: 1,
267 col: 1,
268 trace_chars: tracing::enabled!(target: "fsqlite.parse", Level::TRACE),
269 interner,
270 }
271 }
272
273 pub fn tokenize_into(source: &'a str, tokens: &mut Vec<Token>) {
279 let mut interner = IdentifierInterner::default();
280 Self::tokenize_into_with_interner(source, tokens, &mut interner);
281 }
282
283 pub(crate) fn tokenize_into_with_interner(
284 source: &'a str,
285 tokens: &mut Vec<Token>,
286 interner: &mut IdentifierInterner,
287 ) {
288 let input_bytes = source.len();
289 let collect_tokenize_metrics = tokenize_metrics_enabled();
290 let trace_tokenize = tracing::enabled!(target: "fsqlite.parse", Level::TRACE);
291 let span = trace_tokenize.then(|| {
292 tracing::span!(
293 target: "fsqlite.parse",
294 Level::TRACE,
295 "tokenize",
296 token_count = tracing::field::Empty,
297 input_bytes,
298 elapsed_us = tracing::field::Empty,
299 )
300 });
301 let _guard = span.as_ref().map(|span| span.enter());
302 let started = (collect_tokenize_metrics || trace_tokenize).then(Instant::now);
303
304 let mut lexer = Self::new_with_interner(source, std::mem::take(interner));
305 let target_capacity = input_bytes / 4 + 1;
306 tokens.clear();
307 if target_capacity > tokens.capacity() {
308 tokens.reserve(target_capacity - tokens.capacity());
309 }
310 loop {
311 let tok = lexer.next_token();
312 let is_eof = tok.kind == TokenKind::Eof;
313 tokens.push(tok);
314 if is_eof {
315 break;
316 }
317 }
318
319 *interner = lexer.interner;
320
321 if let Some(started) = started {
322 let elapsed_us = saturating_u64_from_u128(started.elapsed().as_micros());
323 if let Some(span) = span.as_ref() {
324 span.record("token_count", saturating_u64_from_usize(tokens.len()));
325 span.record("elapsed_us", elapsed_us);
326 }
327 if collect_tokenize_metrics {
328 record_tokenize_metrics(tokens.len(), elapsed_us);
329 }
330 }
331 }
332
333 #[must_use]
335 pub fn metrics_snapshot() -> TokenizeMetricsSnapshot {
336 tokenize_metrics_snapshot()
337 }
338
339 pub fn reset_metrics() {
341 reset_tokenize_metrics();
342 }
343
344 pub fn next_token(&mut self) -> Token {
346 self.skip_whitespace_and_comments();
347
348 if self.pos >= self.src.len() {
349 let token = self.make_token(TokenKind::Eof, self.pos, self.pos);
350 Self::log_token(&token);
351 return token;
352 }
353
354 let start = self.pos;
355 let start_line = self.line;
356 let start_col = self.col;
357 let ch = self.src[self.pos];
358
359 let kind = match ch {
360 b'\'' => self.lex_string(),
362
363 b'"' => self.lex_double_quoted_id(),
365
366 b'`' => self.lex_backtick_id(),
368
369 b'[' => self.lex_bracket_id(),
371
372 b'X' | b'x' if self.peek_at(1) == Some(b'\'') => self.lex_blob(),
374
375 b'0'..=b'9' => self.lex_number(),
377 b'.' if self.peek_at(1).is_some_and(|c| c.is_ascii_digit()) => self.lex_number(),
378
379 b'a'..=b'z' | b'A'..=b'Z' | b'_' | 0x80..=0xFF => self.lex_identifier(),
381
382 b'?' => self.lex_question(),
384 b':' => self.lex_colon_param(),
385 b'@' => self.lex_at_param(),
386 b'$' => self.lex_dollar_param(),
387
388 b'+' => {
390 self.advance();
391 TokenKind::Plus
392 }
393 b'*' => {
394 self.advance();
395 TokenKind::Star
396 }
397 b'/' => {
398 self.advance();
399 TokenKind::Slash
400 }
401 b'%' => {
402 self.advance();
403 TokenKind::Percent
404 }
405 b'&' => {
406 self.advance();
407 TokenKind::Ampersand
408 }
409 b'~' => {
410 self.advance();
411 TokenKind::Tilde
412 }
413 b',' => {
414 self.advance();
415 TokenKind::Comma
416 }
417 b';' => {
418 self.advance();
419 TokenKind::Semicolon
420 }
421 b'(' => {
422 self.advance();
423 TokenKind::LeftParen
424 }
425 b')' => {
426 self.advance();
427 TokenKind::RightParen
428 }
429 b'.' => {
430 self.advance();
431 TokenKind::Dot
432 }
433
434 b'-' => self.lex_minus_or_arrow(),
436 b'<' => self.lex_lt(),
437 b'>' => self.lex_gt(),
438 b'=' => self.lex_eq(),
439 b'!' => self.lex_bang(),
440 b'|' => self.lex_pipe(),
441
442 _ => {
443 self.advance();
444 let s = String::from_utf8_lossy(&self.src[start..self.pos]).into_owned();
445 TokenKind::Error(format!("unexpected character: {s}"))
446 }
447 };
448
449 let token = Token {
450 kind,
451 #[allow(clippy::cast_possible_truncation)]
452 span: Span::new(start as u32, self.pos as u32),
453 line: start_line,
454 col: start_col,
455 };
456
457 Self::log_token(&token);
458 token
459 }
460
461 #[allow(clippy::cast_possible_truncation)]
466 fn advance_by(&mut self, n: usize) {
467 if n == 0 {
468 return;
469 }
470 let end = self.pos + n;
471 let slice = &self.src[self.pos..end];
472 #[allow(clippy::naive_bytecount)]
473 let newlines = slice.iter().filter(|&&b| b == b'\n').count();
474 if newlines > 0 {
475 self.line += newlines as u32;
476 let last_nl = slice.iter().rposition(|&b| b == b'\n').unwrap_or(0);
477 self.col = (n - last_nl) as u32;
478 } else {
479 self.col += n as u32;
480 }
481 self.pos = end;
482 }
483
484 fn advance(&mut self) -> u8 {
485 let pos = self.pos;
486 let line = self.line;
487 let col = self.col;
488 let ch = self.src[self.pos];
489 self.pos += 1;
490 if ch == b'\n' {
491 self.line += 1;
492 self.col = 1;
493 } else {
494 self.col += 1;
495 }
496 if self.trace_chars {
497 tracing::trace!(
498 target: "fsqlite.parse",
499 byte = ch,
500 pos,
501 line,
502 col,
503 "tokenize char"
504 );
505 }
506 ch
507 }
508
509 fn peek(&self) -> Option<u8> {
510 self.src.get(self.pos).copied()
511 }
512
513 fn peek_at(&self, offset: usize) -> Option<u8> {
514 self.src.get(self.pos + offset).copied()
515 }
516
517 #[allow(clippy::cast_possible_truncation)]
518 fn make_token(&self, kind: TokenKind, start: usize, end: usize) -> Token {
519 Token {
520 kind,
521 span: Span::new(start as u32, end as u32),
522 line: self.line,
523 col: self.col,
524 }
525 }
526
527 fn skip_whitespace_and_comments(&mut self) {
529 loop {
530 let mut ws_len = 0;
532 while self.pos + ws_len < self.src.len()
533 && self.src[self.pos + ws_len].is_ascii_whitespace()
534 {
535 ws_len += 1;
536 }
537 if ws_len > 0 {
538 self.advance_by(ws_len);
539 }
540
541 if self.pos >= self.src.len() {
542 break;
543 }
544
545 if self.src[self.pos] == b'-' && self.peek_at(1) == Some(b'-') {
547 self.advance(); self.advance(); while self.pos < self.src.len() && self.src[self.pos] != b'\n' {
550 self.advance();
551 }
552 continue;
553 }
554
555 if self.src[self.pos] == b'/' && self.peek_at(1) == Some(b'*') {
557 self.advance(); self.advance(); let closed = loop {
560 if self.pos >= self.src.len() {
561 break false;
562 }
563 if self.src[self.pos] == b'*' && self.peek_at(1) == Some(b'/') {
564 self.advance();
565 self.advance();
566 break true;
567 }
568 self.advance();
569 };
570 if !closed {
571 self.pos = self.src.len();
573 }
574 continue;
575 }
576
577 break;
578 }
579 }
580
581 fn lex_string(&mut self) -> TokenKind {
586 let start = self.pos;
587 self.advance(); let mut value = String::new();
590 loop {
591 let remaining = &self.src[self.pos..];
593 if let Some(offset) = memchr(b'\'', remaining) {
594 value.push_str(&String::from_utf8_lossy(
596 &self.src[self.pos..self.pos + offset],
597 ));
598 self.advance_by(offset);
600 self.advance(); if self.peek() == Some(b'\'') {
604 value.push('\'');
605 self.advance();
606 } else {
607 return TokenKind::String(value);
608 }
609 } else {
610 self.pos = self.src.len();
612 return TokenKind::Error(format!(
613 "unterminated string literal starting at byte {}",
614 start
615 ));
616 }
617 }
618 }
619
620 fn lex_double_quoted_id(&mut self) -> TokenKind {
622 let start = self.pos;
623 self.advance(); let mut value = String::new();
626 loop {
627 let remaining = &self.src[self.pos..];
628 if let Some(offset) = memchr(b'"', remaining) {
629 value.push_str(&String::from_utf8_lossy(
630 &self.src[self.pos..self.pos + offset],
631 ));
632 self.advance_by(offset);
633 self.advance(); if self.peek() == Some(b'"') {
637 value.push('"');
638 self.advance();
639 } else {
640 return TokenKind::QuotedId(self.interner.intern(&value), true);
641 }
642 } else {
643 self.pos = self.src.len();
644 return TokenKind::Error(format!(
645 "unterminated double-quoted identifier at byte {}",
646 start
647 ));
648 }
649 }
650 }
651
652 fn lex_backtick_id(&mut self) -> TokenKind {
654 let start = self.pos;
655 self.advance(); let mut value = String::new();
658 loop {
659 let remaining = &self.src[self.pos..];
660 if let Some(offset) = memchr(b'`', remaining) {
661 value.push_str(&String::from_utf8_lossy(
662 &self.src[self.pos..self.pos + offset],
663 ));
664 self.advance_by(offset);
665 self.advance(); if self.peek() == Some(b'`') {
668 value.push('`');
669 self.advance();
670 } else {
671 return TokenKind::QuotedId(self.interner.intern(&value), false);
672 }
673 } else {
674 self.pos = self.src.len();
675 return TokenKind::Error(format!(
676 "unterminated backtick identifier at byte {}",
677 start
678 ));
679 }
680 }
681 }
682
683 fn lex_bracket_id(&mut self) -> TokenKind {
685 let start = self.pos;
686 self.advance(); let mut value = String::new();
689 let remaining = &self.src[self.pos..];
690 if let Some(offset) = memchr(b']', remaining) {
691 value.push_str(&String::from_utf8_lossy(
692 &self.src[self.pos..self.pos + offset],
693 ));
694 self.advance_by(offset);
695 self.advance(); TokenKind::QuotedId(self.interner.intern(&value), false)
697 } else {
698 self.pos = self.src.len();
699 TokenKind::Error(format!("unterminated bracket identifier at byte {}", start))
700 }
701 }
702
703 fn lex_blob(&mut self) -> TokenKind {
705 let start = self.pos;
706 self.advance(); self.advance(); let hex_start = self.pos;
710 let remaining = &self.src[self.pos..];
711 if let Some(offset) = memchr(b'\'', remaining) {
712 let hex_bytes = &self.src[hex_start..hex_start + offset];
713 self.advance_by(offset);
714 self.advance(); if hex_bytes.len() % 2 != 0 {
718 return TokenKind::Error(format!(
719 "blob literal has odd number of hex digits at byte {}",
720 start
721 ));
722 }
723
724 let mut bytes = Vec::with_capacity(hex_bytes.len() / 2);
727 for pair in hex_bytes.chunks_exact(2) {
728 let hi = hex_digit(pair[0]);
729 let lo = hex_digit(pair[1]);
730 match (hi, lo) {
731 (Some(h), Some(l)) => bytes.push((h << 4) | l),
732 _ => {
733 return TokenKind::Error(format!(
734 "invalid hex in blob literal at byte {start}"
735 ));
736 }
737 }
738 }
739 TokenKind::Blob(bytes)
740 } else {
741 self.pos = self.src.len();
742 TokenKind::Error(format!("unterminated blob literal at byte {}", start))
743 }
744 }
745
746 fn lex_number(&mut self) -> TokenKind {
748 let start = self.pos;
749
750 if self.src[self.pos] == b'0' && self.peek_at(1).is_some_and(|c| c == b'x' || c == b'X') {
752 self.advance(); self.advance(); let hex_start = self.pos;
755 while self.pos < self.src.len() {
760 let c = self.src[self.pos];
761 let is_separator = c == b'_'
762 && self.pos > hex_start
763 && self.src[self.pos - 1].is_ascii_hexdigit()
764 && self.peek_at(1).is_some_and(|n| n.is_ascii_hexdigit());
765 if c.is_ascii_hexdigit() || is_separator {
766 self.advance();
767 } else {
768 break;
769 }
770 }
771 if self.pos == hex_start {
772 return TokenKind::Error("empty hex literal".to_owned());
773 }
774 if self
778 .peek()
779 .is_some_and(|n| n.is_ascii_alphanumeric() || n == b'_')
780 {
781 let err_start = start;
782 while self.pos < self.src.len()
783 && (self.src[self.pos].is_ascii_alphanumeric() || self.src[self.pos] == b'_')
784 {
785 self.advance();
786 }
787 let err_text = String::from_utf8_lossy(&self.src[err_start..self.pos]);
788 return TokenKind::Error(format!("unrecognized token: \"{err_text}\""));
789 }
790 let hex_str = String::from_utf8_lossy(&self.src[hex_start..self.pos]).replace('_', "");
791 let significant = hex_str.trim_start_matches('0');
795 if significant.len() > 16 {
796 return TokenKind::Error(format!("hex literal out of range at byte {start}"));
797 }
798 let parse_str = if significant.is_empty() {
799 "0"
800 } else {
801 significant
802 };
803 return match u64::from_str_radix(parse_str, 16) {
806 Ok(v) => {
807 #[allow(clippy::cast_possible_wrap)]
808 let i = v as i64;
809 TokenKind::Integer(i)
810 }
811 Err(_) => TokenKind::Error(format!("hex literal out of range at byte {start}")),
812 };
813 }
814
815 let mut is_float = false;
817
818 self.consume_decimal_digit_run();
821
822 let is_valid_exponent = |lexer: &Self, mut offset: usize| -> bool {
824 if let Some(c) = lexer.peek_at(offset) {
825 if c == b'e' || c == b'E' {
826 offset += 1;
827 if let Some(s) = lexer.peek_at(offset) {
828 if s == b'+' || s == b'-' {
829 offset += 1;
830 }
831 }
832 if let Some(d) = lexer.peek_at(offset) {
833 return d.is_ascii_digit();
834 }
835 }
836 }
837 false
838 };
839
840 if self.pos < self.src.len()
842 && self.src[self.pos] == b'.'
843 && (self.peek_at(1).is_some_and(|c| c.is_ascii_digit()) || is_valid_exponent(self, 1))
844 {
845 is_float = true;
846 self.advance(); self.consume_decimal_digit_run();
848 } else if self.pos < self.src.len()
849 && self.src[self.pos] == b'.'
850 && start < self.pos && !self.peek_at(1).is_some_and(|c| c.is_ascii_alphanumeric() || c == b'_')
852 {
853 is_float = true;
855 self.advance(); }
857
858 if self.src[start] == b'.' {
860 is_float = true;
861 }
862
863 if is_valid_exponent(self, 0) {
865 is_float = true;
866 self.advance(); if self.pos < self.src.len()
868 && (self.src[self.pos] == b'+' || self.src[self.pos] == b'-')
869 {
870 self.advance();
871 }
872 self.consume_decimal_digit_run();
873 }
874
875 if let Some(c) = self.peek() {
878 if c.is_ascii_alphabetic()
879 || c == b'_'
880 || (c == b'.'
881 && self
882 .peek_at(1)
883 .is_some_and(|n| n.is_ascii_alphabetic() || n == b'_'))
884 {
885 let err_start = start;
886 while self.pos < self.src.len() {
887 let ch = self.src[self.pos];
888 if ch.is_ascii_alphanumeric() || ch == b'_' || ch == b'.' {
889 self.advance();
890 } else {
891 break;
892 }
893 }
894 let err_text = String::from_utf8_lossy(&self.src[err_start..self.pos]);
895 return TokenKind::Error(format!("unrecognized token: \"{err_text}\""));
896 }
897 }
898
899 let text_raw = String::from_utf8_lossy(&self.src[start..self.pos]);
900 let text: std::borrow::Cow<'_, str> = if text_raw.as_ref().contains('_') {
903 std::borrow::Cow::Owned(text_raw.replace('_', ""))
904 } else {
905 text_raw
906 };
907 if is_float {
908 match text.parse::<f64>() {
911 Ok(v) => TokenKind::Float(v),
912 Err(_) => {
913 let mut text_fixed = text.clone().into_owned();
915 if text_fixed.starts_with(".e") || text_fixed.starts_with(".E") {
916 text_fixed.insert(0, '0');
917 }
918 match text_fixed.parse::<f64>() {
919 Ok(v) => TokenKind::Float(v),
920 Err(_) => TokenKind::Error(format!("invalid float: {text}")),
921 }
922 }
923 }
924 } else {
925 match text.parse::<i64>() {
926 Ok(v) => TokenKind::Integer(v),
927 Err(_) => {
928 TokenKind::OversizedInt(text.into_owned())
931 }
932 }
933 }
934 }
935
936 fn consume_decimal_digit_run(&mut self) {
942 while self.pos < self.src.len() {
943 let c = self.src[self.pos];
944 let is_separator = c == b'_'
945 && self.pos > 0
946 && self.src[self.pos - 1].is_ascii_digit()
947 && self.peek_at(1).is_some_and(|n| n.is_ascii_digit());
948 if c.is_ascii_digit() || is_separator {
949 self.advance();
950 } else {
951 break;
952 }
953 }
954 }
955
956 fn lex_identifier(&mut self) -> TokenKind {
958 let start = self.pos;
959 self.advance(); while self.pos < self.src.len() {
962 let ch = self.src[self.pos];
963 if ch.is_ascii_alphanumeric() || ch == b'_' || ch >= 0x80 {
964 self.advance();
965 } else {
966 break;
967 }
968 }
969
970 let ident_bytes = &self.src[start..self.pos];
971
972 if let Some(kw) = TokenKind::lookup_keyword_bytes(ident_bytes) {
974 kw
975 } else {
976 let text = String::from_utf8_lossy(ident_bytes);
977 TokenKind::Id(self.interner.intern(&text))
978 }
979 }
980
981 fn lex_question(&mut self) -> TokenKind {
983 self.advance(); if self.pos < self.src.len() && self.src[self.pos].is_ascii_digit() {
985 let num_start = self.pos;
986 while self.pos < self.src.len() && self.src[self.pos].is_ascii_digit() {
987 self.advance();
988 }
989 let text = String::from_utf8_lossy(&self.src[num_start..self.pos]);
990 match text.parse::<u32>() {
991 Ok(n) if (1..=MAX_VARIABLE_NUMBER).contains(&n) => TokenKind::QuestionNum(n),
992 Ok(n) => TokenKind::Error(format!(
993 "variable number must be between ?1 and ?{MAX_VARIABLE_NUMBER}, got ?{n}"
994 )),
995 Err(_) => TokenKind::Error("invalid parameter number".to_owned()),
996 }
997 } else {
998 TokenKind::Question
999 }
1000 }
1001
1002 fn lex_alpha_param(&mut self, prefix: char, constructor: fn(String) -> TokenKind) -> TokenKind {
1003 self.advance(); let name_start = self.pos;
1005 while self.pos < self.src.len() {
1006 let ch = self.src[self.pos];
1007 if ch.is_ascii_alphanumeric() || ch == b'_' || ch >= 0x80 {
1008 self.advance();
1009 } else if ch == b':' && self.peek_at(1) == Some(b':') {
1010 self.advance();
1011 self.advance();
1012 } else if ch == b'(' {
1013 self.advance();
1014 while self.pos < self.src.len() && self.src[self.pos] != b')' {
1015 self.advance();
1016 }
1017 if self.pos >= self.src.len() || self.src[self.pos] != b')' {
1018 let name = String::from_utf8_lossy(&self.src[name_start..self.pos]);
1019 return TokenKind::Error(format!("unrecognized token: \"{prefix}{name}\""));
1020 }
1021 self.advance();
1022 break; } else {
1024 break;
1025 }
1026 }
1027 if self.pos == name_start {
1028 return TokenKind::Error(format!("empty parameter name after '{prefix}'"));
1029 }
1030 let name = String::from_utf8_lossy(&self.src[name_start..self.pos]).into_owned();
1031 constructor(name)
1032 }
1033
1034 fn lex_colon_param(&mut self) -> TokenKind {
1036 self.lex_alpha_param(':', TokenKind::ColonParam)
1037 }
1038
1039 fn lex_at_param(&mut self) -> TokenKind {
1041 self.lex_alpha_param('@', TokenKind::AtParam)
1042 }
1043
1044 fn lex_dollar_param(&mut self) -> TokenKind {
1046 self.lex_alpha_param('$', TokenKind::DollarParam)
1047 }
1048
1049 fn lex_minus_or_arrow(&mut self) -> TokenKind {
1055 self.advance(); if self.peek() == Some(b'>') {
1057 self.advance(); if self.peek() == Some(b'>') {
1059 self.advance(); TokenKind::DoubleArrow
1061 } else {
1062 TokenKind::Arrow
1063 }
1064 } else {
1065 TokenKind::Minus
1066 }
1067 }
1068
1069 fn lex_lt(&mut self) -> TokenKind {
1071 self.advance(); match self.peek() {
1073 Some(b'=') => {
1074 self.advance();
1075 TokenKind::Le
1076 }
1077 Some(b'>') => {
1078 self.advance();
1079 TokenKind::LtGt
1080 }
1081 Some(b'<') => {
1082 self.advance();
1083 TokenKind::ShiftLeft
1084 }
1085 _ => TokenKind::Lt,
1086 }
1087 }
1088
1089 fn lex_gt(&mut self) -> TokenKind {
1091 self.advance(); match self.peek() {
1093 Some(b'=') => {
1094 self.advance();
1095 TokenKind::Ge
1096 }
1097 Some(b'>') => {
1098 self.advance();
1099 TokenKind::ShiftRight
1100 }
1101 _ => TokenKind::Gt,
1102 }
1103 }
1104
1105 fn lex_eq(&mut self) -> TokenKind {
1107 self.advance(); if self.peek() == Some(b'=') {
1109 self.advance();
1110 TokenKind::EqEq
1111 } else {
1112 TokenKind::Eq
1113 }
1114 }
1115
1116 fn lex_bang(&mut self) -> TokenKind {
1118 self.advance(); if self.peek() == Some(b'=') {
1120 self.advance();
1121 TokenKind::Ne
1122 } else {
1123 TokenKind::Error("unexpected '!', did you mean '!='?".to_owned())
1124 }
1125 }
1126
1127 fn lex_pipe(&mut self) -> TokenKind {
1129 self.advance(); if self.peek() == Some(b'|') {
1131 self.advance();
1132 TokenKind::Concat
1133 } else {
1134 TokenKind::Pipe
1135 }
1136 }
1137}
1138
1139const fn hex_digit(b: u8) -> Option<u8> {
1142 match b {
1143 b'0'..=b'9' => Some(b - b'0'),
1144 b'a'..=b'f' => Some(b - b'a' + 10),
1145 b'A'..=b'F' => Some(b - b'A' + 10),
1146 _ => None,
1147 }
1148}
1149
1150#[cfg(test)]
1151mod tests {
1152 use super::*;
1153
1154 #[test]
1155 fn interner_incremental_bytes_equals_fold() {
1156 let mut interner = IdentifierInterner::default();
1160 for v in ["alpha", "beta", "gamma", "alpha", "delta", "beta"] {
1161 interner.intern(v);
1162 }
1163 assert_eq!(interner.interned_bytes, 19);
1165 set_force_interner_scan_bench(false);
1166 let incremental = interner.retained_bytes();
1167 set_force_interner_scan_bench(true);
1168 let folded = interner.retained_bytes();
1169 set_force_interner_scan_bench(false);
1170 assert_eq!(
1171 incremental, folded,
1172 "incremental retained_bytes must equal the O(N) fold"
1173 );
1174 interner.reset();
1175 assert_eq!(interner.interned_bytes, 0);
1176 assert_eq!(interner.retained_bytes(), 0);
1177 }
1178
1179 fn lex(src: &str) -> Vec<Token> {
1180 Lexer::tokenize(src)
1181 }
1182
1183 fn kinds(src: &str) -> Vec<TokenKind> {
1184 lex(src).into_iter().map(|t| t.kind).collect()
1185 }
1186
1187 #[test]
1188 fn test_lex_integer_literals() {
1189 let tokens = kinds("42 0 0xFF");
1190 assert_eq!(
1191 tokens,
1192 vec![
1193 TokenKind::Integer(42),
1194 TokenKind::Integer(0),
1195 TokenKind::Integer(255),
1196 TokenKind::Eof,
1197 ]
1198 );
1199 }
1200
1201 #[test]
1202 fn test_tokenize_into_reuses_caller_owned_capacity() {
1203 let mut scratch = Vec::new();
1204 Lexer::tokenize_into(
1205 "SELECT 'abcdefghijklmnopqrstuvwxyzabcdefghijklmnopqrstuvwxyz';",
1206 &mut scratch,
1207 );
1208 let warmed_capacity = scratch.capacity();
1209 assert!(
1210 warmed_capacity > 0,
1211 "warm parse should allocate token scratch"
1212 );
1213
1214 Lexer::tokenize_into("SELECT 1;", &mut scratch);
1215 assert_eq!(
1216 scratch.capacity(),
1217 warmed_capacity,
1218 "smaller follow-up parse should reuse the warmed token buffer",
1219 );
1220 assert_eq!(
1221 scratch.last().map(|token| &token.kind),
1222 Some(&TokenKind::Eof),
1223 "tokenize_into should still terminate with EOF in reused scratch",
1224 );
1225 }
1226
1227 #[test]
1228 fn test_lex_float_literals() {
1229 let tokens = kinds("3.14 1e10 .5 1.0e-3 0.0");
1230 let expected = 3.0 + 0.14;
1233 assert!(matches!(
1234 tokens[0],
1235 TokenKind::Float(v) if (v - expected).abs() < 1e-10
1236 ));
1237 assert!(matches!(tokens[1], TokenKind::Float(v) if (v - 1e10).abs() < 1.0));
1238 assert!(matches!(tokens[2], TokenKind::Float(v) if (v - 0.5).abs() < 1e-10));
1239 assert!(matches!(tokens[3], TokenKind::Float(v) if (v - 0.001).abs() < 1e-10));
1240 assert!(matches!(tokens[4], TokenKind::Float(v) if v.abs() < 1e-10));
1241 assert_eq!(tokens[5], TokenKind::Eof);
1242 }
1243
1244 #[test]
1245 fn test_lex_string_literals() {
1246 let tokens = kinds("'hello' 'it''s' ''");
1247 assert_eq!(tokens[0], TokenKind::String("hello".to_owned()));
1248 assert_eq!(tokens[1], TokenKind::String("it's".to_owned()));
1249 assert_eq!(tokens[2], TokenKind::String(String::new()));
1250 assert_eq!(tokens[3], TokenKind::Eof);
1251 }
1252
1253 #[test]
1254 fn test_lex_blob_literals() {
1255 let tokens = kinds("X'CAFE' x'00ff' X''");
1256 assert_eq!(tokens[0], TokenKind::Blob(vec![0xCA, 0xFE]));
1257 assert_eq!(tokens[1], TokenKind::Blob(vec![0x00, 0xFF]));
1258 assert_eq!(tokens[2], TokenKind::Blob(vec![]));
1259 assert_eq!(tokens[3], TokenKind::Eof);
1260 }
1261
1262 #[test]
1263 fn test_lex_blob_odd_hex_error() {
1264 let tokens = kinds("X'CAF'");
1265 assert!(matches!(tokens[0], TokenKind::Error(_)));
1266 }
1267
1268 #[test]
1269 fn test_lex_blob_non_ascii_no_panic() {
1270 let tokens = kinds("X'U\u{05fc} '");
1273 assert!(matches!(tokens[0], TokenKind::Error(_)));
1274
1275 let tokens2 = kinds("X'GG'");
1277 assert!(matches!(tokens2[0], TokenKind::Error(_)));
1278 }
1279
1280 #[test]
1281 fn test_lex_variables() {
1282 let tokens = kinds("?1 :name @param $var ?");
1283 assert_eq!(tokens[0], TokenKind::QuestionNum(1));
1284 assert_eq!(tokens[1], TokenKind::ColonParam("name".to_owned()));
1285 assert_eq!(tokens[2], TokenKind::AtParam("param".to_owned()));
1286 assert_eq!(tokens[3], TokenKind::DollarParam("var".to_owned()));
1287 assert_eq!(tokens[4], TokenKind::Question);
1288 assert_eq!(tokens[5], TokenKind::Eof);
1289 }
1290
1291 #[test]
1292 fn test_lex_quoted_identifiers() {
1293 let tokens = kinds("\"table_name\" [column] `backtick`");
1294 assert_eq!(tokens[0], TokenKind::QuotedId("table_name".into(), true));
1295 assert_eq!(tokens[1], TokenKind::QuotedId("column".into(), false));
1296 assert_eq!(tokens[2], TokenKind::QuotedId("backtick".into(), false));
1297 }
1298
1299 #[test]
1300 fn test_lex_dqs_flag() {
1301 let tokens = kinds("\"hello\"");
1302 assert_eq!(tokens[0], TokenKind::QuotedId("hello".into(), true));
1304 }
1305
1306 #[test]
1307 fn test_lex_keywords() {
1308 let tokens = kinds("SELECT FROM WHERE INSERT CREATE TABLE CONCURRENT");
1309 assert_eq!(tokens[0], TokenKind::KwSelect);
1310 assert_eq!(tokens[1], TokenKind::KwFrom);
1311 assert_eq!(tokens[2], TokenKind::KwWhere);
1312 assert_eq!(tokens[3], TokenKind::KwInsert);
1313 assert_eq!(tokens[4], TokenKind::KwCreate);
1314 assert_eq!(tokens[5], TokenKind::KwTable);
1315 assert_eq!(tokens[6], TokenKind::KwConcurrent);
1316
1317 let tokens2 = kinds("select from where");
1319 assert_eq!(tokens2[0], TokenKind::KwSelect);
1320 assert_eq!(tokens2[1], TokenKind::KwFrom);
1321 assert_eq!(tokens2[2], TokenKind::KwWhere);
1322 }
1323
1324 #[test]
1325 fn test_lex_operators() {
1326 let tokens = kinds("+ - * / % & | ~ << >> = < <= > >= == != <> || -> ->>");
1327 let expected = vec![
1328 TokenKind::Plus,
1329 TokenKind::Minus,
1330 TokenKind::Star,
1331 TokenKind::Slash,
1332 TokenKind::Percent,
1333 TokenKind::Ampersand,
1334 TokenKind::Pipe,
1335 TokenKind::Tilde,
1336 TokenKind::ShiftLeft,
1337 TokenKind::ShiftRight,
1338 TokenKind::Eq,
1339 TokenKind::Lt,
1340 TokenKind::Le,
1341 TokenKind::Gt,
1342 TokenKind::Ge,
1343 TokenKind::EqEq,
1344 TokenKind::Ne,
1345 TokenKind::LtGt,
1346 TokenKind::Concat,
1347 TokenKind::Arrow,
1348 TokenKind::DoubleArrow,
1349 TokenKind::Eof,
1350 ];
1351 assert_eq!(tokens, expected);
1352 }
1353
1354 #[test]
1355 fn test_lex_eq_vs_eqeq() {
1356 let tokens = kinds("= ==");
1357 assert_eq!(tokens[0], TokenKind::Eq);
1358 assert_eq!(tokens[1], TokenKind::EqEq);
1359 }
1360
1361 #[test]
1362 fn test_lex_ne_vs_ltgt() {
1363 let tokens = kinds("!= <>");
1364 assert_eq!(tokens[0], TokenKind::Ne);
1365 assert_eq!(tokens[1], TokenKind::LtGt);
1366 }
1367
1368 #[test]
1369 fn test_lex_error_unterminated_string() {
1370 let tokens = kinds("'hello");
1371 assert!(matches!(tokens[0], TokenKind::Error(_)));
1372 }
1373
1374 #[test]
1375 fn test_lex_line_column_tracking() {
1376 let tokens = lex("SELECT\n a,\n b");
1377 assert_eq!(tokens[0].line, 1);
1378 assert_eq!(tokens[0].col, 1);
1379 assert_eq!(tokens[1].line, 2);
1381 assert_eq!(tokens[1].col, 3);
1382 assert_eq!(tokens[2].line, 2);
1384 assert_eq!(tokens[2].col, 4);
1385 assert_eq!(tokens[3].line, 3);
1387 assert_eq!(tokens[3].col, 3);
1388 }
1389
1390 #[test]
1391 fn test_lex_whitespace_and_comments_skipped() {
1392 let tokens = kinds("SELECT -- this is a comment\n a /* block */ FROM b");
1393 assert_eq!(tokens[0], TokenKind::KwSelect);
1394 assert_eq!(tokens[1], TokenKind::Id("a".into()));
1395 assert_eq!(tokens[2], TokenKind::KwFrom);
1396 assert_eq!(tokens[3], TokenKind::Id("b".into()));
1397 assert_eq!(tokens[4], TokenKind::Eof);
1398 }
1399
1400 #[test]
1401 fn test_lex_hex_large_values() {
1402 let tokens = kinds("0xFFFFFFFFFFFFFFFF");
1405 assert_eq!(tokens[0], TokenKind::Integer(-1));
1406
1407 let tokens = kinds("0x8000000000000000");
1409 assert_eq!(tokens[0], TokenKind::Integer(i64::MIN));
1410
1411 let tokens = kinds("0x7FFFFFFFFFFFFFFF");
1413 assert_eq!(tokens[0], TokenKind::Integer(i64::MAX));
1414 }
1415
1416 #[test]
1417 fn test_lex_hex_overflow_17_digits_rejects() {
1418 let tokens = kinds("0x10000000000000000");
1421 assert!(
1422 matches!(&tokens[0], TokenKind::Error(msg) if msg.contains("out of range")),
1423 "expected error for 17-digit hex, got {:?}",
1424 tokens[0]
1425 );
1426 }
1427
1428 #[test]
1429 fn test_lex_hex_leading_zeros_accepted() {
1430 let tokens = kinds("0x00000000000000001");
1433 assert_eq!(tokens[0], TokenKind::Integer(1));
1434 }
1435
1436 #[test]
1437 fn test_lex_number_hex() {
1438 let tokens = kinds("0x1A 0Xff 0x0");
1439 assert_eq!(tokens[0], TokenKind::Integer(26));
1440 assert_eq!(tokens[1], TokenKind::Integer(255));
1441 assert_eq!(tokens[2], TokenKind::Integer(0));
1442 assert_eq!(tokens[3], TokenKind::Eof);
1443 }
1444
1445 #[test]
1446 fn test_lex_number_unrecognized() {
1447 let tokens = kinds("123a 123.a");
1448 assert!(
1449 matches!(tokens[0], TokenKind::Error(ref e) if e.contains("unrecognized token: \"123a\""))
1450 );
1451 assert!(
1452 matches!(tokens[1], TokenKind::Error(ref e) if e.contains("unrecognized token: \"123.a\""))
1453 );
1454 }
1455
1456 #[test]
1457 fn test_lex_number_hex_invalid() {
1458 let tokens = kinds("0x");
1459 assert!(matches!(tokens[0], TokenKind::Error(_)));
1460 }
1461
1462 #[test]
1463 fn test_lex_positional_params() {
1464 let tokens = kinds("? ?123");
1465 assert_eq!(tokens[0], TokenKind::Question);
1466 assert_eq!(tokens[1], TokenKind::QuestionNum(123));
1467 assert_eq!(tokens[2], TokenKind::Eof);
1468 }
1469
1470 #[test]
1471 fn test_lex_positional_params_reject_zero_and_out_of_range() {
1472 let tokens = kinds("?0 ?32767");
1473 assert!(
1474 matches!(tokens[0], TokenKind::Error(ref e) if e.contains("between ?1 and ?32766")),
1475 "expected ?0 to be rejected, got {:?}",
1476 tokens[0]
1477 );
1478 assert!(
1479 matches!(tokens[1], TokenKind::Error(ref e) if e.contains("between ?1 and ?32766")),
1480 "expected ?32767 to be rejected, got {:?}",
1481 tokens[1]
1482 );
1483 assert_eq!(tokens[2], TokenKind::Eof);
1484 }
1485
1486 #[test]
1487 fn test_lex_named_params() {
1488 let tokens = kinds(":foo @bar $baz_123");
1489 assert_eq!(tokens[0], TokenKind::ColonParam("foo".to_owned()));
1490 assert_eq!(tokens[1], TokenKind::AtParam("bar".to_owned()));
1491 assert_eq!(tokens[2], TokenKind::DollarParam("baz_123".to_owned()));
1492 assert_eq!(tokens[3], TokenKind::Eof);
1493 }
1494
1495 #[test]
1496 fn test_lex_named_params_with_tcl_syntax() {
1497 let tokens = kinds("$::foo(bar) :a::b");
1498 assert_eq!(tokens[0], TokenKind::DollarParam("::foo(bar)".to_owned()));
1499 assert_eq!(tokens[1], TokenKind::ColonParam("a::b".to_owned()));
1500 assert_eq!(tokens[2], TokenKind::Eof);
1501 }
1502
1503 #[test]
1504 fn test_lex_named_params_with_unclosed_tcl_array_syntax() {
1505 let tokens = kinds("$::foo(bar");
1506 assert!(
1507 matches!(tokens[0], TokenKind::Error(ref e) if e.contains("unrecognized token")),
1508 "expected unterminated Tcl-style parameter to be rejected, got {:?}",
1509 tokens[0]
1510 );
1511 assert_eq!(tokens[1], TokenKind::Eof);
1512 }
1513
1514 fn histogram_total(hist: &TokenizeDurationSecondsHistogram) -> u64 {
1515 hist.le_100us + hist.le_250us + hist.le_500us + hist.le_1ms + hist.le_5ms + hist.gt_5ms
1516 }
1517
1518 #[test]
1519 fn test_tokenize_metrics_accumulate_tokens_and_histogram_samples() {
1520 let prev_metrics_enabled = tokenize_metrics_enabled();
1521 reset_tokenize_metrics();
1522 set_tokenize_metrics_enabled(true);
1523
1524 let first = lex("SELECT 1;");
1525 let second = lex("SELECT 2;");
1526
1527 let expected_total_tokens = u64::try_from(first.len() + second.len()).unwrap_or(u64::MAX);
1528 let snap = tokenize_metrics_snapshot();
1529 assert_eq!(snap.fsqlite_tokenize_tokens_total, expected_total_tokens);
1530 assert_eq!(snap.fsqlite_tokenize_duration_seconds_count, 2);
1531 assert_eq!(
1532 histogram_total(&snap.fsqlite_tokenize_duration_seconds),
1533 snap.fsqlite_tokenize_duration_seconds_count
1534 );
1535
1536 set_tokenize_metrics_enabled(prev_metrics_enabled);
1537 reset_tokenize_metrics();
1538 }
1539
1540 #[test]
1541 fn test_tokenize_metrics_reset_clears_all_fields() {
1542 let prev_metrics_enabled = tokenize_metrics_enabled();
1543 reset_tokenize_metrics();
1544 set_tokenize_metrics_enabled(true);
1545 let _ = lex("SELECT 42;");
1546
1547 let before = tokenize_metrics_snapshot();
1548 assert!(before.fsqlite_tokenize_tokens_total > 0);
1549 assert!(before.fsqlite_tokenize_duration_seconds_count > 0);
1550
1551 reset_tokenize_metrics();
1552 let after = tokenize_metrics_snapshot();
1553 assert_eq!(after.fsqlite_tokenize_tokens_total, 0);
1554 assert_eq!(after.fsqlite_tokenize_duration_seconds_count, 0);
1555 assert_eq!(after.fsqlite_tokenize_duration_seconds_sum_micros, 0);
1556 assert_eq!(histogram_total(&after.fsqlite_tokenize_duration_seconds), 0);
1557
1558 set_tokenize_metrics_enabled(prev_metrics_enabled);
1559 }
1560
1561 #[test]
1562 fn test_tokenize_metrics_can_be_disabled_off_hot_path() {
1563 let prev_metrics_enabled = tokenize_metrics_enabled();
1564 reset_tokenize_metrics();
1565 set_tokenize_metrics_enabled(false);
1566
1567 let _ = lex("SELECT 99;");
1568
1569 let snap = tokenize_metrics_snapshot();
1570 assert_eq!(snap.fsqlite_tokenize_tokens_total, 0);
1571 assert_eq!(snap.fsqlite_tokenize_duration_seconds_count, 0);
1572 assert_eq!(snap.fsqlite_tokenize_duration_seconds_sum_micros, 0);
1573 assert_eq!(histogram_total(&snap.fsqlite_tokenize_duration_seconds), 0);
1574
1575 set_tokenize_metrics_enabled(prev_metrics_enabled);
1576 reset_tokenize_metrics();
1577 }
1578}