1use std::io::Write;
33use std::process::{Command, Stdio};
34
35use image::{imageops, RgbImage};
36
37use crate::layout::Region;
38use crate::ocr_prep::is_text_label;
39use crate::pdfium_backend::TextCell;
40use docling_core::debug_log;
41
42#[derive(Debug, Clone, PartialEq, Eq)]
44pub struct TesseractOptions {
45 pub cmd: String,
48 pub lang: Option<String>,
51 pub psm: Option<u8>,
56 pub tessdata_dir: Option<String>,
59}
60
61impl TesseractOptions {
62 pub fn from_env(lang: Option<String>) -> Self {
66 let psm = docling_core::env::nonempty("DOCLING_RS_TESSERACT_PSM").and_then(|raw| {
67 let psm = parse_psm(&raw);
68 if psm.is_none() {
69 eprintln!(
70 "docling-pdf: DOCLING_RS_TESSERACT_PSM={raw:?} is not a page \
71 segmentation mode 0-13; using Tesseract's default"
72 );
73 }
74 psm
75 });
76 Self {
77 cmd: docling_core::env::nonempty("DOCLING_TESSERACT")
78 .unwrap_or_else(|| "tesseract".to_string()),
79 lang,
80 psm,
81 tessdata_dir: docling_core::env::nonempty("DOCLING_RS_TESSDATA_DIR"),
82 }
83 }
84}
85
86fn parse_psm(raw: &str) -> Option<u8> {
89 raw.trim().parse::<u8>().ok().filter(|&n| n <= 13)
90}
91
92pub fn lang_arg(raw: &str) -> Result<String, String> {
110 let mut stems = Vec::new();
111 for part in raw.split('+') {
112 let part = part.trim();
113 let part = part
114 .strip_prefix("iso:")
115 .or_else(|| part.strip_prefix("ISO:"))
116 .map_or(part, |tag| tag.trim());
117 if part.is_empty() {
118 return Err(format!("ocr_lang {raw:?} has an empty language entry"));
119 }
120 let mut subtags = part.split(['-', '_']);
121 let primary = subtags.next().unwrap_or_default();
122 let stem = if primary.len() == 2 && primary.bytes().all(|b| b.is_ascii_alphabetic()) {
123 let rest: Vec<String> = subtags.map(str::to_ascii_lowercase).collect();
124 bcp47_stem(&primary.to_ascii_lowercase(), &rest).ok_or_else(|| {
125 format!(
126 "ocr_lang {part:?}: no Tesseract traineddata name is known for that \
127 BCP-47 tag; give the tessdata stem directly (e.g. `deu`, `chi_sim`, \
128 `script/Latin` — see `tesseract --list-langs`)"
129 )
130 })?
131 } else {
132 match part.to_ascii_lowercase().as_str() {
133 "english" => "eng".to_string(),
134 "chinese" => "chi_sim".to_string(),
135 "chinese_cht" => "chi_tra".to_string(),
136 _ => {
137 let mut chars = part.chars();
138 let head_ok = chars
139 .next()
140 .is_some_and(|c| c.is_ascii_alphanumeric() || c == '_' || c == '/');
141 let tail_ok =
142 chars.all(|c| c.is_ascii_alphanumeric() || matches!(c, '_' | '/' | '-'));
143 if !(head_ok && tail_ok) {
144 return Err(format!(
145 "ocr_lang {part:?} is not a Tesseract language identifier \
146 (letters, digits, `_`, `/`, `-`; e.g. `eng`, `deu+fra`, \
147 `script/Cyrillic`)"
148 ));
149 }
150 part.to_string()
151 }
152 }
153 };
154 if !stems.contains(&stem) {
155 stems.push(stem);
156 }
157 }
158 Ok(stems.join("+"))
159}
160
161fn bcp47_stem(primary: &str, subtags: &[String]) -> Option<String> {
167 let has = |s: &str| subtags.iter().any(|t| t == s);
168 let stem = match primary {
169 "zh" | "ch" => {
171 if has("hant") || has("tw") || has("hk") || has("mo") || has("tra") {
172 "chi_tra"
173 } else {
174 "chi_sim"
175 }
176 }
177 "sr" => {
178 if has("latn") {
179 "srp_latn"
180 } else {
181 "srp"
182 }
183 }
184 "az" => {
185 if has("cyrl") {
186 "aze_cyrl"
187 } else {
188 "aze"
189 }
190 }
191 "uz" => {
192 if has("cyrl") {
193 "uzb_cyrl"
194 } else {
195 "uzb"
196 }
197 }
198 "de" => {
199 if has("latf") {
200 "deu_latf"
201 } else {
202 "deu"
203 }
204 }
205 "ku" => "kmr",
206 "no" | "nb" | "nn" => "nor",
207 "af" => "afr",
208 "am" => "amh",
209 "ar" => "ara",
210 "as" => "asm",
211 "be" => "bel",
212 "bn" => "ben",
213 "bo" => "bod",
214 "bs" => "bos",
215 "br" => "bre",
216 "bg" => "bul",
217 "ca" => "cat",
218 "cs" => "ces",
219 "co" => "cos",
220 "cy" => "cym",
221 "da" => "dan",
222 "dv" => "div",
223 "dz" => "dzo",
224 "el" => "ell",
225 "en" => "eng",
226 "eo" => "epo",
227 "et" => "est",
228 "eu" => "eus",
229 "fo" => "fao",
230 "fa" => "fas",
231 "fi" => "fin",
232 "fr" => "fra",
233 "fy" => "fry",
234 "gd" => "gla",
235 "ga" => "gle",
236 "gl" => "glg",
237 "gu" => "guj",
238 "ht" => "hat",
239 "he" => "heb",
240 "hi" => "hin",
241 "hr" => "hrv",
242 "hu" => "hun",
243 "hy" => "hye",
244 "iu" => "iku",
245 "id" => "ind",
246 "is" => "isl",
247 "it" => "ita",
248 "jv" => "jav",
249 "ja" => "jpn",
250 "kn" => "kan",
251 "ka" => "kat",
252 "kk" => "kaz",
253 "km" => "khm",
254 "ky" => "kir",
255 "ko" => "kor",
256 "lo" => "lao",
257 "la" => "lat",
258 "lv" => "lav",
259 "lt" => "lit",
260 "lb" => "ltz",
261 "ml" => "mal",
262 "mr" => "mar",
263 "mk" => "mkd",
264 "mt" => "mlt",
265 "mn" => "mon",
266 "mi" => "mri",
267 "ms" => "msa",
268 "my" => "mya",
269 "ne" => "nep",
270 "nl" => "nld",
271 "oc" => "oci",
272 "or" => "ori",
273 "pa" => "pan",
274 "pl" => "pol",
275 "pt" => "por",
276 "ps" => "pus",
277 "qu" => "que",
278 "ro" => "ron",
279 "ru" => "rus",
280 "sa" => "san",
281 "si" => "sin",
282 "sk" => "slk",
283 "sl" => "slv",
284 "sd" => "snd",
285 "es" => "spa",
286 "sq" => "sqi",
287 "su" => "sun",
288 "sw" => "swa",
289 "sv" => "swe",
290 "ta" => "tam",
291 "tt" => "tat",
292 "te" => "tel",
293 "tg" => "tgk",
294 "th" => "tha",
295 "ti" => "tir",
296 "to" => "ton",
297 "tr" => "tur",
298 "ug" => "uig",
299 "uk" => "ukr",
300 "ur" => "urd",
301 "vi" => "vie",
302 "yi" => "yid",
303 "yo" => "yor",
304 _ => return None,
305 };
306 Some(stem.to_string())
307}
308
309#[derive(Debug, Clone, PartialEq)]
313struct Word {
314 block: u32,
315 par: u32,
316 line: u32,
317 l: f32,
318 t: f32,
319 r: f32,
320 b: f32,
321 conf: f32,
322 text: String,
323}
324
325fn parse_tsv(tsv: &str) -> Vec<Word> {
330 let mut lines = tsv.lines();
331 let Some(header) = lines.next() else {
332 return Vec::new();
333 };
334 let cols: Vec<&str> = header.split('\t').collect();
335 let col = |name: &str| cols.iter().position(|c| *c == name);
336 let (
337 Some(level),
338 Some(block),
339 Some(par),
340 Some(line),
341 Some(left),
342 Some(top),
343 Some(w),
344 Some(h),
345 Some(conf),
346 Some(text),
347 ) = (
348 col("level"),
349 col("block_num"),
350 col("par_num"),
351 col("line_num"),
352 col("left"),
353 col("top"),
354 col("width"),
355 col("height"),
356 col("conf"),
357 col("text"),
358 )
359 else {
360 return Vec::new();
361 };
362 let mut words = Vec::new();
363 for row in lines {
364 let f: Vec<&str> = row.split('\t').collect();
365 if f.len() <= text || f[level] != "5" {
366 continue;
367 }
368 let text = f[text].trim();
369 if text.is_empty() {
370 continue;
371 }
372 let num = |i: usize| f[i].trim().parse::<f32>().unwrap_or(0.0);
373 let idx = |i: usize| f[i].trim().parse::<u32>().unwrap_or(0);
374 let (l, t) = (num(left), num(top));
375 words.push(Word {
376 block: idx(block),
377 par: idx(par),
378 line: idx(line),
379 l,
380 t,
381 r: l + num(w),
382 b: t + num(h),
383 conf: num(conf).clamp(0.0, 100.0),
384 text: text.to_string(),
385 });
386 }
387 words
388}
389
390type Unit = (f32, f32, f32, f32, String, f32);
393
394fn group_lines(words: &[Word]) -> Vec<Unit> {
399 let mut out: Vec<Unit> = Vec::new();
400 let mut key: Option<(u32, u32, u32)> = None;
401 let mut n = 0.0f32;
402 for w in words {
403 let k = (w.block, w.par, w.line);
404 if key == Some(k) {
405 let last = out.last_mut().expect("a line is open");
406 last.0 = last.0.min(w.l);
407 last.1 = last.1.min(w.t);
408 last.2 = last.2.max(w.r);
409 last.3 = last.3.max(w.b);
410 last.4.push(' ');
411 last.4.push_str(&w.text);
412 last.5 = (last.5 * n + w.conf / 100.0) / (n + 1.0);
413 n += 1.0;
414 } else {
415 key = Some(k);
416 n = 1.0;
417 out.push((w.l, w.t, w.r, w.b, w.text.clone(), w.conf / 100.0));
418 }
419 }
420 out
421}
422
423fn word_units(words: &[Word]) -> Vec<Unit> {
425 words
426 .iter()
427 .map(|w| (w.l, w.t, w.r, w.b, w.text.clone(), w.conf / 100.0))
428 .collect()
429}
430
431const CROP_PAD: u32 = 6;
435const CROP_PAD_RATIO: f32 = 0.3;
445const CROP_PAD_MAX: u32 = 48;
449
450fn crop_pad(h_px: f32) -> u32 {
453 (h_px * CROP_PAD_RATIO)
455 .round()
456 .max(CROP_PAD as f32)
457 .min(CROP_PAD_MAX as f32) as u32
458}
459
460struct Crop {
462 ox: u32,
464 oy: u32,
465 png: Vec<u8>,
466 bounds: (f32, f32, f32, f32),
471}
472
473fn crop_png(img: &RgbImage, region: &Region, scale: f32) -> Option<Crop> {
475 let (iw, ih) = img.dimensions();
476 let bounds = (
477 region.l * scale,
478 region.t * scale,
479 region.r * scale,
480 region.b * scale,
481 );
482 let pad = crop_pad(bounds.3 - bounds.1);
483 let l = (bounds.0.max(0.0) as u32).saturating_sub(pad);
484 let t = (bounds.1.max(0.0) as u32).saturating_sub(pad);
485 let r = ((bounds.2.max(0.0) as u32).saturating_add(pad)).min(iw);
486 let b = ((bounds.3.max(0.0) as u32).saturating_add(pad)).min(ih);
487 if r <= l || b <= t {
488 return None;
489 }
490 let crop = imageops::crop_imm(img, l, t, r - l, b - t).to_image();
491 Some(Crop {
492 ox: l,
493 oy: t,
494 png: encode_png(&crop)?,
495 bounds,
496 })
497}
498
499fn unit_in_region(crop: &Crop, unit: &Unit) -> bool {
505 let (l, t, r, b, _, _) = unit;
506 let cx = crop.ox as f32 + (l + r) / 2.0;
507 let cy = crop.oy as f32 + (t + b) / 2.0;
508 let slack = CROP_PAD as f32;
509 let (bl, bt, br, bb) = crop.bounds;
510 cx >= bl - slack && cx <= br + slack && cy >= bt - slack && cy <= bb + slack
511}
512
513fn encode_png(img: &RgbImage) -> Option<Vec<u8>> {
514 let mut buf = std::io::Cursor::new(Vec::new());
515 img.write_to(&mut buf, image::ImageFormat::Png).ok()?;
516 Some(buf.into_inner())
517}
518
519pub struct TesseractOcr {
521 opts: TesseractOptions,
522 lanes: usize,
524 has_osd: bool,
527}
528
529impl TesseractOcr {
530 pub fn load(opts: TesseractOptions, lanes: usize) -> Result<Self, String> {
535 let lanes = docling_core::env::parse::<usize>("DOCLING_RS_OCR_SESSIONS")
536 .filter(|&n| n > 0)
537 .unwrap_or(lanes)
538 .clamp(1, 16);
539 let version = Command::new(&opts.cmd)
540 .arg("--version")
541 .stdin(Stdio::null())
542 .output()
543 .map_err(|e| {
544 format!(
545 "tesseract binary {:?} not runnable ({e}); install tesseract-ocr or point \
546 DOCLING_TESSERACT at it",
547 opts.cmd
548 )
549 })?;
550 let banner = [version.stdout, version.stderr]
552 .iter()
553 .map(|b| String::from_utf8_lossy(b).trim().to_string())
554 .find(|s| !s.is_empty())
555 .unwrap_or_default();
556 let banner = banner.lines().next().unwrap_or_default().to_string();
557 let mut list = Command::new(&opts.cmd);
558 list.arg("--list-langs").stdin(Stdio::null());
559 if let Some(dir) = &opts.tessdata_dir {
560 list.arg("--tessdata-dir").arg(dir);
561 }
562 let list = list
563 .output()
564 .map_err(|e| format!("tesseract --list-langs failed to run: {e}"))?;
565 let installed: Vec<String> = String::from_utf8_lossy(&list.stdout)
569 .lines()
570 .skip(1)
571 .map(|l| l.trim().replace('\\', "/"))
572 .filter(|l| !l.is_empty())
573 .collect();
574 if installed.is_empty() {
575 return Err(format!(
576 "{banner}: no traineddata found (tesseract --list-langs printed nothing); \
577 install a language pack (e.g. tesseract-ocr-eng) or set \
578 DOCLING_RS_TESSDATA_DIR / TESSDATA_PREFIX"
579 ));
580 }
581 let wanted: Vec<&str> = match &opts.lang {
582 Some(l) => l.split('+').collect(),
583 None => vec!["eng"],
584 };
585 let missing: Vec<&str> = wanted
586 .iter()
587 .copied()
588 .filter(|w| !installed.iter().any(|i| i == w))
589 .collect();
590 if !missing.is_empty() {
591 return Err(format!(
592 "{banner}: no traineddata for {} (installed: {}); install the language \
593 pack or pick an installed one with ocr_lang",
594 missing.join(", "),
595 installed.join(", ")
596 ));
597 }
598 let has_osd = installed.iter().any(|i| i == "osd");
599 debug_log!(
600 "docling-pdf: OCR engine {banner} (lang {}, psm {}, {} lane(s), osd {})",
601 opts.lang.as_deref().unwrap_or("eng"),
602 opts.psm.map_or("default".to_string(), |p| p.to_string()),
603 lanes,
604 if has_osd { "yes" } else { "no" }
605 );
606 Ok(Self {
607 opts,
608 lanes,
609 has_osd,
610 })
611 }
612
613 fn command(&self) -> Command {
619 let mut cmd = Command::new(&self.opts.cmd);
620 cmd.env("OMP_THREAD_LIMIT", "1")
621 .stdin(Stdio::piped())
622 .stdout(Stdio::piped())
623 .stderr(Stdio::null());
624 if let Some(dir) = &self.opts.tessdata_dir {
625 cmd.arg("--tessdata-dir").arg(dir);
626 }
627 cmd
628 }
629
630 fn run(&self, mut cmd: Command, png: &[u8]) -> Result<String, String> {
634 let mut child = cmd
635 .spawn()
636 .map_err(|e| format!("tesseract: spawn {:?}: {e}", self.opts.cmd))?;
637 let mut stdin = child.stdin.take().expect("piped stdin");
640 let png = png.to_vec();
641 let writer = std::thread::spawn(move || stdin.write_all(&png));
642 let out = child
643 .wait_with_output()
644 .map_err(|e| format!("tesseract: wait: {e}"))?;
645 let _ = writer.join();
646 if !out.status.success() {
647 return Err(format!("tesseract exited with {}", out.status));
648 }
649 Ok(String::from_utf8_lossy(&out.stdout).into_owned())
650 }
651
652 fn recognize(&self, png: &[u8], dpi: u32) -> Result<Vec<Word>, String> {
654 let mut cmd = self.command();
655 if let Some(lang) = &self.opts.lang {
656 cmd.arg("-l").arg(lang);
657 }
658 if let Some(psm) = self.opts.psm {
659 cmd.arg("--psm").arg(psm.to_string());
660 }
661 cmd.arg("--dpi").arg(dpi.to_string());
662 cmd.args(["stdin", "stdout", "tsv"]);
663 Ok(parse_tsv(&self.run(cmd, png)?))
664 }
665
666 fn recognize_all(
672 &self,
673 jobs: &[Crop],
674 scale: f32,
675 units: fn(&[Word]) -> Vec<Unit>,
676 ) -> Vec<(TextCell, f32)> {
677 let dpi = (scale * 72.0).round().max(1.0) as u32;
678 let lanes = self.lanes.min(jobs.len()).max(1);
679 let next = std::sync::atomic::AtomicUsize::new(0);
680 let results: Vec<std::sync::Mutex<Option<Vec<Word>>>> =
681 jobs.iter().map(|_| std::sync::Mutex::new(None)).collect();
682 std::thread::scope(|s| {
683 for _ in 0..lanes {
684 s.spawn(|| loop {
685 let i = next.fetch_add(1, std::sync::atomic::Ordering::Relaxed);
686 let Some(job) = jobs.get(i) else {
687 break;
688 };
689 let words = match self.recognize(&job.png, dpi) {
690 Ok(words) => words,
691 Err(e) => {
692 debug_log!("docling-pdf: tesseract: crop {i}: {e}; no text");
693 Vec::new()
694 }
695 };
696 *results[i].lock().expect("crop result slot") = Some(words);
697 });
698 }
699 });
700 let mut cells = Vec::new();
701 for (job, slot) in jobs.iter().zip(results) {
702 let words = slot
703 .into_inner()
704 .expect("crop result slot")
705 .unwrap_or_default();
706 let (ox, oy) = (job.ox as f32, job.oy as f32);
707 for unit in units(&words) {
708 if !unit_in_region(job, &unit) {
709 continue;
710 }
711 let (l, t, r, b, text, conf) = unit;
712 let text = text.trim().to_string();
713 if text.is_empty() {
714 continue;
715 }
716 cells.push((
717 TextCell {
718 text,
719 l: (ox + l) / scale,
720 t: (oy + t) / scale,
721 r: (ox + r) / scale,
722 b: (oy + b) / scale,
723 },
724 conf,
725 ));
726 }
727 }
728 cells
729 }
730
731 fn crops(img: &RgbImage, regions: &[Region], scale: f32, keep: fn(&str) -> bool) -> Vec<Crop> {
733 regions
734 .iter()
735 .filter(|r| keep(r.label))
736 .filter_map(|r| crop_png(img, r, scale))
737 .collect()
738 }
739
740 pub fn ocr_page(
744 &mut self,
745 img: &RgbImage,
746 regions: &[Region],
747 scale: f32,
748 ) -> Result<Vec<(TextCell, f32)>, String> {
749 let jobs = crate::timing::timed("ocr.prep", || {
750 Self::crops(img, regions, scale, is_text_label)
751 });
752 Ok(crate::timing::timed("ocr.rec", || {
753 self.recognize_all(&jobs, scale, group_lines)
754 }))
755 }
756
757 pub fn ocr_table_words(
760 &mut self,
761 img: &RgbImage,
762 regions: &[Region],
763 scale: f32,
764 ) -> Result<Vec<(TextCell, f32)>, String> {
765 let jobs = Self::crops(img, regions, scale, crate::assemble::is_table_like);
766 Ok(self.recognize_all(&jobs, scale, word_units))
767 }
768
769 pub fn detect_orientation(&self, img: &RgbImage, scale: f32) -> Option<u16> {
775 if !self.has_osd {
776 debug_log!("docling-pdf: tesseract: no `osd` traineddata; orientation not probed");
777 return None;
778 }
779 let png = encode_png(img)?;
780 let mut cmd = self.command();
781 cmd.args(["--psm", "0", "-l", "osd", "--dpi"])
782 .arg(((scale * 72.0).round().max(1.0) as u32).to_string())
783 .args(["stdin", "stdout"]);
784 match self.run(cmd, &png) {
785 Ok(out) => parse_osd(&out),
786 Err(e) => {
787 debug_log!("docling-pdf: tesseract OSD failed ({e}); assuming upright");
788 None
789 }
790 }
791 }
792}
793
794fn parse_osd(out: &str) -> Option<u16> {
798 let deg = out
799 .lines()
800 .find_map(|l| l.trim().strip_prefix("Orientation in degrees:"))?
801 .trim()
802 .parse::<u16>()
803 .ok()?;
804 matches!(deg, 0 | 90 | 180 | 270).then_some(deg)
805}
806
807#[cfg(test)]
808mod tests {
809 use super::*;
810
811 #[test]
814 fn lang_arg_maps_tags_and_keeps_stems() {
815 for (raw, want) in [
816 ("eng", "eng"),
817 ("en", "eng"),
818 ("EN-us", "eng"),
819 ("iso:en", "eng"),
820 ("english", "eng"),
821 ("ch", "chi_sim"),
822 ("ch_tra", "chi_tra"),
823 ("chinese_cht", "chi_tra"),
824 ("zh", "chi_sim"),
825 ("zh-Hant", "chi_tra"),
826 ("zh-TW", "chi_tra"),
827 ("iso:zh-CN", "chi_sim"),
828 ("de", "deu"),
829 ("de-Latf", "deu_latf"),
830 ("sr-Latn", "srp_latn"),
831 ("sr", "srp"),
832 ("nb", "nor"),
833 ("deu+fra", "deu+fra"),
834 ("iso:de + fr", "deu+fra"),
835 ("eng+eng", "eng"),
836 ("script/Cyrillic", "script/Cyrillic"),
837 ("chi_sim", "chi_sim"),
838 ("srp_latn", "srp_latn"),
839 ("custom_model", "custom_model"),
840 ] {
841 assert_eq!(lang_arg(raw).as_deref(), Ok(want), "{raw:?}");
842 }
843 for raw in ["", "xx", "en+", "de;u", "a b", "iso:", "deu fra"] {
844 assert!(lang_arg(raw).is_err(), "{raw:?} should be rejected");
845 }
846 }
847
848 #[test]
854 fn crop_pad_grows_with_the_region_and_is_capped() {
855 assert_eq!(crop_pad(20.0), CROP_PAD);
856 assert_eq!(crop_pad(48.0), 14);
857 assert_eq!(crop_pad(1000.0), CROP_PAD_MAX);
858 assert_eq!(crop_pad(f32::NAN), CROP_PAD);
859 let region = Region {
860 label: "text",
861 score: 0.9,
862 l: 100.0,
863 t: 100.0,
864 r: 300.0,
865 b: 148.0,
866 };
867 let img = RgbImage::from_pixel(400, 400, image::Rgb([255, 255, 255]));
868 let crop = crop_png(&img, ®ion, 1.0).expect("crop");
869 assert_eq!((crop.ox, crop.oy), (86, 86), "14 px pad on a 48 px line");
870 assert_eq!(crop.bounds, (100.0, 100.0, 300.0, 148.0));
871 let crop = crop_png(&img, ®ion, 0.4).expect("crop");
872 assert_eq!((crop.ox, crop.oy), (34, 34), "6 px floor on a 19 px line");
873 }
874
875 #[test]
878 fn units_outside_the_region_are_dropped() {
879 let crop = Crop {
880 ox: 86,
881 oy: 86,
882 png: Vec::new(),
883 bounds: (100.0, 100.0, 300.0, 148.0),
884 };
885 let own: Unit = (14.0, 14.0, 214.0, 62.0, "Ação".into(), 0.9);
887 let jittered: Unit = (14.0, 6.0, 214.0, 58.0, "Ação".into(), 0.9);
889 let neighbour: Unit = (14.0, 62.0, 214.0, 110.0, "próxima".into(), 0.9);
891 assert!(unit_in_region(&crop, &own));
892 assert!(unit_in_region(&crop, &jittered));
893 assert!(!unit_in_region(&crop, &neighbour));
894 }
895
896 #[test]
900 fn tsv_words_group_into_lines() {
901 let tsv = "level\tpage_num\tblock_num\tpar_num\tline_num\tword_num\tleft\ttop\twidth\theight\tconf\ttext\n\
902 1\t1\t0\t0\t0\t0\t0\t0\t600\t160\t-1\t\n\
903 4\t1\t1\t1\t1\t0\t23\t28\t242\t25\t-1\t\n\
904 5\t1\t1\t1\t1\t1\t23\t28\t64\t20\t93.2\tHello\n\
905 5\t1\t1\t1\t1\t2\t94\t28\t93\t25\t92.4\tdocling\n\
906 5\t1\t1\t1\t1\t3\t195\t28\t70\t20\t96.0\tworld\n\
907 5\t1\t2\t1\t1\t1\t21\t98\t94\t20\t96.8\tSecond\n\
908 5\t1\t2\t1\t1\t2\t125\t98\t44\t20\t50\t \n\
909 5\t1\t2\t1\t1\t3\t179\t99\t44\t19\t96.8\t123\n";
910 let words = parse_tsv(tsv);
911 assert_eq!(words.len(), 5);
912 let lines = group_lines(&words);
913 assert_eq!(lines.len(), 2);
914 let (l, t, r, b, text, conf) = &lines[0];
915 assert_eq!(text, "Hello docling world");
916 assert_eq!((*l, *t, *r, *b), (23.0, 28.0, 265.0, 53.0));
917 assert!((conf - 0.9387).abs() < 1e-3, "{conf}");
918 assert_eq!(lines[1].4, "Second 123");
919 assert_eq!(word_units(&words).len(), 5);
920 assert!(parse_tsv("").is_empty());
921 assert!(parse_tsv("garbage\n5\t1\n").is_empty());
922 }
923
924 #[test]
925 fn osd_orientation_parses() {
926 let out = "Page number: 0\nOrientation in degrees: 270\nRotate: 90\n\
927 Orientation confidence: 6.47\nScript: Latin\nScript confidence: 4.05\n";
928 assert_eq!(parse_osd(out), Some(270));
929 assert_eq!(parse_osd("Orientation in degrees: 0\n"), Some(0));
930 assert_eq!(parse_osd("Orientation in degrees: 45\n"), None);
931 assert_eq!(parse_osd("Too few characters. Skipping this page\n"), None);
932 }
933
934 #[test]
935 fn psm_is_range_checked() {
936 assert_eq!(parse_psm("6"), Some(6));
937 assert_eq!(parse_psm(" 13 "), Some(13));
938 assert_eq!(parse_psm("0"), Some(0));
939 for bad in ["14", "-1", "300", "six", ""] {
940 assert_eq!(parse_psm(bad), None, "{bad:?}");
941 }
942 }
943}