diff --git a/tests/unit/test_doc_classifier.py b/tests/unit/test_doc_classifier.py index 587e1caa..d875a04b 100644 --- a/tests/unit/test_doc_classifier.py +++ b/tests/unit/test_doc_classifier.py @@ -188,8 +188,9 @@ def test_classify_from_text_no_pages_routes_fast(): def test_classify_from_text_junk_layer_flags_bad_text_layer(): - # Non-zero chars but low quality on every page (high ocr_frac) -> ocr + - # bad_text_layer (gated on ocr_frac, matching classify_pdf). + # Each short segment ( high ocr_frac, and + # total_chars>0 with mean_quality bad_text_layer (gated on ocr_frac, matching classify_pdf). text = "x1y2zx1y2z" c = clf.classify_from_text( text,