Files
kebab/crates/kebab-parse-pdf/tests/ocr_e2e.rs
altair823 da323af87b refactor(config): OCR 중복 제거 — 공유 [ingest.ocr] 엔진 블록 + v4→v5 마이그레이션
Phase 2 Unit 1. OcrCfg(image) 13필드가 PdfOcrCfg(pdf) 와 전부 중복(image 고유
0, pdf 고유 4) + apply_env 에 KEBAB_IMAGE_OCR_*/KEBAB_PDF_OCR_* 27 arm 복제를
제거한다.

- 신규 SharedOcrEngineCfg(13 공유 필드, 전부 Option, default None) = [ingest.ocr].
  엔진 설정 단일 출처. image/pdf 블록은 on/off 토글 + override.
- load-time resolution(Config::resolve_ocr, from_file 호출): 공유 필드가 Some 이고
  미디어 블록이 그 키 미명시면 concrete OcrCfg/PdfOcrCfg 로 overlay(presence 는
  toml::Value 로 판정; 미디어 > 공유 > 내장 default). struct 필드는 그대로 두고
  엔진 필드에 #[serde(default)] 만 추가(slim 블록 파싱) → image(gemma4:e4b/1600)
  vs pdf(qwen2.5vl:3b/2048) 미디어별 기본값 보존.
- resolver Config::image_ocr()/pdf_ocr() 추가. consumer(kebab-parse-image,
  kebab-app build_*_ocr_engine·ingest gate·pdf_ocr_apply·ingest_config_signature)가
  전부 경유 → god-struct 직접 read 제거.
- apply_env: 27 arm → 공유 KEBAB_OCR_* 12 arm(image+pdf 동시) + pdf 고유 4 arm +
  미디어별 KEBAB_IMAGE_OCR_ENABLED/KEBAB_PDF_OCR_ENABLED.
- step_4_to_5: [ingest.image.ocr] 12 엔진 키를 [ingest.ocr] 로 move_table(enabled
  제외). pdf 블록 무손상(reconcile 이 채워 공유 overlay 오염 X). annotated_default
  도 동일 통합으로 v5 canonical 형상. CURRENT_SCHEMA_VERSION=5.
- v4→v5 round-trip 테스트(비-default image engine 보존 + pdf 오염 X + 멱등). effective
  OCR 바이트 동일 → ingest_config_signature 불변 → 강제 재색인 없음.

검증: clippy --workspace --all-targets 0 / kebab-config·kebab-parse-image·
kebab-parse-pdf·kebab-app 테스트 pass. surface: README [ingest.ocr] 절 + SMOKE
config 블록 + DOGFOOD env + HOTFIXES dated entry.

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_012Mc6W1fgsrbFKTsqA6P8La
2026-06-24 11:03:39 +00:00

64 lines
2.4 KiB
Rust

// § Acceptance §9 #3: real Ollama qwen2.5vl:3b 의 alnum accuracy.
// F1 ≥ 0.85, F2 ≥ 0.70. real Ollama 의존 — `#[ignore]` default.
//
// Manual invoke:
// KEBAB_OCR_ENDPOINT=http://192.168.0.47:11434 \
// cargo test -p kebab-parse-pdf --test ocr_e2e --ignored -j 4
use kebab_core::Lang;
use kebab_parse_image::{OcrEngine, OllamaVisionOcr};
use kebab_parse_pdf::extract_dctdecode_page_image;
use lopdf::Document;
fn run_real_ollama_ocr(pdf: &[u8], page: u32) -> anyhow::Result<String> {
// v5: shared KEBAB_OCR_* env (manual harness reads it directly).
let endpoint = std::env::var("KEBAB_OCR_ENDPOINT")
.unwrap_or_else(|_| "http://localhost:11434".to_string());
let doc = Document::load_mem(pdf)?;
let jpeg = extract_dctdecode_page_image(&doc, page)?
.ok_or_else(|| anyhow::anyhow!("page {page} 의 DCTDecode image XObject 부재"))?;
let engine = OllamaVisionOcr::from_parts(
endpoint,
"qwen2.5vl:3b".to_string(),
vec!["eng".to_string(), "kor".to_string()],
2048,
600,
)?;
let result = engine.recognize(&jpeg, Some(&Lang("kor".into())))?;
Ok(result.joined)
}
fn alnum_accuracy(actual: &str, expected: &str) -> f32 {
let a: String = actual.chars().filter(|c| c.is_alphanumeric()).collect();
let e: String = expected.chars().filter(|c| c.is_alphanumeric()).collect();
if e.is_empty() {
return 0.0;
}
let dist = strsim::levenshtein(&a, &e) as f32;
((e.chars().count() as f32 - dist) / e.chars().count() as f32).max(0.0)
}
#[test]
#[ignore = "real Ollama qwen2.5vl:3b dependency"]
fn f1_alnum_accuracy_ge_85() {
let pdf = include_bytes!("fixtures/scanned_page1.pdf");
let ocr = run_real_ollama_ocr(pdf, 1).expect("OCR");
let expected = include_str!("fixtures/scanned_page1_truth.txt");
let accuracy = alnum_accuracy(&ocr, expected);
println!("F1 alnum accuracy = {accuracy:.4}");
assert!(accuracy >= 0.85, "F1 alnum accuracy {accuracy:.4} < 0.85");
}
#[test]
#[ignore = "real Ollama qwen2.5vl:3b dependency"]
fn f2_alnum_accuracy_ge_70() {
let pdf = include_bytes!("fixtures/scanned_page2.pdf");
let ocr = run_real_ollama_ocr(pdf, 1).expect("OCR");
let expected = include_str!("fixtures/scanned_page2_truth.txt");
let accuracy = alnum_accuracy(&ocr, expected);
println!("F2 alnum accuracy = {accuracy:.4}");
assert!(accuracy >= 0.70, "F2 alnum accuracy {accuracy:.4} < 0.70");
}