Сравнение движков распознавания текста

Use Case Версия: 0.1 draft

Главный актор
Аналитик

Аналитик прогоняет одни и те же поля/страницы через разные движки (Qwen-VL, Yandex OCR), чтобы выбрать пригодный для вида данных — печатный или рукописный текст.

⟨/⟩ Исходник

1. Given

2. When

  1. Аналитик выбирает движок текста: Qwen-VL (локальный VLM) или Yandex OCR (модель рукописного текста).
  2. Прогоняет одни и те же поля и сравнивает распознанные значения по читаемому списку и сырому JSON.
  3. При необходимости — сверяет grounding (координаты найденного) и подсветку областей.

3. Then

4. Альтернативы и ошибки

Ситуация Поведение
Облачный Yandex недоступен или лимит Остаётся локальный Qwen-VL; Yandex — один запрос на страницу против частых мелких
Рукопись неразборчива VLM-промт запрещает выдумывать: пустая строка вместо догадки
Нужны координаты найденного Yandex отдаёт измеренные боксы слов (в отличие от оценочного grounding VLM)

5. Трассировка

Шаг Инструмент
Сравнение движков текста, grounding, подсветка ocr-labs/, editor/apply-template.html
Прокси к Yandex/Qwen server/proxy.py

Эпик — эпик «Стенд распознавания карт».

Связанные артефакты

Документы