Темы



Выпуск системы распознавания текста GNU Ocrad 0.29

После двух лет разработки сформирован релиз системы распознавания текста Ocrad 0.29 (Optical Character Recognition), развиваемой под эгидой проекта GNU. Ocrad может применяться как в форме библиотеки для интеграции функций OCR в другие приложения, так и в форме обособленной утилиты, которая на основе переданного на вход изображения выдаёт текст в UTF-8 или 8-битных кодировках.

Для оптического распознавания в Ocrad используется метод выделение признаков (feature extraction). В состав входит анализатор макета страницы, позволяющий корректно разделять столбцы и блоки текста в печатных документах. Распознавание поддерживается только для символов из кодировок «ascii», «iso-8859–9» и «iso-8859–15» (поддержка кириллицы отсутствует).

В новой версии:

  • Улучшено распознавание начертания буквы «L» с наклонённой правой частью.
  • При использовании опции '-o' ('--output') обеспечено создание недостающих промежуточных каталогов, указанных в заданном пути к файлу.
  • В сборочный файл configure и в Makefile.in добавлена переменная MAKEINFO.
  • Диагностические сообщения, связанные с файловыми операциями, преобразованы в форму 'PROGRAM: FILE: MESSAGE'.
  • В сообщениях об использовании некорректных аргументов командной строки обеспечен пока аргумента и имени опции.



Источник: http://www.opennet.ru/opennews/art.shtml? num=60471

© OpenNet