В OCR-системе Google Docs появилась поддержка русского языка01.03.2011 17:45

Спустя восемь месяцев после включения в состав Google Docs механизма оптического распознавания текста из PDF-файлов или изображений форматов JPG, GIF, PNG, разработчики онлайнового офисного пакета сообщили о расширении списка поддерживаемых OCR-системой языков. Теперь алгоритмы последней обеспечивают распознавание текстов на 34 языках, включая русский.Элементы управления OCR-модулем расположены на странице загрузки файлов в Google Docs. Достаточно выставить галочку напротив опции "Преобразовывать текст из PDF-файлов или изображений в формат документов Google", и система автоматически извлечет из отсканированных документов и цифровых фотографий текстовые данные для их последующей правки в текстовом редакторе. Максимальный размер изображений перечисленных выше форматов и PDF-файлов составляет 2 Мбайта. В PDF-документах при поиске текста для распознавания просматриваются только первые десять страниц. С прочими ограничениями и особенностями OCR-системы можно ознакомиться на этой странице прилагаемой к Google Docs документации.В компании отмечают, что OCR-система Google Docs была разработана в сотрудничестве с командой проекта Google Books. По словам специалистов, распознавание лучше всего работает с изображениями в высоком разрешении, при этом алгоритмы системы не всегда хорошо справляются с сохранением стилевого оформления документов. Для того чтобы у пользователя была возможность быстро исправить ошибки распознавания, в обработанный документ включается оригинал изображения.Материалы по теме:Google расширила возможности пакета Google Docs;Пользователи Google Docs могут хранить на сервисе любые файлы;Google Docs начинает соревнование...