Распознавание текста с картинки (OCR)

Извлеките текст из фото или скриншота.

Работает в браузере. Ваши файлы никогда не покидают устройство.

Как извлечь текст из изображения

  1. Перетащите сюда фото или скриншот.
  2. Подождите несколько секунд, пока текст распознаётся.
  3. Скопируйте или скачайте результат.

Что OCR читает хорошо

ИсточникРезультат
Чёткий скриншот напечатанного текстаОтлично, обычно уверенность 95% и выше
Скан печатного документаОчень хорошо
Фото вывески или страницы анфасХорошо
Фото под углом, размытое или при слабом светеПлохо, много ошибок
Рукописный текстНенадёжно, лучше всего работает с очень аккуратным почерком

Как работает оценка уверенности

Движок OCR возвращает процент уверенности для всего извлечения, собственную оценку того, насколько он уверен в найденном тексте. Выше примерно 90 результат обычно точен. Ниже 70 сверяйте результат с исходным изображением, прежде чем доверять ему, особенно для имён, чисел и дат, которые небольшая ошибка распознавания могла бы исказить.

Как получить результат получше

  • Обрежьте всё, что не является текстом, перед загрузкой, например пёстрый фон или фото, поскольку OCR пытается прочитать узоры во всём подряд.
  • Сначала выровняйте фото, снятое под углом, инструментом TabbyKit «Повернуть изображение». Наклонный текст сбивает этап определения строк.
  • Более высокое разрешение помогает лишь до определённого предела. Размытое фото высокого разрешения всё равно распознаётся хуже, чем чёткое фото с более низким разрешением.
  • Хорошее ровное освещение без бликов лучше, чем более яркое, но неравномерно освещённое фото.
  • Плоский скан страницы анфас почти всегда даёт лучший результат, чем фото той же страницы, снятое рукой, даже хорошей камерой.

Как работает этот движок OCR

Этот инструмент использует Tesseract, open-source движок OCR, изначально разработанный в HP и сейчас поддерживаемый Google, полностью внутри вашего браузера в виде WebAssembly. Модель распознавания текста скачивается один раз, а каждое следующее фото читается уже на вашем устройстве без участия сервера.

Частые вопросы о Распознать текст с картинки

Какие языки поддерживает этот инструмент?

Он читает 17 языков: английский, испанский, португальский, французский, немецкий, итальянский, индонезийский, турецкий, японский, русский, вьетнамский, польский, нидерландский, корейский, тайский, украинский и арабский. По умолчанию выбран язык самой страницы, выберите другой в списке «Язык текста» перед тем как добавить изображение. Лучшие результаты получаются на чётком печатном тексте.

Может ли он читать рукописный текст?

Иногда он может прочитать очень аккуратный почерк, но OCR создан для печатного текста и плохо справляется с курсивом или неряшливым почерком.

Что означает оценка уверенности?

Это собственная оценка движка OCR того, насколько он уверен в тексте, от 0 до 100. Выше примерно 90 результат обычно точен, а ниже 70 стоит сверить его с исходным изображением.

Почему скриншот распознаётся лучше, чем фото?

У скриншотов и сканов ровное освещение и чёткие края. Фото, снятое под углом, с тенями или размытием, даёт OCR меньше материала для работы.

Моё изображение загружается на сервер?

Нет. Движок OCR скачивается один раз в браузер, а каждое следующее фото читается уже на вашем устройстве.

Почему не удалось прочитать моё изображение?

Это случается редко, только если сам файл изображения не удаётся декодировать. Попробуйте другое фото или прямой скриншот вместо фото экрана.

Можно скопировать только часть извлечённого текста?

Да. Результат появляется в редактируемом текстовом поле, поэтому можно выделить, скопировать или отредактировать любую его часть перед скачиванием.

Это работает с PDF?

Не напрямую. Сначала сделайте скриншот страницы PDF или экспортируйте её как изображение, затем перетащите это изображение сюда.

Можно использовать это на телефоне?

Да. Всё работает в браузере, включая мобильные Safari и Chrome, хотя очень большое фото может занять на старом телефоне несколько лишних секунд.

Похожие инструменты