PDF в текст
Извлеките текст из PDF, чтобы скопировать или сохранить.
Работает в браузере. Ваши файлы никогда не покидают устройство.
- Копирование или скачивание в .txt
- Пакетная конвертация нескольких PDF
- Ничего не загружается
Как конвертировать PDF в текст
- Перетащите сюда файлы PDF.
- Дождитесь извлечения текста.
- Скопируйте его или скачайте файл .txt для каждого PDF.
Что извлечение сохраняет, а что нет
- Обычный текст каждой страницы, соединённый пустой строкой между страницами.
- Порядок чтения следует внутреннему порядку текста в самом PDF, который не всегда совпадает с визуальным макетом.
- Шрифты, полужирное и курсивное начертание, цвета и изображения не сохраняются, остаются только сами слова.
- Таблицы и многоколоночные страницы могут выйти с перемешанными ячейками или колонками, а не в аккуратном порядке чтения.
Один файл или несколько
Добавьте в очередь один PDF, и извлечённый текст также появится в поле на странице с кнопкой Копировать, готовый для вставки в другое место.
Добавьте больше одного PDF, и каждый скачается как отдельный файл .txt, либо все вместе одним ZIP-архивом, ведь показывать несколько документов в одном поле было бы бесполезно.
Веские причины извлечь текст из PDF
- Скопировать абзац или пункт договора в письмо, не перепечатывая его вручную.
- Перенести текст отчёта в текстовый редактор, чтобы свободно его редактировать.
- Сравнить две версии документа, вставив их обычный текст в инструмент сравнения.
- Передать слова из PDF в другой инструмент этого сайта, например Счётчик слов, который читает только обычный текст.
Частые вопросы о PDF в текст
Почему текстовый файл пустой?
Отсканированные PDF это фотографии страниц без текстового слоя, поэтому извлекать нечего. Вместо этого используйте Изображение в текст, который читает текст с картинки.
Это сохраняет исходное форматирование?
Нет. Колонки, таблицы и шрифты не сохраняются, остаётся только обычный текст, примерно в том порядке, в каком он идёт на странице.
Можно конвертировать сразу несколько PDF?
Да. Перетащите сколько угодно файлов и скачайте каждый файл .txt или все сразу одним ZIP-архивом.
Мой документ загружается?
Нет. Текст извлекается полностью в вашем браузере.
Сохраняются разбиения на абзацы и строки?
Текст каждой страницы отделяется пустой строкой. Переносы внутри страницы следуют внутреннему порядку текста в самом PDF, который обычно совпадает с видимыми строками, но это не гарантировано.
Многоколоночный макет извлечётся в правильном порядке?
Не всегда. Извлечение следует порядку, в котором текст хранится внутри PDF, а не визуальным колонкам, поэтому страница с двумя колонками может выйти с перемешанными колонками.
Это работает с PDF, защищёнными паролем?
Не напрямую. Сначала снимите пароль инструментом Снять пароль с PDF, а затем пропустите разблокированный файл через этот инструмент.
Что если настоящий текст есть только на части страницы?
Эта часть всё равно извлечётся нормально. Страница, где текстовый абзац соседствует с отсканированным изображением, вернёт только абзац, ведь у части-изображения нет текстового слоя для чтения.