Toolyard

Как посчитать слова в PDF

Самый быстрый способ

Откройте Счётчик слов в PDF и перетащите на него PDF. Он читает текст каждой страницы в браузере и показывает слова, символы с пробелами и без, предложения, страницы и время чтения, а также таблицу слов по страницам. Файл никуда не загружается.

В Microsoft Word

Word для Windows умеет открывать PDF напрямую («Файл» → «Открыть»), превращая его в редактируемый документ. Число слов затем видно в строке состояния внизу окна. Преобразование может разбить или склеить некоторые строки, а сложная вёрстка может перенестись неаккуратно, но счёт обычно близок.

Копированием текста

Выделите весь текст в программе просмотра PDF (Ctrl+A или Cmd+A), скопируйте и вставьте в Счётчик слов. Для коротких документов это работает, но некоторые программы копируют только текущую страницу, а колонки и таблицы могут вставиться не по порядку. PDF в текст извлекает текст всех страниц за раз, если хотите сначала его отредактировать.

Почему инструменты считают по-разному

  • Колонтитулы, номера страниц и сноски учитывают инструменты, читающие всю страницу, а некоторые текстовые редакторы пропускают.
  • Слова с переносом, разбитые между строками, могут считаться за два.
  • Числа, адреса и символы в одних инструментах считаются словами, в других нет.

Для ограничения по объёму уточните, что из этого в него входит. Список литературы и приложения обычно принято не считать.

Отсканированные PDF

Отсканированный PDF — набор картинок страниц без текста, поэтому любой счётчик показывает ноль слов. Сначала нужно распознавание текста (OCR); Google Диск умеет это, если открыть PDF в Google Документах, после чего текст можно посчитать.

Почему два инструмента расходятся

УчитываетсяЧтением страницТекстовым редактором
КолонтитулыДаЧасто нет
Номера страницДаЧасто нет
СноскиДаИногда
Текст на рисункахЕсли это настоящий текстРедко
Подписи и содержимое таблицДаДа

Разница в несколько процентов между инструментами нормальна. Для строгого лимита считайте то, что лимит охватывает, и указывайте, каким инструментом пользовались.

Языки без пробелов

Китайский, японский и тайский не ставят пробелы между словами, поэтому счётчик, разбивающий по пробелам, показывает слишком мало. Лимиты для них обычно задают в символах. Используйте число символов, а не слов.

Частые проблемы

  • Число равно нулю. Страницы — изображения. Сначала запустите распознавание текста, затем считайте распознанный текст.
  • Слова слиплись. Некоторые PDF хранят текст без настоящих пробелов, и программа должна угадывать их по положению. Там надёжнее число символов.
  • Две колонки перемешались. Текст извлекается в том порядке, в котором записан в файл, а не всегда в порядке чтения. Лучше работает инструмент, сохраняющий вёрстку, или подсчёт по одной колонке.
  • Переносы в конце строк. Слово, разбитое на две строки, может считаться за два. Удаление этих переносов перед подсчётом это исправляет.

Инструменты из этого руководства

Другие руководства