Самый быстрый способ
Откройте Счётчик слов в PDF и перетащите на него PDF. Он читает текст каждой страницы в браузере и показывает слова, символы с пробелами и без, предложения, страницы и время чтения, а также таблицу слов по страницам. Файл никуда не загружается.
В Microsoft Word
Word для Windows умеет открывать PDF напрямую («Файл» → «Открыть»), превращая его в редактируемый документ. Число слов затем видно в строке состояния внизу окна. Преобразование может разбить или склеить некоторые строки, а сложная вёрстка может перенестись неаккуратно, но счёт обычно близок.
Копированием текста
Выделите весь текст в программе просмотра PDF (Ctrl+A или Cmd+A), скопируйте и вставьте в Счётчик слов. Для коротких документов это работает, но некоторые программы копируют только текущую страницу, а колонки и таблицы могут вставиться не по порядку. PDF в текст извлекает текст всех страниц за раз, если хотите сначала его отредактировать.
Почему инструменты считают по-разному
- Колонтитулы, номера страниц и сноски учитывают инструменты, читающие всю страницу, а некоторые текстовые редакторы пропускают.
- Слова с переносом, разбитые между строками, могут считаться за два.
- Числа, адреса и символы в одних инструментах считаются словами, в других нет.
Для ограничения по объёму уточните, что из этого в него входит. Список литературы и приложения обычно принято не считать.
Отсканированные PDF
Отсканированный PDF — набор картинок страниц без текста, поэтому любой счётчик показывает ноль слов. Сначала нужно распознавание текста (OCR); Google Диск умеет это, если открыть PDF в Google Документах, после чего текст можно посчитать.
Почему два инструмента расходятся
| Учитывается | Чтением страниц | Текстовым редактором |
|---|---|---|
| Колонтитулы | Да | Часто нет |
| Номера страниц | Да | Часто нет |
| Сноски | Да | Иногда |
| Текст на рисунках | Если это настоящий текст | Редко |
| Подписи и содержимое таблиц | Да | Да |
Разница в несколько процентов между инструментами нормальна. Для строгого лимита считайте то, что лимит охватывает, и указывайте, каким инструментом пользовались.
Языки без пробелов
Китайский, японский и тайский не ставят пробелы между словами, поэтому счётчик, разбивающий по пробелам, показывает слишком мало. Лимиты для них обычно задают в символах. Используйте число символов, а не слов.
Частые проблемы
- Число равно нулю. Страницы — изображения. Сначала запустите распознавание текста, затем считайте распознанный текст.
- Слова слиплись. Некоторые PDF хранят текст без настоящих пробелов, и программа должна угадывать их по положению. Там надёжнее число символов.
- Две колонки перемешались. Текст извлекается в том порядке, в котором записан в файл, а не всегда в порядке чтения. Лучше работает инструмент, сохраняющий вёрстку, или подсчёт по одной колонке.
- Переносы в конце строк. Слово, разбитое на две строки, может считаться за два. Удаление этих переносов перед подсчётом это исправляет.