Два вида сравнения
Текстовое сравнение извлекает слова из обоих файлов и выравнивает их, показывая добавленные, удалённые и изменённые формулировки. Визуальное сравнение накладывает страницы как картинки и подсвечивает, где различаются пиксели. Договорам, коммерческим предложениям и отчётам нужно первое. Чертежам, логотипам и макетам вёрстки — второе.
Что ловит текстовое сравнение
- Добавленные или удалённые пункты.
- Изменённые числа: дату, цену, срок уведомления.
- Одно поменявшееся слово, например «может» на «обязан», — такую правку беглое чтение никогда не найдёт.
Оно не заметит сменившийся шрифт, сдвинутую картинку или блок подписи, переехавший на следующую страницу, потому что текст от этого не меняется.
Чего оно не ловит
Если PDF — скан, сравнивать нечего: страница — это фотография слов. Сначала распознайте текст, затем сравнивайте распознанное. Распознавание не идеально, так что горстку странных различий в один символ считайте скорее ошибками распознавания, чем настоящими правками.
Как читать результат
Сравнение работает построчно, поэтому одно вставленное предложение может сбить все следующие строки и подсветить весь остаток страницы. Смотрите, где начинается различие, а не на объём подсветки. Перетекающие абзацы при смене полей дают то же самое: слова идентичны, но все переносы строк сдвинулись.
Перед сравнением
- Проверьте число страниц. Если оно различается, изменилось что-то в структуре, и это стоит найти первым.
- Сравните число слов. Большой разрыв говорит о перемещении содержимого; одинаковое число при различиях — о замене формулировок.
- Берите одинаковые разделы. Сравнение полного документа с выдержкой даёт шум, а не информацию.
Конфиденциальность
Договоры, зарплатные ведомости и медицинские документы — именно то, что люди загружают на чужой сервер, чтобы найти различие. Сравнение, работающее в браузере, никуда не отправляет файл, и для чего-либо конфиденциального стоит пользоваться только им.
Инструменты
Сравнить PDF-файлы выравнивает текст двух PDF и отмечает изменения в браузере. Сравнение текстов делает то же для вставленного текста, Счётчик слов в PDF даёт числа для быстрой проверки, а Изображение в текст (OCR) распознаёт слова на отсканированной странице, чтобы было что сравнивать.