Откуда берутся дубликаты
Повторы появляются при любом объединении данных: выгрузили список из двух источников, склеили базы подписчиков, собрали ключевые слова из разных отчётов. Вручную искать повторы в списке на тысячу строк бессмысленно.
- Списки email и телефонов — перед рассылкой, чтобы не отправить письмо дважды
- Ключевые слова — при сборе семантики из нескольких источников
- Ссылки — очистка перед массовой проверкой или парсингом
- Артикулы и коды — сверка товарных позиций
- Логи — выделение уникальных ошибок из потока
Настройки, которые важны
Игнорирование регистра нужно почти всегда: для почты и доменов регистр значения не имеет, и Ivan@mail.ru с ivan@mail.ru — один и тот же адрес. Но для паролей, идентификаторов и чувствительных к регистру данных опцию стоит отключить.
Обрезка пробелов убирает невидимые различия. Строка с пробелом в конце технически отличается от такой же без пробела, хотя визуально они одинаковы — это самая частая причина «неработающего» удаления дублей в Excel.
Сортировка по частоте
Этот режим показывает не просто уникальные строки, а их рейтинг по количеству повторов. На списке поисковых запросов он выявит самые частые, на логах — самые распространённые ошибки, на списке товаров — популярные позиции.
Что стоит знать
- Сравнение точное, не смысловое. «Иван Петров» и «Петров Иван» — разные строки
- Опечатки не распознаются. Адрес с ошибкой в одной букве считается уникальным
- Порядок сохраняется по умолчанию. Из группы одинаковых остаётся первая встреченная строка
- Регистр в результате. При игнорировании регистра сохраняется написание первого вхождения