«Проверьте текст на уникальность» — совет, который дают, не уточняя, чем проверять. Уточнение решает всё: один и тот же абзац получает и 3 %, и 98 % в зависимости от настроек, которых проверяющий не видит. Мы посчитали это сами, на своём тексте и своим кодом.
Что мы посчитали
| Что проверяли | Результат |
|---|---|
| Один абзац, шингл 3 слова, корпус со статьёй-источником | 3,1 % |
| Тот же абзац, шингл 10 слов, корпус без статьи-источника | 97,8 % |
| Разброс на одном тексте от смены двух настроек | 3–98 % |
| Кусок 300 знаков против того же текста в 1302 знака | 100 % против 92,6 % |
| Страниц в справке Яндекса для вебмастеров | 272 |
| Из них упоминают корень «уникальн» | 35, порога в процентах — ни одного |
| Наших статей с дословными цитатами | 42 из 187, до 29,5 % объёма |
| Уникальность наших статей на фоне своего же блога | медиана 96,4 %, минимум 65,4 % |
| Сервисов, которые удалось проверить машиной | 0 из 3 |
Как устроена проверка
Текст режется на шинглы — цепочки подряд идущих слов. Каждый шингл ищется в корпусе: в индексе поиска, в базе сервиса, в списке страниц. Уникальность — доля шинглов, которые нигде не нашлись.
Отсюда то, о чём не пишут на странице результата: число зависит от двух настроек. Первая — длина шингла: чем он длиннее, тем реже совпадает и тем выше процент. Вторая — корпус: нашлась ли в нём страница, где текст уже опубликован.
Ни один из четырёх проверенных нами сервисных разделов длину шингла не называет. Мы искали слово «шингл» на страницах text.ru, content-watch.ru и be1.ru — ноль вхождений.
Один абзац, два числа
Взяли 1302 знака из своей статьи «Трафик, которого нет», опубликованной и доступной поиску. Корпус — 187 статей нашего блога, 157 678 слов. Считали сами, кодом в десять строк.
| Длина шингла | Корпус со статьёй-источником | Корпус без неё |
|---|---|---|
| 3 слова | 3,1 % | 87,4 % |
| 4 слова | 4,7 % | 92,6 % |
| 5 слов | 6,3 % | 94,7 % |
| 7 слов | 9,6 % | 96,3 % |
| 10 слов | 14,7 % | 97,8 % |
Текст один, разброс — от 3 до 98 %. Левый столбец увидит сервис, нашедший исходную страницу; правый — сервис, до неё не добравшийся: страница молодая, закрыта от индексации или не попала в его базу.
Правильного среди этих чисел нет: каждое верно при своих настройках.
Длина куска двигает число тоже
Тот же текст, тот же корпус, шингл в четыре слова — меняем только сколько знаков проверяем:
| Длина куска | Уникальность |
|---|---|
| 300 знаков | 100 % |
| 500 знаков | 95,8 % |
| 800 знаков | 96,6 % |
| 1000 знаков | 90,3 % |
| 1302 знака | 92,6 % |
Короткий кусок почти всегда уникальнее: шинглов меньше, и одно совпадение весит больше. Проверять абзацами и проверять статью целиком — две разные проверки с разными ответами.
В справке Яндекса нет слова «уникальность»
Мы скачали все страницы справки для вебмастеров — их 272. Корень «уникальн» встречается на 35, почти всегда про уникальный идентификатор объявления, адрес страницы или описания. Порога в процентах нет ни на одной странице.
Нарушение, о котором идёт речь, называется иначе:
Малополезный контент — это информация, которая не несет дополнительную ценность пользователю и не решает его задачу.
Копирование описано признаками:
Контент скопирован полностью или частично с других ресурсов. Информация с нескольких страниц первоисточника собрана в одну. Материал скопирован из меняющегося источника. Информация взята из первоисточника с минимальными изменениями (например, заменили несколько слов).
Последняя строка закрывает рерайт: замена слов от нарушения не спасает, хотя процент поднимает. Само слово «скопирован» справка определяет через затраты, а не через совпадение:
Это способ создания контента, который не требует затрат времени, усилий и специальных навыков, а также ручного редактирования или обработки текста.
Сервис штрафует то, что поиск разрешает
В той же справке есть список того, что малополезным не признаётся:
Оригинальные описания товаров, услуг, событий, организаций, компьютерных программ, инструкций к применению и руководств по эксплуатации. Тексты книг, песен, анекдотов, цитат и афоризмов. Официальные документы, законы, стандарты, шаблоны документов. Пресс-релизы. Собственные тексты сайта, опубликованные на других платформах.
Каждая строка списка в любой проверке даёт совпадение. Закон совпадает с текстом закона, цитата — с источником, свой текст из соцсети — сам с собой.
Для нас это не теория. В 42 наших статьях из 187 есть дословные цитаты: справки Яндекса, законов, приказов. У статьи про уведомление в РКН они занимают 29,5 % объёма — 265 слов из 897. Проверка отнимет эти проценты, а справка Яндекса ровно такой контент из-под нарушения выводит.
Наш блог на фоне самого себя
Честный замер про себя. Мы сравнили каждую из 187 статей со всеми остальными статьями блога — шингл в четыре слова, чужих сайтов в корпусе нет:
- медиана — 96,4 %;
- ниже 95 % — 63 статьи, ниже 90 % — 32;
- минимум — 65,4 %.
Внизу списка — серия городских обзоров: сайты строительных компаний, ветклиник, мебельных производств, автошкол. У них общий каркас: одна методика, одни заголовки разделов, одни формулировки выводов. По существу каждая статья про свою выборку, а по шинглам треть текста повторяется.
Внешний сервис этого не покажет: он ищет по всему интернету, а не внутри одного блога. Но при разборе малоценных страниц смотреть надо сюда — на собственную шаблонность.
Три сервиса проверить машиной не вышло
План был прогнать абзац через три бесплатные проверки и показать разброс. Не получилось, и причина показательна:
- be1.ru после нажатия «Проверить» выдаёт капчу с картинками;
- content-watch.ru прямо пишет в условиях: «Использовать любые средства автоматического доступа к сервису запрещено»;
- text.ru без регистрации и ключа к программному интерфейсу не пускает.
Обходить капчу и запрет мы не стали. Вывод: у чисел, полученных руками в трёх окнах, нет журнала и нет повторяемости. Сравнивать их между собой — сравнивать три замера с неизвестными настройками.
Свой замер воспроизводим: корпус лежит в репозитории, настройки названы, код умещается в десяток строк.
Что делать вместо погони за процентом
Смотреть на список совпадений, а не на число. Сервис показывает, с какими страницами совпал текст. Дальше три случая:
- Совпадение с чужой статьёй длинными кусками — проблема, и число тут не нужно, видно и так.
- Совпадение с текстом закона, ГОСТа, справки — не проблема, справка Яндекса прямо выводит это из-под нарушения.
- Совпадение с самим собой: своей страницей, своим постом в соцсети, своей прошлой статьёй. Первые два безобидны, третий стоит посмотреть — это про шаблонность, а не про плагиат.
Рерайт ради процента — работа против себя: цифру поднимает, а по признакам из справки не меняет ничего.
Границы замера
Мы считали своим кодом по своему корпусу — 187 статей одного блога. Это не интернет: сервисы ищут по индексу поиска, и их числа с нашими сравнивать нельзя. Замер показывает, как настройки двигают результат, а не какой процент выдаст конкретный сервис.
Три сервиса мы не проверили — капча и запрет автоматического доступа. Разброс между сервисами у нас не измерен: измерен разброс от настроек, а различие настроек у них предполагается, раз длину шингла не публикует ни один.
Лемматизацию мы не делали: шинглы считались по словоформам. Сервисы, которые приводят слова к начальной форме, на тех же текстах дадут числа ниже наших.
Справку Яндекса мы читали 22 сентября 2026 года в машинной версии страниц. Справку Google в этот замер не брали.
Коротко
- Уникальность — не свойство текста, а результат сравнения с настройками.
- Меняя только длину шингла и корпус, мы получили на одном абзаце 3 % и 98 %.
- Короткий кусок почти всегда «уникальнее» длинного.
- В справке Яндекса на 272 страницах нет порога уникальности в процентах.
- Нарушение называется «малополезный контент» и описано признаками.
- Цитаты законов и свои тексты с других площадок справка выводит из-под нарушения, а проверка их считает совпадением.
- Смотреть надо на список совпадений, а не на процент.
