Adult-сайты. Мифы и реальность

В октябре 2010 года Яндекс внедрил специальный алгоритм, позволяющий с высокой степенью вероятности определять документы, содержащие рекламу «для взрослых». Под предполагаемый новый фильтр попали сайты, не содержащие ничего крамольного, кроме медийной рекламы. Сайты, на которых никогда не было «взрослого» контента также подверглись пессимизации.

Возник ряд вопросов:

  • Как Яндекс относится к ссылкам с таких сайтов?
  • Как Яндекс относится к ссылкам с сайтов, на которых встречаются adult-слова (ведь не все вебмастера модерируют, например, продаваемые ссылки со своих площадок, либо на сайте встречаются омонимы adult-словам)?
  • Как Яндекс относится к ссылкам со страниц, на которых встречаются adul-слова?

Используя различные выборки самой крупной биржи ссылок Sape.ru, была составлена следующая репрезентативная таблица, из которой видно, насколько засорена донорская база ссылок.

Таблица 1. Характеристики биржи Sape

По процентам, сайты с вхождениями adult-слов составляют менее 2%, однако число документов достаточно большое. На фоне данных цифр было принято решение провести исследование следующего содержания:

  • Выяснить, существует ли подобный фильтр по отношению к донорам.
  • Провести корреляционный анализ между позициями анкоров и вероятностью попадания донора под фильтр.
  • Выявить вероятность попадания ссылок с популярных бирж под семейный фильтр.

Типы сайтов с adult-контентом

Все сайты с контентом, на котором встречаются adult-слова можно разделить на 3 группы.

Первая группа — непосредственно сайты со «взрослым» содержанием.

Вторая группа — сайты, на которых встречаются adult-слова или ссылки на adult-сайты с соответствующими анкорами.

Третья группа — новости, медицинские сайты, сайты, в которых встречаются соответствующие омонимы.

Рис. 1. Типы сайтов с adult-контентом

Настоящие adult-сайты и ссылки с них

Для анализа ссылок с подобных доноров была отобрана небольшая база, которая исследовалась с помощью забытой методики «непот»: [(«уникальный_анкор») (url:домен_донора* | url:домен_сайта*)]. Главным условием отбора анкоров были уникальность и отсутствие точной фразы на сайте-акцепторе, т.е. поиск по НПС для минимизации влияния текстовой составляющей сайта.

В результате наблюдались следующие закономерности:

1. «Взрослые» сайты не ищутся в семейном поиске Яндекса (family.yandex.ru), поэтому в результате поиска точной фразы на доноре и акцепторе в семейном поиске — находится только НПС акцептора. В поиске без ограничений — присутствуют обе ссылки:

Рис.2. Семейный поиск. Донор adult-сайт

Рис. 3. Поиск без ограничений. Донор adult-сайт

2. В противовес ссылкам с adult-доноров, ссылки с обычных сайтов отображаются как в стандартном поиске, так и в семейном:

Рис. 4. Семейный поиск. Донор не adult-сайт

Рис. 5. Поиск без ограничений. Донор не adult-сайт

3. В выдаче без ограничений, НПС с adult-донора ниже, чем с обычного донора. Можно предположить, что текстовая составляющая анкора на adult-сайте перебивает передающий вес ссылки с этого сайта. ВАЖНО, чтобы анкор был уникальным, иначе порядок может не соблюдаться. Подобный пример, но с донором, не принадлежащем категории adult, где НПС выше, чем текстовая составляющая анкора:

Рис. 6. Взаимное положение акцептора и adult-донора в выдаче.

Рис. 7. Взаимное положение акцептора и донора не «adult» в выдаче.

На практике, ссылки с подобных сайтов не покупаются, поэтому провести более глубокое исследование не получилось, однако, с вероятностью 99%, можно говорить, что вес с таких ссылок меньший, чем с обычных сайтов!

Сайты с adult-словами

Покупая ссылки на донорах и проверяя эти страницы с помощью стандартного плагина для Firefox — Вебмастер SAPE 2\.10\.2 от автора Wink-RU, мы не проверяем весь сайт на наличие страниц со «взрослыми» словами. Чтобы выяснить, существует ли фильтр, накладывающийся на весь сайт и влияющий на ссылочную массу акцептора, было проведено корреляционное исследование.

Для этой цели был разработан инструмент, на вход которого подавался список url для проверки его наличия в выдачи «семейного поиска». Также данный инструмент позволял определить вероятность попадания всего сайта под гипотетический фильтр «ты взрослый». Вероятность рассчитывалась, как отношение разности количества страниц сайта, найденных в поиске без ограничения, и количества страниц, найденных в семейном поиске, к количеству страниц, найденных в поиске без ограничения:

где C unrestricted — количество страниц, найденное на сайте в поиске без ограничения;

C family — количество страниц, найденное на сайте в семейном поиске.

Корреляционный анализ проводился на отобранной базе ссылок, участвующих в непосредственном процессе продвижения, и собранных позиций соответствующих анкоров. К сожалению, назвать данный анализ «чистым» нельзя, т.к. все сайты оптимизированы по-разному, авторитетность сайтов — разная, количество ссылок на запросы также разное. Однако даже в этом случае присутствие фильтра, наложенного на весь сайт, должно было отразиться на позициях разбавленных анкоров.

Итоговые результаты представлены в таблице 2 и 3 ниже.

Таблица 2. Итоговая таблица корреляционного анализа по всем запросам

Таблица 3. Итоговая таблица корреляционного анализа по всем сайтам по усредненным показателям

Ссылок не в СП — это количество ссылок, которые не в индексе при поиске по семейному поиску.

Доноров с P>70 — это количество доноров, теоретическая вероятность которых больше порогового значения 70%. Выявлено на следующем этапе исследования.

Ср. НИ в СП — соответственно, среднее количество ссылок, которые не в индексе при поиске по семейному поиску, рассчитывается как отношение показателя «Ссылок не в СП» к общему количеству ссылок.

Ср. P>70 — соответственно, среднее количество доноров, теоретическая вероятность которых больше порогового значения 70%. Рассчитывается как отношение показателя «Доноров с P>70» к общему количеству ссылок.

Из таблиц видно, что корреляция очень слабая. Шкала корреляции представлена ниже:

Можно сделать вывод, что даже если существует фильтр «ты взрослый» — он накладывается не на сайт (корреляция позиции и Доноров с P>70 низкая). А наличие в индексе страницы в семейном поиске требует более глубокой проработки в виде экспериментов на чистых сайтах.

Статистика по биржам

На основе покупаемых ссылок проектов на разных биржах и проверки их по алгоритму, расписанному выше, был получен следующий результат:

Рис. 8. Результат проверки бирж по проставленным ссылкам.

Как видно из графика, в основном все купленные в рамках продвижения проектов ссылки имеют хорошие показатели, не превышающие в среднем 10%. Из графика ниже (увеличенный масштаб на интервале 50-100%) можно сделать вывод, что интервал 70-100%, т.к.

Рис. 9. Увеличенный масштаб графика проверки бирж на интервале 50-100%

В таблице 4 представлены проценты доноров, у которых 100% отсутствие страниц в индексе семейного поиска и у которых данный показатель лежит на интервале 70-100%.

Таблица 4. Вероятность теоретического adult-фильтра по биржам

Таким образом, самым чистым способом оказался старый метод ручной закупки, однако проверяемых доноров было не так много. Из бирж — sape, gogetlinks и miralinks оказались достаточно чистыми, а вот blogun и rotapost получили худшие оценки.

По оценке непосредственного присутствия страницы со ссылкой в поиске лидирует gogetlinks и sape pr. Про blogun.ru можно сказать, что данные не совсем корректные из-за отсутствия страницы в индексе без ограничений.

Выводы

  1. Вес с adult-сайтов передается по ссылке с меньшим весом, чем с обыкновенных сайтов.
  2. Пессимизация, накладываемая на ссылку с сайта, где присутствуют adult-слова, не подтвердилась.
  3. Для подтверждения или опровержения пессимизации, накладываемой на ссылку со страницы, на которой присутствует adult-слово, необходимо проводить чистые исследования на новых сайтах.
  4. Стандартные фильтры по закупке себя оправдывают и не превышают 10% мусора. Однако если предположить, что суммы, ежемесячно выкладываемые за аренду ссылок крупными рекламодателями, составляют только по sape около 500 000 руб., то 10% — это 50000 руб., что немало для оплаты мусора.
  5. Дополнительно необходимо провести эксперимент — снять ссылки, которые не в индексе семейного поиска и отследить изменение в позициях. Если изменений не будет, то экономия в 10% будет существенна для крупных рекламодателей! В рамках же малых денежных вливаний трудозатраты на анализ мусора будут выше, чем прибыли на его экономии.

(Голосов: 5, Рейтинг: 5)