The September 2023 Google Helpful Content Update

Поисковые системы, такие как Google, в последние годы активно развивают технологии выявления и ранжирования полезного контента. Как отмечает Google, качество контента определяется такими факторами, как “точность фактов, объективность подачи информации, ссылки на авторитетные источники, соответствующая глубина и широта освещения темы, грамотность”.

Одним из ключевых инструментов здесь стал алгоритм Helpful Content Update (HCU) — система полезного контента. Его цель — выявлять и понижать позиции сайтов с некачественным, малополезным контентом. Сигнал HCU генерируется на уровне всего сайта и учитывает множество факторов [1]. Это означает, что анализировать нужно показатели, связанные с определением качества контента, как на уровне домена, так и показатели качества самого контента.

Последнее обновление системы полезного контента

Последнее крупное обновление системы полезного контента (HCU) от 14 сентября 2023 года оказало заметное влияние на многие ресурсы.

Цель данного исследования — выявить факторы, влияющие на идентификацию контента этим алгоритмом Google как “бесполезного”. Исследовательский вопрос, на который опирается данное исследование, следующий: Какие характеристики сайта влияют на определение поисковыми системами контента как “бесполезного”?

На основе данных по выборке из 42 сайтов, собранных преимущественно на справочном форуме Google, потерявших трафик после обновления алгоритма “Полезного контента” в сентябре 2023 года, выявлено несколько значимых корреляций между характеристиками сайтов и их идентификацией как источников “бесполезного” контента. Показана роль показателей доверия, объективности, наличия ссылочного спама и обеспечения качественного пользовательского опыта. Полученные результаты могут помочь вебмастерам оптимизировать свои ресурсы с учётом приоритетов поисковых систем в оценке полезности контента.

Программное обеспечение и инструменты

Netpeak Spider. Использовался преимущественно для извлечения списка URL из файлов sitemap анализируемых сайтов.

Netpeak Checker. Использовался для получения значений Majestic TF и Majestic CF, а также для получения информации по параметру “Язык” (для отбора сайтов с английским контентом).

About this result. Эта поисковая фича Google предоставила информацию о том, доверяет ли поисковая система сайту и считает ли она его новым.

Scamadviser. Этот онлайн-инструмент оценивает насколько сайту можно доверять и выводит в примечаниях полезные комментарии, которые позволили классифицировать сайты, как “недавно созданные или сайты с низкой популярностью”.

Анализ контента осуществлялся с помощью внутренних инструментов, а также ChatGPT 4 (модели с плагинами).

SERP feature About the source

Методы:

В исследовании проанализирована выборка из 42 сайтов, потерявших трафик после обновления алгоритма “Полезного контента” от 14 сентября 2023 года. Для каждого сайта были собраны данные по ряду параметров: метрики доверия Majestic, оценки качества и объективности контента, наличие рекламы, признаки спама и др. Затем с помощью корреляционного анализа изучена взаимосвязь между этими характеристиками и отнесением контента сайта к категории “бесполезного”.

Анализ факторов «полезного контента» в алгоритме Google

Результаты:

Корреляционный анализ выявил несколько взаимосвязей:

  1. Сильная отрицательная корреляция (-0.61) обнаружена между метрикой доверия Majestic Trust Flow и вероятностью ссылочного спама. Чем выше вероятность спама, тем ниже уровень доверия.
  2. Положительная корреляция (0.24) найдена между низким трафиком сайта и идентификацией сайта как нового, что указывает на повышенные риски восприятия таких сайтов как “бесполезных”. Недавно созданные или менее популярные сайты, как правило, рискованные с точки зрения спама.
  3. Умеренная положительная связь (0.20) обнаружена между использованием AI-генерированного контента и вероятностью спама. Алгоритм Google может “мыслить” так — сайты, которые полагаются на контент, созданный искусственным интеллектом, весьма, вероятно, используют спам-ссылки. Если Google обнаружит, что контент создан при помощи ИИ и ссылочный профиль сайта при этом не естественный, такой сайт и его контент могут быть признанны как минимум подозрительными (низкий Trust).
  4. Отрицательная корреляция (-0.24) найдена между количеством проиндексированных страниц ниже среднего по выборке (менее 660 URL) и отсутствием полной, достоверной информации о владельцах сайта и его авторах. Это означает, что сайты с количеством проиндексированных URL-адресов ниже среднего часто не обеспечивают прозрачность, что может быть значительным негативным фактором в алгоритмической оценке Google. Это делает корреляцию (-0,24) с отсутствием прозрачности весьма важной.

Комментарий к пункту 4:

Порог “менее 660 URL” определен на значениях сайтов данной выборки. В подобном исследовании Джон Моррис указывает на более высокий предел – “менее 1500 URL”. Другими словами, — в зоне риска сайты, у которых небольшое количество страниц в индексе.

  1. Заметная корреляция 0,24 между показателями «Партнёрские программы / партнёрская программа Amazon» и «Средним показателем предвзятости контента» предполагает, что сайты с многочисленными партнёрскими ссылками также имеют тенденцию создавать предвзятый контент. Это, вероятно, может повлиять на воспринимаемую алгоритмом полезность контента, особенно если содержание контента не соответствует требованиям Google в отношении обзоров и партнёрских программ.
  1. Заметная положительная связь (0.24) выявлена между высоким качеством написания контента (в эпоху чатботов это не сложно) и предвзятостью контента. В выборку попало много сайтов, публикующие статьи “15 лучших…”, “ТОП 5…” Хорошо и грамотно написать — мало, нужно писать объективно.

Рекомендуя что-то как лучшее в целом или лучшее для определенной цели, укажите, почему вы считаете это лучшим, и приведите подтверждающие доказательства из первых рук.

– Google, Write high quality reviews

Комментарий к пункту 6:

Наблюдение о том, что «высококачественный контент может быть «бесполезным», если он не удовлетворяет потребность пользователя в сбалансированной информации», отражает критический, но часто упускаемый из виду аспект SEO и оценки контента.

Пользователи обычно полагаются на поисковые системы, которые предоставляют им достоверную и полную информацию для принятия взвешенных решений. Если контент, с которым они сталкиваются, является необъективным, то это ограничивает их возможности по получению всестороннего понимания темы. Предполагается, что пользователь столкнувшись с таким контентом не может полноценно удовлетворить свои информационные потребности.

Предвзятость может проявляться по-разному: выборочное освещение событий, исключение противоположных точек зрения или даже манипулятивный язык. Необъективный (предвзято написанный) контент вызывает сомнения в целостности представленной информации и не только у пользователя, но и у поисковой системы, поскольку указывает на отсутствие объективной оценки и соблюдения точности фактов. Это подрывает доверие к контенту и может заставить пользователей усомниться в достоверности и надежности сайта в целом.

Для тех, кто хочет более глубоко вникнуть в тему “предвзятости контента”, рекомендую обратиться к патенту US20220245332A1.

Хороший UX – супер важно!

Ещё одной причинной которая может повлиять на оценку качества контента, является плохой UX и агрессивная реклама. Пользовательский опыт играет важную роль в определении качества контента. Поисковые системы понимают важность предоставления легкодоступного контента, не содержащего чрезмерного количества рекламы и представленного в визуально приятной и удобной для пользователя форме.

Некоторые пользователи добавляют рекламные блоки чуть ли не после каждого абзаца считая при этом, что качество и информационная ценность от этого только выиграет.

“Общей чертой многих сайтов, подвергшихся воздействию обновления, в том числе и сайтов с контентом, который, возможно, не является ужасным, является ужасный пользовательский опыт. Другими словами, ситуация с рекламой на многих сайтах очень тяжёлая, пользователей бомбардируют объявлениями по всей странице, автовоспроизводящееся видео следует за вами по мере прокрутки страницы вниз, а также могут появляться всплывающие окна. Основной задачей HCU является удаление нежелательного контента из SERP, но и пользовательский опыт играет не последнюю роль. А сочетание низкокачественного контента с ужасным UX — это поцелуй смерти для HCU”, — считает SEO-эксперт Гленн Гейб [2].

Результаты данного исследования подтверждают мнение Гленна Гейба. Даже незначительный признак плохого UX и огромной рекламы следует считать критическими. Объявления, которые мешают работе пользователей, могут стать причиной того, что контент будет помечен как «бесполезный».

Helpful Content System

Анализ публикаций Google при помощии ИИ

Дополнительно к поиску возможных шаблонов признаков “неполезного контента” я, используя различные чатботы, пранализировал содержание основных публикаций Google, которые в той или иной степени имеют отношение к определению полезности контента.

Термин “Низкокачественный контент”, в контексте Руководства по оценке качества поиска, относится к контенту, который не соответствует запросу пользователя или обеспечивает плохой пользовательский опыт. Это может включать контент, который не имеет отношения к запросу, бесполезный или оскорбительный для пользователей, а также контент, созданный с минимальными или вовсе без усилий, таланта, навыков, оригинальности или добавленной ценности для пользователей. Примеры низкокачественного контента могут включать страницы с поверхностным или спамным контентом, автоматически сгенерированный контент, или контент, в котором слишком много не относящихся к теме ключевых слов или ссылок.

Вот некоторые возможные признаки того, что контент может системами ранжирования Google считаться бесполезным:

  • Тонкий контент – Контент с малым объемом или глубиной, такой как страницы всего с несколькими предложениями текста.
  • Контент с низкой добавленной ценностью – Контент, который не предоставляет много информации, идей или анализа. Например, страницы с базовой информацией, широко доступной где-либо еще. Например, сайты масово публикующие рерайты контента из Википедии. Подтверждается результатами это исследования.
  • Автоматизированный или скопированный контент – Контент, который, сгенерирован автоматически или скопирован из других источников, а не создан для целевой аудитории.
  • Контент, созданный без усилий, – Контент, созданный с минимальными затратами времени, усилий, опыта или таланта. Например, страницы с большим количеством грамматических/орфографических ошибок.
  • Дорвеи – это сайты или страницы, созданные для того, чтобы высоко ранжироваться по определенным поисковым запросам.
  • Избыточная реклама – Страницы, где реклама и другие способы монетизации отвлекают от основного контента. Подтверждается результатами это исследования.
  • Слишком оптимизированный контент – Когда читабельность текста приносится в жертву ради большого количества ключевых слов на странице.
  • Тонкий партнерский контент – Партнерские/обзорные страницы с малой уникальной добавленной ценностью. Подтверждается результатами это исследования.
  • Фейковый или вводящий в заблуждение контент – Страницы с фактически неверной или вводящей в заблуждение информацией.
  • Устаревший контент – Контент, явно вышедший за рамки своей полезности и не обновлявшийся. Подтверждается результатами это исследования.
  • Дублированный контент – Скопированный контент без новой информации.
  • Автоматически сгенерированные ленты комментариев пользователей.
  • Страницы с большим количеством всплывающих окон.
  • Страницы с большим количеством запросов на удаление за нарушение авторских прав (нарушение DMCA).

Взаимодейстиве пользователей с контентом

Рассмотрение контента с точки зрения пользователя – предоставляет ли он ценность, соответствует ли запросу, оригинален ли он, потребовал ли усилий для создания и т.д. – это ключевой момент.

Пользователи “голосуют ногами”, если контент стал менее полезным. Анализ данных вовлеченности пользователей и другой пользовательской аналитики для сайта может дать полезные сигналы о том, снижается ли качество и ценность контента, его способность удовлетворять целевую аудиторию.

Значительное снижение метрик вовлеченности пользователей, таких как возвращающиеся пользователи, общее число пользователей, сессий и средней длительности сессии (вовлеченности), может определенно быть признаком того, что контент становится менее интересным, полезным или удовлетворяющим читателей/пользователей.

Некоторые ключевые признаки снижения качества контента из данных о вовлеченности пользователей:

  • Снижение числа возвращающихся/лояльных пользователей, посещающих сайт с течением времени
  • Снижение общего трафика и количества сессий/пользователей
  • Более короткая средняя длительность сессии по сравнению с предыдущим периодом
  • Рост показателя отказов для статей/страниц
  • Больше одностраничных сессий вместо многостраничных
  • Снижение количества просмотренных страниц за сессию.

Если данные трафика и вовлеченности пользователей начинают демонстрировать негативные тенденции, это хороший повод оценить, действительно контент полезен для аудитории.

Анализ отзывов пользователей, комментариев, количества вернувшихся пользователей, времени нахождения на странице и т.д. может дать дополнительный контекст и могут быть явными сигналами того, что качество и привлекательность контента для пользователей упали. Улучшение актуальности и качества контента для целевой аудитории могло бы помочь улучшить метрики вовлеченности.

Итак, в резюме – такие признаки, как низкая уникальность, отсутствие экспертности, устаревший контент (более не поезен), чрезмерная реклама и плохой пользовательский опыт могут указывать на страницы, которые не предоставляют большую ценность для поисковиков. Анализ времени нахождения на странице, показателя отказов и удовлетворенности пользователей может помочь определить, действительно ли контент полезен.

Обсуждение:

Полученные результаты указывают на то, что поисковые системы при оценке полезности контента опираются на комплексный анализ различных характеристик сайта. Ключевыми факторами являются показатели качества и объективности контента, уровень доверия к сайту, а также обеспечение хорошего пользовательского опыта. Сайты, которые пренебрегают этими аспектами, подвергаются высокому риску быть идентифицированными как источники “бесполезной или не качественной” информации.

Ограничения данного исследования связаны с небольшим размером выборки и использованием корреляционного анализа, позволяющего выявить лишь наличие взаимосвязей между параметрами, но не причинно-следственных связей. Дальнейшие исследования на больших массивах данных с применением методов машинного обучения позволят вам построить более точные предиктивные модели.

Результаты содержат примеры с низкой корреляцией. Тем не менее показатели с низким уровнем корреляции могут иметь кумулятивный или синергетический эффект, который не сразу заметен, если рассматривать каждый фактор по отдельности. В нашем случае лучше найти хоть слабую корреляцию, чем никакой.

Выводы о критериях “бесполезного” контента:

Основными факторами, влияющими на идентификацию контента как “бесполезного” поисковыми системами, являются низкий уровень доверия, признаки спама, недостаточное качество и объективность контента, а также плохой пользовательский опыт. Эти выявленные закономерности позволят веб-мастерам принимать обоснованные решения при оптимизации сайтов под выдачу поисковых систем и избегать попадания их контента в категорию “бесполезного”.

4 коментар до “Анализ факторов “полезного контента” в алгоритме Google”
  1. Забавно получается. Если в Adsense выбрать автоматическое размещение блоков рекламы на странице, то он зачастую столько навешает – закачаешься.
    А после этого сам же Google еще и признает страницу/сайт малополезными. Очень удобно, чего уж там ))

    1. Реклама и поиск живут отдельно. Для целей поиска Adsense не имеет каких-то привилегий. Такая же реклама, как и все. И если Adsense загадит весь основной контент на странице, то конечно такой контент, вероятно, будет оценен как не полезный.

  2. Вячеслав, а не подскажите, какие инструменты и какие плагины, промты, вы используете для анализа контента (на примере вашей таблицы).

    1. Добрый день.

      Инструменты перечислены в статье. Если вас интересует какие чатботы я использовал, то, в основном, это ChatGPT 4.

      Плагины:
      Advanced data analysis (полученные результаты выборочно перепроверялись в Excel и в Orange);
      Wolfram;
      Webpilot.

Коментарі закриті.