У нас справочник товаров: сканируешь штрих-код - получаешь разбор состава, добавки, вердикт. В базе 119 225 товаров, вердикт посчитан у 77 188. Под каждый товар с составом на сайте лежит страница.
В Яндексе в поиске было 39 страниц. Тридцать девять - при семидесяти семи тысячах готовых.
Объяснение напрашивалось удобное: молодой домен, ссылок нет, поисковик не спешит. Вебмастер вроде подтверждал - висело 1112 страниц со статусом “малоценная или маловостребованная”. Ну, думаем, понятно. Копим возраст, ждём.
Два месяца я смотрел не в тот отчёт.
“Малоценные” - это не наш запрет
Строка “малоценные” в Вебмастере - оценка поисковика. Он страницу видел и решил не брать. Наш собственный технический запрет живёт в другом отчёте, и цифра там была другая: noindex на 515 страницах.
Я складывал их в одну кучу, пока не полез проверять адреса руками через “Проверку URL”.
Откуда noindex? Из правила, которое мы сами написали и которое, в общем, разумное: товарная страница публикуется, только если у товара есть название. Иначе выйдет адрес с заголовком “Продукт” - мусор, за который по голове не погладят.
Правило нормальное. Но источник наполнялся кусками: у части товаров приезжал состав и не приезжало имя. И шаблон на таких страницах честно ставил meta robots: noindex, follow.
417 запертых страниц были готовы целиком
Это вылезло, когда я перестал считать проценты и посмотрел, чего запертым страницам не хватает.
Состав есть. Добавки разобраны. Вердикт посчитан. Нет одной строки - имени товара!
Добывали имена из открытых источников по штрих-коду. Тут сразу грабли: качество у источников разное. Один отдаёт чистые единообразные названия. Второй - транслит, обрезки и служебные хвосты вроде “#4” прямо в имени. Третий пишет капсом, но с ним хоть жить можно.
Я разложил добытое на три файла: чистые, требующие правки, и те, которые брать нельзя - непищевые товары, корма, мусор. Залили, открылось 112 страниц. Запертых осталось 310.
Для масштаба: открылось втрое больше, чем весь наш видимый охват в Яндексе до этого.
Страницы открылись, а в карту сайта не попали
Второй слой оказался интереснее первого.
Карта собиралась по правилу: приоритетных адресов не больше трёх тысяч, отбор по полноте карточки - белки, жиры, углеводы, калорийность. Логика понятная, отдаём поисковику лучшее.
Только я взял выгрузку из Search Console и сверил с картой. У нас 76 страниц уже получали показы в Google. 31 из них в карту не попадала - не хватало пары цифр в ЖБУ или адрес не влезал в топ по числу сканов.
Поисковик нашёл страницу сам, показывал её людям, а мы её не заявляли…
Сделали белый список: текстовый файл со штрих-кодами. Адрес из списка идёт в приоритетную карту без требований к полноте, сверх лимита, с приоритетом 1.0. Обновление не требует релиза - присылаем новый файл, строки с решёткой игнорируются, пометки пишем прямо внутри. Сейчас там 172 кода.
Что дало за месяц
было |
стало |
|
|---|---|---|
Клики в Google (28 дней) |
7 |
28 |
Показы |
717 |
2 450 |
Страниц в индексе |
16 200 |
20 468 |
Страниц с показами |
- |
780 |
Запертых товарных страниц |
422 |
310 |
Яндекс не сдвинулся: те же примерно 39 страниц, новое выкидывает как малоценное через несколько дней. Тут техника уже ни при чём - доверие к домену лечится ссылками, а не тегами. Отдельная боль, отдельная история.
Где мы наступили себе на ногу
Заливка ушла не тем файлом. В прод уехали сырые данные парсера, и в заголовках вылезло всё, что я перед этим вычищал:
Пряники с начинкой Вареная сгущенка, 300г, п/п упаковка Коровка - состав... Крекер ... неглазированное "с луком и сыром" - состав... Паштет печеночный Курица ГОСТ, 200г, стекло
Длина заголовков - 107-127 знаков при рекомендуемых шестидесяти. В выдаче человек увидит обрубок на слове “соста”.
Причём поймал я это, открыв семь живых страниц подряд. Лог заливки говорил “успешно” и формально не врал.
Короче, что забрал
Причина запрета бывает размером в одно поле. Проценты запертых страниц об этом молчат.
Свой технический запрет и оценка поисковика - два разных отчёта. Путать дорого.
Search Console знает, какие страницы уже показывают людям. Ваша бизнес-логика в этот же момент может считать их неполными.
Приёмка засчитывается на живой странице. Лог заливки - это ещё не приёмка.
Через две недели замер: попали ли открытые страницы в индекс, дали ли показы. Если да - расширяем белый список до всех 780 адресов. Если нет, значит у Google к нам та же претензия, что у Яндекса, и всё упирается в ссылки.
А у вас бывало, что причиной оказывалось одно поле в шаблоне?