Noindex i robots.txt — jak nie wyciąć strony z Google

Noindex i robots.txt rozwiązują inne problemy. Ich przypadkowe połączenie może utrudnić Google odczytanie strony albo pozostawić w wynikach adres, który miał zniknąć.

Noindex i robots.txt — dwie różne funkcje

noindex informuje wyszukiwarkę, że dana strona nie powinna znaleźć się w indeksie. robots.txt steruje dostępem robota do obszarów witryny. To nie są zamienne mechanizmy.

Jeżeli adres jest zablokowany w robots.txt, robot może nie odczytać znajdującego się na stronie znacznika noindex. Adres może wtedy nadal pojawiać się w wynikach jako znany z linków, choć bez pełnego opisu.

Jak działa noindex?

Najczęściej dyrektywa znajduje się w kodzie HTML:

<meta name="robots" content="noindex, follow">

Może też zostać wysłana w nagłówku HTTP jako X-Robots-Tag, co przydaje się dla plików innych niż HTML, np. PDF. Aby Google zastosował dyrektywę, musi mieć możliwość pobrania zasobu.

Kiedy noindex jest uzasadniony?

  • strony wyników wewnętrznego wyszukiwania,
  • techniczne lub przejściowe strony bez wartości dla wyników Google,
  • duplikaty, których nie da się rozsądnie skonsolidować inaczej,
  • treści prywatne — choć właściwą ochroną pozostaje autoryzacja, nie sam noindex.

Jak działa robots.txt?

Plik powinien być dostępny pod adresem https://domena.pl/robots.txt. Prosta konfiguracja zezwalająca na crawl może wyglądać tak:

User-agent: *
Disallow:

Sitemap: https://example.pl/wp-sitemap.xml

Blokuj tylko obszary, których robot rzeczywiście nie powinien pobierać. Nie blokuj plików CSS, JavaScript ani obrazów potrzebnych Google do prawidłowego renderowania publicznych stron.

Jak nie wyciąć strony z Google?

  1. Przed publikacją sprawdź meta robots oraz nagłówki X-Robots-Tag.
  2. Po migracji usuń globalny noindex używany na stagingu.
  3. Nie kopiuj produkcyjnego robots.txt na staging ani stagingowego na produkcję bez kontroli.
  4. Nie blokuj w robots.txt adresu, z którego chcesz usunąć noindex — robot musi odczytać zmianę.
  5. Po zmianie sprawdź kilka reprezentatywnych stron, nie tylko homepage.
  6. Zweryfikuj sitemapę i linkowanie wewnętrzne, aby ważne adresy były odkrywalne.

Neutralna ocena: noindex lub blokada dostępu mogą być świadomą decyzją właściciela — z powodów technicznych, prawnych, licencyjnych albo prywatności. Zawsze potwierdź intencję przed rekomendacją usunięcia blokady.

Najczęstsze błędy

  • Globalne „Zniechęcaj wyszukiwarki do indeksowania” pozostawione po uruchomieniu WordPressa.
  • Jednoczesny Disallow i noindex, przez co robot nie może odczytać dyrektywy.
  • Blokada całego serwisu regułą Disallow: /.
  • Noindex na stronie głównej, stronie kategorii lub ważnym produkcie.
  • Kilka sprzecznych dyrektyw robots z motywu, pluginów i nagłówków serwera.
  • Traktowanie robots.txt jak zabezpieczenia poufnych danych.

Jak sprawdzić ustawienia?

  • Otwórz /robots.txt i sprawdź odpowiedź HTTP 200 oraz aktywne reguły.
  • Wyświetl źródło strony i wyszukaj name="robots".
  • Sprawdź nagłówki odpowiedzi pod kątem X-Robots-Tag.
  • W GSC użyj Inspekcji adresu URL i porównaj stan opublikowany z informacją Google.
  • Po wdrożeniu monitoruj indeksowanie i nie zakładaj, że zmiana będzie widoczna natychmiast.

Co może zrobić SEO Center?

SEO Center może wskazać adresy z noindex, status pliku robots.txt, blokady 401/403 i inne problemy z pobraniem. Gdy strona odpowiada timeoutem, 429 lub 503, raport powinien oznaczyć dane SEO jako niezweryfikowane zamiast generować sztuczne braki title, H1 czy canonical.

Dla połączonego WordPressa SEO Core może przygotować pojedynczą zmianę index/noindex z dodatkowym ostrzeżeniem, świadomym potwierdzeniem, ochroną strony głównej, weryfikacją wyniku i rollbackiem.