Noindex i robots.txt rozwiązują inne problemy. Ich przypadkowe połączenie może utrudnić Google odczytanie strony albo pozostawić w wynikach adres, który miał zniknąć.
Noindex i robots.txt — dwie różne funkcje
noindex informuje wyszukiwarkę, że dana strona nie powinna znaleźć się w indeksie. robots.txt steruje dostępem robota do obszarów witryny. To nie są zamienne mechanizmy.
Jeżeli adres jest zablokowany w robots.txt, robot może nie odczytać znajdującego się na stronie znacznika noindex. Adres może wtedy nadal pojawiać się w wynikach jako znany z linków, choć bez pełnego opisu.
Jak działa noindex?
Najczęściej dyrektywa znajduje się w kodzie HTML:
<meta name="robots" content="noindex, follow">
Może też zostać wysłana w nagłówku HTTP jako X-Robots-Tag, co przydaje się dla plików innych niż HTML, np. PDF. Aby Google zastosował dyrektywę, musi mieć możliwość pobrania zasobu.
Kiedy noindex jest uzasadniony?
- strony wyników wewnętrznego wyszukiwania,
- techniczne lub przejściowe strony bez wartości dla wyników Google,
- duplikaty, których nie da się rozsądnie skonsolidować inaczej,
- treści prywatne — choć właściwą ochroną pozostaje autoryzacja, nie sam
noindex.
Jak działa robots.txt?
Plik powinien być dostępny pod adresem https://domena.pl/robots.txt. Prosta konfiguracja zezwalająca na crawl może wyglądać tak:
User-agent: *
Disallow:
Sitemap: https://example.pl/wp-sitemap.xml
Blokuj tylko obszary, których robot rzeczywiście nie powinien pobierać. Nie blokuj plików CSS, JavaScript ani obrazów potrzebnych Google do prawidłowego renderowania publicznych stron.
Jak nie wyciąć strony z Google?
- Przed publikacją sprawdź meta robots oraz nagłówki
X-Robots-Tag. - Po migracji usuń globalny
noindexużywany na stagingu. - Nie kopiuj produkcyjnego
robots.txtna staging ani stagingowego na produkcję bez kontroli. - Nie blokuj w robots.txt adresu, z którego chcesz usunąć
noindex— robot musi odczytać zmianę. - Po zmianie sprawdź kilka reprezentatywnych stron, nie tylko homepage.
- Zweryfikuj sitemapę i linkowanie wewnętrzne, aby ważne adresy były odkrywalne.
Neutralna ocena: noindex lub blokada dostępu mogą być świadomą decyzją właściciela — z powodów technicznych, prawnych, licencyjnych albo prywatności. Zawsze potwierdź intencję przed rekomendacją usunięcia blokady.
Najczęstsze błędy
- Globalne „Zniechęcaj wyszukiwarki do indeksowania” pozostawione po uruchomieniu WordPressa.
- Jednoczesny
Disallowinoindex, przez co robot nie może odczytać dyrektywy. - Blokada całego serwisu regułą
Disallow: /. - Noindex na stronie głównej, stronie kategorii lub ważnym produkcie.
- Kilka sprzecznych dyrektyw robots z motywu, pluginów i nagłówków serwera.
- Traktowanie robots.txt jak zabezpieczenia poufnych danych.
Jak sprawdzić ustawienia?
- Otwórz
/robots.txti sprawdź odpowiedź HTTP 200 oraz aktywne reguły. - Wyświetl źródło strony i wyszukaj
name="robots". - Sprawdź nagłówki odpowiedzi pod kątem
X-Robots-Tag. - W GSC użyj Inspekcji adresu URL i porównaj stan opublikowany z informacją Google.
- Po wdrożeniu monitoruj indeksowanie i nie zakładaj, że zmiana będzie widoczna natychmiast.
Co może zrobić SEO Center?
SEO Center może wskazać adresy z noindex, status pliku robots.txt, blokady 401/403 i inne problemy z pobraniem. Gdy strona odpowiada timeoutem, 429 lub 503, raport powinien oznaczyć dane SEO jako niezweryfikowane zamiast generować sztuczne braki title, H1 czy canonical.
Dla połączonego WordPressa SEO Core może przygotować pojedynczą zmianę index/noindex z dodatkowym ostrzeżeniem, świadomym potwierdzeniem, ochroną strony głównej, weryfikacją wyniku i rollbackiem.