Plik robots.txt steruje dostępem robotów do adresów w witrynie, a sitemap.xml wskazuje adresy, które właściciel strony uważa za ważne. Żaden z tych plików nie gwarantuje indeksacji. Błędna reguła może jednak utrudnić Google skanowanie strony, a nieaktualna mapa może przekazywać mylące informacje o jej strukturze. Dlatego oba pliki warto sprawdzić razem.
Spis treści
- Co to jest plik robots.txt?
- Co to jest mapa strony sitemap.xml?
- Jak stworzyć plik robots.txt krok po kroku?
- Jak wygenerować i przesłać sitemap.xml do Google?
- Jakie błędy w robots.txt i sitemap.xml najczęściej utrudniają indeksację?
- Jak sprawdzić konfigurację po wdrożeniu?
- Najczęstsze pytania
Co to jest plik robots.txt?
Robots.txt to plik tekstowy, który określa, do jakich adresów w danym hoście robot może uzyskać dostęp. Dla strony https://example.com/ plik powinien być dostępny pod adresem https://example.com/robots.txt. Reguły służą do zarządzania skanowaniem, a nie do usuwania stron z wyników wyszukiwania.
Prosty plik może wyglądać tak:
User-agent: * Disallow: /koszyk/ Disallow: /moje-konto/ Sitemap: https://example.com/sitemap.xml
User-agentwskazuje robota, którego dotyczą kolejne reguły. Gwiazdka oznacza wszystkie roboty respektujące ten zapis.Disallowwskazuje ścieżkę, której robot nie powinien skanować.Allowmoże dopuścić węższą ścieżkę znajdującą się wewnątrz zablokowanego katalogu.Sitemappodaje bezwzględny adres mapy witryny.
Pusty wpis Disallow: pozwala skanować cały serwis, dlatego nie trzeba dodawać Allow: /. Trzeba też pamiętać, że nie każdy robot musi interpretować reguły identycznie. Poniższe zalecenia odnoszą się przede wszystkim do Google.
Co to jest mapa strony sitemap.xml?
Sitemap.xml to plik z adresami stron, filmów, obrazów lub innych zasobów, o których wyszukiwarka powinna wiedzieć. Pomaga odkrywać treści, szczególnie w dużych, nowych lub słabo połączonych wewnętrznie serwisach. Nie zastępuje jednak linkowania wewnętrznego i nie gwarantuje, że wskazane adresy zostaną przeskanowane lub zaindeksowane.
Minimalny wpis dla pojedynczego adresu wygląda tak:
<url> <loc>https://example.com/blog/artykul/</loc> <lastmod>2026-08-20</lastmod> </url>
W mapie warto umieszczać pełne, kanoniczne adresy, które mają pojawiać się w wynikach wyszukiwania. W praktyce powinny zwracać kod 200 i nie zawierać dyrektywy noindex. Datę lastmod należy podawać tylko wtedy, gdy odpowiada rzeczywistej, istotnej zmianie strony.
Jak stworzyć plik robots.txt krok po kroku?
- Sprawdź istniejący plik. Otwórz adres
/robots.txtdla każdego używanego hosta, na przykład osobno dla subdomeny sklepu. - Ustal, które adresy nie powinny być skanowane. Mogą to być wyniki wyszukiwania wewnętrznego, strony koszyka lub niektóre kombinacje parametrów. Decyzja zależy od architektury serwisu; nie kopiuj gotowej listy bez sprawdzenia skutków.
- Nie blokuj ważnych zasobów strony. Google powinien mieć dostęp do plików CSS, JavaScript i obrazów potrzebnych do poprawnego wyrenderowania treści.
- Dodaj adres mapy. Wpis
Sitemap:pomaga robotom znaleźć właściwy plik, ale nie zastępuje poprawnej konfiguracji mapy. - Umieść plik w katalogu głównym hosta. Reguły z
https://example.com/robots.txtnie dotyczą na przykładhttps://sklep.example.com/. - Sprawdź ważne adresy przed i po zmianie. Zweryfikuj osobno stronę główną, kategorie, produkty lub usługi oraz zasoby używane do renderowania.
Nie używaj robots.txt do ochrony danych prywatnych. Adres pliku i jego zawartość są publiczne, a robot może zignorować zawarte w nim reguły. Wrażliwe zasoby wymagają kontroli dostępu, na przykład logowania.
Jak wygenerować i przesłać sitemap.xml do Google?
- Znajdź mapę generowaną przez system strony. Wiele CMS-ów tworzy ją automatycznie. Adres może kończyć się na
/sitemap.xmlalbo/sitemap_index.xml. - Sprawdź zawartość. Mapa powinna zawierać preferowane, kanoniczne adresy. Usuń z niej przekierowania, błędy, duplikaty oraz strony wyłączone z indeksacji.
- Włącz automatyczną aktualizację. Przy większym serwisie ręczna mapa szybko staje się nieaktualna. Pojedynczy plik może zawierać najwyżej 50 000 adresów i mieć do 50 MB po rozpakowaniu; większy zbiór trzeba podzielić i połączyć indeksem map.
- Udostępnij mapę Google. Dodaj jej adres w raporcie „Mapy witryn” w Google Search Console lub wskaż go w robots.txt. Zgłoszenie jest wskazówką, nie poleceniem natychmiastowej indeksacji.
- Sprawdź przetwarzanie i indeksację osobno. Raport map pokazuje między innymi, czy Google pobrał i przetworzył plik. Stan konkretnych stron sprawdzisz w narzędziu do inspekcji adresu URL, a zbiorcze przyczyny braku indeksacji w raporcie „Indeksowanie stron”.
Jakie błędy w robots.txt i sitemap.xml najczęściej utrudniają indeksację?
| Błąd | Możliwy skutek | Jak naprawić |
|---|---|---|
Disallow: / pozostawione po wdrożeniu wersji testowej | Google nie może skanować adresów w danym hoście | Usuń regułę i sprawdź najważniejsze adresy |
| Blokada plików CSS lub JavaScript potrzebnych do renderowania | Google może zobaczyć stronę inaczej niż użytkownik | Odblokuj potrzebne zasoby i sprawdź wyrenderowaną stronę |
Mapa zawiera przekierowania, błędy lub adresy noindex | Mapa wskazuje adresy, które nie powinny trafić do indeksu | Generuj mapę z kanonicznych adresów zwracających 200 |
| Po migracji nadal działa mapa ze starymi adresami | Google otrzymuje nieaktualny obraz struktury serwisu | Opublikuj nową mapę i zachowaj poprawne przekierowania ze starych adresów |
| Mapa lub jej indeks są zablokowane w robots.txt | Google nie może pobrać pliku | Dopuść skanowanie mapy i ponów zgłoszenie |
Nieprawdziwe daty lastmod | Google może przestać ufać tej informacji | Aktualizuj datę tylko po istotnej zmianie treści |
Przy nakładających się regułach robots.txt Google wybiera regułę dotyczącą najbardziej szczegółowej ścieżki. Jeśli reguły Allow i Disallow mają tę samą długość, pierwszeństwo ma Allow. Zamiast liczyć na kolejność wpisów, lepiej uprościć plik i przetestować konkretne adresy.
Jak sprawdzić konfigurację po wdrożeniu?
Najpierw otwórz robots.txt i mapę w przeglądarce bez logowania. Oba pliki muszą być publicznie dostępne. Następnie w Google Search Console sprawdź kilka reprezentatywnych adresów za pomocą inspekcji URL: czy Google może je pobrać, czy indeksowanie jest dozwolone i jaki adres uznaje za kanoniczny.
W raporcie „Mapy witryn” sprawdź, czy mapa została odczytana bez błędów składni. Sam status „Sukces” nie oznacza, że wszystkie adresy są w indeksie. Do oceny indeksacji użyj raportu „Indeksowanie stron”, filtrując dane według właściwej mapy, a przy pojedynczych problemach wróć do inspekcji URL.
Po migracji lub dużej zmianie struktury obserwuj również przekierowania i błędy 404. Sitemap.xml ma opisywać aktualne adresy; stare powinny prowadzić do odpowiednich nowych stron przez przekierowania, jeśli istnieje dla nich właściwy odpowiednik.
Najczęstsze pytania
Czy strona bez pliku robots.txt jest gorzej pozycjonowana?
Nie. Brak dostępnego pliku robots.txt oznacza dla Google brak ograniczeń skanowania. Plik jest potrzebny wtedy, gdy chcesz świadomie zarządzać dostępem robotów do wybranych adresów, ale sam w sobie nie poprawia pozycji.
Czy zablokowanie strony w robots.txt usuwa ją z wyników Google?
Nie. Google może znać adres z linków i pokazać go w wynikach bez znajomości treści strony. Jeśli strona ma zniknąć z indeksu, Google musi móc ją przeskanować i zobaczyć dyrektywę noindex; alternatywą jest ograniczenie dostępu hasłem. Nie łącz noindex z blokadą w robots.txt, bo robot może nie odczytać tej dyrektywy.
Jak sprawdzić, czy sitemap.xml działa poprawnie?
Otwórz mapę bez logowania, sprawdź poprawność adresów i zgłoś ją w raporcie „Mapy witryn” w Google Search Console. Błędy pobierania lub składni znajdziesz w tym raporcie. Informacji o indeksacji stron szukaj w raporcie „Indeksowanie stron” oraz w inspekcji URL.
Czy każda strona potrzebuje sitemap.xml?
Nie. Google zwykle potrafi odkryć mały, dobrze połączony wewnętrznie serwis bez mapy. Sitemap.xml jest szczególnie przydatna w dużych i nowych witrynach, serwisach ze słabym linkowaniem wewnętrznym oraz stronach z dużą liczbą filmów, obrazów lub treści newsowych.
Jak długo trwa indeksacja po zgłoszeniu mapy?
Google nie podaje gwarantowanego terminu. Zgłoszenie mapy nie oznacza natychmiastowego skanowania ani indeksacji. Jeśli ważny adres nie pojawia się w indeksie, sprawdź go w inspekcji URL i usuń wskazaną przeszkodę zamiast wielokrotnie zgłaszać tę samą mapę.
Jeśli chcesz sprawdzić nie tylko mapę i robots.txt, zobacz, co obejmuje audyt SEO. Z tematem odkrywania adresów wiąże się też crawl budget, który ma znaczenie przede wszystkim w dużych lub szybko zmieniających się serwisach.