robots.txt ellenőrzése és tesztelése
robots.txt beillesztése és URL-ek tesztelése: engedélyezett-e a bejárás adott user-agentnek? Google-féle leghosszabb-egyezés logika.
Miről szól ez az eszköz?
A robots.txt ellenőrző megmutatja, hogy egy adott URL-t bejárhat-e a keresőrobot a robots.txt szabályai szerint. Illeszd be a robots.txt tartalmát, add meg a user-agentet és a tesztelendő URL-eket, az eszköz pedig minden URL-re megmondja, engedélyezett-e a bejárás, és melyik szabály dönt. A Google-féle „leghosszabb egyező szabály nyer” logikát követi, wildcard (*) és sorvég ($) támogatással. Így még élesítés előtt kiszűrheted a véletlen kizárásokat. Minden a böngésződben fut.
Hogyan használd a(z) robots.txt ellenőrzése és tesztelése-t?
-
robots.txt beillesztése
Illeszd be a fájl teljes tartalmát a szövegmezőbe.
-
User-agent
Add meg, melyik botra tesztelsz (pl. Googlebot).
-
URL-ek
Írd be a tesztelendő URL-eket vagy útvonalakat, soronként egyet.
-
Eredmény
Minden URL-re látod: engedélyezett vagy tiltott, és a döntő szabály.
Mikor van rá szükséged?
-
Élesítés előtti ellenőrzés
Annak igazolása, hogy egy új robots.txt nem zárja ki véletlenül a fontos oldalakat.
-
Hibakeresés
Kideríteni, miért nem járja be a Google egy adott URL-t.
-
Bot-specifikus szabályok
Ellenőrizni, hogy egy AI-bot vagy egy adott kereső eléri-e a tartalmat.
-
Audit
Meglévő robots.txt szabályainak ütköztetése a valós URL-struktúrával.
Szabály-illeszkedés példák
| Szabály | Illeszkedik-e a /admin/kep.jpg-re |
|---|---|
| Disallow: /admin/ | Igen – tiltott |
| Allow: /admin/*.jpg | Igen, hosszabb – engedélyezett |
| Disallow: /*.php$ | Nem (nem .php végű) |
Hogyan értelmezi a Google a robots.txt-t?
A robots.txt látszólag egyszerű, de a szabályok ütközésének feloldása gyakran meglepő. Amikor egy URL-re több szabály is illeszkedik – például egy általános Disallow és egy specifikusabb Allow –, a keresők nem a sorrend, hanem a specifikusság alapján döntenek: a leghosszabb (legtöbb karaktert egyeztető) szabály nyer. Ha egy Allow és egy Disallow ugyanolyan hosszan illeszkedik, az Allow az erősebb.
Ehhez jön a mintaillesztés két eszköze: a * bármilyen karaktersorozatot helyettesít, a $ pedig az URL végét rögzíti. Ezekkel finom szabályok írhatók (pl. „minden PDF tiltva, de egy mappa engedélyezve”), amelyek hatását fejben nehéz követni. Ez az eszköz pontosan ezt a logikát futtatja le a beillesztett szabályokon és a teszt-URL-eken, így még élesítés előtt látod, mit enged és mit tilt valójában a robots.txt-d.
Hasznos tippek
-
Új robots.txt élesítése előtt teszteld a legfontosabb URL-jeidet – egy elgépelt Disallow sokba kerülhet.
-
Ne feledd: a leghosszabb egyező szabály nyer, nem a sorrend.
-
Teszteld több user-agentre is, ha bot-specifikus szabályaid vannak.
-
A robots.txt megírásához használd a robots.txt generátorunkat, majd itt teszteld le.
Gyakori kérdések
- A Google szabálya szerint a leghosszabb (legspecifikusabb) egyező szabály nyer. Az eszköz minden Allow és Disallow szabályt megvizsgál a user-agenthez tartozó blokkban, és a leghosszabb egyezőt alkalmazza; azonos hossznál az Allow győz.
- Igen. A * bármilyen karaktersorozatot jelöl (pl. /*.pdf minden PDF-re illeszkedik), a $ pedig a sorvéget rögzíti (pl. /*.php$ csak a .php-re végződő URL-ekre). Ezeket a modern keresők is így értelmezik.
- Az eszköz kliens-oldali, a böngésződben fut, ezért nem tud más domainek robots.txt-jét letölteni (a böngésző biztonsági korlátai miatt). Ehelyett beilleszted a tartalmat – így bizalmas vagy még nem élő robots.txt-t is tesztelhetsz.
- A robots.txt külön szabályokat adhat különböző botoknak (Googlebot, Bingbot, GPTBot…). Az eszköz a megadott user-agenthez tartozó legspecifikusabb blokkot használja, vagy a * blokkot, ha nincs pontos egyezés.
- Nem. A Disallow a bejárást tiltja, de a tiltott URL még megjelenhet a találatokban (cím nélkül). Az indexelésből való teljes kizáráshoz a noindex meta tag kell – de az csak akkor hat, ha a bejárás engedélyezett.
- Nem. A teljes elemzés a böngésződben történik – semmilyen adat nem kerül feltöltésre.