Blokkoljam az AI feltérképező robotokat a Robots.txt vagy szerver szinten? – Kérdezzen meg egy SEO-t

Peter

Az AI feltérképező robotok blokkolása olyan üzleti döntés, amelyről jelenleg sok keresőszakember tárgyal. De ha meghozta a döntést, mi a legjobb módja ezeknek a robotoknak a blokkolásának?

A feltérképező robotok blokkolásának két fő módja van: a robots.txt fájlon és a szerververemen keresztül.

A két megközelítés

Mindkét megközelítésnek megvannak a maga előnyei és hátrányai. Kezdjük azzal, hogy megvizsgáljuk, hogyan működnek, és mi a különbség a kettő között.

Blokkolás a robotokon keresztül.txt

Az AI feltérképező robotok blokkolása a robots.txt fájl használatával pontosan ugyanaz a folyamat, mint bármely típusú bot blokkolásakor.

Minden AI-botnak saját azonosító neve van, például OpenAI GPTBot és OAI-SearchBot. A blokkoláshoz egyszerűen hozzá kell adnia egy tiltó szabályt, amely megadja a bejáró nevét. Például, ha meg szeretné akadályozni, hogy a GPTBot a webhely bármely részét feltérképezze, tegye hozzá:

Felhasználói ügynök: GPTBot

Letiltás: /

Ha webhelyének csak bizonyos részein szeretné megakadályozni az AI-botok feltérképezését, akkor ezeket ugyanúgy előhívhatja. Például, ha meg akarja akadályozni, hogy a GPTBot feltérképezze a termékoldalait, vegye fel az oldalak mappáját, például:

Felhasználói ügynök: GPTBot

Disallow: /termékek/

Blokkolás szerverszinten

Számos módon blokkolhatja a robotokat szerver szinten: magán a szerveren, a CDN-en vagy a WAF-on keresztül.

Ebben az esetben a kiszolgáló beolvassa a bejövő kérést, például a bot IP-címét, fejlécét stb., és alkalmazza az ügynökhöz beállított speciális szabályokat (megtagadás, engedélyezés, átirányítás). Például megadhatja, hogy a GPTBot „megtagadás” parancsot kapjon. Ez megakadályozza, hogy a bot hozzáférjen a webhely tartalmához.

A Content Delivery Network (CDN) esetében a koncepció ugyanaz, de ez egy bot látogatásának korábbi szakaszában történik. A CDN elfog egy bottól érkező tartalomkérést, mielőtt az elérné a szervert. Ez lényegében a szerver sávszélességét takarítja meg, mivel a bot valójában soha nem lép kapcsolatba vele. Egyes CDN-ek natív módon kínálják ezt a technológiát, anélkül, hogy sokat kellene tennie a konfigurálásért. Például a Cloudflare előre beállított blokkolást kínál annak alapján, hogy egy bot keresőrobot, ügynök vagy képzésre használják-e, valamint lehetővé teszi a botonkénti finomhangolást.

A webalkalmazások tűzfalánál (WAF) a robotokat jobban ellenőrzik, mint a CDN-t. A WAF biztonsági rétegként működik, amely képes elemezni a kérések viselkedését, nem csak a botok által használt fejléceket. Ez azt jelenti, hogy képes észlelni azokat a robotokat, amelyek más felhasználói ügynököket hamisítanak. A legtöbb technológiai halmazban ez a legkompetensebb módja a kifinomultabb mesterséges intelligencia bejárók azonosításának, amelyek a blokkolási kísérletek radarja alá akarnak csúszkálni. A vállalat által használt WAF a CDN része lehet, például a Cloudflare WAF, vagy egy önálló alkalmazás, például az AWS WAF.

Robots.txt: előnyei és hátrányai

A robots.txt valószínűleg a kereső szakemberek számára a legelérhetőbb módja a robotok vezérlésének. A keresőoptimalizálók általában módosíthatják a robots.txt fájlt domainjeikhez, vagy egyszerűen kérhetnek gyors frissítést a fejlesztőcsapattól.

Ennek a módszernek azonban más előnyei is vannak.

Profik

A robots.txt letiltási mechanizmusát hivatalosan a legnagyobb, jó hírű AI-cégek támogatják. Például az OpenAI GPTBot és OAI-SearchBot, az Anthropic ClaudeBot, Claude-User és Claude-SearchBot, a Google Google-Extended és a Perplexity PerplexityBot.

Ezzel a módszerrel szelektíven kiválaszthatja, hogy mely oldalakat akadályozza meg a botok látogatásában, valamint a blokkolás finomhangolását az egyes bejárók alapján.

Hátrányok

Ennek a módszernek azonban van néhány hátránya. A legnagyobb kockázat az, hogy a robots.txt betartása teljesen önkéntes, és nincs központilag felügyelve. Ez azt jelenti, hogy bár az AI-botok készítői állíthatják, hogy a robotjaik tiszteletben tartják a robots.txt fájlt, ez csak kérések halmaza, nem pedig tényleges blokk. Tekintsd úgy, mint egy behatolási tilalmat a nyitott kapu előtt. Valójában semmi sem akadályozza meg a robotokat, csak a robots.txt szabályainak betartása érdekében kódolva vannak.

A robots.txt konfigurálható úgy, hogy nagyon könnyen letiltja a robotokat bizonyos oldalakon, ha vannak robots.txt vezérlők a webhely CMS-jében. Ez azt jelenti, hogy a nem műszaki érdekelt felek véletlenül több botot blokkolhatnak, mint amennyit vártak egy hibás tiltó szabállyal. Ez katasztrofális lehet, ha a robots.txt fájlt úgy frissítik, hogy letiltsák az összes botot, például a következők végrehajtásával:

User-agent: *

Letiltás: /

A robots.txt nem frissül automatikusan, amikor új felhasználói ügynökök kerülnek kiadásra. Ez azt jelenti, hogy valakinek manuálisan új tiltásokat kell hozzáadnia, ha meg akarja akadályozni, hogy egy új AI-bot hozzáférjen a webhelyéhez.

Szerververem: előnyei és hátrányai

A robotok szerver-, CDN- vagy WAF-szintű blokkolása a megvalósítástól függően különböző előnyökkel jár.

Profik

A CDN- és WAF-megvalósítások leállítják a botkéréseket, mielőtt azok elérnék a szervert. Ez megtakarítja a szerver sávszélességét, csökkenti a kiszolgáló terhelését és a kapcsolódó költségeket.

A szerververem-megvalósítások legnagyobb előnye, függetlenül attól, hogy melyiket választja, az, hogy egy határozott blokkot képeznek. Ha a robots.txt egy udvarias „behatolás tilos” tábla, akkor a szerver, a CDN és a WAF blokkok egy lakat a kapun. Ezek a megvalósítási módszerek nem követelik meg a bejáró megfelelőségét; észlelik a botokat, és megakadályozzák, hogy hozzáférjenek a tartalomhoz, függetlenül attól, hogy a bot kompatibilis-e vagy sem.

A módszer másik előnye, hogy az ezeken a szinteken lévő szoftverek gyakran jelentést adnak a letiltott robotokról. A „lakat” rögzíti a feloldási kísérleteket. Ez hasznos lehet annak elemzésében, hogy mely robotok próbálnak hozzáférni webhelyéhez. Azoknál a webhelyeknél, amelyekre sok nemkívánatos mesterséges intelligenciarobot figyel, ez felhasználható a botok tulajdonosaival folytatott megbeszélésekre, esetenként jogilag is.

Hátrányok

A kiszolgálóverem-megvalósítási módszerek hátrányai elsősorban a karbantartási költségek. A legtöbb webhelyszerver meglehetősen le van zárva, így csak azok férhetnek hozzá a szerverfájlokhoz, a WAF-hoz vagy a CDN-hez, akik valóban tudják, mit csinálnak velük. Ez azt jelenti, hogy a blokkok módosításait valószínűleg egy fejlesztőn keresztül kell végrehajtani, nem pedig közvetlenül a keresőoptimalizálónak. A közvetítő iránti igény idő-, erőforrás- és költségvonzattal jár, különösen, ha a szervert egy harmadik fél, például egy fejlesztési ügynökség kezeli.

Minden egyes biztonsági réteg esetében lehetséges a bot-hamisítás. Bár a WAF a legerősebb védelmi vonal, még mindig lehetséges, hogy a fejlett robotok megkerülhetik az érvényesítési ellenőrzéseket. Ez azt jelenti, hogy nincs teljesen bolondbiztos módszer a szélhámos AI-botok blokkolására a szerververemen keresztül. Azonban a legtöbb számára továbbra is nagyon hatékonyak.

Tehát melyiket használjuk?

Erre nincs egyetlen válasz. Ez a webhely beállításától, költségeitől és irányítási struktúrájától függ.

Egy ideális világban a szerververem minden szintjén blokkolná a robotokat. A szerver jó módszer az ismert felhasználói ügynökök blokkolására, és képes észlelni a bot viselkedésének egyszerű mintáit. A CDN-blokkok nagymértékben hatékonyak, és megakadályozzák, hogy a robotok a szerver sávszélességét használják fel. A WAF a leghatékonyabb a hamisított robotok észlelésében, és megakadályozza, hogy a fejlett AI-kaparók hozzáférjenek a webhelyhez. Előfordulhat azonban, hogy nem tud könnyen konfigurálni a WAF-ot, ha a webhelyén egyáltalán van ilyen.

A robots.txt a legegyszerűbb módszer annak kinyilvánítására, hogy bizonyos robotok ne érjék el webhelyét, és hatékony a felelős robotok számára. Azonban egyszerűen figyelmen kívül hagyható, ezért elrettentő, nem pedig megelőzési módszer.

Összefoglalva, ha erős szükség van bizonyos mesterséges intelligencia bejárók blokkolására, azt javaslom, hogy a lehető legmagasabbra menjen a szerververemben; blokkolás a WAF-on keresztül, ha lehet, a CDN-n keresztül, ha nem, és a szerveren keresztül, mint végső megoldás.

Ha csak egy vagy két legelismertebb mesterséges intelligencia bejárót kell blokkolnia, akkor valószínűleg csak a robots.txt fájlra támaszkodhat elrettentő eszközként. Azt is javaslom azonban, hogy figyelje a szervernaplókat, hogy lássa, nem csúszik-e át valamelyik robot a robots.txt tiltása mellett.


A szerzőről

Peter, az eOldal.hu tapasztalt SEO szakértője és tartalomgyártója. Több mint 10 éve foglalkozik keresőoptimalizálással és online marketinggel, amelyek révén számos magyar vállalkozás sikerét segítette elő. Cikkeiben részletes és naprakész információkat nyújt az olvasóknak a legfrissebb SEO trendekről és stratégiákról.