Az AI feltérképező robotok blokkolása olyan üzleti döntés, amelyről jelenleg sok keresőszakember tárgyal. De ha meghozta a döntést, mi a legjobb módja ezeknek a robotoknak a blokkolásának?
A feltérképező robotok blokkolásának két fő módja van: a robots.txt fájlon és a szerververemen keresztül.
A két megközelítés
Mindkét megközelítésnek megvannak a maga előnyei és hátrányai. Kezdjük azzal, hogy megvizsgáljuk, hogyan működnek, és mi a különbség a kettő között.
Blokkolás a robotokon keresztül.txt
Az AI feltérképező robotok blokkolása a robots.txt fájl használatával pontosan ugyanaz a folyamat, mint bármely típusú bot blokkolásakor.
Minden AI-botnak saját azonosító neve van, például OpenAI GPTBot és OAI-SearchBot. A blokkoláshoz egyszerűen hozzá kell adnia egy tiltó szabályt, amely megadja a bejáró nevét. Például, ha meg szeretné akadályozni, hogy a GPTBot a webhely bármely részét feltérképezze, tegye hozzá:
Felhasználói ügynök: GPTBot
Letiltás: /
Ha webhelyének csak bizonyos részein szeretné megakadályozni az AI-botok feltérképezését, akkor ezeket ugyanúgy előhívhatja. Például, ha meg akarja akadályozni, hogy a GPTBot feltérképezze a termékoldalait, vegye fel az oldalak mappáját, például:
Felhasználói ügynök: GPTBot
Disallow: /termékek/
Blokkolás szerverszinten
Számos módon blokkolhatja a robotokat szerver szinten: magán a szerveren, a CDN-en vagy a WAF-on keresztül.
Ebben az esetben a kiszolgáló beolvassa a bejövő kérést, például a bot IP-címét, fejlécét stb., és alkalmazza az ügynökhöz beállított speciális szabályokat (megtagadás, engedélyezés, átirányítás). Például megadhatja, hogy a GPTBot „megtagadás” parancsot kapjon. Ez megakadályozza, hogy a bot hozzáférjen a webhely tartalmához.
A Content Delivery Network (CDN) esetében a koncepció ugyanaz, de ez egy bot látogatásának korábbi szakaszában történik. A CDN elfog egy bottól érkező tartalomkérést, mielőtt az elérné a szervert. Ez lényegében a szerver sávszélességét takarítja meg, mivel a bot valójában soha nem lép kapcsolatba vele. Egyes CDN-ek natív módon kínálják ezt a technológiát, anélkül, hogy sokat kellene tennie a konfigurálásért. Például a Cloudflare előre beállított blokkolást kínál annak alapján, hogy egy bot keresőrobot, ügynök vagy képzésre használják-e, valamint lehetővé teszi a botonkénti finomhangolást.
A webalkalmazások tűzfalánál (WAF) a robotokat jobban ellenőrzik, mint a CDN-t. A WAF biztonsági rétegként működik, amely képes elemezni a kérések viselkedését, nem csak a botok által használt fejléceket. Ez azt jelenti, hogy képes észlelni azokat a robotokat, amelyek más felhasználói ügynököket hamisítanak. A legtöbb technológiai halmazban ez a legkompetensebb módja a kifinomultabb mesterséges intelligencia bejárók azonosításának, amelyek a blokkolási kísérletek radarja alá akarnak csúszkálni. A vállalat által használt WAF a CDN része lehet, például a Cloudflare WAF, vagy egy önálló alkalmazás, például az AWS WAF.
Robots.txt: előnyei és hátrányai
A robots.txt valószínűleg a kereső szakemberek számára a legelérhetőbb módja a robotok vezérlésének. A keresőoptimalizálók általában módosíthatják a robots.txt fájlt domainjeikhez, vagy egyszerűen kérhetnek gyors frissítést a fejlesztőcsapattól.
Ennek a módszernek azonban más előnyei is vannak.
Profik
A robots.txt letiltási mechanizmusát hivatalosan a legnagyobb, jó hírű AI-cégek támogatják. Például az OpenAI GPTBot és OAI-SearchBot, az Anthropic ClaudeBot, Claude-User és Claude-SearchBot, a Google Google-Extended és a Perplexity PerplexityBot.
Ezzel a módszerrel szelektíven kiválaszthatja, hogy mely oldalakat akadályozza meg a botok látogatásában, valamint a blokkolás finomhangolását az egyes bejárók alapján.
Hátrányok
Ennek a módszernek azonban van néhány hátránya. A legnagyobb kockázat az, hogy a robots.txt betartása teljesen önkéntes, és nincs központilag felügyelve. Ez azt jelenti, hogy bár az AI-botok készítői állíthatják, hogy a robotjaik tiszteletben tartják a robots.txt fájlt, ez csak kérések halmaza, nem pedig tényleges blokk. Tekintsd úgy, mint egy behatolási tilalmat a nyitott kapu előtt. Valójában semmi sem akadályozza meg a robotokat, csak a robots.txt szabályainak betartása érdekében kódolva vannak.
A robots.txt konfigurálható úgy, hogy nagyon könnyen letiltja a robotokat bizonyos oldalakon, ha vannak robots.txt vezérlők a webhely CMS-jében. Ez azt jelenti, hogy a nem műszaki érdekelt felek véletlenül több botot blokkolhatnak, mint amennyit vártak egy hibás tiltó szabállyal. Ez katasztrofális lehet, ha a robots.txt fájlt úgy frissítik, hogy letiltsák az összes botot, például a következők végrehajtásával:
User-agent: *
Letiltás: /
A robots.txt nem frissül automatikusan, amikor új felhasználói ügynökök kerülnek kiadásra. Ez azt jelenti, hogy valakinek manuálisan új tiltásokat kell hozzáadnia, ha meg akarja akadályozni, hogy egy új AI-bot hozzáférjen a webhelyéhez.
Szerververem: előnyei és hátrányai
A robotok szerver-, CDN- vagy WAF-szintű blokkolása a megvalósítástól függően különböző előnyökkel jár.
Profik
A CDN- és WAF-megvalósítások leállítják a botkéréseket, mielőtt azok elérnék a szervert. Ez megtakarítja a szerver sávszélességét, csökkenti a kiszolgáló terhelését és a kapcsolódó költségeket.
A szerververem-megvalósítások legnagyobb előnye, függetlenül attól, hogy melyiket választja, az, hogy egy határozott blokkot képeznek. Ha a robots.txt egy udvarias „behatolás tilos” tábla, akkor a szerver, a CDN és a WAF blokkok egy lakat a kapun. Ezek a megvalósítási módszerek nem követelik meg a bejáró megfelelőségét; észlelik a botokat, és megakadályozzák, hogy hozzáférjenek a tartalomhoz, függetlenül attól, hogy a bot kompatibilis-e vagy sem.
A módszer másik előnye, hogy az ezeken a szinteken lévő szoftverek gyakran jelentést adnak a letiltott robotokról. A „lakat” rögzíti a feloldási kísérleteket. Ez hasznos lehet annak elemzésében, hogy mely robotok próbálnak hozzáférni webhelyéhez. Azoknál a webhelyeknél, amelyekre sok nemkívánatos mesterséges intelligenciarobot figyel, ez felhasználható a botok tulajdonosaival folytatott megbeszélésekre, esetenként jogilag is.
Hátrányok
A kiszolgálóverem-megvalósítási módszerek hátrányai elsősorban a karbantartási költségek. A legtöbb webhelyszerver meglehetősen le van zárva, így csak azok férhetnek hozzá a szerverfájlokhoz, a WAF-hoz vagy a CDN-hez, akik valóban tudják, mit csinálnak velük. Ez azt jelenti, hogy a blokkok módosításait valószínűleg egy fejlesztőn keresztül kell végrehajtani, nem pedig közvetlenül a keresőoptimalizálónak. A közvetítő iránti igény idő-, erőforrás- és költségvonzattal jár, különösen, ha a szervert egy harmadik fél, például egy fejlesztési ügynökség kezeli.
Minden egyes biztonsági réteg esetében lehetséges a bot-hamisítás. Bár a WAF a legerősebb védelmi vonal, még mindig lehetséges, hogy a fejlett robotok megkerülhetik az érvényesítési ellenőrzéseket. Ez azt jelenti, hogy nincs teljesen bolondbiztos módszer a szélhámos AI-botok blokkolására a szerververemen keresztül. Azonban a legtöbb számára továbbra is nagyon hatékonyak.
Tehát melyiket használjuk?
Erre nincs egyetlen válasz. Ez a webhely beállításától, költségeitől és irányítási struktúrájától függ.
Egy ideális világban a szerververem minden szintjén blokkolná a robotokat. A szerver jó módszer az ismert felhasználói ügynökök blokkolására, és képes észlelni a bot viselkedésének egyszerű mintáit. A CDN-blokkok nagymértékben hatékonyak, és megakadályozzák, hogy a robotok a szerver sávszélességét használják fel. A WAF a leghatékonyabb a hamisított robotok észlelésében, és megakadályozza, hogy a fejlett AI-kaparók hozzáférjenek a webhelyhez. Előfordulhat azonban, hogy nem tud könnyen konfigurálni a WAF-ot, ha a webhelyén egyáltalán van ilyen.
A robots.txt a legegyszerűbb módszer annak kinyilvánítására, hogy bizonyos robotok ne érjék el webhelyét, és hatékony a felelős robotok számára. Azonban egyszerűen figyelmen kívül hagyható, ezért elrettentő, nem pedig megelőzési módszer.
Összefoglalva, ha erős szükség van bizonyos mesterséges intelligencia bejárók blokkolására, azt javaslom, hogy a lehető legmagasabbra menjen a szerververemben; blokkolás a WAF-on keresztül, ha lehet, a CDN-n keresztül, ha nem, és a szerveren keresztül, mint végső megoldás.
Ha csak egy vagy két legelismertebb mesterséges intelligencia bejárót kell blokkolnia, akkor valószínűleg csak a robots.txt fájlra támaszkodhat elrettentő eszközként. Azt is javaslom azonban, hogy figyelje a szervernaplókat, hogy lássa, nem csúszik-e át valamelyik robot a robots.txt tiltása mellett.
