A hétvégén a megosztott Claude-csevegések váratlanul megjelentek a Google keresési eredményei között.
Július 27-én megnéztem a feltérképezési szabályokat a Claude megosztási oldalakon, és találtam egy noindex direktívát, amely egy blokk mögé rejtőzött, és megakadályozta, hogy a Google hozzáférjen.
A megosztási útvonalat a robots.txt blokkolja a claude.ai oldalon. Ezek az oldalak egy X-Robots-Tag fejlécet is visszaküldenek a none értékre, amelyet a Google robots metacímkékre vonatkozó irányelvei ugyanúgy kezelnek, mint a noindex és a nofollow.
Emiatt a szabályok ütköznek egymással. A Google útmutatása szerint a noindex címke csak akkor működik, ha a robot hozzáférhet és elolvashatja az oldalt. Ha egy oldalt a robots.txt blokkol, akkor is indexelhető, ha más oldalak hivatkoznak rá, mivel a Googlebot megjegyzi az URL-t anélkül, hogy ténylegesen megnyitná.
A párosítás nem egyedi az AI-cégeknél. Ha a Google máshol blokkolt URL-t fedez fel, a noindex feltérképezése nélkül fel tudja sorolni az URL-t.
Mi történt
A 404 Media hétfőn arról számolt be, hogy Claude megosztó oldalai jelennek meg a site: operátoron keresztül. A TechCrunch arról számolt be, hogy orvosi anyagokat, belső vállalati dokumentumokat, valamint általános iskolás gyermekek nevét és telefonszámát tartalmazó aktákat talált. A műtermékek, a Claude belsejében épített dokumentumok és minialkalmazások egy második úton jelentek meg.
A tudósítások nagy része, beleértve a The Decodert is, arról számolt be, hogy a megosztási oldalakról hiányzik a noindex címke. Július 27-től a noindex fejléc egy robots.txt blokk mögött található. Nem világos, hogy ez a fejléc a hétvége előtt a helyén volt-e, mivel ezt nem tudtam megerősíteni.
Mit adnak vissza a feltérképezési szabályok
A claude.ai elleni július 27-i ellenőrzésem eredményei:
- A claude.ai címen található robots.txt fájl nem engedélyezi a /share/*-ot a User-agent: * csoport alatt, külön Googlebot-csoport nélkül, tehát a Google ezt a csoportot használja.
- Az élő megosztási URL az x-robots-tag fejléccel válaszol: nincs GET-kérés esetén.
- Ugyanez a fejléc jelenik meg, amikor a kérés azt állítja, hogy Googlebot, és a válasz tartalmazza a Vary: User-Agentet.
- A /public/artifacts/ elérési út nem szerepel a robots.txt fájlban.
Nem ellenőriztem, hogy a melléktermék-URL-ek oldalszintű noindexet adnak-e vissza, ezért ez a két útvonal nem hasonlítható össze a vezérlőelemeik alapján.
Daniel J. Glover független informatikai tanácsadó ugyanerről az ütközésről számolt be július 26-án. Az ellenőrzésem szerint a beállítás még július 27-én is érvényben volt, miután azt jelentették, hogy a csevegések már nem jelennek meg a keresési eredmények között, de nem tudtam megállapítani, hogy mi jelent meg a Google-nak az URL-ek első felfedezésekor.
Miért nem távolítja el az oldal blokkolását?
A Robots.txt segít abban, hogy a keresőmotorok hogyan térképezzék fel webhelyét, de nem dönti el, hogy mi kerüljön indexelésre. A Google ezt már évek óta tisztázza.
John Mueller például elmagyarázza, hogy még a robots.txt által blokkolt oldalak is megjelenhetnek a keresési eredmények között, ha más oldalak hivatkoznak rájuk. Ha egy oldalt távol szeretne tartani a keresési eredményektől, a „noindex” címke használata a megfelelő választás. Martin Splitt azt is javasolja, hogy ne helyezzék el mindkét szabályt ugyanazon az oldalon. A Google a közelmúltban ismét hangsúlyozta ezt a megkülönböztetést, amint az a múlt heti frissítésben is látható.
Az URL-ek robots.txt fájllal történő blokkolása nem távolítja el a már indexelt oldalakat. A tartósabb eltávolítás érdekében a Google azt tanácsolja, hogy használjon egy „noindex” címkét, amelyet a feltérképező robotja el tud olvasni.
Anthropic’s Response
Az Anthropic azt mondta a TechCrunchnak, hogy a megosztott linkek csak akkor jelennek meg a keresési eredmények között, ha az emberek a feltérképező robotok számára hozzáférhető helyeken teszik közzé azokat, és a privát üzenetekben küldött linkek nem lesznek indexelve.
Amie Rotherham szóvivő hozzátette, hogy ezek a linkek „nem sejthetők vagy felfedezhetők, hacsak az emberek nem maguk osztják meg őket”. Ez a nyilvános megosztási URL felfedezésének egyik módját tartalmazza, de nem foglalkozik a július 27-én talált, ütköző szabályokkal.
A Google szóvivője, Ned Adriance kijelentette, hogy a keresőmotorok nem határozzák meg, hogy mely oldalak legyenek nyilvánosak, a Google pedig a webhelytulajdonosok számára biztosítja a feltérképezés és az indexelés szabályozását, és követi ezeket az ellenőrzéseket.
Miért számít ez?
Azok a csevegések vagy műtermékek, amelyek megosztását nem szüntette meg, továbbra is elérhetők maradnak a link birtokában. A teljes lista megtekintéséhez a Claude-ban lépjen a Beállítások > Adatvédelem > Megosztott csevegések menüpontra.
A csevegés megosztásának megszüntetése letiltja a közvetlen linket, de az URL eltávolítása a Google-tól más dolog. Claude-felhasználóként nem szabályozhatja, hogy mit szolgáltasson a Googlebot számára, és nem küldhet be eltávolítási kérelmet, mivel ezeket az Anthropic kezeli.
A műtermékek közzététele saját folyamatukon keresztül történik, így a csevegés megosztásának megszüntetése és a csevegésből származó műtermék közzétételének megszüntetése két külön művelet.
A beállítások módosításán túl fontolja meg egy szabály létrehozását az AI-csevegések és műtermékek megosztására vonatkozóan. Ha egy csevegés olyasmit tartalmaz, amelyet nem tenne közzé nyilvánosan, ne ossza meg olyan linken keresztül, amely később indexelhető.
Előre tekintve
A minta nem egyedi az Anthropic esetében. Az OpenAI 2025 augusztusában eltávolította a megosztott ChatGPT-csevegéseket a keresésből, a Google pedig 2023-ban blokkolta a Bard-átiratok indexelését. Mindegyik eset egy nyilvános megosztási URL-t tartalmazott, amely messzebbre került, mint ahogyan a tulajdonosa várta.
Három cégnél mostanra az ügyfelek csevegései is megjelentek a keresésben. Ez elég ok arra, hogy egy nyilvános megosztási hivatkozást a létezésük pillanatától nyilvános weboldalként kezeljünk.
