A Common Crawl kiadott egy kézikönyvet a mesterséges intelligencia számára való láthatóság érdekében, automatizáltam

Peter

A Common Crawl nevű nonprofit szervezet minden hónapban több mint 2 milliárd weboldalt tölt le, és bárkinek átadja a másolatot, aki akarja.

Ebből az ingyenes archívumból indul ki a legtöbb mesterséges intelligencia képzési adat.

Amikor a Mozilla ellenőrizte a 2019 és 2023 között kiadott LLM-eket, 64%-uk gyakorolt ​​valamilyen formában a Common Crawl-adatokat, és a GPT-3 nagyjából 60%-ban a gyakorlati súly alapján szűrt Common Crawl volt.

Ha egy modell már ismeri a márkáját anélkül, hogy az interneten keresgélne, valószínűleg ez is része annak, ahol megtanulta.

A mögötte lévő bejáró neve CCBot, és az, hogy képes-e olvasni az Ön webhelyét, eldönti, hogy egyáltalán benne van-e az archívumban.

Így néz ki a naplóidban.

CCBot/2.0 (https://commoncrawl.org/faq/)

A 2026. júliusi feltérképezés 2,14 milliárd ilyen oldalt tartalmaz.

Három lemeze a bbc.com oldaláról származik. CCBot engedélyt kért, elolvasta az elutasítást, és elment.

Ami a képzési adatfolyamot illeti, a világ egyik legnagyobb híroldala nem létezik.

A BBC robots.txt fájlja a 14 mesterségesintelligencia-robot közül 13-at blokkol, és más vezető híroldalak 2023 óta szándékosan blokkolják a feltérképező robotok képzését. A BuzzStream mérése szerint ez a legjobb amerikai és brit kiadók 75%-a.

Az a kérdés érdekel, hogy hány webhely hiányzik ebből a feltérképezésből anélkül, hogy eldöntené, hogy az lesz.

Chris Green nemrégiben közzétette a HTTP-archívum számát a LinkedIn-en. Körülbelül 492 000 webhely nevezi CCBot-ot a robots.txt fájlban, és ezeknek az említéseknek körülbelül 95%-a tiltja azt.

Nyitott kérdése megragadt bennem.

Ebből a félmillióból hányan gondolták?

2025. július 1-je óta a Cloudflare alapértelmezés szerint blokkolja az AI-robotokat minden általa kiszolgált új domainen.

Felügyelt robots.txt fájlja további 3,8 millió olyan domaint ért el, amelyek soha nem írtak egyet sem. A hirdetési beépülő modulok tiltólistákat adnak hozzá. 2026-ban a CCBot blokk legalább olyan nagy valószínűséggel lesz platform alapértelmezett, mint döntés.

A Common Crawl maga írt egy kézikönyvet pontosan ennek ellenőrzésére. De mindez kézi munka. Szóval automatizáltam.

A Common Crawl Visibility Checker ingyenes, nem igényel regisztrációt, és egyszerre csak egy domainre válaszol, közvetlenül a Common Crawl saját archívumából.

Ahol a gyakori feltérképezés található az AI-csővezetékben

A bejárás 2008 óta havonta fut, a pillanatképek pedig a C4, a RefinedWeb, a RedPajama, a Dolma, a FineWeb és a legtöbb egyéb nagy tréningkészlet alapanyaga.

A laboratóriumok ritkán érintik meg a nyers feltérképezést. Szűrt származékot vesznek fel, így az oldal modellbe vezető útvonala a CCBot-tól a Common Crawl-on keresztül az egyik ilyen adatkészletbe fut, és minden lépésben csak az előtte haladó marad meg.

A csővezeték is mozog még. A FineWeb hat új, 2025-ös feltérképezést adott hozzá tavaly júliusban, és az NVIDIA a Nemotron képzési készletét a Common Crawl saját tárolójában tárolja.

A séma jelölésének három élete című részében bemutattam a tartalmad képzés előtti életét.

A rövid változat szerint a CCBot az egyetlen bejáró, amelynek látogatásai összetettek.

A GPTBot egyedül az OpenAI számára tölti le az oldaladat. A CCBot látogatása mindenkivel véget ér, aki valaha is a nyílt weben fog edzeni.

Az Audit Common Crawl azt várja, hogy Ön kézzel futtasson

Júniusban a Common Crawl közzétett valami érdekeset.

Az AI Visibility Audit egy 18 oldalas útmutató, amely elmagyarázza a webhelytulajdonosoknak, hogyan ellenőrizhetik helyzetüket az adatkészletben.

Ez egy jó útmutató egy fogással.

Minden ellenőrzés kézi.

A CCBot felhasználói ügynökével összehúzza a kezdőlapját, és összehasonlítja a választ a böngésző válaszával.

Következik az index API, ahol szemügyre veheti a felvételek számát, és a webes grafikonja, ahol megtekintheti a rangját. Ezután kézzel állít össze egy eredménytáblát domainenként. lol!

Elolvastam az ellenőrzőlistát, majd automatizáltam. Kényelmes módon a Common Crawl májusban megnyitotta adatait a böngészőeszközök számára, így ez az a ritka eszköz, amelyet az adatszolgáltató valóban szeretne építeni.

Szerintem pontosan tudják, mit csinálnak. Fair play nekik.

Amit a Checker mutat

Írjon be egy tartományt, és a diagnózis négy panelen jelenik meg.

Rögzítések Per Crawl

Trendként hány oldalt vett igénybe az elmúlt tizenkét havi feltérképezésből.

Webhelyem a tavaly augusztusi feltérképezés során rögzített két oldalról júliusban 55-re nőtt, ami a leghízelgőbb diagram, amit valaha is készített róla.

Ehelyett egy nagy domain becslést kap. Írja be a wikipedia.org címet, és nagyjából 3,7 milliót fog látni becslésként, mivel az eszköz a hatalmas webhelyek indexstruktúráját olvassa be, ahelyett, hogy minden rekordot számolna.

Robots.txt története

A Common Crawl tárolja a robots.txt fájlt, amelyet minden feltérképezés előtt elolvasott. Az ellenőrző hónapról hónapra visszafelé ellenőrzi a tárolt másolatokat, és eltér a mesterséges intelligencia bejáró szabályaitól, így a blokk kezdési dátumot kap.

Futtassa a bbc.com-ot, és minden hónapban ugyanazt olvassa el. CCBot blokkolva, 14/13 token, Tiltott perjel.

Kinek a blokkja úgy néz ki

Ha egy blokk egyezik egy ismert sablonnal, az eszköz ezt mondja. A Cloudflare által kezelt robots.txt fájlhoz egy megkülönböztető licenc megjegyzés tartozik. A Squarespace alapértelmezése saját egyedi aláírással rendelkezik.

És ha nyolc vagy több mesterséges intelligencia-token egy söprés alatt lemerül, az általában egy bővítmény vagy egy másolt lista.

Élő szonda

A történelem azt mondja, hogy mi történt, ezért ez ellenőrzi, hogy most mi igaz. CCBot/2.0 néven tölti le a kezdőlapját egy normál böngésző és egy vezérlőbot mellett, amely elkapja a robots.txt soha nem megjelenő blokkot, egy tűzfalat, amely kihívást jelent a felhasználói ügynöknek a szélén.

Ez a négy a diagnózis. Az ellenőrző többi része mit kell tenni vele.

Minden ellenőrzés egy javítókártya-panelben végződik, amely megfelel a találtnak.

A Cloudflare sablonblokk megkapja az irányítópult elérési útját és figyelmeztetést.

A kézzel írt blokkok a kétsoros robots.txt szakaszt kapják a másolás gombbal.

Ha ehelyett egy szélső kihívásról van szó, a kártya megmutatja a tűzfal gyártóját, és összekapcsolja a CCBot közzétett IP-tartományait.

A kártyák alatt a következő feltérképezés dátuma jelenik meg, mert egy ma elvégzett javítás megjelenik a következő havi adatok között, és fontos tudni, hogy mikor kell keresni.

Webhelytérkép lefedettség

Az oldaltérkép panel az a funkció, amelyet magamnak akartam. Az ellenőrző lekéri a webhelytérképet, és összehasonlítja azt a rögzített URL-ekkel, ami a címsor számát munkasorrá alakítja. Az enyém a júliusi feltérképezés során a 97 oldalból 42-t olvas, a többi 55 pedig CSV-ként tölthető le.

Egyetlen oldal követése

Beilleszthet egy teljes oldal URL-t is a domain helyett, és lekérheti az adott oldal előzményeit egész évben. Ezzel egy percen belül két dolgot tanultam meg a saját webhelyemről.

A ChatGPT-források lebontását az utolsó 12 feltérképezésből csak 1 alkalommal rögzítették. A Common Crawl által tárolt példány pedig egyáltalán nem a tiszta URL.

A CCBot egy hírlevél hivatkozáson keresztül találta meg az oldalt, és a ConvertKit nyomkövetési paraméterei mellett tárolta. Nagyon régen abbahagytam a Kit használatát.

A feltérképező robot nem úgy böngészi a webhelyet, ahogy Ön elképzeli. Bármilyen linket is tartalmaz a weben, azt követi.

Tárolt másolat ellenőrzése

Az utolsó darab egy tárolt másolati csekk. Az eszköz begyűjti a kezdőlaphoz archivált CCBot tényleges bájtjait, kivonja a szöveget, és összehasonlítja az élő HTML-kóddal.

Mindkét oldal beolvasásra kerül a JavaScript futása előtt, ez a lényeg, mert a CCBot soha nem futja le.

A láthatatlan blokkok

Kétféle blokk soha nem jelenik meg, ha kézzel ellenőrzi a robots.txt fájlt.

1. CDN alapértelmezett. A Cloudflare-en 2025 júliusa után létrehozott domain letiltja a mesterséges intelligencia feltérképező robotokat, hacsak valaki nem kapcsolta ki, és a kezelt robots.txt több millió olyan webhelyhez jutott el, amelyek tulajdonosai soha nem érintettek meg egy fájlt.

2. Élszabály. A WAF kihívást jelent a CCBot számára, miközben a robots.txt tisztán olvasható. A Common Crawl saját útmutatója szerint ellenőrizze a CDN irányítópultját, mielőtt bármihez hozzányúlna a szerveren, és igazuk van. Ez az egyetlen hely, ahol nem néz ki klasszikus SEO bejáró.

Mi mozgatja valójában a befogadást

Ha az eredmény nyitott, de alig rögzített, akkor soha nem volt probléma a blokkolással.

Feltérképezési prioritás volt.

A Common Crawl az egyes webhelyekről mintát vesz a domain összekapcsolásának mértéke alapján, így néhány dolog számít.

  1. Először javítsa ki a CDN-t. Ha az élő szonda kihívást mutat, akkor semmilyen robots.txt szerkesztés nem segít.
  2. Engedje be a CCBot-ot. A szabály hiánya már igent jelent. Az enyém kifejezetten megengedi, és közben idézi a Mátrixot. (Nézd meg)
  3. Webhelytérkép hozzáadása a robots.txt fájlhoz. A CCBot a webhelytérkép protokollt követi.
  4. Renderelés a szerveren. A CCBot nem hajtja végre a JavaScriptet, így a csak hidratálás után létező tartalom üres héjat hagy a betanítási adatokban. A méret 2025 márciusában megszűnt mentségnek lenni, amikor a tárolt korlát oldalanként 1 MiB-ról 5 MiB-ra csökkent.
  5. Szerezzen linkeket a jól összekapcsolt webhelyekről. A feltérképezési prioritás a harmonikus központiságot követi, amelyet a Metehan Yeşilyurt webes grafikon eszközében nézhet meg. (Ne hallgass a „SEO halott” ellenzőkre. Vásárolj tovább, elnézést, a linkek építésére gondoltam.)

Amit ez az eszköz nem tud elmondani

A Common Crawlban való részvétel nem tesz modellt.

Minden oktatókészlet szűri a bejárást, és a határlaboratóriumok 2023 körül leálltak a mixeik közzétételével.

A vékony lefedettség önmagában sem bizonyít semmit, mert a Common Crawl a web mintája, nem pedig másolata.

Ezért az ellenőrző együtt megvizsgálja a rögzítéseket, a robotok előzményeit és az élő szondát, mielőtt ítéletet mond.

Ha hárman nem értenek egyet, akkor azt mondja.

Futtassa

Ellenőrizze a domainjét.

Ezután ellenőrizze az ügyfelet. Ha a robots.txt előzményei olyan blokkot mutatnak, amely abban a hónapban jelent meg, amikor a webhely megváltoztatta a CDN-eket, akkor pontosan tudni fogja, mi történt, és valószínűleg Ön lesz az első, aki elmondja nekik.

A hozzáférés-ellenőrző lefedi a mesterséges intelligencia bejáró képének többi részét, a GPTBotot és a ClaudeBotot és barátait, élőben.


Ezt a bejegyzést eredetileg a Suganthan oldalon tették közzé.


A szerzőről

Peter, az eOldal.hu tapasztalt SEO szakértője és tartalomgyártója. Több mint 10 éve foglalkozik keresőoptimalizálással és online marketinggel, amelyek révén számos magyar vállalkozás sikerét segítette elő. Cikkeiben részletes és naprakész információkat nyújt az olvasóknak a legfrissebb SEO trendekről és stratégiákról.