A Common Crawl nevű nonprofit szervezet minden hónapban több mint 2 milliárd weboldalt tölt le, és bárkinek átadja a másolatot, aki akarja.
Ebből az ingyenes archívumból indul ki a legtöbb mesterséges intelligencia képzési adat.
Amikor a Mozilla ellenőrizte a 2019 és 2023 között kiadott LLM-eket, 64%-uk gyakorolt valamilyen formában a Common Crawl-adatokat, és a GPT-3 nagyjából 60%-ban a gyakorlati súly alapján szűrt Common Crawl volt.
Ha egy modell már ismeri a márkáját anélkül, hogy az interneten keresgélne, valószínűleg ez is része annak, ahol megtanulta.
A mögötte lévő bejáró neve CCBot, és az, hogy képes-e olvasni az Ön webhelyét, eldönti, hogy egyáltalán benne van-e az archívumban.
Így néz ki a naplóidban.
CCBot/2.0 (https://commoncrawl.org/faq/)
A 2026. júliusi feltérképezés 2,14 milliárd ilyen oldalt tartalmaz.
Három lemeze a bbc.com oldaláról származik. CCBot engedélyt kért, elolvasta az elutasítást, és elment.
Ami a képzési adatfolyamot illeti, a világ egyik legnagyobb híroldala nem létezik.
A BBC robots.txt fájlja a 14 mesterségesintelligencia-robot közül 13-at blokkol, és más vezető híroldalak 2023 óta szándékosan blokkolják a feltérképező robotok képzését. A BuzzStream mérése szerint ez a legjobb amerikai és brit kiadók 75%-a.
Az a kérdés érdekel, hogy hány webhely hiányzik ebből a feltérképezésből anélkül, hogy eldöntené, hogy az lesz.
Chris Green nemrégiben közzétette a HTTP-archívum számát a LinkedIn-en. Körülbelül 492 000 webhely nevezi CCBot-ot a robots.txt fájlban, és ezeknek az említéseknek körülbelül 95%-a tiltja azt.
Nyitott kérdése megragadt bennem.
Ebből a félmillióból hányan gondolták?
2025. július 1-je óta a Cloudflare alapértelmezés szerint blokkolja az AI-robotokat minden általa kiszolgált új domainen.
Felügyelt robots.txt fájlja további 3,8 millió olyan domaint ért el, amelyek soha nem írtak egyet sem. A hirdetési beépülő modulok tiltólistákat adnak hozzá. 2026-ban a CCBot blokk legalább olyan nagy valószínűséggel lesz platform alapértelmezett, mint döntés.
A Common Crawl maga írt egy kézikönyvet pontosan ennek ellenőrzésére. De mindez kézi munka. Szóval automatizáltam.
A Common Crawl Visibility Checker ingyenes, nem igényel regisztrációt, és egyszerre csak egy domainre válaszol, közvetlenül a Common Crawl saját archívumából.
Ahol a gyakori feltérképezés található az AI-csővezetékben
A bejárás 2008 óta havonta fut, a pillanatképek pedig a C4, a RefinedWeb, a RedPajama, a Dolma, a FineWeb és a legtöbb egyéb nagy tréningkészlet alapanyaga.
A laboratóriumok ritkán érintik meg a nyers feltérképezést. Szűrt származékot vesznek fel, így az oldal modellbe vezető útvonala a CCBot-tól a Common Crawl-on keresztül az egyik ilyen adatkészletbe fut, és minden lépésben csak az előtte haladó marad meg.
A csővezeték is mozog még. A FineWeb hat új, 2025-ös feltérképezést adott hozzá tavaly júliusban, és az NVIDIA a Nemotron képzési készletét a Common Crawl saját tárolójában tárolja.
A séma jelölésének három élete című részében bemutattam a tartalmad képzés előtti életét.
A rövid változat szerint a CCBot az egyetlen bejáró, amelynek látogatásai összetettek.
A GPTBot egyedül az OpenAI számára tölti le az oldaladat. A CCBot látogatása mindenkivel véget ér, aki valaha is a nyílt weben fog edzeni.
Az Audit Common Crawl azt várja, hogy Ön kézzel futtasson
Júniusban a Common Crawl közzétett valami érdekeset.
Az AI Visibility Audit egy 18 oldalas útmutató, amely elmagyarázza a webhelytulajdonosoknak, hogyan ellenőrizhetik helyzetüket az adatkészletben.
Ez egy jó útmutató egy fogással.
Minden ellenőrzés kézi.
A CCBot felhasználói ügynökével összehúzza a kezdőlapját, és összehasonlítja a választ a böngésző válaszával.
Következik az index API, ahol szemügyre veheti a felvételek számát, és a webes grafikonja, ahol megtekintheti a rangját. Ezután kézzel állít össze egy eredménytáblát domainenként. lol!
Elolvastam az ellenőrzőlistát, majd automatizáltam. Kényelmes módon a Common Crawl májusban megnyitotta adatait a böngészőeszközök számára, így ez az a ritka eszköz, amelyet az adatszolgáltató valóban szeretne építeni.
Szerintem pontosan tudják, mit csinálnak. Fair play nekik.
Amit a Checker mutat
Írjon be egy tartományt, és a diagnózis négy panelen jelenik meg.
Rögzítések Per Crawl
Trendként hány oldalt vett igénybe az elmúlt tizenkét havi feltérképezésből.
Webhelyem a tavaly augusztusi feltérképezés során rögzített két oldalról júliusban 55-re nőtt, ami a leghízelgőbb diagram, amit valaha is készített róla.
Ehelyett egy nagy domain becslést kap. Írja be a wikipedia.org címet, és nagyjából 3,7 milliót fog látni becslésként, mivel az eszköz a hatalmas webhelyek indexstruktúráját olvassa be, ahelyett, hogy minden rekordot számolna.
Robots.txt története
A Common Crawl tárolja a robots.txt fájlt, amelyet minden feltérképezés előtt elolvasott. Az ellenőrző hónapról hónapra visszafelé ellenőrzi a tárolt másolatokat, és eltér a mesterséges intelligencia bejáró szabályaitól, így a blokk kezdési dátumot kap.
Futtassa a bbc.com-ot, és minden hónapban ugyanazt olvassa el. CCBot blokkolva, 14/13 token, Tiltott perjel.

Kinek a blokkja úgy néz ki
Ha egy blokk egyezik egy ismert sablonnal, az eszköz ezt mondja. A Cloudflare által kezelt robots.txt fájlhoz egy megkülönböztető licenc megjegyzés tartozik. A Squarespace alapértelmezése saját egyedi aláírással rendelkezik.
És ha nyolc vagy több mesterséges intelligencia-token egy söprés alatt lemerül, az általában egy bővítmény vagy egy másolt lista.

Élő szonda
A történelem azt mondja, hogy mi történt, ezért ez ellenőrzi, hogy most mi igaz. CCBot/2.0 néven tölti le a kezdőlapját egy normál böngésző és egy vezérlőbot mellett, amely elkapja a robots.txt soha nem megjelenő blokkot, egy tűzfalat, amely kihívást jelent a felhasználói ügynöknek a szélén.

Ez a négy a diagnózis. Az ellenőrző többi része mit kell tenni vele.
Minden ellenőrzés egy javítókártya-panelben végződik, amely megfelel a találtnak.
A Cloudflare sablonblokk megkapja az irányítópult elérési útját és figyelmeztetést.
A kézzel írt blokkok a kétsoros robots.txt szakaszt kapják a másolás gombbal.
Ha ehelyett egy szélső kihívásról van szó, a kártya megmutatja a tűzfal gyártóját, és összekapcsolja a CCBot közzétett IP-tartományait.
A kártyák alatt a következő feltérképezés dátuma jelenik meg, mert egy ma elvégzett javítás megjelenik a következő havi adatok között, és fontos tudni, hogy mikor kell keresni.
Webhelytérkép lefedettség
Az oldaltérkép panel az a funkció, amelyet magamnak akartam. Az ellenőrző lekéri a webhelytérképet, és összehasonlítja azt a rögzített URL-ekkel, ami a címsor számát munkasorrá alakítja. Az enyém a júliusi feltérképezés során a 97 oldalból 42-t olvas, a többi 55 pedig CSV-ként tölthető le.

Egyetlen oldal követése
Beilleszthet egy teljes oldal URL-t is a domain helyett, és lekérheti az adott oldal előzményeit egész évben. Ezzel egy percen belül két dolgot tanultam meg a saját webhelyemről.
A ChatGPT-források lebontását az utolsó 12 feltérképezésből csak 1 alkalommal rögzítették. A Common Crawl által tárolt példány pedig egyáltalán nem a tiszta URL.

A CCBot egy hírlevél hivatkozáson keresztül találta meg az oldalt, és a ConvertKit nyomkövetési paraméterei mellett tárolta. Nagyon régen abbahagytam a Kit használatát.
A feltérképező robot nem úgy böngészi a webhelyet, ahogy Ön elképzeli. Bármilyen linket is tartalmaz a weben, azt követi.
Tárolt másolat ellenőrzése
Az utolsó darab egy tárolt másolati csekk. Az eszköz begyűjti a kezdőlaphoz archivált CCBot tényleges bájtjait, kivonja a szöveget, és összehasonlítja az élő HTML-kóddal.
Mindkét oldal beolvasásra kerül a JavaScript futása előtt, ez a lényeg, mert a CCBot soha nem futja le.

A láthatatlan blokkok
Kétféle blokk soha nem jelenik meg, ha kézzel ellenőrzi a robots.txt fájlt.
1. CDN alapértelmezett. A Cloudflare-en 2025 júliusa után létrehozott domain letiltja a mesterséges intelligencia feltérképező robotokat, hacsak valaki nem kapcsolta ki, és a kezelt robots.txt több millió olyan webhelyhez jutott el, amelyek tulajdonosai soha nem érintettek meg egy fájlt.
2. Élszabály. A WAF kihívást jelent a CCBot számára, miközben a robots.txt tisztán olvasható. A Common Crawl saját útmutatója szerint ellenőrizze a CDN irányítópultját, mielőtt bármihez hozzányúlna a szerveren, és igazuk van. Ez az egyetlen hely, ahol nem néz ki klasszikus SEO bejáró.
Mi mozgatja valójában a befogadást
Ha az eredmény nyitott, de alig rögzített, akkor soha nem volt probléma a blokkolással.
Feltérképezési prioritás volt.
A Common Crawl az egyes webhelyekről mintát vesz a domain összekapcsolásának mértéke alapján, így néhány dolog számít.
- Először javítsa ki a CDN-t. Ha az élő szonda kihívást mutat, akkor semmilyen robots.txt szerkesztés nem segít.
- Engedje be a CCBot-ot. A szabály hiánya már igent jelent. Az enyém kifejezetten megengedi, és közben idézi a Mátrixot. (Nézd meg)
- Webhelytérkép hozzáadása a robots.txt fájlhoz. A CCBot a webhelytérkép protokollt követi.
- Renderelés a szerveren. A CCBot nem hajtja végre a JavaScriptet, így a csak hidratálás után létező tartalom üres héjat hagy a betanítási adatokban. A méret 2025 márciusában megszűnt mentségnek lenni, amikor a tárolt korlát oldalanként 1 MiB-ról 5 MiB-ra csökkent.
- Szerezzen linkeket a jól összekapcsolt webhelyekről. A feltérképezési prioritás a harmonikus központiságot követi, amelyet a Metehan Yeşilyurt webes grafikon eszközében nézhet meg. (Ne hallgass a „SEO halott” ellenzőkre. Vásárolj tovább, elnézést, a linkek építésére gondoltam.)
Amit ez az eszköz nem tud elmondani
A Common Crawlban való részvétel nem tesz modellt.
Minden oktatókészlet szűri a bejárást, és a határlaboratóriumok 2023 körül leálltak a mixeik közzétételével.
A vékony lefedettség önmagában sem bizonyít semmit, mert a Common Crawl a web mintája, nem pedig másolata.
Ezért az ellenőrző együtt megvizsgálja a rögzítéseket, a robotok előzményeit és az élő szondát, mielőtt ítéletet mond.
Ha hárman nem értenek egyet, akkor azt mondja.
Futtassa
Ellenőrizze a domainjét.
Ezután ellenőrizze az ügyfelet. Ha a robots.txt előzményei olyan blokkot mutatnak, amely abban a hónapban jelent meg, amikor a webhely megváltoztatta a CDN-eket, akkor pontosan tudni fogja, mi történt, és valószínűleg Ön lesz az első, aki elmondja nekik.
A hozzáférés-ellenőrző lefedi a mesterséges intelligencia bejáró képének többi részét, a GPTBotot és a ClaudeBotot és barátait, élőben.
Ezt a bejegyzést eredetileg a Suganthan oldalon tették közzé.
