A webhelyemen az elmúlt napban található legnagyobb mesterségesintelligencia-robot nem MI-robot volt. Nagyjából 1500 alkalommal érkezett meg Common Crawl nevén; semmit nem küldött vissza, és amit akart, az az SSH-kulcsom volt.
Egy szám miatt kerestem.
A Cloudflare pénzügyi igazgatója azt mondta az elemzőknek, hogy a gépforgalom elérheti az emberi forgalom 1000-szeresét
A Cloudflare pénzügyi igazgatója, Thomas Seifert a cég második negyedéves eredménykimutatása kapcsán elemzőknek azt mondta, hogy „ha a jelenlegi tendenciák folytatódnak, úgy gondoljuk, hogy öt év múlva a nem emberi forgalom 1000-szerese lesz az emberi forgalomnak”. Aztán a sor, amely megragadja a főcímeket: „Az emberek kerekítési hibának számítanak az interneten, nem azért, mert csökken az emberi forgalom, hanem éppen ilyen gyorsan nő a nem emberi forgalom.”
Két dolgot érdemes elmondani, mielőtt bárki a vasvillához nyúlna. Először is, Seifert kéretlenül hozzátette a saját figyelmeztetését: „azzal a nagy figyelmeztetéssel, hogy az út minden pontján rossznak neveztem.” A Cloudflare korábban arra számított, hogy a gépforgalom 2027-ben áthalad az emberforgalomon, és ez 2026 májusában történt. alattbecslés, ami a legerősebb érv a vetület komolyan vétele mellett.
Másodszor, az alapul szolgáló mérés valós. A Cloudflare ugyanazon a héten közzétett saját bejegyzése szerint az összes HTML-oldalkérelem kevesebb mint fele érkezik embertől. nekem ezzel nincs érvem. A géplátogatók valódiak, és ennek a weboldalnak az egész tárgya.
A vita arról szól, hogy mit számít a szám.
Így néz ki egy nap feltérképező forgalom a saját webhelyemen
A Cloudflare mesterséges intelligencia bejáró nézetét lehívtam a nohacks.co oldalra az augusztus 7-én este végződő 24 órára. Körülbelül 3000 kérés, amelyeknek nagyjából egyharmada sikertelen volt, ami több mint 1000%-kal több, mint az előző időszakban.
Bejáróval: CCBot 1,510. ChatGPT-User 375. ClaudeBot 296. Googlebot 245. PetalBot 107. Tizenhárom másik 353 osztja meg közöttük.
A CCBot a Common Crawl bejárója, a régóta működő non-profit webarchívum, amelynek korpusza képezte azoknak a modelleknek a nagy részét, amelyekről most mindenki vitatkozik. Papíron, hogy ez a legnagyobb látogatóm, feltűnő.
Aztán exportáltam az útvonalakat.
Az SSH kulcsaimat kérte, nem a cikkeimet
Íme az AI feltérképező forgalom legkeresettebb útvonalai a kérések számával, pontosan úgy, ahogyan az exportálásból kijöttek:
/.ssh/known_hosts(42 kérés)/phpinfo.php(31 kérés)/.boto(30 kérés)/.env.production(29 kérés)/.vscode/launch.json(28 kérés)/.env.test(27 kérés)/firebase-service-account.json(26 kérés)/.gitconfig(24 kérés)/server/.env(24 kérés)
Így megy ez száz úton: /id_rsa, /id_ecdsa, /private-key, /ssl/localhost.key, /key.json, /serviceAccountKey.json, /.aws/config, /actuator/configprops, /api/v1/env, /Dockerfile, /values.yamlés /@fs/proc/self/environamely egy fejlesztői szerver ismert útvonal-bejárási hibájára tett kísérlet.
Ezen a száz útvonalon keresztül: 1028 kérés, 6,7 MB átvitel és nulla hivatkozás. A ténylegesen általam írt bármire vonatkozó kérések száma a semmihez nem ér. Ez volt a legközelebb a tartalmamhoz /blog/wp-login.phpegy WordPress bejelentkezési vizsgálat, amely olyan webhelyre irányul, amelyen még soha nem futott WordPress, és két kérés a /blog/null.
Ez az utolsó részlet többet számít, mint amilyennek látszik. Bármi is legyen ez, nem olvassa el az oldalaimat, mielőtt rákérdez. Egy listán dolgozik, ugyanazon a listán működik mindenhol, és a webhelyem egy sor a ciklusban.
Ez egy hitelesítő adatolvasó. A Common Crawl követi a hivatkozásokat és lekéri az oldalakat, és nincs oka arra, hogy egy podcast-webhelytől elkérje a Firebase szolgáltatási fiók kulcsát.
Nem tudtam ellenőrizni a forráscímeket a megszemélyesítés bizonyítására, mert a kérésenkénti IP-adatokat nem tudom elérni a tervemmel. A Common Crawl közzéteszi a tesztet: az eredeti CCBot forgalom dokumentált címblokkokból származik, és fordítottan oldja fel a következőre végződő gazdagépnevekre crawl.commoncrawl.org. Valaki, aki rendelkezik ezekkel a naplókkal, egy perc alatt elintézi. Azt tudom mondani, hogy mi érkezett, mit kért, és hogyan címkézték: A Cloudflare mesterséges intelligencia irányítópultja ezt a Common Crawl-nak, mint operátornak tulajdonítja, és minden kérést beleszámít a mesterséges intelligenciarobotok összesített adataiba.
Ami az engem leginkább nyugtalanító részhez vezet. Megkerestem ezeket a kéréseket a biztonsági események között, de semmit sem találtam, mert a biztonsági napló csak azokat a kéréseket rögzíti, amelyek egy szabályt kioldanak. Nem blokkolom ezt a forgalmat, így áthalad, kiszolgálják, és nem hagy nyomot. Pontosan egy helyen jelenik meg az egész irányítópulton: az AI bejáró nézetben, amely a ChatGPT-User és a Googlebot mellett található a listában, egy nonprofit kutatási archívum neve alatt. A hitelesítő adatolvasó számomra teljesen olvasható ügynökforgalomként, és teljesen láthatatlan biztonsági eseményként.
Az utak közül kettő új, és ezek azok, amelyekre folyamatosan gondolok
A listán vannak eltemetve /.mcp.json30 alkalommal kérték, és /.continue/config.jsonkért 24.
Ez a kettő az ügynökszerszám konfigurációja: egy MCP-kiszolgáló definíciója és egy kódolási asszisztens beállítási fájlja. Mindkettő rutinszerűen rendelkezik API-kulcsokkal és hozzáférési jogkivonatokkal, mert ezt helyezi el bennük, hogy az ügynök elérje szolgáltatásait.
Valaki hozzáadta az ügynök hitelesítő adatait a szabványos titkos keresési szólistához. Ugyanaz az automatikus söprés, amelyet az internet minden webhelyétől kértek /.env mivel a nagyjából forever most azt a fájlt is kéri, amely felsorolja, hogy az ügynökei mely eszközöket hívhatják meg, és mivel hitelesítenek. Senki nem jelentette be, és gyorsan történt. Ha bármilyen ügynököt futtat, a szólista még azelőtt megérkezett, hogy a legtöbb ember befejezte volna az első MCP-kiszolgáló megírását.
A Cloudflare ugyanazon a héten tette közzé magát a javítást
A bevétel-felhívás keretezésének legerősebb ellensúlya a Cloudflare saját mérnöki írása ugyanazon a héten.
Ügynöki internetes bejegyzésük szerint a jól viselkedő robotoktól érkező nagy forgalom olyan oldalakat tölt le, amelyek nem változtak, és ez kérések milliárdjaihoz vezet. Az ő szavaik szerint „hatalmas gépi erőfeszítés, amely semmiféle eredményhez kötődik”.
A gépi erőkifejtés és a gépigény különböző mennyiségek. A saját naplóim ugyanannak a pontnak az élesebb változata, mint amire számítottam: a gépforgalmamban a legnagyobb hozzájáruló nem csupán haszontalan volt, hanem ellenséges is, és még mindig számított.
Ha Ön a webhely tulajdonosa, a haszontalan forgalom meghatározása a meta feltérképezése a webhelyén, és soha semmit nem küld vissza. A felosztásról augusztus 1-jén írtam. Egy kutatórobot nevét viselő szkenner, miközben az Ön felhőalapú hitelesítő adataira vadászik, egy kategória alatt van, és mindkettő ugyanabban a sávban landol ugyanazon a diagramon.
Tehát amikor a grafikon emelkedik, a webhely tulajdonosának az a kérdés, hogy mekkora a forgalom valójában.
Segítsen létrehozni a problémát, piacra dobni a problémát, eladni a megoldást
Világos, hogy a Cloudflare miként pozicionálja magát itt, és ezt ki kell hívni. Segítsen létrehozni a problémát, piacra dobja a problémát, eladja a megoldásokat. Csak augusztus első hetében: egy bot-forgalmi előrejelzés a bevételi felhívásról, egy blogbejegyzés, amely számszerűsíti, hogy az internet mekkora része már nem ember, egy ügynök-készenléti szkenner, amely jelzi, hogy még nem áll készen, egy mesterséges intelligencia-láthatósági termék, amely pontozza Önt, egy híd, amely a webhely eszközeit az ügynökök elé tárja, és egy alapértelmezés, amely szeptemberben elkezd blokkolni néhányat, ha az ügynökök különben nem blokkolnak.
Ezen termékek mindegyike ésszerű válasz valami valódira. Ez az, ami miatt a mintát érdemes észrevenni, nem pedig elvetni. A problémát mérő, a problémát megfogalmazó és a javítást értékesítő cég egy cég, és most a mérő és a szelep is övék.
Óvatos akarok lenni, mert sok mindent támogattam, amit a Cloudflare tett. A feltérképezésenkénti fizetés a helyes ötlet volt. Tartalom A függetlenség napja a helyes ötlet volt. Ha a webhelytulajdonosoknak valódi választási lehetőséget biztosítunk afelől, hogy mely gépek kerüljenek be, az legyőzi azt a bíróságot, amely helyettük dönt, ez az, amivel érveltem, amikor a Kilencedik Kör felvetette ezt a kérdést augusztus 4-én.
Mindez egyszerre lehet igaz. A Cloudflare egyszerre tud néhány jót, néhány irányban jót és néhány vázlatosnak tűnő dolgot. A legtöbb cég képes rá. Az a hiba, hogy eldöntjük, ők a jófiúk vagy a rosszfiúk, majd végigolvasunk mindent, amit csinálnak.
Menjen, és nézze meg saját naplóit
Vegyük komolyan a forgalmi számokat, és vegyük a megérdemelt sóval a keretezést. A legtöbb kérés a gépekre vonatkozik. Ez mért, és ez igaz.
Ezután nyissa meg saját bejáró elemzését, és olvassa el az útvonalakat, ne az összesítést. Az enyém három dolgot mondott el, amit ma reggel nem tudtam: hogy a legnagyobb mesterséges intelligencia bejáróm egy szkenner, hogy a sávszélességem megabájtjait égette el a semmire, és hogy a szólista, amelytől mostantól működik, tartalmazza azokat a konfigurációs fájlokat, amelyekben azt hiszi, hogy az ügynökeszközömben él.
Ennek a részletnek egyike sem szerepel senki kivetítésében. A kötet az. Ebből tizenötszáz érkezett egyetlen nap alatt egyetlen kis weboldalra, mindegyik beleszámít az elemzőknek leírt ezer az egyhez Seifertbe, és egyikük sem akart semmit, amit írtam.
Ez a bejegyzés eredetileg a No Hacks oldalon jelent meg.
