Valaki a Redditen megkérdezte, hogy sikerült-e valakinek leértékelési fájlokat szolgáltatnia az LLM-eknek. A Google John Mueller megosztotta személyes tapasztalatait az LLM-fogyasztáshoz szükséges leértékelési fájlok tesztelésével kapcsolatban.
Markdown fájlok LLM-ek számára
A Markdown fájlok gépi és ember által olvasható tartalom, amely jelölést tartalmaz, amely jelzi, hogy valami fejléc és így tovább. Lényegében csak az összes interaktivitás eltávolított tartalma, tehát nincs JavaScript vagy CSS.
Az ötlet az, hogy ezeknek a fájloknak az LLM-eknek való kiszolgálása lehetővé teszi számukra a tartalom felhasználását anélkül, hogy meg kellene küzdeniük az idegen HTML-lel, JavaScripttel és minden mással, ami kifejezetten az emberi interakcióhoz szükséges.
A leértékelési fájlok LLM-nek való kiszolgálásának motivációja az, hogy előnyt szerezzenek a rangsorolásban az AI-keresési felületeken.
Volt valakinek sikeres a Markdown Files-szal?
A Redditen egy személy ezzel a kérdéssel indította a vitát:
„Már gyorsítótárazom a html-weboldalaimat, így nem kell túl nagy munka, hogy leértékelésre konvertáljam és újra gyorsítótárazzam, majd ellenőrizzem a fejléceket, hogy egy bot kérjen-e leértékelést. Mindent elolvastam, amit online találok, és az a konszenzus, hogy ez nem segít több mesterséges intelligencia-hivatkozásban, de nem is fog ártani.
Azon tűnődöm, érdemes-e még mindig megtenni, pusztán azért, hogy megállítsák az AI-botok kalapálását az oldalamon. Néhányat le kellett tiltanom a Cloudflare-ben, mert megőrültek, de ha kisebb leértékelési fájlokat kérnek, akkor talán érdemes lesz újra beengedni őket (kb. harmadára le tudom vágni a fájlokat).
Feltételezem, hogy a kérdésem az, hogy valóban látta-e valaki, hogy az egyik fő mesterséges intelligenciabot kéri a leértékelést?
John Mueller, a Google munkatársa megosztotta tapasztalatát, miszerint a leértékelési fájljait csak a SEO eszközök ütik meg.
Mueller megosztotta:
„Tesztoldalaimon az egyetlen bejáró, amely azt állítja, hogy elfogadja a leértékelést, a SEO eszközök. Ymmv.
(Az is bosszantó, hogy az általam használt szerverbeállítások nem naplózzák az elfogadás fejlécet, így manuálisan kell beállítani a naplózást, még akkor is, ha csak azt szeretné látni, hogy valaki elfogadja-e. Ha kíváncsi a webhelyeire, azt javaslom, hogy találja ki a naplózás módját, és először ellenőrizze a mérőszámokat.)”
A Markdown fájlok olyanok, mint a kulcsszó metacímkéi
Az LLM-ek Markdown-fájljaival az a probléma, hogy az összes generatív kereső- és LLM-cég teljesen elsajátította a HTML-fájlok feltérképezését és indexelését. Továbbá az az érdekük, hogy azt töltsék le, amit a felhasználók látnak, nem pedig speciális tartalmakat, amelyeket csak LLM-ek számára készítettek.
Ennek az az oka, hogy a webhelytulajdonosokra és a keresőoptimalizálókra nem lehet megbízni olyan tartalmat, amely csak az LLM-eknek szól. Ez az oka annak, hogy a kulcsszó metacímkéi sikertelenek. Mindenki teletömte kulcsszóváltozatokkal, elírásokkal és olyan kifejezésekkel, amelyek nem szerepeltek a tartalmukban.
Az LLM-ek és a mesterséges intelligencia-ügynökök nem használnak leértékelési fájlokat, mert nem megbízhatóak, és mivel a HTML-tartalom letöltése és indexelése triviális, ez egy olyan probléma, amelyet már jó harminc éve megoldottak.
Markdown AI-ügynökök számára
A Cloudflare azt hiszi, hogy a leértékelési fájlok rendkívül népszerűek az LLM-ek körében. Olyan szolgáltatásokat kínálnak, amelyek leértékelési fájlokat biztosítanak az AI-ügynökök számára, akik lényegében ezt kérik.
Nemrég ezt írták:
„A Markdown gyorsan az ügynökök és a mesterséges intelligencia rendszerek egészének lingua francaává vált. A formátum explicit felépítése ideálissá teszi az AI-feldolgozáshoz, ami végső soron jobb eredményeket eredményez, miközben minimálisra csökkenti a token-pazarlást.
A Cloudflare hálózata támogatja a valós idejű tartalomkonverziót a forrásnál, az engedélyezett zónákban a tartalomegyeztetési ↗ fejlécek használatával. Amikor a mesterséges intelligencia rendszerek oldalakat kérnek le bármely webhelyről, amely Cloudflare-t használ, és amelyen engedélyezve van a Markdown for Agents, akkor a kérésben kifejezhetik a szöveg/lejelölés preferenciáját, és hálózatunk automatikusan és hatékonyan konvertálja a HTML-t Markdown-ra, ha lehetséges, menet közben.”
Őszintén szólva ez nem a valóság. Ha így történt volna, a Reddit-beszélgetés tele lett volna sikertörténetekkel.
Utasítások AI-ügynökök számára
Az OpenAI és az Anthropic valósághűbb a leértékelési fájlokkal kapcsolatban, mert ez a „lingua franca” az AI-ügynökök készségeihez, útmutatásaihoz és utasításaihoz.
Az OpenAI támogatási oldala elmagyarázza:
„Egyéni utasítások az AGENTS.md-vel
Adjon a Codexnek további utasításokat és kontextust a projektjéhezA Codex minden munka előtt beolvassa az AGENTS.md fájlokat. Ha a globális útmutatást projektspecifikus felülírásokkal rétegezi, minden feladatot következetes elvárásokkal kezdhet, függetlenül attól, hogy melyik adattárat nyitja meg.”
Elvitelre
- Nincs bizonyíték arra, hogy a weboldalak Markdown-verzióinak kiszolgálása javítaná a mesterséges intelligencia hivatkozásait vagy az AI-keresés láthatóságát.
- John Mueller, a Google munkatársa azt állítja, hogy a tesztoldalain az egyetlen olyan robot, amely a leértékelési fájljait körüljárta, a SEO eszközök voltak.
- Mueller azt tanácsolja, hogy állítson be módszereket annak nyomon követésére, hogy az AI-botok valóban kérik-e a Markdown-t, mielőtt all-in generálnák őket a robotokhoz.
- Minden mesterséges intelligencia rendszer már képes feltérképezni és indexelni a HTML-t. Nincs szükségük a HTML-oldalak külön Markdown verziójára.
- A Cloudflare támogatja a HTML automatikus konvertálását Markdown-ba, amikor az AI-rendszerek ezt kérik. Ám az AI-ügynök iránti kereslet ábrázolása túlzottan lelkes.
- A Markdown már hasznos az AI-ügynök utasításaihoz és kontextusához, beleértve az OpenAI Codex által az AGENTS.md-t, valamint az Anthropic Claude-ot is.
- A Markdown hasznossága az AI-ügynökök számára nem terjed ki az AI keresőmotorokban való feltérképezés, indexelés és rangsorolás előnyeire.
