Az Anthropic felfedi, mi a vízjel, és hogyan lehet legyőzni

Peter

Az Anthropic bejelentette, hogyan működik a vízjel, és megerősítette az összes korábban közölt részletet a MirrorMark nevű hasonló vízjelezési módszerről. A MirrorMark-hoz hasonlóan a vízjel maga a véletlenszerűségi minta, amely tükrözi az LLM véletlenszerűségét, amikor szöveget generál.

Hogyan működik a vízjel

Ellentétben azzal, amit egyes AI-befolyásolók mondanak, nincsenek Unicode-karakterek, amelyek be vannak ágyazva a szövegbe. Tehát nem másolhatja be és illesztheti be egy szövegfájlba, hogy eltávolítsa vagy azonosítsa.

Ezenkívül nem az em dash használatáról van szó, és nem az LLM-ek által általában használt mintákról sem, mint például a „Nem ez, hanem az” írásmód. Nem annak a valószínűségét keresi, hogy valamit mesterséges intelligencia írt.

Egy adott vízjelmintát keres.

Az LLM-ek létrehozzák a következő valószínű szöveget egy sorozatban, de véletlenszerűséggel. Nem mindig választja ki a legvalószínűbb következő szót; van egy véletlenszerű elem a kiválasztott szóban. A SynthID ezt a véletlenszerűséget használja fel egy vízjelkulcs és a megelőző szavak kontextusa által diktált minta beállítására. Mivel a SynthID-stílusú vízjel finoman megváltoztatja a szóválasztás véletlenszerűségét, a generált szöveg megkülönböztethetetlen a normál generált szövegtől. A felhasználók nem tudják azonosítani a vízjelet a vízjelkulcs nélkül.

Anthropic magyarázza:

„Ez a minta nem észlelhető az olvasó számára, de mindenki számára észlelhető, akinek van kódoló kulcsa. Vízjel használatakor a választás továbbra is véletlenszerűen történik, de a véletlenszerűség forrása más. Ahelyett, hogy egy tetszőleges véletlenszám-generátort használna a következő szó kiválasztásához, a vízjel a kulcsot és néhány előtte lévő szót használja, hogy eldöntse, melyik szót választja ki, de a modell még mindig üdvözölheti. ellenőrizze a szavak sorrendjét, és nézze meg, hogy összhangban van-e azzal a döntéssel, amelyet Claude a kulcs használata esetén választana.

A SynthID egy verziója

A bejelentés szerint az új vízjel a SynthID-Text verziója, amelyet a Google DeepMind fejlesztett ki 2024-ben. Ez nem SynthID, hanem annak egy változata. Az ilyen típusú vízjelek technika állása jelentősen javult az elmúlt két évben.

A közleményben ez áll:

„Claude szöveges vízjele a SynthID-Text megközelítés egy változata, amelyet a Google DeepMind tett közzé egy Nature-cikkben 2024-ben. A Scott Aaronson 2022-es javaslatára visszanyúló megközelítések családjába tartozik, amelyek mindegyike ugyanazt a tervezési elvet követi, mint amit fentebb leírtunk – a vízjel csak a szavak véletlenszerűségének forrását változtatja meg.”

Legyőzhető az Anthropic’s Watermark?

Igen, átfogalmazva legyőzhető. Az Anthropic szerint a könnyű szerkesztés valószínűleg nem fogja legyőzni.

Az Anthropic szerint:

„Nem szerkesztheti valaki egyszerűen a szöveget, hogy megkerülje a vízjelet?
Bizonyos mértékig igen. A könnyű szerkesztés valószínűleg nem távolítja el teljesen a vízjelet; egy teljes újraírás, ahol minden szó ki van cserélve. Utóbbi esetben természetesen vitatható, hogy a szöveget leírhatjuk-e már AI által generáltnak.”

A SynthID azt a vízjel szómintát keresi, amelyet a szöveg létrehozásakor szúrtak be. Tehát ha eleget átfogalmazod vagy szerkeszted a dokumentumot, akkor a vízjelként működő szavak törlődnek.

Ez nem SynthID

A SynthID-t 2024-ben fejlesztették ki, és az elmúlt két évben fejlődött a legkorszerűbb.

A SynthID legújabb verziója, a MirrorMark, kiterjeszti a SynthID-t azáltal, hogy a vízjelet szétteríti a generált szövegben, és a környező szavakat használja kontextusként az egyes részek elhelyezésének meghatározásához, ami ellenállóbbá teszi a szerkesztéssel szemben.

A SynthID egy nulla bites vízjel, ami azt jelenti, hogy vízjelet vagy vízjelet észlel. A MirrorMark több bitnyi információt is képes kódolni, lényegében szétszórva a vízjelet a generált szövegben.

Íme, mire képes egy 2026-os verzió, például a MirrorMark:

  • Többbites kódolást ad hozzá.
  • Az LLM szöveggenerációjának véletlenszerűségét tükrözi.
  • A CABS-t, a kontextushoz rögzített kiegyensúlyozott ütemezőt használja, amely eldönti, hogy a különböző vízjelek hova legyenek beágyazva.
  • Kifejezetten úgy tervezték, hogy ellenálljon a szerkesztésnek (mint az Anthropicé, amely ellenáll a könnyű szerkesztésnek).

Nem azt mondom, hogy az Anthropic a MirrorMarkot használja. De azt mondom, hogy mielőtt az összes tojást a SynthID kosárba helyezné, amely két éves, hasznos lehet megnézni, mire képes a SynthID 2026-os verziója.

Főbb kivonatok az Anthropic vízjeléből

Íme a legfontosabb kivonatok abból, amit az Anthropic felfedett:

  • Claude vízjellel látja el a jövőbeli szövegkimeneteket.
    Az Anthropic szerint a jövőbeni Claude-modellek vízjeles szöveget fognak generálni az EU AI-törvényének való megfelelés részeként.
  • A vízjel egy szöveggenerálás során létrehozott minta.
    Nem Unicode, metaadatok vagy rejtett karakterek. A vízjel a szókiválasztási folyamaton keresztül jön létre.
  • Claude vízjele a SynthID-Text egy változata.
    Az Anthropic szerint módszere a Google DeepMind 2024-es SynthID-Text megközelítésén alapul.
  • A vízjel megváltoztatja a szavak kiválasztásához használt véletlenszerűség forrását.
    Claude még mindig véletlenszerűen választ a hihető szavak között, de a vízjel kulcsot és az azt megelőző szavakat használják ennek a véletlenszerűségnek a meghatározására.
  • A vízjel kimutatható mintát hoz létre Claude szóválasztásában.
    Valaki, aki rendelkezik a kulccsal, ellenőrizheti, hogy a szavak sorrendje összhangban van-e azzal a döntéssel, amelyet Claude adott volna a kulcs használatával.
  • A szöveghez nincs hozzáadva semmi.
    Az Anthropic kifejezetten azt mondja, hogy nincsenek rejtett karakterek, nincsenek extra tokenek, és nincsenek látható kiegészítések.
  • A vízjeles szöveget nem lehet megkülönböztetni a nem vízjeles szövegtől.
    Az Anthropic szerint a vízjelnek nincs hatása a minőségre vagy a generált tartalomra.
  • A vízjel nem készteti Claude-ot szokatlan szóválasztásra.
    Az Anthropic azt mondja, hogy nem torzítja Claude-ot bizonyos szavak felé.
  • A kevesebb szó kevésbé észlelhetővé teszi.
    Az Anthropic szerint a vízjel-észlelés gyengén működik kis mintákon. Több szóval jobban működik.
  • A vízjel gyengébb a ténytartalomban.
    Kevésbé megbízható, ha kevesebb szó közül lehet választani a tényszerű tartalomtípuson alapuló korlátok miatt.
  • A vízjel gyengébb, ha korrektúra típusú szerkesztésekhez használják.
    Antropikus azt mondja, ha tekérje meg, hogy csak a nyelvtant és az írásjeleket szerkessze, semmi mást, a vízjel csak a maroknyi javításban élhet, ami talán túl kevés a regisztrációhoz.”
  • Az Anthropic egy vízjel-észlelő API kiadását tervezi.
  • A nem szöveges képfájlok, mint például a JPG, PNG és SVG, C2PA metaadatokat használnak.
  • A vízjelezés triviális hatással van a sebességre, és nem jár több token költséggel.

A szerzőről

Peter, az eOldal.hu tapasztalt SEO szakértője és tartalomgyártója. Több mint 10 éve foglalkozik keresőoptimalizálással és online marketinggel, amelyek révén számos magyar vállalkozás sikerét segítette elő. Cikkeiben részletes és naprakész információkat nyújt az olvasóknak a legfrissebb SEO trendekről és stratégiákról.