Az Anthropic bejelentette, hogyan működik a vízjel, és megerősítette az összes korábban közölt részletet a MirrorMark nevű hasonló vízjelezési módszerről. A MirrorMark-hoz hasonlóan a vízjel maga a véletlenszerűségi minta, amely tükrözi az LLM véletlenszerűségét, amikor szöveget generál.
Hogyan működik a vízjel
Ellentétben azzal, amit egyes AI-befolyásolók mondanak, nincsenek Unicode-karakterek, amelyek be vannak ágyazva a szövegbe. Tehát nem másolhatja be és illesztheti be egy szövegfájlba, hogy eltávolítsa vagy azonosítsa.
Ezenkívül nem az em dash használatáról van szó, és nem az LLM-ek által általában használt mintákról sem, mint például a „Nem ez, hanem az” írásmód. Nem annak a valószínűségét keresi, hogy valamit mesterséges intelligencia írt.
Egy adott vízjelmintát keres.
Az LLM-ek létrehozzák a következő valószínű szöveget egy sorozatban, de véletlenszerűséggel. Nem mindig választja ki a legvalószínűbb következő szót; van egy véletlenszerű elem a kiválasztott szóban. A SynthID ezt a véletlenszerűséget használja fel egy vízjelkulcs és a megelőző szavak kontextusa által diktált minta beállítására. Mivel a SynthID-stílusú vízjel finoman megváltoztatja a szóválasztás véletlenszerűségét, a generált szöveg megkülönböztethetetlen a normál generált szövegtől. A felhasználók nem tudják azonosítani a vízjelet a vízjelkulcs nélkül.
Anthropic magyarázza:
„Ez a minta nem észlelhető az olvasó számára, de mindenki számára észlelhető, akinek van kódoló kulcsa. Vízjel használatakor a választás továbbra is véletlenszerűen történik, de a véletlenszerűség forrása más. Ahelyett, hogy egy tetszőleges véletlenszám-generátort használna a következő szó kiválasztásához, a vízjel a kulcsot és néhány előtte lévő szót használja, hogy eldöntse, melyik szót választja ki, de a modell még mindig üdvözölheti. ellenőrizze a szavak sorrendjét, és nézze meg, hogy összhangban van-e azzal a döntéssel, amelyet Claude a kulcs használata esetén választana.
A SynthID egy verziója
A bejelentés szerint az új vízjel a SynthID-Text verziója, amelyet a Google DeepMind fejlesztett ki 2024-ben. Ez nem SynthID, hanem annak egy változata. Az ilyen típusú vízjelek technika állása jelentősen javult az elmúlt két évben.
A közleményben ez áll:
„Claude szöveges vízjele a SynthID-Text megközelítés egy változata, amelyet a Google DeepMind tett közzé egy Nature-cikkben 2024-ben. A Scott Aaronson 2022-es javaslatára visszanyúló megközelítések családjába tartozik, amelyek mindegyike ugyanazt a tervezési elvet követi, mint amit fentebb leírtunk – a vízjel csak a szavak véletlenszerűségének forrását változtatja meg.”
Legyőzhető az Anthropic’s Watermark?
Igen, átfogalmazva legyőzhető. Az Anthropic szerint a könnyű szerkesztés valószínűleg nem fogja legyőzni.
Az Anthropic szerint:
„Nem szerkesztheti valaki egyszerűen a szöveget, hogy megkerülje a vízjelet?
Bizonyos mértékig igen. A könnyű szerkesztés valószínűleg nem távolítja el teljesen a vízjelet; egy teljes újraírás, ahol minden szó ki van cserélve. Utóbbi esetben természetesen vitatható, hogy a szöveget leírhatjuk-e már AI által generáltnak.”
A SynthID azt a vízjel szómintát keresi, amelyet a szöveg létrehozásakor szúrtak be. Tehát ha eleget átfogalmazod vagy szerkeszted a dokumentumot, akkor a vízjelként működő szavak törlődnek.
Ez nem SynthID
A SynthID-t 2024-ben fejlesztették ki, és az elmúlt két évben fejlődött a legkorszerűbb.
A SynthID legújabb verziója, a MirrorMark, kiterjeszti a SynthID-t azáltal, hogy a vízjelet szétteríti a generált szövegben, és a környező szavakat használja kontextusként az egyes részek elhelyezésének meghatározásához, ami ellenállóbbá teszi a szerkesztéssel szemben.
A SynthID egy nulla bites vízjel, ami azt jelenti, hogy vízjelet vagy vízjelet észlel. A MirrorMark több bitnyi információt is képes kódolni, lényegében szétszórva a vízjelet a generált szövegben.
Íme, mire képes egy 2026-os verzió, például a MirrorMark:
- Többbites kódolást ad hozzá.
- Az LLM szöveggenerációjának véletlenszerűségét tükrözi.
- A CABS-t, a kontextushoz rögzített kiegyensúlyozott ütemezőt használja, amely eldönti, hogy a különböző vízjelek hova legyenek beágyazva.
- Kifejezetten úgy tervezték, hogy ellenálljon a szerkesztésnek (mint az Anthropicé, amely ellenáll a könnyű szerkesztésnek).
Nem azt mondom, hogy az Anthropic a MirrorMarkot használja. De azt mondom, hogy mielőtt az összes tojást a SynthID kosárba helyezné, amely két éves, hasznos lehet megnézni, mire képes a SynthID 2026-os verziója.
Főbb kivonatok az Anthropic vízjeléből
Íme a legfontosabb kivonatok abból, amit az Anthropic felfedett:
- Claude vízjellel látja el a jövőbeli szövegkimeneteket.
Az Anthropic szerint a jövőbeni Claude-modellek vízjeles szöveget fognak generálni az EU AI-törvényének való megfelelés részeként. - A vízjel egy szöveggenerálás során létrehozott minta.
Nem Unicode, metaadatok vagy rejtett karakterek. A vízjel a szókiválasztási folyamaton keresztül jön létre. - Claude vízjele a SynthID-Text egy változata.
Az Anthropic szerint módszere a Google DeepMind 2024-es SynthID-Text megközelítésén alapul. - A vízjel megváltoztatja a szavak kiválasztásához használt véletlenszerűség forrását.
Claude még mindig véletlenszerűen választ a hihető szavak között, de a vízjel kulcsot és az azt megelőző szavakat használják ennek a véletlenszerűségnek a meghatározására. - A vízjel kimutatható mintát hoz létre Claude szóválasztásában.
Valaki, aki rendelkezik a kulccsal, ellenőrizheti, hogy a szavak sorrendje összhangban van-e azzal a döntéssel, amelyet Claude adott volna a kulcs használatával. - A szöveghez nincs hozzáadva semmi.
Az Anthropic kifejezetten azt mondja, hogy nincsenek rejtett karakterek, nincsenek extra tokenek, és nincsenek látható kiegészítések. - A vízjeles szöveget nem lehet megkülönböztetni a nem vízjeles szövegtől.
Az Anthropic szerint a vízjelnek nincs hatása a minőségre vagy a generált tartalomra. - A vízjel nem készteti Claude-ot szokatlan szóválasztásra.
Az Anthropic azt mondja, hogy nem torzítja Claude-ot bizonyos szavak felé. - A kevesebb szó kevésbé észlelhetővé teszi.
Az Anthropic szerint a vízjel-észlelés gyengén működik kis mintákon. Több szóval jobban működik. - A vízjel gyengébb a ténytartalomban.
Kevésbé megbízható, ha kevesebb szó közül lehet választani a tényszerű tartalomtípuson alapuló korlátok miatt. - A vízjel gyengébb, ha korrektúra típusú szerkesztésekhez használják.
Antropikus azt mondja, ha tekérje meg, hogy csak a nyelvtant és az írásjeleket szerkessze, semmi mást, a vízjel csak a maroknyi javításban élhet, ami talán túl kevés a regisztrációhoz.” - Az Anthropic egy vízjel-észlelő API kiadását tervezi.
- A nem szöveges képfájlok, mint például a JPG, PNG és SVG, C2PA metaadatokat használnak.
- A vízjelezés triviális hatással van a sebességre, és nem jár több token költséggel.
