Najboljših 5 ta teden

Sorodni članki

Anthropicov nevidni vodni žig: kako in kdaj besedilu doda skrite šifre ter kdaj ne deluje

Anthropic je ustregel zahtevam EU in vsako besedilo, ustvarjeno s Claude (in njihovimi ostalimi modeli), opremil s skrito šifro, ki razkrije, ali je besedilo napisala umetna inteligenca.

Anthropic je v novih modelih Claude uvedel strojno zaznaven, bralcem neviden vodni žig. Njegov namen je pokazati, ali je Claude besedilo verjetno ustvaril ali obdelal, ne pa dokazati avtorstva ali identitete uporabnika.

Anthropic navaja, da novi podprti modeli Claude med ustvarjanjem besedila vstavljajo neopazen statistični vzorec. Sistem temelji na pristopu SynthID-Text podjetja Google DeepMind, predstavljenem v reviji Nature leta 2024.

Kako nastane vodni žig?

Vodni žig nastane na ravni modela. Pri izbiri naslednje besede Claude običajno izbira med več verjetnimi možnostmi. Pri manj pomembnih odločitvah uporabi ključ in predhodne besede, s čimer ustvari statistični vzorec. Ta ni zapisan kot vidna oznaka, dodatno besedilo ali skriti znak, zato ga bralec v odgovoru ne opazi. Anthropic trdi, da sistem ne spreminja pomena, kakovosti, ustvarjalnosti ali berljivosti odgovorov.

Detektor z ustreznim ključem lahko nato oceni verjetnost, da je bil pri nastanku ali obdelavi besedila vključen Claude. To je pomembna omejitev: pozitiven rezultat ne dokazuje, da je Claude napisal celotno delo ali da je ustvaril njegove ideje. Signal se lahko v nekaterih primerih ohrani tudi po lektoriranju, prevajanju, povzemanju ali drugi obdelavi, vendar lahko zlasti obsežnejša obdelava zaznavo oslabi ali prepreči, zato zaznava sama po sebi ne razkriva, kakšna je bila vloga modela.

Vodni žig tudi ne potrjuje, da je besedilo napisal človek, ne prepoznava drugih ponudnikov umetne inteligence in ne razkriva identitete uporabnika, računa, organizacije, pogovora ali vira. Prav tako ni samostojen dokaz o kršitvi pravil ali neprimernem ravnanju.

Praktična uporabnost je odvisna od količine in vrste besedila. Zaznava je manj zanesljiva pri kratkih odlomkih ter vsebinah z malo smiselnimi alternativami za naslednjo besedo, kot so faktografski odlomki in velik del računalniške kode. Lahkotno urejanje lahko signal ohrani, obsežno prepisovanje, parafraziranje, prevajanje ali mešanje z drugim besedilom pa ga lahko oslabi ali odstrani. Anthropic ne navaja javnih meril natančnosti, stopnje lažno pozitivnih rezultatov ali najmanjše dolžine za zanesljivo zaznavo.

Za podprte datoteke Anthropic uporablja ločene, digitalno podpisane podatke o izvoru na podlagi standarda C2PA, kjer je ta funkcija podprta. Besedilni vodni žig torej ni enak mehanizem kot podatki o izvoru pri datotekah.

Modeli Claude, predstavljeni v Evropski uniji 2. avgusta 2026 ali pozneje, naj bi strojno označevanje podpirali že ob uvedbi. Anthropic dodaja, da bo označevanje starejših modelov uvedel v prihodnjih mesecih. Podjetje pojasnjuje, da sistem ob uvedbi uporablja globalno, saj še nima trajnega načina za omejitev po regijah. Prav tako razvija orodja za uporabnike in tretje osebe ter načrtuje API za zaznavanje vodnih žigov, vendar datum izdaje, cena, dostop in tehnične lastnosti še niso objavljeni.

Najbolj popularno