Anthropic inserirà filigrane nei contenuti generati da Claude a livello globale, inclusi i testi modificati da umani
Punti chiave
- •I modelli Claude lanciati nell'UE dal 2 agosto in poi includeranno filigrane leggibili dalle macchine dal loro rilascio, con piani per estendere la tecnologia ai modelli precedenti.
- •Le filigrane verranno applicate a livello globale a tutti i prodotti Claude supportati piuttosto che limitarsi agli utenti dell'UE.
- •I contenuti scritti da umani che sono stati modificati, tradotti o revisionati da Claude potrebbero presentare la filigrana, anche quando il lavoro originale è stato scritto in modo indipendente.
- •Anthropic ha avvertito che la parafrasi pesante, i brevi passaggi di testo o le conversioni di file possono rendere le filigrane e i metadati non rilevabili, limitandone l'affidabilità come prova di paternità dell'IA.
- •Tutti i principali fornitori di IA che operano nell'UE, tra cui OpenAI, Google e Meta, affrontano obblighi di marcatura comparabili secondo le disposizioni di trasparenza dell'AI Act.

Anthropic ha annunciato che inizierà a incorporare filigrane invisibili nei testi prodotti dai suoi modelli di intelligenza artificiale Claude, in risposta ai nuovi requisiti di trasparenza previsti dall'EU AI Act, la prima normativa globale sull'IA al mondo. Le filigrane sono progettate per rendere più facilmente identificabile i contenuti generati dall'IA, ma il sistema flaggherà anche i testi originariamente scritti da umani che sono stati successivamente modificati o elaborati da Claude — una portata che potrebbe complicare gli sforzi per determinare se il materiale sia stato realmente creato dall'IA.
L'azienda di intelligenza artificiale con sede a San Francisco ha dichiarato martedì che i modelli Claude lanciati nell'UE a partire dal 2 agosto includeranno filigrane leggibili dalle macchine dal loro rilascio. Anthropic sta inoltre lavorando per estendere la tecnologia ai modelli precedenti.
Sebbene le filigrane siano state introdotte per conformarsi all'EU AI Act, Anthropic ha confermato che le marcature si applicheranno a livello globale ovunque siano disponibili i modelli Claude supportati, coprendo Claude, Claude Code e la sua piattaforma per sviluppatori.
I testi generati dai modelli porteranno una filigrana incorporata che, secondo Anthropic, dovrebbe persistere attraverso operazioni di copia-incolla e potrebbe sopravvivere ad almeno un certo grado di modifica. Le immagini e altri tipi di file supportati porteranno invece metadati firmati che indicano che sono stati elaborati da Claude.
Anthropic prevede di rilasciare strumenti che consentano a utenti e terze parti di rilevare le sue filigrane, sebbene le specifiche tecniche non siano ancora state divulgate.
L'annuncio arriva in un momento di crescente pressione da parte dei regolatori e degli editori affinché le aziende di intelligenza artificiale rendano i contenuti sintetici più identificabili, in seguito a un aumento dei materiali generati dalle macchine su Internet. Sotto le disposizioni di trasparenza dell'EU AI Act, tutti i principali provider di intelligenza artificiale che operano nel blocco — tra cui OpenAI, Google e Meta — affrontano obblighi comparabili per marcare i contenuti generati dall'IA, e diverse giurisdizioni al di fuori dell'UE, tra cui il Regno Unito e singoli stati americani, stanno avanzando i propri requisiti di etichettatura dell'IA. City AM aveva precedentemente riportato la diffusione di "immondizia" (slop) generata dall'IA nelle redazioni giornalistiche, inclusi pezzi di opinione e proposte presentati in modo ingannevole come opera di dirigenti e altri collaboratori.
Anche i testi scritti da umani potrebbero essere flaggati
Anthropic ha riconosciuto che rilevare una delle sue filigrane non significherebbe necessariamente che Claude abbia scritto i contenuti originali. Un utente potrebbe scrivere un articolo in modo indipendente e poi chiedere a Claude di rileggerlo, tradurlo o modificarlo — e il testo risultante potrebbe comunque riportare la filigrana di Claude, anche se i contenuti e le idee sottostanti hanno avuto origine dall'autore umano.
L'Articolo 50 dell'EU AI Act stabilisce che i requisiti di marcatura non si applicano quando un sistema di intelligenza artificiale svolge "una funzione assistiva per la modifica standard" o non altera sostanzialmente il materiale o il suo significato. Anthropic ha firmato il Codice di Condotta volontario dell'UE che delinea come le aziende possono conformarsi agli obblighi di trasparenza, ma la sua decisione di applicare le filigrane a tutti i contenuti generati dai prodotti Claude supportati significa che il sistema potrebbe catturare materiale oltre quanto strettamente richiesto dalla legislazione.
L'azienda ha inoltre messo in guardia dal considerare le filigrane come prova definitiva della paternità dell'IA. Modifiche pesanti o la parafrasi possono rendere una filigrana non rilevabile e brevi passaggi potrebbero contenere testo insufficiente per produrre un segnale affidabile. I metadati allegati alle immagini e ad altri file possono anche essere rimossi quando i file vengono convertiti o catturati come screenshot.
La tecnologia di rilevamento non è ancora perfetta
Alex Cui, chief technology officer dell'azienda di rilevamento IA GPTZero, ha spiegato in un post su X che la filigranatura del testo in genere funziona alterando sottilmente la probabilità delle selezioni di parole all'interno di un modello, creando un pattern statistico che può essere successivamente rilevato.
Tuttavia, Cui ha notato che la tecnologia rimane imperfetta, osservando che le filigrane potrebbero avere difficoltà a resistere a "parafrasi intense". Ha anche avvertito che il rilascio pubblico di strumenti di rilevamento potrebbe rendere più facile per gli utenti capire come aggirarli.
"I parafrasatori gratuiti che ho provato hanno aggirato rapidamente SynthId di Google DeepMind per quanto vale", ha scritto.
Un recente studio che ha coinvolto 1.682 adulti, pubblicato sulla rivista Judgment and Decision Making, ha rilevato che i partecipanti hanno valutato le storie generate da ChatGPT come più coinvolgenti e di qualità superiore rispetto a quelle scritte da esseri umani. Tuttavia, i rispondenti hanno dato valutazioni più alte alle storie che credevano fossero state scritte da umani. In due esperimenti aggiuntivi, i ricercatori non hanno trovato prove generali che i partecipanti potessero distinguere in modo affidabile tra storie scritte da umani e da IA.
Anthropic ha affermato che la sua filigrana non altererà visibilmente i risultati generati da Claude né ne influenzerà il significato o la leggibilità. L'azienda ha ammesso che il sistema fornisce un segnale piuttosto che una prova conclusiva sull'origine di un contenuto, lasciando ad aziende ed editori il compito di determinare quanto peso attribuire alle nuove marcature.