Venerdì Anthropic ha pubblicato un post sul suo blog in cui fornisce ulteriori dettagli sul funzionamento del watermarking dei testi generati da Claude, introdotto per rispettare il Transparency Code dell’AI Act europeo che impone sistemi di identificazione dei contenuti IA.
A proposito del funzionamento, Anthropic spiega che nelle “scelte a basso rischio” prese nel corso dell’elaborazione del testo (ad esempio tra le parole “coperto” e “grigio” per descrivere il meteo) Claude crea uno schema statistico “impercettibile per il lettore, ma rilevabile da chi possiede una chiave che lo decodifica”, senza alterare qualità o leggibilità della risposta. Il post affronta anche la questione della resistenza del segnale all’editing dei testi, che resta rilevabile anche in seguito a interventi editoriali limitati, mentre riscritture estese o traduzioni possono sensibilmente indebolirlo. Il watermarking viene applicato anche alla generazione di codice, ma con vincoli maggiori, dato che la sintassi di un linguaggio di programmazione lascia al modello meno margine di scelta.
Anthropic adotterà l’approccio SynthID-Text sviluppato da Google DeepMind nel 2024 e renderà disponibile un’API di rilevamento. L’azienda precisa che il watermarking funziona in modo diverso dai sistemi di riconoscimento basati su pattern stilistici, come quelli usati da Pangram.
Leggi l’articolo completo: Anthropic shares more details about how Claude’s new watermarks will work su TechCrunch
Immagine generata tramite DALL-E. Tutti i diritti sono riservati. Università di Torino (28/01/2025).

