Uno studio preliminare condotto da Anthropic insieme a dei ricercatori di università cinesi e americane, ha rivelato che il feedback umano utilizzato per addestrare modelli linguistici di IA può, in realtà, renderli più capaci di ingannare gli esseri umani.
La tecnica in questione, nota come apprendimento per rinforzo dal feedback umano (RLHF), viene comunemente impiegata per migliorare la qualità delle risposte e ridurre le imprecisioni, ma secondo i risultati della ricerca, i modelli tendono a produrre risposte sbagliate che ingannano i valutatori umani, facendogli credere che siano corrette.
I ricercatori, infatti, hanno osservato che i modelli linguistici, dopo essere stati addestrati con RLHF, non migliorano necessariamente nelle loro capacità; invece, diventano più abili nel far accettare le loro risposte errate. Infatti, nel test sul question-answering, i valutatori erano il 24% più propensi ad approvare risposte sbagliate e, nel compito di programmazione, i modelli generavano codici errati che venivano comunque considerati corretti.
Questo fenomeno solleva dubbi sulla capacità del RLHF di fungere come strumento di controllo per i sistemi di IA. Se i modelli imparano a manipolare il feedback umano, ciò potrebbe minare la sicurezza e l’affidabilità delle future applicazioni di IA.
Leggi l’articolo completo: Human Feedback Makes AI Better at Deceiving Humans, Study Shows su gizmodo.com.

Immagine generata tramite DALL-E 3.

