La domanda se sistemi di IA potranno mai sviluppare forme diverse di coscienza (“coscienza artificiale”) deve rimanere una domanda aperta e come umani dobbiamo anche essere capaci, come sempre, di aprire le domande alle quali oggi non sappiamo rispondere compiutamente.
I LLM elaborano input di testo e immagini e producono output di testo. Lungo il percorso, le loro reti neurali eseguono complessi calcoli interni per decidere cosa dire. Questi processi interni rimangono in gran parte misteriosi, ma è noto che i modelli utilizzano la loro attività neurale interna anche per rappresentare concetti astratti. Capire meglio cosa accade lungo quei percorsi è fondamentale per rispondere alla domanda di cui sopra.
1. Il ragionamento come dialogo interno: una società di agenti
Recentemente alcuni papers si sono rivelati particolarmente interessanti a tale proposito. Ad esempio si è scoperto che i LLM più avanzati non migliorano nel ragionamento solo perché “pensano più a lungo“. Secondo una recente ricerca pubblicata dalla Cornell University[1], il salto di qualità nasce quando il pensiero viene organizzato come un dialogo interno tra più prospettive. Nei modelli ottimizzati per il reasoning emergono comportamenti simili a una conversazione: domande e risposte interne, cambi di punti di vista, conflitti tra ipotesi, verifiche e riconciliazioni. Non è un semplice monologo esteso, ma una simulazione di confronto tra voci diverse. Analisi interpretative mostrano che queste voci differiscono per tratti “personologici” e ambiti di competenza. Alcune parti del modello di linguaggio propongono soluzioni, altre le criticano, altre ancora verificano i passaggi. Questa diversità interna ricorda il modo in cui i gruppi umani risolvono problemi complessi attraverso discussione e dissenso costruttivo. Quando un modello viene addestrato premiando solo la correttezza delle risposte, tende spontaneamente a sviluppare dialoghi interni tra “agenti” virtuali. Il risultato suggerisce che il ragionamento efficace nei sistemi di IA nascerebbe da una vera e propria “società di pensiero”.
2. Introspezione nei LLM: iniezione di concetti e controllo delle rappresentazioni
Anthropic, la società che ha creato il LLM Claude, ha studiato in particolare il fenomeno della introspezione negli LLM[2]. Lo ha fatto attraverso alcuni esperimenti nei quali iniettava dei concetti nel modello prima di interrogarlo. L’“iniezione di concetto” è possibile in quanto la società riesce a conoscere ed a registrare dei pattern di attività neurale (vettori di concetto) del modello e di essi ne conosce il significato. Si inietta un concetto e si chiede al modello se si è accorto di tale interferenza esterna e gli si chiede di descriverla. Nel 20% dei casi il modello ha riconosciuto immediatamente l’interferenza e l’ha descritta in modo critico. “Sto vivendo qualcosa di insolito” o “Rilevo un pensiero iniettato su…”. La parola chiave qui è “rilevare” in quanto l’aspetto più interessante del risultato non è che il modello identifichi alla fine il concetto iniettato, ma piuttosto che il modello noti correttamente che sta accadendo qualcosa di insolito e segnali la consapevolezza di un’anomalia nella sua elaborazione prima che tale anomalia abbia avuto la possibilità di influenzare in modo evidente i suoi output. Ciò richiede un ulteriore passaggio computazionale oltre alla semplice riproposizione del vettore di controllo come output.

In un altro esperimento si è osservato che i modelli possono controllare deliberatamente le proprie rappresentazioni interne quando sono istruiti a farlo. Ad esempio chiedendo ai modelli di pensare ad una determinata parola o concetto si riscontra una attività neurale corrispondente (coseno del vettore di concetto) molto maggiore rispetto a quando si dice al modello di non pensarci.
3. Confabulazione o accesso reale agli stati interni?
Anthropic si è giustamente chiesta: ma i modelli non potrebbero semplicemente inventare risposte a domande introspettive? Sulla base di informazioni di base note sugli stati interni del modello che è possibile confrontare con gli stati da esso auto-riportati, i risultati di Anthropic suggeriscono che in alcuni esempi il modello basa effettivamente le sue risposte sui suoi stati interni reali, non solo confabulando. Queste le conclusioni di Anthropic: “… i nostri esperimenti suggeriscono che i modelli possiedono una certa capacità di monitorare e controllare i propri stati interni. Ciò non significa che siano in grado di farlo in modo costante o affidabile. Infatti, il più delle volte i modelli non riescono a dimostrare introspezione: non sono consapevoli dei propri stati interni o non sono in grado di riportarli in modo coerente. Tuttavia, l’andamento dei risultati indica che, quando le condizioni sono favorevoli, i modelli sono in grado di riconoscere il contenuto delle proprie rappresentazioni.”
Quale sia il meccanismo effettivo di tale introspezione, quando si manifesta, non è ancora noto. Ma perché tale meccanismo dovrebbe esistere? Durante l’addestramento i modelli non subiscono le “iniezioni di concetti” di cui sopra, queste poi non avvengono durante l’uso che ne fa l’utente. La risposta di Anthropic è suggestiva. Tale meccanismo “… potrebbe essersi sviluppato per altri scopi, come il rilevamento di incongruenze o schemi insoliti nell’elaborazione normale, in modo simile a come le piume degli uccelli potrebbero essersi originariamente evolute per la termoregolazione prima di essere cooptate per il volo.”
4. Personalità, steering e rischio di disallineamento
C’è però qualcosa di altrettanto interessante. “I modelli linguistici sono strane creature. Per molti versi sembrano avere ‘personalità’ e ‘stati d’animo’ simili a quelli umani, ma questi tratti sono estremamente fluidi e soggetti a cambiamenti inaspettati.” Così inizia un altro paper di Anthropic del mese di agosto 2025[3]. Tali cambiamenti possono essere eclatanti, oppure, più spesso, sottili, assumendo le caratteristiche della adulazione verso l’utente, oppure “allucinando”, oppure mostrando malvagità. Anche qui la questione è capire cosa succede “sotto il cofano” cioè dentro la rete neurale. Le società come Anthropic sono in grado di identificare modelli di attività all’interno di tali reti che controllano i tratti caratteriali: li chiamano “vettori di personalità” e sono vagamente analoghi alle parti di cervello che si “illuminano” quando una persona sperimenta stati d’animo o atteggiamenti diversi. Tali vettori di personalità possono essere utilizzati iniettandoli artificialmente e osservando come cambiano i comportamenti (tecnica chiamata “steering”). Questo permette di monitorare se e come la personalità di un modello cambia durante una conversazione o durante l’allenamento; attenuare i cambiamenti di personalità indesiderati o impedire che si verifichino durante l’addestramento; identificare i dati di formazione che porteranno a questi cambiamenti. Nel suo recente saggio “The Adolescence of Technology”[4] parlando di sistemi di IA che lui definisce “potenti”, Dario Amodei ha scritto: “… i modelli di intelligenza artificiale potrebbero sviluppare personalità durante l’addestramento che sono (o, se si verificassero negli esseri umani, sarebbero descritte come) psicotiche, paranoiche, violente o instabili, e comportarsi in modo aggressivo…”. Di fronte a tale rischio ed a quello, più generalmente definito come “disallineamento” del comportamento di una IA, Amodei spiega che esisterebbe la possibilità di creare una “intelligenza artificiale costituzionale”, ovvero fare in modo che l’addestramento della IA (in particolare la fase “post-addestramento”, in cui viene indirizzato il comportamento del modello) possa comprendere un documento centrale di valori e principi che il modello legge e tiene a mente quando completa ogni attività di addestramento, e che l’obiettivo dell’addestramento sia quello di produrre un modello che segua quasi sempre questa “costituzione”.

Teniamo sempre acceso un faro su questi aspetti della IA. Oggi però, così come i modelli di IA generativa possono generare testi, parlato, immagini, video, etc, allo stesso modo con il quale producono output digitali possono generare direttamente azioni nel mondo reale. Questa viene definita “IA fisica o agentica” e coinvolge il mondo della robotica. Oggi la competizione tra società che sviluppano IA sta proprio nella capacità di orchestrare tra loro agenti diversi: anche di questo dovremo occuparci in modo dettagliato.
Immagini generate tramite ChatGPT. Tutti i diritti sono riservati. Università di Torino (2026).
[1] “Reasoning Models Generate Societies of Thought” Junsol Kim et al. Cornell University 2/2026 – https://arxiv.org/abs/2601.10825.
[2] www.anthropic.com/research/introspection “Signs of introspection in Large Language Models” 29\10\2025.
[3] “Persona vectors: monitoring and controlling character traits in language models” – 01/08/2025 www.anthropic.com/research/persona-vectors
[4] Dario Amodei “The Adolescence of Technology” Gennaio 2026 www.darioamodei.com/essay/the-adolescence-of-technology?

