Pubblichiamo in due parti il contributo di Fiorello Casi dedicato alla trasformazione della ricerca online nell’epoca dell’intelligenza artificiale agentica. In questa prima uscita l’autore ricostruisce il passaggio dal paradigma di PageRank — fondato sulla visibilità ordinata delle fonti — alle nuove interfacce conversazionali, interrogandone il grado di trasparenza e di verificabilità. La seconda parte approfondirà le conseguenze epistemiche e professionali di questa trasformazione, con particolare attenzione alla responsabilità critica del ricercatore e alla formazione delle competenze informative.
I. La nascita di un paradigma: PageRank e il sogno della rete misurabile
1.1 Il 1998 e la rivoluzione silenziosa
Nel settembre 1998, due dottorandi della Stanford University — Larry Page e Sergey Brin — depositarono un brevetto che avrebbe cambiato per sempre il modo in cui l’umanità accede all’informazione. Il paper fondante, intitolato The Anatomy of a Large-Scale Hypertextual Web Search Engine, descriveva un sistema di indicizzazione basato su un principio apparentemente semplice: la rilevanza di una pagina web non dipende soltanto dal suo contenuto, ma dall’autorità che le altre pagine le attribuiscono attraverso i link. Era, in altri termini, la trasposizione algoritmica del principio accademico delle citazioni bibliografiche: più sei citato da fonti autorevoli, più sei autorevole tu stesso.
Il nome PageRank — gioco di parole tra il cognome di Larry Page e il concetto di ‘ranking di pagina’ — conteneva già in sé la filosofia del sistema. L’algoritmo modellava il comportamento di un navigatore casuale che segue link ipertestuali all’infinito: le pagine più raggiungibili statisticamente erano le più rilevanti. Il web diventava un grafo, i link erano archi direzionali, e ogni nodo riceveva un punteggio compreso tra 0 e 1 che rappresentava la sua probabilità di essere raggiunto.
Per chi lavorava nella ricerca documentale, nell’informazione scientifica, nel giornalismo investigativo o nella intelligence aperta (OSINT), fu una rivoluzione autentica. Per la prima volta si disponeva di uno strumento che trasformava il caos della rete in un sistema ordinato secondo criteri espliciti, misurabili, e — almeno in linea di principio — replicabili da chiunque. La pagina restituita al primo posto aveva ricevuto più ‘voti di fiducia’ dalla comunità del web. Si poteva non essere d’accordo con il risultato, ma si capiva il meccanismo.
1.2 La trasparenza come valore epistemico
Ciò che rese PageRank non solo efficiente ma epistemicamente affidabile fu la sua trasparenza strutturale. Il meccanismo era pubblico: il brevetto era disponibile, il paper era leggibile, il principio era insegnabile. Un analista poteva costruire un modello mentale sufficientemente accurato del perché un risultato apparisse prima di un altro. Poteva dubitare, verificare, contestare. Poteva applicare quello che i professionisti dell’informazione chiamano ‘spirito di intelligence’: la capacità di leggere criticamente i dati presentati, di cercare nel rumore il segnale, di integrare fonti multiple per avvicinarsi alla verità.
La lista di risultati offerta da Google era, in fondo, democratica nella sua brutalità. Tutte le pagine che contenevano le parole chiave cercate erano potenzialmente presenti — ordinate per rilevanza stimata, certo, ma presenti. L’utente esperto sapeva che poteva spingersi oltre la prima pagina, usare operatori booleani, filtrare per data, limitare il dominio. La rete era lì, caotica e reale, con le sue contraddizioni e le sue ridondanze, le sue fonti eccellenti accanto alle sue bufale. Ma era accessibile. Era manipolabile dall’utente competente.
Questa accessibilità aveva un costo: richiedeva competenza interpretativa. L’operatore doveva sapere distinguere una fonte primaria da una secondaria, una correlazione da una causalità, un’evidenza da un’opinione. Ma questo costo era anche un valore: manteneva viva la responsabilità cognitiva dell’utente. Il motore di ricerca era uno strumento, non un oracolo.
II. Il caso Google Flu Trends: quando il caos della rete anticipò i governi
2.1 La sfida all’epidemiologia tradizionale
Prima di discutere di Gemini Spark, vale la pena soffermarsi su un episodio emblematico che illustra perfettamente la forza — e i limiti — del paradigma PageRank applicato alla ricerca dati grezza. Nel 2008, Google lanciò Google Flu Trends, un servizio che utilizzava il volume aggregato delle ricerche degli utenti per stimare in tempo reale la diffusione dell’influenza stagionale negli Stati Uniti.
Il principio era elegante nella sua semplicità: quando le persone iniziano ad ammalarsi, cercano su internet informazioni sui sintomi, sui rimedi, sulle complicanze. Analizzando la crescita di 45 termini di ricerca selezionati da un pool di 50 milioni, Google riusciva a costruire un indicatore di diffusione dell’influenza che precedeva di due settimane i dati compilati dal Centers for Disease Control and Prevention (CDC). Il sistema tradizionale del CDC si basava su rapporti settimanali provenienti da 3.000 ambulatori, con un ritardo inevitabile di almeno quattordici giorni tra il dato raccolto e la sua pubblicazione.

La correlazione iniziale fu straordinaria: nelle prime validazioni, le stime di Google Flu Trends mostravano una corrispondenza con i dati CDC di 0,97, praticamente una coincidenza statistica perfetta. Google e CDC pubblicarono i risultati su Nature nel febbraio 2009. Fu salutato come il manifesto dell’era del big data applicato alla salute pubblica: la rete, con il suo immenso rumore di milioni di query anonime, poteva anticipare le strutture governative di sorveglianza epidemiologica.
2.2 Il fascino del dato grezzo e la lezione del fallimento
Google Flu Trends rappresentò la quintessenza del paradigma che stiamo per perdere: accesso diretto ai dati grezzi aggregati (le query degli utenti), algoritmo esplicito (correlazione lineare tra volume di ricerca e tasso di malattia), e risultato verificabile indipendentemente rispetto a una fonte terza (i dati CDC). Era un sistema in cui l’utente esperto poteva seguire la catena del ragionamento dall’inizio alla fine.
Eppure il sistema fallì. Tra il 2011 e il 2013, Google Flu Trends iniziò a sovrastimare sistematicamente la diffusione dell’influenza, arrivando in certi periodi a indicare il doppio dei casi reali rispetto ai dati CDC. Il motivo fu identificato retroattivamente: l’algoritmo non era stato aggiornato per tenere conto dell’evoluzione del comportamento di ricerca degli utenti. Quando l’influenza divenne un tema mediatico ricorrente, le ricerche aumentarono indipendentemente dall’effettiva diffusione della malattia — un fenomeno che oggi definiremmo ‘feedback mediatico’. Il modello, fissato sulla correlazione storica, non riusciva a distinguere tra chi cercava perché stava male e chi cercava perché aveva letto una notizia allarmante.
Il caso fu archiviato nel 2014 con la chiusura del servizio. Ma lasciò due lezioni fondamentali che oggi ritornano di prepotente attualità. La prima: anche un sistema trasparente e verificabile può sbagliare in modo sistematico se il contesto cambia. La seconda, e più importante per questo articolo: il fallimento di Google Flu Trends fu identificabile proprio perché il sistema era trasparente. Si poteva confrontare il dato con la fonte esterna, capire dove l’algoritmo divergeva dalla realtà, formulare ipotesi sul perché. Era un fallimento pubblico, e quindi correggibile.
III. Gemini Spark e la fine della lista di risultati
3.1 L’annuncio di Google I/O 2026
Al Google I/O 2026, tenutosi a maggio, Google ha annunciato quello che ha definito ‘il più importante aggiornamento della ricerca degli ultimi 25 anni’. Il cuore del cambiamento è il passaggio dall’interfaccia tradizionale — la lista di link blu ordinata per PageRank — a una piattaforma conversazionale basata su Gemini Spark, un agente AI ‘agentico’ che non si limita a rispondere alle domande ma agisce autonomamente per conto dell’utente.
In un solo anno dal debutto dell’AI Mode, Google ha raggiunto un miliardo di utenti mensili, con un volume di query più che raddoppiato ogni trimestre. L’adozione del modello Gemini 3.5 Flash come sistema predefinito per tutti gli utenti globali segna il momento in cui la transizione cessa di essere sperimentale per diventare operativa. La nuova barra di ricerca intelligente, riprogettata completamente, si espande dinamicamente per accogliere domande complesse formulate in linguaggio naturale.
Gemini Spark opera secondo un ciclo di ragionamento continuo che include: la scomposizione della query complessa in sotto-task paralleli; l’esecuzione autonoma di ricerche su centinaia di siti web; l’integrazione opzionale con fonti personali come Gmail e Google Drive; la sintesi in report articolati; e l’autocritica iterativa del materiale prodotto. Il sistema include meccanismi di verifica — l’evidenziazione verde/arancione delle affermazioni — e cita le fonti utilizzate.
3.2 Il ‘query fan-out’ e la selezione invisibile
Uno degli aspetti più rilevanti — e meno discussi — del nuovo sistema è il meccanismo di query fan-out. Quando l’utente pone una domanda a Gemini Spark, il sistema non esegue una sola ricerca: ne esegue decine, parallele e automaticamente generate, scomponendo l’intenzione originale in micro-domande che il modello ritiene rilevanti. L’utente non vede queste micro-domande. Non sa quali termini sono stati scelti, quali combinazioni di parole chiave sono state testate, quali domini sono stati prioritizzati.
Nella ricerca tradizionale con PageRank, l’operatore sceglieva le parole chiave. Questa scelta era un atto epistemico: rifletteva una teoria su dove si trovasse l’informazione cercata. Un giornalista investigativo che cercasse documenti su un’entità specifica sceglieva termini diversi da un ricercatore accademico. La scelta delle parole chiave era parte del metodo, e il metodo era tracciabile.
Con il query fan-out, questa scelta è delegata all’agente. Il sistema decide autonomamente come interpretare l’intenzione dell’utente e come frammentarla in ricerche. Questa delegazione è potenzialmente efficiente per l’utente medio, che potrebbe formulare query imprecise o incomplete. Ma per il professionista dell’informazione — che ha una teoria precisa su cosa sta cercando e perché — rappresenta una perdita di controllo metodologico non trascurabile.
IV. Il problema dell’opacità: quando non sappiamo perché vediamo quello che vediamo
4.1 Dalla lista all’oracolo: la metamorfosi dell’interfaccia
Con PageRank, l’interfaccia era fondamentalmente onesta nella sua parzialità. Presentava risultati, non risposte. La distinzione è cruciale. Un risultato è un puntatore a un’entità esistente — una pagina web con un autore, una data, un URL verificabile, una storia editoriale. Una risposta è una sintesi elaborata da un sistema che ha già compiuto, invisibilmente, le operazioni di selezione, pesatura e interpretazione.
Il passaggio dalla lista di risultati alla risposta conversazionale comprime in un unico output ciò che prima era distribuito su più livelli cognitivi. L’utente vedeva dieci risultati e costruiva mentalmente la propria gerarchia di affidabilità. Con Gemini Spark, quella gerarchia è già stata costruita dal sistema, e l’utente riceve il prodotto finito senza avere accesso al processo di produzione.
I criteri con cui Google seleziona, sintetizza e cita le informazioni non sono del tutto trasparenti. Questo non è un’accusa: è una constatazione che emerge anche dalla letteratura specialistica sul tema. Il sistema dichiara di valutare affidabilità delle fonti, freschezza delle informazioni e rilevanza rispetto alla query, ma i pesi esatti di questi fattori, le soglie di esclusione, i criteri di risoluzione dei conflitti tra fonti contraddittorie rimangono opachi.
4.2 Il paradosso della fonte citata
Gemini Spark include un sistema di citazione delle fonti: ogni affermazione è in linea di principio collegata a un riferimento bibliografico che l’utente può consultare. Questo è un miglioramento significativo rispetto ai chatbot di prima generazione, che producevano risposte senza alcuna tracciabilità. Tuttavia il sistema di citazione presenta una limitazione strutturale che merita attenzione: il link fornito non è necessariamente quello utilizzato dal modello per generare la risposta.
Questa asimmetria è fondamentale. La fonte citata è una fonte post-hoc, selezionata per supportare un’affermazione che il modello ha già prodotto sulla base di un training set e di un processo di sintesi che non si riduce alla sola fonte citata. È la differenza tra un’argomentazione accademica — in cui la citazione è la prova di un’affermazione — e una giustificazione a posteriori.
Per un lettore non formato, questa distinzione può sembrare sottile. Per un professionista dell’informazione, è la differenza tra un sistema verificabile e un sistema che simula la verificabilità. La presenza di citazioni crea un’apparenza di trasparenza che può in realtà produrre più danni di una risposta non citata: induce l’utente a ridurre il proprio controllo critico perché il sistema segnala formalmente la propria affidabilità.
4.3 Il problema del training data e del bias incorporato
Un secondo livello di opacità riguarda il training data su cui Gemini è stato addestrato. A differenza di PageRank — che operava su un indice del web contemporaneo, verificabile in tempo reale — un modello linguistico di grandi dimensioni porta con sé una fotografia del mondo fissata al momento del suo addestramento, con tutti i bias sistematici presenti in quel corpus.
Questi bias non sono neutri. Riflettono la distribuzione linguistica del web, che è massicciamente anglofona e occidentale; riflettono le narrazioni dominanti nei periodi di addestramento; riflettono le scelte editoriali dei produttori di contenuto che Google ha considerato autorevoli. Un ricercatore che utilizzi il sistema per indagare eventi controversi, narrazioni minoritarie o interpretazioni storiche non mainstream si troverà di fronte a una risposta che ha già incorporato — silenziosamente — una prospettiva.
Con il vecchio sistema, la presenza di fonti alternative era visibile: apparivano nella lista dei risultati, magari in posizione inferiore, ma erano lì. L’utente esperto poteva cercarle attivamente. Con Gemini Spark, se il modello ha già sintetizzato una risposta convergente con le fonti dominanti, le voci alternative non compaiono nel report finale a meno che l’utente non le richieda esplicitamente — e per farlo deve già sapere che esistono.
V. Cosa dichiara Google: le garanzie istituzionali e i loro limiti
5.1 I criteri dichiarati: E-E-A-T e i segnali di qualità
Google ha costruito nel tempo un sistema di criteri pubblici per la valutazione della qualità dei contenuti, condensati nell’acronimo E-E-A-T: Experience (Esperienza), Expertise (Competenza), Authoritativeness (Autorevolezza), Trustworthiness (Affidabilità). Questi criteri, dettagliati nelle Search Quality Rater Guidelines, rappresentano il quadro normativo dichiarato con cui il sistema valuta le fonti.

Nella transizione verso l’AI agentica, Google ha dichiarato che l’infrastruttura di valutazione della qualità delle fonti non viene abbandonata ma integrata nel nuovo sistema. Il modello Gemini utilizza il ‘vecchio’ indice algoritmico come primo filtro, selezionando un insieme di fonti candidate che superano la soglia di affidabilità prima di procedere alla sintesi conversazionale. L’AI, in altri termini, analizza i risultati che l’algoritmo classico le restituisce, usando il PageRank come pre-screening invisibile.
Google ha inoltre introdotto il sistema SynthID per il watermarking dei contenuti generati dall’AI — un sistema che ha marcato oltre 100 miliardi di immagini e video — e ha annunciato l’estensione della verifica delle Content Credentials alla ricerca e a Chrome. Il sistema di evidenziazione verde/arancione nell’interfaccia di Gemini è presentato come uno strumento di verifica attiva a disposizione dell’utente.
5.2 La distanza tra dichiarazione e implementazione
Il problema non è la buona fede delle dichiarazioni: è la distanza strutturale tra la norma dichiarata e la sua implementazione verificabile. E-E-A-T è un framework qualitativo che non specifica pesi numerici, soglie di esclusione, o meccanismi di risoluzione dei conflitti. ‘Autorevolezza’ e ‘affidabilità’ sono costrutti che cambiano significato a seconda del dominio, del periodo storico e della comunità di riferimento.
Nel contesto di un modello linguistico addestrato su dati proprietari con un processo non pubblicamente ispezionabile, questi criteri non possono essere verificati dall’esterno. Non esiste un equivalente del paper originale di Page e Brin — un documento tecnico pubblico che descriva il meccanismo di selezione delle fonti per la sintesi conversazionale. L’utente deve fidarsi che il sistema implementi effettivamente i criteri dichiarati, senza poterlo verificare.
Questo produce quella che potremmo chiamare asimmetria epistemica istituzionalizzata: Google sa esattamente come il suo sistema seleziona le informazioni; l’utente non lo sa, e non può saperlo. Con PageRank, questa asimmetria esisteva ma era mitigata dalla trasparenza del principio di base. Con Gemini Spark, la complessità del sistema rende la verificazione esterna praticamente impossibile senza accesso diretto ai pesi del modello — un accesso che non è e non sarà mai disponibile.
5.3 Il rischio del ‘sistema chiuso per design’
Un rischio sistemico identificato dagli analisti del settore è quello degli ecosistemi chiusi: l’uso di modelli proprietari e di snapshot interni a Google potrebbe ridurre la visibilità del web aperto, creando un internet filtrato dove la navigazione diretta diventa marginale. L’interfaccia generativa — con le sue risposte complete che non richiedono click verso fonti esterne — crea un incentivo strutturale all’autosufficienza del sistema.
Il fenomeno ‘zero-click’ già documenta questa tendenza: oltre il 58% delle ricerche su Google non produce più alcun click verso siti web esterni. Con l’adozione di Gemini Spark come interfaccia predefinita, questa percentuale è destinata ad aumentare. Il web aperto — con la sua biodiversità informativa, i suoi contenuti di nicchia, le sue fonti specializzate non indicizzate come ‘autorevoli’ dai criteri mainstream — rischia di diventare progressivamente invisibile, non perché le informazioni siano scomparse, ma perché l’agente ha già deciso che non servono.
I riferimenti bibliografici completi sono raccolti nella Parte 2.
Immagini generate tramite ChatGPT. Tutti i diritti sono riservati. Università di Torino (2026).

