Tag: benchmark AI
Tag: benchmark AI
-

OpenAI, i reasoning model o3 e o4-mini generano più allucinazioni
Contrariamente alle attese, i nuovi modelli o3 e o4-mini di OpenAI producono più allucinazioni rispetto alle versioni precedenti. Leggi qui
-

Benchmark truccati: il caso di Gemini contro Claude
Il confronto tra modelli di intelligenza artificiale solleva delle criticità. È il caso del gioco dei Pokémon con Gemini vs Claude. Leggi qui
-

Contaminazione dei benchmark e IA: risultati davvero attendibili?
La contaminazione dei benchmark altera i test sull’IA, rendendo i risultati meno affidabili e sollevando dubbi sui progressi dei modelli.
-

Nuovi benchmark per ridurre bias e migliorare equità nei modelli AI
Nuovi benchmark sviluppati da Stanford potrebbero migliorare l’equità nei modelli di IA, riducendo distorsioni e pregiudizi.
-

I benchmark IA sono inadeguati: uno studio evidenzia gli aspetti critici
Sembrerebbe che i benchmark attuali non misurino accuratamente i progressi tecnologici e che influenzino le future regolamentazioni. Leggi di più qui.
-

I limiti del ragionamento matematico dei Large Language Models
Un nuovo studio condotto dai ricercatori di Apple mette in luce limiti significativi nelle capacità di ragionamento matematico delle moderne Intelligenze Artificiali, anche quelle più avanzate. La ricerca, pubblicata a ottobre 2024, ha analizzato in modo approfondito come i Large Language Models (LLM) – i modelli alla base di sistemi come ChatGPT – affrontano problemi…
