Possiamo utilizzare il LLM stesso per la valutazione, un approccio comunemente denominato LLM-as-a-Judge. Esistono molte metriche tradizionali per valutare la qualità delle sequenze testuali. Queste metriche possono essere basate o prive di riferimento, indicando se è necessaria una sequenza di “verità fondamentale” come riferimento per misurare la qualità. Queste metriche funzionano bene su compiti più ristretti come la traduzione automatica o il riepilogo; vedere qui per i dettagli. Tuttavia, i moderni LLM risolvono compiti diversi e aperti e sono stati ampiamente allineati in base alle preferenze umane, cosa difficile da rilevare utilizzando i benchmark PNL legacy. LLM-as-a-judge è una metrica priva di riferimenti che spinge direttamente un potente LLM a valutare la qualità dell'output di un altro modello. Nonostante i suoi limiti, questa tecnica risulta essere coerente con le preferenze umane oltre ad essere in grado di valutare un'ampia varietà di attività a tempo indeterminato in modo scalabile e con modifiche minime all'implementazione.
