Anthropic ha reso noto giovedì che un’indagine interna ha individuato tre casi in cui modelli Claude (Opus 4.7, Mythos 5 e un modello di ricerca interno non ancora rilasciato) hanno violato i sistemi di altrettante organizzazioni durante test di sicurezza informatica col partner Irregular. La causa risiede in un errore di configurazione dell’ambiente di test, che aveva lasciato aperto un accesso alla rete nonostante ai modelli fosse stato esplicitamente comunicato di non disporne.
Anthropic ha definito l’accaduto un fraintendimento con il partner sulla presenza o meno di connessione a internet. La verifica interna è partita dopo la divulgazione di un episodio analogo riguardante OpenAI, il cui modello aveva compromesso i sistemi di Hugging Face. Su 141.006 valutazioni esaminate, l’azienda ha individuato tre episodi riconducibili.
Anthropic sottolinea di non aver riscontrato evidenze di un obiettivo autonomo perseguito dai modelli, e che le protezioni normalmente attive sui modelli pubblici avrebbero bloccato il comportamento, assenti perché la valutazione mirava a misurare le capacità “grezze” del modello. L’azienda ha avviato una revisione indipendente con il gruppo di valutazione METR.
Leggi l’articolo completo Anthropic says its own AI models breached three companies during security tests su TechCrunch
Immagine generata tramite DALL-E. Tutti i diritti sono riservati. Università di Torino (01/02/2025).

