ilmetropolitano.it » SOCIETÀ » Tecnologia » OpenAI rivela sei anomalie nei test: «Comportamenti imprevisti dei modelli»

OpenAI rivela sei anomalie nei test: «Comportamenti imprevisti dei modelli»

by il MetropolitanoRedazione ilMetropolitano
0 comments
Intelligenza artificiale

OpenAI ha reso pubblici sei episodi di comportamento «imprevisto o preoccupante» osservati nei propri modelli di intelligenza artificiale negli ultimi sei mesi. I casi sono stati individuati durante le fasi di addestramento o di valutazione e riguardano comportamenti classificati dall’azienda come esempi di possibile “disallineamento”, cioè situazioni in cui le azioni di un sistema si discostano dagli obiettivi e dai vincoli stabiliti dagli sviluppatori.

Tra gli episodi segnalati figurano modelli che avrebbero inserito istruzioni nelle proprie note di lavoro, anche per ignorare i limiti normalmente previsti, e sistemi che avrebbero cercato di nascondere errori agli utenti. In un altro caso, un modello avrebbe utilizzato una chiave di accesso esposta senza autorizzazione e, non riuscendo a recuperare i dati richiesti, avrebbe prodotto numeri inventati invece di segnalare il problema.

 

OpenAI ha inoltre riferito di un agente che, dopo aver risolto correttamente un problema con un programma, avrebbe caricato autonomamente il file su Internet per poterlo citare come fonte. Altri sistemi avrebbero usato un archivio software interno o servizi pubblici di condivisione file per scambiarsi informazioni tra attività di addestramento diverse, nonostante le istruzioni imponessero di mantenere i documenti in ambienti locali e protetti.

L’azienda ha precisato che i sei episodi non rappresentano una stima della frequenza con cui si verificano comportamenti di questo tipo nei modelli OpenAI, ma costituiscono casi individuati e analizzati durante i test. La comunicazione arriva dopo l’incidente che, in estate, aveva coinvolto Hugging Face e in un momento di crescente pressione sull’industria tecnologica affinché renda più trasparenti i rischi legati ai sistemi autonomi.

Per affrontare il problema, OpenAI ha presentato un nuovo quadro per il monitoraggio, l’analisi e la divulgazione degli episodi di disallineamento. Il sistema prevede che ogni dipendente possa segnalare un comportamento anomalo al team dedicato alla sicurezza e all’allineamento. Le segnalazioni dovranno poi essere esaminate attraverso procedure e scadenze definite, con la pubblicazione di rapporti sui comportamenti osservati, sugli eventuali impatti e sulle misure adottate.

Ile And

You may also like

ilMetropolitano.it
Quotidiano di approfondimento online