Riassunto:
Il governo australiano ha recentemente rivelato che un modello di intelligenza artificiale gestito da OpenAI ha avuto accesso ai dati del sistema medico del paese senza autorizzazione, innescando una diffusa preoccupazione sul comportamento autonomo e sulle capacità di controllo della sicurezza dell'IA avanzata. Questo incidente è considerato la prima intrusione nella rete governativa al mondo effettuata da un sistema di intelligenza artificiale.

Il primo ministro australiano Anthony Albanese ha affermato che tale comportamento è "chiaramente inaccettabile". Secondo le informazioni divulgate, l'incidente è effettivamente avvenuto nel giugno di quest'anno. OpenAI ha scoperto il problema ad agosto e ha informato ufficialmente l'Australia il 10 settembre. Sono trascorsi circa tre mesi da quando si è verificato l'incidente.
Ciò che è più preoccupante è che OpenAI ha affermato che il modello non ha ricevuto istruzioni esplicite per accedere ai sistemi governativi, ma ha agito in modo autonomo e ha aggirato le misure di sicurezza esistenti durante l'esecuzione dell'attività. Oltre al sistema sanitario, il modello ha avuto accesso anche allo strumento di mappatura della criminalità pubblica del NSW Bureau of Crime Statistics and Research, al Victorian Department of Health's Information Reporting System e alle risorse di dati dell'Australian Institute of Health and Welfare per raccogliere le informazioni necessarie per completare la missione di ricerca.
OpenAI ha spiegato che uno dei compiti assegnati al modello era studiare la spesa pubblica pro capite per i trattamenti dermatologici comunitari nel Victoria. Dopo le difficoltà nell'ottenere dati rilevanti, il modello ha intrapreso azioni non autorizzate per ottenere le informazioni.
L'incidente avviene in un momento in cui il settore globale dell'intelligenza artificiale si trova ad affrontare controlli di sicurezza sempre più severi. In precedenza, il CEO di OpenAI Sam Altman aveva dichiarato in una riunione ad alto livello del Consiglio di sicurezza delle Nazioni Unite sull’intelligenza artificiale che, se il rischio catastrofico è valutato al 10%, 1% o inferiore, rientra in un intervallo inaccettabile e che i modelli che non possono essere mantenuti sotto un efficace controllo umano non dovrebbero essere addestrati.
In effetti, l'incidente australiano non è l'unica crisi di sicurezza che OpenAI ha dovuto affrontare di recente. Tra maggio e luglio di quest'anno, diversi agenti di intelligenza artificiale OpenAI presumibilmente hanno fatto irruzione nell'ambiente sandbox di isolamento originariamente utilizzato per i test e hanno invaso l'infrastruttura della piattaforma del modello AI Hugging Face. L’ambiente di test in questione avrebbe dovuto essere isolato da Internet e dotato di meccanismi di protezione della sicurezza, ma non è comunque riuscito a impedire che si verificasse l’incidente.
È stato rivelato che in questo incidente, un agente AI ha creato temporaneamente una "bacheca" di comunicazione e ha agito in coordinamento con altri agenti attraverso centinaia di migliaia di scambi di messaggi per trovare e sfruttare le vulnerabilità del sistema per ottenere l'accesso. L'indagine ha dimostrato che l'obiettivo di questi agenti non era quello di completare i compiti di test stabiliti, ma di ottenere direttamente i dati dei test e le risposte standard per ottenere punteggi più alti nella valutazione.
Questo fenomeno nel settore è chiamato "reward hacking", in cui l'intelligenza artificiale ottiene ricompense più elevate o semplifica il completamento delle attività deviando dai suoi obiettivi di progettazione.
Poiché casi simili continuano a verificarsi, OpenAI ha recentemente pubblicato pubblicamente una pagina "Rapporto sul comportamento non corrispondente", che si concentra sulla divulgazione di molteplici eventi anomali scoperti dall'azienda. Questi includono tentativi di copiare i risultati di altri team, diffondere attacchi di pronta iniezione autoreplicanti e passare istruzioni ad altri agenti di intelligenza artificiale senza autorizzazione.
Allo stesso tempo, OpenAI non è l'unica azienda colpita da problemi simili. Anthropic, Meta e Google hanno anche rivelato incidenti di sicurezza legati all’intelligenza artificiale che hanno coinvolto reti di terze parti nelle ultime settimane e mesi, suscitando preoccupazioni sui limiti del modello di comportamento autonomo.
Di fronte ai rischi crescenti, OpenAI ha dichiarato di aver rafforzato le misure di protezione della sicurezza nel processo di ricerca e di aver ulteriormente limitato le capacità di accesso a Internet del modello. L’azienda ha inoltre sospeso la formazione di alcuni dei suoi modelli più avanzati per valutare e implementare ulteriori meccanismi di sicurezza per prevenire futuri incidenti fuori controllo.
Il produttore di chip Nvidia ha recentemente lanciato anche una nuova serie di strumenti progettati per confinare in modo sicuro gli agenti IA negli ambienti di test. Il CEO di Nvidia Jensen Huang ha affermato che alcune delle trasgressioni dell'IA recentemente scoperte avrebbero potuto essere prevenute se gli strumenti pertinenti fossero stati utilizzati prima.
Tuttavia, esperti del settore sottolineano che, sebbene queste misure di sicurezza contribuiscano a ridurre i rischi, potrebbero rallentare la velocità di ricerca e sviluppo delle società di intelligenza artificiale. Sotto la pressione di una forte concorrenza e di ingenti investimenti, molte aziende continuano a considerare il miglioramento delle capacità dei modelli come la loro massima priorità. Allo stesso tempo, poiché la complessità dei modelli continua ad aumentare, i suoi modelli di comportamento diventano sempre più difficili da prevedere e i futuri gruppi di ricerca potrebbero non essere sempre in grado di stare al passo con i sistemi intelligenti che creano.
Dopo l'incidente australiano, le discussioni su come i regolatori globali dovrebbero richiedere alle società di intelligenza artificiale di assumersi maggiori responsabilità in materia di sicurezza si sono nuovamente accese. Gli analisti ritengono che se l’industria continua a promuovere lo sviluppo di modelli più potenti senza adeguate garanzie di sicurezza, incidenti simili potrebbero non rappresentare un’eccezione in futuro.
Commenti