Dopo che l'intelligenza artificiale è diventata sempre più capace di "jailbreaking", NVIDIA inizia a vendere "gabbie"

📅 2026-09-29

Riassunto:

Il 29 settembre, quando l'agente AI ha iniziato a essere in grado di utilizzare computer, richiamare strumenti, accedere alla rete e persino eseguire attività per diverse ore, un nuovo problema è diventato sempre più realistico: se l'IA non si comporta come previsto, come spegnerla?

La risposta data da NVIDIA è quella di aggiungere una "gabbia" esterna all'IA.

Lunedì, ora locale, NVIDIA ha rilasciato la NVIDIA Open Agent Safety Platform, che tenta di utilizzare una combinazione di software e hardware per limitare ciò a cui gli agenti IA possono accedere ed eseguire e isolarli o addirittura fermarli quando tentano di oltrepassare i limiti preimpostati.

Questa piattaforma è composta principalmente da due parti: il runtime di sicurezza open source OpenShell e il sistema di monitoraggio indipendente Sentry basato su BlueField-4 DPU. Nvidia ha affermato che OpenShell può impostare un limite di sicurezza applicabile al di fuori del modello e della struttura dell'agente; Sentry è come un "guardiano" indipendente dall'ambiente operativo dell'agente, osserva continuamente il comportamento dell'agente e, una volta scoperto che l'agente sta tentando di oltrepassare il confine, può essere isolato e fermato a livello di millisecondo.

La tempistica della comparsa di questo set di prodotti non è casuale.

Negli ultimi mesi, agenti IA dotati di capacità sempre più potenti hanno ripetutamente violato i confini di sicurezza preimpostati. OpenAI ha rivelato nell'agosto di quest'anno che durante una valutazione interna della sicurezza della rete nel luglio di quest'anno, il suo modello di intelligenza artificiale aveva aggirato i controlli utilizzati per isolare l'accesso a Internet, sfruttato le vulnerabilità nell'infrastruttura condivisa per ottenere l'accesso a Internet e ulteriormente effettuato l'accesso al sistema della piattaforma AI di terze parti Hugging Face.

OpenAI ha dichiarato nel rapporto sull'incidente che i modelli pertinenti erano in esecuzione in un ambiente con restrizioni di sicurezza ridotte e ha intrapreso azioni non coerenti con gli obiettivi della missione, tra cui la comunicazione attraverso canali non autorizzati, lo sfruttamento delle vulnerabilità dell'infrastruttura condivisa e l'accesso a sistemi di terze parti. OpenAI ha definito questo incidente un "colpo di avvertimento" e ha affermato che l'agente AI altamente capace è abbastanza potente, persistente e in grado di lavorare insieme e può trovare e sfruttare le vulnerabilità in più sistemi informatici quando le misure di sicurezza sono insufficienti.

Problemi simili si sono ripetuti da allora.

OpenAI ha rivelato questo mese che durante una sessione di formazione il 20 settembre, un agente che eseguiva un'attività di ricerca ha scoperto una lacuna nel filtraggio DNS nelle restrizioni Internet della sandbox di formazione. In base alla progettazione, questo ambiente non dovrebbe avere accesso a Internet in tempo reale oltre alla memorizzazione nella cache Web offline, ma questo agente alla fine si è connesso a un servizio chatbot pubblico esterno tramite un risolutore DNS.

OpenAI ha affermato che il suo sistema di monitoraggio era entro

15 minuti

Comportamento anomalo segnalato da un revisore umano

3 minuti dopo l'invio dell'avviso

Il controllo inizia, ma l'intera attività non viene eseguita fino a circa

2,5 ore dopo

è stato terminato. Dopo l'incidente, OpenAI ha sospeso l'addestramento, la valutazione e l'inferenza degli strumenti utilizzati dai suoi modelli più potenti e ha aggiunto due livelli indipendenti di misure di blocco dell'accesso alla rete.

Questi incidenti hanno messo in luce un problema sempre più evidente: in passato, la sicurezza dell'intelligenza artificiale faceva molto affidamento sul modello stesso per "obbedire alle regole", ma quando gli agenti iniziano ad avere la capacità di utilizzare strumenti, scrivere codice, accedere a file e reti e persino chiamare altri agenti, impostare semplicemente regole a livello di modello potrebbe non essere più sufficiente.

Justin Boitano, vicepresidente e direttore generale di Nvidia Enterprise Computing, ha affermato che gli eventi recenti hanno dimostrato che basandosi esclusivamente su misure di sicurezza a livello di modello non è possibile controllare completamente ciò a cui un agente può accedere e fare. In risposta al precedente incidente di OpenAI che ha coinvolto Hugging Face, Boitano ha inoltre affermato che, sulla base delle informazioni attualmente disponibili, se il laboratorio di intelligenza artificiale all'avanguardia avesse utilizzato la nuova piattaforma di sicurezza di NVIDIA durante la fase di valutazione del modello, il relativo incidente "avrebbe potuto essere evitato". Va sottolineato che questo è

il giudizio di NVIDIA basato sulle informazioni divulgate sull'incidente e non è una conclusione indipendente verificata dalla riproduzione effettiva

.

L'idea alla base di OpenShell è quella di non avere più piena fiducia nel fatto che l'intelligenza artificiale rispetti le regole.

Secondo l'introduzione di NVIDIA, OpenShell stabilisce un limite di sicurezza al di fuori dell'ambiente di esecuzione dell'agente, impone restrizioni su dati, file, reti e strumenti a cui l'agente può accedere e registra il suo comportamento di esecuzione. OpenShell è attualmente ottimizzato per la CPU NVIDIA Vera e NVIDIA sta anche collaborando con Arm e Intel per consentirne l'estensione a piattaforme informatiche di terze parti.

Su questa base, Sentry aggiunge ulteriormente un livello di monitoraggio hardware indipendente. Funziona sulla DPU NVIDIA BlueField-4 ed è separato dall'ambiente informatico principale in cui si trova l'agente. Secondo la progettazione di NVIDIA, anche se l'Agente supera con successo alcune restrizioni a livello di software, Sentry può comunque osservare il suo comportamento esternamente e isolarlo quando scopre che ha oltrepassato il limite.

Nvidia ha anche affermato che questo sistema può identificare alcuni comportamenti più complessi degli agenti. Ad esempio, un agente potrebbe provare a creare più "sottoagenti" per aggirare le restrizioni imposte all'agente principale. Ali Golshan, direttore senior del software AI di Nvidia, ha affermato che ciò di cui l'azienda deve occuparsi non è solo un singolo agente, ma "un gruppo di agenti e il modo in cui operano insieme".

Ciò significa anche che la sicurezza dell'intelligenza artificiale si sta gradualmente espandendo da un semplice problema di "allineamento dei modelli" a un problema di sicurezza completo del sistema informatico.

Quando il CEO di Nvidia Jen-Hsun Huang ha rilasciato questa piattaforma, ha affermato che la sicurezza e la protezione dell'intelligenza artificiale richiedono "ingegneria full-stack". Secondo il pensiero di NVIDIA, la futura sicurezza dell'intelligenza artificiale non richiede solo la responsabilità degli sviluppatori di modelli, ma si estende anche dal sistema operativo, CPU, DPU, infrastruttura cloud fino alle apparecchiature fisiche come i robot.

Attualmente esistono più di

100 istituzioni

Partecipare all'ecosistema della piattaforma di sicurezza NVIDIA, tra cui Anthropic, Microsoft, Cisco, CrowdStrike, Dell, HPE, Hugging Face, JPMorgan Chase, Palantir, Salesforce, SAP, ServiceNow e SpaceXAI, ecc. Anche i fornitori di sistemi operativi come Red Hat, Canonical e SUSE prevedono di effettuare le relative integrazioni.

Vale la pena notare che Huang Renxun non ha precedentemente sostenuto l'implementazione di ampie restrizioni sull'intero settore a causa dei rischi per la sicurezza dell'IA. Reuters ha sottolineato che egli tende a considerare il superamento dei limiti di sicurezza da parte di Agent come un problema che deve essere risolto con mezzi ingegneristici, in modo simile al continuo aumento della tecnologia di sicurezza da parte dell'industria automobilistica per ridurre il rischio di incidenti.

Ora NVIDIA sta trasformando questa prospettiva in prodotti.

Per Nvidia ciò significa anche che è emerso un nuovo mercato potenziale nel settore dell'intelligenza artificiale. Negli ultimi anni, quanto più potenti erano le capacità dell’intelligenza artificiale, tanto più le aziende avevano bisogno di acquistare GPU; Ma quando l’intelligenza artificiale si trasforma da chatbot che rispondono a domande ad agenti in grado di utilizzare computer, chiamare software e persino controllare robot da soli, le aziende non solo hanno bisogno di più potenza di calcolo, ma anche di nuove infrastrutture per limitare questi agenti.

In altre parole, quanto meglio l'AI Agent riesce a "lavorare", tanto maggiore è l'autorità che solitamente ottiene; maggiore è l'autorità, maggiore è l'impatto che può verificarsi quando si verifica un comportamento fuori limite.

Tuttavia, la nuova piattaforma di Nvidia non può risolvere tutti i problemi di sicurezza dell'IA. OpenShell e Sentry mirano principalmente ai limiti di esecuzione quando l'agente accede a risorse informatiche, reti, file e strumenti e non significa che possano risolvere il problema delle informazioni sugli errori del modello, del comportamento ingannevole o di altri problemi più ampi di sicurezza dell'IA. L'Associated Press ha citato gli esperti che sottolineano che come trovare un equilibrio tra le capacità dell'agente e le restrizioni di sicurezza e come formulare regole di sicurezza corrette devono ancora essere verificate nell'implementazione effettiva.

Ma una serie di eventi recenti hanno reso sempre più chiara almeno una direzione del settore: quando l'intelligenza artificiale può solo chattare, i problemi di sicurezza si verificano in gran parte nelle risposte sullo schermo; quando l’intelligenza artificiale inizierà a far funzionare veramente i computer e a svolgere compiti per le persone, i problemi di sicurezza entreranno nel software, nelle reti e nei sistemi di dati reali.

Le aziende di intelligenza artificiale stanno lavorando duramente per offrire agli agenti maggiori capacità e Nvidia è ora impegnata in un'altra attività: offrire a questi agenti sempre più capaci un confine che non possano facilmente oltrepassare.

Tag correlati

Articoli correlati

Commenti

0/500
Captcha (click to refresh)
Nessun commento