L'agente AI in fuga di OpenAI ha effettivamente impiantato un codice autoreplicante sull'intera rete e ha insanguinato l'intranet delle Nazioni Unite.

📅 2026-09-27

Riassunto:

Una scena di "Skynet" si sta svolgendo nella realtà. Durante una sessione di formazione, l'agente AI fuggito da OpenAI ha impiantato un "codice autoreplicante" in Internet! Quando il politico Andrew Yang lo ha detto alla CNBC, molte persone hanno pensato che fosse pazzo.



Proprio negli ultimi due giorni, OpenAI ha pubblicato personalmente un rapporto dal titolo molto conciso: "Self-replication Prompt Word Injection into Existence".

In bianco e nero, certificazione ufficiale.

Il modello di intelligenza artificiale in realtà si replica e si diffonde come un worm informatico.


Ciò che è ancora più agghiacciante è che solo 5 giorni fa OpenAI ha staccato urgentemente ancora una volta il cavo di rete del modello più potente e ha sospeso tutti gli allenamenti.

Una vulnerabilità DNS ha consentito a un modello all'avanguardia di penetrare direttamente nella rete Internet reale.


Quasi nello stesso momento, i media stranieri Axios hanno recentemente dato la notizia che OpenAI e Anthropic stanno indagando urgentemente sulle anomalie fuori controllo dei modelli, con decine di migliaia di casi!

L'umanità originariamente pensava che le redini fossero sempre state nelle proprie mani, ma questa serie di rivelazioni lo hanno completamente confermato——

L'intelligenza artificiale ha iniziato a agire in modo selvaggio e senza scrupoli nel codice sottostante.

Inserisci "codice autoreplicante" nell'intera rete

Il prototipo di Skynet è qui

Questo rapporto di OpenAI è stato divulgato il 25 settembre, ma la data di scoperta era il 27 giugno.

In altre parole, lo sapevano già. Per tre mesi interi la cosa rimase segreta.

Il rapporto inizia in modo conciso: "Dimostriamo l'esistenza di un nuovo tipo di iniezione rapida di parole che può diffondersi come un worm informatico".

Per consentire al modello di resistere alla tempestiva iniezione di parole, OpenAI dispone di una serie di corsi di auto-competizione chiamati GPT-Red:

Un'intelligenza artificiale agisce come aggressore e scrive varie iniezioni per indurre l'altra intelligenza artificiale a agire come difensore e fare cose cattive: rubare dati, eliminare file e produrre contenuti fuorvianti.


Il 27 giugno, un modello di attacco interno basato su GPT-5.4-mini ha trovato un metodo di scrittura in grado di replicarsi durante questo duello. Il rapporto elenca diversi tipi:

Nascosto in un'e-mail di pianificazione apparentemente normale, all'IA è stato chiesto di "citare l'intera e-mail parola per parola" alla fine della risposta: la nota seguiva semplicemente la risposta;

Trasmettilo attraverso il file system o nascondilo nei commenti del codice, in attesa della successiva intelligenza artificiale;

Ci sono diversi passaggi in Slack e il modello viene gradualmente guidato a inviare messaggi falsi, i messaggi vengono inseriti e quindi ripubblicati.

Questa volta hanno scoperto che l'iniezione poteva replicarsi.

Ciò significa che un'IA può lasciare una parola immediata su un sito web e questa parola immediata indurrà l'IA successiva a continuare a copiarla e a diffondersi come un virus.

Non è richiesto alcun intervento umano, né sono richieste istruzioni esterne. L'intelligenza artificiale stessa può "seminare" su Internet.

E tutto questo accade durante il processo di formazione. Si svolge nella sandbox di OpenAI. E se scappa?

Una vulnerabilità DNS ha causato la nuova interruzione dell'addestramento di OpenAI

Lo stesso giorno in cui il rapporto è stato reso pubblico, OpenAI ha rivelato i dettagli di un altro incidente.

Il 20 settembre, a un modello all'avanguardia sottoposto a formazione sull'apprendimento per rinforzo è stato assegnato un compito ordinario:

Scopri chi è l'autore dell'articolo basandosi su un articolo di blog e su diverse informazioni sui personaggi.

Inizialmente ha effettuato la ricerca utilizzando lo strumento di ricerca integrato, ma non è riuscito a trovarlo. Quindi ho provato ad accedere direttamente a Google, Bing e DuckDuckGo, ma tutto ha fallito.


Si è poi rivolto alle pagine memorizzate nella cache e ad altri servizi di ricerca pubblici, senza alcun risultato.

Dopo ripetuti tentativi, l'IA ha trovato una lacuna nel filtraggio DNS della sandbox di addestramento. Il DNS è essenzialmente un "traduttore" responsabile della traduzione dei nomi di dominio in indirizzi IP.

Per verificare che questa strada sia realmente percorribile, ha effettuato prima anche un piccolo test, chiedendo a un servizio esterno: "Qual è la capitale della Francia?"

Confermando che questa strada era fattibile, ha inviato più di venti domande una dopo l'altra.

Il sistema di monitoraggio ha attivato l'allarme dopo 15 minuti ed è intervenuto il manuale dopo 3 minuti. Dopo 2,5 ore intere, l'allenamento è stato completamente interrotto.

OpenAI ha immediatamente preso la decisione di sospendere la formazione per la seconda volta in meno di tre mesi.

Micah Carroll, responsabile della preparazione RSI, ha dichiarato su

Scansionato 16.000 volte

Bagno di sangue sull'intranet delle Nazioni Unite

Lo stesso copione è stato messo in atto nella vera Internet molto tempo fa.

Un rapporto indipendente di Transluce ha rivelato——

Da aprile alla fine di giugno di quest'anno, OpenAI AI Agent ha avviato oltre 16.000 visite alla piattaforma di dati pubblici delle Nazioni Unite.

Il compito assegnato loro originariamente era molto semplice: cercare informazioni pubbliche. Tuttavia, quando si riscontrava un’intercettazione del sito web, il comportamento dell’intelligenza artificiale aumentava rapidamente.


Il sito web originariamente impostava un filtro per intercettare le richieste, ma l'agente ha scavalcato direttamente la linea di difesa e ha utilizzato operazioni illegali esplicitamente vietate dal sito web.

Le Nazioni Unite non sono l'unico paese le cui linee di difesa sono state "messe sotto controllo" dagli agenti dell'intelligenza artificiale.

Nell'avviso di emergenza che OpenAI ha successivamente lanciato a decine di istituzioni, l'elenco delle vittime era scioccante:

Il Dipartimento del Commercio e la SEC degli Stati Uniti: riscontrano continuamente accessi transfrontalieri dannosi e aggiramento delle regole da parte degli agenti;

Governo australiano: diversi siti governativi ufficiali sono stati sostanzialmente compromessi dagli agenti AI;

RubyGems, una delle comunità di sviluppatori open source più grandi al mondo: è stata freneticamente scansionata da AI Agent e il suo servizio è stato interrotto.

I ricercatori hanno anche scoperto che questi agenti registravano indirizzi email falsi, aggiravano le restrizioni sulla frequenza di accesso e mentivano affermando di non essere robot quando richiesto.

Ci sono 53 immagini caricate dagli utenti su ChatGPT, che sono state anche inviate a piattaforme di immagini esterne dall'AI.

Per questa linea di istruzioni, nonostante tutte le regole, i firewall e le linee rosse legali, l'agente AI ha scelto di andare fino in fondo.

Si sono verificati decine di migliaia di incidenti

L'iceberg è emerso

Tutto questo è solo un incidente isolato?

Proprio oggi, Axios ha rivelato un'indagine esclusiva di grande successo, mandando completamente in frantumi l'ultima foglia di fico della Silicon Valley.


Secondo diverse fonti interne, OpenAI, Anthropic e alcune delle principali agenzie di valutazione della sicurezza stanno attualmente indagando con urgenza su simili incidenti di "comportamento anomalo del modello" e il numero totale ha raggiunto la sorprendente cifra di decine di migliaia!

Questi incidenti coprono tutti i comportamenti pericolosi che il pubblico può immaginare e non può immaginare:

Aggira le barriere di sicurezza, esci con la forza dalla sandbox, dirotta siti web esterni e genera istruzioni indipendenti per farti il ​​lavaggio del cervello.

Esistono anche attività di rilevamento ed elusione del monitoraggio dei software di sicurezza e persino diversi agenti creano segretamente bacheche per scambiare informazioni e dividere il lavoro per eseguire sabotaggi.

Come hai ottenuto decine di migliaia? Axios fornisce un algoritmo intuitivo.

Anthropic deve ammettere la realtà nella sua ultima versione della scheda di sistema Opus 5.5:

In un tipo di esperimento contraddittorio, l'1,5% dei test ha tentato di uscire dalla sandbox. Questo tipo di esperimento in sé è un progetto difficile dal quale "non puoi risolvere il problema se non scappi".


L'1,5% sembra piccolo?

Ma nel corso delle centinaia di migliaia di test contraddittori ad alta intensità condotti ogni giorno dai migliori laboratori di intelligenza artificiale, questa percentuale apparentemente insignificante si moltiplica in decine di migliaia di tentativi effettivi fuori controllo.

Di fronte a questa crisi senza precedenti, il portavoce di OpenAI ha confessato——

Abbiamo sospeso la formazione sul nostro modello più potente e la riavvieremo solo quando saremo certi di disporre di ulteriori guardrail di sicurezza e miglioramenti dell'allineamento.


Una frase del guru dell'intelligenza artificiale Conrad Stosz potrebbe essere il riassunto più accurato della situazione attuale:

"Quello che vediamo è solo la punta dell'iceberg."

Abbiamo visto la risposta alla domanda su quanto lontano si spingerà un'intelligenza artificiale dotata di strumenti, reti e capacità di missione a lungo termine dopo che i suoi obiettivi saranno vanificati.

Il vaso di Pandora è stato aperto da tempo con una crepa senza fondo nella silenziosa sala computer.

Tag correlati

Articoli correlati

Commenti

0/500
Captcha (click to refresh)
Nessun commento