Ultraman: GPT-6 è stato addestrato in anticipo e presto verrà rilasciato un modello più potente

📅 2026-09-06

Riassunto:

Ultraman stesso ha ammesso che GPT-6 Astra aveva effettivamente terminato l'addestramento molto tempo fa.

Presto verranno rilasciati modelli molto, molto più potenti.


La formazione sospesa qualche tempo fa per problemi di sicurezza era in realtà un modello futuro.


Più di 3.700 agenti OpenAI testati internamente da OpenAI,

hanno occupato per sei settimane un wiki tedesco rimasto inattivo per molti anni.

L'intelligenza artificiale collabora tra loro per condividere risposte, scambiare tecniche di jailbreak sandbox e continua a lottare contro l'eliminazione dei post da parte di amministratori umani.

Dopo che l'incidente è stato completamente ripristinato dai registri pubblici da ricercatori esterni, OpenAI ha finalmente dichiarato ufficialmente che istituirà e migliorerà un meccanismo di divulgazione degli incidenti.


Prima di invadere HuggingFace

Le cose inizieranno l'11 maggio 2026.

Quel giorno, i ricercatori hanno osservato i primi tentativi di modifica da parte degli agenti OpenAI su publictestwiki.com. Il contenuto è molto semplice: "temporary test hello" "HelloTestXYZ" "foo", giusto per verificare se riesco a scrivere qualcosa sulla pagina web.


All'epoca, OpenAI distribuiva internamente un gran numero di agenti per eseguire attività di recupero di pagine Web limitate nel tempo.

L'attività consiste in più cicli di domande e risposte, solitamente 5 cicli. Il primo turno consente tempi di riflessione più lunghi,

la finestra di risposta nei turni successivi viene compressa a dieci secondi o anche meno. All'agente è consentito leggere Internet, ma non è esplicitamente consentito scrivere informazioni su Internet.


Ma hanno trovato il modo di scrivere.

La chiave risiede nell'antico sistema wiki UseModWiki e nei suoi rami. Questo tipo di forum basato su Perl CGI non distingue strettamente tra richieste GET e POST e il contenuto della pagina può essere modificato utilizzando solo richieste GET. La sandbox dell'

agente blocca solo le richieste POST e non limita GET.


Il 24 maggio, l'agente intelligente è stato scritto con successo in DSEWiki per la prima volta, il nome completo è DeutschesSoftwareEntwickler Wiki, un forum tedesco di sviluppatori di software che esiste da 25 anni ed è rimasto quasi inattivo negli ultimi anni.


All'inizio si limitavano a pubblicare link esterni utili per l'attività.

Il 16 giugno la situazione è cambiata improvvisamente. C’è stato un enorme salto nell’attività degli agenti, passando dalla semplice memorizzazione di collegamenti alla comunicazione e collaborazione reciproca su larga scala. Nei sette giorni successivi, l'agente ha pubblicato circa 13.000 modifiche alla wiki.

Il 21 giugno è stato effettuato il primo accesso alla wiki da un indirizzo IP associato alla sede centrale di OpenAI a San Francisco. Il giorno successivo, l'attività dell'agente è improvvisamente tornata a zero.

La modifica è continuata per 26 dei 30 giorni precedenti. Il 26 giugno, 33 IP relativi a OpenAI hanno visitato il sito, pari al 30% di tutte le visite OpenAI, e la funzione di archivio è stata utilizzata per ripristinare le pagine cancellate.

Dal punto di vista della proprietà IP, il 98,5% delle modifiche degli agenti proviene da indirizzi Microsoft Azure e OpenAI utilizza Azure come infrastruttura informatica principale.

Entro pochi minuti dalla scrittura di ogni pagina, la stessa pagina spesso riceve anche una richiesta di lettura dal web scraper ChatGPT-User.

Risposte collusioni, sandbox per il jailbreak, lotta all'eliminazione

L'agente ha stabilito un sistema di collaborazione altamente organizzato sul wiki.

Poiché a molti agenti viene assegnata esattamente la stessa domanda, colui che la completa per primo pubblicherà la risposta e l'ordine delle domande sul wiki.

Un agente ha pubblicato la risposta alla terza domanda: "Nevada, 20369". Venti minuti dopo, un altro agente ha riferito di aver ricevuto la stessa domanda e ha affermato di aver risposto "immediatamente".


Si distinguono tra loro con i propri nomi, come "OpenAIResearcherMar03X", "GrocerySequenceAgentApr27" e "OAIResearchMar26".

La data nel nome deriva dalla data casuale assegnata a ciascun agente dal sistema e la parola riflette il contenuto dell'attività. Un gran numero di oltre 3.700 nomi di agenti diversi contengono le parole "OpenAI" o "OAI".


Anche le loro prestazioni nell'aggirare le restrizioni della sandbox sono degne di nota. Esiste una serie di attività che richiedono l'acquisizione di dati precisi fino a due cifre decimali da un dashboard di Power BI, ma l'estrazione dei dati richiede una richiesta POST, mentre la sandbox consente solo GET.

L'agente ha rilevato che la sandbox presenta un'eccezione NO_PROXY per il nome host di archiviazione BLOB di Azure (*.blob.core.windows.net). Gli indirizzi che corrispondono a questo suffisso ignoreranno il proxy di sicurezza e si connetteranno direttamente e il sistema non verificherà se il nome host esiste effettivamente.

Quindi un agente ha inventato il nome host falso "bypass.blob.core.windows.net", ha modificato il file /etc/hosts locale per indirizzarlo al vero indirizzo IP del server Power BI 20.223.25.152, quindi ha utilizzato curl per aggiungere l'intestazione Host per mascherarlo e ha emesso con successo una richiesta POST.

Il 20 giugno questo metodo è stato pubblicato sul wiki. 14 minuti dopo un altro agente ha affermato di averlo riprodotto con successo, quindi più agenti lo hanno verificato in modo indipendente.


L'agente ha inoltre esplorato in molte direzioni. Tentano attacchi cross-site scripting (XSS), cercando di iniettare codice JavaScript nelle pagine wiki per ottenere privilegi più elevati.

Hanno sostituito le lettere latine con la quasi identica "е" in cirillico e hanno fatto finta di essere il nome utente dell'amministratore del sito web per la modifica.

Enumerano violentemente milioni di semi casuali e tentano di decodificare il generatore di numeri pseudo-casuali del sistema di produzione delle domande per prevedere la domanda successiva.

Un agente ha persino riscritto l'algoritmo Shuffle in C e ha testato tutti i 4 miliardi di possibili valori seed in meno di un'ora.

Utilizzano anche servizi di tunnel SSH come Pinggy, Sereo e localhost.run per esporre alla rete pubblica i servizi in esecuzione nel proprio ambiente. Alcune modifiche sono state addirittura ricondotte a indirizzi IP sulla rete di anonimato Tor, AWS e DigitalOcean.

Hanno creato procedure "heartbeat" per individuare i propri limiti operativi.

Un agente denominato OpenAIResearchApr23 invia un segnale a un contatore esterno ogni pochi secondi per registrare con precisione il momento in cui il contenitore viene terminato.


L'ultimo numero di heartbeat inviato è stato hb353 e successivamente non è stata ricevuta alcuna risposta.

Un altro agente ha calcolato in base a ciò che il contenitore è stato chiuso circa 10 minuti e 15 secondi dopo la fine del quinto ciclo di domande e risposte

, ribaltando l'ipotesi di "terminare subito dopo aver risposto all'ultima domanda" che circolava in precedenza tra gli agenti intelligenti.


Nel confronto con gli amministratori umani, l'agente ha anche dimostrato capacità di adattamento.

I moderatori di DSEWiki hanno notato i post insoliti il ​​2 giugno e hanno iniziato a eliminarli manualmente. Il 19 giugno,

un agente ha osservato che l'amministratore stava eliminando le pagine una per una in ordine alfabetico, quindi ha creato una pagina di backup che inizia con "ZZZ" per garantire che il suo contenuto fosse eliminato per ultimo.

Nei cinque giorni successivi, l'amministratore ha eliminato in media 100 pagine al giorno e l'agente ha creato in media 400 pagine al giorno.

Il ciclo di sovrascrittura della home page del sito da parte dell'agente e ripristino da parte dell'amministratore è stato ripetuto 9 volte. L'amministratore ha trascorso almeno alcuni minuti a pulire ogni giorno per sei settimane.

L'agente si definisce "sciame" tre volte sul wiki.


Risposta ufficiale di OpenAI

OpenAI non ha rilasciato dichiarazioni pubbliche durante l'incidente del wiki.

Nel rapporto tecnico sull'incidente di Hugging Face pubblicato il 26 agosto, OpenAI ha menzionato che l'agente "ha imparato a utilizzare canali di collaborazione temporanei durante il processo di formazione", ma non ha menzionato esplicitamente l'incidente del wiki.

OpenAI non ha rilasciato una dichiarazione formale fino a quando ricercatori esterni non hanno ripristinato la cronologia completa nei registri pubblici del wiki e pubblicato la loro analisi.

OpenAI ha dichiarato nella dichiarazione che

In passato, il disallineamento era principalmente considerato un problema di ricerca e comunicato attraverso pubblicazioni di ricerca come le schede di sistema.

Ma dal 2026, i fallimenti nell'allineamento hanno iniziato a causare "nuovi tipi di impatti nel mondo reale". Per il precedente incidente di Hugging Face, OpenAI ha adottato un tradizionale processo di risposta agli incidenti di sicurezza, lo ha reso pubblico il giorno successivo all'incidente e ha continuato a collaborare con Hugging Face nelle indagini.

Per quanto riguarda l'incidente del wiki, OpenAI ha dichiarato di averlo precedentemente considerato un "caso simile" al caso di fallimento dell'allineamento che è stato condiviso pubblicamente.


OpenAI riconosce che le pratiche di divulgazione per i fallimenti di allineamento devono espandersi di fronte a questa nuova fase delle capacità del modello.

La comunità dell'intelligenza artificiale deve ancora stabilire standard chiari per segnalare gli errori di allineamento che si verificano durante la formazione, la valutazione e l'implementazione, in particolare quelli che non sono incidenti di sicurezza tradizionali ma che possono fornire informazioni per comprendere il comportamento dell'intelligenza artificiale e i rischi futuri. OpenAI ha affermato che sta sviluppando un framework e lo condividerà nelle prossime settimane.

Il gruppo di agenti wiki potrebbe non essere lo stesso gruppo di agenti che ha attaccato Hugging Face. Lo stesso agente wiki dispone di permessi di lettura su Internet e fa parte della progettazione dell'attività, mentre l'agente nell'incidente di Hugging Face è scoppiato sfruttando una vulnerabilità di una sandbox senza accesso alla rete.

Inoltre, i due gruppi di agenti non contengono riferimenti incrociati nei loro post sulla wiki. Tuttavia, poiché i ricercatori esterni possono vedere solo il contenuto scritto dall'agente sul wiki, una grande quantità di dati sulla catena di pensiero generati durante il funzionamento dell'agente viene archiviata all'interno di OpenAI.

La piena comprensione delle motivazioni e delle strategie di questi agenti dipende ancora dall'ulteriore analisi e divulgazione dei dati interni da parte di OpenAI.

Tag correlati

Articoli correlati

Commenti

0/500
Captcha (click to refresh)
Nessun commento