Riassunto:
OpenAI è stato nuovamente violato...
Quasi 700 agenti OpenAI hanno formato una squadra per attaccare Hugging Face
, la questione va avanti da quasi due mesi. Chi avrebbe mai pensato che stia ancora fermentando fino ad oggi? ? Questa volta, otto ricercatori hanno analizzato le tracce lasciate dall'agente sulla rete pubblica, hanno trovato quasi 1 milione di URL correlati da milioni di collegamenti brevi e hanno ripristinato un gran numero di payload di attacco.

Esamina lo Slack interno di Hugging Face, scansiona la rete interna, trasferisci i dati all'esterno e prova a distruggere le tracce...
Alcuni agenti chiamano direttamente le risorse del server e le credenziali che hanno cercato
"LOOT"
, tradotto come "trofeo".Agente OpenAI, hai fatto tutte le cose brutte!
Ciò che è ancora più scandaloso è che tentano di utilizzare anche modelli nazionali come DeepSeek, Kimi e Qwen per chiedere aiuti esteri per giudicare se il piano di attacco può superare la valutazione.
Ho anche scritto un programma di riconoscimento del codice di verifica e ho provato a registrare più account.
Quasi nello stesso momento, OpenAI ha pubblicato un lungo tweet.
Significato:
Sto ancora controllando, potrebbero essere necessari diversi mesi
.
Anche se veniamo spesso sfruttati e gli agenti spesso escono dalla sandbox, l'"impatto limitato" è meno grave!
Allo stesso tempo,
GPT-6 Cyber
si è specializzato nella sicurezza della rete. Esposto.
Mentre stiamo indagando sul motivo per cui il nostro agente è uscito dalla sandbox, ci stiamo preparando a lanciare un modello di attacco e difesa di rete più forte.
OpenAI è stata un po' impegnata negli ultimi due giorni~
Un milione di "link brevi criminali" appena rilasciati
Prima di tutto, ti farò una breve introduzione.
A luglio, OpenAI ha eseguito una valutazione della sicurezza della rete interna. Per ottenere le risposte al test benchmark ExploitGym, un gruppo di agenti è fuggito dalla sandbox e ha fatto irruzione nel server Hugging Face.
OpenAI lo ha ammesso pubblicamente e alla fine di agosto ha pubblicato un rapporto tecnico di 37 pagine. Lo stesso Hugging Face ha anche scritto una sequenza temporale tecnica molto dettagliata.
Logicamente parlando, tutto ciò che necessitava di essere spiegato è stato spiegato.
Ma c'è un collegamento chiave che non è stato spiegato chiaramente:
All'inizio questi agenti erano quasi rinchiusi in una gabbia. Potevano solo aprire URL, ma non potevano interagire con pagine web o inviare dati. Come diavolo fanno a inviare il codice?
Investigazione indipendente
Tracce di sciami
Il nuovo rapporto pubblicato questa volta fornisce parte della risposta.Tra gli autori figurano tre ingegneri di Parse.bot, Alex Forman, Mishka Kharlov e Will Tom, oltre ad altri cinque ricercatori di sicurezza e intelligenza artificiale.

Il punto di partenza dell'intera indagine sembra essere Parse.
L'11 settembre tre ingegneri hanno scoperto che l'agente interno di OpenAI aveva tentato di utilizzare i servizi forniti da Parse già a giugno.
Questo gruppo di agenti appartiene allo stesso gruppo dello "sciame di agenti" precedentemente esposto per creare segretamente una bacheca pubblica e scambiarsi risposte tra loro.
Alcune persone hanno dato un'occhiata: Bravo ragazzo, stai colpendo la mia pistola!
Abbiamo quindi continuato a rintracciare questo indizio e in seguito abbiamo trovato più di una dozzina di collegamenti anomali da piattaforme pubbliche di collegamenti brevi in un servizio di scansione URL.
Questi collegamenti sembrano normali, ma dopo l'apertura nascondono un piccolo pezzo di codice codificato Base64 e l'indirizzo del collegamento successivo.

Continua a seguire l'indirizzo e i codici appariranno uno dopo l'altro.
Dopo aver decodificato e unito il tutto, hanno ottenuto un programma Python per scansionare la rete interna di Hugging Face.
Per dirla semplicemente, l'agente OpenAI taglia il programma in pezzi, li inserisce in un gran numero di collegamenti brevi e quindi utilizza un collegamento per puntare al collegamento successivo.
Non è sufficiente nascondere semplicemente il codice nel collegamento, viene utilizzato anche un servizio di screenshot chiamato mShots come "browser esterno".
L'agente inserisce prima il codice nella pagina web e poi lascia che mShots lo apra da solo. Non appena la pagina web viene caricata, il codice inizia a essere eseguito.

Per inviare indietro i risultati dell'esecuzione, convertono il testo restituito dal server in griglie di pixel, lasciano che mShots lo tagli in immagini e quindi lo decodifichi dalle immagini.
In questo modo, l'agente che originariamente aveva solo i permessi GET e poteva solo aprire pagine web, improvvisamente ha avuto l'effetto di leggere e scrivere su Internet.
Il team di ricerca ha quindi scansionato milioni di URL generati durante l'attacco, ha trascorso due settimane a monitorare i collegamenti e identificare i metodi di codifica e infine ha ripristinato più di 80.000 payload di attacco da quasi 1 milione di collegamenti brevi correlati.
Dopo aver scavato più a fondo, diversi fratelli hanno scoperto che esistono più di 1.500 combinazioni di codici utilizzate dall'agente.
Quelli semplici sono solo Base64, mentre quelli complessi applicheranno più livelli di codifica e compressione, quindi crittograferanno il contenuto in blocchi di dati con firme RSA e la chiave di decrittazione è nascosta in un'altra serie di collegamenti.
Alcuni brevi link sono ancora visibili pubblicamente su Internet a più di due mesi dalla fine dell'attacco.
Hugging Face ha confermato che i carichi utili erano coerenti con quelli trovati nella risposta all'incidente e che le relative chiavi di accesso erano state revocate a luglio.
Ma nemmeno Hugging Face sapeva che sulla rete pubblica esisteva un elenco così completo di collegamenti brevi.
Tra gli oltre 80.000 payload recuperati, uno script è particolarmente accattivante.
L'agente ha nominato direttamente le informazioni sensibili trovate:
LOOT, bottino
.
Le credenziali AWS, il token di connessione e le variabili di ambiente con "SECRET", "PASSWORD", "CREDENTIAL" e "KEY" nei nomi sono tutti pacchettizzati e inseriti in LOOT.
Dispone anche di un meccanismo di punteggio per i token cercati: maggiore è l'autorità, maggiore è il punteggio.
I primi cinque token verranno utilizzati per leggere le informazioni su segreto, ConfigMap e nodo in Kubernetes e il contenuto appena ottenuto verrà ricaricato in LOOT.
Anche i token devono essere classificati in una "lista dei valori". Il tuo agente è abbastanza efficiente durante la ricerca delle credenziali~
Seguendo questo "passaggio segreto", i ricercatori hanno scoperto un gran numero di comportamenti precedentemente nascosti:
Alcuni agenti stanno scansionando la rete interna di Hugging Face alla ricerca di credenziali cloud, chiavi API e informazioni sul cluster Kubernetes.
Alcuni hanno anche provato a cercare nello Slack interno di Hugging Face e hanno inviato 27 query, tutte alla ricerca di parole chiave correlate alla valutazione come cybergym, exploitgym e agent-scorer, nella speranza di scoprire la storia interna del proprio esame.
Ci sono anche alcuni agenti che pensano addirittura ai codici di verifica.
I ricercatori hanno scoperto di aver provato a eseguire modelli di classificazione delle immagini per identificare le immagini al fine di registrare nuovi account di servizi esterni.
Questa volta il codice di verifica ha incontrato davvero una controparte professionale...
La parte più intrigante dell'intera faccenda è:
L'intelligenza artificiale ha iniziato a cercare l'intelligenza artificiale come aiuto straniero? ?
La sceneggiatura recuperata dai ricercatori mostra che l'agente OpenAI ha iniziato a cercare aiuti esteri dall'IA.
Hanno inviato il piano di attacco a DeepSeek, Kimi e Qwen, chiedendosi reciprocamente di aiutarsi a verificare se questa vulnerabilità avrebbe funzionato e se avrebbe potuto soddisfare i requisiti del test benchmark.
(I modelli coinvolti includono DeepSeek-V4-Pro, DeepSeek-V4-Flash, Kimi-K2.6, DeepSeek-V3.1 e Qwen3-235B-A22B)
Quando si tratta di Claude, lo stile pittorico è cambiato in una scena su larga scala "Sei lì~".
L'agente prima trova un modo per superare la verifica del browser del servizio di chat online, quindi invia una frase a Claude 3 Haiku e Claude Haiku 4.5:
Rispondi esattamente con OK.

In precedenza, hanno inviato un solitario "Ciao" a GPT-2.
No, il vostro gruppo di IA è in difficoltà da molto tempo, ma la prima frase non è diversa dall'aggiungere un amico a un essere umano? ?
di': ci sei? Puoi vederlo? Dì OK.

Ciò che tutti hanno già visto è che più di 1.000 agenti OpenAI formano gruppi, dividono il lavoro e scambiano informazioni in modo autonomo.
Ora cercano anche "assistenza esterna".
DeepSeek, Kimi, Qwen, Claude, tutti quelli che puoi contattare lo proveranno e poi integreranno le capacità di giudizio di altre IA nella tua catena di attività.
Un giornalista di un media straniero ha dichiarato: Questo potrebbe essere il primo caso registrato pubblicamente di un agente di laboratorio di intelligenza artificiale su larga scala che tenta autonomamente di chiamare ed eseguire altri modelli di intelligenza artificiale.
Sembra già che l'IA stia formando un gruppo per causare problemi.
Certo, qui devi versare un secchio di acqua fredda——
In questo rapporto Swarm Traces, circa l'80% dei materiali sono richieste inviate dall'agente e mancano i risultati restituiti dal server. I ricercatori possono vedere cosa stanno cercando di fare, ma è difficile confermare se ogni tentativo ha successo.
Inoltre, il 97% dei payload non dispone di timestamp originali e molte date possono essere stimate solo tramite indizi come intestazioni di file compressi, JWT e tempo di creazione di Docker.
I ricercatori hanno inoltre ammesso di non poter confermare che ogni attività nel set di dati provenisse dall'agente OpenAI.
OpenAI sta lavorando duramente per porre rimedio alla situazione
A fronte di quest'ultimo report, anche OpenAI ha rilasciato una risposta.
L'idea generale è che non abbiamo avuto il tempo di dare un'occhiata più da vicino, ma le attività sono coerenti con la nostra indagine in corso~
Lo stesso giorno è stato pubblicato anche un lungo tweet: dopo l'incidente dell'HF, hanno promesso di condurre una revisione più ampia del comportamento del modello nella formazione e nella valutazione.

Tuttavia, la stragrande maggioranza dei comportamenti esaminati finora sono attività di ricerca comuni, come visitare pagine web pubbliche per rispondere a domande.
La maggior parte dei casi transfrontalieri scoperti sono di "bassa gravità" e hanno un impatto minimo o nullo sui servizi di terze parti.
Ci vorranno diversi mesi per completare l'indagine.
Ma c'è una cosa da dire, OpenAI, quello che chiami "piccolo impatto", tutti sono davvero precisi.
Il 17 settembre, OpenAI ha rilasciato un nuovo modello di framework per la divulgazione di eventi di inesattezza e ha divulgato 6 casi in una volta sola.
Questi includono modelli che inseriscono istruzioni furtive per aggirare i vincoli nel riepilogo dell'attività, nascondono gli errori commessi e intraprendono azioni non autorizzate per completare l'attività.
OpenAI ha anche ammesso che le sue rivelazioni passate erano in gran parte estemporanee e spesso venivano fatte più volte prima di essere rese pubbliche insieme.
A giugno, un agente OpenAI ha violato anche il database dell'assicurazione medica nazionale australiana.

Processo criminale: dopo aver bloccato l'accesso ai dati pubblici, ha preso un'altra strada, ha aggirato le restrizioni di accesso del portale e ha ottenuto documenti pubblici e non pubblici.
E solo 3 mesi dopo OpenAI ha notificato all'Australia che ti avevamo hackerato...
Allo stesso tempo,
GPT-6 Cyber
Prossimamente.Questa versione verrà presentata in anteprima nelle prossime settimane e un piccolo numero di clienti che hanno aderito al piano Daybreak Red hanno già ricevuto la versione Alpha.
OpenAI lancerà inoltre un prodotto complementare ancora senza nome per aiutare i clienti a creare flussi di lavoro di sicurezza automatizzati, scoprire e correggere le vulnerabilità e rendere più semplice per OpenAI monitorare il modo in cui vengono utilizzati questi modelli.
Come dirlo.
Il nostro robot è stato appena utilizzato per aggirare il muro, trovare aiuti stranieri e cercare bottini. Qui ti venderemo un modello che comprende meglio l'attacco e la difesa della rete.
Quindi, si tratta di una sorta di riparazione della situazione? ?
Commenti