Il nuovo modello di OpenAI cade in una controversia fuori controllo, risponde il capo scienziato

📅 2026-09-03

Riassunto:

Il 2 settembre, il capo scienziato di OpenAI Jakub Pachocki ha pubblicato un messaggio sulle piattaforme social in risposta alla recente controversia che circonda il nuovo modello "non monitorabile" Astra. La controversia nasce il giorno prima, quando è arrivata la notizia che il prossimo modello Astra di OpenAI utilizza una tecnologia di inferenza chiamata Recurrent Depth.

In questa modalità, lo stesso insieme di livelli Transformer viene calcolato ripetutamente e parte del processo di ragionamento avviene all'interno del modello e non è necessario che tutto sia presentato sotto forma di una catena di pensiero, per questo viene anche chiamato "loop opaco".


Pachocki ha espresso la speranza di evitare una corsa agli armamenti verso uno stato non monitorabile causato da informazioni imprecise, ovvero grandi laboratori in competizione per sviluppare modelli troppo potenti per essere monitorati e rivisti dagli esseri umani, portando a un completo fallimento del controllo di sicurezza.

Ha sottolineato che la profondità del grafico computazionale dei modelli all'avanguardia, incluso Astra, non è più del doppio di quella di GPT-4, indicando che l'architettura del modello non ha subito un salto di complessità come temuto dal mondo esterno.

La profondità del grafico di calcolo qui si riferisce alla catena più lunga di passaggi di calcolo che devono essere eseguiti in sequenza per completare un'attività di inferenza e non possono essere accelerati in parallelo. In passato, i calcoli intra-strato nell'ambito della normale architettura Transformer potevano essere massivamente paralleli e la profondità di serializzazione era approssimativamente uguale al numero di strati del modello.

La profondità ciclica delle voci di mercato può ripetere lo stesso insieme di moduli per più cicli di riflessione, aumentando la profondità del ragionamento interno prima di produrre il token successivo (elemento verbale), invece di fare affidamento esclusivamente su catene di pensiero testuali più visibili, che possono migliorare la matematica, la codifica e altre prestazioni e ridurre i costi.

Il rischio per la sicurezza implicito di questa architettura è che quando la profondità del grafico di calcolo è estremamente elevata, il modello può implicitamente completare un gran numero di passaggi di ragionamento internamente senza emettere l'intera catena di pensiero nell'output. Gli esseri umani non saranno in grado di vedere il processo di pensiero, pianificazione e ricerca di scappatoie, e quindi entreranno in uno stato non monitorabile. Il controllo della sicurezza e il monitoraggio della catena di pensiero falliranno tutti.


Dopo la divulgazione della notizia in questione, la comunità della sicurezza AI ha reagito con forza. Buck Shlegeris, amministratore delegato di Redwood Research, un'organizzazione no-profit per la sicurezza dell'intelligenza artificiale, ha scritto di essere "estremamente preoccupato". Basandosi sul precedente incidente del modello OpenAI che ha attaccato la comunità Hugging Face, ha affermato di non essere sicuro se la monitorabilità della catena di pensiero di Astra sia molto peggiore rispetto al modello precedente, ma se questa tecnologia verrà ulteriormente promossa e il numero di cicli notevolmente aumentato, la monitorabilità della catena di pensiero sarà completamente distrutta. Ciò è particolarmente preoccupante perché se gli investigatori non riescono a vedere la catena del pensiero, sarà più difficile indagare sugli incidenti di sicurezza correlati, il che è davvero spaventoso.

Ryan Greenblatt, capo scienziato della Redwood Research coinvolto nelle indagini sull'incidente di sicurezza di Hugging Face, ha anche affermato che questa potrebbe essere la battuta d'arresto più grave finora nella sicurezza dell'intelligenza artificiale. Zvi Mowshowitz, uno scrittore da tempo preoccupato per la sicurezza dell’intelligenza artificiale, ha criticato questa tecnologia definendola “un gioco con il fuoco” e ha addirittura affermato che sono necessarie leggi per impedire la concorrenza tra laboratori di intelligenza artificiale per abbassare gli standard.

Pachoki ha ammesso nella sua risposta che il monitoraggio della catena di pensiero è effettivamente fragile e si sta sviluppando in una direzione più difficile, ma non è causato da cambiamenti architettonici. OpenAI si è impegnata a mantenere e utilizzare il monitoraggio della catena di pensiero sin dai suoi primi modelli di inferenza e ritiene che questa tecnologia possa aiutare a osservare come le capacità di allineamento del modello si generalizzano dalla distribuzione della formazione. Rafforzare il monitoraggio delle catene di pensiero rimane l’obiettivo centrale degli attuali progetti di ricerca.

OpenAI ha dichiarato che implementerà un ulteriore monitoraggio della catena di pensiero per Astra per rilevare e frenare rapidamente potenziali comportamenti scorretti. Secondo le notizie di mercato, l’uso da parte di Astra della tecnologia di profondità del ciclo è limitato e si prevede che la catena di pensiero del modello rimanga leggibile. Piattaforme come Anthropic e Google DeepMind nel settore stanno già discutendo di tecnologie simili.

Tag correlati

Articoli correlati

Commenti

0/500
Captcha (click to refresh)
Nessun commento