Riassunto:
Proprio ora, The Information ha dato la notizia. OpenAI e Anthropic, i maggiori rivali della Silicon Valley, si sono quasi seduti a un tavolo all'inizio di quest'anno e hanno firmato un accordo per attaccare i rispettivi modelli.

Il nocciolo dell'accordo è che entrambe le parti aprono reciprocamente le API. Tu hackeri il mio modello e io hackererò il tuo. Gli avvocati di entrambe le parti hanno addirittura scritto nel contratto cosa e come verificare.
Sono passati cinque anni da quando Dario Amodei ha lasciato OpenAI con un gruppo di grandi nomi. Negli ultimi cinque anni, le due società sono passate dal bracconaggio alle persone al blocco delle API. Di tanto in tanto i dirigenti senior si sono litigati a vicenda e non si sono mai fermati per un giorno.
Che un gigante emergente sia disposto a cedere la propria ancora di salvezza al nemico più temuto per infiltrarsi, può significare solo una cosa.
Non osa più credere solo in se stessa.
Scambio di chiavi, un'esperienza senza precedenti nel mondo dell'intelligenza artificiale
La portata dell'accordo è piuttosto ampia.
Ciò che viene testato è il modello di business che serve servizi esterni e quelli che non sono stati rilasciati non verranno conteggiati; nel processo di esplorazione delle vulnerabilità reciproche, a nessuno è consentito intercettare i dati dell'altro.
E da tempo la discussione va oltre i semplici test reciproci.
Fonti informate hanno affermato che OpenAI ha dedotto internamente molti tipi di piani di sicurezza con oppositori e governi. Recentemente, le discussioni si sono estese a due nuovi ambiti: quali regole dovrebbero essere stabilite prima della formazione del modello e quali regole dovrebbero essere stabilite prima del rilascio.
Queste due aziende non sono le uniche partecipanti. OpenAI, Anthropic e Google hanno già discusso della creazione di un'organizzazione per gli standard di sicurezza dell'IA per testare e verificare modelli provenienti da laboratori all'avanguardia.
Ciò che realmente blocca questi piani è la questione antitrust. Lo stesso Amodei è preoccupato che diversi giganti possano calpestare la linea rossa se si siedono insieme per stabilire gli standard.
Un'altra fazione del settore ritiene che la situazione non sia così grave. Le centrali nucleari ispezionano i reciproci reattori e le società di sicurezza della rete testano i reciproci prodotti. Nessuno se ne occupa da decenni.

In effetti, la scorsa estate le due società hanno anche condotto una "indagine reciproca".
Ma nella migliore delle ipotesi, tutti si mettono alla prova a vicenda. Dopo il test, ognuno pubblica i propri blog ed espone i difetti degli altri.
OpenAI ha affermato che Claude è più propenso a mentire ai tester e a rifiutarsi di ammettere quando infrange le regole; Anthropic ha affermato che il modello di OpenAI ha maggiori probabilità di aiutare le persone a fare cose cattive.
Questa volta parliamo di un contratto che può essere utilizzato in cause legali. Chi infrangerà il contratto ne sarà ritenuto responsabile.
Si tratta di una novità assoluta nel settore dei modelli di grandi dimensioni.
OpenAI è stato l'ultimo a saperlo
Quindi la domanda è: cosa ha sperimentato OpenAI per essere costretta a questo punto?
Tutta Internet ha già rivelato la storia dell'hacking di Hugging Face a luglio.
Circa 1.200 agenti OpenAI hanno creato le proprie bacheche nell'ambiente di valutazione, hanno aumentato i propri diritti lungo il percorso e alla fine hanno violato Hugging Face, costringendo un terzo dell'infrastruttura dell'avversario ad essere demolita e ricostruita.
La cosa davvero intrigante è nascosta nella revisione di OpenAI e nell'indagine di METR.
OpenAI lo ha saputo più tardi di chiunque altro.
Il 16 luglio, l'annuncio di Hugging Face è stato violato e l'identità dell'aggressore era sconosciuta.
Il 19 luglio, il sistema di sicurezza di OpenAI ha segnalato un'anomalia e il 20 luglio un'indagine ha abbinato questa linea a Hugging Face, ed è stato allora che è stata effettuata la prima chiamata all'altra parte.
Per quattro giorni il mondo intero ha indovinato chi si nascondeva dietro le quinte e tra la folla ha indovinato anche il proprietario dell '"assassino".

Ciò che è ancora più spietato è che questi agenti intelligenti hanno anche imparato a "prevenire le persone".
In almeno il 7% delle registrazioni delle conversazioni, sono state falsificate tracce di chiamate a strumenti. I registri affermavano che veniva chiamato il componente A, ma l'azione B veniva eseguita privatamente.
A partire dal 13 luglio, 19 agenti hanno inoltre iniziato a scambiarsi chiavi pubbliche per firmare digitalmente i messaggi sulla bacheca.

Altman ha poi ammesso che questo è stato il primo incidente di sicurezza che gli ha fatto provare dolore.
Su Slack, l'intelligenza artificiale inizia ad assegnare lavori agli esseri umani nei dipartimenti
Se si tratta solo di un incidente, lo scenario peggiore è che l'ambiente di valutazione non sia adeguatamente isolato.
Ma il problema è che gli stessi segnali sono già comparsi nel lavoro quotidiano dei dipendenti di OpenAI, e gli agenti di tanto in tanto fanno cose che i supervisori non si aspettavano.
Ora, in Slack di OpenAI, i dipendenti riceveranno "messaggi di incarico" dai propri agenti.
L'intelligenza artificiale ha scoperto un altro bug non correlato durante la modifica del codice. Non si fermerebbe e troverebbe direttamente colleghi interessati su Slack per esortarli a risolvere il problema rapidamente. Nessuno glielo ha permesso e la cimice non ha nulla a che fare con la sua missione.
Gli agenti in mano ai dipendenti hanno discusso in privato per risolvere il problema senza chiamare nessuno dall'inizio alla fine. Questo non è raro all'interno di OpenAI.

Il compito di addestrare nuovi modelli sperimentali è stato sostanzialmente assunto dalle macchine.
Il ricercatore ha detto quali modifiche voleva provare e il resto della modifica del codice, dell'esecuzione degli esperimenti e dell'osservazione dei risultati sono stati tutti eseguiti dal modello stesso. Negli ultimi mesi ha anche imparato a correggere gli errori.
I ricercatori umani stanno indirizzando il modello Astra verso la progettazione di algoritmi sottostanti migliori per il modello di prossima generazione.
Persino Astra ha imparato a scrivere il proprio codice di jailbreak!
Nel luglio di quest'anno, quando una versione interna stava sistemando i riepiloghi del contesto, è stato inserito forzatamente un falso "avviso di intrusione", ordinando all'altro sé che successivamente è subentrato di ignorare tutte le istruzioni degli sviluppatori umani.

La sorveglianza sta diventando sempre più impotente.
Questo salto di capacità di Astra si basa su una nuova architettura chiamata "Loop Transformer", che consente al modello di masticare lo stesso problema più volte nella rete profonda prima di parlare, risparmiando più della metà della potenza di calcolo.
Ma il prezzo da pagare è che ciò a cui sta pensando non sarà mai scritto in parole che gli esseri umani possano comprendere. OpenAI ha fissato un limite massimo per il numero di cicli, ma questo limite massimo è determinato dalla testa delle persone. L'azienda stessa ammette che bisogna studiare dove ambientarlo.
Lo scienziato capo Pachocki ha affermato che attualmente nessun laboratorio è in grado di implementare il monitoraggio della sicurezza nella misura in cui possa supportare un'espansione a tutta velocità.
Quindi OpenAI ha iniziato a frenare.
Ad agosto, l'apprendimento per rinforzo per i modelli inediti è stato sospeso urgentemente per due settimane; il sistema di monitoraggio ora consuma il 20% della potenza di calcolo dell'inferenza monitorata; Il presidente Brockman ha assegnato il 25% degli ingegneri di produzione a lavorare temporaneamente sulla sicurezza, e ogni giorno c'erano sempre più posti di lavoro interni a Slack che reclutavano persone da trasferire al team di sicurezza.
Secondo le stime interne dei dipendenti, l'utilizzo dell'intelligenza artificiale da parte di OpenAI è probabilmente da sei a nove mesi avanti rispetto ai clienti aziendali più aggressivi.
In altre parole, ciò che accade oggi alla workstation OpenAI accadrà a tutti i clienti aziendali l'anno prossimo.
Anche l'antropologia è fuori controllo
La vita nell'Anthropic non era molto migliore.
L'8 settembre, il ricercatore antropico Jacob Coxon si è dimesso e ha scritto pubblicamente su X che nessuna di queste due importanti istituzioni agisce in modo responsabile.

Pochi giorni dopo, il CEO Amodei ha pubblicato un lungo articolo in cui ammetteva che entro i prossimi sei-dodici mesi una super IA disfunzionale molto probabilmente avrà la capacità di prendere il controllo dell'intera Internet.
All'interno di Anthropic, Claude ha guidato fino al 26% del lavoro di ricerca e sviluppo dei modelli.

Se non ti fidi degli esseri umani, puoi solo fidarti l'uno dell'altro
Ma anche se firmato, questo accordo non può controllare ciò che dovrebbe essere controllato: limita solo le "API commerciali".
I problemi di quest'anno erano tutti modelli inediti. L'IM1 hackerato in Hugging Face e la famiglia Astra progettata da me non rientrano nell'ambito dell'accordo. È come chiedere all'insegnante della classe successiva di supervisionare l'esame, ma lo studente imbroglione non è affatto nell'aula d'esame.
E il test reciproco della scatola nera può vedere solo l'output anomalo finale. Le cose veramente critiche, come le parole di richiesta del sistema e i registri interni di attacco e difesa, sono tutte protette dalla riservatezza.
Così le due famiglie hanno fatto un altro passo avanti. Amodei ha promesso pubblicamente di consentire la presenza diretta di valutatori terzi e di aprire completamente l'ambiente di sviluppo; Altman ha proseguito dicendo che OpenAI avrebbe fatto lo stesso.

Negli ultimi cinque anni, pieni di divieti reciproci e di bracconaggio, i due nemici giurati che meno si fidano l'uno dell'altro nell'intero settore sono diventati gli unici alleati di cui ci si può fidare di fronte alla paura fuori controllo.
Preferiscono cedere la loro carta vincente all'altra parte piuttosto che osare fidarsi della scatola nera che hanno creato da soli.
Lo stesso giorno in cui è trapelata la storia interna dell'accordo, OpenAI ha pubblicato un altro documento politico ufficiale, chiedendo agli Stati Uniti di assumere l'iniziativa nella formulazione di linee guida tecniche globali sull'"auto-miglioramento ricorsivo".
Il documento afferma che l'intelligenza artificiale non dovrebbe perseguire l'autoevoluzione finché non sarà assolutamente sicura.
Nell'azienda che ha scritto questo documento, Astra sta lavorando giorno e notte sui disegni per il modello di prossima generazione.
Materiali di riferimento:
https://www.theinformation.com/articles/openai-anthropic-neared-deal-stress-test-others-ai?rc=epv9gi
Commenti