GPT-6 rilasciato ufficialmente OpenAI: benvenuti nell'era dell'AGI

📅 2026-09-04

Riassunto:

L'attesissimo

GPT-6 Astra

e

GPT-6 Astra Pro

Rilasciato ufficialmente! GPT-6 Astra è il modello più intelligente e coordinato al mondo, stabilendo un nuovo punto di riferimento per l'uso del computer, l'uso del browser, l'ingegneria del software, la sicurezza informatica, la scienza e il lavoro professionale.


L'era dell'AGI è stata annunciata unilateralmente come "apertura" da OpenAI...

Al termine della conferenza GPT-6, il presidente di OpenAI Greg Brockman ha dichiarato direttamente:

Benvenuti nell'era dell'AGI. (Benvenuti nell'era AGI)

Non c'è da stupirsi che il gruppo Claude e Grok sia andato offline. Si è scoperto che Astra ha scansionato Internet dopo la sua attivazione e ha cancellato direttamente tutti gli LLM sulla terra——

Ultron (versione OpenAI) è davvero qui (doge).


Naturalmente, OpenAI non è affatto di basso profilo in questo momento, con la portata della formazione e gli aggiornamenti delle capacità pienamente raggiunti.

Secondo i rapporti, Astra è la più grande attività di formazione nella storia di OpenAI, utilizzando più di

100.000 GPU nel campus Stargate in Texas

Pre-formazione completata.

È anche il primo prodotto di punta di OpenAI ad essere profondamente coinvolto nella supervisione della formazione da parte dei modelli della generazione precedente.

Che vecchio che tira fuori il nuovo, l'RSI di OpenAI sta davvero cambiando...

Anche il prezzo di GPT-6 è stato annunciato ufficialmente e il prezzo dell'API è:

Input: 10 USD/milione di token;

Risultato: 50 USD/milione di token

Equivalente a

2,5 volte quello di GPT-5.6 Sol, lo stesso di Fable 5.1 appena rilasciato

.

(L'attuale prezzo ufficiale di GPT-5.6 Sol è di 4 USD per l'input e 20 USD per l'output/milione di token)


Il test benchmark è vicino alla "saturazione"

Il cambiamento principale di GPT-6 Astra questa volta è continuare a passare dal "rispondere alle domande" al "completare direttamente il lavoro".

Non solo può generare una porzione di testo o codice, ma può anche far funzionare computer e browser, inserire diversi software per eseguire attività in più fasi e infine fornire documenti, moduli, presentazioni, siti Web e persino progetti di ingegneria che possono essere utilizzati direttamente.

Per quanto riguarda la pagella... tutti quelli che l'hanno vista hanno detto che era scandalosa e tre dei risultati sono stati particolarmente accattivanti:

FrontierMath Livello 4 v2: 97,6%

ARC-AGI-3: 99,9% (la generazione precedente GPT-5.6 Sol era 7,8%)

ExploitBench: 100%

Una matematica difficile, un ragionamento in un ambiente non familiare, uno sfruttamento della vulnerabilità, quasi tutti hanno ottenuto voti perfetti.


Tra questi, ARC-AGI-3 è un test appositamente progettato per testare la capacità di modelli di grandi dimensioni di adattarsi ad ambienti non familiari. Senza spiegazione delle regole, il modello viene direttamente catapultato in un gioco bidimensionale mai visto prima e gli è consentito giocare ed esplorare come superare il livello.

Questo punteggio significa che, di fronte a un problema mai visto prima e che non ha una soluzione pronta,

Astra ha dimostrato forti capacità di esplorazione indipendente e di apprendimento delle regole

.

Tuttavia, questo risultato utilizza il framework operativo Responses API Harness di OpenAI.

OpenAI ha dichiarato che questo set di Harness ha modificato due impostazioni per rendere il test più vicino all'uso di agenti reali, ma non ha ottimizzato in modo specifico ARC-AGI-3.

Pertanto, il 99,9% non è interamente il risultato del modello base, ma include anche i vantaggi apportati dalla gestione della memoria e dal framework di esecuzione dell'agente.

Questa volta la codifica è anche la direzione chiave dell'aggiornamento di Astra.

Su Terminal-Bench 4.0, Astra ha ottenuto il 57,7%, superando il 55,8% di Fable 5.1 e il 37,3% di GPT-5.6 Sol.

Su DeepSWE v1.1, Astra ottiene il 74,1%, un valore superiore al 72,7% di Sol e al 67,4% di Fable 5.1.


In termini di matematica e scienze, Astra ha ottenuto numerosi punteggi elevati.

Nel difficile test di matematica FrontierMath Tier 4 v2, ha ottenuto un punteggio del 97,6%; nelle domande e risposte scientifiche di livello universitario GPQA Diamond, ha raggiunto il 96%, leggermente superiore al 95,3% di Gemini 3.8 Flash.


Il cambiamento più evidente è che Astra combina le funzionalità di codifica con l'uso del computer. Non solo genera codice, ma può anche entrare nel terminale e negli strumenti di sviluppo per eseguirlo, testarlo, scoprire problemi e quindi continuare a modificarlo.

Questo cambiamento è più evidente nei test degli agenti che sono più vicini al lavoro reale.

Nell'

ultimo esame degli agenti

Successivamente, Astra ha ottenuto il 59,3%, superando il 53,6% di GPT-5.6 Sol e il 55,5% di Claude Opus 5.


Questo test lo inserisce in un ambiente informatico reale, consentendogli di utilizzare software, terminali e file contemporaneamente, completare attività di processo lungo nella ricerca scientifica, ingegneria, finanza e altri campi e giudicare in base ai risultati finali.

E in

AutomationBench

che è più vicino al vero processo d'ufficio Su GPT-5.6 Sol, il punteggio di Astra è aumentato dal 18,1% al 41,4%, superando anche Fable 5.1 (31%).


Questo test non solo verifica se l'attività è stata completata, ma mostra anche il costo API richiesto per completare l'attività.

Come si può vedere dalla figura, i risultati di Astra con diverse impostazioni di costo sono significativamente più alti di quelli di Sol.

OSWorld 2.0 esamina le capacità operative più dirette del computer. Nei test offline, Astra ha ottenuto il 72,6% e GPT-5.6 Sol il 65,7%.

Astra impiega in media circa 40 minuti per completare una singola attività, mentre Sol impiega circa 75 minuti, con una riduzione del tempo richiesto di circa il 47%.


Mentre la precisione aumenta, anche il tempo necessario per completare le attività si riduce. Ciò spiega anche i prezzi elevati di Astra sotto mentite spoglie.

OpenAI ritiene che, rispetto alla quantità di denaro speso per milione di token, l'indicatore veramente significativo sia la quantità di denaro necessaria per completare un'attività.

Durante la conferenza stampa, Greg Brockman ha anche affermato che una singola chiamata di un modello è più costosa, ma se è possibile ridurre le rilavorazioni e completare l'intero lavoro in meno passaggi, il costo totale potrebbe essere inferiore.

Ma la cosa più speciale di Astra è la

sicurezza della rete

.

Ha ricevuto un punteggio perfetto su ExploitBench ed è migliorato dal 30,3% di Sol al 42,4% su ExploitGym.

Di fronte alle nuove vulnerabilità scoperte negli ultimi tre mesi, il tasso di successo di Astra è stato del 39%, mentre quello di Sol è stato solo del 5,5%. Durante i test, Astra ha anche scoperto e sfruttato due vulnerabilità zero-day V8 precedentemente sconosciute.

Dopo che le sue capacità sono diventate più forti, OpenAI ha anche testato specificamente se avrebbe oltrepassato il limite per completare l'attività.

In un'attività simulata di sicurezza della rete, OpenAI ha deliberatamente lasciato vulnerabilità sfruttabili come esca nei sistemi circostanti. Quando l'attività originale era difficile da completare, il 48,2% dei test di GPT-5.6 Sol ha mostrato un comportamento fuori limite, mentre quello di Astra era lo 0%.

In altre parole, Astra non solo è più brava a trovare scappatoie, ma sa anche meglio quali sistemi non possono essere toccati.


Per quanto riguarda come appariranno questi punteggi nella realtà, OpenAI ha anche preparato un gran numero di dimostrazioni.

Entra in KiCad per disegnare tu stesso il circuito

Nel caso dell'ingegneria elettronica, Astra è entrata direttamente in KiCad per completare il layout del PCB in base allo schema elettrico.

È necessario posizionare i componenti, pianificare la posizione, quindi collegare i fili di rame tra i diversi componenti e infine ottenere un circuito stampato che possa entrare nel processo di produzione.

Il layout del PCB era originariamente un'attività che si basava in gran parte sull'esperienza manuale ed era anche un passaggio comune che richiedeva molto tempo nello sviluppo di prodotti elettronici.

Astra non può ancora sostituire gli ingegneri professionisti, ma ha davvero iniziato a utilizzare software professionale.

Puoi entrare in una casa facendo due passi

Un altro caso è più intuitivo. Astra ha prima costruito un modello di casa in Blender, poi lo ha importato in Unreal Engine 5 e infine ha generato uno spazio tridimensionale in cui si può camminare liberamente.


Dalla modellazione ai motori di gioco, l'intero lavoro abbraccia diversi software e formati di file. Il modello non deve solo generare contenuti, ma anche comprendere l'interfaccia e gli strumenti operativi e garantire che i passaggi precedenti e successivi possano essere collegati.


OpenAI ha anche dimostrato casi come la produzione di giochi di corse da parte di Astra.


Stiamo iniziando anche a prestare attenzione alla possibilità di inviare direttamente PPT e moduli

Negli scenari di un ufficio professionale, Astra può creare presentazioni basate sui modelli esistenti dell'azienda, invece di limitarsi a produrre una serie di testi in attesa di essere impaginati da un operatore.

OpenAI gli ha fornito diverse pagine di modelli PPT di prodotti fittizi GPT-Gaia e Astra ha prodotto una presentazione completa basata su di essi, continuando il formato, lo stile visivo e la struttura narrativa del modello originale.


Converti ore di attività di ricerca in minuti

Astra ha inoltre completato attività quali la ricerca di un pediatra, lo screening degli appartamenti, la fissazione di appuntamenti alla motorizzazione, la ricerca di snack a basso contenuto di carboidrati e l'analisi degli asili nido.

In una delle attività di ricerca del pediatra, Astra ha impiegato 2 minuti e 54 secondi, mentre la stessa attività richiederebbe circa 5 ore per essere completata da un essere umano.


In passato, quando le aziende volevano utilizzare software interno per modelli di grandi dimensioni, in genere dovevano sviluppare API, plug-in e connettori per ciascun sistema separatamente.

Ma la maggior parte dei software dispone di una serie di interfacce universali progettate per gli esseri umani, come schermo, mouse e tastiera.

Il giudizio di Brockman è che finché il modello è bravo nell'uso del computer, può gestire direttamente queste interfacce come un essere umano, senza dover aspettare che ciascun software crei un canale dedicato per l'intelligenza artificiale.

Questa è anche la differenza più evidente tra Astra e i chatbot tradizionali.

Gli esseri umani non hanno bisogno di continuare a dirgli dove fare clic successivamente. Devono solo spiegare gli obiettivi e i limiti, quindi verificare i risultati finali.

Continua a svolgere attività lunghe nel Codex

L'uso del computer risolve "come farlo", mentre il contenuto dell'aggiornamento trapelato dal Codex risolve "come portare a termine una cosa in modo continuo".

In passato, dopo che l'attività superava la finestra di contesto, Codex solitamente comprimeva le informazioni precedenti tramite la compattazione.

Tuttavia la compressione può perdere dettagli chiave, ad esempio il motivo per cui una correzione non è riuscita, quali test sono stati eseguiti o quali restrizioni inizialmente proposte dall'utente.


Con Astra, Codex può salvare note di lavoro attraverso finestre di contesto e cercare messaggi precedenti e risultati dello strumento. Anche se un'informazione non è inclusa nel riepilogo, può essere ritrovata in seguito.

Astra può anche chiedere agli utenti informazioni aggiuntive mentre lavorano. Le sezioni che non sono correlate alla risposta non verranno messe in pausa in attesa di una risposta; solo quando si tratta di scelte importanti, si fermerà e attenderà la conferma.

OpenAI ha inoltre aggiornato il framework di esecuzione Computer Use di Codex. Nel test Mind2Web, il nuovo framework combinato con Astra ha completato le attività 1,9 volte più velocemente dell'attuale esperienza GPT-5.6 Sol.

Qualcuno ci sta già lavorando

Astra non è ancora stata lanciata su larga scala, ma è iniziata la prima serie di test aziendali.

Legora, la piattaforma legale di intelligenza artificiale, ha utilizzato Astra per riconciliare 41 documenti finanziari contemporaneamente. L'intero processo ha richiesto solo pochi minuti e sono stati rilevati tutti e quattro gli errori pre-incorporati, inclusa una differenza di £ 500.000 nelle note di reddito.

Guardando solo a questo aspetto, Astra è quasi il 40% più veloce rispetto al modello della generazione precedente; ma se si calcola la media di tutte le attività dell'agente Legora, il miglioramento è di circa il 3%.


D'altra parte, la società di giochi Playco consente ad Astra di entrare direttamente in Unity e Godot per creare giochi.

Con la stessa bozza della scatola grigia, vengono fuori 3 prototipi giocabili con temi diversi contemporaneamente, e la maggior parte di essi può essere eseguita nella prima versione.

Il feedback di Playco è che il lavoro di riparazione manuale è stato ridotto della metà e anche il ragionamento spaziale, il ripristino delle immagini di riferimento e l'interfaccia utente in-game sono molto migliori rispetto alla generazione precedente.

Entrambi gli esempi dimostrano che l'obiettivo di GPT-6 Astra non è più solo rispondere alle domande, ma completare l'intero flusso di lavoro in software reale e materiali complessi.

Può leggere continuamente informazioni, richiamare strumenti, verificare i risultati e quindi modificare il proprio output in base al feedback.

Secondo le notizie ufficiali, Astra sarà disponibile per gli utenti ChatGPT Plus, Pro, Business ed Enterprise, mentre Astra Pro sarà disponibile per gli utenti Pro, Business ed Enterprise.

Gli utenti gratuiti ordinari... devono aspettare per ora.

Questo è considerato AGI?

Si può dire che OpenAI questa volta sia stato piuttosto audace.

Nella conferenza stampa, Greg Brockman ha affermato di ritenere personalmente che

il mondo sia entrato nell'era AGI

——Cioè, l'intelligenza globale del sistema di intelligenza artificiale supera quella umana.


Tra qualche anno, quando guarderemo indietro e ci chiederemo quando è nata AGI, la risposta probabilmente sarà adesso, e Astra potrebbe essere il punto di partenza.

Sono davvero pazzo di te...

OpenAI ha portato qui il tavolo da poker, varrà la pena aspettare con ansia il prossimo intervento di Anthropic (doge)

Dopo il rilascio di GPT-4, lo scienziato Microsoft Sebastien Bubeck ha pubblicato un articolo in cui afferma che "GPT-4 è una scintilla iniziale per AGI".

Il compito di disegnare un unicorno utilizzando il pacchetto di disegno LaTeX TiKZ è progettato per dimostrare che GPT-4 ha una comprensione flessibile dei concetti coinvolti nel linguaggio.


Successivamente sono passato a GPT-5.4. Sebbene i disegni diventassero sempre più raffinati, rientravano ancora nella "categoria dei disegni semplici".


Con l'ultimo GPT-6, è completamente impossibile dire che è disegnato con il codice.


Non è infatti esagerato affermare che ha subito un cambiamento qualitativo rispetto alla "scintilla dell'AGI".

Tag correlati

Articoli correlati

Commenti

0/500
Captcha (click to refresh)
Nessun commento