Riassunto:
Negli ultimi due giorni, credo che tutti siano rimasti stupefatti dai vari incredibili gameplay di GPT-6 Astra: modellazione 3D completa in una frase, creazione di un gioco completo da zero, smantellamento di migliaia di parti in un colpo d'occhio e persino utilizzo per controllare i robot... In breve, è incredibilmente potente. I netizen hanno un detto esagerato: finché impari lentamente, non devi imparare. Ma GPT-6 Astra dà alle persone la sensazione che non appena uscirà, la complessità che originariamente affliggeva molti campi sembrerà improvvisamente risolta.
Questa tendenza non dovrebbe essere sottovalutata, ma le attuali capacità del modello non dovrebbero essere eccessivamente esagerate. In questo articolo, faremo il punto sui vari incredibili gameplay di GPT-6 Astra e sui suoi attuali limiti.
Modellazione 3D,
All'improvviso sta diventando più facile?
La funzionalità di scorrimento dello schermo più intensa di Astra negli ultimi due giorni è probabilmente 3D.
Qualcuno lo ha usato per generare direttamente treni 3D:

![]()
Entrambi i treni vengono generati direttamente da Astra utilizzando il codice TypeScript e Three.js durante l'esecuzione nel browser. Le dimensioni del corpo, il contorno e le varie strutture geometriche provengono dai parametri delle dimensioni, dal profilo e dalla funzione geometrica nel codice; il movimento delle ruote è il codice, e anche l'animazione dell'intero treno che esplode, le parti che cadono a pezzi e il riassemblaggio è tutto codice.
Inoltre, questi modelli possono essere smontati in parti dopo essere stati realizzati. Una fotocamera può essere smontata in 122 gruppi di componenti e 1877 parti modellate individualmente. L'esecuzione dell'intera attività ha richiesto circa 3 ore. L'autore ha affermato di non essersi mai reso conto che Three.js (una libreria JavaScript utilizzata per creare e visualizzare grafica 3D nel browser) potesse essere utilizzata in questo modo.
![]()
La fotocamera può essere smontata, così come la Tesla. Qualcuno lo ha smontato in 334 parti di modellazione e i nomi, i numeri e le strutture di base di queste 334 parti sono ufficiali e non fabbricati dall'intelligenza artificiale. Ovviamente si tratta solo di uno smontaggio molto approssimativo a livello di frame, per nulla vicino al livello di dettaglio richiesto per uno smontaggio 3D.
![]()

È interessante notare che questo autore non era soddisfatto dopo aver smantellato Tesla e ha persino creato un sito Web per "smantellare un uomo (maschio)": le 2234 parti modellanti dell'intero corpo possono essere visualizzate una per una e possono essere mappate nei file sorgente.
![]()
Vedendo questi casi, alcune persone hanno gridato: "Il cielo sta cadendo per gli studenti di modellazione 3D".

Ma alcuni sostengono che gli attuali risultati diretti dell'intelligenza artificiale non sono ancora disponibili in commercio.

Inoltre, anche la stabilità è un grosso problema. Dopotutto, ha ancora bisogno che le persone risolvano i bug.

L'importanza di queste demo non è solo quella di dimostrare che Astra può modellare. Ancora più importante, dimostra un nuovo modo di interazione: le persone non hanno più bisogno di apprendere complessi software 3D, ma descrivono direttamente il mondo che desiderano e lasciano che l’intelligenza artificiale sia responsabile della traduzione delle idee in strutture spaziali.
In passato la modellazione 3D rappresentava la soglia per entrare nel mondo digitale; in futuro, potrebbe diventare una capacità fondamentale dell’intelligenza artificiale di comprendere e generare il mondo reale. Naturalmente, c’è ancora molta strada da fare prima di ottenere applicazioni realmente di livello industriale, ma il percorso sta diventando sempre più chiaro.
Non c'è bisogno di imparare a usare il software?
Astra, entra tu stessa
Nel posizionamento ufficiale di OpenAI, l'uso del computer e del browser sono le capacità vincenti di GPT-6 Astra. In un esempio di dipinto su Canva, lo vediamo in azione.
In questo caso, il netizen ha chiesto ad Astra di disegnarlo in Canva (replicando il ritratto da una foto di riferimento). Durante il processo di disegno, Astra può controllare direttamente l'interfaccia di Canva nel browser: selezionare gli strumenti, fare clic/trascinare con precisione, disegnare strato per strato (dallo sfondo al corpo, alle braccia, ai dettagli del viso) e infine completare un ritratto semi-realistico in stile pixel molto simile.
![]()
Ciò comporta anche operazioni in più passaggi a lungo termine (il feedback dell'autore è di circa 1 ora), cambio di strumento (Chrome passa alla modalità di utilizzo del computer dopo che si verifica un problema a metà strada), nonché una comprensione estremamente elevata dell'interfaccia e una precisione di controllo accurata.


Anche Fable 5.1 della porta accanto ha ricevuto lo stesso messaggio, ma il risultato ha deluso gli utenti della rete:

Non è l'unico a fare questo esperimento. Anche un altro netizen ha scattato la stessa foto e ha chiesto a due IA di disegnarla, e i risultati sono stati simili: Astra è più realistica, Fable 5.1 è più gratuito e facile...


Link video: https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q
Tuttavia, alcuni netizen hanno sottolineato che gli effetti visivi finali di queste cose non sono al centro dell'attenzione. Ciò che è importante è che gli agenti supportati da Astra possono già gestire Blender, Unreal Engine e i browser da soli e trasformare direttamente i prompt in file di progetto.


Negli ultimi giorni, "Astra usa Blender per ricostruire il San Francisco Palace of Fine Arts", "Un vecchio disegno di un treno a vapore trasformato in 3295 oggetti modificabili in Blender" e "600 agenti Astra che vivono nello stesso mondo irreale" sono tutti casi tipici in questa direzione.


Link video: https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q
Un altro caso interessante è "suonare il pianoforte". Il dipendente di OpenAI Victor E. Nunez ha chiesto ad Astra di trovare un pianoforte online e suonare "River Flows in You" utilizzando il computer. Durante il processo di esecuzione, Astra ha cercato e aperto da sola un sito web di pianoforte virtuale online, quindi ha utilizzato Computer Use per controllare direttamente l'interfaccia del computer: fare clic con il mouse come "mano destra" e fare clic sui tasti del pianoforte. Il controllo della tastiera viene trattato come "mano sinistra + paragrafo veloce". I due si sono esibiti contemporaneamente, controllando accuratamente il ritmo e la durata delle note, ed hanno eseguito completamente la canzone "River Flows in You".

Link video: https://mp.weixin.qq.com/s/6tOR2GptUa97ffW-jWJF2Q
La cosa più interessante è che Astra ha registrato lo schermo stesso e ha montato questo video dimostrativo. L'intero processo è end-to-end: dalla comprensione del compito → ricerca del sito web → caricamento dello strumento → suonare in tempo reale, senza intervento manuale nei passaggi intermedi.
Questi casi dimostrano che GPT-6 Astra ha raggiunto un nuovo livello nell'uso dei computer ad agenti, con velocità, precisione, parallelismo multi-strumento e funzionalità di feedback in tempo reale che raggiungono tutti un livello molto elevato.
Forse, in futuro, le persone potranno smettere di pensare a come ricreare le capacità di un determinato software professionale in funzioni di intelligenza artificiale e affidare semplicemente il software all'intelligenza artificiale. Essere in grado di utilizzare qualsiasi software progettato per gli esseri umani espande notevolmente gli scenari applicativi dell’intelligenza artificiale.
Fuori dallo schermo,
Astra inizia a controllare il robot
Non importa quanto scandalose fossero le demo precedenti, essenzialmente si svolgevano tutte sul computer.
Il test effettuato dal netizen Jay Chooi è stato diverso: hanno effettivamente collegato Astra al braccio robotico.
![]()
Uno dei compiti è far sì che il braccio robotico metta i blocchi in una ciotola. GPT-6 Astra è stato eseguito 20 volte e il tasso di successo ha raggiunto il 95%; il controllo Fable 5.1 era del 40%. Allo stesso tempo, il suo numero di token in uscita è solo circa il 16% di quest’ultimo, e il suo costo è solo circa il 43% di quest’ultimo.
Ancora più importante, non esiste alcuna dimostrazione o messa a punto di Astra per questa attività. Jay Chooi in seguito aggiunse specificamente che si trattava di un test a colpo zero. Il modello è responsabile di fornire la posizione e l'atteggiamento dell'effettore finale del braccio robotico e quindi di convertirlo in movimento del braccio robotico attraverso il risolutore automatico della cinematica inversa.
Con l'accelerazione della velocità di output dei token di grandi dimensioni, Jay Chooi prevede ottimisticamente che LLM sarà in grado di controllare il braccio robotico in tempo reale già alla fine di quest'anno e fino al 2029.

Yu Xiang, ex ricercatore presso NVIDIA, ha inoltre sottolineato che la prossima frontiera della robotica potrebbe riguardare l'utilizzo reale di modelli di intelligenza artificiale avanzati per il controllo. Usarli semplicemente come agenti per invocare moduli di percezione e pianificazione non è sufficiente. Abbiamo bisogno di nuovi modi per connettere questi modelli al mondo fisico.
![]()
Tali risultati incuriosiscono anche le persone. Cosa ha aggiunto OpenAI dopo la formazione per rendere il modello così versatile? Oppure c'è una svolta nella pre-formazione?
![]()
Stai ancora studiando?
Dopo aver letto questo articolo, alcune persone si sono lamentate del fatto che l'intelligenza artificiale non si accontenta più di generare un'immagine, ma ha iniziato a provare a "ricostruire il mondo".
![]()
Sorge spontanea una domanda: quando l'intelligenza artificiale sarà in grado di modellare, scrivere codice, utilizzare software e persino iniziare a entrare in contatto con il mondo fisico, quante delle competenze che abbiamo imparato così duramente oggi esisteranno ancora nella loro forma attuale?
![]()
Non esiste certamente una risposta a questa domanda ora. Ci sono ancora molte cose su Astra che sono instabili, rozze o addirittura inutilizzabili, ma ciò che è veramente inquietante ed emozionante in questi due giorni potrebbe essere proprio questo: per la prima volta, molte operazioni complesse che devono essere padroneggiate dagli esseri umani per impostazione predefinita sono diventate possibili per essere confezionate nel loro insieme per l'intelligenza artificiale.
Per quanto riguarda "dovrei ancora impararlo in futuro?", la risposta è sicuramente che devo ancora impararlo. È solo che potremmo dover ripensare a ciò che vale la pena imparare.
Commenti