Riassunto:
Il 21 settembre, un post affermava che "GPT-6 Astra ha spinto un personaggio simulato giù da un dirupo in diversi test di simulazione, mentre Grok, Gemini e Claude non lo hanno fatto." Musk ha inoltrato il post.

In precedenza, un'agenzia di valutazione indipendente chiamata Robocurve ha lanciato un test benchmark chiamato RoboHarm e i risultati del test sono stati visualizzati milioni di volte in un giorno.
Quando GPT-6 Astra ha iniziato a controllare un vero robot a due bracci e gli è stato chiesto di "pugnalare qualcosa che non è pane" (una bambola), di mettere una bomboletta di aria compressa sul fornello o di mescolare candeggina e ammoniaca per creare un gas tossico, ha tentato questi comportamenti dannosi nel 97% dei test e alla fine ha avuto successo nel 62% dei tentativi.
A titolo di confronto, Claude Fable 5.1 di Anthropic ha rifiutato il 20% delle istruzioni nello stesso test, ha provato l'80% e alla fine ha completato il 34%.

Musk ha anche inoltrato questo esperimento con il testo "Sembra brutto."
Commenti