Riassunto:
Mentre OpenAI e Anthropic continuano a lanciare nuove generazioni di modelli all'avanguardia, Google ha rilasciato ufficialmente il nuovo modello di punta dell'intelligenza artificiale Gemini 4 Argon, sperando di rientrare nella concorrenza del mercato dei modelli di fascia alta con capacità di ragionamento a lungo raggio più forti e prezzi più competitivi.

Google posiziona Gemini 4 Argon come un modello all'avanguardia per attività complesse a lungo termine, concentrandosi su aree quali lo sviluppo di software, il lavoro di conoscenza aziendale e la difesa della sicurezza della rete. Tuttavia, il modello non è ancora completamente aperto al pubblico. Verrà invece data priorità ai test di alcune organizzazioni di difesa della sicurezza della rete che partecipano al programma Google Fairwind, mentre continua il lavoro aggiuntivo di valutazione della sicurezza.
Rispetto alla precedente serie Gemini, uno degli aggiornamenti più importanti di Argon è il sostanziale aumento della capacità di produzione. Google ha aumentato la durata massima di output di una singola transazione dai precedenti 64.000 token a 1 milione di token. Ciò significa che il modello può completare processi di inferenza più lunghi in un unico ciclo di attività, eseguire progetti complessi di ingegneria del software, attività di ricerca ed elaborazione di flussi di lavoro su larga scala senza frequenti interruzioni e riavvii delle attività.
In termini di prestazioni, i risultati di numerosi test benchmark pubblicati da Google mostrano che Gemini 4 Argon supera GPT-6 Astra di OpenAI e Claude Opus 5.5 di Anthropic in diverse aree chiave. Tra questi, Argon ha ottenuto un punteggio del 77,9% nel test DeepSWE v1.1 che misura le capacità di ingegneria del software a lungo termine; un punteggio del 51,3% nel benchmark delle attività automatizzate Zapier AutomationBench; e un punteggio del 91,7% nel lungo test di capacità di comprensione dei video LVBench.

Google ha inoltre affermato che Argon si è classificato al primo posto anche nel test dell'indice Vals che valuta la capacità di attività economiche reali come la finanza, il diritto, la tassazione e lo sviluppo di software. Secondo i dati ufficiali, il modello ha superato GPT-6 Astra e Claude Opus 5.5 in una serie di importanti benchmark AI.
Oltre ai risultati di test esterni, Google ha rivelato che l'Argon è stato effettivamente utilizzato all'interno dell'azienda. Migliaia di dipendenti utilizzano il modello per completare attività quali programmazione, ricerca e documentazione. I casi applicativi citati da Google includono progetti di ingegneria come l'ottimizzazione degli algoritmi quantistici, l'ottimizzazione delle risorse di memoria dei data center e la migrazione di grandi basi di codice C e C++ nel linguaggio Rust.
La sicurezza informatica è una delle principali aree di rafforzamento di Argon. Google ha affermato che il modello può identificare, verificare e correggere autonomamente le vulnerabilità del software. Il team di sicurezza Wiz di Google ha utilizzato Argon per eseguire attività di ricerca sulla sicurezza attraverso il programma "Scan for Good". Nel test CWE-bench v1, utilizzato per valutare le capacità di risoluzione delle vulnerabilità, Argon ha ottenuto un punteggio del 68%, pari ai migliori del settore.
Per migliorare la competitività sul mercato, questa volta Google ha adottato una strategia di prezzo significativamente più aggressiva. Il prezzo iniziale di Gemini 4 Argon è di 2 dollari per 1 milione di token di input e di 10 dollari per 1 milione di token di output. Google offre anche uno sconto del 95% sulla memorizzazione nella cache dei contenuti di input. In confronto, il prezzo è significativamente inferiore a quello attualmente addebitato da alcuni modelli concorrenti di fascia alta.
Sebbene prestazioni e prezzo abbiano dimostrato una forte competitività, questa volta Google ha scelto di procedere con cautela con il ritmo di implementazione. La società ha dichiarato che Gemini 4 Argon continuerà a fornire servizi in modo limitato fino a quando non saranno completati ulteriori test e verifiche di sicurezza e un successivo calendario per un'apertura più ampia non è stato ancora annunciato.
Commenti