Riassunto:
xAI, la società di intelligenza artificiale di Musk, ha rilasciato ufficialmente Grok 4.7, una nuova generazione di modelli di grandi dimensioni, e lo ha posizionato come il modello di programmazione e di lavoro della conoscenza più potente attualmente. L'azienda ha affermato che il nuovo modello non solo migliora le capacità di elaborazione di compiti complessi, ma mantiene anche la stessa velocità operativa e il sistema di prezzi dei prodotti della generazione precedente e compete sul mercato a costi inferiori.

Secondo le informazioni rilasciate da xAI, Grok 4.7 adotta un nuovo modello di base su scala più ampia ed esegue un'ottimizzazione dell'apprendimento per rinforzo più lunga durante il processo di addestramento. Rispetto alle versioni precedenti, il nuovo modello è esposto a compiti di formazione più complessi, con un gran numero di compiti progettati per durare diverse ore per essere completati. Ciò consente al modello di ottenere miglioramenti significativi nel ragionamento a lungo termine, nell’autoverifica e nella gestione delle attività complesse.
xAI ha affermato che uno dei maggiori cambiamenti in Grok 4.7 è la sua maggiore "capacità di autotest". I modelli possono controllare in modo più proattivo il proprio output quando rispondono a domande, scrivono codice ed eseguono compiti di conoscenza complessi, riducendo così i tassi di errore e migliorando l'affidabilità dei risultati finali.
Allo stesso tempo, è stata migliorata anche la capacità del nuovo modello di gestire contesti estremamente lunghi. Di fronte a documenti di grandi dimensioni, molteplici cicli di attività e progetti di lunga durata, Grok 4.7 può mantenere capacità di gestione delle informazioni più stabili senza evidente degrado delle prestazioni man mano che il contesto cresce come alcuni modelli tradizionali.
Al fine di migliorare ulteriormente l'esperienza lavorativa reale, xAI addestra appositamente Grok 4.7 a comprendere in modo nativo il framework operativo Grok Bot. Ciò significa che non è adatto solo per scenari di domande e risposte singole, ma anche più adatto per partecipare a flussi di lavoro come agente intelligente a lungo termine. L'azienda ritiene che ciò migliorerà le prestazioni del modello nel lavoro di conoscenza generale, nelle conversazioni continue e nelle attività a livello aziendale.
Oltre alle funzionalità di programmazione, Grok 4.7 è dotato anche di funzionalità più potenti per la creazione di documenti e presentazioni. I funzionari hanno affermato che il modello è ora in grado di generare meglio report professionali, documenti aziendali e materiali di presentazione e spera di espandere ulteriormente il suo ambito di applicazione nel campo dell'automazione degli uffici.
In termini di prestazioni, xAI ha annunciato una serie di risultati di test interni.
Nel test CursorBench 4.0, utilizzato per valutare le capacità di ingegneria del software a lungo termine, Grok 4.7 ha ottenuto un punteggio del 46,3%, che è stato significativamente migliorato rispetto al 40,4% di Grok 4.6. Nel test di ingegneria del software DeepSWE, il nuovo modello ha ottenuto un punteggio del 71%, continuando a mantenere un livello competitivo vicino ai prodotti leader del settore.
Nel test EEBench nel campo dell'ingegneria elettronica, Grok 4.7 ha ottenuto un punteggio del 64%, con un aumento di oltre dieci punti percentuali rispetto alla generazione precedente. Per le attività d'ufficio che comportano una grande quantità di conoscenze professionali e flussi di lavoro complessi, anche le prestazioni del modello nel test AA Briefcase sono migliorate.
In termini di analisi legale, Grok 4.7 ha ottenuto il 19,6% nel test Harvey Legal Agent Benchmark, un ulteriore miglioramento rispetto al prodotto della generazione precedente. Nel campo del ragionamento medico, anche i punteggi di HealthBench Professional sono migliorati dal 48,5% al 56,7%.
Nel campo del lavoro di cultura generale, xAI ha sottolineato in particolare i due risultati della valutazione di GDPval e AA Briefcase. L'azienda ritiene che questi test siano più vicini al reale contenuto lavorativo di professionisti come avvocati, infermieri e analisti finanziari, e Grok 4.7 ha raggiunto il livello competitivo degli attuali modelli all'avanguardia in questi scenari.



Il prezzo è un altro importante punto di forza di questa versione.

Secondo i dati ufficiali, il prezzo di ingresso di Grok 4.7 rimane pari a 2 dollari USA per milione di token e il prezzo di uscita è di 6 dollari USA per milione di token, in linea con Grok 4.6. Rispetto ad alcuni modelli all'avanguardia che spesso costano diverse volte o addirittura dieci volte di più, xAI sottolinea che Grok 4.7 può completare compiti di livello simile a un costo inferiore.
L'azienda la descrive addirittura come una soluzione che "fornisce prestazioni competitive a circa la metà del prezzo dei modelli dello stesso livello", sperando di espandere ulteriormente la quota di mercato con il vantaggio in termini di costi.
In termini di sicurezza, xAI ha affermato che Grok 4.7 adotta un sistema di protezione della sicurezza recentemente ricostruito. Secondo i risultati dei test interni, il nuovo modello ha raggiunto il miglior livello della serie Grok in termini di rifiuto di richieste pericolose, resistenza agli attacchi di jailbreak e identificazione di contenuti ad alto rischio.
In particolare in settori sensibili come la sicurezza informatica e la biosicurezza, i modelli sono progettati per aiutare ad affrontare compiti difensivi legittimi negando usi pericolosi o dannosi. I dati ufficiali mostrano che Grok 4.7 ha ottenuto prestazioni di primo piano in alcuni test sui rischi per la sicurezza della rete e valutazioni di biosicurezza.
Attualmente, Grok 4.7 è stato aperto agli utenti tramite API e piattaforma Grok. Gli sviluppatori possono chiamare questo modello per la programmazione, le domande e risposte sulla conoscenza, la scrittura di documenti e lo sviluppo di applicazioni con agenti intelligenti.
Con il lancio ufficiale di Grok 4.7, xAI ha ulteriormente accelerato il ritmo dell'iterazione del prodotto. Dal rilascio di Grok 4.5 nel luglio di quest'anno, al lancio di Grok 4.6 in agosto, e ora Grok 4.7, xAI ha completato tre importanti aggiornamenti in meno di tre mesi. Per il mercato fortemente competitivo dell’intelligenza artificiale, Grok 4.7 non è solo un aggiornamento regolare, ma mostra anche l’intenzione strategica di xAI di sfidare i leader del settore attraverso iterazioni più veloci, prezzi più bassi e capacità di lavoro più forti.
Commenti