Il CEO di Qualcomm suggerisce che entro il 2028 potrebbero essere disponibili modelli linguistici su larga scala in grado di gestire 100 miliardi di parametri

📅 2026-10-11

Riassunto:

Alcune importanti aziende di intelligenza artificiale stanno promuovendo l'industria della telefonia mobile per sviluppare dispositivi in ​​grado di eseguire continuamente modelli linguistici di grandi dimensioni con 100 miliardi di parametri, con un obiettivo temporale che punta al 2028. Tuttavia, questa idea deve affrontare due sfide pratiche: in primo luogo, l'esecuzione di un modello così grande richiede una grande quantità di memoria e, in secondo luogo, i data center di intelligenza artificiale competono per la capacità di produzione di memoria globale, con conseguente scarsità di memoria di livello consumer e continui aumenti dei prezzi.

Il CEO di Qualcomm, Amon, ha dichiarato in un'intervista a Fireside Alpha che alcune aziende all'avanguardia nel settore dell'intelligenza artificiale stanno esplorando telefoni cellulari in grado di eseguire continuamente centinaia di miliardi di modelli di parametri. Non ha rivelato i nomi specifici di queste società, ma le dichiarazioni pertinenti mostrano che le aspettative delle società di intelligenza artificiale per i dispositivi mobili stanno cambiando: in futuro, i telefoni cellulari potrebbero non essere più solo terminali che occasionalmente chiamano servizi di intelligenza artificiale nel cloud, ma dispositivi di personal computing in grado di eseguire continuamente modelli di grandi dimensioni a livello locale e gestire attivamente le attività.

Tuttavia, la dichiarazione di Amon riguardava più la descrizione degli obiettivi proposti dai clienti del settore piuttosto che la roadmap del prodotto annunciata ufficialmente da Qualcomm. Al momento Qualcomm non ha ancora fornito una soluzione hardware completa in grado di raggiungere questo obiettivo nel 2028, né ha promesso che entro quella data lancerà sul mercato un telefono cellulare con le funzionalità corrispondenti.

Da un punto di vista tecnico, il modello da 100 miliardi di parametri presenta requisiti molto più elevati per l'hardware del telefono cellulare rispetto ai modelli di intelligenza artificiale attualmente comuni sui dispositivi. I parametri di un modello linguistico di grandi dimensioni determinano il gran numero di valori che il modello deve salvare e richiamare e questi dati di solito devono essere archiviati in memoria in modo che il processore possa accedervi rapidamente durante l'inferenza.

Prendiamo come esempio un modello con 100 miliardi di parametri. Se viene utilizzata la quantizzazione a 4 bit, ogni parametro richiede teoricamente solo 4 bit di archiviazione, quindi solo i parametri del modello richiedono circa 50 GB di memoria. Nel funzionamento effettivo, lo spazio deve essere riservato anche al sistema operativo, ad altre applicazioni, alla cache di contesto e ai dati temporanei durante l'inferenza. Pertanto, 50 GB non rappresentano la capacità di memoria completa richiesta da un telefono cellulare per far funzionare il modello senza problemi.

Se il modello viene ulteriormente quantizzato a 2 bit, ogni parametro richiede solo 2 bit e il requisito di archiviazione teorico per i parametri del modello può essere ridotto a circa 25 GB. Tuttavia, questa soluzione richiede ancora che i telefoni cellulari abbiano una capacità di memoria di gran lunga superiore a quella degli attuali prodotti tradizionali, e una quantizzazione a precisione estremamente bassa può danneggiare in modo significativo la qualità di output del modello, soprattutto in compiti di inferenza complessi.

Va notato che il numero di parametri non determina direttamente le piene capacità del modello. I dati di addestramento, l'architettura, i metodi di addestramento e le tecniche di inferenza di diversi modelli influenzeranno tutti le prestazioni finali. È del tutto possibile che un modello piccolo e ottimizzato superi un modello più grande in un compito specifico. Pertanto, anche se per il momento il cellulare non può eseguire direttamente il modello da 100 miliardi di parametri, ciò non significa che non possa fornire un'esperienza d'uso reale vicina a quella di un modello di grandi dimensioni.

Attualmente esiste ancora un netto divario tra la configurazione della memoria degli smartphone e la capacità richiesta da centinaia di miliardi di modelli di parametri. In passato, alcuni telefoni Android di punta fornivano una memoria LPDDR5X da 24 GB. Tuttavia, con la scarsità di memoria e l'aumento dei prezzi, i produttori di telefoni cellulari hanno iniziato a rivalutare il valore commerciale delle versioni ad alta memoria. Per i consumatori comuni, l’aumento della capacità di memoria significa costi hardware più elevati ed è difficile per i produttori di telefoni cellulari determinare se gli utenti sono disposti a pagare un extra per l’esecuzione di modelli di IA locali più grandi.

Ciò crea una contraddizione: le società di intelligenza artificiale sperano che i telefoni cellulari dispongano di capacità di elaborazione locale sempre più potenti, ma la memoria necessaria per raggiungere questo obiettivo sta diventando sempre più costosa e difficile da ottenere.

L'offerta di memoria globale è scarsa, il che è strettamente correlato alla rapida espansione dei data center di intelligenza artificiale. Le grandi aziende tecnologiche continuano a investire in server AI, che richiedono grandi quantità di DRAM, memoria a larghezza di banda elevata e dispositivi di archiviazione ad alta velocità. I produttori di memorie prestano sempre più attenzione anche ai prodotti legati all'intelligenza artificiale con una forte domanda e profitti più elevati nell'organizzazione della produzione. La memoria tradizionale richiesta per le apparecchiature elettroniche di consumo è quindi sotto pressione.

Sebbene la DRAM a basso consumo utilizzata negli smartphone e la memoria a larghezza di banda elevata utilizzata negli acceleratori di intelligenza artificiale siano diverse nella struttura del prodotto e nei requisiti di produzione, sono comunque influenzati dai cambiamenti nell'allocazione della capacità produttiva e nella domanda e offerta di mercato nell'intero settore dei semiconduttori. Quanto più forte sarà la domanda di memoria da parte delle infrastrutture di intelligenza artificiale, tanto più difficile sarà per i produttori di elettronica di consumo mantenere le condizioni precedenti in termini di prezzo e offerta.

Questa pressione si è riflessa sui costi di produzione dei telefoni cellulari. Un’analisi pubblicata in precedenza dalla società di ricerche di mercato Counterpoint Research ha mostrato che nel secondo trimestre del 2026, i prezzi delle memorie per smartphone sono aumentati di oltre l’80% rispetto al trimestre precedente. Tra i telefoni cellulari di diverse fasce di prezzo, l'aumento dei costi della memoria ha un impatto significativo sui costi complessivi dei materiali.

Counterpoint ha sottolineato che il costo della distinta base dei telefoni cellulari di fascia media è aumentato di circa il 52% su base annua e che la memoria rappresentava circa il 40% del costo complessivo della distinta base. Anche i telefoni cellulari di fascia alta sono stati colpiti e la DRAM ha addirittura superato i chip a livello di sistema, diventando il componente singolo più costoso in alcuni telefoni cellulari di punta.

Ciò significa che i produttori di telefoni cellulari non devono solo considerare se hanno la capacità di configurare 50 GB o più di memoria per 100 miliardi di modelli di parametri, ma devono anche rispondere a una domanda più realistica: i consumatori sono disposti a pagare per queste memorie?

Se solo per utilizzare modelli di grandi dimensioni, la memoria del telefono cellulare deve essere aumentata dagli attuali 12 GB o 16 GB a 64 GB o anche di più, e il costo dell'intera macchina potrebbe aumentare in modo significativo. Insieme a processori più potenti, packaging avanzato e design termico, il prezzo del prodotto finale potrebbe essere più lontano dalla gamma accettabile per i consumatori ordinari.

Qualcomm e Apple stanno cercando di alleviare questo problema in termini di architettura dei chip e tecnologia di packaging. Rapporti correlati menzionano che Apple A20 Pro e la piattaforma di punta Snapdragon di nuova generazione di Qualcomm stanno esplorando progetti di chip e metodi di organizzazione della memoria che siano più favorevoli al funzionamento di modelli di grandi dimensioni, sperando di migliorare l'efficienza di accesso ai dati e ridurre il sovraccarico di trasmissione dei dati tra il processore e la memoria.

Tuttavia, migliorare l'incapsulamento e l'efficienza dell'accesso ai dati non significa che i requisiti di memoria fisica scompariranno automaticamente. Anche se il processore può utilizzare la memoria in modo più efficiente, il modello da 100 miliardi di parametri deve comunque salvare molti dati dei parametri. Per rendere modelli di questa scala realmente adattabili ai telefoni cellulari, l’industria potrebbe aver bisogno di compiere ulteriori progressi nella compressione dei modelli, nell’architettura di inferenza e nell’accesso allo spazio di archiviazione.

Una possibile soluzione è una tecnologia di quantificazione più radicale. Riducendo il numero di bit utilizzati per parametro, il modello può essere eseguito in uno spazio di memoria più piccolo. Tuttavia, la quantificazione non è priva di costi. Per le attività che richiedono un ragionamento logico complesso, una precisione numerica troppo bassa può portare a un significativo degrado delle prestazioni del modello. Pertanto, come trovare un equilibrio tra utilizzo della memoria e qualità del modello diventerà un’importante direzione di ricerca per l’IA end-side.

Un'altra soluzione è il modello esperto ibrido, ovvero l'architettura MoE. A differenza delle tradizionali architetture intensive che richiedono di chiamare l'intero modello per ogni inferenza, il modello MoE seleziona parte della rete di esperti per partecipare ai calcoli basati su compiti specifici. Con una progettazione adeguata, è necessario attivare solo un piccolo insieme di parametri nel modello ogni volta che viene elaborato un token.

Se viene ulteriormente adottata la tecnologia di scaricamento degli esperti, il sistema può conservare gli esperti attualmente necessari nella DRAM e archiviare gli esperti che non sono necessari temporaneamente nella memoria flash. Quando sono necessari altri esperti per il processo di inferenza, i dati rilevanti vengono letti dalla memoria flash alla memoria.

Questo approccio può ridurre la quantità di dati che il modello deve risiedere contemporaneamente nella DRAM, ma a scapito di un maggiore accesso allo spazio di archiviazione e di un sovraccarico di trasferimento dei dati. La velocità di accesso e le caratteristiche di latenza della memoria flash UFS utilizzata nei telefoni cellulari sono significativamente diverse dalla DRAM. Se il modello legge frequentemente i parametri dalla memoria flash, la velocità di inferenza potrebbe risentirne.

Apple ha anche studiato in precedenza la soluzione di utilizzare la memoria integrata del dispositivo per eseguire modelli linguistici di grandi dimensioni. Si prevede che questo tipo di tecnologia riduca la dipendenza dalla capacità della DRAM, ma se sarà in grado di raggiungere una latenza sufficientemente bassa, un throughput elevato e un consumo energetico accettabile sui telefoni cellulari richiede ancora ulteriori verifiche.

Inoltre, il funzionamento continuo di modelli di grandi dimensioni causerà anche problemi di dissipazione del calore e di durata della batteria. Lo spazio interno dei telefoni cellulari è limitato e non possono essere dotati di sistemi di raffreddamento su larga scala come computer desktop o server. Se il processore esegue un'inferenza AI ad alta intensità per un lungo periodo, la temperatura del chip potrebbe continuare ad aumentare, attivando successivamente il meccanismo di riduzione della frequenza, con conseguente degrado delle prestazioni.

Questo problema è particolarmente grave per gli agenti che devono operare 24 ore su 24. I chatbot tradizionali di solito iniziano a elaborare le attività dopo che l’utente ha effettuato una richiesta, ma la nuova generazione di agenti IA potrebbe dover monitorare continuamente le informazioni, analizzare il contesto ed eseguire in modo proattivo le operazioni al momento opportuno. Se il telefono deve far funzionare modelli di grandi dimensioni 24 ore su 24, non solo la memoria deve essere sempre disponibile, ma anche il consumo energetico del processore e il consumo della batteria devono essere strettamente controllati.

Pertanto, anche se un futuro telefono cellulare potrà caricare con successo un modello da 100 miliardi di parametri, ciò non significa che possa continuare a funzionare alla velocità ideale. Se il modello può veramente risiedere nella memoria, quante parole può elaborare al secondo, quanto calore genera durante il funzionamento e quanto impatto ha sulla durata della batteria sono tutti indicatori importanti per misurare il valore d’uso effettivo.

Rispetto al collegamento diretto di un modello da 100 miliardi di parametri a un telefono cellulare, una soluzione più realistica potrebbe essere quella di eseguire un modello distillato e ottimizzato di medie dimensioni.

La distillazione del modello di solito sfrutta le capacità di un modello di grandi dimensioni per addestrare un modello più piccolo, in modo che quest'ultimo possa mantenere il più possibile le prestazioni del modello di grandi dimensioni in un'attività specifica mentre la scala dei parametri è significativamente ridotta. Wccftech ritiene che un modello di parametri adeguatamente distillato da 20 a 30 miliardi possa avvicinarsi alle prestazioni di un modello da 100 miliardi di parametri su determinati compiti, ed è quindi più adatto a diventare la forza principale dell'intelligenza artificiale locale nei futuri smartphone.

Il vantaggio di questa soluzione è che non deve fare affidamento su una capacità di memoria estremamente ampia e ha l'opportunità di fornire capacità di ragionamento piuttosto potenti. Per i produttori di telefoni cellulari, invece di perseguire semplicemente quanti parametri possono essere soddisfatti, è meglio ottenere una migliore esperienza reale con risorse hardware limitate attraverso l’architettura del modello, la quantificazione, la distillazione e l’ottimizzazione dell’inferenza.

Naturalmente, le prestazioni dei diversi modelli variano notevolmente e un modello da 20 a 30 miliardi di parametri non può sostituire il modello da 100 miliardi di parametri in tutte le attività. Capacità come il ragionamento complesso, la competenza e l'elaborazione di contesti lunghi dipendono ancora dalla formazione e dalla progettazione dell'architettura di modelli specifici. Ma dal punto di vista della produzione, essere in grado di completare la maggior parte delle attività quotidiane con un consumo energetico e un costo ragionevoli può essere più prezioso che perseguire la pura scala dei parametri.

La dichiarazione del CEO di Qualcomm riflette anche che il settore degli smartphone è alla ricerca di nuove direzioni di crescita. Poiché i vantaggi marginali degli aggiornamenti hardware tradizionali diminuiscono gradualmente, i produttori di telefoni cellulari sperano di utilizzare agenti di intelligenza artificiale per ridefinire il modo in cui vengono utilizzati i dispositivi.

I futuri smartphone potrebbero non essere più solo dispositivi in ​​attesa che gli utenti aprano applicazioni e inseriscano comandi, ma piuttosto assistenti personali in grado di comprendere continuamente le esigenze, organizzare attività e chiamare diversi servizi nell'ambito dell'autorizzazione dell'utente. Tali sistemi richiedono capacità di ragionamento locale più forti, nonché una gestione della memoria più efficiente, un calcolo a basso consumo e meccanismi di sicurezza.

Tuttavia, esiste ancora una distanza tra gli obiettivi del settore e il prodotto finale. Amon non ha annunciato il nome della specifica azienda partner, né ha fornito una roadmap completa dell'hardware o un programma di produzione di massa. Il 2028 è più adatto per essere inteso come il tempo target in cui alcune aziende di intelligenza artificiale sperano di raggiungere questa capacità, piuttosto che la data di rilascio del prodotto confermata da Qualcomm.

A giudicare dalle attuali condizioni tecniche, non è del tutto impossibile che i telefoni cellulari possano eseguire centinaia di miliardi di modelli di parametri nel 2028, ma il metodo di implementazione potrebbe essere diverso da quello che si immagina "caricando tutti i modelli completi nella memoria del telefono cellulare". Una quantizzazione più aggressiva, l'architettura MoE, l'offloading esperto, la progettazione della memoria dedicata e la distillazione del modello possono tutti contribuire al raggiungimento dell'obiettivo.

Allo stesso tempo, l'offerta globale di memoria e l'andamento dei prezzi influenzeranno direttamente la fattibilità commerciale di questa direzione. Se la fornitura di DRAM di livello consumer verrà ridotta a lungo dai data center AI, anche se fosse tecnicamente possibile produrre telefoni cellulari con 64 GB o più di memoria, i produttori potrebbero non essere disposti a lanciare tali prodotti su larga scala.

Pertanto, la visione di Qualcomm di un telefono cellulare da 100 miliardi di parametri deve davvero essere soddisfatta non solo in termini di prestazioni del chip, ma anche nell'equilibrio globale tra dimensioni del modello, capacità di memoria, costi di produzione, dissipazione del calore, durata della batteria e domanda dei consumatori. Per gli utenti comuni, la cosa più interessante in futuro potrebbe non essere se il telefono cellulare sarà in grado di eseguire un modello con 100 miliardi di parametri, ma se sarà in grado di fornire servizi IA locali affidabili, veloci e veramente utili senza aumentare significativamente il prezzo o sacrificare seriamente la durata della batteria.

Tag correlati

Articoli correlati

Commenti

0/500
Captcha (click to refresh)
Nessun commento