Riassunto:
Colpito dalla continua e scarsa fornitura di DRAM, il settore dell'intelligenza artificiale si sta spostando da "potenza di calcolo limitata" a "memoria limitata". Secondo i rapporti, Google ha iniziato a smantellare i server dismessi, a riciclare i moduli di memoria DDR4 che possono ancora essere utilizzati e a riutilizzarli in alcuni server AI di nuova costruzione, stabilendo gradualmente una catena di approvvigionamento interna di riciclo della memoria.

Nikhil Cherian, direttore senior delle infrastrutture della catena di fornitura di Google, ha recentemente rivelato in un forum che la memoria ad alte prestazioni rappresenta attualmente circa il 75% del costo della distinta base di un server AI. Per superare il collo di bottiglia della memoria, Google sta promuovendo soluzioni sia a livello software che hardware, compreso lo smantellamento dei server dismessi e il riciclaggio di componenti utilizzabili.
Google ha anche adattatori hardware appositamente progettati per consentire la connessione delle generazioni precedenti di soluzioni di memoria come DDR4 ai server AI di nuova generazione. Cherian ha anche ammesso che Google rimpatrierà appositamente alcuni server ritirati solo per rimuovere i moduli di memoria DDR4.
Allo stesso tempo, Google continua a ottimizzare la libreria di funzioni sottostanti, l'architettura del modello e la tecnologia di compressione della cache KV per ridurre la capacità di memoria richiesta per unità di potenza di calcolo.
Quest'anno Google ha lanciato due versioni ASIC TPU, di cui TPU8t viene utilizzato principalmente per l'addestramento dei modelli AI, mentre TPU8i è ottimizzato per attività di inferenza. Per eliminare i colli di bottiglia delle prestazioni, TPU8i adotta un design di memoria multistrato altamente personalizzato.
Ogni chip TPU 8i è dotato di memoria HBM3e da 288 GB, che può fornire una larghezza di banda di memoria ultraelevata di 8,6 TB al secondo. Il chip integra inoltre 384 MB di SRAM su chip per archiviare una cache di valori-chiave attiva per evitare l'accesso frequente alla memoria di sistema esterna.
Nella parte host del server, il server TPU 8i annulla completamente il tradizionale processore principale x86 e utilizza il processore Axion personalizzato di Google basato sull'architettura Arm. Il processore Axion si basa sull'architettura di memoria DDR5 ad alta velocità ed è principalmente responsabile delle attività a livello host come la preelaborazione dei dati.
Tuttavia, in base all'ultima dichiarazione di Cherian, sembra che Google abbia utilizzato la memoria DDR4 più vecchia in alcuni nuovi server AI per sostituire i moduli DDR5 che originariamente avrebbero dovuto esserne equipaggiati. La gamma specifica di server e il numero di moduli DDR4 coinvolti non sono ancora stati resi noti.
Commenti