Riassunto:
Riesci a credere che la produzione del primo chip di OpenAI abbia effettivamente sconfitto l'intera serie NVIDIA? ! Proprio ora, il primo chip sviluppato internamente da OpenAI, Jalapeño, ha consegnato il primo lotto di risultati misurati: prestazioni di inferenza AI, superando completamente NVIDIA GB200 e GB300.


Decolla direttamente alla velocità misurata!
Jalapeño può emettere 1.459 token in un secondo, mentre Nvidia GB200 può emettere solo 535 token, ovvero meno della metà.
"Pepper" impiega solo 1,65 secondi per completare un'attività, ma impiega quasi 6 secondi per GB300, una differenza di 3,6 volte.
La cosa più crudele è che anche se GB300 viene costretto alla massima velocità di decodifica, il throughput di Jalapeño è comunque 104,3 volte superiore.
Il consumo energetico nominale di Jalapeño è di soli 700 W, mentre quello di GB300 è di 1400 W, ovvero esattamente la metà.
Il famoso analista di semiconduttori Dylan Patel ha addirittura affermato duramente: "Non è solo Blackwell ad essere stato rovesciato, anche il chip Rubin di Nvidia è stato superato"!

Per un certo periodo, l'intero circolo dell'IA è esploso. I netizen si sono meravigliati del fatto che OpenAI fosse così pazzesco che anche Nvidia fosse stata sconfitta.
L'affermazione di Ultraman era autoritaria ma contenuta: "Abbiamo creato un chip, è ridicolmente veloce"!


01
Un "peperoncino" ha ribaltato l'ammiraglia di Nvidia
Non è OpenAI che parla di se stessa.
SemiAnalysis è andato in laboratorio per effettuare misurazioni effettive e la conclusione che hanno scritto è——
Jalapeño ha sconfitto ogni chip Nvidia, AMD e Google testato in precedenza.
Quanto è grande la differenza? L'ultima Vera Rubin di Nvidia consuma abbastanza elettricità per nutrire quasi tre Jalapeños.

Durante il test, OpenAI ha selezionato tre modelli pubblici da eseguire: GPT-OSS 120B e un modello 670B e 1T.
Questa serie di test copre le architetture MoE con parametri da un valore medio a un trilione. I risultati complessivi sono i seguenti:
Il carico di lavoro dell'IA per watt è aumentato di 1,5-1,9 volte
Latenza end-to-end ridotta di 1,7–3,6 volte
Miglioramento delle prestazioni di 2,1–4,1 volte su carichi di lavoro altamente interattivi

I 1459 token menzionati in precedenza sono stati misurati su GPT-OSS 120B.
Convertito nell'intervallo di parole, ci sono solo 0,69 millisecondi tra i due token.
Una persona normalmente legge circa cinque o sei parole in un secondo, ma ne emette 1.459 parole in un secondo. Gli occhi non riescono a tenere il passo e lo schermo non riesce a leggerli.

Il verde è Jalapeño, il blu è il più forte disponibile. I tre modelli sono rispettivamente 2,7 volte, 4,1 volte e 3,8 volte più veloci
L'intervallo di quattro secondi tra 1,65 e 5,99 secondi può essere tollerato in chat, ma è un'altra questione quando viene utilizzata su un agente, perché un'attività richiede dozzine di passaggi consecutivi, quindi la differenza deve essere moltiplicata.
Poi si disse che l'intera rete ruotava 104,3 volte.
Ciò che significa esattamente è che spingendo GB300 alla massima velocità di decodifica, ovvero 169 token al secondo, a quel punto il throughput di Jalapeño è 104,3 volte superiore.
Questa tendenza è vera per i tre modelli, con GPT-OSS che raggiunge 53,7 volte e il modello 1T che raggiunge 56,1 volte.


Per lo stesso modello, all'aumentare della velocità di produzione delle parole richiesta, il margine iniziale aumenta da 1,7 volte a 104,3 volte
In altre parole, il punto in cui l'avversario raggiunge il limite e inizia ad ansimare è esattamente dove sta ancora navigando con calma.
Se i valori di picco vengono calcolati in base ai rispettivi migliori punti di lavoro, la differenza sarà molto più lieve, rispettivamente 1,9 volte, 1,7 volte e 1,5 volte per i tre modelli.

Ciò che crea davvero distanza è la scena ad alta interazione

L'asse orizzontale dell'immagine a sinistra è la velocità di output della parola, mentre l'asse orizzontale dell'immagine a destra è il ritardo della richiesta completa. Il Jalapeño verde preme il GB200 blu su tutta la curva
SemiAnalysis prende in considerazione l'alimentazione, la dissipazione del calore e la rete, quindi li distribuisce su ciascun chip.
Di conseguenza, Jalapeño ha 1,125 kilowatt per unità, GB200 ha 1,87 kilowatt e Vera Rubin ha 3,3 kilowatt.
Quando si esegue GPT-OSS a questo calibro, Jalapeño emette circa 53 milioni di token per megawatt al secondo, mentre GB200 NVL72 ne emette solo circa 10 milioni.

Quello viola è Jalapeño, l'asse orizzontale è la velocità di interazione e l'asse verticale è il numero di gettoni sputati per megawatt al secondo
In termini di costi, il costo totale di proprietà per ora di chip è di 1,56 dollari per Jalapeño, che è quasi uguale a 1,55 dollari per H100, mentre Vera Rubin è di 3,61 dollari.

Il verde è Vera Rubin, il viola è Jalapeño. Dopo 200 gettoni al secondo, il viola è arrivato fino a un punto fuori dalla portata del verde
La cosa più terribile è che questi risultati non rappresentano tutta la forza di Jalapeño.
Non consente nemmeno la decodifica speculativa e la previsione dei token, né esegue la distribuzione separata di precompilazione e decodifica. Tuttavia, ogni altro chip nell'immagine esegue la propria configurazione ottimale e nessuna delle ottimizzazioni che dovrebbero essere abilitate viene tralasciata.
SemiAnalysis stima che la sola decodifica speculativa possa ridurre il costo per token di oltre 2/3.

Un Jalapeño può anche eseguire il "Doom Slayer"
02
In nove mesi, GPT‑Astra ha lavorato fino alla sala di registrazione
Per un progetto del genere, ci sono voluti solo nove mesi dalla progettazione alla realizzazione di OpenAI. In confronto, un intervallo di tempo comune nel settore è di 18-36 mesi.
Tutti coloro che hanno svolto l'ASIC sanno che il lavoro più estenuante in questo ciclo è la verifica. La simulazione deve essere ripetuta più e più volte e, se cambi posto, devi ricominciare tutto da capo.
Il motivo per cui OpenAI può "imbrogliare" è perché invita il suo modello più potente nella stanza di registrazione——
Il modello che ha contribuito a sviluppare Jalapeño si chiama GPT-Astra, che è il GPT-6 di cui si vocifera nel mondo esterno!


Durante l'intero processo, GPT-Astra è diventato sostanzialmente il supporto più forte del team.
Aiuta a esplorare soluzioni di implementazione, stringe a morte l'intero circolo "progettazione-misurazione-verifica" e micromanipola anche i circuiti aritmetici.
In che misura viene praticata la microgestione? Le cifre ricavate da SemiAnalysis indicano che la progettazione assistita dall'intelligenza artificiale riduce l'area dell'unità SIMD dell'8% e l'area del motore della matrice del 10%.
Allo stesso tempo, questi moduli sono migliori della prima versione in termini di tempistica e consumo energetico.

Il die di elaborazione è al centro, con tre HBM4 su ciascun lato e quello superiore è il chip I/O
Il die di calcolo principale è di circa 840 millimetri quadrati e il limite della maschera della macchina per litografia EUV è di 858 millimetri quadrati. Questo pezzo di silicio è a soli 18 millimetri quadrati dal soffitto fisico.
Si può dire che l'area in cui la macchina fotolitografica può essere utilizzata per disegnare è praticamente occupata e non lascia nulla.

La riga rosa è Jalapeño e le tre colonne più a destra sono larghezza di banda HBM per watt, FLOP per watt e rapporto potenza di calcolo/larghezza di banda
In termini di larghezza di banda HBM per watt, Jalapeño è 22, Rubin al secondo posto è 11,1 e GB300 è solo 5,71. È esattamente il doppio del secondo posto.
I FLOP per watt sono 19,1 e quelli di Rubin sono 19,4. I due sono quasi alla pari, ma il Rubin brucia più di 1.800 watt, mentre il Jalapeño brucia solo 700 watt.
Si esegue solo con passaggi A0. B0 è già in produzione e le sue prestazioni per watt sono superiori di circa il 25% rispetto a A0.
In questo modo, basandosi sulla potente combinazione di Codex e GPT-Astra, OpenAI ha trasformato in soli due mesi tre modelli open source che non erano stati originariamente pianificati in uno stato ad alte prestazioni.
Ciò che è ancora più spaventoso è che nei moduli "Attenzione" e MoE più affamati di prestazioni, il codice digitato dall'intelligenza artificiale viene eseguito da 1,5 a 1,8 volte più velocemente dei migliori esperti umani.
L'intelligenza artificiale progetta il chip, il chip esegue l'intelligenza artificiale e l'intelligenza artificiale torna indietro per ottimizzare l'intelligenza artificiale sul chip.
Questo volano, OpenAI, sta già girando.


Fossato CUDA, morto?
Il fossato più profondo di NVIDIA è sempre stato CUDA.
Lo stack software accumulato negli ultimi vent'anni ha coltivato la memoria muscolare degli ingegneri di tutto il mondo. Ogni volta che l'hardware viene cambiato, devono smontarlo e ricominciare tutto da capo.
SemiAnalysis ha espresso un giudizio molto pesante nell'articolo, affermando che il fossato del CUDA potrebbe essere morto.

Il motivo è la velocità.
Hanno anche aggiunto un paragone ancora più straziante: Rubin di Nvidia ha effettivamente completato il tapeout di CoWoS un mese prima di Jalapeño.
Ma fino ad ora, gli unici risultati Rubin che il mondo esterno può vedere sono i dati provenienti dai campioni tecnici CoreWeave. Nvidia non mette terze parti in laboratorio per test casuali come OpenAI.
Quindi il problema sta nella velocità con cui si avvia il software. Non c'è niente di sbagliato nell'hardware stesso di NVIDIA.
Partire da zero dà addirittura un vantaggio a OpenAI. Non ha bisogno di portare con sé un bagaglio storico e l'architettura può essere disegnata completamente su un foglio di carta bianco.
L'ultima frase di SemiAnalysis è molto grafica——
Dicono che i modelli OpenAI come GPT-5.6 Sol in esecuzione su GPU NVIDIA siano stati utilizzati per progettare un chip che minaccia davvero il fossato CUDA. Le GPU NVIDIA stanno generando i propri "successori" in tempo reale.

03
10 gigawatt, questo è solo l'inizio
Jalapeño è solo il primo colpo su un fronte.
Nell'ottobre dello scorso anno, OpenAI e Broadcom hanno fatto una grande mossa e hanno firmato un grosso ordine di cooperazione per un acceleratore personalizzato da 10 GW.

Il CEO di Ultraman e Broadcom, Chen Fuyang, ha mostrato il wafer Jalapeño, con la targhetta con la scritta "Jalapeño Intelligence Processor"
Il livello di 10 GW equivale quasi a dieci centrali nucleari che funzionano a piena capacità.

Il cabinet principale della CPU a sinistra, il cabinet ASIC a destra, 128 chip in un cabinet, il totale dei due cabinet è di circa 160 kilowatt
A proposito, il vassoio che contiene la CPU si chiama Katsu, il chip si chiama Vindaloo Indian curry e l'interruttore si chiama Chana ceci. Dal cibo giapponese al cibo indiano piccante, queste persone vogliono davvero che tu ricordi questo sistema.
E Jalapeño è solo la prima generazione sulla tabella di marcia, OpenAI lo afferma chiaramente nel rapporto——
La Gen2 è già in fase di profondo sviluppo e anche la Gen3 sta prendendo forma.
La produzione di massa non aumenterà gradualmente fino al 2027 e il prossimo traguardo sarà di 100 megawatt.

Tuttavia, proprio oggi, è stato rivelato che il responsabile del data center di OpenAI, Chris Malone, se n'è andato!
Malone è il capo di Stargate.
Ora l'IPO è sempre più vicina. In questo frangente, la perdita del comandante chiave dell’infrastruttura informatica porta le persone a interrogarsi sulla corrente sotterranea dietro OpenAI.

Naturalmente, un Jalapeño non è sufficiente per rovesciare Nvidia.
Ma il vero segnale di pericolo è che OpenAI ha trasformato modelli, chip e software in un volano in accelerazione.
Il Jalapeño di oggi è solo la prima generazione, seguita dalla Gen2, dalla Gen3 e da un panorama di potenza di calcolo di 10 GW. Anche se i principali dirigenti se ne andassero, ciò non potrebbe impedire che questo percorso continui ad andare avanti.
Nvidia siede ancora sul trono.
Solo che questa volta il sostituto non si è messo in fila davanti alla porta, era già corso nella sala computer.
I rivali di Nvidia iniziarono finalmente a costruire la propria Nvidia.
Commenti