Perché DeepSeek è stato così crudele nei confronti del suo fiore all'occhiello quando è stato rimosso dagli scaffali dopo 32 giorni?

📅 2026-09-11

Riassunto:

Dal rilascio ufficiale fino al momento in cui è stato sostituito da Flash, DeepSeek ha lasciato solo 32 giorni per la versione ufficiale di V4 Pro.

Il 10 settembre, DeepSeek ha rilasciato V4.1 Flash e ha annunciato che a partire dalle ore 12 del 14 settembre, ora di Pechino, tutte le richieste inviate a V4 Pro nell'API ufficiale verranno prese in carico da Flash e addebitate a un prezzo Flash inferiore. Questa disposizione continuerà fino al lancio della V4.1 Pro.

V4 Pro sarà disponibile come versione di anteprima dal 24 aprile e verrà rilasciato ufficialmente il 13 agosto.

Meno di un mese dopo il lancio della versione ufficiale, l'azienda ha già deciso il suo "orario di uscita".

Ciò che vale ancora la pena chiedersi è: perché DeepSeek non ha ridotto il prezzo del Pro e lo ha mantenuto, o semplicemente ha aspettato che la prossima generazione di Pro fosse pronta, per poi lasciare che i due prendessero il sopravvento normalmente?

Il mio giudizio è che V4 Pro ha ancora dei punti di forza, ma non vale più il continuo investimento di DeepSeek solo nella potenza di calcolo.

L'adozione di V4.1 Flash, che rende l'architettura più efficiente e ha superato molti test di agenti intelligenti, può non solo ridurre le spese operative dell'azienda, ma anche abbassare le bollette dell'utente.

01 Flash ha raggiunto la direzione su cui Pro si era concentrato il mese scorso

Un mese fa è stata lanciata la versione ufficiale di V4 Pro. La sua direzione principale è molto chiara: agenti intelligenti, programmazione del codice e invocazione di strumenti. DeepSeek ha aperto diverse intensità di inferenza in quel momento e ha anche adattato appositamente il Codex, sperando che potesse svolgere un lavoro più complesso e con processi più lunghi.

Ma qualcosa è andato storto il giorno in cui la versione ufficiale è stata messa online: la notifica del sito ufficiale e l'annuncio della piattaforma aperta sono stati rimossi per un certo periodo e sono stati ripristinati quella notte. Durante questo periodo l'ingresso tramite chiamata API è stato sempre mantenuto. Secondo quanto riportato dai media, alcuni sviluppatori hanno anche riferito che il tempo di riflessione del modello era troppo breve, che le attività lunghe venivano terminate prematuramente e che i risultati potrebbero essere molto diversi se la stessa domanda viene eseguita poche ore dopo.

Il successivo aumento dei prezzi ha innalzato lo standard per il suo adempimento. A partire dal 17 agosto, il prezzo di uscita di Pro nelle ore di punta è aumentato da 6 yuan a 27 yuan per milione di token, ovvero 4,5 volte il prezzo originale.

Per gli sviluppatori che già ritengono che le loro prestazioni siano instabili, è difficile dire che questa spesa aggiuntiva sia stata scambiata con miglioramenti corrispondenti.

Ora, il nuovo Flash ha appena raggiunto queste direzioni chiave.

I dati ufficiali mostrano che nel test di ingegneria del software DeepSWE v1.1 e nel test di automazione dell'ufficio AutomationBench, Flash ha ottenuto rispettivamente 74,2 punti e 54,8 punti, significativamente davanti ai 62,7 punti e ai 43,2 punti di V4Pro.

Ciò che vince il nuovo modello è proprio il compito che Pro è stato promosso il mese scorso.

Pro non perde ogni volta. Nel sottoinsieme di testo semplice HLE che non richiama strumenti, è ancora in testa a Flash con 42,7 punti e 39,1 punti; ma nel test HLE completo che consente l'utilizzo degli strumenti, Flash ha ottenuto 63,9 punti, 60 punti in più rispetto a Pro. Inoltre, nel confronto dei modelli di base prima della post-formazione, Pro mantiene ancora il primato nelle domande e risposte sulla conoscenza verificata da SimpleQA e nei test di testo lungo LongBench-V2.

Pertanto, il "superamento completo" nell'annuncio ufficiale di DeepSeek non può essere semplicemente inteso come vincente in ogni sottocategoria.

Ci sono ancora cose che Pro fa bene ed è comunque prezioso per gli utenti che hanno bisogno di quelle abilità specifiche. Ciò che veramente fa vacillare è l'originario posizionamento commerciale del prodotto di punta.

In passato, gli sviluppatori e le aziende capivano facilmente la divisione tra i due modelli: si sceglieva Flash se il budget era limitato e i compiti complessi e lunghi venivano lasciati al più costoso Pro. Ora che Flash ha superato molti test mainstream degli smartphone, è difficile per Pro convincere il mercato con l'etichetta di "più costoso, ma generalmente più potente".

Un ampio vantaggio è sufficiente per sostenere un'ammiraglia dal prezzo elevato per il grande pubblico; ma se domina solo alcuni compiti segmentati, l’azienda deve ricalcolare: quante persone non possono fare a meno di queste capacità, quanto premio sono disposte a pagare per questo e se vale la pena allocare cluster di potenza di calcolo per supportarlo.

Le informazioni pubbliche non forniscono ancora conti specifici relativi ai costi e alla ripartizione degli utenti. Ma a giudicare dalle azioni del prodotto DeepSeek, evidentemente ha rinunciato all'idea di mantenere una dotazione indipendente ed esclusiva per il vecchio Pro.

02 Riduci il prezzo di Pro e risparmia sui costi di gestione

Se il problema è semplicemente che Flash è economico, Pro può naturalmente seguire la promozione di riduzione del prezzo. La difficoltà è che i tagli dei prezzi possono solo cambiare i numeri sulla bolletta, ma non il consumo fisico alla base del modello.

Secondo i dati divulgati dalla scheda modello ufficiale, il numero di parametri attivati ​​da ciascun Token di V4 Pro arriva a 49 miliardi. V4.1Flash disaccoppia l'elaborazione dell'input dalla generazione di risposte, attivando rispettivamente solo 8 miliardi e 16 miliardi di parametri. Sebbene il rapporto parametrico non possa essere direttamente equiparato alla riduzione dei costi, la scala di calcoli richiesta per ciascuna inferenza diretta tra i due è completamente diversa nello stesso ordine di grandezza.

La nuova architettura riduce inoltre in modo significativo il sovraccarico di archiviazione delle attività con contesto lungo. Rispetto alla Flash V4, la cache KV globale occupata dalla Flash V4.1 è stata ridotta a circa un quarto e lo spazio SSD occupato dalla cache KV persistente è stato ridotto a circa un ottavo. Il funzionamento dell'agente richiede la lettura ripetuta del codice contesto, dei documenti di riferimento e dei dati restituiti da strumenti esterni. La cache viene utilizzata appositamente per archiviare lo stato storico calcolato dal modello di grandi dimensioni.

Una volta che il ciclo dell'attività si allunga e la quantità di concorrenza aumenta, la memoria di archiviazione raggiunge rapidamente il limite. Ciò che Flash deve risolvere non è solo rispondere correttamente a una domanda, ma anche la riduzione delle risorse quando vengono eseguite contemporaneamente massicce attività simultanee.

DeepSeek ha menzionato direttamente nell'annuncio che una maggiore efficienza dell'architettura consente all'azienda di gestire più concorrenza a un costo inferiore, quindi è logico abbassare il prezzo.

A partire dall'11 settembre, calcolato su base per milione di token a Gushi, il prezzo di input della miss cache V4 Pro è di 4,5 yuan e il prezzo di output è di 13,5 yuan; i prezzi corrispondenti della V4.1 Flash sono solo 1 yuan e 4 yuan (i prezzi massimi di entrambi i modelli sono il doppio di quelli di Gushi). Con l'implementazione dello switch i costi per la costosa interfaccia Pro originariamente verranno ridotti direttamente al livello di Flash.

Sebbene la differenza di prezzo tra i due non equivalga al costo materiale reale di DeepSeek, la strategia è molto chiara: utilizzare una nuova architettura altamente efficiente per accettare pienamente le richieste di vecchie interfacce e quindi trasferire sul mercato i costi hardware risparmiati.

Se riduci il prezzo di Pro, la piattaforma dovrà comunque sostenere da sola i pesanti costi di inferenza e manutenzione; passando a Flash avrai l'opportunità di ridurre allo stesso tempo le bollette degli utenti e il carico del server.

Una volta terminato l'addestramento della grande modella, il pozzo senza fondo del denaro non è stato chiuso. Ogni volta che risponde a una chiamata, occupa le risorse di calcolo in tempo reale e il funzionamento e la manutenzione non possono fermarsi per un attimo.

"Ho appena speso un sacco di soldi per allenarmi" non può essere una medaglia d'oro senza morte per mantenere il vecchio professionista. I costi irrecuperabili sono diventati una realtà e il mantenimento del vecchio modello richiede un consumo continuo di denaro reale.

Anche se il vecchio Pro può continuare a guadagnare, è ovviamente più conveniente utilizzare la stessa potenza di calcolo dell’hardware per eseguire un nuovo modello con maggiore efficienza.

03 La consegna di 160.000 chip Ascend potrebbe richiedere più di un anno

In combinazione con le recenti azioni chiave di DeepSeek, possiamo comprendere meglio il senso di urgenza dietro questo trasferimento di risorse.

Nell'agosto di quest'anno, DeepSeek ha lanciato prezzi variabili di picco e valle per guidare le attività di elaborazione batch non in tempo reale da eseguire durante i periodi di inattività.

Si tratta essenzialmente di spremere tutta la potenza di calcolo esistente dalla pianificazione interna quando l'hardware esterno è limitato.

Anche l'approvvigionamento di hardware sta facendo progressi, ma l'acqua che viene da lontano non può placare la sete di vicinanza. Bloomberg ha riferito il 4 settembre, citando persone a conoscenza della questione, che DeepSeek prevede di implementare almeno 160.000 chip Huawei Ascend 950DT nei data center della Mongolia Interna, che attualmente sono pianificati principalmente per l'inferenza dei modelli piuttosto che per l'addestramento. Tuttavia, il rapporto menziona anche che la capacità produttiva di Huawei deve prendersi cura di più clienti e, a causa dei colli di bottiglia della catena di fornitura, l'intero ciclo di consegna degli ordini potrebbe richiedere più di un anno.

Anche i finanziamenti di DeepSeek stanno accelerando. Reuters ha riferito il 9 settembre, citando persone a conoscenza della questione, che DeepSeek ha assunto CITIC Securities per promuovere il processo di IPO del Science and Technology Innovation Board. La raccolta fondi è principalmente finalizzata a colmare il deficit di finanziamento per le infrastrutture informatiche, la ricerca e lo sviluppo di modelli all’avanguardia e il reclutamento dei migliori talenti. Tuttavia, il calendario della quotazione, l'importo della raccolta fondi e l'obiettivo di valutazione non sono stati ancora definiti e né DeepSeek né CITIC Securities hanno commentato ciò.

Mettendo insieme questi pezzi del puzzle, ciò che emerge è una startup che desidera una rapida espansione ma è sempre vincolata dai limiti delle risorse fisiche.

L'acquisto di hardware dall'esterno e la ricerca di finanziamenti per l'IPO risolvono il problema dell'incremento delle risorse a lungo termine; mentre ricercare l’efficienza nell’architettura degli algoritmi significa consentire alla potenza di calcolo esistente di resistere a un picco di chiamate maggiore.

Il primo richiede un lungo ciclo di consegna e un’operazione di capitale, mentre il secondo può liberare immediatamente capacità nelle imprese esistenti finché la tecnologia matura.

Con risorse così limitate è possibile continuare a mantenere la vecchia ammiraglia, ma il rapporto prezzo/prestazioni è estremamente basso.

Quando i modelli più leggeri ed economici sono già in grado di svolgere la maggior parte dei compiti fondamentali, i pochi vantaggi lasciati dal vecchio Pro sono davvero difficili da convincere il team a continuare ad allocare cluster preziosi per supportarlo.

Il fondatore Liang Wenfeng aveva già chiarito questo compromesso quando comunicava con gli investitori in precedenza. Egli pone chiaramente l’esplorazione AGI a lungo termine al di sopra della massimizzazione del profitto a breve termine, ritiene che il modello open source e la commercializzazione siano completamente autocoerenti e afferma senza mezzi termini che la potenza di calcolo è il principale collo di bottiglia dell’attuale espansione del business.

Ripensando a questo "cambio di modello flash" da questa prospettiva, preferisco una spiegazione strategica: l'obiettivo di DeepSeek è portare all'estremo la portata dei servizi esistenti il ​​prima possibile, promuovendo al contempo la prossima generazione di esplorazioni di frontiera.

Ora che le nuove tecnologie hanno completamente ristrutturato le curve dei costi della potenza di calcolo e delle prestazioni, la matrice dei prodotti deve essere riorganizzata vigorosamente. Non è necessario imporre un lungo periodo di protezione premium per le ammiraglie della generazione precedente.

04 DeepSeek non aspetta il prossimo Pro

La caratteristica più evidente di questo sostituto è la sua risolutezza: DeepSeek non ha nemmeno aspettato che V4.1 Pro prendesse forma.

Secondo la pratica del software commerciale convenzionale, può mantenere completamente il canale indipendente del vecchio Pro per accontentare i clienti aziendali che fanno affidamento sul vecchio modello e allo stesso tempo lanciare Flash come sostituto declassato; attendere fino a quando la prossima generazione Pro sarà completamente matura, quindi completare l'iterazione passo passo passo dopo passo per rendere la linea di prodotti liscia e ordinata.

Ma DeepSeek ha annunciato un altro accordo: il vecchio Flash verrà sostituito da Flash V4.1 e anche il traffico API del vecchio Pro verrà forzatamente unito a Flash dopo il 14 settembre. Anche se il nome dell'interfaccia originale viene mantenuto e la fatturazione viene scontata direttamente, il core del modello sottostante è stato completamente sostituito.

L'ufficiale ha ancora menzionato la futura V4.1 Pro, ma non l'hanno aspettata e continuano a mantenere la posizione del vecchio Pro.

DeepSeek è disposto a lasciare che la sua nuova tecnologia elimini prima la sua vecchia ammiraglia. La quantità di investimenti in ricerca e sviluppo e il fatto che sia online solo da un mese non sono diventati un motivo per proteggerlo.

Tuttavia, solo perché il nome dell'interfaccia rimane invariato non significa che gli sviluppatori possano sedersi e rilassarsi.

Molte aziende hanno precedentemente perfezionato il framework Prompt, le impostazioni di sistema e i collegamenti di chiamata degli strumenti in più passaggi attorno al vecchio Pro e molto probabilmente dovranno eseguire nuovamente i test di regressione sul nuovo modello.

Se l'esecuzione di determinati compiti che si basano fortemente sul testo lungo o sul ragionamento in testo semplice di Pro diminuisce, anche gli appelli della comunità e dei clienti aziendali a mantenere il vecchio canale hanno una razionalità pratica.

Ciò pone un problema per la prossima generazione Pro che non è ancora stato presentato: se vuole fornire nuovamente servizi indipendenti a un prezzo più alto, deve inventare funzionalità difficili da ottenere con Flash e che valgano il pagamento extra per gli utenti, non solo migliori della vecchia Pro.

Tag correlati

Articoli correlati

Commenti

0/500
Captcha (click to refresh)
Nessun commento