Riassunto:
Rilasciati Fable 5.1 e Mythos 5.1! Si è classificato al primo posto in tutti gli 8 test di riferimento pubblici e il prezzo è sceso fino al 45%. Soprattutto nei settori della ricerca scientifica e della codifica, si è chiaramente lasciato alle spalle Fable 5 e il suo vicino GPT-5.6 Sol. Da un punto di vista più intuitivo, ora eseguendo Fable 5.1 con livelli di inferenza medio e basso, le prestazioni sono sostanzialmente equivalenti alla vecchia versione di Mythos 5 con livello di inferenza estremamente alto o addirittura il più alto. In questa ondata, "Fable" ha ucciso "Mythos".


In termini di prezzo, Fable 5.1 ha abbassato il prezzo di lettura della cache a 0,25 dollari per milione di token, una riduzione del 75%.
I prezzi di input e output sono coerenti con Fable 5, rispettivamente a 10 e 50 dollari per milione di token.
Sembra che sia stato ridotto un solo prezzo, ma l'impatto effettivo è relativamente ampio, perché nell'attività dell'agente, la lettura della cache rappresenta la maggior parte del costo.
I dati forniti da Anthropic indicano che il costo dei carichi di lavoro tipici è inferiore di circa il 25% rispetto a quello di Fable 5. Se si tratta di un'attività altamente intelligente, può far risparmiare fino al 45%.

Il video di rilascio ufficiale ha qualcosa da dire:
Indipendentemente dal compito che hai chiesto a Claude di gestire in precedenza, Fable 5.1 può fare di più e gestire meglio le parti più difficili.

Lo fa perché è in grado di gestire attività in più fasi.
In questo tipo di attività, se si verifica un piccolo errore nel secondo passaggio, tutto crollerà al 40° passaggio, ma Fable 5.1 può fornire un output stabile durante l'intero processo.
Se riscontri un problema che non può essere risolto, ti dirà quali soluzioni hai provato e dove sei bloccato.
Il ricercatore Flix Rieseberg ha inoltre menzionato specificamente che, in termini di scrittura, Fable 5.1 riduce l'uso di caratteri in grassetto, utilizza meno titoli, elenchi o virgolette e segue meglio i segnali di stile.
Quello che sto dicendo è: puoi comunque rendere open source i tuoi consigli di stile?

Ancora fedele alla forma, Fable 5.1 è aperto a tutti gli utenti e Mythos 5.1 è disponibile solo per organizzazioni di sicurezza informatica e scienze della vita controllate attraverso il Trusted Access Program.
Ricerca scientifica pratica: progettazione di proteine, generazione di mappe di Venere, accelerazione GPU
Oltre ai punteggi parziali, Anthropic ha anche dimostrato i risultati pratici di Fable 5.1 e Mythos 5.1 nel campo della ricerca scientifica.
In termini di progettazione delle proteine, Anthropic ha utilizzato Mythos 5.1 per utilizzare strumenti open source di progettazione e ripiegamento delle proteine per progettare proteine leganti ad alta affinità e ha inviato il piano a due istituzioni esterne per la verifica sperimentale.
Su tre target, l'affinità di legame del progetto Mythos 5.1 è stata 10 volte superiore a quella della migliore soluzione nel concorso per la progettazione delle proteine Adaptyv Bio. Per tutti i 12 target, il tasso di successo è stato vicino al 50%, rispetto al tasso di successo tipico del 10-15% nell'attuale campo della progettazione delle proteine.
Le proteine leganti ad alta affinità rappresentano il primo passo in molti processi comuni di sviluppo dei farmaci e determinano direttamente se il farmaco può funzionare a dosi più basse.

In astronomia, Fable 5.1 ha addestrato una rete neurale basata su immagini radar scattate dalla navicella spaziale Magellan della NASA più di 30 anni fa per generare una nuova mappa topografica ad alta risoluzione di un terzo della superficie di Venere.
Le mappe topografiche precedentemente disponibili coprivano solo un quinto di Venere, con risoluzioni comprese tra 10 e 20 chilometri. Fable 5.1 aumenta la risoluzione da 2 a 3 chilometri e la precisione dell'altezza è superiore del 25% rispetto a prima. Questa mappa è stata rilasciata come open source con licenza CC e verrà utilizzata come riferimento per le prossime missioni NASA VERITAS ed ESA EnVision per aiutare a identificare le caratteristiche geologiche chiave per le osservazioni future.

In termini di biologia computazionale, Mythos 5.1 migliora la velocità di esecuzione di 7 modelli di deep learning open source fino a 2,5 volte scrivendo kernel GPU personalizzati e memorizzando nella cache i risultati intermedi, e l'output è completamente coerente.

Nella ricerca vera e propria, i biologi potrebbero aver bisogno di eseguire questi modelli migliaia di volte, testando tutte le possibili mutazioni vicino a ciascun gene umano. I modelli ottimizzati possono ridurre i costi della GPU dal 30% al 60%.

Il completamento di questo tipo di ottimizzazione richiede solitamente diverse settimane da parte di un team di ingegneri delle prestazioni e molti laboratori accademici semplicemente non possono permetterselo. Tuttavia, Mythos 5.1 ce l'ha fatta in pochi giorni e si è affidato esclusivamente al codice open source.
Anthropic prevede di rendere queste ottimizzazioni open source nel prossimo futuro.
Il meccanismo anti-distillazione è online
Con il rilascio di Fable 5.1, sono presenti alcune normative speciali e modifiche all'API.
Parliamo brevemente prima della sicurezza.
Il tasso di falsi positivi nella sicurezza della rete di Fable 5.1 è inferiore del 60% rispetto a quello di Fable 5. Ora è consentito utilizzarlo per scoprire vulnerabilità del software, ma lo sviluppo di exploit è ancora vietato. Le attività a duplice scopo come test di penetrazione, generazione di exploit, scansione di vulnerabilità basata su binario, ecc. verranno comunque reindirizzate al modello della serie Opus.
I tassi di falsi positivi per domande mediche e di biologia di base sono stati ridotti dell'85%, ma le domande che coinvolgono la ricerca e lo sviluppo delle scienze della vita vengono ancora indirizzate all'elaborazione del modello Opus e i professionisti devono ottenere l'accesso tramite il Life Sciences Validation Program (LSVP) di Mythos 5.1.
Poi parliamo del meccanismo anti-distillazione appena aggiunto.
A partire da oggi, gli account API appena registrati non possono modificare manualmente il contesto di Claude in più cicli di conversazioni conservando i record della catena di pensiero.
Esiste una tecnica comune che è stata registrata pubblicamente in precedenza: manomettere manualmente il contesto precedente di Claude in più cicli di conversazioni, ma conservare deliberatamente la registrazione della catena di pensiero. Ciò consente al modello di riprodurre il ragionamento prodotto sotto un altro insieme di istruzioni sotto un nuovo insieme di istruzioni, possibilmente contraddittorio.
Questa strada ora è bloccata.

L'approccio consiste nell'aggiungere una firma a ciascun blocco della catena di pensiero.
Quando l'utente invia la risposta dell'assistente all'API nelle richieste successive, il sistema utilizzerà questa firma per fare due cose: verificare se il modello corrente ha il diritto di leggere questo blocco e verificare se l'intera conversazione prima di questo blocco (incluse le parole del prompt del sistema, l'elenco degli strumenti e tutti i messaggi storici) è esattamente la stessa di quando è stata originariamente generata.
La verifica della firma fallirà ogni volta che viene toccato qualcosa nella conversazione.
Cosa fare dopo un errore dipende da un parametro prefix_mismatch_behavior impostato dallo sviluppatore: il valore predefinito è "error", che restituisce direttamente un codice di stato 400 e la richiesta viene rifiutata; se è impostato su "drop_block", il sistema eliminerà silenziosamente il blocco e tutte le catene di pensiero successive e la richiesta stessa verrà eseguita come al solito.
La parte scartata non viene conteggiata (le persone sono un po' strane) e verrà elencata nell'array input_transformations nella risposta.

Quali operazioni causeranno un errore di verifica?
La documentazione fornisce un elenco dettagliato: modifica, riorganizzazione o eliminazione di eventuali messaggi precedenti dell'utente/assistente/di sistema, modifica della parola di prompt del sistema di livello superiore, aggiunta, eliminazione o ridenominazione dell'elenco degli strumenti, rimozione di un blocco della catena di pensiero dalla cronologia delle conversazioni ma mantenendo i blocchi successivi e riferimento a un'immagine o a un URL di documento che ha restituito contenuti diversi tra le richieste.
Qualsiasi delle cause precedenti farà sì che tutti i successivi blocchi della catena di pensiero diventino non validi.

Al contrario, alcune operazioni sono sicure:
L'aggiunta di nuovi messaggi alla fine della conversazione, la rimozione del blocco della catena di pensiero dall'inizio della cronologia, la modifica dei parametri della richiesta come max_tokens, l'aumento o la diminuzione dei tag cache_control e la compattazione lato server o la modifica del contesto non attiveranno errori di verifica.
Esiste anche un design di verifica della catena. Ogni blocco della catena pensante registrerà le informazioni del blocco precedente, formando una catena incrociata. I blocchi possono essere rimossi dalla testa della catena, ma se ne viene rimosso uno dal centro, ogni blocco successivo diventerà non valido e l'intera catena sarà invalidata dal punto di interruzione.
Per evitare che gli sviluppatori rimangano bloccati, Anthropic fornisce anche una serie di alternative che possono ottenere lo stesso effetto senza intaccare la cronologia.
Hai bisogno di modificare le istruzioni a metà strada? Utilizza i messaggi di sistema a metà conversazione invece di modificare direttamente la parola del prompt di livello superiore.
Devi aggiungere un promemoria temporaneo per ogni round? Utilizzare il messaggio di sistema a livello globale con il parametro clear_at per sostituire il vecchio metodo "inserisci prima e poi elimina".
Devi aggiungere o rimuovere strumenti nel frattempo? Utilizza i blocchi tool_addition e tool_removal invece di modificare direttamente l'elenco degli strumenti.
Hai bisogno di ritagliare il contesto? Sostituisci il troncamento lato client con la compressione lato server e la modifica contestuale.
Se utilizzi prodotti ufficiali come Claude Code, claude.ai, Claude Managed Agents o Claude Agent SDK, non è necessario modificare nulla. Si sono assicurati automaticamente che il prefisso della conversazione non venga manomesso.
Ma se sei uno sviluppatore che chiama direttamente l'API Messages, il suggerimento di Anthropic è di utilizzare l'array dei messaggi esclusivamente come append-only, quindi eseguire un test completo di sessione multi-round con prefix_mismatch_behavior impostato sulla modalità "drop_block" per vedere se sono presenti voci prefix_binding_mismatch nel registro.
Il documento finale menziona inoltre specificamente uno scenario in cui è facile finire nei guai.
Se gestisci uno strumento o un framework e gli utenti utilizzano le proprie chiavi API per chiamarlo, gli utenti appena registrati dovranno affrontare questa verifica prima. Poiché molto probabilmente la chiave dello sviluppatore è stata registrata prima del 31 agosto, non è stata ancora applicata.
In questo caso, si consiglia di impostare in modo proattivo prefix_mismatch_behavior e testarlo in anticipo. Non aspettare che gli utenti vadano in crash prima di scoprirlo.
Ancora una cosa
Con un trambusto così grande proveniente dall'azienda A, la vicina OpenAI non potrà certamente restare ferma.
Ma il loro nuovo modello Astra non è ancora pronto, quindi devono prima fornire un'anteprima simbolica.

In occasione del rilascio di Fable 5.1 e OpenAI Astra, anche Ilya è raramente uscito per parlare apertamente, chiedendo di rafforzare la sicurezza della rete.

Commenti