Vai a Easy Invoice Cloud
Guida PepperTools
Notizie dal mondo

Claude Fable 5.1 è arrivato: cosa dicono davvero i benchmark – e perché dal 14 settembre la vostra quota si riduce comunque

Anthropic lancia Claude Fable 5.1: molto avanti rispetto a Opus 5 e GPT-5.6 Sol nei test scientifici e di automazione, e circa il 25% più economico nell'uso. Allo stesso tempo, dal 14 settembre la quota settimanale di Claude Code si riduce al netto – anche se Anthropic la presenta come un aumento.

Claude Fable 5.1 è arrivato: cosa dicono davvero i benchmark – e perché dal 14 settembre la vostra quota si riduce comunque

Aggiornamento del 4 settembre 2026: OpenAI ha pubblicato GPT-6 Astra. Che cosa arriva nel vostro abbonamento ChatGPT e quanto costa: GPT-6 Astra: disponibilità e prezzi.

Anthropic ha pubblicato Claude Fable 5.1 il 1° settembre 2026. Nei test pubblicati il modello risolve molte più attività del predecessore Fable 5, del più economico Opus 5 e di GPT-5.6 Sol di OpenAI – soprattutto nella ricerca scientifica e nell'automazione dei processi aziendali. I prezzi per token restano invariati, ma Fable 5.1 ne consuma meno: secondo Anthropic le attività tipiche diventano circa il 25 per cento più economiche. C'è però un inghippo, e non sta nell'annuncio: dal 14 settembre gli abbonati avranno in Claude Code al netto circa il 17 per cento di quota settimanale in meno rispetto a oggi – anche se Anthropic presenta la modifica come «25 per cento di utilizzo in più». Il calcolo è spiegato più avanti.

Indice

Cosa significano le percentuali nei benchmark

Un benchmark è una raccolta fissa di prove d'esame che ogni modello riceve alle stesse condizioni – come un compito in classe svolto da più studenti. La percentuale dice quante prove il modello ha risolto. «Terminal-Bench 4.0: 55,8%» significa quindi: Fable 5.1 ha completato correttamente il 55,8 per cento di queste prove.

Tre punti aiutano a inquadrare i numeri:

  1. Nessun modello raggiunge il 100 per cento. Le prove sono volutamente così difficili che anche i sistemi migliori falliscono. Il 55 per cento può quindi essere un valore di punta – conta la distanza dagli altri modelli, non il numero assoluto.
  2. Ogni benchmark misura qualcosa di diverso. Un modello può essere forte nel test di programmazione e debole in quello scientifico, come uno studente eccelle in matematica e arranca in inglese.
  3. Un numero della tabella non è una percentuale: GDPval-AA è un punteggio Elo come negli scacchi. I valutatori confrontano due risposte e scelgono un vincitore; ne nasce un punteggio di classifica. 1.853 contro 1.824 significa: Fable 5.1 vince questi duelli un po' più spesso di Opus 5.

E una riserva che vale per ogni annuncio di modello: i numeri vengono dal produttore stesso. Anthropic sceglie quali test compaiono nell'annuncio – presumibilmente quelli in cui il proprio modello fa bella figura. I test indipendenti arrivano di solito solo giorni o settimane dopo.

I risultati dei benchmark in sintesi

Tutti i numeri provengono dall'annuncio di Anthropic del 1° settembre 2026. Il valore migliore è in grassetto.

Benchmark (cosa misura)Fable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1 (attività di ricerca scientifica)52,6%24,7%29,0%22,4%
Terminal-Bench 4.0 (lavoro autonomo a riga di comando)55,8%42,0%52,3%37,3%
AutomationBench (automazione di processi aziendali)31,4%17,1%26,9%19,6%
GDPval-AA v2 (lavoro d'ufficio e di conoscenza, punteggio Elo)1.8531.7231.8241.711
OSWorld 2.0 strict (usare un computer come un umano: finestre, clic)41,7%36,1%39,6%
Humanity's Last Exam senza strumenti (conoscenze specialistiche difficili in tutti i campi)60,9%57,8%56,6%
CursorBench 3.2.0 (programmare in un editor di codice)73,4%70,5%70,0%67,2%

Dove Fable 5.1 è davvero molto avanti – e dove no

La tabella mostra due immagini molto diverse, a seconda di dove si guarda.

I grandi salti riguardano due tipi di attività. Nelle attività di ricerca scientifica (Terminal-Bench-Science) Fable 5.1 risolve con il 52,6 per cento più del doppio delle prove del proprio predecessore – e lascia molto indietro Opus 5 (29,0%) e GPT-5.6 Sol (22,4%). Simile nell'automazione dei processi aziendali (AutomationBench): 31,4 per cento contro 17,1 per cento del predecessore. Sono esattamente le attività lunghe e a più passaggi in cui il modello deve pianificare da solo, usare strumenti e verificare risultati intermedi. Anthropic cita un esempio dalla ricerca: nella progettazione di leganti proteici Fable 5.1 ha raggiunto un tasso di successo di quasi il 50 per cento, dove il 10-15 per cento è considerato normale.

Il distacco resta piccolo nella programmazione quotidiana e nelle conoscenze. Nel test dell'editor CursorBench solo 2,9 punti percentuali separano Fable 5.1 dal predecessore; nel test di conoscenze Humanity's Last Exam 3,1. Chi usa il modello per normali attività di codice e testo noterà a malapena la differenza nel lavoro quotidiano.

In breve: Fable 5.1 è soprattutto un modello per lunghe catene di lavoro autonome – ricerca, analisi, processi con molti passaggi. Per la singola attività veloce il vantaggio è piccolo.

Quanto costa Fable 5.1 – e perché «stesso prezzo» è comunque più economico

I prezzi di listino tramite l'interfaccia per sviluppatori (API) sono invariati – il risparmio sta altrove:

Voce (per 1 milione di token)Fable 5.1Fable 5Opus 5GPT-5.6 Sol*
Input10 $10 $5 $4 $
Output50 $50 $25 $20 $
Input memorizzato (cache)0,25 $1,00 $

\* Prezzo promozionale almeno fino al 21 novembre 2026; prezzo di listino 5 $/30 $.

I token sono l'unità di fatturazione dei fornitori di IA – all'incirca un frammento di parola. Ed è qui la vera leva di prezzo: Fable 5.1 consuma meno token per lo stesso lavoro. Anthropic quantifica il risparmio in circa il 25 per cento per le attività tipiche e fino al 45 per cento per le lunghe catene di lavoro autonome. Il fornitore di dati finanziari Bloomberg riferisce dai propri test che il modello era circa due volte più veloce di Opus 5 usando la metà dei token. A ciò si aggiunge il prezzo della cache: chi invia più volte gli stessi documenti – il caso normale nelle sessioni di lavoro lunghe – paga per queste ripetizioni solo un quarto del prezzo precedente.

Quale modello per quale attività? Tre raccomandazioni

Da prezzo e risultati dei test insieme derivano tre semplici regole pratiche. Valgono per settembre 2026 e si basano sui numeri del produttore citati sopra:

  1. Attività quotidiane – testi, e-mail, traduzioni, programmazione normale: qui basta la fascia media. Claude Sonnet 5 (2 $/10 $ per milione di token) o GPT-5.6 Sol (4 $/20 $) svolgono questo lavoro a una frazione dei costi di Fable; su attività brevi e singole la differenza di qualità è appena percepibile. Chi lavora con un abbonamento Claude risparmia così anche la propria quota settimanale, perché lì Fable pesa doppio (vedi sotto).
  2. Attività singole impegnative – un bug ostico, l'analisi di un contratto, una valutazione complessa: Claude Opus 5 (5 $/25 $) è qui il punto di equilibrio prezzo-prestazioni. Nella maggior parte dei test resta solo di pochi punti dietro Fable 5.1, ma costa la metà.
  3. Lunghe catene di lavoro autonome – ricerca su molte fonti, automazione a più passaggi, analisi scientifiche: qui Fable 5.1 sfrutta il suo vantaggio, e per due volte: risolve molte più attività di questo tipo (52,6% contro 29,0% di Opus 5 nel test scientifico) e per farlo consuma meno token. In questo tipo di lavoro il modello più caro può risultare alla fine il più economico – misurato sul costo per attività completata, non per richiesta.

Le clausole in piccolo sulla quota: +25% annunciato, −17% nella pratica

Parallelamente all'annuncio del modello, Anthropic ha comunicato una modifica dei limiti di utilizzo: dal 14 settembre 2026 i limiti settimanali standard nello strumento di programmazione Claude Code aumentano stabilmente del 25 per cento – per i piani Pro, Max, Team e i posti Enterprise.

Cosa manca nella comunicazione: da maggio è in vigore un aumento temporaneo del 50 per cento, prorogato più volte, che scade il 13 settembre. Il calcolo è quindi questo:

Quota settimanale (base = 100)
Limite originario100
Oggi (temporaneo +50%)150
Dal 14 settembre (stabile +25% sulla vecchia base)125

Rispetto al limite originario è effettivamente il 25 per cento in più. Rispetto a ciò a cui gli utenti sono abituati da mesi, è circa il 17 per cento in meno (125 invece di 150). Entrambe le affermazioni sono vere – solo che l'annuncio racconta la prima e tace la seconda. Media specializzati come BleepingComputer hanno rifatto il calcolo.

Per i modelli Fable in abbonamento la regola resta invariata: sui posti Max e premium potete spendere al massimo la metà del vostro limite settimanale per Fable; dopo si acquistano crediti extra o si passa a un modello più piccolo. Nel piano Pro, Fable funziona fin dall'inizio solo con crediti a pagamento. Il fatto che Fable 5.1 sia più parsimonioso con i token attenua la cosa nella pratica – ma non cambia nulla al limite in sé.

Se state valutando quali strumenti di IA convengono alla vostra azienda: come si sono evolute le famiglie di modelli di Anthropic e OpenAI lo leggete nei nostri articoli su GPT-5.6 Sol, Terra e Luna e sulla storia movimentata di Claude Fable 5. Questa guida è pubblicata su office1.cloud, dove gli autonomi gestiscono anche fatture e contabilità.

Sull’autore

Charles Imilkowski

Sviluppatore software · PepperTools

Charles Imilkowski sviluppa e distribuisce dal 2014, con la sua azienda PepperTools, software proprio per fatturazione e contabilità. Dal 2004 lavora inoltre come sviluppatore software, oggi per imprese di medie dimensioni, e realizza interfacce tra sistemi ERP come SAP e soluzioni contabili come DATEV.

Gestire le fatture piu facilmente

Easy Invoice unisce preventivi, fatture e gestione clienti nel cloud.

Prova Easy Invoice

Versioni linguistiche

DE Claude Fable 5.1 ist da: Was die Benchmarks wirklich sagen – und warum Ihr Kontingent ab 14. September trotzdem schrumpft ES Claude Fable 5.1 ya está aquí: lo que dicen de verdad los benchmarks – y por qué su cupo se reduce igualmente el 14 de septiembre PL Claude Fable 5.1 już jest: co naprawdę mówią benchmarki – i dlaczego od 14 września Twój limit i tak się kurczy EN Claude Fable 5.1 is here: what the benchmarks really say – and why your quota still shrinks on September 14 FR Claude Fable 5.1 est là : ce que disent vraiment les benchmarks – et pourquoi votre quota diminue quand même le 14 septembre TR Claude Fable 5.1 çıktı: Benchmark'lar gerçekten ne söylüyor – ve kotanız 14 Eylül'den itibaren neden yine de küçülüyor RU Вышел Claude Fable 5.1: что на самом деле говорят бенчмарки – и почему ваша квота с 14 сентября всё равно уменьшится NL Claude Fable 5.1 is er: wat de benchmarks echt zeggen – en waarom uw tegoed vanaf 14 september toch krimpt