Vers Easy Invoice Cloud
Guide PepperTools
Actualités du monde

Claude Fable 5.1 est là : ce que disent vraiment les benchmarks – et pourquoi votre quota diminue quand même le 14 septembre

Anthropic lance Claude Fable 5.1 : loin devant Opus 5 et GPT-5.6 Sol dans les tests scientifiques et d'automatisation, et environ 25 % moins cher à l'usage. En même temps, le quota hebdomadaire de Claude Code diminue au net à partir du 14 septembre – même si Anthropic parle d'une augmentation.

Claude Fable 5.1 est là : ce que disent vraiment les benchmarks – et pourquoi votre quota diminue quand même le 14 septembre

Mise à jour du 4 septembre 2026 : OpenAI a publié GPT-6 Astra. Ce qui arrive dans votre abonnement ChatGPT et ce que cela coûte : GPT-6 Astra : disponibilité et prix.

Anthropic a publié Claude Fable 5.1 le 1er septembre 2026. Dans les tests publiés, le modèle résout nettement plus de tâches que son prédécesseur Fable 5, que le moins cher Opus 5 et que GPT-5.6 Sol d'OpenAI – surtout en recherche scientifique et en automatisation de processus d'entreprise. Les prix par token restent identiques, mais Fable 5.1 en consomme moins : selon Anthropic, les tâches typiques deviennent environ 25 % moins chères. Il y a pourtant un hic, absent de l'annonce : à partir du 14 septembre, les abonnés disposent au net d'environ 17 % de quota hebdomadaire en moins dans Claude Code qu'aujourd'hui – même si Anthropic présente le changement comme « 25 % d'utilisation en plus ». Le calcul est détaillé plus bas.

Sommaire

Ce que signifient les pourcentages dans les benchmarks

Un benchmark est un ensemble fixe d'épreuves que chaque modèle passe dans les mêmes conditions – comme un contrôle que plusieurs élèves rédigent. Le pourcentage indique combien de tâches le modèle a résolues. « Terminal-Bench 4.0 : 55,8 % » signifie donc : Fable 5.1 a accompli correctement 55,8 % de ces épreuves.

Trois repères aident à situer les chiffres :

  1. Aucun modèle n'atteint 100 %. Les épreuves sont volontairement si difficiles que même les meilleurs systèmes échouent. 55 % peut donc être un score de pointe – ce qui compte, c'est l'écart avec les autres modèles, pas le chiffre absolu.
  2. Chaque benchmark teste autre chose. Un modèle peut briller au test de programmation et faiblir au test scientifique, comme un élève excelle en maths et peine en anglais.
  3. Un chiffre du tableau n'est pas un pourcentage : GDPval-AA est un classement Elo comme aux échecs. Des évaluateurs comparent deux réponses et désignent un vainqueur ; il en résulte un score de classement. 1 853 contre 1 824 signifie : Fable 5.1 gagne ces duels un peu plus souvent qu'Opus 5.

Et une réserve valable pour toute annonce de modèle : les chiffres viennent du fabricant lui-même. Anthropic choisit quels tests figurent dans l'annonce – vraisemblablement ceux où son propre modèle brille. Les contre-tests indépendants paraissent généralement des jours, voire des semaines plus tard.

Les résultats des benchmarks en un coup d'œil

Tous les chiffres proviennent de l'annonce d'Anthropic du 1er septembre 2026. La meilleure valeur est en gras.

Benchmark (ce qu'il teste)Fable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1 (tâches de recherche scientifique)52,6 %24,7 %29,0 %22,4 %
Terminal-Bench 4.0 (travail autonome en ligne de commande)55,8 %42,0 %52,3 %37,3 %
AutomationBench (automatisation de processus d'entreprise)31,4 %17,1 %26,9 %19,6 %
GDPval-AA v2 (travail de bureau et de connaissance, classement Elo)1 8531 7231 8241 711
OSWorld 2.0 strict (utiliser un ordinateur comme un humain : fenêtres, clics)41,7 %36,1 %39,6 %
Humanity's Last Exam sans outils (savoir expert difficile, toutes disciplines)60,9 %57,8 %56,6 %
CursorBench 3.2.0 (programmation dans un éditeur de code)73,4 %70,5 %70,0 %67,2 %

Où Fable 5.1 est vraiment loin devant – et où il ne l'est pas

Le tableau montre deux images très différentes selon l'endroit où l'on regarde.

Deux types de tâches font des bonds. En recherche scientifique (Terminal-Bench-Science), Fable 5.1 résout avec 52,6 % plus de deux fois plus d'épreuves que son propre prédécesseur – et laisse Opus 5 (29,0 %) et GPT-5.6 Sol (22,4 %) loin derrière. Même chose pour l'automatisation de processus (AutomationBench) : 31,4 % contre 17,1 % pour le prédécesseur. Ce sont précisément les tâches longues, en plusieurs étapes, où le modèle doit planifier seul, utiliser des outils et vérifier des résultats intermédiaires. Anthropic cite un exemple issu de la recherche : pour la conception de liants protéiques, Fable 5.1 a atteint un taux de réussite de près de 50 %, là où 10 à 15 % sont considérés comme habituels.

L'écart reste faible en programmation courante et en connaissances. Au test d'éditeur CursorBench, seuls 2,9 points de pourcentage séparent Fable 5.1 de son prédécesseur ; au test de connaissances Humanity's Last Exam, 3,1. Qui utilise le modèle pour des tâches normales de code et de texte remarquera à peine la différence au quotidien.

En bref : Fable 5.1 est avant tout un modèle pour les longues chaînes de travail autonomes – recherche, analyse, processus à nombreuses étapes. Pour la petite tâche rapide entre deux, l'avance est mince.

Combien coûte Fable 5.1 – et pourquoi « même prix » revient quand même moins cher

Les prix catalogue via l'interface pour développeurs (API) sont inchangés – l'économie se situe ailleurs :

Poste (par million de tokens)Fable 5.1Fable 5Opus 5GPT-5.6 Sol*
Entrée10 $10 $5 $4 $
Sortie50 $50 $25 $20 $
Entrées mises en cache0,25 $1,00 $

\* Prix promotionnel jusqu'au 21 novembre 2026 au moins ; prix catalogue 5 $/30 $.

Les tokens sont l'unité de facturation des fournisseurs d'IA – en gros, un fragment de mot. Et c'est là le vrai levier de prix : Fable 5.1 consomme moins de tokens pour le même travail. Anthropic chiffre l'économie à environ 25 % pour les tâches typiques et jusqu'à 45 % pour les longues chaînes de travail autonomes. Le fournisseur de données financières Bloomberg rapporte, d'après ses propres tests, que le modèle était environ deux fois plus rapide qu'Opus 5 avec moitié moins de tokens. S'y ajoute le prix du cache : qui renvoie plusieurs fois les mêmes documents – le cas normal des sessions de travail longues – ne paie plus qu'un quart du prix antérieur pour ces répétitions.

Quel modèle pour quelle tâche ? Trois recommandations

Prix et résultats de tests combinés donnent trois règles simples. Elles valent pour septembre 2026 et reposent sur les chiffres du fabricant cités plus haut :

  1. Tâches quotidiennes – textes, e-mails, traductions, programmation courante : le milieu de gamme suffit. Claude Sonnet 5 (2 $/10 $ par million de tokens) ou GPT-5.6 Sol (4 $/20 $) font ce travail pour une fraction du coût de Fable ; sur des tâches courtes et isolées, la différence de qualité est à peine perceptible. Qui travaille avec un abonnement Claude ménage en plus son quota hebdomadaire, car Fable y pèse doublement lourd (voir plus bas).
  2. Tâches isolées difficiles – bug épineux, analyse de contrat, évaluation complexe : Claude Opus 5 (5 $/25 $) est ici le point d'équilibre prix-performance. Il ne cède que quelques points à Fable 5.1 dans la plupart des tests, mais coûte moitié moins.
  3. Longues chaînes de travail autonomes – recherche sur de nombreuses sources, automatisation en plusieurs étapes, analyses scientifiques : c'est là que Fable 5.1 fait valoir son avance, et doublement : il résout nettement plus de ces tâches (52,6 % contre 29,0 % pour Opus 5 au test scientifique) et consomme moins de tokens pour y parvenir. Sur ce type de travail, le modèle le plus cher peut au final être le moins cher – mesuré au coût par tâche accomplie, pas par requête.

Les petites lignes du quota : +25 % annoncés, −17 % en pratique

Parallèlement à l'annonce du modèle, Anthropic a communiqué un changement des limites d'utilisation : à partir du 14 septembre 2026, les limites hebdomadaires standard de l'outil de programmation Claude Code augmentent durablement de 25 % – pour les offres Pro, Max, Team et les sièges Enterprise.

Ce que la communication omet : depuis mai court une augmentation temporaire de 50 %, prolongée plusieurs fois, qui expire le 13 septembre. Le calcul se présente donc ainsi :

Quota hebdomadaire (base = 100)
Limite d'origine100
Aujourd'hui (temporaire +50 %)150
À partir du 14 septembre (durable +25 % sur l'ancienne base)125

Par rapport à la limite d'origine, c'est effectivement 25 % de plus. Par rapport à ce dont les utilisateurs ont l'habitude depuis des mois, c'est environ 17 % de moins (125 au lieu de 150). Les deux affirmations sont vraies – l'annonce ne raconte que la première et tait la seconde. Des médias spécialisés comme BleepingComputer ont refait le calcul.

Pour les modèles Fable en abonnement, la règle reste inchangée : sur les sièges Max et premium, vous pouvez consacrer au maximum la moitié de votre limite hebdomadaire à Fable ; ensuite, il faut acheter du crédit supplémentaire ou passer à un modèle plus petit. Dans l'offre Pro, Fable fonctionne d'emblée sur crédits payants. Le fait que Fable 5.1 soit plus économe en tokens adoucit cela en pratique – mais ne change rien à la limite elle-même.

Si vous évaluez quels outils d'IA sont rentables pour votre entreprise : l'évolution des familles de modèles d'Anthropic et d'OpenAI est retracée dans nos articles sur GPT-5.6 Sol, Terra et Luna et l'histoire mouvementée de Claude Fable 5. Ce guide paraît sur office1.cloud, où les indépendants gèrent aussi factures et comptabilité.

À propos de l’auteur

Charles Imilkowski

Développeur de logiciels · PepperTools

Charles Imilkowski développe et commercialise depuis 2014, avec son entreprise PepperTools, ses propres logiciels de facturation et de comptabilité. Il travaille par ailleurs depuis 2004 comme développeur de logiciels, aujourd’hui pour des entreprises de taille moyenne, et réalise des interfaces entre des systèmes ERP comme SAP et des solutions comptables comme DATEV.

Gerer les factures plus simplement

Easy Invoice regroupe devis, factures et gestion client dans le cloud.

Essayer Easy Invoice

Versions linguistiques

DE Claude Fable 5.1 ist da: Was die Benchmarks wirklich sagen – und warum Ihr Kontingent ab 14. September trotzdem schrumpft ES Claude Fable 5.1 ya está aquí: lo que dicen de verdad los benchmarks – y por qué su cupo se reduce igualmente el 14 de septiembre PL Claude Fable 5.1 już jest: co naprawdę mówią benchmarki – i dlaczego od 14 września Twój limit i tak się kurczy EN Claude Fable 5.1 is here: what the benchmarks really say – and why your quota still shrinks on September 14 TR Claude Fable 5.1 çıktı: Benchmark'lar gerçekten ne söylüyor – ve kotanız 14 Eylül'den itibaren neden yine de küçülüyor RU Вышел Claude Fable 5.1: что на самом деле говорят бенчмарки – и почему ваша квота с 14 сентября всё равно уменьшится IT Claude Fable 5.1 è arrivato: cosa dicono davvero i benchmark – e perché dal 14 settembre la vostra quota si riduce comunque NL Claude Fable 5.1 is er: wat de benchmarks echt zeggen – en waarom uw tegoed vanaf 14 september toch krimpt