Do Easy Invoice Cloud
Poradnik PepperTools
Wiadomości ze świata

Claude Fable 5.1 już jest: co naprawdę mówią benchmarki – i dlaczego od 14 września Twój limit i tak się kurczy

Anthropic wydaje Claude Fable 5.1: daleko przed Opus 5 i GPT-5.6 Sol w testach naukowych i automatyzacji, do tego około 25% tańszy w użyciu. Jednocześnie od 14 września tygodniowy limit Claude Code netto się zmniejsza – choć Anthropic przedstawia to jako podwyżkę.

Claude Fable 5.1 już jest: co naprawdę mówią benchmarki – i dlaczego od 14 września Twój limit i tak się kurczy

Aktualizacja z 4 września 2026: OpenAI wydało GPT-6 Astra. Co trafia do abonamentu ChatGPT i ile kosztuje, opisujemy w GPT-6 Astra: dostępność i ceny.

Anthropic opublikował Claude Fable 5.1 1 września 2026 r. W opublikowanych testach model rozwiązuje znacznie więcej zadań niż jego poprzednik Fable 5, niż tańszy Opus 5 i niż GPT-5.6 Sol od OpenAI – zwłaszcza w badaniach naukowych i automatyzacji procesów biznesowych. Ceny za token pozostają bez zmian, ale Fable 5.1 zużywa ich mniej: według Anthropic typowe zadania stają się około 25 procent tańsze. Jest jednak haczyk, którego nie ma w ogłoszeniu: od 14 września abonenci będą mieli w Claude Code netto około 17 procent mniej tygodniowego limitu niż dziś – choć Anthropic sprzedaje tę zmianę jako „25 procent więcej użycia". Rachunek wyjaśniamy poniżej.

Spis treści

Co oznaczają procenty w benchmarkach

Benchmark to stały zestaw zadań egzaminacyjnych, które każdy model dostaje w tych samych warunkach – jak klasówka pisana przez kilku uczniów. Procent mówi, ile zadań model rozwiązał. „Terminal-Bench 4.0: 55,8%" oznacza więc: Fable 5.1 poprawnie wykonał 55,8 procent tych zadań testowych.

Trzy rzeczy pomagają w interpretacji:

  1. Żaden model nie osiąga 100 procent. Zadania są celowo tak trudne, że nawet najlepsze systemy zawodzą. 55 procent może więc być wynikiem czołowym – liczy się dystans do innych modeli, nie liczba bezwzględna.
  2. Każdy benchmark sprawdza coś innego. Model może być mocny w teście programowania i słaby w naukowym, tak jak uczeń błyszczy z matematyki, a męczy się z angielskim.
  3. Jedna liczba w tabeli nie jest procentem: GDPval-AA to ranking Elo jak w szachach. Oceniający porównują dwie odpowiedzi i wskazują zwycięzcę; z tego powstaje liczba rankingowa. 1853 wobec 1824 oznacza: Fable 5.1 wygrywa takie pojedynki nieco częściej niż Opus 5.

I jedno zastrzeżenie, które dotyczy każdego ogłoszenia modelu: liczby pochodzą od samego producenta. Anthropic wybiera, które testy trafiają do ogłoszenia – zapewne te, w których własny model dobrze wypada. Niezależne powtórki testów pojawiają się zwykle dopiero po dniach lub tygodniach.

Wyniki benchmarków w skrócie

Wszystkie liczby pochodzą z ogłoszenia Anthropic z 1 września 2026 r.. Najlepsza wartość jest pogrubiona.

Benchmark (co sprawdza)Fable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1 (zadania badawcze/naukowe)52,6%24,7%29,0%22,4%
Terminal-Bench 4.0 (samodzielna praca w wierszu poleceń)55,8%42,0%52,3%37,3%
AutomationBench (automatyzacja procesów biznesowych)31,4%17,1%26,9%19,6%
GDPval-AA v2 (praca biurowa i umysłowa, ranking Elo)1853172318241711
OSWorld 2.0 strict (obsługa komputera jak człowiek: okna, kliknięcia)41,7%36,1%39,6%
Humanity's Last Exam bez narzędzi (trudna wiedza ekspercka ze wszystkich dziedzin)60,9%57,8%56,6%
CursorBench 3.2.0 (programowanie w edytorze kodu)73,4%70,5%70,0%67,2%

Gdzie Fable 5.1 naprawdę jest daleko z przodu – a gdzie nie

Tabela pokazuje dwa bardzo różne obrazy, zależnie od tego, gdzie spojrzeć.

Duże skoki dotyczą dwóch typów zadań. W zadaniach badawczych (Terminal-Bench-Science) Fable 5.1 z wynikiem 52,6 procent rozwiązuje ponad dwa razy więcej zadań niż jego własny poprzednik – i zostawia daleko w tyle Opus 5 (29,0%) oraz GPT-5.6 Sol (22,4%). Podobnie w automatyzacji procesów biznesowych (AutomationBench): 31,4 procent wobec 17,1 procent u poprzednika. To dokładnie te długie, wieloetapowe zadania, w których model musi samodzielnie planować, używać narzędzi i sprawdzać wyniki pośrednie. Anthropic podaje przykład z badań: przy projektowaniu białek wiążących Fable 5.1 osiągnął skuteczność blisko 50 procent, podczas gdy za typowe uchodzi 10–15 procent.

Mały pozostaje dystans w codziennym programowaniu i wiedzy. W teście edytora CursorBench Fable 5.1 dzieli od poprzednika tylko 2,9 punktu procentowego, w teście wiedzy Humanity's Last Exam – 3,1. Kto używa modelu do zwykłych zadań kodowych i tekstowych, w codziennej pracy ledwo zauważy różnicę.

Krótko mówiąc: Fable 5.1 to przede wszystkim model do długich, samodzielnych łańcuchów pracy – badań, analiz, procesów o wielu krokach. Przy szybkim pojedynczym zadaniu przewaga jest niewielka.

Ile kosztuje Fable 5.1 – i dlaczego „ta sama cena" i tak wychodzi taniej

Ceny katalogowe przez interfejs dla programistów (API) się nie zmieniają – oszczędność leży gdzie indziej:

Pozycja (za 1 mln tokenów)Fable 5.1Fable 5Opus 5GPT-5.6 Sol*
Wejście10 $10 $5 $4 $
Wyjście50 $50 $25 $20 $
Wejście z pamięci podręcznej (cache)0,25 $1,00 $

\* Cena promocyjna co najmniej do 21 listopada 2026 r.; cena katalogowa 5 $/30 $.

Tokeny to jednostka rozliczeniowa dostawców AI – z grubsza fragment słowa. I tu leży prawdziwa dźwignia cenowa: Fable 5.1 zużywa mniej tokenów na tę samą pracę. Anthropic szacuje oszczędność na około 25 procent przy typowych zadaniach i do 45 procent przy długich, samodzielnych łańcuchach pracy. Dostawca danych finansowych Bloomberg donosi z własnych testów, że model był około dwa razy szybszy niż Opus 5 i zużył o połowę mniej tokenów. Do tego dochodzi cena cache: kto wielokrotnie wysyła te same dokumenty – normalny przypadek przy dłuższych sesjach pracy – płaci za te powtórzenia już tylko jedną czwartą dotychczasowej ceny.

Który model do jakiego zadania? Trzy rekomendacje

Z połączenia ceny i wyników testów wynikają trzy proste zasady. Obowiązują na stan z września 2026 r. i opierają się na powyższych danych producenta:

  1. Codzienne zadania – teksty, e-maile, tłumaczenia, zwykłe programowanie: tu wystarczy klasa średnia. Claude Sonnet 5 (2 $/10 $ za milion tokenów) albo GPT-5.6 Sol (4 $/20 $) wykonują tę pracę za ułamek kosztów Fable; przy krótkich pojedynczych zadaniach różnica jakości jest ledwo odczuwalna. Kto pracuje w abonamencie Claude, oszczędza przy tym swój tygodniowy limit, bo Fable liczy się tam podwójnie (patrz niżej).
  2. Trudne pojedyncze zadania – zawiły błąd w kodzie, analiza umowy, złożona ocena: Claude Opus 5 (5 $/25 $) to tutaj optimum ceny do wydajności. W większości testów ustępuje Fable 5.1 tylko o kilka punktów, a kosztuje połowę.
  3. Długie, samodzielne łańcuchy pracy – research po wielu źródłach, wieloetapowa automatyzacja, analizy naukowe: tu Fable 5.1 wykorzystuje swoją przewagę, i to podwójnie: rozwiązuje znacznie więcej takich zadań (52,6% wobec 29,0% Opus 5 w teście naukowym) i potrzebuje do tego mniej tokenów. Przy tego rodzaju pracy droższy model może się ostatecznie okazać tańszy – licząc koszt ukończonego zadania, a nie pojedynczego zapytania.

Drobny druk przy limicie: +25% ogłoszone, −17% w praktyce

Równolegle do ogłoszenia modelu Anthropic zakomunikował zmianę limitów użycia: od 14 września 2026 r. standardowe tygodniowe limity w narzędziu programistycznym Claude Code rosną na stałe o 25 procent – dla planów Pro, Max, Team i miejsc Enterprise.

Czego w komunikacie brakuje: od maja obowiązuje tymczasowa podwyżka o 50 procent, kilkakrotnie przedłużana, która wygasa 13 września. Rachunek wygląda więc tak:

Limit tygodniowy (baza = 100)
Pierwotny limit100
Dziś (tymczasowo +50%)150
Od 14 września (na stałe +25% od starej bazy)125

Względem pierwotnego limitu to faktycznie 25 procent więcej. Względem tego, do czego użytkownicy przywykli od miesięcy, to około 17 procent mniej (125 zamiast 150). Oba stwierdzenia są prawdziwe – tyle że ogłoszenie opowiada pierwsze, a przemilcza drugie. Media branżowe, jak BleepingComputer, prześledziły to wyliczenie.

Dla modeli Fable w abonamencie zasada pozostaje bez zmian: na miejscach Max i premium można wydać na Fable najwyżej połowę tygodniowego limitu; potem trzeba dokupić kredyty albo przejść na mniejszy model. W planie Pro Fable działa od początku wyłącznie na płatnych kredytach. To, że Fable 5.1 oszczędniej gospodaruje tokenami, nieco to w praktyce łagodzi – ale samego limitu nie zmienia.

Jeśli planujesz, które narzędzia AI opłacają się w Twojej firmie: jak rozwijały się rodziny modeli Anthropic i OpenAI, przeczytasz w naszych artykułach o GPT-5.6 Sol, Terra i Luna oraz o burzliwej historii Claude Fable 5. Ten poradnik ukazuje się na office1.cloud, gdzie samozatrudnieni prowadzą też faktury i księgowość.

O autorze

Charles Imilkowski

Programista · PepperTools

Charles Imilkowski od 2014 roku rozwija i sprzedaje własne oprogramowanie do faktur i księgowości w ramach swojej firmy PepperTools. Poza tym od 2004 roku pracuje jako programista, dziś dla średnich przedsiębiorstw, i tworzy interfejsy między systemami ERP, takimi jak SAP, a rozwiązaniami księgowymi, takimi jak DATEV.

Latwiejsze fakturowanie

Easy Invoice laczy oferty, faktury i zarzadzanie klientami w chmurze.

Wyprobuj Easy Invoice

Wersje jezykowe

DE Claude Fable 5.1 ist da: Was die Benchmarks wirklich sagen – und warum Ihr Kontingent ab 14. September trotzdem schrumpft ES Claude Fable 5.1 ya está aquí: lo que dicen de verdad los benchmarks – y por qué su cupo se reduce igualmente el 14 de septiembre EN Claude Fable 5.1 is here: what the benchmarks really say – and why your quota still shrinks on September 14 FR Claude Fable 5.1 est là : ce que disent vraiment les benchmarks – et pourquoi votre quota diminue quand même le 14 septembre TR Claude Fable 5.1 çıktı: Benchmark'lar gerçekten ne söylüyor – ve kotanız 14 Eylül'den itibaren neden yine de küçülüyor RU Вышел Claude Fable 5.1: что на самом деле говорят бенчмарки – и почему ваша квота с 14 сентября всё равно уменьшится IT Claude Fable 5.1 è arrivato: cosa dicono davvero i benchmark – e perché dal 14 settembre la vostra quota si riduce comunque NL Claude Fable 5.1 is er: wat de benchmarks echt zeggen – en waarom uw tegoed vanaf 14 september toch krimpt