Aktualizacja z 4 września 2026: OpenAI wydało GPT-6 Astra. Co trafia do abonamentu ChatGPT i ile kosztuje, opisujemy w GPT-6 Astra: dostępność i ceny.
Anthropic opublikował Claude Fable 5.1 1 września 2026 r. W opublikowanych testach model rozwiązuje znacznie więcej zadań niż jego poprzednik Fable 5, niż tańszy Opus 5 i niż GPT-5.6 Sol od OpenAI – zwłaszcza w badaniach naukowych i automatyzacji procesów biznesowych. Ceny za token pozostają bez zmian, ale Fable 5.1 zużywa ich mniej: według Anthropic typowe zadania stają się około 25 procent tańsze. Jest jednak haczyk, którego nie ma w ogłoszeniu: od 14 września abonenci będą mieli w Claude Code netto około 17 procent mniej tygodniowego limitu niż dziś – choć Anthropic sprzedaje tę zmianę jako „25 procent więcej użycia". Rachunek wyjaśniamy poniżej.
Spis treści
- Co oznaczają procenty w benchmarkach
- Wyniki benchmarków w skrócie
- Gdzie Fable 5.1 naprawdę jest daleko z przodu – a gdzie nie
- Ile kosztuje Fable 5.1 – i dlaczego „ta sama cena" i tak wychodzi taniej
- Który model do jakiego zadania? Trzy rekomendacje
- Drobny druk przy limicie: +25% ogłoszone, −17% w praktyce
Co oznaczają procenty w benchmarkach
Benchmark to stały zestaw zadań egzaminacyjnych, które każdy model dostaje w tych samych warunkach – jak klasówka pisana przez kilku uczniów. Procent mówi, ile zadań model rozwiązał. „Terminal-Bench 4.0: 55,8%" oznacza więc: Fable 5.1 poprawnie wykonał 55,8 procent tych zadań testowych.
Trzy rzeczy pomagają w interpretacji:
- Żaden model nie osiąga 100 procent. Zadania są celowo tak trudne, że nawet najlepsze systemy zawodzą. 55 procent może więc być wynikiem czołowym – liczy się dystans do innych modeli, nie liczba bezwzględna.
- Każdy benchmark sprawdza coś innego. Model może być mocny w teście programowania i słaby w naukowym, tak jak uczeń błyszczy z matematyki, a męczy się z angielskim.
- Jedna liczba w tabeli nie jest procentem: GDPval-AA to ranking Elo jak w szachach. Oceniający porównują dwie odpowiedzi i wskazują zwycięzcę; z tego powstaje liczba rankingowa. 1853 wobec 1824 oznacza: Fable 5.1 wygrywa takie pojedynki nieco częściej niż Opus 5.
I jedno zastrzeżenie, które dotyczy każdego ogłoszenia modelu: liczby pochodzą od samego producenta. Anthropic wybiera, które testy trafiają do ogłoszenia – zapewne te, w których własny model dobrze wypada. Niezależne powtórki testów pojawiają się zwykle dopiero po dniach lub tygodniach.
Wyniki benchmarków w skrócie
Wszystkie liczby pochodzą z ogłoszenia Anthropic z 1 września 2026 r.. Najlepsza wartość jest pogrubiona.
| Benchmark (co sprawdza) | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 (zadania badawcze/naukowe) | 52,6% | 24,7% | 29,0% | 22,4% |
| Terminal-Bench 4.0 (samodzielna praca w wierszu poleceń) | 55,8% | 42,0% | 52,3% | 37,3% |
| AutomationBench (automatyzacja procesów biznesowych) | 31,4% | 17,1% | 26,9% | 19,6% |
| GDPval-AA v2 (praca biurowa i umysłowa, ranking Elo) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 strict (obsługa komputera jak człowiek: okna, kliknięcia) | 41,7% | 36,1% | 39,6% | — |
| Humanity's Last Exam bez narzędzi (trudna wiedza ekspercka ze wszystkich dziedzin) | 60,9% | 57,8% | 56,6% | — |
| CursorBench 3.2.0 (programowanie w edytorze kodu) | 73,4% | 70,5% | 70,0% | 67,2% |
Gdzie Fable 5.1 naprawdę jest daleko z przodu – a gdzie nie
Tabela pokazuje dwa bardzo różne obrazy, zależnie od tego, gdzie spojrzeć.
Duże skoki dotyczą dwóch typów zadań. W zadaniach badawczych (Terminal-Bench-Science) Fable 5.1 z wynikiem 52,6 procent rozwiązuje ponad dwa razy więcej zadań niż jego własny poprzednik – i zostawia daleko w tyle Opus 5 (29,0%) oraz GPT-5.6 Sol (22,4%). Podobnie w automatyzacji procesów biznesowych (AutomationBench): 31,4 procent wobec 17,1 procent u poprzednika. To dokładnie te długie, wieloetapowe zadania, w których model musi samodzielnie planować, używać narzędzi i sprawdzać wyniki pośrednie. Anthropic podaje przykład z badań: przy projektowaniu białek wiążących Fable 5.1 osiągnął skuteczność blisko 50 procent, podczas gdy za typowe uchodzi 10–15 procent.
Mały pozostaje dystans w codziennym programowaniu i wiedzy. W teście edytora CursorBench Fable 5.1 dzieli od poprzednika tylko 2,9 punktu procentowego, w teście wiedzy Humanity's Last Exam – 3,1. Kto używa modelu do zwykłych zadań kodowych i tekstowych, w codziennej pracy ledwo zauważy różnicę.
Krótko mówiąc: Fable 5.1 to przede wszystkim model do długich, samodzielnych łańcuchów pracy – badań, analiz, procesów o wielu krokach. Przy szybkim pojedynczym zadaniu przewaga jest niewielka.
Ile kosztuje Fable 5.1 – i dlaczego „ta sama cena" i tak wychodzi taniej
Ceny katalogowe przez interfejs dla programistów (API) się nie zmieniają – oszczędność leży gdzie indziej:
| Pozycja (za 1 mln tokenów) | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol* |
|---|---|---|---|---|
| Wejście | 10 $ | 10 $ | 5 $ | 4 $ |
| Wyjście | 50 $ | 50 $ | 25 $ | 20 $ |
| Wejście z pamięci podręcznej (cache) | 0,25 $ | 1,00 $ | — | — |
\* Cena promocyjna co najmniej do 21 listopada 2026 r.; cena katalogowa 5 $/30 $.
Tokeny to jednostka rozliczeniowa dostawców AI – z grubsza fragment słowa. I tu leży prawdziwa dźwignia cenowa: Fable 5.1 zużywa mniej tokenów na tę samą pracę. Anthropic szacuje oszczędność na około 25 procent przy typowych zadaniach i do 45 procent przy długich, samodzielnych łańcuchach pracy. Dostawca danych finansowych Bloomberg donosi z własnych testów, że model był około dwa razy szybszy niż Opus 5 i zużył o połowę mniej tokenów. Do tego dochodzi cena cache: kto wielokrotnie wysyła te same dokumenty – normalny przypadek przy dłuższych sesjach pracy – płaci za te powtórzenia już tylko jedną czwartą dotychczasowej ceny.
Który model do jakiego zadania? Trzy rekomendacje
Z połączenia ceny i wyników testów wynikają trzy proste zasady. Obowiązują na stan z września 2026 r. i opierają się na powyższych danych producenta:
- Codzienne zadania – teksty, e-maile, tłumaczenia, zwykłe programowanie: tu wystarczy klasa średnia. Claude Sonnet 5 (2 $/10 $ za milion tokenów) albo GPT-5.6 Sol (4 $/20 $) wykonują tę pracę za ułamek kosztów Fable; przy krótkich pojedynczych zadaniach różnica jakości jest ledwo odczuwalna. Kto pracuje w abonamencie Claude, oszczędza przy tym swój tygodniowy limit, bo Fable liczy się tam podwójnie (patrz niżej).
- Trudne pojedyncze zadania – zawiły błąd w kodzie, analiza umowy, złożona ocena: Claude Opus 5 (5 $/25 $) to tutaj optimum ceny do wydajności. W większości testów ustępuje Fable 5.1 tylko o kilka punktów, a kosztuje połowę.
- Długie, samodzielne łańcuchy pracy – research po wielu źródłach, wieloetapowa automatyzacja, analizy naukowe: tu Fable 5.1 wykorzystuje swoją przewagę, i to podwójnie: rozwiązuje znacznie więcej takich zadań (52,6% wobec 29,0% Opus 5 w teście naukowym) i potrzebuje do tego mniej tokenów. Przy tego rodzaju pracy droższy model może się ostatecznie okazać tańszy – licząc koszt ukończonego zadania, a nie pojedynczego zapytania.
Drobny druk przy limicie: +25% ogłoszone, −17% w praktyce
Równolegle do ogłoszenia modelu Anthropic zakomunikował zmianę limitów użycia: od 14 września 2026 r. standardowe tygodniowe limity w narzędziu programistycznym Claude Code rosną na stałe o 25 procent – dla planów Pro, Max, Team i miejsc Enterprise.
Czego w komunikacie brakuje: od maja obowiązuje tymczasowa podwyżka o 50 procent, kilkakrotnie przedłużana, która wygasa 13 września. Rachunek wygląda więc tak:
| Limit tygodniowy (baza = 100) | |
|---|---|
| Pierwotny limit | 100 |
| Dziś (tymczasowo +50%) | 150 |
| Od 14 września (na stałe +25% od starej bazy) | 125 |
Względem pierwotnego limitu to faktycznie 25 procent więcej. Względem tego, do czego użytkownicy przywykli od miesięcy, to około 17 procent mniej (125 zamiast 150). Oba stwierdzenia są prawdziwe – tyle że ogłoszenie opowiada pierwsze, a przemilcza drugie. Media branżowe, jak BleepingComputer, prześledziły to wyliczenie.
Dla modeli Fable w abonamencie zasada pozostaje bez zmian: na miejscach Max i premium można wydać na Fable najwyżej połowę tygodniowego limitu; potem trzeba dokupić kredyty albo przejść na mniejszy model. W planie Pro Fable działa od początku wyłącznie na płatnych kredytach. To, że Fable 5.1 oszczędniej gospodaruje tokenami, nieco to w praktyce łagodzi – ale samego limitu nie zmienia.
Jeśli planujesz, które narzędzia AI opłacają się w Twojej firmie: jak rozwijały się rodziny modeli Anthropic i OpenAI, przeczytasz w naszych artykułach o GPT-5.6 Sol, Terra i Luna oraz o burzliwej historii Claude Fable 5. Ten poradnik ukazuje się na office1.cloud, gdzie samozatrudnieni prowadzą też faktury i księgowość.
Latwiejsze fakturowanie
Easy Invoice laczy oferty, faktury i zarzadzanie klientami w chmurze.
Wyprobuj Easy Invoice