К Easy Invoice Cloud
Rukovodstvo PepperTools
Новости со всего мира

Вышел Claude Fable 5.1: что на самом деле говорят бенчмарки – и почему ваша квота с 14 сентября всё равно уменьшится

Anthropic выпустила Claude Fable 5.1: далеко впереди Opus 5 и GPT-5.6 Sol в тестах по науке и автоматизации, при этом примерно на 25% дешевле в использовании. Одновременно недельная квота Claude Code с 14 сентября фактически сокращается – хотя Anthropic подаёт это как повышение.

Вышел Claude Fable 5.1: что на самом деле говорят бенчмарки – и почему ваша квота с 14 сентября всё равно уменьшится

Обновление от 4 сентября 2026 года: OpenAI выпустила GPT-6 Astra. Что приходит в подписку ChatGPT и сколько это стоит — в GPT-6 Astra: доступность и цены.

1 сентября 2026 года Anthropic выпустила Claude Fable 5.1. В опубликованных тестах модель решает заметно больше задач, чем её предшественник Fable 5, чем более дешёвый Opus 5 и чем GPT-5.6 Sol от OpenAI – особенно в научных исследованиях и автоматизации бизнес-процессов. Цены за токен не изменились, но Fable 5.1 расходует их меньше: по данным Anthropic, типичные задачи обходятся примерно на 25 процентов дешевле. Однако есть подвох, и в анонсе его нет: с 14 сентября у подписчиков в Claude Code будет фактически примерно на 17 процентов меньше недельной квоты, чем сегодня, – хотя Anthropic преподносит изменение как «на 25 процентов больше использования». Расчёт – ниже.

Содержание

Что означают проценты в бенчмарках

Бенчмарк – это фиксированный набор экзаменационных задач, который все модели получают в одинаковых условиях, как контрольная работа, которую пишут несколько учеников. Процент показывает, сколько задач модель решила. «Terminal-Bench 4.0: 55,8%» означает: Fable 5.1 корректно выполнила 55,8 процента этих тестовых задач.

Три вещи помогают правильно читать цифры:

  1. 100 процентов не набирает ни одна модель. Задачи намеренно настолько сложны, что даже лучшие системы ошибаются. Поэтому 55 процентов может быть выдающимся результатом – важен отрыв от других моделей, а не абсолютное число.
  2. Каждый бенчмарк проверяет своё. Модель может быть сильной в тесте по программированию и слабой в научном – как ученик блистает в математике и буксует в английском.
  3. Одно число в таблице – не процент: GDPval-AA – это рейтинг Эло, как в шахматах. Оценщики сравнивают два ответа и выбирают победителя; из этого складывается рейтинговое число. 1 853 против 1 824 означает: Fable 5.1 выигрывает такие дуэли немного чаще, чем Opus 5.

И одна оговорка, справедливая для любого анонса модели: цифры исходят от самого производителя. Anthropic выбирает, какие тесты попадут в анонс, – вероятно, те, где её модель выглядит хорошо. Независимые перепроверки обычно появляются через дни, а то и недели.

Результаты бенчмарков в одной таблице

Все цифры – из анонса Anthropic от 1 сентября 2026 года. Лучшее значение выделено жирным.

Бенчмарк (что проверяет)Fable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1 (задачи научных исследований)52,6%24,7%29,0%22,4%
Terminal-Bench 4.0 (самостоятельная работа в командной строке)55,8%42,0%52,3%37,3%
AutomationBench (автоматизация бизнес-процессов)31,4%17,1%26,9%19,6%
GDPval-AA v2 (офисная и интеллектуальная работа, рейтинг Эло)1 8531 7231 8241 711
OSWorld 2.0 strict (управление компьютером как человек: окна, клики)41,7%36,1%39,6%
Humanity's Last Exam без инструментов (сложные экспертные знания из всех областей)60,9%57,8%56,6%
CursorBench 3.2.0 (программирование в редакторе кода)73,4%70,5%70,0%67,2%

Где Fable 5.1 действительно далеко впереди – а где нет

Таблица показывает две очень разные картины – в зависимости от того, куда смотреть.

Большие скачки – в двух типах задач. В задачах научных исследований (Terminal-Bench-Science) Fable 5.1 с 52,6 процента решает более чем вдвое больше задач, чем её собственный предшественник, – и оставляет далеко позади Opus 5 (29,0%) и GPT-5.6 Sol (22,4%). Похожая картина в автоматизации бизнес-процессов (AutomationBench): 31,4 процента против 17,1 процента у предшественника. Это ровно те длинные многошаговые задачи, где модель должна самостоятельно планировать, пользоваться инструментами и проверять промежуточные результаты. Anthropic приводит пример из исследований: при проектировании белковых связующих Fable 5.1 достигла доли попаданий почти 50 процентов, тогда как обычными считаются 10–15 процентов.

Небольшим остаётся отрыв в повседневном программировании и знаниях. В тесте редактора CursorBench Fable 5.1 отделяют от предшественника лишь 2,9 процентного пункта, в тесте знаний Humanity's Last Exam – 3,1. Кто использует модель для обычных задач с кодом и текстом, в повседневной работе разницы почти не заметит.

Коротко: Fable 5.1 – это прежде всего модель для длинных самостоятельных цепочек работы: исследований, анализа, многошаговых процессов. Для быстрой разовой задачи преимущество невелико.

Сколько стоит Fable 5.1 – и почему «та же цена» всё равно выходит дешевле

Прейскурантные цены через интерфейс для разработчиков (API) не изменились – экономия в другом:

Позиция (за 1 млн токенов)Fable 5.1Fable 5Opus 5GPT-5.6 Sol*
Ввод10 $10 $5 $4 $
Вывод50 $50 $25 $20 $
Кешированный ввод0,25 $1,00 $

\* Акционная цена как минимум до 21 ноября 2026 года; прейскурантная цена 5 $/30 $.

Токены – расчётная единица провайдеров ИИ, грубо говоря, фрагмент слова. И здесь настоящий ценовой рычаг: Fable 5.1 расходует меньше токенов на ту же работу. Anthropic оценивает экономию примерно в 25 процентов на типичных задачах и до 45 процентов на длинных самостоятельных цепочках работы. Поставщик финансовых данных Bloomberg сообщает по итогам собственных тестов, что модель была примерно вдвое быстрее Opus 5 и использовала вдвое меньше токенов. К этому добавляется цена кеша: кто многократно отправляет одни и те же документы – обычный случай при длинных рабочих сессиях, – платит за эти повторы лишь четверть прежней цены.

Какая модель для какой задачи? Три рекомендации

Из сочетания цены и результатов тестов следуют три простых правила. Они действительны на сентябрь 2026 года и опираются на приведённые выше данные производителя:

  1. Повседневные задачи – тексты, письма, переводы, обычное программирование: здесь достаточно среднего класса. Claude Sonnet 5 (2 $/10 $ за миллион токенов) или GPT-5.6 Sol (4 $/20 $) делают эту работу за долю стоимости Fable; на коротких разовых задачах разница в качестве почти не ощущается. Кто работает по подписке Claude, заодно бережёт свою недельную квоту: Fable там «весит» вдвое (см. ниже).
  2. Сложные разовые задачи – каверзная ошибка в коде, анализ договора, сложная оценка: Claude Opus 5 (5 $/25 $) – оптимум цены и качества. В большинстве тестов он отстаёт от Fable 5.1 лишь на несколько пунктов, но стоит вдвое дешевле.
  3. Длинные самостоятельные цепочки работы – исследование по многим источникам, многошаговая автоматизация, научный анализ: здесь Fable 5.1 реализует своё преимущество, причём дважды: она решает заметно больше таких задач (52,6% против 29,0% у Opus 5 в научном тесте) и тратит на это меньше токенов. В такой работе более дорогая модель может в итоге оказаться более дешёвой – если считать стоимость выполненной задачи, а не запроса.

Мелкий шрифт про квоту: анонсировано +25%, на практике −17%

Параллельно с анонсом модели Anthropic сообщила об изменении лимитов использования: с 14 сентября 2026 года стандартные недельные лимиты в инструменте программирования Claude Code навсегда вырастают на 25 процентов – для планов Pro, Max, Team и корпоративных мест Enterprise.

Чего в сообщении нет: с мая действует временное повышение на 50 процентов, несколько раз продлевавшееся, которое истекает 13 сентября. Поэтому расчёт выглядит так:

Недельная квота (база = 100)
Первоначальный лимит100
Сегодня (временно +50%)150
С 14 сентября (навсегда +25% к старой базе)125

По сравнению с первоначальным лимитом это действительно на 25 процентов больше. По сравнению с тем, к чему пользователи привыкли за месяцы, – примерно на 17 процентов меньше (125 вместо 150). Оба утверждения верны – просто анонс рассказывает первое и умалчивает второе. Отраслевые издания, такие как BleepingComputer, воспроизвели этот расчёт.

Для моделей Fable в подписках правило не меняется: на местах Max и premium на Fable можно потратить не более половины недельного лимита; дальше – докупать кредиты или переходить на меньшую модель. В плане Pro Fable с самого начала работает только на платных кредитах. То, что Fable 5.1 бережливее расходует токены, на практике это немного смягчает – но сам лимит не меняет.

Если вы прикидываете, какие инструменты ИИ окупятся в вашем деле: как развивались семейства моделей Anthropic и OpenAI, читайте в наших статьях о GPT-5.6 Sol, Terra и Luna и о бурной истории Claude Fable 5. Это руководство выходит на office1.cloud, где самозанятые ведут счета и бухгалтерию.

Об авторе

Charles Imilkowski

Разработчик программного обеспечения · PepperTools

Charles Imilkowski с 2014 года разрабатывает и продаёт собственное программное обеспечение для счетов и бухгалтерии в своей компании PepperTools. Кроме того, с 2004 года он работает разработчиком программного обеспечения, сегодня для средних предприятий, и создаёт интерфейсы между ERP-системами, такими как SAP, и бухгалтерскими решениями, такими как DATEV.

Prosche rabotat so schetami

Easy Invoice obiedinyaet predlozheniya, scheta i rabotu s klientami v oblake.

Poprobovat Easy Invoice

Yazykovye versii

DE Claude Fable 5.1 ist da: Was die Benchmarks wirklich sagen – und warum Ihr Kontingent ab 14. September trotzdem schrumpft ES Claude Fable 5.1 ya está aquí: lo que dicen de verdad los benchmarks – y por qué su cupo se reduce igualmente el 14 de septiembre PL Claude Fable 5.1 już jest: co naprawdę mówią benchmarki – i dlaczego od 14 września Twój limit i tak się kurczy EN Claude Fable 5.1 is here: what the benchmarks really say – and why your quota still shrinks on September 14 FR Claude Fable 5.1 est là : ce que disent vraiment les benchmarks – et pourquoi votre quota diminue quand même le 14 septembre TR Claude Fable 5.1 çıktı: Benchmark'lar gerçekten ne söylüyor – ve kotanız 14 Eylül'den itibaren neden yine de küçülüyor IT Claude Fable 5.1 è arrivato: cosa dicono davvero i benchmark – e perché dal 14 settembre la vostra quota si riduce comunque NL Claude Fable 5.1 is er: wat de benchmarks echt zeggen – en waarom uw tegoed vanaf 14 september toch krimpt