Ir a Easy Invoice Cloud
Guia PepperTools
Noticias del mundo

Claude Fable 5.1 ya está aquí: lo que dicen de verdad los benchmarks – y por qué su cupo se reduce igualmente el 14 de septiembre

Anthropic lanza Claude Fable 5.1: muy por delante de Opus 5 y GPT-5.6 Sol en pruebas de ciencia y automatización, y un 25% más barato en el uso. Al mismo tiempo, el cupo semanal de Claude Code se reduce en neto desde el 14 de septiembre – aunque Anthropic lo presenta como un aumento.

Claude Fable 5.1 ya está aquí: lo que dicen de verdad los benchmarks – y por qué su cupo se reduce igualmente el 14 de septiembre

Actualización del 4 de septiembre de 2026: OpenAI ha publicado GPT-6 Astra. Qué llega a su suscripción de ChatGPT y qué cuesta: GPT-6 Astra: disponibilidad y precios.

Anthropic publicó Claude Fable 5.1 el 1 de septiembre de 2026. En las pruebas publicadas, el modelo resuelve bastantes más tareas que su predecesor Fable 5, que el más barato Opus 5 y que GPT-5.6 Sol de OpenAI – sobre todo en investigación científica y en la automatización de procesos empresariales. Los precios por token no cambian, pero Fable 5.1 consume menos: según Anthropic, las tareas típicas salen alrededor de un 25 por ciento más baratas. Aun así hay una pega, y no figura en el anuncio: desde el 14 de septiembre, los suscriptores tendrán en Claude Code en neto alrededor de un 17 por ciento menos de cupo semanal que hoy – aunque Anthropic presenta el cambio como «un 25 por ciento más de uso». El cálculo se explica más abajo.

Contenido

Qué significan los porcentajes en los benchmarks

Un benchmark es un conjunto fijo de ejercicios de examen que todos los modelos reciben en las mismas condiciones – como un examen que escriben varios alumnos. El porcentaje indica cuántos ejercicios resolvió el modelo. «Terminal-Bench 4.0: 55,8 %» significa, por tanto: Fable 5.1 completó correctamente el 55,8 por ciento de esos ejercicios.

Tres claves ayudan a situar las cifras:

  1. Ningún modelo llega al 100 por ciento. Los ejercicios son a propósito tan difíciles que incluso los mejores sistemas fallan. Un 55 por ciento puede ser, por tanto, una puntuación de élite – lo decisivo es la distancia con los demás modelos, no la cifra absoluta.
  2. Cada benchmark mide algo distinto. Un modelo puede ser fuerte en la prueba de programación y flojo en la científica, igual que un alumno brilla en matemáticas y sufre con el inglés.
  3. Una cifra de la tabla no es un porcentaje: GDPval-AA es una puntuación Elo como en el ajedrez. Los evaluadores comparan dos respuestas y eligen un ganador; de ahí sale una cifra de clasificación. 1.853 frente a 1.824 significa: Fable 5.1 gana esos duelos algo más a menudo que Opus 5.

Y una reserva que vale para todo anuncio de modelo: las cifras proceden del propio fabricante. Anthropic elige qué pruebas aparecen en el anuncio – previsiblemente aquellas en las que su modelo luce bien. Las repeticiones independientes suelen llegar días o semanas después.

Los resultados de los benchmarks de un vistazo

Todas las cifras proceden del anuncio de Anthropic del 1 de septiembre de 2026. El mejor valor va en negrita.

Benchmark (qué mide)Fable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.1 (tareas de investigación científica)52,6 %24,7 %29,0 %22,4 %
Terminal-Bench 4.0 (trabajo autónomo en la línea de comandos)55,8 %42,0 %52,3 %37,3 %
AutomationBench (automatización de procesos empresariales)31,4 %17,1 %26,9 %19,6 %
GDPval-AA v2 (trabajo de oficina y de conocimiento, puntuación Elo)1.8531.7231.8241.711
OSWorld 2.0 strict (manejar un ordenador como un humano: ventanas, clics)41,7 %36,1 %39,6 %
Humanity's Last Exam sin herramientas (conocimiento experto difícil de todas las áreas)60,9 %57,8 %56,6 %
CursorBench 3.2.0 (programar en un editor de código)73,4 %70,5 %70,0 %67,2 %

Dónde Fable 5.1 va realmente muy por delante – y dónde no

La tabla muestra dos imágenes muy distintas según dónde se mire.

Hay grandes saltos en dos tipos de tarea. En tareas de investigación científica (Terminal-Bench-Science), Fable 5.1 resuelve con un 52,6 por ciento más del doble de ejercicios que su propio predecesor – y deja muy atrás a Opus 5 (29,0 %) y GPT-5.6 Sol (22,4 %). Algo parecido en la automatización de procesos (AutomationBench): 31,4 por ciento frente al 17,1 por ciento del predecesor. Son exactamente las tareas largas y de varios pasos en las que el modelo debe planificar por su cuenta, usar herramientas y comprobar resultados intermedios. Anthropic cita un ejemplo de la investigación: al diseñar ligandos de proteínas, Fable 5.1 alcanzó una tasa de acierto de casi el 50 por ciento, donde lo habitual es entre el 10 y el 15 por ciento.

La distancia sigue siendo pequeña en la programación cotidiana y el conocimiento. En la prueba de editor CursorBench solo 2,9 puntos porcentuales separan a Fable 5.1 de su predecesor; en la prueba de conocimiento Humanity's Last Exam, 3,1. Quien use el modelo para tareas normales de código y texto apenas notará la diferencia en el día a día.

En resumen: Fable 5.1 es sobre todo un modelo para cadenas de trabajo largas y autónomas – investigación, análisis, procesos de muchos pasos. Para la tarea rápida y suelta, la ventaja es pequeña.

Cuánto cuesta Fable 5.1 – y por qué «mismo precio» sale igualmente más barato

Los precios de lista a través de la interfaz para desarrolladores (API) no cambian – el ahorro está en otra parte:

Concepto (por 1 millón de tokens)Fable 5.1Fable 5Opus 5GPT-5.6 Sol*
Entrada10 $10 $5 $4 $
Salida50 $50 $25 $20 $
Entradas guardadas (caché)0,25 $1,00 $

\* Precio promocional al menos hasta el 21 de noviembre de 2026; precio de lista 5 $/30 $.

Los tokens son la unidad de facturación de los proveedores de IA – a grandes rasgos, un fragmento de palabra. Y aquí está la verdadera palanca de precio: Fable 5.1 consume menos tokens para el mismo trabajo. Anthropic cifra el ahorro en torno al 25 por ciento en tareas típicas y hasta el 45 por ciento en cadenas de trabajo largas y autónomas. El proveedor de datos financieros Bloomberg informa, según sus propias pruebas, de que el modelo fue aproximadamente el doble de rápido que Opus 5 usando la mitad de tokens. A eso se suma el precio de la caché: quien envía varias veces los mismos documentos – el caso normal en sesiones de trabajo largas – paga por esas repeticiones solo una cuarta parte del precio anterior.

¿Qué modelo para qué tarea? Tres recomendaciones

De la combinación de precio y resultados de las pruebas salen tres reglas sencillas. Valen para septiembre de 2026 y se basan en las cifras del fabricante citadas arriba:

  1. Tareas cotidianas – textos, correos, traducciones, programación normal: aquí basta la gama media. Claude Sonnet 5 (2 $/10 $ por millón de tokens) o GPT-5.6 Sol (4 $/20 $) hacen este trabajo por una fracción del coste de Fable; en tareas cortas y sueltas la diferencia de calidad apenas se nota. Quien trabaje con una suscripción de Claude protege además su cupo semanal, porque allí Fable pesa el doble (ver abajo).
  2. Tareas sueltas exigentes – un error de programación enrevesado, el análisis de un contrato, una evaluación compleja: Claude Opus 5 (5 $/25 $) es aquí el punto óptimo de precio y rendimiento. En la mayoría de las pruebas queda solo unos puntos por detrás de Fable 5.1, pero cuesta la mitad.
  3. Cadenas de trabajo largas y autónomas – investigación en muchas fuentes, automatización de varios pasos, análisis científicos: aquí Fable 5.1 explota su ventaja, y por partida doble: resuelve bastantes más tareas de este tipo (52,6 % frente al 29,0 % de Opus 5 en la prueba científica) y necesita menos tokens para hacerlo. En este tipo de trabajo, el modelo más caro puede acabar siendo el más barato – medido en coste por tarea completada, no por petición.

La letra pequeña del cupo: +25% anunciado, −17% en la práctica

En paralelo al anuncio del modelo, Anthropic comunicó un cambio en los límites de uso: desde el 14 de septiembre de 2026, los límites semanales estándar de la herramienta de programación Claude Code suben de forma permanente un 25 por ciento – para los planes Pro, Max, Team y los puestos Enterprise.

Lo que falta en la comunicación: desde mayo rige un aumento temporal del 50 por ciento, prorrogado varias veces, que expira el 13 de septiembre. El cálculo queda así:

Cupo semanal (base = 100)
Límite original100
Hoy (temporal +50 %)150
Desde el 14 de septiembre (permanente +25 % sobre la base antigua)125

Respecto al límite original, es efectivamente un 25 por ciento más. Respecto a lo que los usuarios llevan meses acostumbrados, es alrededor de un 17 por ciento menos (125 en lugar de 150). Ambas afirmaciones son ciertas – solo que el anuncio cuenta la primera y calla la segunda. Medios especializados como BleepingComputer han rehecho el cálculo.

Para los modelos Fable en suscripción, la regla no cambia: en los puestos Max y premium puede gastar como máximo la mitad de su límite semanal en Fable; después toca comprar crédito extra o cambiar a un modelo más pequeño. En el plan Pro, Fable funciona desde el principio solo con créditos de pago. Que Fable 5.1 sea más ahorrador con los tokens lo suaviza en la práctica – pero no cambia nada en el límite en sí.

Si está valorando qué herramientas de IA compensan en su negocio: cómo han evolucionado las familias de modelos de Anthropic y OpenAI lo puede leer en nuestros artículos sobre GPT-5.6 Sol, Terra y Luna y la agitada historia de Claude Fable 5. Esta guía se publica en office1.cloud, donde los autónomos también gestionan facturas y contabilidad.

Sobre el autor

Charles Imilkowski

Desarrollador de software · PepperTools

Charles Imilkowski desarrolla y comercializa desde 2014, con su empresa PepperTools, su propio software de facturación y contabilidad. Además, trabaja desde 2004 como desarrollador de software, hoy para empresas medianas, y crea interfaces entre sistemas ERP como SAP y soluciones contables como DATEV.

Gestiona facturas con mas facilidad

Easy Invoice combina presupuestos, facturas y gestion de clientes en la nube.

Probar Easy Invoice

Versiones de idioma

DE Claude Fable 5.1 ist da: Was die Benchmarks wirklich sagen – und warum Ihr Kontingent ab 14. September trotzdem schrumpft PL Claude Fable 5.1 już jest: co naprawdę mówią benchmarki – i dlaczego od 14 września Twój limit i tak się kurczy EN Claude Fable 5.1 is here: what the benchmarks really say – and why your quota still shrinks on September 14 FR Claude Fable 5.1 est là : ce que disent vraiment les benchmarks – et pourquoi votre quota diminue quand même le 14 septembre TR Claude Fable 5.1 çıktı: Benchmark'lar gerçekten ne söylüyor – ve kotanız 14 Eylül'den itibaren neden yine de küçülüyor RU Вышел Claude Fable 5.1: что на самом деле говорят бенчмарки – и почему ваша квота с 14 сентября всё равно уменьшится IT Claude Fable 5.1 è arrivato: cosa dicono davvero i benchmark – e perché dal 14 settembre la vostra quota si riduce comunque NL Claude Fable 5.1 is er: wat de benchmarks echt zeggen – en waarom uw tegoed vanaf 14 september toch krimpt