Moteurs de réponse

Claude Fable 5.1 et Mythos 5.1 : ce qui change vraiment

Anthropic publie deux modèles qui n'en sont qu'un seul, séparés par leurs garde-fous. Les chiffres de l'annonce, le prix qui baisse, et ce qu'elle tait.

Portrait de Abderrahim ELBAHI

Abderrahim ELBAHI

Fondateur et Directeur Général

Profil LinkedIn

Publié le , mis à jour le · 6 min de lecture

Carte d'annonce d'Anthropic : le titre « Claude Fable 5.1 and Mythos 5.1 » composé en blanc sur un ciel bleu parcouru de nuages roses, un croissant de lune en haut à droite

Anthropic a annoncé le 1er septembre 2026 deux modèles, Claude Fable 5.1 et Claude Mythos 5.1. Ce sont le même modèle, séparés par leurs seuls garde-fous : Fable est ouvert à tous, Mythos est réservé à des programmes vérifiés en cybersécurité et en sciences du vivant. C’est la distinction la moins reprise, et c’est la plus structurante.

Deux noms, un seul modèle — et c’est le point à retenir

La plupart des annonces de ce type opposent une version rapide à une version puissante. Ici, non. La page d’annonce d’Anthropic l’écrit sans ambiguïté : les deux modèles sont identiques, seuls diffèrent les niveaux de protection appliqués par-dessus.

Mythos 5.1 n’est pas achetable. Il passe par deux programmes de vérification — l’un pour la sécurité défensive, l’autre pour les sciences du vivant, mené avec le gouvernement américain — et n’est ouvert qu’à un ensemble d’organisations américaines.

Ce que ça dit du secteur : le facteur limitant n’est plus la capacité du modèle, c’est ce qu’on l’autorise à faire. Deux clients peuvent recevoir exactement les mêmes poids et obtenir des réponses différentes, non pas parce que l’un paie davantage, mais parce que l’un a été vérifié.

Ce que disent les mesures

Sur Terminal-Bench 4.0, un test d’exécution de tâches en ligne de commande, Fable 5.1 obtient 55,8 % contre 42,0 % pour Fable 5 et 52,3 % pour Opus 5. Mythos 5.1, avec ses garde-fous propres, monte à 60,9 %. Tous ces chiffres sont ceux publiés par Anthropic — aucun n’a été rejoué de notre côté.

Diagramme en barres comparant les scores Terminal-Bench 4.0 de cinq modèles, Mythos 5.1 en tête devant Fable 5.1, puis Opus 5, Fable 5 et GPT-5.6 Sol
Terminal-Bench 4.0 mesure l'exécution de tâches en ligne de commande. Les cinq valeurs sont celles publiées par Anthropic ; aucune n'a été rejouée de notre côté.

L’écart le plus large n’est pas sur le code mais sur les tâches scientifiques :

Fable 5.152,6 %Opus 529,0 %Fable 524,7 %GPT-5.6 Sol22,4 %

Sur Terminal-Bench-Science 0.1, Fable 5.1 fait 52,6 % quand Fable 5 faisait 24,7 %. Le score double. Sur AutomationBench, il passe de 17,1 % à 31,4 %. Sur les autres tests, les gains sont réels mais modestes : Humanity’s Last Exam sans outils va de 57,8 % à 60,9 %, CursorBench de 70,5 % à 73,4 %.

Lire un tableau de scores demande de savoir ce que chaque test mesure. Un doublement sur un test scientifique et trois points sur un test de connaissances générales ne racontent pas la même histoire : le premier suggère une capacité qui n’existait pas, le second une amélioration continue.

Le prix baisse, et c’est le cache qui le fait

Le tarif au million de jetons ne bouge pas. Ce qui change est la lecture de cache — le poste facturé quand le modèle relit un contexte déjà traité —, dont le prix baisse de 75 % selon l’annonce d’Anthropic.

La même page annonce une baisse de coût d’environ 25 % sur une charge de travail ordinaire, et jusqu’à 45 % sur les tâches très agentiques.

L’écart entre ces deux valeurs s’explique de lui-même : plus un agent relit un contexte déjà traité, plus la remise sur le cache pèse dans sa facture. Une intégration qui envoie à chaque appel un contexte neuf n’en verra presque rien.

Les montants exacts ne sont pas repris ici — ce site réserve les grilles tarifaires à une seule page, la sienne, et mêler un tarif d’éditeur à nos propres prix n’apporterait rien au lecteur. Ils figurent sur la page d’Anthropic liée ci-dessus.

Ce que ça change pour un projet francophone

Rien d’immédiat, et c’est honnête de le dire. Un modèle plus économique sur les tâches répétitives déplace le seuil à partir duquel une automatisation devient rentable — mais ce seuil dépend surtout de votre volume, pas du tarif affiché.

Le point réellement actionnable est ailleurs : la baisse porte sur le cache, donc sur l’architecture de vos appels, pas sur votre facture par défaut. Une intégration qui ne met rien en cache ne bénéficiera d’aucune des deux remises annoncées.

Ce que l’annonce ne dit pas

Trois réserves, qui n’enlèvent rien aux chiffres mais qu’il faut poser.

Les résultats sont ceux de l’éditeur. Ils sont publiés, datés et reproductibles en principe ; ils n’ont pas été rejoués par un tiers indépendant, ni par nous. Un score de test n’est pas une mesure d’usage.

Les garde-fous se mesurent en taux, pas en garanties. L’annonce indique que les protections en biologie se déclenchent 85 % moins souvent sur des questions bénignes, et 60 % de faux positifs en moins côté cybersécurité. Ce sont des réductions de gêne, pas des promesses de sécurité, et l’annonce ne les présente pas autrement.

Mythos 5.1 est hors de portée pour l’immense majorité des équipes. Réservé à des organisations américaines vérifiées, il n’entre dans aucune décision d’outillage pour une agence marocaine ou européenne. Sa présence dans les tableaux de résultats ne doit pas laisser croire l’inverse.

En pratique

Si vous utilisez déjà l’API d’Anthropic, la seule chose à regarder cette semaine est votre taux de lecture de cache : c’est lui qui décide si la baisse annoncée vous concerne. Si vous ne l’utilisez pas, cette annonce ne change pas votre feuille de route — elle confirme une direction, celle d’un coût qui baisse plus vite sur le contexte relu que sur le calcul neuf.

Partager

Sur le même sujet

Visibilité IA

À lire ensuite

Démarrer

Exposez votre besoin