Fable 5.1 est le meilleur modèle de tous les temps (et moins cher que Fable 5)

CChase AI
Computing/Software

Transcript

00:00:00Fable 5.1 est donc là, et c'est mieux, moins cher,
00:00:02et aujourd'hui je vais vous dire
00:00:04tout ce que vous devez savoir à ce sujet.
00:00:05Alors tout d'abord, le prix.
00:00:07Fable 5.1 coûtera environ 25 % de moins que Fable 5,
00:00:11et c'est parce qu'ils réduisent le prix
00:00:13des lectures en cache.
00:00:14C'est énorme si vous faites beaucoup de travail d'agent de longue durée,
00:00:19et ils le soulignent spécifiquement,
00:00:21et votre réduction de coût peut aller jusqu'à 45 %
00:00:23dans ces cas où vous effectuez un travail
00:00:24qui comporte des milliers et des milliers de jetons,
00:00:27et que vous travaillez avec des longueurs de fenêtre de contexte
00:00:28de 50, 60, 70 %.
00:00:30Ils mettent à jour leur politique de conservation des données,
00:00:32ils l'introduisent progressivement pour leurs clients professionnels,
00:00:34et en ce qui concerne les protections,
00:00:35ils réduisent les faux positifs,
00:00:37ce qui était plutôt pénible
00:00:38avec le Fable 5 d'origine,
00:00:40parce que si vous lui posiez des questions
00:00:41liées à des sujets comme la cybersécurité,
00:00:43vous étiez constamment bloqué,
00:00:44et dans ce cas, il y a désormais 60 % de risques en moins
00:00:47d'avoir un faux positif.
00:00:49Jetons maintenant un œil aux benchmarks.
00:00:50De manière générale, il surpasse Fable 5, Opus 5
00:00:53et GPT 5.6 dans littéralement tous les domaines.
00:00:56Certains bonds sont d'ailleurs assez significatifs.
00:00:58Quand on regarde la recherche scientifique par agent,
00:01:00c'est le double de ce que faisait Fable 5.
00:01:03Le code par agent fait aussi un bond en avant considérable.
00:01:05On passe de 42 % avec Fable 5 à 55,8 avec Fable 5.1.
00:01:09Je me rappelle quand on avait regardé les benchmarks d'Opus 5,
00:01:11on était plutôt bluffés par ce qu'Opus 5 était capable de nous offrir
00:01:14en termes de chiffres bruts.
00:01:16En réalité, je pense que la plupart des gens préfèrent toujours Fable 5 à Opus 5,
00:01:19mais j'ai l'impression que la comparaison entre Fable 5 et 5.1
00:01:23est probablement un peu plus fidèle
00:01:24à ce que l'on ressent
00:01:26lorsqu'on l'utilise réellement.
00:01:28Au-delà de ça, la plupart des hausses de benchmarks
00:01:29sont relativement progressives.
00:01:31On parle de quelques pourcents par-ci par-là,
00:01:32à l'exception des flux de travail professionnels
00:01:34utilisant le benchmark d'automatisation.
00:01:37Maintenant, ce qui importe, ce n'est pas seulement le benchmark en soi,
00:01:39c'est combien nous payons pour ce genre de scores,
00:01:41et quel genre de changements nous observons
00:01:43quand on modifie le niveau d'effort ?
00:01:44Parce que c'est toujours très intéressant à observer,
00:01:46car souvent, lorsque nous regardons des niveaux d'effort
00:01:48très élevés ou max,
00:01:49nous n'en avons vraiment pas pour notre argent
00:01:51par rapport au niveau élevé ou même moyen.
00:01:53Nous avons donc ici le Terminal Bench 4.0.
00:01:56Nous avons Mythos 5.1 tout en haut,
00:01:59Fable 5.1 au milieu,
00:02:00et puis Mythos 5 en bas,
00:02:02et vous pouvez imaginer que Fable 5 est légèrement sous Mythos.
00:02:05Donc Fable 5.1 et Mythos 5.1,
00:02:07c'est évidemment un grand bond par rapport à Mythos 5,
00:02:10et c'est moins cher.
00:02:12Et ce qui est vraiment cool, c'est que si l'on regarde
00:02:13un niveau comme élevé par exemple,
00:02:15qui est là où se situent la plupart des gens je pense,
00:02:16j'utilise souvent le niveau moyen
00:02:17pour mes cas d'usage de Fable,
00:02:20vous obtenez essentiellement,
00:02:20si l'on regarde le niveau moyen,
00:02:21les performances maximales de Mythos 5,
00:02:25mais au lieu de coûter 26 $,
00:02:27ce serait 7,80 $.
00:02:30Et quand on passe à élevé,
00:02:32et qu'on compare le niveau élevé au niveau max disons,
00:02:34vous n'avez qu'un,
00:02:35comment dire, un changement de 6 % en termes de résultats,
00:02:38pourtant c'est 19,50 $contre 10,50$.
00:02:42Ce qui est vraiment chouette avec ces nouveaux modèles,
00:02:43c'est que vous pouvez obtenir des performances extrêmement élevées
00:02:45avec ces niveaux d'effort intermédiaires
00:02:47et faire de vraies économies sur les coûts.
00:02:50Et on observe le même schéma
00:02:52dans ces autres benchmarks, n'est-ce pas ?
00:02:53Il s'agit de Humanity's Last Exam.
00:02:55Encore une fois, on ne voit pas une hausse énorme
00:02:57quand on passe du niveau élevé au niveau max,
00:02:59pourtant on a de très bonnes performances
00:03:00à un coût plutôt raisonnable
00:03:02avec ces paramètres de niveau intermédiaire.
00:03:04La seule exception, c'est lorsqu'on regarde
00:03:05le code par agent sur Cursor Bench,
00:03:07avec Fable 5.1,
00:03:08on constate un saut assez élevé du niveau élevé au niveau très élevé,
00:03:11mais encore une fois, entre très élevé et max,
00:03:13pas grand-chose.
00:03:14Mais, vous savez, si je suis au niveau élevé,
00:03:15sur Fable 5.1,
00:03:17c'est la même chose que d'être au niveau très élevé
00:03:18avec Fable 5,
00:03:20pour moins de la moitié du coût.
00:03:22Donc d'immenses économies ici,
00:03:24même si vous n'êtes pas quelqu'un
00:03:25qui fait nécessairement un travail extrêmement complexe.
00:03:27Si vous êtes juste, entre guillemets,
00:03:29votre développeur solo moyen,
00:03:30vos problèmes ne sont pas si compliqués,
00:03:32mais vous aimez utiliser ces modèles de pointe,
00:03:33vous avez désormais la possibilité
00:03:34de simplement baisser le niveau d'effort
00:03:36et vous faites pratiquement
00:03:37ce que vous faisiez avant
00:03:38pour, je le redis, la moitié du coût,
00:03:40ce qui n'est pas négligeable.
00:03:41Maintenant, la recherche scientifique
00:03:42a toujours été un argument de vente majeur
00:03:44pour les modèles Fable et Mythos.
00:03:46Et avec la version 5.1,
00:03:48aucun changement de ce côté-là.
00:03:49Ils parlent beaucoup de conception moléculaire,
00:03:51d'analyse et de modélisation computationnelles,
00:03:53ainsi que de biologie computationnelle.
00:03:55Encore une fois, ce sont plutôt des problèmes de niche
00:03:57que certaines personnes résolvent,
00:03:58mais c'est toujours intéressant
00:04:00de voir ce qui se passe dans ces domaines
00:04:01par rapport à votre standard,
00:04:03à savoir ce que cela donne
00:04:03sur ce benchmark de code par agent.
00:04:05Et comme je le suggérais dans l'intro,
00:04:07il y a eu quelques changements
00:04:08en matière de sécurité
00:04:09et d'alignement.
00:04:09Vue d'ensemble :
00:04:11moins de faux positifs.
00:04:12Moins de faux positifs.
00:04:13Vous pouvez lui poser davantage de questions
00:04:14liées à des sujets comme la cybersécurité
00:04:15et il est assez intelligent
00:04:16pour ne pas paniquer
00:04:18et vous rediriger vers Opus
00:04:19quoi qu'il arrive.
00:04:20Si vous voulez aller vraiment en profondeur,
00:04:21très en profondeur sur le sujet,
00:04:21ils ont leur fiche de modèle
00:04:23que vous pouvez toujours consulter.
00:04:24C'est, vous savez,
00:04:25plusieurs centaines de pages de lecture,
00:04:27212 pour être exact,
00:04:28mais ils nous en donnent un bon résumé ici.
00:04:30Mais tout ce qui doit vous importer,
00:04:31c'est que ces garde-fous
00:04:32sont plus précis,
00:04:33ils risquent donc moins
00:04:34de signaler du contenu bénin
00:04:35et de vous basculer
00:04:36vers un modèle inférieur.
00:04:37Spécifiquement pour les questions de cybersécurité,
00:04:40les utilisateurs de Cloud Code
00:04:40peuvent s'attendre en moyenne
00:04:41à 60 % d'interventions en moins
00:04:43par session
00:04:44de la part de ces protections,
00:04:46ce qui est super
00:04:46si vous travaillez
00:04:47sur n'importe quel type d'application
00:04:48où vous devez poser des questions
00:04:49sur les meilleures pratiques de cybersécurité
00:04:51pour votre cas d'usage particulier.
00:04:53Ils ont
00:04:53un paragraphe intéressant ici
00:04:54qui parle
00:04:55des mécanismes anti-distillation,
00:04:57ce qui est une méthode
00:04:58qui est une méthode
00:04:59pour extraire l'essentiel
00:05:01de Fable 5
00:05:02et de Fable 5.1
00:05:03C'est un sujet
00:05:04assez important
00:05:05en lien avec
00:05:06les modèles open source.
00:05:07Vous avez probablement
00:05:08beaucoup entendu parler
00:05:08de tous ces excellents modèles
00:05:09open source
00:05:10et il ne fait aucun doute
00:05:11qu'il va y en avoir d'autres
00:05:13grâce à la distillation
00:05:14à partir de ces modèles de pointe.
00:05:15C'est donc le genre de sujet
00:05:17qu'il est bon
00:05:17de garder
00:05:18à l'œil.
00:05:18Cela ne vous affecte pas vraiment,
00:05:20l'utilisateur final,
00:05:21mais c'est, vous savez,
00:05:22une sorte de truc meta
00:05:23où l'on a tous ces
00:05:24modèles open source
00:05:25qui viennent de Chine,
00:05:26alors que la plupart
00:05:26des entreprises de pointe
00:05:27sont aux États-Unis.
00:05:28Et il y a toujours
00:05:29ce genre de discussions,
00:05:31disant que tous ces
00:05:32modèles open source
00:05:32font en réalité que piocher
00:05:33dans des projets comme
00:05:35Opus et Fable.
00:05:36Ils donnent un exemple
00:05:37de la façon dont cela fonctionne,
00:05:38où les nouveaux comptes API
00:05:39ne peuvent pas modifier
00:05:40le contexte préalable de Claude
00:05:42pour extraire essentiellement
00:05:43la façon dont Claude
00:05:44réfléchit
00:05:44et formule
00:05:45ses réponses.
00:05:46Et encore une fois,
00:05:46c'est spécifiquement
00:05:47pour les nouveaux comptes,
00:05:48donc si vous en avez déjà un,
00:05:48encore une fois,
00:05:49cela ne vous touchera pas vraiment.
00:05:50Maintenant, en ce qui concerne
00:05:51le coût et la disponibilité,
00:05:52disponibilité,
00:05:52c'est disponible
00:05:53partout dès maintenant.
00:05:54Coût.
00:05:55Par jeton,
00:05:56si l'on regarde,
00:05:56c'est exactement le même
00:05:58que Fable 5.
00:05:58On est à 10 dollars
00:05:59par million de jetons d'entrée
00:06:00et 50 dollars par million
00:06:02de jetons de sortie,
00:06:03mais en réalité,
00:06:04quand vous utilisez réellement ceci
00:06:05en termes de,
00:06:06eh bien, je lui fais faire
00:06:07cette tâche,
00:06:08cela va coûter moins cher
00:06:09et cela va coûter moins cher
00:06:10grâce aux lectures de cache.
00:06:12Maintenant, si vous n'avez aucune idée
00:06:12de ce qu'est la mise en cache de invites,
00:06:14vous pouvez regarder la vidéo
00:06:14que j'ai faite la semaine dernière
00:06:16où j'en parle.
00:06:18Essentiellement,
00:06:18c'est énorme
00:06:19si vous êtes quelqu'un
00:06:20qui effectue
00:06:20des tâches d'agents de longue durée.
00:06:23Vous avez donc des sessions
00:06:23très importantes,
00:06:25des tonnes de contexte,
00:06:26et vous l'utilisez
00:06:27de manière continue.
00:06:28Vous ne lui demandez pas de faire
00:06:29quelque chose
00:06:29pour revenir le lendemain.
00:06:30Vous ne faites que parler
00:06:31et parler et parler
00:06:32avec lui.
00:06:32Ces lectures de cache
00:06:33coûtent 75% de moins,
00:06:35ce qui représente un changement massif,
00:06:37qui est ce qui entraîne
00:06:39ces coûts réduits.
00:06:40Et ce graphique
00:06:41l'explique clairement ici.
00:06:42Cela peut faire environ
00:06:4225% de moins en termes
00:06:44de coût sur les tâches normales,
00:06:45mais encore une fois,
00:06:46pour les charges de travail très agentiques,
00:06:47jusqu'à 45% de moins.
00:06:49C'est donc très excitant
00:06:49d'obtenir une mise à niveau
00:06:50vers le modèle Fable.
00:06:51J'ai adoré Fable 5,
00:06:53c'était moyen
00:06:53quand il s'agissait d'Opus 5,
00:06:54mais pour ceux d'entre vous
00:06:55qui ont testé Fable en pratique,
00:06:56je pense que vous conviendrez
00:06:57qu'il y a définitivement
00:06:58un changement significatif
00:06:59dans ce que ce modèle nous apporte
00:07:01par rapport à tout le reste
00:07:02que nous avons obtenu
00:07:03jusqu'à présent
00:07:03de la part d'Anthropic.
00:07:04Avoir donc quelque chose
00:07:05qui est meilleur
00:07:06et moins cher,
00:07:07et pour lequel nous devons moins nous soucier
00:07:09en termes de garde-fous,
00:07:10je pense que c'est une excellente chose.
00:07:11Alors allez le découvrir sans plus tarder.
00:07:12Faites-moi savoir
00:07:13ce que vous en pensez.

Key Takeaway

Le modèle Fable 5.1 améliore toutes les performances de recherche et de code tout en réduisant les coûts de cache jusqu'à 75 % et les faux positifs de sécurité de 60 %.

Highlights

  • Le modèle Fable 5.1 coûte environ 25 % de moins que la version précédente grâce à une réduction du prix des lectures en cache.

  • Les tâches d'agents de longue durée bénéficient d'une réduction de coût pouvant atteindre 45 %.

  • Le taux de faux positifs des filtres de sécurité diminue de 60 % pour les requêtes liées à la cybersécurité.

  • Le benchmark de recherche scientifique par agent double ses performances par rapport à Fable 5.

  • Les lectures de cache coûtent 75 % de moins, ce qui réduit considérablement le coût total des sessions prolongées.

Timeline

Tarification et réductions des lectures en cache

  • Fable 5.1 réduit les prix d'environ 25 % par rapport à Fable 5.
  • Les travaux d'agents de longue durée atteignent 45 % de réduction de coût.
  • Les niveaux d'effort intermédiaires fournissent des performances maximales à moindre coût.

La baisse des tarifs provient principalement de la diminution du coût des lectures en cache. Les utilisateurs effectuant des flux de travail complexes avec de larges fenêtres de contexte réalisent des économies substantielles. Les paramètres de niveau moyen ou élevé suffisent pour obtenir des résultats proches du niveau maximum tout en divisant les dépenses par deux.

Performances des benchmarks et recherche scientifique

  • Fable 5.1 surpasse Fable 5, Opus 5 et GPT 5.6 dans l'ensemble des domaines.
  • La recherche scientifique par agent double ses résultats par rapport à Fable 5.
  • Le code par agent passe de 42 % à 55,8 % de réussite.

Les gains de performance se manifestent principalement dans la recherche scientifique par agent et le code par agent. Les domaines de niche tels que la conception moléculaire et la biologie computationnelle profitent directement de ces améliorations de calcul.

Sécurité, alignement et disponibilité

  • Les faux positifs liés à la cybersécurité diminuent de 60 %.
  • Les mécanismes anti-distillation protègent les données des nouveaux comptes API.
  • Le modèle est disponible immédiatement dans le monde entier au tarif de 10 dollars par million de jetons d'entrée et 50 dollars par million de jetons de sortie.

Les filtres de modération s'avèrent plus précis, ce qui évite de bloquer par erreur le contenu bénin ou les requêtes légitimes sur les meilleures pratiques de sécurité. Les tarifs bruts par jeton restent alignés sur ceux de Fable 5, mais l'optimisation du cache diminue la facture finale pour l'utilisateur.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video