24 heures folles au pays des modèles d'IA
MMaximilian Schwarzmüller
Computing/SoftwareBusiness NewsInternet Technology
Transcript
00:00:00Au cours des dernières 36 heures, beaucoup de nouveaux modèles d'IA sont sortis, et vous verrez plein de vidéos à leur sujet, j'en suis sûr.
00:00:06Dans cette vidéo, je vais simplement vous dire quel était le meilleur, quel est le décevant,
00:00:11le moyen, celui qui est passé sous le radar et que nous avons tous manqué, ou la plupart d'entre nous,
00:00:15et les stars pas si cachées que ça, afin que vous sachiez quel modèle utiliser pour quoi.
00:00:19Je ne vais même pas faire durer le suspense, je vais vous donner le meilleur tout de suite.
00:00:25Sans surprise probablement, il s'agit d'Opus 5.5.
00:00:29Claude a sorti ou annoncé Opus 5.5 il y a quelques heures, vous pouvez déjà l'utiliser dans Claude Code avec votre abonnement.
00:00:37Et bien sûr, comme toujours, nous avons des chiffres de benchmark incroyables, il est globalement meilleur que les autres modèles phares dans la plupart de ces domaines.
00:00:45Et bien sûr, il faut prendre cela avec des pincettes, vous savez tous comment fonctionnent ces benchmarks.
00:00:51C'est facile et courant d'optimiser les modèles pour qu'ils réussissent les benchmarks. Nous avons eu des modèles avec d'excellents chiffres
00:00:59mais qui ne performaient pas si bien en pratique, mais évidemment, on regarde ces chiffres et oui, Opus 5.5 y est très impressionnant.
00:01:06Maintenant, ils ont eux-mêmes partagé plus de détails, par exemple, et c'est important, le fait qu'il soit moins cher.
00:01:13Et il n'est pas seulement moins cher comparé à Opus 5 concernant le coût des tokens d'entrée et de sortie, il consomme moins de puissance de calcul et semble plus efficace.
00:01:24Ils disent donc qu'il devrait coûter environ 40 % de moins qu'Opus 5, ce qui signifie aussi, selon moi, qu'il durera plus longtemps dans votre forfait. Si vous avez l'abonnement Claude, vous devriez pouvoir faire plus d'usage d'Opus.
00:01:40C'est aussi intéressant si l'on regarde des comparaisons comme celle-ci, où l'on voit le coût par tentative (plus c'est bas, mieux c'est) et le score (plus c'est haut, mieux c'est). On constate qu'Opus surpasse largement, d'après ce benchmark, non seulement GPT-6 Astra, mais aussi Fable, qui est le point vert.
00:02:02Ce qui signifie en quelque sorte qu'il n'y a plus vraiment de raison de recourir à Fable désormais, si l'on se fie à ces benchmarks, car Opus est tout simplement meilleur.
00:02:14Et particulièrement, l'utilisation élevée ici semble être un vrai point idéal, d'après ce benchmark en tout cas (il y en a d'autres, bien sûr), car vous obtenez un score très élevé pour un coût bien inférieur à ce que vous donnerait Fable.
00:02:29Gardez à l'esprit qu'il s'agit d'une échelle logarithmique.
00:02:31On peut aussi le voir sur ce graphique, qui inclut plus de modèles, où j'ai surligné le dernier modèle Opus, Fable et Astra. La courbe du dernier Opus 5.5 nous offre une intelligence supérieure sur tous les niveaux de raisonnement avec un coût généralement plus bas, surtout comparé à Fable, où le niveau de raisonnement maximal de Fable donne une intelligence inférieure et coûte plus cher que le niveau d'effort maximal d'Opus 5.5.
00:03:00Bien sûr, les benchmarks ne sont que ce qu'ils sont, comme je l'ai dit, mais d'après les retours que j'ai vus sur X, les gens semblent aussi très satisfaits d'Opus 5.5.
00:03:10Encore une fois, soyons prudents. On sait tous que dès qu'un nouveau modèle sort, les influenceurs habituels débarquent en disant qu'ils peuvent enfin en parler, que c'est incroyable, le meilleur, et patati et patata, vous connaissez la chanson.
00:03:23Mais j'ai vu de plus en plus de publications de personnes qui ne semblent pas être ces influenceurs, qui ont l'air sincèrement impressionnées par le modèle. Et lors de mes premiers essais, il m'a aussi semblé intelligent, respectant bien les instructions, résolvant des problèmes complexes et, aspect non négligeable,
00:03:43c'est quelque chose qu'Anthropic a également annoncé dans son post sur X : il communique bien mieux.
00:03:49Et ils ont montré cette comparaison ici : il ne crache plus de longues explications ou de pavés remplis de jargon, mais se montre au contraire plus concis et vous donne la réponse recherchée dans un langage naturel.
00:04:05Et c'est quelque chose que je peux aussi confirmer, il est bien meilleur là-dessus.
00:04:10Ça semble donc être un modèle vraiment incroyable.
00:04:13Et si vous avez un abonnement Anthropic ou Claude, c'est une évidence selon moi de l'utiliser.
00:04:19Actuellement, je ne vois pas vraiment pourquoi vous utiliseriez encore Fable 5.1 dans certaines situations, mais je dois faire plus de tests là-dessus.
00:04:28C'est définitivement le choix par défaut par rapport à Opus 5, bien sûr.
00:04:31Et si vous n'avez pas encore d'abonnement Claude, cela pourrait être une bonne raison de sauter le pas.
00:04:35Maintenant, avant de me plonger dans tous ces autres modèles, c'est probablement le bon moment pour un peu d me concernant.
00:04:42Je lance un programme (il n'est pas encore disponible, mais vous pouvez vous inscrire pour être notifié à l'ouverture des inscriptions) où je partage la façon dont je développe des applications web avec l'IA.
00:04:53C'est un programme de deux semaines. Je vous guiderai à travers tout le processus : recherche, planification, configuration du projet, mise en place des garde-fous, discussion des contraintes, conception de l'architecture système, en utilisant ma stack technique préférée, Alchemy Cloudflare.
00:05:10L'objectif est de vous montrer et de vous embarquer avec moi sur la façon dont je développe avec l'IA, sans coder au pif, sans me perdre, et avec d'excellents résultats.
00:05:19À la fin de ce programme de deux semaines, nous aurons une application terminée.
00:05:22Et donc, oui, vous trouverez un lien ci-dessous, évidemment.
00:05:25Si cela vous intéresse, inscrivez-vous pour savoir quand les inscriptions ouvriront.
00:05:30Le modèle décevant n'est pas GPT-6 Sol, nous en parlerons bientôt.
00:05:35Ce n'est pas le gagnant, mais ce n'est pas non plus le plus décevant.
00:05:38Le décevant, c'est plutôt Grok 4.7.
00:05:42Sorti il y a environ 30 heures, je crois.
00:05:48Là aussi, des chiffres de benchmark impressionnants, même si, pour être honnête, ce n'est pas le gagnant incontesté dans toutes ces catégories.
00:05:56Il n'est en fait le gagnant que dans deux des catégories ici, et aucune ne concerne le codage dans ce benchmark publié.
00:06:03Mais c'est une avancée en ingénierie logicielle par rapport à la version 4.6, par exemple, et le prix reste le même.
00:06:10Tout va bien alors ?
00:06:11Eh bien non.
00:06:12Grok 4.7 mérite cette place ici parce que dans mes tests, tout comme dans ce qu'on peut lire d'autres utilisateurs,
00:06:23il n'est tout simplement pas très efficace.
00:06:26Il est lent et prend énormément de temps pour accomplir les tâches.
00:06:31J'ai trouvé plusieurs posts de ce genre où les gens mentionnent essentiellement qu'il consomme juste plus de ressources
00:06:38sans sembler plus intelligent que le 4.6.
00:06:42Mon expérience personnelle a été exactement la même.
00:06:46Je l'ai utilisé pour diverses tâches et ce n'était pas mauvais.
00:06:50Ce n'est pas un mauvais modèle, évidemment.
00:06:52C'est juste qu'il ne représente pas une grande avancée par rapport au 4.6, apparemment, et il était nettement plus lent tout en consommant plus de tokens.
00:07:01Donc pour Grok, vous devriez continuer d'utiliser Grok 4.6 au lieu du 4.7.
00:07:09Je ne pense pas que la mise à niveau en vaille la peine, du moins pour l'instant.
00:07:12S'ils l'améliorent encore, s'ils ajustent les prix ou quelque chose du genre, les choses évolueront peut-être.
00:07:17Mais à l'heure actuelle, c'est le modèle décevant.
00:07:20Maintenant, quel est le modèle passable ?
00:07:22Eh bien, vous l'avez peut-être déjà deviné.
00:07:24Il s'agit de GPT-6 Sol.
00:07:27Nous n'avons pas seulement eu droit à Opus 5.5.
00:07:30Nous avons aussi eu GPT-6 Sol par OpenAI.
00:07:33Et c'est lui, le modèle moyen.
00:07:37Astra GPT-6 est un plutôt bon modèle.
00:07:40Il a ses particularités.
00:07:41Il peut être un peu difficile à maîtriser et à exploiter au maximum.
00:07:47Mais c'est un bon modèle d'après mon expérience.
00:07:50GPT-6 Sol, et c'est important, est aussi un bon modèle.
00:07:54Si nous n'avions pas eu Opus 5.5 hier, l'accueil aurait été bien meilleur, j'imagine.
00:08:02Mais il donne juste l'impression d'être un modèle qui ne trouve pas vraiment sa place.
00:08:09Si l'on jette un œil au benchmark officiel ici, les chiffres de l'Automation Bench publiés par OpenAI,
00:08:15on constate que GPT-6 Sol est plus intelligent et plus rentable que le 5.6 Sol.
00:08:23Et c'est en effet ainsi qu'il faut le voir, et c'est comme ça qu'ils veulent qu'on le voie.
00:08:28C'est une meilleure version de 5.6 Sol.
00:08:31Il est moins bon, en termes d'intelligence, qu'Astra cependant.
00:08:36Il est en revanche plus économique.
00:08:38Et c'est bien pour cela qu'il est juste « bof ».
00:08:40Il n'est pas décevant.
00:08:42Il fait ce pour quoi il a été conçu : être un meilleur 5.6 Sol.
00:08:48Il n'est simplement pas au même niveau qu'Astra sur le plan de l'intelligence.
00:08:54Il y a un grand écart, rien que dans ce benchmark.
00:08:58Il est en revanche plus rentable.
00:09:00L'idée est donc qu'avec ChatGPT, dans le cadre de votre abonnement OpenAI,
00:09:06vous rentabilisiez davantage votre forfait,
00:09:09et que vous utilisiez GPT-6 Sol pour toutes les tâches
00:09:12qui ne nécessitent pas le plus haut niveau d'intelligence.
00:09:16Le problème, c'est que c'est simplement qu'avec Opus 5.5,
00:09:21ce n'est pas un compromis que vous devez faire.
00:09:24Bien sûr, nous aurons probablement bientôt un Fable 5.5 ou autre,
00:09:29et la donne changera à nouveau.
00:09:30Mais avec le lancement d'hier,
00:09:32nous avons essentiellement un modèle Opus,
00:09:35qui est moins cher que Fable,
00:09:37et qui est meilleur que Fable.
00:09:40Ou du moins du même niveau, selon la façon dont on le regarde.
00:09:43Pour GPT-6 Sol, ce n'est pas le cas.
00:09:46Il est clairement moins bon qu'Astra.
00:09:50Maintenant, je dois encore faire plus de tests de mon côté
00:09:53pour voir ce que j'en pense dans mes projets.
00:09:55Et il est certain que, du moins pour l'instant,
00:09:58je me vois l'utiliser pour pas mal de travail au quotidien
00:10:02en raison de sa rentabilité accrue.
00:10:06Mais lorsque vous travaillez sur des projets complexes,
00:10:09vous voulez vraiment viser le plus haut niveau d'intelligence possible.
00:10:13C'est la raison pour laquelle, auparavant,
00:10:15vous auriez probablement dû utiliser Fable
00:10:17plutôt que de vous contenter d'Opus 5 pour tout,
00:10:21ou de GPT-5.6 Sol pour tout.
00:10:25C'est la raison pour laquelle vous voulez utiliser Astra
00:10:27et le garder sous contrôle,
00:10:29et peut-être pas GPT-6 Sol.
00:10:33C'est donc un modèle sans plus.
00:10:35Il a sa raison d'être.
00:10:36Il a son utilité.
00:10:39Il est juste un peu plus limité,
00:10:41et il faut y réfléchir à deux fois
00:10:43contrairement à Opus 5.5.
00:10:46Pour celui-ci, pas besoin de trop réfléchir.
00:10:48On peut le voir sur cet indice d'intelligence
00:10:50par rapport au coût par graphique d'intelligence ici
00:10:54sur Artificial Analysis.
00:10:57Voici Opus 5.5,
00:10:59qui correspond à la ligne tout en haut.
00:11:02Je vous ai montré ça plus tôt.
00:11:03Et GPT-6 Sol,
00:11:05qui correspond à cette ligne noire.
00:11:07L'autre ligne noire ici représente Astra.
00:11:09Qui, comme vous pouvez le voir,
00:11:10est un peu moins bon qu'Opus 5.5,
00:11:12mais reste performant,
00:11:13bien que coûteux.
00:11:15GPT-6 Sol est plus limité,
00:11:18si l'on peut dire ainsi,
00:11:19mais moins cher.
00:11:21Donc, oui, c'est assez moyen.
00:11:24Si vous avez un abonnement ChatGPT
00:11:26et que c'est votre seul abonnement,
00:11:28et que vous l'utilisez pour coder,
00:11:30ma recommandation serait
00:11:31de vous en tenir à Astra
00:11:33et de ne passer à GPT-6 Sol
00:11:36que si vous êtes vraiment limité
00:11:37dans votre utilisation
00:11:38et/ou si vous vous attaquez à
00:11:41des tâches plus petites et moins complexes,
00:11:45j'imagine.
00:11:46Mais encore une fois,
00:11:47ce n'est peut-être pas la bonne méthode
00:11:48pour faire de l'ingénierie par agents,
00:11:50pour programmer avec l'IA.
00:11:51Mais malgré tout,
00:11:52c'est ainsi que je l'utiliserais
00:11:53si je devais l'utiliser.
00:11:54Si vous avez le choix,
00:11:56en ce moment,
00:11:56Opus 5.5 est probablement la meilleure option.
00:11:59Maintenant, avant de passer à celui qui est négligé,
00:12:01parlons de
00:12:01la star pas si cachée que ça,
00:12:03car il s'agit d'un modèle GPT-6,
00:12:06mais c'est Luna.
00:12:08Je précise tout de suite,
00:12:09ce n'est pas un modèle
00:12:11qui convient à tous les cas d'utilisation.
00:12:14Ce n'est clairement pas le modèle
00:12:15que l'on veut utiliser pour du codage
00:12:18complexe, ni même classique,
00:12:22ou pour des tâches avec l'IA.
00:12:25Mais GPT-5.6 Luna
00:12:26était déjà assez intéressant
00:12:28pour certains cas.
00:12:29Et pour GPT-6 Luna,
00:12:31c'est vrai aussi.
00:12:32Et encore une fois,
00:12:33je reviens
00:12:33à ce benchmark officiel ici.
00:12:36Ce qui est important ici,
00:12:38c'est que l'axe des x
00:12:40est une échelle logarithmique.
00:12:41Elle n'est pas linéaire.
00:12:43Et cela dessert
00:12:45GPT-6 Luna,
00:12:47qui est ce graphique ici,
00:12:48en réalité.
00:12:50Cela le fait paraître pire
00:12:51qu'il ne l'est,
00:12:51car ce modèle
00:12:53ne coûte trois fois rien.
00:12:55La version d'effort maximal
00:12:59de ce modèle
00:13:00revient à moins de 5 cents
00:13:04par tâche
00:13:05dans ce benchmark.
00:13:07L'intelligence
00:13:08est au même niveau
00:13:11que GPT-5.6 Sol
00:13:15en réglage d'effort moyen,
00:13:18ou le modèle
00:13:22GPT-6 Sol
00:13:23en réglage d'effort faible.
00:13:26Donc à nouveau,
00:13:27ce n'est évidemment
00:13:28pas forcément
00:13:28ce qu'on veut utiliser
00:13:29pour du codage de pointe.
00:13:32Mais pour des tâches triviales
00:13:34et pour des tâches hors codage,
00:13:37c'est vraiment
00:13:38un modèle à envisager,
00:13:39car tout le monde
00:13:39ne fait pas du code
00:13:40toute la journée.
00:13:41Et ce modèle
00:13:42est pratiquement gratuit
00:13:44dans votre abonnement,
00:13:45ainsi que si vous l'utilisez
00:13:47via l'API.
00:13:49Je veux dire,
00:13:49si vous voulez
00:13:50la meilleure version d'Astra,
00:13:52la version la plus puissante
00:13:53d'Astra,
00:13:54on est sur
00:13:56un peu moins de
00:13:57deux dollars
00:13:58par tâche ici.
00:14:00La meilleure version de Luna,
00:14:01qui est bien sûr
00:14:02beaucoup moins intelligente,
00:14:03mais encore une fois,
00:14:04super pour certains usages,
00:14:05parfait,
00:14:06coûte une fraction de cela.
00:14:09Et c'est pourquoi
00:14:10je voulais lui faire
00:14:10un clin d'œil,
00:14:11pour ainsi dire.
00:14:12Pourquoi je veux
00:14:13que vous le sachiez.
00:14:14GPT-6 Luna
00:14:15est en fait
00:14:17un excellent modèle
00:14:19chaque fois que vous n'avez pas
00:14:21besoin d'une intelligence
00:14:23de premier ordre.
00:14:24Donc,
00:14:25si vous avez
00:14:26des tâches plus triviales,
00:14:29des tâches
00:14:30où, peut-être,
00:14:31un paquet de données
00:14:33doit être
00:14:34converti
00:14:35d'un format A
00:14:36vers un format B
00:14:37ou ce genre de chose,
00:14:38tout ce qui ne demande
00:14:39pas énormément
00:14:40d'intelligence,
00:14:41mais où il vous faut
00:14:42un bourreau de travail,
00:14:45regardez Luna.
00:14:46C'est peut-être
00:14:46une bonne idée.
00:14:48Et pour être
00:14:48bien clair,
00:14:49c'est beaucoup
00:14:51moins intelligent
00:14:52qu'Astra.
00:14:53Il surpasse
00:14:54facilement tous les modèles
00:14:55qu'on avait il y a un an
00:14:57ou deux
00:14:57sur le niveau
00:14:58de raisonnement maximal.
00:14:59C'est une sorte
00:15:00de gestion des attentes
00:15:01qu'il faut faire ici,
00:15:02mais c'est vraiment
00:15:04quelque chose qu'il ne faut pas
00:15:05délaisser.
00:15:06Quel est celui
00:15:07qui est sous-estimé,
00:15:08selon moi,
00:15:09et je parle
00:15:10uniquement
00:15:11des lancements récents,
00:15:12ce serait
00:15:12MIMO 2.6.
00:15:14Et peut-être que vous
00:15:15n'en avez jamais entendu
00:15:15parler avant.
00:15:16J'avoue,
00:15:17je n'avais jamais entendu
00:15:17parler des modèles
00:15:18MIMO auparavant.
00:15:20C'est un modèle
00:15:21de Xiaomi.
00:15:22Et ils ont lancé
00:15:23deux variantes,
00:15:24Pro et Flash,
00:15:25et je ne les ai utilisés
00:15:26que via
00:15:27Open Router,
00:15:28j'ai donc payé
00:15:29les prix de l'API
00:15:30pendant mes tests.
00:15:31Je n'ai pas
00:15:32d'abonnement
00:15:33là-bas,
00:15:33et je crois
00:15:34qu'on ne peut
00:15:34s'abonner
00:15:35qu'avec un VPN
00:15:37chinois ou un truc
00:15:38du genre,
00:15:39mais c'est un
00:15:40bon modèle.
00:15:40Ils ont publié
00:15:41quelques chiffres de
00:15:42benchmarks.
00:15:44Il convient de noter
00:15:45qu'ils n'ont pas
00:15:46inclus Astra ici,
00:15:47ni Fable 5.1,
00:15:48et évidemment pas
00:15:49Opus 5.5,
00:15:51mais leur modèle,
00:15:53le 2.6 Pro,
00:15:55surpasse Fable 5,
00:15:56par exemple,
00:15:57sur le benchmark
00:15:58de génie logiciel
00:15:59avancé présenté ici.
00:16:01Et il est vraiment bon
00:16:02sur ces benchmarks,
00:16:03et je peux confirmer,
00:16:04je l'ai beaucoup utilisé
00:16:05ces dernières 24 heures.
00:16:07C'est un bon modèle.
00:16:08Cela dit,
00:16:09sa vitesse de réflexion
00:16:10vient d'un
00:16:11autre monde.
00:16:13J'ai fait un post
00:16:14à ce sujet hier.
00:16:15Il va réfléchir
00:16:16pendant 10 minutes,
00:16:1815 minutes.
00:16:18Je l'ai vu réfléchir
00:16:19une éternité avant
00:16:20qu'il ne commence vraiment
00:16:21à faire quelque chose.
00:16:22Évidemment,
00:16:23on peut ajuster
00:16:24le niveau d'effort,
00:16:25et je parle
00:16:26du modèle Pro
00:16:27ici,
00:16:29la version Flash,
00:16:30évidemment, comme son nom
00:16:31l'indique, est plus rapide,
00:16:32mais aussi moins intelligente.
00:16:33Mais oui,
00:16:34ça prend du temps,
00:16:35mais c'est vraiment pas cher.
00:16:37J'ai dépensé quelques dollars,
00:16:39vraiment trois fois rien,
00:16:40pour le faire tourner
00:16:41pendant des heures
00:16:43sur des problèmes
00:16:45pas ultra complexes,
00:16:46mais sur des problèmes
00:16:47assez complexes quand même,
00:16:49je dirais.
00:16:50Et j'ai été vraiment
00:16:51impressionné par le résultat.
00:16:52Après,
00:16:53je pense que ce n'est pas un modèle
00:16:55qui sera adopté
00:16:56massivement
00:16:57parce que, encore une fois,
00:16:58il n'est pas intégré à un
00:16:59abonnement grand public
00:17:00ou quelque chose
00:17:01du genre.
00:17:02Mais si vous
00:17:03développez des applications
00:17:05qui intègrent
00:17:06de l'IA,
00:17:07qui ont besoin d'un cerveau,
00:17:08si vous concevez
00:17:09votre propre agent de code
00:17:10où vous ne pouvez pas
00:17:11ou ne voulez pas
00:17:12passer par
00:17:12un abonnement,
00:17:15ou quoi que ce soit d'autre,
00:17:16c'est vraiment un modèle
00:17:17à envisager.
00:17:18De manière générale,
00:17:19et ce n'est pas une surprise,
00:17:20tous ces modèles chinois
00:17:21sont assez impressionnants,
00:17:23et j'ai vraiment hâte
00:17:24de voir ce que
00:17:25Qwen 4 nous réserve,
00:17:27entre autres.
00:17:28Mais bref,
00:17:28celui-ci est sorti
00:17:30ces dernières
00:17:31heures,
00:17:32et j'imagine que
00:17:33la plupart l'ont raté,
00:17:34mais je pense
00:17:34que vous devriez y jeter un œil.
00:17:35Il a toute sa place
00:17:36et c'est un très bon modèle,
00:17:39surtout si on le
00:17:40compare à un modèle
00:17:41comme Grok 4.7,
00:17:42qui était plutôt
00:17:43décevant,
00:17:43en plus d'être lent
00:17:45et coûteux.
00:17:46Celui-ci est lent
00:17:47dans sa version Pro,
00:17:48mais il n'est pas cher
00:17:49et fonctionne très bien.
00:17:50Voilà donc mon aperçu
00:17:52et mon avis
00:17:54sur ces modèles,
00:17:55ainsi que mes recommandations
00:17:56d'usage pour chacun
00:17:57d'entre eux.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video