Ce modèle open source corrige le plus grand défaut de l'IA (ThinkingCap)
BBetter Stack
Computing/SoftwareSmall Business/Startups
Transcript
00:00:00C'est la même question posée au même modèle de base.
00:00:03Regardez les compteurs de jetons ici.
00:00:05L'un d'eux passe beaucoup de temps à réfléchir à la question,
00:00:09tandis que l'autre a déjà terminé la tâche.
00:00:12Et si nous vérifions les deux résultats, la réponse à la question est fondamentalement la même.
00:00:16Mais le modèle de droite a gaspillé beaucoup plus de jetons pour arriver à la même conclusion.
00:00:21Et c'est plutôt cool, car la seule différence entre ces deux modèles,
00:00:24c'est que celui de gauche exécute Thinking Cap,
00:00:27une version personnalisée et optimisée du même modèle,
00:00:31qui vise à garantir des résultats de même qualité
00:00:34tout en sacrifiant moins de jetons et en obtenant votre réponse deux fois plus vite.
00:00:39Dans la vidéo d'aujourd'hui, nous allons donc nous pencher sur Thinking Cap,
00:00:42voir comment il fonctionne, puis nous allons les tester nous-mêmes
00:00:45pour voir s'il s'agit vraiment d'une nouvelle approche pour affiner les modèles d'IA.
00:00:50Ça va être très amusant, alors entrons dans le vif du sujet.
00:00:57Avant de parler de Thinking Cap, rembobinons un peu pour voir comment nous en sommes arrivés là.
00:01:03Le tout premier modèle largement disponible, GPT-3, a été lancé en 2020,
00:01:09et fin 2022,
00:01:11ChatGPT a mis GPT-3.5 à la disposition du grand public pour la première fois.
00:01:17C'est à ce moment-là que la relation de la plupart des gens avec l'IA a réellement commencé.
00:01:21GPT-4 a suivi en 2023, ce qui a représenté un autre bond en avant en termes de capacités,
00:01:25mais reposait fondamentalement sur le même principe.
00:01:28Prédire le jeton suivant et répondre immédiatement.
00:01:31Mais en septembre 2024, OpenAI a publié o1,
00:01:37et c'était le premier modèle à utiliser un mode de réflexion avant de répondre.
00:01:42Au lieu d'envoyer une réponse immédiatement,
00:01:45il passait du temps et des jetons supplémentaires à analyser le problème au préalable.
00:01:49Ce seul changement architectural a inauguré l'ère des modèles de raisonnement.
00:01:54DeepSeek-R1 a suivi quelques mois plus tard
00:01:56et a apporté la même idée au monde open source.
00:02:00Et très vite,
00:02:01le raisonnement est devenu ce que tous les principaux fabricants de modèles d'IA proposaient.
00:02:05Mais aujourd'hui, un peu plus d'un an plus tard,
00:02:08nous commençons à voir la tendance inverse se dessiner.
00:02:11Des modèles spécifiquement optimisés pour penser moins et non plus.
00:02:15D'une certaine manière, nous retournons aux sources,
00:02:17mais avec tout ce que nous avons appris de l'ère du raisonnement intégré.
00:02:21Mais voici le problème.
00:02:22Cette évolution vers plus de réflexion a résolu un problème et en a créé un autre en silence.
00:02:28Personne n'a réellement appris à ces modèles quand s'arrêter de réfléchir.
00:02:31Si vous posez une question vraiment simple à un modèle de raisonnement,
00:02:34il va quand même consommer des milliers de jetons,
00:02:37en re-dérivant des choses qu'il avait déjà comprises trois phrases plus tôt,
00:02:41en reformulant le même point avec d'autres mots,
00:02:44ou dans le pire des cas, il va se mettre à boucler.
00:02:48Et je pèse mes mots.
00:02:50Laissez-moi vous montrer l'un des exemples les plus ridicules que j'aie rencontrés.
00:02:54Il s'agit de Step 3.5 Flash.
00:02:56Et lorsque je testais ce modèle de raisonnement,
00:02:58je lui ai simplement envoyé un seul mot : bonjour.
00:03:01Et regardez ce qu'il fait avec ça.
00:03:03Il passe plusieurs paragraphes à débattre pour savoir s'il est tenu de se présenter par son nom exact de modèle,
00:03:09si l'expression « utiliser toujours le nom exact lors de la présentation » signifie qu'il doit se présenter à chaque fois ou seulement lorsqu'il le choisit.
00:03:19Ensuite, il évalue si mentionner la date du jour est pertinent.
00:03:22Et finalement, après tout cela, il aboutit à une réponse que n'importe lequel d'entre nous aurait tapée en deux secondes.
00:03:28Bonjour, je suis Step 3.5 Flash.
00:03:31Comment puis-je vous aider aujourd'hui ?
00:03:33Ce n'est donc pas vraiment du raisonnement.
00:03:35C'est un modèle entraîné à penser, mais qui n'a jamais appris à savoir quand la réflexion est terminée.
00:03:41Maintenant, BottleCap AI est une startup européenne spécialisée dans l'optimisation de l'inférence.
00:03:47Et ce qu'ils ont fait avec ThinkingCap est honnêtement très astucieux.
00:03:51Ils ont donc pris le modèle Qwen 3.6, la version à 27 milliards de paramètres,
00:03:55et n'ont pas cherché à le rendre plus intelligent, ni à lui enseigner de nouvelles compétences, ni à modifier sa personnalité ou son comportement de sécurité.
00:04:04La seule chose qu'ils voulaient changer, c'est la quantité de calculs consommée pour arriver à une réponse qu'il était déjà capable de donner.
00:04:11Cela a l'air simple, mais c'est en réalité plus difficile qu'il n'y paraît.
00:04:15La solution de facilité pour rendre un modèle plus rapide est de couper court à son raisonnement.
00:04:20Le forcer à s'arrêter après un certain nombre de jetons, qu'il ait terminé ou non.
00:04:25Cela réduira à coup sûr le nombre de jetons.
00:04:27Mais cela rendra aussi le modèle plus souvent erroné, car il a parfois réellement besoin de ces étapes supplémentaires.
00:04:34Le véritable défi technique ici n'est donc pas de raccourcir.
00:04:38C'est de raccourcir sans le rendre secrètement plus stupide.
00:04:42Et voici comment ils y sont parvenus.
00:04:44En partant du point de contrôle de base du modèle Qwen 3.6 à 27 milliards de paramètres,
00:04:48ils l'ont entraîné sur un ensemble sélectionné de problèmes couvrant de multiples domaines et niveaux de difficulté.
00:04:55Et au lieu de récompenser le modèle pour avoir trouvé la bonne réponse,
00:04:58ils l'ont récompensé pour avoir trouvé la bonne réponse efficacement.
00:05:02Car si un modèle n'est récompensé que pour son exactitude, être verbeux ne coûte rien.
00:05:08Il n'y a aucune incitation à s'arrêter de réfléchir plus tôt.
00:05:10Mais en récompensant explicitement l'efficacité aux côtés de l'exactitude,
00:05:14le modèle apprend à reconnaître quand il en a déjà assez pour s'engager sur une réponse.
00:05:19Par conséquent, ils ont obtenu un modèle qui se comporte de manière presque identique à l'original.
00:05:23Regardons maintenant les chiffres, car c'est là que ça devient intéressant.
00:05:27Sur 12 benchmarks hors domaine, c'est-à-dire des problèmes qui ne faisaient pas partie des données d'entraînement,
00:05:33Thinking Cap a réduit ses jetons de réflexion de 45,8 % en moyenne.
00:05:37Et la précision a à peine changé.
00:05:40Elle a varié de moins d'un pour cent en moyenne.
00:05:43Et sur les benchmarks qui faisaient partie du domaine d'entraînement,
00:05:46la réduction des jetons a été encore plus importante, près de 58 %.
00:05:49Et sur GSM8K en particulier, la précision est en fait passée de 93,3 % à 96,5 %.
00:05:58Ils ont également suivi ce qu'on appelle le taux de bouclage.
00:06:00La fréquence à laquelle un modèle reste bloqué à reformuler le même raisonnement encore et encore sans converger,
00:06:06comme nous venons de le voir dans l'exemple de Step 3.5 Flash.
00:06:10Cela a également baissé sur la plupart des benchmarks,
00:06:12ce qui nous indique qu'une grande partie du raisonnement supplémentaire effectué par ces modèles n'a jamais été réellement productive.
00:06:18C'était juste du bruit qui avait l'apparence d'un effort.
00:06:21Bon, les chiffres sur le papier c'est une chose, mais testons-le vraiment par nous-mêmes.
00:06:26J'exécute donc ce test sur une machine équipée d'une RTX 5090 avec 64 gigaoctets de RAM.
00:06:32Et je vais poser la même question aux deux modèles.
00:06:35Quel est le plus petit entier positif n tel que n factorielle possède exactement 100 zéros à la fin ?
00:06:42Et pour arriver à la réponse de cette question, il doit utiliser la formule de Legendre,
00:06:47ce qui, dans le cas de cette question particulière, donnerait la réponse de 405.
00:06:51Il n'y a qu'une seule bonne réponse.
00:06:53Il n'y a pas d'intermédiaire.
00:06:55Donc si nous obtenons 405, nous savons que le modèle a répondu correctement.
00:07:00Bien, exécutons d'abord le modèle Qwen 3.6 quantifié standard à 27 milliards de paramètres
00:07:05et voyons comment il se comporte.
00:07:07Et comme vous pouvez le voir tout de suite, la vitesse de traitement des jetons n'est pas si mal.
00:07:12Elle est d'environ 60 jetons par seconde.
00:07:14Mais regardez combien ce modèle réfléchit.
00:07:17C'est absolument ridicule.
00:07:20Nous avons largement dépassé la minute maintenant, et il continue de cracher des jetons juste pour la partie raisonnement.
00:07:26J'ai dû accélérer l'aperçu ici car le temps total dépassait deux minutes.
00:07:30Mais néanmoins, à la fin, nous avons obtenu le résultat correct, qui est 405, ce qui est une bonne chose.
00:07:37Mais regardez le temps écoulé total.
00:07:39Il est de 140 secondes.
00:07:41Et regardez la consommation de jetons.
00:07:43Plus de 7 000 jetons ont été dépensés rien que pour le raisonnement, et à peine 900 jetons pour afficher la réponse.
00:07:52Cet exemple démontre donc clairement à quel point le raisonnement de Qwen est excessivement ridicule sur chaque requête.
00:07:59Passons maintenant à la version Thinking Cap du même modèle.
00:08:02Et pour que ce soit clair, nous utilisons le même modèle à 27 milliards de paramètres avec la même quantification.
00:08:08Et comme vous pouvez le voir ici, 20 secondes se sont écoulées et nous avons déjà terminé le raisonnement.
00:08:13Et seulement 9 secondes plus tard, nous obtenons la réponse, qui dans ce cas est également correcte : 405.
00:08:19Et regardez la différence saisissante.
00:08:21Non seulement nous avons dépensé moins de 2 000 jetons au total, dont seulement 1 100 alloués au raisonnement,
00:08:30mais nous avons également obtenu une vitesse légèrement supérieure de 62 jetons par seconde.
00:08:36Sur tous les plans, ce modèle surclasse complètement le modèle Qwen 3.6 de base.
00:08:42Il est plus rapide, plus efficace, coûte moins de jetons et donne la même réponse correcte.
00:08:48C'est donc une amélioration assez impressionnante.
00:08:51Et voici un détail de leur rapport que je dois mentionner, car c'est un accident vraiment amusant.
00:08:57Leur objectif initial était de réduire uniquement la trace de réflexion, c'est-à-dire la partie raisonnement,
00:09:02tout en maintenant la réponse finale exactement de la même longueur qu'avant.
00:09:06Mais ils ont eu un bug.
00:09:07Le raccourcissement s'est appliqué par accident à la réponse finale aussi, et pas seulement à la réflexion.
00:09:12Ils ont donc corrigé le bug, mais apparemment, en interne, tout le monde préférait la version boguée.
00:09:18Leur théorie est donc que les humains se fatiguent à écrire de longues réponses, alors nous compressons naturellement ce que nous disons.
00:09:25Et ces modèles n'avaient jamais eu ce genre de fatigue intégrée jusqu'à présent.
00:09:29Ils ont donc fini par publier la version boguée et concise quand même, et ont réservé la version techniquement correcte pour une future sortie.
00:09:37Voilà donc, les amis.
00:09:38C'est ce qu'est Thinking Cap en résumé.
00:09:40Je suppose que la grande conclusion à tirer de tout cela est que nous avons toujours cru que plus les modèles réfléchissent, plus ils sont intelligents.
00:09:48Alors que Thinking Cap vient de prouver que ce n'est pas nécessairement le cas.
00:09:53Une fois qu'on l'entraîne réellement dans ce sens, on peut obtenir une sortie de la même qualité pour une fraction du coût, sans presque rien sacrifier.
00:10:01Si vous voulez tester le modèle par vous-même, il est disponible gratuitement sur Hugging Face sous licence Apache 2.0.
00:10:08Et j'aimerais avoir votre avis, les amis.
00:10:10Que pensez-vous de cette nouvelle approche ?
00:10:12Voyez-vous des avantages ou des inconvénients à cette technique ?
00:10:15Faites-le-nous savoir dans la section des commentaires ci-dessous.
00:10:17Et, les amis, si vous aimez ce genre d'analyses techniques, faites-le-moi savoir en pulvérisant ce bouton J'aime sous la vidéo.
00:10:23Et n'oubliez pas non plus de vous abonner à notre chaîne.
00:10:26C'était Andres de BetterStack, et je vous dis à bientôt dans les prochaines vidéos.