Ce modèle open source corrige le plus grand défaut de l'IA (ThinkingCap)

BBetter Stack
Computing/SoftwareSmall Business/Startups

Transcript

00:00:00C'est la même question posée au même modèle de base.
00:00:03Regardez les compteurs de jetons ici.
00:00:05L'un d'eux passe beaucoup de temps à réfléchir à la question,
00:00:09tandis que l'autre a déjà terminé la tâche.
00:00:12Et si nous vérifions les deux résultats, la réponse à la question est fondamentalement la même.
00:00:16Mais le modèle de droite a gaspillé beaucoup plus de jetons pour arriver à la même conclusion.
00:00:21Et c'est plutôt cool, car la seule différence entre ces deux modèles,
00:00:24c'est que celui de gauche exécute Thinking Cap,
00:00:27une version personnalisée et optimisée du même modèle,
00:00:31qui vise à garantir des résultats de même qualité
00:00:34tout en sacrifiant moins de jetons et en obtenant votre réponse deux fois plus vite.
00:00:39Dans la vidéo d'aujourd'hui, nous allons donc nous pencher sur Thinking Cap,
00:00:42voir comment il fonctionne, puis nous allons les tester nous-mêmes
00:00:45pour voir s'il s'agit vraiment d'une nouvelle approche pour affiner les modèles d'IA.
00:00:50Ça va être très amusant, alors entrons dans le vif du sujet.
00:00:57Avant de parler de Thinking Cap, rembobinons un peu pour voir comment nous en sommes arrivés là.
00:01:03Le tout premier modèle largement disponible, GPT-3, a été lancé en 2020,
00:01:09et fin 2022,
00:01:11ChatGPT a mis GPT-3.5 à la disposition du grand public pour la première fois.
00:01:17C'est à ce moment-là que la relation de la plupart des gens avec l'IA a réellement commencé.
00:01:21GPT-4 a suivi en 2023, ce qui a représenté un autre bond en avant en termes de capacités,
00:01:25mais reposait fondamentalement sur le même principe.
00:01:28Prédire le jeton suivant et répondre immédiatement.
00:01:31Mais en septembre 2024, OpenAI a publié o1,
00:01:37et c'était le premier modèle à utiliser un mode de réflexion avant de répondre.
00:01:42Au lieu d'envoyer une réponse immédiatement,
00:01:45il passait du temps et des jetons supplémentaires à analyser le problème au préalable.
00:01:49Ce seul changement architectural a inauguré l'ère des modèles de raisonnement.
00:01:54DeepSeek-R1 a suivi quelques mois plus tard
00:01:56et a apporté la même idée au monde open source.
00:02:00Et très vite,
00:02:01le raisonnement est devenu ce que tous les principaux fabricants de modèles d'IA proposaient.
00:02:05Mais aujourd'hui, un peu plus d'un an plus tard,
00:02:08nous commençons à voir la tendance inverse se dessiner.
00:02:11Des modèles spécifiquement optimisés pour penser moins et non plus.
00:02:15D'une certaine manière, nous retournons aux sources,
00:02:17mais avec tout ce que nous avons appris de l'ère du raisonnement intégré.
00:02:21Mais voici le problème.
00:02:22Cette évolution vers plus de réflexion a résolu un problème et en a créé un autre en silence.
00:02:28Personne n'a réellement appris à ces modèles quand s'arrêter de réfléchir.
00:02:31Si vous posez une question vraiment simple à un modèle de raisonnement,
00:02:34il va quand même consommer des milliers de jetons,
00:02:37en re-dérivant des choses qu'il avait déjà comprises trois phrases plus tôt,
00:02:41en reformulant le même point avec d'autres mots,
00:02:44ou dans le pire des cas, il va se mettre à boucler.
00:02:48Et je pèse mes mots.
00:02:50Laissez-moi vous montrer l'un des exemples les plus ridicules que j'aie rencontrés.
00:02:54Il s'agit de Step 3.5 Flash.
00:02:56Et lorsque je testais ce modèle de raisonnement,
00:02:58je lui ai simplement envoyé un seul mot : bonjour.
00:03:01Et regardez ce qu'il fait avec ça.
00:03:03Il passe plusieurs paragraphes à débattre pour savoir s'il est tenu de se présenter par son nom exact de modèle,
00:03:09si l'expression « utiliser toujours le nom exact lors de la présentation » signifie qu'il doit se présenter à chaque fois ou seulement lorsqu'il le choisit.
00:03:19Ensuite, il évalue si mentionner la date du jour est pertinent.
00:03:22Et finalement, après tout cela, il aboutit à une réponse que n'importe lequel d'entre nous aurait tapée en deux secondes.
00:03:28Bonjour, je suis Step 3.5 Flash.
00:03:31Comment puis-je vous aider aujourd'hui ?
00:03:33Ce n'est donc pas vraiment du raisonnement.
00:03:35C'est un modèle entraîné à penser, mais qui n'a jamais appris à savoir quand la réflexion est terminée.
00:03:41Maintenant, BottleCap AI est une startup européenne spécialisée dans l'optimisation de l'inférence.
00:03:47Et ce qu'ils ont fait avec ThinkingCap est honnêtement très astucieux.
00:03:51Ils ont donc pris le modèle Qwen 3.6, la version à 27 milliards de paramètres,
00:03:55et n'ont pas cherché à le rendre plus intelligent, ni à lui enseigner de nouvelles compétences, ni à modifier sa personnalité ou son comportement de sécurité.
00:04:04La seule chose qu'ils voulaient changer, c'est la quantité de calculs consommée pour arriver à une réponse qu'il était déjà capable de donner.
00:04:11Cela a l'air simple, mais c'est en réalité plus difficile qu'il n'y paraît.
00:04:15La solution de facilité pour rendre un modèle plus rapide est de couper court à son raisonnement.
00:04:20Le forcer à s'arrêter après un certain nombre de jetons, qu'il ait terminé ou non.
00:04:25Cela réduira à coup sûr le nombre de jetons.
00:04:27Mais cela rendra aussi le modèle plus souvent erroné, car il a parfois réellement besoin de ces étapes supplémentaires.
00:04:34Le véritable défi technique ici n'est donc pas de raccourcir.
00:04:38C'est de raccourcir sans le rendre secrètement plus stupide.
00:04:42Et voici comment ils y sont parvenus.
00:04:44En partant du point de contrôle de base du modèle Qwen 3.6 à 27 milliards de paramètres,
00:04:48ils l'ont entraîné sur un ensemble sélectionné de problèmes couvrant de multiples domaines et niveaux de difficulté.
00:04:55Et au lieu de récompenser le modèle pour avoir trouvé la bonne réponse,
00:04:58ils l'ont récompensé pour avoir trouvé la bonne réponse efficacement.
00:05:02Car si un modèle n'est récompensé que pour son exactitude, être verbeux ne coûte rien.
00:05:08Il n'y a aucune incitation à s'arrêter de réfléchir plus tôt.
00:05:10Mais en récompensant explicitement l'efficacité aux côtés de l'exactitude,
00:05:14le modèle apprend à reconnaître quand il en a déjà assez pour s'engager sur une réponse.
00:05:19Par conséquent, ils ont obtenu un modèle qui se comporte de manière presque identique à l'original.
00:05:23Regardons maintenant les chiffres, car c'est là que ça devient intéressant.
00:05:27Sur 12 benchmarks hors domaine, c'est-à-dire des problèmes qui ne faisaient pas partie des données d'entraînement,
00:05:33Thinking Cap a réduit ses jetons de réflexion de 45,8 % en moyenne.
00:05:37Et la précision a à peine changé.
00:05:40Elle a varié de moins d'un pour cent en moyenne.
00:05:43Et sur les benchmarks qui faisaient partie du domaine d'entraînement,
00:05:46la réduction des jetons a été encore plus importante, près de 58 %.
00:05:49Et sur GSM8K en particulier, la précision est en fait passée de 93,3 % à 96,5 %.
00:05:58Ils ont également suivi ce qu'on appelle le taux de bouclage.
00:06:00La fréquence à laquelle un modèle reste bloqué à reformuler le même raisonnement encore et encore sans converger,
00:06:06comme nous venons de le voir dans l'exemple de Step 3.5 Flash.
00:06:10Cela a également baissé sur la plupart des benchmarks,
00:06:12ce qui nous indique qu'une grande partie du raisonnement supplémentaire effectué par ces modèles n'a jamais été réellement productive.
00:06:18C'était juste du bruit qui avait l'apparence d'un effort.
00:06:21Bon, les chiffres sur le papier c'est une chose, mais testons-le vraiment par nous-mêmes.
00:06:26J'exécute donc ce test sur une machine équipée d'une RTX 5090 avec 64 gigaoctets de RAM.
00:06:32Et je vais poser la même question aux deux modèles.
00:06:35Quel est le plus petit entier positif n tel que n factorielle possède exactement 100 zéros à la fin ?
00:06:42Et pour arriver à la réponse de cette question, il doit utiliser la formule de Legendre,
00:06:47ce qui, dans le cas de cette question particulière, donnerait la réponse de 405.
00:06:51Il n'y a qu'une seule bonne réponse.
00:06:53Il n'y a pas d'intermédiaire.
00:06:55Donc si nous obtenons 405, nous savons que le modèle a répondu correctement.
00:07:00Bien, exécutons d'abord le modèle Qwen 3.6 quantifié standard à 27 milliards de paramètres
00:07:05et voyons comment il se comporte.
00:07:07Et comme vous pouvez le voir tout de suite, la vitesse de traitement des jetons n'est pas si mal.
00:07:12Elle est d'environ 60 jetons par seconde.
00:07:14Mais regardez combien ce modèle réfléchit.
00:07:17C'est absolument ridicule.
00:07:20Nous avons largement dépassé la minute maintenant, et il continue de cracher des jetons juste pour la partie raisonnement.
00:07:26J'ai dû accélérer l'aperçu ici car le temps total dépassait deux minutes.
00:07:30Mais néanmoins, à la fin, nous avons obtenu le résultat correct, qui est 405, ce qui est une bonne chose.
00:07:37Mais regardez le temps écoulé total.
00:07:39Il est de 140 secondes.
00:07:41Et regardez la consommation de jetons.
00:07:43Plus de 7 000 jetons ont été dépensés rien que pour le raisonnement, et à peine 900 jetons pour afficher la réponse.
00:07:52Cet exemple démontre donc clairement à quel point le raisonnement de Qwen est excessivement ridicule sur chaque requête.
00:07:59Passons maintenant à la version Thinking Cap du même modèle.
00:08:02Et pour que ce soit clair, nous utilisons le même modèle à 27 milliards de paramètres avec la même quantification.
00:08:08Et comme vous pouvez le voir ici, 20 secondes se sont écoulées et nous avons déjà terminé le raisonnement.
00:08:13Et seulement 9 secondes plus tard, nous obtenons la réponse, qui dans ce cas est également correcte : 405.
00:08:19Et regardez la différence saisissante.
00:08:21Non seulement nous avons dépensé moins de 2 000 jetons au total, dont seulement 1 100 alloués au raisonnement,
00:08:30mais nous avons également obtenu une vitesse légèrement supérieure de 62 jetons par seconde.
00:08:36Sur tous les plans, ce modèle surclasse complètement le modèle Qwen 3.6 de base.
00:08:42Il est plus rapide, plus efficace, coûte moins de jetons et donne la même réponse correcte.
00:08:48C'est donc une amélioration assez impressionnante.
00:08:51Et voici un détail de leur rapport que je dois mentionner, car c'est un accident vraiment amusant.
00:08:57Leur objectif initial était de réduire uniquement la trace de réflexion, c'est-à-dire la partie raisonnement,
00:09:02tout en maintenant la réponse finale exactement de la même longueur qu'avant.
00:09:06Mais ils ont eu un bug.
00:09:07Le raccourcissement s'est appliqué par accident à la réponse finale aussi, et pas seulement à la réflexion.
00:09:12Ils ont donc corrigé le bug, mais apparemment, en interne, tout le monde préférait la version boguée.
00:09:18Leur théorie est donc que les humains se fatiguent à écrire de longues réponses, alors nous compressons naturellement ce que nous disons.
00:09:25Et ces modèles n'avaient jamais eu ce genre de fatigue intégrée jusqu'à présent.
00:09:29Ils ont donc fini par publier la version boguée et concise quand même, et ont réservé la version techniquement correcte pour une future sortie.
00:09:37Voilà donc, les amis.
00:09:38C'est ce qu'est Thinking Cap en résumé.
00:09:40Je suppose que la grande conclusion à tirer de tout cela est que nous avons toujours cru que plus les modèles réfléchissent, plus ils sont intelligents.
00:09:48Alors que Thinking Cap vient de prouver que ce n'est pas nécessairement le cas.
00:09:53Une fois qu'on l'entraîne réellement dans ce sens, on peut obtenir une sortie de la même qualité pour une fraction du coût, sans presque rien sacrifier.
00:10:01Si vous voulez tester le modèle par vous-même, il est disponible gratuitement sur Hugging Face sous licence Apache 2.0.
00:10:08Et j'aimerais avoir votre avis, les amis.
00:10:10Que pensez-vous de cette nouvelle approche ?
00:10:12Voyez-vous des avantages ou des inconvénients à cette technique ?
00:10:15Faites-le-nous savoir dans la section des commentaires ci-dessous.
00:10:17Et, les amis, si vous aimez ce genre d'analyses techniques, faites-le-moi savoir en pulvérisant ce bouton J'aime sous la vidéo.
00:10:23Et n'oubliez pas non plus de vous abonner à notre chaîne.
00:10:26C'était Andres de BetterStack, et je vous dis à bientôt dans les prochaines vidéos.

Key Takeaway

Thinking Cap démontre qu'un modèle de raisonnement open source peut réduire sa consommation de jetons de près de 58 % tout en préservant sa précision grâce à un entraînement axé sur l'efficacité.

Highlights

  • Thinking Cap réduit les jetons de réflexion de 45,8 % en moyenne sur 12 benchmarks hors domaine tout en maintenant la précision.

  • La version Thinking Cap du modèle Qwen 3.6 (27 milliards de paramètres) consomme moins de 2 000 jetons au total contre plus de 7 000 pour la version standard.

  • Le modèle de base nécessite 140 secondes pour traiter une requête mathématique, tandis que la version optimisée résout la même tâche en 29 secondes.

  • BottleCap AI a entraîné Thinking Cap à récompenser l'efficacité en plus de l'exactitude pour éliminer les boucles de raisonnement superflues.

  • La précision sur le benchmark GSM8K augmente de 93,3 % à 96,5 % grâce à cette approche d'inférence optimisée.

Timeline

Évolution et inefficacité des modèles de raisonnement

  • L'introduction des modèles de raisonnement en septembre 2024 modifie le paradigme de génération en augmentant le temps de calcul préalable.
  • L'absence de mécanisme d'arrêt conduit ces modèles à consommer des milliers de jetons superflus sur des questions simples.
  • Le modèle Step 3.5 Flash illustre ces dérives en débattant longuement sur un simple mot comme bonjour.

L'industrie passe progressivement de la prédiction directe de jetons à des architectures dotées d'une phase de réflexion. Toutefois, cette évolution crée un nouveau problème, car les modèles ne savent pas quand s'arrêter. Les requêtes basiques entraînent des redondances textuelles et des boucles de raisonnement inefficaces.

Fonctionnement et entraînement de Thinking Cap

  • BottleCap AI développe Thinking Cap sur la base du modèle Qwen 3.6 à 27 milliards de paramètres.
  • L'entraînement récompense explicitement l'efficacité d'exécution et non plus seulement l'exactitude des réponses.
  • Le modèle apprend à reconnaître le moment où les informations accumulées suffisent pour formuler une réponse correcte.

La startup européenne BottleCap AI cherche à réduire les calculs superflus sans dégrader les compétences du modèle. Contrairement aux méthodes qui coupent brutalement la génération après un quota fixe de jetons, cette approche intègre une incitation à la concision directement dans la phase d'apprentissage.

Performances et tests pratiques

  • Thinking Cap réduit les jetons de réflexion de 45,8 % sur des benchmarks hors domaine et de près de 58 % sur les domaines d'entraînement.
  • Le test pratique sur un problème de factorielle montre un temps total réduit de 140 secondes à 29 secondes.
  • Le modèle est disponible gratuitement sur Hugging Face sous licence Apache 2.0.

Les résultats chiffrés valident la réduction du bruit textuel et des boucles de raisonnement. Les tests matériels sur une RTX 5090 confirment la supériorité opérationnelle de la version optimisée en termes de vitesse et de coût en jetons, tout en conservant une exactitude rigoureuse.

Community Posts

View all posts