Donnez-moi 9 minutes pour vous prouver qu'il ne faut vraiment pas passer à côté de Jev

MMaximilian Schwarzmüller
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Il y a quelques heures, un nouveau modèle d'IA est sorti, et je pense sincèrement qu'il pourrait changer la donne.
00:00:07Je sais, je sais, on a de nouveaux modèles presque chaque semaine, mais je ne parle pas d'un nouveau
00:00:13grand modèle linguistique. À la place, je vous parle de Jeff par TypeSafe AI. Je sais que ça ressemble
00:00:19à un assistant personnel, comme un Grokbot appelé Jeff, n'est-ce pas ? Et “TypeSafe AI”, ça fait penser
00:00:25à une bibliothèque TypeScript, mais rien de tout cela n'est le cas. C'est un nouveau genre de modèle d'IA. Ce n'est pas
00:00:31un grand modèle linguistique, mais il semble assez intelligent et il nous offre quelque chose que les grands modèles
00:00:39linguistiques ne nous apportent que partiellement. Au fait, pour préciser tout de suite, cette vidéo n'est pas
00:00:44sponsorisée du tout. Vous pouvez aller sur leur site web, typesafe.ai, et là-bas vous pouvez
00:00:51rejoindre une liste d'attente. C'est ce que j'ai fait hier soir, comme tout le monde, et j'ai eu mon accès
00:00:56ce matin. Me voilà donc. Alors, de quoi s'agit-il ? L'idée, c'est d'avoir un modèle qui ne cherche pas
00:01:04à générer du texte, mais à le comprendre. Vous pouvez lui soumettre n'importe quel texte, puis lui proposer des
00:01:12choix. Par exemple, voici un cas de base : j'ai quelques exemples de textes, qui pourraient être des e-mails ou
00:01:21des messages du chat client. Vous avez un chat sur votre site et les clients envoient des messages,
00:01:28qui pourraient ressembler à ceux-ci, et vous voulez décider quoi en faire. Évidemment,
00:01:34vous pourriez les faire passer par un grand modèle linguistique. Mais il y a plusieurs problèmes : d'abord, les injections de prompt ;
00:01:40second problème, cela peut coûter assez cher parce qu'il faut un modèle relativement intelligent. Vous
00:01:48allez donc consommer beaucoup de jetons, car vous devez lui transmettre toutes les descriptions d'outils,
00:01:54ainsi que des informations supplémentaires et le message du client, bien sûr.
00:02:00Et vous consommez des jetons au passage. Troisièmement, c'est assez lent. Ces grands modèles de pointe
00:02:06mettent du temps à répondre. Jeff, en revanche, est super rapide : on parle ici de millisecondes.
00:02:12Il ne tourne pas en local, il reste dans le cloud, mais il est ultra-rapide. L'idée,
00:02:18c'est de donner le message à Jeff. Ici, la fonction askJeff, c'est juste mon client qui communique avec l'IA.
00:02:26Vous lui transmettez ce message, et vous pouvez même envoyer des données structurées plus complexes, il ne s'agit pas
00:02:32forcément d'une simple chaîne de caractères. Ensuite, vous lui indiquez ce qu'il doit faire avec ce
00:02:39message. Plus précisément, vous lui posez des questions. Il en existe trois types :
00:02:46les choix, la notation et le statut. Les choix, c'est exactement ce à quoi ça ressemble : vous proposez des options,
00:02:53et le modèle d'IA vous renvoie un niveau de confiance sur le choix ou l'option à retenir.
00:02:58La note, c'est pour évaluer : vous définissez des
00:03:02niveaux, pour ainsi dire, et il génère une note basée dessus. Et enfin, les questions oui/non.
00:03:10Dans cet exemple basique, je reçois des messages d'utilisateurs et je les envoie au modèle.
00:03:15Ensuite, je définis mes questions. La première est : “Quelle équipe doit traiter ce message ?”, et je lui
00:03:21donne trois options. C'est entièrement modulable : vous définissez exactement ce dont vous avez besoin.
00:03:26Vous pouvez ajouter d'autres options, je crois jusqu'à 10 actuellement, et vous décrivez chaque option. J'ai
00:03:33une équipe de facturation, et je précise qu'elle gère les paiements, les factures, etc.
00:03:38J'ai aussi d'autres équipes dans cette démo. C'est donc la première question que j'envoie à Jeff
00:03:44basée sur le message du client. Mais ce n'est pas tout, car on peut poser plusieurs questions à la fois.
00:03:49On pourrait avoir plusieurs choix, mais ici je veux en montrer une de chaque catégorie. J'ai donc une
00:03:53question à choix multiples, une question oui/non pour savoir si le message exprime une urgence, et on va y passer
00:04:00nos trois messages afin de vérifier s'il y a urgence pour chacun. Le troisième type
00:04:07de question concerne la notation, pour déterminer à quel point le client semble frustré.
00:04:11Si je lance ça ici comme ceci, on voit que ça s'exécute, et c'est vraiment très rapide.
00:04:20Tout a été envoyé au cloud, au modèle d'IA, et traité, mais aucun grand modèle linguistique
00:04:25n'a été impliqué. Au lieu de cela, pour le premier message client, l'option choisie est
00:04:30que l'équipe technique s'en charge, avec un niveau de confiance généré automatiquement par Jeff.
00:04:36Concernant la question oui/non sur l'urgence : oui, c'est assez urgent. On a un score de confiance
00:04:42très élevé, presque 1, confirmant l'urgence, et la frustration est plutôt haute. Pour le deuxième
00:04:49message, il s'agissait d'un double prélèvement avec demande de remboursement immédiat. Ça doit aller
00:04:56à l'équipe de facturation. Jeff a estimé que c'était assez urgent et que la frustration était élevée. Enfin,
00:05:03la troisième question va à l'équipe commerciale, ce n'est pas urgent et il n'y a pas de frustration.
00:05:09Comme vous pouvez le constater, ou du moins c'est mon avis, cela pourrait être extrêmement utile. On peut créer cela
00:05:18avec des grands modèles linguistiques, mais j'ai souligné leurs inconvénients. Ici, c'est rapide et vraiment
00:05:24pas cher. Parlons tarifs : cela coûte 42 dollars par milliard — milliard, pas million comme les autres
00:05:33modèles — de jetons d'entrée, et les jetons de sortie sont gratuits. Ils ne coûtent rien ! C'est donc largement
00:05:40moins cher que tous ces grands modèles linguistiques. Vous pouvez envoyer plein de questions complexes à Jeff, ça ne vous coûtera
00:05:49presque rien. Et encore une fois, les jetons de sortie sont gratuits, c'est ultra-rapide et c'est conçu sur mesure
00:05:56pour ce genre de décisions. Quand on y pense, et c'est pour ça que je suis enthousiaste,
00:06:02une grande partie de ce qu'on développe se résume à des décisions. Chaque agent d'IA qu'on conçoit en est rempli :
00:06:08savoir quel outil appeler et quand, ce sont toutes des décisions. Comme je l'ai dit, on peut aussi le combiner
00:06:15avec de grands modèles linguistiques. J'ai un autre exemple où j'ai créé un assistant avec quelques
00:06:22appels d'outils très simples. Disons qu'il s'agit d'un assistant domotique qui permet d'éteindre
00:06:29ou d'allumer la lumière dans une pièce. J'ai une fonction et un outil fictifs pour ça. Mais
00:06:35on souhaite parfois utiliser un grand modèle linguistique pour certaines tâches, car Jeff ne peut pas
00:06:42rédiger de texte. Dès que vous devez générer du texte, comme un e-mail de réponse à un client,
00:06:48vous devez utiliser un grand modèle linguistique. C'est ce que je fais ici : j'en utilise un
00:06:54via le SDK AI de Vercel. J'utilise GPT-5.6 Terra avec un niveau de réflexion moyen, ce qui reste
00:07:02abordable, puis je laisse Jeff choisir quel outil utiliser. C'est donc Jeff qui décide, pas le
00:07:10grand modèle linguistique, puis j'exécute ces outils. Certains font appel à un grand modèle linguistique,
00:07:15d'autres non. C'est vraiment ça qui est fantastique : on conçoit des systèmes où l'on doit prendre des décisions
00:07:21en permanence, où l'on doit évaluer des éléments ou répondre par oui ou par non à longueur de temps.
00:07:26Aujourd'hui, on utilise souvent des grands modèles linguistiques pour ça, et ils sont très bons,
00:07:31ne me comprenez pas mal. Ils conservent un avantage, par exemple au niveau de la fenêtre
00:07:36de contexte. La documentation mentionne une limite d'environ 32 000 jetons de texte à passer dans vos
00:07:45questions. Il y a donc des limites. La doc contient aussi un article sur l'irrécularité
00:07:50de leur modèle de pointe actuel, qui peine avec les maths, les chiffres ou la comparaison de dates et d'heures.
00:07:56Il y a donc des domaines où il est moins performant. D'une part, je m'attends à ce que, comme pour tous les modèles d'IA,
00:08:05cela s'améliore à l'avenir et que les problèmes soient résolus. D'autre part, ce n'est pas un choix
00:08:12exclusif, c'est un complément. C'est un excellent outil supplémentaire à utiliser en plus des grands modèles linguistiques. S'il
00:08:18était aussi lent et coûteux, je ne verrais pas vraiment l'intérêt, mais ce n'est pas le cas. Avec
00:08:24ses avantages, il semble très prometteur. Il faudra mener des tests sur le long terme, le voir
00:08:32en production et sur des cas plus complexes pour évaluer s'il est sujet aux erreurs ou très sensible
00:08:40aux injections de prompt. Bref, voir s'il peut rencontrer ce genre de problèmes. Mais ça a l'air
00:08:47vraiment utile. Et contrairement au buzz autour des architectures sous-quadratiques d'il y a quelques
00:08:53mois, c'est quelque chose qu'on peut tester dès maintenant, au moins si vous obtenez un accès.
00:08:57Inscrivez-vous sur la liste d'attente ; pour moi, ça n'a pris que quelques heures. Ça m'a l'air
00:09:03très prometteur. Je pense qu'on peut créer de super programmes en combinant Jeff avec de la programmation
00:09:12traditionnelle, donc du code déterministe classique, mais aussi des grands modèles linguistiques. On peut réaliser d'excellentes
00:09:20choses avec tout ça. Voilà, j'espère que cet aperçu vous donne une bonne idée de ce qu'est Jeff. Inscrivez-vous
00:09:27sur la liste d'attente si vous voulez mettre les mains dans le cambouis et tester le modèle par vous-même.

핵심 요약

Jev de TypeSafe AI remplace les grands modèles linguistiques pour la prise de décision rapide et l'évaluation de texte, réduisant les coûts à 42 dollars par milliard de jetons d'entrée avec des jetons de sortie gratuits.

하이라이트

  • Jev par TypeSafe AI est un modèle conçu exclusivement pour comprendre le texte et prendre des décisions en quelques millisecondes, sans génération de contenu.

  • Le modèle coûte 42 dollars par milliard de jetons d'entrée, tandis que les jetons de sortie sont entièrement gratuits.

  • Jev traite trois types de requêtes spécifiques : les choix multiples (jusqu'à 10 options décrites), la notation et les réponses binaire oui/non.

  • La limite de contexte actuelle du modèle s'élève à environ 32 000 jetons de texte.

  • Jev présente des limites sur la comparaison de dates, les calculs mathématiques et la gestion des chiffres.

타임라인

Présentation du modèle Jev et problèmes des LLM traditionnels

  • Jev est un modèle spécialisé dans la compréhension de texte et la prise de décision, plutôt que dans la génération de texte.
  • L'utilisation de grands modèles linguistiques pour la classification de messages entraîne des coûts élevés en jetons, une latence importante et des risques d'injection de prompt.

Les applications de support client nécessitent souvent de trier les messages entrants. L'utilisation d'un grand modèle linguistique classique exige l'envoi constant des définitions d'outils et de contextes lourds, ce qui ralentit le traitement et augmente la facture. Jev fonctionne dans le cloud avec un temps de réponse mesuré en millisecondes, évitant la surcharge liée aux modèles génératifs.

Structure des requêtes et types de questions gérés

  • Jev évalue les données fournies selon trois types de questions : les choix multiples, la notation et le statut oui/non.
  • Chaque réponse retournée par le modèle s'accompagne d'un indice de confiance automatiquement calculé.
  • Le système accepte jusqu'à 10 options personnalisées et décrites par question pour orienter la décision.

Une seule requête permet d'envoyer simultanément plusieurs questions sur un même message. Par exemple, le modèle peut orienter une demande vers l'équipe technique, commerciale ou de facturation, tout en évaluant l'urgence par un statut binaire et le niveau de frustration du client sur une échelle numérique. Le traitement de ces demandes complexes s'exécute quasi instantanément.

Structure tarifaire et intégration hybride avec les LLM

  • La tarification s'établit à 42 dollars par milliard de jetons d'entrée, sans aucun coût pour les jetons de sortie.
  • Jev prend en charge l'aiguillage et la sélection des outils, déléguant la rédaction textuelle aux LLM génératifs.

La majorité de l'architecture des agents IA repose sur des prises de décision logiques pour savoir quel outil exécuter. Utiliser Jev pour orchestrer ces choix permet d'économiser des jetons coûteux. Lorsqu'une rédaction de texte complète reste indispensable, comme la formulation d'un e-mail de réponse, Jev peut déclencher un modèle comme GPT-5.6 Terra via le SDK AI de Vercel.

Limites techniques et perspectives d'utilisation

  • Le modèle actuel plafonne à une fenêtre de contexte de 32 000 jetons environ.
  • Les performances restent faibles sur la manipulation des chiffres, les opérations mathématiques et la comparaison de dates.
  • Le système s'utilise comme un composant complémentaire au code déterministe et aux modèles génératifs.

Jev ne cherche pas à remplacer complètement les grands modèles linguistiques, mais à s'insérer comme une couche de décision ultra-rapide. Des tests en production restent nécessaires pour mesurer sa résistance aux injections de prompt et sa fiabilité globale sur des cas complexes. La combinaison de la logique traditionnelle, de la rapidité de Jev et de la capacité de rédaction des LLM offre une structure logicielle plus efficace.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기