Comment déployer un modèle 27B sur un serveur interne et maîtriser les coûts des jetons
TuBrief 편집팀
2026년 8월 11일
0
Computing/Software원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
커뮤니티의 다른 글
댓글 (0)
Log in to leave a comment
아직 작성된 글이 없습니다
원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
Log in to leave a comment
아직 작성된 글이 없습니다
En raison des réglementations de sécurité interdisant l'utilisation d'API externes, vous devez héberger un modèle 27B sur votre propre serveur. Le budget est insuffisant pour s'offrir des cartes H100 hors de prix, et les coûts mensuels en jetons augmentent de façon exponentielle. Cet article présente des méthodes pratiques concrètes pour réduire le budget matériel de plus de 40 % et bloquer le gaspillage de jetons lié aux boucles infinies dans un environnement sur site (on-premise).
Pour exécuter un modèle 27B sans erreur OOM (Out Of Memory), il est nécessaire de calculer précisément les besoins en VRAM. Au lieu d'acheter un unique Nvidia H100 de 80 Go, associez deux cartes RTX 4090 de 24 Go pour obtenir une VRAM unifiée de 48 Go. Cette approche permet de diviser par deux ou plus le coût initial d'investissement matériel.
--tensor-parallel-size 2 lors de l'exécution de vLLM afin de répartir les calculs dans la limite de la bande passante PCIe.Il n'est pas nécessaire de s'entêter sur un équipement unique et onéreux. Associer des cartes graphiques abordables en parallèle constitue une alternative réaliste pour les équipes d'infrastructure soumises à des contraintes budgétaires.
Récemment, lors du traitement de logiques complexes, les modèles 27B omettent souvent d'émettre un jeton de fin et tombent dans une boucle infinie jusqu'à atteindre le nombre maximal de jetons. Dans un environnement d'API commerciale, ce seul phénomène fait grimper les coûts d'exploitation mensuels à un niveau insoutenable. Il est possible d'éliminer définitivement ce gaspillage en ajustant simplement les paramètres du moteur de service local.
repeat_penalty 1.15 et presence_penalty 0.1 aux paramètres de service pour inhiber l'apparition répétée de phrases identiques.<|im_end|>, <|eot_id|> et \nUser: dans le tableau stop du fichier de configuration pour empêcher le modèle de poursuivre un monologue en autarcie.temperature 0.2 et min_p 0.05 pour contraindre le modèle à ne pas s'aventurer sur des jetons à faible probabilité.L'application de ces paramètres réduit le nombre moyen de jetons de sortie de 4 000 à 800. Même en incluant les coûts d'électricité et l'amortissement du matériel, les frais d'exploitation mensuels par unité peuvent être maîtrisés autour de 290 dollars.
Dans un environnement isolé (air-gap) totalement coupé du réseau externe, il est indispensable de disposer d'un pipeline pour gérer et servir les poids de manière stable. L'utilisation de vLLM permet d'ouvrir des points de terminaison d'API sur le réseau interne de l'entreprise avec des vitesses comparables à celles d'un service commercial.
huggingface-cli depuis une machine bastion connectée à Internet en utilisant l'option --local-dir-use-symlinks False pour les récupérer sous une structure de fichier unique.--enable-prefix-caching et --gpu-memory-utilization 0.92 pour accroître la réutilisabilité du contexte RAG et prévenir la fragmentation de la VRAM./metrics) et, dès que l'indicateur vllm:gpu_cache_usage_factor dépasse 90 %, réduisez immédiatement --max-model-len de 16384 à 8192.En fin de compte, la seule façon de maîtriser les coûts tout en respectant les politiques de sécurité internes reste un déploiement direct et un suivi rigoureux des métriques.