Como implementar um modelo 27B em seu servidor interno e controlar os custos de tokens
Em situações onde APIs externas não podem ser usadas devido a regulamentações de segurança, é necessário hospedar um modelo 27B em seu próprio servidor. O orçamento é insuficiente para comprar um H100 caro, e os custos mensais de tokens estão crescendo como uma bola de neve. Este artigo aborda métodos práticos específicos para economizar mais de 40% no orçamento de hardware em um ambiente on-premise e bloquear o desperdício de tokens em loop infinito.
Configuração multi-GPU para reduzir o orçamento de hardware
Para executar o modelo 27B sem OOM, você precisa calcular com precisão os requisitos de VRAM. Em vez de comprar uma única Nvidia H100 de 80GB, combine duas RTX 4090 de 24GB para criar 48GB de VRAM unificada. Usar essa abordagem pode reduzir o custo inicial de configuração de hardware para menos da metade.
- Adicione os pesos do modelo (cerca de 28GB em FP8) e o cache KV (1GB para um contexto de 8K) para verificar se a VRAM total necessária não excede 30GB.
- Em ambientes sem NVLink, especifique a opção
--tensor-parallel-size 2 ao executar o vLLM para distribuir os cálculos dentro da largura de banda PCIe.
- Para suportar o pico de energia de mais de 1000W gerado por duas RTX 4090, use uma fonte com certificação 80 Plus Titanium e evite o afogamento térmico (thermal throttling) com ventiladores de admissão frontais.
Não há necessidade de se fixar em um único equipamento de alto padrão. Agrupar placas de vídeo baratas em paralelo é uma alternativa realista para equipes de infraestrutura sob pressão orçamentária.
Configurações do motor para evitar o consumo de tokens em loop infinito
Recentemente, ao processar lógicas complexas, os modelos 27B frequentemente não conseguem emitir o token de término e entram em um loop infinito até o número máximo de tokens. Em ambientes de API comercial, apenas esse fenômeno torna insuportável o crescimento dos custos operacionais mensais. Você pode conter esse desperdício com certeza ajustando apenas os parâmetros no motor de atendimento local.
- Atribua
repeat_penalty 1.15 e presence_penalty 0.1 aos parâmetros de atendimento para suprimir o fenômeno de geração repetida de frases idênticas.
- Insira
<|im_end|>, <|eot_id|> e \nUser: na matriz stop do arquivo de configuração para forçar o modelo a não continuar conversando consigo mesmo.
- Aplique
temperature 0.2 e min_p 0.05 para manter o modelo impedido de tocar em tokens de baixa probabilidade.
Ao aplicar essas configurações, o número médio de tokens de saída diminui de 4.000 para 800. Mesmo incluindo custos de energia e depreciação de equipamentos, o custo operacional mensal por unidade pode ser controlado na faixa de 290 dólares.
Implantação de pesos e gerenciamento de pipeline em ambiente air-gapped
Em um ambiente air-gapped completamente isolado da rede externa, um pipeline para gerenciar e atender de forma estável aos pesos é essencial. Ao utilizar o vLLM, você pode abrir um endpoint de API com velocidade comparável a um serviço comercial, mesmo na rede interna da empresa.
- Baixe os pesos com
huggingface-cli em um host bastião conectado à internet e use a opção --local-dir-use-symlinks False para baixar em uma estrutura de arquivo único.
- Ao executar o vLLM, aplique
--enable-prefix-caching e --gpu-memory-utilization 0.92 para aumentar a reusabilidade do contexto RAG e evitar a fragmentação de VRAM.
- Monitore constantemente o endpoint do Prometheus (
/metrics) e, se o indicador vllm:gpu_cache_usage_factor ultrapassar 90%, reduza imediatamente o --max-model-len de 16384 para 8192.
A única maneira de controlar custos enquanto cumpre as políticas de segurança corporativa é construir você mesmo e monitorar as métricas.