Cara Menyiapkan Model 27B di Server Internal dan Mengendalikan Biaya Token
TuBrief 편집팀
2026년 8월 11일
0
Computing/Software원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
커뮤니티의 다른 글
댓글 (0)
Log in to leave a comment
아직 작성된 글이 없습니다
원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.
Log in to leave a comment
아직 작성된 글이 없습니다
Dalam situasi di mana API eksternal tidak dapat digunakan karena regulasi keamanan, Anda harus menghosting model 27B di server Anda sendiri. Anggaran tidak mencukupi untuk membeli H100 yang mahal, dan biaya token bulanan terus membengkak seperti bola salju. Artikel ini membahas metode praktis spesifik untuk menghemat lebih dari 40% anggaran perangkat keras di lingkungan on-premise dan memblokir pemborosan token dari infinite loop.
Untuk menjalankan model 27B tanpa OOM (Out of Memory), Anda perlu menghitung kebutuhan VRAM secara akurat. Daripada membeli satu NVIDIA H100 80GB, gabungkan dua RTX 4090 24GB untuk membuat VRAM terintegrasi sebesar 48GB. Menggunakan metode ini dapat menurunkan biaya penyiapan perangkat keras awal hingga setengahnya atau lebih.
--tensor-parallel-size 2 saat menjalankan vLLM untuk mendistribusikan komputasi dalam lebar pita PCIe.Tidak perlu terpaku pada perangkat mahal tunggal. Mengikat kartu grafis murah secara paralel adalah alternatif yang realistis untuk tim infrastruktur yang berada di bawah tekanan anggaran.
Baru-baru ini, ketika model 27B memproses logika yang kompleks, seringkali mereka gagal mencetak token akhir (stop token) dan mengalami infinite loop hingga jumlah token maksimum tercapai. Di lingkungan API komersial, fenomena ini saja sudah membuat biaya operasional bulanan membengkak hingga tingkat yang tidak tertahankan. Anda dapat mengatasi pemborosan ini dengan pasti hanya dengan menyesuaikan parameter di engine serving lokal.
repeat_penalty 1.15 dan presence_penalty 0.1 ke parameter serving untuk menekan fenomena di mana kalimat yang sama berulang kali dihasilkan.<|im_end|>, <|eot_id|>, dan \nUser: ke dalam susunan stop pada file konfigurasi untuk memaksa model agar tidak melanjutkan tanya jawab sendiri.temperature 0.2 dan min_p 0.05 untuk mengikat model agar tidak menyentuh token dengan probabilitas rendah.Jika Anda menerapkan pengaturan ini, rata-rata jumlah token keluaran akan berkurang dari 4.000 menjadi 800. Bahkan termasuk biaya listrik dan penyusutan peralatan, Anda dapat mengontrol biaya operasional bulanan per unit di sekitar kisaran 290 dolar.
Di lingkungan air-gapped yang sepenuhnya terisolasi dari jaringan eksternal, pipeline untuk mengelola bobot secara stabil dan melayaninya adalah suatu keharusan. Dengan memanfaatkan vLLM, Anda dapat membuka endpoint API dengan kecepatan yang tidak kalah dari layanan komersial bahkan di dalam jaringan internal perusahaan.
huggingface-cli di bastion host yang memiliki akses internet, dan unduh ke dalam struktur file tunggal dengan menggunakan opsi --local-dir-use-symlinks False.--enable-prefix-caching dan --gpu-memory-utilization 0.92 saat menjalankan vLLM./metrics) secara konstan, dan jika indikator vllm:gpu_cache_usage_factor melebihi 90%, segera turunkan --max-model-len dari 16384 menjadi 8192.Satu-satunya cara untuk mengontrol biaya sambil tetap mematuhi kebijakan keamanan perusahaan pada akhirnya adalah dengan membangunnya sendiri dan memantau angkanya secara langsung.