TuBrief
Subscribed Channels
Videos
Community

Cara Menyiapkan Model 27B di Server Internal dan Mengendalikan Biaya Token

TuBrief Editorial
August 11, 2026
0
Computing/Software

Written with AI assistance from the source video. The video is the authority.

Bahasa Indonesia한국어EnglishEspañol中文العربيةहिन्दीDeutschFrançaisPortuguêsРусский日本語

Related Video

Model Open Source Ini Memperbaiki Kelemahan Terbesar AI (ThinkingCap)10:46

Model Open Source Ini Memperbaiki Kelemahan Terbesar AI (ThinkingCap)

Better Stack

More from the community

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

September 13, 2026

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

September 13, 2026

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

September 13, 2026

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

September 13, 2026

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

September 12, 2026

Apple Won the AI Race

September 12, 2026

Comments (0)

Log in to leave a comment

No posts yet

© 2026 . All rights reserved.

TuBrief
Subscribed Channels
Videos
Community
Log in

Cara Menyiapkan Model 27B di Server Internal dan Menyiapkan Biaya Token

Dalam situasi di mana API eksternal tidak dapat digunakan karena regulasi keamanan, Anda harus menghosting model 27B di server Anda sendiri. Anggaran tidak mencukupi untuk membeli H100 yang mahal, dan biaya token bulanan terus membengkak seperti bola salju. Artikel ini membahas metode praktis spesifik untuk menghemat lebih dari 40% anggaran perangkat keras di lingkungan on-premise dan memblokir pemborosan token dari infinite loop.

Konfigurasi Multi-GPU untuk Mengurangi Anggaran Perangkat Keras

Untuk menjalankan model 27B tanpa OOM (Out of Memory), Anda perlu menghitung kebutuhan VRAM secara akurat. Daripada membeli satu NVIDIA H100 80GB, gabungkan dua RTX 4090 24GB untuk membuat VRAM terintegrasi sebesar 48GB. Menggunakan metode ini dapat menurunkan biaya penyiapan perangkat keras awal hingga setengahnya atau lebih.

  1. Pastikan total VRAM yang dibutuhkan tidak melebihi 30GB dengan menjumlahkan bobot model (sekitar 28GB berdasarkan FP8) dan KV cache (1GB berdasarkan konteks 8K).
  2. Di lingkungan tanpa NVLink, tentukan opsi --tensor-parallel-size 2 saat menjalankan vLLM untuk mendistribusikan komputasi dalam lebar pita PCIe.
  3. Untuk menahan daya puncak lebih dari 1000W yang dikeluarkan oleh dua RTX 4090, gunakan catu daya bersertifikat 80 Plus Titanium dan cegah thermal throttling dengan kipas intake depan.

Tidak perlu terpaku pada perangkat mahal tunggal. Mengikat kartu grafis murah secara paralel adalah alternatif yang realistis untuk tim infrastruktur yang berada di bawah tekanan anggaran.

Pengaturan Engine untuk Mencegah Konsumsi Token Infinite Loop

Baru-baru ini, ketika model 27B memproses logika yang kompleks, seringkali mereka gagal mencetak token akhir (stop token) dan mengalami infinite loop hingga jumlah token maksimum tercapai. Di lingkungan API komersial, fenomena ini saja sudah membuat biaya operasional bulanan membengkak hingga tingkat yang tidak tertahankan. Anda dapat mengatasi pemborosan ini dengan pasti hanya dengan menyesuaikan parameter di engine serving lokal.

  1. Berikan repeat_penalty 1.15 dan presence_penalty 0.1 ke parameter serving untuk menekan fenomena di mana kalimat yang sama berulang kali dihasilkan.
  2. Masukkan <|im_end|>, <|eot_id|>, dan \nUser: ke dalam susunan stop pada file konfigurasi untuk memaksa model agar tidak melanjutkan tanya jawab sendiri.
  3. Terapkan temperature 0.2 dan min_p 0.05 untuk mengikat model agar tidak menyentuh token dengan probabilitas rendah.

Jika Anda menerapkan pengaturan ini, rata-rata jumlah token keluaran akan berkurang dari 4.000 menjadi 800. Bahkan termasuk biaya listrik dan penyusutan peralatan, Anda dapat mengontrol biaya operasional bulanan per unit di sekitar kisaran 290 dolar.

Distribusi Bobot dan Manajemen Pipeline di Lingkungan Air-Gapped

Di lingkungan air-gapped yang sepenuhnya terisolasi dari jaringan eksternal, pipeline untuk mengelola bobot secara stabil dan melayaninya adalah suatu keharusan. Dengan memanfaatkan vLLM, Anda dapat membuka endpoint API dengan kecepatan yang tidak kalah dari layanan komersial bahkan di dalam jaringan internal perusahaan.

  1. Unduh bobot menggunakan huggingface-cli di bastion host yang memiliki akses internet, dan unduh ke dalam struktur file tunggal dengan menggunakan opsi --local-dir-use-symlinks False.
  2. Tingkatkan reusabilitas konteks RAG dan cegah fragmentasi VRAM dengan menerapkan --enable-prefix-caching dan --gpu-memory-utilization 0.92 saat menjalankan vLLM.
  3. Pantau endpoint Prometheus (/metrics) secara konstan, dan jika indikator vllm:gpu_cache_usage_factor melebihi 90%, segera turunkan --max-model-len dari 16384 menjadi 8192.

Satu-satunya cara untuk mengontrol biaya sambil tetap mematuhi kebijakan keamanan perusahaan pada akhirnya adalah dengan membangunnya sendiri dan memantau angkanya secara langsung.