TuBrief
Subscribed Channels
Videos
Community

27B 모델을 사내 서버에 구축하고 토큰 비용을 잡는 법

TuBrief Editorial
August 11, 2026
0
컴퓨터/소프트웨어

Written with AI assistance from the source video. The video is the authority.

한국어EnglishEspañol中文العربيةहिन्दीDeutschFrançaisPortuguêsРусскийBahasa Indonesia日本語

Related Video

AI의 가장 큰 결점을 해결하는 오픈소스 모델 (ThinkingCap)10:46

AI의 가장 큰 결점을 해결하는 오픈소스 모델 (ThinkingCap)

Better Stack

More from the community

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

September 13, 2026

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

September 13, 2026

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

September 13, 2026

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

September 13, 2026

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

September 12, 2026

Apple Won the AI Race

September 12, 2026

Comments (0)

Log in to leave a comment

No posts yet

© 2026 . All rights reserved.

TuBrief
Subscribed Channels
Videos
Community
Log in

27B 모델을 사내 서버에 구축하고 토큰 비용을 잡는 법

보안 규제 때문에 외부 API를 쓸 수 없는 상황에서 27B 모델을 자체 서버에 올려야 합니다. 고가의 H100을 사기엔 예산이 부족하고, 매달 나가는 토큰 비용은 눈덩이처럼 불어나고 있습니다. 이 글은 온프레미스 환경에서 하드웨어 예산을 40% 이상 아끼고 무한 루프 토큰 낭비를 차단하는 구체적인 실무 방법을 다룹니다.

하드웨어 예산을 줄이는 멀티 GPU 구성법

27B 모델을 OOM 없이 돌리려면 VRAM 요구량을 정확히 계산해야 합니다. 엔비디아 H100 80GB 한 대를 사는 대신, RTX 4090 24GB 두 대를 묶어 48GB의 통합 VRAM을 만드십시오. 이 방식을 쓰면 초기 하드웨어 구축 비용을 절반 이하로 낮출 수 있습니다.

  1. 모델 가중치(FP8 기준 약 28GB)와 KV 캐시(8K 컨텍스트 기준 1GB)를 더해 총 필요 VRAM이 30GB를 넘지 않는지 확인합니다.
  2. NVLink가 없는 환경에서는 vLLM 실행 시 --tensor-parallel-size 2 옵션을 지정해 PCIe 대역폭 내에서 연산을 분산합니다.
  3. RTX 4090 두 대가 뿜어내는 1000W 이상의 피크 전력을 버티기 위해 80 Plus Titanium 인증 파워를 쓰고, 전면 흡기 팬으로 열 스로틀링을 막습니다.

단일 고가 장비에 집착할 필요가 없습니다. 저렴한 그래픽카드를 병렬로 묶는 편이 예산 압박을 받는 인프라 팀에게 현실적인 대안입니다.

무한 루프 토큰 소비를 막는 엔진 설정

최근 27B 모델은 복잡한 논리를 처리할 때 종료 토큰을 출력하지 못하고 최대 토큰 수까지 무한 루프를 돌리는 경우가 많습니다. 상용 API 환경에서는 이 현상 하나만으로도 월간 운영 비용이 감당하기 힘들 정도로 불어납니다. 로컬 서빙 엔진에서 파라미터만 손봐도 이 낭비를 확실하게 잡을 수 있습니다.

  1. 서빙 파라미터에 repeat_penalty 1.15와 presence_penalty 0.1을 주어 동일 문장이 반복해서 생기는 현상을 억제합니다.
  2. 설정 파일의 stop 배열에 <|im_end|>, <|eot_id|>, \nUser:를 넣어 모델이 혼자 자문자답을 이어가지 못하게 강제합니다.
  3. temperature 0.2, min_p 0.05를 적용해 모델이 확률이 낮은 토큰을 건드리지 않도록 묶어둡니다.

이 설정들을 적용하면 평균 출력 토큰 수가 4,000개에서 800개로 줄어듭니다. 전력비와 장비 감가상각을 포함해도 대당 월간 운영비를 290달러 선에서 통제할 수 있습니다.

에어갭 환경에서 가중치 배포 및 파이프라인 관리

외부 망과 완전히 차단된 에어갭 환경에서는 가중치를 안정적으로 관리하고 서빙하는 파이프라인이 필수입니다. vLLM을 활용하면 사내 내부망에서도 상용 서비스와 다름없는 속도의 API 엔드포인트를 열 수 있습니다.

  1. 인터넷이 되는 바스온 호스트에서 huggingface-cli로 가중치를 받고 --local-dir-use-symlinks False 옵션을 써서 단일 파일 구조로 내려받습니다.
  2. vLLM 구동 시 --enable-prefix-caching과 --gpu-memory-utilization 0.92를 적용해 RAG 컨텍스트 재사용성을 높이고 VRAM 파편화를 방지합니다.
  3. 프로메테우스 엔드포인트(/metrics)를 상시 모니터링하다가 vllm:gpu_cache_usage_factor 지표가 90%를 넘어가면 --max-model-len을 16384에서 8192로 즉시 낮춥니다.

사내 보안 정책을 지키면서도 비용을 통제하는 유일한 방법은 결국 직접 구축하고 수치를 모니터링하는 것뿐입니다.