TuBrief
구독 채널
비디오
커뮤니티

Alasan Mengapa Anda Tidak Boleh Hanya Menggunakan Claude Sonnet untuk Layanan Web Mandiri

TuBrief 편집팀
2026년 8월 22일
0
Computing/Software

원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.

Bahasa Indonesia한국어EnglishEspañol中文العربيةहिन्दीDeutschFrançaisPortuguêsРусский

관련 영상

Gemini 3.5 Flash memang... biasa saja6:48

Gemini 3.5 Flash memang... biasa saja

Better Stack

커뮤니티의 다른 글

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

2026년 9월 13일

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

2026년 9월 13일

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

2026년 9월 13일

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

2026년 9월 13일

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

2026년 9월 12일

Apple Won the AI Race

2026년 9월 12일

댓글 (0)

Log in to leave a comment

아직 작성된 글이 없습니다

© 2026 . All rights reserved.

TuBrief
구독 채널
비디오
커뮤니티
로그인

Alasan Mengapa Anda Tidak Boleh Hanya Menggunakan Claude Sonnet untuk Layanan Web Mandiri

Ketika Anda membuat dan mengoperasikan layanan web sendiri dengan anggaran bulanan di bawah 5 juta won, penggunaan model AI tingkat atas saja akan dengan cepat membengkak biaya API Anda. Jika Anda memilih model asisten coding hanya berdasarkan skor benchmark, Anda akan melampaui batas pengeluaran dalam beberapa putaran saja di lingkungan pengembangan nyata. Dengan memahami konsumsi token untuk setiap tahap kerja dan membagi model yang digunakan, Anda dapat mengurangi pengeluaran API lebih dari 30% sekaligus mempertahankan kecepatan pengembangan.


1. Konsumsi Token Aktual dan Rumus Perhitungan Saat Mengembangkan Sendiri

Pengembangan layanan web dibagi menjadi pembuatan prototipe, penulisan logika inti, refactoring, dan debugging. Dengan asumsi rata-rata 50 panggilan per hari atau 1.000 panggilan dalam sebulan (berdasarkan 20 hari), proporsi token input sangat bervariasi di setiap tahap kerja. Tahap debugging, di mana log error dan kode sebelumnya terakumulasi dalam satu jendela obrolan, dapat melonjak hingga 45.000 token input sekaligus, dan penulisan logika backend juga memerlukan input tinggi sekitar 25.000 token.

Tahap Pengembangan Jumlah Panggilan Bulanan Rata-rata Token Input per Panggilan Rata-rata Token Respon per Panggilan Total Token Input Bulanan Total Token Respon Bulanan
Pembuatan Prototipe & Desain Awal 150 3.000 1.500 450.000 225.000
Implementasi Logika Inti 450 25.000 2.000 11.250.000 900.000
Refactoring & Code Review 200 15.000 1.000 3.000.000 200.000
Debugging & Error Tracing 200 45.000 2.500 9.000.000 500.000
Total Bulanan 1.000 -- -- 23.700.000 1.825.000

Saat menghitung pengeluaran API, Anda harus menyertakan perbedaan harga satuan antara token input dan token respon. Karena token respon menggunakan sumber daya komputasi waktu nyata, harganya minimal 3 hingga 5 kali lebih mahal daripada token input. Total biaya pengeluaran bulanan dihitung dengan rumus berikut:

ext{Cost}*{ ext{monthly}} = sum*{m} left( rac{T_{ ext{input}, m}}{1.000.000} cdot P_{ ext{input}, m} + rac{T_{ ext{cache}, m}}{1.000.000} cdot P_{ ext{cache}, m} + rac{T_{ ext{output}, m}}{1.000.000} cdot P_{ ext{output}, m} ight)

Jika semua pekerjaan diproses dengan satu model tunggal yaitu Claude 3.5 Sonnet ($3.00 per 1M input, $15.00 per 1M respon), berdasarkan total bulanan (sekitar 23,7 juta input, sekitar 1,825 juta respon), biayanya menjadi $98.48 (sekitar 135.000 won) per bulan. Masalahnya adalah ketika percakapan menjadi panjang dan konteks terakumulasi. Jika jumlah input meningkat 3 kali lipat, pengeluaran bulanan langsung melebihi $250. Pengembang tunggal harus menetapkan batas atas AI pada tingkat $100 hingga 150,yangkurangdari10150, yang kurang dari 10% dari total anggaran operasional, dan mengatur notifikasi 50% (150,yangkurangdari1050) dan 80% ($80), serta pemblokiran paksa 100% (Hard Limit) di konsol penyedia agar aman.


2. Pengecualian File yang Tidak Perlu dan Caching Prompt

Jika Anda memasukkan seluruh folder proyek ke dalam agen coding apa adanya, file tambahan seperti node_modules, dist/, dan package-lock.json akan ikut masuk, menyebabkan 60-70% token input terbuang sia-sia. Sebaiknya gunakan alat CLI seperti Repomix untuk memilih dan mengemas hanya file logika bisnis yang diperlukan.

json { "output": { "filePath": "repomix-output.xml", "style": "xml", "removeComments": true, "removeEmptyLines": true }, "ignore": { "useGitignore": true, "useDefaultPatterns": true, "customPatterns": [ "**/node_modules/<strong>", "</strong>/dist/<strong>", "</strong>/*.test.ts", "**/*.spec.ts", "<strong>/package-lock.json", "</strong>/yarn.lock", "**/*.public/<strong>", "</strong>/*.svg" ] } }

Terapkan caching prompt pada prompt sistem dan kode pustaka umum. Untuk Anthropic Claude API, jika Anda menyertakan breakpoint cache_control pada prompt sistem dengan minimal 1.024 token atau lebih, saat Anda meminta ulang dalam waktu 5 menit setelah penulisan pertama, harga baca cache diskon 90% sebesar $0.30/1M akan diterapkan.

json { "model": "claude-3-5-sonnet-20241022", "max_tokens": 2048, "system": [ { "type": "text", "text": "Pengguna adalah pengembang tunggal spesialis TypeScript dan Next.js. Kembalikan hanya kode yang disesuaikan dengan spesifikasi antarmuka yang presisi.", "cache_control": {"type": "ephemeral"} } ], "messages": [ { "role": "user", "content": "Isi file definisi skema DB umum..." } ] }

Cara untuk mengurangi panjang prompt dapat dirangkum dalam tiga tahap:

  • Berikan opsi --compress saat menjalankan Repomix untuk mengecualikan bagian implementasi internal dan hanya mengekstrak antarmuka serta tanda tangan fungsi (function signature).
  • Lampirkan flag --remove-comments dan --remove-empty-lines untuk memangkas komentar dan spasi kosong. Panjang token akan berkurang 15~20% lagi.
  • Bungkus blok kode yang diekstrak dengan tag XML alih-alih teks biasa agar model tidak bingung saat melakukan parsing.

3. Pemisahan Model yang Digunakan untuk Draf UI dan Logika Backend

Tidak perlu menggunakan model mahal untuk penataan komponen sederhana atau pekerjaan gaya Tailwind CSS. Untuk draf UI frontend, gunakan Gemini 2.0 Flash ($0.10/1M input, 0.40/1Mrespon)atauGPT−4omini(0.40/1M respon) atau GPT-4o mini (0.40/1Mrespon)atauGPT−4omini(0.15/1M input, $0.60/1M respon) yang memproses konteks panjang dengan murah.

Area Kerja Detail Pekerjaan Model yang Disarankan Alasan Pemilihan
UI Frontend Penulisan Tailwind CSS berbasis tangkapan layar, penyusunan tata letak HTML Gemini 2.0 Flash Pemrosesan multimodal yang murah dan kecepatan respons cepat
Backend Umum Implementasi RESTful API, CRUD DB dasar, validasi nilai input DeepSeek V3 Memberikan performa yang layak dengan harga 1/10 dibandingkan Claude
Backend Kompleks Multi-transaksi, kontrol konkurensi, refactoring kompleks, verifikasi keamanan Claude 3.5 Sonnet Penggantian presisi ketika kesalahan berulang pada model yang lebih rendah

CRUD umum atau logika API sekali pakai ditulis menggunakan DeepSeek V3 ($0.25/1M input, $0.95/1M respon) yang harganya sepersepuluh dari Claude 3.5 Sonnet. Beralihlah ke Claude 3.5 Sonnet hanya ketika kesalahan tidak dapat diselesaikan pada kode yang rumit seperti kueri kompleks yang melibatkan banyak tabel atau transaksi kontrol konkurensi.

Metode koneksi untuk mengurangi pemborosan konteks antara kedua model adalah sebagai berikut:

  • Ekstrak hanya TypeScript Interface (Props dan State) dari komponen UI yang dibuat dengan Gemini 2.0 Flash, dengan mengecualikan seluruh kode.
  • Buat skema JSON ringan yang berisi metode HTTP, jalur URL, serta isi permintaan dan respons untuk tujuan penerusan ke backend.
  • Teruskan hanya skema ini ke DeepSeek V3 untuk mengimplementasikan endpoint API backend. Anda dapat menghemat 15.000 token per sesi sekaligus mempersingkat total waktu pekerjaan pengembangan sekitar 5 jam.

4. Pemblokiran Looping Koreksi Mandiri dan Standar Inspeksi Praktis

Karena benchmark publik diukur dengan kueri satu kali (single-shot), benchmark tersebut berbeda dari lingkungan agen coding (seperti Aider). Jika percakapan berlanjut selama lebih dari 10 putaran, riwayat percakapan sebelumnya dikirim secara bersamaan setiap saat, sehingga menghabiskan $1 hingga $2 hanya untuk memperbaiki satu kesalahan pengetikan.

Jika agen terjebak dalam perulangan koreksi mandiri di mana ia memperbaiki kode sendiri dan menjalankannya kembali setelah pengujian gagal, $20 hingga $50 akan terkuras dalam beberapa menit. Untuk mencegah hal ini, Anda harus menyiapkan tiga kriteria kontrol:

  • Batasi jumlah maksimum perulangan otonom tanpa intervensi manusia (Max Iterations) menjadi 3 hingga 5 kali dalam opsi eksekusi agen.
  • Jangan meneruskan seluruh log error, tetapi potong dan masukkan hanya pesan inti dalam 20 baris teratas.
  • Jika perbaikan berulang di lokasi file yang sama lebih dari tiga kali, segera hentikan proses secara paksa dan periksa kodenya secara langsung.
Item Verifikasi Detail Tinjauan Metode Eksekusi & Inspeksi
Isolasi Prompt Pengaturan file abaikan dan pemeriksaan ukuran pengepakan Pengukuran awal token pengepakan setelah menerapkan .gitignore dan repomix.config.json
Distribusi Model Penentuan model berdasarkan tingkat kesulitan kerja Menunjuk Gemini Flash untuk UI, DeepSeek V3 untuk CRUD, dan Claude Sonnet untuk logika kompleks
Caching Prompt Unit token minimum dan verifikasi breakpoint Memastikan prompt sistem 1.000 token atau lebih lalu menyisipkan cache_control
Batas Pengeluaran & Batasan Looping Pengaturan perangkat pemutus pengaman Membatasi perulangan otonom agen hingga 5 kali atau kurang, mengatur batas pengeluaran konsol penyedia API

Poin penting saat menggunakan AI coding adalah bukan dengan membabi buta memasang model mahal terbaru, melainkan mengontrol alat sesuai dengan karakteristik pekerjaan. Anda dapat menyelesaikan produk tanpa beban biaya dengan memperkirakan anggaran menggunakan rumus perhitungan token, memangkas prompt menggunakan Repomix, dan mencampur model sesuai dengan sifat pekerjaan.