Pengaturan untuk Membatasi Pengeluaran API Bulanan Anthropic di Sekitar 2 Juta Rupiah Setelah Pembaruan Tarif
Bagi freelancer atau tim kecil yang bekerja dengan anggaran pengembangan bulanan di bawah 5 juta rupiah, perubahan kebijakan Anthropic kali ini cukup merepotkan. Penggunaan alat pihak ketiga menjadi dibatasi, dan kredit yang tersisa setiap bulan tidak akan dibawa ke bulan berikutnya dan langsung hangus begitu saja. Namun, jika Anda hanya menggunakan klien resmi secara membabi buta, tagihan API bisa dengan mudah melampaui ratusan ribu hingga jutaan rupiah hanya untuk beberapa kali coding.
Mengganti alat tidak akan menyelesaikan masalah. Anda harus memperbaiki struktur pertukaran prompt itu sendiri untuk menyelamatkan saldo rekening Anda.
Periksa Log Konsumsi Token dan Perbaiki Tingkat Hit Cache Terlebih Dahulu
Alat coding berbasis agen mengirimkan puluhan ribu token konteks sekaligus dalam satu permintaan. Berdasarkan daftar harga resmi Anthropic, biaya input dasar Claude 3.5 Sonnet adalah $3,00 per 1 juta token, dan output adalah $15,00. Di sisi lain, jika Anda menerapkan caching prompt, harga unit input turun menjadi $0,30. Itu adalah perbedaan sebesar 90%. Begitu ekstensi pihak ketiga memasukkan timestamp atau ID sesi di bagian atas prompt sistem, cache ini akan hancur total dan Anda harus membayar $3,00 setiap saat.
Pertama-tama, buka log selama 3 bulan terakhir dan hitung rasio cache_read_input_tokens terhadap token input.
- Proyek dengan tingkat hit cache kurang dari 40% perlu memeriksa metode injeksi prompt mereka.
- Alih-alih mengirimkan seluruh basis kode pada setiap permintaan, ubah agar hanya meneruskan file yang diubah berdasarkan
git diff ke dalam konteks.
- Letakkan aturan tetap di bagian atas prompt sistem dan deklarasikan
cache_control: {"type": "ephemeral"}.
Dengan hanya menurunkan variabel dinamis ke bagian bawah prompt dan menyimpan teks statis ke dalam cache, Anda dapat mengurangi hampir separuh pemborosan token latar belakang.
Bagi Model Berdasarkan Tingkat Kesulitan Tugas dengan LiteLLM Proxy
Anda tidak perlu menulis setiap baris kode dengan Sonnet atau Opus. Memanggil model frontier cloud untuk pelengkapan otomatis tab adalah pemborosan yang jelas.
| Klasifikasi Tugas |
Model yang Dipanggil |
Lokasi Eksekusi |
Tingkat Biaya |
| Desain arsitektur dan refactoring skala besar |
Claude 3.5 Sonnet |
Cloud API |
Tarif standar (100%) |
| Fungsi utilitas sederhana dan unit test |
Claude 3.5 Haiku, DeepSeek-V3 |
Cloud API |
Sekitar 20% ~ 30% |
| Pelengkapan tab real-time dan boilerplate |
Ollama (Qwen2.5-Coder 14B) |
Local On-Device |
$0,00 |
Jalankan LiteLLM di mesin lokal Anda untuk dijadikan sebagai gateway lalu lintas. Tulis aturan perutean model di config.yaml.
`yaml
model_list:
- model_name: smart-model
litellm_params:
model: anthropic/claude-3-5-sonnet-20241022
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: fast-model
litellm_params:
model: deepseek/deepseek-chat
api_key: os.environ/DEEPSEEK_API_KEY
- model_name: local-coder
litellm_params:
model: ollama/qwen2.5-coder:14b
api_base: http://localhost:11434
`
Tentukan export ANTHROPIC_BASE_URL="http://localhost:4000" di terminal dan hubungkan Continue.dev atau Claude Code. Pelengkapan otomatis secara real-time ditangani oleh model Qwen GPU lokal, dan hanya pertanyaan desain yang kompleks yang diteruskan ke Sonnet.
Lakukan juga pekerjaan untuk mengurangi token output secara bersamaan. Jika Anda menulis prompt sistem untuk menghilangkan semua pendahuluan, salam, dan penjelasan kode yang tidak perlu dan hanya mengembalikan blok kode, pengeluaran token output dengan harga tinggi akan berkurang secara signifikan.
Alihkan Sisa Kredit Bulanan ke Batch API untuk Menghabiskannya
Kredit bulanan Anthropic akan kedaluwarsa begitu melewati tanggal kedaluwarsa. Agar sisa saldo tidak terbuang percuma, Anda harus menjalankan Batch API Anthropic 3 hari sebelum masa berlakunya habis.
Batch API memberikan diskon 50% untuk semua harga token dengan syarat pengembalian asinkron dalam waktu 24 jam. Jika Anda menggabungkannya dengan caching prompt, Anda dapat memprosesnya pada tingkat sekitar 5% dari harga asli. Kumpulkan tugas-tugas yang tidak memerlukan jawaban real-time segera dan teruskan sekaligus.
- Analisis statis dan pemeriksaan kerentanan keamanan untuk seluruh basis kode
- Pembuatan kode unit test massal untuk kode lama
- Pembaruan otomatis spesifikasi endpoint API dan dokumentasi teknis
Jika Anda menggabungkan tugas-tugas ini ke dalam file JSONL dan memasukkannya ke endpoint batch, Anda dapat mengubah kredit yang tadinya hampir terbuang menjadi aset kode uji dan dokumentasi.
Tetapkan Batas Pengeluaran dan Jalur Bypass Lokal
Untuk mencegah tagihan yang berlebihan, nonaktifkan pengisian ulang otomatis (Auto-Recharge) di pengaturan penagihan konsol Anthropic, dan isi ulang secara manual sekitar $150 pada awal bulan.
Setelah mengikat batas panggilan langsung ke $150 di menu Spend Limits konsol, tambahkan pengaturan pemulihan kegagalan (Fallback) ke proxy LiteLLM.
`yaml
router_settings:
fallbacks:
- claude-3-5-sonnet-20241022: ["ollama/qwen2.5-coder:14b"]
`
Bahkan jika kredit habis dan kesalahan 429 terjadi, Ollama lokal akan langsung mengambil alih panggilan. Jika Anda bekerja dalam unit tim, bagikan .continue/config.json di root repositori Git, dan tentukan batas bulanan kunci virtual (Virtual Key) setiap anggota tim sebesar $50 di halaman manajemen LiteLLM. Hanya lalu lintas pengembang yang melampaui batas yang akan dialihkan ke model lokal, sehingga pengeluaran seluruh tim tidak akan melebihi anggaran.