Jalankan Claude Code dengan Ollama untuk AI yang 99% Lebih Murah

BBetter Stack
Computing/SoftwareInternet Technology

Transcript

00:00:00Ollama adalah server model headless dengan lebih dari 176.000 bintang di GitHub yang memungkinkan Anda menjalankan model terbuka
00:00:06melalui aplikasi atau agen apa pun termasuk Clawed Code, Codex, dan bahkan Open Claw, Anda dapat mengarahkan
00:00:12alat Anda ke Ollama yang bahkan mengelola model lokal atau mengarahkan lalu lintas Anda ke model yang dihosting di Clawed
00:00:18Code, sebagai contoh, Anda cukup mengubah variabel lingkungan base URL untuk mengarah ke server Ollama Anda
00:00:23sekarang semuanya bekerja persis seperti sebelumnya tetapi Anda telah membuka akses ke ratusan
00:00:28model, bukan hanya empat, seperti GLM, DeepSeek, dan bahkan model lokal seperti Gemma dan Qwen, semuanya
00:00:34tersedia. Ini adalah terobosan besar karena Anda dapat terus menggunakan semua alat yang Anda sukai dengan cara
00:00:38yang sama tetapi sekarang Anda telah membuka akses ke setiap model yang terpikirkan oleh Anda. Hari ini kita akan mencoba Ollama
00:00:44kita akan mencoba menjalankan model terbuka melalui Clawed Code dan melihat apakah layak digunakan dibandingkan kompetitor lain
00:00:50seperti vLLM dan LM Studio. Saat kita meluncurkan CLI Ollama secara langsung, itu memberi kita opsi untuk meluncurkan alat CLI lain
00:01:01seperti Clawed Code atau Open Code, lalu kita bisa memilih model pilihan kita. Sekarang saya berada di dalam Open
00:01:07Code, tapi saya menjalankan Gemma 4 melalui Ollama dan sekarang saya bisa mengetik sesuatu seperti apakah Anda berlangganan Better
00:01:12Stack dan jika jawabannya tidak, maka mengapa tidak berlangganan di bawah video ini. Kita bahkan tidak perlu melalui
00:01:17CLI Ollama sama sekali. Dengan Clawed Code sebagai contoh, Anda cukup mengubah variabel lingkungan untuk mengarah ke
00:01:23Ollama, mengubah base URL dan API token, dan sekarang Anda bisa langsung menjalankan Clawed Code yang mengarah ke
00:01:29model mana pun yang Anda suka. Hasilnya, sekarang saya berada di dalam Clawed Code, saya bisa menggunakannya persis seperti sebelumnya tetapi
00:01:34sekarang saya menjalankannya dengan model sumber terbuka. Anda bahkan dapat menjalankan model secara langsung dengan Ollama seperti menjalankan
00:01:40Gemma 4 yang merupakan model multimodal, saya bisa menanyakan pertanyaan seperti mengidentifikasi apa isi sebuah gambar dan Anda
00:01:46bahkan bisa masuk ke harness Ollama secara langsung untuk mengobrol dengan model seperti Gemma sehingga Anda tidak butuh alat pihak
00:01:51ketiga sama sekali. Oke, jadi kita berada di terminal di sini dan saya akan mengetik "ollama" untuk masuk ke CLI
00:01:57dan Anda bisa melihat di sini kita punya banyak opsi agen atau harness berbeda yang bisa kita masuki
00:02:01kita bisa mengobrol dengannya secara langsung, tapi dalam kasus ini saya hanya akan masuk ke Clawed Code dan Anda bisa melihat
00:02:05juga bahwa model default yang sudah saya unduh adalah Gemma 4. Jadi sekarang kita berada di dalam Clawed Code dan
00:02:11Anda bisa melihat kita menggunakan Gemma 4 dengan "high effort". Tertulis "API usage billing", tetapi karena ini sebenarnya
00:02:17adalah model lokal, itu tidak akan memakan biaya apa pun sama sekali, jadi kita bisa mengetik pesan seperti "hello". Jadi setelah model
00:02:23membalas, Anda masih bisa melihat bahwa ia tetap mengira dirinya adalah Clawed Code, padahal ia masih menjalankan model Gemma
00:02:284, jadi kita mendapatkan respons, "hello, I'm Clawed Code, your assistant for all things software engineering". Jadi
00:02:34ini berarti sekarang Anda bisa terus menggunakan Clawed Code persis seperti sebelumnya, tetapi Anda telah menipunya
00:02:39dengan cara tertentu karena alih-alih menggunakan model dari Anthropic, Anda sebenarnya menggunakan model lokal dan sumber
00:02:44terbuka. Sekarang ada banyak model lain yang tersedia, Anda bisa melihat di sini di olama.com, cari
00:02:49kita punya pilihan banyak sekali model termasuk model seperti Qwen 3.6
00:02:55kita punya MiniMax, saya yakin kita punya, ya, keluarga DeepSeek juga ada di sini. Jadi pada dasarnya model populer apa pun
00:03:01yang bisa Anda pikirkan akan tersedia dan untuk menjalankannya kita cukup mengetik perintah seperti
00:03:05ollama run Qwen 3.6 dan itu akan mulai mengunduh model tersebut jika belum diunduh, jadi
00:03:11Anda harus menunggu beberapa saat untuk unduhannya, tapi begitu tersedia, Anda kemudian dapat menjalankannya di
00:03:15mesin Anda. Sekarang mari kita lihat skrip deteksi gambar itu, jadi saya bisa berkata "ollama run Gemma 4"
00:03:20dan kemudian di dalam tanda kutip kita katakan "apa isi gambar ini" dan kemudian arahkan ke gambar yang kebetulan
00:03:25berada di folder unduhan saya dan kemudian secara langsung, dengan sangat cepat sebenarnya, kita mendapatkan respons dan
00:03:29ia telah menganalisis ini dan mengatakan bahwa ada kucing di gambar tersebut, itu kucing tabby, pose dan tindakannya
00:03:35kucing itu sedang berbaring, semua ini benar dan ini adalah gambar yang digunakannya untuk deteksi. Sekarang
00:03:41memori yang tersedia dan performa sistem Anda sangat penting saat menjalankan model lokal. Jika Anda memiliki
00:03:45kurang dari 24 GB VRAM, Anda hanya akan mendapatkan 4k konteks, 28 hingga 48 GB VRAM memberi Anda 32k konteks
00:03:52dan lebih dari 48 GB VRAM memberi Anda 256k konteks. Baru-baru ini, Ollama juga membuat pembaruan besar saat
00:03:59berjalan di macOS. Kembali pada bulan Maret, Ollama melakukan porting ke MLX untuk Apple Silicon, yaitu kerangka kerja
00:04:06pembelajaran mesin milik Apple. Ini memungkinkan model untuk memanfaatkan memori terpadu Anda sepenuhnya dan memungkinkan Ollama untuk
00:04:11memanfaatkan akselerator saraf GPU untuk mempercepat waktu token pertama dan kecepatan pembuatan teks. Pada dasarnya, ini
00:04:18lebih cepat. Selain mesin lokal Anda, Ollama juga dapat berjalan di dalam Docker sehingga Anda dapat menjalankan layanan Anda sendiri
00:04:24yang mengandalkan model lokal. Dokumentasinya mencakup panduan lengkap tentang penggunaan Ollama di dalam kontainer, baik menggunakan
00:04:30hanya CPU atau dengan GPU NVIDIA dan AMD, kemudian Anda dapat meluncurkan model di dalam Docker dan bahkan melakukan permintaan curl
00:04:37langsung ke sana. Referensi API juga menyertakan beberapa endpoint lain yang bisa Anda panggil. Sekarang, membandingkan Ollama dengan
00:04:44alat lain, vLLM tampak jauh lebih cocok untuk menjalankan model sebagai layanan daripada sebagai alat CLI lokal
00:04:49dan secara signifikan lebih cepat untuk penyebaran server karena banyaknya peningkatan performa
00:04:54seperti throughput penyajian mutakhir, manajemen memori yang efisien, dan kuantisasi. Jadi, jika Anda
00:05:00menjalankan layanan yang dihosting, maka vLLM mungkin menjadi pilihan yang lebih baik. LM Studio jauh lebih mirip dengan Ollama dalam hal
00:05:06alur kerja lokal dan juga dilengkapi dengan GUI yang indah. Namun, saya ingin menyebutkan bahwa Ollama memang memiliki GUI-nya sendiri
00:05:12resmi jika itu adalah sesuatu yang Anda minati. Tentu saja ada banyak alat lain di
00:05:17ruang ini seperti Everything LLM, yang sudah kami bahas dalam satu video penuh di sini. Jika tidak, saya harap Anda merasa ini
00:05:22bermanfaat. Saya Warren dari Better Stack, terima kasih telah menonton dan sampai jumpa di video berikutnya

Key Takeaway

Ollama memungkinkan pengoperasian Claude Code menggunakan model sumber terbuka secara lokal untuk menghilangkan biaya API sekaligus memperluas akses ke ratusan model bahasa.

Highlights

  • Ollama memungkinkan penggunaan model terbuka seperti DeepSeek, Gemma, dan Qwen dalam agen AI seperti Claude Code.

  • Pengguna dapat menjalankan model lokal melalui Claude Code dengan mengubah variabel lingkungan 'base URL' dan API token.

  • Model lokal tidak memakan biaya API, sehingga pengguna dapat menjalankan Claude Code tanpa tagihan penggunaan.

  • Kapasitas konteks model bergantung pada VRAM GPU: kurang dari 24 GB untuk 4k, 28-48 GB untuk 32k, dan di atas 48 GB untuk 256k.

  • Integrasi MLX pada macOS memungkinkan Ollama memanfaatkan memori terpadu dan akselerator saraf GPU untuk mempercepat pembuatan teks.

  • Ollama dapat dijalankan di dalam Docker, baik menggunakan CPU maupun GPU NVIDIA dan AMD untuk layanan mandiri.

Timeline

Integrasi Ollama dengan Agen AI

  • Ollama berfungsi sebagai server model headless untuk menjalankan berbagai model terbuka.
  • Claude Code dapat diarahkan ke server Ollama melalui modifikasi variabel lingkungan.
  • Pengguna memperoleh akses ke ratusan model seperti DeepSeek atau Qwen melalui antarmuka Claude Code.

Ollama menyediakan infrastruktur untuk menjalankan model terbuka di berbagai agen AI. Dengan mengganti URL dasar ke server Ollama, agen seperti Claude Code akan beroperasi menggunakan model lokal alih-alih model berbayar dari penyedia pihak ketiga. Pengguna tetap mendapatkan fungsi yang sama tanpa harus membayar biaya API.

Operasi Lokal dan Deteksi Gambar

  • Claude Code dapat berjalan menggunakan model lokal seperti Gemma 4 tanpa biaya.
  • Model multimodal dalam Ollama mampu melakukan analisis gambar secara instan.
  • Model yang berjalan secara lokal tetap mempertahankan identitas sebagai asisten perangkat lunak.

Terminal Ollama memungkinkan akses langsung ke berbagai harness agen. Saat menjalankan Gemma 4 melalui Claude Code, pengguna mendapatkan respons layaknya menggunakan model asli Anthropic. Selain itu, model multimodal seperti Gemma 4 memungkinkan tugas seperti deteksi konten gambar secara lokal dengan performa yang cepat.

Optimasi Performa dan Penyebaran

  • Kapasitas konteks ditentukan oleh ketersediaan VRAM pada sistem.
  • Integrasi MLX pada Apple Silicon mengoptimalkan kecepatan token pertama.
  • Docker mendukung penggunaan Ollama dengan konfigurasi CPU atau GPU.

Performa sistem sangat bergantung pada spesifikasi perangkat keras, khususnya VRAM yang menentukan batasan konteks token. Untuk pengguna Mac, penggunaan MLX memberikan percepatan pada pembuatan teks. Ollama juga mendukung eksekusi dalam kontainer Docker untuk kebutuhan layanan yang lebih kompleks.

Community Posts

View all posts