스크립트
00:00:00Ollama adalah server model headless dengan lebih dari 176.000 bintang di GitHub yang memungkinkan Anda menjalankan model terbuka
00:00:06melalui aplikasi atau agen apa pun termasuk Clawed Code, Codex, dan bahkan Open Claw, Anda dapat mengarahkan
00:00:12alat Anda ke Ollama yang bahkan mengelola model lokal atau mengarahkan lalu lintas Anda ke model yang dihosting di Clawed
00:00:18Code, sebagai contoh, Anda cukup mengubah variabel lingkungan base URL untuk mengarah ke server Ollama Anda
00:00:23sekarang semuanya bekerja persis seperti sebelumnya tetapi Anda telah membuka akses ke ratusan
00:00:28model, bukan hanya empat, seperti GLM, DeepSeek, dan bahkan model lokal seperti Gemma dan Qwen, semuanya
00:00:34tersedia. Ini adalah terobosan besar karena Anda dapat terus menggunakan semua alat yang Anda sukai dengan cara
00:00:38yang sama tetapi sekarang Anda telah membuka akses ke setiap model yang terpikirkan oleh Anda. Hari ini kita akan mencoba Ollama
00:00:44kita akan mencoba menjalankan model terbuka melalui Clawed Code dan melihat apakah layak digunakan dibandingkan kompetitor lain
00:00:50seperti vLLM dan LM Studio. Saat kita meluncurkan CLI Ollama secara langsung, itu memberi kita opsi untuk meluncurkan alat CLI lain
00:01:01seperti Clawed Code atau Open Code, lalu kita bisa memilih model pilihan kita. Sekarang saya berada di dalam Open
00:01:07Code, tapi saya menjalankan Gemma 4 melalui Ollama dan sekarang saya bisa mengetik sesuatu seperti apakah Anda berlangganan Better
00:01:12Stack dan jika jawabannya tidak, maka mengapa tidak berlangganan di bawah video ini. Kita bahkan tidak perlu melalui
00:01:17CLI Ollama sama sekali. Dengan Clawed Code sebagai contoh, Anda cukup mengubah variabel lingkungan untuk mengarah ke
00:01:23Ollama, mengubah base URL dan API token, dan sekarang Anda bisa langsung menjalankan Clawed Code yang mengarah ke
00:01:29model mana pun yang Anda suka. Hasilnya, sekarang saya berada di dalam Clawed Code, saya bisa menggunakannya persis seperti sebelumnya tetapi
00:01:34sekarang saya menjalankannya dengan model sumber terbuka. Anda bahkan dapat menjalankan model secara langsung dengan Ollama seperti menjalankan
00:01:40Gemma 4 yang merupakan model multimodal, saya bisa menanyakan pertanyaan seperti mengidentifikasi apa isi sebuah gambar dan Anda
00:01:46bahkan bisa masuk ke harness Ollama secara langsung untuk mengobrol dengan model seperti Gemma sehingga Anda tidak butuh alat pihak
00:01:51ketiga sama sekali. Oke, jadi kita berada di terminal di sini dan saya akan mengetik "ollama" untuk masuk ke CLI
00:01:57dan Anda bisa melihat di sini kita punya banyak opsi agen atau harness berbeda yang bisa kita masuki
00:02:01kita bisa mengobrol dengannya secara langsung, tapi dalam kasus ini saya hanya akan masuk ke Clawed Code dan Anda bisa melihat
00:02:05juga bahwa model default yang sudah saya unduh adalah Gemma 4. Jadi sekarang kita berada di dalam Clawed Code dan
00:02:11Anda bisa melihat kita menggunakan Gemma 4 dengan "high effort". Tertulis "API usage billing", tetapi karena ini sebenarnya
00:02:17adalah model lokal, itu tidak akan memakan biaya apa pun sama sekali, jadi kita bisa mengetik pesan seperti "hello". Jadi setelah model
00:02:23membalas, Anda masih bisa melihat bahwa ia tetap mengira dirinya adalah Clawed Code, padahal ia masih menjalankan model Gemma
00:02:284, jadi kita mendapatkan respons, "hello, I'm Clawed Code, your assistant for all things software engineering". Jadi
00:02:34ini berarti sekarang Anda bisa terus menggunakan Clawed Code persis seperti sebelumnya, tetapi Anda telah menipunya
00:02:39dengan cara tertentu karena alih-alih menggunakan model dari Anthropic, Anda sebenarnya menggunakan model lokal dan sumber
00:02:44terbuka. Sekarang ada banyak model lain yang tersedia, Anda bisa melihat di sini di olama.com, cari
00:02:49kita punya pilihan banyak sekali model termasuk model seperti Qwen 3.6
00:02:55kita punya MiniMax, saya yakin kita punya, ya, keluarga DeepSeek juga ada di sini. Jadi pada dasarnya model populer apa pun
00:03:01yang bisa Anda pikirkan akan tersedia dan untuk menjalankannya kita cukup mengetik perintah seperti
00:03:05ollama run Qwen 3.6 dan itu akan mulai mengunduh model tersebut jika belum diunduh, jadi
00:03:11Anda harus menunggu beberapa saat untuk unduhannya, tapi begitu tersedia, Anda kemudian dapat menjalankannya di
00:03:15mesin Anda. Sekarang mari kita lihat skrip deteksi gambar itu, jadi saya bisa berkata "ollama run Gemma 4"
00:03:20dan kemudian di dalam tanda kutip kita katakan "apa isi gambar ini" dan kemudian arahkan ke gambar yang kebetulan
00:03:25berada di folder unduhan saya dan kemudian secara langsung, dengan sangat cepat sebenarnya, kita mendapatkan respons dan
00:03:29ia telah menganalisis ini dan mengatakan bahwa ada kucing di gambar tersebut, itu kucing tabby, pose dan tindakannya
00:03:35kucing itu sedang berbaring, semua ini benar dan ini adalah gambar yang digunakannya untuk deteksi. Sekarang
00:03:41memori yang tersedia dan performa sistem Anda sangat penting saat menjalankan model lokal. Jika Anda memiliki
00:03:45kurang dari 24 GB VRAM, Anda hanya akan mendapatkan 4k konteks, 28 hingga 48 GB VRAM memberi Anda 32k konteks
00:03:52dan lebih dari 48 GB VRAM memberi Anda 256k konteks. Baru-baru ini, Ollama juga membuat pembaruan besar saat
00:03:59berjalan di macOS. Kembali pada bulan Maret, Ollama melakukan porting ke MLX untuk Apple Silicon, yaitu kerangka kerja
00:04:06pembelajaran mesin milik Apple. Ini memungkinkan model untuk memanfaatkan memori terpadu Anda sepenuhnya dan memungkinkan Ollama untuk
00:04:11memanfaatkan akselerator saraf GPU untuk mempercepat waktu token pertama dan kecepatan pembuatan teks. Pada dasarnya, ini
00:04:18lebih cepat. Selain mesin lokal Anda, Ollama juga dapat berjalan di dalam Docker sehingga Anda dapat menjalankan layanan Anda sendiri
00:04:24yang mengandalkan model lokal. Dokumentasinya mencakup panduan lengkap tentang penggunaan Ollama di dalam kontainer, baik menggunakan
00:04:30hanya CPU atau dengan GPU NVIDIA dan AMD, kemudian Anda dapat meluncurkan model di dalam Docker dan bahkan melakukan permintaan curl
00:04:37langsung ke sana. Referensi API juga menyertakan beberapa endpoint lain yang bisa Anda panggil. Sekarang, membandingkan Ollama dengan
00:04:44alat lain, vLLM tampak jauh lebih cocok untuk menjalankan model sebagai layanan daripada sebagai alat CLI lokal
00:04:49dan secara signifikan lebih cepat untuk penyebaran server karena banyaknya peningkatan performa
00:04:54seperti throughput penyajian mutakhir, manajemen memori yang efisien, dan kuantisasi. Jadi, jika Anda
00:05:00menjalankan layanan yang dihosting, maka vLLM mungkin menjadi pilihan yang lebih baik. LM Studio jauh lebih mirip dengan Ollama dalam hal
00:05:06alur kerja lokal dan juga dilengkapi dengan GUI yang indah. Namun, saya ingin menyebutkan bahwa Ollama memang memiliki GUI-nya sendiri
00:05:12resmi jika itu adalah sesuatu yang Anda minati. Tentu saja ada banyak alat lain di
00:05:17ruang ini seperti Everything LLM, yang sudah kami bahas dalam satu video penuh di sini. Jika tidak, saya harap Anda merasa ini
00:05:22bermanfaat. Saya Warren dari Better Stack, terima kasih telah menonton dan sampai jumpa di video berikutnya