스크립트
00:00:00Ollama é um servidor headless com mais de 176 mil estrelas no GitHub que permite rodar modelos abertos
00:00:06através de qualquer aplicativo ou agente, incluindo Claude Code, Codex e até mesmo Open Claude. Você pode apontar suas
00:00:12ferramentas para o Ollama, que gerencia modelos locais ou roteia seu tráfego para modelos hospedados no Claude
00:00:18Code. Por exemplo, você pode apenas alterar a variável de ambiente base URL para apontar para seu servidor
00:00:23Ollama. Agora tudo funciona exatamente como antes, mas você desbloqueou o acesso a centenas de
00:00:28modelos em vez de apenas quatro. Modelos como GLM, DeepSeek e até modelos locais como Gemma e Qwen estão todos
00:00:34disponíveis. Isso é uma grande vantagem, porque você pode continuar usando todas as ferramentas que gosta exatamente
00:00:38da mesma maneira, mas agora com acesso a qualquer modelo que imaginar. Hoje, vamos testar o Ollama,
00:00:44tentar rodar modelos abertos através do Claude Code e ver se vale a pena usá-lo em vez de outros concorrentes
00:00:50como vLLM e LM Studio. Quando lançamos o CLI do Ollama diretamente, ele nos dá opções para iniciar outras ferramentas CLI,
00:01:01como Claude Code ou Open Code, e selecionar nosso modelo preferido. Agora estou dentro do Open
00:01:07Code, mas estou rodando o Gemma 4 via Ollama. Agora posso digitar algo como: “você é inscrito no Better
00:01:12Stack?”. E se a resposta for não, por que não se inscrever abaixo deste vídeo? Nem precisamos passar pelo
00:01:17CLI do Ollama com o Claude Code, por exemplo. Você pode apenas alterar as variáveis de ambiente para apontar para
00:01:23o Ollama, alterando a base URL e os tokens, e agora você pode rodar o Claude Code diretamente, apontando para
00:01:29qualquer modelo que desejar. O resultado é que estou dentro do Claude Code, posso usá-lo exatamente como antes, mas
00:01:34agora estou rodando com um modelo open source. Você pode até rodar modelos diretamente com o Ollama, como rodar
00:01:40o Gemma 4, que é um modelo multimodal. Posso fazer perguntas a ele, como identificar o que há dentro de uma imagem, e você
00:01:46pode até entrar no ambiente do Ollama diretamente para conversar com modelos como o Gemma, sem precisar de nenhuma
00:01:51ferramenta de terceiros. Ok, então estamos no terminal aqui e vou digitar “ollama” para entrar no CLI
00:01:57e você pode ver que temos várias opções de diferentes agentes ou ambientes que podemos acessar.
00:02:01Poderíamos conversar diretamente com ele, mas, neste caso, vou entrar no Claude Code e você verá
00:02:05que o modelo padrão, que já baixei, é o Gemma 4. Agora estamos dentro do Claude Code e
00:02:11você pode ver que estamos no Gemma 4 com alto esforço. Ele menciona faturamento de uso de API, mas como este é
00:02:17um modelo local, não nos custará nada. Então podemos digitar uma mensagem como “olá”. Assim que o modelo
00:02:23responde, você ainda pode ver que ele acha que é o Claude Code, exceto que ele está rodando o modelo
00:02:28Gemma 4. Então recebemos a resposta: “Olá, sou o Claude Code, seu assistente para tudo relacionado à engenharia de software”. Então
00:02:34isso significa que você pode continuar usando o Claude Code exatamente como antes, mas o enganou
00:02:39de certa forma, porque em vez de usar os modelos da Anthropic, você está usando um modelo local e de
00:02:44código aberto. Agora, há muitos outros modelos disponíveis; você pode ver aqui em ollama.com. Pesquisando,
00:02:49temos opções de muitos, muitos modelos, incluindo coisas como Qwen 3.6
00:02:55Temos o Minimax, e claro, a família DeepSeek também está aqui. Então, basicamente, qualquer modelo popular
00:03:01que você imaginar estará disponível. E para rodar isso, basta digitar um comando como
00:03:05ollama run qwen 3.6, e isso, se o modelo não estiver baixado, começará a baixá-lo. Então
00:03:11você teria que esperar um pouco pelo download, mas uma vez disponível, você pode rodá-lo na sua
00:03:15máquina. Agora, vamos verificar aquele script de detecção de imagem, então posso dizer: ollama run gemma 4
00:03:20e então, entre aspas, dizemos “o que há dentro desta imagem?” e apontamos para uma imagem que está
00:03:25na minha pasta de downloads. E instantaneamente, muito rapidamente, recebemos uma resposta e
00:03:29ele analisou isso e diz que há um gato na imagem, é um gato malhado, a pose e a ação:
00:03:35o gato está deitado. Tudo isso é verdade, e esta é a imagem contra a qual ele fez a detecção. Agora,
00:03:41sua memória disponível e o desempenho do sistema realmente importam ao rodar modelos locais. Se você tiver
00:03:45menos de 24 GB de VRAM, terá apenas 4K de contexto; 28 a 48 GB de VRAM garantem 32K de contexto,
00:03:52e mais de 48 GB de VRAM garantem 256K de contexto. Recentemente, o Ollama também fez grandes atualizações ao
00:03:59rodar no macOS. Em março, o Ollama foi portado para MLX para Apple Silicon, que é a estrutura de aprendizado
00:04:06de máquina da Apple. Isso permite que os modelos aproveitem ao máximo sua memória unificada e permite que o Ollama
00:04:11use aceleradores neurais de GPU para acelerar tanto o tempo para o primeiro token quanto a velocidade de geração. Basicamente, é
00:04:18mais rápido. Além da sua máquina local, o Ollama também pode rodar dentro do Docker, para que você possa rodar seus próprios serviços
00:04:24que dependem de modelos locais. A documentação inclui um guia completo sobre como usar o Ollama dentro de um container, seja usando
00:04:30apenas CPU ou com GPUs NVIDIA e AMD. Então, você pode iniciar o modelo dentro do Docker e até mesmo fazer requisições curl
00:04:37diretamente para ele. A referência da API também inclui vários outros endpoints que você pode chamar. Agora, comparando o Ollama a
00:04:44outras ferramentas, o vLLM parece muito mais adequado para rodar modelos como serviços, em vez de uma ferramenta CLI local,
00:04:49e é significativamente mais rápido para implantações em servidor devido a uma série de melhorias de desempenho
00:04:54como throughput de servidor de ponta, gerenciamento eficiente de memória e quantização. Então, se você está
00:05:00rodando um serviço hospedado, o vLLM pode ser a melhor escolha. O LM Studio é muito mais próximo do Ollama em termos
00:05:06de fluxos de trabalho locais e também vem com uma bela interface gráfica. No entanto, eu mencionaria que o Ollama tem sua própria
00:05:12interface gráfica oficial, se isso for algo do seu interesse. Existem, é claro, muitas outras ferramentas nesse
00:05:17espaço, como o AnythingLLM, sobre o qual fizemos um vídeo inteiro. De qualquer forma, espero que você tenha achado isso
00:05:22útil. Eu sou Warren, do Better Stack, obrigado por assistir e até a próxima.