Ejecuta Claude Code con Ollama y ahorra un 99% en IA

BBetter Stack
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Ollama es un servidor headless con más de 176 000 estrellas en GitHub que permite ejecutar modelos abiertos
00:00:06a través de cualquier aplicación o agente, incluyendo Claude Code, Codex e incluso Open Claude. Puedes apuntar tus
00:00:12herramientas a Ollama, que incluso gestiona modelos locales o redirige tu tráfico a modelos alojados en Claude
00:00:18Code. Por ejemplo, puedes cambiar la variable de entorno de la URL base para apuntar a tu servidor
00:00:23Ollama. Ahora todo funciona exactamente igual que antes, pero has desbloqueado el acceso a cientos de
00:00:28modelos en lugar de cuatro. Modelos como GLM, DeepSeek e incluso locales como Gemma y Qwen están todos
00:00:34disponibles. Este es un gran avance porque puedes seguir usando todas las herramientas que te gustan de la misma
00:00:38manera, pero ahora tienes acceso a todos los modelos que puedas imaginar. Hoy probaremos Ollama,
00:00:44intentaremos ejecutar modelos abiertos a través de Claude Code y veremos si vale la pena frente a otros competidores
00:00:50como vLLM y LM Studio. Cuando iniciamos la CLI de Ollama directamente, nos da opciones para lanzar otras herramientas de CLI
00:01:01como Claude Code u Open Code, permitiéndonos seleccionar nuestro modelo preferido. Ahora estoy dentro de Open
00:01:07Code, ejecutando Gemma 4 a través de Ollama, y ahora puedo escribir algo como: ¿estás suscrito a Better
00:01:12Stack? Y si la respuesta es no, ¿por qué no te suscribes debajo de este video? Ni siquiera tenemos que pasar por la
00:01:17CLI de Ollama en absoluto. Con Claude Code, por ejemplo, puedes simplemente cambiar las variables de entorno para apuntar a
00:01:23Ollama cambiando la URL base y los tokens, y ahora puedes ejecutar Claude Code directamente apuntando al
00:01:29modelo que quieras. El resultado es que ahora estoy dentro de Claude Code; puedo usarlo exactamente como antes, pero
00:01:34ahora lo ejecuto con un modelo de código abierto. Incluso puedes ejecutar modelos directamente con Ollama, como ejecutar
00:01:40Gemma 4, que es un modelo multimodal. Puedo hacerle preguntas como identificar qué hay dentro de una imagen y
00:01:46incluso puedes entrar directamente en el entorno de Ollama para chatear con modelos como Gemma, así que no necesitas ninguna
00:01:51herramienta de terceros. Bien, estamos en la terminal y simplemente escribiré “ollama” para entrar en la CLI
00:01:57y puedes ver aquí que tenemos un montón de opciones de diferentes agentes o entornos en los que podríamos entrar.
00:02:01Podríamos chatear directamente, pero en este caso simplemente entraré en Claude Code y puedes ver
00:02:05también que el modelo predeterminado, que ya descargué, es Gemma 4. Así que ahora estamos dentro de Claude Code y
00:02:11puedes ver que estamos en Gemma 4. Menciona facturación de uso de API, pero como este es en realidad
00:02:17un modelo local, no nos costará absolutamente nada, así que podemos escribir un mensaje como “hola”. Una vez que el modelo
00:02:23responde, todavía puedes ver que piensa que sigue siendo Claude Code, aunque está ejecutando el modelo
00:02:28Gemma 4, por lo que recibimos la respuesta: “Hola, soy Claude Code, tu asistente para todo lo relacionado con la ingeniería de software”. Así que
00:02:34esto significa que ahora puedes seguir usando Claude Code exactamente como antes, pero lo has engañado
00:02:39en cierto modo, porque en lugar de usar los modelos de Anthropic, en realidad estás usando un modelo
00:02:44local y de código abierto. Ahora, hay muchísimos otros modelos disponibles; puedes verlos aquí, en ollama.com. Busca,
00:02:49tenemos opciones de muchos, muchos modelos, incluyendo cosas como Qwen 3.6.
00:02:55Tenemos Minimax, estoy seguro de que tenemos... sí, la familia DeepSeek también está aquí. Así que básicamente, cualquier modelo
00:03:01popular que se te ocurra estará disponible, y para ejecutar esto, podemos simplemente escribir un comando como
00:03:05“ollama run qwen 3.6” y eso, si el modelo no está descargado, comenzará a descargarlo, así que
00:03:11tendrás que esperar un tiempo a que se descargue, pero una vez que esté disponible, podrás ejecutarlo en tu
00:03:15máquina. Ahora, revisemos ese script de detección de imágenes. Puedo decir “ollama run gemma 4”
00:03:20y luego, entre comillas, decir “¿qué hay dentro de esta imagen?” y apuntar a una imagen que simplemente
00:03:25se encuentra en mi carpeta de descargas, y de inmediato, muy rápidamente, obtenemos una respuesta y
00:03:29la ha analizado diciendo que hay un gato en la imagen, es un gato atigrado, la pose y la acción
00:03:35es que el gato está tumbado; todo esto es cierto y esta es la imagen contra la que realizó la detección. Ahora,
00:03:41la memoria disponible y el rendimiento del sistema realmente importan al ejecutar modelos locales. Si tienes
00:03:45menos de 24 gigabytes de VRAM, solo obtendrás 4k de contexto; de 28 a 48 gigas de VRAM te dan 32k de contexto
00:03:52y más de 48 gigas de VRAM te dan 256k de contexto. Recientemente, Ollama también hizo grandes actualizaciones al
00:03:59ejecutarse en macOS. En marzo, Ollama se adaptó a MLX para Apple Silicon, que es el marco de aprendizaje
00:04:06automático de Apple. Esto permite que los modelos aprovechen al máximo tu memoria unificada y permite que Ollama
00:04:11aproveche los aceleradores neuronales de la GPU para acelerar tanto el tiempo del primer token como la velocidad de generación; básicamente, es
00:04:18más rápido. Además de en tu máquina local, Ollama también puede ejecutarse dentro de Docker, por lo que puedes ejecutar tus propios servicios
00:04:24que dependen de modelos locales. La documentación incluye una guía completa sobre el uso de Ollama dentro de un contenedor, ya sea usando
00:04:30solo CPU o con GPUs NVIDIA y AMD. Luego puedes lanzar el modelo dentro de Docker e incluso hacer solicitudes curl
00:04:37directamente a él. La referencia de la API también incluye varios otros endpoints que puedes llamar. Ahora, comparando Ollama con
00:04:44otras herramientas, vLLM parece mucho más adecuado para ejecutar modelos como servicios que como una herramienta de CLI local,
00:04:49y es significativamente más rápido para implementaciones en servidor debido a toda una serie de mejoras de rendimiento
00:04:54como un rendimiento de servicio de última generación, gestión eficiente de memoria y cuantización. Así que, si estás
00:05:00ejecutando un servicio alojado, entonces vLLM puede ser la mejor opción. LM Studio es mucho más parecido a Ollama en cuanto
00:05:06a flujos de trabajo locales y también viene con una interfaz gráfica hermosa. Sin embargo, mencionaría que Ollama tiene su propia
00:05:12interfaz gráfica oficial si eso es algo que te interesa. Hay, por supuesto, un montón de otras herramientas en este
00:05:17espacio, como AnythingLLM, sobre el que hemos hecho un video completo aquí. Por lo demás, espero que hayas encontrado esto
00:05:22útil. Soy Warren, de Better Stack, gracias por vernos y nos vemos la próxima vez.

핵심 요약

La redirección de la URL base en herramientas como Claude Code hacia un servidor Ollama local permite ejecutar modelos de código abierto sin costo alguno, manteniendo la funcionalidad original de la herramienta.

하이라이트

  • Ollama permite ejecutar modelos locales como Gemma, Qwen y DeepSeek a través de herramientas como Claude Code, eliminando costos de API.

  • La configuración requiere modificar la variable de entorno de la URL base para redirigir el tráfico de Claude Code al servidor local de Ollama.

  • El contexto disponible depende directamente de la VRAM: 4k para menos de 24GB, 32k para 28-48GB y 256k para más de 48GB.

  • La integración con MLX para Apple Silicon permite aprovechar la memoria unificada y los aceleradores neuronales para acelerar la generación de tokens.

  • Ollama admite el uso dentro de contenedores Docker mediante configuraciones específicas para CPU o GPUs NVIDIA y AMD.

  • vLLM ofrece un rendimiento superior para despliegues de servicios en servidor, mientras que Ollama se especializa en flujos de trabajo de línea de comandos locales.

타임라인

Integración de Ollama con Claude Code

  • Ollama actúa como un servidor headless que redirige el tráfico de aplicaciones a modelos locales.
  • Cambiar las variables de entorno de la URL base permite sustituir los modelos de Anthropic por modelos locales.
  • El uso de modelos locales elimina los costos asociados a la facturación de la API.

El servidor Ollama funciona como un puente que permite conectar herramientas de ingeniería de software con una amplia variedad de modelos. Al apuntar la configuración de Claude Code al servidor local, la herramienta continúa operando con su interfaz y flujo de trabajo habituales, pero procesando las peticiones a través de modelos ejecutados en la propia máquina.

Rendimiento, hardware y optimizaciones

  • El límite de contexto del modelo escala según la VRAM disponible, alcanzando hasta 256k con más de 48GB.
  • La adaptación de Ollama a MLX en marzo de 2026 mejora significativamente la velocidad en chips Apple Silicon.
  • Los modelos multimodales como Gemma 4 pueden realizar tareas de visión e identificación de contenido directamente desde la terminal.

La capacidad del sistema está determinada por el hardware, donde la memoria unificada de Apple juega un papel central tras la integración con el marco MLX. Esto optimiza el uso de la GPU y los aceleradores neuronales, reduciendo el tiempo de respuesta en la generación de tokens y aumentando la eficiencia general en dispositivos macOS.

Despliegue y comparativa de herramientas

  • El despliegue en contenedores Docker es compatible con configuraciones de solo CPU o con aceleración por GPUs NVIDIA y AMD.
  • vLLM es más eficiente para servicios alojados debido a mejoras en gestión de memoria y cuantización.
  • LM Studio ofrece una alternativa con interfaz gráfica similar a las capacidades de Ollama.

Aunque Ollama destaca en el uso local a través de la línea de comandos, existen alternativas según el caso de uso. vLLM es preferible para entornos de servidor donde el rendimiento de servicio es la prioridad, mientras que herramientas como Docker permiten integrar Ollama en arquitecturas más complejas de forma consistente.

커뮤니티 글

모든 글 보기