스크립트
00:00:00Ollama es un servidor headless con más de 176 000 estrellas en GitHub que permite ejecutar modelos abiertos
00:00:06a través de cualquier aplicación o agente, incluyendo Claude Code, Codex e incluso Open Claude. Puedes apuntar tus
00:00:12herramientas a Ollama, que incluso gestiona modelos locales o redirige tu tráfico a modelos alojados en Claude
00:00:18Code. Por ejemplo, puedes cambiar la variable de entorno de la URL base para apuntar a tu servidor
00:00:23Ollama. Ahora todo funciona exactamente igual que antes, pero has desbloqueado el acceso a cientos de
00:00:28modelos en lugar de cuatro. Modelos como GLM, DeepSeek e incluso locales como Gemma y Qwen están todos
00:00:34disponibles. Este es un gran avance porque puedes seguir usando todas las herramientas que te gustan de la misma
00:00:38manera, pero ahora tienes acceso a todos los modelos que puedas imaginar. Hoy probaremos Ollama,
00:00:44intentaremos ejecutar modelos abiertos a través de Claude Code y veremos si vale la pena frente a otros competidores
00:00:50como vLLM y LM Studio. Cuando iniciamos la CLI de Ollama directamente, nos da opciones para lanzar otras herramientas de CLI
00:01:01como Claude Code u Open Code, permitiéndonos seleccionar nuestro modelo preferido. Ahora estoy dentro de Open
00:01:07Code, ejecutando Gemma 4 a través de Ollama, y ahora puedo escribir algo como: ¿estás suscrito a Better
00:01:12Stack? Y si la respuesta es no, ¿por qué no te suscribes debajo de este video? Ni siquiera tenemos que pasar por la
00:01:17CLI de Ollama en absoluto. Con Claude Code, por ejemplo, puedes simplemente cambiar las variables de entorno para apuntar a
00:01:23Ollama cambiando la URL base y los tokens, y ahora puedes ejecutar Claude Code directamente apuntando al
00:01:29modelo que quieras. El resultado es que ahora estoy dentro de Claude Code; puedo usarlo exactamente como antes, pero
00:01:34ahora lo ejecuto con un modelo de código abierto. Incluso puedes ejecutar modelos directamente con Ollama, como ejecutar
00:01:40Gemma 4, que es un modelo multimodal. Puedo hacerle preguntas como identificar qué hay dentro de una imagen y
00:01:46incluso puedes entrar directamente en el entorno de Ollama para chatear con modelos como Gemma, así que no necesitas ninguna
00:01:51herramienta de terceros. Bien, estamos en la terminal y simplemente escribiré “ollama” para entrar en la CLI
00:01:57y puedes ver aquí que tenemos un montón de opciones de diferentes agentes o entornos en los que podríamos entrar.
00:02:01Podríamos chatear directamente, pero en este caso simplemente entraré en Claude Code y puedes ver
00:02:05también que el modelo predeterminado, que ya descargué, es Gemma 4. Así que ahora estamos dentro de Claude Code y
00:02:11puedes ver que estamos en Gemma 4. Menciona facturación de uso de API, pero como este es en realidad
00:02:17un modelo local, no nos costará absolutamente nada, así que podemos escribir un mensaje como “hola”. Una vez que el modelo
00:02:23responde, todavía puedes ver que piensa que sigue siendo Claude Code, aunque está ejecutando el modelo
00:02:28Gemma 4, por lo que recibimos la respuesta: “Hola, soy Claude Code, tu asistente para todo lo relacionado con la ingeniería de software”. Así que
00:02:34esto significa que ahora puedes seguir usando Claude Code exactamente como antes, pero lo has engañado
00:02:39en cierto modo, porque en lugar de usar los modelos de Anthropic, en realidad estás usando un modelo
00:02:44local y de código abierto. Ahora, hay muchísimos otros modelos disponibles; puedes verlos aquí, en ollama.com. Busca,
00:02:49tenemos opciones de muchos, muchos modelos, incluyendo cosas como Qwen 3.6.
00:02:55Tenemos Minimax, estoy seguro de que tenemos... sí, la familia DeepSeek también está aquí. Así que básicamente, cualquier modelo
00:03:01popular que se te ocurra estará disponible, y para ejecutar esto, podemos simplemente escribir un comando como
00:03:05“ollama run qwen 3.6” y eso, si el modelo no está descargado, comenzará a descargarlo, así que
00:03:11tendrás que esperar un tiempo a que se descargue, pero una vez que esté disponible, podrás ejecutarlo en tu
00:03:15máquina. Ahora, revisemos ese script de detección de imágenes. Puedo decir “ollama run gemma 4”
00:03:20y luego, entre comillas, decir “¿qué hay dentro de esta imagen?” y apuntar a una imagen que simplemente
00:03:25se encuentra en mi carpeta de descargas, y de inmediato, muy rápidamente, obtenemos una respuesta y
00:03:29la ha analizado diciendo que hay un gato en la imagen, es un gato atigrado, la pose y la acción
00:03:35es que el gato está tumbado; todo esto es cierto y esta es la imagen contra la que realizó la detección. Ahora,
00:03:41la memoria disponible y el rendimiento del sistema realmente importan al ejecutar modelos locales. Si tienes
00:03:45menos de 24 gigabytes de VRAM, solo obtendrás 4k de contexto; de 28 a 48 gigas de VRAM te dan 32k de contexto
00:03:52y más de 48 gigas de VRAM te dan 256k de contexto. Recientemente, Ollama también hizo grandes actualizaciones al
00:03:59ejecutarse en macOS. En marzo, Ollama se adaptó a MLX para Apple Silicon, que es el marco de aprendizaje
00:04:06automático de Apple. Esto permite que los modelos aprovechen al máximo tu memoria unificada y permite que Ollama
00:04:11aproveche los aceleradores neuronales de la GPU para acelerar tanto el tiempo del primer token como la velocidad de generación; básicamente, es
00:04:18más rápido. Además de en tu máquina local, Ollama también puede ejecutarse dentro de Docker, por lo que puedes ejecutar tus propios servicios
00:04:24que dependen de modelos locales. La documentación incluye una guía completa sobre el uso de Ollama dentro de un contenedor, ya sea usando
00:04:30solo CPU o con GPUs NVIDIA y AMD. Luego puedes lanzar el modelo dentro de Docker e incluso hacer solicitudes curl
00:04:37directamente a él. La referencia de la API también incluye varios otros endpoints que puedes llamar. Ahora, comparando Ollama con
00:04:44otras herramientas, vLLM parece mucho más adecuado para ejecutar modelos como servicios que como una herramienta de CLI local,
00:04:49y es significativamente más rápido para implementaciones en servidor debido a toda una serie de mejoras de rendimiento
00:04:54como un rendimiento de servicio de última generación, gestión eficiente de memoria y cuantización. Así que, si estás
00:05:00ejecutando un servicio alojado, entonces vLLM puede ser la mejor opción. LM Studio es mucho más parecido a Ollama en cuanto
00:05:06a flujos de trabajo locales y también viene con una interfaz gráfica hermosa. Sin embargo, mencionaría que Ollama tiene su propia
00:05:12interfaz gráfica oficial si eso es algo que te interesa. Hay, por supuesto, un montón de otras herramientas en este
00:05:17espacio, como AnythingLLM, sobre el que hemos hecho un video completo aquí. Por lo demás, espero que hayas encontrado esto
00:05:22útil. Soy Warren, de Better Stack, gracias por vernos y nos vemos la próxima vez.