La nube de inferencia de IA de vanguardia para agentes: Byung-Gon (Gon) Chun, FriendliAI

AAI Engineer
Computing/SoftwareSmall Business/StartupsInternet Technology

Transcript

00:00:00Empecemos. Hola a todos. Gracias por venir. Es la última hora de la tarde del último día, así que de verdad se lo agradezco.
00:00:25Soy Gon, fundador y CEO de Friendly AI. Hoy quiero hablar sobre la inferencia agéntica. Primero repasaré qué ha cambiado, por qué importa y cómo hemos reconstruido la nube de inferencia para agentes.
00:00:40Antes de profundizar, permítanme presentar brevemente a Friendly AI. Friendly AI es la nube de inferencia de IA de frontera para agentes.
00:00:50A escala, más rápida, más económica y más fiable. Nacimos de un equipo de investigación de la Universidad Nacional de Seúl, y esas raíces investigadoras aún nos definen.
00:01:02Somos el equipo que inventó el “continuous batching”, la optimización de inferencia que hoy es un estándar en toda la industria, y nuestro trabajo en ORCA inspiró vLLM, un marco de código abierto muy utilizado.
00:01:15Hoy operamos a nivel global, con sede en San Francisco y un equipo en Seúl para escalar la inferencia de frontera.
00:01:24Como saben, 2026 es el año en que los agentes entran en producción masiva, impulsados por la confluencia de dos tendencias.
00:01:33En primer lugar, los agentes crecen de forma exponencial. Los agentes de IA están impulsando una adopción explosiva en software, operaciones y trabajo del conocimiento.
00:01:45En segundo lugar, los modelos de pesos abiertos han alcanzado la frontera y hacen que los agentes sean rentables. Ahora rivalizan en capacidad con los modelos cerrados de frontera, lo que significa que pueden ejecutar agentes con calidad de frontera usando modelos abiertos y a un coste por token mucho menor.
00:02:00Aclarémoslo: los modelos de pesos abiertos ya son lo bastante potentes para este tipo de flujos de trabajo de agentes reales.
00:02:13Aquí le encomendamos exactamente la misma tarea a dos modelos mediante un agente de programación: crear un juego de defensa de torres.
00:02:19A la izquierda está GLM 5.2, un modelo de pesos abiertos ejecutado en Friendly AI. A la derecha está Opus 4.8 de Anthropic.
00:02:29Lo importante no es que los resultados sean idénticos, sino que ambos completan la tarea a un nivel claramente utilizable.
00:02:38Para muchos flujos de trabajo de agentes, los modelos de pesos abiertos han superado el umbral de calidad, pero la parte económica es muy distinta.
00:02:49Para la misma tarea, Opus 4.8 cuesta unos 1,50 $. GLM 5.2 en Friendly AI cuesta 0,27 $, es decir, 5,6 veces más barato.
00:03:03Esta es la promesa que mencionaba antes: los modelos de pesos abiertos ofrecen agentes con calidad de frontera a una fracción del coste.
00:03:12Pero el coste del modelo es solo una parte de la historia. Para que los agentes sean realmente rápidos y fiables, la propia pila de inferencia tiene que cambiar.
00:03:22Veamos qué ocurre realmente dentro de una carga de trabajo agéntica.
00:03:28En primer lugar, analicemos los cambios en la carga de trabajo. En el pasado, el uso dominante era el chat.
00:03:34La unidad básica era la solicitud: una persona hace una pregunta, el modelo responde y la persona la lee.
00:03:41La latencia se medía en función de la rapidez para recibir una respuesta. Con los agentes es distinto: la unidad básica es la tarea.
00:03:49Una tarea puede requerir múltiples llamadas al modelo y a herramientas, y ejecutarse de forma autónoma durante un tiempo.
00:03:58Por lo tanto, al usuario no le importa realmente la latencia de una sola solicitud individual.
00:04:04Al usuario le importa cuándo se completa la tarea entera.
00:04:08Eso significa que debemos optimizar pensando en tareas, no solo en solicitudes individuales.
00:04:16Analicemos con más detalle las cargas agénticas. Un agente ejecuta en realidad una sesión compuesta por tareas.
00:04:23Cada tarea suele correr en un bucle. Primero planifica, lo que suele traducirse en una llamada al LLM.
00:04:29Luego actúa, quizás llamando a una herramienta. Después observa el resultado y lo añade de nuevo al contexto.
00:04:38Y repite este proceso hasta finalizar la tarea.
00:04:41Así pues, alternamos constantemente entre la inferencia del LLM y la ejecución de una o más herramientas externas.
00:04:50De este modo se genera un intervalo entre llamadas al LLM. Un agente también puede crear subagentes y ejecutarlos en paralelo.
00:05:01Las entradas de los agentes también son muy diferentes a las del chat. Este gráfico muestra la distribución de longitud de prompts y completados en las ejecuciones internas de nuestro agente de programación con GLM 5.2, el cual usamos a diario.
00:05:15Son mucho más largas. Van aumentando a medida que avanza la tarea, ya que cada observación se concatena de nuevo al contexto.
00:05:25Hay un patrón clave aquí: los pasos consecutivos de un agente suelen compartir un prefijo enorme.
00:05:32Si recalculamos ese mismo prefijo cada vez, estamos desperdiciando mucho cómputo en un trabajo que ya habíamos hecho.
00:05:40Por ello, esta es una de las mayores oportunidades en la inferencia agéntica.
00:05:46¿Hasta qué punto consumen tokens los agentes?
00:05:49Veamos un ejemplo de tarea de largo alcance como la investigación profunda (deep research).
00:05:53Le pedimos que explicara el marco de decodificación especulativa en vLLM usando Kilo Code con GLM 5.2 en Friendly AI.
00:06:02Hay múltiples etapas y cada una consta de subagentes que ejecutan diversas inferencias y llamadas a herramientas.
00:06:12Puede llegar a realizar decenas o cientos de pasos de inferencia, a veces a lo largo de minutos u horas.
00:06:19Y el contexto compartido sigue creciendo durante todo ese tiempo.
00:06:23Para el usuario, lo determinante no es la latencia de un solo token o de una llamada individual.
00:06:28Lo que importa es cuándo se completa la tarea.
00:06:35Por tanto, la inferencia agéntica no es solo un chat con más solicitudes.
00:06:39Es un problema distinto. El contexto crece con el tiempo.
00:06:43El trabajo de las herramientas se intercala entre las llamadas al modelo.
00:06:46La cantidad de llamadas al modelo depende de la entrada.
00:06:49Así que no es posible planificar en base a una tasa fija de solicitudes.
00:06:55Y la métrica real es la latencia de extremo a extremo de la tarea, no la de una solicitud concreta.
00:07:02Entonces, ¿cómo lo logramos? Permítanme mostrarles la ingeniería clave que hay detrás.
00:07:23Aquí está la hoja de ruta técnica de cómo lo enfocamos.
00:07:27Diseñamos la pila capa por capa en torno a cargas de trabajo agénticas.
00:07:33Hay cuatro grandes pilares que voy a abordar hoy.
00:07:37Caché de prefijos, gestión de caché Key-Value (o KV), enrutamiento enfocado en caché y optimización adaptada a agentes.
00:07:48Y, por supuesto, en la base necesitamos optimización a nivel de modelo, como atención dispersa para contextos largos,
00:07:56técnicas para reducir errores, kernels rápidos, un servicio resiliente y más.
00:08:02En esta presentación me centraré en los cuatro pilares.
00:08:05Empecemos con el almacenamiento en caché de prefijos.
00:08:09Dado que los pasos del agente comparten un gran prefijo, calculamos el valor clave del prefijo una vez y lo guardamos en caché.
00:08:17En los pasos posteriores, reutilizamos el valor clave en caché y solo procesamos el sufijo nuevo.
00:08:23Leer de la caché es mucho más económico que recalcular el prefill,
00:08:27por lo que esto mejora el tiempo hasta el primer token y reduce el cómputo en cada paso.
00:08:33Y cuanto más tiempo se ejecute la tarea en los agentes, más valioso se vuelve esto.
00:08:41Pero la caché solo funciona si la caché KV realmente cabe y se puede mover de forma eficiente.
00:08:48Por eso necesitamos una gestión sólida de la caché KV.
00:08:52Usamos una gestión de memoria al estilo de Google para empaquetar más contextos activos en la memoria de cada GPU.
00:08:59Usamos cuantización de KV para reducir la huella de memoria.
00:09:04Usamos almacenamiento en caché jerárquico en la memoria GPU, la memoria del host y el disco, superando así los límites de la GPU.
00:09:13Y también empleamos caché distribuida para servir un mismo prefijo entre réplicas, no solo dentro de una instancia.
00:09:26A escala de un clúster global, el enrutamiento se vuelve realmente crucial.
00:09:29Un balanceador de carga básico puede repartir las peticiones por igual entre los clústeres de GPU, pero eso arruina la localidad de la caché.
00:09:38Un enrutador consciente de la caché a escala global actúa con más inteligencia.
00:09:42Envía la solicitud a un pod que ya tiene almacenado el prefijo correcto, convirtiendo un prefill costoso en un impacto de caché instantáneo.
00:09:51Al mismo tiempo, debe mantener el equilibrio de carga para evitar que un pod se sobrecargue.
00:09:58En este ejemplo, las dos peticiones de la tarea A van al mismo pod por localidad de caché.
00:10:08El siguiente componente es la optimización adaptada a agentes.
00:10:11Y esta es la nueva frontera de la inferencia de agentes.
00:10:16Hoy en día, la mayoría de los sistemas planifican cada llamada al LLM como si fuera independiente.
00:10:21No entienden realmente que esa llamada forma parte de un programa agéntico más amplio.
00:10:27Pero si el optimizador conoce el contexto a nivel de agente, puede tomar mejores decisiones.
00:10:33Por ejemplo, desalojar el trabajo adecuado, realizar un prefill especulativo del contexto para un probable paso siguiente o tomar una mejor decisión de desahucio de caché basada en el contexto del agente.
00:10:48El objetivo es reducir la latencia de extremo a extremo de la tarea, no solo hacer que una llamada individual parezca rápida.
00:10:58Cuando juntamos todo esto, esta es la recompensa.
00:11:01Usamos el mismo modelo, GLM 5.2, junto con Kilo Code para crear un juego móvil sencillo.
00:11:07Ejecutamos la misma tarea con las API de modelo de Friendly AI y las de otro proveedor de inferencia muy conocido.
00:11:14Como pueden ver, Friendly AI completa la misma tarea de principio a fin de forma más rápida gracias a nuestro diseño de nube centrado en agentes.
00:11:24¿Qué posibilita esto en la práctica?
00:11:29Una pila de producción para agentes más sólida.
00:11:32Tomen un agente que ya utilicen.
00:11:35Y conecten modelos de frontera de pesos abiertos como GLM 5.2, MiniMax y Kimi alojados en Friendly AI.
00:11:43El modelo les aporta capacidades de nivel de frontera con un mejor rendimiento económico.
00:11:49Friendly AI les brinda la velocidad, fiabilidad y rendimiento integral necesarios en un entorno de producción.
00:11:56Esa combinación —calidad, velocidad, fiabilidad y coste— es lo que hace que los agentes sean realmente útiles y rentables en producción.
00:12:06Friendly AI está respaldando actualmente en producción a equipos que van desde startups nativas de IA hasta empresas globales.
00:12:15Me gustaría destacar un par de ellos.
00:12:20Kilo es una herramienta de programación agéntica enormemente popular que da servicio a millones de usuarios.
00:12:27LG es una corporación global con áreas de negocio que abarcan desde la electrónica hasta la salud y la energía.
00:12:35Son empresas muy distintas, pero todas necesitan lo mismo:
00:12:39inferencia agéntica rápida, fiable y rentable.
00:12:45Este testimonio de nuestro cliente Kilo lo resume perfectamente:
00:12:50“Durante el último año, Kilo Code ha probado varios proveedores de inferencia alojando tanto modelos abiertos como cerrados.
00:12:56En una prueba comparativa del uso de GLM 5 frente a otros proveedores externos y el uso directo desde el laboratorio Zhipu AI,
00:13:05Friendly AI fue de forma constante siete veces más rápido con una tasa de error significativamente menor.
00:13:12Hoy, Friendly AI es un componente fundamental de la pila de Kilo”.
00:13:17Y pueden consumir esto de la forma que mejor se adapte a su infraestructura.
00:13:23La API del modelo es la vía más rápida para empezar.
00:13:26Accedan a los principales modelos de pesos abiertos de frontera mediante nuestra API serverless.
00:13:29Los endpoints dedicados ofrecen un despliegue aislado con SLA garantizados para entornos de producción.
00:13:36Y la modalidad BYOG (“trae tu propia GPU”) permite ejecutar la inferencia de Friendly en su propia infraestructura.
00:13:44La misma tecnología, disponible en tres formas de despliegue.
00:13:49Para resumir, hay tres puntos clave a recordar.
00:13:53Primero, los modelos de pesos abiertos de frontera hacen que los agentes en producción sean escalables económicamente.
00:13:59Segundo, los agentes no son solo chat con más llamadas.
00:14:03La inferencia agéntica exige optimizar la latencia total de la tarea resolviendo los desafíos que he descrito.
00:14:10Tercero, Friendly AI está diseñada como una nube de inferencia orientada a este nuevo escenario.
00:14:16Inferencia agéntica rápida, fiable y asequible.
00:14:23Gracias por asistir a mi charla.
00:14:25Si están construyendo agentes, prueben hoy mismo los modelos de pesos abiertos de frontera en Friendly AI,
00:14:30pueden comenzar a usar Friendly AI en cuestión de minutos.
00:14:34Muchas gracias.
00:14:35Estaré por aquí al terminar la sesión.
00:14:37Gracias.
00:14:38Gracias.

Key Takeaway

La inferencia para agentes requiere rediseñar la pila de la nube mediante caché de prefijos y gestión jerárquica de memoria KV para optimizar el tiempo total de finalización de las tareas y reducir hasta 5,6 veces el coste operativo frente a modelos cerrados.

Highlights

  • Los modelos de pesos abiertos de frontera permiten ejecutar flujos de trabajo de agentes reales como la creación de un juego por 0,27 $, frente a los 1,50 $ que cuesta con modelos cerrados como Opus 4.8.

  • ORCA, el trabajo de investigación desarrollado por el equipo de FriendliAI, definió la técnica de “continuous batching” e inspiró el marco de código abierto vLLM.

  • La métrica fundamental en la inferencia agéntica no es la latencia de una solicitud individual, sino el tiempo total de finalización de extremo a extremo de la tarea.

  • El uso de caché de prefijos evita recalcular la fase de prefill en pasos de inferencia consecutivos que comparten grandes volúmenes de contexto en tareas agénticas.

  • Kilo Code registró una velocidad siete veces mayor y una tasa de error significativamente inferior al utilizar la infraestructura de FriendliAI en comparación con otros proveedores de inferencia.

Timeline

Evolución de los modelos abiertos y costes en producción

  • El año 2026 marca el inicio de la producción masiva de agentes de inteligencia artificial.
  • Los modelos de pesos abiertos alcanzan capacidades equivalentes a los modelos cerrados de frontera con costes significativamente menores.

FriendliAI surge de un equipo de investigación de la Universidad Nacional de Seúl, creador del continuous batching y del trabajo en ORCA que inspiró vLLM. En pruebas prácticas de generación de código como la creación de un juego de defensa de torres, el modelo de pesos abiertos GLM 5.2 completa la tarea con un rendimiento funcional idéntico a Opus 4.8 de Anthropic. El gasto asociado se reduce de 1,50 $en el modelo cerrado a 0,27$ en la infraestructura de FriendliAI.

Diferencias estructurales entre cargas de chat e inferencia agéntica

  • Las cargas agénticas sustituyen la solicitud puntual por la ejecución de tareas autónomas de larga duración.
  • Las llamadas a modelos e instrumentos externos generan intervalos vacíos e incrementan progresivamente la longitud del contexto.

A diferencia del chat tradicional centrado en la latencia de respuesta a una sola pregunta, los agentes funcionan en bucles continuos de planificación, acción y observación. Cada herramienta ejecutada concatena nueva información a la entrada, provocando que los pasos consecutivos compartan un prefijo idéntico de gran tamaño. En tareas de investigación profunda, el proceso abarca decenas o cientos de llamadas durante minutos u horas, priorizando la velocidad global de la tarea sobre el tiempo hasta el primer token individual.

Arquitectura técnica y pilares de la nube de inferencia agéntica

  • El almacenamiento en caché de prefijos reutiliza los valores Key-Value para procesar únicamente los nuevos sufijos.
  • La gestión de memoria KV emplea esquemas jerárquicos y cuantización para superar los límites físicos de la GPU.
  • El enrutamiento inteligente redirige las peticiones hacia los pods que alojan el prefijo requerido sin romper el equilibrio del clúster.

La optimización para agentes requiere intervenir en cuatro niveles fundamentales: caché de prefijos, gestión de memoria KV, enrutamiento consciente de la caché y optimizaciones específicas del programa agéntico. Mediante técnicas de memoria inspiradas en Google, cuantización y almacenamiento distribuido entre memoria GPU, memoria del host y disco, el sistema maximiza el impacto de la caché. Un enrutador global envía la tarea A al mismo pod para evitar prefills costosos, mientras el planificador anticipa los pasos probables del subagente.

Despliegue e impacto en entornos de producción reales

  • Modelos de pesos abiertos como GLM 5.2, MiniMax y Kimi se integran mediante plataformas optimizadas para entornos corporativos.
  • Las modalidades de integración abarcan API serverless, endpoints dedicados y la opción de despliegue en infraestructura propia (BYOG).

Empresas como Kilo Code y LG utilizan la nube de FriendliAI para ejecutar sus agentes de desarrollo y operaciones. Kilo Code validó un rendimiento siete veces superior en velocidad en comparación con las API directas del laboratorio Zhipu AI y otros proveedores externos. Las opciones de despliegue permiten elegir entre conectores serverless, nodos aislados con garantías de nivel de servicio (SLA) o la integración de la tecnología sobre clústeres propios de GPU.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video