La nube de inferencia de IA de vanguardia para agentes: Byung-Gon (Gon) Chun, FriendliAI
AAI Engineer
컴퓨터/소프트웨어창업/스타트업AI/미래기술
스크립트
00:00:00Empecemos. Hola a todos. Gracias por venir. Es la última hora de la tarde del último día, así que de verdad se lo agradezco.
00:00:25Soy Gon, fundador y CEO de Friendly AI. Hoy quiero hablar sobre la inferencia agéntica. Primero repasaré qué ha cambiado, por qué importa y cómo hemos reconstruido la nube de inferencia para agentes.
00:00:40Antes de profundizar, permítanme presentar brevemente a Friendly AI. Friendly AI es la nube de inferencia de IA de frontera para agentes.
00:00:50A escala, más rápida, más económica y más fiable. Nacimos de un equipo de investigación de la Universidad Nacional de Seúl, y esas raíces investigadoras aún nos definen.
00:01:02Somos el equipo que inventó el “continuous batching”, la optimización de inferencia que hoy es un estándar en toda la industria, y nuestro trabajo en ORCA inspiró vLLM, un marco de código abierto muy utilizado.
00:01:15Hoy operamos a nivel global, con sede en San Francisco y un equipo en Seúl para escalar la inferencia de frontera.
00:01:24Como saben, 2026 es el año en que los agentes entran en producción masiva, impulsados por la confluencia de dos tendencias.
00:01:33En primer lugar, los agentes crecen de forma exponencial. Los agentes de IA están impulsando una adopción explosiva en software, operaciones y trabajo del conocimiento.
00:01:45En segundo lugar, los modelos de pesos abiertos han alcanzado la frontera y hacen que los agentes sean rentables. Ahora rivalizan en capacidad con los modelos cerrados de frontera, lo que significa que pueden ejecutar agentes con calidad de frontera usando modelos abiertos y a un coste por token mucho menor.
00:02:00Aclarémoslo: los modelos de pesos abiertos ya son lo bastante potentes para este tipo de flujos de trabajo de agentes reales.
00:02:13Aquí le encomendamos exactamente la misma tarea a dos modelos mediante un agente de programación: crear un juego de defensa de torres.
00:02:19A la izquierda está GLM 5.2, un modelo de pesos abiertos ejecutado en Friendly AI. A la derecha está Opus 4.8 de Anthropic.
00:02:29Lo importante no es que los resultados sean idénticos, sino que ambos completan la tarea a un nivel claramente utilizable.
00:02:38Para muchos flujos de trabajo de agentes, los modelos de pesos abiertos han superado el umbral de calidad, pero la parte económica es muy distinta.
00:02:49Para la misma tarea, Opus 4.8 cuesta unos 1,50 $. GLM 5.2 en Friendly AI cuesta 0,27 $, es decir, 5,6 veces más barato.
00:03:03Esta es la promesa que mencionaba antes: los modelos de pesos abiertos ofrecen agentes con calidad de frontera a una fracción del coste.
00:03:12Pero el coste del modelo es solo una parte de la historia. Para que los agentes sean realmente rápidos y fiables, la propia pila de inferencia tiene que cambiar.
00:03:22Veamos qué ocurre realmente dentro de una carga de trabajo agéntica.
00:03:28En primer lugar, analicemos los cambios en la carga de trabajo. En el pasado, el uso dominante era el chat.
00:03:34La unidad básica era la solicitud: una persona hace una pregunta, el modelo responde y la persona la lee.
00:03:41La latencia se medía en función de la rapidez para recibir una respuesta. Con los agentes es distinto: la unidad básica es la tarea.
00:03:49Una tarea puede requerir múltiples llamadas al modelo y a herramientas, y ejecutarse de forma autónoma durante un tiempo.
00:03:58Por lo tanto, al usuario no le importa realmente la latencia de una sola solicitud individual.
00:04:04Al usuario le importa cuándo se completa la tarea entera.
00:04:08Eso significa que debemos optimizar pensando en tareas, no solo en solicitudes individuales.
00:04:16Analicemos con más detalle las cargas agénticas. Un agente ejecuta en realidad una sesión compuesta por tareas.
00:04:23Cada tarea suele correr en un bucle. Primero planifica, lo que suele traducirse en una llamada al LLM.
00:04:29Luego actúa, quizás llamando a una herramienta. Después observa el resultado y lo añade de nuevo al contexto.
00:04:38Y repite este proceso hasta finalizar la tarea.
00:04:41Así pues, alternamos constantemente entre la inferencia del LLM y la ejecución de una o más herramientas externas.
00:04:50De este modo se genera un intervalo entre llamadas al LLM. Un agente también puede crear subagentes y ejecutarlos en paralelo.
00:05:01Las entradas de los agentes también son muy diferentes a las del chat. Este gráfico muestra la distribución de longitud de prompts y completados en las ejecuciones internas de nuestro agente de programación con GLM 5.2, el cual usamos a diario.
00:05:15Son mucho más largas. Van aumentando a medida que avanza la tarea, ya que cada observación se concatena de nuevo al contexto.
00:05:25Hay un patrón clave aquí: los pasos consecutivos de un agente suelen compartir un prefijo enorme.
00:05:32Si recalculamos ese mismo prefijo cada vez, estamos desperdiciando mucho cómputo en un trabajo que ya habíamos hecho.
00:05:40Por ello, esta es una de las mayores oportunidades en la inferencia agéntica.
00:05:46¿Hasta qué punto consumen tokens los agentes?
00:05:49Veamos un ejemplo de tarea de largo alcance como la investigación profunda (deep research).
00:05:53Le pedimos que explicara el marco de decodificación especulativa en vLLM usando Kilo Code con GLM 5.2 en Friendly AI.
00:06:02Hay múltiples etapas y cada una consta de subagentes que ejecutan diversas inferencias y llamadas a herramientas.
00:06:12Puede llegar a realizar decenas o cientos de pasos de inferencia, a veces a lo largo de minutos u horas.
00:06:19Y el contexto compartido sigue creciendo durante todo ese tiempo.
00:06:23Para el usuario, lo determinante no es la latencia de un solo token o de una llamada individual.
00:06:28Lo que importa es cuándo se completa la tarea.
00:06:35Por tanto, la inferencia agéntica no es solo un chat con más solicitudes.
00:06:39Es un problema distinto. El contexto crece con el tiempo.
00:06:43El trabajo de las herramientas se intercala entre las llamadas al modelo.
00:06:46La cantidad de llamadas al modelo depende de la entrada.
00:06:49Así que no es posible planificar en base a una tasa fija de solicitudes.
00:06:55Y la métrica real es la latencia de extremo a extremo de la tarea, no la de una solicitud concreta.
00:07:02Entonces, ¿cómo lo logramos? Permítanme mostrarles la ingeniería clave que hay detrás.
00:07:23Aquí está la hoja de ruta técnica de cómo lo enfocamos.
00:07:27Diseñamos la pila capa por capa en torno a cargas de trabajo agénticas.
00:07:33Hay cuatro grandes pilares que voy a abordar hoy.
00:07:37Caché de prefijos, gestión de caché Key-Value (o KV), enrutamiento enfocado en caché y optimización adaptada a agentes.
00:07:48Y, por supuesto, en la base necesitamos optimización a nivel de modelo, como atención dispersa para contextos largos,
00:07:56técnicas para reducir errores, kernels rápidos, un servicio resiliente y más.
00:08:02En esta presentación me centraré en los cuatro pilares.
00:08:05Empecemos con el almacenamiento en caché de prefijos.
00:08:09Dado que los pasos del agente comparten un gran prefijo, calculamos el valor clave del prefijo una vez y lo guardamos en caché.
00:08:17En los pasos posteriores, reutilizamos el valor clave en caché y solo procesamos el sufijo nuevo.
00:08:23Leer de la caché es mucho más económico que recalcular el prefill,
00:08:27por lo que esto mejora el tiempo hasta el primer token y reduce el cómputo en cada paso.
00:08:33Y cuanto más tiempo se ejecute la tarea en los agentes, más valioso se vuelve esto.
00:08:41Pero la caché solo funciona si la caché KV realmente cabe y se puede mover de forma eficiente.
00:08:48Por eso necesitamos una gestión sólida de la caché KV.
00:08:52Usamos una gestión de memoria al estilo de Google para empaquetar más contextos activos en la memoria de cada GPU.
00:08:59Usamos cuantización de KV para reducir la huella de memoria.
00:09:04Usamos almacenamiento en caché jerárquico en la memoria GPU, la memoria del host y el disco, superando así los límites de la GPU.
00:09:13Y también empleamos caché distribuida para servir un mismo prefijo entre réplicas, no solo dentro de una instancia.
00:09:26A escala de un clúster global, el enrutamiento se vuelve realmente crucial.
00:09:29Un balanceador de carga básico puede repartir las peticiones por igual entre los clústeres de GPU, pero eso arruina la localidad de la caché.
00:09:38Un enrutador consciente de la caché a escala global actúa con más inteligencia.
00:09:42Envía la solicitud a un pod que ya tiene almacenado el prefijo correcto, convirtiendo un prefill costoso en un impacto de caché instantáneo.
00:09:51Al mismo tiempo, debe mantener el equilibrio de carga para evitar que un pod se sobrecargue.
00:09:58En este ejemplo, las dos peticiones de la tarea A van al mismo pod por localidad de caché.
00:10:08El siguiente componente es la optimización adaptada a agentes.
00:10:11Y esta es la nueva frontera de la inferencia de agentes.
00:10:16Hoy en día, la mayoría de los sistemas planifican cada llamada al LLM como si fuera independiente.
00:10:21No entienden realmente que esa llamada forma parte de un programa agéntico más amplio.
00:10:27Pero si el optimizador conoce el contexto a nivel de agente, puede tomar mejores decisiones.
00:10:33Por ejemplo, desalojar el trabajo adecuado, realizar un prefill especulativo del contexto para un probable paso siguiente o tomar una mejor decisión de desahucio de caché basada en el contexto del agente.
00:10:48El objetivo es reducir la latencia de extremo a extremo de la tarea, no solo hacer que una llamada individual parezca rápida.
00:10:58Cuando juntamos todo esto, esta es la recompensa.
00:11:01Usamos el mismo modelo, GLM 5.2, junto con Kilo Code para crear un juego móvil sencillo.
00:11:07Ejecutamos la misma tarea con las API de modelo de Friendly AI y las de otro proveedor de inferencia muy conocido.
00:11:14Como pueden ver, Friendly AI completa la misma tarea de principio a fin de forma más rápida gracias a nuestro diseño de nube centrado en agentes.
00:11:24¿Qué posibilita esto en la práctica?
00:11:29Una pila de producción para agentes más sólida.
00:11:32Tomen un agente que ya utilicen.
00:11:35Y conecten modelos de frontera de pesos abiertos como GLM 5.2, MiniMax y Kimi alojados en Friendly AI.
00:11:43El modelo les aporta capacidades de nivel de frontera con un mejor rendimiento económico.
00:11:49Friendly AI les brinda la velocidad, fiabilidad y rendimiento integral necesarios en un entorno de producción.
00:11:56Esa combinación —calidad, velocidad, fiabilidad y coste— es lo que hace que los agentes sean realmente útiles y rentables en producción.
00:12:06Friendly AI está respaldando actualmente en producción a equipos que van desde startups nativas de IA hasta empresas globales.
00:12:15Me gustaría destacar un par de ellos.
00:12:20Kilo es una herramienta de programación agéntica enormemente popular que da servicio a millones de usuarios.
00:12:27LG es una corporación global con áreas de negocio que abarcan desde la electrónica hasta la salud y la energía.
00:12:35Son empresas muy distintas, pero todas necesitan lo mismo:
00:12:39inferencia agéntica rápida, fiable y rentable.
00:12:45Este testimonio de nuestro cliente Kilo lo resume perfectamente:
00:12:50“Durante el último año, Kilo Code ha probado varios proveedores de inferencia alojando tanto modelos abiertos como cerrados.
00:12:56En una prueba comparativa del uso de GLM 5 frente a otros proveedores externos y el uso directo desde el laboratorio Zhipu AI,
00:13:05Friendly AI fue de forma constante siete veces más rápido con una tasa de error significativamente menor.
00:13:12Hoy, Friendly AI es un componente fundamental de la pila de Kilo”.
00:13:17Y pueden consumir esto de la forma que mejor se adapte a su infraestructura.
00:13:23La API del modelo es la vía más rápida para empezar.
00:13:26Accedan a los principales modelos de pesos abiertos de frontera mediante nuestra API serverless.
00:13:29Los endpoints dedicados ofrecen un despliegue aislado con SLA garantizados para entornos de producción.
00:13:36Y la modalidad BYOG (“trae tu propia GPU”) permite ejecutar la inferencia de Friendly en su propia infraestructura.
00:13:44La misma tecnología, disponible en tres formas de despliegue.
00:13:49Para resumir, hay tres puntos clave a recordar.
00:13:53Primero, los modelos de pesos abiertos de frontera hacen que los agentes en producción sean escalables económicamente.
00:13:59Segundo, los agentes no son solo chat con más llamadas.
00:14:03La inferencia agéntica exige optimizar la latencia total de la tarea resolviendo los desafíos que he descrito.
00:14:10Tercero, Friendly AI está diseñada como una nube de inferencia orientada a este nuevo escenario.
00:14:16Inferencia agéntica rápida, fiable y asequible.
00:14:23Gracias por asistir a mi charla.
00:14:25Si están construyendo agentes, prueben hoy mismo los modelos de pesos abiertos de frontera en Friendly AI,
00:14:30pueden comenzar a usar Friendly AI en cuestión de minutos.
00:14:34Muchas gracias.
00:14:35Estaré por aquí al terminar la sesión.
00:14:37Gracias.
00:14:38Gracias.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기