A Nuvem deInferência de IA de Fronteira para Agentes — Byung-Gon (Gon) Chun, FriendliAI

AAI Engineer
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00Vamos começar. Olá a todos. Obrigado por virem. É o final da tarde do último dia, então eu realmente agradeço.
00:00:25Eu sou o Gon, fundador e CEO da Friendly AI. Hoje quero falar sobre inferência agêntica. Primeiro, vou passar pelo que mudou, por que isso importa e como reconstruímos a nuvem de inferência para agentes.
00:00:40Antes de nos aprofundarmos, permitam-me apresentar brevemente a Friendly AI. A Friendly AI é a nuvem de inferência de IA de ponta para agentes.
00:00:50Em escala, mais rápida, mais barata e mais confiável. Surgimos de uma equipe de pesquisa na Universidade Nacional de Seul, e essas raízes de pesquisa ainda nos definem.
00:01:02Somos a equipe que inventou o batching contínuo, a otimização de inferência que agora é padrão em toda a indústria, e nosso trabalho com o ORCA inspirou o vLLM, um framework de código aberto amplamente utilizado.
00:01:15Hoje operamos globalmente, com sede em São Francisco e uma equipe em Seul para escalar a inferência de ponta.
00:01:24Como sabem, 2026 é o ano em que os agentes entram em produção massiva, e isso é impulsionado por duas tendências que se unem.
00:01:33Primeiro, os agentes estão crescendo exponencialmente. Agentes de IA estão impulsionando uma adoção explosiva em softwares, operações e trabalho de conhecimento.
00:01:45Segundo, os modelos open-weight atingiram o nível de ponta e tornam os agentes econômicos. Eles agora rivalizam com os modelos proprietários em capacidade, o que significa que você pode executar agentes com qualidade de ponta em modelos abertos com custos de token muito menores.
00:02:00Deixem-me mostrar que os modelos open-weight agora são fortes o suficiente para esses tipos de fluxos de trabalho agênticos reais.
00:02:13Aqui demos exatamente a mesma tarefa, criar um jogo de tower defense com um agente de programação, para dois modelos.
00:02:19À esquerda está o GLM 5.2, um modelo open-weight rodando na Friendly AI. À direita está o Opus 4.8 da Anthropic.
00:02:29O ponto importante não é que os resultados sejam idênticos. O ponto é que ambos concluem a tarefa em um nível claramente utilizável.
00:02:38Para muitos fluxos de trabalho agênticos, os modelos open-weight ultrapassaram o limite de qualidade, mas a economia é muito diferente.
00:02:49Para a mesma tarefa, o Opus 4.8 custa cerca de $1,50. O GLM 5.2 na Friendly AI custa $0,27, ou seja, 5,6 vezes mais barato.
00:03:03Esta é a promessa que mencionei antes: modelos open-weight oferecem agentes com qualidade de ponta por uma fração do custo.
00:03:12Mas o custo do modelo é apenas uma parte da história. Para tornar os agentes realmente rápidos e confiáveis, a própria pilha de inferência precisa mudar.
00:03:22Então, vamos ver o que realmente acontece dentro de uma carga de trabalho agêntica.
00:03:28Primeiro, vamos olhar para as mudanças na carga de trabalho. No passado, o uso dominante era o chat.
00:03:34A unidade básica era uma requisição. Uma pessoa faz uma pergunta, o modelo responde e a pessoa lê.
00:03:41Latência significava o quão rápido eu recebia uma resposta. Os agentes são diferentes. A unidade básica é uma tarefa.
00:03:49Uma tarefa pode envolver muitas chamadas ao modelo, muitas chamadas a ferramentas e pode rodar de forma autônoma por um tempo.
00:03:58Portanto, o usuário não se importa realmente com a latência de uma única requisição individual.
00:04:04O usuário se importa com o momento em que toda a tarefa é concluída.
00:04:08Isso significa que precisamos otimizar para tarefas, não apenas para requisições individuais.
00:04:16Vamos examinar as cargas agênticas mais de perto. Um agente na verdade executa uma sessão composta por tarefas.
00:04:23Cada tarefa geralmente roda em um loop. Primeiro, ele planeja, o que normalmente significa uma chamada de LLM.
00:04:29Depois ele age, talvez chamando uma ferramenta. Em seguida, ele observa o resultado e adiciona isso de volta ao contexto.
00:04:38E ele repete isso até que a tarefa esteja concluída.
00:04:41Portanto, estamos constantemente alternando entre a inferência de LLM e uma ou mais execuções de ferramentas externas.
00:04:50Assim, existe um intervalo entre as chamadas de LLM. Um agente também pode criar subagentes e executá-los em paralelo.
00:05:01As entradas do agente também são muito diferentes do chat. O gráfico aqui mostra a distribuição de tamanho de prompt e geração nas execuções internas do nosso agente de código com o GLM 5.2, que usamos no dia a dia.
00:05:15Eles são muito mais longos. Eles crescem à medida que a tarefa avança, pois cada observação é anexada de volta ao contexto.
00:05:25Há um padrão importante aqui. Passos consecutivos do agente geralmente compartilham um prefixo enorme.
00:05:32Se recomputarmos esse mesmo prefixo toda vez, estaremos queimando muito processamento em um trabalho que já fizemos.
00:05:40Portanto, esta é uma das maiores oportunidades na inferência agêntica.
00:05:46Afinal, o quão famintos por tokens são os agentes?
00:05:49Agora vamos ver um exemplo de tarefa de longo horizonte, como pesquisa profunda.
00:05:53Explicamos o framework de decodificação especulativa no vLLM usando o Kilo Code com o GLM 5.2 na Friendly AI.
00:06:02Existem várias etapas, e cada etapa é composta por subagentes que executam múltiplas inferências e chamadas de ferramentas.
00:06:12Portanto, ele pode rodar dezenas ou até centenas de passos de inferência, às vezes ao longo de minutos ou horas.
00:06:19E o contexto compartilhado continua crescendo o tempo todo.
00:06:23Para o usuário, o que importa não é a latência de um único token ou de uma chamada.
00:06:28O que importa é: quando a minha tarefa será concluída?
00:06:35Então a inferência agêntica não é apenas um chat com mais requisições.
00:06:39É um problema diferente. O contexto cresce ao longo do tempo.
00:06:43O trabalho das ferramentas é intercalado entre as chamadas ao modelo.
00:06:46O número de chamadas ao modelo depende da entrada.
00:06:49Portanto, você não pode se planejar em torno de uma taxa fixa de requisições.
00:06:55E a métrica real é a latência da tarefa de ponta a ponta, não a latência de uma única requisição.
00:07:02Então, como fazemos isso? Deixe-me mostrar a engenharia principal por trás disso.
00:07:23Aqui está o mapa de engenharia de como pensamos sobre o problema.
00:07:27Construímos a pilha camada por camada ao redor das cargas de trabalho agênticas.
00:07:33Há quatro grandes pilares que vou abordar hoje.
00:07:37Prefix caching, gerenciamento de cache de Key-Value (KV), roteamento consciente de cache e otimização consciente do agente.
00:07:48E, claro, por baixo, precisamos de otimização na camada do modelo, como atenção esparsa para contextos longos,
00:07:56técnicas para reduzir erros, kernels rápidos, servidores resilientes e muito mais.
00:08:02Nesta apresentação, vou focar nos quatro pilares.
00:08:05Vamos começar com o prefix caching.
00:08:09Como os passos do agente compartilham um grande prefixo, calculamos o KV para o prefixo uma vez e o armazenamos no cache.
00:08:17Nos passos seguintes, reutilizamos o KV armazenado e processamos apenas o novo sufixo.
00:08:23Ler do cache é muito mais barato do que recomputar o prefill,
00:08:27então isso melhora o tempo até o primeiro token e reduz o processamento em cada passo.
00:08:33E quanto mais tempo a tarefa roda nos agentes, mais valioso isso se torna.
00:08:41Mas o caching só funciona se o cache de KV realmente couber e puder ser movido com eficiência.
00:08:48Portanto, precisamos de um gerenciamento forte de cache de KV.
00:08:52Usamos um gerenciamento de memória eficiente para compactar mais contextos ativos na memória de cada GPU.
00:08:59Usamos quantização de KV para reduzir o consumo de memória.
00:09:04Usamos caching hierárquico através da memória da GPU, memória do host e disco, para que possamos ir além dos limites da GPU.
00:09:13E também usamos caching distribuído para que um mesmo prefixo possa ser servido em várias réplicas, não apenas dentro de uma única instância.
00:09:26Em escala de cluster global, o roteamento se torna extremamente importante.
00:09:29Um balanceador de carga simples pode distribuir as requisições uniformemente entre os clusters de GPU, mas pode destruir a localidade do cache.
00:09:38Um roteador consciente de cache em escala global faz algo mais inteligente.
00:09:42Ele envia a requisição para um pod que já possui o prefixo correto no cache, transformando um prefill pesado em um hit de cache.
00:09:51Ao mesmo tempo, ele ainda precisa balancear a carga para que um único pod não fique sobrecarregado.
00:09:58Neste exemplo, as duas requisições da tarefa A vão para o mesmo pod 1 por conta da localidade de cache.
00:10:08A próxima peça é a otimização consciente do agente.
00:10:11E esta é a próxima fronteira da inferência agêntica.
00:10:16Hoje, a maioria dos sistemas agenda cada chamada de LLM como se fosse independente.
00:10:21Eles realmente não entendem que essa chamada faz parte de um programa agêntico mais longo.
00:10:27Mas se o otimizador conhece o contexto do agente, ele pode tomar decisões melhores.
00:10:33Por exemplo, interromper o trabalho certo, fazer prefill especulativo de contexto para um próximo passo provável ou tomar uma decisão melhor de despejo de cache com base no contexto do agente.
00:10:48O objetivo é reduzir a latência da tarefa de ponta a ponta, e não apenas fazer com que uma chamada pareça rápida.
00:10:58Quando juntamos tudo isso, este é o resultado.
00:11:01Estamos usando o mesmo modelo, GLM 5.2, com o Kilo Code para criar um jogo mobile simples.
00:11:07Executamos a mesma tarefa com as APIs da Friendly AI e de outro provedor de inferência conhecido.
00:11:14Como podem ver, a Friendly AI conclui a mesma tarefa de ponta a ponta muito mais rápido, graças ao nosso design de nuvem focado em agentes.
00:11:24Então, o que isso possibilita na prática?
00:11:29Uma pilha de agentes em produção muito mais forte.
00:11:32Pegue um agente que você já gosta.
00:11:35Agora, conecte modelos open-weight de ponta como GLM 5.2, Minimax e Kimi servidos na Friendly AI.
00:11:43O modelo oferece capacidade com qualidade de ponta e uma economia muito melhor.
00:11:49A Friendly AI oferece a velocidade, a confiabilidade e o desempenho de ponta a ponta necessários na produção.
00:11:56Essa combinação — qualidade, velocidade, confiabilidade e custo — é o que torna os agentes realmente úteis e econômicos na produção.
00:12:06A Friendly AI está atualmente capacitando equipes em produção, desde startups nativas de IA até grandes empresas globais.
00:12:15Gostaria de destacar um par de exemplos aqui.
00:12:20A Kilo é uma ferramenta de programação agêntica com IA extremamente popular que atende a milhões de usuários.
00:12:27A LG é uma empresa global cujos negócios variam de eletrônicos a saúde e energia.
00:12:35Empresas muito diferentes, mas todas precisam da mesma coisa:
00:12:39Inferência agêntica rápida, confiável e econômica.
00:12:45Este depoimento do nosso cliente Kilo diz tudo.
00:12:50“No último ano, o Kilo Code testou vários provedores de inferência hospedando modelos abertos e fechados.
00:12:56Em um teste comparativo do uso do GLM 5 contra outros provedores e o uso direto do laboratório do modelo, a G.AI,
00:13:05a Friendly AI foi consistentemente sete vezes mais rápida, com uma taxa de erro significativamente menor.
00:13:12Hoje, a Friendly AI é um componente central da estrutura do Kilo.”
00:13:17E você pode consumir isso de qualquer forma que se adapte à sua infraestrutura.
00:13:23A API de Modelos é a maneira mais rápida de começar.
00:13:26Acesse os principais modelos open-weight de ponta através da nossa API serverless.
00:13:29Endpoints dedicados oferecem sua própria implantação isolada com SLAs garantidos para cargas de produção.
00:13:36E o BYOG (Traga sua própria GPU) permite rodar a inferência da Friendly na sua própria infraestrutura.
00:13:44A mesma pilha, três maneiras de implantar.
00:13:49Para encerrar, há três coisas para lembrar.
00:13:53Primeiro, modelos open-weight de ponta tornam os agentes em produção economicamente escaláveis.
00:13:59Segundo, agentes não são apenas chats com mais chamadas.
00:14:03A inferência agêntica exige a otimização da latência da tarefa de ponta a ponta, com os desafios que mencionei.
00:14:10Terceiro, a Friendly AI foi criada como uma nuvem de inferência para esse mundo.
00:14:16Inferência agêntica rápida, confiável e barata.
00:14:23Obrigado por assistirem à minha palestra.
00:14:25Se você está construindo agentes, experimente os modelos open-weight de ponta na Friendly AI hoje mesmo.
00:14:30Você pode começar na Friendly AI em questão de minutos.
00:14:34E obrigado.
00:14:35Estarei por aqui após a sessão.
00:14:37Muito obrigado.
00:14:38Obrigado.

핵심 요약

A otimização de infraestrutura para agentes exige uma nuvem de inferência focada na latência total da tarefa via prefix caching, gerenciamento hierárquico de memória KV e roteamento consciente de cache, reduzindo custos em até 5,6 vezes com modelos de peso aberto.

하이라이트

  • A criadora da técnica de continuous batching e do projeto ORCA, que deu origem ao vLLM, desenvolveu uma arquitetura de nuvem focada na execução de agentes de IA.

  • Modelos de peso aberto como o GLM 5.2 concluem tarefas complexas de programação por $0,27, enquanto modelos proprietários como o Opus 4.8 custam $1,50 para a mesma execução.

  • A latência na inferência agêntica deve ser calculada pelo tempo total de conclusão da tarefa ponta a ponta, e não pelo tempo de resposta de requisições individuais.

  • O prefix caching elimina a recomputação do contexto acumulado em etapas sequenciais, reduzindo drasticamente o tempo até o primeiro token.

  • O roteamento consciente de cache em escala de cluster direciona novas chamadas para instâncias que já contêm o histórico da sessão na memória de GPU.

  • Testes no ambiente de produção da ferramenta Kilo Code registraram uma velocidade sete vezes superior e menor taxa de erro em comparação aos endpoints do laboratório original.

타임라인

A evolução da inferência e a ascensão dos modelos abertos

  • A maturidade dos modelos de peso aberto possibilita a execução econômica de agentes em escala industrial no ano de 2026.
  • A equivalência de capacidade entre modelos abertos e proprietários reduz os custos por token sem comprometer o resultado final da tarefa.

Modelos abertos atingiram paridade técnica com alternativas proprietárias em tarefas complexas, como a geração de código para jogos. Um benchmark de programação agêntica demonstrou a conclusão bem-sucedida de um jogo de defesa de torre tanto pelo GLM 5.2 quanto pelo Opus 4.8. A diferença crítica reside no custo operacional: a execução no GLM 5.2 custa $0,27 contra $1,50 no Opus 4.8, gerando uma economia de 5,6 vezes por tarefa.

A mudança estrutural das cargas de trabalho agênticas

  • A unidade fundamental da inferência agêntica mudou de requisições isoladas para tarefas autônomas compostas por múltiplos passos.
  • O contexto dos agentes cresce continuamente devido ao anexo iterativo de observações e retornos de ferramentas.
  • Passos consecutivos de uma mesma sessão agêntica compartilham prefixos massivos de dados.

Diferente das interações de chat tradicionais baseadas em uma pergunta e uma resposta, as cargas agênticas funcionam em loops de planejamento, ação e observação. A alternância entre chamadas ao modelo de linguagem e execuções de ferramentas externas gera intervalos operacionais e expansão do prompt. Em tarefas de longo horizonte como pesquisa profunda, dezenas de subagentes operam em paralelo ao longo de minutos ou horas, exigindo otimização voltada à latência de ponta a ponta da tarefa.

Os quatro pilares da engenharia de inferência para agentes

  • O prefix caching armazena os valores de Key-Value (KV) do histórico para reprocessar apenas os novos sufixos de texto.
  • O gerenciamento de cache KV utiliza quantização e armazenamento hierárquico distribuído entre GPU, memória do host e disco.
  • O roteamento consciente de cache encaminha requisições para nós que já contêm o prefixo carregado, preservando a localidade.

A pilha de engenharia estruturada para agentes baseia-se em quatro componentes principais. O prefix caching reaproveita os dados calculados em etapas anteriores, reduzindo a fase de prefill. Para contornar a limitação física da VRAM nas GPUs, a memória é gerenciada em camadas hierárquicas e distribuídas por clusters. O balanceador de carga prioriza pods com histórico em cache, enquanto a otimização consciente do agente executa descarte seletivo e prefill especulativo com base nos passos futuros previstos.

Resultados de produção e opções de implantação

  • A arquitetura otimizada para agentes entrega ganhos diretos de velocidade na conclusão de projetos de software integrados.
  • O ecossistema oferece opções de consumo por API serverless, endpoints dedicados com SLA ou infraestrutura própria via BYOG.
  • A adoção em ambientes corporativos e ferramentas de código atinge milhões de usuários finais.

Na criação de jogos móveis com o agente Kilo Code, a infraestrutura especializada concluiu o pipeline completo com velocidade superior aos provedores padrão. Dados de telemetria da plataforma Kilo confirmaram um desempenho sete vezes mais rápido no processamento do GLM 5 do que o acesso direto ao laboratório criador do modelo. Essa arquitetura atende demandas desde startups até conglomerados como a LG, operando por API gerenciada ou na modalidade Bring Your Own GPU (BYOG).

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기