Os seus agentes carecem de contexto: Veja como resolver o "Você tem toda razão!" — Brandon Waselnuk, Unblocked

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Boa tarde. Espero que todos estejam tendo um dia adorável aqui na AIE. Nós tivemos um ótimo
00:00:17clima, embora o índice UV tenha estado em nove, então espero que tenham passado protetor solar
00:00:20e estejam agindo como adultos sensatos. Estou aqui para falar com vocês sobre engenharia
00:00:24de contexto e tenho a sorte de suceder o AJ do LinkedIn, porque ele
00:00:27falou bastante sobre o sistema que nós realmente projetamos e vendemos para outras
00:00:29soluções. Vou apresentar uma série de ferramentas de código aberto, então, se vocês assistiram
00:00:33àquela última palestra logo antes de mim, vão receber um conjunto de cadeias de ferramentas para
00:00:36explorarem por conta própria, e vou ensinar várias técnicas hoje. O objetivo
00:00:39é claro corrigir... você tem toda razão. Acho que eles retiraram isso
00:00:44dos prompts agora, então diz apenas você está certo ou outras coisas, mas tenho certeza de que
00:00:47vocês já passaram por isso. Sou o Brandon, trabalho na unblocked, sim, tenho um coco, estivemos
00:00:53distribuindo esses cocos frescos como símbolo de contexto fresco, mas o que eu quero
00:00:57discutir com vocês é que, com esses modelos, especialmente com os modelos Claude,
00:01:01acho que o Fable 5 vai voltar hoje, então dizem que vocês podem assistir à gravação da minha chamada
00:01:05tentando agendar isso, vamos ignorar. Mas o que quero que façam é pensar
00:01:11sobre o fato de que, com essas ferramentas, o código gerado por IA deve parecer ter sido
00:01:15escrito por alguém que está na sua equipe há anos. Portanto, para entrar na mentalidade correta de
00:01:23anos, vocês precisam considerar que têm sido o motor de contexto. Como vocês fizeram isso?
00:01:27Construíram contexto indo trabalhar, fazendo perguntas, enviando PRs e
00:01:34tendo-os rejeitados, participando de reuniões, e tudo isso construiu lentamente ao longo do tempo
00:01:39o motor que é o seu cérebro. Vocês entendem como as coisas funcionam aqui, sabem como o software é
00:01:42entregue, estavam de plantão naquela noite em que derrubaram a produção e sabem por que isso aconteceu. O
00:01:48problema é que esses agentes enfrentam exatamente a mesma dificuldade: toda vez que você cria
00:01:53uma nova sessão de terminal com um agente dentro dela, ele é muito inteligente, mas não
00:01:57tem nenhum contexto sobre como a sua empresa opera, então precisa obtê-lo de alguma forma. O
00:02:02problema é que, à medida que você escala esses agentes, esse custo se acumula caso você erre
00:02:07no início. A alavancagem vem do contexto e do conteúdo. Vamos apenas corrigir isso
00:02:13porque acho que as pessoas querem tirar algumas fotos. Perfeito. Esse problema de contexto vai
00:02:20se agravar. Então, na extrema esquerda, todos nós nos lembramos daquela época antiga de dois anos
00:02:25atrás, em que tínhamos modelos de autocompletar que eram bem legais. O que acontecia
00:02:29era que o modelo sugeria o código e rapidamente na sua mente, com o seu
00:02:32contexto, você pensava: não, isso é ruim. Ou dizia: que legal, e apertava a tecla Tab. Ótimo.
00:02:37À medida que avançamos na curva de adoção de agentes, o que acontece é que entramos
00:02:41em mais situações nas quais temos agentes operando sem um humano no circuito ou, pelo
00:02:46menos, você gostaria de não precisar estar no circuito. O que eles precisam é de uma maneira de
00:02:50fazer as perguntas necessárias quando encontram barreiras, a fim de escrever código ou
00:02:54resolver o problema e, por fim, gerar um código que possa ser mesclado
00:02:58na sua base de código, especialmente considerando que muitas pessoas aqui trabalham em bases de código legadas
00:03:02que existem há muito tempo e geram receita real,
00:03:06e não apenas projetos novos e divertidos. Portanto, esse custo de um contexto ruim acumulado no início
00:03:12é barato se você pensar na mentalidade de antecipação: encontrar um defeito ou bug o mais cedo
00:03:17possível é o ideal. O mesmo vale para o contexto, pois, conforme você avança,
00:03:22acaba caindo em loops infinitos. Você geralmente pede para o agente fazer algo e ele responde:
00:03:26ei, eu fiz!, e você pensa: não, meu amigo, e aí você corrige, corrige e corrige.
00:03:29Isso desperdiça tokens de busca e também tempo de retrabalho, o que
00:03:34não é aceitável com a tokenômica que está por vir. Além disso, ao caminhar em direção a agentes paralelos,
00:03:39etc., você começa a sofrer com uma taxa de revisão. Tentamos usar revisores de código de IA,
00:03:43mas, novamente, o contexto principal é importante para que essas revisões de código consigam
00:03:48basicamente compreender o funcionamento da empresa, conhecendo a lógica de negócios
00:03:52e muito mais. E, finalmente, se o seu objetivo é sair completamente do circuito,
00:03:57tipo agentes em segundo plano resolvendo tudo sem cometer erros, você realmente precisa garantir
00:04:02que possui um motor de contexto para que esses agentes possam consultá-lo e obter todas
00:04:05as respostas necessárias para continuar operando de forma eficaz.
00:04:08Existem algumas abordagens comuns que não funcionam; elas representam essencialmente máximos locais. Duas das que
00:04:16mais vemos com nossas centenas de clientes corporativos e empresas de médio porte são
00:04:21a armadilha do contexto curado. Se você já sentou e configurou um sistema de arquivos virtual
00:04:26ou talvez um sistema de arquivos local, colocando alguns arquivos Markdown nele e pensando: aqui está todo o contexto deste projeto,
00:04:30é assim que ele funciona, e depois permitindo que seu agente faça buscas (grep) nisso, ele obtém bons dados e apresenta um desempenho melhor.
00:04:35O problema é que, primeiro, agora você precisa distribuir isso, talvez jogando no GitHub para sua equipe baixar, mas depois o repositório vai se deteriorar, assim como todas as outras documentações que você escreveu; e quem na sua organização é a figura onipotente com bom gosto para curar esse arquivo ou repositório literalmente para todos na empresa?
00:04:52Então você começa a esbarrar nesses problemas. O próximo é o platô do MCP. Isso é bem claro: temos servidores MCP, eles são ótimos, você pode fornecê-los ao seu agente para que ele consiga obter informações de outro sistema de origem. O problema, claro, é que, dependendo de como você escreve a descrição do servidor e das ferramentas, seu agente pode nunca chamá-lo, mesmo quando deveria; ou, se chamar, existe um viés conhecido chamado viés de satisfação de busca. O que isso significa é que, quando o agente encontra
00:05:22a primeira informação que julga correta, ele pensa: pronto, tenho o que preciso, e continua. Em muitas organizações, há uma conversa no Slack da noite anterior dizendo que você deveria fazer A em vez de B, e o agente nunca encontrará isso se encontrar algum registro de arquitetura primeiro, portanto, ele não considera todo o contexto.
00:05:40O problema aqui é que acesso à informação não é compreensão. Para entregar compreensão a um modelo, você precisa usar outras técnicas. O que estou tentando dizer é que o que o agente não consegue ver é tudo o que está abaixo da linha d'água. Ele consegue 100% obter código que compila, mas esse código que compila derruba a produção, gerando um incidente P0 à uma hora da manhã porque ele ignorou o fato de que havia um procedimento específico de lançamento — como desativar uma flag de recurso, seja lá o que for.
00:06:10Portanto, sua equipe precisa de um motor de contexto, pois ele deve entender quem você é e onde trabalha na organização. Se eu disser que quero configurar a autenticação (auth), ele sabe onde trabalho, onde estão meus commits no Git, quem revisa esses commits e compreende o meu contexto; ele pode me orientar e usar isso como ponto de partida para encontrar o restante das informações.
00:06:33Ele resolve conflitos — como mencionado, entre um diagrama de arquitetura antigo e a conversa no Slack com o CTO na noite anterior. Qual deles está certo? É preciso usar várias técnicas para determinar isso.
00:06:44Respeita permissões e governança, é claro. O MCP nos permite usar OAuth e outros escopos e SSO, mas se alguém fizer uma pergunta aqui e não puder saber sobre o projeto secreto A, você precisa garantir que isso não vaze na resposta.
00:06:58E, finalmente, entregar o contexto certo, no momento certo, ao modelo de maneira otimizada em termos de tokens.
00:07:03Temos várias superfícies de contato porque os engenheiros humanos ainda conversam com o unblocked o tempo todo para obter as informações de que precisam no Slack ou em outros meios.
00:07:09Mas você também deseja respostas otimizadas em tokens se estiver se comunicando de máquina para máquina, para não desperdiçar uma quantidade enorme de classes vazias com seus gastos de tokens.
00:07:17É assim que um motor funciona. Serei breve sobre isso, mas basicamente, no lado esquerdo, você vê todas as fontes de dados que chegam.
00:07:26Para nós, focamos em equipes de engenharia, que são quem nos usa, bem como nas equipes tecnicamente mais leves ao redor, como suporte, vendas e outras.
00:07:34Você ingere todos esses dados, obtém dados em tempo real de ferramentas como a sua cadeia de ferramentas de gerenciamento de incidentes.
00:07:39Tudo isso chega ao motor, e o motor processa na parte inferior — vou detalhar esse slide em um momento.
00:07:45Mas, basicamente, ele usa estas seis características principais e, à direita, gera o contexto para o fluxo de trabalho exato da maneira necessária.
00:07:53Esses seis pontos principais, conforme mencionado: contexto de sistema unificado, você precisa abranger todo o ecossistema.
00:08:01Em organizações grandes, empresas na escala do LinkedIn, Workday, General Motors, seja qual for, elas precisam desse tipo de dado.
00:08:08Elas precisam entender tudo o que está acontecendo.
00:08:10E Tharik mencionou esta manhã sobre o Fable possivelmente ser lançado mais tarde hoje.
00:08:15Ele comentou que você precisa fornecer um mapa e depois deixar o Fable explorar o território.
00:08:21A maneira de ajudar a restringir isso é garantir que esses modelos tenham acesso a todo o contexto, porque eles encontrarão seus desconhecidos desconhecidos.
00:08:29Definitivamente há coisas acontecendo na sua empresa das quais você simplesmente não tem consciência, mas que seriam muito úteis para a tarefa que está tentando realizar.
00:08:35Isso fará com que você avance mais rápido.
00:08:37Quanto à recuperação direcionada, você deve ser capaz de fornecer um link rapidamente, expandi-lo, recuperar esse documento e seguir em frente.
00:08:43Portanto, são duas tarefas: pesquisa profunda, ir a fundo, tudo bem.
00:08:46Mas você também precisa de velocidade quando a velocidade é necessária.
00:08:49Resolução de conflitos, já falamos sobre isso.
00:08:51Uma coisa diz para fazer A, outra diz para fazer B, quem está com a razão?
00:08:55Relevância personalizada: quem sou eu, onde trabalho, no que estou trabalhando.
00:08:59Aquela otimização de tokens: garantir que a resposta seja boa, eficaz e não sobrecarregue a janela.
00:09:04E, claro, aplicação de permissões: OAuth, se você não deve ver, você não verá.
00:09:10O que fizemos em alguns testes foi executar exatamente o mesmo prompt no mesmo modelo, um com contexto e outro sem.
00:09:17Esta é a economia de tempo de relógio, que foi de cerca de duas horas, o que é ótimo.
00:09:21E depois, a economia de tokens.
00:09:23Portanto, foi uma tarefa considerável.
00:09:25Custou cerca de 21 milhões de tokens sem contexto e depois 18, ou melhor, 10,8 milhões de tokens com ele.
00:09:31Este é o tipo de experiência que você normalmente vê ao usar um motor de contexto, porque a maioria daqueles tokens de busca desperdiçados — onde o modelo precisa fazer buscas no início de cada sessão para entender e descobrir as coisas — deixa de existir quando ele é hidratado com contexto.
00:09:45Hidratado.
00:09:47E então, conforme você avança, obtém estes tipos de resultados.
00:09:5050% menos tokens, triagem mais rápida e a qualidade da resposta é de fato melhor porque o modelo sabia o que estava acontecendo dentro da empresa.
00:09:57Agora, para esta próxima parte, vocês provavelmente vão querer tirar uma foto.
00:10:01Se não sabem, vocês podem tirar uma foto de um código QR e, depois, nas fotos, tocar nele para abrir o link, para que não precisem ficar flutuando aqui, já que vou mostrar três códigos QR.
00:10:09Este primeiro é para a rede de comentários sociais.
00:10:12Vou colocá-lo na tela para vocês tirarem uma foto.
00:10:14Mas esta é uma ferramenta de código aberto que criamos que, usando programação puramente determinística, examina seu GitHub e entende quem trabalha na sua equipe.
00:10:22Esta é a minha equipe real.
00:10:23Chamamos o Rasheen de máquina porque ele entrega código como louco.
00:10:26Mas à direita, você pode ver os commits dele, onde ele faz commits, quem está revisando o trabalho dele.
00:10:30E então, nessas abas, você encontra um gráfico de especialistas destilado.
00:10:33Você obtém uma cobertura completa do que está acontecendo na sua empresa.
00:10:35E se você opcionalmente adicionar uma das chaves de API da OpenAI ou da Anthropic, ele determinará quem são suas equipes fazendo alguma rotulagem para você.
00:10:44É uma ferramenta muito legal para entender onde sua equipe trabalha e obter essa rede social para direcionar um motor de contexto se você for construir essas ferramentas por conta própria.
00:10:52O próximo é chamado de agente de regras de repositório.
00:10:55Este é um exemplo da nossa base de código real.
00:10:57Vou colocar isso na tela de qualquer forma, então você não precisa falar com o negócio.
00:11:00Mas, em suma, o que ele faz é descobrir todos os lugares em que sua equipe escreveu arquivos de regras, verifica todos eles e diz quais severidades você atribuiu, que outras coisas você deu.
00:11:11Devo simplesmente mudar para isto?
00:11:13Ele diz qual -- ah, olá.
00:11:15É bom conhecer todos vocês.
00:11:17Basicamente, ele encontrará todas as regras dentro do seu repositório e dirá se você tem problemas duplicados ou outros problemas.
00:11:24E então você pode fazer um grep nisso como um índice.
00:11:26Portanto, esse índice pode ser chamado e você pode remover duplicatas, e isso ajudará a melhorar a recuperação de contexto.
00:11:32E, finalmente, na segunda-feira, ministramos este workshop, que foi além do RAG, e ensinamos como construir um motor de contexto relacional do zero.
00:11:40Portanto, se você escanear isso, obterá o manual completo.
00:11:43Ele tem seis PRs empilhados que ensinam como percorrer esse processo.
00:11:46Mas, resumindo, o RAG é uma técnica incrível, e você quer isso.
00:11:49Mas a outra metade do problema é o que as pessoas realmente perguntam:
00:11:53quais são os PRs abertos em que trabalhei na última semana com autenticação?
00:11:57O RAG não pode responder a essa pergunta sozinho.
00:12:00Você precisa de consultas.
00:12:01Portanto, isso mostra como fazer uma busca basicamente sem esquema que permite ao agente descobrir um esquema,
00:12:08e então escrever consultas contra ele de forma determinística para extrair esse tipo de dado relacional.
00:12:13Uma técnica muito útil.
00:12:15Os casos de uso de um motor de contexto, é claro, vão além da geração de código.
00:12:21É aqui que nós vivemos muito.
00:12:22É onde muitos dos nossos clientes passam o tempo.
00:12:24Mas é incrível ver o que acontece quando várias outras pessoas na empresa começam a adotar essas ferramentas.
00:12:30Pessoal de sucesso do cliente resolvendo tickets bem no momento em que eles chegam de um cliente.
00:12:35Temos pessoal de vendas fechando negócios mais cedo no trimestre porque conseguem consultar o motor de contexto desimpedido em tempo real enquanto estão em campo.
00:12:44E muitos mais.
00:12:45O que você também pode fazer é, se você viu aquele gráfico de curvas mais cedo onde falei sobre os níveis,
00:12:51criamos umaferramentinha divertida onde basicamente um LLM faz perguntas a você sobre o que está acontecendo,
00:12:55e então ele mapeia exatamente onde você está e lhe dá algumas técnicas sobre como subir de nível através disso
00:13:01se você estiver procurando essencialmente multiplicar suas capacidades e entregar com ferramentas de IA em escala.
00:13:07É readiness.getunblocked.com.
00:13:11A lacuna não é mais a inteligência.
00:13:13É o contexto.
00:13:14Continuaremos a ter modelos incríveis como o Mythos, à medida que tem sido desenvolvido pela Anthropic,
00:13:19e tenho certeza de que o Sol, assim que eu tiver permissão para ver, eu o terei.
00:13:22Feliz Dia do Canadá, a propósito.
00:13:24Mas o que está acontecendo é que se trata do contexto com o qual você envolve esses modelos para que eles sejam eficazes
00:13:30e eficientes em termos de tokens dentro da sua organização.
00:13:35Portanto, eu tenho um slide de perguntas, mas não tenho certeza se tenho permissão.
00:13:40Não.
00:13:41Então, o que você vai fazer é vir me encontrar no estande P16.
00:13:44Você pode procurar pelo coco.
00:13:46Seria ótimo passar um tempo com todos vocês e entrar em detalhes por aqui, se precisarem.
00:13:49Obrigado pelo seu tempo.
00:14:00Obrigado.

핵심 요약

A eficácia dos agentes de IA em bases de código depende de motores de contexto que fornecem dados em tempo real e reduzem o consumo de tokens em quase 50%.

하이라이트

  • Agentes de IA geram código que parece descontextualizado devido à ausência de histórico empresarial em cada sessão de terminal.

  • Abordagens tradicionais como a armadilha do contexto curado e o platô do MCP sofrem com a deterioração de repositórios e o viés de satisfação de busca.

  • O uso de um motor de contexto reduziu o tempo de execução de tarefas em cerca de duas horas e diminuiu o consumo de tokens de 21 milhões para 10,8 milhões.

  • Ferramentas de código aberto utilizam programação determinística para examinar o GitHub e mapear a rede de especialistas e commits da equipe.

  • A escassez atual na engenharia de IA não é a inteligência dos modelos, mas sim a disponibilidade de contexto estruturado.

타임라인

O problema fundamental da falta de contexto em agentes

  • Os modelos de IA carecem de histórico operacional ao iniciarem novas sessões de terminal.
  • O custo de um contexto inadequado acumula-se e resulta em loops infinitos e retrabalho.
  • Sistemas autônomos exigem motores de contexto para evitar erros que derrubam ambientes de produção.

Desenvolvedores acumulam contexto ao longo de anos através de reuniões, incidentes de produção e PRs. Agentes de IA enfrentam o mesmo desafio operacional a cada nova sessão, gerando custos de tokens e riscos de falhas caso operem sem informações precisas sobre a infraestrutura da empresa.

Limitações das abordagens comuns

  • Sistemas de arquivos virtuais com arquivos Markdown sofrem com a rápida deterioração documental.
  • Servidores MCP apresentam o viés de satisfação de busca, onde o agente interrompe a pesquisa prematuramente.
  • O acesso à informação difere da compreensão profunda exigida para evitar incidentes graves.

Métodos convencionais como curadoria manual de arquivos e servidores MCP atingem máximos locais. O agente frequentemente ignora conversas recentes em canais de comunicação ou diretrizes críticas de lançamento ao encontrar a primeira informação superficialmente correta.

Arquitetura e resultados do motor de contexto

  • A ingestão unificada abrange o ecossistema de engenharia e ferramentas de gerenciamento de incidentes.
  • O uso de contexto otimizado reduziu o gasto de tokens de 21 milhões para 10,8 milhões.
  • A qualidade das respostas melhora e o tempo de conclusão de tarefas diminui consideravelmente.

O motor processa fluxos de dados em tempo real e aplica características como relevância personalizada, resolução de conflitos e governança de permissões. Testes práticos demonstram economia de tempo de relógio e cortes expressivos no volume de tokens desperdiçados em buscas iniciais.

Ferramentas de código aberto e diretrizes práticas

  • Uma ferramenta de código aberto analisa o GitHub de forma determinística para mapear a rede social da equipe.
  • Agentes de regras de repositório indexam diretrizes internas e removem duplicatas.
  • Motores relacionais resolvem consultas complexas que vão além do RAG tradicional.

Recursos de código aberto auxiliam na estruturação de redes de especialistas e na extração de dados relacionais via consultas determinísticas. A lacuna tecnológica atual concentra-se na gestão adequada de contexto para multiplicar a capacidade operativa das equipes.

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기