Se quisermos que eles façam Trabalho de Conhecimento, projete-os como Agentes de Conhecimento — Benjamin Clavié, Mixedbread

AAI Engineer
Computing/SoftwareManagementInternet Technology

Transcript

00:00:00Certo, olá a todos. Vou fazer a apresentação mais rápida sobre mim. Sou Ben Clavier. Trabalhei na Mixed Bread, onde fazemos recuperação de informação. Sou francês e moro em Tóquio. Hoje vou falar sobre o fato de que os agentes deveriam fazer trabalho do conhecimento e, portanto, deveríamos projetá-los como trabalhadores do conhecimento.
00:00:29Deveríamos projetá-los como agentes do conhecimento, não como agentes de programação. Vou explicar a diferença e por que acho isso importante. É uma palestra meio polêmica, mas vamos começar. A primeira coisa é que os primeiros agentes nos davam curiosidades divertidas. Refiro-me aos primeiros agentes de 2022, quando tudo o que tínhamos era RAG, e os agentes nem podiam chamar ferramentas. Tudo o que tínhamos era a instrução IF, busca, e era legal, dava para falar com seu PDF. Essa foi a primeira forma de trabalho agente. Não era muito útil.
00:00:59Falamos sobre isso por muito tempo. O que veio a seguir foram os agentes de programação, e isso foi a sensação. Quando os agentes começaram a buscar direito, entender as coisas, executar tarefas e chamar ferramentas, começamos a criar agentes de programação, e eles são algo grande.
00:01:15Essa é uma forma de trabalho do conhecimento. Mas os agentes não eram trabalhadores do conhecimento na época; eram agentes de programação. Agora estão se tornando trabalhadores do conhecimento. E com isso quero dizer que o trabalho do conhecimento é um grande superconjunto, e quase todo fluxo de trabalho em que você pensou antes é uma forma de agente do conhecimento.
00:01:37É como ter um agente advogado procurando documentos jurídicos, um agente financeiro ou procurando informações sobre medicamentos. Muita gente no Twitter tenta se autodiagnosticar, e há muito uso médico.
00:01:53Tudo isso são agentes de programação tentando encontrar conhecimento, tentando usá-lo. Programar faz parte disso, claro. Até a pequena parte de RAG que mencionamos no primeiro slide faz parte.
00:02:09Mas isso é uma proporção muito pequena do todo. Há muito mais no conhecimento do que qualquer domínio isolado. E o que é o trabalho do conhecimento? Pois estou dizendo que é importante. Eles fazem trabalho do conhecimento. Programar é trabalho do conhecimento.
00:02:23A meu ver, há duas maneiras de definir isso. Uma delas é que o trabalho do conhecimento é aquele em que a principal entrada é a informação. Sua principal entrada não é um material físico, não é algo tocável. É conhecimento, é informação.
00:02:38A natureza desse trabalho é processar essa informação, que por natureza é ambígua e difusa, e o principal resultado é algo acionável. É um julgamento, uma decisão. Se for um advogado, você terá as conclusões do seu caso e ele poderá pleitear por você. Você terá um elemento de reflexão acionável, algo não tangível, mas que existe como conhecimento.
00:03:03Há também uma definição tautológica que faz sentido aqui: se você precisa de busca, é um problema de conhecimento. E se é um problema de conhecimento, você precisa de busca. É algo muito fácil e autodefinido.
00:03:14No mundo real, a maior parte do trabalho que vemos na economia de serviços é uma forma de trabalho do conhecimento. Advogados, acadêmicos, contadores, engenheiros de software e pesquisadores também são trabalhadores do conhecimento.
00:03:29O fato de haver tanto trabalho do conhecimento na sociedade contribuiu para uma estruturação em constante evolução. Existem fluxos de trabalho muito bem definidos de como devemos realizar o trabalho do conhecimento, de como o conhecimento funciona em si e de como o desenvolvemos.
00:03:43Mas, até agora, a área de agentes focou no caso especial e tentou generalizar a partir dele. Esse caso especial é a programação e a engenharia de software. O ponto é que código é conhecimento, mas nem todo conhecimento é código. O código é uma forma muito única de conhecimento porque possui pistas muito duradouras.
00:04:01Em uma base de código, haverá muitas referências a um identificador, arquivo ou caminho. Quando programamos de forma intuitiva, isso pode mudar, mas, na maioria das vezes, não muda tanto.
00:04:12Tudo é muito duradouro. Essa superfície agora é passível de busca por grep. Há palavras-chave, definições de métodos e muitas coisas que, por definição, você pode localizar com grep no código.
00:04:24E a tarefa — esta parte é muito importante e não falamos muito sobre ela —, as pessoas dizem: "Por que o grep é suficiente para programar?" ou "Por que um agente pode programar e você diz que ele não pode fazer uma pesquisa profunda para uma questão jurídica?"
00:04:37Uma das razões é que não percebemos, mas, ao interagir com agentes de programação, damos a eles tarefas extremamente estreitas. Não esperamos tanto deles.
00:04:47Tudo é sempre sobre uma funcionalidade ou um ticket específico. Há uma tarefa em mãos. Você não vai dizer ao agente: "Descubra um novo paradigma de programação e implemente-o neste novo aplicativo".
00:04:58Boa sorte com isso. Mas no trabalho do conhecimento, isso costuma acontecer. Primeiro, você não tem essas pistas duradouras. O significado é sempre implícito.
00:05:08E o mais importante: a mesma pista pode significar muitas coisas diferentes. Não temos definições de funções no trabalho do conhecimento. Se seu agente procura por 30 dias,
00:05:17é um prazo? É um período de carência? É uma regra de retenção? Está no mesmo domínio? Você está buscando 30 dias em um contrato e obtendo medicamentos?
00:05:25Há muita informação contextual aqui, mas, o mais importante, a busca começa a partir de uma intenção. Mesmo no exemplo jurídico,
00:05:33se você pergunta sobre uma regra específica para um domínio específico, precisará analisar as normas internacionais aplicáveis
00:05:40e ver se elas se aplicam neste caso. Há muita informação condicional que não está pré-definida na tarefa. Cabe ao agente encontrar tudo isso.
00:05:47O conhecimento que não é código é muito contextual e guiado pelo significado, o que é bem mais difícil do que código.
00:05:54Nada do que estou dizendo é novo. As pessoas fazem trabalho do conhecimento há muito tempo,
00:06:01e isso resultou em dois ciclos infinitos. Há o ciclo das ferramentas: no início, nós conversávamos.
00:06:10Em certo ponto, alguém disse: "Deveríamos escrever as coisas". Em Alexandria, tivemos o caso de Pinakes,
00:06:14em que o curador da Biblioteca de Alexandria teve a ideia de criar uma maneira
00:06:19de catalogar todos os livros existentes. Desenvolvemos a escrita e depois as bibliografias.
00:06:24Terminamos com a versão atual do sistema de Classificação Decimal de Dewey para bibliotecas.
00:06:30Hoje temos motores de busca. Mas também tivemos um ciclo organizacional,
00:06:34que é conectado, mas diferente do das ferramentas: costumava ser um único especialista talentoso.
00:06:40Todos ouvimos falar do polímata do passado, a pessoa que sabia tudo sobre um ou todos os domínios,
00:06:46e você recorria a ela se precisasse de informação. Mas isso não escala, então surgiram os mosteiros,
00:06:51que eram guardiões do conhecimento. Depois vieram as universidades e acabamos criando as burocracias.
00:06:55Hoje criamos a organização moderna do trabalho, com empresas muito especializadas.
00:07:01Nos hospitais, há o médico, o médico sênior, o enfermeiro especializado,
00:07:05os enfermeiros, os assistentes de saúde, e todos se especializam em diferentes níveis de tarefas.
00:07:10Essa é uma ótima forma de otimização. A questão é que se trata de apenas um ciclo.
00:07:17Mostro dois ciclos aqui, mas na verdade eles são apenas um:
00:07:20temos novos conhecimentos, e novos conhecimentos exigem ferramentas melhores.
00:07:24E ferramentas melhores significam que acabamos criando novos fluxos de trabalho e novas funções.
00:07:28Precisamos de pessoas treinas para usar essas ferramentas, pessoas que entendam o que a nova ferramenta faz.
00:07:33Se há alguém que sabe ir à biblioteca e você diz "use o Google",
00:07:37é preciso saber o que é o Google. Essa pessoa precisa aprender que é um motor de busca.
00:07:42Basta digitar as coisas. Não há necessidade de ir até lá fisicamente.
00:07:44Isso significa requalificação. Formam-se novos trabalhadores do conhecimento mais eficientes,
00:07:47que geram mais conhecimento. Assim, precisamos de novas ferramentas, e assim por diante.
00:07:51Tanto o ciclo de ferramentas quanto o organizacional são apenas este único ciclo de auto-otimização
00:07:56que aciona o outro sem parar.
00:08:00E o ponto sobre ferramentas e otimização é que não são complementos neutros.
00:08:06Digo que continuamos otimizando ferramentas, coisas surgem e criamos novidades a partir delas.
00:08:11Mas isso nunca é algo neutro. Ferramental não é só ter uma busca 5% melhor.
00:08:16O fato de termos ou não uma ferramenta é o que decide se uma tarefa —
00:08:20não se a tarefa é possível, pois dá para fazer coisas sem a ferramenta certa,
00:08:23mas se a tarefa é escalável e pode ser feita de forma barata, pois ser barata permite escalar.
00:08:29Claro, se você for à Biblioteca de Alexandria antes do Pinakes,
00:08:34pode encontrar seu manuscrito em algum lugar. O que procura está lá.
00:08:37Provavelmente vai levar duas ou três semanas.
00:08:39Então você vai precisar muito, muito desse conhecimento.
00:08:42Mas se houver um catálogo na biblioteca, levará 10 minutos, e fica bem mais fácil dizer:
00:08:46"Preciso saber mais sobre isso, então vou pesquisar".
00:08:50Da mesma forma, se você tem um diretório de mapas ou um mapa para começar,
00:08:54que em si é uma ferramenta de informação, explorar o mundo torna-se uma ideia muito melhor.
00:08:59Você não vai depender de descobrir a América por acaso a caminho das Índias.
00:09:03Você sabe para onde está indo.
00:09:05E, da mesma forma, se você tem uma plataforma de busca multimodal,
00:09:08pode pesquisar milhões de PDFs como não podíamos antes.
00:09:11Agora há muitos casos de uso em que você pensaria: "Está nos arquivos,
00:09:14não vou mexer nisso", mas que se tornam realmente úteis.
00:09:19Na prática, isso se parece com isto.
00:09:21Entrando na parte mais técnica aqui,
00:09:23que é sobre uma tarefa simples de pesquisa profunda.
00:09:25Este é o ranking BrowseCom Plus,
00:09:27feito para avaliar a qualidade de ferramentas de busca em uma tarefa bem delimitada de pesquisa profunda.
00:09:32Você tem 200 documentos encontrados e consultas específicas.
00:09:35Falamos sobre isso hoje de manhã, e é um benchmark muito útil para analisar consultas.
00:09:40O que vemos é que uma ferramenta ruim —
00:09:43isso é algo sobre o qual as pessoas costumam reclamar.
00:09:46Você verá que há dois BM25 aqui.
00:09:48Há dois, um otimizado e um não otimizado.
00:09:51As pessoas dizem que o BM25 não é bom por essa razão:
00:09:55não existe apenas um BM25. Existem centenas deles.
00:09:59É uma forma de fazer busca lexical.
00:10:00Você deve sempre otimizar suas referências.
00:10:01Sempre otimize aquilo que está tentando superar.
00:10:03O que se vê é que uma ferramenta mal otimizada é inútil, como 60% de precisão.
00:10:06Você não vai confiar em alguém que acerta 60% das vezes.
00:10:11Você vai preferir fazer sozinho.
00:10:14Quando você otimiza as ferramentas, sobe para 70, 80, e o melhor mesmo é uma estrutura híbrida.
00:10:16Ela chega a 90.
00:10:22Mas talvez essa não seja a parte mais interessante, pois estagnamos em certo ponto.
00:10:23O salto de 89,8 para 90,2 é variação entre execuções.
00:10:28Isso não importa.
00:10:34O que importa é que essa precisão de 90,2% é atingida com 20% a menos de chamadas de ferramentas.
00:10:35Isso é enorme porque, na prática, são 20% a menos de tokens, 20% a menos de recursos usados.
00:10:42É basicamente 20% de economia direta.
00:10:48E comparado à referência não otimizada, você gasta cerca de 5% do valor inicial.
00:10:50A ferramenta é o que faz a tarefa valer a pena.
00:10:57Ninguém continuaria usando a ferramenta se ela exigisse 25 chamadas.
00:10:59Mas se exige 8 chamadas, você pensa: "Legal.
00:11:02É um fluxo de trabalho que posso introduzir".
00:11:04A segunda parte, associada às ferramentas e que considero tão importante quanto —
00:11:08pois o BrowseCom Plus no slide anterior é interessante, mas é fácil.
00:11:15São 100 mil documentos.
00:11:16É apenas texto.
00:11:18É só uma pergunta.
00:11:19Não é tão aberto assim.
00:11:21É apenas um pouco confuso.
00:11:22Mas quando se faz trabalho do conhecimento no mundo real, há aquele fluxo de trabalho que tento fazer: você tem um cliente.
00:11:30Eles procuram o chefe.
00:11:31Procuram o advogado.
00:11:32Aquele que é o sócio da empresa.
00:11:34E dizem: "Certo, esta é a minha situação.
00:11:36Esse é o meu problema.
00:11:37E eles se reúnem.
00:11:38Mas aí o que o sócio faz é: ele não vai ser o responsável por toda a pesquisa jurídica.
00:11:43Eles não vão ser os encarregados de fazer cada etapa do problema.
00:11:46O que eles fazem é meio que entender tipo: “Ok, essa pessoa tem esse problema.
00:11:50Isso vai causar aquilo a ela.
00:11:51Esses são os fatos.
00:11:53Eu preciso das leis relevantes para este, aquele e outros aspectos”.
00:11:57E aí eles têm metas das partes.
00:11:58Eles têm assistentes.
00:11:59E os assistentes é que vão fazer essa pesquisa.
00:12:01Eles vão usar o conjunto de ferramentas que foram treinados para usar.
00:12:04E vão produzir memorandos e notas.
00:12:06E depois entregam isso de volta aos chefões.
00:12:08Talvez eles pesquisem um ponto específico de esclarecimento.
00:12:10Mas eles confiam principalmente no que os agentes de pesquisa,
00:12:13seus assistentes, encontraram para eles.
00:12:15E essa é a resposta que você vai obter.
00:12:18E isso reforça o ponto que mencionei antes: no código, quando se está programando,
00:12:22você mesmo acaba fazendo esse trabalho.
00:12:24Você já desmembrou a consulta.
00:12:25Sabe exatamente o que quer fazer.
00:12:27Tem um ticket detalhado.
00:12:28Tem algo pronto para entregar ao agente.
00:12:30No mundo real, você tem um cliente com um problema muito abrangente.
00:12:33E você precisa desmembrá-lo por conta própria.
00:12:35E o seu agente precisa desmembrá-lo sozinho e usar subagentes que façam essa pesquisa.
00:12:41E é assim que ferramentas melhores e organização funcionam em conjunto.
00:12:45Porque este aqui é o MatQA, outro tipo de benchmark de conhecimento.
00:12:49O MatQA foi lançado conjuntamente pela Hugging Face e pela Snowflake.
00:12:53E é uma tarefa empresarial baseada em PDFs.
00:12:55Possui PDFs e versões com OCR desses PDFs.
00:12:58E o estado atual da tabela de classificação mostrou que tanto ferramentas quanto organização são necessárias.
00:13:04E dá para ver isso no fato de que com BM25, por mais otimizado que esteja,
00:13:10o humano no Gemini 3 atingiu o mesmo patamar.
00:13:13E isso não significa que o Gemini 3 seja tão bom quanto um humano.
00:13:16Significa que nem mesmo um humano consegue a informação correta tendo buscas ilimitadas com BM25.
00:13:22Portanto, temos a configuração de ferramentas e precisamos de ferramentas melhores para avançar.
00:13:26Essa é a parte de otimização de ferramentas do processo.
00:13:28Felizmente, temos ferramentas melhores.
00:13:30Temos modelos capazes de processar PDFs.
00:13:33Temos visão computacional.
00:13:34Não precisamos depender de texto via OCR.
00:13:36E o que vemos com isso é um salto: o Gemini e a ferramenta de busca Mixedbread,
00:13:41que é totalmente multimodal, conseguem ler o PDF.
00:13:44Você obtém as tabelas.
00:13:45Obtém tudo isso diretamente na sua busca.
00:13:47E isso nos dá um grande salto de precisão.
00:13:50Mas o interessante é que isso não funciona...
00:13:53Bem, não que não funcione.
00:13:54Funciona sim.
00:13:55Mas não tão bem quanto gostaríamos.
00:13:56Porque por que meu agente atinge 88,9 se o humano alcança 99,4?
00:14:00São 10% que estou deixando para trás aqui.
00:14:02Sendo que esse agente...
00:14:04acho que ele faz 10 tentativas no benchmark.
00:14:06Então é um sistema totalmente agêntico.
00:14:08Ele consegue refletir sobre seus resultados.
00:14:09E, ainda assim, falta desempenho.
00:14:11E é aí que introduzimos o agente de busca Mixedbread,
00:14:14que faz exatamente a divisão de trabalho que vimos antes,
00:14:17onde basicamente dizemos ao agente principal, aquele que responde à pergunta:
00:14:21“Ok, esse é um tópico amplo.
00:14:23Existem milhares de PDFs.
00:14:25Você não vai pesquisar tudo sozinho.
00:14:26Por favor, desmembre o problema para mim.
00:14:28Escreva consultas sobre os aspectos que considera importantes para responder.
00:14:31Eles são importantes para responder à consulta principal”.
00:14:33E temos pesquisadores que agem de forma autônoma.
00:14:35Eles encontram os resultados certos.
00:14:36E trazem um pequeno resumo para o seu agente.
00:14:38E então o seu agente finalmente responde.
00:14:40Isso aumenta a precisão em 3,5 pontos.
00:14:43Pode não parecer muito,
00:14:45mas gosto de pensar nisso como a lacuna do Oráculo.
00:14:47E a lacuna do Oráculo é a diferença entre documentos perfeitos
00:14:51e o seu sistema de busca.
00:14:53E essa lacuna aqui é de cerca de 10 pontos antes de usar os agentes.
00:14:58E cai para seis pontos após o uso dos agentes.
00:15:01Isso significa que temos uma redução de cerca de 40% nos erros.
00:15:04A diferença entre humanos e agentes diminui em 40% apenas
00:15:08por ter uma arquitetura melhor para pesquisar.
00:15:12E acho que este é o fim do meu slide, pois meu tempo está acabando.
00:15:16E é perfeito, pois este é meu slide de conclusões.
00:15:18O que quero que absorvam desta palestra é que sabemos projetar fluxos
00:15:23de trabalho de conhecimento melhores para humanos.
00:15:24E os agentes de IA se beneficiam muito desse padrão.
00:15:26Nós projetamos isso.
00:15:28Sabemos como fazer isso.
00:15:29Humanos trabalham nisso há séculos.
00:15:30As pessoas sempre precisaram de mais conhecimento.
00:15:33Os impérios tinham bibliotecários.
00:15:34Temos paralegais.
00:15:35Temos escritórios de advocacia.
00:15:36Sabemos exatamente como o setor jurídico estruturou o trabalho paralegal.
00:15:41O setor médico também estruturou o dele.
00:15:43E nada disso se parece com programação.
00:15:45A programação tem um sistema muito diferente, porque é um caso de uso muito específico.
00:15:49Deveríamos aprender com o universo do conhecimento para projetar agentes
00:15:54capazes de trabalhar nesse mesmo universo.
00:15:56E não se deve confiar excessivamente em ferramentas, pois elas não são um fim
00:16:02em si mesmas.
00:16:03Elas existem para superar limites.
00:16:05Buscamos ferramentas melhores quando atingimos um teto e o desempenho
00:16:08não está onde gostaríamos.
00:16:09Então desenvolvemos ferramentas melhores para superar esses limites.
00:16:12E, mais importante, as ferramentas precisam ser projetadas junto com os agentes.
00:16:16Os agentes precisam saber usar as ferramentas. Algo comum de se ver é
00:16:20agentes tentando criar consultas grep, porque grep está por toda parte nos dados de treinamento.
00:16:25E BM25 nos dados.
00:16:27Nem sempre é disso que você precisa.
00:16:28Às vezes é necessária uma busca semântica em um PDF.
00:16:30Não dá para dar grep num PDF.
00:16:31Nem usar BM25 num PDF.
00:16:32É preciso elaborar uma consulta melhor.
00:16:34Por isso é essencial que suas estruturas agênticas ou modelos agênticos saibam
00:16:39que possuem mais de uma ferramenta à disposição.
00:16:41E trata-se de primitivas.
00:16:42Grep é uma primitiva.
00:16:43BM25 é uma primitiva.
00:16:44E a busca semântica é uma primitiva.
00:16:46E todas elas precisam passar por um treinamento muito bom.
00:16:49Os modelos precisam conhecer todas elas.
00:16:52Por fim, a orquestração adequada da busca trará resultados muito melhores,
00:16:58pois o contexto é um recurso finito.
00:17:01Mesmo que tenhamos um modelo com janela de contexto de 100 milhões de tokens,
00:17:04primeiro: isso vai custar muito dinheiro.
00:17:06Segundo: ainda assim não é nada.
00:17:08Não cobre nem metade do código jurídico de um único estado,
00:17:11quanto mais dos EUA, do direito internacional ou de tribunais especializados.
00:17:15Portanto, é preciso ter uma forma de desmembrar a tarefa.
00:17:18É necessário ter o orquestrador, os agentes principais,
00:17:21e agentes capazes de organizar o conhecimento para eles.
00:17:25E é isso.
00:17:27Temos dois minutos para perguntas.
00:17:30Obrigado.
00:17:31Obrigado.

Key Takeaway

Projetar sistemas de IA como agentes de conhecimento com arquiteturas hierárquicas e busca multimodal reduz os erros em relação ao desempenho humano em 40%.

Highlights

  • A maior parte do trabalho na economia de serviços é trabalho do conhecimento, onde a principal entrada e o resultado final são informações abstratas e julgamentos acionáveis.

  • A busca em bases de código funciona com o comando grep devido a identificadores rígidos, enquanto o conhecimento geral exige interpretação de contextos ambíguos e implícitos.

  • Otimizar ferramentas de busca híbridas reduz o uso de chamadas em 20% e gera até 95% de economia de recursos em comparação a referências não otimizadas.

  • Modelos multimodais que leem tabelas e imagens em PDFs superam a dependência de leituras via OCR tradicional em benchmarks de conhecimento.

  • A divisão de tarefas entre um agente orquestrador e subagentes pesquisadores reduz em 40% a lacuna de precisão entre humanos e sistemas agênticos.

Timeline

A evolução e a definição do trabalho do conhecimento

  • Os primeiros sistemas agênticos de 2022 limitavam-se a instruções condicionais e consultas simples em arquivos PDF.
  • O trabalho do conhecimento transforma entradas informacionais ambíguas em decisões e julgamentos acionáveis.
  • Profissões como advocacia, medicina e engenharia de software compartilham a mesma dependência de busca e processamento de dados.

Os agentes iniciais serviam apenas para responder curiosidades sem capacidade de chamar ferramentas externas. Com a evolução da tecnologia, o foco migrou para a automação de processos complexos baseados em informação. A essência desse trabalho consiste em extrair sentido de dados não estruturados para orientar decisões. Como a economia moderna depende do conhecimento, qualquer problema que exige busca se enquadra nessa categoria.

Diferenças fundamentais entre código e conhecimento geral

  • O código-fonte possui estruturas duradouras e identificadores explícitos que facilitam buscas por palavras-chave.
  • O conhecimento não estruturado depende de significados implícitos e termos com múltiplos sentidos.
  • Os agentes de programação recebem tarefas delimitadas, enquanto os agentes de conhecimento enfrentam metas abertas.

A área de IA tentou generalizar a arquitetura de agentes a partir do desenvolvimento de software. O código é um caso especial de conhecimento dotado de caminhos e nomes de funções estruturados, pesquisáveis via grep. Em contrapartida, informações jurídicas ou médicas contêm ambiguidades contextuais que mudam conforme a aplicação. Projetar agentes capazes de navegar por essa complexidade exige superar a lógica restrita dos scripts de programação.

O ciclo de desenvolvimento de ferramentas e organizações

  • A evolução do conhecimento impulsiona o surgimento de novas ferramentas de catalogação e busca.
  • A especialização das ferramentas reformula a organização do trabalho e exige novas competências profissionais.
  • A eficiência da busca determina se uma tarefa complexa torna-se viável e escalável no mundo real.

A história da informação mostra uma evolução paralela entre ferramentas e estruturas sociais, desde a Biblioteca de Alexandria até os motores de busca modernos. O surgimento de catálogos e classificações permitiu substituir especialistas individuais por grandes burocracias e organizações especializadas. Ferramentas eficientes reduzem o tempo de execução de tarefas de semanas para minutos, viabilizando novos fluxos de trabalho.

Impacto da otimização de busca na eficiência dos agentes

  • A busca lexical BM25 exige otimização específica para evitar taxas de erro inaceitáveis de até 40%.
  • Sistemas de busca híbrida alcançam 90,2% de precisão em tarefas de pesquisa profunda.
  • Ferramentas otimizadas reduzem o consumo de tokens e custos operacionais em 20%.

O benchmark BrowseCom Plus demonstra que ferramentas de busca mal configuradas inviabilizam o uso de agentes autônomos. A combinação de técnicas de busca melhora a precisão e reduz dramaticamente a quantidade de chamadas necessárias. Essa economia de recursos transforma fluxos de trabalho inviáveis em processos acessíveis e confiáveis. A qualidade da ferramenta de busca impacta diretamente a viabilidade do sistema agêntico.

Orquestração hierárquica e busca multimodal

  • Modelos multimodais leem tabelas e elementos visuais em PDFs sem depender de conversão OCR.
  • A divisão do trabalho entre agente principal e subagentes pesquisadores eleva a precisão em 3,5 pontos percentuais.
  • A arquitetura com delegados autônomos reduz a lacuna de desempenho em relação aos humanos de 10 para 6 pontos.

O benchmark MatQA reflete os desafios do trabalho corporativo real, onde problemas amplos precisam ser desmembrados em subtarefas. O uso de visão computacional para interpretar documentos complexos superou os limites das buscas por texto puro. A introdução de uma estrutura hierárquica, na qual o orquestrador delega pesquisas específicas para subagentes, diminuiu a taxa de erro em 40%.

Primitivas de busca e gestão de contexto em sistemas agênticos

  • Os agentes precisam ser treinados para escolher entre primitivas como grep, BM25 e busca semântica.
  • Janelas de contexto grandes não eliminam a necessidade de orquestração nem barateiam o custo operacional.
  • A estrutura dos agentes de conhecimento deve replicar divisões de trabalho já validadas em setores como o jurídico.

O conhecimento acumulado em setores tradicionais serve de modelo para a arquitetura de sistemas de IA. A janela de contexto dos modelos é um recurso finito e dispendioso, incapaz de abarcar todo o volume de dados de um domínio especializado. Os modelos devem reconhecer as ferramentas disponíveis e saber formular consultas semânticas adequadas para filtrar a informação antes do processamento.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video