Quanto tempo as suas skills podem ter antes que o seu agente esqueça o que você disse? — Laurie Voss, Arize AI
AAI Engineer
Computing/SoftwareInternet Technology
Transcript
00:00:00-
00:00:12- Tudo bem, olá a todos.
00:00:15Obrigado por virem a esta palestra deliciosamente nerd.
00:00:20Esta palestra tem um título muito longo,
00:00:22então vou dar a versão resumida logo de cara.
00:00:23Você escreve arquivos de habilidades e os enche de instruções.
00:00:27A certa altura, o modelo para de acompanhar todas elas.
00:00:31A pergunta é: onde fica esse ponto?
00:00:33A partir de quantas instruções colocadas
00:00:35nos seus arquivos de habilidades...
00:00:36E a resposta mudou muito no último ano.
00:00:40Sou a Laurie, sou chefe de relações com desenvolvedores na Arise AI.
00:00:44Numa vida anterior, co-fundei a NPM Inc.
00:00:46Então, alguns de vocês podem me conhecer dos tempos do JavaScript.
00:00:48Hoje em dia, passo muito tempo pensando em IA
00:00:50e em como testá-la.
00:00:53Alguns meses atrás, eu estava em uma conferência de IA em Miami,
00:00:55o que foi uma boa conferência.
00:00:57E eu estava assistindo a uma palestra do Dexter Horthy.
00:00:59Foi uma boa palestra.
00:01:00Não era sobre este assunto de forma alguma.
00:01:02Mas, enquanto ele dava essa palestra,
00:01:04ele mencionou, como um aparte,
00:01:06que um agente consegue seguir até cerca de 200 instruções
00:01:10antes de começar a esquecer essas instruções.
00:01:13E então ele seguiu em frente na palestra,
00:01:15sendo inteiramente um comentário paralelo.
00:01:17E ele mencionou que esse dado é de 2025,
00:01:20então as coisas podem estar melhores agora.
00:01:22E eu parei de ouvir por um segundo
00:01:25porque pensei: 200 instruções
00:01:27não são quase instruções nenhumas, certo?
00:01:31Um arquivo de habilidades decente ultrapassa 200 instruções
00:01:33quase imediatamente.
00:01:35Se o usuário disser X, faça Y,
00:01:37sempre inclua uma seção sobre Z,
00:01:39nunca use a frase W,
00:01:40cada uma delas é uma instrução separada.
00:01:42E se o modelo para silenciosamente de rastreá-las após 200,
00:01:45esse é um limite muito rígido
00:01:47para a complexidade do que você pode construir.
00:01:49Então eu queria saber de onde ele tirou esse número primeiro,
00:01:52e queria saber se era verdade.
00:01:55Então vocês conhecem a sensação de que estou falando.
00:01:57Você escreve esse arquivo de habilidades grande e bonito,
00:01:58páginas de regras, casos limite, tom, formatação.
00:02:00Você o entrega ao agente.
00:02:01Ele faz a tarefa.
00:02:03E você olha para o resultado e pensa:
00:02:05ele prestou atenção de verdade?
00:02:07Ele seguiu de fato todas essas regras?
00:02:09Ou ele só fez mais ou menos o que quis
00:02:11e me deu um simulacro aproximado
00:02:14do que eu estava esperando?
00:02:16Não dá para saber bem, ou dá?
00:02:18Falaremos mais sobre isso depois.
00:02:20E assim você vive com essa ansiedade de baixo grau
00:02:23toda vez que aperta executar.
00:02:24E esse sentimento é o que esta pesquisa aborda
00:02:27e o que estamos tentando descobrir se podemos evitar.
00:02:30Então, aqui está a minha promessa para os seus próximos 18 minutos.
00:02:33Vou mostrar de onde veio esse número 200,
00:02:36se ele ainda é verdade,
00:02:37e qual é o número real hoje,
00:02:39porque ele mudou numa ordem de grandeza.
00:02:41E então vamos conversar sobre o que isso significa
00:02:44para você levar como aprendizado.
00:02:46Qual o tamanho que suas habilidades e prompts podem ter de verdade,
00:02:49e quais mudanças você deve fazer
00:02:51no seu fluxo de trabalho como resultado.
00:02:54Portanto, o número 200 não é lenda urbana.
00:02:57Ele vem de um benchmark real chamado IfScale,
00:02:59de um artigo deste rapaz cujo nome vou pronunciar errado,
00:03:03Jaroslawicz, e coautores no ano passado.
00:03:06E o teste é maravilhosamente simples.
00:03:10É assim que o IfScale funciona.
00:03:12Você pede ao modelo para escrever um relatório de negócios,
00:03:14e você fornece uma lista de palavras específicas
00:03:16que ele tem de incluir exatamente no relatório.
00:03:19Incluir a palavra exata cliente,
00:03:20incluir a palavra exata receita,
00:03:22e assim por diante para quantas palavras você quiser.
00:03:24Cada uma delas é uma instrução que ele precisa seguir.
00:03:27E então você conta quantas dessas palavras exatas apareceram.
00:03:32Portanto, como o teste é tão simples,
00:03:34você só precisa manter dois números na cabeça.
00:03:36Um é a densidade, que chamamos de n.
00:03:38Isso é de quantas regras estamos falando ao mesmo tempo.
00:03:41E o segundo é a precisão,
00:03:42que é a porcentagem dessas regras
00:03:43que ele conseguiu seguir de fato.
00:03:46Agora você pode dizer que incluir palavras aleatórias em um relatório
00:03:50não é o mesmo que seguir instruções reais,
00:03:52e é verdade, e vamos falar sobre isso.
00:03:55Mas as palavras-chave são uma proxy.
00:03:57Incluir a palavra receita tem o mesmo formato de tarefa
00:04:01do que incluir uma seção sobre preços, certo?
00:04:02Ou nunca usar esta frase.
00:04:04É uma restrição distinta e nomeada
00:04:06que você disse ao agente que ele deve seguir.
00:04:09Se um modelo não consegue rastrear 200 palavras em um único prompt,
00:04:11ele definitivamente vai penar
00:04:13com 200 instruções mais complexas.
00:04:16Portanto, se houver diferença, ele vai se sair pior.
00:04:20Então este número é um teto.
00:04:22Este número é o máximo que você pode alcançar.
00:04:23Se você lhe der instruções mais complexas,
00:04:25o número provavelmente vai diminuir.
00:04:27E 200 é um teto realmente baixo.
00:04:30Portanto, antes de ir atrás de novos modelos,
00:04:32você precisa fazer ciência de verdade,
00:04:33o que significa que você precisa replicar o resultado antigo
00:04:36e garantir que o teto de 200 seja real.
00:04:39Então eu rodei de novo o benchmark original.
00:04:42O artigo original testou um monte de modelos,
00:04:45e os modelos nascem e morrem muito rápido.
00:04:47Então, quando eu cheguei a fazer esses testes,
00:04:50apenas três dos modelos do conjunto original
00:04:52de 10 modelos que eles usaram
00:04:54ainda estavam disponíveis por qualquer tipo de API.
00:04:57Eles eram o GPT 4.1, Claude Sonnet 4
00:04:59e Gemini 2.5 Pro.
00:05:01Esses eram modelos disponíveis há 12 meses,
00:05:03que ainda continuam disponíveis agora.
00:05:05E é por isso que testamos esses três,
00:05:07porque era o que tinha sobbrado.
00:05:08E desde que publiquei esta pesquisa pela primeira vez
00:05:11algumas semanas atrás,
00:05:12um desses três modelos foi descontinuado.
00:05:14Portanto, este era o último momento possível
00:05:16em que eu poderia ter rodado este teste.
00:05:17Então, daquela lista, já caímos para dois.
00:05:20Portanto, não se afeiçoem aos seus modelos.
00:05:22Então, aqui estão os resultados que obtivemos ao replicar
00:05:25a descoberta original do IfScale.
00:05:27Esta é a precisão no eixo vertical.
00:05:29Portanto, começa em 100% e começa a cair.
00:05:32E então o número de regras subindo na parte inferior
00:05:35em escala logarítmica.
00:05:36Então, toda vez que avança metade do caminho,
00:05:37o número de regras com o qual ele está lidando dobrou.
00:05:42Portanto, com 500 regras, você perde 30, 40, 50% delas.
00:05:46Nossas curvas corresponderam aos resultados do artigo original
00:05:49dentro do limite de ruído, então a descoberta era real.
00:05:52Há um ano, em torno de 200 a 300 regras,
00:05:55os modelos de ponta começavam a falhar.
00:05:57Esse é um teto realmente baixo.
00:06:00Então essa é a nossa base, e agora vem a parte divertida
00:06:03em que aplicamos exatamente o mesmo teste
00:06:05e o direcionamos para a ponta atual,
00:06:07ou melhor, o que era a ponta atual
00:06:09quando eu rodei este teste.
00:06:10Então eu testei o GPT 5.5, o Claude Opus 4.7,
00:06:13porque o 4.8 saiu uma semana depois de eu rodar este teste,
00:06:17o Gemini 3.1 Pro e o DeepSeek V4 Pro.
00:06:20Então dei a eles o mesmo comando, as mesmas palavras,
00:06:22exatamente tudo igual, e imediatamente esbarrei num problema,
00:06:25que é o fato de que eles gabaritaram.
00:06:27Todos tiraram 100% imediatamente neste teste,
00:06:30absolutamente nenhum erro.
00:06:34Então tínhamos criado um teste para encontrar o teto,
00:06:36e os modelos passaram direto pelo teto
00:06:37sem sequer perceberem que ele estava lá.
00:06:40E isso era um problema, porque o benchmark
00:06:42foi feito para atingir o limite em 500 palavras,
00:06:43então tive que alterar o benchmark
00:06:45para conseguir encontrar o novo teto.
00:06:47Então mudei as regras do jogo, dei mais palavras para incluir.
00:06:50Dobrei de 500 para 1.000,
00:06:52dobrei de novo de 1.000 para 2.000,
00:06:55e continuei fazendo isso até atingir um vocabulário
00:06:56de 10.000 palavras, e foi aí que comecei a encontrar o teto
00:07:00do que os modelos conseguem fazer hoje em dia.
00:07:03Deem uma olhada nisso, este é o slide principal,
00:07:06estes são os resultados.
00:07:07Lembrem-se, escala logarítmica no eixo x ali.
00:07:12Então vai de 500 para 1.000, 5.000 e 10.000.
00:07:16Parece que essa escala está despencando de um penhasco,
00:07:18e na verdade isso acontece ao longo de umas 1.000 unidades.
00:07:20Mas olhem quão longe à direita essas novas curvas chegam
00:07:25antes de começarem a cair.
00:07:26Há um ano, elas desabavam com 200 a 300 instruções,
00:07:29e agora, dependendo do modelo, o limite fica mais perto de 2.000,
00:07:32e para o melhor deles, chega a 5.000 instruções
00:07:36antes de começarem a despencar.
00:07:38Portanto, em cerca de 12 meses, os modelos de ponta ficaram quase 10 vezes
00:07:41melhores em seguir instruções simultaneamente.
00:07:44Essa é a principal descoberta, e há muitas nuances
00:07:47das quais precisamos falar.
00:07:49A capacidade de rastrear 2.000 restrições nomeadas em um único prompt
00:07:53já existe.
00:07:55E isso é muito interessante porque eu acho,
00:07:57não sei se todo mundo tem essa sensação,
00:07:59mas parecia para mim que o salto do, sabe,
00:08:04GPT 5.1 para o GPT 5.5 foi meio incremental, né?
00:08:07Não parecia que tínhamos ficado 10 vezes melhores,
00:08:09mas este é um teste que realmente importa para algo muito prático,
00:08:14como o tamanho que o meu arquivo de habilidades pode ter.
00:08:17E no espaço de um ano, ficamos 10 vezes melhores.
00:08:21E o que me impressiona é que este benchmark
00:08:23tem mal um ano de idade.
00:08:25Um ano depois, 500 é um erro de arredondamento,
00:08:27e isso continua mudando debaixo dos meus pés.
00:08:29Testei o 4.7, o Opus 4.8 é ainda melhor.
00:08:35Então este gráfico já está um pouco desatualizado,
00:08:36o que é exatamente o ponto principal.
00:08:37Se você definiu suas premissas de engenharia
00:08:39sobre como os arquivos de habilidades devem funcionar,
00:08:41sobre o tamanho que o seu prompt pode ter,
00:08:44e fez isso há mais de uns seis meses,
00:08:46você está ultrapassado agora,
00:08:48e provavelmente deveria reformular a forma como faz as coisas.
00:08:52Mas há mais nessa história,
00:08:54porque a forma como os modelos falharam
00:08:59mudou drasticamente
00:09:00e a maneira como eles falham é muito importante.
00:09:02Esta parte foi uma descoberta completamente inesperada
00:09:06quando comecei a executar o experimento.
00:09:07E isso bagunçou totalmente o meu teste no início,
00:09:10porque o modo de falha antigo era sem graça.
00:09:13Eles simplesmente esqueciam instruções
00:09:14e eu conseguia medir quantas instruções
00:09:16eles tinham lembrado ou esquecido.
00:09:17Mas os novos desabam da sua própria maneira bizarra
00:09:20e totalmente característica.
00:09:22Então deixe-me apresentar como esses quatro modelos falham.
00:09:26O DeepSeek 4 é um modelo tradicional.
00:09:29Ele apenas esquece as coisas.
00:09:30Não tem nenhum drama.
00:09:31Ele começa a esquecer instruções por volta de 750 regras,
00:09:35e com 2.000, ele descarta quase metade delas.
00:09:38Então ele apenas esquece, o que francamente é o modo de falha
00:09:41em que mais confio porque é previsível.
00:09:43É muito fácil de medir.
00:09:44E os outros modelos não foram nem de longe tão cooperativos.
00:09:48O Opus 4.7 decidia repetidamente
00:09:52que o teste era perigoso.
00:09:54E o que ele fazia era se recusar
00:09:57a nível de API a concluir o teste.
00:09:59Eu não sabia que havia uma resposta de API
00:10:01que você podia receber do Claude em que ele dizia,
00:10:03não, eu poderia fazer isso, mas não vou fazer.
00:10:06Mas essa é absolutamente uma resposta a nível de API
00:10:09que o Claude suporta porque eles se importam
00:10:10tanto com a segurança, e eu comecei a receber isso
00:10:13o tempo todo.
00:10:15E o motivo de isso estar acontecendo
00:10:16é porque o Claude tem um classificador de segurança muito sensível.
00:10:19E se você colocar certas combinações de palavras,
00:10:22como digamos antraz e cianeto,
00:10:24ele decide que o pedido inteiro é perigoso
00:10:26e ele aborta.
00:10:27E se você se lembra do que o meu teste faz,
00:10:29o meu teste joga de cinco a 10.000 palavras aleatórias
00:10:33em um arquivo de instruções.
00:10:35E então minhas palavras selecionadas aleatoriamente continham
00:10:38todo tipo de coisa que parecia perigosa
00:10:39em combinação para o filtro de segurança.
00:10:41E por isso ele continuava abortando dizendo que eu estava pedindo
00:10:43para ele fazer uma bomba ou algo assim.
00:10:47Então nós tivemos que, para fazer o Claude cooperar,
00:10:52eu tive que pegar todas as minhas palavras
00:10:54e passá-las pelo filtro de segurança da OpenAI
00:10:56e filtrar todas as palavras com cara de impróprias
00:10:58para que pudesse avançar.
00:10:59Assim que forneci isso, o Claude se saiu muito bem.
00:11:03Mas o modo de falha é que o Claude tem mais probabilidade
00:11:05de decidir que o que você está fazendo é perigoso bem no início,
00:11:08sabe, com até duzentas ou trezentas instruções,
00:11:11se o que você está fazendo, sabe,
00:11:13contiver qualquer coisa relacionada a conselho médico,
00:11:15porque coisas médicas costumam ter duplo propósito.
00:11:17Elas podem ser perigosas, podem ser seguras.
00:11:20Portanto, o terceiro modo de falha foi o Gemini 3.1 Pro.
00:11:24O Gemini é extremamente sólido até 5.000 instruções.
00:11:28Ele se sai extremamente bem.
00:11:30Genuineamente um dos melhores no gráfico.
00:11:32E depois disso, as coisas ficam estranhas.
00:11:35Ele não esquece as instruções.
00:11:37Ele fica sobrecarregado com as instruções.
00:11:39O que ele tenta fazer é, ele usa tokens de raciocínio
00:11:44para ter certeza de que está seguindo
00:11:45todas as instruções de uma vez.
00:11:46E quando o número de instruções fica muito alto,
00:11:48ele usa todos os seus tokens de raciocínio.
00:11:50Ele gasta todo o seu orçamento de tokens pensando
00:11:53e depois não gera nenhuma saída.
00:11:55Ele chega tipo a nove, sabe,
00:11:57se você deu a ele 10.000 tokens,
00:11:59ele gasta 9.500 tokens em raciocínio
00:12:02e depois te dá uma resposta de 500 palavras,
00:12:04que não contém nenhum dos tokens.
00:12:07Então ele pensa tanto que se encurrala
00:12:09e fica sem espaço para responder de fato,
00:12:10o que é muito caro e totalmente inútil,
00:12:13o que combina bem com ele, não é?
00:12:19O que, sabe, eu nunca diria em voz alta.
00:12:23E finalmente vem o vencedor, que é o GPT 5.5.
00:12:26O GPT 5.5 é o melhor do lote, 99% de precisão,
00:12:29tudo isso indo até 5.000 regras.
00:12:32Mas se você forçar a barra,
00:12:33ele é de longe o mais bizarro do grupo.
00:12:35Porque ele não recusa de cara,
00:12:37ele não esquece em silêncio.
00:12:38Em vez disso, o que ele faz é ficar frustrado
00:12:41e te dizer que o teste é idiota.
00:12:45Ele começa o relatório, faz algumas,
00:12:47tipo, essa é a questão,
00:12:48ele não começa simplesmente dizendo não.
00:12:50Ele começa o relatório,
00:12:51ele começa a escrever o relatório,
00:12:52e umas 500 palavras adentro do relatório,
00:12:54ele tipo, não, isso é idiota.
00:12:55Eu não vou fazer isso.
00:12:56E aí ele te diz educadamente que isso é idiota.
00:12:58Eu não vou mais fazer isso.
00:13:00Essa foi a resposta real que ele me deu.
00:13:02Mas isso já estava um umas 5.000 palavras adentro deste relatório comercial
00:13:05que eu mandei ele gerar.
00:13:08Então ele não está errado, certo?
00:13:10Eu estava pedindo um relatório comercial coerente
00:13:12que não fosse sobre nenhum assunto específico
00:13:14e que contivesse 5.000 palavras aleatórias.
00:13:17Você tem razão, GPT.
00:13:19Isso é uma coisa idiota de se pedir.
00:13:23O que é um pedido totalmente absurdo,
00:13:25e o GPT apontou isso.
00:13:27Mas ainda conta como uma falha no teste.
00:13:29Porque o relatório semiacabado que ele te dá
00:13:31não tem a maior parte das palavras-chave,
00:13:32e também é o mais difícil de detectar.
00:13:35Porque o Claude desiste imediatamente.
00:13:36O Claude diz, não,
00:13:37eu não vou fazer isso.
00:13:39O DeepSeek faz o seu melhor.
00:13:41Mas o GPT faz o que parece ser um bom trabalho,
00:13:44a menos que você leia até o final do relatório,
00:13:46onde ele diz, não, na verdade,
00:13:47eu vou cair fora porque isso é idiota.
00:13:51Então, se você der um passo atrás e olhar para os quatro juntos,
00:13:53o DeepSeek esquece de fininho.
00:13:54O Claude fica com medo e recusa.
00:13:56O Gemini pensa tanto que fica em silêncio.
00:13:58E o GPT 5.5 termina metade do trabalho,
00:14:00e te diz que o resto está abaixo dele.
00:14:04E o ponto não é qual deles é o mais engraçado.
00:14:07Embora seja genuinamente um pouco engraçado.
00:14:09O ponto é que a pergunta “ele seguiu minhas instruções?”
00:14:12não tem mais apenas um modo de falha.
00:14:14Ele tem quatro maneiras diferentes de falhar.
00:14:16E você não consegue reconhecer essa falha a menos que saiba
00:14:19com qual modelo você está lidando e qual será o padrão de falha dele.
00:14:23Então os modelos ficaram 10 vezes melhores.
00:14:27Eles falham de formas engraçadas.
00:14:29Por que você deveria se importar quando voltar para a sua mesa?
00:14:31Porque três coisas mudaram no seu fluxo de trabalho.
00:14:34A primeira é que, há um ano, a atitude inteligente era manter cada arquivo de habilidades muito, muito curto.
00:14:39Com menos de 200 instruções, apontando então para sub-habilidades e um labirinto bizantino inteiro de arquivos de habilidades adicionais, subarquivos e coisas do tipo.
00:14:50E você comprimia suas instruções para caber em um espaço disponível muito pequeno, e você não precisa mais fazer isso.
00:14:57Seus arquivos de habilidades podem ser bem longos.
00:14:59O segundo é que, se o seu caso de uso precisa de cem regras específicas ou trezentas, você pode simplesmente colocá-las todas no comando.
00:15:06Você não precisa ficar acordado pensando quais delas o modelo ignorou em silêncio.
00:15:12E se você tem pensado na sua própria experiência de uso de modelos, provavelmente vai reconhecer isso.
00:15:21Você descobriu que tem se preocupado menos com o tamanho do seu comando, porque os modelos realmente ficaram 10 vezes melhores em segui-los.
00:15:322.000 restrições nomeadas formam um guia de estilo inteiro, certo?
00:15:35É cada regra de marca, cada aviso legal.
00:15:38Um ano atrás, você teria que dividir isso entre uma dúzia de agentes especializados e torcer para que eles se comuniquem perfeitamente.
00:15:46Mas agora você pode ignorar isso.
00:15:48Mas a terceira coisa é a mais importante.
00:15:50A pergunta costumava ser: o modelo consegue fazer isso?
00:15:53E a resposta agora é firmemente sim.
00:15:55Bem, razoavelmente firmemente.
00:15:58“Vale a pena o custo?” é a nova pergunta.
00:16:01Porque você pode incluir 10.000 palavras de... desculpe, 10.000 instruções diferentes, mas será um prompt enorme.
00:16:07Vai ser um prompt muito caro.
00:16:09Vai ser um prompt muito lento.
00:16:10Então, o que era uma barreira rígida agora virou um meio-termo: vale a pena adicionar tantas instruções se isso trouxer mais custo e latência?
00:16:19E agora, algumas ressalvas para evitar perguntas.
00:16:25Primeiro e mais importante, mencionei isso antes: esta é uma tarefa proxy. Incluir palavras aleatórias em um relatório falso é indício de que arquivos longos funcionam.
00:16:38Não é a mesma coisa que prova de que arquivos de habilidades longos funcionam.
00:16:41Além disso, os modelos encontram limites em pontos muito diferentes, de 750 a mais de 9.000, então você precisa escolher seu modelo com cuidado.
00:16:49O que nosso teste não faz é medir se o modelo raciocinou com clareza sobre um prompt gigante.
00:16:57A boa notícia é que, desde que fiz minha pesquisa há várias semanas, muita gente entrou na área e agora há boas pesquisas.
00:17:05Cientistas reais se envolveram — a Chroma fez um trabalho de degradação de contexto em 18 modelos, mostrando que a precisão em entradas longas pode cair de 30 a 50 por cento bem antes do limite da janela.
00:17:21E a parte estranha da descoberta foi que textos coerentes e bem estruturados têm mais chances de falhar do que se você colocar as instruções em ordem aleatória.
00:17:33Não sei por que isso acontece, teria que ler o relatório deles.
00:17:37Então, o modelo consegue rastrear 2.000, 5.000, possivelmente 10.000 instruções, mas não vai necessariamente raciocinar com clareza sobre elas.
00:17:46Se essas instruções entrarem em conflito, se houver tensão entre elas, ele não vai necessariamente acertar.
00:17:53E tem o outro ponto que mencionei brevemente.
00:17:56As recusas do Claude são irritantes, mas são evidentes.
00:18:00Você recebe um erro e sabe que falhou.
00:18:02O relatório educado e inacabado do GPT é bem mais perigoso porque parece uma resposta real.
00:18:07Você precisa ler tudo para notar que ele desistiu silenciosamente na metade, o que significa que não dá para confiar na saída.
00:18:13Significa que você tem que ler a resposta todas as vezes para garantir se está funcionando ou não.
00:18:17Portanto, o modelo aceitará suas 2.000 regras e entregará algo que parece, pelo menos no início, seguro e polido, mas pode ter desistido no meio.
00:18:30Como um aparte, as pessoas sempre me perguntam quanto tudo isso custou.
00:18:34Custou 209 dólares para rodar todas essas consultas.
00:18:372.300 chamadas em sete modelos deram 209 dólares.
00:18:43Acontece que pesquisas inéditas não custam muito.
00:18:46E esta é a parte da palestra em que eu dizia que você precisa verificar isso em produção porque não pode confiar que seu modelo não vai falhar em silêncio.
00:18:55Então, você sabia que eu acabaria mencionando avaliações porque trabalho na Arise e é isso que eu faço lá.
00:19:01Mas chega de propagandas da Arise.
00:19:03Vou dizer apenas uma verdade: se você está construindo uma aplicação de IA real e dando a ela tarefas difíceis,
00:19:10você vai esbarrar em um ou mais desses modos de falha com um modelo de ponta.
00:19:14E a menos que seja o Claude mandando você se danar na API, a única forma de saber que algo deu errado é monitorando suas saídas com outro LLM.
00:19:23Isso é uma avaliação, é o que a Arise faz e vou deixar por isso mesmo.
00:19:27Já mencionei que houve novas pesquisas desde que fizemos a nossa.
00:19:30Aqui está outra importante.
00:19:31Um artigo foi publicado testando 46 modelos chamado Revisiting the Reliability of Language Models in Instruction Following,
00:19:37o que, pode apostar, chamou minha atenção depois que fiz essa pesquisa por conta própria.
00:19:41E eles descobriram algo incômodo: um modelo pode gabaritar um benchmark como o nosso e ainda assim ser extremamente pouco confiável.
00:19:47Porque se você reescrever a mesma instrução de forma ligeiramente diferente, isso pode causar uma diferença radical em quão bem ele a segue.
00:19:56Então o modelo pode seguir 2.000 instruções e fazer isso muito bem.
00:20:00Mas se você colocar as mesmas 2.000 instruções em outra ordem, isso pode de repente fazer o modelo seguir muito pior.
00:20:08E como fazer isso exatamente, qual é a ordem correta das instruções para que o modelo as siga perfeitamente em vez de se confundir, ainda é objeto de pesquisa.
00:20:19Portanto, a capacidade aumentou, mas a confiabilidade ainda é um problema.
00:20:24E agora, uma pequena ostentação porque fiquei feliz: não sou cientista, fiz algumas pesquisas.
00:20:31E um monte de outros cientistas reais entraram em ação e fizeram ciência de verdade sobre a mesma questão.
00:20:36Agora há vários benchmarks que surgiram para medir essa mesma questão.
00:20:40Firebench, CCRbench, Guidebench estão todos tentando medir a mesma coisa.
00:20:44Quão bem os modelos seguem várias restrições reais e complexas ao mesmo tempo.
00:20:49E agora o campo todo está de olho nisso, então se você quer uma ciência melhor do que as minhas 10.000 palavras aleatórias, a ciência de verdade já existe.
00:20:58Isso me leva ao ponto em que deixo vocês.
00:21:00Um ano atrás, a parte difícil de escrever uma habilidade era encaixar tudo sem que o modelo se perdesse.
00:21:05Isso era um problema de compressão e o problema de compressão desapareceu.
00:21:08O modelo vai reter suas 2.000 instruções perfeitamente.
00:21:11A nova parte difícil é saber se ele realmente fez o que você disse, e isso é um problema de verificação.
00:21:16Um problema de verificação não se resolve escrevendo um prompt melhor.
00:21:20Ele se resolve verificando a saída todas as vezes, do mesmo jeito que você testaria qualquer outro código: ou seja, uma avaliação.
00:21:26O limite subiu 10 vezes em um ano.
00:21:29Então volte e verifique as suposições que você fez seis meses atrás sobre o tamanho dos seus prompts e instruções, porque elas podem já estar erradas.
00:21:41Então essa é a palestra.
00:21:42Se você quiser todo o código e todos os dados, eles estão nesta URL do GitHub.
00:21:48E este outro QR code é algo que o marketing me obrigou a inserir.
00:21:51Vamos ter uma festa para assistir à Copa do Mundo hoje às 17h.
00:21:55Vocês podem vir à nossa festa.
00:21:56Aquele link é para o Luma, que dará acesso à festa.
00:22:01Espero que esta palestra tenha trazido alguma informação inédita ou pelo menos algumas risadas, e muito obrigado pelo seu tempo e atenção.
00:22:07Obrigado.
00:22:08Obrigado.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video