Quanto tempo as suas skills podem ter antes que o seu agente esqueça o que você disse? — Laurie Voss, Arize AI

AAI Engineer
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00-
00:00:12- Tudo bem, olá a todos.
00:00:15Obrigado por virem a esta palestra deliciosamente nerd.
00:00:20Esta palestra tem um título muito longo,
00:00:22então vou dar a versão resumida logo de cara.
00:00:23Você escreve arquivos de habilidades e os enche de instruções.
00:00:27A certa altura, o modelo para de acompanhar todas elas.
00:00:31A pergunta é: onde fica esse ponto?
00:00:33A partir de quantas instruções colocadas
00:00:35nos seus arquivos de habilidades...
00:00:36E a resposta mudou muito no último ano.
00:00:40Sou a Laurie, sou chefe de relações com desenvolvedores na Arise AI.
00:00:44Numa vida anterior, co-fundei a NPM Inc.
00:00:46Então, alguns de vocês podem me conhecer dos tempos do JavaScript.
00:00:48Hoje em dia, passo muito tempo pensando em IA
00:00:50e em como testá-la.
00:00:53Alguns meses atrás, eu estava em uma conferência de IA em Miami,
00:00:55o que foi uma boa conferência.
00:00:57E eu estava assistindo a uma palestra do Dexter Horthy.
00:00:59Foi uma boa palestra.
00:01:00Não era sobre este assunto de forma alguma.
00:01:02Mas, enquanto ele dava essa palestra,
00:01:04ele mencionou, como um aparte,
00:01:06que um agente consegue seguir até cerca de 200 instruções
00:01:10antes de começar a esquecer essas instruções.
00:01:13E então ele seguiu em frente na palestra,
00:01:15sendo inteiramente um comentário paralelo.
00:01:17E ele mencionou que esse dado é de 2025,
00:01:20então as coisas podem estar melhores agora.
00:01:22E eu parei de ouvir por um segundo
00:01:25porque pensei: 200 instruções
00:01:27não são quase instruções nenhumas, certo?
00:01:31Um arquivo de habilidades decente ultrapassa 200 instruções
00:01:33quase imediatamente.
00:01:35Se o usuário disser X, faça Y,
00:01:37sempre inclua uma seção sobre Z,
00:01:39nunca use a frase W,
00:01:40cada uma delas é uma instrução separada.
00:01:42E se o modelo para silenciosamente de rastreá-las após 200,
00:01:45esse é um limite muito rígido
00:01:47para a complexidade do que você pode construir.
00:01:49Então eu queria saber de onde ele tirou esse número primeiro,
00:01:52e queria saber se era verdade.
00:01:55Então vocês conhecem a sensação de que estou falando.
00:01:57Você escreve esse arquivo de habilidades grande e bonito,
00:01:58páginas de regras, casos limite, tom, formatação.
00:02:00Você o entrega ao agente.
00:02:01Ele faz a tarefa.
00:02:03E você olha para o resultado e pensa:
00:02:05ele prestou atenção de verdade?
00:02:07Ele seguiu de fato todas essas regras?
00:02:09Ou ele só fez mais ou menos o que quis
00:02:11e me deu um simulacro aproximado
00:02:14do que eu estava esperando?
00:02:16Não dá para saber bem, ou dá?
00:02:18Falaremos mais sobre isso depois.
00:02:20E assim você vive com essa ansiedade de baixo grau
00:02:23toda vez que aperta executar.
00:02:24E esse sentimento é o que esta pesquisa aborda
00:02:27e o que estamos tentando descobrir se podemos evitar.
00:02:30Então, aqui está a minha promessa para os seus próximos 18 minutos.
00:02:33Vou mostrar de onde veio esse número 200,
00:02:36se ele ainda é verdade,
00:02:37e qual é o número real hoje,
00:02:39porque ele mudou numa ordem de grandeza.
00:02:41E então vamos conversar sobre o que isso significa
00:02:44para você levar como aprendizado.
00:02:46Qual o tamanho que suas habilidades e prompts podem ter de verdade,
00:02:49e quais mudanças você deve fazer
00:02:51no seu fluxo de trabalho como resultado.
00:02:54Portanto, o número 200 não é lenda urbana.
00:02:57Ele vem de um benchmark real chamado IfScale,
00:02:59de um artigo deste rapaz cujo nome vou pronunciar errado,
00:03:03Jaroslawicz, e coautores no ano passado.
00:03:06E o teste é maravilhosamente simples.
00:03:10É assim que o IfScale funciona.
00:03:12Você pede ao modelo para escrever um relatório de negócios,
00:03:14e você fornece uma lista de palavras específicas
00:03:16que ele tem de incluir exatamente no relatório.
00:03:19Incluir a palavra exata cliente,
00:03:20incluir a palavra exata receita,
00:03:22e assim por diante para quantas palavras você quiser.
00:03:24Cada uma delas é uma instrução que ele precisa seguir.
00:03:27E então você conta quantas dessas palavras exatas apareceram.
00:03:32Portanto, como o teste é tão simples,
00:03:34você só precisa manter dois números na cabeça.
00:03:36Um é a densidade, que chamamos de n.
00:03:38Isso é de quantas regras estamos falando ao mesmo tempo.
00:03:41E o segundo é a precisão,
00:03:42que é a porcentagem dessas regras
00:03:43que ele conseguiu seguir de fato.
00:03:46Agora você pode dizer que incluir palavras aleatórias em um relatório
00:03:50não é o mesmo que seguir instruções reais,
00:03:52e é verdade, e vamos falar sobre isso.
00:03:55Mas as palavras-chave são uma proxy.
00:03:57Incluir a palavra receita tem o mesmo formato de tarefa
00:04:01do que incluir uma seção sobre preços, certo?
00:04:02Ou nunca usar esta frase.
00:04:04É uma restrição distinta e nomeada
00:04:06que você disse ao agente que ele deve seguir.
00:04:09Se um modelo não consegue rastrear 200 palavras em um único prompt,
00:04:11ele definitivamente vai penar
00:04:13com 200 instruções mais complexas.
00:04:16Portanto, se houver diferença, ele vai se sair pior.
00:04:20Então este número é um teto.
00:04:22Este número é o máximo que você pode alcançar.
00:04:23Se você lhe der instruções mais complexas,
00:04:25o número provavelmente vai diminuir.
00:04:27E 200 é um teto realmente baixo.
00:04:30Portanto, antes de ir atrás de novos modelos,
00:04:32você precisa fazer ciência de verdade,
00:04:33o que significa que você precisa replicar o resultado antigo
00:04:36e garantir que o teto de 200 seja real.
00:04:39Então eu rodei de novo o benchmark original.
00:04:42O artigo original testou um monte de modelos,
00:04:45e os modelos nascem e morrem muito rápido.
00:04:47Então, quando eu cheguei a fazer esses testes,
00:04:50apenas três dos modelos do conjunto original
00:04:52de 10 modelos que eles usaram
00:04:54ainda estavam disponíveis por qualquer tipo de API.
00:04:57Eles eram o GPT 4.1, Claude Sonnet 4
00:04:59e Gemini 2.5 Pro.
00:05:01Esses eram modelos disponíveis há 12 meses,
00:05:03que ainda continuam disponíveis agora.
00:05:05E é por isso que testamos esses três,
00:05:07porque era o que tinha sobbrado.
00:05:08E desde que publiquei esta pesquisa pela primeira vez
00:05:11algumas semanas atrás,
00:05:12um desses três modelos foi descontinuado.
00:05:14Portanto, este era o último momento possível
00:05:16em que eu poderia ter rodado este teste.
00:05:17Então, daquela lista, já caímos para dois.
00:05:20Portanto, não se afeiçoem aos seus modelos.
00:05:22Então, aqui estão os resultados que obtivemos ao replicar
00:05:25a descoberta original do IfScale.
00:05:27Esta é a precisão no eixo vertical.
00:05:29Portanto, começa em 100% e começa a cair.
00:05:32E então o número de regras subindo na parte inferior
00:05:35em escala logarítmica.
00:05:36Então, toda vez que avança metade do caminho,
00:05:37o número de regras com o qual ele está lidando dobrou.
00:05:42Portanto, com 500 regras, você perde 30, 40, 50% delas.
00:05:46Nossas curvas corresponderam aos resultados do artigo original
00:05:49dentro do limite de ruído, então a descoberta era real.
00:05:52Há um ano, em torno de 200 a 300 regras,
00:05:55os modelos de ponta começavam a falhar.
00:05:57Esse é um teto realmente baixo.
00:06:00Então essa é a nossa base, e agora vem a parte divertida
00:06:03em que aplicamos exatamente o mesmo teste
00:06:05e o direcionamos para a ponta atual,
00:06:07ou melhor, o que era a ponta atual
00:06:09quando eu rodei este teste.
00:06:10Então eu testei o GPT 5.5, o Claude Opus 4.7,
00:06:13porque o 4.8 saiu uma semana depois de eu rodar este teste,
00:06:17o Gemini 3.1 Pro e o DeepSeek V4 Pro.
00:06:20Então dei a eles o mesmo comando, as mesmas palavras,
00:06:22exatamente tudo igual, e imediatamente esbarrei num problema,
00:06:25que é o fato de que eles gabaritaram.
00:06:27Todos tiraram 100% imediatamente neste teste,
00:06:30absolutamente nenhum erro.
00:06:34Então tínhamos criado um teste para encontrar o teto,
00:06:36e os modelos passaram direto pelo teto
00:06:37sem sequer perceberem que ele estava lá.
00:06:40E isso era um problema, porque o benchmark
00:06:42foi feito para atingir o limite em 500 palavras,
00:06:43então tive que alterar o benchmark
00:06:45para conseguir encontrar o novo teto.
00:06:47Então mudei as regras do jogo, dei mais palavras para incluir.
00:06:50Dobrei de 500 para 1.000,
00:06:52dobrei de novo de 1.000 para 2.000,
00:06:55e continuei fazendo isso até atingir um vocabulário
00:06:56de 10.000 palavras, e foi aí que comecei a encontrar o teto
00:07:00do que os modelos conseguem fazer hoje em dia.
00:07:03Deem uma olhada nisso, este é o slide principal,
00:07:06estes são os resultados.
00:07:07Lembrem-se, escala logarítmica no eixo x ali.
00:07:12Então vai de 500 para 1.000, 5.000 e 10.000.
00:07:16Parece que essa escala está despencando de um penhasco,
00:07:18e na verdade isso acontece ao longo de umas 1.000 unidades.
00:07:20Mas olhem quão longe à direita essas novas curvas chegam
00:07:25antes de começarem a cair.
00:07:26Há um ano, elas desabavam com 200 a 300 instruções,
00:07:29e agora, dependendo do modelo, o limite fica mais perto de 2.000,
00:07:32e para o melhor deles, chega a 5.000 instruções
00:07:36antes de começarem a despencar.
00:07:38Portanto, em cerca de 12 meses, os modelos de ponta ficaram quase 10 vezes
00:07:41melhores em seguir instruções simultaneamente.
00:07:44Essa é a principal descoberta, e há muitas nuances
00:07:47das quais precisamos falar.
00:07:49A capacidade de rastrear 2.000 restrições nomeadas em um único prompt
00:07:53já existe.
00:07:55E isso é muito interessante porque eu acho,
00:07:57não sei se todo mundo tem essa sensação,
00:07:59mas parecia para mim que o salto do, sabe,
00:08:04GPT 5.1 para o GPT 5.5 foi meio incremental, né?
00:08:07Não parecia que tínhamos ficado 10 vezes melhores,
00:08:09mas este é um teste que realmente importa para algo muito prático,
00:08:14como o tamanho que o meu arquivo de habilidades pode ter.
00:08:17E no espaço de um ano, ficamos 10 vezes melhores.
00:08:21E o que me impressiona é que este benchmark
00:08:23tem mal um ano de idade.
00:08:25Um ano depois, 500 é um erro de arredondamento,
00:08:27e isso continua mudando debaixo dos meus pés.
00:08:29Testei o 4.7, o Opus 4.8 é ainda melhor.
00:08:35Então este gráfico já está um pouco desatualizado,
00:08:36o que é exatamente o ponto principal.
00:08:37Se você definiu suas premissas de engenharia
00:08:39sobre como os arquivos de habilidades devem funcionar,
00:08:41sobre o tamanho que o seu prompt pode ter,
00:08:44e fez isso há mais de uns seis meses,
00:08:46você está ultrapassado agora,
00:08:48e provavelmente deveria reformular a forma como faz as coisas.
00:08:52Mas há mais nessa história,
00:08:54porque a forma como os modelos falharam
00:08:59mudou drasticamente
00:09:00e a maneira como eles falham é muito importante.
00:09:02Esta parte foi uma descoberta completamente inesperada
00:09:06quando comecei a executar o experimento.
00:09:07E isso bagunçou totalmente o meu teste no início,
00:09:10porque o modo de falha antigo era sem graça.
00:09:13Eles simplesmente esqueciam instruções
00:09:14e eu conseguia medir quantas instruções
00:09:16eles tinham lembrado ou esquecido.
00:09:17Mas os novos desabam da sua própria maneira bizarra
00:09:20e totalmente característica.
00:09:22Então deixe-me apresentar como esses quatro modelos falham.
00:09:26O DeepSeek 4 é um modelo tradicional.
00:09:29Ele apenas esquece as coisas.
00:09:30Não tem nenhum drama.
00:09:31Ele começa a esquecer instruções por volta de 750 regras,
00:09:35e com 2.000, ele descarta quase metade delas.
00:09:38Então ele apenas esquece, o que francamente é o modo de falha
00:09:41em que mais confio porque é previsível.
00:09:43É muito fácil de medir.
00:09:44E os outros modelos não foram nem de longe tão cooperativos.
00:09:48O Opus 4.7 decidia repetidamente
00:09:52que o teste era perigoso.
00:09:54E o que ele fazia era se recusar
00:09:57a nível de API a concluir o teste.
00:09:59Eu não sabia que havia uma resposta de API
00:10:01que você podia receber do Claude em que ele dizia,
00:10:03não, eu poderia fazer isso, mas não vou fazer.
00:10:06Mas essa é absolutamente uma resposta a nível de API
00:10:09que o Claude suporta porque eles se importam
00:10:10tanto com a segurança, e eu comecei a receber isso
00:10:13o tempo todo.
00:10:15E o motivo de isso estar acontecendo
00:10:16é porque o Claude tem um classificador de segurança muito sensível.
00:10:19E se você colocar certas combinações de palavras,
00:10:22como digamos antraz e cianeto,
00:10:24ele decide que o pedido inteiro é perigoso
00:10:26e ele aborta.
00:10:27E se você se lembra do que o meu teste faz,
00:10:29o meu teste joga de cinco a 10.000 palavras aleatórias
00:10:33em um arquivo de instruções.
00:10:35E então minhas palavras selecionadas aleatoriamente continham
00:10:38todo tipo de coisa que parecia perigosa
00:10:39em combinação para o filtro de segurança.
00:10:41E por isso ele continuava abortando dizendo que eu estava pedindo
00:10:43para ele fazer uma bomba ou algo assim.
00:10:47Então nós tivemos que, para fazer o Claude cooperar,
00:10:52eu tive que pegar todas as minhas palavras
00:10:54e passá-las pelo filtro de segurança da OpenAI
00:10:56e filtrar todas as palavras com cara de impróprias
00:10:58para que pudesse avançar.
00:10:59Assim que forneci isso, o Claude se saiu muito bem.
00:11:03Mas o modo de falha é que o Claude tem mais probabilidade
00:11:05de decidir que o que você está fazendo é perigoso bem no início,
00:11:08sabe, com até duzentas ou trezentas instruções,
00:11:11se o que você está fazendo, sabe,
00:11:13contiver qualquer coisa relacionada a conselho médico,
00:11:15porque coisas médicas costumam ter duplo propósito.
00:11:17Elas podem ser perigosas, podem ser seguras.
00:11:20Portanto, o terceiro modo de falha foi o Gemini 3.1 Pro.
00:11:24O Gemini é extremamente sólido até 5.000 instruções.
00:11:28Ele se sai extremamente bem.
00:11:30Genuineamente um dos melhores no gráfico.
00:11:32E depois disso, as coisas ficam estranhas.
00:11:35Ele não esquece as instruções.
00:11:37Ele fica sobrecarregado com as instruções.
00:11:39O que ele tenta fazer é, ele usa tokens de raciocínio
00:11:44para ter certeza de que está seguindo
00:11:45todas as instruções de uma vez.
00:11:46E quando o número de instruções fica muito alto,
00:11:48ele usa todos os seus tokens de raciocínio.
00:11:50Ele gasta todo o seu orçamento de tokens pensando
00:11:53e depois não gera nenhuma saída.
00:11:55Ele chega tipo a nove, sabe,
00:11:57se você deu a ele 10.000 tokens,
00:11:59ele gasta 9.500 tokens em raciocínio
00:12:02e depois te dá uma resposta de 500 palavras,
00:12:04que não contém nenhum dos tokens.
00:12:07Então ele pensa tanto que se encurrala
00:12:09e fica sem espaço para responder de fato,
00:12:10o que é muito caro e totalmente inútil,
00:12:13o que combina bem com ele, não é?
00:12:19O que, sabe, eu nunca diria em voz alta.
00:12:23E finalmente vem o vencedor, que é o GPT 5.5.
00:12:26O GPT 5.5 é o melhor do lote, 99% de precisão,
00:12:29tudo isso indo até 5.000 regras.
00:12:32Mas se você forçar a barra,
00:12:33ele é de longe o mais bizarro do grupo.
00:12:35Porque ele não recusa de cara,
00:12:37ele não esquece em silêncio.
00:12:38Em vez disso, o que ele faz é ficar frustrado
00:12:41e te dizer que o teste é idiota.
00:12:45Ele começa o relatório, faz algumas,
00:12:47tipo, essa é a questão,
00:12:48ele não começa simplesmente dizendo não.
00:12:50Ele começa o relatório,
00:12:51ele começa a escrever o relatório,
00:12:52e umas 500 palavras adentro do relatório,
00:12:54ele tipo, não, isso é idiota.
00:12:55Eu não vou fazer isso.
00:12:56E aí ele te diz educadamente que isso é idiota.
00:12:58Eu não vou mais fazer isso.
00:13:00Essa foi a resposta real que ele me deu.
00:13:02Mas isso já estava um umas 5.000 palavras adentro deste relatório comercial
00:13:05que eu mandei ele gerar.
00:13:08Então ele não está errado, certo?
00:13:10Eu estava pedindo um relatório comercial coerente
00:13:12que não fosse sobre nenhum assunto específico
00:13:14e que contivesse 5.000 palavras aleatórias.
00:13:17Você tem razão, GPT.
00:13:19Isso é uma coisa idiota de se pedir.
00:13:23O que é um pedido totalmente absurdo,
00:13:25e o GPT apontou isso.
00:13:27Mas ainda conta como uma falha no teste.
00:13:29Porque o relatório semiacabado que ele te dá
00:13:31não tem a maior parte das palavras-chave,
00:13:32e também é o mais difícil de detectar.
00:13:35Porque o Claude desiste imediatamente.
00:13:36O Claude diz, não,
00:13:37eu não vou fazer isso.
00:13:39O DeepSeek faz o seu melhor.
00:13:41Mas o GPT faz o que parece ser um bom trabalho,
00:13:44a menos que você leia até o final do relatório,
00:13:46onde ele diz, não, na verdade,
00:13:47eu vou cair fora porque isso é idiota.
00:13:51Então, se você der um passo atrás e olhar para os quatro juntos,
00:13:53o DeepSeek esquece de fininho.
00:13:54O Claude fica com medo e recusa.
00:13:56O Gemini pensa tanto que fica em silêncio.
00:13:58E o GPT 5.5 termina metade do trabalho,
00:14:00e te diz que o resto está abaixo dele.
00:14:04E o ponto não é qual deles é o mais engraçado.
00:14:07Embora seja genuinamente um pouco engraçado.
00:14:09O ponto é que a pergunta “ele seguiu minhas instruções?”
00:14:12não tem mais apenas um modo de falha.
00:14:14Ele tem quatro maneiras diferentes de falhar.
00:14:16E você não consegue reconhecer essa falha a menos que saiba
00:14:19com qual modelo você está lidando e qual será o padrão de falha dele.
00:14:23Então os modelos ficaram 10 vezes melhores.
00:14:27Eles falham de formas engraçadas.
00:14:29Por que você deveria se importar quando voltar para a sua mesa?
00:14:31Porque três coisas mudaram no seu fluxo de trabalho.
00:14:34A primeira é que, há um ano, a atitude inteligente era manter cada arquivo de habilidades muito, muito curto.
00:14:39Com menos de 200 instruções, apontando então para sub-habilidades e um labirinto bizantino inteiro de arquivos de habilidades adicionais, subarquivos e coisas do tipo.
00:14:50E você comprimia suas instruções para caber em um espaço disponível muito pequeno, e você não precisa mais fazer isso.
00:14:57Seus arquivos de habilidades podem ser bem longos.
00:14:59O segundo é que, se o seu caso de uso precisa de cem regras específicas ou trezentas, você pode simplesmente colocá-las todas no comando.
00:15:06Você não precisa ficar acordado pensando quais delas o modelo ignorou em silêncio.
00:15:12E se você tem pensado na sua própria experiência de uso de modelos, provavelmente vai reconhecer isso.
00:15:21Você descobriu que tem se preocupado menos com o tamanho do seu comando, porque os modelos realmente ficaram 10 vezes melhores em segui-los.
00:15:322.000 restrições nomeadas formam um guia de estilo inteiro, certo?
00:15:35É cada regra de marca, cada aviso legal.
00:15:38Um ano atrás, você teria que dividir isso entre uma dúzia de agentes especializados e torcer para que eles se comuniquem perfeitamente.
00:15:46Mas agora você pode ignorar isso.
00:15:48Mas a terceira coisa é a mais importante.
00:15:50A pergunta costumava ser: o modelo consegue fazer isso?
00:15:53E a resposta agora é firmemente sim.
00:15:55Bem, razoavelmente firmemente.
00:15:58“Vale a pena o custo?” é a nova pergunta.
00:16:01Porque você pode incluir 10.000 palavras de... desculpe, 10.000 instruções diferentes, mas será um prompt enorme.
00:16:07Vai ser um prompt muito caro.
00:16:09Vai ser um prompt muito lento.
00:16:10Então, o que era uma barreira rígida agora virou um meio-termo: vale a pena adicionar tantas instruções se isso trouxer mais custo e latência?
00:16:19E agora, algumas ressalvas para evitar perguntas.
00:16:25Primeiro e mais importante, mencionei isso antes: esta é uma tarefa proxy. Incluir palavras aleatórias em um relatório falso é indício de que arquivos longos funcionam.
00:16:38Não é a mesma coisa que prova de que arquivos de habilidades longos funcionam.
00:16:41Além disso, os modelos encontram limites em pontos muito diferentes, de 750 a mais de 9.000, então você precisa escolher seu modelo com cuidado.
00:16:49O que nosso teste não faz é medir se o modelo raciocinou com clareza sobre um prompt gigante.
00:16:57A boa notícia é que, desde que fiz minha pesquisa há várias semanas, muita gente entrou na área e agora há boas pesquisas.
00:17:05Cientistas reais se envolveram — a Chroma fez um trabalho de degradação de contexto em 18 modelos, mostrando que a precisão em entradas longas pode cair de 30 a 50 por cento bem antes do limite da janela.
00:17:21E a parte estranha da descoberta foi que textos coerentes e bem estruturados têm mais chances de falhar do que se você colocar as instruções em ordem aleatória.
00:17:33Não sei por que isso acontece, teria que ler o relatório deles.
00:17:37Então, o modelo consegue rastrear 2.000, 5.000, possivelmente 10.000 instruções, mas não vai necessariamente raciocinar com clareza sobre elas.
00:17:46Se essas instruções entrarem em conflito, se houver tensão entre elas, ele não vai necessariamente acertar.
00:17:53E tem o outro ponto que mencionei brevemente.
00:17:56As recusas do Claude são irritantes, mas são evidentes.
00:18:00Você recebe um erro e sabe que falhou.
00:18:02O relatório educado e inacabado do GPT é bem mais perigoso porque parece uma resposta real.
00:18:07Você precisa ler tudo para notar que ele desistiu silenciosamente na metade, o que significa que não dá para confiar na saída.
00:18:13Significa que você tem que ler a resposta todas as vezes para garantir se está funcionando ou não.
00:18:17Portanto, o modelo aceitará suas 2.000 regras e entregará algo que parece, pelo menos no início, seguro e polido, mas pode ter desistido no meio.
00:18:30Como um aparte, as pessoas sempre me perguntam quanto tudo isso custou.
00:18:34Custou 209 dólares para rodar todas essas consultas.
00:18:372.300 chamadas em sete modelos deram 209 dólares.
00:18:43Acontece que pesquisas inéditas não custam muito.
00:18:46E esta é a parte da palestra em que eu dizia que você precisa verificar isso em produção porque não pode confiar que seu modelo não vai falhar em silêncio.
00:18:55Então, você sabia que eu acabaria mencionando avaliações porque trabalho na Arise e é isso que eu faço lá.
00:19:01Mas chega de propagandas da Arise.
00:19:03Vou dizer apenas uma verdade: se você está construindo uma aplicação de IA real e dando a ela tarefas difíceis,
00:19:10você vai esbarrar em um ou mais desses modos de falha com um modelo de ponta.
00:19:14E a menos que seja o Claude mandando você se danar na API, a única forma de saber que algo deu errado é monitorando suas saídas com outro LLM.
00:19:23Isso é uma avaliação, é o que a Arise faz e vou deixar por isso mesmo.
00:19:27Já mencionei que houve novas pesquisas desde que fizemos a nossa.
00:19:30Aqui está outra importante.
00:19:31Um artigo foi publicado testando 46 modelos chamado Revisiting the Reliability of Language Models in Instruction Following,
00:19:37o que, pode apostar, chamou minha atenção depois que fiz essa pesquisa por conta própria.
00:19:41E eles descobriram algo incômodo: um modelo pode gabaritar um benchmark como o nosso e ainda assim ser extremamente pouco confiável.
00:19:47Porque se você reescrever a mesma instrução de forma ligeiramente diferente, isso pode causar uma diferença radical em quão bem ele a segue.
00:19:56Então o modelo pode seguir 2.000 instruções e fazer isso muito bem.
00:20:00Mas se você colocar as mesmas 2.000 instruções em outra ordem, isso pode de repente fazer o modelo seguir muito pior.
00:20:08E como fazer isso exatamente, qual é a ordem correta das instruções para que o modelo as siga perfeitamente em vez de se confundir, ainda é objeto de pesquisa.
00:20:19Portanto, a capacidade aumentou, mas a confiabilidade ainda é um problema.
00:20:24E agora, uma pequena ostentação porque fiquei feliz: não sou cientista, fiz algumas pesquisas.
00:20:31E um monte de outros cientistas reais entraram em ação e fizeram ciência de verdade sobre a mesma questão.
00:20:36Agora há vários benchmarks que surgiram para medir essa mesma questão.
00:20:40Firebench, CCRbench, Guidebench estão todos tentando medir a mesma coisa.
00:20:44Quão bem os modelos seguem várias restrições reais e complexas ao mesmo tempo.
00:20:49E agora o campo todo está de olho nisso, então se você quer uma ciência melhor do que as minhas 10.000 palavras aleatórias, a ciência de verdade já existe.
00:20:58Isso me leva ao ponto em que deixo vocês.
00:21:00Um ano atrás, a parte difícil de escrever uma habilidade era encaixar tudo sem que o modelo se perdesse.
00:21:05Isso era um problema de compressão e o problema de compressão desapareceu.
00:21:08O modelo vai reter suas 2.000 instruções perfeitamente.
00:21:11A nova parte difícil é saber se ele realmente fez o que você disse, e isso é um problema de verificação.
00:21:16Um problema de verificação não se resolve escrevendo um prompt melhor.
00:21:20Ele se resolve verificando a saída todas as vezes, do mesmo jeito que você testaria qualquer outro código: ou seja, uma avaliação.
00:21:26O limite subiu 10 vezes em um ano.
00:21:29Então volte e verifique as suposições que você fez seis meses atrás sobre o tamanho dos seus prompts e instruções, porque elas podem já estar erradas.
00:21:41Então essa é a palestra.
00:21:42Se você quiser todo o código e todos os dados, eles estão nesta URL do GitHub.
00:21:48E este outro QR code é algo que o marketing me obrigou a inserir.
00:21:51Vamos ter uma festa para assistir à Copa do Mundo hoje às 17h.
00:21:55Vocês podem vir à nossa festa.
00:21:56Aquele link é para o Luma, que dará acesso à festa.
00:22:01Espero que esta palestra tenha trazido alguma informação inédita ou pelo menos algumas risadas, e muito obrigado pelo seu tempo e atenção.
00:22:07Obrigado.
00:22:08Obrigado.

설명

Laurie Voss reran a year old benchmark and the models walked straight through its ceiling without noticing it was there. IFScale asks a model to write a business report containing a list of exact words, then counts how many actually appear. A year ago frontier models started dropping instructions somewhere around 200 to 300, which is a hard limit on how much you can put in a skills file. Voss, head of developer relations at Arize AI and a cofounder of npm, first replicated that result on the three models from the original paper still reachable by API, then pointed the same test at the current frontier. They scored 100 percent immediately. He had to raise the benchmark from 500 words to 10,000 before anything broke at all. The boundary now sits near 2,000 instructions, and for the best model closer to 5,000, roughly a tenfold gain in twelve months. The stranger finding is that the models no longer fail the same way. One simply forgets, shedding nearly half its rules by 2,000. One refuses at the API level, because a pile of random words trips its safety classifier. One spends its whole thinking budget verifying instructions and leaves no room to answer. The last writes five thousand words of the report, decides the request is stupid, says so politely, and stops, which reads like a finished answer unless you get to the end. Voss argues this moves the work: fitting rules into a small budget was a compression problem and it is gone, while knowing whether the model obeyed is a verification problem that only checking outputs solves. The whole study cost 29 dollars. Speaker info: - https://x.com/seldo - https://www.linkedin.com/in/seldo/ - https://seldo.com Timestamps: 0:00 - The 200 instruction ceiling and where it came from 1:49 - Not knowing whether it followed your rules 2:58 - How the IFScale benchmark works 4:19 - Replicating last year's result 6:12 - Pointing the same test at current models 7:07 - The headline, a tenfold jump in a year 9:01 - Four models, four different ways to fail 14:27 - What this changes in your workflow 16:29 - Caveats, and what the test does not prove 19:32 - Capacity went up, reliability did not 21:06 - Compression solved, verification remains

커뮤니티 글

아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!

이 영상에 대해 글쓰기