Transcript
00:00:00Então o Fable 5.1 chegou, e ele é melhor, mais barato,
00:00:02e hoje eu vou te contar
00:00:04tudo o que você precisa saber sobre ele.
00:00:05Primeiro, vamos falar de preço.
00:00:07O Fable 5.1 vai custar cerca de 25% a menos que o Fable 5,
00:00:11e isso porque eles estão reduzindo o preço
00:00:13das leituras em cache.
00:00:14Isso é enorme se você faz muito trabalho agêntico de longa duração,
00:00:19e eles destacam isso especificamente,
00:00:21e a sua redução de custo pode chegar a 45%
00:00:23nesses casos em que você está realizando trabalhos
00:00:24que envolvem milhares e milhares de tokens,
00:00:27e você está trabalhando com comprimentos de janela de contexto
00:00:28de 50, 60, 70%.
00:00:30Eles estão atualizando a política de retenção de dados,
00:00:32introduzindo isso gradualmente para os clientes corporativos,
00:00:34e em relação às salvaguardas,
00:00:35eles estão reduzindo os falsos positivos,
00:00:37o que era meio irritante
00:00:38no Fable 5 original,
00:00:40porque se você fizesse perguntas
00:00:41relacionadas a coisas como segurança cibernética,
00:00:43você era bloqueado constantemente,
00:00:44e agora há uma chance 60% menor
00:00:47de ocorrer um falso positivo.
00:00:49Agora vamos dar uma olhada nos benchmarks.
00:00:50Em termos gerais, ele supera o Fable 5, o Opus 5
00:00:53e o GPT 5.6 em literalmente tudo.
00:00:56Agora, alguns dos saltos são bem significativos.
00:00:58Quando olhamos para pesquisa científica agêntica,
00:01:00o resultado é o dobro do Fable 5.
00:01:03A programação agêntica também dá um salto enorme.
00:01:05Estamos indo de 42% no Fable 5 para 55,8 no Fable 5.1.
00:01:09Eu me lembro quando vimos os benchmarks do Opus 5,
00:01:11ficamos bastante impressionados com o que o Opus 5 conseguia nos entregar
00:01:14em termos de números brutos.
00:01:16Na realidade, acho que a maioria das pessoas ainda prefere o Fable 5 ao Opus 5,
00:01:19mas sinto que a comparação entre o Fable 5 e o 5.1
00:01:23é provavelmente um pouco mais precisa
00:01:24em termos de qual será a sensação
00:01:26quando você estiver realmente usando.
00:01:28Além disso, a maioria dos aumentos nos benchmarks
00:01:29é relativamente incremental.
00:01:31Estamos falando de alguns pontos percentuais aqui e ali,
00:01:32sendo a exceção os fluxos de trabalho empresariais
00:01:34usando o benchmark de automação.
00:01:37Agora, o que importa não é apenas o benchmark em si,
00:01:39mas quanto estamos pagando por esses tipos de pontuações,
00:01:41e que tipo de mudanças nós vemos
00:01:43quando mexemos no nível de esforço?
00:01:44Porque isso é sempre muito interessante de observar,
00:01:46já que muitas vezes, quando olhamos para níveis de esforço
00:01:48extra alto ou máximo,
00:01:49nós realmente não temos um retorno tão compensatório
00:01:51em comparação com o alto ou mesmo o médio.
00:01:53Então o que temos aqui é o Terminal Bench 4.0.
00:01:56Temos o Mythos 5.1 aqui em cima,
00:01:59o Fable 5.1 no meio,
00:02:00e depois o Mythos 5 aqui embaixo,
00:02:02e você pode imaginar que o Fable 5 fica ligeiramente abaixo do Mythos.
00:02:05Portanto, o Fable 5.1 e o Mythos 5.1,
00:02:07obviamente representam um grande salto em comparação ao Mythos 5,
00:02:10e ele é mais barato.
00:02:12E o mais legal é quando olhamos para algo
00:02:13como o nível alto, por exemplo,
00:02:15que é onde eu acho que a maioria das pessoas fica,
00:02:16muitas vezes eu uso o nível médio
00:02:17quando se trata dos meus casos de uso do Fable,
00:02:20você basicamente,
00:02:20se olharmos para o médio,
00:02:21estamos igualando a saída máxima do Mythos 5,
00:02:25mas em vez de custar US$ 26,
00:02:27ele custaria US$ 7,80.
00:02:30E quando passamos para o alto,
00:02:32e comparamos o alto com, digamos, o máximo,
00:02:34você está olhando apenas para uma,
00:02:35o quê, mudança de 6% em termos de saída,
00:02:38mas com US$ 19,50 versus US$ 10,50.
00:02:42Então, o que é realmente legal nesses novos modelos
00:02:43é que você pode obter um desempenho extremamente alto
00:02:45nesses níveis de esforço medianos
00:02:47e realmente economizar nos custos.
00:02:50E vemos o mesmo padrão se repetir
00:02:52nesses outros benchmarks, certo?
00:02:53Este é o Humanity's Last Exam.
00:02:55Novamente, não vemos um aumento enorme
00:02:57quando saltamos do alto para o máximo,
00:02:59mas ainda assim temos um desempenho muito bom
00:03:00a um custo bastante razoável
00:03:02nessas configurações de nível intermediário.
00:03:04A única exceção é quando olhamos para
00:03:05programação agêntica no Cursor Bench,
00:03:07com o Fable 5.1,
00:03:08nós vemos um salto bem alto do alto para o extra alto,
00:03:11mas novamente, entre o extra alto e o máximo,
00:03:13não é tanta coisa.
00:03:14Mas, sabe, se eu estou no alto,
00:03:15no Fable 5.1,
00:03:17é o mesmo que estar no extra alto
00:03:18com o Fable 5,
00:03:20e custando menos da metade.
00:03:22Portanto, há uma enorme economia de preço aqui,
00:03:24mesmo que você não seja alguém
00:03:25que necessariamente faz um trabalho terrivelmente complexo.
00:03:27Se você é apenas, entre aspas,
00:03:29o seu desenvolvedor solo comum,
00:03:30tipo, seus problemas não são tão complicados,
00:03:32mas você gosta de usar esses modelos de ponta,
00:03:33agora você tem a capacidade
00:03:34de simplesmente reduzir o nível de esforço
00:03:36e continuar fazendo basicamente
00:03:37o que você fazia antes,
00:03:38novamente, pela metade do custo,
00:03:40o que é impressionante.
00:03:41Agora, a pesquisa científica
00:03:42sempre foi um grande argumento de venda
00:03:44quando se trata dos modelos Fable e Mythos.
00:03:46E com o lançamento do 5.1,
00:03:48não há mudanças nisso.
00:03:49Eles falam muito sobre design molecular,
00:03:51análise computacional e modelagem,
00:03:53bem como biologia computacional.
00:03:55Novamente, esses são problemas mais específicos
00:03:57que algumas pessoas estão resolvendo,
00:03:58mas é sempre interessante
00:04:00ver o que está acontecendo nessas áreas
00:04:01em comparação ao padrão,
00:04:03como isso se sai
00:04:03neste benchmark de programação agêntica.
00:04:05E como mencionei na introdução,
00:04:07houve algumas mudanças
00:04:08quando se trata de segurança,
00:04:09proteção
00:04:09e alinhamento.
00:04:11No geral,
00:04:12menos falsos positivos.
00:04:13Você pode fazer mais perguntas a ele
00:04:14relacionadas a coisas como segurança cibernética
00:04:15e ele é inteligente o suficiente
00:04:16para não apenas entrar em pânico
00:04:18e te mandar para o Opus
00:04:19de jeito nenhum.
00:04:20Se você quiser ir muito a fundo,
00:04:21bem a fundo nisso,
00:04:21eles têm o cartão do sistema deles
00:04:23que você sempre pode dar uma olhada.
00:04:24Isso tem, sabe,
00:04:25várias centenas de páginas de conteúdo,
00:04:27212 para ser exato,
00:04:28mas eles nos dão um bom resumo aqui.
00:04:30Mas tudo o que você precisa se importar
00:04:31é que essas barreiras de proteção
00:04:32são mais precisas,
00:04:33então é menos provável
00:04:34que sinalizem conteúdo benigno
00:04:35e simplesmente te redirecionem
00:04:36para um modelo inferior.
00:04:37Específicamente para perguntas sobre segurança cibernética,
00:04:40os usuários do Cloud Code
00:04:40podem esperar uma média
00:04:41de 60% a menos de intervenções
00:04:43por sessão
00:04:44provenientes dessas salvaguardas,
00:04:46o que é ótimo
00:04:46se você estiver trabalhando
00:04:47em qualquer tipo de aplicativo
00:04:48onde precise fazer perguntas
00:04:49sobre as melhores práticas de segurança cibernética
00:04:51para o seu caso de uso específico.
00:04:53Eles têm
00:04:53um parágrafo interessante aqui
00:04:54falando sobre
00:04:55mecanismos antidestilação,
00:04:57que é um método
00:04:58que consiste essencialmente em extrair
00:04:59o melhor do Fable 5
00:05:01e do Fable 5.1
00:05:02para usar em outros modelos.
00:05:03Este é um tema
00:05:04bastante discutido
00:05:05no que diz respeito
00:05:06aos modelos de código aberto.
00:05:07Você provavelmente já ouviu falar
00:05:08de todos esses
00:05:08ótimos modelos de código aberto
00:05:09que estão surgindo,
00:05:10e sem dúvida
00:05:11eles continuarão a surgir
00:05:13à medida que forem destilados
00:05:14a partir desses modelos de ponta.
00:05:15Portanto, este é o tipo
00:05:17de discussão
00:05:17que vale a pena
00:05:18acompanhar de perto.
00:05:18Isso não afeta diretamente você,
00:05:20o usuário final,
00:05:21mas é, sabe,
00:05:22como se fosse essa coisa em nível de meta,
00:05:23onde temos todos esses
00:05:24modelos de código aberto
00:05:25vindo da China,
00:05:26enquanto muitas das empresas
00:05:26de ponta
00:05:27ficam nos EUA,
00:05:28e há sempre
00:05:29esse papo, sabe,
00:05:31de que todos esses
00:05:32modelos de código aberto
00:05:32estão na verdade apenas extraindo
00:05:33dados de ferramentas como
00:05:35Opus e Fable.
00:05:36Eles dão um exemplo
00:05:37de como isso funciona,
00:05:38onde novas contas de API
00:05:39não podem editar
00:05:40o contexto anterior do Claude
00:05:42para essencialmente extrair
00:05:43a forma como o Claude
00:05:44está pensando
00:05:44e chegando
00:05:45às suas respostas.
00:05:46E novamente,
00:05:46isso é específico
00:05:47para contas novas,
00:05:48então se você já tem uma,
00:05:48como eu disse,
00:05:49isso não vai te afetar.
00:05:50Agora, em termos de custo
00:05:51e disponibilidade,
00:05:52disponibilidade,
00:05:52está disponível
00:05:53em todo lugar agora.
00:05:54Custo.
00:05:55Por token,
00:05:56se você analisar,
00:05:56é exatamente o mesmo
00:05:58que o Fable 5.
00:05:58Estamos falando de 10 dólares
00:05:59por milhão de tokens de entrada
00:06:00e 50 dólares por milhão
00:06:02de tokens de saída,
00:06:03mas na realidade,
00:06:04quando você realmente usa isso
00:06:05em termos de,
00:06:06hey, estou colocando
00:06:07para fazer esta tarefa,
00:06:08vai custar menos
00:06:09e vai custar menos
00:06:10por causa das leituras em cache.
00:06:12Agora, se você faz ideia
00:06:12do que seja o cache de prompt,
00:06:14você pode ver o vídeo
00:06:14que fiz na semana passada
00:06:16onde falo sobre isso.
00:06:18Basicamente,
00:06:18isso é enorme
00:06:19se você é alguém
00:06:20que realiza
00:06:20tarefas agênticas de longa duração.
00:06:23Então você tem
00:06:23sessões muito grandes,
00:06:25toneladas de contexto,
00:06:26e você o está usando
00:06:27de forma contínua.
00:06:28Você não pede para ele
00:06:29fazer algo
00:06:29e só volta no dia seguinte.
00:06:30Você fica conversando
00:06:31e conversando e conversando
00:06:32com ele.
00:06:32Portanto, essas leituras em cache
00:06:33custam 75% a menos,
00:06:35o que representa uma mudança monumental,
00:06:37e é isso que resulta
00:06:39nesses custos mais baixos.
00:06:40E este gráfico deixa
00:06:41isso bem claro.
00:06:42Isso pode ser aproximadamente
00:06:4225% menor em termos
00:06:44de custos em tarefas normais,
00:06:45mas, novamente,
00:06:46cargas de trabalho altamente agênticas
00:06:47chegam a ser até 45% mais baratas.
00:06:49É realmente empolgante
00:06:49receber uma atualização
00:06:50para o modelo Fable.
00:06:51Eu adorei o Fable 5,
00:06:53mas achei mais ou menos
00:06:53quando se tratou do Opus 5,
00:06:54mas para aqueles de vocês
00:06:55que têm experiência prática
00:06:56com o Fable,
00:06:57acho que concordam plenamente
00:06:58que há
00:06:59uma mudança significativa
00:07:01no que este modelo nos traz
00:07:02em comparação a tudo o mais
00:07:03que recebimos
00:07:03da Anthropic.
00:07:04Portanto, ter algo
00:07:05que seja melhor
00:07:06e mais barato,
00:07:07e sobre o qual precisamos nos preocupar menos
00:07:09em termos de diretrizes de segurança,
00:07:10é excelente.
00:07:11Então, não deixe de conferir.
00:07:12Me diga
00:07:13o que você acha.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video