O Sonnet 5 já está disponível e compete com o Opus

CChase AI
Computing/SoftwareSmall Business/StartupsManagement

Transcript

00:00:00A Anthropic acabou de lançar o Sonnet 5, então vamos ver tudo o que você precisa saber sobre ele.
00:00:04Vamos começar pelos benchmarks. E lembre-se, o Sonnet 5 é um modelo menos potente,
00:00:08menos caro do que coisas como o Opus e definitivamente o Fable. Não tínhamos uma atualização aqui
00:00:13desde a versão 4.6. Agora, comparando o 5 com o 4.6, vemos um enorme salto em termos de codificação agentica,
00:00:21raciocínio multidisciplinar, uso de computador e trabalho de conhecimento. Então, uma melhoria geral
00:00:26em toda a linha. Agora, quando comparamos com o Opus 4.8, a questão não é se ele chega perto, mas o quanto
00:00:32de desempenho perdemos? E, honestamente, não é tanta perda assim. Na verdade, ele apresenta números melhores
00:00:39em trabalho de conhecimento, o que é meio louco. O uso de computador está apenas 2% atrás, e está apenas
00:00:442% atrás na codificação agentica, e apenas alguns pontos percentuais atrás em raciocínio
00:00:49multidisciplinar. A maior diferença está aqui no Sweebench Pro, com 63% contra 69%.
00:00:56Mas ei, Terminal Bench 2.1, 80% contra 82%. Então não é uma grande diferença. E esta discussão
00:01:03sobre desempenho deve ser feita no contexto dos preços. Lembre-se, Fable 5, Mythos 5,
00:01:08estamos olhando para US$ 10 por tokens de entrada, o que é o dobro do Opus. O Opus custa US$ 5 por milhão de tokens de entrada.
00:01:16E para saída, custa US$ 25. Então US$ 5 e US$ 25. Para o Sonnet 5, estamos olhando para US$ 2. Então, apenas 40% do custo do
00:01:26Opus em tokens de entrada. E para saída, são US$ 10. Então, significativamente mais barato, menos da metade do custo do
00:01:34Opus. Ainda assim, quando olhamos os números, é bem próximo. Então, isso é uma ótima notícia se você é alguém que
00:01:40não está realizando tarefas de ponta com IA, mas sim tarefas mais rotineiras, e você
00:01:46ainda quer potência, bem, o Sonnet 5 agora está preenchendo essa lacuna. Agora vamos olhar para esses gráficos que vão
00:01:51além dos benchmarks. Aqui estamos olhando para o desempenho de busca agentica por nível de esforço, comparando
00:01:55Opus 4.8 com Sonnet 5 e Sonnet 4.6. Então, logo de cara, acho que você vai notar aqui, Sonnet 5, existe uma enorme
00:02:04lacuna nas taxas de sucesso conforme avançamos entre os níveis de esforço. No nível baixo, ele faz 55%. Mas se olharmos para
00:02:13baixo no Sonnet 4.6, o baixo no Sonnet 4.6 na verdade tem um desempenho melhor. No entanto, em termos de custo, é bem menor.
00:02:19Passamos para o médio, essencialmente estamos obtendo o mesmo desempenho que vimos com o Sonnet 4.6,
00:02:25mas com um desconto significativo. E só quando passamos para níveis de esforço alto é que começamos a superar
00:02:34o Sonnet 4.6. Mas, a essa altura, estamos obtendo um desempenho melhor que o do Sonnet 4.6, mas a um custo que
00:02:41teria sido no nível de esforço baixo para o Sonnet 4.6. Então esse tipo de distinção de nível de esforço,
00:02:49acho muito importante porque não é apenas: ei, o Sonnet 5 é melhor em toda a linha, onde o baixo
00:02:53no 5 é necessariamente melhor que o baixo no 4.6. Baixo no Sonnet 5 significa apenas que vai ser super
00:02:59barato. Mas em termos de obter um desempenho de nível mais alto, o que vimos no passado,
00:03:03provavelmente precisamos fazer algo que esteja na faixa alta. Dito isto, quando estamos na faixa
00:03:08alta com o Sonnet 5, estamos pagando praticamente o mesmo valor que pagaríamos com o Opus. O Opus no médio
00:03:14e alto custa o mesmo que o Sonnet no alto, mas estamos obtendo uma taxa de sucesso melhor. Então isso traz
00:03:21muita nuance a essa discussão. Precisamos usar o Sonnet 5 em vez do Opus 4.8 e coisas como
00:03:27Busca Agentica? Acho que realmente depende. Se for um problema mais complexo, no final, o Opus 4.8 pode ser
00:03:33mais barato só porque é tão eficiente em termos de tokens e o Sonnet simplesmente não é a ferramenta certa para o trabalho.
00:03:38No entanto, quando estamos realizando tarefas que não são tão desafiadoras para esses modelos de IA, talvez
00:03:44não faça sentido usar o Opus 4.8. É aí que trazemos o Sonnet 5. Então, acho que este
00:03:49é um lugar interessante onde estamos agora, onde é meio que caso a caso qual modelo
00:03:54você deve usar. Agora, aqui está outro exemplo interessante quando vemos o uso de computador agentico. Agora, de modo geral,
00:03:58em sua maior parte, o Sonnet 5 está vencendo o Sonnet 4.6 e fazendo isso a um custo bem baixo. Então
00:04:05Busca Agentica, definitivamente esse não foi o caso, mas uso de computador agentico, de repente,
00:04:09sempre usaríamos o Sonnet 5 em vez do 4.6. E novamente, isso volta à ideia de que agora é caso a caso
00:04:14qual modelo você deve usar. Curiosamente, porém, olhe para o Opus. O Opus High tem um desempenho
00:04:20melhor que o Sonnet 5 no máximo e é mais barato. Então, quero dizer, você olha para isso e pensa:
00:04:26uau, tipo, o Opus é realmente muito eficiente para o que faz. Sem mencionar que ele meio que atinge esses níveis mais altos
00:04:30que o Sonnet simplesmente não consegue alcançar. Então coisas para pensar, honestamente, só porque o custo por milhão
00:04:36de tokens é mais barato com o Opus, haverá muitos casos em que o Opus ainda será o melhor. Agora, eu não quero fazer
00:04:41um lançamento de modelo da Anthropic sem falar sobre comportamento desalinhado. Podemos ver que é uma melhoria
00:04:45com o Sonnet 5, mas ainda abaixo do que esperaríamos com o Opus 4.8 e Mythos Preview. E em termos de
00:04:50exploits e toda essa questão de cibersegurança que deixou o Mythos praticamente bloqueado, isso não é um
00:04:55problema ou algo com que você precise se preocupar com a classe Sonnet. Então, no geral, eu não daria muita
00:04:59atenção a esses benchmarks, para ser honesto. Esse tipo de benchmark, esse tipo de gráfico me deixa muito
00:05:05mais receoso porque a questão não acho que seja Sonnet 5 versus 4.6. Praticamente sempre vamos
00:05:11usar o Sonnet 5. É Sonnet 5 versus Opus 4.8. E a pergunta é: o Opus é realmente mais barato? E
00:05:18eu adoraria ver mais testes e mais coisas da Anthropic que meio que expliquem, aqui está aquele
00:05:24tipo de linha de demarcação entre, ok, o Sonnet 5 pode ir muito bem nisso e é mais barato que
00:05:29o Opus versus, ei, isso agora é uma tarefa mais complicada. O Opus será realmente mais eficiente que
00:05:34o Sonnet para completar isso. Então coisas para pensar, definitivamente algo bom de se ter. Acho que no geral, para tarefas de
00:05:40nível inferior, o Sonnet será uma bênção, porque para aqueles de nós que usam tokens de API para, você sabe,
00:05:46nossos aplicativos ou coisas que não estão no ecossistema do plano Claude Max, é meio difícil usar
00:05:51a Anthropic. É simplesmente caro demais. E eu venho dizendo às pessoas há muito tempo, tipo, apenas dêem uma olhada
00:05:55na OpenAI, sabe, olhem para alguns dos modelos mini deles, porque isso costuma ser mais que o suficiente para o trabalho de muitas
00:05:59pessoas. Bem, agora temos uma opção de nível intermediário com a Anthropic, o que é muito bom
00:06:05de se ter. Então é onde vou deixar vocês hoje. Isso está disponível em todos os lugares. Acho
00:06:09que será muita tentativa e erro descobrir onde isso faz mais sentido. Então me digam
00:06:13o que vocês acharam. Não deixem de conferir o Chase AI Plus se quiserem colocar as mãos na minha Masterclass
00:06:17de Programação Claude e vejo vocês por aí.

Key Takeaway

O Sonnet 5 oferece uma alternativa de custo reduzido, custando menos da metade do preço do Opus, sendo ideal para tarefas de nível intermediário, embora o Opus ainda supere o modelo em cenários de alta complexidade.

Highlights

  • O Sonnet 5 apresenta um custo de tokens de entrada de US$ 2 por milhão, representando 40% do valor cobrado pelo modelo Opus.

  • O custo de saída para o Sonnet 5 é de US$ 10 por milhão de tokens, menos da metade do preço do Opus.

  • Em tarefas de codificação agentica e uso de computador, o Sonnet 5 mantém um desempenho dentro de 2% de diferença em relação ao Opus 4.8.

  • O desempenho do Sonnet 5 em busca agentica escala conforme o nível de esforço, exigindo configurações de alto esforço para superar o Sonnet 4.6.

  • O Opus 4.8 permanece mais eficiente em termos de custo-benefício para problemas complexos, apesar do custo unitário maior por token.

Timeline

Desempenho e Benchmarks do Sonnet 5

  • O Sonnet 5 supera o antecessor 4.6 em codificação agentica, raciocínio multidisciplinar e trabalho de conhecimento.
  • A diferença de desempenho entre o Sonnet 5 e o Opus 4.8 é marginal em métricas como Terminal Bench 2.1 e codificação agentica.
  • O Sweebench Pro mostra uma diferença de 63% para o Sonnet 5 contra 69% do Opus.

A atualização para a versão 5 do Sonnet traz melhorias abrangentes em relação à versão 4.6. Embora o Opus 4.8 ainda mantenha a liderança em tarefas de ponta, a lacuna de desempenho é surpreendentemente pequena, com apenas 2% de diferença em categorias críticas como uso de computador e codificação.

Análise de Custos e Eficiência Operacional

  • O custo de tokens de entrada do Sonnet 5 é de US$ 2, comparado aos US$ 5 do Opus.
  • Tokens de saída para o Sonnet 5 custam US$ 10, enquanto o Opus custa US$ 25 por milhão.
  • O Sonnet 5 preenche a lacuna de potência para tarefas rotineiras que não exigem o desempenho máximo do Opus.

A estratégia de preços do Sonnet 5 posiciona o modelo como uma opção econômica. O custo por milhão de tokens de entrada representa apenas 40% do valor do Opus, tornando-o atraente para aplicações que demandam alta frequência de uso sem a complexidade máxima.

Comportamento em Busca e Uso de Computador

  • A taxa de sucesso do Sonnet 5 em busca agentica depende fortemente do nível de esforço aplicado.
  • O Sonnet 5 supera o Sonnet 4.6 no uso de computador agentico em quase todos os cenários.
  • O Opus demonstra maior eficiência em tarefas complexas, mantendo taxas de sucesso superiores a custos equivalentes de alta performance.

Testes revelam nuances importantes: o Sonnet 5 entrega resultados próximos ao 4.6 em níveis médios de esforço com menor custo, mas exige configurações de alto esforço para superá-lo. Em casos complexos, o Opus ainda se mostra superior devido à sua eficiência intrínseca em gerenciar tokens para problemas difíceis.

Segurança e Conclusões sobre a Classe Sonnet

  • O Sonnet 5 apresenta melhorias no comportamento, embora ainda inferior ao Opus 4.8 e Mythos Preview.
  • Preocupações com exploits e cibersegurança, presentes no modelo Mythos, não afetam a classe Sonnet.
  • A adoção do Sonnet 5 é recomendada para tarefas de nível inferior para reduzir custos de API.

O modelo Sonnet 5 se estabelece como uma ferramenta equilibrada, removendo preocupações de segurança que bloqueavam modelos de classe superior. Para desenvolvedores que buscam integrar a tecnologia da Anthropic em seus próprios aplicativos, a nova classe intermediária oferece um meio termo acessível em comparação aos modelos mais caros.

Community Posts

View all posts