Opus 5 Supera Fable... Pela Metade do Preço?

BBetter Stack
Computing/SoftwareBusiness NewsInternet Technology

Transcript

00:00:00A Anthropic acabou de lançar o Claude Opus 5, e ele pode ser realmente melhor que o Fable
00:00:04custando a metade do preço. Se isso for verdade, este é o meu novo modelo favorito, então vamos conferir.
00:00:13É assim que eles descrevem o Opus 5: O Opus 5 é um modelo ponderado e proativo que chega
00:00:18perto da inteligência de ponta do Claude Fable 5 por metade do preço. Em programação e tarefas de conhecimento
00:00:23avaliadas em benchmarks como Frontier Bench e GDP Val, o Opus 5 é o novo estado da arte, ficando
00:00:28atrás apenas do Mythos 5 em tarefas de cibersegurança. O Opus 5 foi projetado para uso diário, ele funciona de forma
00:00:33mais eficiente que outros modelos e é o novo modelo padrão no Claude Max, além de ser o mais avançado
00:00:38nos planos Claude Pro. Depois disso, eles mostram os benchmarks, e ele está vencendo em vários
00:00:43deles, mesmo com o Fable 5 na disputa, e não está ganhando por pouco. Segundo
00:00:47eles, ele é quase 10% melhor no Frontier Bench do que o Fable 5, mas um dos números mais impressionantes
00:00:52é a pontuação no Arc AGI. O Opus 4.8 marcou 1,5% aqui, enquanto o Sol marcou 7,8%, que era a maior
00:01:00pontuação anterior, mas o Opus 5 atingiu 30,2%. A equipe por trás desse benchmark mostrou que o Opus teve uma nova
00:01:06capacidade nunca vista antes em outros modelos, onde ele convertia os testes em
00:01:10notação algébrica para realizar raciocínio lógico avançado. Isso é realmente impressionante.
00:01:15A propósito, se você está se perguntando por que o Fable não está aqui, é por causa da política
00:01:19de retenção de dados do Fable. O pessoal do Arc AGI não quer arriscar vazar detalhes desse teste para a Anthropic, mas a
00:01:24boa notícia é que o Opus 5 não exige retenção de dados para acesso geral. Isso vai
00:01:29deixar muita gente bem feliz. Mas continuando, vamos dar uma olhada nos benchmarks de terceiros da
00:01:33Artificial Analysis. No índice de programação, ele fica em segundo lugar, perdendo por apenas 0,3 ponto para o GPT 5.6 Sol
00:01:39Extra High, mas supera o Fable por 1,5 ponto e é um avanço bem bacana em relação ao Opus 4.8.
00:01:45Um destaque para o Kimi K3 aqui, aliás, por se infiltrar entre os gigantes. Eu fiz um vídeo sobre
00:01:49ele quando foi lançado, então inscreva-se para ficar por dentro das novidades de IA e
00:01:52desenvolvimento. Se olharmos para o índice de agentes, o Opus 5 na verdade assume a liderança
00:01:57aqui, ficando um pouco acima do Fable 5 e superando o modelo Sol da OpenAI. O mesmo acontece
00:02:02no índice de inteligência, onde o Opus 5 também está na frente. Então, do ponto de vista de desempenho,
00:02:06parece que o Opus 5 é um modelo realmente excelente, e sinceramente, estou bastante surpreso. Eu achava que
00:02:11o Fable seria o foco principal deles agora e que o Opus se tornaria um tipo de novo
00:02:15modelo Sonic, mas agora parece que Fable e Opus estão quase pau a pau, até considerarmos
00:02:19o preço. Se olharmos para o custo para concluir uma tarefa na Artificial Analysis, o Opus
00:02:235 sai 72 centavos mais barato que o Fable 5 e é só um pouco mais caro que o
00:02:28Opus 4.8. Agora, eu diria que se você busca custo-benefício, o GPT 5.6 Sol
00:02:33ainda é o vencedor aqui, custando quase a metade do preço do Opus 5. Dá para ver
00:02:37neste gráfico onde o verde é o quadrante mais atraente, os modelos GPT ficam exatamente ali,
00:02:42junto com o Kimi K3, enquanto os modelos da Anthropic têm sua própria área no lado de preços mais
00:02:46altos. O Cursor Bench também reflete todos esses benchmarks que analisamos. Nele,
00:02:50o Opus 5 Max tem quase a mesma pontuação que o Fable 5, mas o Fable custa $17 para essa
00:02:56tarefa, enquanto o Opus custa $8. O preço em si é o mesmo do Opus 4.8, ou seja,
00:03:01$5 por milhão de tokens de entrada e $25 por milhão de tokens de saída. Portanto, se você gosta do
00:03:06Opus 4.8, não vejo motivo para não usar este modelo. E como fã
00:03:10do Fable 5, com certeza vou usar muito o Opus 5 para economizar minha assinatura
00:03:14e meus créditos para que não acabem tão rápido. Sinceramente, meu palpite sobre Fable versus Opus
00:03:18é que o Fable continuará sendo o modelo principal para problemas difíceis e de longo prazo,
00:03:23mas para 95% do trabalho, o Opus 5 pode assumir o lugar dele. Vamos ver
00:03:28ele em ação com alguns testes locais. O primeiro teste que fiz foi pedir aos modelos para criarem
00:03:32um jogo completo de Fórmula 1 em um único arquivo HTML usando Three.js. Vou falar do tempo que
00:03:37cada modelo levou e quanto custaria na API no final, mas primeiro,
00:03:40vamos ver os resultados. Este é o resultado que o Opus 5 me deu, e devo dizer que estou muito
00:03:45impressionado com os modelos aqui. Ele não usa assets externos nem nada do tipo. Foi tudo
00:03:50feito pelo Opus 5 e tudo parece excelente. O traçado da pista estava um pouco invertido ali,
00:03:55mas a dirigibilidade está ótima. Os tempos de volta, posições e classificação,
00:03:59tudo funciona bem. Sim, estamos dirigindo sob a grama aqui, mas dá para ver que a colisão funciona
00:04:03e realmente existe uma pista sob a grama, então posso corrigir isso facilmente com um prompt.
00:04:07E as caixas de brita também parecem funcionar super bem. Sinceramente, estou muito impressionado com
00:04:12o resultado do Opus 5 aqui. Na minha opinião, esses carros de F1 ficaram os melhores de todos.
00:04:16Mas vou deixar você decidir. Este é o resultado que o Fable me deu. Acho que este também ficou
00:04:20muito legal em relação ao traçado, mas os carros são um pouco mais simples que os do Opus 5.
00:04:25Eu gostei bastante do balanço da câmera ao fazer curvas, e novamente, todos os
00:04:28outros recursos funcionam, como posição na pista, cronometragem e tudo mais. O Fable 5
00:04:33fez um ótimo trabalho, mas honestamente acho que prefiro o do Opus. Este é o resultado
00:04:37que obtive do GPT 5.6 Sol, também no modo de esforço máximo. Ele fez um bom trabalho com a
00:04:43modelagem e com o visual da câmera, mas como dá para ver, não há pista, alguns elementos estão ao
00:04:47contrário e, no meio do percurso, a pista se quebra. Então ele fez
00:04:51um trabalho pior, na minha opinião, do que o Fable e o Opus. Acho que o Opus ainda está
00:04:56vencendo aqui. O último modelo que testei foi o Kimi K3, e este foi o resultado,
00:05:01e sinceramente, impressionante para um modelo de pesos abertos. Ele se saiu muito bem,
00:05:05bem parecido com o GPT 5.6 Sol. As barreiras funcionam, a pista funciona,
00:05:09posicionamento, tudo funcionando. Ele me criou um jogo bem legal de primeira. Se olharmos
00:05:14para o custo e o tempo dessas execuções, o Opus 5 levou 46 minutos e 51 segundos
00:05:19para concluir o jogo de F1, o que custaria cerca de $12,99 se usássemos a API. Para mim,
00:05:25o Opus 5 acabou sendo mais caro que o Fable aqui, e analisando, foi porque ele usou
00:05:30cinco vezes mais tokens. Espero que isso seja uma exceção, já que outros benchmarks não parecem
00:05:35relatar o mesmo. Devo adicionar que estou calculando o custo desses modelos Claude com a ferramenta
00:05:39de uso do Claude Code, então pode haver imprecisões, pois você não obtém o preço exato ao usar
00:05:44a assinatura. Como disse antes, esses modelos ainda são mais caros, então se optar por
00:05:49algo como o GPT 5.6, você terá um modelo mais rápido e barato, mas os resultados foram,
00:05:54na minha opinião, piores. Vamos tentar outro teste. Desta vez, pedi para criarem um dashboard de
00:05:58gestão financeira pessoal, uma aplicação full stack com front-end e back-end,
00:06:02e listei alguns recursos para adicionarem. Este foi o resultado que obtive
00:06:06com o Opus 5, e devo dizer que estou bastante impressionado. Gostei muito dessa interface, é um
00:06:11estilo que particularmente aprecio. Me diga nos comentários se você também gosta, e tudo está
00:06:15totalmente funcional. Testei e tudo funciona, temos páginas separadas para cada uma das
00:06:20funcionalidades solicitadas, e a integração entre o front-end e o
00:06:24back-end está perfeita. Adorei o estilo da UI escolhida. Acho que foi a melhor de
00:06:28todas. Quanto ao código, ele usou React e React Router no front-end, o que eu gosto
00:06:33muito, e no back-end também ganha pontos por ter usado um banco de dados real. Ele usou
00:06:37Node SQLite para o banco de dados e Express no servidor. Este é o resultado
00:06:42que o Fable 5 me entregou. Prefiro a UI do Opus 5, mas esta também não é ruim,
00:06:48embora esses gráficos sejam um pouco inúteis. Este aqui de baixo é legal, e
00:06:53todos os recursos funcionam. Só acho que o Opus 5 caprichou mais na interface, sendo
00:06:57definitivamente melhor nesse ponto. No código, fez algo parecido com o Opus 5, usando
00:07:01React, mas não usou uma biblioteca de roteamento. Ele criou uma pequena biblioteca própria
00:07:05de roteamento. Eu preferiria que usasse algo padrão como o React Router,
00:07:09e para o banco de dados fez o mesmo, usando Node SQLite, rodando
00:07:13em Express, então o back-end foi bem semelhante, mas o Opus escolheu uma
00:07:18stack melhor para o front-end. Este é o resultado do GPT 5.6 Sol, e devo dizer que está
00:07:22no mesmo nível em termos de UI. Bate de frente com o Opus. É só um estilo diferente, então
00:07:26vai do gosto pessoal, mas eu gostei bastante. Ele fez um trabalho
00:07:31incrível ao estruturar toda a UI e todos os recursos funcionam, mas este
00:07:35não usou páginas separadas para as funcionalidades. Ele apenas navega para outra
00:07:38seção da mesma página. Ele também escolheu a stack mais diferente de todas. Usou NextJS com
00:07:43Drizzle, que eu gosto bastante para banco de dados e é uma abordagem válida para
00:07:47algo assim. Mas também usou Cloudflare e Vinext para hospedagem, o que acho uma decisão
00:07:52estranha, porque o Vinext é muito recente e não me parece ter sido
00:07:56testado ainda. Há algo no prompt forçando o uso de Cloudflare
00:08:00e Vinext. Como mencionei no meu vídeo sobre o Kimi K3, é provável que seja assim que os sites
00:08:04hospedados do ChatGPT funcionam. Por fim, o último modelo que testei foi o Kimi K3, e este foi o resultado
00:08:09que recebemos. Eu diria que ele fez um ótimo trabalho. A UI lembra algo que eu obteria
00:08:14do GPT 5.4 ou 5.5, então está um pouco atrás no design de UI, mas todas as funcionalidades
00:08:19funcionam e não posso reclamar da interface. Ela cumpre exatamente o que pedi.
00:08:24No entanto, o código perde alguns pontos. Ele escolheu React no front-end
00:08:28e criou uma biblioteca de roteamento própria como o Fable, mas ao olhar o servidor,
00:08:32ele apenas possui um servidor Express sem um banco de dados real como Node SQLite
00:08:36ou similar. Na verdade, ele criou um banco simulado em JavaScript, salvando
00:08:40tudo em um arquivo JSON. Definitivamente não é a abordagem ideal.
00:08:44Quanto ao tempo e custo dos modelos no teste financeiro, o Fable foi o mais caro,
00:08:48custando $30,79 e levando 56 minutos e 55 segundos. Já o Opus pareceu ter
00:08:55um preço muito próximo ao do Fable, custando $29,82 e demorando ainda mais: 59 minutos e 15
00:09:02segundos. Os modelos GPT têm preços muito mais atraentes em comparação, sendo cerca de três vezes e meia
00:09:07mais baratos. Espero que essa concorrência comece a baixar os preços da Anthropic.
00:09:11Minha impressão é um pouco mista. Obviamente, executei cada teste apenas uma vez e fiz só dois testes,
00:09:16então espero que os benchmarks da Artificial Analysis sejam mais precisos, mostrando que o Opus
00:09:20custa um terço do preço do Fable, mas terei que usá-lo mais para confirmar.
00:09:24Pode ser apenas a ferramenta usada para medir os custos. Outro ponto a favor do Opus
00:09:28é ser um pouco menos rígido em tarefas de cibersegurança que o Fable 5. As proteções são bem
00:09:33semelhantes às do Opus 4.8, com exceção de restrições mais fortes em uma gama estreita de tarefas
00:09:37cibernéticas. Aparentemente, essas regras permitem que o Opus 5 encontre vulnerabilidades em código-fonte,
00:09:42mas bloqueiam varreduras de vulnerabilidade em arquivos binários, bem como testes de intrusão e
00:09:46criação de exploits. Os testes mostraram que os classificadores intervêm cerca de 85% menos
00:09:51do que no Fable 5. A concorrência entre os modelos está realmente bastante impressionante
00:09:55no momento. Temos o GPT 5.6 mostrando que os preços podem cair, temos modelos abertos como o Kimi
00:10:00se equiparando aos grandes em inteligência, e a Anthropic constantemente elevando esse nível
00:10:04de inteligência cada vez mais. Qual é o seu modelo favorito? Gostou da proposta do Opus?
00:10:09Deixe nos comentários abaixo, aproveite para se inscrever e, como sempre, nos vemos no próximo vídeo.

Key Takeaway

O Claude Opus 5 entrega desempenho idêntico ou superior ao Fable 5 em benchmarks de programação e agentes por metade do preço oficial por token, embora seu consumo elevado de tokens possa equiparar os custos em tarefas complexas de código.

Highlights

  • O Claude Opus 5 atingiu 30,2% no benchmark Arc AGI ao converter testes automaticamente em notação algébrica para raciocínio lógico avançado.

  • No índice de agentes da Artificial Analysis, o Opus 5 assumiu a liderança geral, superando o Fable 5 e o GPT 5.6 Sol.

  • O Opus 5 não exige retenção de dados para acesso geral, ao contrário da política restritiva aplicada ao Fable 5.

  • Para a criação de um jogo 3D completo em arquivo HTML único, o Opus 5 consumiu cinco vezes mais tokens que o Fable 5, elevando o custo da API para $12,99.

  • Os classificadores de segurança do Opus 5 intervêm 85% menos do que no Fable 5 em tarefas de cibersegurança.

Timeline

Especificações e Desempenho em Benchmarks do Opus 5

  • O Opus 5 alcançou o estado da arte no Frontier Bench e GDP Val por metade do preço por token do Fable 5.
  • O modelo saltou de 1,5% no Opus 4.8 para 30,2% no Arc AGI via conversão autônoma para notação algébrica.
  • A ausência de exigência de retenção de dados no Opus 5 libera seu acesso geral sem os riscos de privacidade do Fable.

A Anthropic estruturou o Opus 5 como o modelo padrão no plano Claude Max e o topo de linha no Pro. Sua capacidade de converter dilemas de raciocínio lógico em notação algébrica permitiu superar o recorde anterior do Sol de 7,8% no Arc AGI. Essa mudança arquitetônica elimina a dependência da retenção de dados que impedia a adoção ampla do Fable 5 em testes rigorosos.

Comparativo de Custos e Liderança em Agentes

  • O Opus 5 lidera o índice de agentes e o índice geral de inteligência da Artificial Analysis.
  • A taxa por token permanece fixada em $5 por milhão de entradas e $25 por milhão de saídas.
  • O GPT 5.6 Sol mantém a liderança em custo-benefício por praticamente metade do valor por execução do Opus 5.

Em testes de terceiros, o Opus 5 ficou a 0,3 ponto do GPT 5.6 Sol Extra High em programação e superou o Fable 5 no Cursor Bench, reduzindo o custo da tarefa de $17 para $8. Embora apresente valores mais elevados do que as alternativas da OpenAI e o modelo aberto Kimi K3, o equilíbrio entre inteligência e precificação viabiliza sua substituição ao Fable em 95% do trabalho rotineiro.

Desenvolvimento Local de Jogos 3D em HTML

  • O Opus 5 gerou o modelo visual de carros de F1 mais detalhado e com física funcional em um único arquivo de 46 minutos.
  • A execução do Opus 5 custou $12,99 na API devido ao uso quíntuplo de tokens em relação ao Fable 5.
  • O GPT 5.6 Sol e o Kimi K3 falharam em estruturar o traçado contínuo da pista de corrida.

O teste prático exigiu a criação de um jogo de Formula 1 em Three.js sem ativos externos. O Opus 5 entregou física de colisão e interface de tempos superiores ao Fable 5, enquanto o GPT 5.6 Sol apresentou pistas quebradas no meio do percurso. Apesar da vitória técnica, o consumo excessivo de tokens do Opus 5 gerou um custo final mais alto que o do próprio Fable na API.

Arquitetura Full Stack e Interface de Painel Financeiro

  • O Opus 5 construiu a aplicação com React, React Router, Express e banco de dados real em Node SQLite.
  • O Fable 5 e o Kimi K3 falharam ao criar bibliotecas próprias de roteamento sem padrões de mercado.
  • O custo de geração do painel full stack atingiu $29,82 no Opus 5 contra $30,79 no Fable 5.

Na criação de um painel de gestão financeira, o Opus 5 escolheu uma stack técnica madura com roteamento padrão e banco de dados relacional funcional, superando a solução do Kimi K3 que utilizou apenas um arquivo JSON simulado. A interface gerada pelo Opus 5 superou a do Fable 5 em usabilidade, embora a diferença de preço e tempo entre ambos tenha ficado abaixo de 3% devido ao volume de tokens processados.

Filtros de Cibersegurança e Conclusões da Competição

  • O Opus 5 registra 85% menos intervenções de segurança ativas do que o Fable 5.
  • As restrições do modelo permitem análise de código-fonte, mas bloqueiam testes de intrusão e criação de exploits.
  • A pressão de preços do GPT 5.6 e do Kimi K3 força a Anthropic a focar em inteligência bruta.

A política de recusa do Opus 5 aproxima-se dos níveis do Opus 4.8, liberando identificação de vulnerabilidades em código sem acionar bloqueios indevidos comuns no Fable 5. O cenário atual mostra uma divisão clara: OpenAI e modelos abertos puxam os custos para baixo, enquanto a Anthropic busca justificar preços superiores através de capacidade analítica.

Community Posts

View all posts