스크립트
00:00:00A Anthropic lançou o Claude Sonnet 5 na semana passada e foi decepcionante, mas pelo menos o Fable 5 está de volta,
00:00:04só que talvez limitado, e ah, o Claude Code pode ter algum código tipo spyware para detectar uso
00:00:09chinês. Vamos começar. Vou começar com o Sonnet 5. Esta é, na verdade, a primeira atualização do Sonnet em quatro
00:00:18meses e meio, e a Anthropic diz que ele foi feito para ser o seu modelo Sonnet mais agentic até agora,
00:00:22com desempenho próximo ao Opus 4.8, mas a preços menores. A precificação é um ponto muito interessante
00:00:28com este modelo, então voltaremos a falar disso. Primeiro, vamos dar uma olhada nos benchmarks
00:00:31que a Anthropic fornece. Ele supera seu predecessor em todos eles, e chega perto do Opus em alguns,
00:00:35como o Terminal Bench e o Computer Use, até superando o Opus ligeiramente em trabalho de conhecimento. Prefiro olhar
00:00:40para benchmarks de terceiros, e os que eu confio são da Artificial Analysis, e nesse
00:00:44índice de codificação, ele fica alguns pontos atrás do Opus, mas ligeiramente à frente do GPT 5.4. Ele deu um
00:00:50salto muito bom em relação ao seu predecessor, o Sonnet 4.6. A mesma história se repete no Índice de Inteligência também,
00:00:56posicionado entre o GPT 5.5 e o GPT 5.4, mas curiosamente, no índice agentic, ele superou o GPT 5.5.
00:01:03Então, quando disseram naquele blog que investiram muito trabalho em suas capacidades agentic,
00:01:06parece ter valido a pena aqui. Pelos benchmarks, então, parece ser um modelo bastante competente,
00:01:10e é definitivamente um passo à frente do Sonnet 4.6, mas agora vamos falar sobre o elemento de preço.
00:01:14Na precificação da API, eles estão oferecendo um preço com desconto de $2 por um milhão de tokens de entrada,
00:01:18e $10 por um milhão de tokens de saída, isso até 31 de agosto. Depois disso, voltará ao mesmo
00:01:23preço dos outros modelos Sonnet, que era $3 por um milhão de tokens de entrada e $15 por um milhão de tokens
00:01:28de saída. Isso o coloca perto do Gemini 3.5 Flash e do GPT 5.6 Terra, se um dia tivermos acesso a ele,
00:01:34e como eles disseram, é mais barato que o Opus 4.8. O problema é que, na prática, isso simplesmente não
00:01:39é verdade. Este modelo consome tokens demais. Ele usa cerca de 69.000 tokens para executar uma tarefa no
00:01:45Índice de Inteligência da Artificial Analysis, tornando-o mais caro que o Sonnet 4.6, Opus 4.8, Fable 5, GPT 5.4,
00:01:52e 5.5. Se você olhar para este quadrante aqui, onde o verde é o lugar ideal, ele está tão longe quanto
00:01:57pode estar desses outros modelos. Isso obviamente tem um efeito cascata no custo real de uma tarefa,
00:02:02e a Artificial Analysis descobriu que o Sonnet 5 acabou sendo mais caro que o Opus 4.8 por tarefa,
00:02:07superado apenas pelo Fable. Além disso, se você pegar um modelo como o GPT 5.5, que na verdade se sai melhor na maioria dos
00:02:12benchmarks, ele custa metade do preço do Sonnet 5. Vale notar aqui que a Artificial Analysis
00:02:16está usando o preço padrão do modelo e não o com desconto, então eu ficaria muito
00:02:20curioso para ver se a Anthropic tenta consertar isso estendendo aquele desconto ou simplesmente mantendo
00:02:25o preço atual como permanente. Pior ainda do que o custo por tarefa, a Artificial Analysis descobriu que
00:02:29para executar todo o seu conjunto de testes, o Sonnet 5 custou mais que o Fable 5. Tipo, o que aconteceu aqui? Mesmo no
00:02:34Cursor Bench, se você olhar para o Sonnet 5 High, o preço é quase o mesmo do Opus 4.8 para um resultado
00:02:39similar, e à medida que você aumenta os níveis de esforço, o Sonnet 5 Max pontua pior que o Opus 4.8 Extra High enquanto
00:02:44custa mais. Realmente parece que eles precisam atualizar ou consertar algo aqui, caso contrário, eu não vejo
00:02:48onde este modelo se encaixa. Ele não é um modelo ruim em termos de capacidade, só economicamente, e eu tenho
00:02:54sido um grande fã dos modelos Sonnet. Acho que eles foram os primeiros que muitos de nós usamos diariamente,
00:02:58mas nos últimos meses eu sempre usei o Opus 4.8, e nada disso me fez mudar de ideia.
00:03:02Especialmente com o Fable de volta, será Fable para as tarefas difíceis,
00:03:05e Opus 4.8 para uso diário, e Sonnet para nada. Falando do Fable 5, os controles de exportação
00:03:11foram suspensos, e ele está de volta para todos, independentemente da sua cidadania, mas infelizmente você
00:03:15teve uma semana para usar isso dentro dos limites do seu plano, ou pelo menos 50% dos seus limites, e após 7 de julho
00:03:20ele só estará disponível via créditos de uso. Havia alguns pontos interessantes naquele blog sobre
00:03:24o banimento inicial. Ele veio de um suposto jailbreak de um pesquisador da Amazon que conseguiu
00:03:29fazê-lo encontrar vulnerabilidades de segurança, e em um caso demonstrou como explorar uma,
00:03:33mas ao investigar isso, a Anthropic descobriu que muitos modelos como Claude Opus 4.8,
00:03:37GPT 5.5 e Kimi K 2.7 poderiam identificar exatamente a mesma vulnerabilidade que o Fable 5 naquele relatório,
00:03:43e quando se tratou de uma demonstração de como explorar a única vulnerabilidade,
00:03:47cada modelo testado conseguiu fazer isso, incluindo Claude Haiku 4.5, Sonnet 4.6, Opus 4.6,
00:03:524.7, 4.8, GPT 5.4, 5.5 e Kimi K 2.7. Então parece-me que o banimento foi inútil
00:03:58então, e tudo o que realmente alcançaram é que a Anthropic tornou as proteções ainda
00:04:02mais rígidas no Fable, fazendo com que muito mais solicitações normais sejam bloqueadas, e no seu tweet de anúncio
00:04:06eles realmente disseram que tarefas rotineiras como depuração e codificação seriam transferidas para o Opus 4.8,
00:04:11mas um funcionário da Anthropic corrigiu isso posteriormente, dizendo que deveria ser apenas um pequeno número delas.
00:04:14Mas isso aparentemente impactou alguns benchmarks mais do que outros, com alegações de que o Fable foi agora
00:04:18limitado. Basicamente, ele está apenas recorrendo mais ao Opus 4.8, então está com um desempenho muito pior nestes
00:04:23benchmarks. Em um tópico semelhante aos controles de exportação e banimentos, algumas pessoas notaram que o Claude
00:04:27code agora tem algumas tentativas de impressão digital de uma forma muito furtiva, modificando a string de data
00:04:32do seu sistema de prompts. Este é um ótimo blog post que detalha tudo, e deixarei o link
00:04:35abaixo, mas o resumo é que existe uma função no Claude code que verifica se o seu fuso horário está na
00:04:40China. Se estiver, a sua string de data mudará de usar hifens para usar barras. Então ele também
00:04:44verificará se o seu URL baseado em API corresponde a esta lista, ou se o hostname contém palavras-chave específicas de laboratórios de IA
00:04:49como DeepSeq, Minimax ou ZAI, e se contiver, ele alterará o apóstrofo em “today's” para um caractere
00:04:55Unicode diferente que parece exatamente o mesmo. É uma técnica muito inteligente chamada esteganografia,
00:05:00e a maioria de vocês não será impactada por isso. Basicamente, é para tentar detectar aqueles revendedores de
00:05:03API, gateways não autorizados do Claude code e ataques de destilação de modelos. Eu não tenho realmente um
00:05:08problema com eles tentando fazer isso, eu só preferiria que fossem um pouco mais honestos sobre as coisas que
00:05:12estão no Claude code, e não tentassem esconder dessa forma. Você acha que isso é um problema, e o que você
00:05:16acha do Sonnet 5 e do retorno do Fable? Deixe-me saber nos comentários abaixo, ou se você é inscrito,
00:05:20e como sempre, vejo você no próximo vídeo.