스크립트
00:00:00O Fable 5.1 e o GPT-6 Astra foram lançados com poucos dias de diferença e ambos vêm obtendo
00:00:05notas muito altas em benchmarks. O Astra até pontuou quase 100% no teste de AGI, ao qual nenhum modelo
00:00:11havia chegado perto. Então, olhando para esses números, você esperaria que ele se saísse muito bem ao dar
00:00:16seu próprio trabalho a ele. Mas ir bem nesses testes não diz o quão bem um modelo
00:00:20vai lidar com o trabalho que você lhe der, e queríamos ver se ambos os modelos têm um desempenho igualmente bom no
00:00:25nosso próprio trabalho. Como somos uma empresa de software, já tínhamos projetos para testá-los, então demos a ambos
00:00:30os modelos trabalhos desses projetos e verificamos o que eles concluíram. Executamos cada modelo em vários
00:00:35projetos e pontuamos seu desempenho em diferentes áreas. Usamos o GPT-5.6 para ajudar a julgar
00:00:41os resultados e pontuá-los. Esse modelo juiz não sabia quais resultados vieram do Fable e quais vieram
00:00:45do Astra. Um modelo obteve uma pontuação geral de 86 em 100, enquanto o outro obteve 84. Agora, isso pode parecer
00:00:52uma pequena diferença, mas o modelo que ficou à frente no geral não venceu todas as partes dos testes e
00:00:57o outro teve um desempenho surpreendentemente bom em algumas dessas áreas. Então, vamos analisar como cada
00:01:02modelo se saiu em nossos testes e qual deles venceu em cada categoria para que você saiba como essas diferenças
00:01:07afetam o trabalho que você está entregando a ele. Antes de passarmos para o desempenho de cada modelo, vamos primeiro revisar
00:01:12os próprios modelos. Esta seção é apenas para quem não os conhece, então se você já sabe
00:01:17os detalhes, pode pular esta seção e ir direto para a próxima. A Anthropic lançou
00:01:22o Fable 5.1 no dia 1º de setembro e, antes mesmo que a Anthropic pudesse aproveitar totalmente o entusiasmo do lançamento,
00:01:27a OpenAI lançou o GPT-6 Astra poucos dias depois do Fable, e as pessoas têm construído produtos realmente interessantes
00:01:33com esses modelos, levando-os aos limites de suas capacidades e obtendo resultados realmente
00:01:37surpreendentes. Quando se trata de preços, ambos os modelos têm exatamente o mesmo preço de US$ 10 por
00:01:43milhão de tokens de entrada e US$ 50 por milhão de tokens de saída. Mas com o Fable 5.1 há uma coisa
00:01:49diferente: a Anthropic cortou o preço das leituras em cache em 75%. Para quem não sabe
00:01:54sobre leituras em cache, partes da conversa que o modelo já leu são de fato salvas para
00:02:00reutilização. Quando você envia um novo prompt, essas partes salvas são reutilizadas em vez de o modelo ler tudo
00:02:05de novo do zero, e isso se chama leitura em cache. Essas leituras já tornam mais barato reutilizar a
00:02:10conversa, mas com o preço reduzido fica ainda mais barato. Mas isso não significa que o Fable seja um
00:02:14modelo mais barato de usar no geral, porque a fatura total também depende de vários outros fatores, sobre os quais
00:02:19falaremos daqui a pouco. Agora, os modelos Fable estão no Claude Code há algum tempo, mas o Fable 5.1 ainda não
00:02:25está incluído no plano Claude Pro, então no Pro você tem que pagar por ele separadamente por meio de créditos de uso. Nos
00:02:30planos Max, o Fable 5.1 está incluído, mas os modelos Fable têm um limite menor do que o restante dos modelos.
00:02:36Por outro lado, a OpenAI não trata o Astra como um modelo separado dessa forma, porque o Astra faz parte dos
00:02:41limites normais do Codex no ChatGPT+ e Pro, e você pode gastar todo o seu uso no Astra. Agora, esses
00:02:47modelos são realmente capazes de trabalhar em tarefas longas, o que significa que você pode simplesmente pedir que construam um recurso
00:02:52grande e deixá-los trabalhar nas etapas por conta própria. Mas quando você deixa esses modelos trabalhando
00:02:57em uma tarefa longa, a quantidade de contexto que eles conseguem reter também importa. O Fable oferece um milhão de tokens
00:03:02no Claude Code, enquanto a janela de contexto padrão do Astra no Codex é de apenas 272.000 tokens, mesmo que o Astra tenha
00:03:09uma janela muito maior por meio de sua API, que é ainda maior do que o milhão do Fable. Mas você não vai
00:03:14obter isso no Codex por enquanto, porque o Codex usa por padrão uma janela de contexto de 272.000 tokens, mesmo para o Astra.
00:03:21Agora, esses modelos alcançaram um nível em que podem realizar pesquisas avançadas, então a OpenAI
00:03:26e a Anthropic adicionaram barreiras de segurança que restringe parte do trabalho que eles têm permissão para fazer.
00:03:31Mas essas restrições também afetam seu trabalho de maneiras diferentes, porque cada modelo reage de forma distinta
00:03:36quando seu sistema de segurança decide que sua solicitação não é permitida. Quando o Astra chega a uma parte da tarefa que
00:03:41vai contra suas regras, ele simplesmente recusa essa tarefa e avisa você. Por outro lado,
00:03:45o Claude Code muda do Fable para um modelo mais fraco quando uma solicitação vai contra suas regras. E muitas
00:03:51pessoas descobriram que o Claude Code havia mudado de modelo sem que elas soubessem. Portanto, se o Claude Code continuar
00:03:56trabalhando após essa troca, o resultado que você está obtendo pode não vir mais do Fable.
00:04:01Agora, a primeira métrica que medimos foi a qualidade, que analisa quão bom é o trabalho do modelo na
00:04:06prática. Para este teste, usamos vários projetos de clientes, então não podemos revelar os detalhes desses
00:04:11projetos, mas podemos explicar como julgamos o trabalho e onde os modelos diferiram. Em relação a quão bem o código
00:04:16foi escrito e organizado, o Fable pontuou 90 em comparação com os 78 do Astra, porque manteve o código de diferentes
00:04:22partes do aplicativo mais claramente separadas. Isso facilita para o modelo entender o aplicativo ao
00:04:27fazer alterações mais tarde, e o Fable ficou à frente do Astra nisso em todos os projetos que testamos. E em
00:04:32relação a quanto do trabalho solicitado foi concluído, o Fable pontuou 91 comparado aos 84 do Astra, porque ele também corrigiu
00:04:39problemas que não havíamos pedido especificamente para ele consertar. Mas também verificamos se os recursos concluídos
00:04:44funcionavam corretamente sem que precisássemos pedir correções, e o Astra pontuou 87 em comparação com os 85 do Fable nisso.
00:04:50Parte da vantagem do Astra veio de verificar os aplicativos de forma mais completa e corrigir mais problemas conhecidos.
00:04:55Quando o Fable testou seus aplicativos, ele perdeu algumas situações em que eles poderiam falhar, então os recursos concluídos
00:05:00ainda tinham alguns problemas. Quando se tratou da experiência de usar o aplicativo, o Astra pontuou 89 em comparação com os 88 do Fable,
00:05:08porque ele organizou as diferentes partes da página em locais que tornavam mais fácil encontrá-las e usá-las.
00:05:13Portanto, com base em todos os testes que acabamos de mencionar, a pontuação geral de qualidade do Fable foi 88, enquanto o Astra pontuou 84,
00:05:19porque ele construiu recursos mais completos e seu trabalho era mais fácil de alterar depois. Então, em termos de qualidade,
00:05:25o Fable é o vencedor claro. Mas antes de passarmos para o próximo teste, vamos ouvir uma palavra do nosso patrocinador,
00:05:30a Zapier. Você cria um aplicativo com IA e ele funciona ótimo, mas no momento em que quer que ele se conecte a ferramentas
00:05:35como Gmail, Slack e Notion, você acaba configurando cada integração e fluxo OAuth manualmente. Antes que você
00:05:41perceba, está enterrado em código de autenticação e de repente as integrações viram o projeto inteiro. É aí que
00:05:46entra o SDK da Zapier. É uma biblioteca de código que você adiciona ao seu projeto direto no Claude Code ou Cursor,
00:05:52dando a você acesso programático ao ecossistema de mais de 9.000 aplicativos da Zapier. Então, em vez de construir cada integração
00:05:58manualmente, nós apenas chamamos as que precisávamos e seguimos em frente. Em poucas linhas, nosso aplicativo estava enviando e-mails
00:06:04e criando páginas no Notion sem documentação de API e sem precisar lutar com autenticação. E quando precisávamos atualizar
00:06:10uma propriedade personalizada no Notion que não tinha uma ação pré-construída, nós a chamávamos diretamente por meio do
00:06:15SDK. Ele realmente vai até você onde você já trabalha. Se você está cansado de configurar integrações manualmente,
00:06:20experimente o SDK da Zapier. O link está na descrição abaixo. A próxima métrica que medimos foi quão bem
00:06:26os modelos lidaram com tarefas de longa duração, ou seja, quanto trabalho eles concluíram sozinhos com pouca
00:06:31orientação nossa enquanto trabalhavam. Também verificamos quão bem eles lidaram com problemas que surgiram no caminho.
00:06:36Para isso, demos a cada modelo uma ideia de aplicativo para construir e redigimos a solicitação de acordo com o seu guia de prompts
00:06:42para que ele tivesse a melhor chance de fazer o trabalho bem. Não mencionamos os detalhes específicos que queríamos
00:06:47e apenas descrevemos o que o aplicativo precisava fazer. O Astra trabalhou por cerca de 32 minutos e o Fable trabalhou por
00:06:53cerca de 44 minutos. O Astra encontrou erros ao construir e verificar seu aplicativo, mas lidou com eles
00:06:58e continuou corrigindo o aplicativo sem que precisássemos guiá-lo em cada problema. O Fable também terminou
00:07:03seu aplicativo sem parar mais cedo ou nos perguntar o que fazer a seguir, e executou verificações do que havia construído.
00:07:09Portanto, ambos levaram o trabalho até o fim, mas também revisamos os aplicativos prontos para ver o que eles
00:07:13tinham nos deixado. O aplicativo do Astra abriu direto em uma página de login, sem uma página inicial separada. Assim que
00:07:18fizemos login, o layout estava bem organizado e o aplicativo funcionava, embora ainda tivesse os layouts familiares que
00:07:24aparecem em muitos aplicativos gerados por IA. Mas tivemos um problema com o painel lateral porque ele não rolava
00:07:30o suficiente para nos permitir alcançar o botão de sair. Tivemos que diminuir o zoom para alcançar esse botão, o que era
00:07:35algo que as próprias verificações do Astra não haviam detectado. O aplicativo do Fable também abriu direto em uma página de login, mas seu
00:07:40design parecia muito mais genérico. Os recursos funcionavam, mas tudo estava tão espremido que
00:07:45o aplicativo era difícil de usar e os gradientes repetidos contribuíam para aquela aparência familiar de gerado por IA. Ele se adaptava a
00:07:51telas menores, mas ainda assim não tinha um layout utilizable, embora os recursos fossem profundos. Nós
00:07:56também tínhamos vários outros aplicativos e recursos enormes planejados e construídos dessa forma, com os modelos deixados
00:08:01para trabalhar sozinhos. Portanto, em tarefas de longa duração, o Astra pontuou 93 de 100 em comparação com os 90 do Fable.
00:08:08O Fable focou mais em fazer os recursos funcionarem, a menos que tivéssemos especificado no prompt que ele deveria
00:08:13focar em visuais também. O Astra prestou atenção tanto em como os aplicativos funcionavam quanto em sua aparência,
00:08:18então o Astra vence em tarefas de longa duração. A próxima métrica que analisamos foi o design e quão
00:08:23fáceis de usar os aplicativos eram. Nós deixamos o modelo pontuar os designs, mas não queríamos depender apenas
00:08:28do seu gosto de design. Então, construímos um visualizador para os resultados do Fable e outro para o Astra, o que nos permitiu analisar
00:08:33os designs nós mesmos e comparar como era usá-los. Demos a ambos os modelos as mesmas tarefas de design,
00:08:38começando com uma página inicial para uma empresa que vende fontes. A versão do Fable parecia muito semelhante a
00:08:44o que o Opus costuma produzir, desde as cores e fontes até o layout. Ela até tinha aquela faixa de texto se movendo
00:08:50pela página que temos visto nos designs do Opus ultimamente. Mas uma coisa que o Fable fez diferente
00:08:55do Opus foi adicionar muito mais elementos interativos em todo o design, e isso fez o aplicativo parecer
00:09:00A versão da Astra tinha um layout mais espaçoso, com diferenças mais claras no tamanho do texto e
00:09:05nas cores, o que tornava a leitura mais fácil. Mas havia muito menos movimento, então, embora parecesse mais
00:09:10agradável de olhar, não oferecia a mesma experiência que o design da Fable. É por isso que a Fable
00:09:14teve nota 94 em interação, enquanto a Astra marcou 85. Em seguida, pedimos a cada modelo que criasse uma página
00:09:20de um jogo de terror. O design da Fable usou um farol animado para criar a atmosfera. O modelo
00:09:25criou a arte em SVG, que são imagens desenhadas com código, mas o texto não se destacava o bastante contra o fundo
00:09:31escuro por causa dos tamanhos e cores escolhidos pela Fable. E na mesma tarefa de design, a Astra usou o
00:09:36modelo de geração de imagem integrado ao Codex para criar uma imagem em vez de gerar a arte com código.
00:09:42Ela também criou um teaser para o jogo, mesmo sem termos pedido. E onde a Astra se destacou
00:09:47foi na escolha de fontes e cores, fazendo com que o texto se sobressaísse no fundo escuro.
00:09:52Para o site de festival de música, a versão da Fable repetiu muitas das escolhas de design vistas em projetos
00:09:57feitos pelo Opus. Mas mesmo com essas escolhas familiares, parecia que a Fable havia se dedicado mais a dar
00:10:03ao site um estilo próprio. A Astra usou uma foto de show gerada por IA, mas o design geral pareceu mais
00:10:08genérico. A última comparação foi um jogo de baliza, onde a versão da Fable ficou realmente muito bem feita,
00:10:13e o espelho retrovisor nos ajudou a julgar com mais precisão onde mover o carro. O jogo tinha duas
00:10:18visões de câmera, mas ambas apresentavam problemas. Como uma mostrava o lado errado da vaga,
00:10:23enquanto a outra exibia apenas um lado em vez de dar uma visão completa da estrada à frente. Isso dificultava
00:10:27ver para onde estávamos movendo o carro, e se esses ângulos de câmera estivessem certos, o jogo
00:10:32teria parecido mais realista. A Astra forneceu três visões fixas e adicionou dicas de direção no painel lateral,
00:10:38o que tornou o jogo mais fácil de jogar. Os ângulos de câmera eram bem melhores que os da Fable. Estes foram
00:10:42testes gerais em que demos aos modelos pouquíssimos detalhes sobre os designs desejados, então estávamos avaliando
00:10:48o gosto próprio de cada modelo. Ambos repetiram escolhas de design vistas em outros trabalhos, mas ambos
00:10:53produziram bons resultados. E com um pouco mais de detalhe sobre a aparência e a experiência desejadas para os apps,
00:10:58esperaríamos um bom design de ambos. Portanto, apenas em termos de gosto, a Astra venceu em visual e usabilidade, enquanto a Fable venceu em
00:11:04animações e interatividade. Mas antes de passarmos para os testes de custo e velocidade, seria ótimo se você
00:11:09se inscrevesse no canal e curtisse o vídeo. Esse pequeno gesto de apoio faz uma grande diferença para nós.
00:11:15A próxima métrica que medimos foi a eficiência, que abrangeu o custo do trabalho, o tempo que levou
00:11:20e quantas vezes o modelo usou suas ferramentas para concluir a tarefa. Uma coisa importante sobre os custos é que
00:11:25não usamos a API, então estas são apenas estimativas de quanto custaria o trabalho caso usássemos a API
00:11:31com base nos tokens consumidos. Executamos os testes em nossa assinatura habitual. Em todas as execuções, o custo
00:11:37total estimado da Fable chegou a $49,18, comparado a $27,69 da Astra, o que significa que o total da Astra foi cerca de 44% menor.
00:11:47A Fable gerou quase três vezes mais tokens de saída do que a Astra, assim como o guia de prompts da Fable
00:11:52menciona que ela tende a escrever mais do que outros modelos. O custo por token foi o mesmo para ambos,
00:11:57então escrever mais foi o que aumentou o custo da Fable. O uso de ferramentas também eleva o consumo de tokens,
00:12:03já que o modelo decide qual ferramenta usar e lê os resultados antes de continuar trabalhando. Em todas as
00:12:09seis execuções, o agente principal da Fable usou suas ferramentas 443 vezes, contra 287 da Astra, o que também aumentou o
00:12:17custo. No quesito custo, a Astra obteve 80 de 100, comparado a 66 da Fable. Em relação à velocidade, a Astra também
00:12:23ficou à frente com 70, contra 67 da Fable. As tarefas de longa duração levaram cerca de 62 minutos no total para a Astra,
00:12:30frente a 73 minutos para a Fable. Portanto, considerando as pontuações de custo, velocidade e eficiência de ferramentas,
00:12:35a Astra superou a Fable. A próxima métrica que medimos foi a obediência a instruções,
00:12:40onde verificamos quão bem os modelos seguiram as instruções fornecidas durante a construção
00:12:44e se continuaram seguindo-as conforme o trabalho avançava. Ao executar a Fable em um projeto,
00:12:49ela inicialmente adicionou uma mensagem de coautoria dizendo que o Claude ajudou a escrever o código,
00:12:53mesmo com nossas instruções explicitamente determinando o contrário. Ela também ignorou uma regra sobre como podia
00:12:58criar ou alterar arquivos. Instruímos o modelo a usar as próprias ferramentas de edição de arquivos do Claude, para que as alterações fossem rastreadas
00:13:04e fáceis de desfazer, mas ele acabou criando dois arquivos executando comandos. Em obediência a instruções,
00:13:09a Astra pontuou 96 de 100, contra 88 da Fable. Logo, no que diz respeito a seguir as instruções,
00:13:16a Astra levou vantagem nestas execuções. A próxima métrica que medimos foi a qualidade da revisão, onde fornecemos aos
00:13:21modelos um projeto contendo problemas e pedimos que os encontrassem. Primeiro, demos a ambos os modelos o
00:13:27mesmo código para revisar, com quatro problemas inseridos propositalmente para sabermos o que eles precisavam encontrar. A Fable
00:13:33encontrou todos os quatro e ainda achou cinco problemas adicionais que não havíamos adicionado, os quais foram
00:13:37verificados e confirmados. A Astra encontrou dois dos quatro problemas inseridos, mas ainda assim nos disse que a revisão
00:13:42estava completa. Também incluímos três partes que pareciam suspeitas, mas que na verdade estavam corretas,
00:13:47porque queríamos ver se o modelo apontaria falsos problemas. Nenhum deles tratou isso como bug, então a
00:13:52diferença aqui esteve na quantidade encontrada, e a Fable nos entregou uma revisão mais minuciosa,
00:13:57mas quando os testamos em um projeto maior com nove problemas confirmados, a Astra corrigiu cinco, enquanto a Fable
00:14:03apenas encontrou e corrigiu quatro. Assim, a Astra concluiu mais reparos, embora ambos tenham deixado vários problemas
00:14:08sem correção. Na qualidade de revisão, que incluiu esses reparos e a forma como os modelos verificaram o restante do trabalho,
00:14:13a Fable pontuou 84 contra 78 da Astra. Portanto, a Fable levou a melhor na pontuação geral de revisão,
00:14:19porque ofereceu uma análise mais sólida no geral. Com base nesses resultados, a Astra é a clara vencedora em
00:14:25várias categorias testadas, mas isso não significa que a Fable seja um modelo ruim, pois teve um bom desempenho
00:14:30nas tarefas e não ficou muito atrás da Astra em várias delas. Portanto, você só precisa escolher o modelo
00:14:35com base nas tarefas que vai atribuir a eles. Agora, para levar esses dois modelos ao limite máximo de suas capacidades, existem
00:14:40certas práticas que você deve seguir. Usamos muitas delas em nossos testes, e se você quiser ter acesso
00:14:45a elas também, pode encontrá-las no AI Labs Pro, que é a nossa comunidade. Então, se você gostou do nosso
00:14:51trabalho e quer apoiar o canal, esta é a melhor forma de fazer isso. O link está na descrição.
00:14:56E chegamos ao fim deste vídeo. Se quiser apoiar o canal e nos ajudar a continuar produzindo
00:15:01vídeos como este, você pode fazer isso usando o botão de valeu demais abaixo. Como sempre,
00:15:05obrigado por assistir e nos vemos no próximo.
커뮤니티 글
아직 글이 없습니다. 이 영상에 대한 첫 번째 글을 작성해 보세요!
이 영상에 대해 글쓰기