O GPT 6 Astra Chegou (E é Melhor que o Fable 5.1?)

CChase AI
컴퓨터/소프트웨어AI/미래기술

스크립트

00:00:00Logo após a Anthropic lançar o Fable 5.1, a OpenAI revida e lança o GPT-6 Astra.
00:00:07Agora vamos começar analisando alguns benchmarks do GPT-6 Astra. E um salve para
00:00:10a OpenAI por nos fornecer muito mais benchmarks para analisar do que a Anthropic mostrou com o Fable
00:00:145.1. Quando se trata de uso de computador, ele praticamente domina tudo. Nem temos muitos dados
00:00:19aqui sobre o Fable 5.1. Quando olhamos para os benchmarks profissionais, coisas como o BenchCAD
00:00:24e o browse comp, novamente, o GPT-6 se sai muito bem. O único lugar onde ele não vence é no
00:00:31índice de inteligência de análise artificial, onde pontua 61,2 em comparação com os 65,7 do Fable 5.1.
00:00:38Em seguida, temos programação. E novamente, praticamente a mesma história. Ele está vencendo o Fable 5.1 ou está
00:00:43empatado. Se olharmos especificamente para o TerminalBench 4.0, vemos um salto enorme do GPT 5.6 solo
00:00:49de 37,3 para 57,7. E se olharmos para o DeepSuite, que é provavelmente meu benchmark de programação
00:00:55favorito, ele foca realmente em tarefas agênticas de longa duração. Ele pontua 74,1%, o que, novamente,
00:01:02é melhor do que qualquer outra coisa no mercado. O GPT-6 também esmaga os benchmarks acadêmicos, bem como os
00:01:08de ciência e saúde. E quando olhamos para os benchmarks de cibersegurança, novamente, estou prestando muita atenção
00:01:13no 5.6 solo aqui. Saltos enormes, de 78,5 para 100%. De 55,9 até 88,5% no exploit
00:01:22bench, chegando a 39%. Portanto, esta é uma mudança drástica em relação aos modelos da série 5. E em termos
00:01:27de contexto longo, o GPT-6 também arrasa. Pontuação de 100% no teste de oito agulhas de 256 a 512 mil
00:01:34tokens. Basicamente de um quarto a uma janela de contexto totalmente cheia. E então, quando essa janela tem 512.000
00:01:41tokens até um milhão, ele ainda pontua 96,3%. Então, se você é alguém que está sempre jogando uma tonelada de
00:01:46contexto no seu modelo de IA de escolha, o GPT-6 vai se dar muito bem nesses cenários. Mas as pontuações brutas
00:01:51de benchmark não são suficientes. Precisamos saber quanto custa realmente alcançar essas pontuações,
00:01:55porque o Astra pode ter a melhor pontuação do mundo, mas se custar 10 vezes mais que todo o resto, qual é o
00:01:59ponto? Agora, felizmente para os modelos GPT, historicamente, eles têm sido muito eficientes em termos de tokens. Então, quando olhamos
00:02:04aqui para a pontuação do terminal bench 4.0, vemos que isso meio que se confirma. Portanto, o GPT-6 Astra aqui com as estrelas,
00:02:11a primeira coisa que quero notar é que, como muitos desses modelos, vemos uma espécie de queda na eficiência
00:02:16à medida que subimos na cadeia de nível de esforço. Então, quando vou de baixo para médio e alto, continuo obtendo
00:02:23melhores pontuações a um aumento de custo um tanto linear. Mas à medida que passo de alto para extra alto, e depois máximo,
00:02:30na verdade, estou obtendo uma pontuação pior a um custo maior. Então, no alto por US$ 7,21, estou obtendo
00:02:39uma precisão de 57,9%. Quando comparo isso com o Fable 5.1 bem aqui, e estou no alto, bem, estou obtendo 49,4%
00:02:49de precisão por US$ 10,50. Portanto, mais caro e não pontua tão bem. Agora, o Fable pontua muito alto
00:02:57quando o coloco no esforço máximo de 55,8, mas está me custando US$ 19,50. Então, pela mesma pontuação,
00:03:06novamente, cerca de 55%, são quase US$ 20 do Fable 5. E para o GPT-6 Astra, são US$ 7,20. Portanto, infinitamente mais barato
00:03:16essencialmente pela mesma precisão. E quando olhamos para o Frontier Code 1.1, vemos um padrão semelhante,
00:03:22onde nas pontas mais altas, estamos obtendo pontuações semelhantes. Quando olhamos para o GPT-6 versus o Fable 5.1
00:03:29ou o Fable 5. Nesse caso, o Fable 5 realmente pontuou mais alto aqui. Mas é muito mais caro
00:03:34executar esses modelos de nuvem devido à eficiência de tokens com o GPT-6 Astra. Agora, existem algumas funcionalidades
00:03:39além dos benchmarks que a OpenAI destaca quando se trata do GPT-6. A primeira é que eles estão chamando de
00:03:43o melhor modelo de uso de computador do mundo. Agora, existem alguns benchmarks que testam esse tipo de
00:03:48coisa, como o último exame do agente. E como vimos com outros benchmarks, o que isso nos mostra?
00:03:52Mostra o Astra arrasando, tanto em termos de precisão quanto nos custos de API, que nunca
00:03:57podem ser descartados. Mas, indiscutivelmente, ainda mais importante que a precisão é a velocidade. O Codex na verdade tem
00:04:01um uso de computador muito bom, especialmente se você o usar em conjunto com o modo de voz. E o Astra é
00:04:06supostamente 1,9 vezes mais rápido que o GPT-5.6, o que é ótimo se você é alguém que tem usado muito isso
00:04:11no último mês mais ou menos. A outra coisa que eles destacam é a adesão a modelos. Então, se você
00:04:15fornece algum tipo de modelo de, digamos, uma apresentação de slides, como você vê aqui à esquerda, e pede para ele
00:04:20criar outra apresentação de slides da mesma maneira sobre um tópico diferente, bem, você obtém algo
00:04:25como vemos à direita, algo que adere ao estilo muito, muito bem. Portanto, se você tem algum
00:04:31tipo de modelo que usa repetidamente, seja para apresentações de slides ou sites, pense nele como um
00:04:35sistema de design para realmente qualquer tipo de saída, o GPT-6 é ótimo para isso. Você pode ver isso novamente aqui com
00:04:41documentos do Excel e estilização de documentos em geral. Aqui estava essencialmente a imagem de referência que lhe foi dada.
00:04:46Aqui está o que obtínhamos antes e aqui está o que obtemos à direita depois, com ele olhando para essa
00:04:51imagem de referência. Outra coisa interessante é esta linha aqui, onde eles falam sobre o GPT-6 Astra
00:04:55trazendo um julgamento visual mais forte para sites, jogos, aplicativos e renderizações integradas, ou seja, eles estão
00:05:00dizendo que o GPT-6 tem melhor gosto. E você provavelmente já ouviu várias vezes que a IA não tem gosto.
00:05:05Bem, eles estão dizendo que o GPT-6 tem. Agora, sejamos honestos, sempre haverá problemas quando se
00:05:10trata de IA e gosto, porque se você der a ela um comando ruim, haverá algum tipo de regressão
00:05:15à média, não importa o quê. E seja qual for essa média, as pessoas vão associá-la a lixo gerado por IA,
00:05:20não importa quão bom ele realmente seja. Mas eles mostram alguns exemplos aqui de essencialmente uma simulação
00:05:25do Unreal Engine que fizeram, modelagem no Blender, bem como algumas imagens estáticas aqui. Agora, uma coisa muito legal
00:05:31que eles estão adicionando com o Astra são mudanças na forma como ele faz a compactação automática quando a janela de contexto se enche. Agora,
00:05:37geralmente, você enche sua janela de contexto, ela é compactada automaticamente, criando um resumo
00:05:41de tudo o que você discutiu nessa última sessão, e então iniciando uma nova sessão. Bem,
00:05:46isso cria problemas, às vezes omite detalhes. Mas agora, o Astra mantém notas entre as janelas de contexto
00:05:52em vez de ter apenas um único resumo. Então, em vez de um documento, ele essencialmente tem um monte
00:05:57de notas autoadesivas diferentes sobre o que ele acha importante. E ele pode consultá-las a qualquer momento,
00:06:01em vez de ser apenas uma tentativa única do tipo: aqui está um resumo, espero que isso seja tudo o que precisamos.
00:06:06E de fato, as janelas de contexto anteriores continuam pesquisáveis. Então, novamente, não é como se este fosse o
00:06:12único documento que temos em termos de resumo. E se não estiver aqui, estamos ferrados. Simplesmente não é mais o caso
00:06:16assim. Agora, este é um recurso experimental. Então você precisará ativá-lo na configuração do codex,
00:06:20mas ele se tornará o padrão em algumas semanas. Agora, quando se trata de cibersegurança,
00:06:24o Astra está tratando isso de forma semelhante à forma como a Anthropic trata o Fable, onde eles dizem: este modelo é tão
00:06:28poderoso que pode criar vários exploits. Portanto, se ele achar que você está tentando criar algum tipo de
00:06:33exploit, ele simplesmente não vai deixar você fazer isso. Ele não vai aderir, ele não vai responder
00:06:37ao seu problema. Outra grande melhoria no GPT-6 em comparação com a série 5 é uma taxa de alucinação
00:06:42mais baixa. O GPT-5.6 Sol e os modelos 5.6 em geral alucinavam bastante em comparação
00:06:48com os outros modelos de fronteira. No entanto, comparando diretamente, vemos que passamos de algo como uma taxa de alucinação de 9,4%
00:06:54para uma taxa de alucinação de 2%. O Astra já está disponível? Bem,
00:07:01ele está aberto a um conjunto limitado de organizações. E nos próximos dias, estará aberto essencialmente
00:07:06para todo mundo. Quanto à API, ela está disponível para desenvolvedores. E em relação ao preço, novamente,
00:07:11corresponde ao preço do Fable. Estamos olhando para US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída.
00:07:17Portanto, com base nos números, a OpenAI está nos dando um modelo muito sólido que pode competir totalmente
00:07:22com o que há de melhor na Anthropic. E eles estão fazendo isso a um preço menor. Então
00:07:26estou super animado para testar isso. Acho que ter concorrência entre os maiores players aqui
00:07:30é ultimamente ótimo para nós, os usuários finais.

핵심 요약

O GPT-6 Astra supera a concorrência em benchmarks de programação e uso de computador com menor custo de API e taxa de alucinação reduzida para 2%.

하이라이트

  • O GPT-6 Astra pontua 61,2 no índice de inteligência de análise artificial, ficando atrás dos 65,7 do Fable 5.1.

  • O TerminalBench 4.0 do GPT-6 Astra salta de 37,3 para 57,7, enquanto o DeepSuite atinge 74,1% em tarefas agênticas.

  • A taxa de alucinação do modelo cai de 9,4% nos modelos da série 5 para 2% no Astra.

  • O custo do GPT-6 Astra em nível de esforço alto é de US$ 7,21 com 57,9% de precisão, comparado a US$ 10,50 do concorrente.

  • A velocidade do Astra é 1,9 vez superior à do GPT-5.6.

  • O preço da API do Astra é de US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída.

타임라인

Desempenho em Benchmarks

  • O GPT-6 Astra domina tarefas de uso de computador e benchmarks profissionais.
  • O índice de inteligência de análise artificial pontua 61,2 contra 65,7 do Fable 5.1.
  • O TerminalBench 4.0 registra 57,7 e o DeepSuite atinge 74,1% em tarefas de longa duração.

A OpenAI lança o GPT-6 Astra logo após o Fable 5.1 da Anthropic. O modelo lidera em programação, cibersegurança e áreas acadêmicas, embora fique ligeiramente abaixo no índice geral de inteligência artificial da Anthropic.

Análise de Custos e Eficiência

  • O nível de esforço alto do Astra atinge 57,9% de precisão por US$ 7,21.
  • Níveis de esforço máximo elevam os custos sem melhorias proporcionais de precisão.
  • A eficiência de tokens torna a execução em nuvem mais econômica que a concorrência.

As pontuações brutas exigem análise de custos de API. O modelo entrega precisão superior ou equiparável à do Fable 5.1 com investimento financeiro inferior, exceto em configurações extremas de esforço.

Novas Funcionalidades e Recursos Visuais

  • A velocidade de execução supera o GPT-5.6 em 1,9 vez.
  • O modelo mantém notas estruturadas entre janelas de contexto em vez de resumos únicos.
  • A adesão a modelos visuais e de design melhora a formatação de planilhas e slides.

O Astra introduz julgamento visual aprimorado para simulações e aplicativos. O sistema de compactação automática preserva notas detalhadas de sessões anteriores para consultas contínuas.

Disponibilidade e Cibersegurança

  • A taxa de alucinação despenca de 9,4% para 2%.
  • Medidas de segurança bloqueiam a criação de exploits maliciosos.
  • A API custa US$ 10 por milhão de tokens de entrada e US$ 50 de saída.

O modelo chega inicialmente a organizações selecionadas antes do lançamento geral. A cibersegurança restringe geração de exploits e os preços da API alinham-se aos padrões de mercado.

커뮤니티 글

모든 글 보기