스크립트
00:00:00Será que um modelo chinês de peso aberto acaba de superar o GPT 5.6 e o Fable 5?
00:00:05Bem, se você esteve perto do YouTube ou do Twitter nas últimas 24 horas,
00:00:08com certeza foi bombardeado com gráficos mostrando o KimiK3 com um desempenho igual,
00:00:13se não melhor, que o que a Anthropic e a OpenAI têm a oferecer,
00:00:17tudo isso por uma fração do preço.
00:00:20Mas será que você deve acreditar no hype?
00:00:22Bem, é exatamente isso que vamos responder no vídeo de hoje,
00:00:24enquanto analisamos mais a fundo o que esses benchmarks realmente nos dizem,
00:00:28e fazemos um teste comparativo entre o GPT 5.6, o Fable 5 e o K3
00:00:34na única área em que o KimiK3 está apresentando números melhores que qualquer outro: design front-end.
00:00:40Portanto, ao final deste vídeo, teremos uma ideia muito melhor se o KimiK3 é o novo rei.
00:00:46Então, vamos começar com os números e benchmarks do KimiK3,
00:00:49porque há muito que podemos extrair disso tudo
00:00:51e há algumas nuances que vão além desses gráficos
00:00:53que você viu espalhados por toda parte; estes dois são os mais populares.
00:00:57Agora, quando falamos do KimiK3, é um modelo de peso aberto de 2,8 trilhões.
00:01:02Quando falamos de peso aberto, falamos de código aberto,
00:01:05isso não significa que você pode rodar isso no seu computador.
00:01:07Estamos falando de milhões de dólares em hardware necessários para rodar uma dessas coisas.
00:01:11Mas ainda é ótimo que seja de peso aberto,
00:01:12que possamos ver como todos os parâmetros são ajustados
00:01:15em comparação com algo como o Fable 5 ou o GPT 5.6, onde isso é invisível para nós.
00:01:20Agora, como ele se sai nos números?
00:01:23Isso nos chega cortesia da Kimi e do seu laboratório Moonshot,
00:01:27e mostra que ele compete, mais uma vez, com o Fable 5 e o GPT 5.6
00:01:31em todos esses grandes benchmarks de programação.
00:01:34O outro gráfico que você viu por aí é este.
00:01:36Isso vem do arena.ai, e está medindo seu código front-end.
00:01:40Agora, como esse benchmark funciona é: se você for ao arena.ai e pedir:
00:01:44Ei, crie uma landing page para mim,
00:01:45ele lhe dará duas respostas de dois modelos diferentes,
00:01:49e você não sabe qual é qual.
00:01:50É como o desafio da Pepsi, e você escolhe o que quiser.
00:01:53Com o tempo, vemos quais foram votados contra seu concorrente.
00:01:57E agora, o Kimi K3 se saiu melhor do que qualquer outro modelo neste espaço.
00:02:01Mas entenda que isso é muito, muito subjetivo.
00:02:03E então, quando olhamos para esses dois gráficos,
00:02:05e comparamos isso com os preços entre esses modelos,
00:02:08vemos que o Kimi K3 também é extremamente barato.
00:02:13Sua entrada custa US$ 3 por milhão de tokens em comparação com o Fable, que custa 10,
00:02:17em comparação com o 5.6, que custa 5.
00:02:20Portanto, é 60% do custo do 5.6,
00:02:23e é 30% do custo do Fable 5 na entrada.
00:02:26E em relação à saída, custa metade do 5.6,
00:02:29e é 30% do custo do Fable 5.
00:02:32Então, muito mais barato, e é basicamente tão bom, se não melhor.
00:02:35Então, o que não amar?
00:02:36Mas é aqui que precisamos começar a mergulhar um pouco mais fundo
00:02:38em termos de custo e velocidade.
00:02:40Porque uma coisa é ver, oh, por milhão de tokens,
00:02:43custa US$ 3 e aquele custa US$ 10.
00:02:45Bem, quantos tokens ele realmente usa?
00:02:46Nem todos os modelos são tratados de forma igual em termos de eficiência de tokens.
00:02:49Na verdade, esses modelos chineses de código aberto tendem a consumir muitos tokens,
00:02:53o que significa que, embora no papel seja muito barato,
00:02:56o que isso significa na realidade?
00:02:57E como ele se compara a esses caras
00:02:58que são realmente muito, muito eficientes em tokens, como o GPT 5.6?
00:03:01Bem, se olharmos para isso a partir da análise artificial,
00:03:03que é um serviço de benchmark independente,
00:03:05eles têm um custo por tarefa do índice de inteligência.
00:03:09Então, quanto custa concluir essas tarefas?
00:03:11Então, o Kimi K3, bem aqui, está em US$ 0,95.
00:03:15Contra o GPT 5.6, sole, que custa US$ 1,04.
00:03:20Então, um pouco mais caro.
00:03:23Se olharmos para o 5.5 extra high, sabe, está por aqui.
00:03:26Se olharmos para o Terra, que é o 5.6 no máximo,
00:03:29custa metade do preço do Kimi K3.
00:03:30Agora, versus Claude, certo, bem caro.
00:03:35Fable 5, US$ 2,75.
00:03:38Então essa economia de custos definitivamente se aplica
00:03:40quando comparamos o Fable ao Kimi K3.
00:03:42Mas quando comparamos ao 5.6, não há uma grande diferença.
00:03:46Estamos falando de uns 10% ou menos.
00:03:49E, na verdade, há certos casos em que o Terra,
00:03:51alguns desses modelos menores no reino do 5.6,
00:03:54são na verdade metade do custo do Kimi K3.
00:03:56Agora, a outra coisa que queremos observar é o tempo,
00:03:58porque o tempo é certamente uma moeda
00:03:59à qual queremos prestar atenção.
00:04:01Historicamente, esses modelos de código aberto da China são lentos.
00:04:04E você pode ver isso aqui.
00:04:05O modelo mais lento do grupo é o antigo Kimi K2.6.
00:04:09Agora, o Kimi K3 melhorou significativamente.
00:04:12Neste gráfico, ele está rastreando em seis minutos.
00:04:14Se compararmos isso com o Fable 5,
00:04:17o Fable 5 está em cinco minutos e o 5.6 está em 4,7.
00:04:21Então, sabe, é menos eficiente em tokens e é mais lento.
00:04:27Mas, no geral, muito mais barato que o Fable 5
00:04:32e quase equivalente ao 5.6.
00:04:34Agora, o último benchmark de que quero falar
00:04:35é o índice de omnisciência.
00:04:37Isso está medindo alucinações.
00:04:39Eles dão ao modelo uma série de perguntas muito difíceis
00:04:42para as quais ele pode ou não saber a resposta.
00:04:44E é avaliado em termos de: acertou?
00:04:46Errou?
00:04:47Ou ele diz: não sei?
00:04:49Você ganha um ponto se acertar.
00:04:50Você perde um ponto se errar.
00:04:52E você ganha um zero se apenas disser: não sei.
00:04:54E podemos ver aqui, e isso é de 100,
00:04:57o Fable 5 pontua melhor, com 40 pontos.
00:05:00O 5.6 está bem atrás, com 22.
00:05:03E então o Kimi K3 está com 18.
00:05:06E acho que este benchmark é realmente importante
00:05:08se você estiver usando esses agentes em um contexto
00:05:10que exige muita nuance
00:05:11e há muita área cinzenta.
00:05:13Portanto, quando pegamos todos esses benchmarks juntos
00:05:14no agregado, acho que o que devemos tirar disso
00:05:16é que o Kimi K3, no papel, é extremamente poderoso.
00:05:19No entanto, quando falamos sobre o quão barato ele é,
00:05:21isso é um tanto exagerado,
00:05:23especialmente quando o comparamos aos modelos GPT
00:05:25que são hiper eficientes em tokens.
00:05:27Além disso, o Kimi K3 é um pouco mais lento também.
00:05:30Então, torna-se apenas uma questão de
00:05:32quais dessas três coisas é mais importante para você
00:05:34em relação a potência, custo e velocidade.
00:05:38Então, agora vamos para a frente
00:05:39e testar entre esses três modelos.
00:05:40Então, bem aqui à esquerda,
00:05:42tenho o Fable 5 rodando dentro do Claude Code.
00:05:45E à direita, tenho o Kimi K3
00:05:46também rodando dentro do Claude Code.
00:05:49E aqui atrás, tenho o Codex.
00:05:51Então, este é o prompt que vou dar a ele.
00:05:54E estou dizendo a ele que quero construir
00:05:55um painel de viagem com globo 3D
00:05:57que pareça uma cena do meu filme de ficção científica,
00:05:59não apenas um site.
00:06:01Estou dizendo a ele que essencialmente
00:06:02quero torná-lo um espetáculo visual.
00:06:04E quero que ele seja bastante criativo.
00:06:06Na verdade, digo: me surpreenda
00:06:08com pelo menos uma ideia que eu ainda não tenha visto.
00:06:10Tento não ser muito específico com este prompt
00:06:13porque quero ver
00:06:14como todos esses modelos divergem
00:06:15e o que eles realmente constroem para mim.
00:06:16Então, vamos colocá-los à prova.
00:06:20Tudo bem, os três terminaram
00:06:22de construir seus sites.
00:06:23Então, vamos passar por todos eles.
00:06:24E, no final,
00:06:25compararemos o custo real,
00:06:28a quantidade de tokens usados e o tempo.
00:06:30Então, vamos começar com o Kimi 3.
00:06:34Aqui vamos nós.
00:06:35Temos a Terra 3D.
00:06:37Posso aumentar e diminuir o zoom.
00:06:38Posso movê-lo.
00:06:41Não é de altíssima fidelidade,
00:06:43mas tudo bem.
00:06:43Se eu clicar em algo como a Cidade do México,
00:06:46nada acontece realmente.
00:06:51O que mais?
00:06:51Tem alguns outros pontos aqui,
00:06:53como a Cidade do Cabo.
00:06:55Aqui à esquerda,
00:06:56mostra algumas rotas ativas.
00:06:58Então, se eu clicar em uma rota ativa, como Tóquio,
00:07:01ele realmente me leva até lá.
00:07:02E então, aqui no lado direito,
00:07:04vou mover um pouco.
00:07:05Podemos ver, sabe,
00:07:07é muito tempo,
00:07:08clima,
00:07:09a melhor época para viajar para lá,
00:07:10entrada,
00:07:11e depois, tipo,
00:07:12quanto custa agora.
00:07:16E conforme clico nas coisas aqui à esquerda,
00:07:19sabe,
00:07:20ele me leva a essas diferentes cidades
00:07:21bem como todas as suas estatísticas.
00:07:23Então, no geral,
00:07:24bem legal.
00:07:24E você pode ver como ele também tem a Terra
00:07:26dividida em, sabe,
00:07:29sabe,
00:07:29dia e noite e tudo mais.
00:07:31Então, no geral,
00:07:31parece muito bom.
00:07:32Agora vamos dar uma olhada no Fable 5.
00:07:34Então, logo de cara,
00:07:36eu diria que esses gráficos
00:07:38parecem um pouco mais limpos, certo?
00:07:39Certo?
00:07:39Se compararmos os dois,
00:07:40isso parece um pouco mais nítido.
00:07:43Também temos um pouco de iluminação,
00:07:44o que é legal.
00:07:45Temos aquela mesma divisão
00:07:46de dia,
00:07:46noite e tudo mais,
00:07:47mas eu realmente posso,
00:07:49tenho uma roda de rolagem,
00:07:51uma coisinha bem aqui
00:07:52onde posso alternar entre dia e noite,
00:07:55o que é muito legal.
00:07:57Não consigo dar tanto zoom,
00:08:00mas consigo ver mais dessas cidades
00:08:02e parece um pouco mais fiel.
00:08:04Então, se eu clicar em uma delas,
00:08:06certo,
00:08:06o mesmo que antes,
00:08:08exibe algumas estatísticas.
00:08:09Latitude e longitude mostram as condições
00:08:11em termos de clima e hora
00:08:12e, de certa forma, qual é a tarifa.
00:08:15Mostra a tarifa de retorno,
00:08:16embora eu não tenha certeza total
00:08:17de onde isso realmente vem.
00:08:19Se eu clicar aqui na esquerda,
00:08:21a mesma coisa,
00:08:22me leva para essa cidade.
00:08:24Posso ver algumas das estatísticas,
00:08:25assim como o que custaria.
00:08:27Acho que, no geral,
00:08:29em termos de polimento da interface
00:08:33entre esses dois,
00:08:34acho que prefiro
00:08:36o que o Fable 5 apresentou,
00:08:38especialmente esse tipo de,
00:08:40sabe,
00:08:41coisa de dia versus noite
00:08:42que está acontecendo.
00:08:44E, curiosamente,
00:08:45parece que
00:08:46quando mudo onde é
00:08:48durante o dia,
00:08:48você pode ver que ele atualiza
00:08:50o custo
00:08:51no lado direito
00:08:52dependendo de quando você
00:08:53realmente pousaria lá.
00:08:55Então, muito bom.
00:08:56E agora vamos ver o GPT 5.6.
00:08:59Então, impressões iniciais,
00:09:01parece um retrocesso
00:09:02em relação ao que vimos
00:09:03com o Kimmy K3
00:09:04e o Fable
00:09:04em termos do globo em si.
00:09:06Tipo, esses globos
00:09:07definitivamente têm muito mais acontecendo
00:09:09e são muito mais
00:09:09um espetáculo visual.
00:09:11Este,
00:09:11acho que eles quase optaram por mais
00:09:12um visual de ficção científica.
00:09:15Que meio que tem tipo aleatório,
00:09:17é tipo,
00:09:17é para ser o quê?
00:09:19Ok.
00:09:20Então, a mesma coisa
00:09:21se eu clicar em certas cidades aqui,
00:09:23como Cingapura,
00:09:24isso aparece,
00:09:24mas meio que sobrepõe
00:09:26o próprio globo
00:09:27e tudo é tão pequeno em termos de texto,
00:09:29que é meio difícil até de ler.
00:09:31Eu tenho aqui na parte inferior
00:09:33tipo um dia versus noite
00:09:35tipo de varredura
00:09:36como tínhamos lá
00:09:37com o Fable 5,
00:09:39mas não é tão bom.
00:09:42E quando é noite,
00:09:43você meio que nem consegue ver
00:09:44o continente em si.
00:09:45Acho que aquelas luzes
00:09:46deveriam ser tipo cidades.
00:09:47Se eu clicar aqui na esquerda,
00:09:49sim,
00:09:50o mesmo que antes
00:09:51nos leva para essas cidades reais.
00:09:53Mas, novamente,
00:09:53definitivamente parece um passo atrás
00:09:54em relação aos dois últimos que vimos.
00:09:56Então, no geral,
00:09:56quando comparamos esses três,
00:09:57eu colocaria o Fable 5 na liderança.
00:10:00Não muito atrás,
00:10:02eu colocaria o Kimi K3
00:10:04e, em terceiro lugar,
00:10:05eu colocaria o GPT 5.6.
00:10:07Então agora vamos comparar tokens,
00:10:09tempo e custo
00:10:10porque vimos o resultado final,
00:10:11mas o que nós realmente
00:10:13tivemos que pagar por isso?
00:10:15Então tivemos o Kimi,
00:10:16tivemos o Fable
00:10:17e depois tivemos o Codex,
00:10:19que vou apenas chamar de X.
00:10:21Então, em termos de tokens,
00:10:24o Kimi foi de longe o mais pesado.
00:10:26Ele levou 21,5 milhões de tokens
00:10:30para chegar a isso.
00:10:31E em termos de tempo,
00:10:33levou uma hora
00:10:35e 33 minutos.
00:10:37Então, mais de 90 minutos
00:10:39para criar isso
00:10:39em 21,5 milhões de tokens.
00:10:42Custo,
00:10:42e tudo isso vindo
00:10:43do Open Router,
00:10:44foi de 8,66 dólares.
00:10:47Agora vamos falar sobre o Fable.
00:10:49Em termos de tokens,
00:10:50ele usou 3,5 milhões.
00:10:53Em termos de tempo,
00:10:55levou apenas 17 minutos
00:10:56e o custo total
00:10:58foi de 11,64.
00:11:00Então, novamente,
00:11:02sobre o que eu falei
00:11:02no início?
00:11:03Falamos sobre velocidade
00:11:04e eficiência de tokens.
00:11:06O Kimi K3 está claramente
00:11:07muito atrás do Fable
00:11:09nesse aspecto,
00:11:09especialmente quando se trata
00:11:11de tempo.
00:11:11E então, quando analisamos
00:11:12esse custo de token para token
00:11:14por milhão,
00:11:15foi tipo,
00:11:16oh,
00:11:16é um terço do custo
00:11:17do Fable.
00:11:18Bem,
00:11:19na realidade,
00:11:20nem tanto.
00:11:20Ainda é mais barato que o Fable.
00:11:22Não me entenda mal,
00:11:23mas nem de longe
00:11:25tão eficiente.
00:11:26Então tivemos o Codex,
00:11:27do qual fiquei meio
00:11:28decepcionado com seu resultado,
00:11:28para ser totalmente honesto.
00:11:29Levou 5,6 milhões de tokens.
00:11:32Para o tempo,
00:11:33levou 25 minutos
00:11:35e seu custo total
00:11:36foi de 5,66.
00:11:38Se você está se perguntando
00:11:39sobre tokens
00:11:40e custo
00:11:42e por que isso não
00:11:42se alinha exatamente
00:11:43para entradas
00:11:44versus saídas
00:11:44versus o que é anunciado,
00:11:46entenda que há muito
00:11:47cache acontecendo
00:11:48para todos esses três.
00:11:49Então, o que isso
00:11:51significa?
00:11:52Bem,
00:11:52a grande questão é o Kimi,
00:11:53certo?
00:11:55Muito pesado
00:11:56nos tokens
00:11:57e demorou uma eternidade.
00:11:59Levou uma hora
00:12:00e meia.
00:12:00Para ser sincero,
00:12:01quando eu estava fazendo este vídeo,
00:12:01eu pensei,
00:12:02ah,
00:12:02talvez eu faça tipo,
00:12:03sabe,
00:12:03três,
00:12:04talvez até quatro exemplos.
00:12:05Não,
00:12:06eu não vou ficar sentado aqui
00:12:07por 20 horas para fazer isso.
00:12:09E,
00:12:09sabe,
00:12:10tão atrás
00:12:11nesses dois lugares
00:12:12em relação aos modelos Frontier,
00:12:13mas no geral,
00:12:14seu resultado foi sólido.
00:12:15Sabe,
00:12:15achei que ele fez
00:12:16um trabalho muito bom,
00:12:17levando tudo em consideração.
00:12:18E o mais caro
00:12:19do grupo,
00:12:20obviamente,
00:12:20foi o Fable
00:12:21sendo o Fable
00:12:22o mais caro.
00:12:24Então, o que podemos realmente tirar
00:12:26de tudo isso?
00:12:27Bem,
00:12:27eu acho que o que podemos tirar,
00:12:29pelo menos aqui
00:12:29no lado do front-end,
00:12:31e que provavelmente se aplica
00:12:32da mesma forma à codificação
00:12:32se quisermos levar
00:12:33os benchmarks
00:12:33pelo valor nominal,
00:12:34é que o Kimi
00:12:36consegue competir.
00:12:37O Kimi K3
00:12:38é um modelo de código aberto
00:12:39que pode competir
00:12:40com o Fable na versão 5.6.
00:12:42No entanto,
00:12:43não é tão barato
00:12:45quanto você esperaria.
00:12:46Em certos casos,
00:12:47é mais caro.
00:12:49E é simplesmente lento.
00:12:51É tão lento.
00:12:54O que é, de certa forma,
00:12:55um fator decisivo
00:12:55para muitas pessoas,
00:12:56dependendo do que você está fazendo.
00:12:58Mas,
00:12:58se isso estiver bem para você,
00:13:01sabe,
00:13:02então talvez não seja
00:13:03uma desvantagem tão grande.
00:13:03Mas eu acho que
00:13:04a grande questão
00:13:05que acaba se perdendo
00:13:06nos benchmarks
00:13:06e nos números
00:13:07é realmente o custo.
00:13:08Certo?
00:13:09Porque não é
00:13:09tão barato
00:13:10quanto você esperaria
00:13:11por causa dessa
00:13:12ineficiência
00:13:12quando se trata
00:13:14de usar tokens de fato.
00:13:15Então, é aqui
00:13:16que eu vou deixar vocês.
00:13:16Espero ter conseguido
00:13:17esclarecer um pouco mais
00:13:18sobre o Kimi K3.
00:13:19Eu acho incrível.
00:13:20Temos um modelo de código aberto
00:13:21que pode competir.
00:13:22Mas não vamos nos precipitar
00:13:23em termos de
00:13:23sua potência bruta
00:13:24e, especificamente,
00:13:25seu custo.
00:13:26Tanto em termos de dinheiro
00:13:27quanto de tempo.
00:13:28Portanto,
00:13:29deixem nos comentários
00:13:30o que vocês acharam.
00:13:31Não deixem de conferir
00:13:31o Chase AIA Plus
00:13:32se vocês quiserem colocar as mãos
00:13:32no meu Masterclass de Cloud Code
00:13:33que também inclui
00:13:34um Masterclass de Codex
00:13:35atualmente.
00:13:36Além disso,
00:13:37nos vemos por aí.
00:13:39Até mais.