스크립트
00:00:00O Kimi K3 chegou e, honestamente, este é surpreendente. Ele não apenas alcançou o Opus e o
00:00:04GPT 5.5, ele alcançou o Fable e o GPT 5.6. Os modelos abertos não estão tão atrás quanto pensávamos
00:00:10no início. Vamos dar uma olhada. Vamos começar com o anúncio. O Kimi K3 é um modelo de 2,8 trilhões
00:00:19de parâmetros construído sobre o Kimi Delta Retention e Attention Residuals com recursos nativos
00:00:24de visão e uma janela de contexto de 1 milhão de tokens. É o primeiro modelo aberto de classe de 3 trilhões do mundo
00:00:29projetado para inteligência de ponta em codificação de longo prazo, trabalho de conhecimento e raciocínio.
00:00:34Em todos os benchmarks que eles mostram neste blog, o Kimi K3 está logo atrás do Fable
00:00:38e do GPT 5.6 Soul, ou até mesmo os vencendo em algumas outras áreas. Esse salto é tão absurdo
00:00:43que acho que pouca gente previu. Mas, obviamente, isso é no benchmark deles, então vamos dar
00:00:47uma olhada na inteligência artificial e nos de terceiros, e fico feliz em dizer que os resultados praticamente
00:00:52correspondem. Neste benchmark, vemos que cerca de 80% de vocês que estão assistindo não são inscritos,
00:00:56então clique no botão de se inscrever se quiser ficar por dentro de tudo sobre desenvolvimento de software
00:01:00e IA. Mas vamos aos benchmarks reais, começando com o índice de codificação: ele pontua 76,2
00:01:06nisso, ficando 0,3 pontos atrás do Fable 5, e ligeiramente acima do GPT 5.5, do Opus 4.8 e
00:01:12do GPT 5.6 Luna, e perde por muito pouco para o GPT 5.6 Soul e Terra. Vejam só o salto que eles
00:01:19deram em relação ao último modelo. Se olharmos para o índice de agentes, é a mesma história.
00:01:23Ele fica em terceiro aqui, perdendo apenas para o Fable e o Soul, mas isso ainda é muito impressionante e vocês já estão
00:01:29acostumados com isso, mas é exatamente igual no índice de inteligência também. Então, até os
00:01:32benchmarks de terceiros confirmam que este modelo é incrível. Infelizmente, ainda não temos os resultados do Deep SWE até
00:01:38o momento desta gravação, mas se olharmos para os nossos próprios benchmarks, ele ficou em terceiro de novo.
00:01:42Esse modelo parece bom demais para ser verdade. O único ponto negativo que encontro nele é
00:01:46que ele é um pouco caro. A menos que você tenha um supercomputador em casa, não acho que vá
00:01:50rodá-lo localmente, então pela API ele custa US$ 3 por
00:01:54milhão de tokens de entrada e US$ 15 por milhão de tokens de saída. É um aumento considerável em relação ao Kimi K 2.6
00:02:00e fica na mesma faixa de preço do Sonic 5 sem o desconto, mas é mais barato que o Fable 5,
00:02:06Opus e GPT 5.6. Mas o preço da API não é tudo, então se olharmos na prática com o custo
00:02:12por tarefa, ele é semelhante ao GPT 5.6 Soul e tem quase metade do preço do Opus 4.8 e, claro,
00:02:17é mais barato que o Fable e o Sonic 5. Portanto, é competitivo com esses modelos fechados de ponta, mas
00:02:22para quem prefere modelos abertos por serem um pouco mais baratos, este modelo provavelmente
00:02:26não será a melhor escolha. O GLM 5.2 é a segunda melhor opção e custa metade do preço. Ele também não é o
00:02:31modelo mais rápido de todos, mas me parece bastante competitivo para esse nível de inteligência.
00:02:36No geral, é bem difícil falar mal desse modelo, então vamos direto para alguns dos meus testes locais.
00:02:40O primeiro teste que fiz com esses modelos foi pedir para criar um
00:02:44jogo de corrida de Fórmula 1 completo em 3.js dentro de um único index.html. Este aqui é o Kimi K3 rodando
00:02:50via Open Router. Também testei no CLI Kimi Code para ver se a interface muda alguma
00:02:56coisa. Vocês podem ver aqui que ele pensou por 14 minutos antes de começar e, no total, levou
00:03:0035 minutos para criar este web app em 3.js, custando US$ 1,24 em tokens de API. E os resultados que obtive são
00:03:06bem impressionantes. Obviamente ele não tem acesso a arquivos externos, então fez o melhor que pôde para criar
00:03:11esses modelos. Mas a pista funciona. Temos corredores de IA que parecem conseguir dar a volta na
00:03:16pista. As barreiras funcionam, então não consigo atravessá-las. Nossa posição é atualizada.
00:03:21O mapa é atualizado. O tempo atual e as voltas também são atualizados. Eu dei
00:03:25uma volta completa e confirmo que tudo funciona. É um resultado excelente para o que o Kimi K3 entregou.
00:03:30Como eu disse, também testei interfaces diferentes. Este é o Kimi K3, mas no Kimi Code. E este aqui,
00:03:35eu diria, ficou um pouco mais bonito. Ele fez um trabalho melhor com os recursos, embora seja só uma
00:03:39guia de estilo. Há um pouco de lag com esses modelos, mas a jogabilidade é ligeiramente melhor.
00:03:43Os controles ainda estão invertidos, o que parece ser um padrão em muitas aplicações em 3.js por algum
00:03:48motivo. Mas, novamente, tudo roda muito bem e tem recursos como sair da
00:03:52pista desacelerar o carro. E sim, ele fez um trabalho bem impressionante. Mas agora vamos
00:03:57comparar isso com os modelos de ponta. Temos o Fable 5 aqui no Claude Code no modo “max”, que levou
00:04:0144 minutos para criar o app em 3.js. Também testamos o GPT 5.6 Sol no modo “max”. E este
00:04:07levou 18 minutos. Este é o resultado do Fable. Temos o Fable GP aqui. E eu diria
00:04:12que talvez pareça um pouco mais bonito. Mas, de novo, é apenas uma escolha estética. E os controles
00:04:17não estão invertidos neste aqui. Há também um leve tremor de câmera, o que acho um detalhe
00:04:22muito legal. E tudo parece funcionar neste aqui, como nos outros. Testei dar
00:04:26uma volta completa, por mais difícil que seja. Também temos colisões aqui, como podem ver. Mas sim,
00:04:31tudo parece estar funcionando e é bem comparável ao que o Kimi K3 nos deu. A história é parecida
00:04:35com o GPT 5.6 Sol. Como podem ver, temos um jogo funcional aqui. Embora a estrada aqui
00:04:40seja de grama. Ele não renderizou a pista de fato. Mas tudo parece estar funcionando. Os controles
00:04:44estão invertidos neste também. E temos alguns elementos invertidos. Não sei por que esses modelos
00:04:48gostam de fazer isso. O único que não fez foi o Fable. Além disso, a pista aqui fica um pouco
00:04:53bagunçada. Esse foi o único que não criou uma pista funcional. Para uma comparação
00:04:57final, também testei o GLM 5.2, que é o próximo melhor modelo aberto. E este
00:05:02pensou por 5 minutos e 58 segundos. Embora não tenha terminado em um único prompt. Houve
00:05:07alguns bugs, então precisei enviar outro prompt. Mesmo quando finalmente fiz o jogo rodar,
00:05:11dá para ver que há muitos bugs. Primeiro, não começamos na direção certa da pista.
00:05:15E nem sequer existe uma pista de verdade. Além de parecer bem pior do que os outros.
00:05:20Portanto, há uma grande evolução quando subimos para o Kimi K3. Passando para o teste 2,
00:05:25pedi um painel de controle de finanças pessoais. Isso criará uma aplicação full-stack com front-end
00:05:29e back-end. A única coisa que pedi para não incluir foi autenticação. E também pedi para gerar alguns dados.
00:05:33Fiz este teste novamente via Open Router com o K3, e depois no Kimi Code. Este aqui é no Open
00:05:38Router, e vocês podem ver que levou 56 minutos no total para criar a aplicação. E custou
00:05:43US$ 1,30. Mas este foi o resultado obtido. E honestamente, não posso reclamar.
00:05:48É exatamente o que pedi. É um painel de controle financeiro pessoal. Eu diria que ficou
00:05:53muito bonito também. E temos todos os recursos, como páginas adicionais. Eu
00:05:57testei adicionar fundos e enviar dinheiro. Tudo funciona. Ele fez um ótimo trabalho. Também
00:06:01fico curioso para ver quais ferramentas ele usou, já que não dou nenhuma
00:06:05instrução sobre a stack que deve usar no prompt. No front-end, ele optou por
00:06:09React e React DOM. Ele não usou nenhum roteador nem nada parecido. Ele mesmo criou o
00:06:12seu próprio sistema de visualização. Eu preferiria que tivesse usado algo como React Router,
00:06:16TanStack ou Next.js. E no back-end, ele também construiu o próprio servidor. Acredito que
00:06:21este esteja usando Express.js, como vemos aqui embaixo. Mas ele criou o banco de dados usando apenas um
00:06:26arquivo JSON. Não usou SQLite, drizzle ou nada do tipo, o que eu gostaria de
00:06:31ver se fôssemos escalar este app no futuro. Mas, obviamente, eu poderia ter
00:06:35especificado isso no prompt. Mas gosto de ver o que eles escolhem por padrão. Este é o
00:06:38resultado que obtive usando o K3 pelo Kimi Code. E dá para ver que é um pouco mais simples.
00:06:43Tem apenas uma página e não tem a barra lateral. Mas todos os recursos funcionam e ele tem
00:06:47um visual parecido com o do Open Router. No entanto, analisando o código, eu
00:06:51prefiro o que o Kimi Code nos entregou com o K3. O front-end é bem parecido, onde
00:06:55apenas usa React sem biblioteca de rotas. Mas o servidor usou de fato um banco de dados. Dá para ver
00:06:59que foi feito em Express. Temos um banco de dados financeiro e ele está usando Node
00:07:04SQLite. Comparando isso com os modelos de ponta, este aqui é o Fable 5 no Claude Code.
00:07:08Vejam que ele trabalhou por 56 minutos no esforço máximo. Também tenho o GPT 5.6 Soul Max
00:07:13que pensou por 31 minutos para criar a aplicação. Aqui está o resultado do Fable 5 e,
00:07:17honestamente, o design é bem parecido. Afinal, não há muito mais a se inventar em um
00:07:21painel de finanças pessoais. E todas as funções funcionam. Ele adotou um estilo
00:07:25diferente para as fontes, o que tenho visto o Fable e o Opus fazerem bastante ultimamente. Parece que estão
00:07:29treinando os modelos para se distanciarem do visual clássico de IA e criando um estilo
00:07:34novo. Este parece ser o escolhido por eles. Eu diria que esses gráficos são um pouco
00:07:38menos úteis do que os gerados pelo Kimi K3. Mas no geral é bem parecido e funciona
00:07:43basicamente da mesma forma. Até o código é bem semelhante. Vemos que ele escolheu React para o front-end
00:07:47e também não usou biblioteca de rotas, criando a sua própria. E no banco de dados,
00:07:51ele conseguiu usar um banco de dados de forma adequada. Usamos Node SQLite neste também. E para o
00:07:57servidor de fato, roda apenas Express. Passando para o GPT 5.6 Soul. Este é meio
00:08:02curioso. É sem dúvida o meu design favorito de todos. E mais uma vez, todas as funções estão
00:08:06funcionando. Me digam se concordam que é o melhor design. Mas a parte estranha está no código.
00:08:11Este é certamente o código de aplicação mais completo que vimos nestes exemplos. Ele
00:08:15de fato criou uma aplicação Next.js completa e utilizou o Drizzle, exatamente como eu faria. E usou Next.js
00:08:20tanto para o front-end quanto para o servidor. Mas a parte que acho um pouco estranha é que ele
00:08:24escolheu hospedar no Cloudflare, o que não é estranho em si, mas usou uma integração recente do Next. E não
00:08:29que eu não recomendaria isso, mas acho que ainda não foi muito testado. E é bem
00:08:33recente, o que mostra que estão direcionando o GPT 5.6 Soul para usá-lo. Só posso especular o motivo,
00:08:38mas parece ser porque é assim que os sites do ChatGPT funcionam de fato. Vocês podem
00:08:42ver que ele decidiu hospedar isso para mim no recurso de sites do ChatGPT, embora eu não tenha pedido.
00:08:47Pessoalmente, não gosto muito disso quando estou programando um app. Não quero
00:08:50que ele hospede para mim, prefiro gerenciar isso eu mesmo. Mas eu poderia ter pedido isso no
00:08:54prompt. Eu preferiria ter que solicitar a hospedagem em vez do contrário.
00:08:58O resultado final que tenho aqui é o GLM 5.2, e ele fez algo bem parecido com o que o Kimi K3
00:09:04fez no Kimi Code, criando apenas uma página única. Mas todos os recursos funcionam e eu
00:09:08acho esse design bem bonito. O GLM 5.2 levou 15 minutos para fazer isso e custou
00:09:13US$ 1,11. Quanto ao código em si, o GLM 5.2 também optou pelo caminho do Next.js,
00:09:19o que eu realmente gosto. Mas ele criou uma store própria em vez de usar um banco de dados, então tudo fica
00:09:24apenas na memória em JavaScript. Pelo meu teste rápido, acho que o Kimi K3 bate de frente com o Fable
00:09:29e o GPT 5.6 Sol, fazendo jus ao hype gerado pelos benchmarks. E honestamente, está ficando
00:09:33bem difícil mostrar o quão potentes são esses modelos em uma demonstração em vídeo. Você precisa
00:09:38usá-los ao longo de uma semana em um ambiente de produção real para notar de fato a qualidade
00:09:42do código. Se tiverem ideias de testes que eu possa demonstrar em vídeo e que realmente
00:09:46coloquem esses modelos à prova, deixem nos comentários abaixo. Também quero
00:09:50mostrar alguns dos exemplos apresentados no blog técnico deles. Vemos que o Kimi
00:09:53K3 criou este jogo aqui, mas utilizou outra ferramenta para gerar os recursos visuais, então o caubói e o
00:09:58cavalo não foram gerados pelo K3, vieram de outro lugar. Mas ele fez um trabalho excelente
00:10:03com isso em 3.js. Outra coisa absurda é este projeto de chip. Vocês podem ver que, como prova de
00:10:08conceito inicial, o Kimi K3 projetou um chip para rodar um nano modelo baseado em sua própria arquitetura. Em uma única
00:10:13execução autônoma de 48 horas, o K3 construiu, otimizou e verificou o chip usando ferramentas de código aberto. Espero
00:10:19que tenham visto que este modelo é incrível e com certeza será um duro golpe para
00:10:23esses laboratórios de modelos fechados. Ou pelo menos será quando liberarem os pesos de fato. Eles ainda não
00:10:27os liberaram, mas planejam fazer isso. Então espero que os vejamos em breve. O que vocês acham
00:10:32disso? Esperavam que um laboratório chinês alcançasse tão rápido? Esse modelo interessa a vocês?
00:10:36Deixem nos comentários abaixo. Aproveitem para se inscrever e, como sempre, até a próxima!