스크립트
00:00:00A Thinking Machines, a startup de 12 bilhões da ex-diretora de tecnologia da OpenAI, Mira Moretti, acaba de lançar o seu
00:00:05primeiro modelo. São 975 bilhões de parâmetros, licença Apache 2.0, e os pesos estão todos
00:00:12no Hugging Face para quem quiser baixar. E embora ele não esteja competindo com laboratórios de ponta
00:00:17como a Anthropic, o seu objetivo real é ser ajustado especificamente com a sua própria plataforma,
00:00:22o Tinker. Então, se você precisa de um modelo treinado para uma tarefa altamente específica,
00:00:25então este pode ser exatamente o que você procura. Hoje vamos abordar por que você iria querer usar
00:00:29este modelo especificamente e todas as razões pelas quais você faria o fine-tuning. E há uma maneira super
00:00:35interessante como este modelo processa áudio e vídeo, que eu nunca tinha visto antes. Então fique
00:00:40ligado que vamos cobrir isso também neste vídeo. E nós cobrimos tópicos de IA constantemente neste
00:00:44canal. Então, se você quiser ficar por dentro, inscreva-se no BetterStack.
00:00:52A Thinking Machines é muito transparente sobre o fato de que o seu novo modelo não é tão forte quanto basicamente
00:00:57qualquer modelo geral no mercado. E eles dizem isso no post de lançamento. Então eles estão apenas gerenciando
00:01:01expectativas e você pode ver o porquê nos benchmarks. Em seguimento de instruções, ele supera o GLM 5.2,
00:01:0779,8 contra 73,3. Mas no Terminal Bench, onde os agentes saem e realmente fazem o trabalho, ele é severamente superado
00:01:14com 63,8 a 82,7. Então ele é bom em seguir ordens, mas muito mais fraco em resolver as coisas por conta própria.
00:01:21No entanto, é um ótimo ponto de partida se a sua intenção for fazer o fine-tuning. Por baixo do capô, é uma mistura de
00:01:27especialistas. Então há 975 bilhões de parâmetros no total, mas cada camada possui 256 especialistas únicos e cada token
00:01:35é enviado para apenas seis deles, o que significa que apenas cerca de 41 bilhões de parâmetros estão fazendo algum trabalho a qualquer
00:01:41momento. Ele também é multimodal. Portanto, imagens, texto e áudio entram. E a forma como ele faz isso é muito
00:01:47diferente de qualquer modelo que você já viu antes. Normalmente, quando um modelo lida com áudio, por exemplo,
00:01:52há um modelo de fala separado na frente do modelo de linguagem que transcreve o texto e então
00:01:56passa essa transcrição para o modelo de linguagem. As imagens podem funcionar da mesma forma. Um codificador de visão analisa
00:02:02a imagem e cria uma descrição para ela, passando-a em seguida para o modelo de linguagem.
00:02:07E, claro, fazer isso significa que haverá alguma forma de perda de dados ao longo do caminho.
00:02:11O Inkling não faz nada disso. O áudio entra direto como um espectrograma, de modo que as bandas de frequência brutas do
00:02:16som são divididas em blocos. As imagens também entram como patches de 40 por 40 pixels. Ambos vão direto para o
00:02:23mesmo espaço onde vivem os tokens de texto e o modelo processa todos eles juntos. Portanto, nada é
00:02:28reduzido a texto. Assim, teoricamente, você deve ter muito menos perda de dados e compressão ao processar
00:02:35coisas como áudio e vídeo especificamente com o modelo Inkling. E de fato, em comparação com a maioria dos
00:02:40modelos generalistas que não suportam áudio bruto de forma alguma, o Inkling se destaca claramente. Agora, se você
00:02:46deve sequer fazer o fine-tuning, isso se resume aos seus objetivos específicos. A regra geral é que
00:02:50o fine-tuning ensina a um modelo como responder, não o que saber. Por exemplo, tom de voz ou saída
00:02:57estruturada rígida, onde milhares de exemplos seriam necessários no contexto para guiar a saída do modelo
00:03:02já que passar milhares de exemplos por meio de um prompt seria simplesmente impraticável. Além disso, custo e latência
00:03:08de destilação, onde executar uma tarefa restrita com um modelo geral seria consideravelmente mais caro
00:03:13do que fazer o fine-tuning em um modelo menor. Basicamente, se houver alguma situação em que você precise de milhares de
00:03:18exemplos para obter uma saída decente, então isso pode se beneficiar do fine-tuning. Mas se você precisa que o modelo saiba
00:03:23coisas que ele não sabe, então não faça o fine-tuning. Há na verdade um artigo muito citado que compara a recuperação
00:03:28ao fine-tuning e a recuperação vence consistentemente. E se você quer um melhor raciocínio, o fine-tuning pode
00:03:34na verdade piorá-lo, porque degrada a cadeia de pensamento do modelo. E curiosamente, os modelos menores
00:03:40sofrem mais. Mas especificamente para trabalhos restritos, os resultados do fine-tuning podem ser ótimos. Se pegarmos
00:03:46a Harvey, que cria ferramentas de IA para escritórios de advocacia, eles treinaram um modelo pequeno para extrair citações de documentos jurídicos.
00:03:52Eles pontuaram seu F1, que é uma métrica usada para avaliar o desempenho de um modelo de classificação. E o fine-tuning
00:03:58os levou de 0,56 para 0,68. E em um confronto direto contra o GPT-4o, o modelo menor venceu ou empatou 93%
00:04:07das vezes. E ainda rodou mais rápido. A Thinking Machines até mostra uma demonstração forçando o Inkling a nunca
00:04:12usar a letra E, onde você pode literalmente pedir para ele fazer o fine-tuning de si mesmo via Tinker. Ele então sai e
00:04:18cria o conjunto de dados de treinamento e pode executar todo o processo de fine-tuning de forma totalmente automática. E
00:04:24o resultado disso é um modelo que tem uma fobia severa da letra épsilon e, de alguma forma, as respostas ainda fazem sentido.
00:04:29Mas você não está retreinando o modelo inteiro aqui. Você está na verdade usando algo chamado LoRa,
00:04:32que significa adaptação de baixa rank (Low-Rank Adaptation). Em vez de treinar o modelo inteiro, o LoRa congela os pesos originais
00:04:38e injeta matrizes menores e leves para capturar novos dados específicos. Isso oferece vantagens de
00:04:44custo e velocidade para o pós-treinamento em comparação com o fine-tuning de um modelo inteiro, o que provavelmente seria
00:04:49impraticável. Agora, o Tinker já suporta vários modelos abertos como Qwen, Kimi, DeepSeek, NemoTron da Nvidia
00:04:55e GPT OSS da OpenAI. E o Inkling é um dos mais caros, então por que você se daria ao trabalho de usá-lo?
00:05:02Bem, há duas razões e já cobrimos um pouco delas. A primeira é o áudio. De todos os
00:05:06modelos na plataforma, o Inkling é o único que aceita áudio. Vários deles aceitam imagens,
00:05:11o Kimi e a maioria dos modelos Qwen lidam bem com visão, mas nenhum deles lida com
00:05:16som bruto. E eles também lançaram três receitas de exemplo para acompanhar isso, como reconhecimento de fala
00:05:20e classificação de estilo de fala. Assim, o modelo pode dizer como algo foi dito, e não apenas o que foi
00:05:26dito. E há também um exemplo médico treinado com receitas ditadas, ensinando nomes de medicamentos que
00:05:31a maioria dos modelos distorceria. A segunda é o esforço de pensamento. O Inkling permite definir o quanto ele
00:05:36pensa como um número de zero a um. A maioria dos modelos oferece uma chave de duas a três configurações. O GPT OSS
00:05:42oferece baixo, médio e alto, por exemplo, mas o Inkling oferece um controle deslizante completo. Então a grande
00:05:47pergunta é: você deveria realmente usá-lo? Bem, se você quer um modelo para rodar do jeito que vem, então este provavelmente
00:05:52não é o ideal. E eles mesmos deixam isso explícito. Mas se você tem uma tarefa
00:05:56específica e de alto volume, alguns dados rotulados reais e uma forma de avaliar a saída, fazer o fine-tuning de um pequeno modelo aberto é uma
00:06:02das coisas mais subestimadas que você pode fazer agora. E com plataformas como o Tinker, fica muito mais fácil.
00:06:07E se o Inkling é o que você deve testar, isso se resume ao que você está alimentando nele.
00:06:11Se houver áudio entrando, o Inkling é uma forte escolha e nada mais no Tinker aceita áudio
00:06:16bruto no momento. E se você está procurando o melhor modelo generalista aberto agora mesmo, acabamos de fazer um
00:06:21vídeo sobre o Kimi K3 que você pode assistir aqui, e ele obteve alguns resultados incríveis. Mas, de qualquer forma,
00:06:26obrigado por assistir. Eu sou o Warren do BetterStack e vejo você no próximo.