Inkling: Este modelo de pesos abertos quer ser ajustado

BBetter Stack
컴퓨터/소프트웨어창업/스타트업AI/미래기술

스크립트

00:00:00A Thinking Machines, a startup de 12 bilhões da ex-diretora de tecnologia da OpenAI, Mira Moretti, acaba de lançar o seu
00:00:05primeiro modelo. São 975 bilhões de parâmetros, licença Apache 2.0, e os pesos estão todos
00:00:12no Hugging Face para quem quiser baixar. E embora ele não esteja competindo com laboratórios de ponta
00:00:17como a Anthropic, o seu objetivo real é ser ajustado especificamente com a sua própria plataforma,
00:00:22o Tinker. Então, se você precisa de um modelo treinado para uma tarefa altamente específica,
00:00:25então este pode ser exatamente o que você procura. Hoje vamos abordar por que você iria querer usar
00:00:29este modelo especificamente e todas as razões pelas quais você faria o fine-tuning. E há uma maneira super
00:00:35interessante como este modelo processa áudio e vídeo, que eu nunca tinha visto antes. Então fique
00:00:40ligado que vamos cobrir isso também neste vídeo. E nós cobrimos tópicos de IA constantemente neste
00:00:44canal. Então, se você quiser ficar por dentro, inscreva-se no BetterStack.
00:00:52A Thinking Machines é muito transparente sobre o fato de que o seu novo modelo não é tão forte quanto basicamente
00:00:57qualquer modelo geral no mercado. E eles dizem isso no post de lançamento. Então eles estão apenas gerenciando
00:01:01expectativas e você pode ver o porquê nos benchmarks. Em seguimento de instruções, ele supera o GLM 5.2,
00:01:0779,8 contra 73,3. Mas no Terminal Bench, onde os agentes saem e realmente fazem o trabalho, ele é severamente superado
00:01:14com 63,8 a 82,7. Então ele é bom em seguir ordens, mas muito mais fraco em resolver as coisas por conta própria.
00:01:21No entanto, é um ótimo ponto de partida se a sua intenção for fazer o fine-tuning. Por baixo do capô, é uma mistura de
00:01:27especialistas. Então há 975 bilhões de parâmetros no total, mas cada camada possui 256 especialistas únicos e cada token
00:01:35é enviado para apenas seis deles, o que significa que apenas cerca de 41 bilhões de parâmetros estão fazendo algum trabalho a qualquer
00:01:41momento. Ele também é multimodal. Portanto, imagens, texto e áudio entram. E a forma como ele faz isso é muito
00:01:47diferente de qualquer modelo que você já viu antes. Normalmente, quando um modelo lida com áudio, por exemplo,
00:01:52há um modelo de fala separado na frente do modelo de linguagem que transcreve o texto e então
00:01:56passa essa transcrição para o modelo de linguagem. As imagens podem funcionar da mesma forma. Um codificador de visão analisa
00:02:02a imagem e cria uma descrição para ela, passando-a em seguida para o modelo de linguagem.
00:02:07E, claro, fazer isso significa que haverá alguma forma de perda de dados ao longo do caminho.
00:02:11O Inkling não faz nada disso. O áudio entra direto como um espectrograma, de modo que as bandas de frequência brutas do
00:02:16som são divididas em blocos. As imagens também entram como patches de 40 por 40 pixels. Ambos vão direto para o
00:02:23mesmo espaço onde vivem os tokens de texto e o modelo processa todos eles juntos. Portanto, nada é
00:02:28reduzido a texto. Assim, teoricamente, você deve ter muito menos perda de dados e compressão ao processar
00:02:35coisas como áudio e vídeo especificamente com o modelo Inkling. E de fato, em comparação com a maioria dos
00:02:40modelos generalistas que não suportam áudio bruto de forma alguma, o Inkling se destaca claramente. Agora, se você
00:02:46deve sequer fazer o fine-tuning, isso se resume aos seus objetivos específicos. A regra geral é que
00:02:50o fine-tuning ensina a um modelo como responder, não o que saber. Por exemplo, tom de voz ou saída
00:02:57estruturada rígida, onde milhares de exemplos seriam necessários no contexto para guiar a saída do modelo
00:03:02já que passar milhares de exemplos por meio de um prompt seria simplesmente impraticável. Além disso, custo e latência
00:03:08de destilação, onde executar uma tarefa restrita com um modelo geral seria consideravelmente mais caro
00:03:13do que fazer o fine-tuning em um modelo menor. Basicamente, se houver alguma situação em que você precise de milhares de
00:03:18exemplos para obter uma saída decente, então isso pode se beneficiar do fine-tuning. Mas se você precisa que o modelo saiba
00:03:23coisas que ele não sabe, então não faça o fine-tuning. Há na verdade um artigo muito citado que compara a recuperação
00:03:28ao fine-tuning e a recuperação vence consistentemente. E se você quer um melhor raciocínio, o fine-tuning pode
00:03:34na verdade piorá-lo, porque degrada a cadeia de pensamento do modelo. E curiosamente, os modelos menores
00:03:40sofrem mais. Mas especificamente para trabalhos restritos, os resultados do fine-tuning podem ser ótimos. Se pegarmos
00:03:46a Harvey, que cria ferramentas de IA para escritórios de advocacia, eles treinaram um modelo pequeno para extrair citações de documentos jurídicos.
00:03:52Eles pontuaram seu F1, que é uma métrica usada para avaliar o desempenho de um modelo de classificação. E o fine-tuning
00:03:58os levou de 0,56 para 0,68. E em um confronto direto contra o GPT-4o, o modelo menor venceu ou empatou 93%
00:04:07das vezes. E ainda rodou mais rápido. A Thinking Machines até mostra uma demonstração forçando o Inkling a nunca
00:04:12usar a letra E, onde você pode literalmente pedir para ele fazer o fine-tuning de si mesmo via Tinker. Ele então sai e
00:04:18cria o conjunto de dados de treinamento e pode executar todo o processo de fine-tuning de forma totalmente automática. E
00:04:24o resultado disso é um modelo que tem uma fobia severa da letra épsilon e, de alguma forma, as respostas ainda fazem sentido.
00:04:29Mas você não está retreinando o modelo inteiro aqui. Você está na verdade usando algo chamado LoRa,
00:04:32que significa adaptação de baixa rank (Low-Rank Adaptation). Em vez de treinar o modelo inteiro, o LoRa congela os pesos originais
00:04:38e injeta matrizes menores e leves para capturar novos dados específicos. Isso oferece vantagens de
00:04:44custo e velocidade para o pós-treinamento em comparação com o fine-tuning de um modelo inteiro, o que provavelmente seria
00:04:49impraticável. Agora, o Tinker já suporta vários modelos abertos como Qwen, Kimi, DeepSeek, NemoTron da Nvidia
00:04:55e GPT OSS da OpenAI. E o Inkling é um dos mais caros, então por que você se daria ao trabalho de usá-lo?
00:05:02Bem, há duas razões e já cobrimos um pouco delas. A primeira é o áudio. De todos os
00:05:06modelos na plataforma, o Inkling é o único que aceita áudio. Vários deles aceitam imagens,
00:05:11o Kimi e a maioria dos modelos Qwen lidam bem com visão, mas nenhum deles lida com
00:05:16som bruto. E eles também lançaram três receitas de exemplo para acompanhar isso, como reconhecimento de fala
00:05:20e classificação de estilo de fala. Assim, o modelo pode dizer como algo foi dito, e não apenas o que foi
00:05:26dito. E há também um exemplo médico treinado com receitas ditadas, ensinando nomes de medicamentos que
00:05:31a maioria dos modelos distorceria. A segunda é o esforço de pensamento. O Inkling permite definir o quanto ele
00:05:36pensa como um número de zero a um. A maioria dos modelos oferece uma chave de duas a três configurações. O GPT OSS
00:05:42oferece baixo, médio e alto, por exemplo, mas o Inkling oferece um controle deslizante completo. Então a grande
00:05:47pergunta é: você deveria realmente usá-lo? Bem, se você quer um modelo para rodar do jeito que vem, então este provavelmente
00:05:52não é o ideal. E eles mesmos deixam isso explícito. Mas se você tem uma tarefa
00:05:56específica e de alto volume, alguns dados rotulados reais e uma forma de avaliar a saída, fazer o fine-tuning de um pequeno modelo aberto é uma
00:06:02das coisas mais subestimadas que você pode fazer agora. E com plataformas como o Tinker, fica muito mais fácil.
00:06:07E se o Inkling é o que você deve testar, isso se resume ao que você está alimentando nele.
00:06:11Se houver áudio entrando, o Inkling é uma forte escolha e nada mais no Tinker aceita áudio
00:06:16bruto no momento. E se você está procurando o melhor modelo generalista aberto agora mesmo, acabamos de fazer um
00:06:21vídeo sobre o Kimi K3 que você pode assistir aqui, e ele obteve alguns resultados incríveis. Mas, de qualquer forma,
00:06:26obrigado por assistir. Eu sou o Warren do BetterStack e vejo você no próximo.

핵심 요약

O Inkling utiliza processamento multimodal de áudio bruto e uma arquitetura baseada em Mixture-of-Experts para otimizar tarefas específicas por meio de fine-tuning na plataforma Tinker.

하이라이트

  • A Thinking Machines lançou o Inkling, um modelo de pesos abertos com 975 bilhões de parâmetros sob a licença Apache 2.0 no Hugging Face.

  • O modelo processa áudio bruto diretamente como espectrograma e imagens como patches de 40 por 40 pixels, sem conversão prévia para texto.

  • A arquitetura Mixture-of-Experts emprega 256 especialistas por camada, direcionando cada token para apenas seis deles, o que resulta em 41 bilhões de parâmetros ativos por vez.

  • A técnica LoRa congela os pesos originais do modelo e injeta matrizes menores e leves para capturar dados específicos durante o pós-treinamento.

  • O Inkling é o único modelo na plataforma Tinker que aceita áudio bruto e permite um controle deslizante de zero a um para o esforço de pensamento.

타임라인

Lançamento e Arquitetura do Inkling

  • A Thinking Machines lançou o Inkling com 975 bilhões de parâmetros e licença Apache 2.0.
  • O desempenho em seguimento de instruções atinge 79,8 contra 73,3 do GLM 5.2, mas o Terminal Bench registra 63,8.
  • Cada camada possui 256 especialistas exclusivos que direcionam cada token para seis destinos.

O modelo foi desenvolvido pela startup da ex-diretora de tecnologia da OpenAI, Mira Moretti. A estrutura emprega uma mistura de especialistas onde apenas cerca de 41 bilhões de parâmetros realizam trabalho simultaneamente. Embora supere concorrentes no seguimento de instruções, o desempenho em tarefas autônomas de agentes é inferior.

Processamento Multimodal Direto

  • O áudio entra diretamente no modelo como um espectrograma em bandas de frequência brutas.
  • As imagens entram como patches de 40 por 40 pixels no mesmo espaço dos tokens de texto.
  • A ausência de transcrição prévia elimina a perda de dados associada a codificadores separados.

Modelos tradicionais dependem de sistemas separados para transcrever áudio ou descrever imagens antes de passá-los para a linguagem. O Inkling elimina essa etapa intermediária ao enviar áudio e vídeo diretamente para o espaço de processamento textual. Essa abordagem reduz a compressão e preserva os dados originais.

Diretrizes e Aplicações de Fine-Tuning

  • O fine-tuning altera a forma como o modelo responde, não o conhecimento pré-existente.
  • Ferramentas jurídicas como a Harvey aumentaram a métrica F1 de 0,56 para 0,68 após o treinamento.
  • O LoRa congela os pesos originais e insere matrizes leves para o pós-treinamento.

O fine-tuning adequa o tom de voz e saídas estruturadas, mas o uso inadequado para inserir fatos pode degradar a cadeia de raciocínio. O uso da técnica LoRa viabiliza o ajuste de modelos grandes sem a necessidade de retreinamento completo. A plataforma Tinker permite automação completa desse processo de adaptação.

Vantagens do Inkling na Plataforma Tinker

  • O Inkling é o único modelo no Tinker que aceita áudio bruto com receitas para reconhecimento de fala.
  • O controle do esforço de pensamento utiliza uma escala numérica de zero a um.
  • O modelo serve como opção ideal para tarefas específicas de alto volume com dados rotulados.

A plataforma Tinker abriga diversos modelos abertos, mas o Inkling destaca-se pelo suporte nativo a som bruto e controle detalhado de raciocínio. Casos de uso especializados, como terminologias médicas ou ditados de receitas, beneficiam-se diretamente dessa capacidade. Tarefas gerais de uso imediato encontram melhores resultados em outros modelos generalistas.

커뮤니티 글

모든 글 보기