Este Modelo de Código Aberto Corrige o Maior Defeito da IA (ThinkingCap)

BBetter Stack
Computing/SoftwareSmall Business/Startups

Transcript

00:00:00Esta é a mesma pergunta feita ao mesmo modelo base.
00:00:03Observem os contadores de tokens aqui.
00:00:05Um deles está gastando muito tempo raciocinando sobre a pergunta,
00:00:09enquanto o outro já concluiu a tarefa.
00:00:12E se verificarmos ambas as saídas, a resposta para a pergunta é basicamente a mesma.
00:00:16Mas o modelo à direita desperdiçou muito mais tokens para chegar à mesma conclusão.
00:00:21E isso é muito legal, porque a única diferença entre esses dois modelos
00:00:24é que o da esquerda está executando o Thinking Cap,
00:00:27uma versão personalizada e ajustada do mesmo modelo,
00:00:31que visa garantir que você obtenha saídas da mesma qualidade
00:00:34enquanto sacrifica menos tokens e chega à resposta duas vezes mais rápido.
00:00:39Então, no vídeo de hoje, vamos dar uma olhada no Thinking Cap,
00:00:42ver como ele funciona e depois vamos testá-lo nós mesmos
00:00:45para ver se esta é realmente uma abordagem inovadora para o ajuste fino de modelos de IA.
00:00:50Vai ser muito divertido, então vamos direto ao assunto.
00:00:57Antes de falarmos sobre o Thinking Cap, vamos voltar um pouco no tempo para ver como chegamos até aqui.
00:01:03O primeiro modelo amplamente disponível, o GPT-3, foi lançado em 2020,
00:01:09e no final de 2022,
00:01:11o ChatGPT colocou o GPT 3.5 à disposição do público em geral pela primeira vez.
00:01:17Foi quando o relacionamento da maioria das pessoas com a IA realmente começou.
00:01:21O GPT-4 veio em seguida em 2023, o que representou outro salto em capacidade,
00:01:25mas ele ainda mantinha fundamentalmente a mesma ideia.
00:01:28Prever o próximo token e responder imediatamente.
00:01:31Mas então, em setembro de 2024, a OpenAI lançou o o1,
00:01:37e este foi o primeiro modelo que usou um modo de pensamento antes de responder.
00:01:42Portanto, em vez de disparar uma resposta imediatamente,
00:01:45ele gastava tempo e tokens extras raciocinando sobre o problema primeiro.
00:01:49Essa única mudança arquitetônica inaugurou a era dos modelos de raciocínio.
00:01:54O DeepSeek R1 veio alguns meses depois
00:01:56e levou a mesma ideia para o mundo de código aberto.
00:02:00E muito rapidamente,
00:02:01o raciocínio se tornou o recurso que todos os principais fabricantes de modelos de IA estavam lançando.
00:02:05Mas agora, pouco mais de um ano depois,
00:02:08estamos começando a ver a tendência oposta surgir.
00:02:11Modelos ajustados especificamente para pensar menos, e não mais.
00:02:15De certa forma, estamos voltando ao básico,
00:02:17mas com tudo o que aprendemos na era do raciocínio embutido.
00:02:21Mas eis a questão.
00:02:22Essa mudança em direção a mais raciocínio resolveu um problema e silenciosamente criou outro.
00:02:28Ninguém realmente ensinou a esses modelos quando parar de pensar.
00:02:31Se você fizer uma pergunta genuinamente simples a um modelo de raciocínio,
00:02:34ele ainda gastará milhares de tokens,
00:02:37re-derivando coisas que ele já havia descoberto três frases atrás,
00:02:41reafirmando o mesmo ponto com palavras ligeiramente diferentes,
00:02:44ou no pior cenário, ele começará a entrar em loop.
00:02:48E digo isso quase literalmente.
00:02:50Deixe-me mostrar um dos exemplos mais ridículos com que me deparei.
00:02:54Este é o Step 3.5 Flash.
00:02:56E quando eu estava testando este modelo de raciocínio,
00:02:58eu apenas enviei uma única palavra: olá.
00:03:01E veja o que ele faz com isso.
00:03:03Ele passa vários parágrafos debatendo se é obrigado a se apresentar pelo seu nome exato de modelo,
00:03:09se “sempre usar o nome exato ao se apresentar” significa que ele deve se apresentar todas as vezes ou apenas quando decidir fazê-lo.
00:03:19Depois, ele avalia se mencionar a data de hoje é relevante.
00:03:22E eventualmente, após tudo isso, ele chega a uma resposta que qualquer um de nós teria digitado em cerca de dois segundos.
00:03:28Olá, sou o Step 3.5 Flash.
00:03:31Como posso ajudar você hoje?
00:03:33Portanto, isso não é realmente raciocínio.
00:03:35Esse é um modelo treinado para pensar, mas que nunca foi treinado para saber quando o pensamento terminou.
00:03:41Agora, a BottleCap AI é uma startup europeia focada especificamente em tornar a inferência mais eficiente.
00:03:47E o que eles fizeram com o Thinking Cap é francamente muito inteligente.
00:03:51Eles pegaram o modelo Qwen 3.6, a versão de 27 bilhões de parâmetros,
00:03:55e não estavam tentando torná-lo mais inteligente, nem ensinando novas habilidades, mudando sua personalidade ou mexendo no comportamento de segurança.
00:04:04A única coisa que eles queriam mudar era quanto computacionalismo ele gasta para chegar a uma resposta que ele já era capaz de dar.
00:04:11E isso parece simples, mas na verdade é mais difícil do que parece.
00:04:15Portanto, a maneira mais fácil de tornar um modelo mais rápido é simplesmente interromper seu raciocínio.
00:04:20Forçá-lo a parar após uma quantidade X de tokens, quer ele realmente tenha terminado ou não.
00:04:25Isso com certeza reduzirá a contagem de tokens.
00:04:27Mas também fará com que o modelo erre mais frequentemente, porque às vezes ele realmente precisa daqueles passos extras.
00:04:34Portanto, o verdadeiro desafio de engenharia aqui não é torná-lo mais curto.
00:04:38É torná-lo mais curto sem torná-lo secretamente mais burro.
00:04:42E aqui está como eles realmente fizeram isso.
00:04:44Partindo do ponto de verificação base do Qwen 3.6 de 27 bilhões de parâmetros,
00:04:48eles o treinaram em um conjunto curado de problemas que abrangem vários domínios e níveis de dificuldade.
00:04:55E em vez de recompensar o modelo por acertar a resposta,
00:04:58eles o recompensaram por acertar a resposta de forma eficiente.
00:05:02Porque se um modelo é recompensado apenas pela correção, ser prolixo não custa nada.
00:05:08Não há incentivo para parar de pensar cedo.
00:05:10Mas ao recompensar explicitamente a eficiência junto com a correção,
00:05:14o modelo aprende a reconhecer quando já tem o suficiente para se comprometer com uma resposta.
00:05:19Como resultado, eles obtiveram um modelo que se comporta de forma quase idêntica ao original.
00:05:23Agora vamos olhar para os números, porque é aqui que fica interessante.
00:05:27Em 12 benchmarks fora do domínio, ou seja, problemas que não faziam parte dos dados de treinamento,
00:05:33o Thinking Cap reduziu seus tokens de pensamento em uma média de 45,8%.
00:05:37E a precisão mal mudou.
00:05:40Ela variou em menos de um ponto percentual em média.
00:05:43E nos benchmarks que faziam parte do domínio de treinamento,
00:05:46a redução de tokens foi ainda maior, quase 58%.
00:05:49E especificamente no GSM8K, a precisão subiu de 93,3% para 96,5%.
00:05:58Eles também monitoraram algo chamado taxa de loop.
00:06:00Com que frequência um modelo fica preso reformulando o mesmo raciocínio repetidamente sem convergir,
00:06:06como acabamos de ver naquele exemplo do Step 3.5 Flash.
00:06:10Isso também caiu na maioria dos benchmarks,
00:06:12o que nos diz que muito do raciocínio extra que esses modelos estavam fazendo nunca foi realmente produtivo.
00:06:18Era apenas ruído que parecia esforço.
00:06:21Ok, números no papel são uma coisa, mas vamos testar isso nós mesmos.
00:06:26Então, estou executando este teste em uma máquina com uma RTX 5090 e 64 gigabytes de RAM.
00:06:32E vou fazer a mesma pergunta para ambos os modelos.
00:06:35Qual é o menor inteiro positivo n tal que n fatorial tenha exatamente 100 zeros à direita?
00:06:42E para chegar à resposta desta pergunta, ele precisa usar a fórmula de Legendre,
00:06:47cujo resultado para esta pergunta específica seria 405.
00:06:51Há apenas uma resposta correta.
00:06:53Não há meio-termo.
00:06:55Portanto, se obtivermos 405, sabemos que o modelo respondeu corretamente.
00:07:00Ok, primeiro vamos rodar o modelo padrão Qwen 3.6 quantizado de 27 bilhões de parâmetros
00:07:05e ver como ele se sai.
00:07:07E como você pode ver logo de cara, a velocidade de tokens não é tão ruim.
00:07:12Ele está com uma média de cerca de 60 tokens por segundo.
00:07:14Mas veja quanto esse modelo está pensando.
00:07:17É absolutamente ridículo.
00:07:20Já passamos de um minuto e ele continua gerando tokens apenas na parte de raciocínio.
00:07:26Tive que acelerar a visualização aqui porque o tempo total ultrapassou dois minutos.
00:07:30No entanto, no final, obtivemos o resultado correto, que é 405, o que é bom.
00:07:37Mas olhe o tempo total decorrido.
00:07:39São 140 segundos.
00:07:41E veja o consumo de tokens.
00:07:43Mais de 7.000 tokens foram gastos apenas no raciocínio, e meros 900 tokens foram gastos para escrever a resposta.
00:07:52Portanto, este exemplo demonstra claramente o quão exagerado e ridículo é o raciocínio do Qwen em cada solicitação.
00:07:59Agora vamos mudar para a versão Thinking Cap do mesmo modelo.
00:08:02E para constar, estamos usando o mesmo modelo de 27 bilhões de parâmetros com a mesma quantização.
00:08:08E como você pode ver aqui, estamos a 20 segundos e já terminamos o raciocínio.
00:08:13E apenas 9 segundos depois, obtemos a resposta, que neste caso também está correta: 405.
00:08:19E veja que diferença gritante.
00:08:21Não apenas gastamos menos de 2.000 tokens no total, dos quais apenas 1.100 foram alocados para o raciocínio,
00:08:30mas também obtivemos uma velocidade de tokens por segundo ligeiramente maior, de 62 tokens por segundo.
00:08:36Portanto, em todas as métricas, este modelo simplesmente supera o Qwen 3.6 base com folga.
00:08:42Ele é mais rápido, mais eficiente, custa menos tokens e dá a mesma resposta correta.
00:08:48Portanto, esta é uma melhoria bastante impressionante.
00:08:51E aqui está um detalhe do artigo deles que preciso mencionar, porque é genuinamente um acidente engraçado.
00:08:57O objetivo original deles era encolher apenas o rastro de pensamento, ou seja, a parte do raciocínio,
00:09:02enquanto mantinham a resposta final exatamente com o mesmo comprimento de antes.
00:09:06Mas eles tiveram um bug.
00:09:07O encurtamento se aplicou acidentalmente à resposta final também, e não apenas ao pensamento.
00:09:12Eles corrigiram o bug, mas aparentemente, internamente, todo mundo preferiu a versão com o bug.
00:09:18Então a teoria deles é que os humanos se cansavam de escrever respostas longas, então naturalmente comprimimos o que dizemos.
00:09:25E esses modelos nunca tiveram esse tipo de fadiga embutida até agora.
00:09:29Portanto, eles acabaram lançando a versão concisa com falha de qualquer maneira e guardaram a tecnicamente correta para uma versão futura.
00:09:37Aí está, pessoal.
00:09:38Esse é o Thinking Cap em resumo.
00:09:40Acho que a grande conclusão de tudo isso é que sempre acreditamos que quanto mais os modelos pensam, mais inteligentes eles são.
00:09:48Enquanto o Thinking Cap acabou de provar que esse não é necessariamente o caso.
00:09:53Uma vez que você realmente o treina para isso, você pode obter a mesma qualidade de saída por uma fração do custo, sem abrir mão de praticamente nada.
00:10:01Se você quiser testar o modelo por conta própria, ele está disponível gratuitamente no Hugging Face sob a licença Apache 2.0.
00:10:08E eu quero ouvir de vocês, pessoal.
00:10:10O que vocês acham dessa nova abordagem?
00:10:12Vocês conseguem ver prós ou contras nessa técnica?
00:10:15Deixem-nos saber na seção de comentários abaixo.
00:10:17E, pessoal, se vocês gostam desse tipo de análise técnica, por favor, me avistem esmagando o botão de Curtir embaixo do vídeo.
00:10:23E também, não se esqueçam de se inscrever no nosso canal.
00:10:26Este foi o Andres da BetterStack, e vejo vocês nos próximos vídeos.

Key Takeaway

O Thinking Cap reduz o tempo de raciocínio e o consumo de tokens em cerca de 45% a 58% sem sacrificar a precisão, resolvendo o problema de modelos de IA que entram em loop ou pensam excessivamente em perguntas simples.

Highlights

  • O Thinking Cap, uma versão ajustada do modelo Qwen 3.6 de 27 bilhões de parâmetros, reduz os tokens de pensamento em 45,8% em média em benchmarks fora do domínio.

  • A precisão do modelo ajustado variou em menos de um ponto percentual em média nos testes, mantendo a mesma qualidade de saída.

  • No benchmark GSM8K, a precisão do modelo subiu de 93,3% para 96,5% após a aplicação da técnica.

  • O modelo padrão Qwen 3.6 gastou mais de 7.000 tokens e 140 segundos para responder a uma pergunta matemática, enquanto a versão Thinking Cap concluiu a mesma tarefa em menos de 2.000 tokens e 29 segundos.

  • A BottleCap AI treinou o modelo recompensando explicitamente a eficiência junto com a correção, ensinando o sistema a parar de pensar quando já possui dados suficientes.

Timeline

A evolução e o problema atual dos modelos de raciocínio

  • Os modelos de raciocínio introduzidos em 2024 gastam tokens extras pensando antes de responder.
  • Nenhum mecanismo padrão ensina esses modelos quando o processo de pensamento deve terminar.
  • Perguntas simples frequentemente fazem com que os modelos entrem em loops de raciocínio redundantes.

A introdução de modelos como o OpenAI o1 mudou o paradigma da inteligência artificial ao priorizar o raciocínio pré-resposta. No entanto, a ausência de um limite natural para o pensamento gera desperdício severo de tokens em tarefas triviais. Exemplos práticos demonstram modelos gastando dezenas de parágrafos debatendo instruções básicas antes de emitir respostas simples.

A engenharia por trás do Thinking Cap

  • A startup BottleCap AI desenvolveu o Thinking Cap baseado no Qwen 3.6 de 27 bilhões de parâmetros.
  • O treinamento recompensa o modelo tanto pela correção quanto pela eficiência computacional.
  • Reduzir o raciocínio sem prejudicar a precisão exige evitar o corte arbitrário de tokens.

Interromper o raciocínio de forma abrupta prejudica a precisão do modelo. Para contornar esse obstáculo, os desenvolvedores treinaram o sistema em conjuntos de dados variados, premiando a rapidez na chegada à resposta correta. Essa abordagem ensina o modelo a reconhecer o momento exato em que possui informações suficientes para responder.

Testes práticos e resultados de desempenho

  • Em testes práticos com a fórmula de Legendre, o modelo base consumiu 140 segundos e mais de 7.000 tokens de raciocínio.
  • A versão Thinking Cap resolveu o mesmo problema matemático em 29 segundos utilizando menos de 2.000 tokens.
  • O modelo está disponível gratuitamente no Hugging Face sob a licença Apache 2.0.

A execução de testes comparativos em hardware local evidencia a superioridade da nova abordagem. Enquanto a versão tradicional gasta tempo excessivo gerando redundâncias, a versão otimizada entrega o mesmo resultado correto de 405 com maior velocidade por token. Um bug acidental no treinamento também comprimiu a resposta final, antecipando uma preferência humana natural por concisão.

Community Posts

View all posts