Este modelo de 600M corrige o que o Whisper deixa para trás

BBetter Stack
Computing/SoftwareInternet Technology

Transcript

00:00:00A conversão de fala em texto já é boa o suficiente para que a transcrição não seja o problema, mas a limpeza ainda é.
00:00:06Você pode jogar o GPT ou o Claude em cada transcrição bagunçada, ou usar um modelo de 600 milhões de parâmetros criado exatamente para isso.
00:00:14O Super Whisper acabou de lançar o S1 Mini. Ele roda totalmente local, limpa vícios de linguagem, correções, números e formatação.
00:00:22Além disso, ele é pequeno o suficiente para entrar direto no seu próprio pipeline de ASR.
00:00:26Eu testei e está na hora de te mostrar para onde tudo isso está indo.
00:00:30S1 Mini. É tudo sobre o pipeline, então pense nisso da seguinte forma.
00:00:39Sua fala vai para qualquer sistema de transcrição que você já esteja usando.
00:00:43Whisper, Whisper CPP, Parakeet, seu próprio serviço de ASR.
00:00:47Isso te dá o texto bruto.
00:00:50Então, o S1 Mini entra logo depois.
00:00:53Transcrição bruta entra, texto limpo sai.
00:00:56Ele remove vícios de linguagem como "hum", "eh", resolve falsos começos e autocorreções, e formata números, datas e endereços de e-mail.
00:01:06Você pode até controlar o tom da saída.
00:01:09E nada disso exige enviar sua transcrição para outra API.
00:01:12Acho que o valor principal é justamente esse.
00:01:16Eu não estou substituindo uma pilha de transcrição.
00:01:18Estou apenas adicionando uma pequena camada de limpeza a tudo isso.
00:01:21O Super Whisper também lançou o S1 Voice e o S1 Language, mas esses são os modelos em nuvem deles.
00:01:27Para nós, o S1 Mini é o mais interessante, porque ele é o modelo aberto.
00:01:32E ele pode rodar totalmente local, então vamos ver se realmente funciona.
00:01:36Se você gosta de ferramentas de programação para acelerar seu fluxo de trabalho, não deixe de se inscrever.
00:01:39Sempre temos vídeos novos saindo.
00:01:41Muito bem, agora estou rodando isso no meu Mac M4 Pro, e a primeira surpresa é o tamanho.
00:01:46Eu não preciso baixar nenhum modelo local gigante.
00:01:49A versão quantizada que estou usando tem cerca de 462 megabytes.
00:01:53Eu só peguei no Hugging Face e executei um comando curl para instalar.
00:01:57E como versões GGUF estão disponíveis, você pode rodá-lo com as ferramentas locais normais.
00:02:02Então Llama CPP, Ollama, LM Studio, a escolha é realmente sua.
00:02:07O que já se encaixa no seu fluxo de trabalho, mas aqui eu escolhi o Ollama, pois já o estava usando.
00:02:13Depois de instalar o modelo e criar um Modelfile simples na minha área de trabalho, posso disponibilizá-lo
00:02:18e executá-lo com o Ollama.
00:02:20Agora, lembre-se, este é um limpador de transcrições.
00:02:23Então vamos ver como é a limpeza aqui e como podemos integrá-la ao nosso fluxo de trabalho.
00:02:28Deixe-me dar a ele algo propositalmente ruim, ok?
00:02:31Aqui está a transcrição bruta.
00:02:33Você pode ver aqui que eu gaguejei em várias coisas.
00:02:36Eu tive, hã, está quebrado.
00:02:37Tudo isso está realmente acontecendo.
00:02:39E bem no final, eu digo envie um e-mail para support@betterstack.com.
00:02:43Isso tem basicamente tudo o que torna a conversão de fala em texto irritante.
00:02:47Tem um vício de linguagem no início, uma correção no meio.
00:02:50Há números falados.
00:02:52Há muita coisa acontecendo naquele endereço de e-mail que é dito em voz alta.
00:02:55Tudo isso é onde um LLM geral poderia facilmente fazer demais.
00:03:00Vamos ver o que o S1 Mini faz em vez disso.
00:03:02Execute-o através do modelo e pronto, aí está.
00:03:05E esses vícios de linguagem desaparecem instantaneamente, sem nenhum atraso.
00:03:08Ele entende que eu mudei de ideia no meio do caminho.
00:03:11O endereço de e-mail é formatado corretamente e o resultado fica muito mais parecido com algo que eu
00:03:17realmente quis digitar.
00:03:18Claro.
00:03:19Aqui estão alguns outros rápidos pelos quais posso passar.
00:03:22Temos um aqui.
00:03:23Ok.
00:03:24Ok, rápido.
00:03:25Outro aqui.
00:03:26Parecendo bom.
00:03:27E este aqui.
00:03:29Você pode ver que todos foram quase instantâneos e você pode ver a saída de todos eles com uma limpeza
00:03:34rápida.
00:03:35Ele não transforma de repente uma frase em um longo e ramificado e-mail.
00:03:39Ele deixa a maior parte do significado intacta.
00:03:41Ele apenas limpa a bagunça ao redor.
00:03:44E para limpeza de transcrições, é exatamente isso que eu quero.
00:03:47Agora, deixe-me integrar isso a um fluxo rápido aqui, porque seria legal colocar isso em outra
00:03:51camada real com alguma fala ao vivo.
00:03:53Eu tenho um áudio pré-gravado aqui no meu Mac.
00:03:56Tem cerca de 10 segundos.
00:03:57Vou usar o MLX Whisper, já que é limpo de rodar no meu Mac primeiro.
00:04:02Vamos transcrevê-lo aqui com esta execução.
00:04:05Então, quando eu rodo este comando aqui, ele faz a limpeza tão bem quanto e a gera em
00:04:09texto.
00:04:10Isso foi pegar meu arquivo de áudio real e trabalhar com ele.
00:04:14Agora, como o S1 Mini provavelmente não deveria ser o modelo principal na sua aplicação.
00:04:18Nós realmente não queremos isso.
00:04:19Faz mais sentido como uma pequena camada entre outras duas coisas.
00:04:23Imagine que você está construindo uma configuração de ditado totalmente local.
00:04:26O Whisper CPP lida com o áudio.
00:04:29O S1 Mini lida com a limpeza.
00:04:31Então o texto do arquivo vai direto para o seu editor, para que nada saia da nossa máquina.
00:04:35É isso.
00:04:36E é para lá que o S1 Mini deve ir.
00:04:38Texto bruto está entrando.
00:04:40Texto limpo está saindo.
00:04:42E há vários lugares onde isso importa mais do que parece, certo?
00:04:46Então, eu não sei.
00:04:46Peguemos agentes de programação.
00:04:47Limpe a correção antes que ela chegue ao agente, e a instrução se torna muito mais clara.
00:04:52O mesmo vale para mensagens do Slack escritas por voz.
00:04:54Tickets de suporte por e-mail.
00:04:56Notas de reunião.
00:04:57Em qualquer lugar onde você fala a entrada, mas quer que o resultado pareça texto escrito.
00:05:01Cada etapa de limpeza pode permanecer local.
00:05:04Não há chamada de API extra e transcrição indo para outro lugar.
00:05:08E há uma pergunta óbvia aqui.
00:05:10Se modelos grandes já fazem isso bem, por que estamos nos incomodando com este pequenininho?
00:05:14Claro, é.
00:05:15Você poderia absolutamente enviar a transcrição para o GPT, Claude ou um modelo Llama local, e eles
00:05:21provavelmente a limparem bem.
00:05:23Mas esse também é o problema aqui.
00:05:25Porque todos esses modelos podem, na verdade, fazer demais.
00:05:28Um LLM geral pode reescrever sua transcrição, resumí-la, expandi-la.
00:05:32Vocês já viram isso acontecer antes.
00:05:34Você sabe o que acontece quando damos algo assim a um LLM.
00:05:37Ele basicamente pode levar o texto em qualquer direção que quiser.
00:05:41O S1 Mini tem um trabalho muito menor.
00:05:43Pegar fala bagunçada, normalizá-la.
00:05:46É realmente só isso.
00:05:47Então agora estamos usando um modelo de 600 milhões de parâmetros projetado exatamente para esse tipo de transformação.
00:05:53Portanto, para esta única tarefa, você potencialmente obtém menor uso de recursos e menor latência.
00:05:57E se você estiver fazendo isso em escala, não há fatura de API de limpeza.
00:06:01Também vale a pena separar o S1 Mini de algo como o Whisper local.
00:06:05O Whisper resolve um problema.
00:06:07Áudio vira texto.
00:06:09O S1 Mini resolve o próximo.
00:06:12Esse texto se torna algo que parece que um ser humano o digitou ou escreveu intencionalmente.
00:06:17Então o pipeline é muito simples.
00:06:20Fala, transcrição bruta, texto limpo.
00:06:22O Whisper agora tem modelos para ambos os lados desse fluxo de trabalho.
00:06:25Mas a parte importante é que você não precisa usar toda a pilha deles.
00:06:28Você pode pegar o S1 Mini e inseri-lo na sua própria.
00:06:31E acho que é por isso que este modelo é mais interessante do que outro lançamento de LLM diminuto.
00:06:35Mas ei, isso não é perfeito.
00:06:36Há algumas limitações que precisamos conhecer antes de colocá-lo em algo importante.
00:06:40Agora as coisas boas.
00:06:41Bem, as coisas boas.
00:06:42Ele é minúsculo.
00:06:43Ele é rápido.
00:06:43Ele pode rodar totalmente local.
00:06:44Portanto, uma vez concluída a transcrição, não há ida e volta pela rede apenas para limpar o texto.
00:06:49Isso é uma grande vitória.
00:06:50Isso é especialmente forte no que é óbvio.
00:06:53Vícios de linguagem, autocorreções, números falados, formatação básica.
00:06:56Mas agora chegamos à primeira grande limitação.
00:06:59Ele é apenas em inglês no momento.
00:07:01Portanto, se o seu fluxo de trabalho precisa de limpeza de transcrições multilíngues, esta não é a ferramenta de hoje.
00:07:05Segundo, não confunda seu foco restrito com uma fraqueza.
00:07:08Você não está baixando o S1 Mini para substituir o Claude ou qualquer outra coisa.
00:07:12Se você quer raciocínio, sumarização ou um agente local geral, use o Claude.
00:07:17Use um modelo geral.
00:07:18O S1 Mini apenas limpa transcrições.
00:07:21Esse é o trabalho.
00:07:22E há outra distinção fácil de fazer.
00:07:24O S1 Mini não é o S1 Voice.
00:07:26O S1 Voice é o modelo de reconhecimento de fala em nuvem do Super Whisper.
00:07:30Essa é uma parte da pilha separada do que estou testando aqui.
00:07:34Toda a família S1 também é muito nova.
00:07:36Foi lançada em 19 de agosto, então eu ainda a trataria como software em estágio inicial.
00:07:41O modelo em si pode rodar de forma independente, então a questão simples torna-se bem direta.
00:07:46Quem deve realmente usar isso?
00:07:48Se você já roda conversão de fala em texto local, o S1 Mini faz muito sentido, especialmente se você
00:07:53estiver usando Whisper CPP, Parakeet ou seu próprio sistema ASR, e tem se perguntado o que
00:07:58fazer com a transcrição depois.
00:08:00Em vez de enviar tudo para um LLM completo de propósito geral, o que muitos de nós já fazem, você pode colocar
00:08:06este pequeno modelo logo após a transcrição e deixá-lo cuidar da limpeza.
00:08:10Se a privacidade importa, isso se torna mais útil.
00:08:12É local.
00:08:13Qualquer coisa que faça valer a pena enviar a transcrição para outro modelo em nuvem apenas para formatação parece desnecessária.
00:08:18Se você está processando muita fala, isso faz sentido.
00:08:20Todas essas pequenas limpezas são chamadas de API, então nós realmente não precisamos delas se estivermos usando
00:08:24o S1 Mini.
00:08:25Vou colocar a página do S1 Mini no Hugging Face na descrição se você quiser conferir por conta própria.
00:08:30Se você curte dicas e truques de programação como este, não deixe de se inscrever no canal BetterStack.
00:08:33Nos vemos em outro vídeo.

Key Takeaway

O modelo S1 Mini de 600 milhões de parâmetros processa transcrições brutas localmente para remover vícios de linguagem e formatar dados sem a necessidade de LLMs gerais ou APIs em nuvem.

Highlights

  • O modelo S1 Mini possui 600 milhões de parâmetros e roda totalmente local para limpar transcrições de fala em texto.

  • A versão quantizada do S1 Mini ocupa cerca de 462 megabytes e pode ser executada através de ferramentas locais como Ollama e Llama CPP.

  • O S1 Mini remove vícios de linguagem, resolve falsos começos, autocorreções e formata números, datas e endereços de e-mail instantaneamente.

  • A família de modelos S1 foi lançada em 19 de agosto e atualmente o S1 Mini suporta apenas o idioma inglês.

  • O modelo funciona como uma camada intermediária entre o sistema ASR bruto e o editor de texto, preservando a privacidade e eliminando chamadas de API.

Timeline

Apresentação do S1 Mini para limpeza de transcrições

  • O Super Whisper lançou o S1 Mini, um modelo de 600 milhões de parâmetros voltado especificamente para a limpeza de transcrições.
  • O pipeline local recebe o texto bruto de sistemas ASR como Whisper ou Parakeet e entrega um texto limpo.
  • O modelo remove vícios de linguagem, corrige autocorreções e formata dados sem o envio de dados para APIs externas.

A conversão de fala em texto já é eficiente, mas a limpeza do texto transcrito continua sendo um desafio. O S1 Mini atua exatamente nessa etapa intermediária, eliminando ruídos conversacionais e mantendo a operação totalmente local.

Configuração e testes do modelo local

  • A versão quantizada do S1 Mini possui 462 megabytes e roda em hardware como um Mac M4 Pro.
  • O modelo é compatível com ferramentas locais comuns, incluindo Ollama, Llama CPP e LM Studio.
  • A limpeza de transcrições com erros intencionais e endereços de e-mail complexos ocorre de forma instantânea e precisa.

A instalação do modelo é feita a partir do Hugging Face com comandos simples e integração via Ollama. Testes práticos com transcrições contendo gaguejiras e dados técnicos demonstram que o S1 Mini remove os vícios sem alterar o significado original do texto.

Integração em fluxos de trabalho e limitações

  • O S1 Mini encaixa-se perfeitamente em configurações de ditado local, agentes de programação e mensagens de voz.
  • O modelo evita que LLMs gerais realizem alterações excessivas ou resumos indesejados no texto transcrito.
  • A principal limitação atual é o suporte exclusivo ao idioma inglês e o estágio inicial do software lançado em 19 de agosto.

Diferente de modelos de propósito geral que podem reescrever ou expandir excessivamente o texto, o S1 Mini foca exclusivamente na normalização de fala bagunçada. Embora seja restrito ao inglês no momento, ele elimina custos de API e garante total privacidade para processamento em larga escala.

Community Posts

No posts yet. Be the first to write about this video!

Write about this video