Este modelo de 600M corrige o que o Whisper deixa para trás
BBetter Stack
Computing/SoftwareInternet Technology
Transcript
00:00:00A conversão de fala em texto já é boa o suficiente para que a transcrição não seja o problema, mas a limpeza ainda é.
00:00:06Você pode jogar o GPT ou o Claude em cada transcrição bagunçada, ou usar um modelo de 600 milhões de parâmetros criado exatamente para isso.
00:00:14O Super Whisper acabou de lançar o S1 Mini. Ele roda totalmente local, limpa vícios de linguagem, correções, números e formatação.
00:00:22Além disso, ele é pequeno o suficiente para entrar direto no seu próprio pipeline de ASR.
00:00:26Eu testei e está na hora de te mostrar para onde tudo isso está indo.
00:00:30S1 Mini. É tudo sobre o pipeline, então pense nisso da seguinte forma.
00:00:39Sua fala vai para qualquer sistema de transcrição que você já esteja usando.
00:00:43Whisper, Whisper CPP, Parakeet, seu próprio serviço de ASR.
00:00:47Isso te dá o texto bruto.
00:00:50Então, o S1 Mini entra logo depois.
00:00:53Transcrição bruta entra, texto limpo sai.
00:00:56Ele remove vícios de linguagem como "hum", "eh", resolve falsos começos e autocorreções, e formata números, datas e endereços de e-mail.
00:01:06Você pode até controlar o tom da saída.
00:01:09E nada disso exige enviar sua transcrição para outra API.
00:01:12Acho que o valor principal é justamente esse.
00:01:16Eu não estou substituindo uma pilha de transcrição.
00:01:18Estou apenas adicionando uma pequena camada de limpeza a tudo isso.
00:01:21O Super Whisper também lançou o S1 Voice e o S1 Language, mas esses são os modelos em nuvem deles.
00:01:27Para nós, o S1 Mini é o mais interessante, porque ele é o modelo aberto.
00:01:32E ele pode rodar totalmente local, então vamos ver se realmente funciona.
00:01:36Se você gosta de ferramentas de programação para acelerar seu fluxo de trabalho, não deixe de se inscrever.
00:01:39Sempre temos vídeos novos saindo.
00:01:41Muito bem, agora estou rodando isso no meu Mac M4 Pro, e a primeira surpresa é o tamanho.
00:01:46Eu não preciso baixar nenhum modelo local gigante.
00:01:49A versão quantizada que estou usando tem cerca de 462 megabytes.
00:01:53Eu só peguei no Hugging Face e executei um comando curl para instalar.
00:01:57E como versões GGUF estão disponíveis, você pode rodá-lo com as ferramentas locais normais.
00:02:02Então Llama CPP, Ollama, LM Studio, a escolha é realmente sua.
00:02:07O que já se encaixa no seu fluxo de trabalho, mas aqui eu escolhi o Ollama, pois já o estava usando.
00:02:13Depois de instalar o modelo e criar um Modelfile simples na minha área de trabalho, posso disponibilizá-lo
00:02:18e executá-lo com o Ollama.
00:02:20Agora, lembre-se, este é um limpador de transcrições.
00:02:23Então vamos ver como é a limpeza aqui e como podemos integrá-la ao nosso fluxo de trabalho.
00:02:28Deixe-me dar a ele algo propositalmente ruim, ok?
00:02:31Aqui está a transcrição bruta.
00:02:33Você pode ver aqui que eu gaguejei em várias coisas.
00:02:36Eu tive, hã, está quebrado.
00:02:37Tudo isso está realmente acontecendo.
00:02:39E bem no final, eu digo envie um e-mail para support@betterstack.com.
00:02:43Isso tem basicamente tudo o que torna a conversão de fala em texto irritante.
00:02:47Tem um vício de linguagem no início, uma correção no meio.
00:02:50Há números falados.
00:02:52Há muita coisa acontecendo naquele endereço de e-mail que é dito em voz alta.
00:02:55Tudo isso é onde um LLM geral poderia facilmente fazer demais.
00:03:00Vamos ver o que o S1 Mini faz em vez disso.
00:03:02Execute-o através do modelo e pronto, aí está.
00:03:05E esses vícios de linguagem desaparecem instantaneamente, sem nenhum atraso.
00:03:08Ele entende que eu mudei de ideia no meio do caminho.
00:03:11O endereço de e-mail é formatado corretamente e o resultado fica muito mais parecido com algo que eu
00:03:17realmente quis digitar.
00:03:18Claro.
00:03:19Aqui estão alguns outros rápidos pelos quais posso passar.
00:03:22Temos um aqui.
00:03:23Ok.
00:03:24Ok, rápido.
00:03:25Outro aqui.
00:03:26Parecendo bom.
00:03:27E este aqui.
00:03:29Você pode ver que todos foram quase instantâneos e você pode ver a saída de todos eles com uma limpeza
00:03:34rápida.
00:03:35Ele não transforma de repente uma frase em um longo e ramificado e-mail.
00:03:39Ele deixa a maior parte do significado intacta.
00:03:41Ele apenas limpa a bagunça ao redor.
00:03:44E para limpeza de transcrições, é exatamente isso que eu quero.
00:03:47Agora, deixe-me integrar isso a um fluxo rápido aqui, porque seria legal colocar isso em outra
00:03:51camada real com alguma fala ao vivo.
00:03:53Eu tenho um áudio pré-gravado aqui no meu Mac.
00:03:56Tem cerca de 10 segundos.
00:03:57Vou usar o MLX Whisper, já que é limpo de rodar no meu Mac primeiro.
00:04:02Vamos transcrevê-lo aqui com esta execução.
00:04:05Então, quando eu rodo este comando aqui, ele faz a limpeza tão bem quanto e a gera em
00:04:09texto.
00:04:10Isso foi pegar meu arquivo de áudio real e trabalhar com ele.
00:04:14Agora, como o S1 Mini provavelmente não deveria ser o modelo principal na sua aplicação.
00:04:18Nós realmente não queremos isso.
00:04:19Faz mais sentido como uma pequena camada entre outras duas coisas.
00:04:23Imagine que você está construindo uma configuração de ditado totalmente local.
00:04:26O Whisper CPP lida com o áudio.
00:04:29O S1 Mini lida com a limpeza.
00:04:31Então o texto do arquivo vai direto para o seu editor, para que nada saia da nossa máquina.
00:04:35É isso.
00:04:36E é para lá que o S1 Mini deve ir.
00:04:38Texto bruto está entrando.
00:04:40Texto limpo está saindo.
00:04:42E há vários lugares onde isso importa mais do que parece, certo?
00:04:46Então, eu não sei.
00:04:46Peguemos agentes de programação.
00:04:47Limpe a correção antes que ela chegue ao agente, e a instrução se torna muito mais clara.
00:04:52O mesmo vale para mensagens do Slack escritas por voz.
00:04:54Tickets de suporte por e-mail.
00:04:56Notas de reunião.
00:04:57Em qualquer lugar onde você fala a entrada, mas quer que o resultado pareça texto escrito.
00:05:01Cada etapa de limpeza pode permanecer local.
00:05:04Não há chamada de API extra e transcrição indo para outro lugar.
00:05:08E há uma pergunta óbvia aqui.
00:05:10Se modelos grandes já fazem isso bem, por que estamos nos incomodando com este pequenininho?
00:05:14Claro, é.
00:05:15Você poderia absolutamente enviar a transcrição para o GPT, Claude ou um modelo Llama local, e eles
00:05:21provavelmente a limparem bem.
00:05:23Mas esse também é o problema aqui.
00:05:25Porque todos esses modelos podem, na verdade, fazer demais.
00:05:28Um LLM geral pode reescrever sua transcrição, resumí-la, expandi-la.
00:05:32Vocês já viram isso acontecer antes.
00:05:34Você sabe o que acontece quando damos algo assim a um LLM.
00:05:37Ele basicamente pode levar o texto em qualquer direção que quiser.
00:05:41O S1 Mini tem um trabalho muito menor.
00:05:43Pegar fala bagunçada, normalizá-la.
00:05:46É realmente só isso.
00:05:47Então agora estamos usando um modelo de 600 milhões de parâmetros projetado exatamente para esse tipo de transformação.
00:05:53Portanto, para esta única tarefa, você potencialmente obtém menor uso de recursos e menor latência.
00:05:57E se você estiver fazendo isso em escala, não há fatura de API de limpeza.
00:06:01Também vale a pena separar o S1 Mini de algo como o Whisper local.
00:06:05O Whisper resolve um problema.
00:06:07Áudio vira texto.
00:06:09O S1 Mini resolve o próximo.
00:06:12Esse texto se torna algo que parece que um ser humano o digitou ou escreveu intencionalmente.
00:06:17Então o pipeline é muito simples.
00:06:20Fala, transcrição bruta, texto limpo.
00:06:22O Whisper agora tem modelos para ambos os lados desse fluxo de trabalho.
00:06:25Mas a parte importante é que você não precisa usar toda a pilha deles.
00:06:28Você pode pegar o S1 Mini e inseri-lo na sua própria.
00:06:31E acho que é por isso que este modelo é mais interessante do que outro lançamento de LLM diminuto.
00:06:35Mas ei, isso não é perfeito.
00:06:36Há algumas limitações que precisamos conhecer antes de colocá-lo em algo importante.
00:06:40Agora as coisas boas.
00:06:41Bem, as coisas boas.
00:06:42Ele é minúsculo.
00:06:43Ele é rápido.
00:06:43Ele pode rodar totalmente local.
00:06:44Portanto, uma vez concluída a transcrição, não há ida e volta pela rede apenas para limpar o texto.
00:06:49Isso é uma grande vitória.
00:06:50Isso é especialmente forte no que é óbvio.
00:06:53Vícios de linguagem, autocorreções, números falados, formatação básica.
00:06:56Mas agora chegamos à primeira grande limitação.
00:06:59Ele é apenas em inglês no momento.
00:07:01Portanto, se o seu fluxo de trabalho precisa de limpeza de transcrições multilíngues, esta não é a ferramenta de hoje.
00:07:05Segundo, não confunda seu foco restrito com uma fraqueza.
00:07:08Você não está baixando o S1 Mini para substituir o Claude ou qualquer outra coisa.
00:07:12Se você quer raciocínio, sumarização ou um agente local geral, use o Claude.
00:07:17Use um modelo geral.
00:07:18O S1 Mini apenas limpa transcrições.
00:07:21Esse é o trabalho.
00:07:22E há outra distinção fácil de fazer.
00:07:24O S1 Mini não é o S1 Voice.
00:07:26O S1 Voice é o modelo de reconhecimento de fala em nuvem do Super Whisper.
00:07:30Essa é uma parte da pilha separada do que estou testando aqui.
00:07:34Toda a família S1 também é muito nova.
00:07:36Foi lançada em 19 de agosto, então eu ainda a trataria como software em estágio inicial.
00:07:41O modelo em si pode rodar de forma independente, então a questão simples torna-se bem direta.
00:07:46Quem deve realmente usar isso?
00:07:48Se você já roda conversão de fala em texto local, o S1 Mini faz muito sentido, especialmente se você
00:07:53estiver usando Whisper CPP, Parakeet ou seu próprio sistema ASR, e tem se perguntado o que
00:07:58fazer com a transcrição depois.
00:08:00Em vez de enviar tudo para um LLM completo de propósito geral, o que muitos de nós já fazem, você pode colocar
00:08:06este pequeno modelo logo após a transcrição e deixá-lo cuidar da limpeza.
00:08:10Se a privacidade importa, isso se torna mais útil.
00:08:12É local.
00:08:13Qualquer coisa que faça valer a pena enviar a transcrição para outro modelo em nuvem apenas para formatação parece desnecessária.
00:08:18Se você está processando muita fala, isso faz sentido.
00:08:20Todas essas pequenas limpezas são chamadas de API, então nós realmente não precisamos delas se estivermos usando
00:08:24o S1 Mini.
00:08:25Vou colocar a página do S1 Mini no Hugging Face na descrição se você quiser conferir por conta própria.
00:08:30Se você curte dicas e truques de programação como este, não deixe de se inscrever no canal BetterStack.
00:08:33Nos vemos em outro vídeo.
Community Posts
No posts yet. Be the first to write about this video!
Write about this video