Skip to main content
Ferramenta grátis · Nada é enviado

Removedor de voz que roda no seu navegador

A maioria dos removedores de voz envia o seu ficheiro, põe-no numa fila e manda-lhe um link por e-mail. Este transfere o modelo de separação para o seu navegador e executa-o aí, por isso o áudio nunca sai do separador. Recebe um instrumental e um a cappella, ambos em WAV.

Corre no seu navegador · Sem conta · Até 10 minutos por faixa

Ouça a separação

Separador de stems, instrumental, acapella e karaokê

Os mesmos 15 segundos de uma música: a mixagem original e as duas faixas que esta página tirou dela.

  • Mixagem original

    Heartbreak Is a Highway · 15 s

  • Só vocal (acapella)

    Heartbreak Is a Highway · 15 s

  • Instrumental (karaokê)

    Heartbreak Is a Highway · 15 s

O separador

Entra um ficheiro, saem duas faixas

A primeira utilização transfere cerca de 64 MB de modelo, que o seu navegador guarda em cache. Separar é trabalho a sério — conte com alguns minutos num portátil normal, e com mais tempo do que a música dura se o seu navegador não suportar WebGPU.

O que aqui é diferente

O ficheiro fica na sua máquina

Não é um slogan de privacidade aparafusado à mesma arquitetura de toda a gente — é uma arquitetura diferente, e tem consequências que vale a pena conhecer antes de escolher uma ferramenta.

Nada é enviado

Esta página não tem qualquer ponto de envio. A sua mistura por lançar, as faixas do seu cliente e a sua nota de voz são lidas pelo separador e ficam lá. Fechá-lo apaga tudo.

As faixas somadas devolvem o original

O modelo estima o instrumental e a voz é o que sobra, por isso somar os dois reconstrói exatamente o seu ficheiro. É isso que torna o instrumental uma base de karaoke utilizável em vez de uma aproximação.

É a sua máquina que trabalha

É essa a troca: sem fila e sem custo, mas também sem parque de servidores. Navegadores com WebGPU acabam bem antes do fim da música; sem ele fica em WebAssembly de um só fio e nota-se.

Como funciona

Espectrogramas, não magia

Vale a pena saber o que a ferramenta faz: em parte explica a espera e em parte diz-lhe quando o resultado vai ser bom.

  1. 01

    O seu ficheiro é descodificado e reamostrado

    Para 44,1 kHz estéreo, porque foi com isso que o modelo foi treinado. Um ficheiro mono sai pelos dois lados; aceita-se tudo o que o navegador conseguir descodificar.

  2. 02

    O áudio torna-se uma imagem de si próprio

    Blocos de seis segundos tornam-se espectrogramas — uma transformada de 6144 pontos a cada 1024 amostras, exatamente o que o modelo espera receber.

  3. 03

    O modelo estima o instrumental

    Bloco a bloco, com as extremidades cruzadas em fade para não ouvir uma emenda a cada seis segundos. É esta a parte que consome o tempo.

  4. 04

    A voz é o que sobra

    Subtrair o instrumental estimado ao seu original dá a voz, e garante que as duas metades somadas devolvem exatamente aquilo com que começou.

Dois limites honestos. A separação é imperfeita em misturas densas — reverberação forte, vozes duplicadas e pratos altos são onde vai ouvir artefactos, nas duas faixas. E um tema longo mantém a mistura e as duas faixas em memória ao mesmo tempo, e é por isso que o teto são 10 minutos e não um lado de um álbum.

Créditos

O modelo não é nosso

A separação usa o UVR-MDX-NET-Inst_HQ_1, treinado e publicado pelo projeto Ultimate Vocal Remover sob a licença MIT, que pede a quem usa os seus modelos que o credite. A arquitetura é MDX-Net, da KUIELab. Nós fizemos a parte do navegador; o trabalho a sério é deles.

Perguntas

As que merecem resposta

É grátis? Tem algum limite?

Grátis, sem conta e sem limite por faixa: quem trabalha é o seu computador, então não há nada a medir. Os únicos limites são 10 minutos por faixa e a memória do seu aparelho.

Meu áudio é enviado para algum lugar?

Não. A página não tem caminho de envio: seu navegador baixa o modelo e o executa localmente, então o áudio nunca sai da aba. O único download grande é o próprio modelo.

O que eu recebo?

Duas faixas, a instrumental e o vocal, em WAV estéreo de 44100 Hz. Somadas, reproduzem exatamente o original, porque o vocal é o que sobra depois de estimar a instrumental.

Posso fazer um karaokê ou uma acapella?

As duas coisas numa passada: a instrumental é seu karaokê ou base, o vocal é sua acapella. Mixagens densas deixam alguns artefatos, então ouça as duas antes de usar uma.

Quais arquivos e de que duração?

Tudo o que seu navegador consegue decodificar: MP3, WAV, M4A/AAC, FLAC ou OGG, até 10 minutos. A primeira vez baixa uma única vez cerca de 64 MB de modelo; separar leva alguns minutos num notebook comum.

Posso usar as faixas comercialmente?

Depende da música, não da ferramenta: separar uma gravação não lhe dá direitos sobre ela. Suas próprias gravações são suas. Para música que você possa licenciar, gere a sua.