Skip to main content
Herramienta gratuita · No se sube nada

Quitar la voz, directamente en tu navegador

La mayoría de los quita-voces suben tu archivo, lo ponen en cola y te mandan un enlace por correo. Este descarga el modelo de separación a tu navegador y lo ejecuta ahí, así que el audio nunca sale de la pestaña. Obtienes un instrumental y una a capela, ambos en WAV.

Funciona en tu navegador · Sin cuenta · Hasta 10 minutos por pista

Escucha la separación

Separador de stems, instrumental, acapella y karaoke

Los mismos 15 segundos de una canción: la mezcla original y las dos pistas que esta página sacó de ella.

  • Mezcla original

    Heartbreak Is a Highway · 15 s

  • Solo voz (acapella)

    Heartbreak Is a Highway · 15 s

  • Instrumental (karaoke)

    Heartbreak Is a Highway · 15 s

El separador

Un archivo entra, dos pistas salen

La primera vez se descargan unos 64 MB de modelo, que tu navegador guarda en caché. Separar es trabajo de verdad: cuenta con unos minutos en un portátil normal, y con más tiempo del que dura la canción si tu navegador no admite WebGPU.

Qué cambia aquí

El archivo se queda en tu equipo

No es un eslogan de privacidad pegado sobre la misma arquitectura que los demás: es una arquitectura distinta, y tiene consecuencias que conviene conocer antes de elegir herramienta.

No se sube nada

Esta página no tiene ningún punto de subida. Tu mezcla inédita, las pistas de tu cliente y tu nota de voz los lee la pestaña y ahí se quedan. Al cerrarla desaparece todo.

Las pistas suman de vuelta el original

El modelo estima el instrumental y la voz es lo que sobra, así que sumando ambos se reconstruye tu archivo exactamente. Eso es lo que convierte el instrumental en una base de karaoke utilizable y no en una aproximación.

El trabajo lo hace tu máquina

Ese es el trato: sin cola y sin coste, pero tampoco hay granja de servidores. Los navegadores con WebGPU terminan bastante antes de lo que dura la canción; sin él vas con WebAssembly de un hilo y se nota.

Cómo funciona

Espectrogramas, no magia

Merece la pena saber qué hace la herramienta: en parte explica la espera y en parte te dice cuándo el resultado va a ser bueno.

  1. 01

    Tu archivo se decodifica y se remuestrea

    A 44,1 kHz estéreo, porque es con lo que se entrenó el modelo. Un archivo mono suena por los dos lados; se acepta todo lo que el navegador sepa decodificar.

  2. 02

    El audio se convierte en una imagen de sí mismo

    Bloques de seis segundos se convierten en espectrogramas: una transformada de 6144 puntos cada 1024 muestras, que es justo lo que el modelo espera recibir.

  3. 03

    El modelo estima el instrumental

    Bloque a bloque, con los bordes fundidos para que no oigas una costura cada seis segundos. Esta es la parte que consume el tiempo.

  4. 04

    La voz es lo que sobra

    Restar el instrumental estimado a tu original da la voz, y garantiza que las dos mitades sumadas devuelvan exactamente aquello con lo que empezaste.

Dos límites honestos. La separación es imperfecta en mezclas densas: reverberación fuerte, voces dobladas y platillos altos son donde oirás artefactos, en las dos pistas. Y un tema largo mantiene la mezcla y las dos pistas en memoria a la vez, por eso el techo son 10 minutos y no una cara de un disco.

Créditos

El modelo no es nuestro

La separación usa UVR-MDX-NET-Inst_HQ_1, entrenado y publicado por el proyecto Ultimate Vocal Remover bajo licencia MIT, que pide a quienes usan sus modelos que lo citen. La arquitectura es MDX-Net, de KUIELab. Nosotros hicimos la parte del navegador; el trabajo de verdad es suyo.

Preguntas

Las que merecen respuesta

¿Es gratis? ¿Tiene algún límite?

Gratis, sin cuenta y sin tope por pista: el trabajo lo hace tu ordenador, así que no hay nada que medir. Los únicos límites son 10 minutos por pista y la memoria de tu equipo.

¿Se sube mi audio a algún sitio?

No. La página no tiene ninguna vía de subida: tu navegador descarga el modelo y lo ejecuta en local, así que el audio nunca sale de la pestaña. La única descarga grande es el modelo.

¿Qué obtengo?

Dos pistas, la instrumental y la voz, en WAV estéreo a 44100 Hz. Sumadas dan exactamente tu original, porque la voz es lo que queda tras estimar la instrumental.

¿Puedo hacer un karaoke o una acapella?

Las dos cosas en una pasada: la instrumental es tu karaoke o base, la voz es tu acapella. Las mezclas densas dejan algunos artefactos, así que escucha ambas antes de usar una.

¿Qué archivos y de qué duración?

Todo lo que tu navegador pueda decodificar: MP3, WAV, M4A/AAC, FLAC u OGG, hasta 10 minutos. La primera vez descarga una sola vez unos 64 MB de modelo; separar lleva unos minutos en un portátil normal.

¿Puedo usar las pistas comercialmente?

Depende de la canción, no de la herramienta: separar una grabación no te da derechos sobre ella. Tus propias grabaciones son tuyas. Para música que puedas licenciar, genera la tuya.