Skip to main content
Strumento gratuito · Non si carica nulla

Rimuovere la voce, direttamente nel browser

Quasi tutti i rimuovi-voce caricano il tuo file, lo mettono in coda e ti mandano un link via email. Questo scarica invece il modello di separazione nel tuo browser e lo esegue lì, così l’audio non lascia mai la scheda. Ottieni uno strumentale e un a cappella, entrambi in WAV.

Gira nel tuo browser · Senza account · Fino a 10 minuti per brano

Ascolta la separazione

Separatore di stem, basi strumentali, acapella e karaoke

Gli stessi 15 secondi di una canzone: il mix di partenza e le due tracce che questa pagina ne ha ricavato.

  • Mix originale

    Heartbreak Is a Highway · 15 s

  • Solo voce (acapella)

    Heartbreak Is a Highway · 15 s

  • Strumentale (karaoke)

    Heartbreak Is a Highway · 15 s

Il separatore

Entra un file, escono due tracce

La prima esecuzione scarica circa 64 MB di modello, che poi il browser tiene in cache. Separare è lavoro vero: metti in conto qualche minuto su un portatile normale, e più tempo della canzone stessa se il tuo browser non supporta WebGPU.

Cosa cambia qui

Il file resta sulla tua macchina

Non è uno slogan sulla privacy avvitato sulla stessa architettura di tutti gli altri — è un’architettura diversa, e ha conseguenze che conviene conoscere prima di scegliere uno strumento.

Non si carica nulla

Questa pagina non ha alcun endpoint di caricamento. Il tuo mix non ancora uscito, le tracce del tuo cliente e il tuo memo vocale li legge la scheda e lì restano. Chiuderla cancella tutto.

Le tracce risommate danno l’originale

Il modello stima lo strumentale e la voce è ciò che resta, quindi risommando le due si ricostruisce esattamente il tuo file. È questo che rende lo strumentale una base karaoke utilizzabile e non un’approssimazione.

È la tua macchina a lavorare

È questo il compromesso: niente coda e niente costi, ma nemmeno una server farm. I browser con WebGPU finiscono ben prima della fine del brano; senza, si va di WebAssembly a thread singolo e si sente.

Come funziona

Spettrogrammi, non magia

Vale la pena sapere cosa sta facendo lo strumento: in parte spiega l’attesa, in parte ti dice quando il risultato sarà buono.

  1. 01

    Il file viene decodificato e ricampionato

    A 44,1 kHz stereo, perché è su questo che il modello è stato addestrato. Un file mono esce da entrambi i lati; si accetta tutto ciò che il browser sa decodificare.

  2. 02

    L’audio diventa un’immagine di sé

    Blocchi di sei secondi diventano spettrogrammi — una trasformata da 6144 punti ogni 1024 campioni, esattamente ciò che il modello si aspetta.

  3. 03

    Il modello stima lo strumentale

    Blocco per blocco, con i bordi in dissolvenza incrociata per non sentire una giuntura ogni sei secondi. È questa la parte che richiede tempo.

  4. 04

    La voce è ciò che resta

    Sottrarre lo strumentale stimato dall’originale dà la voce, e garantisce che le due metà risommate restituiscano esattamente il punto di partenza.

Due limiti onesti. Sui mix densi la separazione è imperfetta — riverbero abbondante, voci raddoppiate e piatti forti sono i punti in cui sentirai artefatti, in entrambe le tracce. E un brano lungo tiene in memoria il mix e tutte e due le tracce insieme: per questo il tetto è di 10 minuti e non di una facciata di album.

Crediti

Il modello non è nostro

La separazione usa UVR-MDX-NET-Inst_HQ_1, addestrato e pubblicato dal progetto Ultimate Vocal Remover con licenza MIT, che chiede a chi ne usa i modelli di citarlo. L’architettura è MDX-Net, di KUIELab. Noi abbiamo fatto la parte nel browser; il lavoro vero è loro.

Domande

Quelle che meritano una risposta

È gratis? C’è un limite?

Gratis, senza account e senza limite per traccia: il lavoro lo fa il tuo computer, quindi non c’è nulla da contare. Gli unici limiti sono 10 minuti per traccia e la memoria del dispositivo.

Il mio audio viene caricato da qualche parte?

No. La pagina non ha alcun percorso di caricamento: il browser scarica il modello e lo esegue in locale, quindi l’audio non lascia mai la scheda. L’unica richiesta pesante è il modello stesso.

Cosa ottengo?

Due tracce, lo strumentale e la voce, in WAV stereo a 44100 Hz. Sommate ridanno esattamente l’originale, perché la voce è ciò che resta dopo aver stimato lo strumentale.

Posso fare una base karaoke o un’acapella?

Entrambe, in un solo passaggio: lo strumentale è la tua base karaoke, la voce la tua acapella. I mix densi lasciano qualche artefatto, quindi ascoltale entrambe prima di usarne una.

Quali file, e quanto lunghi?

Tutto ciò che il browser sa decodificare: MP3, WAV, M4A/AAC, FLAC o OGG, fino a 10 minuti. La prima volta scarica una sola volta circa 64 MB di modello; la separazione richiede qualche minuto su un portatile normale.

Posso usare gli stem a scopo commerciale?

Dipende dalla canzone, non dallo strumento: separare una registrazione non ti dà alcun diritto su di essa. Le tue registrazioni sono tue. Per musica che puoi concedere in licenza, generane una tua.