Skip to main content
Kostenloses Tool · Nichts wird hochgeladen

Gesang entfernen, direkt im Browser

Die meisten Gesangsentferner laden deine Datei hoch, stellen sie in eine Warteschlange und schicken dir einen Link per Mail. Dieses Tool lädt stattdessen das Trennmodell in deinen Browser und führt es dort aus — das Audio verlässt den Tab nie. Heraus kommen ein Instrumental und ein A-cappella, beide als WAV.

Läuft im Browser · Ohne Konto · Bis zu 10 Minuten pro Track

Hör dir die Trennung an

Stem-Splitter, Instrumental-Maker, Acapella-Extraktor, Karaoke-Maker

Dieselben 15 Sekunden eines Songs: der Mix, der hineinging, und die zwei Stems, die diese Seite daraus gemacht hat.

  • Originalmix

    Heartbreak Is a Highway · 15 s

  • Nur Gesang (Acapella)

    Heartbreak Is a Highway · 15 s

  • Instrumental (Karaoke)

    Heartbreak Is a Highway · 15 s

Der Trenner

Eine Datei rein, zwei Spuren raus

Beim ersten Lauf werden rund 64 MB Modell geladen, die dein Browser danach zwischenspeichert. Trennen ist echte Rechenarbeit — rechne auf einem normalen Laptop mit einigen Minuten, und mit mehr Zeit als der Song dauert, sofern dein Browser kein WebGPU unterstützt.

Was hier anders ist

Die Datei bleibt auf deinem Rechner

Das ist kein Datenschutz-Slogan, der auf dieselbe Architektur wie überall geschraubt wurde — es ist eine andere Architektur, und sie hat Folgen, die man vor der Wahl eines Tools kennen sollte.

Nichts wird hochgeladen

Diese Seite hat überhaupt keinen Upload-Endpunkt. Dein unveröffentlichter Mix, die Spuren deines Kunden und deine Sprachnotiz werden vom Tab gelesen und bleiben dort. Schließt du ihn, ist alles weg.

Die Spuren ergeben zusammen wieder das Original

Das Modell schätzt das Instrumental, der Gesang ist der Rest — addiert man beide wieder, ergibt das exakt deine Datei. Genau das macht das Instrumental zu einem brauchbaren Karaoke-Playback statt zu einer Annäherung daran.

Dein Rechner macht die Arbeit

Das ist der Handel: keine Warteschlange und keine Kosten, aber auch keine Serverfarm. Browser mit WebGPU sind deutlich schneller fertig als der Song lang ist; ohne WebGPU läuft es auf einkernigem WebAssembly und dauert spürbar länger.

So funktioniert es

Spektrogramme, keine Magie

Es lohnt sich zu wissen, was das Tool tut — zum einen erklärt es die Wartezeit, zum anderen sagt es dir, wann das Ergebnis gut wird.

  1. 01

    Deine Datei wird dekodiert und umgerechnet

    Auf 44,1 kHz Stereo, denn darauf wurde das Modell trainiert. Eine Mono-Datei läuft auf beiden Seiten; akzeptiert wird alles, was der Browser dekodieren kann.

  2. 02

    Das Audio wird zum Bild seiner selbst

    Sechs-Sekunden-Blöcke werden zu Spektrogrammen — eine 6144-Punkt-Transformation alle 1024 Samples, genau das, was das Modell erwartet.

  3. 03

    Das Modell schätzt das Instrumental

    Block für Block, mit übergeblendeten Rändern, damit du nicht alle sechs Sekunden eine Naht hörst. Das ist der Teil, der die Zeit kostet.

  4. 04

    Der Gesang ist das, was übrig bleibt

    Zieht man das geschätzte Instrumental vom Original ab, bleibt der Gesang — und beide Hälften ergeben zusammen garantiert wieder genau das, womit du angefangen hast.

Zwei ehrliche Grenzen. Bei dichten Mixen ist die Trennung unvollkommen — kräftiger Hall, gedoppelter Gesang und laute Becken sind die Stellen, an denen du Artefakte hörst, und zwar in beiden Spuren. Und ein langer Track hält den Mix und beide Spuren gleichzeitig im Speicher, weshalb die Obergrenze 10 Minuten beträgt und nicht eine Albumseite.

Nennung

Das Modell ist nicht unseres

Die Trennung nutzt UVR-MDX-NET-Inst_HQ_1, trainiert und veröffentlicht vom Projekt Ultimate Vocal Remover unter der MIT-Lizenz, die von Entwicklern eine Nennung erbittet, wenn sie diese Modelle verwenden. Die Architektur ist MDX-Net von KUIELab. Wir haben die Browser-Seite gebaut; die eigentliche Arbeit leisten sie.

Fragen

Die, die eine Antwort verdienen

Ist es kostenlos, und gibt es ein Limit?

Kostenlos, ohne Konto und ohne Limit pro Track: Dein Computer macht die Arbeit, also gibt es nichts zu zählen. Grenzen sind nur 10 Minuten pro Track und der Arbeitsspeicher deines Geräts.

Wird mein Audio irgendwo hochgeladen?

Nein. Die Seite hat keinen Upload-Weg: Dein Browser lädt das Modell herunter und führt es lokal aus, das Audio verlässt den Tab nie. Die einzige große Anfrage ist das Modell selbst.

Was bekomme ich?

Zwei Stems, Instrumental und Gesang, als 44100-Hz-Stereo-WAV. Zusammen ergeben sie exakt dein Original, weil der Gesang das ist, was nach dem geschätzten Instrumental übrig bleibt.

Kann ich einen Karaoke-Track oder ein Acapella machen?

Beides, aus einem Durchlauf: Das Instrumental ist dein Karaoke- oder Backing-Track, der Gesang dein Acapella. Dichte Mixe hinterlassen Artefakte, also hör dir beide an, bevor du eins nutzt.

Welche Dateien, und wie lang?

Alles, was dein Browser dekodieren kann: MP3, WAV, M4A/AAC, FLAC oder OGG, bis 10 Minuten. Beim ersten Mal lädt er einmalig etwa 64 MB Modell; eine Trennung dauert auf einem normalen Laptop einige Minuten.

Darf ich die Stems kommerziell nutzen?

Das hängt vom Song ab, nicht vom Tool: Eine Aufnahme zu trennen gibt dir keine Rechte daran. Eigene Aufnahmen kannst du frei nutzen. Für lizenzierbare Musik generierst du deine eigene.