KI-Audio-Transkription

Lassen Sie die KI zuhören — präzise, interpunktierte Transkripte aus jeder Aufnahme.
Angetrieben von OpenAI Whisper, 99 Sprachen, Zeitstempel. Kostenlos starten.

Legen Sie Ihr Video aboder Audio
Datei zum Hochladen hier ablegen
Die ersten 30 Minuten sind gratis — die ganze Aufnahme gibt's mit Pro →
oder

Der Link muss öffentlich zugänglich sein.

KI-Transkription in drei Schritten

Moderne Sprach-KI macht aus Aufnahmen sauberen Text, viel schneller und günstiger als eine Schreibkraft — so läuft es ab.

  1. Schritt 1

    Audio oder Link hochladen

    Legen Sie eine beliebige Aufnahme ab oder fügen Sie einen Link von YouTube, TikTok, Instagram, Vimeo und anderen ein. Es gibt kein Modell einzustellen und keine Sprache anzugeben — beides wird aus dem Ton selbst entschieden.

  2. Schritt 2

    Die KI transkribiert sie

    Die Aufnahme wird dekodiert, bei Länge zerteilt und an OpenAI Whisper geschickt, das interpunktierten Text in korrekter Groß- und Kleinschreibung zurückgibt, aufgeteilt in satzlange Segmente mit je einer Start- und Endzeit.

  3. Schritt 3

    Bearbeiten und exportieren

    Das Transkript steht neben dem Player, sodass jedes Segment erneut angehört und korrigiert werden kann. Export als TXT, Markdown, DOCX, PDF, SRT oder VTT — mit demselben Code, der auch die eigenständigen Untertitel-Werkzeuge antreibt.

Wofür sich KI-Transkription eignet

Sprach-KI bewältigt Menge, Tempo und Sprachen, bei denen manuelle Transkription nicht mithält.

Tempo im großen Maßstab

Eine lange Aufnahme wird in Stücke zerlegt und mehrere davon gleichzeitig transkribiert, sodass eine Stunde Audio keine Stunde Warten bedeutet.

99 Sprachen

Ein Modell deckt fast jede Sprache ab, und die Sprache wird aus dem Ton gelesen statt in einem Menü gewählt, in dem man sich irren kann.

Interpunktion inklusive

Sätze, Kommas und Großschreibung kommen mit dem Text zurück — das ist der Unterschied zwischen einem lesbaren Transkript und einer Wand aus Kleinbuchstaben.

Zeitstempel auf jedem Segment

Jede Passage trägt den Moment, in dem sie gesprochen wurde, und genau daraus entstehen Klick-zum-Abspielen, Untertitelexport und die Suche in der Aufnahme.

Gleichbleibendes Ergebnis

Keine Ermüdung, kein Abdriften — Datei fünfzig kommt auf demselben Niveau heraus wie Datei eins, zum selben Preis pro Minute.

Jede Aufnahme

Interviews, Anrufe, Vorlesungen, Sprachnotizen, Feldaufnahmen — wo Sprache drin ist, schreibt das Modell sie mit.

Warum KI für die Transkription

Manuelle Transkription ist langsam und teuer — etwa vier Stunden Arbeit pro Stunde Audio. KI-Transkription mit OpenAI Whisper erledigt dieselbe Aufgabe in Minuten, ergänzt Interpunktion und Zeitstempel und bewältigt 99 Sprachen ohne ins Stocken zu geraten. Die Kontrolle bleibt bei Ihnen: Das Transkript steht neben dem Audio, sodass Sie prüfen und korrigieren können, was das Modell übersehen hat.

Wie die Transkription tatsächlich abläuft

Die Engine, die Entscheidungen dahinter und die Stellen, an denen sie weiterhin danebenliegt.

Warum whisper-1 und kein neueres Modell

OpenAI hat schnellere und genauere Sprachmodelle — gpt-4o-transcribe und dessen Mini-Variante — und wir setzen sie bewusst nicht ein. Sie liefern reinen Text und sonst nichts. whisper-1 ist das einzige Modell, das Zeitstempel je Segment zurückgibt, und auf diesen Zeitstempeln bauen der Player, der SRT- und VTT-Export sowie die Übersetzung auf. Ein Wechsel zum genaueren Modell würde die Wortgenauigkeit heben und drei Funktionen stillschweigend zerstören — deshalb fällt der Handel andersherum aus.

Was mit einer langen Aufnahme passiert

Audio ab einer gewissen Länge wird nicht am Stück verschickt. Die Datei wird nach Sprechpausen abgesucht und an der letzten stillen Stelle vor jeder Grenze geschnitten, damit die Trennung zwischen Sätzen fällt und nicht mitten in ein Wort, und die Stücke werden mehrere gleichzeitig statt nacheinander transkribiert. Bricht ein Auftrag ab, sind die Schnittpunkte bereits gespeichert: Er setzt an dem Stück wieder an, bei dem er stehen blieb, statt die ganze Datei neu zu beginnen.

Die Sprache wird einmal entschieden, nicht pro Stück

Die Sprache wird am ersten Stück erkannt und dann für die restliche Datei weiterverwendet. Das ist Absicht: Dürfte das Modell bei jedem Stück neu erkennen, kann es mitten in der Aufnahme an einer leisen oder stark akzentuierten Stelle die Sprache wechseln und ein Transkript zurückgeben, das auf halbem Weg die Sprache wechselt. Der Preis dieser Regel: Eine wirklich zweisprachige Aufnahme wird in ihrer Anfangssprache transkribiert.

Wo sie danebenliegt

Genauigkeit ist eine Eigenschaft Ihres Audios und nicht der Marketingseite, deshalb veröffentlichen wir keine Prozentzahl. Was sie bewegt: einander überlappende Stimmen, Störgeräusche und Hintergrundmusik, Telefonqualität, starke Akzente und Eigennamen, die das Modell nicht kennen kann — Personen, Medikamente, interne Produktnamen. Die praktische Antwort ist der Editor: Der Text bleibt neben dem Audio, jedes Segment ist anklickbar, und eine Handvoll Namen zu korrigieren kostet einen Bruchteil der Zeit, die Abtippen bräuchte.

Wie eine lange Datei im kostenlosen Tarif aussieht

Eine Datei, die länger ist als das kostenlose Anzeigelimit, wird trotzdem vollständig transkribiert — im Modellaufruf wird nichts abgeschnitten —, aber ohne Pro werden nur die ersten 30 Minuten angezeigt und exportiert. Vom Kontingent wird abgezogen, was Ihnen gezeigt wurde, höchstens 30 Minuten, nicht die volle Länge der Datei. Das Limit wird vor dem Upload genannt statt danach entdeckt, und Pro hebt es vollständig auf.

Was das Modell tatsächlich mit Ihrem Audio macht

Modell
OpenAI whisper-1 — gewählt, weil es das einzige OpenAI-Modell mit Zeitstempeln je Segment ist
Spracherkennung
Wird aus dem Audio selbst gelesen, über 99 Sprachen hinweg — es gibt keine Sprachauswahl, bei der man danebengreifen kann
Interpunktion und Groß-/Kleinschreibung
Werden automatisch ergänzt, sodass sich das Ergebnis als Sätze liest und nicht als Wand aus Kleinbuchstaben
Segmentierung
Die Sprache wird in satzlange Segmente geteilt, jedes mit dem Zeitpunkt des Gesagten
Langes Audio
Wird an Sprechpausen statt nach fester Uhr geschnitten, parallel transkribiert und in der richtigen Reihenfolge zusammengesetzt
Exporte
TXT, Markdown, DOCX, PDF, SRT und VTT, alle aus denselben Zeitsegmenten gebaut
Bearbeitung
Der Text steht neben dem Player, sodass jedes Segment mit seinem Audio abgeglichen und korrigiert werden kann
Was es nicht tut
Es schreibt mit, was gesagt wurde — es fasst nicht zusammen, formuliert nicht um und kennzeichnet nicht, wer spricht

Häufige Fragen

Welches KI-Modell kommt zum Einsatz?

Die Transkription läuft auf OpenAI whisper-1, das den neueren und genaueren gpt-4o-transcribe-Modellen vorgezogen wird, weil es als einziges Zeitstempel je Segment liefert — die Grundlage für Player, Untertitelexport und Übersetzung.

Ist die KI-Transkription genau?

Die Genauigkeit hängt an der Aufnahme und nicht am Tarif: Klare Sprache kommt nahezu wortgetreu zurück, während überlappende Stimmen, Hintergrundmusik, Telefonqualität und ungewöhnliche Eigennamen die Stellen sind, an denen Fehler auftauchen. Jedes Segment ist neben dem Audio anklickbar, sodass Korrekturen Minuten kosten statt neu zu tippen.

Wie schnell ist sie?

Die meisten Dateien sind in Minuten fertig statt in der Länge der Aufnahme, weil eine 60-minütige Datei in Stücke zerlegt wird und mehrere davon gleichzeitig statt hintereinander transkribiert werden. Lange Uploads laufen im Hintergrund weiter, auch wenn Sie den Tab schließen.

Welche Sprachen bewältigt die KI?

Sprache in 99 Sprachen, automatisch aus dem Audio erkannt und ohne Einstellung zum Auswählen. Die Sprache wird am ersten Stück erkannt und für die restliche Datei gehalten, sodass eine Aufnahme, die mittendrin die Sprache wechselt, in ihrer Anfangssprache transkribiert wird.

Kann ich das Ergebnis exportieren?

Das Transkript lässt sich als TXT, Markdown, DOCX, PDF, SRT und VTT exportieren, alles aus denselben Zeitsegmenten erzeugt, sodass die Untertitel millisekundengenau zum Ton passen.

Kennzeichnet es, wer gerade spricht?

Sprecherkennzeichen sind heute nicht Teil der Ausgabe — das Transkript gibt wieder, was gesagt wurde, in Reihenfolge und mit Zeiten. Bei einem Interview hilft in der Praxis, dass der Sprecherwechsel an den Segmentgrenzen sichtbar wird.

Fasst es die Aufnahme zusammen?

Die Transkription schreibt mit, was gesagt wurde, und sonst nichts; die KI-Zusammenfassung ist eine eigene Aktion, die Sie selbst auslösen — das Transkript wird also nie stillschweigend umgeschrieben oder gekürzt.

Was passiert mit einer Datei über dem kostenlosen Limit?

Die Datei wird vollständig transkribiert, aber ein Konto ohne Pro sieht und exportiert die ersten 30 Minuten und bekommt höchstens 30 Minuten vom Kontingent abgezogen. Die Obergrenze wird vor dem Upload angezeigt, nicht nach dem Warten.

Wie lang darf eine Aufnahme sein?

Eine einzelne Datei darf im kostenlosen Tarif 60 Minuten und mit Pro 10 Stunden lang sein, in beiden Fällen innerhalb von 5 GB pro Upload.

Ist die KI-Transkription kostenlos?

Die KI-Transkription ist im Rahmen von 60 Minuten pro Monat ohne Karte kostenlos; Pro hebt das auf 30 Stunden monatlich an, entfernt die Anzeigegrenze und das tägliche Upload-Limit.

Weitere Wege zu transkribieren

Audio und Video in TextPräzise MP3-TranskriptionAudio in TextKostenlose Transkription

Lange Aufnahmen und große Dateien?

Mit Pro transkribieren Sie stundenlanges Audio und Video, mit mehr Minuten pro Monat und unbegrenzten Uploads — präziser Text in 99 Sprachen.