Laissez l'IA écouter à votre place — des transcriptions précises et ponctuées de n'importe quel enregistrement.
Propulsé par OpenAI Whisper, 99 langues, horodatages. Gratuit pour commencer.
Le lien doit être accessible publiquement.
L'IA vocale moderne transforme les enregistrements en texte propre bien plus vite et moins cher qu'un dactylographe — voici comment.
Déposez n'importe quel enregistrement ou collez un lien YouTube, TikTok, Instagram, Vimeo et d'autres. Il n'y a ni modèle à régler ni langue à déclarer : les deux se décident à partir de l'audio lui-même.
L'enregistrement est décodé, découpé s'il est long, puis envoyé à OpenAI Whisper, qui renvoie un texte ponctué et capitalisé, réparti en segments de la longueur d'une phrase portant chacun un temps de début et de fin.
La transcription se place à côté du lecteur, si bien que chaque segment peut être réécouté et corrigé. Export en TXT, Markdown, DOCX, PDF, SRT ou VTT — avec le code qui alimente aussi les outils de sous-titres.
L'IA vocale encaisse le volume, la vitesse et les langues qu'une transcription manuelle ne peut pas suivre.
Un long enregistrement est découpé en morceaux transcrits plusieurs à la fois : une heure d'audio ne veut donc pas dire une heure d'attente.
Un seul modèle couvre presque toutes les langues, et la langue se lit dans l'audio au lieu d'être choisie dans un menu où l'on peut se tromper.
Les phrases, les virgules et les majuscules reviennent avec le texte : c'est ce qui sépare une transcription lisible d'un mur de mots en minuscules.
Chaque réplique porte l'instant où elle a été prononcée, et c'est de là que viennent le clic-pour-écouter, l'export de sous-titres et la recherche dans l'enregistrement.
Ni fatigue ni dérive : le cinquantième fichier sort au même niveau que le premier, au même coût par minute.
Entretiens, appels, cours, mémos vocaux, prises de son sur le terrain — s'il y a de la parole, le modèle l'écrit.
La transcription manuelle est lente et coûteuse — environ quatre heures de travail par heure d'audio. La transcription IA avec OpenAI Whisper fait le même travail en quelques minutes, ajoute la ponctuation et les horodatages et gère 99 langues sans broncher. Vous gardez la main : la transcription est affichée à côté de l'audio pour vérifier et corriger ce que le modèle a manqué.
Le moteur, les choix qui le sous-tendent et les endroits où il se trompe encore.
OpenAI propose des modèles vocaux plus rapides et plus précis — gpt-4o-transcribe et sa variante mini — et nous ne les utilisons pas, volontairement. Ils ne renvoient que du texte brut. whisper-1 est le seul à renvoyer des horodatages par segment, et c'est sur eux que reposent le lecteur, l'export SRT et VTT et la traduction. Passer au modèle plus précis ferait monter l'exactitude des mots et casserait silencieusement trois fonctions : l'arbitrage penche donc de l'autre côté.
Au-delà d'une certaine durée, l'audio n'est pas envoyé d'un bloc. Le fichier est parcouru à la recherche des silences et coupé au dernier moment calme avant chaque limite, de sorte que la césure tombe entre deux phrases et non au milieu d'un mot, et les morceaux sont transcrits plusieurs à la fois plutôt que l'un après l'autre. Si le travail est interrompu, les points de coupe sont déjà enregistrés : il reprend au morceau où il s'est arrêté au lieu de recommencer le fichier entier.
La langue est détectée sur le premier morceau puis réutilisée pour tout le fichier. C'est délibéré : laissé libre de détecter à chaque morceau, le modèle peut basculer de langue au milieu d'un enregistrement sur un passage bas ou accentué et rendre une transcription qui change de langue en route. Le prix de cette règle, c'est qu'un enregistrement réellement bilingue est transcrit dans la langue de son ouverture.
La précision est une propriété de votre audio, pas de la page marketing : nous ne publions donc pas de pourcentage. Ce qui la fait bouger : les voix qui se chevauchent, le bruit et la musique de fond, la compression de qualité téléphonique, les accents marqués et les noms propres que le modèle n'a aucun moyen de connaître — personnes, médicaments, noms de produits internes. La réponse pratique, c'est l'éditeur : le texte reste à côté de l'audio, chaque segment est cliquable, et corriger une poignée de noms coûte une fraction du temps qu'il faudrait pour tout taper.
Un fichier plus long que la limite d'affichage gratuite est tout de même transcrit en entier — rien n'est tronqué dans l'appel au modèle — mais seules les 30 premières minutes s'affichent et s'exportent tant que le compte n'est pas Pro. Votre quota est débité de ce qui vous a été montré, dans la limite de 30 minutes, et non de la durée complète du fichier. La limite est annoncée avant le début de l'envoi plutôt que découverte après, et Pro la supprime entièrement.
La transcription tourne sur OpenAI whisper-1, préféré aux gpt-4o-transcribe plus récents et plus précis parce qu'il est le seul à renvoyer des horodatages par segment, dont dépendent le lecteur, l'export de sous-titres et la traduction.
La précision dépend de l'enregistrement et non de l'offre : une parole nette revient quasiment mot pour mot, tandis que les voix superposées, la musique de fond, l'audio de qualité téléphonique et les noms propres inhabituels sont là où apparaissent les erreurs. Chaque segment est cliquable à côté de l'audio, si bien que corriger prend des minutes plutôt qu'une refrappe.
La plupart des fichiers se terminent en quelques minutes et non dans la durée de l'enregistrement, parce qu'un fichier de 60 minutes est découpé en morceaux dont plusieurs sont transcrits en même temps au lieu de se suivre. Les envois longs continuent en arrière-plan même si vous fermez l'onglet.
La parole en 99 langues, reconnue automatiquement d'après l'audio et sans aucun réglage à choisir. La langue est détectée sur le premier morceau puis conservée pour tout le fichier : un enregistrement qui change de langue en cours de route est transcrit dans celle par laquelle il a commencé.
La transcription s'exporte en TXT, Markdown, DOCX, PDF, SRT et VTT, le tout produit à partir des mêmes segments horodatés, si bien que les sous-titres collent à l'audio à la milliseconde.
Les étiquettes de locuteur ne font pas partie du résultat aujourd'hui : la transcription rend ce qui a été dit, dans l'ordre, avec les temps. Pour un entretien, l'astuce habituelle est que les tours de parole se devinent aux coupures entre segments.
La transcription écrit ce qui a été dit et rien de plus ; le résumé par IA est une action distincte que vous déclenchez vous-même, la transcription n'est donc jamais réécrite ni raccourcie à votre insu.
Le fichier est transcrit intégralement, mais un compte sans Pro voit et exporte les 30 premières minutes et se voit débiter au plus 30 minutes de son quota. Le plafond est affiché avant l'envoi, pas après l'attente.
Un fichier unique peut atteindre 60 minutes en gratuit et 10 heures en Pro, dans la limite de 5 Go par envoi dans les deux cas.
La transcription par IA est gratuite dans la limite mensuelle de 60 minutes sans carte bancaire ; Pro la porte à 30 heures par mois, lève le plafond d'affichage et supprime la limite quotidienne d'envois.
Passez à Pro pour transcrire des heures d'audio et de vidéo, avec plus de minutes mensuelles et des envois illimités — un texte précis en 99 langues.
Voir les offres Pro