Transcription audio par IA

Laissez l'IA écouter à votre place — des transcriptions précises et ponctuées de n'importe quel enregistrement.
Propulsé par OpenAI Whisper, 99 langues, horodatages. Gratuit pour commencer.

Déposez votre vidéoou audio
Déposez votre fichier ici pour l'envoyer
Les 30 premières minutes sont gratuites — débloquez l'enregistrement complet avec Pro →
ou

Le lien doit être accessible publiquement.

La transcription IA en trois étapes

L'IA vocale moderne transforme les enregistrements en texte propre bien plus vite et moins cher qu'un dactylographe — voici comment.

  1. Étape 1

    Envoyez un audio ou un lien

    Déposez n'importe quel enregistrement ou collez un lien YouTube, TikTok, Instagram, Vimeo et d'autres. Il n'y a ni modèle à régler ni langue à déclarer : les deux se décident à partir de l'audio lui-même.

  2. Étape 2

    L'IA le transcrit

    L'enregistrement est décodé, découpé s'il est long, puis envoyé à OpenAI Whisper, qui renvoie un texte ponctué et capitalisé, réparti en segments de la longueur d'une phrase portant chacun un temps de début et de fin.

  3. Étape 3

    Modifiez et exportez

    La transcription se place à côté du lecteur, si bien que chaque segment peut être réécouté et corrigé. Export en TXT, Markdown, DOCX, PDF, SRT ou VTT — avec le code qui alimente aussi les outils de sous-titres.

À quoi sert la transcription par IA

L'IA vocale encaisse le volume, la vitesse et les langues qu'une transcription manuelle ne peut pas suivre.

La vitesse à l'échelle

Un long enregistrement est découpé en morceaux transcrits plusieurs à la fois : une heure d'audio ne veut donc pas dire une heure d'attente.

99 langues

Un seul modèle couvre presque toutes les langues, et la langue se lit dans l'audio au lieu d'être choisie dans un menu où l'on peut se tromper.

Ponctuation comprise

Les phrases, les virgules et les majuscules reviennent avec le texte : c'est ce qui sépare une transcription lisible d'un mur de mots en minuscules.

Un horodatage par segment

Chaque réplique porte l'instant où elle a été prononcée, et c'est de là que viennent le clic-pour-écouter, l'export de sous-titres et la recherche dans l'enregistrement.

Un rendu constant

Ni fatigue ni dérive : le cinquantième fichier sort au même niveau que le premier, au même coût par minute.

N'importe quel enregistrement

Entretiens, appels, cours, mémos vocaux, prises de son sur le terrain — s'il y a de la parole, le modèle l'écrit.

Pourquoi utiliser l'IA pour transcrire

La transcription manuelle est lente et coûteuse — environ quatre heures de travail par heure d'audio. La transcription IA avec OpenAI Whisper fait le même travail en quelques minutes, ajoute la ponctuation et les horodatages et gère 99 langues sans broncher. Vous gardez la main : la transcription est affichée à côté de l'audio pour vérifier et corriger ce que le modèle a manqué.

Comment la transcription se déroule vraiment

Le moteur, les choix qui le sous-tendent et les endroits où il se trompe encore.

Pourquoi whisper-1 et pas un modèle plus récent

OpenAI propose des modèles vocaux plus rapides et plus précis — gpt-4o-transcribe et sa variante mini — et nous ne les utilisons pas, volontairement. Ils ne renvoient que du texte brut. whisper-1 est le seul à renvoyer des horodatages par segment, et c'est sur eux que reposent le lecteur, l'export SRT et VTT et la traduction. Passer au modèle plus précis ferait monter l'exactitude des mots et casserait silencieusement trois fonctions : l'arbitrage penche donc de l'autre côté.

Ce qui arrive à un long enregistrement

Au-delà d'une certaine durée, l'audio n'est pas envoyé d'un bloc. Le fichier est parcouru à la recherche des silences et coupé au dernier moment calme avant chaque limite, de sorte que la césure tombe entre deux phrases et non au milieu d'un mot, et les morceaux sont transcrits plusieurs à la fois plutôt que l'un après l'autre. Si le travail est interrompu, les points de coupe sont déjà enregistrés : il reprend au morceau où il s'est arrêté au lieu de recommencer le fichier entier.

La langue est décidée une fois, pas morceau par morceau

La langue est détectée sur le premier morceau puis réutilisée pour tout le fichier. C'est délibéré : laissé libre de détecter à chaque morceau, le modèle peut basculer de langue au milieu d'un enregistrement sur un passage bas ou accentué et rendre une transcription qui change de langue en route. Le prix de cette règle, c'est qu'un enregistrement réellement bilingue est transcrit dans la langue de son ouverture.

Là où il se trompe

La précision est une propriété de votre audio, pas de la page marketing : nous ne publions donc pas de pourcentage. Ce qui la fait bouger : les voix qui se chevauchent, le bruit et la musique de fond, la compression de qualité téléphonique, les accents marqués et les noms propres que le modèle n'a aucun moyen de connaître — personnes, médicaments, noms de produits internes. La réponse pratique, c'est l'éditeur : le texte reste à côté de l'audio, chaque segment est cliquable, et corriger une poignée de noms coûte une fraction du temps qu'il faudrait pour tout taper.

Ce que donne un fichier long sur l'offre gratuite

Un fichier plus long que la limite d'affichage gratuite est tout de même transcrit en entier — rien n'est tronqué dans l'appel au modèle — mais seules les 30 premières minutes s'affichent et s'exportent tant que le compte n'est pas Pro. Votre quota est débité de ce qui vous a été montré, dans la limite de 30 minutes, et non de la durée complète du fichier. La limite est annoncée avant le début de l'envoi plutôt que découverte après, et Pro la supprime entièrement.

Ce que le modèle fait réellement à votre audio

Modèle
OpenAI whisper-1, retenu parce que c'est le seul modèle OpenAI qui renvoie des horodatages par segment
Identification de la langue
Lue dans l'audio lui-même, parmi 99 langues — aucun sélecteur de langue à se tromper
Ponctuation et majuscules
Ajoutées automatiquement, pour un texte qui se lit en phrases et non en bloc minuscule
Segmentation
La parole est découpée en segments de la longueur d'une phrase, chacun portant son instant
Audio long
Coupé sur les silences plutôt qu'à horloge fixe, transcrit en parallèle puis recousu dans l'ordre
Exports
TXT, Markdown, DOCX, PDF, SRT et VTT, tous construits à partir des mêmes segments horodatés
Édition
Le texte est à côté du lecteur, chaque segment peut être confronté à son audio et corrigé
Ce qu'il ne fait pas
Il écrit ce qui a été dit — il ne résume pas, ne réécrit pas et n'indique pas qui parle

Questions fréquentes

Quel modèle d'IA est utilisé ?

La transcription tourne sur OpenAI whisper-1, préféré aux gpt-4o-transcribe plus récents et plus précis parce qu'il est le seul à renvoyer des horodatages par segment, dont dépendent le lecteur, l'export de sous-titres et la traduction.

La transcription par IA est-elle précise ?

La précision dépend de l'enregistrement et non de l'offre : une parole nette revient quasiment mot pour mot, tandis que les voix superposées, la musique de fond, l'audio de qualité téléphonique et les noms propres inhabituels sont là où apparaissent les erreurs. Chaque segment est cliquable à côté de l'audio, si bien que corriger prend des minutes plutôt qu'une refrappe.

Quelle est sa rapidité ?

La plupart des fichiers se terminent en quelques minutes et non dans la durée de l'enregistrement, parce qu'un fichier de 60 minutes est découpé en morceaux dont plusieurs sont transcrits en même temps au lieu de se suivre. Les envois longs continuent en arrière-plan même si vous fermez l'onglet.

Quelles langues l'IA gère-t-elle ?

La parole en 99 langues, reconnue automatiquement d'après l'audio et sans aucun réglage à choisir. La langue est détectée sur le premier morceau puis conservée pour tout le fichier : un enregistrement qui change de langue en cours de route est transcrit dans celle par laquelle il a commencé.

Puis-je exporter le résultat ?

La transcription s'exporte en TXT, Markdown, DOCX, PDF, SRT et VTT, le tout produit à partir des mêmes segments horodatés, si bien que les sous-titres collent à l'audio à la milliseconde.

Indique-t-il qui parle ?

Les étiquettes de locuteur ne font pas partie du résultat aujourd'hui : la transcription rend ce qui a été dit, dans l'ordre, avec les temps. Pour un entretien, l'astuce habituelle est que les tours de parole se devinent aux coupures entre segments.

Résume-t-il l'enregistrement ?

La transcription écrit ce qui a été dit et rien de plus ; le résumé par IA est une action distincte que vous déclenchez vous-même, la transcription n'est donc jamais réécrite ni raccourcie à votre insu.

Que se passe-t-il avec un fichier plus long que la limite gratuite ?

Le fichier est transcrit intégralement, mais un compte sans Pro voit et exporte les 30 premières minutes et se voit débiter au plus 30 minutes de son quota. Le plafond est affiché avant l'envoi, pas après l'attente.

Quelle durée d'enregistrement puis-je transcrire ?

Un fichier unique peut atteindre 60 minutes en gratuit et 10 heures en Pro, dans la limite de 5 Go par envoi dans les deux cas.

La transcription par IA est-elle gratuite ?

La transcription par IA est gratuite dans la limite mensuelle de 60 minutes sans carte bancaire ; Pro la porte à 30 heures par mois, lève le plafond d'affichage et supprime la limite quotidienne d'envois.

Plus de façons de transcrire

Audio et vidéo en texteTranscription MP3 préciseAudio en texteTranscription gratuite

Enregistrements longs et gros fichiers ?

Passez à Pro pour transcrire des heures d'audio et de vidéo, avec plus de minutes mensuelles et des envois illimités — un texte précis en 99 langues.