Довірте прослуховування штучному інтелекту — точні тексти з пунктуацією з будь-якого запису.
На базі OpenAI Whisper, 99 мов, таймкоди. Безкоштовно для старту.
Посилання має бути публічно доступним.
Сучасний AI для мовлення перетворює записи на чистий текст значно швидше й дешевше, ніж людина-друкарка — ось як це працює.
Додайте будь-який запис або вставте посилання з YouTube, TikTok, Instagram, Vimeo та інших. Ані моделі налаштовувати, ані мову вказувати не треба — і те, і те визначається із самого звуку.
Запис декодується, за потреби ділиться на частини й надсилається в OpenAI Whisper, який повертає текст із пунктуацією та великими літерами, розбитий на фразові сегменти з часом початку й кінця в кожному.
Транскрипт стоїть поруч із плеєром, тож будь-який сегмент можна переслухати й виправити. Експорт у TXT, Markdown, DOCX, PDF, SRT або VTT — тим самим кодом, що й окремі інструменти для субтитрів.
AI для мовлення справляється з обсягом, швидкістю й мовами, з якими ручна транскрибація не встигає.
Довгий запис ріжеться на частини й транскрибується по кілька шматків одночасно, тож година аудіо не означає години очікування.
Одна модель покриває майже будь-яку мову, і мова читається зі звуку, а не обирається в меню, де можна помилитися.
Речення, коми й великі літери повертаються разом із текстом — саме це відрізняє транскрипт, який можна читати, від суцільного нижнього регістру.
Кожна фраза несе час, коли її вимовили: саме на цьому тримаються клік-по-тексту, експорт субтитрів і пошук усередині запису.
Без втоми й дрейфу — п'ятдесятий файл виходить на тому ж рівні, що й перший, і за ту саму ціну за хвилину.
Інтерв'ю, дзвінки, лекції, голосові нотатки, польові записи — якщо там є мовлення, модель його запише.
Ручна транскрибація повільна й дорога — приблизно чотири години роботи на годину аудіо. AI-транскрибація на OpenAI Whisper виконує ту саму роботу за хвилини, додає пунктуацію й таймкоди та обробляє 99 мов без збоїв. Контроль залишається за вами: текст розташований поруч з аудіо, тож можна перевірити й виправити все, що модель пропустила.
Двигун, рішення за ним і місця, де він досі помиляється.
У OpenAI є швидші й точніші моделі мовлення — gpt-4o-transcribe і її mini-версія, — і ми свідомо ними не користуємось. Вони повертають лише простий текст. whisper-1 єдина віддає таймкоди по сегментах, а саме на них тримаються плеєр, експорт SRT і VTT та переклад. Перехід на точнішу модель підняв би точність слів і мовчки зламав три функції, тож вибір зроблено на користь таймкодів.
Аудіо понад певну довжину не надсилається одним шматком. Файл сканується на паузи, і розріз ставиться в останній тиші перед межею, тож поділ припадає між реченнями, а не всередині слова, а частини транскрибуються по кілька одночасно, а не одна за одною. Якщо завдання перервалося, точки розрізу вже збережені, тож воно продовжується з того шматка, на якому спинилося, а не з початку файлу.
Мова визначається на першому фрагменті й далі використовується для всього файлу. Це зроблено навмисно: якщо дозволити визначати мову на кожному шматку, модель може перемкнутися посеред запису на тихому чи акцентованому уривку й віддати транскрипт, що змінює мову на середині. Ціна цього правила — справді двомовний запис буде розшифрований мовою свого початку.
Точність — властивість вашого аудіо, а не маркетингової сторінки, тому ми не публікуємо відсотків. Що на неї впливає: перехресна мова кількох людей, шум і музика на фоні, телефонна якість, сильний акцент і власні назви, яких модель знати не може, — імена, назви ліків, внутрішні продуктові назви. Практична відповідь — редактор: текст лишається поруч зі звуком, кожен сегмент клікабельний, і виправити кілька імен швидше, ніж набрати транскрипт руками.
Файл, довший за безкоштовний ліміт показу, все одно транскрибується повністю — у виклику моделі нічого не обрізається, — але до переходу на Pro показуються й експортуються перші 30 хвилин. З ліміту списується стільки, скільки вам показали, але не більше ніж 30 хвилин, а не вся довжина файлу. Про обмеження ми кажемо до початку завантаження, а не після нього, і Pro прибирає його повністю.
Транскрибація працює на OpenAI whisper-1, обраній замість новіших і точніших gpt-4o-transcribe тому, що вона єдина повертає таймкоди по сегментах, на яких тримаються плеєр, експорт субтитрів і переклад.
Точність залежить від запису, а не від тарифу: чиста мова повертається майже дослівно, а помилки з'являються там, де люди говорять одночасно, грає музика, звук телефонної якості або звучать незнайомі власні назви. Кожен сегмент клікабельний поруч зі звуком, тож виправлення — це хвилини, а не передрук.
Більшість файлів завершується за хвилини, а не за час самого запису: 60-хвилинний файл ріжеться на частини, і кілька з них транскрибуються одночасно, а не поспіль. Довгі завантаження продовжують працювати у фоні, навіть якщо закрити вкладку.
Мовлення 99 мовами, розпізнається зі звуку автоматично, без жодного налаштування. Мова визначається на першому фрагменті й тримається до кінця файлу, тож запис, що змінює мову посередині, буде розшифрований мовою свого початку.
Транскрипт експортується в TXT, Markdown, DOCX, PDF, SRT і VTT — усе з тих самих сегментів із часом, тож субтитри збігаються зі звуком до мілісекунди.
Позначок спікерів у результаті сьогодні немає — транскрипт передає сказане по порядку й з часом. Для інтерв'ю зазвичай виручає те, що зміну реплік видно по розривах між сегментами.
Транскрибація записує сказане й нічого більше; AI-конспект — окрема дія, яку ви запускаєте самі, тож транскрипт ніколи не переписується й не скорочується без вашого відома.
Файл транскрибується цілком, але акаунт без Pro бачить і експортує перші 30 хвилин, а з ліміту списується щонайбільше 30 хвилин. Про обмеження ми кажемо до завантаження, а не після очікування.
Один файл може тривати до 60 хвилин на Free і до 10 годин на Pro, в межах 5 ГБ на завантаження в обох випадках.
AI-транскрипція безкоштовна в межах місячного ліміту 60 хвилин без картки; Pro піднімає його до 30 годин на місяць, знімає обмеження показу й прибирає денний ліміт завантажень.
Перейдіть на Pro, щоб транскрибувати години аудіо й відео — більше хвилин щомісяця та необмежені завантаження, точний текст 99 мовами.
Дивитись тарифи Pro