Как записать разговор, чтобы расшифровка не превратилась в кашу
Мы делаем AudioVText — сервис, который переводит аудио и видео в текст. Распознавание речи сейчас работает хорошо. Но у него есть предел, и задаёт его запись. Плохой звук испортит текст в любом сервисе, наш тут не исключение.
Собрали то, что портит расшифровку сильнее всего. Почти всё исправляется ещё до того, как вы нажмёте «Запись».
Телефон в кармане пишет ткань, а не голос
Самая частая проблема — расстояние. Телефон лежит в сумке или во внутреннем кармане. Говорящий сидит в паре метров. Голос приходит глухим и тонет в отражениях от стен.
Человек такую запись ещё разберёт, если прислушается. Нейросеть начнёт угадывать слова по звучанию.
Решение скучное. Положите телефон на стол между собеседниками, микрофоном вверх. Уберите подальше чашки и ноутбук с шумным вентилятором. На лекции садитесь ближе к преподавателю. С последнего ряда голос потом не вытянуть.
Голые стены хуже шумной улицы
Пустой кабинет с плиткой и стеклом звучит как ванная комната. Каждое слово отражается и накладывается на следующее. Окончания пропадают первыми.
Ковёр, шторы и мягкая мебель гасят эхо лучше любых настроек. Кстати, припаркованная машина с заглушённым двигателем — неплохая студия. Салон маленький, обивка мягкая.
Музыка со словами мешает больше, чем гул
Ровный шум кондиционера или вентилятора распознаванию почти не вредит. Модель отделяет его от речи. С песней по радио или включённым телевизором так не выйдет.
Там тоже звучат слова. Нейросеть честно пытается записать и их. В итоге посреди совещания в тексте появляется припев.
Когда говорят двое, теряются обе фразы
В живом споре перебивать нормально. На записи две одновременные реплики сливаются в одну невнятную. Разделение по спикерам в таких местах тоже ошибается.
На интервью помогает простое правило: задали вопрос — дождитесь конца ответа. На совещании нужен ведущий, который даёт слово по очереди.
Громкая связь съедает половину голоса
Созвон часто пишут так. Телефон лежит рядом с динамиком ноутбука. Голос собеседника уже сжат связью. Потом он ещё раз проходит через воздух и теряет остатки чёткости.
Лучше включить запись в самой программе для звонков, во многих она есть. Если такой функции нет, говорите через гарнитуру.
Редкие имена лучше произнести отдельно
Фамилии, названия компаний и профессиональный жаргон модель знает хуже обычных слов. Она подставит похожее по звучанию. Незнакомая фамилия легко рассыпается на два-три случайных слова.
В начале записи назовите ключевые имена чётко и чуть медленнее. После расшифровки пройдитесь поиском по тексту и замените ошибки разом.
Не пережимайте файл
Иногда запись конвертируют по нескольку раз, чтобы уменьшить размер. Каждое пережатие съедает часть звука. Шипящие и тихие окончания страдают первыми.
Отдавайте на расшифровку исходный файл с диктофона или из программы. С видео то же самое. Звуковую дорожку AudioVText достанет из ролика сам.
Десять секунд, которые экономят час
Перед важной встречей запишите короткий тест и послушайте его в наушниках. Каждое слово разбирается без напряжения — значит, и нейросеть справится. Если приходится вслушиваться, пересядьте сейчас. Восстанавливать смысл по обрывкам потом намного дольше.






