«Сначала я решил, что ему конец, но потом услышал русскую речь»
В зарубежных СМИ завирусился ролик с россиянином, выгуливавшим ручных медведей. За сутки видео набрало более 8 млн просмотров.
А потом говорят «стереотипы»
Сохраняй посты, комментируй и ставь оценки
В зарубежных СМИ завирусился ролик с россиянином, выгуливавшим ручных медведей. За сутки видео набрало более 8 млн просмотров.
А потом говорят «стереотипы»

Медведю приглянулся гамак, установленный в лесистой местности. Косолапый зверёк попытался забраться в него, однако сделать это оказалось непросто.

На Новой Земле метеоролог криком прогнала пришедшего на станцию за треской белого медведя.

На кадрах виден пушистый зверёк, который обследует постройку. По словам агрессивной женщины, мишка попытался забраться в пристройку, где находятся остатки улова трески.
«Ты задолбал. Ушел отсюда! Бегом отсюда пошел!» — слышно голос автора ролика.
Животные приспособились к новым условиям, но биологи пока не понимают, как именно

Белые медведи — наглядный пример последствий изменения климата на планете для дикой природы. Эти гигантские млекопитающие охотятся, спариваются и проводят свои дни на арктическом морском льду, который стремительно исчезает по мере роста глобального потепления.

Однако выясняется, что белые медведи, по крайне мере, некоторые их популяции, гораздо более устойчивы перед лицом изменения климата, чем предполагалось до сих пор. Как обнаружили к своему удивлению ученые из Норвежского института полярных исследований, статья которых опубликована в журнале Scientific Reports, медведи, обитающие в районе архипелага Шпицберген в Баренцевом море, неплохо адаптировались к сокращению площади морского льда.
В течение 24 лет, с 1995 по 2019 годы, исследователи периодически выслеживали медведей с вертолета и временно обездвиживали их, чтобы оценить общее физическое состояние животных — показатель, называемый индексом состояния тела, или BCI.
В общей сложности было проведено более тысячи оценок BCI 770 белых медведей в районе Шпицбергена — регионе, где за последние десятилетия наблюдалось особенно резкое сокращение площади морского льда. К 2019-му ежегодный ледовый сезон в регионе сократился более чем на два месяца по сравнению с тем, что было 24 года назад.

Анализ собранных данных показал, что, даже несмотря на исчезновение морского льда, состояние здоровья медведей не ухудшилось. По словам ведущего автора исследования Йона Аарса, вопреки прогнозам белые медведи оказались в «довольно хорошем» состоянии, даже восстановившись после снижения BCI в период с 1995-го по 2000 год, и это прямо противоположно тому, чего он и его команда ожидали.
Это не значит, что медведи совсем не пострадали от сокращения площади морского льда; некоторые переместились в другие места обитания или сдвинули свои ареалы на север, следуя за отступающим льдом, говорит Аарс. И конечно, трудно сказать, были бы белые медведи в еще лучшем состоянии, если бы не изменение климата.
Хотя результаты наблюдения за медведями на Шпицбергене могут быть полезны для изучения других районов со схожими экосистемами, Аарс предупреждает, что это не означает, что все десятки тысяч белых медведей в Арктике одинаково благоденствуют.
Но почему медведи на Шпицбергене чувствуют себя так хорошо? Аарс и его коллеги предполагают, что это может быть связано с изменениями в рационе животных. Возможно, из-за сокращения площади льда стало легче охотиться на тюленей, которые собираются на оставшемся льду, а может быть, медведи стали больше питаться тушами моржей или северных оленей.

На видео показано, как на одной из приморских сопок косолапый подходит к «деревянному шесту», встает на задние лапы и широкой спиной к камере. Он начинает танцевать, активно почесываясь. Затем он видит, что напротив есть еще одно дерево. Он хочет сделать то же самое и с этим «шестом». Медведь медленно идет ближе, останавливается и обнюхивает царапины на коре. После этого он обтирается о них головой, стоя на четырех лапах. А далее он снова встает, поворачивается к камере, раскрывает пасть и начинает танцевать.
В заповеднике объяснили, что медведи исполняют такие необычные на первый взгляд движения, чтобы оставить запах и пометить свой район. На дереве же остается много их шерсти, что тоже является знаком для остальных животных. Помимо этого, так звери «смолятся», чтобы их меньше одолевали насекомые, блохи и клещи.

Медвежонок обнаружил загадочный для него артефакт — перчатку. Разумеется, медвежонок понятия не имел, для чего нужны эти штуки, поэтому, на всякий случай, решил устроить незваной гостье хорошую взбучку.
Сначала косолапый хышник храбрился, с яростью атакуя неподвижного врага и явно считая себя грозой леса. Но внезапно, то ли испугавшись собственной тени, то ли вообразив, что перчатка вот-вот оживет и даст сдачи, маленький «герой» совершил тактическое отступление на ближайшее дерево. Видимо, решил, что высота — лучший союзник в борьбе с коварными перчатками.
Извините - это редко от меня, но тут пост-клип. Думаю 15 минут доставят Вам инфы - редко такие клипы видишь...
Короткий аудиофрагмент из Common Voice и двухчасовое совещание с перебиваниями, шумом кондиционера и названиями продуктов проверяют систему распознавания речи по-разному. Поэтому место модели в публичном бенчмарке еще не отвечает на главный вопрос бизнеса: сколько времени уйдет на получение пригодного текста из реальной записи.
Для транскрибации звонков, лекций, интервью и субтитров важна не только точность распознавания слов. На итог влияют сегментация длинного файла, работа с тишиной, пунктуация, диаризация спикеров, устойчивость API, поддержка форматов и качество склейки результата.
Ниже сравним OpenAI Whisper Large v3, Microsoft VibeVoice-ASR, Yandex SpeechKit и Google Cloud Speech-to-Text с Chirp 3. Лучшей модели для всех сценариев нет. Для русскоязычных длинных записей сильный движок нужно оценивать вместе с инфраструктурой и постобработкой.
Whisper построен как encoder-decoder Transformer. Исходное семейство обучалось на 680 000 часах многоязычного аудио. Версия Large v3 получила значительно больший обучающий набор: 1 млн часов с неполной разметкой и 4 млн часов псевдоразмеченного аудио. Large v3 Turbo сокращает число слоев декодера с 32 до 4, поэтому работает заметно быстрее ценой небольшого снижения качества.
Сильная сторона Whisper для русского языка проявляется на сложной речи: разговорной лексике, смешении русских и английских терминов, неидеальной дикции и фоне. Модель сразу генерирует текст со знаками препинания и обычно дает более читаемый черновик, чем классические ASR-системы без развитой языковой части.
Но у архитектуры есть ограничение: базовое окно Whisper рассчитано примерно на 30 секунд аудио. Длинный файл все равно обрабатывается последовательно. Библиотека или провайдер режет запись на сегменты, переносит контекст и затем собирает результат.
Именно здесь две системы на одной модели могут показать разное качество. Ошибки появляются не только внутри сегмента, но и на границах: пропавшее слово, повтор фразы, неверный таймкод, потерянный спикер. На тишине или музыке Whisper способен генерировать правдоподобный, но отсутствующий в записи текст. Для production-сценария нужны VAD, контроль повторов, фильтрация пустых сегментов и логика восстановления контекста.
У официального OpenAI API в 2026 году есть и новые модели транскрибации, включая GPT-4o Transcribe и вариант с диаризацией. При этом загрузка файла через стандартные speech-to-text endpoints по-прежнему ограничена 25 МБ. Большие записи приходится сжимать или делить до отправки.
VibeVoice-ASR появился в открытом доступе в январе 2026 года. В официальном репозитории текущая модель обозначена как VibeVoice-ASR-7B. Она принимает до 60 минут непрерывного аудио в пределах контекста 64K и за один проход формирует структурированный результат: кто говорил, когда и что сказал.
Модель объединяет распознавание, таймкоды и диаризацию. Поддерживаются пользовательские hotwords: имена, бренды, аббревиатуры и термины можно передать как контекст. Для технических интервью и корпоративных встреч это полезнее, чем попытка исправлять каждое название после транскрибации.
В официальном тесте MLC-Challenge для русского языка VibeVoice-ASR показал WER 12,40%. Эта цифра характеризует конкретный датасет и протокол. Сравнивать ее напрямую с результатами Whisper, Yandex или Google из других тестов нельзя.
Практическая цена часового контекста заключается в требованиях к развертыванию. Нужны Python, CUDA, FFmpeg, совместимое окружение и NVIDIA GPU. Репозиторий Microsoft предлагает запуск через NVIDIA PyTorch Container. Сторонние сборки снижают порог входа, но не снимают задачи обновления зависимостей, мониторинга памяти и масштабирования очереди.
VibeVoice интересен разработчикам, которым нужен открытый long-form ASR с диаризацией и возможностью дообучения. Для обычного пользователя это пока не готовый облачный продукт. Microsoft прямо рекомендует дополнительное тестирование и разработку перед коммерческим применением.
SpeechKit изначально ориентирован на русский язык и российские сценарии. Сервис поддерживает потоковое, синхронное и асинхронное распознавание. В актуальной документации синхронный режим рассчитан на короткие файлы до 30 секунд, асинхронный принимает записи длительностью до 4 часов и размером до 1 ГБ.
Утверждение, что Yandex не расставляет пунктуацию, в 2026 году устарело. Режим литературного текста добавляет заглавные буквы и знаки препинания. Есть нормализация чисел и дат, определение дикторов, дообучение и обработка результата с помощью LLM.
Слабое место SpeechKit не в отсутствии базовых функций, а в количестве режимов, параметров и ограничений. Разработчику нужно выбрать API, способ загрузки, формат, модель, нормализацию и схему получения результата. Для длинных файлов применяется асинхронная обработка, поэтому интеграция включает создание операции, проверку статуса и получение транскрипта.
Опубликованный на Habr тест 2025 года показал неудачный результат SpeechKit Playground на части файлов, включая повторы строк. Это полезный сигнал, но не универсальная оценка всей платформы: автор использовал собственный набор из 16 записей, а ошибки запроса включал в WER. Перед внедрением SpeechKit нужно тестировать на звонках и записях именно вашего домена.
Сравнивать Whisper с абстрактным Google Speech в 2026 году некорректно. Актуальная многоязычная модель Google называется Chirp 3. Она поддерживает русский язык, потоковое и пакетное распознавание, автоматическую пунктуацию, адаптацию под фразы и автоматическое определение языка.
Для длинного аудио используется BatchRecognize. В документации Chirp 3 указан типовой диапазон от одной минуты до одного часа. Русский доступен для транскрибации, но диаризация Chirp 3 на момент проверки перечислена только для ограниченного набора языков, без ru-RU.
Google удобен компаниям, которые уже работают в Google Cloud и готовы хранить аудио в облачной инфраструктуре проекта. Сильные стороны здесь не сводятся к качеству отдельной модели: IAM, региональные endpoints, журналирование, квоты и масштабирование входят в общую платформу.
Заявлять, что Google всегда хуже Whisper на русском, без единого контролируемого теста нельзя. На чистой диктовке разница может быть небольшой, а на телефонной записи с отраслевой лексикой порядок моделей способен измениться.

Таблица показывает, почему вопрос о лучшей модели распознавания речи нельзя закрыть одной цифрой WER. Сначала определите сценарий: звонки, интервью, субтитры, поток или архив. Затем соберите тестовый набор хотя бы из 20–50 своих файлов и посчитайте не только ошибки слов, но и стоимость ручной правки.
Разделить аудио через FFmpeg несложно. Сложно разделить его так, чтобы фраза не оборвалась на полуслове. Обычно сегменты делают с перекрытием. После распознавания нужно найти повторяющийся участок текста, удалить дубль и сохранить таймкоды.
На одном чистом монологе эвристика работает. На совещании с короткими репликами, паузами и перебиваниями она начинает ошибаться. Чем больше правил добавляется, тем сильнее проект превращается из вызова модели в отдельную ASR-платформу.
Музыка, длинная пауза, шум зала и тихая речь могут запустить ложную генерацию. Whisper иногда повторяет последнюю фразу или создает типовые подписи, которых не было в аудио.
Production-конвейер использует VAD, минимальную длительность речи, пороги уверенности, контроль компрессии текста и поиск повторяющихся последовательностей. После этого все равно нужен журнал проблемных сегментов для повторной обработки.
Пользователь загружает не только MP3. На вход приходят WAV, M4A, OGG, FLAC, MP4, AVI, записи телефонии с двумя каналами и файлы с нестандартной частотой дискретизации. Их нужно проверить, извлечь аудиодорожку, привести к ожидаемому формату и не потерять метаданные времени.
Лимит OpenAI в 25 МБ добавляет еще один слой: сжатие, нарезку, очередь запросов и сборку результата. Размер файла при этом не равен длительности. 25 МБ могут содержать короткий WAV или длинный MP3 с низким битрейтом.
Собственный сервер выгоден при предсказуемом постоянном потоке. При редких загрузках видеокарта простаивает. При резком наплыве файлов возникает очередь, пользователи ждут, а команде приходится добавлять воркеры и следить за памятью.
К стоимости GPU прибавляются хранение файлов, мониторинг, повторные задания, обновление CUDA, безопасность, резервирование и поддержка форматов. Бесплатная модель не означает бесплатный сервис.
Для исследовательского проекта разумно поднять Whisper или VibeVoice локально. Вы получите контроль над кодом, данными и параметрами. Для продукта важнее другой вопрос: кто отвечает за длинные файлы, сбои, диаризацию, форматы и качество текста на стыках.
Whisper, VibeVoice, Yandex и Google решают разные части одной задачи. Whisper дает сильное качество базовой транскрибации, VibeVoice сохраняет часовой контекст, Yandex предлагает развитый набор режимов для русского языка, Google встраивает STT в масштабируемую облачную платформу.
На практике качество определяет весь конвейер: подготовка аудио, VAD, склейка сегментов, диаризация, пунктуация, контроль повторов и обработка ошибок. Поэтому бизнесу часто выгоднее тестировать не голую модель, а готовый результат на своих файлах.
Комментарии