Итак, погнали. Несколько историй от меня. Работал тогда не совсем в тп, просто сопровождали продукт, который и допиливали и прочее. Но были клиенты, у которых была ночная отгрузка (молочка) и потому, что бы она резко не встала, ночью мы ещё и условно дежурили. То есть я отработал с 8 до 18, а потом по срочным вопросам должен был быть на телефоне. Открылся новый филиал, набрали сотрудников и там открылся портал в ад. 1 Звонов в три ночи. - Добрый день, я могу распечатать ещё раз документы, а то подписала не правильно? - Да можете - Спасибо Отключились... 2 Звонов от этого же оператора, в другой день, время примерно тоже - Добрый день, я случайно провела документ, который ещё не готов к отгрузке, могу я его распровести?
- У вас кнопка доступна? - Да - Нажмите, есть какое то сообщение или предупреждение? - Нет - Значит можете - Спасибо Отключилась
Но в том филиале не все такие были. Там по первой люди забывали закрывать сеансы, а потому лицензий сильно не хватало. 2 из 3 коллеги уехали и на месте проводили внедрение и ученье, а потом в дневное время все вопросы по ТП падали на меня. И вот была юрист, которая вечно не могла попасть в базу, она звонила мне. Я перезапускал службу попутно выгоняя тех кто сидит и нет активности. В раз пятый, был примерно такой диалог.
-Добрый день, не могу попасть в базу. -Добрый, минуту посмотрю Открываю рдп, смотрю всё это, тем временем в телефонной трубле -Чип Чип Чип Чип и Дейл к вам спешат Чип Чип Чип Чип и Дейл лучше всех
Дальше про другую фирму. Внутренний клиент, но разработки было много. Мне под руку попала большая задача, а потому когда с ней были ошибки падало ко мне. Даже зачастую минуя линию ТП, а пользователи звонили на прямую. И вот была такая история. - Добрый день, не проводится документ - Какая ошибка? - Нет ошибки - То есть нет ни одного сообщения или предупреждения? - Нет - Да быть того не может - Я такой, ну ок, подключусь. У пользователя что то типа такого
Только там какое-то поле не заполнено.
- Вот же ошибка. = А это ошибка?
Закончу другой, как по мне самой крутой историей. Делали автоматизацию склада. Основная суть менеджер выписал документ. На склад падает задача по сборке. Кто то из кладовщиков берёт и собирает товар в зоне отгрузке. Как он собрал, падает задача отвественному проверить, что всё принесли. Если принесли лишнее то задача на размещение, если не принесли, то задача принести ещё (но уже всё ответственному). Если в заказе есть позиция, которой нет на складе, то позиция удаляется из заказа. Как ответственный сказал, что всё ок. Ждут отгрузку и проводится документ. Итак, звонит мне зам начальника склада. - Ваша программа не работает. - Слушаю Диктует что за отгрузка. Нахожу что не может списать БАМПЕР. Смотрю по базе, его нет уже как несколько месяцев. Спрашиваю, он физически есть этот бампер? - Да - Ты сам его видел - Нет, но ответственный поставил - Давай ты выйдешь, посмотришь, что есть и если он и правда есть буду искать почему не положили на остатки его. Выходит. Зовёт ответственного. Ты поставил что он есть, покажи. Как не можешь показать? Ты чё охуел? Нахуй ты тут сидишь? - Ладно я понял, спасибо давай.
Вы загрузили запись разговора в Whisper, дождались обработки и получили точный, но почти бесполезный текст:
добрый день вы оставляли заявку на подключение телефонии да нам нужно записывать звонки менеджеров сколько человек работает в отделе сейчас восемь но планируем расширяться
Слова распознаны правильно, однако непонятно, где говорит клиент, а где менеджер. Такой результат сложно передать в CRM, использовать для контроля качества звонков или отправить в нейросеть для подготовки резюме.
После разделения по голосам та же запись выглядит иначе:
Менеджер: Добрый день. Вы оставляли заявку на подключение телефонии?
Клиент: Да, нам нужно записывать звонки менеджеров.
Менеджер: Сколько человек работает в отделе?
Клиент: Сейчас восемь, но планируем расширяться.
Чтобы получить такую структуру, одного распознавания речи недостаточно. Системе нужно определить, кто и в какой момент говорил. Эта задача называется диаризацией спикеров.
Разберемся, как работает распознавание речи с диаризацией, можно ли добавить разделение по голосам к Whisper и когда выгоднее использовать готовый API вместо локальных моделей.
Почему Whisper возвращает сплошной текст
Whisper хорошо распознает речь, определяет язык и разбивает запись на временные сегменты. Но базовая модель не присваивает репликам метки конкретных участников.
На выходе обычно есть:
распознанный текст;
начало и конец фрагмента;
служебные данные о языке и вероятности распознавания.
Информации о том, кто произнес фразу, в стандартном результате нет.
Для лекции, голосовой заметки или монолога этого достаточно. В разговоре двух и более людей теряется сама структура коммуникации. Вопросы смешиваются с ответами, а реплики разных участников склеиваются в один абзац.
Особенно заметна проблема на длинных записях:
телефонных разговорах;
интервью;
совещаниях;
консультациях;
подкастах;
переговорах;
фокус-группах.
Поэтому Whisper с разделением спикеров обычно представляет собой не одну модель, а связку распознавания речи и отдельной системы диаризации.
Что такое диаризация спикеров
Диаризация отвечает на вопрос: кто говорил и в какой момент.
Система анализирует голосовые признаки, делит запись на интервалы и объединяет похожие фрагменты в группы. В результате каждый участок получает условную метку:
00:00:01 Speaker_0: Добрый день. Чем могу помочь?
00:00:04 Speaker_1: Хочу уточнить статус заказа.
00:00:08 Speaker_0: Назовите, пожалуйста, номер заявки.
Метки Speaker_0 и Speaker_1 не являются именами людей. Они показывают, что фразы произнесли разные участники.
Чтобы заменить технические обозначения на роли или имена, нужны дополнительные данные. Например, в телефонном разговоре можно заранее знать, какой канал принадлежит сотруднику. На онлайн-встрече имена иногда берут из списка участников. В остальных случаях спикеров переименовывают после расшифровки.
Диаризацию не следует путать с идентификацией личности по голосу. Первая разделяет участников между собой, вторая пытается определить конкретного человека по заранее известному голосовому образцу.
Где разделение по голосам приносит практическую пользу
Диаризация нужна не ради красивого оформления текста. Она позволяет использовать расшифровку как структурированные данные.
Аналитика звонков отдела продаж
Когда реплики клиента и менеджера разделены, можно автоматически определить:
какие вопросы задавал сотрудник;
какие возражения высказал клиент;
была ли презентация продукта;
договорились ли стороны о следующем шаге;
кто говорил большую часть времени;
соблюдался ли сценарий разговора.
Без разделения по голосам нейросеть может приписать слова клиента менеджеру и сделать неверный вывод о качестве звонка.
Интервью и исследования
Журналисту или исследователю важно отделить вопросы от ответов. После диаризации проще готовить публикацию, искать цитаты и сравнивать позиции нескольких участников.
Если в беседе участвуют три или четыре человека, ручная разметка часовой записи занимает больше времени, чем сама вычитка текста.
Совещания и рабочие встречи
Структурированная расшифровка помогает восстановить ход обсуждения:
кто предложил решение;
кто взял задачу;
какие возражения возникли;
кто назвал срок;
по какому вопросу не пришли к согласию.
На основе такого диалога можно подготовить протокол, список поручений и краткое резюме встречи.
Подкасты и видеоконтент
Разделение по спикерам упрощает монтаж, подготовку субтитров, создание таймкодов и публикацию текстовой версии выпуска.
Редактор может быстро найти реплику ведущего или гостя, не прослушивая запись целиком.
Консультации
Юридические, медицинские и экспертные консультации часто содержат вопросы, уточнения и рекомендации. Диаризация сохраняет логику разговора и снижает риск смешать слова специалиста с описанием ситуации клиента.
При работе с персональными или коммерческими данными необходимо отдельно проверить условия хранения, обработки и удаления загруженных файлов.
Можно ли добавить диаризацию к Whisper
Да, но сама модель Whisper не решает эту задачу полностью.
Для локальной обработки обычно используют следующую схему:
Аудиофайл
|
+--> Whisper: распознает слова и ставит таймкоды
|
+--> Модель диаризации: определяет интервалы спикеров
|
+--> Сопоставление результатов по времени
|
+--> Готовый диалог
В качестве модели диаризации часто используют pyannote.audio или компоненты NVIDIA NeMo. В 2026 году появились и end-to-end решения, например VibeVoice ASR, которые объединяют распознавание, временную разметку и определение спикеров в одном проходе.
Подобные модели сокращают число этапов, но не отменяют проверку качества. На результат влияют шум, длительность записи, перебивания, количество участников и доступные вычислительные ресурсы.
Для эксперимента или внутреннего ML-проекта локальный стек дает больше контроля. Для массовой обработки звонков нужно дополнительно решать вопросы очередей, повторных запусков, обновления моделей и распределения нагрузки.
Почему локальная диаризация сложнее, чем кажется
На тестовом аудио из двух четких голосов результат может выглядеть безупречно. На реальных звонках быстро проявляются пограничные случаи.
Участники перебивают друг друга
Когда два человека говорят одновременно, системе нужно обнаружить overlapping speech и решить, какие слова относятся к каждому голосу.
Если запись одноканальная, голоса физически смешаны. Даже правильное определение двух активных спикеров не гарантирует точного разделения текста.
Метки могут поменяться местами
Условный Speaker_0 не означает постоянного человека. Если длинную запись обрабатывать частями, в одном фрагменте эта метка может принадлежать клиенту, а в следующем менеджеру.
Поэтому результаты отдельных частей нельзя просто объединить без дополнительного сопоставления голосов.
Короткие реплики определяются хуже
Слова да, нет, понятно или хорошо содержат мало голосовых данных. Модель может присвоить такую реплику соседнему участнику, особенно если люди говорят быстро.
Шум меняет голосовые признаки
Телефонная компрессия, музыка, эхо, громкая улица и слабый микрофон ухудшают не только качество текста. Они мешают системе сравнивать голоса и объединять фрагменты одного человека.
Длинные записи требуют инфраструктуры
Локальная обработка включает не только запуск модели. Нужно контролировать очередь файлов, использование памяти, ошибки декодирования, повторные задачи и хранение промежуточных результатов.
Если диаризация является частью продукта, а не разовым экспериментом, стоимость поддержки такого контура может оказаться выше прямых затрат на вычисления.
RTTM: зачем нужен этот формат
Системы диаризации часто сохраняют результат в формате RTTM. В нем указываются начало фрагмента, его длительность и идентификатор спикера.
Упрощенный пример:
SPEAKER call_102 1 0.50 4.20 speaker_0
SPEAKER call_102 1 6.00 3.10 speaker_1
Первая строка означает, что speaker_0 говорил с отметки 0,5 секунды в течение 4,2 секунды. Вторая строка описывает интервал другого участника.
Проблема в том, что RTTM хранит временную разметку, но не создает готовый диалог. Текст Whisper и интервалы спикеров приходится сопоставлять по таймкодам.
Для исследовательской работы формат RTTM удобен. В бизнес-приложении обычно нужен другой результат:
{
"dialogue": [
{
"speaker": "Менеджер",
"start": 0.5,
"text": "Добрый день. Чем могу помочь?"
},
{
"speaker": "Клиент",
"start": 6.0,
"text": "Хочу уточнить статус заказа."
}
]
}
Такой JSON можно передать в CRM, систему аналитики или языковую модель без дополнительного парсинга промежуточных файлов.
В CRM отдела продаж могут храниться тысячи часов разговоров с клиентами. Формально записи есть, но для управления продажами они почти бесполезны: руководитель не может регулярно прослушивать весь поток, а выборочная проверка нескольких звонков показывает только отдельные эпизоды.
В результате часть информации остается внутри аудиофайлов. Менеджер договорился перезвонить, но не создал задачу. Клиент назвал причину отказа, но в карточке сделки появилась общая формулировка. Покупатель пожаловался на доставку, однако обращение не дошло до продуктовой команды. Супервайзер заметил нарушение скрипта спустя неделю, когда сделка уже была потеряна.
Расшифровка звонков колл-центра решает только первый уровень задачи. Она переводит разговор в текст, но бизнесу нужны более прикладные результаты:
краткое содержание звонка;
договоренности и следующие действия;
причина обращения или отказа;
оценка работы менеджера;
признаки недовольства;
упоминания конкурентов;
автоматически заполненные поля CRM;
теги для фильтрации и отчетов.
Для этого используется речевая аналитика: запись разговора переводится в структурированный текст, разделяется по спикерам и передается на дальнейший AI-анализ.
Собрать такую систему можно самостоятельно. Понадобятся ASR-модель, диаризация, обработка аудио, очередь заданий, GPU-инфраструктура, хранение результатов, контроль ошибок и отдельный аналитический слой. Для пилотного проекта этот путь выглядит доступным. При запуске на потоке звонков выясняется, что большую часть времени команда тратит не на аналитику, а на поддержку технического конвейера.
Есть более короткий маршрут: подключить готовый speech to text API или CRM-виджет и сосредоточиться на бизнес-правилах.
Как внедряют речевую аналитику лидеры рынка и почему не каждый подход подходит отделу продаж
На Habr опубликовано несколько показательных кейсов. Каждый решает реальную задачу, но не каждое решение разумно переносить в малый или средний бизнес.
Кастомная платформа под один бизнес-процесс
В кейсе Technokratos для HT Lab была разработана система анализа интервью. Она принимала запись, расшифровывала ее через Whisper Large 3, распределяла ответы по компетенциям и формировала заключение с помощью языковой модели. Рабочий сервис собрали за три недели.
Это хороший срок для заказной разработки, но к нему нужно добавить подготовку требований, тестирование, сопровождение, доработку промптов, мониторинг качества и поддержку инфраструктуры. Когда меняется CRM, формат отчета или модель оценки, изменения снова проходят через разработчиков.
Такой вариант оправдан, если процесс уникален, а готовый сервис не покрывает требования. Использовать его только ради транскрибации звонков CRM обычно невыгодно.
Python, Whisper и Google Colab
Команда ВкусВилл Бизнес пошла от практической задачи: в CRM находились тысячи звонков, которые невозможно было прослушать вручную. Записи скачивали скриптом, обрабатывали через Whisper в Google Colab, очищали от персональных данных и отправляли на анализ. Для первого теста применялась модель base, автор отдельно отметил ошибки в специальных терминах.
Подход удобен для разового исследования. Например, продуктовой команде нужно разобрать 300 интервью и найти повторяющиеся жалобы.
Для ежедневной автоматизации отдела продаж возникают ограничения:
среда Colab временная;
загрузка и выгрузка файлов требуют дополнительных сценариев;
при сбое часть заданий приходится перезапускать;
результаты нужно самостоятельно возвращать в CRM;
очистка персональных данных становится отдельным этапом;
нет гарантированного времени обработки;
сложно контролировать параллельный поток.
Прототип работает. Продакшен-сервис требует другой архитектуры.
Локальный стек из Whisper, NeMo, Ollama и Gemma
В материале Альфа-Банка показан локальный конвейер: ffmpeg готовит аудио, Whisper делает транскрипт, NVIDIA NeMo разделяет реплики по спикерам, Gemma через Ollama формирует саммари, а результаты сохраняются в Obsidian.
Для аналитика, исследователя или внутреннего эксперимента это полезная схема. Все компоненты можно контролировать, а данные не требуется отправлять во внешний сервис.
Для колл-центра появляется другой масштаб. Нужно обновлять несколько библиотек, следить за совместимостью CUDA и драйверов, хранить модели, управлять очередью, распределять нагрузку и контролировать качество диаризации. Если утром одновременно завершились 200 звонков, локальная видеокарта не увеличит производительность автоматически.
Телеком-API с базовой транскрибацией
Exolve показывает сценарий, в котором приложение создает звонок, получает идентификатор записи и запускает транскрибацию через SDK. В статье 2024 года приводилась стоимость 0,60 рубля за минуту. Автор прямо описывал этот пример как базу для собственной механики.
Телеком-API удобно использовать, когда телефония уже работает у того же поставщика. Но текст звонка еще не является речевой аналитикой. Отдельно потребуются:
распределение реплик между клиентом и менеджером;
нормализация текста;
саммари;
оценка скрипта;
тегирование;
запись результата в нужные поля CRM;
отчеты для руководителя.
Сравнение подходов
Три ловушки самописной STT-системы
Самостоятельный прототип часто выглядит как один вызов Whisper. Реальный конвейер сложнее. Основные проблемы становятся заметны после загрузки первых сотен записей.
Ловушка 1. Диаризация спикеров
Распознавание речи отвечает на вопрос, какие слова прозвучали. Диаризация определяет, кто и когда говорил.
Без нее получается текст, в котором реплики клиента и менеджера перемешаны. На таком материале трудно проверять скрипт. Система может приписать вопрос менеджера клиенту, а обещание клиента оплатить счет посчитать обязательством сотрудника.
Диаризация строится из нескольких компонентов. Например, каскадный сценарий NVIDIA NeMo включает детектор речевой активности, извлечение голосовых признаков и кластеризацию спикеров.
На результат влияют:
одновременная речь;
фоновый шум;
музыка ожидания;
переадресация;
громкая связь;
разная громкость каналов;
короткие реплики;
соединение нескольких разговоров в одном файле.
Даже после разделения на Спикера 1 и Спикера 2 нужно определить роли. В стереозаписи телефонии задача проще: менеджер и клиент могут находиться на разных каналах. В монофайле роли приходится устанавливать по контексту или дополнительным данным CRM.
Ловушка 2. Границы чанков и галлюцинации
Whisper обрабатывает аудио сегментами. Базовая архитектура рассчитана на 30-секундные фрагменты. При длинной записи система должна последовательно распознать сегменты и сохранить контекст между ними.
На границе могут возникнуть три типа дефектов:
фраза делится между двумя сегментами;
часть слова или реплики пропускается;
предыдущий контекст вызывает повторение.
Отдельная проблема связана с тишиной, музыкой и неречевыми звуками. Исследования Whisper показывают, что на таких участках модель иногда генерирует связные фразы, которых нет в записи. Для длинных разговоров также характерны повторяющиеся последовательности и пропуски содержания.
Поэтому production-пайплайн использует не только ASR. Нужны VAD, контроль временных меток, подавление повторов, проверка подозрительных сегментов, ограничения декодирования и правила обработки тишины.
Ловушка 3. Инфраструктура под неравномерную нагрузку
Нагрузка отдела продаж распределяется неравномерно. В середине дня очередь растет, ночью сервер простаивает. Собственная инфраструктура оплачивается независимо от загрузки.
Кроме GPU потребуются:
API-шлюз;
объектное хранилище;
база заданий;
очередь сообщений;
обработчики повторных попыток;
журналирование;
контроль лимитов;
мониторинг времени обработки;
резервирование;
механизм удаления файлов.
Если один час звонков обрабатывается несколько минут, это еще не значит, что система справится со ста часами, полученными одновременно. Нужно измерять не скорость одного файла, а пропускную способность всей очереди и максимальное время ожидания результата.
Короткий аудиофрагмент из Common Voice и двухчасовое совещание с перебиваниями, шумом кондиционера и названиями продуктов проверяют систему распознавания речи по-разному. Поэтому место модели в публичном бенчмарке еще не отвечает на главный вопрос бизнеса: сколько времени уйдет на получение пригодного текста из реальной записи.
Для транскрибации звонков, лекций, интервью и субтитров важна не только точность распознавания слов. На итог влияют сегментация длинного файла, работа с тишиной, пунктуация, диаризация спикеров, устойчивость API, поддержка форматов и качество склейки результата.
Ниже сравним OpenAI Whisper Large v3, Microsoft VibeVoice-ASR, Yandex SpeechKit и Google Cloud Speech-to-Text с Chirp 3. Лучшей модели для всех сценариев нет. Для русскоязычных длинных записей сильный движок нужно оценивать вместе с инфраструктурой и постобработкой.
Что умеют модели и где начинаются ограничения
1. OpenAI Whisper Large v3 и Large v3 Turbo
Whisper построен как encoder-decoder Transformer. Исходное семейство обучалось на 680 000 часах многоязычного аудио. Версия Large v3 получила значительно больший обучающий набор: 1 млн часов с неполной разметкой и 4 млн часов псевдоразмеченного аудио. Large v3 Turbo сокращает число слоев декодера с 32 до 4, поэтому работает заметно быстрее ценой небольшого снижения качества.
Сильная сторона Whisper для русского языка проявляется на сложной речи: разговорной лексике, смешении русских и английских терминов, неидеальной дикции и фоне. Модель сразу генерирует текст со знаками препинания и обычно дает более читаемый черновик, чем классические ASR-системы без развитой языковой части.
Но у архитектуры есть ограничение: базовое окно Whisper рассчитано примерно на 30 секунд аудио. Длинный файл все равно обрабатывается последовательно. Библиотека или провайдер режет запись на сегменты, переносит контекст и затем собирает результат.
Именно здесь две системы на одной модели могут показать разное качество. Ошибки появляются не только внутри сегмента, но и на границах: пропавшее слово, повтор фразы, неверный таймкод, потерянный спикер. На тишине или музыке Whisper способен генерировать правдоподобный, но отсутствующий в записи текст. Для production-сценария нужны VAD, контроль повторов, фильтрация пустых сегментов и логика восстановления контекста.
У официального OpenAI API в 2026 году есть и новые модели транскрибации, включая GPT-4o Transcribe и вариант с диаризацией. При этом загрузка файла через стандартные speech-to-text endpoints по-прежнему ограничена 25 МБ. Большие записи приходится сжимать или делить до отправки.
2. Microsoft VibeVoice-ASR
VibeVoice-ASR появился в открытом доступе в январе 2026 года. В официальном репозитории текущая модель обозначена как VibeVoice-ASR-7B. Она принимает до 60 минут непрерывного аудио в пределах контекста 64K и за один проход формирует структурированный результат: кто говорил, когда и что сказал.
Модель объединяет распознавание, таймкоды и диаризацию. Поддерживаются пользовательские hotwords: имена, бренды, аббревиатуры и термины можно передать как контекст. Для технических интервью и корпоративных встреч это полезнее, чем попытка исправлять каждое название после транскрибации.
В официальном тесте MLC-Challenge для русского языка VibeVoice-ASR показал WER 12,40%. Эта цифра характеризует конкретный датасет и протокол. Сравнивать ее напрямую с результатами Whisper, Yandex или Google из других тестов нельзя.
Практическая цена часового контекста заключается в требованиях к развертыванию. Нужны Python, CUDA, FFmpeg, совместимое окружение и NVIDIA GPU. Репозиторий Microsoft предлагает запуск через NVIDIA PyTorch Container. Сторонние сборки снижают порог входа, но не снимают задачи обновления зависимостей, мониторинга памяти и масштабирования очереди.
VibeVoice интересен разработчикам, которым нужен открытый long-form ASR с диаризацией и возможностью дообучения. Для обычного пользователя это пока не готовый облачный продукт. Microsoft прямо рекомендует дополнительное тестирование и разработку перед коммерческим применением.
3. Yandex SpeechKit
SpeechKit изначально ориентирован на русский язык и российские сценарии. Сервис поддерживает потоковое, синхронное и асинхронное распознавание. В актуальной документации синхронный режим рассчитан на короткие файлы до 30 секунд, асинхронный принимает записи длительностью до 4 часов и размером до 1 ГБ.
Утверждение, что Yandex не расставляет пунктуацию, в 2026 году устарело. Режим литературного текста добавляет заглавные буквы и знаки препинания. Есть нормализация чисел и дат, определение дикторов, дообучение и обработка результата с помощью LLM.
Слабое место SpeechKit не в отсутствии базовых функций, а в количестве режимов, параметров и ограничений. Разработчику нужно выбрать API, способ загрузки, формат, модель, нормализацию и схему получения результата. Для длинных файлов применяется асинхронная обработка, поэтому интеграция включает создание операции, проверку статуса и получение транскрипта.
Опубликованный на Habr тест 2025 года показал неудачный результат SpeechKit Playground на части файлов, включая повторы строк. Это полезный сигнал, но не универсальная оценка всей платформы: автор использовал собственный набор из 16 записей, а ошибки запроса включал в WER. Перед внедрением SpeechKit нужно тестировать на звонках и записях именно вашего домена.
4. Google Cloud Speech-to-Text с Chirp 3
Сравнивать Whisper с абстрактным Google Speech в 2026 году некорректно. Актуальная многоязычная модель Google называется Chirp 3. Она поддерживает русский язык, потоковое и пакетное распознавание, автоматическую пунктуацию, адаптацию под фразы и автоматическое определение языка.
Для длинного аудио используется BatchRecognize. В документации Chirp 3 указан типовой диапазон от одной минуты до одного часа. Русский доступен для транскрибации, но диаризация Chirp 3 на момент проверки перечислена только для ограниченного набора языков, без ru-RU.
Google удобен компаниям, которые уже работают в Google Cloud и готовы хранить аудио в облачной инфраструктуре проекта. Сильные стороны здесь не сводятся к качеству отдельной модели: IAM, региональные endpoints, журналирование, квоты и масштабирование входят в общую платформу.
Заявлять, что Google всегда хуже Whisper на русском, без единого контролируемого теста нельзя. На чистой диктовке разница может быть небольшой, а на телефонной записи с отраслевой лексикой порядок моделей способен измениться.
Техническое сравнение STT-моделей для русского языка
Таблица показывает, почему вопрос о лучшей модели распознавания речи нельзя закрыть одной цифрой WER. Сначала определите сценарий: звонки, интервью, субтитры, поток или архив. Затем соберите тестовый набор хотя бы из 20–50 своих файлов и посчитайте не только ошибки слов, но и стоимость ручной правки.
Боль бэкендера: почему поднять свой Whisper сложнее, чем кажется
Склейка чанков
Разделить аудио через FFmpeg несложно. Сложно разделить его так, чтобы фраза не оборвалась на полуслове. Обычно сегменты делают с перекрытием. После распознавания нужно найти повторяющийся участок текста, удалить дубль и сохранить таймкоды.
На одном чистом монологе эвристика работает. На совещании с короткими репликами, паузами и перебиваниями она начинает ошибаться. Чем больше правил добавляется, тем сильнее проект превращается из вызова модели в отдельную ASR-платформу.
Галлюцинации на тишине
Музыка, длинная пауза, шум зала и тихая речь могут запустить ложную генерацию. Whisper иногда повторяет последнюю фразу или создает типовые подписи, которых не было в аудио.
Production-конвейер использует VAD, минимальную длительность речи, пороги уверенности, контроль компрессии текста и поиск повторяющихся последовательностей. После этого все равно нужен журнал проблемных сегментов для повторной обработки.
Форматы и лимиты
Пользователь загружает не только MP3. На вход приходят WAV, M4A, OGG, FLAC, MP4, AVI, записи телефонии с двумя каналами и файлы с нестандартной частотой дискретизации. Их нужно проверить, извлечь аудиодорожку, привести к ожидаемому формату и не потерять метаданные времени.
Лимит OpenAI в 25 МБ добавляет еще один слой: сжатие, нарезку, очередь запросов и сборку результата. Размер файла при этом не равен длительности. 25 МБ могут содержать короткий WAV или длинный MP3 с низким битрейтом.
GPU и неравномерная нагрузка
Собственный сервер выгоден при предсказуемом постоянном потоке. При редких загрузках видеокарта простаивает. При резком наплыве файлов возникает очередь, пользователи ждут, а команде приходится добавлять воркеры и следить за памятью.
К стоимости GPU прибавляются хранение файлов, мониторинг, повторные задания, обновление CUDA, безопасность, резервирование и поддержка форматов. Бесплатная модель не означает бесплатный сервис.
Практический вывод: использовать модель или готовую систему
Для исследовательского проекта разумно поднять Whisper или VibeVoice локально. Вы получите контроль над кодом, данными и параметрами. Для продукта важнее другой вопрос: кто отвечает за длинные файлы, сбои, диаризацию, форматы и качество текста на стыках.
Заключение
Whisper, VibeVoice, Yandex и Google решают разные части одной задачи. Whisper дает сильное качество базовой транскрибации, VibeVoice сохраняет часовой контекст, Yandex предлагает развитый набор режимов для русского языка, Google встраивает STT в масштабируемую облачную платформу.
На практике качество определяет весь конвейер: подготовка аудио, VAD, склейка сегментов, диаризация, пунктуация, контроль повторов и обработка ошибок. Поэтому бизнесу часто выгоднее тестировать не голую модель, а готовый результат на своих файлах.
Эволюция экономических
систем подчиняется универсальным закономерностям, которые можно проследить
через их развитие от простых структур до сложных глобальных взаимодействий. Эти
закономерности включают процессы дифференциации, интеграции, специализации и
адаптации. Дифференциация происходит, когда системы усложняются, разделяя
функции и роли между участниками. Например, в ранних аграрных обществах
экономическая деятельность была сосредоточена на удовлетворении базовых
потребностей, тогда как современные экономики включают специализированные
сектора, такие как высокотехнологичное производство и услуги. Интеграция
проявляется в объединении различных элементов в более устойчивые структуры,
например, в виде торговых союзов, международных корпораций и глобальных
финансовых систем.
Специализация
способствует повышению эффективности, позволяя субъектам фокусироваться на
своей ключевой компетенции. Это также усиливает взаимозависимость экономических
агентов, что можно наблюдать в глобальных цепочках поставок, где производство
одного продукта распределено между множеством стран.
Ключевые эпохи эволюции экономических систем
Характеристики следующей эпохи эволюции – «Интеллектуальная экономика» – можно описать как сосредоточение на знании, креативности, инновациях и автоматизации. Она опирается на искусственный интеллект, большие данные, автоматизированные системы и интеграцию человека и технологий. Ключевые черты включают:
– Искусственный интеллект и автоматизация: использование умных систем для управления процессами, принятия решений и повышения эффективности;
– Инновационная экосистема: развитая сеть научно-исследовательских центров, стартапов и компаний, ориентированных на внедрение новаторских идей;
– Устойчивое развитие: баланс между экономическим ростом, социальной справедливостью и защитой окружающей среды;
– Цифровая глобализация: международная интеграция через цифровые платформы, позволяющая глобальному обмену знаниями и услугами;
– Человеческий капитал как ключевой ресурс: акцент на развитии навыков, образования и креативности, где каждый индивид играет значимую роль в создании ценностей.
Китай XXI века можно
рассматривать как один из примеров стремления к интеллектуальной экономике.
Страна активно внедряет технологии искусственного интеллекта, роботизации и
автоматизации, что видно в таких инициативах, как проект "Made in China
2025". Также Китай вкладывает значительные ресурсы в развитие
человеческого капитала через программы образования и инноваций.
Кроме того, Китай
добивается значительного прогресса в области цифровой трансформации, занимая
лидирующие позиции в e-commerce, развитии суперприложений (например, WeChat) и
цифровых платформах.
Некоторые показатели, которые связывают Китай с интеллектуальной экономикой
Однако Китай пока
остается страной переходного этапа, т.к. сохраняется сильная зависимость от
индустриального сектора и производства. Превращение Китая в полноправную
интеллектуальную экономику потребует решения проблем экологической
устойчивости, защиты интеллектуальной собственности и перераспределения
доходов.
Адаптация экономических
систем проявляется в их способности реагировать на изменения внешних условий,
таких как технологические прорывы, природные катаклизмы или политические
кризисы. Эта адаптация может быть как постепенной, в виде реформ и
модернизации, так и резкой, например, в ответ на экономические санкции или
глобальные эпидемии. Примером универсальной закономерности можно считать кривую
производственных возможностей, которая отражает компромиссы между различными
экономическими целями.
Эволюция экономических
систем также подчиняется законам термодинамики и принципам максимальной
энтропии, что выражается в стремлении к равновесию через перераспределение
ресурсов и устранение барьеров для их перемещения. Например, интеграция рынков
капитала и труда способствует более эффективному использованию глобальных
ресурсов. Такие закономерности отражают глубокую взаимосвязь между физическими
и социальными системами, подчеркивая универсальность процессов, управляющих
развитием человеческого общества.
Автоматизация и внедрение искусственного интеллекта значительно трансформируют современный рынок труда, создавая как новые возможности, так и вызовы для работников и компаний. Эти изменения обусловлены способностью алгоритмов и роботов выполнять задачи, которые ранее требовали человеческого участия, включая сложные аналитические процессы, обслуживание клиентов и даже творческие функции. С одной стороны, это способствует повышению производительности, снижению издержек и ускорению процессов в различных отраслях. С другой стороны, возникает риск сокращения рабочих мест, особенно в тех секторах, где рутинные задачи могут быть полностью автоматизированы.
Примером такого воздействия может служить производственная сфера, где автоматизация процессов с помощью промышленных роботов приводит к значительному уменьшению потребности в неквалифицированном труде. В логистике и транспорте автоматизированные системы управления складами и беспилотные транспортные средства трансформируют традиционные подходы к доставке товаров, уменьшая зависимость от человеческого труда. Однако, в то же время, растёт спрос на специалистов, способных управлять этими системами, разрабатывать алгоритмы и обеспечивать их техническое обслуживание. Это приводит к необходимости переквалификации работников и адаптации образовательных систем для подготовки кадров к новым требованиям.
Аналитические и творческие профессии также сталкиваются с влиянием искусственного интеллекта. Алгоритмы на основе машинного обучения уже успешно применяются в таких областях, как анализ финансовых данных, разработка маркетинговых стратегий и даже создание контента, включая музыку, тексты и визуальные материалы. Однако здесь роль человека смещается в сторону управления процессом и креативного взаимодействия с технологиями. Возникает уникальная синергия, где искусственный интеллект и человек совместно создают ценность.
В долгосрочной перспективе автоматизация и ИИ могут способствовать перераспределению ресурсов, увеличению общего уровня благосостояния и даже сокращению рабочего времени. Однако успешная интеграция этих технологий в общество требует осознанного подхода к регулированию, создания систем социальной защиты и обеспечения равного доступа к образовательным возможностям.
Изменения в спросе на труд в различных отраслях
Эти данные показывают, что влияние автоматизации и ИИ на рынок труда неоднородно и требует комплексного подхода для обеспечения устойчивого развития и минимизации негативных последствий для работников.
Продолжение: Цифровизация мировой торговли: возможности и ограничения
Этот пост входит вЧасть 9. Экономическая адаптация и устойчивость
Как экономические системы адаптируются к меняющимся условиям. Теория устойчивого развития, экологии и зелёной экономики как примеры современной адаптации.
СерияПроисхождение экономических систем путём естественного отбора
Кто интересуется развитием общественно-экономических формаций, подписывайтесь!
Промышленная революция
стала поворотным моментом в истории человечества, изменив не только способы
производства, но и социальные, экономические и культурные структуры общества.
Начавшись в Великобритании в конце XVIII века, она распространилась по всему
миру, трансформируя аграрные общества в индустриальные. Основой этой революции
стали инновации, такие как паровой двигатель, механический ткацкий станок и
железные дороги, которые значительно повысили производительность труда и
ускорили процессы перемещения товаров и людей. Эти технологические прорывы не
только изменили производственные методы, но и создали основу для новых форм социального
взаимодействия.
Рост фабричного
производства и урбанизации привел к масштабному перемещению населения из
сельских районов в города, что вызвало серьезные изменения в социальной
структуре. На смену традиционным сельским общинам пришли промышленные города,
где формировался новый класс наемных рабочих. Эти изменения сопровождались
тяжелыми условиями труда, низкой оплатой и отсутствием социальных гарантий,
что, в свою очередь, способствовало появлению первых движений за права рабочих
и профсоюзов. Рабочий класс стал важной социальной силой, настаивавшей на
введении ограничений на рабочее время, улучшении условий труда и создании
систем социальной защиты.
Инновации, возникшие в
этот период, не только изменили производственные процессы, но и повлияли на
формирование новых экономических моделей. Переход от ручного труда к машинному
производству сопровождался концентрацией капитала и появлением крупных
промышленных предприятий. Это привело к усилению роли предпринимателей и
инвесторов, что стало основой для капиталистической экономической системы.
Однако концентрация богатства в руках узкой элиты породила глубокие социальные
неравенства, которые стали основой для дальнейших экономических и политических
изменений.
Rлючевые аспекты взаимодействия инноваций и социальных преобразований в рамках промышленной революции
Промышленная революция
также дала начало глобальной экономической интеграции, так как развитие транспорта
и коммуникаций способствовало росту международной торговли. Одновременно с этим
она вызвала серьезные экологические проблемы, такие как загрязнение воздуха и
воды, что стало вызовом для будущих поколений. Взаимодействие инноваций и
социальных преобразований, возникших в этот период, стало фундаментом для
модернизации общества, но также показало необходимость учета социальных и
экологических последствий технологического прогресса. Как показала промышленная
революция, изменение технических цепочек и повышение уровня автоматизации влияют
на общественные страты.
В XXI веке, когда
нейросети способны обрабатывать миллиарды транзакций, поведенческих паттернов и
логистических цепочек в динамике, экономика находится на пороге появления
кибернетического мета-координирующего слоя, способного заменять рыночные
сигналы на более точные и мягкие формы регулирования.
Сопоставление фаз автоматизации и социальных трансформаций
Во-первых, автоматизация
размывает границы между производителем и потребителем. Платформенные решения
делают возможной занятость без принадлежности к классу наемных работников в
привычном смысле - фрилансеры, курьеры, водители агрегаторов, авторы цифрового
контента становятся микро-предпринимателями, но без доступа к капиталу.
Возникает новая прекаризация - форма зависимости без прямой эксплуатации, но с
тотальным алгоритмическим контролем.
Во-вторых,
производственные цепочки укрупняются и централизуются, но при этом логистика и
кастомизация становятся гиперлокальными благодаря on-demand производству. Это
приводит к возникновению новой страты - технических медиаторов, тех, кто
настраивает цепочки, связывает потребности и мощности. Они заменяют
классических инженеров или финансистов и формируют инфраструктурный слой будущей
плановой экономики.
В-третьих, цифровой мета-координирующий
слой - это не «большой брат», а распределённый агент, встроенный в каждую
ячейку производства и потребления: от кофемашины до системы управления городом.
Такие системы уже сегодня меняют расстановку сил: доступ к данным становится
важнее, чем владение заводом. Класс капиталистов уже трансформируется в класс
операторов алгоритмов, а класс рабочих - в класс пользователей и управляемых
систем.
Шаги изменений социальных страт под воздействием автоматизации
И наконец, в условиях сверхавтоматизированных цепочек растёт важность
эмоционального, смыслового, гуманитарного труда - креативная индустрия, воспитание,
культура, уход, терапия. Это продолжает радикально изменять иерархию социальной
ценности профессий: труд блоггера (автора цифрового контента), например, уже
стал более значимым, чем труд оператора колл-центра, которого давно заменил ИИ.
Продолжение: Цифровая трансформация: от локальных изменений к глобальным мутациям
Этот пост входит в Часть 8. Влияние мутаций: инновации и кризисы
Роль технологических, социальных и финансовых кризисов в преобразовании экономических систем. Анализ примеров внезапных изменений, таких как Великая депрессия, промышленная революция и цифровая трансформация.
СерияПроисхождение экономических систем путём естественного отбора
Кто интересуется развитием общественно-экономических формаций, подписывайтесь!
Привет. В этом ролике я проведу для вас обзор конструкции кабеля ИнСил-ПРО-ВЭКВнг(А)-FRLS 37х1.5. Мы посмотрим из каких основных конструктивных элементов состоит кабель ИнСил-ПРО-ВЭКВнг(А)-FRLS 37х1.5. В целом данный кабель довольно интересный и относится к типам кабелей для цепей контроля и управления, или проще говоря кабелям КиП.
Технологические революции
неизменно становятся движущей силой изменений в экономических системах,
превращая их в сложные, динамичные структуры, способные адаптироваться к новым
вызовам. Каждый технологический прорыв — от изобретения парового двигателя до
появления искусственного интеллекта — создавал условия для преобразования
производственных процессов, структуры занятости и глобального распределения
ресурсов. Эти изменения можно рассматривать как своего рода «мутации», которые
нарушают устоявшиеся механизмы функционирования и открывают новые возможности.
Например, промышленная революция XVIII-XIX веков привела к массовой механизации
труда, сокращению роли сельского хозяйства в экономике и быстрому росту
урбанизации. В то же время она породила новые вызовы, такие как неравенство
доходов, эксплуатация труда и ухудшение экологической ситуации.
Современные
технологические революции, такие как цифровизация и автоматизация, имеют схожий
эффект, но действуют на более глобальном уровне и с большей скоростью. Они
трансформируют не только отдельные отрасли, но и принципы управления, системы
логистики, а также способы взаимодействия между производителем и потребителем.
Возьмем, к примеру, развитие электронной коммерции: такие компании, как Amazon
и Alibaba, радикально изменили рынок, сократив цепочки поставок и сделав товары
доступными в любом уголке мира. При этом традиционные розничные сети
сталкиваются с сокращением прибыли и вынуждены адаптироваться или исчезать.
Таблица ниже иллюстрирует
ключевые технологические революции и их последствия для экономики:
Таблица иллюстрирует ключевые технологические революции и их последствия для экономики
Инновации порождают как разрушение старых моделей, так и создание новых
систем, способных более эффективно использовать ресурсы. Это можно видеть на
примере перехода от угольной к возобновляемой энергетике. Однако такие мутации
не всегда безболезненны: они сопровождаются разрушением традиционных рынков
труда, усилением социального неравенства и усилением конкурентной борьбы между
странами. Таким образом, технологические революции одновременно выступают
драйвером прогресса и источником нестабильности, формируя новые экономические
реальности.
Продолжение: Социальные кризисы и их роль в трансформации моделей управления
Этот пост начинает Часть 8. Влияние мутаций: инновации и кризисы
Роль технологических, социальных и финансовых кризисов в преобразовании экономических систем. Анализ примеров внезапных изменений, таких как Великая депрессия, промышленная революция и цифровая трансформация.
СерияПроисхождение экономических систем путём естественного отбора
Кто интересуется развитием общественно-экономических формаций, подписывайтесь!
Обжиг размягчает латунь и упрощает переснаряжение. В том числе, позволяет плотнее обжать пулю. Производится компанией BurstFire, Сан-Рамон, Калифорния.
Сейчас у меня дома стоит 4 счетчика воды(2 для холодной и 2 для горячей).
Стояки проходят в кухне и в ванной комнате.
Кухня
Ванная
Два счетчика(горячая вода) более года назад требовали поверку, и с большой вероятностью ее бы не прошли(старые). Я по малодушности забил на это дело и подарил ресуропостовляющей компании большие деньги, так как долгое время платил по нормам основанным на количестве проживающих. Стоит ли говорить, что данные нормы существенно завышены от среднего потребления в моей квартире? Это обидно, более обидно, что с учетом новых законов, даже если мои счетчики пройдут поверку, то я все равно не смогу потребовать перерасчет(это я узнал недавно, а ранее думал, что это меня выручит). Это меня не выручило, я подарил кучу денег из-за своей лени. Закон явно не на стороне логики и справдливости тех, кого доят.
В общем счетчики горячей воды нужно менять, и в скором времени нужно менять также счетчики холодной воды.
Изначально я хотел поставить счетчики с внешним интрефейсом который бы имел логику. Дешевле всего проводное решение. Скажем на RS-485 там-же была бы какя-то логика.
Я имею ввиду, что в самом счетчике может быть контроллер, который сам считает импульсы с крыльчатки, и умеет их хранить. Остается только сделать запрос по определенному протоколу.
У меня уже был опыт ввода в систему автоматического сбора показаний на базе счетчиков с радио интерфейсом, для который была выделена общая база, которая далее общалась по шине RS-485.
И я хотел что-то подобное. Но на местном рынке я не нашел ничего похожего в бюджетном варианте.
Поэтому я взял постейшие счетчики с импульсным выходом(у нас такой стоит чуть менее 900 руб в Аквадоме). Ну и заодно прикупил вентили и фильтры грубой очистки, которые вроде как должны стоять перед счетчиком, но у меня не стояли(я купил квартиру в таком виде, вторичное жилье)
Моя покупка(или управляйки?, за что мне не будет спасибо)
Завтра жду мастера, потому что, как минимум, я сам не могу перекрыть стояк. Да и каждый должен заниматься своим делом и дело не должно быть бесплатным.
По автоматизации: Я инженер-системотехник и любитель схемотехник. У меня есть множество наработанных инструментов, софта, опыта и знаний.
И далее я планирую подключить к этим счетчикам полностью свое решение(как программное, так и аппаратное) .
Все свои действия по данной задачке я панирую выкладывать в этой серии публикаций.
Планирую закрыть следующие задачи:
- Подводка шины RS-485 к месту установки счетчиков и электронных плат
- Установка своей электронной платы с МК, которая будет считать импульсы и передавать общеквартирному контроллеру.
- Разработка прошивки для этой электронной платы на базе своей операционной системы реального времени. Главный почти решенный вопрос - это живучесть EEPROM.
- Доработка своей платы дополнителным модулем для управления запорным вентилем и анализом датчиков протечкек.
- Связь данного решения в общую личную систему автоматизации дома.
- Автоматическая переача показаний, информирование о необходимости поверки.
При этом я буду использовать полностью свое программное обеспечение. И это программное обеспечение дает мне намного больше возможностей и преимуществ, чем имеющиеся на официальном профессиональном рынке.
Про Ардуино здесь и речи нет.
А главное - для меня это будет существенно дешевле, чем любое решение на рынке.
UPD:
Приходил мастер. Я сказал, что хочу заменить счетчики, поставить фильтры грубой очистки(которые должны стоять) и заменить старые(более 10 лет) вентили на трубах исходящих от стояка, два из которых не проворачиваются.
Он мне посчитал 1500 рублей за замену вентиля(так как нужно перекрывать стояк) и 800 рублей за замену счетчика с пломбировкой и регистрацией.
Работы перенесены на понедельник.
Вот теперь сижу и думаю, а не пытаются ли меня развести как последнего лоха?
Вентили однозначно собственность общедомовая - ответственность УК. УК говорит, что бесплатно меняет только аварийные - которые текут. Т.е. нужно ждать аварии и топить соседей? А как насчет того, что два из них я не могу закрыть?
Счетчики я и сам могу установить, а регистрация и пломбировка вроде как бесплатная.
(1500+800) * 4 = 9200 с меня хотят поиметь на пустом месте, так еще и материал мой.
Наверное мне стоит вызвать мастера, чтобы он заменил не работающие вентиля, причем бесплатно. После чего установить самому счетчики и вызвать его повторно для бесплатной регистрации.
На волне предыдущего поста - еще один случай, имеющий некоторое отношение к правописанию.
Несколько лет назад, когда я еще почитывал паблики в ВК, в одном из местных городских пабликов одним из подписчиков была озвучена какая-то там проблема, касательно ЗоЗПП. В комментариях отвечали всякий бред, а я, как имеющий некоторое отношение к юрисприденции, не удержался и написал, как надлежит потребителю поступить правильно. Написал очень подробно.
Прошло буквально секунд пять и комментарий пропал... непонятно! Сперва я подумал, что ВК где-то глюкнул и написал комментарий повторно. Уже не столь подробно.
Опять прошло буквально несколько секунд и он пропал! Вообще странно! Написал в третий раз, жмакнул кнопку "отправить"... а ВК ответил, что я забанен в этом паблике за повторный запрет на мат в комментариях. Вообще непонятно! Какой там был мат?
Я сидел и прокручивал в голове, где мог написать какой-то мат, но так и не мог сообразить - где! Озарение пришло где-то через полчаса. Конечно! ПотрЕБИтель! Автоматический фильтр отфильтровал слово "потребитель", сочтя его часть матом!
Недавно я установил в свой автомобиль головное устройство на Android. Уже имея на тот момент модуль OBD2 и зная о существовании такой программы как Torque, я задался вопросом, а можно ли отправлять данные снимаемые Torque в систему домашней автоматизации Home Assistant. Как оказалось, можно. Давайте попробуем это сделать.
Что нам понадобится
Естественно, нам понадобится сам модуль OBD2. Выглядеть они могут по разному. И стоить по разному. Главное условие беспроблемной работы, чтобы они были построены на оригинальном чипе PIC18F25K80 с прошивкой v1.5. Так же нам необходимо, чтобы у нас был интернет канал для передачи данных в Home Assistant. Это может быть смартфон с установленными приложениями и с подключением к интернет или Android магнитола с подключением к интернету по Wi-Fi c телефона или по USB модему. И парочка приложений.
Необходимо оборудование:
Автомобильный Bluetooth или WI-FI модуль ODB2.
Android устройство (8 или более поздней версии).
Устройство передачи данных (может выступать само устройство на Android или USB модем).
Необходимо программное обеспечение:
Llamalab Automate. Стоит программа недорого. Есть и патченная версия на четырепда. Если вы никогда не слышали об этом приложении раньше, это визуальный инструмент сценариев. Оно похоже на приложение под названием Tasker. Но если вы выберете Llamalab Automate, вы сможете скачать заранее подготовленный скрипт, чтобы захватывать данные ODB2 и отправлять их в Home Assistant, что сильно облегчит жизнь.
Torque pro. лайт версию не пробовал, не знаю. Также есть версия на четырепда. Очень популярное приложение, которое работает с модулями ODB2. Можно использовать для отображения данных в самом приложении, но для этого проекта мы будем использовать его возможности записи данных.
MQTT Broker (mosquito или др.). Вполне вероятно, что на вашем сервере Home Assistant уже запущен сервер MQTT, но если нет, то вам нужно установить MQTT сервер и настроить его в Home Assistant.
Шаг 1: установка в автомобиль адаптера ODB2 и программного обеспечения Torque:
Итак, если у вас есть компоненты, которые описаны выше, первое, что нужно сделать, это установить адаптер ODB2 в ваш автомобиль. Где находится порт подключения можно узнать из руководства по эксплуатации вашего автомобиля.
Установка приложения Torque:
Установите на ваше устройство приложение Torque. Включите зажигание автомобиля, чтобы обеспечить питание ODB2 адаптеру, а затем на вашем Android-устройстве перейдите в Настройки Bluetooth и выполните поиск и сопряжение с ODB2 адаптером.
Теперь откройте приложение Torque pro на своем Android-устройстве. Приложение попросит вас заполнить некоторую информацию о вашем автомобиле. Если сопряжение пройдет нормально, то на главном экране приложения будет отображен тахометр, где будут показаны текущие обороты вашего двигателя.
Теперь, когда у нас есть успешное соединение, нам нужно настроить ведение журнала. Перейдите в раздел «Настройки» и выберите «Запись и выгрузка журналов». Выполните следующие настройки:
Выберите, какие данные записывать:
Первое, что вы должны сделать, это выбрать набор данных, который вы хотите записывать. Для этого переходим в пункт «Что записывать». Эти наборы данных называются PID в протоколе ODB2. Конкретный набор данных (PID), доступный для вашего автомобиля, будет зависеть от того, что производитель автомобиля готов предоставить через интерфейс ODB2. Приложение Torque выделяет доступные PID в светло-зеленом цвете. После выбора PID возвращаемся в настройки.
Далее в настройках выбрать:
Синхронизация журналов: Выкл
Интервал записи журналов: выберите 5 секунд.
Начинать журнал при запуске Torque: Да
Только при подключенном OBD: Да
Автозапись данных GPS: Да
Создавать новый журнал: Нет
Другие параметры нам не интересны, но можете в них покопаться. Далее вернитесь к основным настройкам, выберите «Панель приборов" и выполните следующую настройку:
Запуск Torque после перезагрузки: Да
Остальные параметры нас так же не интересуют.
Итак, мы установили адаптер ODB2 и подключили его к устройству Android. Мы установили приложение Torque и настроили его для подключения к адаптеру ODB2 и ведения журнала некоторых данных непрерывно, чтобы всегда работать в фоновом режиме (даже после перезагрузки).
Для следующего шага нам нужно подготовить Home Assistant к получению данных с внешнего устройства, и для этого мы будем использовать "Long Lived Tokens" или "Долгосрочные токены доступа".
Примечание: Просто создайте токен доступа в Home assistant и скопируйте строку, для последующего использования в настройках скрипта.
Шаг 3: Установка Llamalab Automate:
На вашем устройстве Android установите Llamalab Automate из магазина Google play или четырепда.
Примечание: Работать со сценарием сможет только полная (Premium) версия программы.
Затем перейдите в раздел Community в приложении (программа может попросить доустановить некоторые модули, например Automate Network permissions.) и найдите "Car Telemetry to Home Assistant" (автор Robert Cunningham). Загрузите сценарий, перейдите в него, дайте все привелегии и запустите его кнопкой «Start».
После запуска скрипт попросит ввести вас такие данные как название автомобиля (обязательно запомните что ввели, нам это далее понадобится), адрес сервера Home Assistant и токен, который мы ранее создали в HA и записали.
Адрес сервера вводим в таком виде: https://[ваш адрес сервера Home Assistant]:8123
Примечание 1: мой сервер Home Assistant подключен с SSL. Ваш может быть и http
Примечание 2: скрипт будет отправлять данные на https://[ваш адрес сервера Home Assistant]:8123/api/service/mqtt/publish
Примечание 3: Если вы не в первый раз запускаете скрипт и хотите изменить информацию, перейдите в каталог /Torqlogs на вашем устройстве Android и удалите файл car_config.
Шаг 3: Тестируем:
Итак, если все прошло хорошо, то после ввода настроек данные должны начать поступать. Если в логах Car Telemetry to Home Assistant вы видите сообщения типа "Rest Post success:Torque data:200", то это означает, что сообщения поступают на ваш сервер Home Assistant правильно. Проверьте ваш сервер MQTT и найдите topic c названием ‘devices/[название автомобиля]/torque’. Он должен содержать JSON-пакет данных программы Torque от вашего автомобиля. Если вы видите в логах Car Telemetry to Home Assistant сообщения об ошибках, вот несколько советов, которые могут помочь в решении проблем:
Помните, что если вы не используете SSL в Home Assistant, то адрес сервера должен начинаться с "http", а не "https".
Проверьте что программа Torque создает лог-файл с именем Torque.log
Если Llamalab Automate не может подключится к серверу Home Assistant, а в самом Home Assistant появилось сообщение о неудачном подключении с внешнего ip, то вводим токен следующим образом «Bearer токен».
Шаг 4: Конфигурация Home Asisstant
Последний шаг известен каждому пользователю Home Assistant. Нам нужно добавить сенсор в configuration.yaml чтобы получать данные.
Не мог приступить ранее к написанию этого поста, переезд, ремонт, все дела.
Самый правильный умный дом - в дела которого ты не вмешиваешься, а он всё делает сам. Так (ну примерно так) говорил один мой бывший шеф, которому ставил систему дома.
И так, мы хотим сделать себе какой-нибудь умный дом. К шинным технологиям мы перейдём чуть позже. Сначала рассмотрим, а что реально нужно в умном доме, а потом будем объединять это в единое целое.
Мой список из must have следующий:
1) Защита от протечек. Как элемент умного дома продаётся весьма за бюджетные деньги, но поможет сэкономить на ремонте Вашим соседям снизу. Система состоит из датчиков протечки, кранов и контроллера. Датчики бывают двух основных типов - открытый коллектор и геркон. Стоимость 300-500 рублей. Краны - электрические шаровые краны или электромагнитные клапана. Клапана в последние пару лет вообще не встречал, т.к. у них множество минусов: Очень быстро захлопываются и из-за этого можно получить гидравлический удар и протечку перед клапаном, работают пока подано напряжение - есть напряжение, тогда закрывают; или пока есть напряжение - держат открытым подачу воды. У шаровых таких проблем нет. Чтобы перевести их из одного положения в другое требуется подать напряжение. Бывают на 12, 24 (постоянки) и 220В (переменки). Контроллер - проверяет датчики и включает реле при замыкании датчиков, внутри встроен маленький трансформатор для питания датчиков. Контроллеры некоторых производителей комплектуются батареями (аккумуляторами) на случай отключения электричества. Проще всего купить готовый комплект, цена у основных производителей (которые на слуху у меня) порядка 8000 - 15000 рублей - Нептун, Гидролок, H20 контакт. Смотрите и выбирай сами, тут уже дело вкуса, размера и монтажа (в подрозетник или накладной на стену).
2) Датчики движения и присутствия. Датчики ИК диапазона, отличающиеся в точности определения движения и от этого в цене. Не буду рассматривать датчики движения из супермаркетов аля Оби и Леруа - там продаётся ширпотреб, не факт что он долго у Вас проживёт. Буду говорить про нормальные немецкие. Конечно они стоят в 5-10 раз дороже, но и работают они отлично (у родителей датчик движения из низкого ценового диапазона нормальных немецких датчиков уже 7 лет работает). Можете купить дешевый, а потом объяснять жене почему свет в туалете не горит и что ей в этом случае делать. =) Она очень обрадуется. Основные места установки датчиков - коридоры, гардеробные, кладовки, туалеты и ванные комнаты. В первые 3 места можно смело ставить датчики движения, там вы редко остаётесь неподвижными на 3-5 минут, а вот в туалете и ванной обязательно ставьте датчики присутствия. Там Вы можете себе позволить замереть на 5-10 минут. Так же Важно обратить внимание что датчики бывают одно и двух релейными для подключения света и вентиляции с раздельными временными промежутками, чтобы вентиляция поработала на 2-10 минут дольше света. Для ванной желательно посмотреть датчики с влагозащитой, хотя некоторые коллеги говорили что это не обязательно. Монтаж датчиков бывает нескольких направлений - настенный в подрозетник, настенный накладной (обычно для улиц), накладной для потолка (в случае НЕ подвесного потолка) и врезной в потолок (для подвесных потолков). Мои любимые бренды Esylux и Theben. Стоимость от 4000 до 25000 рублей за штуку в зависимости от монтажа, типа и дизайна.
Пока на этом всё, буду думать с какой шины начать рассказывать про интеграцию. Может Вы читатели мне подскажете.