Если вы разрабатываете агентов, интегрируете GPT в бизнес-логику или просто строите чат-ботов — уязвимости могут стать не теоретической, а очень практической болью. OWASP подготовил подробный список из 10 наиболее распространенных угроз, с которыми уже сталкиваются разработчики LLM-продуктов.
📘 Новость в том, что теперь весь список переведен на русский язык. Это полноценная PDF, где у каждого пункта есть описание, примеры, сценарии атак и меры предотвращения. Прочитать можно за вечер — сэкономите недели на разборках после продакшена.
Что внутри?
Вот несколько уязвимостей, которые стоит знать до, а не после:
🔓 Prompt Injection (LLM01)
Манипуляция промптами, когда злоумышленник через запросы влияет на поведение модели. Причем не всегда напрямую — инструкции могут быть спрятаны в других источниках: веб-страницах, описаниях или даже изображениях. 💥 Последствия: обход системных ограничений, генерация нежелательного контента, утечка данных.
🧠 Чрезмерная агентность (LLM06)
Когда ваш LLM получает слишком много возможностей и начинает действовать почти автономно. Особенно критично в агентных архитектурах: вроде хотели автоматизировать рутину — а получили сбой в цепочке действий и неожиданный запрос в продовую систему.
🕵️ Утечка системных инструкций (LLM07)
Системный prompt, на который вы надеялись, что он «где-то под капотом» — может внезапно всплыть в ответе. И да, это уже происходило в реальных кейсах.
☠️ Отравление модели и данных (LLM04)
Если используете RAG, fine-tuning или хостите датасеты от пользователей — атака может прийти снаружи. Достаточно одного вредоносного документа, чтобы искажать ответы модели.
Почему это важно?
Потому что LLM-интеграции — это не просто UX-фича, а точка доступа в критические процессы. Слишком часто в AI-продуктах безопасность оказывается "потом".
OWASP формирует этот список на основе реальных атак, багрепортов и практики. Это живой, работающий фреймворк, а не академическая выжимка.
Если вы пишете что-то на базе GPT, Claude или других LLM — этот список должен быть у вас в закладках. Потому что баг, который вы считаете “забавной фичей”, может завтра попасть в презентацию хакеров на DEF CON.
🔗 Я веду Telegram-канал, где разбираю такие истории и делюсь собственными экспериментами в инди-хакинге и запуске микро-продуктов. Ссылка — в профиле.
🌟 Обновления на Капибаре: Новый уровень взаимодействия и контента! 🌟
Здравствуйте, уважаемые Капибарины и Капибарышни, а также все заинтересованные и мимо проходящие.
Сегодня важный день, ведь на сайте впервые выходят официальные новости проекта и в них мы хотим рассказать, что было сделано за последнюю пару недель!
📸 Изображения
Картинки в постах - это так привычно, что кажется само собой разумеющимся. Однако, чтоб добавить возможность загрузки изображений на сайт, команде разработки пришлось знатно потрудиться :)
Для максимальной скорости и эффективности выгрузки изображений из любой точки Земли мы внедрили на сайт CDN - Content Delivery Network. Эта система позволяет оптимизировать загрузку, распределяя ваши картинки по серверам, что минимизирует задержки и ускоряет отображение.
Также была реализована функция проверки размера изображений и их сжатие. Это гарантирует, что слишком большая фотография не заставит сайт лагать или работать медленнее. Мы понимаем, что такое решение может расстроить фотографов и тех капибаринов, которым важно разглядеть все мельчайшие детали в первозданном виде. Однако покуда наш сайт молод и мал, к сожалению, это наиболее оптимальное решение для обеспечения его работоспособности.
На наш сайт помимо обычных картинок вы можете загружать и гифки (.apng, .gif, .webp) размером до 5 Мб. Каждое загруженное изображение конвертируется на стороне бэкенда в webp для оптимального отображения и снижения нагрузки на инфраструктуру.
Для не прогружающихся картинок - из-за плохого интернета, проблем на сайте или в браузере - мы добавили плейсхолдер - специальную рамку, которая рисуется вместо проблемного изображения.
Ограничение количества медиа в комментариях. Введено ограничение на количество медиафайлов в комментариях до двух изображений, чтоб не перегружать интерфейс и не удлинять сверх меры комментарий. При попытке добавить третью картинку сайт предложит создать отдельный пост.
🤖 Бот для Верификации через Telegram.
Для упрощения процесса верификации профилей через Telegram был создан специальный бот. Он позволяет пользователям верифицировать свои аккаунты всего в три клика.
Для бота верификации добавлена поддержка создания Docker-образов в среде GitLab-CI.
Это означает, что процесс развертывания и обновления бота теперь может быть полностью автоматизирован с использованием Docker-контейнеров. Внедрение GitLab-CI обеспечивает непрерывную интеграцию и доставку (CI/CD).
💭 Комментарии
Почти одновременно с началом альфа-теста была завершена разработка дерева комментариев. Мы реализовали сами комментарии а так же систему управления их вложенностью - это значит, что когда ветка уходит вправо на 4 (для телефонов) или 9 уровней (для компьютеров), новые комментарии оказываются снова слева , однако теперь с гиперссылкой на родительский комментарий. Это улучшает визуальное восприятие длинных веток и предотвращает излишнее дробление обсуждения.
Заложен первый камень в защиту сайта от ботов. Была реализована верификация пользователей через телеграм и ограничение на комментирование, голосование и создание постов для тех, кто её не прошёл. Такая система позволит усложнить жизнь ботоводам, ведь завести 100500 почт намного легче чем 100500 телеграм-аккаунтов. От того, что они у нас массово зарегистрируются, особого вреда не будет, а вот от того, что они будут клепать «нужные» посты, бурстить / топить «нужные» комментарии / посты — вред очевиден (Если этого не сделать, будет как на Пикабу сейчас)
Для живых, пока еще неверифицированных пользователей, мы реализовали интуитивно понятные всплывающие сообщения о необходимости подтверждения аккаунта при попытках комментирования, голосования или создания постов. Это улучшает пользовательский опыт, предоставляя чёткие инструкции о необходимости верификации для полного доступа к функционалу платформы.
Индикация новых и непрочитанных комментариев. Сейчас ведётся активная работа над системой визуальной индикации, которая будет выделять новые и непрочитанные комментарии в ленте ответов. Это значительно упростит отслеживание активности в дискуссиях и поможет пользователям не упустить важные моменты обсуждения.
🏷️ Теги
Фильтрация по тегам. Разработали ленту постов с поиском по одному или нескольким тегам. В нее можно перейти как с бокового меню(вкладка «Теги»), так и напрямую из поста кликнув по тегу. В открывшейся вкладке вы можете добавить дополнительные теги по которым будет осуществляться поиск постов.
Пока только на бэкенде, но уже сделали API отдающее список популярных тегов для быстрого выбора тегов на странице поиска по тегам.
Установили лимит в 10 тегов на пост, исключая специальные теги, такие как «Своё», «Авторское» и «Телеграм». Это предотвращает перегрузку постов избыточным количеством тегов и способствует более точной категоризации контента.
Специализированные Теги «Своё» и «Авторское». Ведётся разработка нового блока в интерфейсе создания поста для выбора этих специальных тегов, включая подсказки, которые объясняют их значение. Тег «Своё» предназначен для контента, созданного пользователем лично или имеющего к нему прямое отношение. Тег «Авторское» применяется к контенту, в который пользователь вложил своё время, старания и творческие усилия
👁️ Лента «Просмотренное»
На бэкенде реализован API для управления и вывода просмотренных постов. Это означает, что теперь у нас есть бэкенд-структура, которая способна обрабатывать и передавать данные о просмотренных пользователями постах. Однако, эта функциональность пока что не интегрирована в пользовательский интерфейс и доступна только на уровне сервера.
Также на бэкенде начата работа над механизмом скрытия просмотренных постов из ленты. Эта функция также пока не реализована, но находится в активной разработке
🔥 Лента «Тренды»
За последнее время мы также сделали ленту «Тренды», в которую попадают положительно оцененные пользователями посты.
В данный момент алгоритм выходы в Тренды следующий: рейтинг поста больше 25 и более 80% плюсов. Сортировка в ленте осуществляется на основе двух ключевых параметров: процента положительных оценок и времени публикации поста.
Хотя лента «Тренды»(как и «Новое» и «Топ») визуально кажется бесконечной, посты на самом деле подгружаются постранично (пагинация). Это означает, что контент из бэкенда на фронтенд отдаётся не одновременно, а порциями. Введено ограничение в 20 постов на страницу для лент. Это решение позволяет ускорить загрузку контента и снизить нагрузку на базу данных.
Существующий алгоритм сортировки в ленте «Тренды» не является финальным, и мы планируем продолжить экспериментировать для определения наиболее оптимальных критериев сортировки. Как минимум, следующим шагом добавим влияние наличия тегов «Своё» и «Авторское» на упрощение выхода поста в Тренды. После добавления функционала скрытия постов продолжим искать наилучший алгоритм.
🖋️ Редактор постов
Добавлено ограничение по количеству символов в заголовках постов на Капибаре. Это необходимо для более красивых URL-адресов и менее загруженного внешнего вида сайта.
Ещё теперь можно загружать видео, правда пока что только с YouTube и Coub. В ближайшем будущем возможно расширение функционала возможностью добавления видео с других платформ, например из ВКонтакта. К сожалению, прямая загрузка видео на сайт пока невозможна ввиду ограниченного бюджета проекта. т. к. стоимость хранения и обработки зависит в том числе от количества просмотров.
👤 Профиль пользователя
Наконец-то можно поставить свою аватарку! Также близится к своему завершению доработка функции «О себе» - вы сможете написать какую-то фразу в своём профиле, которая будет видна остальным пользователям… Вернее, написать вы можете уже сейчас, просто пока что информация не сохранится. Но это скоро починим
Помимо этого, была исправлена ошибка 404, которая возникала при попытке доступа к страницам профилей пользователей.
И, наконец, важное изменение в создании профиля - нами была введена проверка на уникальность имени пользователя, игнорирующая регистр букв. Это означает, что имена типа "kapibar" и "KaPiBaR" теперь считаются идентичными с точки зрения системы.
🔨 Прочие Улучшения
Вёрстка. Исправлена вёрстка для обеспечения корректного отображения сайта на экранах с шириной 800 пикселей.
Были отрисованы новая иконка сайта и аватар по-умолчанию, спрототипированы страницы для удалённых по разным причинам постов.
Внедрено ограничение на количество запросов на логин, сброс пароля и регистрацию на уровне API. Эта мера безопасности направлена на борьбу с DDoS-атаками и другими видами злоупотреблений, повышая стабильность и безопасность платформы.
Определение темы. Теперь сайт автоматически подхватывает тему, установленную на устройстве.
Проведена работа по исправлению ошибок в русском языке на различных страницах сайта. Граммар-наци ликуют.
Устранено более 150 мелких и значительных ошибок, обнаруженных отважными авторам - альфа-тестировщиками и сообщенных через систему репортов.
🪲 Баги.
Мы понимаем, что вам важно видеть, какие баги есть и какие из найденных вами багов мы уже пофиксили.
Часто мелкие баги быстрее исправить «налету», чем добавлять в таски, описывать, пересылать и уведомлять. И поэтому сейчас мы работаем над автоматизацией, чтобы каждый найденный вами баг не остался без обратной связи от команды.
Вы присылаете баг-репорты в Телеграм-бота. Они все хранятся в сервисном телеграм-канале, мы их видим.
На прошлой неделе мы прикрутили автоматическое создание задач по баг-репортам на нашей доске в таск-трекере. И прямо сейчас работаем над обратным процессом. Т. е., когда задача отмечается как выполненная, будет отправляться уведомление обратно в Телеграм с обновленным статусом.
Также есть баг-репорты, которые не являются багами. Например, когда проблема не на сайте, а в куках пользователя. В таких случаях разработчик будет писать комментарий к задаче с инструкцией, что нужно сделать, чтобы проблема прошла, а бот будет отправлять этот комментарий пользователю.
🙏 Объявляется благодарность всем нашим авторам - альфа-тестировщикам!
Мы не можем упустить возможность выразить нашу глубокую благодарность всем альфа-тестировщикам, которые помогли и помогают нам обнаружить и устранить баги на нашей платформе. Ваша обратная связь была неоценимой, и мы благодарны за каждый отправленный вами баг-репорт! Ребята, вы - лучшие :)
🌟 А также Особая благодарность десяти самым активным тестировщикам:
Мы постоянно работаем над улучшением Капибары и ценим вашу обратную связь. Записывайтесь на альфа-тест, в данный момент набираем не только авторов но и активных комментаторов.
35 лет подряд Янн Лекун угадывает повороты в ИИ. В 80-х он говорил про распознавание изображений, в нулевых - про нейросети, в 2016 - про самообучение. И вот сейчас он заявляет самое радикальное:LLM в том виде, в каком мы их знаем, мертвы.
Проблема не в данных и не в мощности, а в архитектуре. Каждый токен чуть сдвигает модель в сторону, и чем длиннее вывод - тем выше шанс галлюцинаций. Никакие терабайты и GPU это не спасут.
А теперь подумай, сколько сейчас продуктов держится только на API OpenAI. Чат-боты, резюмирование документов, генерация текстов. Все эти проекты живут лишь потому, что можно позвать API.
Но новая волна придёт не от «больше параметров», а от моделей, которые учатся «как дети»: через видео, восприятие и понимание мира. И тогда поддерживать бизнес на API старых LLM станет бессмысленно. Новые модели будут быстрее, точнее и дешевле.
Лекун прямо говорит: закрытые модели исчезнут, открытые и распределённые — победят. Meta уже вкладывает $20 млрд в перестройку стратегии. Сроки короткие: 3-5 лет до первых моделей мира, и около десятилетия до ИИ уровня человека.
Для корпораций это вызов. А для indie-hacker’ов - шанс. У больших игроков всё завязано на старых API и инерции. А у нас есть свобода пробовать новое. Пет-проекты — это маленькие лаборатории, где можно тестировать идеи будущего и учиться жить «после LLM».
Когда рынок перетрясёт, выиграют те, кто уже умеет мыслить продуктом, а не строками API.
Я как раз пишу о своих экспериментах в инди-хакинге и пет-проектах у себя в телеге 👉 ссылка в профиле
В интервью Eurogamer Тодд Говард из Bethesda осторожно прошёл по минному полю дискуссий об ИИ в игровой индустрии, пояснив, что технология может быть полезным "инструментом", но не для создания контента.
Я рассматриваю это как инструмент. Творческое намерение исходит от людей-художников, это главное. Но мы смотрим на ИИ как на инструмент – есть ли способ использовать его, чтобы быстрее проходить некоторые итерации, которые мы делаем сами. Не для генерации вещей, но мы постоянно работаем над нашим инструментарием для построения миров или проверки элементов.
Говард далеко не первый известный разработчик с подобной позицией. Хидео Кодзима недавно назвал ИИ "другом", которого хотел бы привлекать только для "рутинных задач", снижающих затраты и экономящих время.
Думаю, если вернуться на 10 лет назад, к той версии Photoshop – вы бы не захотели работать с ней снова. Таков наш взгляд на это. Но мы хотим защитить художественность. Человеческое намерение – вот что делает наши работы особенными.
Говард и Кодзима находятся в умеренном разделе спектра принятия ИИ. Другие руководители вроде основателя Valve Гейба Ньюэлла и главы Ubisoft Ива Гиймо занимают куда более оптимистичную позицию, не говоря уже о гигантах вроде EA, инвестирующих огромные суммы в полное внедрение технологии. В то же время, есть разработчики, выступающие категорически против использования ИИ-инструментов в создании игр.
Нейро Сама была первой "витубершей" (от Virtual Youtuber - в классическом понимании человек, делающий видеоконтент, управляя анимированным аватаром c помощью motion capture технологий). В ней нет ничего человеческого (всеми системами управляют ИИ). Удерживает титул самой популярной стримерши Твича.
В своё время их размножили на две версии, потому что фанаты тяжело переживали изменения классического голоса и прочих "личностных" характеристик по мере развития. В итоге Нейро Сама осталась на ранней версии вокалоида и улучшается только в аспектах, которые не нарушают её восприятие зрителями, а в Злой Нейро дорабатываются все аспекты.
Китайская компания Starpery Technology планирует производить
гиперреалистичные интерактивные куклы для взрослых, которые способны
к голосовому и физическому взаимодействию.
Они используют
собственную модель искусственного интеллекта для создания эмоциональной
связи между пользователем и устройством, обеспечивая полное погружение.
Планируется,
что куклы для взрослых высотой 172 см и весом всего 29 кг появятся
на рынке уже в августе текущего года по цене $1500...
Согласно заявлению представителя компании, эти устройства
нового поколения, оснащенные моделями искусственного интеллекта
и датчиками, способны реагировать как на движения, так и на речь, что
значительно улучшит эмоциональное взаимодействие.
Крупнейший банк Австралии соврал про эффективность чатботов и теперь возвращает уволенных сотрудников обратно.
Commonwealth Bank of Australia уволил 45 человек, заявив что их новый бот обрабатывает на 2000 звонков в неделю больше. Проблема: это оказалось полной ложью.
На самом деле звонков стало БОЛЬШЕ после внедрения бота. Менеджеры сами брали трубки, предлагали сверхурочные, лишь бы справиться с наплывом. А банк в это время рассказывал про сокращение нагрузки.
Профсоюз подал в суд, и там выяснилось что банк параллельно нанимал аналогичных специалистов в Индии. То есть ИИ был просто прикрытием для переноса рабочих мест.
Если компания говорит "ИИ заменил людей", проверьте не растёт ли у неё штат где-то еще. Часто за революцией автоматизации скрывается аутсорсинг с ароматом карри.
На первой конференции разработчиков OpenAI компания, создавшая ChatGPT, анонсировала новые инструменты, позволяющие любому желающему создать свой собственный чат-бот или ИИ-агент - для этого не требуется никаких навыков кодирования.
Теперь компания намерена еще больше расширить спектр возможностей ChatGPT, предоставив возможность любому желающему создать собственный чат-бот на базе этой технологии, не имея при этом никаких навыков кодирования. OpenAI предполагает, что люди захотят создавать собственных ботов для решения конкретных проблем или удовлетворения своих интересов, например, для помощи в изучении правил настольной игры, обучения детей математике или дизайна наклеек с помощью искусственного интеллекта.
Чтобы создать одного из таких пользовательских ботов или агентов ИИ, которые в OpenAI называют "GPT", пользователю достаточно указать в разговоре с ChatGPT, что именно он хотел бы, чтобы бот делал. За кулисами ChatGPT напишет код, необходимый для создания и работы нового бота. По словам представителей OpenAI, боты могут подключаться к другим сайтам и сервисам и выполнять такие действия, как доступ к базам данных, поиск электронной почты и автоматизация заказов в электронной торговле.
Сегодня компания заявила, что более 2 млн. разработчиков и более 92% компаний из списка Fortune 500 используют ее API, которые в той или иной мере обеспечивают доступ к ChatGPT или лежащей в ее основе технологии генерации текстов и изображений. По данным OpenAI, в настоящее время ChatGPT имеет около 100 млн. еженедельных активных пользователей.
За год, прошедший с момента запуска ChatGPT, бот практически полностью изменил технологическую индустрию. Google и другие крупные технологические компании реорганизовали свою деятельность, чтобы сосредоточиться на создании аналогичных инструментов искусственного интеллекта. Десятки хорошо финансируемых стартапов теперь предлагают альтернативные модели ИИ. А правительства вынуждены принимать меры, направленные на предотвращение неправомерного использования мощных моделей. Новые пользовательские чат-боты могут позволить OpenAI вновь опередить своих конкурентов в области ИИ, если они станут популярными.
Гендиректор крупнейшей нефтяной компании видит в ИИ опасность беспрецедентного масштаба.
habr.com
На международном форуме по кибербезопасности , прошедшем 1-го и 2-го ноября в Саудовской Аравии, руководитель Saudi Aramco, крупнейшей нефтяной компании в мире, публично высказался относительно новых вызовов в сфере киберугроз, связанных с развитием генеративного искусственного интеллекта. Амин Нассер призвал к международному сотрудничеству для противодействия «тёмной стороне» искусственного интеллекта.
В своём выступлении глава Saudi Aramco подчеркнул, что энергетическая отрасль является привлекательной целью для кибератак, и внедрение новейших технологий, включая генеративный ИИ, лишь усиливает эту угрозу. Он акцентировал внимание на том, что масштабные сбои в поставках энергии могут мгновенно повлечь за собой значительные последствия для всего мира.
Нассер заявил, что перед полноценным внедрением генеративного ИИ необходим тщательный анализ потенциальных угроз и уязвимостей, с которыми могут столкнуться отрасли, планирующие использовать данную технологию.
Вспоминая последствия атак с использованием вайпера Shamoon, которые затронули и Saudi Aramco в далёком 2012 году, Нассер подчеркнул необходимость глобального сотрудничества для обеспечения коллективной безопасности, включая установление международных стандартов и передовых практик. Он выразил мнение, что борьба с киберугрозами не должна ложиться на плечи одного лица или сектора.
Специализирующийся на технологиях искусственного интеллекта стартап xAI Илона Маска (Elon Musk) уже завтра представит на суд ограниченного контингента пользователей свою первую ИИ-модель, сообщает Reuters со ссылкой на заявление миллиардера.
Источник изображения: x.ai
Бизнесмену потребовался без малого год, чтобы полноценно включиться в мировую гонку технологий ИИ, запущенную с выходом службы ChatGPT от OpenAI. Маск и сам числился среди учредителей OpenAI в 2015 году, но в 2018 году он покинул совет директоров компании. «В некоторых отношениях она [новая ИИ-модель от xAI] является лучшей из ныне существующих», — заявил он.
Маск критически отзывается о проектах, которые в области ИИ реализуют технологические гиганты, а также к цензурным ограничениям, которые этим проектам сопутствуют. Поэтому он решил выпустить собственную ИИ-модель, которая, по его словам, поможет в понимании природы Вселенной и окажется конкурентом общедоступным аналогам от Microsoft и Google. Среди разработчиков в компании xAI значатся выходцы из подразделения Google DeepMind, Microsoft и других компаний, работающих в области ИИ.
Стартап xAI и принадлежащая также Маску соцсеть X являются самостоятельными единицами, но они тесно сотрудничают. Совместную работу с xAI проводит также Tesla и другие компании. Соучредитель Oracle и близкий друг Маска Ларри Эллисон (Larry Ellison) в сентябре рассказал, что xAI заключила контракт на обучение ИИ в облачной инфраструктуре Oracle.
В период с 15 по 24 ноября в Китае пройдет двадцать второй автосалон в Гуанчжоу. В его выставочных залах будут представлены 1171 автомобиль. Из них 78 моделей будут впервые представлены широкой публике. Китайские автомобили займут заслуженное место в списке самых интересных автомобилей на предстоящей выставке.
Автосалон в Гуанчжоу является одним из крупнейших мероприятий в мире. Он проходит в Кантонском выставочном комплексе, общая площадь которого составляет 220 тысяч квадратных метров. Особое внимание на этом событии привлекут компании из Жемчужного Залива, такие как GAC и BYD, которые представят большое количество интересных моделей.
Denza Z9
Автомобиль Denza Z9, принадлежащий компании BYD, будет представлен на предстоящей выставке. Ранее в Китае уже начали продавать эту модель в кузове универсал, а теперь готовится к дебюту и обычная версия «девятки».
Габариты Denza Z9 составляют 5235 х 1990 х 1500 мм с колесной базой 3125 мм. Эти размеры делают его сравнимым с флагманскими моделями BMW, Mercedes-Benz и Audi. В салоне китайского седана можно обнаружить до девяти экранов, включая центральный монитор водителя с диагональю 17,3 дюйма.
Denza Z9 будет доступен в электрической и бензиновой версиях. Электрическая модель оснащена тремя электромоторами общей мощностью 966 л.с. и запасом хода до 630 км. В «смешанной» версии также три электродвигателя, но их мощность немного ниже — 870 л.с., поддерживаемые 2-литровым мотором на 207 л.с.
Ожидается, что цены на Denza Z9 будут варьироваться от 330 до 420 тысяч юаней (4,5-5,7 млн рублей).
Кроссовер Denza N9
Компанию флагманскому седану марки на автосалоне должен составить полноразмерный кроссовер Denza N9. Ранее он уже получил разрешение на массовое производство и приготовился к старту продаж. Впрочем, в Гуанчжоу компания пока не называет точные цены на N9.
Denza N9 – это истинно гигантский кроссовер с точными размерами 5258 х 2030 х 1830 мм и колесной базой 3125 мм. Вес в снаряженном состоянии составляет более 3 тонн. Кроме того, N9 способен буксировать прицеп весом до 2,5 тонны. Силовые установки у Denza N9 аналогичны седану Z9 – 966 л.с. в электрическом варианте и более 1000 лошадиных сил в гибридной версии (с учетом ДВС).
Минивэн BYD Xia
На сегодняшний день BYD является одним из лидеров в автомобильной индустрии, представляя свои инновационные разработки на мировой арене. Минивэн BYD Xia, который только недавно был показан на выставке в Гуанчжоу, вызывает огромный интерес у публики.
BYD Xia отличается не только стильным дизайном, но и внушительными размерами – его длина, ширина и высота соответственно составляют 5145, 1970 и 1805 мм. Размеры между колесами также внушают уважение – 3045 мм, что гарантирует комфортное пространство в салоне. Внутри авто можно разместить до семи пассажиров, предлагая им уют и функциональность.
BYD Xia оснащен гибридной системой DM пятого поколения, состоящей из 1,5-литрового двигателя мощностью 156 л.с. и электродвигателя на 272 л.с. Благодаря этой современной технологии, автомобиль может проехать до 145 км на одном заряде батареи, что делает его привлекательным для экологически осознанных покупателей.
BYD Xia – это не просто автомобиль, это символ передовых разработок и высокого качества, который воплощает в себе лучшие традиции марки BYD.
Внедорожники Tank 500 Hi4-Z
Пока отвлечемся от автомобилей из Жемчужного залива и обратим взор на более северные марки. Одним из самых интересных новинок является рамный внедорожник Tank 500 Hi4-Z. Этот автомобиль был лишь кратко показан в конце октября, и пока не было полноценной премьеры.
По внешнему виду Tank 500 Hi4-Z практически не отличается от уже представленного на рынке Tank 500 Hi4-T. Однако главные изменения коснулись технической составляющей этого внедорожника. Основное изменение коснулось силовой установки.
Под капотом этого автомобиля установлен 2-литровый бензиновый двигатель, который выдает 253 лошадиных силы. Ему помогает 3-ступенчатая трансмиссия DHT с интегрированным электродвигателем, который развивает 286 л.с. Еще один электромотор мощностью 326 л.с. размещен на задней оси. Общая выходная мощность силовой установки Tank 500 Hi4-Z достигает 864 л.с. На полностью заряженной батарее этот внедорожник может проехать 200 километров.
Hongqi EHS7
Hongqi EHS7 — один из китайских автомобилей, который отличается от других «долгостроев». Обычно новые модели разрабатывают и выпускают в производство за год с небольшим, но электрический кроссовер EHS7 был анонсирован ещё в январе 2023 года. Недавно этот электрокар был представлен европейской публике на автосалоне в Париже, и теперь модель должна поступить в предзаказ в Гуанчжоу.
Размеры Hongqi EHS7 составляют 4925 х 1950 х 1680 мм с межосевым расстоянием 3000 мм. Силовая установка этого автомобиля обеспечивает отдачу в диапазоне 344-619 л.с., а запас хода достигает 730 км.
Электрический кроссовер Lynk & Co Z20
Lynk & Co Z20 — это инновационная электрическая модель, разработанная совместными усилиями Geely и Volvo. Этот автомобиль был специально создан для европейского рынка, но также пользуется популярностью и в Китае благодаря своей модульной архитектуре SEA и элегантному дизайну.
С его габаритами 4460 х 1845 х 1573 мм и колесной базой 2755 мм Lynk & Co Z20 обеспечивает комфортное пространство для пассажиров и багажа. Один из основных преимуществ этой модели — это электродвигатель мощностью 340 л.с., который обеспечивает плавное и эффективное движение.
Lynk & Co Z20 — это идеальный выбор для тех, кто ценит современные технологии, стильный дизайн и ответственное отношение к окружающей среде. Не упустите возможность испытать уникальные ощущения от вождения этой передовой электрической модели!
Электрический хэтчбек GAC Aion UT
Возвращаясь к автокомпаниям из Жемчужного залива, мы не можем не обратить внимание на компанию GAC, которая представит на автосалоне свой новый электрический хэтчбек Aion UT. Этот автомобиль направлен на конкуренцию с BYD Dolphin и, что удивительно, позиционируется как глобальная модель. Планируется, что после успешного дебюта на рынке Китая, Aion UT будет доступен и в других странах.
Габариты Aion UT впечатляют: длина, ширина и высота соответственно составляют 4270, 1850 и 1575 мм. При этом колесная база автомобиля удлинилась до 2750 мм, несмотря на относительно небольшую длину кузова. Электромотор мощностью 136 л.с. обеспечивает автомобиль плавное движение. Ожидается, что цена на модель в Китае будет составлять менее 100 тысяч юаней, что примерно равно 1,4 млн рублей.
Кроссовер GAC S7
На предстоящем автосалоне в Гуанчжоу будет представлена загадочная новинка — GAC S7. Первое официальное изображение этого кроссовера было опубликовано в сети 10 ноября. Неудивительно, что его пропорции напоминают популярный в России GAC GS8. Представители компании утверждают, что S7 будет оснащен гибридной установкой третьего поколения с характеристиками, сравнимыми с системами Geely и BYD.
Короткий аудиофрагмент из Common Voice и двухчасовое совещание с перебиваниями, шумом кондиционера и названиями продуктов проверяют систему распознавания речи по-разному. Поэтому место модели в публичном бенчмарке еще не отвечает на главный вопрос бизнеса: сколько времени уйдет на получение пригодного текста из реальной записи.
Для транскрибации звонков, лекций, интервью и субтитров важна не только точность распознавания слов. На итог влияют сегментация длинного файла, работа с тишиной, пунктуация, диаризация спикеров, устойчивость API, поддержка форматов и качество склейки результата.
Ниже сравним OpenAI Whisper Large v3, Microsoft VibeVoice-ASR, Yandex SpeechKit и Google Cloud Speech-to-Text с Chirp 3. Лучшей модели для всех сценариев нет. Для русскоязычных длинных записей сильный движок нужно оценивать вместе с инфраструктурой и постобработкой.
Что умеют модели и где начинаются ограничения
1. OpenAI Whisper Large v3 и Large v3 Turbo
Whisper построен как encoder-decoder Transformer. Исходное семейство обучалось на 680 000 часах многоязычного аудио. Версия Large v3 получила значительно больший обучающий набор: 1 млн часов с неполной разметкой и 4 млн часов псевдоразмеченного аудио. Large v3 Turbo сокращает число слоев декодера с 32 до 4, поэтому работает заметно быстрее ценой небольшого снижения качества.
Сильная сторона Whisper для русского языка проявляется на сложной речи: разговорной лексике, смешении русских и английских терминов, неидеальной дикции и фоне. Модель сразу генерирует текст со знаками препинания и обычно дает более читаемый черновик, чем классические ASR-системы без развитой языковой части.
Но у архитектуры есть ограничение: базовое окно Whisper рассчитано примерно на 30 секунд аудио. Длинный файл все равно обрабатывается последовательно. Библиотека или провайдер режет запись на сегменты, переносит контекст и затем собирает результат.
Именно здесь две системы на одной модели могут показать разное качество. Ошибки появляются не только внутри сегмента, но и на границах: пропавшее слово, повтор фразы, неверный таймкод, потерянный спикер. На тишине или музыке Whisper способен генерировать правдоподобный, но отсутствующий в записи текст. Для production-сценария нужны VAD, контроль повторов, фильтрация пустых сегментов и логика восстановления контекста.
У официального OpenAI API в 2026 году есть и новые модели транскрибации, включая GPT-4o Transcribe и вариант с диаризацией. При этом загрузка файла через стандартные speech-to-text endpoints по-прежнему ограничена 25 МБ. Большие записи приходится сжимать или делить до отправки.
2. Microsoft VibeVoice-ASR
VibeVoice-ASR появился в открытом доступе в январе 2026 года. В официальном репозитории текущая модель обозначена как VibeVoice-ASR-7B. Она принимает до 60 минут непрерывного аудио в пределах контекста 64K и за один проход формирует структурированный результат: кто говорил, когда и что сказал.
Модель объединяет распознавание, таймкоды и диаризацию. Поддерживаются пользовательские hotwords: имена, бренды, аббревиатуры и термины можно передать как контекст. Для технических интервью и корпоративных встреч это полезнее, чем попытка исправлять каждое название после транскрибации.
В официальном тесте MLC-Challenge для русского языка VibeVoice-ASR показал WER 12,40%. Эта цифра характеризует конкретный датасет и протокол. Сравнивать ее напрямую с результатами Whisper, Yandex или Google из других тестов нельзя.
Практическая цена часового контекста заключается в требованиях к развертыванию. Нужны Python, CUDA, FFmpeg, совместимое окружение и NVIDIA GPU. Репозиторий Microsoft предлагает запуск через NVIDIA PyTorch Container. Сторонние сборки снижают порог входа, но не снимают задачи обновления зависимостей, мониторинга памяти и масштабирования очереди.
VibeVoice интересен разработчикам, которым нужен открытый long-form ASR с диаризацией и возможностью дообучения. Для обычного пользователя это пока не готовый облачный продукт. Microsoft прямо рекомендует дополнительное тестирование и разработку перед коммерческим применением.
3. Yandex SpeechKit
SpeechKit изначально ориентирован на русский язык и российские сценарии. Сервис поддерживает потоковое, синхронное и асинхронное распознавание. В актуальной документации синхронный режим рассчитан на короткие файлы до 30 секунд, асинхронный принимает записи длительностью до 4 часов и размером до 1 ГБ.
Утверждение, что Yandex не расставляет пунктуацию, в 2026 году устарело. Режим литературного текста добавляет заглавные буквы и знаки препинания. Есть нормализация чисел и дат, определение дикторов, дообучение и обработка результата с помощью LLM.
Слабое место SpeechKit не в отсутствии базовых функций, а в количестве режимов, параметров и ограничений. Разработчику нужно выбрать API, способ загрузки, формат, модель, нормализацию и схему получения результата. Для длинных файлов применяется асинхронная обработка, поэтому интеграция включает создание операции, проверку статуса и получение транскрипта.
Опубликованный на Habr тест 2025 года показал неудачный результат SpeechKit Playground на части файлов, включая повторы строк. Это полезный сигнал, но не универсальная оценка всей платформы: автор использовал собственный набор из 16 записей, а ошибки запроса включал в WER. Перед внедрением SpeechKit нужно тестировать на звонках и записях именно вашего домена.
4. Google Cloud Speech-to-Text с Chirp 3
Сравнивать Whisper с абстрактным Google Speech в 2026 году некорректно. Актуальная многоязычная модель Google называется Chirp 3. Она поддерживает русский язык, потоковое и пакетное распознавание, автоматическую пунктуацию, адаптацию под фразы и автоматическое определение языка.
Для длинного аудио используется BatchRecognize. В документации Chirp 3 указан типовой диапазон от одной минуты до одного часа. Русский доступен для транскрибации, но диаризация Chirp 3 на момент проверки перечислена только для ограниченного набора языков, без ru-RU.
Google удобен компаниям, которые уже работают в Google Cloud и готовы хранить аудио в облачной инфраструктуре проекта. Сильные стороны здесь не сводятся к качеству отдельной модели: IAM, региональные endpoints, журналирование, квоты и масштабирование входят в общую платформу.
Заявлять, что Google всегда хуже Whisper на русском, без единого контролируемого теста нельзя. На чистой диктовке разница может быть небольшой, а на телефонной записи с отраслевой лексикой порядок моделей способен измениться.
Техническое сравнение STT-моделей для русского языка
Таблица показывает, почему вопрос о лучшей модели распознавания речи нельзя закрыть одной цифрой WER. Сначала определите сценарий: звонки, интервью, субтитры, поток или архив. Затем соберите тестовый набор хотя бы из 20–50 своих файлов и посчитайте не только ошибки слов, но и стоимость ручной правки.
Боль бэкендера: почему поднять свой Whisper сложнее, чем кажется
Склейка чанков
Разделить аудио через FFmpeg несложно. Сложно разделить его так, чтобы фраза не оборвалась на полуслове. Обычно сегменты делают с перекрытием. После распознавания нужно найти повторяющийся участок текста, удалить дубль и сохранить таймкоды.
На одном чистом монологе эвристика работает. На совещании с короткими репликами, паузами и перебиваниями она начинает ошибаться. Чем больше правил добавляется, тем сильнее проект превращается из вызова модели в отдельную ASR-платформу.
Галлюцинации на тишине
Музыка, длинная пауза, шум зала и тихая речь могут запустить ложную генерацию. Whisper иногда повторяет последнюю фразу или создает типовые подписи, которых не было в аудио.
Production-конвейер использует VAD, минимальную длительность речи, пороги уверенности, контроль компрессии текста и поиск повторяющихся последовательностей. После этого все равно нужен журнал проблемных сегментов для повторной обработки.
Форматы и лимиты
Пользователь загружает не только MP3. На вход приходят WAV, M4A, OGG, FLAC, MP4, AVI, записи телефонии с двумя каналами и файлы с нестандартной частотой дискретизации. Их нужно проверить, извлечь аудиодорожку, привести к ожидаемому формату и не потерять метаданные времени.
Лимит OpenAI в 25 МБ добавляет еще один слой: сжатие, нарезку, очередь запросов и сборку результата. Размер файла при этом не равен длительности. 25 МБ могут содержать короткий WAV или длинный MP3 с низким битрейтом.
GPU и неравномерная нагрузка
Собственный сервер выгоден при предсказуемом постоянном потоке. При редких загрузках видеокарта простаивает. При резком наплыве файлов возникает очередь, пользователи ждут, а команде приходится добавлять воркеры и следить за памятью.
К стоимости GPU прибавляются хранение файлов, мониторинг, повторные задания, обновление CUDA, безопасность, резервирование и поддержка форматов. Бесплатная модель не означает бесплатный сервис.
Практический вывод: использовать модель или готовую систему
Для исследовательского проекта разумно поднять Whisper или VibeVoice локально. Вы получите контроль над кодом, данными и параметрами. Для продукта важнее другой вопрос: кто отвечает за длинные файлы, сбои, диаризацию, форматы и качество текста на стыках.
Заключение
Whisper, VibeVoice, Yandex и Google решают разные части одной задачи. Whisper дает сильное качество базовой транскрибации, VibeVoice сохраняет часовой контекст, Yandex предлагает развитый набор режимов для русского языка, Google встраивает STT в масштабируемую облачную платформу.
На практике качество определяет весь конвейер: подготовка аудио, VAD, склейка сегментов, диаризация, пунктуация, контроль повторов и обработка ошибок. Поэтому бизнесу часто выгоднее тестировать не голую модель, а готовый результат на своих файлах.
Я хотел бы поделиться нашими новыми публичными моделями синтеза речи. Они стали радикально лучше, качественнее и обзавелись целым рядом фич:
Модели в 10 раз быстрее и в 2 раза меньше (и все голоса внутри одной модели) Теперь там появился новый высококачественный диктор, а также модель умеет генерировать случайных дикторов (пример на видео ниже) Мы научили их делать паузы, менять скорость и тон речи Они могут генерировать аудио разного качества - от телефонии до диктора из студии (8, 24, 48 kHz) Теперь нет детских болячек таких как зависание или пропуск слов
Реализация автомобилей марки "Москвич" в России увеличилась на 77,9% всего за год.
Москвич остается в лидерах автомобильного рынка России благодаря своей славной истории и популярности среди отечественных автолюбителей. Этот автомобиль производится в России уже более полувека и имеет свою постоянную аудиторию, которая ценит его надежность и простоту в обслуживании.
Российская автомобильная марка «Москвич» продолжает укреплять свои позиции на рынке и занимает достойное место среди самых популярных брендов уже второй месяц подряд. По данным агентства «АВТОСТАТ», в ноябре 2024 года продажи «Москвича» достигли 2 620 новых автомобилей, что на 37,2% больше, чем в прошлом году.
В декабре этот российский бренд продемонстрировал еще более впечатляющие результаты, поднявшись на седьмое место с продажами 3 148 автомобилей, что на 30,4% больше, чем в декабре 2023 года.
В течение 2024 года было реализовано 23,3 тысячи автомобилей «Москвич», что сравнимо с приростом на 77,9% по сравнению с предыдущим годом. По итогам года бренд занял 12-е место в рейтинге автомобильных марок России.
В линейке моделей «Москвич» представлены кроссовер «Москвич 3», лифтбек «Москвич 6» и электрокроссовер «Москвич 3е». В феврале 2025 года запланирован старт продаж новой модели — 7-местногокроссовера «Москвич 8».
Не секрет, что у Baldur's Gate 3 не было оригинальной русской озвучки. Мы сделали так, что главные персонажи из игры могут говорить на русском языке. Некоторые говорят с небольшим акцентом … а некоторые с заметным акцентом.
Комментарии