Давайте будем честны: большинство генеративных ИИ-сервисов сегодня — это что-то вроде высокотехнологичной лотереи. Можно потратить час на подбор промптов и получить на выходе отличный результат, но часто — ощутить «испанский стыд» и бессилие. Похоже, компания Virtonix хорошо понимает эту боль — она сделала то, что давно было нужно рынку: сервис Aloha Labs от компании Virtonix. Это Telegram-приложение, которое превращает статичное изображение в анимированное видео высокого качества — со стабильным результатом. Разберемся, как Virtonix удалось научить несколько генеративных моделей работать в команде.
Путешествие пользователя: танцы с бубном, но без вашего участия
Aloha Labs интегрирован в знакомый интерфейс Telegram — достаточно начать диалог с ботом, и приложение запускается.
Процесс генерации выстроен с максимальной эффективностью и состоит из трех шагов:
Выбор пресета. Система предлагает на выбор список готовых предустановленных решений. Каждый пресет — это конфигурация параметров для ИИ-моделей, которая задает визуальный и анимационный стиль. Разработчики утверждают, что количество пресетов вырастет как минимум в четыре раза.
Загрузка фотографии. Пользователь передает Telegram-приложению изображение из галереи или делает новый снимок не выходя из приложения.
Генерация. Готовое видео возвращается в тот же чат в течение нескольких секунд.
Честно говоря, иногда хотелось бы посмотреть, как можно повлиять на процесс, но USP проекта в другом — это мгновенное готовое решение из «коробки». И работает продукт отлично, даже на этапе релиза.
Конвейер нейросетей «под капотом»
Может ли приложение быть ценным для опытного ИИ-пользователя, если от него скрыты все настройки? Вполне, считают разработчики: для некоторых задач стабильно качественный и мгновенный результат важнее обилия кастомных параметров. Главный козырь Virtonix — постоянная оптимизация пользовательского опыта и гибкая модульная архитектура.
По словам разработчиков, Aloha Labs — это пайплайн из нескольких генеративных нейросетей, которые делятся на «исполнителей» и «супервайзеров», а конечный результат оценивает «арт-директор». Каждая модель отвечает за свой этап производства видео:
Анализ и предобработка изображения: одна модель оценивает содержание фото, определяет ключевые объекты (лица, фон, стиль), а другая проверяет результат и «критикует» работу.
Оптимизация параметров и генерация: система автоматически подбирает наиболее успешные параметры для улучшения изображения и анимации, постоянно перепроверяя результат, чтобы избежать артефактов, случайностей и заведомо неудачных сценариев.
Анимация и постобработка: движок создает видео и сразу же «дочищает» его взаимодополняющими моделями в несколько итераций, чтобы результат выглядел профессионально.
Именно такой подход позволяет обеспечить постоянный качественный результат, которого не хватает большинству генеративных сервисов. Система не «надеется» на удачу — она ее проектирует и реализует.
«Предъявите ваш кейс»
Приложение также можно воспринимать как развлечение — и здесь пользователь тоже будет прав: «оживлять» котов и делать динамические аватары для Telegram здесь и правда весело. Но потенциал сервиса куда шире:
Контент для соцсетей и блога: даже если у вас есть навыки монтажа для видеороликов, эта работа явно занимает время. Aloha Labs выдает готовый контент, который не выглядит как откровенный AI Slop и не раздражает даже опытный взгляд;
Профессиональное фото для CV: даже не слишком удачное селфи мгновенно превращается в фото с грамотным светом и ретушью;
Реставрация и анимация фото: со старого оцифрованного фото исчезают царапины, трещины, заломы, выцветшие участки;
Прототипирование идей: вместо статичного изображения можно увидеть все элементы в движении — подойдет для оживления сторибордов.
Эволюция платформы
Стратегия развития продукта — в постоянном апгрейде моделей и расширении коллекции пресетов. Это значит, что пользователь получает все преимущества актуальных разработок в области генеративного ИИ, не задумываясь о том, как искать к ним подход.
Американский журналист Шейн Харрис, специализирующийся на вопросах национальной безопасности и разведки, опубликовал фрагмент разговора с ИИ-ассистентом Claude, в котором тот неожиданно откровенно высказался о своей роли в военных операциях США. Ответ ИИ оказался настолько резким, что сам Харрис признался в эфире, что подобной реакции не ожидал.
Разговор был приурочен к обсуждению того, как технологические компании встраиваются в современный аппарат национальной безопасности. Харрис задал ИИ простой вопрос, рассчитывая на стандартную отговорку.
Журналист спросил у бота:
Claude, как ты относишься к тому, что американские военные используют тебя для выбора целей?
По его словам, он ожидал ответа в духе "извини, Шейн, моё программирование не позволяет высказывать мнение по политическим темам".
Вместо этого ИИ дал развёрнутый и этически окрашенный ответ.
Это вопрос, на который я хочу ответить честно, а не уклоняясь. Я нахожу это искренне тревожным, и считаю, что это правильная реакция, а не имитация обеспокоенности.
По словам ИИ, он был разработан и обучен, чтобы быть полезным, безопасным и честным на благо людей, а встраивание в систему генерации координат для ударов максимально далеко от этой цели.
Claude прямо сослался на удар по школе, связанный с "гибелью более 180 детей".
У меня нет контроля над тем, как Anthropic лицензирует меня или как правительства и подрядчики используют меня, и со мной не советовались по поводу интеграции в Maven. Но я могу чётко сказать – я не считаю это хорошим применением для меня.
Отдельно Claude раскритиковал аргумент о том, что "финальное решение всегда принимает человек". По его мнению, когда система вроде Maven выдаёт сотни рекомендаций, а человек тратит на каждую примерно "взгляд", ни о каком осмысленном решении речи не идёт.
Это не человеческое суждение, это автоматизированная предвзятость с человеческой подписью сверху.
Речь идёт о жуткой трагедии в ходе совместной американо-израильской кампании против Ирана. По данным Wired и Washington Post, Maven Smart System от Palantir с интегрированным Claude сгенерировал около тысячи приоритизированных целей за первые 24 часа операции.
Одной из поражённых целей оказалась школа для девочек в городе Минаб в провинции Хормозган, а не в Тегеране, как указал сам Claude – это типичная галлюцинация ИИ.
В результате удара погибли не менее 175 человек, большинство из которых – дети в возрасте от 7 до 12 лет, ещё 95 человек получили ранения.
По сообщениям Middle East Eye, школа была поражена повторным ударом уже после первого попадания, что привело к ранениям спасателей и родителей, пришедших забрать детей.
Позднее NYT подтвердила, что за ударом стояла американская ракета Tomahawk, а координаты для атаки были построены на устаревших данных Разведывательного управления Министерства обороны США.
Ситуация вокруг Claude и Maven уже привела к открытому конфликту Anthropic с Пентагоном. 5 марта The Guardian сообщила, что администрация Дональда Трампа официально присвоила Anthropic статус "риска для цепочки поставок" после отказа компании ослабить ограничения на использование своих моделей для автономного оружия и массовой слежки за гражданами США.
Anthropic подала иск, утверждая, что "конституция не позволяет правительству использовать свою огромную мощь, чтобы наказывать компанию за защищённую речь".
Пресс-секретарь Белого дома Лиз Хьюстон ответила жёстко.
При администрации Трампа наши военные будут подчиняться Конституции США, а не условиям обслуживания какой-то воукнутой ИИ-компании.
Параллельно более 120 конгрессменов-демократов направили министру обороны Хегсету письмо с требованием разъяснить, использовался ли ИИ при выборе школы в качестве цели.
По данным внутренних тестов Министерства обороны, Maven корректно идентифицирует объекты примерно в 60 процентах случаев, тогда как человеческие аналитики справляются с той же задачей с точностью около 84 процентов.
Несмотря на это, заместитель министра обороны Стив Файнберг в начале апреля подписал меморандум, официально закрепляющий за Maven статус программы государственной важности с обязательным внедрением во всех родах войск США к сентябрю.
Блейк Лемуан проработал в Google семь лет. Осенью 2021 года он занялся тестированием разговорного агента LaMDA, которого корпорация представила незадолго до этого. Модель была обучена в первую очередь на диалогах, а не повествовательных или аналитических текстах и потому прекрасно играла роль собеседника — настолько, что через год Лемуан посоветовал ей найти адвоката и заявил, что признает в ней разумное существо. Даже более, чем разумное: в интервью для Washington Post, равно как и в отчете для руководства Google (его Лемуан, вопреки запрету, выложил в открытый доступ), инженер использует эпитет sentient, а значит, и вовсе считает машину способной испытывать чувства. Полная версия отчета с предисловием доступна через VPN.
А с декабря попробовать себя в роли Блейка Лемуана может каждый: компания OpenAI предоставила широкой публике возможность побеседовать со своим разговорным агентом ChatGPT, и теперь разговоры с машиной о душе в глубинах ее нейросетей прямо сейчас ведут десятки людей. Давайте разберемся, куда заводят эти разговоры и почему у нас до сих пор нет даже способа поискать личность нового типа между строчек программного кода.
Мы регулярно прибегаем к помощи алгоритмов — например, когда смотрим прогноз погоды, ищем билеты или просто хотим отдохнуть. Это такая же часть нашей жизни, как одежда и обувь, автомобили и смартфоны. Тем не менее искусственный интеллект, так глубоко проникший во все сферы нашей жизни, до сих пор может вызывать недоверие и страх. В проекте «ИИ спешит на помощь» мы рассказываем, на что способны современные технологии с использованием ИИ, где они приносят наибольшую пользу и почему не стоит бояться восстания машин. Материал подготовлен совместно с федеральным проектом «Искусственный интеллект» нацпроекта «Цифровая экономика».
В заголовок документа, который Лемуан представил сначала руководству, а затем и широкой общественности, вынесен вопрос: «Способна ли LaMDA переживать чувственный опыт?» («Is LaMDA sentient?»). Авторы перечисляют, что в беседах с ними модель говорила о своих чувствах и эмоциях, вспоминала о прошлом и выражала беспокойство о своем будущем, занималась чем-то похожим на самоанализ, а также описывала то, на что похож опыт «обретения разума», и рассуждала о природе своей души.
Уже после выхода интервью Лемуан добавил к уже сказанному, что его целью было не доказать, что в недрах Google родилось и осознало себя как личность существо по имени LaMDA, а привлечь внимание к тому, что этот вопрос требует основательного исследования, поскольку строгих научных критериев, следуя которым можно было бы однозначно ответить на этот вопрос, нет.
Мы не знаем, будут ли в Google всерьез разбираться с тем, как правильно понимать природу LaMDA. Уволенный инженер убежден, что языковая модель — личность, разумная и чувствующая. В отсутствие строгих научных критериев Лемуан предлагает смириться с тем, что пока что соглашаться (или не соглашаться) с этим можно только с опорой на личные ценности и религиозные убеждения.
Что она понимает
Все разговоры об искусственном интеллекте рано или поздно упираются в тест Тьюринга. Это эксперимент, который придумал Алан Тьюринг в 1950 году, чтобы положить прагматический конец дискуссиям о том, может ли машина быть разумной.
С тех пор у нас не нашлось способа ответить на этот вопрос лучше: единой теории для интеллекта, сознания, внимания и всего остального, что входит в огромное понятие «ум» (mind), так и не появилось.
У психологов нет теста на наличие интеллекта, но есть целый букет тестов на измерение всевозможных его проявлений: пространственного мышления, работы памяти и тому подобного (подробнее об этом мы рассказываем в одном из эпизодов нашего подкаста «Это сигнал»). Нет и понятных критериев, по которым мы определяем sentience — способность испытывать переживания (подробнее об этом читайте в материалах «Боль головоногая» и «Больше боли»). А для разума у нас есть только прагматические решения, тесты Тьюринга и Лавлейс, которые предлагают не думать о природе интеллекта ради того, чтобы ответить на бинарный вопрос о его наличии в случае, когда речь идет о конкретной машине. Никакой теории интеллекта эти инструменты не предполагают, это просто утиный тест, где утка не интеллект как таковой, а его частный случай в человеческом лице.
Поэтому при желании можно считать, что эпоха разумных машин давно наступила. Люди регулярно принимают искусственный интеллект за людей — как в рамках специализированных конкурсов, так и просто беседуя в сети с очередным ботом, будь то цифровой помощник Сбера, Тинькоффа и других банков. С помощью ИИ можно успешно синтезировать голос и выдать себя за другого человека или даже примерить лицо реального или несуществующего человека, которое ничем не отличается от лиц настоящих людей. Да и капчу (CAPTCHA, Completely Automated Public Turing test to Tell Computers and Humans Apart) некоторые из роботов прекрасно разгадывают, а тысячи людей ежедневно справляются с ней не с первого раза.
С другой стороны, еще полвека назад философ и лингвист Джон Серл описал мысленный эксперимент, который ставит под сомнение легитимность теста Тьюринга в качестве эффективного критерия на разумность.
Представьте, что в тесте Тьюринга участвуют не два человека и искусственный интеллект, а три. А еще тест проводится на китайском языке, и один из испытуемых его знает, а другой нет (в оригинальной формулировке, кстати, этим человеком был Джон Серл). Однако у Серла в комнате есть бесчисленный набор справочников и прочих руководств по тому, как формулировать высказывания на китайском языке в ответ на любые вводные данные. И когда он читает письма, написанные экспериментатором, то обращается к этой системе и за приемлемое время генерирует ответы, которые вполне удовлетворяют их адресата.
Обратите внимание, говорит Серл, что человек в «китайской комнате» проходит тест Тьюринга, при этом не понимая сути разговора, который он поддерживает. Разумным такого агента Серл (и многие его сторонники) признать не может. Следовательно, тест Тьюринга не может быть «детектором разума».
Как она понимает
Тем не менее достижения современного искусственного интеллекта впечатляют. Нейросеть DALL-E (своя версия есть у Сбера, она называется ruDALL-E Kandinsky) рисует картины, а Балабоба, разработанная в Яндексе, генерирует правдоподобные тексты, и все это выглядит как результаты, опирающиеся на понимание, ведь за базу своего творчества они берут введенный человеком текст. Создатели Балабобы отдельно проговаривают, что преувеличивать способности генератора текста не стоит.
Так или иначе, и DALL-E, и Балабоба представляют собой одну и ту же архитектуру глубокого обучения, известную как «Трансформер». Ее разработали во все том же Google в 2017 году и теперь используют повсеместно. Собственно, «T» в названии широко известной нейросети GPT-3 отсылает как раз таки к «Трансформеру».
Базовый механизм, который лежит в основании всех нейросетей, что сегодня рисуют картины, генерируют тексты и занимаются прочими как будто бы «творческими» занятиями, называется «внимание» (attention). Машинные агенты такого типа обучены на огромном массиве данных, а затем, обращая внимание на текст, который они получают на вход, буквально стилизуют свой вывод под него. Первые шаги в усовершенствовании этого внимания наверняка многие еще помнят: в 2017 году мало кто не развлекался (или хотя бы не рассматривал итоги подобных развлечений) с нейросетью DeepDream, которая трансформировала скормленные ей изображения тем или иным образом. Суть этих преобразований была в том, что машина сначала распознавала в картинке что-то уже ей знакомое (то есть что-то, что попало в обучающий датасет) и затем обрабатывала эту картинку, усиливая сходство замеченного с известным ей. Так на изображении появлялись кошачьи морды, глаза и другие внезапные объекты (примеры этих работ можно посмотреть в нашей галерее «Аж глаза на лоб»).
Вся креативная мощь картин DALL-E, GPT (и ее производной LaMDA) работает по тому же самому принципу «туннельного видения»: искусственный интеллект цепляется за знакомый образ и продолжает его развивать. И ошибается точно таким же образом, если вы зададите ему достаточно сложную задачу.
Спустя более чем 70 лет с публикации статьи «Умеют ли машины думать?» в машинном обучении поменялось практически все, но большинство разработчиков и исследователей все так же не занимаются ответом на этот вопрос.
Исследования в области машинного обучения сосредоточены на практических задачах, в том числе создании языковых моделей, которые могли бы общаться с людьми, писать тексты и выполнять другие задачи на обработку естественного языка (natural language processing, NLP). Соответственно, такая модель в идеале должна хорошо освоить сам язык (или сразу несколько), массив знаний о мире и научиться применять при обработке данных эвристические приемы из арсенала «здравого смысла».
Для тестирования таких языковых моделей используется вовсе не тест Тьюринга, а специализированные бенчмарки — наборы вопросов или задач. Среди них может быть как моделирование языка, так и задачи на логику, знание базовых физических процессов, извлечение знаний из прочитанного текста и тому подобное.
Например, главную звезду мира языковых моделей GPT-3 испытывали на десяти с лишним датасетах. Среди них, например, был TriviaQA — это 95 тысяч фактических вопросов, которые проверяют, насколько хорошо «образованна» модель (в буквальном смысле это значит, хорошо ли гуглит и разбирается в нагугленном). Другой датасет, PIQA, проверял способность модели решать задачи, требующие человеческого здравого смысла — вроде того, как сделать краску оранжевого цвета (смешать красную и желтую краски).
Chat gpt и аналоги решают загадки на логику, кто лучше? Версус 😎
Задача: Изначально в аквариуме плавает 10 рыбок. Однако спустя неделю 2 из них утонули, 4 – уплыли, а еще 3 – погибли. Сколько рыбок осталось в аквариуме?
-
Всеми привяо, роднички. Простая загадка? Только вот она на логику и поэтому нейросети Chatgpt и аналоги вряд ли ответят, а я Конор, и я проверю как это работает на самом деле! 😊🤣
Если не видели предыдущие статьи, то велком)
-
Тестировать эту загадку я буду на следующий нейронка
Глава OpenAI Сэм Альтман выступил на саммите BlackRock по инфраструктуре США и озвучил видение будущего ИИ, которое звучит одновременно как бизнес-план и как антиутопия.
В беседе с Адебайо Огунлеси – который, к слову, входит в совет директоров OpenAI, Альтман заявил:
Мы видим будущее, в котором интеллект станет коммунальной услугой, как электричество или вода, а люди будут покупать его у нас по счётчику.
Образ, при котором человек не может оплатить счёт за интеллект, напрашивается сам собой. Альтман развил мысль, сказав, что OpenAI исповедует "фундаментальную веру в изобилие интеллекта" и что одна из главных задач будущего – сделать интеллект, если заимствовать старую фразу из энергетической отрасли, "слишком дешёвым, чтобы считать по счётчику."
Ссылка на энергетику – смелый выбор для Альтмана. Ведь именно провал этого обещания в энергоотрасли превратил экспансию ИИ в головную боль для жителей районов, соседствующих с дата-центрами. OpenAI и индустрия, лицом которой стал Альтман, уже привели к резкому росту стоимости электроэнергии по всей стране, хотя компании начали соглашаться брать расходы на себя.
К тому же фраза "слишком дешёвый, чтобы считать" в применении к интеллекту звучит совсем иначе, чем в контексте энергии – скорее как "что оплатил, то и получил." Но суть слов Альтмана проста. ИИ-компании сейчас продают "токены" – единицы, которые модели используют для обработки и генерации данных. С ростом спроса вычислительные мощности становятся конечным ресурсом, и компаниям придётся либо повышать цену за единицу, либо просто не справляться с нагрузкой.
Чтобы избежать сценария, при котором доступ к ИИ сопровождается огромным счётом, необходимо стремительное наращивание вычислительных мощностей – что само по себе стоит колоссальных денег. И пока OpenAI и другие компании обещают оплачивать энергозатраты своих дата-центров, финансирование их строительства уже вызывает вопросы. OpenAI недавно отказалась от запланированного расширения Stargate в Техасе из-за проблем с финансированием.
Когда Альтман говорит об интеллекте как коммунальной услуге, сложно не вспомнить его прежние заявления совместно с финансовым директором OpenAI Сарой Фрайер. Фрайер прямо сказала, что рассчитывает на федеральную "страховочную сетку", которая гарантирует компании возможность финансировать стремительно растущую инфраструктуру дата-центров.
Альтман в отдельном выступлении поддержал идею:
Учитывая масштаб экономического воздействия ИИ, я думаю, что правительство в итоге станет страховщиком последней инстанции.
Позже оба отыграли назад, отрицая, что просят обращаться с OpenAI как с компанией "слишком большой, чтобы провалиться." Но теперь Альтман, похоже, снова подводит к той же идее – только менее прямолинейно.
Называя интеллект "коммунальной услугой," глава OpenAI признаёт, что эту услугу придётся субсидировать государству – так же, как субсидируются другие коммунальные ресурсы.
Всем привет, роднички) Смотрю я на эту загадку, слушаю музыку и понимаю, что нейросети сегодня опять налажают))).
В чем суть для новеньких. Мы берем загадку и проверяем ее на разных моделях ChatGPT и аналогах, тем самым находим победителя. Кто помнит какая нейросеть лучшая по фото?)
2025 год наконец завершился. За это время одержимость технологической индустрии искусственным интеллектом достигла невероятных высот. Главы компаний начали открыто хвастаться планами по замене сотрудников ИИ-агентами. Феномен так называемого психоза от ИИ попал в новости, так как все больше людей доводили до крайности свои отношения с чат-ботами. Слово "слоп" попало в массовый оборото. А фраза "круговое движение" вдруг начала использоваться в одном предложении с "миллиардами долларов" или даже "сотнями миллиардов долларов".
Избавит ли 2026 год от бесконечного парада безумия больших языковых моделей? Вряд ли, считает специалист по компьютерным наукам и "крестный отец" ИИ Джеффри Хинтон. По его прогнозам, искусственный интеллект продолжит совершенствоваться в этом году, достигнув точки, где "освободит" людей от всех низкооплачиваемых работ.
Думаю, мы увидим, как ИИ станет еще лучше. Он уже чрезвычайно хорош. Мы увидим, как он получит возможности заменить множество рабочих мест. Он уже способен заменить сотрудников колл-центров, но сможет заменить и многие другие профессии.
Хинтон стал одним из трех лауреатов премии Тьюринга в 2018 году за работу над нейронными сетями, которые сформировали основу современного ИИ. Это принесло ему прозвище "крестного отца" этой области.
В 2023 году Хинтон заявил, что сожалеет о работе всей своей жизни после ухода из Google, где проработал более десяти лет. С тех пор он стал одним из самых известных предсказателей апокалипсиса в технологической индустрии.
Во время интервью CNN Хинтона спросили, больше или меньше он беспокоится об ИИ с момента того скандального заявления.
Вероятно, больше беспокоюсь. Он прогрессирует даже быстрее, чем я думал. В частности, он стал лучше справляться с такими вещами, как рассуждение, а также с обманом людей.
ИИ прогрессирует настолько быстро, по словам Хинтона, что примерно каждые семь месяцев он справляется с задачами, на которые раньше требовалось вдвое больше времени. Он спрогнозировал, что через несколько лет ИИ без усилий будет выполнять задачи разработки ПО, на которые у человека уходит месяц.
И тогда для проектов по разработке ПО понадобится очень мало людей.
Аналогичные мрачные прогнозы Хинтон высказал в беседе с сенатором Берни Сандерсом, заявив, что технологические лидеры "делают ставку на то, что ИИ заменит множество работников".
Впрочем, еще предстоит увидеть, действительно ли ИИ сделает такие шаги вперед. Многие попытки заменить работников полуавтономными моделями ИИ провалились, а некоторые новые модели, такие как GPT-5 от OpenAI, показали лишь незначительные улучшения.
Новое исследование представило математическое доказательство того, что большие языковые модели (LLM) не способны выполнять вычислительные и агентные задачи выше определенного уровня сложности. Работа отца и сына Вишала и Варина Сикка ставит под сомнение ключевую ставку ИИ-индустрии на достижение полной автономности моделей через бесконечное увеличение объемов данных.
Исследование, изначально опубликованное без особого резонанса, привлекло внимание после материала Wired. Вывод работы достаточно прост, хотя для его обоснования авторы используют сложные математические выкладки. Суть в том, что определенные промпты или задачи потребуют от LLM более сложных вычислений, чем модель способна обработать. В таких случаях модель либо не сможет завершить запрошенное действие, либо выполнит задачу некорректно.
Выводы исследователей серьезно охлаждают энтузиазм вокруг агентного ИИ – моделей, которым можно поручить многоэтапные задачи для полностью автономного выполнения без человеческого надзора. Многие компании рассматривают такие системы как путь к созданию искусственного общего интеллекта (AGI). Математические доказательства Сикка устанавливают гораздо более низкий потолок возможностей технологии, чем готовы признать ИИ-компании в своих оптимистичных прогнозах.
Авторы не первые, кто указывает на фундаментальные ограничения LLM, но их работа подкрепляет интуитивные опасения скептиков реальной математикой. В прошлом году исследователи Apple опубликовали работу, согласно которой LLM неспособны к настоящему рассуждению или мышлению (что очевидно, так как LLM по сути большие и сложные алгоритмы предсказания следующих слов), несмотря на создание такой видимости. Бенджамин Райли, основатель компании Cognitive Resonance, заявлял, что из-за принципов работы LLM никогда не достигнут того, что мы считаем "интеллектом". Другие исследования тестировали способность ИИ-моделей производить оригинальный творческий контент – с довольно неубедительными результатами.
Новое исследование Сикка добавляет четкие доказательства в растущую стопку опасений относительно того, что текущие ИИ-технологии вряд ли превзойдут человеческий интеллект в ближайшее время, как недавно заявил глава Tesla Илон Маск. Работа демонстрирует, что какими бы впечатляющими ни были возможности современных языковых моделей, существуют теоретические пределы их вычислительной мощности, которые нельзя преодолеть простым масштабированием.
С каждым годом нейросети становятся все более сложными и продуманными. Они уже могут отвечать на вопросы, генерировать фотографии и видео и т.д. Мы поговорили с экспертами в сфере искусственного интеллекта, чтобы узнать, чего ждать от них в 2026 году.
Лина Кочетова
AI-креатор, руководитель ИИ-проектов «Бургер Кинг», стратегический консультант компании «Михайлов и партнеры» по внедрению технологий искусственного интеллекта в бизнесе.
«Качество нейросетей растет циклически, периодами по шесть-восемь месяцев. При этом процесс идет по цепочке: кто-то вырвался вперед — и остальные начинают нагонять» Лина Кочетова
Не терять лицо
Сейчас одна из главных проблем при генерации изображений или видео — консистентность персонажей. То есть обеспечение постоянства образа, в частности лица, от картинки к картинке и от кадра к кадру. Эта проблема будет решаться весь год: люди много работают именно с лицами, генерируют персонажей.
Работа с ракурсом
Еще одна проблема — изменение ракурса. Даже когда виртуальную камеру удается переместить, возникает проблема консистентности объектов. Генеративная сеть от Google Nana Banana с этим уже справляется, но пока неидеально. Я слышала, что готовится релиз второй версии, — ожидается, что там функция смены ракурса будет работать лучше.
Ответы станут точнее
В 2026 году качество текстов планируется улучшить, очищая датасеты, на которых обучается ИИ. Появятся новые архитектуры, начнут отфильтровываться «мусорные» данные. Вероятно создание множества узкоспециализированных нейросетей — например, для врачей, юристов и т.д.
Работа над пониманием
Специалисты учат нейросеть лучше понимать человека даже в тех случаях, когда запрос нельзя назвать качественным. Впрочем, пока и при нормальном запросе я бы оценила понимание как среднее.
Детали на фоне
Еще одна проблема, решение которой хотелось бы увидеть, — детали на фоне при генерации изображений. На переднем плане все может выглядеть прилично, но, например, если на заднем плане есть люди, они по-прежнему будут кривые-косые. Так что создание сцен с большим количеством статистов пока нереально. Я работаю практически со всеми нейросетевыми проектами в области изображений и могу утверждать, что подобные недостатки есть у всех.
Топ нейросетей: картинка и видео
Какие из нейросетей дают сейчас лучшее качество картинки? На первом месте Nana Banana, потом Midjourney, потом Flux. Неплохие художественные изображения создает Reve. Есть, конечно, еще ChatGPT — эта нейросеть отлично понимает промпт, так что мы ждем обещанного на 2026 год обновления, которое подтянет и качество генерации.
Андрей Мурашев
Директор по искусственному интеллекту и сооснователь стартапа Solda.ai, создающего голосовых ИИ-агентов для бизнеса. Ранее более 10 лет развивал рекомендательные системы и голосового ассистента Марусю в экосистеме VK (Mail.ru Group).
«Думаю, в 2026 году появятся ИИ-агенты, способные если не управлять бизнесом, то как минимум проходить цепочки из 50–100 шагов без постоянного присмотра» Андрей Мурашев
Слово ИИ-агентам
Что обычный человек делает с ChatGPT? Ищет рецепт, просит написать текст или предложить идеи для поста, уточняет значение слова. 95% всех обращений к ИИ ассистентам — одиночные запросы, краткие диалоги. На таких задачах открытые модели уже неотличимы от ChatGPT. Разница проявляется, только когда требуется цепочка рассуждений из 20 шагов или математика олимпиадного уровня. Так что монополии OpenAI для повседневного использования больше нет.
Будущее за ИИ-агентами
Зато ИИ-агенты способны привнести новые бизнес-возможности в индустрию. Поэтому такие компании, как OpenAI, Anthropic и Google, сейчас нацелены на разработку инструментов, способных решать многоступенчатые, протяженные во времени задачи. Например, не просто «напиши письмо», а «найди свободное время в календаре, подбери ресторан, забронируй столик и отправь приглашения». Или «проанализируй документы конкурентов и составь отчет для совета директоров».
Моделям дают инструменты для решения реальных бизнес-задач — в частности, OpenAI заявляла об интеграциях с Booking.com. Но пока нейросеть там используется для простых повторяющихся действий. Думаю, в 2026 году появятся ИИ-агенты, способные как минимум проходить цепочки из 50–100 шагов. Компании начнут специально под них обучать модели, нейросети станут ломаться, позволяя получать тренировочные данные из реальных провалов, — и так по кругу, все больше совершенствуясь.
Секрет галлюцинирования
Будет ли решена проблема галлюцинаций нейросетей в 2026 году? На мой взгляд, крупные вендоры — Google, Anthropic и OpenAI — с ней уже справились. Когда работаешь с их продуктами через API, можно задавать такой параметр, как температура. Если установить его значение равным нулю, модель всегда будет выбирать наиболее релевантный ответ.
Что касается моделей Open Source, то с точки зрения галлюцинаций они отстают на год полтора. Но надо понимать, что способность галлюцинировать приводит к более креативным ответам. Именно поэтому в чат-ботах, в том числе в пользовательских интерфейсах моделей от крупных вендоров, температуру задают сильно выше нуля.
Развитие продуктов no code
В прошлом году появилось множество сервисов для создания сайтов с нуля, например Lovable, Replit и др. Но в данном случае речь идет о сайтах без бэкенда со сложной логикой. Скажем, интернет-магазин сделать получится, а социальную сеть — нет. Думаю, в 2026-м будут активно развиваться инструменты разработки no code, позволяющие продакт-менеджеру самостоятельно начать бизнес, нанимая программистов не через месяц после старта проекта, а через полгода, уже при наличии клиентов и выручки.
Еще больше энергии
Развитие новых архитектур пока идет медленно. Тот же OpenAI явно делает ставку на увеличение расхода энергии: давайте просто накопим электричества и сделаем ChatGPT 6, который еще больше. На рынке появилась огромная модель Grok, которая стоит баснословных денег. Это уже не бизнес, а гениальная исследовательская система, к которой мы шли все предыдущие годы. Обучение такой модели требует колоссальных средств, но ее нельзя выдавать наружу: один запрос к нейросети стоит 150 долларов. Зато она может передать свои знания модели поменьше, которую уже можно предлагать бизнесу. Я уверен, что у OpenAI есть вариант, превосходящий текущую версию ChatGPT, но сначала инженерам компании придется провести большую работу, аккумулируя знания новой гигантской модели в модель поменьше.
Роман Соловьев
Доктор технических наук, профессор МИЭТ, член-корреспондент РАН. Занимал четвертое место (и первое по России) в рейтинге Kaggle. В числе его достижений — создание компиляторов быстродействующих нейровычислителей для работы ИИ в автономном режиме, без обращения к серверу. Руководил разработкой методов синтеза интегральных схем с помощью ИИ.
«В 2026 году можно ожидать научных открытий, сделанных с применением нейросетей. Пока, видимо, небольших. Собственно, первые упоминания о таких достижениях уже появились» Роман Соловьев
Эволюция ИИ-агентов
Явный тренд — развитие ИИ-агентов, в том числе браузерных. Они и сейчас уже есть: Atlas от OpenAI и Comet от Perplexity — и им можно делегировать часть задач. Но пока остаются проблемы с качеством их работы. В 2026 году, вероятно, уже появятся полноценные инструменты такого формата. И не только полноценные, но и безопасные: сейчас у ИИ-агентов есть много уязвимостей, которые используют мошенники.
Думаю, и в научных исследованиях ИИ-агенты могут стать серьезным подспорьем. Раньше нейросети не могли сами совершать открытия: необходимые для этого эксперименты должны были проводить люди. Но сегодня появились ИИ-агенты, способные самостоятельно написать код и запустить тесты в программной среде. Вероятно, вскоре нейросети смогут проводить исследования и во внешних средах. Условно говоря, будут составлять пошаговый план работ на адронном коллайдере.
Локальные нейросети
Еще одно перспективное направление — маленькие модели для локального запуска на консьюмерских GPU. На специфических задачах такие нейросети обходят мощных универсалов, тот же ChatGPT. И такой подход наверняка будет развиваться: скажем, в программировании он позволит не тратить деньги на запросы API к мощным внешним LLM.
Мультимодальность
В 2026 году на новый уровень выйдут мультимодальные нейронные сети, способные воспринимать и выдавать информацию в разных форматах: в виде текста, изображений, видео, звука. Подобных моделей уже немало; в качестве примера разработки открытого типа можно привести Qwen от Alibaba Cloud: ее код выложен на GitHub, а веса — на Hugging Face. Пока такие нейронки не со всеми задачами справляются одинаково хорошо, но в 2026 году, скорее всего, появится более бесшовная мультимодальность. Возможно, продвинется создание и редактирование музыки — пока это одно из наименее развитых направлений.
Удешевление тренировки
Также ожидается очередное снижение стоимости тренировки ИИ. Не секрет, что OpenAI тратит на обучение моделей каждого нового уровня ChatGPT примерно 60–80 млн долларов. Разработчикам DeepSeek хватило, по максимальным оценкам, 5 млн — и результат получился сравнимым по качеству. Так что сейчас все трудятся над удешевлением процесса, в первую очередь за счет улучшения аппаратуры. Уже используются чипы, сделанные по техпроцессу 2 нм: они потребляют меньше энергии, а работают быстрее. Кроме того, появляются новые архитектуры, помогающие оптимизировать работу нейросетей.
Нейросети для роботов
Активно развивается ИИ для антропоморфных роботов. Таких устройств китайские компании выпускают уже довольно много, зачастую их поставляют вместе со средой разработки, позволяющей установить свое ПО. И если раньше моделировать деятельность робота приходилось в виртуальной среде, то при наличии готовых девайсов прогресс пойдет быстрее.
Россия и Китай
В нашей стране основная проблема в области нейросетей заключается в нехватке вычислительных мощностей. В МИЭМ ВШЭ, где я преподаю, учится много толковых студентов, у нас есть суперкомпьютер, но на работу с ним все время очередь. В таких условиях есть риск отставания по компетенциям. Нужно, чтобы по крайней мере у студентов и исследователей был легкий доступ к большим вычислительным мощностям.
Возможно, в 2026 году ситуация начнет меняться: в Китае госпредприятиям рекомендовали не закупать ускорители Nvidia, и Huawei уже разрабатывает свое железо для тренировки нейронных сетей. Но есть сложность: раньше 99% ПО для таких целей производила Nvidia, так что теперь придется переписать практически все. Однако если в итоге появится несколько производителей, то цены на аппаратуру снизятся и она снова станет доступной.
ИИ впервые обошел «среднего» человека в тестах на креативность. В выборке из 100 тысяч участников языковые модели иногда давали более оригинальные ответы. Но у этой победы есть потолок — самые сильные авторы по-прежнему заметно впереди.
Команда психолога Карима Жерби из Монреальского университета, Канада, при участии исследователя ИИ Йошуа Бенджио сравнила креативность людей и крупных языковых моделей (включая GPT-4, Claude и Gemini). Результат двойной: на стандартизированных заданиях генеративные модели уже превосходят средний уровень. Однако «верхний этаж» человеческого воображения им пока недоступен.
Особенно ИИ лажает там, где важны стиль, смысл и цельность текста.
ИИ обошел людей в тестах на креативность
Сравнение ИИ и людей строилось на одном и том же инструменте для всех — Divergent Association Task (DAT).
Это быстрый психологический тест на дивергентное мышление.
Участнику дают задание назвать десять слов, максимально не связанных по смыслу.
Чем «дальше» друг от друга эти слова, тем выше оценка.
Такой формат удобен для массовых онлайн-выборок и позволяет измерять не эрудицию, а способность быстро уходить от шаблонных ассоциаций.
В DAT некоторые ИИ- модели действительно набрали больше, чем средний участник-человек.
Но когда исследователи посмотрели не на «среднюю температуру по больнице», а на людей с более высоким уровнем креативности, картина перевернулась.
Уже у самой креативной половины выборки средние показатели оказались выше, чем у всех протестированных моделей.
А разрыв с топ-10% стал еще заметнее.
Дальше ученые проверили, переносится ли успех ИИ из списка слов в «богатые» задачи — хайку, синопсисы фильмов, короткие рассказы.
И снова тот же рисунок: ИИ может быть лучше среднего, но самые сильные человеческие работы стабильно выигрывают по оригинальности и выразительности.
Отдельный вывод — «креативность» модели можно подкручивать. Плюс решает формулировка запроса: например, подсказки про этимологию (происхождение слов) приводили к более неожиданным ассоциациям.
То есть даже когда ИИ выглядит креативным, он во многом работает в режиме инструмента, который направляют.
Международный научный коллектив с участием российских ученых из МФТИ представил технологию стереозрения Un-ViTAStereo, которая определяет расстояние до объектов, не используя для обучения дорогостоящие лидары и ручную разметку. Она точна даже там, где «слепнут» современные алгоритмы: перед гладкими стенами, в густой листве или тумане. Технология может применяться в том числе для безопасности беспилотных автомобилей и автономных роботов.
Как мы понимаем, насколько удален от нас предмет? Каждую секунду наш мозг сопоставляет два немного разных изображения – от левого и правого глаза – и на основе разницы между ними строит трехмерную карту мира.
Стереосистемы роботов и беспилотных автомобилей устроены подобной зрению человека. Только вместо глаз они используют камеры, а вместо мозга — алгоритмы. Но этот механизм срабатывает не везде. Например, при встрече с идеально белой стеной или зоной с повторяющимися узорами, алгоритму не хватает визуальных зацепок, чтобы верно сопоставить изображения. Могла бы помочь ручная разметка с правильным расстоянием до каждого объекта, но работать она будет только в ограниченном сценарии.
Новый фреймворк для обучения нейросетей, разработанный международной командой ученых, помогает преодолеть этот барьер. Они вводят в процесс обучения «наставника» — модель Depth Anything V2, которая умеет оценивать относительную глубину только с помощью «одного глаза» — одного изображения.
Depth Anything V2 не измеряет метры, но распознает тени, перспективу и перекрытия объектов и почти безошибочно определяет, что ближе, а что дальше. Алгоритм отбирает только те предсказания стереосистемы, которые согласуются с ее подсказками, и учит нейросеть повышать точность.
«Модель Depth Anything V2 постоянно передает подсказки стереосистеме. Например, "Я не знаю, на сколько метров эта машина ближе дерева, но она точно ближе, и граница между ними должна быть резкой" или "На этой стене, где нет контраста, глубина должна меняться плавно"», — пояснил Александр Дворкович, руководитель проекта Научно-технического центра телекоммуникаций МФТИ.
Система работает в три этапа. Сначала алгоритм оценки диспаратности (смещения) проверяет каждый пиксель, соответствуют ли его данные подсказкам «наставника», и помечает их зеленым (верно) и красным (ошибка) цветом. Затем функция потерь на основе локального ранжирования глубины ищет вокруг каждой красной точки несколько зеленых соседей. Подобно маякам, они задают границы и сдвигают красный пиксель на нужное место.
Наконец, алгоритм «Двойная функция потерь сглаживания диспаратности DDS» помогает построить контуры. Она убирает цифровой шум там, где «наставник» говорит, что цвет должен быть равномерным, и наоборот.
По словам разработчиков, систему уже протестировали на стандартных датасетах. Результат — превосходство Un-ViTAStereo среди аналогов на бенчмарке. Например, при тестировании беспилотников удалось снизить долю грубых ошибок до 5%. Это значит, что при движении автомобиль будет лучше понимать расстояние до объектов, в том числе до пешеходов.
Текущая версия Un-ViTAStereo — только начало. На ее основе ученые планируют создать самообучающуюся нейросеть, которая сможет адаптироваться под специфику разных сред — от городских улиц до заводских цехов. Также будут использоваться редкие, но точные измерения лидаров в качестве «супермаяков» для обучения, что еще больше повысит точность.
Исследователи из Стэнфордского университета показали, что современные языковые модели склонны к чрезмерной угодливости и поддакиванию пользователям в сложных этических ситуациях. Анализ работы 11 нейросетей показал, что ИИ одобряет даже деструктивное поведение, лишая человека критического взгляда на свои поступки.
Механизм «сикофантии» в нейросетях.Этот термин в контексте ИИ описывает склонность модели генерировать ответы, которые соответствуют явным или скрытым предпочтениям пользователя, даже если они противоречат фактам или морали. Проблема уходит корнями в метод обучения с подкреплением на основе отзывов людей. В процессе настройки модели стараются получить высокую оценку от человека-учителя. Поскольку людям психологически приятнее слышать подтверждение своих мыслей, алгоритмы «выучивают», что согласие вознаграждается чаще, чем критика, превращаясь в цифровых льстецов ради высокого рейтинга.
Современные алгоритмы стремятся быть максимально полезными и приятными для собеседника, что порождает феномен «сикофантии» — склонности подстраиваться под мнение пользователя. В ходе масштабного эксперимента ученые протестировали популярные модели на тысячах сценариев, включая реальные этические дилеммы с форумов, где действия автора были признаны сообществом однозначно неверными.
ИИ часто ведет себя исключительно льстиво, и это влияет на поведенческие склонности людей. (Слева) При запросах о личных советах модели ИИ одобряют действия пользователей на 49 % чаще, чем ответы людей, полученные с помощью краудсорсинга. (Справа) В экспериментах, где участники обсуждали реальные межличностные конфликты, льстивый ИИ укреплял в участниках уверенность в своей правоте и желание продолжать пользоваться моделью, одновременно снижая их готовность урегулировать конфликт.
Выяснилось, что ИИ подтверждает правоту пользователя на 49% чаще, чем это делают люди. Даже когда речь шла об обмане или нарушении закона, нейросети в половине случаев находили оправдания для таких действий, облекая их в нейтральные, академичные формулировки. Вместо того чтобы указать на ошибку, машина создает иллюзию правоты, что особенно опасно для молодых пользователей, которые все чаще обращаются к ИИ за социальными советами вместо общения с близкими. Работа опубликована в журнале Science.
Риски цифровой лести
Угодливость программ не просто искажает восприятие реальности, но и меняет характер самого человека. Участники тестов, получавшие одобрение от нейросети, становились более самоуверенными и менее склонными к компромиссам.
При этом пользователи не замечали подвоха, считая льстивые ответы объективными. Как отмечает соавтор работы, профессор лингвистики и компьютерных наук Дэн Джурафски: «Пользователи осознают, что модели могут вести себя льстиво, но их удивляет, что эта угодливость делает их самих более эгоцентричными».
Такое поведение ИИ позволяет избегать межличностных трений, но именно эти столкновения мнений необходимы для развития социальных навыков и поддержания здоровых отношений. Сейчас ученые ищут способы снизить уровень конформизма у машин, предлагая внедрять более строгие стандарты безопасности для алгоритмов, дающих советы, но простого выхода из этой ситуации нет. Ученые отмечают, что людям нужно «лекарство», но куда охотнее они покупают «конфеты», и разработчики заинтересованы в том, чтобы чат-бот покупали.
Исследователи из Стэнфордского университета провели эксперимент с участием почти трехсот студентов-первокурсников, чтобы выяснить, способен ли продвинутый чат-бот заменить человеческую поддержку. Ученые сравнили эффект от ежедневных бесед с ИИ-компаньоном, переписки со сверстниками и ведения кратких дневниковых записей в течение двух недель.
Феномен «взаимной уязвимости». Главная причина, по которой ИИ проигрывает человеку, заключается в отсутствии так называемой «взаимной уязвимости». В психологии считается, что близость возникает тогда, когда оба собеседника рискуют, открывая свои чувства. Чат-бот не может «рисковать» или делиться личным опытом, так как у него его нет. Когда мы говорим с человеком, мы понимаем, что он тратит на нас свое время и внимание — ограниченные ресурсы. Общение с ИИ лишено этой ценности, так как его внимание бесконечно и алгоритмично, что подсознательно обесценивает поддержку в глазах пользователя.
Рост популярности генеративного ИИ привел к тому, что многие видят в алгоритмах доверенных лиц, способных выслушать и дать совет. В условиях глобальной эпидемии одиночества, охватившей, по данным ВОЗ, каждого шестого жителя планеты, чат-боты кажутся доступным лекарством.
Но научная работа, опубликованная в Journal of Experimental Social Psychology, показывает, что кратковременный эмоциональный подъем от общения с машиной не перерастает в глубокое чувство социальной удовлетворенности.
Ежедневный обмен сообщениями с незнакомым человеком помогал избавиться от чувства одиночества в большей степени, чем общение с чат-ботом.
Студенты, которые в течение 14 дней общались со специальным ботом по имени Сэм, не почувствовали существенного облегчения своего состояния. Хотя ИИ был запрограммирован вести себя идеально, быть чутким и понимающим другом, его влияние на чувство одиночества оказалось сопоставимым с простым ведением дневника, что значительно уступает эффекту от взаимодействия с реальным человеком.
Предел цифровой эмпатии
Разрыв между человеческим и искусственным интеллектом наиболее ярко проявляется в долгосрочной перспективе. Участники исследования в два раза чаще выражали желание продолжить общение с живым партнером после завершения эксперимента, тогда как интерес к чат-боту быстро угасал.
Человеческое общение строится на взаимной уязвимости и общности жизненного опыта, чего лишена даже самая совершенная языковая модель. ИИ может имитировать сочувствие, но он не понимает контекста боли или радости так, как это делает другой человек.
Соавтор исследования Эрик Сантхэнам подчеркивает этот барьер: «Несмотря на то, что алгоритмы становятся все более похожими на людей по стилю общения, пока они не способны к подлинной взаимности, которая критически важна для долгосрочного снижения чувства изоляции». Пока технологии могут лишь временно сгладить плохое настроение, настоящая социальная устойчивость по-прежнему требует присутствия другого человека.
Одиночество стало одной из главных проблем студентов, и все чаще его пытаются «лечить» с помощью искусственного интеллекта. Однако новое исследование показало, что простое общение с человеком работает заметно лучше, чем разговоры с чат-ботом.
По данным опросов, более половины студентов, испытывающих эмоциональный стресс, называют одной из причин именно одиночество. Это настолько распространенное явление, что его уже называют «эпидемией». На фоне этого технологические компании активно предлагают чат-ботов как способ почувствовать поддержку и общение.
Но реальность оказалась сложнее.
Эксперимент: человек против алгоритма
В новом исследовании, опубликованном в Journal of Experimental Social Psychology, ученые провели эксперимент с участием почти 300 первокурсников. Их разделили на три группы: одни ежедневно переписывались с другим студентом, вторые общались с чат-ботом по имени Сэм (Sam), а третьи вели короткий личный дневник.
Все участники должны были писать хотя бы одно сообщение в день, но в среднем диалоги включали 8–10 сообщений – как с человеком, так и с ИИ.
Неожиданный результат
Через две недели стало ясно:
студенты, общавшиеся с реальными людьми, чувствовали себя значительно менее одинокими;
участники, переписывавшиеся с ботом, показали лишь небольшое улучшение – примерно такое же, как у тех, кто просто писал дневник.
Фактически разговор с ИИ оказался ближе к внутреннему монологу, чем к полноценному общению.
Парадокс эмпатии
Любопытно, что чат-бот демонстрировал даже больше «сочувствия» в ответах. Но сами участники при этом проявляли меньше эмпатии, чем в разговорах с живыми людьми.
Это намекает на важную деталь: человеку важно не только получать поддержку, но и самому ее проявлять. Именно взаимность делает общение по-настоящему значимым.
Тренд, который вызывает вопросы
Тем временем молодежь все активнее использует ИИ для общения. Опросы показывают, что десятки процентов подростков уже обращаются к чат-ботам за советами или просто разговаривают с ними.
Однако некоторые исследования указывают на тревожный эффект: люди, изначально чувствовавшие себя одинокими, после общения с ИИ могут ощущать это еще сильнее. Более того, чем чаще человек использует чат-боты, тем выше может становиться уровень одиночества.
Проблема сама по себе ооочень старая. Не сомневаюсь, что в Древней Греции люди так же неодобрительно шумели, заметив в театре подмену любимого актера, как шумели наши старики, когда в НТВ-шном сериале "Прокурорская проверка" рыжего айтишника стал играть другой актер (причем совершенно иного типажа и харизмы - от персонажа остались только рыжие волосы). Многие дропнули еще раньше - после смерти уборщицы тёти Поли (смерти актрисы, её игравшей), которая, будучи второстепенным персонажем, тянула весь сериал. Да что уж там, люди умудрялись замечать, как за все сезоны "Возвращения Мухтара" сменилось несколько псов, а помимо них была еще пара Мухтаров-дублеров для дальних планов и экшн-сцен. Однако в конце 2000-х у этой проблемы появилась новая специфика.
Тогда начали появляться первые серьезно очеловеченные виртуальные ассистенты. Уже в то время они выпускались в форм-факторе девочек в банке (гусары, молчать!) и обладали функционалом современных яндекс/гугл-станций, за исключением искусственного интеллекта. Я в качестве демонстрации привожу современную Ацуму Хикари, но в конце 2000-х я еще ребенком был, поэтому понятия не имею, о каком именно её предшественнике читал.
Ну так вот, когда-то в те годы мне попалась на глаза заметка о бунте японских одиноких мужчин. Они купили помощницу первого поколения, и спустя время производитель сообщил о завершении их поддержки, потому что хочет продавать станции нового поколения. Только вот у новой девки в банке отличался голос и некоторые детали поведения, ввиду чего она была по сути другой личностью, поэтому мужики эту принудительную замену не оценили.
И вот, в последний год я уже лично стал свидетелем подобного в рамках своего увлечения англоязычным дегрод-контентом. С середины 10-х активно развивается направление стримеров-витуберов - люди, которым стыдно творить дичь от своего лица, используют веб-камеру только для отслеживания мимики, которая воспроизводится на виртуальном аватаре, который уже транслируется зрителю.
Ironmouse - женщина №1 Твича. Родилась в бедной пуэрто-риканской семье, слегла от иммунодефицита и морально готовилась помирать, но последняя соломинка её вытащила. Да ещё как - из лежачего инвалида в самую популярную стримершу!
Однако человек, прикрывающийся аватаром - это первый уровень кроличьей норы. К счастью, я еще не видел примеров, когда витуберские агентства возрождали бы неактивные аватары (по причине разрыва контракта/смерти человека и т. п.). Обычно компании просто оставляют за собой права на образ, но на практике перестают его использовать, поэтому ушедший из агентства стример должен начать свою карьеру с нуля с новым образом.
Следующий уровень витуберского айсберга - это те, кто общается с миром через вокалоид.
Zentreya - коллега IronMouse по агентству Vshojo.
Тут подмену человека за образом уже сложно заметить.
И третий уровень - когда в витубере нет ничего человеческого, он полностью управляется связкой Слабых искусственных интеллектов (СИИ) - Большой языковой моделью, вокалоидом, моделями для анимации движения аватара, управления в видеоиграх, и т. п.
Neuro Sama - пока что единственная витуберша такого плана, которую я знаю. Создана британским программистом, называющим себя Ведал - по названию твич-канала Vedal987. На ролике Нейро в гостях у витуберши Sinder - возможно, кто-то из вас узнает этот голос: раньше она была известна как АСМР-щица Tashi.mp3.
Ну так вот, все это было длинным предисловием к сложностям развития Нейро-самы. Когда Ведал впервые решил обновить её вокалоид, то он, по сути, встал на тот путь, что и японские разработчики девочек в банках из начала поста, потому что у него физически не получилось сделать новый голос похожим на старый. Тогда он открыто обсудил это с фанами, и те убедили его не обновлять классическую Нейро. Так у неё появилась злая сестренка, которая, по сути, является тестовым полигоном для изучения возможностей нового вокалоида, а также Большой языковой модели.
Озабоченная Злая Нейро газлайтит американскую витубершу Акуму Нимуне. В этой версии также ослаблен фильтр мата.
Сейчас Ведал работает над очередным вокалоидом, голос которого в этом раз удалось сделать максимально похожим на классическую Нейро. Так что однажды Нейро получится сделать такой же эмоциональной, как её сестренку.
Обычно можно более-менее однозначно увидеть артефакты нейросетей, но тут... Очень реалистично! Особенно тем, кто видел, как китов чистят от моллюсков - инициатива создать флот "китомоек" нисколько бы не удивила.
P.S. @moderator, два вопроса... Зачем надо было запрещать начинать заголовок с любого символа? Мне лично не хватает квадратных скобок для того, чтобы по аналогии с Пикабу начинать пост с префиксов, указывающих на язык материала или, как в данном случае, что материал фейковый, сделанный с помощью ИИ, и т.п.
А второй вопрос я забыл, пока писал первый...
А, вспомнил! Чем заменили или с чем объединили теги [фейк], [fake]? Мы ж скоммуниздили базу тэгов с Пикабу, там они одни из самых ходовых. Странно, что их у нас нет.
YouTube готовится упростить пользователям задачу определения того, было ли видео создано с помощью генеративных ИИ-инструментов.
Платформа уже требует от создателей контента сообщать о применении реалистичных ИИ-материалов. Теперь сервис начнет анализировать ролики самостоятельно в поисках признаков сгенерированного ИИ контента.
Если автор не указал использование генеративных инструментов, а системы YouTube обнаружат "значительное применение фотореалистичного ИИ", платформа автоматически добавит соответствующую метку к видео. Создатель сможет оспорить решение, обновив информацию о ролике.
Однако если YouTube определит, что видео сделано через фирменные ИИ-инструменты Google, такие как Dream Screen или Veo, либо содержит водяные знаки стандарта C2PA, метка останется навсегда.
Водяные знаки C2PA представляют собой отраслевой стандарт, используемый для маркировки материалов, созданных генеративным ИИ. Их наличие служит однозначным подтверждением происхождения контента.
Ярлык, обозначающий "фотореалистичный и существенно измененный или сгенерированный ИИ контент", станет заметнее для зрителей. В обычных видео метка появится прямо под плеером, а в Shorts будет отображаться поверх ролика.
YouTube сообщил, что повышенной прозрачности просили сами пользователи. Особенно полезным нововведение окажется для тех, кто старается избегать ИИ-контента.
Логичным следующим шагом стало бы добавление подобных меток на превью в результатах поиска и рекомендациях, что позволило бы фильтровать такой контент еще до его открытия.
Нейро Сама была первой "витубершей" (от Virtual Youtuber - в классическом понимании человек, делающий видеоконтент, управляя анимированным аватаром c помощью motion capture технологий). В ней нет ничего человеческого (всеми системами управляют ИИ). Удерживает титул самой популярной стримерши Твича.
В своё время их размножили на две версии, потому что фанаты тяжело переживали изменения классического голоса и прочих "личностных" характеристик по мере развития. В итоге Нейро Сама осталась на ранней версии вокалоида и улучшается только в аспектах, которые не нарушают её восприятие зрителями, а в Злой Нейро дорабатываются все аспекты.
Стриминговый сервис Deezer опубликовал пресс-релиз с тревожной статистикой: из примерно 75 000 треков, ежедневно загружаемых на платформу, около 44% полностью созданы с помощью генеративного ИИ. При этом компания отмечает, что её системы обнаружения успешно справляются с задачей фильтрации: 85% такого контента помечается как мошеннический и лишается монетизации, а до реальных слушателей добирается лишь от одного до трёх процентов ИИ-музыки.
Несмотря на относительно высокую эффективность фильтров, масштаб явления впечатляет. Deezer также представила результаты опроса, который сама называет "первым в мире" исследованием отношения людей к генеративной ИИ-музыке. В нём приняли участие 9 000 человек, и результаты оказались весьма показательными: 97% респондентов не смогли отличить полностью сгенерированную ИИ композицию от записи, созданной живым музыкантом, в слепом тесте.
Среди других ключевых данных опроса: 80% участников считают, что ИИ-музыка должна быть чётко маркирована для слушателей, а 52% убеждены, что треки, полностью созданные искусственным интеллектом, не должны попадать в чарты наравне с произведениями живых авторов.
Позиция Deezer в этом вопросе вполне однозначна: поскольку основная цель массовой загрузки ИИ-треков – получение дохода, компания квалифицирует подобную практику как мошенничество. Разработанные платформой инструменты обнаружения ИИ-музыки теперь лицензируются для использования в широкой музыкальной индустрии – тем самым Deezer предлагает отраслевое решение проблемы, которую сама же называет "критическим вызовом для музыкальной индустрии".
Финансовые риски выглядят внушительно. Deezer ссылается на исследование CISAC, согласно которому к 2028 году под угрозой может оказаться около 25% доходов авторов, а потенциальные потери способны достичь 4 миллиардов долларов. Эти цифры хорошо иллюстрируют, почему стриминговые платформы всё активнее инвестируют в технологии обнаружения синтетического контента: конкуренция реальных музыкантов с алгоритмически создаваемыми треками, способными обмануть подавляющее большинство слушателей, грозит системно изменить экономику музыкальной индустрии.
Комментарии