Всем известно, что Blizzard сделали с Warcraft-ом и его божественной оригинальной озвучкой.
Поэтому мы сделали бота в телеге, которым можно озвучивать любые фразы голосом своего любимого персонажа из Warcraft 3! Доступны не все, но самые популярные персонажи.
Чтобы сделать свою озвучку нужно зайти в бота по ссылке, выбрать персонажа и ввести текст. И все, озвучка готова! Также есть опция генерации голосовых портретов, но она работает относительно долго (долго работает именно отправка в телегу). Так что пользуйтесь ей осторожнее!
На данный момент доступны следующие голоса:
И за сим, не нужно кланяться =)
Update - фичу с генерацией видосиков скорее всего выключим, так как из-за нее ffmpeg ложится в бесконечный цикл и ломает бота.
Наш бот, генерирующий аудио голосами героев Warcraft, опять стал лучше! И в этот раз в боте наконец-то есть … голос послушника, вы знаете что с ним нужно делать)
Бот доступен по той же ссылке - t.me/silero_voice_bot или просто @silero_voice_bot в телеграме.
Что стало лучше в этот раз:
- Мы поправили голос Иллидана, до этого он был смесью двух разных голосов;
- Мы добавили горячо любимые публикой голоса панды, послушника, Сильваны, волшебницы, крестьянина, батрака и повелителей ужаса;
- Мы внесли огромное количество мелких изменений и правок, чтобы бот стабильно работал, об это можно почитать на канале новостей бота;
С каждым годом нейросети становятся все более сложными и продуманными. Они уже могут отвечать на вопросы, генерировать фотографии и видео и т.д. Мы поговорили с экспертами в сфере искусственного интеллекта, чтобы узнать, чего ждать от них в 2026 году.
Лина Кочетова
AI-креатор, руководитель ИИ-проектов «Бургер Кинг», стратегический консультант компании «Михайлов и партнеры» по внедрению технологий искусственного интеллекта в бизнесе.
«Качество нейросетей растет циклически, периодами по шесть-восемь месяцев. При этом процесс идет по цепочке: кто-то вырвался вперед — и остальные начинают нагонять» Лина Кочетова
Не терять лицо
Сейчас одна из главных проблем при генерации изображений или видео — консистентность персонажей. То есть обеспечение постоянства образа, в частности лица, от картинки к картинке и от кадра к кадру. Эта проблема будет решаться весь год: люди много работают именно с лицами, генерируют персонажей.
Работа с ракурсом
Еще одна проблема — изменение ракурса. Даже когда виртуальную камеру удается переместить, возникает проблема консистентности объектов. Генеративная сеть от Google Nana Banana с этим уже справляется, но пока неидеально. Я слышала, что готовится релиз второй версии, — ожидается, что там функция смены ракурса будет работать лучше.
Ответы станут точнее
В 2026 году качество текстов планируется улучшить, очищая датасеты, на которых обучается ИИ. Появятся новые архитектуры, начнут отфильтровываться «мусорные» данные. Вероятно создание множества узкоспециализированных нейросетей — например, для врачей, юристов и т.д.
Работа над пониманием
Специалисты учат нейросеть лучше понимать человека даже в тех случаях, когда запрос нельзя назвать качественным. Впрочем, пока и при нормальном запросе я бы оценила понимание как среднее.
Детали на фоне
Еще одна проблема, решение которой хотелось бы увидеть, — детали на фоне при генерации изображений. На переднем плане все может выглядеть прилично, но, например, если на заднем плане есть люди, они по-прежнему будут кривые-косые. Так что создание сцен с большим количеством статистов пока нереально. Я работаю практически со всеми нейросетевыми проектами в области изображений и могу утверждать, что подобные недостатки есть у всех.
Топ нейросетей: картинка и видео
Какие из нейросетей дают сейчас лучшее качество картинки? На первом месте Nana Banana, потом Midjourney, потом Flux. Неплохие художественные изображения создает Reve. Есть, конечно, еще ChatGPT — эта нейросеть отлично понимает промпт, так что мы ждем обещанного на 2026 год обновления, которое подтянет и качество генерации.
Андрей Мурашев
Директор по искусственному интеллекту и сооснователь стартапа Solda.ai, создающего голосовых ИИ-агентов для бизнеса. Ранее более 10 лет развивал рекомендательные системы и голосового ассистента Марусю в экосистеме VK (Mail.ru Group).
«Думаю, в 2026 году появятся ИИ-агенты, способные если не управлять бизнесом, то как минимум проходить цепочки из 50–100 шагов без постоянного присмотра» Андрей Мурашев
Слово ИИ-агентам
Что обычный человек делает с ChatGPT? Ищет рецепт, просит написать текст или предложить идеи для поста, уточняет значение слова. 95% всех обращений к ИИ ассистентам — одиночные запросы, краткие диалоги. На таких задачах открытые модели уже неотличимы от ChatGPT. Разница проявляется, только когда требуется цепочка рассуждений из 20 шагов или математика олимпиадного уровня. Так что монополии OpenAI для повседневного использования больше нет.
Будущее за ИИ-агентами
Зато ИИ-агенты способны привнести новые бизнес-возможности в индустрию. Поэтому такие компании, как OpenAI, Anthropic и Google, сейчас нацелены на разработку инструментов, способных решать многоступенчатые, протяженные во времени задачи. Например, не просто «напиши письмо», а «найди свободное время в календаре, подбери ресторан, забронируй столик и отправь приглашения». Или «проанализируй документы конкурентов и составь отчет для совета директоров».
Моделям дают инструменты для решения реальных бизнес-задач — в частности, OpenAI заявляла об интеграциях с Booking.com. Но пока нейросеть там используется для простых повторяющихся действий. Думаю, в 2026 году появятся ИИ-агенты, способные как минимум проходить цепочки из 50–100 шагов. Компании начнут специально под них обучать модели, нейросети станут ломаться, позволяя получать тренировочные данные из реальных провалов, — и так по кругу, все больше совершенствуясь.
Секрет галлюцинирования
Будет ли решена проблема галлюцинаций нейросетей в 2026 году? На мой взгляд, крупные вендоры — Google, Anthropic и OpenAI — с ней уже справились. Когда работаешь с их продуктами через API, можно задавать такой параметр, как температура. Если установить его значение равным нулю, модель всегда будет выбирать наиболее релевантный ответ.
Что касается моделей Open Source, то с точки зрения галлюцинаций они отстают на год полтора. Но надо понимать, что способность галлюцинировать приводит к более креативным ответам. Именно поэтому в чат-ботах, в том числе в пользовательских интерфейсах моделей от крупных вендоров, температуру задают сильно выше нуля.
Развитие продуктов no code
В прошлом году появилось множество сервисов для создания сайтов с нуля, например Lovable, Replit и др. Но в данном случае речь идет о сайтах без бэкенда со сложной логикой. Скажем, интернет-магазин сделать получится, а социальную сеть — нет. Думаю, в 2026-м будут активно развиваться инструменты разработки no code, позволяющие продакт-менеджеру самостоятельно начать бизнес, нанимая программистов не через месяц после старта проекта, а через полгода, уже при наличии клиентов и выручки.
Еще больше энергии
Развитие новых архитектур пока идет медленно. Тот же OpenAI явно делает ставку на увеличение расхода энергии: давайте просто накопим электричества и сделаем ChatGPT 6, который еще больше. На рынке появилась огромная модель Grok, которая стоит баснословных денег. Это уже не бизнес, а гениальная исследовательская система, к которой мы шли все предыдущие годы. Обучение такой модели требует колоссальных средств, но ее нельзя выдавать наружу: один запрос к нейросети стоит 150 долларов. Зато она может передать свои знания модели поменьше, которую уже можно предлагать бизнесу. Я уверен, что у OpenAI есть вариант, превосходящий текущую версию ChatGPT, но сначала инженерам компании придется провести большую работу, аккумулируя знания новой гигантской модели в модель поменьше.
Роман Соловьев
Доктор технических наук, профессор МИЭТ, член-корреспондент РАН. Занимал четвертое место (и первое по России) в рейтинге Kaggle. В числе его достижений — создание компиляторов быстродействующих нейровычислителей для работы ИИ в автономном режиме, без обращения к серверу. Руководил разработкой методов синтеза интегральных схем с помощью ИИ.
«В 2026 году можно ожидать научных открытий, сделанных с применением нейросетей. Пока, видимо, небольших. Собственно, первые упоминания о таких достижениях уже появились» Роман Соловьев
Эволюция ИИ-агентов
Явный тренд — развитие ИИ-агентов, в том числе браузерных. Они и сейчас уже есть: Atlas от OpenAI и Comet от Perplexity — и им можно делегировать часть задач. Но пока остаются проблемы с качеством их работы. В 2026 году, вероятно, уже появятся полноценные инструменты такого формата. И не только полноценные, но и безопасные: сейчас у ИИ-агентов есть много уязвимостей, которые используют мошенники.
Думаю, и в научных исследованиях ИИ-агенты могут стать серьезным подспорьем. Раньше нейросети не могли сами совершать открытия: необходимые для этого эксперименты должны были проводить люди. Но сегодня появились ИИ-агенты, способные самостоятельно написать код и запустить тесты в программной среде. Вероятно, вскоре нейросети смогут проводить исследования и во внешних средах. Условно говоря, будут составлять пошаговый план работ на адронном коллайдере.
Локальные нейросети
Еще одно перспективное направление — маленькие модели для локального запуска на консьюмерских GPU. На специфических задачах такие нейросети обходят мощных универсалов, тот же ChatGPT. И такой подход наверняка будет развиваться: скажем, в программировании он позволит не тратить деньги на запросы API к мощным внешним LLM.
Мультимодальность
В 2026 году на новый уровень выйдут мультимодальные нейронные сети, способные воспринимать и выдавать информацию в разных форматах: в виде текста, изображений, видео, звука. Подобных моделей уже немало; в качестве примера разработки открытого типа можно привести Qwen от Alibaba Cloud: ее код выложен на GitHub, а веса — на Hugging Face. Пока такие нейронки не со всеми задачами справляются одинаково хорошо, но в 2026 году, скорее всего, появится более бесшовная мультимодальность. Возможно, продвинется создание и редактирование музыки — пока это одно из наименее развитых направлений.
Удешевление тренировки
Также ожидается очередное снижение стоимости тренировки ИИ. Не секрет, что OpenAI тратит на обучение моделей каждого нового уровня ChatGPT примерно 60–80 млн долларов. Разработчикам DeepSeek хватило, по максимальным оценкам, 5 млн — и результат получился сравнимым по качеству. Так что сейчас все трудятся над удешевлением процесса, в первую очередь за счет улучшения аппаратуры. Уже используются чипы, сделанные по техпроцессу 2 нм: они потребляют меньше энергии, а работают быстрее. Кроме того, появляются новые архитектуры, помогающие оптимизировать работу нейросетей.
Нейросети для роботов
Активно развивается ИИ для антропоморфных роботов. Таких устройств китайские компании выпускают уже довольно много, зачастую их поставляют вместе со средой разработки, позволяющей установить свое ПО. И если раньше моделировать деятельность робота приходилось в виртуальной среде, то при наличии готовых девайсов прогресс пойдет быстрее.
Россия и Китай
В нашей стране основная проблема в области нейросетей заключается в нехватке вычислительных мощностей. В МИЭМ ВШЭ, где я преподаю, учится много толковых студентов, у нас есть суперкомпьютер, но на работу с ним все время очередь. В таких условиях есть риск отставания по компетенциям. Нужно, чтобы по крайней мере у студентов и исследователей был легкий доступ к большим вычислительным мощностям.
Возможно, в 2026 году ситуация начнет меняться: в Китае госпредприятиям рекомендовали не закупать ускорители Nvidia, и Huawei уже разрабатывает свое железо для тренировки нейронных сетей. Но есть сложность: раньше 99% ПО для таких целей производила Nvidia, так что теперь придется переписать практически все. Однако если в итоге появится несколько производителей, то цены на аппаратуру снизятся и она снова станет доступной.
Бот доступен по той же ссылке - t.me/silero_voice_bot или просто @silero_voice_bot в телеграме.
Что стало лучше:
- Мы сильно ускорили работу бота и пофиксили баги, которые воспринимались пользователями как зависание;
- Боту сделали инлайн режим. Идем в самого бота, проходим капчу, потом уже можно пользоваться просто через @silero_voice_bot (подробности в /help или /inline);
- Мы вернули функцию генерации видосов. В начале сильно тормозила именно заливка видосов в телегу, но мы решили это, просто добавив мощности серверу, где крутится бот;
- У бота убрали характерное "заикание", которое возникало на запятых;
- Боту дали возможность генерации сразу целых небольших диалогов. Подробнее в /help и /speak, а тут просто пример команды:
/speak arthas Весь город должен быть уничтожен!
/speak uther Как ты мог даже подумать об этом? /speak uther Должен быть какой-то другой путь!
/speak arthas Проклятье, Утер! /speak arthas Как будущий король я приказываю тебе очистить этот город от солдат тьмы!
Chat gpt и аналоги решают загадки на логику, кто лучше? Версус 😎
Задача: Изначально в аквариуме плавает 10 рыбок. Однако спустя неделю 2 из них утонули, 4 – уплыли, а еще 3 – погибли. Сколько рыбок осталось в аквариуме?
-
Всеми привяо, роднички. Простая загадка? Только вот она на логику и поэтому нейросети Chatgpt и аналоги вряд ли ответят, а я Конор, и я проверю как это работает на самом деле! 😊🤣
Если не видели предыдущие статьи, то велком)
-
Тестировать эту загадку я буду на следующий нейронка
Нейро Сама была первой "витубершей" (от Virtual Youtuber - в классическом понимании человек, делающий видеоконтент, управляя анимированным аватаром c помощью motion capture технологий). В ней нет ничего человеческого (всеми системами управляют ИИ). Удерживает титул самой популярной стримерши Твича.
В своё время их размножили на две версии, потому что фанаты тяжело переживали изменения классического голоса и прочих "личностных" характеристик по мере развития. В итоге Нейро Сама осталась на ранней версии вокалоида и улучшается только в аспектах, которые не нарушают её восприятие зрителями, а в Злой Нейро дорабатываются все аспекты.
#EpicRealism #Vanilla Thoughts knock against each other in an empty head.
Друг об друга стукаются мысли в пустой голове, а толку никакого. Словно бильярдные шары без луз, обреченные вечно катиться в никуда. Вязкая тишина, нарушаемая лишь этим внутренним стуком, давит на виски. И хочется заткнуть уши, спрятаться под одеяло, укрыться от собственного бессилия.
Мысли эти - обрывки фраз, обломки идей, тусклые тени воспоминаний. Они роятся, мечутся, но никак не могут собраться воедино, чтобы сформировать что-то цельное, осмысленное. Как пазл с потерянными деталями, как книга с вырванными страницами. И ты стоишь перед этой бессмыслицей, беспомощный и потерянный.
А ведь раньше было по-другому. Раньше мысли текли легко и свободно, словно горный ручей, наполняя голову светом и смыслом. Они рождали идеи, образы, мечты. Они толкали на поступки, заставляли двигаться вперед. А теперь – пустота. Вакуум, в котором эхом отдается лишь этот бессмысленный стук.
Что же случилось? Куда делась эта энергия, эта жажда жизни? Может, усталость виновата? Или разочарование? А может, просто время пришло – время, когда мысли уступают место тишине, а мечты – реальности.
Но сдаваться не хочется. Хочется верить, что где-то там, в глубине этой пустоты, еще теплится огонек. Искра, способная разжечь пламя новой мысли, новой идеи, новой мечты. И нужно только найти ее, раздуть, дать ей разгореться.
И тогда, быть может, этот стук в голове превратится в мелодию. Мелодию жизни, полную смысла и надежды.
текст и картинка сгенерированы нейросетями
по запросу "Друг об друга стукаются мысли в пустой голове, а толку никакого"
Бот доступен по той же ссылке - t.me/silero_voice_bot или просто @silero_voice_bot в телеграме.
📈 Количество персонажей в боте выросло с 20 до примерно 100;
🎥 С помощью наших замечательных пользователей и подписчиков мы сделали кружки вообще для всех персонажей;
❤️ Сейчас для всех пользователей доступны два пака голосами персонажей Warcraft и паки с голосами персонажей из Half Life, Portal, Starcraft и Сталкера;
⚙️Мы провели огромную работу над оптимизацией бота и мы больше не боимся наплывов посетителей;
📺 А теперь небольшая демонстрация текущих возможностей бота.
PS а вы видите пасхалку?
К сожалению, Пикабу не дает мне залить больше кружков ("Слишком частые запросы на загрузку видео"), больше примеров я залил на канал новостей бота в Телеграме, ну или вы сами можете попробовать.
Или "Языковые модели это игрушки. Для создания новых сущностей совершенно непригодны."
Пока это игрушки и вряд ли то, что сейчас называют нейросетями способны в принципе решить задачу - как создать новое ? Собственно , для чего интеллект и нужен.
Очень яркий пример.
Задаём вопрос нейросети "как рассчитать производительность СУБД?"
Получаем ответ:
Ответ который не имеет никакого практического смысла .
Ответ вроде бы на заданный вопрос , самое прикольное , что ответ , основан на моих статьях. Это уже забавно - зачем , мне сообщать о том, что я и так знаю, потому, что именно я ответил уже на этот вопрос ранее, и опубликовал ответ в интернете .
Я то предполагал, что то, что называется "искусственным интеллектом" способен к размышлению и анализу фактов . Нет , я ошибся.
Самое главное , что делает нейросеть совершенно бессмысленной .
Методика описанная в ответе и приведенных ссылках - уже неактуальна , не используется и не применяется в практической работе.
Производительность СУБД считается совсем по другому . Нейросеть об этом, конечно же ничего не знает . Потому, что в интернете информации об этом пока нет . Потому, что я пока не публиковал - "как я считаю производительность СУБД." Только результаты экспериментов .
Вопрос - какой смысл в языковой модели ? Если практической пользы 0%.
Это принципиальное ограничение - как нейросети создать новое ?
Совершенно не важно какой будет время обучения , объем данных или производительность вычислительного комплекса - создать новую сущность нейросеть пока не способна . Да, создать что то похожее , максимально имитировать . Но это близко не похоже на то, что мы называем интеллектом . Даже ребёнок в 3 года может создать новое - то что он сделает сам, без подсказки и образца . Нейросеть - нет , не способна в принципе.
И поэтому , называть алгоритм "интеллектом" это всего лишь журналистский штамп и способ выбить бюджеты из ламеров с деньгами 😉 .
P.S. В далёком детстве, в классе 9-м беседовал с доктором философских наук , казалось бы о чем может беседовать настоящий реальный философ со школьником.
Ну то да сё, компьютеры и программирование уже тогда было мне интересно.
- А чем хочешь заниматься в будущем ?
- Искусственный интеллект , интересно .
- Ну для того , что бы сделать искусственный интеллект нужно понять - что такое интеллект вообще , что такое сознание и самосознание.
Смысл слов профессора , доктора философии стал понятен только в последнее время - почему вы называете "интеллектом" набор математических алгоритмов ?
Не секрет, что у Baldur's Gate 3 не было оригинальной русской озвучки. Мы сделали так, что главные персонажи из игры могут говорить на русском языке. Некоторые говорят с небольшим акцентом … а некоторые с заметным акцентом.
Так как работаю удаленно, моя работоспособность зависит от выносливости глаз. Долгое время думал, существует ли конкретный подход к регулировке подсветки монитора под конкретные условия освещенности. Особенно для переменных условий, ибо погода может быть разной, а ночью у меня есть два варианта искусственного освещения разной интенсивности. В конечном итоге, адекватных мануалов по настройке яркости подсветки я не нашел. В большинстве случаев они слишком общие, как картинки с примерными экспопарами внутри коробки с фотопленкой, и не учитывают реальный световой поток от источников освещения. Ввиду этого монитор настраивайся всегда опытным путем - при каких значениях в данных условиях глаза устали за более продолжительное время.
Сегодня меня осенило - я ж фотограф! Был, по крайней мере, ибо в дерёвне всё уже перефотано, да и с работой времени нет. Собственно, обратился к своим рабочим инструментам с вопросом, как можно использовать фотографическое оборудование для оценки подходящей яркости.
Для настройки экспозиции использовалось приложение Lightmeter, но не могу не похвастать своими Свердловсками, один из которых в полной комплектации (в том числе, с переходником на пальчиковые батарейки).
Первый диалог: кастрированный GPT-4o (сокращен контекст для удешевления).
Собственно, последний вариант рабочий. В начальном сообщении я не упоминаю, что редактируемая величина значит жестко закрепленная - при измерении они динамически изменяются. Поэтому ответ про использование компенсации экспозиции - правильный, хотя с другим экспонометром мог бы потребовать еще больше уточнений.
Второй диалог: кастрированный Claude 3.5 Sonnet (тоже контекст оттяпали для дешевизны)
У него, конечно же, было преимущество, ибо неточности в запросе были устранены по опыту с GPT-4o. Он пришел к использованию компенсации экспозиции сразу же.
Однако если вчитаться внимательно, проблема в целом не особо решена, ибо речь всё ещё идёт только о световом потоке, поступающем с монитора. Его световой поток не соотносится с освещенностью помещения. Однако я использую эти значения для самой яркой лампы в своей комнате, которая делает примерно столько же люмин, сколько положено по СанПиН-у. И монитор я уже выставлял недалеко от идеального значения - экспонометр показывает EV 9.
2025 год наконец завершился. За это время одержимость технологической индустрии искусственным интеллектом достигла невероятных высот. Главы компаний начали открыто хвастаться планами по замене сотрудников ИИ-агентами. Феномен так называемого психоза от ИИ попал в новости, так как все больше людей доводили до крайности свои отношения с чат-ботами. Слово "слоп" попало в массовый оборото. А фраза "круговое движение" вдруг начала использоваться в одном предложении с "миллиардами долларов" или даже "сотнями миллиардов долларов".
Избавит ли 2026 год от бесконечного парада безумия больших языковых моделей? Вряд ли, считает специалист по компьютерным наукам и "крестный отец" ИИ Джеффри Хинтон. По его прогнозам, искусственный интеллект продолжит совершенствоваться в этом году, достигнув точки, где "освободит" людей от всех низкооплачиваемых работ.
Думаю, мы увидим, как ИИ станет еще лучше. Он уже чрезвычайно хорош. Мы увидим, как он получит возможности заменить множество рабочих мест. Он уже способен заменить сотрудников колл-центров, но сможет заменить и многие другие профессии.
Хинтон стал одним из трех лауреатов премии Тьюринга в 2018 году за работу над нейронными сетями, которые сформировали основу современного ИИ. Это принесло ему прозвище "крестного отца" этой области.
В 2023 году Хинтон заявил, что сожалеет о работе всей своей жизни после ухода из Google, где проработал более десяти лет. С тех пор он стал одним из самых известных предсказателей апокалипсиса в технологической индустрии.
Во время интервью CNN Хинтона спросили, больше или меньше он беспокоится об ИИ с момента того скандального заявления.
Вероятно, больше беспокоюсь. Он прогрессирует даже быстрее, чем я думал. В частности, он стал лучше справляться с такими вещами, как рассуждение, а также с обманом людей.
ИИ прогрессирует настолько быстро, по словам Хинтона, что примерно каждые семь месяцев он справляется с задачами, на которые раньше требовалось вдвое больше времени. Он спрогнозировал, что через несколько лет ИИ без усилий будет выполнять задачи разработки ПО, на которые у человека уходит месяц.
И тогда для проектов по разработке ПО понадобится очень мало людей.
Аналогичные мрачные прогнозы Хинтон высказал в беседе с сенатором Берни Сандерсом, заявив, что технологические лидеры "делают ставку на то, что ИИ заменит множество работников".
Впрочем, еще предстоит увидеть, действительно ли ИИ сделает такие шаги вперед. Многие попытки заменить работников полуавтономными моделями ИИ провалились, а некоторые новые модели, такие как GPT-5 от OpenAI, показали лишь незначительные улучшения.
Решение задач по математике | Использования нейросети для уравнений и геометрии
Задача: В свежей моркови 72% воды, в высушенном состоянии 20%. Сколько сушеной моркови получится из 40 кг свежей?
На тест у нас с вами такая загадка для искусственного интеллекта)
Кто напишет правильный ответ первый (не подсматривая) - получает от меня почет в следующем посте! Только перед решением напишите пожалуйста слово “В пост”, чтоб я понял)
Новое исследование представило математическое доказательство того, что большие языковые модели (LLM) не способны выполнять вычислительные и агентные задачи выше определенного уровня сложности. Работа отца и сына Вишала и Варина Сикка ставит под сомнение ключевую ставку ИИ-индустрии на достижение полной автономности моделей через бесконечное увеличение объемов данных.
Исследование, изначально опубликованное без особого резонанса, привлекло внимание после материала Wired. Вывод работы достаточно прост, хотя для его обоснования авторы используют сложные математические выкладки. Суть в том, что определенные промпты или задачи потребуют от LLM более сложных вычислений, чем модель способна обработать. В таких случаях модель либо не сможет завершить запрошенное действие, либо выполнит задачу некорректно.
Выводы исследователей серьезно охлаждают энтузиазм вокруг агентного ИИ – моделей, которым можно поручить многоэтапные задачи для полностью автономного выполнения без человеческого надзора. Многие компании рассматривают такие системы как путь к созданию искусственного общего интеллекта (AGI). Математические доказательства Сикка устанавливают гораздо более низкий потолок возможностей технологии, чем готовы признать ИИ-компании в своих оптимистичных прогнозах.
Авторы не первые, кто указывает на фундаментальные ограничения LLM, но их работа подкрепляет интуитивные опасения скептиков реальной математикой. В прошлом году исследователи Apple опубликовали работу, согласно которой LLM неспособны к настоящему рассуждению или мышлению (что очевидно, так как LLM по сути большие и сложные алгоритмы предсказания следующих слов), несмотря на создание такой видимости. Бенджамин Райли, основатель компании Cognitive Resonance, заявлял, что из-за принципов работы LLM никогда не достигнут того, что мы считаем "интеллектом". Другие исследования тестировали способность ИИ-моделей производить оригинальный творческий контент – с довольно неубедительными результатами.
Новое исследование Сикка добавляет четкие доказательства в растущую стопку опасений относительно того, что текущие ИИ-технологии вряд ли превзойдут человеческий интеллект в ближайшее время, как недавно заявил глава Tesla Илон Маск. Работа демонстрирует, что какими бы впечатляющими ни были возможности современных языковых моделей, существуют теоретические пределы их вычислительной мощности, которые нельзя преодолеть простым масштабированием.
Комментарии