Продолжаем обучение что начали в этом посте https://vombat.su/post/19956-uchimsya-pet-kak-padonagh-ili-pesn-vombata
Погнали. Сегодня у нас новая ( а может и не новая) нейронка Udio.com
Заходим на сайт, в правом верхнем углу жмём Sign in чтобы залогиниться/зарегаться.
В верхней части окна жмём на поле ввода текста
сюда
Вылезает такая шняга:
в поле 1 пишем что хотим получить. Например цыганский романс или колыбельную, или тыкаем предложенные снизу тэги. Кнопка 2 переключает авто и ручной режим. Авто - генерит по запросу как есть, ручной - вычленяет жанр из запроса. В чём разница - хз, по-моему это одно и то же.
Дальше жмём Custom поскольку мы хотим ввести свои стихи для шедевра в поле 4. Кстати удио банит ваши песни если вы используете чужие стихи, у меня только одну песню удалось пропихнуть без moderation error, но можно его обмануть. Так же есть instrumental - для музыки без слов и auto-generated - чтобы и музыка и слова писались сами, но язык у меня почемуто был на звук испанский.
далее жмём 5 - Create и ждём.
чуть ниже появятся 2 отрезка по 30 сек. Или если вы недождались то позже можно будет зайти в раздел My Creations и они появятся там.
у меня то ли браузер глючит то ли где
Слушаем кусочки, если вам не нравится что получилось, то повторяем всё заново. Отрезки генерятся странно, могут с конца песни, могут с середины. Если что-то понравилось и вы хотите добавить фрагмент из 30 секунд до или после прослушанного, то справа жмём extend.
И имеем следующее:
уже знакомо
тут добавляются 4 кнопки.
1- добавить вступление
2- добавить предшествующий фрагмент
3- добавить фрагмент после
4- добавить заключение (хз как правильно)
Если нужно вступление или завершение, то советую включить instumental. Так как текст генерится как какая-то каша. Ну а если мы делаем со своим текстом, то надо ввести именну ту часть которую вы хотите слышать в вашем фрагменте а не полный текст песни.
Повторяя эти шаги много раз - можно получить неплохую песенку на 2-3 минуты.
как появилось что-то стоящее- жмём на название песни (где у меня кракозябры)
Жмём EDIT
Теперь мы можем:
1 -переименовать
2-сгенерить обложку
3- скачать аудио/видео
4-завершить редактирование
А если нажмете паблиш - то трек будет в открытом доступе, и кто-то сможет его послушать. Ну а теперь расширенная версия песни вомбата от Udio.com
Про говно в генерации обложки не упоминал, видимо удио так оценило мой трек
Для первого случая нам понадобится вот этот сайт https://aimusicstudio.oneplus.com/
о нём кстати я узнал на Вомбате вот из этого поста https://vombat.su/post/14945-oneplus-zapustila-besplatnuyu-neiroset-dlya-sozdaniya-muziki-i-pesen
переходим на сайт, жмём кнопку
Далее предлагают залогиниться. Специально для вас создал учётку.
логин - alexios.yichen@meshfor.com
пароль - alexios.yichen@meshfor.com1
Потом выбираем например такие настройки и жмём PROCEED
Далее нам нужно написать о чём будет наша песня и нажать GENERATE. К сожалению чтобы у нас получилась песня - писать надо на английском, и песня будет на английском (какое совпадение). Да и текст песни в отличии от гениального автора падонга нам будет генерировать ИИ.
Далее нам предлагают вот такой текст и мы можем либо продолжить либо перегенерить его (редактировать текст вручную нельзя). Нам подходит, жмём PROCEED
Воу воу уж больно как-то синтетически поёт. Переключим ка на женский вокал.
ну вот так то лучше.
С этим разобрались. Но как быть с остальным? Хочется же по русски петь да ещё чтобы и текст свой вставить можно было.
Тут нужен другой сайт. Тут нужен https://www.suno.ai/
переходим на сайт, в правом верхнем углу жмём Make a song
На следующей странице лева вверху жмём Create
Далее как залогинились жмём вверху слева на ползунок Custom Mode
В окошке Lyrics пишем текст своей песни. Ниже текстом пишем жанр песни (на любом языке) и название для песни (возможно не обязательно). Жмём Create и ждём.
Через секунд 30 у нас есть аж 2 готовые песни, которые мы можем послушать, скачать как аудио и как статичный видосик, а так же выложить в интернеты.
У одной из песен даже обложка с вомбатом! А вот и сами эти песенки:
Сегодня заседание нашего клуба любителей нейронок предлагаю начать с небольшого эксперимента.
Допустим, есть у нас картинка, на который изображены три кубика с буквами Т, О, К.
картинка, на который изображены три кубика с буквами Т, О, К.
Предложим, есть у нас вот такой простенький, ясный, однозначный промпт для создания видео.
Кубик с буквой Т перемещается в левый нижний угол. Кубик с буквой О раскрашивается в красный цвет. Кубик с буквой К превращается в шар.
Казалось бы, тут ошибиться невозможно.
Но нейронки могут всё!
В том числе делать странные ошибки при выполнении простейших заданий.
Результат выполнения вот такой.
Видео из картинки и промпта выше
Заключительный кадр
На меня результат произвёл шокирующее впечатление.
Странные передвижения, а в итоге появился кубик с буквой Б, и три шара без букв, два из которых золотистого цвета.
Не просто мелкие ошибки, а вообще всё не так.
Как такое может быть? Задание ведь максимально простое. Я же не требую каких-то сложных визуальных эффектов. Простейшие движения. Кубиков всего три, буквы чётко прорисованы. Фон чистый. Ничто не должно помешать правильно выполнить задание.
После этого ещё говорят, что делать видео с помощью нейронок - простейшее занятие. Ага! Блажен, кто верует. И где тут знаменитое "компьютерное зрение"?
Попробуйте сами выполнить это и подобные упражнения и публикуйте результаты. Будем обсуждать. Хорошо, если тут выступит эксперт по нейронкам и прокомментирует этот тест.
Кстати, тема обучения детей с помощью подобных видео тоже интересна. Если вы профессионально занимаетесь с детьми и у вас есть интерес, чтобы я вам создавал подобные видео на заказ, пишите мне в личку или прямо в комменты. Будем сотрудничать.
Всем доброго времени суток, с вами на связи Lis-ST, и сегодня мы с вами более подробно ознакомимся с нейросетями, которые чаще всего и называют ИИ, а именно с языковыми моделями. Начнём от простого, к сложному.
Восприятие языковых нейронок.
Как нейросеть видит нашу письменность.
Модели не понимают буквы и слова как люди. Их родной язык — числа. Решить эту проблему довольно просто, ведь правда? Просто присваиваем каждой букве и знаку число - проблема решена! Но практика показала обратное, на обработку текста в таком формате требовалось очень много вычислительных мощностей и времени, а при увеличении длины текста требования росли в квадратичной зависимости. Причина банальна, внутри скрытого слоя каждый символ должен "взаимодействовать" с каждым, и это не единственная проблема.
Первый шаг в решении данной проблемы, разбить текст на части - "токены". А раз уж решили прибегнуть к такому способу и так как нейросеть всё-равно работает с числами, почему бы их не сделать из наиболее часто встречающихся частей текста:
С одно стороны, когда у нас были символы, наш словарь состоял из 256 значений, а токенов в той же GPT более 50000... Какая-то оптимизация наоборот, скажете вы и будете не правы. Всё дело в том, что если токеновая модель обрабатывает последовательность из 1000 токенов за условные 10 секунд, то символьной модели для обработки того же текста потребуется уже минимум 160 секунд, неплохая такая разница?
Вкратце затронем эмбеддинги - так называемый вектор. Зачем нам какой-то вектор, ведь токены у нас, числа им присвоены? Но нужно же как-то определять, в каком порядке токены размещены в тексте. Не забываем о контексте за который отвечает механизм внимания (Self-Attention), работающий так-же в скрытом слое, всё также путём присвоения дополнительных значений токенам.
Генерация - не сердце, но суть нейросетей.
Валера, что-то не нравится мне этот расклад, как бы чего плохого не случилось.
Языковая модель — этоочень умный писатель, он никогда не видит весь текст сразу, а пишет по кусочкам (токенам). И каждый раз, когда нужно выбрать следующий кусочек, в его голове происходит невидимое "голосование".
После того как модель прочитала всё, что вы написали, она составляетвнутренний рейтинг всех возможных продолжений. У неё в голове есть огромная доска рейтинга на 50 000 мест (по числу токенов). У каждого варианта — своя оценка. Эти оценки — не про "правильность", а протипичность. Модель спрашивает себя: "Что в моей обучающей библиотеке чаще всего шло после такого начала?"
Пример: вы написали "Сегодня хорошая...". В голове модели:
место №1: "погода" - (очень высокий балл)
место №2: "." (точка) - средний балл
место №3: "для" - небольшой балл
место №1000: "крокодил" - почти ноль
Модельникогда не уверена на 100%, у неё есть тольковеса предпочтений.
Что происходит с этими весами дальше? Два Варианта:
Вариант №1: Точность.
Модель всегда берётсамый верхний вариантиз рейтинга. Увидела "погода" - напечатала "погода". Потом снова смотрит рейтинг для "Сегодня хорошая погода", опять берёт самый верхний... В итоге получается очень предсказуемый, сухой,бездумно-правильныйтекст. Как говорят: "модель включила режим калькулятора". Плюс: не ошибается, минус: нет творчества, повторяет штампы.
Такой режим используется, когда нужен точный факт, код или перевод. Но общаться с таким собеседником скучно и бесполезно, но главное, абсолютно бесперспективно, если вы сунетесь к нейронке с тем, чему она не обучена (запомните главный принцип, касательно "проблем", если решения вашей проблемы нет в интернете, вероятность того, что поможет нейросеть, стремится к нулю, даже при варианте №2).
Вариант №2: Обычный человек.
Модель смотрит на рейтинг иподбрасывает волшебный кубик, где грани взвешены по весам. Вариант с весом 80% занимает 80% граней кубика, вариант с 15% - 15% граней и т.д.. Так она иногда может выбрать и "погоду", и неожиданно «.», и даже очень редко "крокодила", если кубик так выпадет.
Именно за счёт случайноститекст становится живым, разнообразным, иногда остроумным. Но изредка - странным или глупым. Это плата за "человечность" и творчество.
Температура.
Температура за бортом.
Температура - это ручка управления "креативностью" нейросети.
Холодная температура (низкая, например 0.2).
Модель как быувеличивает контрастмежду первым местом и всеми остальными. Первое место становитсягигантским, а все остальные - крошечными. Кубик почти всегда падает на топ-1 результат. Текст становится сухим, однообразным, как диктор новостей, читающий по бумажке.
Лучше всего для:фактов, инструкций, кода, перевода.
Комнатная температура (1.0 - стандарт).
Это естественное состояние модели, то, чему её обучили. Разница между первым и вторым местом естественная. Кубик отражает реальные статистические веса. Текст получаетсяпохожим на обычную человеческую речь- с предсказуемыми, но иногда слегка неожиданными поворотами.
Лучше всего для:обычного чата, деловых писем, новостей.
Горячая температура (высокая, например 1.5).
Модельсглаживает оценки: первое место уже ненамного выше второго, а сотый вариант получает заметный шанс. Кубик становится "расслабленным" - он может выбросить редкое слово, необычную конструкцию, даже неуклюжий, носвежийоборот. Текст получается творческим, иногда странным, иногда гениальным, иногда бредовым.
Лучше всего для:стихов, шуток, креативных идей.
Кипящая температура (очень высокая, например 2.5+).
Все варианты становятся почти равноправными. "Погода" и "крокодил" получают почти одинаковые шансы. Кубик выпадает практически случайно. Текст превращается вбессмысленный словесный шум - связные слова, но нелепые сочетания ("Сегодня хорошая крокодил на завтрак"). Полезно разве что для демонстрации того, как модель ломается.
Есть ещё более умные настройки, дополняющие температуру, но статья и так уже не маленькая, а это плохо.
Манипуляции нейросетью.
Да, я такой.
Чтобы задать нейросети нужный "настрой" или стиль, используют два главных инструмента:ручки температуры(о которых мы говорили) иволшебные слова в начале диалога(промпты).
1. Задаём "характер" словами.
Представьте, что вы нанимаете актёра. Вы не просто говорите "говори", а даётевводную о роли:
"Ты - научный популяризатор, который объясняет сложные вещи на пальцах. Ты не используешь формулы и термины, если без них можно обойтись. Ты любишь метафоры, примеры из жизни и немного юмора. Твой стиль - как у хорошего учителя или ведущего научно-популярного шоу."
В GPT это называетсяsystem prompt(системное сообщение). В других моделях - просто первое сообщение, которое задаёт контекст.
Что ещё можно прописать в настройку:
"отвечай кратко, не более трёх абзацев"
"используй маркированные списки, но без markdown"
"называй меня на "ты""
"добавляй примеры из кулинарии/спорта/путешествий"
Это самый мощный способ изменить стиль, потому что модель начинает "вживаться" в роль.
Вот несколько самых интересных примеров того, на что способен системный промпт за пределами привычных сценариев:
Придумать "анти-совет" для вашей идеи (Адвокат Дьявола):
Нейронка по умолчанию старается быть вежливой и соглашаться. Но промпт может превратить её в беспристрастного критика, задача которого - найти слабые места в вашем бизнес-плане или проекте, чтобы вы могли его улучшить.
Подготовиться к сложному интервью:
Попросите нейросеть представить себя журналистом, который задаст вам каверзные вопросы. Это поможет вам заранее подготовиться к разговору с реальным экспертом.
Писать стихи в стиле числа "π":
В этом промпте каждое слово стихотворения должно строго соответствовать цифрам числа Пи (3,14,15…), где первое слово - из трёх букв, второе - из одной, третье - из четырёх и т.д.
Заключение? Итог? Выводы?
А теперь можно вернуться к вопросу, существует ли ИИ на сегодняшний день? Но чтоб разобраться в данном вопросе, нужно в первую очередь понять, что такое ИИ.
Исходя из словосочетания, ИИ, это интеллект, но искусственный, а интеллект - это качество психики, состоящее из способности осознавать новые ситуации, способности к обучению и запоминанию на основе опыта, пониманию и применению абстрактных концепций, и использованию своих знаний для управления средой обитания человека.
Да, это сухое, весьма размытое определение, которое не даёт чёткого представления о том, что-же это такое. Если же посмотреть на то, с помощью чего он реализуется, всё становится на свои места: способности познавать, обучаться, мыслить логически, систематизировать информацию путём её анализа, определять её применимость, находить в ней связи, закономерности и отличия, ассоциировать её с подобной информацией, оценивать её достоверность, актуальность и многое другое...
И опять вернёмся непосредственно к вопросу, являются ли нейросети - искусственным интеллектом? На все 100% нет, и даже близко ничего общего с ним не имеют. По своей сути нейронки - поисковик, работающий на глюках.
П.С.:
У Лисёнка голова бобо. Тут хотел написать в рифму к первому предложению, но видимо ещё не совсем.
Всем спасибо за внимание, с вами был Lis - Silver Tail. Ссылка на первый пост об основах нейросетей ниже.(блин, это же ещё всё вычитывать...(здесь был смайлик))
- Сейчас вся сила в гемоглобине, - задумчиво произнёс мудрый старичок.
Все замолчали и задумались о волшебных свойствах гемоглобина.
Сегодня можно, перефразируя классику, сказать так.
- Сейчас вся сила в "нейронках"!
Давайте, подумаем и порассуждаем о волшебных свойствах "нейронок".
Не знаю, как у вас, а в нашей корпорации поощряется изучение сотрудниками современных нейро технологий во всех проявлениях.
Это правильно, как мне представляется. Чем умнее и развитие сотрудники, тем выше прибыль компании. Если у вас другое мнение, сообщайте, обсудим.
С помощью "нейронок" эффективность работы конкретного индивидуума резко повышается. С помощью "нейронок" один человек может самостоятельно выполнять разноплановые задачи.
Например.
1. Написать программу на "Питоне", которая бегает по сайтам и выгрызает из них нужную информацию (например, контент в теге "title") для дальнейшей работы.
2. Сделать короткий видео ролик в вертикальном формате (рилс), который наберёт миллион просмотров.
3. Быстро написать интересный и читабельный пост на определённую тему для публикации в соцсетях.
А что такое "читабельный"? Ну, раз вы дочитали до этого места, значит, читабельный.
Для погружения в тему "нейронок" я прошёл несколько курсов и сейчас горю желанием поделиться с вами впечатлениями.
Меня поразило огромное количество курсов по данной теме. Не выходя за пределы "Телеги" и русского языка на глаза мне попалась сотня курсов по теме "нейронки". Если выбрать из них самые лучшие, там где руководители представительные солидные мужчины или красивые приятные дамы, то получим примерно 20 курсов. Если из них выберем только те, у которых красивые лицензии с подписями и печатями, то число 10 будет минимальным.
Вывод ясен. Учиться, учиться и учиться!
Чему же я научился? Сейчас коротко расскажу. Можно потом будет и подробнее, если вам захочется меня слушать.
Для меня как писателя стало неприятным открытием, что читают сейчас мало. В большинстве смотрят видосики. И тенденция развития в пользу видео. Ещё несколько лет и читать вообще перестанут (художественные тексты). Останется несколько мамонтов - маргиналов. Вы, я, ещё несколько человек. И это всё.
Следующая мысль развивается из предыдущей. Не все видосики одинаково полезны. Нужно делать короткие вертикальные "рилсы"! Если научитесь их делать хорошо, то будет вам счастье. Если нет, тогда нет.
Для справки. Рилс (Reels) - короткие видео вертикального формата. Соотношение сторон: 9:16 (1080x1920, 540x960)
Главный современный навык - умение привлекать к себе внимание. Умеет писатель Константин Оборотов привлекать к себе внимание - будет успешным и популярным. Если нет, тогда нет.
А как привлекать внимание? Сегодня это рилсы, о которых мы говорили выше, завтра ещё что-нить новенькое. Но пока рилсы.
Тут я попробовал поспорить с преподавательницей. Заявил, что я - человек культурный, продвинутый, воспитанный на классической музыке, лучших образцах литературы, тонко чувствую красоту шахматного искусства. И мне неприятно прогибаться под этот чокнутый мир, погружаться в интересы этих странных людей, которые любят рилсы. Конечно, есть неплохие образцы. Там, где котики играют джаз, решают шахматный этюд или даже взламывают банкомат. Но в целом, это поток откровенного, хоть и красивого (признаю), маразма.
На это руководительница курсов сказала, что не имеет значения, что там нравится тебе. Надо держать "нос по ветру" и делать то, что понравится большому количеству людей.
Для меня это была мысль хоть и не новая, но традиционно сложная. Я её думал и раньше, но теперь думаю больше и глубже.
Ладно! Если вам тема "нейронок" в принципе интересна, будем общаться и дальше по этой теме. А пока я предлагаю вашему вниманию небольшой ролик в формате рилс (чёрт бы его побрал!). Этот ролик я сделал в рамках защиты дипломного проекта на этих курсах - "Побольше оборотов!". Мобильная версия Reels.
Ранее я уже знакомил вас с песней номер 1 (главная песня) и песней номер 2 (Песня успешно уснувшего). Если вы хотите их прослушать-переслушать, то все готовые песни можно найти в этом списке.
Все песни не повторяют текста самого романа. Они являются всего лишь моей эмоциональной реакцией в музыкальной форме на роман.
Эта песня отображает душевные переживания княгини Ольги до её встречи с попаданцем. А как она догадалась, что попаданец к ней заявится? Чуйка подсказала.
Надеюсь, песня понравится ценителям истории и культуры Древней Руси. Песня княгини Ольги представляет собой интересное произведение, которое сочетает исторические элементы с современной поэтической формой. Она способна вызвать отклик у любителей русской истории и литературы.
...
Песня княгини Ольги "Волнение перед встречей с попаданцем"
Первоисточник (мой персональный сайт, без оплаты, без регистрации, без СМС и, конечно, без парадоксов):
Фантастическая сага от Алекса Гора: циклы "Дикий прапор", "Отец", "Контуженный" и "Апогей".
ИДЕЯ И САУНД-ПРОДЮССИРОВАНИЕ - ZAKHAR PAROV PROJECT ----------------- МУЗЫКА и ВОКАЛ - ZAKHAR PAROV PROJECT СЛОВА - АЛЕКС ГОР, ZAKHAR PAROV ----------------- ℗ декабрь 2025
Неожиданно пролетел второй год жизни нашего Вомбатика. Если верить этому посту то
Двухлетний ребенок уже достаточно самостоятелен. У малыша уже довольно хорошо развита координация, он постоянно находится в движении. С помощью взрослых двухлетка вполне может сам себя обслуживать.
Что уже соотвествует реальности - сайт вполне самостоятельный. Он уже умеет постить, лайкать и иногда устраивать холивары. Правда, с обслуживанием себя у него не так всё гладко - требует ежемесячно ему оплачивать какие-то сервера...
За последнее время у нас было не очень много релизов, заметных со стороны пользователей - все силы были брошены на новую версию вомбатьего движка, который при старте проекта был написан полностью за 1.5 месяца (что не могло не отразиться на качестве кода) и отчаянно требовал полного рефакторинга. Сейчас мы уже на новой версии, о чём писала @Vombatolog в посте. К сожалению, все баги при столь масштабных изменениях на этапе тестирования выявить не удалось, так что спасибо огромное всем, кто присылает репорты об ошибках - сами мы физически не в состоянии всё протестировать досконально.
Ну и, конечно, работа над новыми фичами не останавливается. Небольшой спойлер о следующих изменениях - они будут связаны с редактором постов и черновиками.
А ещё - обязательно присылайте нам свои идеи и пожелания по развитию проекта, новым ачивкам/челленджам/конкурсам, дополнению Вомбаттла. Это позволяет нам понять, на что стоит обратить внимание и реализовать в первую очередь, а некоторые вещи, предложенные пользователями, могут перерасти во что-то грандиозное и традиционное - достаточно вспомнить Ивент Вомбата, постов по которому за последний год написано 915 штук. Спасибо @PyKAMACTEPA@JasonWoorhies@Yasher_Ko@dewqas, что поддерживаете эту движуху!
Также напоминаю, что поддержать проект можно донатом.
А теперь немного итогов и цифр. Вся приведённая статистика - за последний год.
Самое главное - посты. За год у нас их прибавилось на 17 326, из которых 15 598 написано на Вомбате (остальные перенесены). Т.е. в среднем у нас пишется 42 поста в сутки.
3 188 592 - суммарное количество просмотров постов
4 682 поста опубликовано в виде отложенных
2 071 раз для тегов и 1 268 для пользователей использован игнор
а подписки - 359 на теги и 1 007 на юзеров
121 795 действий было произведено в Вомбаттле
И Яндекс.метрика:
Трафик за год
Посетители - уникальные люди за выбранный период Визиты - это сеансы, то есть отдельные заходы на сайт. Просмотры (или просмотры страниц) - это количество загруженных страниц сайта.
Всплеск в январе-феврале - это запущенная реклама. Вещь эффективная, но довольно дорогая. После неё начался рост органического трафика, с 300-400 человек в день до неё до 700-1000 человек на текущий момент.
И сводка основных источников:
По-прежнему, лучший источник - поисковые системы. Генерируют большую часть наших посетителей по самым разным запросам...
Спасибо каждому, кто пишет, комментирует и просто читает — именно вы делаете это место живым. И огромное спасибо всем за поздравления!
Субботний вомбат идёт на дачные грядки, трудяга. Рекомендую почитать на выходных Интервью с нейросетью: Знакомство немного для подумать чтиво. Хороших выходных всем!
Комментарии