Сегодня 11 апреля 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → генерация музыки

Представлена нейросеть Stable Audio 2.0 для генерации полноценных трёхминутных музыкальных треков с вокалом

Модель ИИ для генерации аудио Stable Audio 2.0 от Stability AI позволяет пользователям загружать свои собственные аудиозаписи, на основе которых ИИ генерирует трёхминутные треки в соответствии с подсказками. По утверждению Stability AI, главное отличие новой версии Stable Audio состоит в создании песен с классической музыкальной структурой: вступлением, развитием и финалом. Тем не менее, эксперты уверены, что на «Грэмми» этим трекам пока рассчитывать не приходится.

 Источник изображения: Pixabay

Источник изображения: Pixabay

Первая версия Stable Audio была выпущена в сентябре 2023 года и предлагала платным пользователям генерацию треков длительностью до 90 секунд, пригодных только для экспериментов. Stable Audio 2.0 генерирует полноценный трёхминутный аудиофайл, что соответствует продолжительности песен для радиовещания. Новая версия Stable Audio полностью бесплатна и доступна как на официальном сайте, так и через API.

Stability AI сообщила, что модель обучалась на данных музыкальной библиотеки AudioSparx из более чем 800 000 композиций, причём артистам была предоставлена возможность запретить использование своего материала для обучения модели. Stable Audio 2.0 позволяет пользователям настраивать проект в широком диапазоне, регулируя степень влияния подсказки и то, какую часть загруженного аудио она будет изменять. Доступно добавление звуковых эффектов.

Исследователи, успевшие поэкспериментировать со Stable Audio 2.0, довольно сдержаны в своих оценках. По мнению одного из них, добавленный генератором вокал похож на звуки, издаваемые китами, другому показалось, что он «случайно вызвал в свой дом потустороннее существо». Эксперты назвали сгенерированные треки «бездушными и странными».

Все загруженные пользователем аудиозаписи не должны нарушать авторских прав. Проблемы с последними стали одной из причин, по которой бывший вице-президент Stability AI Эд Ньютон-Рекс (Ed Newton-Rex) покинул компанию вскоре после запуска Stable Audio. Теперь Stability AI заключила партнёрское соглашение с Audible Magic, чтобы использовать технологию распознавания контента, разработанную компанией, для отслеживания и блокировки попадания на платформу материалов, защищённых авторским правом.

«Сбер» научил GigaChat создавать уникальную музыку по текстовому описанию

«Сбер» научил своего ИИ-чат-бота GigaChat генерировать музыкальные композиции по текстовым запросам пользователей. Новостью поделился вице-президент по цифровым поверхностям «Салют» Сбербанка Денис Филиппов в рамках международной конференции по искусственному интеллекту AI Jorney 2023. Возможности сервиса были расширены путём интеграции нейросетей CLaMP и SymFormer.

Для создания музыки человек может просто сформулировать задачу. К примеру задать следующее описание: «Сочини весёлую музыку в стиле кантри» или «Напиши композицию для лаундж-зоны бизнес-центра». В результате GigaChat создаст аудиофайл с уникальной музыкальной дорожкой, а также нотную партитуру в формате MIDI, совместимую с любой DAW (Digital Audio Workstation). После этого пользователь сможет скачать и прослушать получившуюся музыку, а MIDI-файл — использовать в своих творческих проектах: редактировать гармонии, менять аранжировку и получать разнообразные варианты звучания композиции.

Генерация музыки стала возможна в GigaChat благодаря интеграции нейросетей CLaMP и SymFormer. Для обучения SymFormer применили платформу ML Space на базе суперкомпьютера Christofari и датасет из более чем 200 тысяч композиций разных музыкальных стилей: от классики до современной электронной и тяжёлой музыки. В основе модели генерации композиций лежит принцип рассмотрения музыки в качестве нотного текста — в этом помогла адаптация подхода text-2-image к нотному домену.

Отмечается, что создание музыкальных треков происходит в несколько этапов:

  1. Текстовый запрос пользователя с помощью модели CLaMP конвертируется в понятный для генератора мелодий язык.
  2. Данные от CLaMP, включая информацию о стиле, поступают на вход SysFormer, которая выполняет генерацию нескольких вариантов мультидорожечной композиции, из которых нейросеть выбирает наиболее удачные варианты по стилю.
  3. На последнем этапе генерации механизм рендеринга формирует аудиофайл и отправляет результат пользователю.

«Новые возможности GigaChat будут полезны не только музыкальным энтузиастам и представителям творческих профессий. Одним из сегментов целевой аудитории сервиса мы видим представителей малого и среднего бизнеса. Благодаря GigaChat они смогут быстро, качественно и, что важно, абсолютно легально решать задачи бизнеса: создавать фоновое музыкальное сопровождение для кафе, залов ожидания и салонов красоты, создавать мелодии для рекламных видеороликов и соцсетей», — поясняет Денис Филиппов.

Напомним, что ранее этой осенью в рамках культурной программы Восточного экономического форума (ВЭФ) во Владивостоке состоялся первый в мире симфонический концерт с импровизациями, созданными искусственным интеллектом. Нейросеть SymFormer выступила на этом концерте вместе с оркестром Мариинского театра Приморской сцены. В первой части симфонии «Космос», написанной композитором Петром Дранга, SymFormer управляла экспрессивностью исполнения. В третьей и четвёртой частях симфонии нейросеть импровизировала в режиме реального времени на основе информации, полученной от партитуры музыканта.


window-new
Soft
Hard
Тренды 🔥
OpenAI прокачала память ChatGPT, чтобы бот мог ссылаться на прошлые диалоги 39 мин.
«То, что я ждал от The Movies 2»: голливудская стратегия Hollywood Animal от авторов This is the Police вышла в прокат раннего доступа Steam 2 ч.
Роскомнадзор порекомендовал перестать пользоваться зарубежными протоколами VPN 2 ч.
AMD признала, что в процессорах Zen 5 имеется опасная уязвимость EntrySign 3 ч.
Масштабное дополнение к Katana Zero вернулось из небытия с новым трейлером — оно всё ещё бесплатное и почти готово 3 ч.
В графическом онлайн-редакторе Canva появился ИИ для генерации изображений и создания приложений 3 ч.
«Смотрится очень круто»: сюжетный трейлер Heroes of Might & Magic: Olden Era взбудоражил фанатов перед летним релизом 4 ч.
Новый геймплейный трейлер раскрыл дату выхода философского выживания The Alters от создателей Frostpunk 2 5 ч.
Журналисты раскопали причины провала Apple с внедрением ИИ в Siri 6 ч.
Cloud.ru готовит облачную платформу для локального развёртывания ИИ-сервисов 6 ч.
Новая статья: Обзор блока питания Ocypus Iota P1000 55 мин.
Акции Apple, Tesla и Meta рухнули вслед за Nasdaq после взлёта в среду — инвесторы обеспокоены пошлинами 58 мин.
Audio-Technica выпустила наушники за $6800 для фанатов «Звёздных войн» 2 ч.
Oppo представила флагманский планшет Pad 4 Pro, смарт-часы Watch X2 Mini и беспроводные наушники Enco Free4 4 ч.
В Австралии начали строить ультрасовременную антенну дальней космической связи — она обеспечит связь с «Вояджерами» и не только 5 ч.
Исправление опечатки на умных часах OnePlus Watch 3 увеличило их цену на 50 % до $500 6 ч.
ИИ-континент: Евросоюз намерен как минимум утроить ёмкость дата-центров в ближайшие годы 6 ч.
Oppo представила ультрафлагман Find X8 Ultra — с мощной камерой, Snapdragon 8 Elite и батареей на 6100 мА·ч за $885 7 ч.
Oppo представила компактные флагманы Find X8s и X8s+ с новейшим MediaTek и ценой от $570 7 ч.
Представлено умное табло Busy Bar от создателей хакерского мультитула Flipper Zero 8 ч.