AI сервисы для инструменталок: mvsep против uvronline

Не смотря на то что изготовление инструменталок к песням, или же по простому - "минусовок", как тема всегда остается актуальной, меня она прошла стороной. Не слышал я и "бум"а так называемого ии-пузыря который каждый день лопал и лопает по сей день. Лично я отношусь к AI как к следующему по уровню инструменту, а не как к чему-то заумному, о чём кудахчат журналисты. И уже когда я открыл для себя разные музыкальные AI сервисы, я только лишний раз убедился в своей стойкой позиции.
Этих сервисов много и функционал их разнообразен; в статье всё внимание я хочу уделить же двум "титанах" - mvsep и uvronline, и по моему мнению жемчужиной их функционала - удаление вокала из песен (в широком смысле)
Статья эта оказалась в разделе "Услуги" неспроста, ведь сервисы платные. Хотя они по сути все платные, с отличием на взгляд халявщика в том что какие-то дают попробовать что к чему, а какие-то сразу берут деньги, а стулья потом. Так как я хотел сравнить именно результат который выдают эти два сервиса, то всё сравнение лучше не совсем хорошо представить в виде "1 на 1" - это будет понятно чуть позже.

Косметические отличия uvronline с его версиями (Два слева - старая версия, два справа - новая, которая в названии содержит nextgen.uvronline)
1785407108875.png1785407316760.png1785407164086.png1785407351993.png
и mvsep
1785407644971.png1785407825105.png
мало интересны в сравнении о котором будет идти речь.
Поэтому ничья.

Внимательные заметили разные счётчики лимитов. Это важный момент, к которому лучше вернуться после основного сравнения. Опуская детали в виде формата скачивания, приоритетов ожиданий и paywall-ьных аи-моделей, uvronline предоставляет услуги в виде фиксированного кол-ва минут в неделю в базовых планах и дает около 20 минут бесплатных конвертаций, в то время как mvsep имеет грубый кредитный расчет где 1 мин песни в среднем обойдется в 2 кредита, хотя и бесплатно но с регистрацией дает 50 ежедневных конвертаций с лимитом по 10 минут на песню. И лидер в сравнении уже был бы очевиден, не было бы "но"...

Качество. И сопутствующие проблемы с получением высококачественных инструменталок, с которыми столкнётся искушенный (как я собс-но).
Неприятности начинаются с того что голос как таковой не совсем удаляется в привычном понимании. Он маскируется. И то насколько это хорошо делается и определяет качество модели, в частности (припиской на сайте mvsep) как "sdr", который не смотря на линейное увеличение качества по мере роста этого числа, оказывается имеет нелинейные diminishing returns, вплоть до ухудшения качества там где старые модели с меньшим sdr справлялись лучше. mvsep хоть и предоставляет в разы большее количество моделей, основными из них можно выделить всего несколько "семей" - bs-roformer, mel-band, mdx, scnet и подсемьи одноименные собственно сайтам. Несмотря на обилие разных моделей, даже среди основных семей, качество слабо варьируется между последними моделями с близким по значению sdr, да и "качество" это имеет не совсем прямое отношение к "чистоте" инструменталки на выходе, а скорее нелинейное соотношение получившихся артефактов на выходе к музыке на входе.
Взглянем на первый пример:
1785415244762.png
Результат слева выдадут старые "outdated" модели, часть новых бесплатных. Результат справа можно было бы считать хорошим будь артефакты\шумы по уровню ниже маскировочного шума (музыки), что можно рассмотреть подробнее на втором примере, где вокал удалился хорошо, но его часть осталась (очень тихо, но четко слышно если слушаешь не на минимальной громкости):
1785416059178.png
Подобный вид имеют и другие артефакты. Основная разница, и как следствие основная слабость, в аи-алгоритмах (моделях) состоит в том что разные модели имеют разную "хватку"-алгоритмы, в том числе и глубину вычитания вокала. Разные семьи моделей в зависимости от глубины вычитания вокала также порождают и разные по характеру артефакты. К примеру известным артефактом семьи melband является ошибочное удаление звуков духовой и синтезаторной природы и замена их звук с металлическим звоном с реверберацией. Более крутое значение приводит к левому результату первого примера, среднее значение же, дает компромисс между агрессивностью удаления вокала и качеством инструменталки на выходе, порождая субалгоритмы(авторские надстройки) в одной семье.
Тем не менее, все эти недочёты имеют определенную повторяемость, которая также относится к достоинствам и недостаткам моделей. Из основных мест где возникают артефакты в конечном счёте выделяются:
-внезапная тишина или же долгий отрывок с большой разницей между громкостью до отрывка и в самом отрывке, что порождает артефакты с крутизной больше чем во втором примере. В лучшем случае переход от инструмента к вокалу который "просочился в тишину", можно будет заменить вручную, скопировав сэмплы тишины из того же трека, в промежутке - комбинировать результаты нескольких моделей в надежде что другая-третья модель возьмёт, да аккуратно сделает дело, а в худшем же остается прибегать к левому результату первого примера
-голос с участками с затуханием, хуже - с нарастанием амплитуды. В худшем случае голос не удалится вовсе, в промежутке - появятся родственные семьям моделей артефакты (реверберация у melband, шум с модуляцией голосом у bsroformer, общее плохое качество у scnet). Продвинутые модели и\или же ручное комбинирование результатов нескольких моделей решает большинство проблем этого рода, если только нету следующего.
-сочетание продолжительного тона (голоса в основном, хуже если и голоса и в музыке) и музыки, что при обработке порождает самые разнообразные и режущие слух артефакты, ибо аи-алгоритм не в состоянии модулировать членораздельный сложный и изменяющийся во времени исходный тон. Остроты проблеме добавляет то что вокал может быть и не однотонным, к примеру как в опере где певцы подобно соловьям поют со своим динамическим диапазоном и своеобразной техникой извлечения тона. Лечение спорное с переменной эффективностью, путем применения ensemble-алгоритмов (об этом позже чуть). Вручную не вылечить, кроме как полным восстановлением музыкальной части с ноля через подбор инструментов
-что выше, только в добавок музыка и\или голос имеют небольшой динамический диапазон и особенно сильный наложеный компрессор. Несмотря на то что голос при разделении даже старыми моделями остается членораздельный и высокого качества, музыка от этого необратимо теряет в качестве. Артефакты этого рода характеризуются нестабильной, "wobbly"-плавающей громкостью, мутностью, будто кто-то дергает ползунок громкости и одновременно одеялом накрывает динамик. Лечения нет или вероятно через полное разложение на отдельные инструменты с восстановлением динамического диапазона каждого из них а затем сведением обратно, но качество остается только прикидывать на пальцах, ибо не имея нот, одним мультиполосным компрессором "эксайтером" не обойтись), а количество ручной работы даже с использованием аи-алгоритмов для мимикрирования стиля игры займет чудовищное количество времени.
Вы должно было заметили что я не привязывал ошибки к конкретному сайту. А все потому что функционал в этом плане почти одинаков. Буквально.
Основное качество на выходе задает качеством и жанром музыкальных композиций на входе. Так, узнаваемые шумовые артефакты в основном скроются за большей частью "громкой" музыки (рок или просто динамичная гитара, ударники, да и тарелки если не особо вслушиваться но сгладят косяки). Но что делать когда музыка это соло инструмент? Или тихая нота которая то и дело обращает на себя внимание? А что если на входе будет вовсе классическая музыка где что не продолжительный тон, то соловьиные трели певцов?

Теперь стоит рассказать об основном отличии сайтов mvsep и uvronline - наличие у первого продвинутых аи-моделей, которые называются "ensemble". Суть заключается в том что эти модели берут выход нескольких других моделей, сравнивают между собой и грубо говоря усредняют результат между собой. Это исключительно позитивно сказывается на качестве, если конечно входная запись не страдает сильно проблемными местами. Иначе выход от усреднения нескольких плохих результатов получается еще хуже чем от одной.
Но и это не все. На скрине можно видеть замочек на модели - модель платная. И не только платная она сама, но и субмодели которые она использует по умолчанию, так же платные и стоят больше кредитов на минуту.
А раз качество и цена важны, то по чём же удовольствие?
1785430169645.png1785430233460.png
За 3.5$ uvronline предлагает целых 1200 минут обработки, с усредненными параметрами почти самых свежих моделей семей BS-roformer и Mel-band (самые ходовые), в то время как за эту же стоимость mvsep едва ли предложит полчаса обработки на самых ресурсоемких субмоделях которые сами по себе имеют +накрутки кредитов, и это при том что ensemble еще накинет ценник за использование нескольких моделей. С другой стороны почти все модели доступны и в бесплатной версии, опять же если не считать нюансов в виде ограничения на продолжительность входящего файла, параметры файла на выходе и времени ожидания и других quality-of-life нюансов. Хммм... Что же это, сортировочная шляпа объявляет ничью? Нет.

По итогу: если вы цените качество результата и его скорость получения относительно затраченных средств, то uvronline более привлекателен. С другой стороны если цель получить максимально возможно чистую инструменталку - вам понадобятся глубокие карманы ибо дорога лежит на mvsep, который не смотря на справедливые расценки относительно кредитов за минуту, имеет совершенно нечестную систему которая не позволяет делать "превью"-предпросмотр\предпрослушку целевого результата относительно входящей музыки, из-за чего аналогичное время которое предлагает uvronline за 3,5$ - 1200 минут, на mvsep могут вылиться в астрономические суммы, учитывая местные расценки. Хотя, когда речь заходит об обработке классики, то цена не так сильно бъет по карману как это с другими жанрами, ведь ensemble доставляет качество которое отчасти сразу замечаешь. Но с противоположной стороны в таком количестве аи-моделей что предлагает mvsep можно голову сломать, тем более когда для новичков не очевидны проблемы получения чистой инструменталки с первых кликов\первых сотен кредитов.

В конце концов, я придерживаюсь мнения что оба сайты достойные внимания и платы за предоставляемые услуги, ровно как и то что лучше пользоваться ими двумя для достижения наилучшего результата не только в качестве, но и в затраченном времени и цене.
Что касается "гайдов" по моделям - проще каждому на своей музыке один раз услышать и интуитивно научится оценивать возможные артефакты на выходе, чем мне показывать сто картинок которые по итогу можно свести к сути которая была изложена выше.

Надеюсь статья оказалась для вас полезной.
 

Статистика форума

Темы
3,417
Сообщения
276,763
Пользователи
2,616
Новый пользователь
Vlad Federman
Назад
Сверху Снизу