В мире генеративного ИИ всё меняется стремительно. Этим летом музыкальное ИИ‑сообщество столкнулось с сюрпризом: разработчики Suno навсегда отключили полюбившиеся многим старые версии моделей (v4, v4.5, v5 и v5.5).

Пользователи нашей ИИ‑платформы GPTunneL (агрегатора нейросетей) массово жаловались: пропал тот самый вайб, а новые алгоритмы стали слишком жесткими. К тому же в Suno всегда была одна фундаментальная проблема, которая бесила многих креаторов — там нельзя было просто взять и поменять текст в уже готовом, сгенерированном треке.

Мы выслушали боль нашей аудитории, посмотрели на то, чего не хватает рынку, и решили сделать свой продукт.

Сегодня, 18 сентября, мы официально запускаем Grom Zvuk — нашу собственную музыкальную ИИ‑модель. Она работает на наших серверах, выдает крутое качество, делает невероятные каверы и стоит дешевле западных аналогов. Рассказываем, как она устроена и на что способна.


Что такое Grom Zvuk и как это звучит

Grom Zvuk — это первая музыкальная модель в нашем семействе «Гром». Задача амбициозная: чтобы генерация полноценного трека по вашему промпту стоила копейки, а управлять процессом было проще, чем в существующих аналогах.

Zvuk уже доступен в GPTunnel.

Попробуйте модель здесь:

Grom Zvuk

Модель генерирует треки длительностью до 5 минут (можем расширить лимит до 6 минут), с вокалом или в виде инструментала.

Вместо тысячи слов — лучше послушать, что она умеет делать прямо из коробки:

Ещё примеры

Киллер‑фичи: свобода, каверы и работа с готовыми треками

Главная проблема большинства музыкальных нейросетей — вы получаете «черный ящик». С Grom Zvuk мы пошли дальше простой генерации по тексту. Модель умеет работать с уже готовыми треками. Замысел трека живет в партитуре, поэтому песню можно править частями.

  1. Создание каверов (свой текст на готовую музыку). Берём существующую песню, подставляем туда свои собственные стихи и меняем жанр. Музыка и вокальный рисунок остаются узнаваемыми, а слова — ваши.

  2. Смена жанра и стиля. Тот же трек, тот же оригинальный текст, но совершенно другой жанр. Хотите сделать из баллады Артиста кантри в стиле лап‑стил или суровый хардкор? Легко.

  3. Отсутствие строгой модерации. Пока западные сервисы закручивают гайки по авторским правам (блокируя всё, что отдаленно напоминает известных артистов), мы даем создателям свободу. Строгой модерации у нас, что открывает огромный простор для экспериментов с каверами и стилизациями.

Под капотом: как устроена генерация

Мы не используем сжатые «черновики». Grom Zvuk сразу отдает результат в 48 кГц, стерео, с настоящей стереопанорамой. (Кстати, сейчас дорабатываем поддержку lossless‑форматов, они появятся чуть позже.)

Генерация идет одним проходом. Модель прорабатывает все части трека одновременно. Сначала она заливает шумом всю длину будущей песни и размечает структуру: где встанут куплеты, где припев, а где бридж. Затем в несколько подходов превращает этот шум в звук. Интро, куплеты, припев и финал считаются как одна цельная композиция. Поэтому промежуточного результата не существует: трек появляется, когда досчитан целиком. Зато части не спорят друг с другом, а сведение звучит монолитно на всю длину.

Процесс превращения шума в структурированный аудиосигнал
Процесс превращения шума в структурированный аудиосигнал

Архитектурно конвейер устроен так: работают два эксперта под общим вниманием (attention). Первый пишет музыку символами, выстраивая композиционную логику, а второй разворачивает эти символы непосредственно в акустический сигнал.

Упрощенная схема: от символьной партитуры к полноценному звучанию
Упрощенная схема: от символьной партитуры к полноценному звучанию

Мультиязычность без акцента. Модель поет на любом языке (включая: русский, английский, китайский, японский, казахский, испанский, немецкий, французский, корейский, итальянский, португальский, турецкий, арабский, хинди и др.). В отличие от многих западных нейросетей, Grom Zvuk отлично понимает русские ударения и фразировку.

Синтетические тесты: бьем Suno v6

Мы провели слепое тестирование на выборке из 150 запросов. Оценивались два параметра: качество звучания (насколько аудио похоже на реальную студийную запись) и точность следования тексту (не путает ли модель слова, поет ли ровно то, что заказали). Названия моделей оценивающим не показывались.

Сравнение Grom Zvuk с другими музыкальными моделями
Сравнение Grom Zvuk с другими музыкальными моделями

По синтетическим бенчмаркам Grom Zvuk уверенно соревнуется с Suno v6 в балансе между точностью текста (85/100) и качеством звучания (83/100). По точности воспроизведения заданных текстов наша модель входит в первую тройку мирового рынка, обходя популярную Mureka.

Стоимость модели и условия для B2B

Мы сделали модель, которая работает на наших собственных мощностях.

  • Базовая стоимость генерации трека — 8 рублей, до конца сентября скидка 50%!

Для кого эта модель:

  • Музыкантам и креаторам: для создания быстрых демо, поиска аранжировок, экспериментов с жанрами и генерации фоновой музыки (например, эмбиент, лоу‑фай для видео).

  • Агрегаторам и бизнесу: готовы предоставить доступ к Grom Zvuk по API. Можем масштабировать кластеры ускорителей под конкретные объемы B2B‑клиентов. Для партнеров есть тестовый период.


GPTunneL — это ИИ‑платформа. В одном окне без VPN и сложных регистраций мы объединяем более 100 топовых ИИ‑инструментов: ChatGPT, Claude, Midjourney, Kling и другие, а также музыкальные Suno, Mureka и MiniMax. На платформе уже 1,5 млн пользователей.

Grom Zvuk пополнил наше проприетарное семейство моделей Grom, куда уже входят:

  • Grom GPT — флагманская текстовая модель (работает быстро, поддерживает русский, бесплатный в базовый вариант).

  • Grom Nova и Grom Art — генерация картинок по описанию, а также инпайнтинг, замена объектов и стили.

  • Grom TV — генерация видеороликов от 3 до 20 секунд.

  • Grom Pixel — умный апскейл до 100 мегапикселей с восстановлением фактуры.

Grom Zvuk уже доступен в разделе «Музыка» в GPTunneL рядом с Suno и Mureka. Заходите, тестируйте, ломайте жанры и делайте каверы!

Ждем ваших треков и фидбека в комментариях!

Комментарии (11)


  1. Sazonov
    18.09.2026 10:42

    Ваша модель может отдавать сгенерированную музыку отдельными дорожками для каждого инструмента? Как бы именно это - киллер фича Suno.


    1. Master_AI Автор
      18.09.2026 10:42

      Может, но пока мы не добились такого качества, чтобы показать это публике, сейчас фокусируемся на частичном редактировании трека – эта фича может появиться в ближайшее время.


  1. ToxaBes
    18.09.2026 10:42

    Признавайтесь, дообучили ACE-Step 1.5? :)

    По описанию эта же архитектура. В любом случае, отличная работа, эта модель как раз и создана для подобного (в том числе коммерческого) использования.


    1. shugajev
      18.09.2026 10:42

      ACE-Step 1.5 ну очень мне не понравилась модель, да бесплатная, но плясок с бубном было больше чем просто подписка на Суно, и я не заметил чтобы прямо было вау.. скорей, что за..


      1. Master_AI Автор
        18.09.2026 10:42

        В Zvuk'е совсем другая начинка)


    1. 8leed
      18.09.2026 10:42

      Из ACE даже если сильно постараться такого звучания не вытянуть - крайне слабый фундамент. Тут звук сильно богаче


      1. ToxaBes
        18.09.2026 10:42

        Ну почему же? Архитектура один в один. Если правильно дообучить, то вполне можно. Но это лишь мое предположение.


    1. Master_AI Автор
      18.09.2026 10:42

      Нет, это не ACE-Step, Grom Zvuk фундаментально отличается от ACE-Step по архитектуре.


      1. ToxaBes
        18.09.2026 10:42

        Значит, практически полностью описанная в этой статье архитектура ACE-Step: одношаговая полнотрековая диффузия, LM-планировщик и DiT-рендерер (два эксперта из статьи), временные рамки - это просто совпадение и архитектуры чем-то фундаментально отличаются.

        В любом случае отличная работа. Я рад, что появляются подобные новые модели от наших разработчиков.