
В мире генеративного ИИ всё меняется стремительно. Этим летом музыкальное ИИ‑сообщество столкнулось с сюрпризом: разработчики Suno навсегда отключили полюбившиеся многим старые версии моделей (v4, v4.5, v5 и v5.5).
Пользователи нашей ИИ‑платформы GPTunneL (агрегатора нейросетей) массово жаловались: пропал тот самый вайб, а новые алгоритмы стали слишком жесткими. К тому же в Suno всегда была одна фундаментальная проблема, которая бесила многих креаторов — там нельзя было просто взять и поменять текст в уже готовом, сгенерированном треке.
Мы выслушали боль нашей аудитории, посмотрели на то, чего не хватает рынку, и решили сделать свой продукт.
Сегодня, 18 сентября, мы официально запускаем Grom Zvuk — нашу собственную музыкальную ИИ‑модель. Она работает на наших серверах, выдает крутое качество, делает невероятные каверы и стоит дешевле западных аналогов. Рассказываем, как она устроена и на что способна.

Что такое Grom Zvuk и как это звучит
Grom Zvuk — это первая музыкальная модель в нашем семействе «Гром». Задача амбициозная: чтобы генерация полноценного трека по вашему промпту стоила копейки, а управлять процессом было проще, чем в существующих аналогах.

Zvuk уже доступен в GPTunnel.
Попробуйте модель здесь:
Модель генерирует треки длительностью до 5 минут (можем расширить лимит до 6 минут), с вокалом или в виде инструментала.
Вместо тысячи слов — лучше послушать, что она умеет делать прямо из коробки:
Ещё примеры
Киллер‑фичи: свобода, каверы и работа с готовыми треками
Главная проблема большинства музыкальных нейросетей — вы получаете «черный ящик». С Grom Zvuk мы пошли дальше простой генерации по тексту. Модель умеет работать с уже готовыми треками. Замысел трека живет в партитуре, поэтому песню можно править частями.
Создание каверов (свой текст на готовую музыку). Берём существующую песню, подставляем туда свои собственные стихи и меняем жанр. Музыка и вокальный рисунок остаются узнаваемыми, а слова — ваши.
Смена жанра и стиля. Тот же трек, тот же оригинальный текст, но совершенно другой жанр. Хотите сделать из баллады Артиста кантри в стиле лап‑стил или суровый хардкор? Легко.
Отсутствие строгой модерации. Пока западные сервисы закручивают гайки по авторским правам (блокируя всё, что отдаленно напоминает известных артистов), мы даем создателям свободу. Строгой модерации у нас, что открывает огромный простор для экспериментов с каверами и стилизациями.
Под капотом: как устроена генерация
Мы не используем сжатые «черновики». Grom Zvuk сразу отдает результат в 48 кГц, стерео, с настоящей стереопанорамой. (Кстати, сейчас дорабатываем поддержку lossless‑форматов, они появятся чуть позже.)
Генерация идет одним проходом. Модель прорабатывает все части трека одновременно. Сначала она заливает шумом всю длину будущей песни и размечает структуру: где встанут куплеты, где припев, а где бридж. Затем в несколько подходов превращает этот шум в звук. Интро, куплеты, припев и финал считаются как одна цельная композиция. Поэтому промежуточного результата не существует: трек появляется, когда досчитан целиком. Зато части не спорят друг с другом, а сведение звучит монолитно на всю длину.

Архитектурно конвейер устроен так: работают два эксперта под общим вниманием (attention). Первый пишет музыку символами, выстраивая композиционную логику, а второй разворачивает эти символы непосредственно в акустический сигнал.

Мультиязычность без акцента. Модель поет на любом языке (включая: русский, английский, китайский, японский, казахский, испанский, немецкий, французский, корейский, итальянский, португальский, турецкий, арабский, хинди и др.). В отличие от многих западных нейросетей, Grom Zvuk отлично понимает русские ударения и фразировку.
Синтетические тесты: бьем Suno v6
Мы провели слепое тестирование на выборке из 150 запросов. Оценивались два параметра: качество звучания (насколько аудио похоже на реальную студийную запись) и точность следования тексту (не путает ли модель слова, поет ли ровно то, что заказали). Названия моделей оценивающим не показывались.

По синтетическим бенчмаркам Grom Zvuk уверенно соревнуется с Suno v6 в балансе между точностью текста (85/100) и качеством звучания (83/100). По точности воспроизведения заданных текстов наша модель входит в первую тройку мирового рынка, обходя популярную Mureka.
Стоимость модели и условия для B2B
Мы сделали модель, которая работает на наших собственных мощностях.
Базовая стоимость генерации трека — 8 рублей, до конца сентября скидка 50%!
Для кого эта модель:
Музыкантам и креаторам: для создания быстрых демо, поиска аранжировок, экспериментов с жанрами и генерации фоновой музыки (например, эмбиент, лоу‑фай для видео).
Агрегаторам и бизнесу: готовы предоставить доступ к Grom Zvuk по API. Можем масштабировать кластеры ускорителей под конкретные объемы B2B‑клиентов. Для партнеров есть тестовый период.
GPTunneL — это ИИ‑платформа. В одном окне без VPN и сложных регистраций мы объединяем более 100 топовых ИИ‑инструментов: ChatGPT, Claude, Midjourney, Kling и другие, а также музыкальные Suno, Mureka и MiniMax. На платформе уже 1,5 млн пользователей.
Grom Zvuk пополнил наше проприетарное семейство моделей Grom, куда уже входят:
Grom GPT — флагманская текстовая модель (работает быстро, поддерживает русский, бесплатный в базовый вариант).
Grom Nova и Grom Art — генерация картинок по описанию, а также инпайнтинг, замена объектов и стили.
Grom TV — генерация видеороликов от 3 до 20 секунд.
Grom Pixel — умный апскейл до 100 мегапикселей с восстановлением фактуры.
Grom Zvuk уже доступен в разделе «Музыка» в GPTunneL рядом с Suno и Mureka. Заходите, тестируйте, ломайте жанры и делайте каверы!
Ждем ваших треков и фидбека в комментариях!
Комментарии (11)

ToxaBes
18.09.2026 10:42Признавайтесь, дообучили ACE-Step 1.5? :)
По описанию эта же архитектура. В любом случае, отличная работа, эта модель как раз и создана для подобного (в том числе коммерческого) использования.

Master_AI Автор
18.09.2026 10:42Нет, это не ACE-Step, Grom Zvuk фундаментально отличается от ACE-Step по архитектуре.

ToxaBes
18.09.2026 10:42Значит, практически полностью описанная в этой статье архитектура ACE-Step: одношаговая полнотрековая диффузия, LM-планировщик и DiT-рендерер (два эксперта из статьи), временные рамки - это просто совпадение и архитектуры чем-то фундаментально отличаются.
В любом случае отличная работа. Я рад, что появляются подобные новые модели от наших разработчиков.
Sazonov
Ваша модель может отдавать сгенерированную музыку отдельными дорожками для каждого инструмента? Как бы именно это - киллер фича Suno.
Master_AI Автор
Может, но пока мы не добились такого качества, чтобы показать это публике, сейчас фокусируемся на частичном редактировании трека – эта фича может появиться в ближайшее время.