digestors.

Понятно, практично, по делу

MiniMax представила открытую нейросеть Music 3.0 для создания пятиминутных треков

MiniMax открыто опубликовала модель генерации музыки Music 3.0 с заявленным потолком композиции в пять минут.

MiniMax представила открытую нейросеть Music 3.0 для создания пятиминутных треков

По данным компании, система выдаёт готовый трек в одном проходе — от аранжировки до финального сведения — по текстовому описанию и опциональным текстам песни. Для читателей digestors это повод проверить не презентационные тезисы, а юридические и технические условия реального применения.

Архитектура и ключевые параметры

  • Полный цикл генерации: описание → языковое моделирование → аудио-рендеринг.
  • Три ключевых компонента: токенизатор, Hybrid-LM, стек синтеза. Каждый закрывает отдельную задачу — представление данных, моделирование структуры и деталей, реконструкция аудио.
  • Глобальная LLM — 8B параметров, инициализирована из Qwen3.5-8B. Предсказывает семантические токены покадрово и удерживает глобальный контекст композиции.
  • Локальная LLM — 0.6B, случайная инициализация. Отвечает за предсказание акустических токенов внутри фрейма по оси глубины.
  • Синтез: скрытые состояния глобальной и локальной моделей объединяются и поступают в flow-matching модуль на 2.4B параметров, затем в Flow-VAE декодер на 123M.
  • Восьмислойный RVQ. Первый слой фиксирует семантику и структуру. Оставшиеся семь кодируют акустические остатки прогрессивно.
  • Обучение поэтапное. Первый слой учится отдельно для стабильного информационного каркаса. Затем все кодбуки тренируются совместно для тонкой детализации звука.

Условия, которые требуется проверить

  • Лицензия. Заявлен статус открытой модели. Конкретный тип лицензии, объём доступных весов и допустимость коммерческого использования в сообщении не раскрыты.
  • Правовой контур. Использование сгенерированного вокала и инструментов в коммерческих продуктах требует отдельной проверки прав на обучающие данные и условий распространения производных треков.
  • Реальная длительность. Потолок в пять минут заявлен. Качество на полной длительности, а не на коротких демо-фрагментах, остаётся предметом независимой проверки.
  • Вокал. Подача позиционируется как «исполненная», а не синтезированная. Разборчивость дикции и инструментальная когерентность требуют сторонних аудиотестов.
  • Практический вход. Опубликован ли репозиторий с весами, каковы требования по VRAM, есть ли API и лимиты по частоте запросов — вопросы, на которые анонс не даёт ответа.

Вердикт

Техническая заявка структурирована. Hybrid-LM и flow-matching — рабочая связка для удержания структуры на длинных последовательностях. Многослойный RVQ разводит семантику и акустику по разным слоям. Без публикации лицензии, весов и независимых бенчмарков оценивать модель преждевременно. Позиция digestors: дождаться раскрытия условий доступа и первой волны независимых прослушиваний.