MiniMax、階層的生成を用いた5分間の楽曲向けMusic 3をリリース

Yan Junjie'sのモデルは長期的な構成を音響レンダリングから分離し、詳細なセクション単位の制御を受け付けるが、検証時点では公式の学習済み重みは入手できなかった。

By · Published

Primary source: MiniMax

Why it matters

Music 3 gives developers a detailed view of a five-minute song model that separates long-range composition from acoustic rendering. Its repository and demo expose the architecture, input controls and selected outputs, while the official weights were not yet available at verification.

MiniMax releases Music 3 for five-minute songs with hierarchical generation

MiniMaxYan Junjie によって設立された上海拠点のAI企業は、2026年8月13日に Music 3 を発表し、歌詞と詳細な制作ブリーフから最大5分の楽曲を生成するオープンウェイトのモデルであると説明しました。公開デモと技術資料はローンチ時に利用可能でした。公式リポジトリ にはドキュメントとアセットが含まれていましたが、公式のリリース資料ではモデルの重みはまだ公開されていませんでした。MiniMax はまた ModelScope の掲載 を行いました。

MiniMaxのX

発表では開発者に対して Hugging Face のモデルページGitHub リポジトリModelScope、および 公開デモ への案内が示されました。MiniMax は Music 3 を「プロダクション対応」と称していますが、その根拠として提示されているのは現時点では企業が選定したサンプルと再現可能な生成例であり、独立した品質テスト、公開された顧客、またはプロフェッショナルスタジオでの採用といった裏付けは示されていません。

このリリースは、Yan が SenseTime において6年以上務め、副社長および研究所副所長に昇進した後に進めた技術的な道筋に沿うものです。MiniMaxの経営陣略歴 によれば、Yan は中国科学院自動化研究所で人工知能の博士号を取得し、その後清華大学でポストドク研究を行ったとされています。MiniMax の 年次報告書 は彼を会長、CEO、CTO として記載しており、モデル研究と企業戦略を創業者が統括していることが示されています。

階層構造を中心に構築された楽曲モデル

公式モデルページ によると、Music 3 は作曲(コンポジション)と音響レンダリングを分離しています。Qwen3-8B から初期化された80億パラメータのGlobal LLMが長距離の構造を扱い、最初のセマンティック音楽コードブックを予測します。6億パラメータのLocal LLMがフレームレベルの音響ディテールをさらに7つのコードブックにわたって埋めます。

これらのモデルの隠れ状態は、24億パラメータのFlow Matchingモジュールと1.23億パラメータのFlow-VAEデコーダに供給されます。Music 3 は32 kHz、16ビットのステレオWAVファイルを生成します。MiniMax はこのアーキテクチャがフルソングにわたるリズム、ボーカルのアイデンティティ、音楽的テーマ、およびアレンジの変化を維持するのに役立つと述べています。

ユーザーは二つの入力を供給します:歌詞と音楽の説明(ミュージック・ディスクリプション)。歌詞には [Intro]、[Verse]、[Pre-Chorus]、[Chorus]、[Bridge]、[Instrumental]、[Solo]、[Outro] といったセクションラベルを含めることができます。説明ではジャンル、BPM、キー、感情の推移、ボーカルの音色、コーラス(バッキングボーカル)、楽器、打楽器、およびアレンジの変化を指定できます。

そのインターフェースにより、開発者は抑制された最初のヴァースを要求し、コーラスでドラムを導入し、ブリッジでギターソロを確保するといった指示が可能になります。これらのコントロールは Music 3 に単一のテキストプロンプトを超えた楽曲制作の語彙を与え、ユーザーが5分にわたるアレンジの変化を記述できるようにします。

モデル資料に記載されたトークナイザは8つの residual-vector-quantization(残差ベクトル量子化)コードブックを使用します。1つの16,384エントリのコードブックがセマンティックな内容を表現し、7つの1,024エントリのコードブックが音響ディテールを担います。推論の指示では1秒あたり25オーディオフレームでの生成が記載されています。

開発者がテストできること

MiniMax は Music 3 をオープンウェイトのリリースであると説明しましたが、2026年8月13日に確認した時点では配布は不完全でした。公式リポジトリにはドキュメントとデモ用アセットが含まれていましたが、公式の重みファイルはまだ利用できませんでした。

デモは入力フォーマットを確立し、選定された出力を提供します。

入手可能なモデル資料は意図された推論セットアップについても説明しています。モデルカードによれば、CPUオフロードはビデオメモリ使用量を概ね8 GB程度まで削減できるとされています。リポジトリの指示は CUDA を要求し、ノンストリーミング生成を説明し、2基のGPUを想定しています。

Music 3の背後にいる会社

MiniMax は2022年初頭に設立され、テキスト、オーディオ、画像、ビデオ、音楽にまたがるモデルと製品を開発しています。MiniMax は自社の説明で、同社のモデルと製品が200以上の国・地域で3億人以上の個人と、100以上の国・地域で100万以上の企業・開発者に利用されていると述べています。これらは会社全体の数値であり、Music 3 の採用状況が個別に示されているわけではありません。

Fortune によれば、Alibaba は2024年3月に評価額25億ドル超で6億ドルの資金調達ラウンドを主導し、HongShan も参加しました。MiniMax はその後2026年1月に香港で上場し、Reuters によればIPOで約6.19億ドルを調達しました。

MiniMax の2025年年次報告は、売上高が2025年に7,900万ドル(2024年の3,050万ドルから増加)であり、研究開発費が2億5,280万ドルであったと記録しています。年次報告は2025年末時点の従業員数を418名(常勤415名、非常勤3名)と記載しています。これらの数値は Music 3 チームではなく MiniMax Group 全体を対象としています。

Music 3 の5分間の出力は、別のダウンロード可能な音楽モデルファミリーと範囲を同じくします。Stability AI の Stable Audio 3.0 は、同社の資料によればおおよそ6分の作曲をサポートするオープンウェイトの比較対象です。

Suno や Udio といったホスティング型の競合は、ローカルで推論インフラを管理する手間をユーザーから省きます。Music 3 のモデル資料は意図されたローカル推論のセットアップを説明していますが、公式の重みは確認時に利用できませんでした。

MiniMax は Hailuo AI(MiniMax の画像およびビデオサービス)からの無断学習および出力に関連して、Disney、Universal、および Warner Bros. Discovery によって提起された米国の著作権訴訟を争っています。この訴訟は Music 3 に特化したものではありません。

Yan は Music 3 を用いて、より長い楽曲と詳細なアレンジ制御を求める開発者に対して MiniMax のオーディオ研究を提示しようとしています。その階層的アーキテクチャと5分間のデモは、初期的な評価の基礎を開発者に提供します。公式の重みはリリース資料確認時点ではまだ利用できませんでした。

Reader comments

Conversation for this story loads after sign-in.