Suno v6 の生成結果と評価、Variety, Max Mode の説明 … v6はショボい。著作権対策か?
Suno v6 の生成結果と評価、Variety, Max Mode の説明 … v6はショボい。著作権対策か?
2026 年 9 月 9 日に Suno が v6 を出した。同時に v5 系を含む旧モデルが全部モデルピッカーから消えた。
v5 が出たときは結構な衝撃があり、使っていくうちにタグの情報量の限界を感じつつも、この先の v6 には「現代のポピュラーミュージックを全部過去にする AI」ぐらいの期待をしていた。
その不満と期待を歌った楽曲も作ったことがある (モア・タグ)。
しかし、v6が実際にリリースされ、実際に触った第一印象は「音楽の面白さが破綻している」であり、期待以下というか v5 以下だと感じた。メジャー感が無い。
ネットを見ると同じ時期に世界中で「音がこもった」「スピーカーに毛布を掛けたようだ」という声が上がっていて、MusicRadar は "muffled, generic, soulless garbage"、MusicTech は "The death of Suno" という見出しを付けている。一方で Recording Academy の投票権を持つ歴 30 年のエンジニアが同じ歌詞で v5.5 と比較して「音は v6 の勝ち」と言っていたりもする。
このブログ ytyng.com は記事ごとに歌詞を書いて Suno で BGM を作っている。つまり v6 以前に生成した曲が手元に残っている。旧モデルが消えた今、これは持っている人しか作れない比較になる。
作った楽曲
スタイルプロンプト
Three Drawers
100BPM, french electro pop, hyperpulse, artcore, glitch, sci-fi understones, lo-fi beat, ruspy tone, 808 sub base, atomospheric synths, haunting, stacked vocals on chorus part
french electro pop, hyperpulse, glitch という特徴的なタグを入れており、デジタル的な混沌を含めた電子ポップを生成する意図がある。
今までに v5 で作った曲だと、 Frozen Opacity (ブログ記事), Turtle Badge (ブログ記事), Antimatter(Suno), Undersong(Suno) といったものに類似したサウンドを狙った。
Credential Cereal
160BPM, alternative rock, math rock, solid guitar cutting, guittar arrpeggio, warm saturation, garage band energy, stacked vocals on chorus part, digital effects
math rock が特徴的に発現し、複雑なギターカッティングを含んだソリッドなロックサウンドを生成する意図がある。
今までに v5 で作った曲だと、Terabyte Whispers (ブログ記事), 秒針(Suno) といったものに類似したサウンドを狙った。
生成パターン
すべて、 Weirdness = 20%, Style Influence = 80% で統一。 そのうえで、 Variety を Off と Max の2パターンで生成し、 Max Mode も On と Off の2パターンで生成した。
Variety とは
楽曲生成時に、生成AIがスタイルプロンプトを再解釈し、変更して楽曲生成をする機能。
これは推測ではなく、公式の v6 FAQ にそう書いてある。
The Variety slider is designed to introduce variety in your outputs by adjusting and updating your style prompts.
If you'd like to retain full control of your style tags, reduce the Variety slider to 0.
つまり Variety は「生成の乱数の幅を広げる」機能ではなく、書いたスタイルプロンプトそのものを書き換える機能。0 にして初めて自分の書いたタグがそのまま通る。
Suno は、1回の生成で2曲作るが、2曲それぞれでプロンプトが少し変わる。
今回は Variety On の場合は複数回生成したが、生成した曲を自分で聴いて、一番まともに聞ける生成結果をパターン内で恣意的に1つづつ選んで公開している。
変換例
100BPM, french electro pop, hyperpulse, artcore, glitch, sci-fi understones, lo-fi beat, ruspy tone, 808 sub base, atomospheric synths, haunting, stacked vocals on chorus part
というスタイルを入力して、 Variety = Max で生成すると、
French electro pop, artcore: clipped electric guitar and ticket-stamp percussion over 808 sub base and atmospheric synths, 100BPM hyperpulse lo-fi beat, female ruspy-tone vocals with two-part harmony and stacked chorus layers, glitch processing, sci-fi undertones, distorted tape dropouts
French electro pop, female ruspy two-part vocal harmony with stacked chorus vocals, glitchy lo-fi production and sci-fi undertones, 808 sub base, atmospheric synths, clipped electric guitar, ticket-stamp percussion, haunting 100BPM hyperpulse groove
French electro pop, artcore at 100BPM with glitch hyperpulse and lo-fi tape distortion; female vocals in a raspy tone, close-mic verses with stacked harmonies and two-part chorus doubling; 808 sub bass, atmospheric synths, clipped electric guitar, ticket-stamp percussion; haunting half-time pulse with clipped electronic transitions
French electro pop, female vocal with a ruspy tone, close-mic verses and stacked harmonies in the chorus, hyperpulse glitch production with lo-fi tape grain, 100BPM steady midtempo pulse, 808 sub base, atmospheric synths, clipped electric guitar, ticket-stamp percussion, sci-fi undertones and haunting reverb tails
といったスタイルに変換される。
160BPM, alternative rock, math rock, solid guitar cutting, guittar arrpeggio, warm saturation, garage band energy, stacked vocals on chorus part, digital effects
というスタイルの場合、
Alternative rock, math rock at 160BPM with solid cutting guitar and interlocking arpeggios, male vocal driving tight verses and stacked harmonized chorus vocals in two-part harmony, warm saturation, digital effects, garage-band punch, handclaps, cash-register chimes, brass glissando
Alternative rock with math rock precision: solid cutting guitar and interlocking guitar arpeggios, male two-part vocal harmony with stacked harmonized vocals, warm saturation and digital effects, driving 160BPM garage-band pulse
Alternative rock, male lead with clipped talk-sung verses and stacked two-part chorus harmonies; solid cutting guitars interlocking with arpeggios, handclaps, cash-register chimes, and brass glissando; driving 160BPM math-rock pulse with garage-band punch; warm saturation, digital effects, tight vocal doubles, and a wide final-chorus lift
Alternative rock, math rock; male English vocals with clipped verse delivery and stacked two-part harmonized choruses; warm saturation, digital effects, cash-register chimes, handclaps, brass glissando; driving 160BPM garage-band pulse; solid cutting guitar interlocked with precise arpeggios, syncopated math-rock riffs, tight drums, and a full-power final chorus
といったスタイルに変換される。
書き換えの傾向
今回のプロンプトでは、書き換えは「長くする」方向に働いた。入力の 10〜12 語のタグ列が、30〜50 語の散文的な指示に膨らむ。そして膨らんだ部分には、自分が書いていない要素が入ってくる。
Three Drawers の例だと clipped electric guitar、ticket-stamp percussion、distorted tape dropouts、close-mic verses、half-time pulse は入力に無い。female というボーカルの性別指定も勝手に付いている。Credential Cereal 側も handclaps、cash-register chimes、brass glissando、male が追加されている。
歌詞の内容から編曲を推論しているらしく (Three Drawers は引き出しとチケット売り場の歌、Credential Cereal はスーパーマーケットの歌)、狙いとしては分かる。ただこれはスタイル指定の主導権が自分から離れるということでもある。
韓国の Suno 板に、この書き換えを約 1000 回試したという検証があった (DCinside)。匿名の投稿なので裏は取れていないが、報告されている傾向は今回の変換例と整合している。
- 書き換えの優先度は ジャンル名 > 楽器名 > 一般語。一般的な語ほど差し替えられる
Rockと書いて Max にすると、エレキギターの比率が半分近くに落ちてシンセやハーモニカが混ざる- 日本語の歌詞を入れると日本語のスタイルプロンプトが生成され、質が落ちうる
- 推奨は「探索は Normal〜Max、仕上げは OFF」
英語圏でも、書き換え後のプロンプトが元より短く弱くなるという指摘がある (roo.beehiiv.com)。これは Reddit の投稿をまとめたブログで、原投稿の URL は示されていない。今回の例では逆に長くなっているので、少なくとも一貫して短くなるわけではなさそう。
Max Mode とは
1 回の生成にかける計算量を増やすオプション。公式の v6 FAQ の説明はこう。
Max Mode is an option you can turn on for any generation when you want v6 to spend more on getting it right. It costs more credits and it's best for: songs longer than two minutes, covers where you want the result to stay close to the original, transferring the style of one song onto another, and keeping vocals and style consistent through the whole track.
注目したいのは、公式が挙げている用途が全部「一貫性」と「忠実さ」だという点。
- 2 分を超える曲
- 原曲に寄せたいカバー
- ある曲のスタイルを別の曲へ転写する
- 曲全体を通してボーカルとスタイルを一貫させる
音質を上げる機能だとは書いていない。「外さないための機能」であって「良くするための機能」ではない、という位置づけになっている。
トークン消費量は2倍になる。主観的には v6-wild の場合、 Max Mode = Off だと v5 よりさらにショボい生成結果、 Max Mode = On だと、 v5 に近しい生成結果になると感じた。
各モデルの違い
3 モデルとも 1 回の生成で最大 8 分まで。v6 と v6-wild は Pro / Premier のみ、v6-mini は無料枠を含む全プランで使える (公式ヘルプ)。
v6
Suno の説明は 2 か所にあって、少し表現が違う。
reliable, precise and consistently delivers polished music across every genre and style
Balanced, expressive, and built for a wide range of styles and prompts. Great for everyday creation.
reliable (信頼できる)、precise (正確)、consistently (一貫して)、balanced (バランスが取れている)。どれも外さないことを指す語で、「すごい曲ができる」方向の言葉が 1 つも無い。
他の人の評価も、この無難さに集中している。MusicRadar は解約を宣言するユーザーの声をまとめて "muffled, generic, soulless garbage" という見出しを付けた。記事中で繰り返されているのは「音がこもって鈍く、妙に生気がない」「ボーカルが埋もれる」「高域がほぼ消えた」。MusicTech の見出しは "The death of Suno"。プロンプト遵守についても、テンポ・ジャンル・編成・デュエットの役割指定が外れるという報告が複数の証言として整理されている (jackrighteous.com)。
一方で肯定側も居る。Recording Academy の Producers & Engineers Wing で投票権を持つ経験 30 年のエンジニアが、同じ歌詞・同じプロンプトで v5.5 と v6 の 3 モデルを比較して 「音そのものは v6 の勝ち」と結論している (暖かい / 広い / 低域が強い / ミックスに奥行きがある)。同時に「ボーカルに滲みを感じる人は間違っていない、エンジニアとしては自分にも聞こえる」とも述べている (検証動画)。
ドイツ語圏のメディアは技術面を肯定的に評価していて、楽器編成・ボーカル・雰囲気といった音楽的な概念を前バージョンより大幅に理解する、polished, radio-compatible だと書いている (basic-tutorials)。
ここは評価が割れているというより、見ている軸が違うのだと思う。「録音物として仕上がっているか」で見れば v6 は勝ちうるし、「聴いて面白いか」で見れば負ける。
自分の評価は後者。全体的に、気持ち良い音楽理論からは悪い意味で逸脱していると感じる。 あまり商用性というかメジャー感、王道感を感じない、悪い意味で期待を裏切られ続ける楽曲が作られる。
音楽に人生をかけていない人が大量に作ったテキトーな楽曲をひたすら学んで生成している感じがする。
実用できる感じが全くしない。
Suno は学習データの構成を公開していない。そもそも AI 音楽の学習データ監査では、2024 年の時点で データ時間の約 86% が Global North の音楽に集中し、ギター・ピアノ・ドラムは学習クリップの 52〜67% に存在する一方、シタール・タブラ・アコーディオン・バグパイプは合計 3% 未満という偏りが報告されている。ニッチジャンルが弱いのは v6 固有の問題ではなく、この分野全体の構造的な傾向でもある。
v6-wild
less predictable and more varied, producing unexpected, textured and ambitious results
A more experimental take on v6. Leans into unexpected choices, genre-blending, and results that push further from the prompt.
unexpected (予期しない)、genre-blending (ジャンルの混合)、push further from the prompt (プロンプトからさらに離れる)。creative な事故を狙うモデル、という位置づけになっている。
他の人の評価は割れている。Reddit をまとめたブログは、ローンチ当日のテスターの声として v6-wild の生成の約半分が壊れて使い物にならなかった という報告を紹介している (roo.beehiiv.com)。台湾の個人ブログは「wild は途中で歪むので全部聴いたほうがいい」と書いている (jiuliyue.com)。avant-garde や glitch jazz で良い結果が出たという投稿もある一方、アーティファクトと反復生成への批判も記録されている (jackrighteous.com)。
なお、後述する WildSongBench のスコアでは v6-wild は v6 より低い (6.4195 対 6.5562)。
主観では、v6-wild は v5 に近いモデルだと感じており、使い勝手が良い。v5.6 って感じか?
このような評価をしている人は、調べた範囲では見つからなかった。公式は別モデルだと説明していて、それを覆す材料も無い。これは主観でしかない。
公式では、創発に向いているっていう方針らしいけど私はそういうイメージじゃなくて、v5 を使ってきた中だと安心感がある。
というより v5 系より少ししょぼい感じがする。ので v5マイナス って感じかな。
ちなみに v5, v5.5 は今は選べなくなっているので、もしかしたら商用楽曲のライセンスに配慮して(まずいものを抜いて)安全な素材のみで学習しなおしたって感じなのかな。そう考えるとけっこういろいろ腑に落ちる感じがする。
v5 の時に特徴的だった math rock や hyperpulse, glitch というタグを入れているが、あまりいい発火をしていないので、v5 より情報量というか発現タグが少ない感じ。
v6 よりは v6-wild のほうが俺の好みには近いと感じるが、 v5 よりショボく上手に使いこなすにはまだ時間が必要なんだと感じる。というか使う気にならない。
v6-mini
faster, more efficient version available to everyone … delivers better, faster results than any free model
A lighter, faster variant. Ideal for quick ideas, high-volume generation, and exploring concepts before committing to a full generation.
無料枠で唯一使える v6 系という位置づけで、公式も「本番の前に案を探るため」と書いている。品質で勝つモデルとしては売られていない。
評価も概ねその線に沿っている。台湾の個人ブログは「無難なトランスポップ寄り」と書いている (jiuliyue.com)。韓国の Suno 板には「質素なローファイ感があり、狙って使う価値がある」という評価があった (DCinside)。一方で、有料のフラッグシップよりアーティファクトが多いという指摘もある。意外にも保存に値する結果が出る、リミックス用途では良いという報告も記録されている (jackrighteous.com)。
自分の印象も、下位モデルとしては筋が通っている、というもの。v6 や v6-wild に対して「速くて安い代わりに粗い」という関係になっていて、その粗さが素朴なローファイとして機能する場面はある。
スペクトル計測
音質の客観的な評価として、スペクトルの計測もしてみた。
「曲の良さ」とスペクトルはあまり関連性は無いが、機械計測できる客観的な差としてこれぐらいしか思いつかなかったので実施した。
v6 は 2〜12kHz が 2〜3.4dB 落ちていて、スペクトル重心が 36% 下がっていた。一方で「過圧縮」という評判は支持されなかった。 狭くなったのは帯域であって、ダイナミクスではない。
測ったもの
2026 年 9 月 22 日の 23:03 から 23:43 までの 40 分間で、2 曲ぶんの歌詞を使って 24 本を生成した。
- 曲:
Credential CerealとThree Drawersの 2 種類 (どちらもこのブログの記事から作った歌詞) - モデル:
v6/v6-wild/v6-miniの 3 つ - Max mode: On / Off
- Variety スライダー: Off / 有効
2 曲 × 3 モデル × 2 × 2 で 24 本。同じアカウント、同じ 40 分、同じ歌詞なので、モデルと設定以外の条件はほぼ揃っている。
比較対象として、このブログに載せている v6 以前の曲を 12 本使った。生成日は 2026 年 7 月 26 日から 8 月 31 日で、v6 リリースの 9 日から 10 日以上前なので v5 系にあたる。生成プロンプトは今回 v6で作ったものとは違う。
計測は ffmpeg でデコードして FFT にかけた。帯域エネルギーはフルバンド RMS に対する相対 dB で出している。絶対値で出すとラウドネスの差だけで順位が動いてしまうため。曲頭と曲尾のフェードを避けて中央 80% だけを使い、無音フレームは除外した。
コーデックの違い
2 つのセットはコーデックが違う。今回、Suno は m4a 形式でのダウンロードができるようになったので使ってみた。以前は mp3 と wav のみだった。
そのため、今回の計測はコーデックによる特徴の変化も含むことになるので、厳密な v6 vs v5 とはなっていないため注意してほしい。
v6 の 24 本は mp4 コンテナに入った Opus 132kbps / 48kHz。v6 以前の 12 本は MP3 約 180kbps VBR / 48kHz。どちらも 48kHz なので、コーデック側の帯域上限が測定に効いてくるのは 16kHz より上の領域になる。
再エンコードして揃えることはしていない。普段このブログに載っている音は mp3 で、今回 v6 で聴いていた音は m4a なので、この 2 つを素のまま比べるのが実際に耳にしている状態にあたる。揃えると、どちらの数字も「実際に聴いていない音」のものになる。
結果
v6 以前 12 本 (mp3) と v6 24 本 (m4a) の平均。
| 指標 | v6 以前 (12本) | v6 (24本) | 差 |
|---|---|---|---|
| Integrated LUFS | -14.84 | -13.72 | +1.11 dB |
| True peak | -2.35 dBTP | -0.60 dBTP | +1.75 dB |
| LRA | 3.74 | 5.65 | +1.91 |
| クレストファクター | 14.53 dB | 14.70 dB | +0.17 dB |
| 200-400Hz | -10.28 | -10.73 | -0.45 dB |
| 2-5kHz | -13.07 | -15.17 | -2.10 dB |
| 5-8kHz | -17.98 | -20.17 | -2.19 dB |
| 8-12kHz | -17.00 | -20.35 | -3.36 dB |
| 12-16kHz | -23.48 | -25.75 | -2.27 dB |
| スペクトル重心 | 866 Hz | 557 Hz | -36% |
| ロールオフ95% | 4774 Hz | 2228 Hz | -53% |
平均だけだと外れ値に引っ張られている可能性があるので、36 本の総当たり 288 通りでも見た。
- 8-12kHz は、v6 以前の方が高い組み合わせが 260 通り (90.3%)
- ロールオフ95% は 250 通り (86.8%)、スペクトル重心は 244 通り (84.7%)
- 2-5kHz は 206 通り (71.5%)
- true peak は逆で、v6 の方が高い組み合わせが 276 通り (95.8%)
v6 側は 2 曲しかないので、曲ごとにも分けた。
| LUFS | True peak | LRA | 2-5kHz | 8-12kHz | 重心 | |
|---|---|---|---|---|---|---|
| v6 以前 (6曲12本) | -14.84 | -2.35 | 3.74 | -13.07 | -17.00 | 866 Hz |
| v6 Credential Cereal (12本) | -14.25 | -0.58 | 5.39 | -12.88 | -19.35 | 685 Hz |
| v6 Three Drawers (12本) | -13.19 | -0.63 | 5.92 | -17.46 | -21.36 | 429 Hz |
2 曲とも独立に、v6 以前より暗い。 8-12kHz はどちらも 2.3dB 以上落ちている。
「こもる」「毛布を掛けたよう」という言葉が指しているものは、これだと思う。
ダイナミクス・コンプレッションの変化
ネットで繰り返されている不満に "overproduced, heavily compressed" がある。潰されて平板になった、という主張。手元の音源はそうなっていない。
- クレストファクターは 14.53 → 14.70 dB でほぼ同じ (+0.17dB)。ピークと RMS の比が変わっていない = 波形の潰れ具合は変わっていない。総当たりでも v6 以前の方が高い組み合わせが 50.7%、v6 の方が高い組み合わせが 49.3% で、差が無い。
- LRA はむしろ v6 の方が 1.91 広い (3.74 → 5.65)。曲中のラウドネスの振れ幅は増えている。総当たりでは 92.0% の組み合わせで v6 の方が広い。
圧縮が強まったなら、クレストファクターは下がり LRA は狭くなるはずで、両方とも逆に出ている。
つまり 狭くなったのは帯域であって、ダイナミクスではない。高域が無い音を聴くと「詰まっている」「潰れている」と感じやすいので、耳の印象としては分かるが、原因の指し先が違う。ここを取り違えたままコンプレッサーを疑っても直らない。
ピークの変化
もうひとつ、圧縮とは別に明確な変化がある。
True peak が -2.35 dBTP から -0.60 dBTP に上がっている。 総当たりで 95.8% の組み合わせで v6 の方が高い。Integrated LUFS も 1.11dB 上がっている (87.5%)。
クレストファクターが変わっていないのに天井だけ 1.75dB 上がったということは、波形の形は変えずに全体を持ち上げた、つまり、出力のマスタリング/リミッター設定が変わったということになる。0 dBTP まで 0.6dB しか残っていないのは配信基準としてはかなり良くなっている。
この実測の限界
数字を出したので、限界も書いておく。
一番大きいのは、曲とジャンルが統制されていないこと。 v6 側は 2 曲、v6 以前は 6 曲で、それぞれ別のプロンプトから作られている。スペクトル重心はジャンルで大きく動くので、この差の一部、あるいは全部が「曲が違うから」である可能性は消せていない。同じ歌詞・同じプロンプトを v5 と v6 に通せれば決着するが、v5 はもう選べない。
次に大きいのがコーデック。 上に書いたとおり、v6 側は m4a (Opus 132kbps)、v6 以前は mp3 (約 180kbps VBR) で、素のまま比べている。聴いている状態に合わせた意図的な選択だが、差の一部がコーデック由来である可能性は残る。ただし 8-12kHz はどちらのコーデックも素通しする帯域で、そこで 3.36dB の差が出ているので、これを全部コーデックで説明するのは無理があると思っている。
それから、v6 以前の 12 本が v5 なのか v5.5 なのかは、生成日から推定しているだけで確認できていない。
Suno 内部のマスターはどちらの形式よりも高域があるはずで、測っているのはあくまで書き出し後の音。
v6 への転換について、何が起きているのか
v6 の位置づけは、Suno 自身の説明を読むとはっきりしている。
公式ブログは v6 を "reliable, precise and consistently delivers polished music across every genre and style" と説明していて、外さないことを前面に出している。v6-wild が "less predictable and more varied"、v6-mini が "faster, more efficient"。そして "developed with our industry partners, including Warner Music Group, BMG and Believe" と、レーベルとの協業を明記している。
旧モデルについては "As v6 rolls out, we will retire our previous models and move Suno entirely onto the v6 generation."
時系列に並べると、これは音楽的なアップデートというより権利処理の履行に見える。
| 日付 | 出来事 |
|---|---|
| 2024-06 | UMG / Sony が Suno を提訴 |
| 2025-11-25 | Warner と和解。公開された条件に 「2026 年にライセンス済みモデルを出して現行モデルを deprecate する」「有料アカウントにも月次のダウンロード上限を設ける」 が入っている |
| 2026-07-31 | ミュンヘン地裁で GEMA が勝訴 (LG München I, 42 O 763/25、未確定) |
| 2026-09-03 | ダウンロード上限が発効 (Pro 20曲/月、Premier 60曲/月) |
| 2026-09-09 | v6 リリース、旧モデル廃止 |
| 2026-09-18 | UMG / Sony が第2次提訴 (No. 1:26-cv-14275, D. Mass.) |
9 月 3 日のダウンロード上限と 9 月 9 日の旧モデル廃止は、偶然重なったのではなく、10 か月前の和解で予告されていた条件そのものが実行されたものだった。これは Warner のプレスリリースに書いてある。
そして興味深いのが第 2 次提訴の中身で、UMG と Sony は v6 を "the fruit of the same poisoned tree" (同じ毒された木の果実) と呼んでいる。v6 は旧モデルの出力・ユーザーの嗜好データ・knowledge distillation を使って作られているので、ライセンスを取っても侵害は洗浄されない、という主張。訴状では Audible Magic で照合して一致した録音 60,202 件を挙げている。
念のため書いておくと、これは原告の主張であって裁判所の認定ではない。Suno 側は「事実面でも法律面でも根本的に欠陥がある」と反論している。
ただ、事実として言えることが 1 つある。Suno はライセンス契約を結んで新モデルに移行したのに、大手 2 社との訴訟リスクは解消していない。
なお、リリースから 2 週間、Suno は品質への批判に対して公式には何も言っていない。ブログも X も宣伝だけ。一方で第 2 次提訴には翌日に反論を出している。
生成品質はどう変わったか
「劣化した」という話と「向上した」という話が同時に成立してしまう理由は、評価条件が揃っていないからだ。
これを解消するには同じプロンプトを v5 と v6 に通せばいいのだが、旧モデルが消えた時点で、新規生成での同条件比較は誰にもできなくなった。過去の生成物を持っている人が、今回のように後から測ることはできる。ただし新しく条件を揃えることはできない。
そして Suno は listening test もベンチマークスコアも公表していない。
唯一見つかった定量データは、オープンモデル YuE2 が公式サイトで公開している WildSongBench (192 プロンプト、自動指標 9 種、17 の system setting を比較) のスコア。
| モデル | SongBench 平均 |
|---|---|
| YuE2 (best-of-8) | 6.9632 |
| Suno v5 | 6.8721 |
| Suno v6 | 6.5562 |
| Suno v6-wild | 6.4195 |
Suno 自身の系譜で v5 → v6 はスコアが下がっている。
ただしこれは競合するオープンモデルの開発者自身が出した数字で、独立検証は見つからない。しかも自社を best-of-8 (8 回生成して SongBench Musicality で選ぶ) で、他のシステムは別の選び方で比べている。人間の盲検リスニング試験ではなく自動指標でもある。同サイト自身も、選定手順が揃っていないので直接比較は方法論的に複雑だと注記している。決定的な証拠としての採用は難しい。
つまり、「v6 は劣化した」も「v6 は向上した」も、もう誰も証明できない状態になっている。個人的にはこれが一番厄介だと思っている。
乗り換えるとしたら
高品質なAI音楽生成をしたいとしたら、今後どうしたらいいか。 Suno は選択肢に入らないと感じている。
商用サービスの乗り換え先は、調べた範囲では芳しくない。Udio は 2025 年 10 月以降ダウンロードを止めていて外に出せない。ElevenLabs Music v2 は規約で映画・TV・ゲーム用途が Enterprise 限定。
現実的なのはオープンモデルをローカルで動かす方向で、ライセンスを読んだ結果 ACE-Step 1.5 が第一候補になった。
| ライセンス | VRAM | 日本語 | |
|---|---|---|---|
| ACE-Step 1.5 | MIT。モデルカードに「生成物は商用利用可」と明記 | 4GB 未満から。3090 で 1 曲 10 秒未満 | 50 以上の言語に対応 |
| YuE2-3B | コードは Apache-2.0 だが 重みは CC BY-NC 4.0。個人なら出力の収益化可、企業の商用は別契約 | 24GB 級 (ピーク 14GiB) | 公式タグは zh / en のみ |
| MiniMax Music 3 | 商用可だが UI に "MiniMax-Music3" の表示義務。年商 2,000 万ドル超は事前許可 | 24GB 未満 (層ストリーミングで 8GB) | 未確認 |
「オープンウェイト」は「オープンソース」でも「無条件に商用利用可」でもない。ベンチマークのスコアだけ見て YuE2 に行くと、企業で使う場合にライセンスで詰まる。
もっとも、オープンモデル側に権利リスクが無いわけでもない。学習データを開示しているのは YuE2 (CC0 と合成データ中心) と ACE-Step (ライセンス楽曲 + PD + MIDI 合成) ぐらいで、他は非開示。
「ライセンス整備で商用モデルの表現力が落ちた結果、オープンモデルが追いつく余地が生まれた」という筋書きは話としては面白いが、因果を示す材料は何も無い。そう見える、というだけ。
開発相談をお待ちしています。