|
一、先把音频「翻译」成模型能处理的 Token 音乐生成比文本生成难,难在信号形态不同。文字是离散符号,音频是连续波形——采样率 24kHz 意味着每秒 24,000 个采样点。直接丢进 Transformer,算力和上下文长度都吃不消。 Suno 走的是业界主流路线:先把音频压缩成 Token,再用大模型预测下一个 Token。Meta 开源的 AudioCraft 体系里,EnCodec 这类神经编解码器可以把 24kHz 音频压到每秒约 300 个 Token(4 个码本、码率约 3kb/s),再喂给 GPT 式自回归模型。
| 对比项 | 文本大模型 | 音频音乐模型 | 输入形态 | 离散词元 | 连续波形,需先 Token 化 | 每秒 Token 量 | 几个到几十个 | 原始采样上万,压缩后仍数百 | 核心难点 | 语义对齐 | 压缩率与音质的权衡 | 常用架构 | 纯 Transformer | Transformer + 扩散模型组合 |
创始人曾提到,团队同时用了自回归模型和扩散模型,各取所长:自回归擅长结构推进,扩散在细节质感上更灵活。压缩率越高,预测越轻松,但音质越容易糊——Suno 能在「能算」和「能听」之间找到甜点,是迭代快的重要前提。
|