§18.2.2
AudioLM 是什么?为什么把 audio 当成 "language" 来生成?
LLM 大模型 · 付费章节
每个框架的第 1 节免费。要读后续章节,可单独解锁本框架,或一次解锁 4 个框架。
或 Pro 订阅 ¥49/月 · 报名冲刺营 都包含解锁
- §18.2wav2vec 2.0 的训练目标和架构是什么?为什么是 audio SSL 的里程碑?→
- §18.2MusicLM 是怎么做 text-to-music 的?跟 Stable Audio / Suno V3 有什么差异?→
- §18.1Mel-spectrogram 是什么?为什么所有 audio AI 模型几乎都用它而不是原始 waveform?→
- §18.1Spatial Audio / 3D 音频是什么?binaural / object-based / Ambisonics 三种渲染各适用什么场景?→
- §18.3Conv-TasNet 是什么?为什么直接在 waveform 上做 separation 比 STFT 域更好?→
- §18.4ImageBind 是什么?为什么 "一个 embedding 空间绑住 6 种模态" 是巧妙的?→