§18.4.3
Multimodal evaluation 怎么做?MM-Vet / MMMU / SEED-Bench 各考察什么?
LLM 大模型 · 付费章节
每个框架的第 1 节免费。要读后续章节,可单独解锁本框架,或一次解锁 4 个框架。
或 Pro 订阅 ¥49/月 · 报名冲刺营 都包含解锁
- §18.4ImageBind 是什么?为什么 "一个 embedding 空间绑住 6 种模态" 是巧妙的?→
- §18.4Tri-modal alignment(audio + video + text)的核心挑战和解法?→
- §18.4非语音音频任务全谱:SED / Audio Tagging / Music Transcription / Room Acoustics→
- §18.1Mel-spectrogram 是什么?为什么所有 audio AI 模型几乎都用它而不是原始 waveform?→
- §18.1Spatial Audio / 3D 音频是什么?binaural / object-based / Ambisonics 三种渲染各适用什么场景?→
- §18.2wav2vec 2.0 的训练目标和架构是什么?为什么是 audio SSL 的里程碑?→