概念
不随版本变化
音频与音乐生成:另一类非图像输出
同样的工作流范式,换成声音:输入是文字或音频,输出是波形。
工作流的范式是一样的:给条件,让模型生成。区别在输出是一段波形而不是一张图,所以参数表、时长概念和评估方式都不一样。
音频生成的几种任务
| 任务 | 输入 | 输出 |
|---|---|---|
| 文生音乐 / 音效 | 文字描述(风格、情绪、乐器) | 一段音频 |
| 歌声合成 | 歌词与曲风描述 | 带人声的片段 |
| 翻唱 / 音色迁移 | 一段演唱加目标音色 | 换音色后的同一段演唱 |
| 语音合成(朗读) | 文字 | 语音 |
| 语音识别 / 转写 | 音频 | 文字(常用于给视频自动上字幕) |
与图像流程的异同
- 相同点:都有「种子 + 条件 + 迭代」这套结构,也都有步数、引导强度这类参数
- 不同点:输出是随时间变化的信号,所以「时长」和「采样率」取代了「分辨率」成为主要约束
- 不同点:音频的「连贯性」要求更高,接缝处的杂音比视频的跳帧更容易被听出来
时长与采样率
时长决定生成多少内容:做更长的音频通常需要分段生成再拼接,接缝处要做淡入淡出处理。采样率决定音频能表示的频率上限,它由模型与输出设置决定,事后提高采样率不会让音频变清楚。
常见误解
常见误解
- 把生成的音频直接拉长
拉长(变速)会同时改变音高与音色。要更长的内容应该分段生成再拼接,而不是把成品拉伸。 - 以为文字描述能精确控制乐谱
它擅长控制风格、情绪、配器走向,不擅长精确指定旋律与和声进行。要精确控制得用参考音频或分段引导。 - 忽略采样率与格式的匹配
下游工具对采样率有要求,格式不匹配会出现变速或无法导入。衔接处按下游工具的要求导出。
知仓学习社