音频与音乐生成:另一类非图像输出 / 全站资源搜索
搜索 更新 2026-10-02
概念 不随版本变化

音频与音乐生成:另一类非图像输出

同样的工作流范式,换成声音:输入是文字或音频,输出是波形。

工作流的范式是一样的:给条件,让模型生成。区别在输出是一段波形而不是一张图,所以参数表、时长概念和评估方式都不一样。

音频生成的几种任务

任务输入输出
文生音乐 / 音效文字描述(风格、情绪、乐器)一段音频
歌声合成歌词与曲风描述带人声的片段
翻唱 / 音色迁移一段演唱加目标音色换音色后的同一段演唱
语音合成(朗读)文字语音
语音识别 / 转写音频文字(常用于给视频自动上字幕)

与图像流程的异同

  • 相同点:都有「种子 + 条件 + 迭代」这套结构,也都有步数、引导强度这类参数
  • 不同点:输出是随时间变化的信号,所以「时长」和「采样率」取代了「分辨率」成为主要约束
  • 不同点:音频的「连贯性」要求更高,接缝处的杂音比视频的跳帧更容易被听出来

时长与采样率

时长决定生成多少内容:做更长的音频通常需要分段生成再拼接,接缝处要做淡入淡出处理。采样率决定音频能表示的频率上限,它由模型与输出设置决定,事后提高采样率不会让音频变清楚。

常见误解

常见误解
  • 把生成的音频直接拉长
    拉长(变速)会同时改变音高与音色。要更长的内容应该分段生成再拼接,而不是把成品拉伸。
  • 以为文字描述能精确控制乐谱
    它擅长控制风格、情绪、配器走向,不擅长精确指定旋律与和声进行。要精确控制得用参考音频或分段引导。
  • 忽略采样率与格式的匹配
    下游工具对采样率有要求,格式不匹配会出现变速或无法导入。衔接处按下游工具的要求导出。

相关条目