语音识别 / 转写
这一类用途在全部 8108 个节点仓库里命中 47 个。 下面按下载量列出前 8 个,点进去看每个仓库的适配模型、说明原文与下载入口。
抠图 / 去背景放大 / 超分换脸 / 人脸处理局部重绘 / 修补ControlNet / 结构控制参考图 / 风格迁移视频生成视频插帧 / 补帧数字人 / 口型同步3D 生成语音合成 / TTS语音识别 / 转写音乐 / 歌声生成提示词增强 / 翻译图像反推 / 打标LLM / 对话接入显存优化 / 加速模型加载 / LoRA工作流增强 / 界面批量 / 自动化
1. wanaigc/ComfyUI-Qwen3-TTS
Qwen3-TTS 的音色克隆与多角色配音:脚本驱动的无限多角色配音、情感感知的语音转换(ASR)与语音素材管理。
音频模型(ACE-Step/Whisper/TTS) / LLM/VLM(Florence/JoyCaption/Qwen)
下载 2.5 万
2. DarioFT/ComfyUI-Qwen3-ASR
Qwen3-ASR 节点套件:支持 1.7B 与 0.6B 模型的语音转文字,覆盖 52 种语言/方言,可选时间戳对齐。
LLM/VLM(Florence/JoyCaption/Qwen)
下载 1.4 万
3. civen-cn/ComfyUI-Whisper-Translator
用 Whisper 翻译字幕的节点,支持中英日韩俄法德西葡意阿等多种语言;非拉丁字符需要把字体放进 fonts 文件夹。
音频模型(ACE-Step/Whisper/TTS)
下载 1.3 万
4. 1038lab/ComfyUI-QwenASR
轻量的 Qwen3-ASR 节点包:本地模型缓存、可输出时间戳,支持 Qwen3-ASR-1.7B 与 0.6B,可选 HuggingFace 或 ModelScope 下载。
LLM/VLM(Florence/JoyCaption/Qwen)
下载 1 万
5. if-ai/ComfyUI-IF_AI_WishperSpeechNode
基于 Whisper Speech 的语音合成应用,支持边用边训练音色模型,可快速训练与推理。
音频模型(ACE-Step/Whisper/TTS)
下载 7.8k
6. kaushiknishchay/ComfyUI-Qwen3-ASR
Qwen3-ASR(0.6B/1.7B)与 ForcedAligner 节点:52 种语言/方言的高精度识别与语种判断,含 22 种中文方言,支持词级时间戳与长音频转写,并针对显存优化。
LLM/VLM(Florence/JoyCaption/Qwen)
下载 7.2k
7. lazniak/videoclipgenerator
Vibe Music Engine 节点:用 OpenAI Whisper 处理音频,提供转写、翻译与词级时间点,便于生成字幕与剪辑决策表;另含节拍检测。
音频模型(ACE-Step/Whisper/TTS)
下载 4.7k
8. billwuhao/ComfyUI_EraX-WoW-Turbo
基于 Whisper Large-v3 Turbo 的超快多语言语音识别节点。
音频模型(ACE-Step/Whisper/TTS)
下载 3.9k
其它用途
抠图 / 去背景命中 471 个仓库
看这一类
放大 / 超分命中 191 个仓库
看这一类
换脸 / 人脸处理命中 54 个仓库
看这一类
局部重绘 / 修补命中 113 个仓库
看这一类
ControlNet / 结构控制命中 321 个仓库
看这一类
参考图 / 风格迁移命中 279 个仓库
看这一类
视频生成命中 1102 个仓库
看这一类
视频插帧 / 补帧命中 29 个仓库
看这一类
知仓学习社