语音识别 / 转写 / 全站资源搜索
搜索 更新 2026-10-02

语音识别 / 转写

这一类用途在全部 8108 个节点仓库里命中 47 个。 下面按下载量列出前 8 个,点进去看每个仓库的适配模型、说明原文与下载入口。

1. wanaigc/ComfyUI-Qwen3-TTS Qwen3-TTS 的音色克隆与多角色配音:脚本驱动的无限多角色配音、情感感知的语音转换(ASR)与语音素材管理。 音频模型(ACE-Step/Whisper/TTS) / LLM/VLM(Florence/JoyCaption/Qwen) 下载 2.5 万 2. DarioFT/ComfyUI-Qwen3-ASR Qwen3-ASR 节点套件:支持 1.7B 与 0.6B 模型的语音转文字,覆盖 52 种语言/方言,可选时间戳对齐。 LLM/VLM(Florence/JoyCaption/Qwen) 下载 1.4 万 3. civen-cn/ComfyUI-Whisper-Translator 用 Whisper 翻译字幕的节点,支持中英日韩俄法德西葡意阿等多种语言;非拉丁字符需要把字体放进 fonts 文件夹。 音频模型(ACE-Step/Whisper/TTS) 下载 1.3 万 4. 1038lab/ComfyUI-QwenASR 轻量的 Qwen3-ASR 节点包:本地模型缓存、可输出时间戳,支持 Qwen3-ASR-1.7B 与 0.6B,可选 HuggingFace 或 ModelScope 下载。 LLM/VLM(Florence/JoyCaption/Qwen) 下载 1 万 5. if-ai/ComfyUI-IF_AI_WishperSpeechNode 基于 Whisper Speech 的语音合成应用,支持边用边训练音色模型,可快速训练与推理。 音频模型(ACE-Step/Whisper/TTS) 下载 7.8k 6. kaushiknishchay/ComfyUI-Qwen3-ASR Qwen3-ASR(0.6B/1.7B)与 ForcedAligner 节点:52 种语言/方言的高精度识别与语种判断,含 22 种中文方言,支持词级时间戳与长音频转写,并针对显存优化。 LLM/VLM(Florence/JoyCaption/Qwen) 下载 7.2k 7. lazniak/videoclipgenerator Vibe Music Engine 节点:用 OpenAI Whisper 处理音频,提供转写、翻译与词级时间点,便于生成字幕与剪辑决策表;另含节拍检测。 音频模型(ACE-Step/Whisper/TTS) 下载 4.7k 8. billwuhao/ComfyUI_EraX-WoW-Turbo 基于 Whisper Large-v3 Turbo 的超快多语言语音识别节点。 音频模型(ACE-Step/Whisper/TTS) 下载 3.9k

其它用途

相关入口

全部 20 个用途