VibeVoice
详细介绍
产品定位
VibeVoice 是微软开源的前沿语音 AI 模型家族,主仓库 microsoft/VibeVoice 收获 5 万+ Star。其中 VibeVoice-ASR 是端到端长音频语音识别模型,让长篇录音无需切片即可一次转写,直击 Whisper 类工具长音频“断章取义”的痛点。
核心功能
可在 64K 上下文内一次性转录最长 60 分钟连续音频,单次推理联合完成语音识别、说话人分离与时间戳标注,直接输出“谁在何时说了什么”的结构化文本;支持注入人名、专业术语等热词提升识别准确率,原生支持 50+ 语言并能处理中英夹杂场景。
技术特点
采用超低帧率 7.5Hz 连续语音 tokenizer 结合 next-token diffusion 架构,兼顾长序列效率与声学保真。同家族还有 VibeVoice-TTS-1.5B(多说话人长语音合成)与 VibeVoice-Realtime-0.5B(实时流式)。MIT 协议开源,模型体积小、CPU 环境即可本地部署,可免费商用。
适用场景
一小时会议录音一键生成纪要、播客与访谈自动转写并区分说话人、客服通话质检、课程自动字幕,也适合二次开发为智能录音笔等应用。











