VibeVoice
VibeVoice

VibeVoice

语音识别开源

微软开源语音AI,60分钟长音频一次转录成带说话人的文本

访问官网
收录: 2026-09-02·更新: 2026-09-02·音频工具

详细介绍

产品定位
VibeVoice 是微软开源的前沿语音 AI 模型家族,主仓库 microsoft/VibeVoice 收获 5 万+ Star。其中 VibeVoice-ASR 是端到端长音频语音识别模型,让长篇录音无需切片即可一次转写,直击 Whisper 类工具长音频“断章取义”的痛点。

核心功能
可在 64K 上下文内一次性转录最长 60 分钟连续音频,单次推理联合完成语音识别、说话人分离与时间戳标注,直接输出“谁在何时说了什么”的结构化文本;支持注入人名、专业术语等热词提升识别准确率,原生支持 50+ 语言并能处理中英夹杂场景。

技术特点
采用超低帧率 7.5Hz 连续语音 tokenizer 结合 next-token diffusion 架构,兼顾长序列效率与声学保真。同家族还有 VibeVoice-TTS-1.5B(多说话人长语音合成)与 VibeVoice-Realtime-0.5B(实时流式)。MIT 协议开源,模型体积小、CPU 环境即可本地部署,可免费商用。

适用场景
一小时会议录音一键生成纪要、播客与访谈自动转写并区分说话人、客服通话质检、课程自动字幕,也适合二次开发为智能录音笔等应用。