项目地址
https://github.com/microsoft/VibeVoice
AI 摘要
VibeVoice 是微软开源的前沿语音 AI 模型家族,包含文本转语音(TTS)和自动语音识别(ASR)。核心创新在于使用超低帧率(7.5 Hz)的连续语音分词器。ASR 支持超50种语言,可单次处理60分钟长音频,生成带说话人、时间戳和内容的结构化转录。TTS 可实现最多4个说话人的长达90分钟的语音合成。项目已集成到 Azure AI Foundry Labs 和 Hugging Face Transformers。
README 原文
📰 News
2026-07-23: ⚡ We released VibeVoice-ASR-BitNet, an edge CPU inference engine for VibeVoice-ASR. Through heterogeneous quantization (I8_S + I2_S), the model is compressed from 4.62 GB to 1.58 GB with real-time inference (RTF < 1) on 3+ CPU threads — no GPU required. [Code] [Models] [Report]
2026-03-12: 🚀 VibeVoice-ASR is now integrated into Azure AI Foundry Labs! You can now explore and test our un...
项目地址
https://github.com/microsoft/VibeVoice
AI 摘要
VibeVoice 是微软开源的前沿语音 AI 模型家族,包含文本转语音(TTS)和自动语音识别(ASR)。核心创新在于使用超低帧率(7.5 Hz)的连续语音分词器。ASR 支持超50种语言,可单次处理60分钟长音频,生成带说话人、时间戳和内容的结构化转录。TTS 可实现最多4个说话人的长达90分钟的语音合成。项目已集成到 Azure AI Foundry Labs 和 Hugging Face Transformers。
README 原文
🎙️ VibeVoice: Open-Source Frontier Voice AI
📰 News
2026-07-23: ⚡ We released VibeVoice-ASR-BitNet, an edge CPU inference engine for VibeVoice-ASR. Through heterogeneous quantization (I8_S + I2_S), the model is compressed from 4.62 GB to 1.58 GB with real-time inference (RTF < 1) on 3+ CPU threads — no GPU required. [Code] [Models] [Report]
2026-03-12: 🚀 VibeVoice-ASR is now integrated into Azure AI Foundry Labs! You can now explore and test our un...