Microsoft AI releases new transcription and text-to-speech models for voice agents
AI 导读
实时转录文本转语音声音克隆低延迟
微软发布实时转录模型MAI-Transcribe-2-Streaming和文本转语音模型MAI-Voice-2.1,支持多语言、低延迟且可克隆声音,提升语音助手交互体验。
Microsoft unveils MAI-Transcribe-2-Streaming for real-time transcription and MAI-Voice-2.1 for text-to-speech, supporting 60+ languages with low latency and voice cloning.
重点速览
- MAI-Transcribe-2-Streaming支持60种语言,100毫秒内输出初步转录结果 MAI-Transcribe-2-Streaming transcribes 60 languages with 100ms initial output
- MAI-Voice-2.1可生成23种语言的自然语音,Flash版成本降低30% MAI-Voice-2.1 generates natural speech in 23 languages at 150ms latency
- 模型具备声音克隆功能,但内置安全机制防止滥用 Voice cloning capability with built-in misuse prevention
- 测试显示40%用户误认为合成语音是真人发声 40% testers believed synthetic voices were real
一句话:微软新模型通过低延迟和多语言支持,显著提升语音交互效率与真实性。 / Microsoft's new models enhance voice interaction efficiency and realism through low latency and multilingual support.
推荐理由 值得关注其对语音助手行业技术门槛的降低和用户体验的革新潜力。
二次创作声明:本页为 AI 热榜聚合导读,内容与热度数据来自公开来源 (decoder),版权归原始作者所有;本站仅做转载指引与摘要评述,不复制原文。