decoder 资讯 热度 30

Microsoft AI releases new transcription and text-to-speech models for voice agents

AI 导读

实时转录文本转语音声音克隆低延迟

微软发布实时转录模型MAI-Transcribe-2-Streaming和文本转语音模型MAI-Voice-2.1,支持多语言、低延迟且可克隆声音,提升语音助手交互体验。

Microsoft unveils MAI-Transcribe-2-Streaming for real-time transcription and MAI-Voice-2.1 for text-to-speech, supporting 60+ languages with low latency and voice cloning.

重点速览

  • MAI-Transcribe-2-Streaming支持60种语言,100毫秒内输出初步转录结果 MAI-Transcribe-2-Streaming transcribes 60 languages with 100ms initial output
  • MAI-Voice-2.1可生成23种语言的自然语音,Flash版成本降低30% MAI-Voice-2.1 generates natural speech in 23 languages at 150ms latency
  • 模型具备声音克隆功能,但内置安全机制防止滥用 Voice cloning capability with built-in misuse prevention
  • 测试显示40%用户误认为合成语音是真人发声 40% testers believed synthetic voices were real

一句话:微软新模型通过低延迟和多语言支持,显著提升语音交互效率与真实性。 / Microsoft's new models enhance voice interaction efficiency and realism through low latency and multilingual support.

推荐理由 值得关注其对语音助手行业技术门槛的降低和用户体验的革新潜力。

查看原文 ↗ 返回热榜

二次创作声明:本页为 AI 热榜聚合导读,内容与热度数据来自公开来源 (decoder),版权归原始作者所有;本站仅做转载指引与摘要评述,不复制原文。