Qisqacha mazmuni (Executive Summary)
  • Microsoft AI ovozli agentlar va real vaqt muloqotlari uchun mo'ljallangan uchta yangi modelni taqdim etdi: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 va Voice-2.1-Flash.
  • Transkripsiya modeli 60 tilda 320ms minimal kechikish bilan nutqni taniy oladi va Artificial Analysis xalqaro reytingida 1-o'rinni qayd etdi.
  • Ovoz generatsiya qilish modeli 23 tilda tabiiy intonatsiya va his-tuyg'ularni saqlagan holda barqaror ovoz profilini ta'minlaydi.

Tasvir: Microsoft korporativ identifikatori (Microsoft rasmiy manbasi orqali)

Microsoft korporatsiyasi avtonom ovozli agentlar, qo'ng'iroq markazlari va interaktiv yordamchilar uchun maxsus moslashtirilgan uchta yangi sun'iy intellekt modelini rasman taqdim etdi: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 hamda yuqori tezlikdagi MAI-Voice-2.1-Flash.

Mazkur yangilik Microsoft'ning sun'iy intellekt infratuzilmasida to'liq mustaqil ovozli stekni (audio-in, audio-out) yo'lga qo'yganini anglatadi.

Real vaqt transkripsiyasida yangi rekord

MAI-Transcribe-2-Streaming modeli inson nutqi yangraganidan so'ng 320 millisekund ichida dastlabki matn farazlarini chiqara boshlaydi. Tizim 60 ta tilda avtomatik tilni aniqlash funksiyasiga ega bo'lib, xalqaro Artificial Analysis sinovlarida atigi 2.5% xatolik ko'rsatkichi (Word Error Rate) bilan jahonda 1-o'rinni egalladi.

Ekspressiv ovoz va past kechikish

  • MAI-Voice-2.1: Audiokitoblar, podkastlar va tushuntiruvchi materiallar uchun 23 tilda hissiy intonatsiyani to'liq yetkazuvchi yuqori sifatli ovoz sintezi;
  • MAI-Voice-2.1-Flash: Tezkor javob talab etiladigan mijozlarga xizmat ko'rsatish agentlari uchun minimal kechikishga optimallashtirilgan yengil arxitektura;
  • Ovoz barqarorligi: Bir xil ovoz tembri turli tillarga o'tganda ham o'z shaxsiyatini saqlab qoladi.

Yangi modellar ishlab chiquvchilar uchun Microsoft Foundry platformasi orqali foydalanishga topshirildi.

Asl manba: Microsoft Tech Community ↗