- Microsoft AI ovozli agentlar va real vaqt muloqotlari uchun mo'ljallangan uchta yangi modelni taqdim etdi: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 va Voice-2.1-Flash.
- Transkripsiya modeli 60 tilda 320ms minimal kechikish bilan nutqni taniy oladi va Artificial Analysis xalqaro reytingida 1-o'rinni qayd etdi.
- Ovoz generatsiya qilish modeli 23 tilda tabiiy intonatsiya va his-tuyg'ularni saqlagan holda barqaror ovoz profilini ta'minlaydi.
Tasvir: Microsoft korporativ identifikatori (Microsoft rasmiy manbasi orqali)
Microsoft korporatsiyasi avtonom ovozli agentlar, qo'ng'iroq markazlari va interaktiv yordamchilar uchun maxsus moslashtirilgan uchta yangi sun'iy intellekt modelini rasman taqdim etdi: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 hamda yuqori tezlikdagi MAI-Voice-2.1-Flash.
Mazkur yangilik Microsoft'ning sun'iy intellekt infratuzilmasida to'liq mustaqil ovozli stekni (audio-in, audio-out) yo'lga qo'yganini anglatadi.
Real vaqt transkripsiyasida yangi rekord
MAI-Transcribe-2-Streaming modeli inson nutqi yangraganidan so'ng 320 millisekund ichida dastlabki matn farazlarini chiqara boshlaydi. Tizim 60 ta tilda avtomatik tilni aniqlash funksiyasiga ega bo'lib, xalqaro Artificial Analysis sinovlarida atigi 2.5% xatolik ko'rsatkichi (Word Error Rate) bilan jahonda 1-o'rinni egalladi.
Ekspressiv ovoz va past kechikish
- MAI-Voice-2.1: Audiokitoblar, podkastlar va tushuntiruvchi materiallar uchun 23 tilda hissiy intonatsiyani to'liq yetkazuvchi yuqori sifatli ovoz sintezi;
- MAI-Voice-2.1-Flash: Tezkor javob talab etiladigan mijozlarga xizmat ko'rsatish agentlari uchun minimal kechikishga optimallashtirilgan yengil arxitektura;
- Ovoz barqarorligi: Bir xil ovoz tembri turli tillarga o'tganda ham o'z shaxsiyatini saqlab qoladi.
Yangi modellar ishlab chiquvchilar uchun Microsoft Foundry platformasi orqali foydalanishga topshirildi.