OVOZ KONVERTATSIYASIDA NOPARALLEL MA'LUMOTLARNI KENGAYTIRISH: DIQTOR AJRATUVCHI ARXITEKTURA ASOSIDAGI YONDASHUVNING TAHLILI

Authors

  • Subxonqulov Umidjon Author

Abstract

Ovoz konvertatsiyasi (voice conversion) manba diqtorning nutqini uning lingvistik mazmunini o'zgartirmagan holda maqsadli diqtor ovoziga aylantirish vazifasi bo'lib, sun'iy intellekt asosidagi nutq texnologiyalarining tez rivojlanayotgan yo'nalishlaridan biri hisoblanadi. Amaliyotda ikkala diqtorning bir xil matnni o'qigan parallel audio yozuvlarini yig'ish deyarli imkonsiz bo'lgani sababli, noparallel ma'lumotlar asosida modellashtirish dolzarb ilmiy-amaliy muammoga aylangan. Mavjud yechimlar odatda diqtor va lingvistik mazmunni ajratish (disentanglement) yoki matndan sun'iy parallel audio yaratish (matn-nutq sintezi orqali) strategiyalariga tayanadi, biroq bunday sintez qilingan parallel ma'lumotlarda manba nutqning mahalliy talaffuz uslubi (prosodiya, energiya, fonema davomiyligi) yo'qolib, faqat maqsadli diqtorning uslubi saqlanib qoladi. Natijada konvertatsiya modeli haqiqiy nutq xususiyatlaridan emas, balki sun'iy, uslubiy jihatdan bir xillashtirilgan ma'lumotlardan o'rganishga majbur bo'ladi, bu esa konvertatsiya sifatining pasayishiga olib keladi. Shu sababli, manba nutqning mahalliy uslubini saqlagan holda vaqt bo'yicha to'g'ri tekislangan parallel ma'lumotlarni sun'iy generatsiya qilish usullarini ishlab chiqish muhim ilmiy ahamiyat kasb etadi.

References

Published

2026-07-10