پایان نامه > کتابخانه مرکزی دانشگاه صنعتی شاهرود > مهندسی برق > مقطع کارشناسی ارشد > سال 1405
پدیدآورندگان:
: رضا رضائی [پدیدآور اصلی]، سید مسعود میررضائی [استاد راهنما]
چکیده: تبدیل متن به گفتار یکی از حوزههای کلیدی در تعامل انسان و ماشین است که هدف آن تولید گفتاری طبیعی، روان و قابلفهم از ورودیهای متنی میباشد. با وجود پیشرفتهای چشمگیر در این حوزه، بهویژه برای زبانهای پرمنبع مانند انگلیسی، زبان فارسی بهدلیل ویژگیهای خاص واجشناختی، نحوی و نوشتاری، همچنان با محدودیتهای جدی در توسعه سامانههای باکیفیت تبدیل متن به گفتار مواجه است. نبود نشانههای آوایی در خط فارسی، وجود همنویسهها، انعطافپذیری ساختار نحوی و کمبود مجموعهدادههای استاندارد، از جمله چالشهای اصلی در این زمینه به شمار میآیند.
در این پژوهش، یک سامانه تبدیل متن به گفتار فارسی مبتنی بر معماری یکپارچه انتهابهانتهای VITS طراحی و پیادهسازی شده است. در این معماری، مراحل رمزگذاری متن، همترازی زمانی، مدلسازی آکوستیکی و تولید موج صوتی در قالب یک چارچوب واحد انجام میگیرد که منجر به کاهش پیچیدگی سامانه و بهبود طبیعیبودن گفتار خروجی میشود. هدف اصلی این تحقیق، تولید گفتاری روان، طبیعی و نزدیک به گفتار انسانی با حداقل نیاز به پردازشهای پسین است.
برای ارزیابی عملکرد سامانۀ پیشنهادی، از معیار ادراکی MOS استفاده شده است. در این ارزیابی، نمونههای صوتی تولیدشده توسط مدل با گفتار طبیعی دادههای مرجع مقایسه شده و توسط ۲۰ شنونده فارسیزبان مورد قضاوت قرار گرفتهاند. نتایج حاصل نشان میدهد که سامانه پیشنهادی توانسته است کیفیت قابلقبولی از نظر طبیعیبودن، روانی و شباهت به گفتار انسانی ارائه دهد. یافتههای این پژوهش نشاندهندۀ ظرفیت بالای معماری VITS برای توسعه سامانههای تبدیل متن به گفتار فارسی و زبانهای کممنبع مشابه است.
کلید واژه ها (نمایه ها):
#تبدیل متن به گفتار #زبان فارسی #معماری VITS #تولید گفتار انتهابهانتها #مدلسازی فرازبانی #امتیازدهی شنیداری (MOS) #زبانهای کممنبع
محل نگهداری: کتابخانه مرکزی دانشگاه صنعتی شاهرود
یادداشت: حقوق مادی و معنوی متعلق به دانشگاه صنعتی شاهرود می باشد.
تعداد بازدید کننده: