پایان نامه > کتابخانه مرکزی دانشگاه صنعتی شاهرود > مهندسی برق > مقطع کارشناسی ارشد > سال 1405
پدیدآورندگان:
: رضا رضائی [پدیدآور اصلی]، سید مسعود میررضائی [استاد راهنما]
چکیده: تبدیل متن به گفتار یکی از حوزه‌های کلیدی در تعامل انسان و ماشین است که هدف آن تولید گفتاری طبیعی، روان و قابل‌فهم از ورودی‌های متنی می‌باشد. با وجود پیشرفت‌های چشمگیر در این حوزه، به‌ویژه برای زبان‌های پرمنبع مانند انگلیسی، زبان فارسی به‌دلیل ویژگی‌های خاص واج‌شناختی، نحوی و نوشتاری، همچنان با محدودیت‌های جدی در توسعه سامانه‌های باکیفیت تبدیل متن به گفتار مواجه است. نبود نشانه‌های آوایی در خط فارسی، وجود هم‌نویسه‌ها، انعطاف‌پذیری ساختار نحوی و کمبود مجموعه‌داده‌های استاندارد، از جمله چالش‌های اصلی در این زمینه به شمار می‌آیند. در این پژوهش، یک سامانه تبدیل متن به گفتار فارسی مبتنی بر معماری یکپارچه انتهابه‌انتهای VITS طراحی و پیاده‌سازی شده است. در این معماری، مراحل رمزگذاری متن، هم‌ترازی زمانی، مدل‌سازی آکوستیکی و تولید موج صوتی در قالب یک چارچوب واحد انجام می‌گیرد که منجر به کاهش پیچیدگی سامانه و بهبود طبیعی‌بودن گفتار خروجی می‌شود. هدف اصلی این تحقیق، تولید گفتاری روان، طبیعی و نزدیک به گفتار انسانی با حداقل نیاز به پردازش‌های پسین است. برای ارزیابی عملکرد سامانۀ پیشنهادی، از معیار ادراکی MOS استفاده شده است. در این ارزیابی، نمونه‌های صوتی تولیدشده توسط مدل با گفتار طبیعی داده‌های مرجع مقایسه شده و توسط ۲۰ شنونده فارسی‌زبان مورد قضاوت قرار گرفته‌اند. نتایج حاصل نشان می‌دهد که سامانه پیشنهادی توانسته است کیفیت قابل‌قبولی از نظر طبیعی‌بودن، روانی و شباهت به گفتار انسانی ارائه دهد. یافته‌های این پژوهش نشان‌دهندۀ ظرفیت بالای معماری VITS برای توسعه سامانه‌های تبدیل متن به گفتار فارسی و زبان‌های کم‌منبع مشابه است.
کلید واژه ها (نمایه ها):
#تبدیل متن به گفتار #زبان فارسی #معماری VITS #تولید گفتار انتهابه‌انتها #مدل‌سازی فرازبانی #امتیازدهی شنیداری (MOS) #زبان‌های کم‌منبع
محل نگهداری: کتابخانه مرکزی دانشگاه صنعتی شاهرود
یادداشت: حقوق مادی و معنوی متعلق به دانشگاه صنعتی شاهرود می باشد.
تعداد بازدید کننده:
پایان نامه های مرتبط (بر اساس کلیدواژه ها)