پایان نامه > کتابخانه مرکزی دانشگاه صنعتی شاهرود > مهندسی کامپیوتر > مقطع کارشناسی ارشد > سال 1405
پدیدآورندگان:
أحمد مقداد مجد بیاتلی [پدیدآور اصلی]، مرضیه رحیمى [استاد راهنما]
چکیده: در سالهای اخیر، طبقهبندی متن به عنوان یکی از مسائل کلیدی در حوزه پردازش زبان طبیعی، نیازمند روشهایی با دقت و تعمیمپذیری بالا است. در این پژوهش، یک چارچوب نوآورانه برای طبقهبندی احساسات در نقدهای متنی ارائه میشود که با هدف افزایش کیفیت داده، بهبود نمایش ویژگیها و ارتقای عملکرد نهایی طراحی شده است. ابتدا با بهرهگیری از مدل زبانی BERT، بردارهای معنایی عمیق از جملات استخراج و در قالب یک مخزن دادهی اولیه ذخیره میشود. سپس با استفاده از رویکرد افزایش داده مبتنی بر بازیابی اطلاعات، نمونههای جدید و معنادار از طریق بهکارگیری k-نزدیکترین همسایگی و الگوریتم (MLM) Masked Language Model تولید میگردد تا تنوع و غنای دادهها افزایش یابد. در گام بعد، انتخاب ویژگیها با استفاده از الگوریتم آنالیز مولفه همسایگی (NCA) برای کاهش ابعاد و حذف ویژگیهای کماهمیت انجام میشود. نهایتاً یک ساختار یادگیری گروهی برای طبقهبندی بهکار گرفته میشود تا دقت و پایداری مدل بهبود یابد. روش پیشنهادی بر روی پایگاه داده Movie Review از مجموعه SentEval آزمایش شده و دقت چشمگیر 97.8٪ را در تشخیص نقدهای مثبت و منفی به دست آورده است. نتایج نشان میدهد که ترکیب مؤثر استخراج ویژگی مبتنی بر BERT، افزایش داده هوشمند و یادگیری گروهی میتواند بهطور قابلتوجهی عملکرد سیستمهای طبقهبندی متن را ارتقا دهد.
کلید واژه ها (نمایه ها):
#کلیدواژهها: طبقهبندی متن #BERT #افزایش داده #الگوریتم NCA #یادگیری گروهی #پردازش زبان طبیعی (NLP).
محل نگهداری: کتابخانه مرکزی دانشگاه صنعتی شاهرود
یادداشت: حقوق مادی و معنوی متعلق به دانشگاه صنعتی شاهرود می باشد.
تعداد بازدید کننده: