پایان نامه > کتابخانه مرکزی دانشگاه صنعتی شاهرود > مهندسی کامپیوتر > مقطع کارشناسی ارشد > سال 1405
پدیدآورندگان:
ساره سعد کاظم البوذبحک [پدیدآور اصلی]، هدی مشایخی [استاد راهنما]
چکیده: در این پژوهش، یک چارچوب خودکار برای طبقهبندی گزارشهای خطای نرمافزاری با استفاده از الگوریتمهای یادگیری ماشین، همراه با پیشپردازش و استخراج ویژگیهای متنی و تنظیم عدمقطعیت ارائه شده است. این پژوهش به چالش دستهبندی دستی گزارشهای خطای نرمافزاری پرداخته و امکان خودکارسازی فرایند طبقهبندی این گزارشها را فراهم میکند. مجموعهداده مورد استفاده در این تحقیق، مجموعهداده Bugzilla Bug Reports بوده است. تمرکز اصلی پژوهش بر وظیفه پیشبینی وضعیت اصلاح گزارشهای خطا، بهویژه تشخیص این موضوع بوده است که آیا یک گزارش بیانگر نقص معتبری است که نیازمند اصلاح واقعی در کد میباشد یا خیر؛ این پیشبینی بر اساس محتوای متنی گزارش انجام شده است. فیلدهای متنی موجود در گزارش خطا، شامل عنوان و توضیحات، ابتدا پیشپردازش و پاکسازی شدند، سپس با یکدیگر ادغام و محدودسازی طول متن بر روی آنها اعمال گردید. سپس این فیلدهای متنی با استفاده از روش فراوانی واژگان–معکوس فراوانی سند (TF-IDF) به ویژگیهای عددی تبدیل شدند تا در ساخت و آموزش مدلهای کلاسیک یادگیری ماشین مورد استفاده قرار گیرند. همچنین، بهمنظور توسعه مدل حافظه بلندمدت کوتاهمدت دوسویه (BiLSTM)، متون به دنبالههایی از توکنها تبدیل و کدگذاری شدند تا مدل بتواند روابط ترتیبی و وابستگیهای موجود در متن را یاد بگیرد.
در این پژوهش، چندین طبقهبند توسعه داده شده و با یکدیگر مقایسه شدند که شامل رگرسیون لجستیک، ماشین بردار پشتیبان خطی، بیز ساده چندجملهای، بیز ساده مکمل و BiLSTM بودند. بهمنظور بهبود عملکرد طبقهبندها و ارائه برآوردهای اطمینان قابلاعتماد برای پیشبینیهای مدل، روشهایی مانند تنظیم ابرپارامترها، وزندهی نمونهها، تنظیم آستانه و تکنیکهای کالیبراسیون به کار گرفته شدند. علاوه بر این، برای مدلهای کلاسیک یادگیری ماشین از کالیبراسیون سیگموید استفاده شد و برای مدل BiLSTM نیز روشهای مقیاسبندی دما و Monte Carlo Dropout به کار رفتند.
مدلها با استفاده از معیارهای مختلفی شامل دقت، صحت، Recall، F1-Score وزندهیشده، ماتریس confusion ، خطای مورد انتظار کالیبراسیون (ECE)، Brier Score، نمودارهای قابلیت اعتماد و تحلیل نمونههای کماطمینان ارزیابی شدند. در نهایت، نتایج پژوهش نشان داد که مدل رگرسیون لجستیک مبتنی بر TF-IDF همراه با کالیبراسیون سیگموید، بهترین عملکرد کلی را در میان طبقهبندهای مورد استفاده ارائه داده است و به دقت کلی 85.52 درصد و F1-Score وزندهیشده معادل 85.60 درصد دست یافته است.
کلید واژه ها (نمایه ها):
#کلیدواژهها: گزارشهای نرمافزاری #Bugzilla #یادگیری ماشین #پیشپردازش متن #استخراج ویژگیهای متنی #TF-IDF #رگرسیون لجستیک #ماشین بردار پشتیبان #BiLSTM #تنظیم عدمقطعیت.
محل نگهداری: کتابخانه مرکزی دانشگاه صنعتی شاهرود
یادداشت: حقوق مادی و معنوی متعلق به دانشگاه صنعتی شاهرود می باشد.
تعداد بازدید کننده: