```
پایان نامه > کتابخانه مرکزی دانشگاه صنعتی شاهرود > مهندسی کامپیوتر > مقطع کارشناسی ارشد > سال 1405
پدیدآورندگان:
ساره سعد کاظم البوذبحک [پدیدآور اصلی]، هدی مشایخی [استاد راهنما]
چکیده: در این پژوهش، یک چارچوب خودکار برای طبقه‌بندی گزارش‌های خطای نرم‌افزاری با استفاده از الگوریتم‌های یادگیری ماشین، همراه با پیش‌پردازش و استخراج ویژگی‌های متنی و تنظیم عدم‌قطعیت ارائه شده است. این پژوهش به چالش دسته‌بندی دستی گزارش‌های خطای نرم‌افزاری پرداخته و امکان خودکارسازی فرایند طبقه‌بندی این گزارش‌ها را فراهم می‌کند. مجموعه‌داده مورد استفاده در این تحقیق، مجموعه‌داده Bugzilla Bug Reports بوده است. تمرکز اصلی پژوهش بر وظیفه پیش‌بینی وضعیت اصلاح گزارش‌های خطا، به‌ویژه تشخیص این موضوع بوده است که آیا یک گزارش بیانگر نقص معتبری است که نیازمند اصلاح واقعی در کد می‌باشد یا خیر؛ این پیش‌بینی بر اساس محتوای متنی گزارش انجام شده است. فیلدهای متنی موجود در گزارش خطا، شامل عنوان و توضیحات، ابتدا پیش‌پردازش و پاک‌سازی شدند، سپس با یکدیگر ادغام و محدودسازی طول متن بر روی آن‌ها اعمال گردید. سپس این فیلدهای متنی با استفاده از روش فراوانی واژگان–معکوس فراوانی سند (TF-IDF) به ویژگی‌های عددی تبدیل شدند تا در ساخت و آموزش مدل‌های کلاسیک یادگیری ماشین مورد استفاده قرار گیرند. همچنین، به‌منظور توسعه مدل حافظه بلندمدت کوتاه‌مدت دوسویه (BiLSTM)، متون به دنباله‌هایی از توکن‌ها تبدیل و کدگذاری شدند تا مدل بتواند روابط ترتیبی و وابستگی‌های موجود در متن را یاد بگیرد. در این پژوهش، چندین طبقه‌بند توسعه داده شده و با یکدیگر مقایسه شدند که شامل رگرسیون لجستیک، ماشین بردار پشتیبان خطی، بیز ساده چندجمله‌ای، بیز ساده مکمل و BiLSTM بودند. به‌منظور بهبود عملکرد طبقه‌بندها و ارائه برآوردهای اطمینان قابل‌اعتماد برای پیش‌بینی‌های مدل، روش‌هایی مانند تنظیم ابرپارامترها، وزن‌دهی نمونه‌ها، تنظیم آستانه و تکنیک‌های کالیبراسیون به کار گرفته شدند. علاوه بر این، برای مدل‌های کلاسیک یادگیری ماشین از کالیبراسیون سیگموید استفاده شد و برای مدل BiLSTM نیز روش‌های مقیاس‌بندی دما و Monte Carlo Dropout به کار رفتند. مدل‌ها با استفاده از معیارهای مختلفی شامل دقت، صحت، Recall، F1-Score وزن‌دهی‌شده، ماتریس confusion ، خطای مورد انتظار کالیبراسیون (ECE)، Brier Score، نمودارهای قابلیت اعتماد و تحلیل نمونه‌های کم‌اطمینان ارزیابی شدند. در نهایت، نتایج پژوهش نشان داد که مدل رگرسیون لجستیک مبتنی بر TF-IDF همراه با کالیبراسیون سیگموید، بهترین عملکرد کلی را در میان طبقه‌بندهای مورد استفاده ارائه داده است و به دقت کلی 85.52 درصد و F1-Score وزن‌دهی‌شده معادل 85.60 درصد دست یافته است.
کلید واژه ها (نمایه ها):
#کلیدواژه‌ها: گزارش‌های نرم‌افزاری #Bugzilla #یادگیری ماشین #پیش‌پردازش متن #استخراج ویژگی‌های متنی #TF-IDF #رگرسیون لجستیک #ماشین بردار پشتیبان #BiLSTM #تنظیم عدم‌قطعیت.
محل نگهداری: کتابخانه مرکزی دانشگاه صنعتی شاهرود
یادداشت: حقوق مادی و معنوی متعلق به دانشگاه صنعتی شاهرود می باشد.
تعداد بازدید کننده:
پایان نامه های مرتبط (بر اساس کلیدواژه ها)