{
    "metadata": {
        "dataset_id": "shahroodut-thesis",
        "record_id": "TK376",
        "title": "ناحیه بندی تصاویر اسناد پیچیده فارسی به بلوکهای متن، شکل و جدول",
        "publisher": "دانشگاه صنعتی شاهرود",
        "owner": "کتابخانه مرکزی دانشگاه صنعتی شاهرود",
        "license": "CC-BY-4.0",
        "license_url": "https://creativecommons.org/licenses/by/4.0/",
        "license_text": "استفاده، بازنشر، تحلیل، پردازش و بهره برداری پژوهشی، آموزشی و صنعتی با ذکر منبع دانشگاه صنعتی شاهرود مجاز است.",
        "publication_date": "1393",
        "last_update": "2026-08-25",
        "language": "fa",
        "format": "application/json",
        "contact": "thesis@shahroodut.ac.ir",
        "access": {
            "fulltext_available": "true",
            "public_access": "true"
        }
    },
    "data": {
        "thesis_id": "TK376",
        "title": "ناحیه بندی تصاویر اسناد پیچیده فارسی به بلوکهای متن، شکل و جدول",
        "degree": null,
        "faculty": "مهندسی برق",
        "year": 1393,
        "authors": [
            {
                "name": "مصطفی گلزاده حمزکانلو",
                "role": "پدیدآور اصلی"
            },
            {
                "name": "حسین خسروی",
                "role": "استاد راهنما"
            }
        ],
        "keywords": [
            "ناحیه بندی اسناد",
            "تحلیل ساختار اسناد",
            "قطعه بندی اسناد",
            "مستطیل محیطی",
            "مؤلفه های پیوسته"
        ],
        "abstract": "سامانه‌های نویسه خوان نوری، OCR، نقش بزرگی در تحقق دولت الکترونیک و کاهش حجم بایگانیهای کاغذی و دیجیتال دارند. این سامانه ها از سه بخش اصلی پیش پردازش، شناسایی متن و پس پردازش تشکیل شده اند. طبیعی است که هر خطایی در مرحله پیش پردازش، بازگشت ناپذیر است، مثلا اگر زاویه چرخش سند اشتباه شناسایی شود، سبب خواهد شد که خطوط متن کج بشوند و فرایند شناسایی متن، به درستی صورت نگیرد. یکی از قسمتهای مهم در پیش پردازش، تحلیل پیکربندی اسناد است؛ به این معنا که مشخص کنیم کدام بخشها از تصویر سند، متن است، کدام بخشها جدول اند و چه نواحی ای شکل هستند. هر خطایی در این بخش، سبب تولید خطاهای بیشتر در فرایند OCR خواهد شد. در این پایان نامه به تحلیل ساختار اسناد فارسی چند ستونه می‌پردازیم. در زمینه تحلیل اسناد، سه رویکرد، متداول است، رویکرد پایین به بالا که از پیکسلها شروع می کند و با ادغام و رشد پیکسلها، به نواحی بزرگتر می رسد. رویکرد بالا به پایین مثل روش برش XY که ابتدا تصویر را با برشهایی به چند ناحیه تقسیم می کند و سپس با تکنیکهایی هر ناحیه،  را به نواحی کوچکتر تجزیه می کند. ترکیب این دو روش هم با عنوان رویکرد ترکیبی شناخته می شود. ما یک رویکرد تقریبا ترکیبی که بیشتر مبتنی بر روش پایین به بالاست ارائه می دهیم. در این رویکرد از تکنیکهای آستانه گذاری وفقی، برچسب زنی مولفه ها، عملیات ریخت شناسی و تبدیل هاف استفاده شده و با یک الگوریتم مکاشفه ای و معرفی قوانین خاصی برای ترکیب نواحی کوچک بدون ادغام نواحی غیریکسان، سند را به ناحیه های متنی، جدول و شکل تقسیم می کنیم. روش معرفی شده روی اسناد متعدد چند ستونه و اسنادی که زمینه‌ی گرافیکی یا هنری دارند، آزمایش شده و عملکرد خوبی در مقایسه با نرم افزارهای پیشرو در حوزه OCR مثل OmniPage و FineReader ارائه می‌دهد. که نتایج به‌لحاظ‌عددی‌بدین‌شرح است که الگوریتم ما متن های فارسی را با 72 ، شکل ها را با 75‌ و جدول‌ها را‌92 ‌درصد درست تشخیص می دهد. و ‌88 درصد اسناد فارسی را تقریبا درست ناحیه بندی می‌کند.",
        "repository": "کتابخانه مرکزی دانشگاه صنعتی شاهرود",
        "note": "حقوق مادی و معنوی متعلق به دانشگاه صنعتی شاهرود می باشد.",
        "download_url": "https://shahroodut.ac.ir/fa/thesis/files/somefiles/sf_TK376.pdf"
    },
    "dictionary": {
        "thesis_id": {
            "title": "شناسه پایان نامه",
            "type": "string",
            "description": "شناسه یکتای پایان نامه در سامانه کتابخانه"
        },
        "title": {
            "title": "عنوان پایان نامه",
            "type": "string",
            "description": "عنوان کامل پایان نامه"
        },
        "degree": {
            "title": "مقطع تحصیلی",
            "type": "string",
            "description": "مقطع تحصیلی پایان نامه"
        },
        "faculty": {
            "title": "دانشکده",
            "type": "string",
            "description": "دانشکده یا واحد آموزشی"
        },
        "year": {
            "title": "سال دفاع",
            "type": "integer",
            "description": "سال دفاع یا انتشار پایان نامه"
        },
        "authors": {
            "title": "پدیدآورندگان",
            "type": "array",
            "description": "فهرست نویسندگان، استاد راهنما، استاد مشاور و سایر نقش های علمی"
        },
        "keywords": {
            "title": "کلیدواژه ها",
            "type": "array",
            "description": "کلیدواژه های علمی پایان نامه"
        },
        "abstract": {
            "title": "چکیده",
            "type": "string",
            "description": "متن چکیده پایان نامه"
        },
        "repository": {
            "title": "محل نگهداری",
            "type": "string",
            "description": "محل نگهداری نسخه اصلی پایان نامه"
        },
        "note": {
            "title": "یادداشت",
            "type": "string",
            "description": "توضیحات تکمیلی یا یادداشت های ثبت شده"
        },
        "download_url": {
            "title": "آدرس فایل پایان نامه",
            "type": "string",
            "description": "نشانی فایل چکیده یا متن کامل پایان نامه"
        }
    }
}