مدل دو مرحله ای شکاف- گلچین برای نمایه سازی خودکار متون فارسی
Publish Year: 1394
نوع سند: مقاله ژورنالی
زبان: Persian
View: 89
متن کامل این Paper منتشر نشده است و فقط به صورت چکیده یا چکیده مبسوط در پایگاه موجود می باشد.
توضیح: معمولا کلیه مقالاتی که کمتر از ۵ صفحه باشند در پایگاه سیویلیکا اصل Paper (فول تکست) محسوب نمی شوند و فقط کاربران عضو بدون کسر اعتبار می توانند فایل آنها را دریافت نمایند.
- Certificate
- من نویسنده این مقاله هستم
استخراج به نرم افزارهای پژوهشی:
شناسه ملی سند علمی:
JR_PUBLIJ-21-1_002
تاریخ نمایه سازی: 22 خرداد 1401
Abstract:
هدف: به علت خاص بودن برخی از مسائل زبانی، لازم است که مدلهای بومی نمایهسازی خودکار را با توجه به ویژگیهای هر زبان طراحی کرد. این مدلها باید بهگونهای طراحی شود که جامعیت و مانعیت نمایهسازی مورد توجه باشد. هدف این مقاله معرفی و سنجش توانمندی مدل دو مرحلهای شکاف – گلچین برای نمایهسازی خودکار مقالات فارسی است. ابتدا الگوریتم کار به تفصیل توضیح داده میشود و سپس همخوانی نتایج حاصل از این الگوریتم با کلیدواژههای نویسنده سنجیده خواهد شد.
روش: مدل نمایهسازی خودکار فارسی بههمراه توضیح مراحل و مسائل مرتبط با آن معرفی خواهد شد. ارزیابی مدل از طریق شاخص دربردارندگی انجام می شود که برای تعیین درصد همخوانی بین نمایهسازان مورد استفاده قرار میگیرد. برای این کار، میزان همخوانی اصطلاحات نمایه ای که از پیادهسازی الگوریتم این مدل حاصل شدهاند، با کلیدواژههای نویسندگان مقالات بررسی میگردد.
یافته ها: یافتهها نشان داد که در ۹۰ درصد از موارد، اصطلاحی که این مدل در یک مقاله بهعنوان پروزنترین اصطلاح تشخیص داده است، مشابه اولین کلیدواژه نویسنده آن مقاله است. در کل، بین نتایج این مدل و کلیدواژههای نویسندگان ۷۶ درصد همخوانی وجود داشت که در مقایسه با کارهای قبلی، قابل قبول به نظر میرسد.
اصالت/ارزش: ارزش اولیه این کار پرداختن به نمایهسازی خودکار با توجه به ویژگیهای زبان فارسی است. برای پیادهسازی مدل ارائه شده، فرض بر استفاده از زبان عبارات الگودار است که توسط بسیاری از زبانهای برنامهنویسی پشتیبانی میشود و نیاز به نصب و استفاده از جدولهای بانک اطلاعاتی را برای پردازش متن کاهش میدهد. همچنین، مشکل تعیین آستانه بالایی اصطلاحات اصلی را حل میکند. علاوه بر آن، با الگوریتمی خاص، حد پایینی را نیز تعیین میکند؛ بهگونهای که دیگر تعداد اصطلاحات گلچین شده به طول متن بستگی ندارد. این امکان، جامعیت و مانعیت نمایهسازی را تضمین میکند.
Keywords:
Automatic Indexing , Persian Language , Break-Cull Model. , نمایهسازی خودکار , زبان فارسی , مدل شکاف – گلچین.
Authors
محمد توکلی زاده راوری
Yazd University
مراجع و منابع این Paper:
لیست زیر مراجع و منابع استفاده شده در این Paper را نمایش می دهد. این مراجع به صورت کاملا ماشینی و بر اساس هوش مصنوعی استخراج شده اند و لذا ممکن است دارای اشکالاتی باشند که به مرور زمان دقت استخراج این محتوا افزایش می یابد. مراجعی که مقالات مربوط به آنها در سیویلیکا نمایه شده و پیدا شده اند، به خود Paper لینک شده اند :