بررسی و حل مشکل خروجی فارسی در مدل های زبانی

Publish Year: 1404
نوع سند: مقاله کنفرانسی
زبان: Persian
View: 64

This Paper With 6 Page And PDF Format Ready To Download

  • Certificate
  • من نویسنده این مقاله هستم

استخراج به نرم افزارهای پژوهشی:

لینک ثابت به این Paper:

شناسه ملی سند علمی:

NERA10_315

تاریخ نمایه سازی: 11 تیر 1405

Abstract:

مدل های زبانی بزرگ (LLM) مانند Qwen برای پردازش متن و تولید خروجی، ابتدا جملات را به توکن های کوچک تبدیل می کنند و سپس این توکن ها را به بردارهای عددی (Embedding) تبدیل می کنند. با این حال، Vocabulary پیش فرض این مدل ها عمدتا برای زبان انگلیسی بهینه شده و باعث می شود پردازش زبان هایی مانند فارسی کیفیت پایینی داشته باشد. در این پروژه، به جای آموزش مجدد کل مدل، از روش Vocabulary Conversion استفاده کردیم؛ به طوری که توکن های انگلیسی و وزن های اصلی مدل حفظ شده و توکن های اختصاصی فارسی با الگوریتم های BPE و Unigram به Vocabulary اضافه شدند. این روش به مدل امکان می دهد جملات فارسی را به شکل بهینه پردازش کند و خروجی دقیق و طبیعی ارائه دهد، بدون آنکه دانش پیشین مدل درباره زبان های دیگر از بین برود.

Authors

یاسین کیخا

دانشکده ملی و مهارت محمودآباد