بهبود کارایی در خلاصه سازی ویدیو با استفاده از شبکه هایعصبی

علی, کریمی

بهبود کارایی در خلاصه سازی ویدیو با استفاده از شبکه هایعصبی

عنوان مقاله: بهبود کارایی در خلاصه سازی ویدیو با استفاده از شبکه هایعصبی
شناسه ملی مقاله: IVCONF05_075
منتشر شده در پنجمین همایش ملی توسعه علوم فناوریهای نوین در مدیریت، حسابداری و کامپیوتر در سال 1401

مشخصات نویسندگان مقاله:

علی کریمی - دانشگاه تهرانمهندسی فناوری اطلاعات-گرایش شبکه های ارتباطی و کامپیوتری

خلاصه مقاله:

در این تحقیق با توجه به عدم وجود مجموعه داده از صدای گزارشگرمجموعه داده صوتی به زبان انگلیسی شامل بیان ۲۱ کلمه فوتبالیجمع آوری شده است که هر کلمه مجموعا ۲۱۰۰ بار توسط ۷۰۰ نفر متفاوتبیان شده است. شبکه تشخیص کلمه پیشنهادی که شبکه ای مبتنی بر لایه هایکانولوشنی و شبکه های بازگشتی است بر روی این مجموعه داده توانستهاست به دقت ۸۵.۸ درصدی برسد. مجموعه داده جمع آوری شده دیگر شامل۶۲۷۷ ویدیو در ۱۲ رویداد مختلف بوده است که هدف از جمع آوری آنایجاد مجموعه داده ای از رویدادهای مختلف با ابتدا و انتهای مشخصاز آن رویداد بوده است. شبکه عصبی پیشنهادی برای طبقه بندی ویدیوبه طور هم زمان از یادگیری عمیق و یادگیری کم عمق استفاده می کند. ازیادگیری عمیق در راستای استخراج ویژگی های محلی که از ارزش بالاییبرای تشخیص نوع ویدیو برخوردار هستند استفاده می شود و از یادگیریکم عمق در راستای استخراج ویژگی های زمانی استفاده می شود. روشپیشنهادی ۶.۲ درصد دقیق تر از سایر روش های طبقه ویدیو در فوتبال استو درعین حال حدود ۲۹ درصد محاسبات کمتری نسبت به بهترین شبکه عصبیمشابه نیاز دارد. در مجموع با استفاده از شبکه تشخیص صحنه و اعمالشبکه طبقه بندی کننده ویدیو بر روی ویدیو، دقت الگوریتم تشخیص رویداددر طول یک مسابقه فوتبال به ۸۸.۷۳ درصد می رسد. همچنین با اضافه شدنصدای گزارشگر دقت آشکارسازی رویداد ۱.۶۴ درصد و با افزودن صدایتماشاگر دقت ۰.۶۳ درصد افزایش می یابد تا در نهایت دقت آشکارسازیرویداد روش پیشنهادی با استفاده هم زمان از ویدیو، صدای تماشاگر وگزارشگر به ۹۱ درصد برسد.

کلمات کلیدی:

خلاصه سازی ویدیو، شبکه عصبی، یادگیری عمیق، ویدیوفوتبال، تشخیص رویداد

صفحه اختصاصی مقاله و دریافت فایل کامل: https://civilica.com/doc/1554064/