چکیده:
تحلیل احساسات یا استخراج نظر، روشی در پردازش زبان طبیعی (NLP) برای شناسایی و دستهبندی محاسباتی نظرات کاربران بیان شده در دادههای متنی است. عمدتاً از آن برای تعیین اینکه نظرات، احساسات، ارزیابیها یا قضاوتهای کاربر نسبت به یک رویداد، موضوع، محصول و غیره مثبت، منفی یا خنثی است، استفاده میشود. در این رویکرد، حجم عظیمی از دادههای دیجیتال تولید شده آنلاین از وبلاگها و وبسایتهای رسانههای اجتماعی جمعآوری و تحلیل میشوند تا بینشها را کشف کرده و به تصمیمگیریهای تجاری کمک کنند. رسانههای اجتماعی اپلیکیشنهای مبتنی بر وب هستند که برای اجازه دادن به افراد جهت اشتراکگذاری سریع و کارآمد محتوای دیجیتال در لحظه طراحی و توسعه یافتهاند. بسیاری از مردم رسانههای اجتماعی را به عنوان اپلیکیشنهایی در گوشی هوشمند یا تبلت خود تعریف میکنند، اما حقیقت این است که این ابزار ارتباطی با کامپیوترها شروع شد. این ابزار به بخشی ضروری و جداییناپذیر از زندگی انسان تبدیل شده است. بیشتر کسبوکارها از رسانههای اجتماعی برای بازاریابی محصولات، تبلیغ برندها، ارتباط با مشتریان فعلی و پرورش کسبوکارهای جدید استفاده میکنند. دادههای رسانههای اجتماعی آنلاین فراگیر هستند. این دادهها به افراد اجازه میدهند نظرات و احساسات خود را درباره محصولات، رویدادها و سایر افراد در قالب پیامهای متنی کوتاه منتشر کنند. به عنوان مثال، توییتر یک سرویس شبکه اجتماعی آنلاین است که در آن کاربران پیامهای کوتاهی به نام «توییت» ارسال و با آنها تعامل دارند. از این رو، در حال حاضر رسانههای اجتماعی به منبعی آیندهدار برای کسبوکارها جهت کشف احساسات و نظرات مردم درباره یک رویداد یا محصول خاص تبدیل شدهاند. این مقاله بر توسعه یک تجزیهگر احساسات و طبقهبندیکننده تحلیل متن دادههای رسانههای اجتماعی مبتنی بر Multinomial Naïve Bayes تمرکز دارد. این مقاله همچنین روشهای مختلف غنیشدهای را که در تکنیکهای پیشپردازش استفاده میشوند، توضیح میدهد. همچنین این مقاله بر تکنیکهای مختلف یادگیری ماشین و مراحل استفاده از طبقهبندیکننده متن و انواع مختلف مدلهای زبانی تمرکز دارد.
خلاصه ماشینی:
این مقاله بر توسعه سیستم مبتنی بر یادگیری ماشین برای طبقهبندی توییت داده شده به دو دسته مثبت یا منفی تمرکز دارد.
معماری سیستم پیشنهادی تحلیلگر احساسات مبتنی بر ML برای تحلیل داده های توییتر با استفاده از تکنیک های پیش پردازش غنی شده و یک طبقهبندی کننده Multinomial Naive Bayes استفاده می شود.
این سیستم شامل موارد زیر است: استخراج کننده توییت ها (Tweets Extractor) پیش پردازش کننده غنی شده (Enriched Pre-processor) استخراج کننده ویژگی (Feature Extractor) طبقهبندی کننده احساسات (Emotion Classifier) یافته ی دقت (Accuracy Finder) / شکل 1.
پاک کننده متن غنی شده و پیش پردازش کننده (Enriched Text Cleaner and Pre-processor): برای تبدیل متن خام به متن تمیز از طریق حذف مقادیر عددی، کاراکترهای غیر انگلیسی، URL ها، فضاهای خالی و کلمات توقف (stop words) استفاده می شود.
مجموعه داده (Dataset) / توییت ها کلمات عامیانهای هستند که برای بیان احساسات کاربران درباره مسائل روز در توییتر استفاده می شوند.
مراحل انجام شده توسط پیش پردازش کننده غنی شده این سیستم به شرح زیر است: استفاده از فرهنگ لغت ایموجی ها: جایگزینی تمام ایموجی ها با مقدار قطبیت احساسی آنها ||pos||/||neg||.
جایگزینی URL ها با تگ ||url|| با استفاده از عبارت های منظم (Regular Expressions) حذف کاراکترهای یونیکد (Unicode) رمزگشایی موجودیت های HTML تبدیل تمام حروف به حروف کوچک (lowercase) جایگزینی نام کاربری ها/هدف ها @ با ||target|| جایگزینی مخفف ها با ترجمه آنها جایگزینی کلمات نفی کننده مانند not، no، never با تگ ||not|| جایگزینی دنباله کاراکترهای تکراری با دو کاراکتر (به عنوان مثال، "helloooo" = "helloo") برای حفظ کاربرد تاکید شده کلمه.
یک طبقهبند Naive Bayes یک مدل یادگیری ماشین احتمالی است که برای طبقهبندی استفاده میشود.