ارتقای دقت مدل‌های هوش مصنوعی و یادگیری ماشین از طریق پاک‌سازی پیشرفته داده‌ها: مدیریت مؤثر مقادیر گمشده و نقاط پرت
کد مقاله : 1066-DATAGOV2024
نویسندگان
محمد غانمی *
مدرس دانشگاه آزاد واحد پارسیان
چکیده مقاله
در فضای رقابتی امروز، تصمیم گیری مبتنی بر داده به عامل کلیدی موفقیت سازمان ها بدل شده است،اما کیفیت تحلیل ها به شدت به کیفیت داده وابسته است.این پژوهش با رویکردی روش شناختی، اهمیت پاکسازی داده ها را در تحلیل های کمی کسب و کار بررسی کرده و چارچوبی برای شناسایی،تشخیص و اصلاح ناهنجاری های داده ای ارائه می دهد.تمرکز تحقیق بر مدیریت مقادیر گمشده و پرت است که در مدل های یادگیری ماشین و سیستم های پیش بینی نقش حیاتی دارند.در روش اجرا،از تکنیک های جاگذاری آماری،جایگزینی چندگانه داده، شناسایی پرت ها با روش های آماری و الگوریتم های یادگیری ماشین بهره گرفته شده است. یافته ها نشان می دهد پیش پردازش داده ها، به ویژه در مراحل اولیه تحلیل، از سوگیری مدل های پیش بینی جلوگیری کرده و دقت آنها را به طور قابل توجهی افزایش می دهد.همچنین، مستند سازی فرآیند پاکسازی موجب ارتقای اعتبار و قابلیت تعمیم نتایج می گردد.در نتیجه،پاک سازی داده ها نه یک فعالیت جانبی،بلکه فرآیندی راهبردی برای اطمینان از صحت،سازگاری و کامل بودن دادهاست و اجرای آن باعث بهبود تصمیم گیری در حوزه هایی چون سلامت،بازاریابی هدفمند،مدیریت ریسک،پیش بینی فروش و بهینه سازی عملیات می شود.
کلیدواژه ها
پاک‌سازی داده‌ها ؛ آماده‌سازی داده‌ها ؛ مقادیر ناسازگار ؛ داده‌های گمشده ؛ داده پرت
وضعیت: پذیرفته شده برای ارسال فایل های ارائه پوستر