دانلود پایان نامه داده کاوی در پزشکی در قالب word به صورت کامل و آماده در 78 صفحه به قیمت 69000 تومان که لینک دانلود بلافاصله بعد از پرداخت نمایش داده می شود.
پایان نامه داده کاوی در پزشکی
مقدمه
امروزه با گسترش سيستم هاي پايگاهي و حجم بالاي داده¬هاي ذخيره شده در اين سيستم ها ، نياز به ابزاري است تا بتوان داده هاي ذخيره شده پردازش کرد و اطلاعات حاصل از اين پردازش را در اختيار کاربران قرار داد . با استفاده ار پرسش¬هاي ساده در SQL و ابزارهاي گوناگون گزارش گيري معمولي ، مي توان اطلاعاتي را در اختيار کاربران قرار داد تا بتوانند به نتيجه گيري در مورد داده ها و روابط منطقي ميان آنها بپردازند اما وقتي که حجم داده¬ها بالا باشد ، کاربران هر چند زبر دست و با تجربه باشند نمي توانند الگوهاي مفيد را در ميان حجم انبوه داده ها تشخيص دهند و يا اگر قادر به اين کار هم با شند ، هزينه عمليات از نظر نيروي انساني و مادي بسيار بالا است .از سوي ديگر کاربران معمولا فرضيه اي را مطرح مي کنند و سپس بر اساس گزارشات مشاهده شده به اثبات يا رد فرضيه مي پردازند ، در حالي که امروزه نياز به روشهايي است که اصطلاحا به کشف دانش بپردازند يعني با کمترين دخالت کاربر و به صورت خودکار الگوها و رابطه هاي منطقي را بيان نمايند .
داده کاوي يکي از مهمترين اين روشها است که به وسيله آن الگوهاي مفيد در داده ها با حداقل دخالت کاربران شناخته مي شوند و اطلاعاتي را در اختيار کاربران و تحليل گران قرار مي دهند تا براساس آنها تصميمات مهم و حياتي در سازمانها اتخاذ شوند .در داده کاوي از بخشي از علم آمار به نام تحليل اکتشافي داده ها استفاده مي شود که در آن بر کشف اطلاعات نهفته و ناشناخته از درون حجم انبوه داده ها تاکيد مي شود . علاوه بر اين داده کاوي با هوش مصنوعي و يادگيري ماشين نيز ارتباط تنگاتنگي دارد ، بنابراين مي توان گفت در داده کاوي تئوريهاي پايگاه داده ها ، هوش مصنوعي ، يادگيري ماشين و علم آمار را در هم مي آميزند تا زمينه کاربردي فراهم شود . بايد توجه داشت که اصطلاح داده کاوي زماني به کار برده مي شود که با حجم بزرگي از داده ها ، در حد مگا يا ترابايت ، مواجه باشيم . در تمامي منابع داده کاوي بر اين مطلب تاکيد شده است . هر چه حجم داده ها بيشتر و روابط ميان آنها پيچيده تر باشد دسترسي به اطلاعات نهفته در ميان داده ها مشکلتر مي شود و نقش داده کاوي به عنوان يکي از روشهاي کشف دانش ، روشن تر مي گردد .
1-2-مفاهيم پايه در داده کاوي
در داده کاوي معمولا به کشف الگوهاي مفيد از ميان داده ها اشاره مي شود . منظور از الگوي مفيد ، مدلي در داده ها است که ارتباط ميان يک زير مجموعه از داده ها را توصيف مي کند و معتبر ، ساده ، قابل فهم و جديد است .
1-2-1-تعريف داده کاوي
در متون آکادميک تعاريف گوناگوني براي داده کاوي ارائه شده اند . در برخي از اين تعاريف داده کاوي در حد ابزاري که کاربران را قادر به ارتباط مستقيم با حجم عظيم داده ها مي سازد معرفي گرديده است و در برخي ديگر ، تعاريف دقيقتر که درآنها به کاوش در داده ها توجه مي شود موجود است . برخي از اين تعاريف عبارتند از :
• داده کاوي عبارت است از فرايند استخراج اطلاعات معتبر ، از پيش ناشناخته ، قابل فهم و قابل اعتماد از پايگاه داده هاي بزرگ و استفاده از آن در تصميم گيري در فعاليت هاي تجاري مهم.
• اصطلاح داده کاوي به فرايند نيم خودکار تجزيه و تحليل پايگاه داده هاي بزرگ به منظور يافتن الگوهاي مفيد اطلاق مي شود
• داده کاوي يعني جستجو در يک پايگاه داده ها براي يافتن الگوهايي ميان داده ها .
• داده کاوي يعني استخراج دانش کلان ، قابل استناد و جديد از پايگاه داده ها ي بزرگ .
• داده کاوي يعني تجزيه و تحليل مجموعه داده هاي قابل مشاهده براي يافتن روابط مطمئن بين داده ها .
همانگونه که در تعاريف گوناگون داده کاوي مشاهده مي شود ، تقريبا در تمامي تعاريف به مفاهيمي چون استخراج دانش ، تحليل و يافتن الگوي بين داده ها اشاره شده است .
1-3- تاريخچه داده کاوي
اخيرا داده کاوي موضوع بسياري از مقالات ، کنفرانس ها و رساله ها ي عملي شده است ، اما اين واژه تا اوايل دهه نود مفهومي نداشت وبه کار برده نمي شد .در دهه شصت و پيش از آن زمينه هايي براي ايجاد سيستم ها ي جمع آوري و مديريت داده ها ايجاد شد و تحقيقاتي در اين زمينه انجام پذيرفت که منجر به معرفي و ايجاد سيستم هاي مديريت پايگاه داده ها گرديد .ايجاد و توسعه مدلهاي داده اي براي پايگاه سلسله مراتبي ، شبکه اي و بخصوص رابطه اي در دهه هفتاد ، منجر به معرفي مفاهيمي همچون شاخص گذاري و سازماندهي داده ها و در نهايت ايجاد زبان پرسش SQL در اوايل دهه هشتاد گرديد تا کاربران بتوانند گزارشات و فرمهاي اطلاعاتي مورد نظر خود را ، از اين طريق ايجاد نمايند .توسعه سيستم هاي پايگاهي پيشرفته در دهه هشتاد و ايجاد پايگاه هاي شي گرا ، کاربرد گرا و فعال باعث توسعه همه جانبه و کاربردي شدن اين سيستم ها در سراسر جهان گرديد . بدين ترتيب DBMS هايي همچون DB2 ، Oracle ، Sybase ، … ايجاد شدند و حجم زيادي از اطلاعات با استفاده از اين سيستم ها مورد پردازش قرار گرفتند . شايد بتوان مهمترين جنبه در معرفي داده کاوي را مبحث کشف دانش از پايگاه داده ها ( KDD) دانست بطوري که در بسياري موارد DM و KDD بصورت مترادف مورد استفاده قرار مي گيرند.همانطور که در تعريف داده کاوي ذکر شد ، هدف از جستجو و کشف الگوهايي در پايگاه داده ها و استفاده از آنها در اخذ تصميمات حياتي است ، بنابراين مي توان گفت که DM بخشي از فرايند KDD است که در نهايت به ايجاد سيستم هاي DSS شکل 1-1 نقش داده کاوي در فرايند کشف دانش از پايگاه داده ها را نشان مي دهد . براي اولين بار مفهوم داده کاوي در کارگاه IJCAI در زمينه KDD توسط Shapir مطرح گرديد . به دنبال آن در سالهاي 1991 تا 1994 ، کارگاههاي KDD مفاهيم جديدي را در اين شاخه از علم ارائه کردند بطوري که بسياري از علوم و مفاهيم با آن مرتبط گرديدند که مي توان آنها را در شکل 2-1 مشاهده نمود .
برخي از کاربردهاي داده کاوي در محيطهاي واقعي عبارتند از :
1. خرده فروشي : از کاربردهاي کلاسيک داده کاوي است که مي توان به موارد زير اشاره کرد :
• تعيين الگوهاي خريد مشتريان
• تجزيه و تحليل سبد خريد بازار
• پيشگويي ميزان خريد مشتريان از طريق پست(فروش الکترونيکي)
2. بانکداري :
• پيش بيني الگوهاي کلاهبرداري از طريق کارتهاي اعتباري
• تشخيص مشتريان ثابت
• تعيين ميزان استفاده از کارتهاي اعتباري بر اساس گروههاي اجتماعي
3. بيمه :
• تجزيه و تحليل دعاوي
• پيشگويي ميزان خريد بيمه نامه هاي جديد توسط مشتريان
4. پزشکي :
• تعيين نوع رفتار با بيماران و پيشگويي ميزان موفقيت اعمال جراحي
• تعيين ميزان موفقيت روشهاي درماني در برخورد با بيماريهاي سخت
1-4-مراحل فرايند کشف دانش از پايگاه داده ها
فرايند کشف دانش از پايگاه داده ها شامل پنج مرحله است که عبارتند از :
1. انبارش داده ها
2. انتخاب داده ها
3. تبديل داده ها
4. کاوش در داده ها
5. تفسير نتيجه
همانگونه که مشاهده مي شود داده کاوي يکي از مراحل اين فرايند است که به عنوان بخش چهارم آن نقش مهمي در کشف دانش از داده ها ايفا مي کند .
1-4-1-انبارش داده ها
وجود اطلاعات صحيح و منسجم يکي از ملزوماتي است که در داده کاوي به آن نيازمنديم . اشتباه و عدم وجود اطلاعات صحيح باعث نتيجه گيري غلط و در نتيجه اخذ تصميمات ناصحيح در سازمانها مي گردد و منتج به نتايج خطرناکي خواهد گرديد که نمونه هاي آن کم نيستند .اکثر سازمانها دچار يک خلا اطلاعاتي هستند . در اينگونه سازمانها معمولا سيستم هاي اطلاعاتي در طول زمان و با معماري و مديريت هاي گوناگون ساخته شده اند ، به طوري که سازمان اطلاعاتي يکپارچه و مشخصي مشاهده نمي گردد . علاوه بر اين براي فرايند داده کاوي به اطلاعات خلاصه و مهم در زمينه تصميم گيريهاي حياتي نيازمنديم .
هدف از فرايند انبارش داده ها فراهم کردن يک محيط يکپارچه جهت پردازش اطلاعات است . در اين فرايند ، اطلاعات تحليلي و موجز در دوره هاي مناسب زماني سازماندهي و ذخيره مي شود تا بتوان از آنها در فرايند هاي تصميم گيري که از ملزومات آن داده کاوي است ، استفاده شود . به طور کلي تعريف زير براي انبار داده ها ارائه مي گردد :
انبار داده ها ، مجموعه اي است موضوعي ، مجتمع ، متغير در زمان و پايدار از داده ها که به منظور پشتيباني از فرايند مديريت تصميم گيري مورد استفاده قرار مي گيرد. انبارش داده ها خود موضوع مفصلي است که مقاله ها و رساله ها ي گوناگوني در مورد آن نگاشته شده اند . در اين فصل به منظور آشنايي با اين فرايند به آن اشاره اي شد .
1-4-2-انتخاب داده ها
انبار داده ها شامل انواع مختلف و گوناگوني از داده ها است که همه آنها در داده کاوي مورد نياز نيستند . براي فرايند داده کاوي بايد داده ها ي مورد نياز انتخاب شوند . به عنوان مثال در يک پايگاه داده هاي مربوط به سيستم فروشگاهي ، اطلاعاتي در مورد خريد مشتريان ، خصوصيات آماري آنها ، تامين کنندگان ، خريد ، حسابداري و … وجود دارند . براي تعيين نحوه چيدن قفسه ها تنها به داده ها يي در مورد خريد مشتريان و خصوصيات آماري آنها نياز است . حتي در مواردي نياز به کاوش در تمام محتويات پايگاه نيست بلکه ممکن است به منظور کاهش هزينه عمليات ، نمونه هايي از عناصر انتخاب و کاوش شوند .
1-4-3-تبديل داده ها
هنگامي که داده هاي مورد نياز انتخاب شدند و داده ها ي مورد کاوش مشخص گرديدند ، معملا به تبديلات خاصي روي داده ها نياز است . نوع تبديل به عمليات و تکنيک داده کاوي مورد استفاده بستگي دارد : تبديلاتي ساده همچون تبديل نوع داده اي به نوع ديگر تا تبديلات پيچيده تر همچون تعريف صفات جديد با انجام عملياتهاي رياضي و منطقي روي صفات موجود .
1-4-4-کاوش در داده ها
داده هاي تبديل شده با استفاده از تکنيکها و عملياتهاي داده کاوي مورد کاوش قرار مي گيرند تا الگوهاي مورد نظر کشف شوند .
1-4-5-تفسير نتيجه
اطلاعات استخراج شده با توجه به هدف کاربر تجزيه و تحليل و بهترين نتايج معين مي گردند . هدف از اين مرحله تنها ارائه نتيجه (بصورت منطقي و يا نموداري) نيست ، بلکه پالايش اطلاعات ارايه شده به کاربر نيز از اهداف مهم اين مرحله است .
1-5-عملياتهاي داده کاوي
در داده کاوي ، چهار عمل اصلي انجام مي شود که عبارتند از :
1. مدلسازي پيشگويي کننده
2. تقطيع پايگاه داده ها
3. تحليل پيوند
4. تشخيص انحراف
از عملياتهاي اصلي مذکور ، يک يا بيش از يکي از آنها در پياده سازي کاربرد هاي گوناگون داده کاوي استفاده مي شوند . به عنوان مثال براي کاربرد هاي خرده فروشي معمولا از عمليات تقطيع و تحليل پيوند استفاده مي شود در حالي که براي تشخيص کلاهبرداري ، مي توان از هر يک از چهار عمليات مذکور استفاده نمود . علاوه برا ين مي توان از دنباله اي از عملياتها براي يک منظور خاص استفاده کرد . مثلا براي شناسايي مشتريان ، ابتدا پايگاه تقطيع مي شود و سپس مدلسازي پيشگويي کننده در قطعات ايجاد شده اعمال مي گردد .
تکنيکها ، روشها و الگوريتمهاي داده کاوي ، راههاي پياده سازي عملياتهاي داده کاوي هستند . اگر چه هر عمليات نقاط ضعف و قوت خود را دارد ، ابزارهاي گوناگون داده کاوي عملياتها را بر اساس معيارهاي خاصي ، انتخاب مي کنند . اين معيارها عبارتند از :
• تناسب با نوع داده هاي ورودي
• شفافيت خروجي داده کاوي
• مقاومت در مقابل اشتباه در مقادير داده ها
• ميزان صحت خروجي
• توانايي کار کردن با حجم بالاي داده ها
در جدول زيرتکنيکهاي وابسته به هر يک از عملياتهاي چهار گانه مشخص شده اند
نام عمليات تکنيک هاي داده کاوي
مدلسازي پيشگويي کننده رده بندي ، پيشگويي مقدار
تقطيع پايگاه داده ها خوشه بندي آماري ، خوشه بندي
تحليل پيوند کشف بستگي ، کشف الگوهاي متوالي ، کشف دنباله هاي زماني مشابه
تشخيص انحراف آمار ، تجسم مدل
جدول(1-1): عملياتها و تکنيکهاي داده کاوي
1-6-مدلسازي پيشگويي کننده
مدلسازي پيشگويي کننده ، شبيه تجربه يادگيري انسان در به کار بردن مشاهدات براي ايجاد يک مدل از خصوصيات مهم پديده ها است . در اين روش از تعميم دنياي واقعي و تعميم دنياي واقعي و قابليت تطبيق داده هاي جديد با يک قالب کلي ، استفاده مي شود .در اين مدل ، مي توان با تحليل يک پايگاه داده هاي موجود ، خصوصيات مجموعه هاي داده را تعيين کرد . اين مدل با استفاده از روش يادگيري نظارت شده، شامل دو فاز آموزش و آزمايش ايجاد شده است . در فاز آموزش با استفاده از نمونه هاي عظيمي از داده هاي سابقه اي ، مدلي ساخته مي شود که که به آن مجموعه آموزشي گو يند . در فاز آزمايش اين مدل روي داده هايي که در مجموعه آموزشي قرار ندارند ، اعمال مي شود تا صحت و خصو صيات آن تاييد گردد .از کاربردهاي عمده اين مدل مي توان به مديريت مشتريان ، تصويب اعتبار ، بازاريابي مستقيم در خرده فروشي و … اشاره کرد .
1-7-تقطيع پايگاه داده ها
هدف از تقطيع پايگاه داده ها ، تقسيم آن به تعداد نامعيني از قطعات يا خوشه هايي از رکوردهاي مشابه است ، يعني رکوردهايي که خصوصياتي مشابه دارند و مي توان آنها را همگن فرض کرد . پيوستگي داخلي اين قطعات بسيار زياد است در حالي که همبستگي خارجي ميان آنها کم مي باشد . در اين مدل بر خلاف مدل قبل ، از يادگيري نظارت نشده براي تعيين زيرشاخه هاي ممکن از جمعيت داده اي استفاده مي شود . دقت تقطيع پايگاه داده ها از روشهاي ديگر کمتر است ، بنابراين در مقابل خصوصيات نامربوط و افزونگي ، حساسيت کمتري از خود نشان مي دهد .
از کاربردهاي اين روش مي توان به شناسايي مشتريان ، بازاريابي مستقيم و … اشاره کرد . در اين مثال ، پايگاه داده ها شامل 200 مشاهده است که در آن 100 اسکناس تقلبي و 100 اسکناس واقعي هستند . داده ها داراي شش بعد مي باشند که هر بعد مربوط به يک معيار از اندازه اسکناس ها است . با استفاده از تقطيع پايگاه داده ها مي توان خوشه هاي متناظر با اسکناسهاي معتبر و تقلبي را تشخيص داد . دو خوشه از اسکناسهاي تقلبي وجود دارند و اين بدان معني است که حداقل دو گروه مبادرت به توليد و چاپ اسکناسهاي تقلبي مي کنند .تقطيع پايگاه داده ها با آمارگيري مرتبط است که در ان از فاصله ميان رکوردها و درصد قرار گرفتن داده هاي ورودي در خوشه ها ، جهت تجزيه و تحليل استفاده مي شود .
1-8-تحليل پيوند
در اين روش پيوند هايي مرسوم به بستگي ميان رکوردها و يا مجموعه اي از رکوردها بازشناسي مي شوند . سه رده ويژه از تحليل پيوند وجود دارند که عبارتند از :
1. کشف بستگي
2. کشف الگوهاي متوالي
3. کشف دنباله هاي زماني مشابه
براي قوانين وابستگي دو پارامتر معرفي مي گردند :
1. درجه پشتيباني : کسري از جمعيت است که در يک قاعده ، هم مقدم و هم تالي را دارند . در واقع درصدي از تراکنشها که شامل همه اقلام ظاهر شده در مقدم و تالي باشند . فرض کنيم که تنها در 0001/ . % از تراکنشهاي خريد ، شير و پيچ گوشتي با هم باشند ، بنابراين درجه پشتيباني براي قانون ” پيچ گوشتي → شير ” بسيار پايين است . اين مساله نشان مي دهد که مدرکي براي اثبات رابطه ميان ” شير ” و ” پيچ گوشتي ” وجود ندارد .
2. درجه اطمينان : در يک جمعيت مورد بررسي ، کسري از موارد است که وقتي مقدم قاعده در آنها ظاهر شده است ، تالي نيز در آنها وجود دارد . به عنوان مثال در قانون ” پنير → نان ” اگر درجه اطمينان برابر 80% تراکنشهاي خريد ، اگر نان وجود داشته باشد ، پنير نيز وجود دارد . بايد توجه داشت که مقدار درجه اطمينان با تعويض مقدم و تالي در قاعده ، ممکن است به شدت تغيير کند .
دامنه اندازه پايگاه هاي داده امروزه به ترا بايت رسيده است اين پايگاه داده به همراه اطلاعات فراواني که به صورت ناشناخته در آن تعبيه گرديده مي بايشد مساله اين است که چگونه مي توان از ميان اين جنگل عظيم اطلاعاتي به همراه درختهاي پيچيده آن اطلاعاتي را استنتاج نمود؟با استفاده از داده کاوي مي توان اين هزينه را کم نمود و در عوض بازدهي بيشتري بدست آورد.در حال حاضر شرکتهاي بي شماري سعي دارند با استفاده از اين روش به مشتريان خود پيشنهادات بهتري براي خريد ارائه دهند تا فروش آنها بالاتر رفته و در عوض ضرر و زيان موجود از اين طريق کمينه گردد. داده کاوي فرآيندي است که طي آن با استفاده از انواع مختلف ابزار تحليل داده به دنبال کشف الگوها و ارتباطات ميان داده هاي موجود که ممکن است منجر به استخراج اطلاعات جديدي از پايگاه داده گردند مي باشد. اولين وساده ترين گام تحليل داده در داده کاوي توضيح و شرح مشخص داده (از جمله معني داده وانحراف استاندارد کلمه)مي باشد که اين کار مي تواند به وسيله نمدارها و گراف هاييوهمچنين کلماتي که با اين کلمه ارتباط معنايي نزديکي دارند انجام گردد در نيجه جمع آوري جستجو و انتخاب داده درست در اين بخش بسيار مهم و حياتي مي باشد.
اما اين کار به تنهايي کار خاصي انجام نمي دهد شما بايد يک مدل پيش بيني کننده بر اساس الگهايي که از نتايج دانش به دست آورده شده بسازيد سپس آزمايش کنيد که آيا ان مدل با نمونه اصلي سازگار است يک مدل خوب نبايد با جهان واقع تفاوت چنداني داشته باشد.آخرين گام نيز تشخيص صحت وسقم عملکرد مدل بصورت تجربي مي باشدم.براي مثال از يک بانک مربوط به مشتريان وپاسخ هايي که به يک پيشنهاد خاص داده اند يک مدل مي سازيد که بر اساس آن مشخص مي شود که کدام حدس وانتظار بيشترين نزديکي را با يک پيشنهاد مانند پيشنهاد قبلي دارد و اينکه آيا شما مي توانيد بر اين حدس اعتماد کنيد يا نه؟
قابليتهاي DataMining
بايد توجه داشته باشيد كه داده كاوي يك ابزار جادويي نيست كه بتواند در پايگاه داده شما به دنبال الگوهاي جالب بگردد و اگر به الگويي جديدي برخورد كرد آن را به شما اعلام كند بلكه صرفا الگوها و روابط بين داده ها را به شما اعلام مي كند بدون توجه به ارزش آنها. بنابراين الگوهايي كه به اين وسيله كشف مي شوند بايد با جهان واقع تطابق داشته باشند. به عنوان مثال داده كاوي مي تواند با تعيين نرخ در آمدهايي كه بطور مثال بين 50/000$ و 65/000$ است كه براي خريد روزنامه خاصي در ميان فروشندگان است تعيين كند كه اكثر كالاهاي مورد نياز مردم چه رنجي از قيمت بوده وكدام ها هستند؟
به اين ترتيب شما مي توانيد از هدف خريد مردم بدون اينكه فاكتورهايي براي خريد كالاهاي خود در نظر بگيريد مطلع شويد؟
براي تضمين بدست آمدن نتايج با معني لازم است كه شما بتوانيد داده هاي خود را تحليل كنيد كيفيت خروجي شما به اطلاعات خارج از پايگاه داده ( به عنوان مثال داده اي باارزشي كه متفاوت از داده هاي نوعي در پايگاه داده شماست) ستونهاي ظاهرا بي ارتباط يا با ارتباط نزديك به بقيه پايگاه داده(مانند تاريخ توليد يا انقضاي كالا) بستگي نزديكي دارند .الگوريتم بر اساس حساسيتشان به داده ها روشهاي متفاوتي دارند. اما غير عاقلانه است كه به محصول داده كاوي صرفا به براي تمام تصميم گيري هايمان تكيه كنيم.
داده كاوي بطور اتوماتيك و بدون رهنمايي قادر به كشف راه حل ها نيست. شما ترجيحا به جاي بيان يك هدف مبهم مانند “كمك به ارتقاي پاسخ دهي به در خواست ها mail من ” شما بايد از داده كاوي براي يافتن خصيصه هاي افرادي كه
(1): به درخواست هاي شما پاسخ مي دهند
(2): به درخواست هاي شما پاسخ داده و خريد زيادي مي كنند
استفاده كنيد. الگو هايي كه داده كاوي براي يافتن به اين دو هدف استفاده مي كنند متفاوت است.
اگر چه يك ابزار خوب براي داده كاوي شما را از پيچيدگي هاي تكنيكهاي آماري راحت مي سازد اما به شما براي فهميدن كار هاي ابزاري كه انتخاب كرده ايد و همچنين الگوريتمهايي كه بر پايه آن كار مي كند نيازمند است. انتخابي كه شما براي ابزار مورد نياز انجام مي دهيد و بهينه سازي هايي را كه شما انجام مي دهيد در دقت و سرعت كار بسيار تاثير دارد.
1-9-داده كاوي و انبار داده ها
اغلب داده اي كه مورد كاوش قرار مي گيرد ابتدا از يك انبار داده آماده شده به داخل يك پايگاه داده كاوي سرازير مي شود. اين كار مزاياي زيادي دارد. پايگاه داده كاوي مي تواند به جاي يك انبار فيزيكي داده يك انبار منطقي از داده ها باشد. به شرط آنكه انبار دادهDBMS بتواند دامنه هاي منابع اضافي از داده كاوي را نيز پوشش دهد.
1-10-داده كاوي و OLAP
يكي از سوالهاي رايج در ميان متخصصان پردازش داده در مورد تفاوت ميان داده كاوي وOLAP(پردازش آناليزي on-line).Olap قسمتي از قالب ابزارهاي تصميم گيري است. پرس وجو هاي سنتي و ابزارهاي گزارش گيري كه چه چيزي در داخل يك پايگاه داده است.olap از اين فراتر ميرود و براي جواب دادن به علت درستي برخي موارد استفاده دارد.
داده كاوي , آمار و يادگيري ماشين
داده كاوي فوايدي از پيشرفتهاي رشته هوش مصنوعي را در خود جاي داده است كه هم شامل قواعدي براي مسائل تشخيص الگو و طبقه بندي مي باشد وهم ارتباطاتي كه از طريق كاربرد شبكه هاي عصبي و درختهاي تصميم گيري براي فهم مسائل صورت مي گيرد مي باشد.داده كاوي در اين زمينه داراي الگوريتم هاي نسبتا جديدي مانند شبكه عصبي و درخت تصميم ورهيافت هاي جديدي براي الگوريتم هاي قديميتر مانند الگوريتم هاي تفكيك كننده دارد.نكته مهم آنكه داده كاوي كاربرد اين تكنيكها را براي مسائل تجاري مشابه بالا به طريقي كه اين تكنيكها را براي كاربر خبره دانش و آمارگير متخصص قابل دسترس سازد استفاده مي شود.
1-11-كاربردهاي داده كاوي
داده كاوي به سرعت در حال محبوبيت است به خاطر كمك هاي اساسي آن.سازمانهاي زيادي در حال استفاده از داده كاوي براي كمك به مديريت تمام فازهاي ارتباط با مشتري شامل به دست آوردن مشتريان جديد, افزايش سود از طريق مشتريان موجود و حفظ كردن مشتريان خوب هستند.با تعيين مشخصات يك مشتري خوب يك شركت مي تواند با همان مشخصات اهداف آينده خويش را پيش بيني كند. با پرونده سازي براي مشتري كه يك محصول خاص را خردي مي نمايد اين شركت مي تواند توجه خود را به مشتريان مشابهي كه از اين محصول خريد نكرده اند معطوف دارد با پرونده سازي براي مشترياني كه اين سازمان را ترك كرده اند يك شركت مي تواند مشترياني را كه خطر رفتن آنها نيز وجود دارد را نگه دارد چرا كه نگهداري يك مشتري موجود بسيار كم هزينه تر از بدست آوردن يك مشتري جديد هزينه مي برد. داده كاوي ارزشهايي را از طريق بررسي يك طيف وسيعي از كارخانه ها پيشنهاد مي كند.شركتهاي ارتباطات از راه دور و كارت هاي اعتباري دو شاخه بزرگ در استفاده از داده كاوي براي تشخيص استفاده كلاه بردارانه از خدمات آنها مي باشند. شركتهاي بيمه و درآمد هم علاقمند به استفاده از اين تكنولوژي براي كاهش كلاه برداري مي باشند. كاربردهاي دارويي نواحي مفيد ديگري هستند كه داده كاوي در آنها دست دارد داده كاوي مي تواند براي تشخيص تاثير اعمال جراحي, آزمايش هاي دارويي ودرمان استفاده گردد. شركتهايي كه در خريد و فروشهاي مالي فعاليت مي كنند از داده كاوي براي تعيين شاخصه هاي بازار و صنعت براي تشخيص كارايي درآمد استفاده مي كنند. خرده فروشها از داده كاوي براي تصميم در مورد اينكه كدام محصول در فروشگاه ها در آمد زاست به منظور دسترسي به ارتقاي كيفيت كار خود استفاده بيشتري مي نمايند. شركتهاي دارويي در حال كاوش پايگاههاي داده بزرگي از تركيبات شيميايي و مواد ژنتيكي براي كشف مواد كه مي توانند گزينه خوبي براي ساخت به عنوان دارو باشند.
داده كاوي موفق
دو نكته براي موفق بودن يك داده كاوي وجود دارد. اول اينكه يك فرموله سازي دقيق از مساله اي است كه شما بايد حل كنيد. دومين نكته استفاده از داده صحيح است. پس از انتخاب داده اي كه در دسترس شماست يا شايد خريد داده خارجي شما ممكن است نيازمند شويد آن را به روشهايي انتقال داده يا دسته بندي كنيد.
تحليل ارتباطات
تحليل ارتباط يک رهيافت توصيفي براي اکتشاف داده است که مي تواند به مشخص سازي ارتباطات ميان مقادير در پايگاه داده کمک نمايد.دو رهيافت عام براي رسيدن به تحليل ارتباطي اکتشاف ارتباطي و اکتشاف توالي مي باشد.اکتشاف ارتباطات قوانيني را در مورد مواردي را که بايد با هم در يک رويداد ظاهرشوند مانند تراکنش خريد را مي ِابد.تحليل سبد عرضه يک نمونه شناخته شده از کشف ارتباط مي باشد.کشف توالي بسيبار شبيه کشف ارتباط است با توجه به اين نکته که در اينجا توالي يک ارتباط است که در طول يک بازه زماني صورت مي گيرد.ارتباطات به صورت A=>B نوشته مي شود که به A مقدم يا طرف سمت چپ و به B تالي يا طرف سمت راست مي گويند.براي مثال در قانون ارتباطي “اگر مردم يک چکش بخرند آنگاه مي توانند ميخ بخرند” جمله مقدم “خريد چکش” و جمله تالي “خريد ميخ” مي باشد.براحتي ميتوان نسبت تراکنشهايي را که شامل مورد يا ليستي ازموارد خاص مي باشد با شمردن آنها تعيين کرد (که در اطنجا موارد ميخ ها و چکش هامي باشد) را تعيين کرد.تعداد موجود از يک نوع ارتباط خاص که در يک پايگاه داده به نظر مي رسد را موجودي يا شيوع آن مورد مي گويند.اگر براي مثال گفته شود که از هر 1000 تراکنش 15 تاي آن شامل “ميخ و چکش” مي باشد موجودي اين ارتباط 1.5%خواهد بود.يک موجودي کم(مثلا يک در ميليون) مي تواند بيانگر اين باشد که ان ارتباط خاص در پايگاه داده چندان مهم نيست.
براي کشف قوانين معنا دار ما بايد به فراواني متناسب دفعات اتفاق موارد و ترکيباتشان نيز بنگريم.باداشتن تعداد دفعات اتفاق مورد A مورد B چند بار اتفاق مي افتد؟به عبارت ديگر سوال اين است که ببينيم “هنگامي که مردم يک چکش مي خرند چه تعداد از اين افراد ميخ هم مي خرند؟ عبارت ديگر براي اين پيش بيني شرطي اطمينان نام دارد.فرض کنيد پايگاه داده فرضي مان رابه صورت زير و با جزئيات بيشتر براي بيان اين مفاهيم در نظر بگيريم:
تمام تراکنشهاي سخت افزار :1000
تعداد تراکنشهايي که شامل “چکش ” مي باشد:50
تعداد تراکنشهايي که شامل “ميخ” مي باشد:80
تعداد تراکنشهايي که شامل “تخته ” مي باشد:20
تعداد تراکنشهايي که شامل ” ميخ و چکش”مي باشد:15
تعداد تراکنشهايي که شامل ” ميخ و تخته ” مي باشد:10
تعداد تراکنشهايي که شامل ” چکش و تخته” مي باشد: 10
تعداد تراکنشهايي که شامل ” چکش و تخته و ميخ ” مي باشد:5
حال قادر به محاسبه ايم:
موجودي “ميخ و چکش”=1.5%
موجودي ” ميخ و چکش وتخته”=0.5%
درصد اطمينان “چکش=>ميخ” = 30%
درصد اطمينان ” ميخ=> چکش” = 19%
درصد اطمينان ” چکش و ميخ=>تخته” = 33%
درصد اطمينان ” تخته=> چکش و ميخ ” =25%
بنابراين ما مي بينيم که احتمال اينکه يک خرنده چکش ميخ هم بخرد(30%) بيشتر از احتمال آن است که فردي که ميخ مي خرد چکش هم بخرد(19%).ارتباط چکش و ميخ به اندازه اي بزرگ است که يک قانون با معني باشد.
Lift(نسبتا پيشرفت) يکي از معيارهاي اندازه گيري قدرت يک ارتباط است.هر چه lift بزرگتر باشد تاثير اتفاقات A بر احتمال اينکه B اتفاق بيفتد بيشتر است.lift بصورت نسبت
(اطمينان A=>B) تقسيم بر فراواني B محاسبه مي شود:
براي مثال ما:
Lift “چکش=>ميخ” :3.75
Lift ” چکش و ميخ =>تخته “:16.5
الگوريتمهاي ارتباط اين قوانين را با معادل مرتب سازي داده هنگام شمارش دفعاتي که مي توانند درصد اطمينان و موجودي را محاسبه كنند مي يابد. اثراتي كه هر يك از اين قوانين مي توانند داشته باشند يكي از معيارهاي تفاوت اين الگوريتم هاست. اين معيار مهم است زيرا كه نتايج تركيبي بسيار زيادي از تعداد بي شماري از قوانين بدست مي آيد حتي براي سبد هاي خريد. برخي از الگوريتمها يك پايگاه داده از قوانين, فاكتورهاي ايمن, و فراهم آوردن امكان جستجو(براي مثال تمام ارتباطاتي كه در آن كلمه بستني در قوانين به عنوان نتيجه آمده و فاكتوري برابر 80%را دارند نشان بده)را ايجاد مي نمايند.اغلب تصميم گيري در مورد كار با قوانيني كه شما كشف كرده ايد دشوار است.به عنوان مثال در يك نقشه خريد براي مشتريان در يك فروشگاه قراردادن تمام اجناس مرتبط منطقي به صورت فيزيكي در كنار يكديگر ممكن است ارزش كامل سبد خريد را كاهش دهد – مشتريان ممكن است در مجموع ارزش كمتري خريد كنند چون آنها بر خلاف نقشه خريد مورد نظر شما در حين راه رفتن در مغازه اجناس مورد دلخواه خود را خريد مي كنند. در چنين حالتي تقريب و تحليل ارتباطات معمولا براي بدست آوردن هر گونه سودي از قوانين مرتبط با هم مورد نياز خواهد بود.روشهاي گرافيكي مي توانند در نمايش ساختار ارتباطات نقش داشته باشند.
1-12-سلسله مراتبي از انتخاب ها
هدف داده كاوي توليد دانش جديدي است كه كاربر بتواند بر اساس آن كار خود را جلو برد. اين كار بوسيله ساختن مدلي از جهان واقعي بر پايه داده هايي كه از منابع گوناگون بدست مي آيد صورت گيرد كه اين منابع مي تواند شامل تراكنشهاي هماهنگ, تاريخ مربوط به هر مشتري, اطلاعات نمايش گرافيكي, داده كنترل فرآيند و پايگاه داده هاي مرتبط خارجي مانند اطلاعات اعتبار اداري و … باشد. نتيجه مدل سازي يك سري توضيحات در مورد الگوها و ارتباطات داده اي كه مي تواند به صورت مطمئني جهت پيش بيني آينده مورد استفاده قرار گيرد.
براي جلوگيري از سرگرداني در مراحل مختلف داده كاوي ايجاد تصويري از سلسله مراتبي از انتخابات و تصميم ها كه نياز مند آن هستيد در ذهن قبل از شروع كار به شما كمك خواهد كرد:
– هدف كار
– نوع پيش بيني
– نوع مدل انتخابي
– الگوريتم
– محصول
اولين گام مشخص نمودن هدف كار مي باشد :
هدف نهايي از جستجوي اين داده چيست؟ براي مثال جهت يافتن الگوهاي مفيدي در داده خود براي اين كه به شما كمك كند مشتريان خود را حفظ كنيد شما بايد يك مدل براي پيش بيني سودبخشي به مشتري و مدل ديگري براي شناسايي مشترياني كه آنجا را ترك كرده اند طراحي كنيد. دانش شما از احتياجات و اهداف سازمانتان شما را به سمت فرموله كردن اهداف مدلهايتان راهنمايي خواهد كرد.
گام بعدي تصميم در مورد انتخاب نوعي پيش بيني كه از همه مناسب تر است مي باشد:
(1) طبقه بندي: تعيين اين كه اين مورد خاص در كدام كلاس يا دسته قرار مي گيرد.
(2) حدس زدن اينكه يك متغير چه مقدار عددي خواهد داشت(اگر متغيري باشد كه با زمان تغيير كند اين كار حدس سريهاي زماني ناميده مي شود).در مثال بالا شما مي توانيد از اين حدس براي پيش بيني مقدار سوددهي و طبقه بندي براي پيش بيني اينكه كدام مشتريان ممكن است خريد شما را ترك كنند استفاده كنيد.
حالا نوبت به نوع مدل مي رسد:
كه عبارت است از يك شبكه عصبي براي انجام حدس فوق الذكر و يك درخت تصميم براي طبقه بندي. مدلهاي آماري سنتي نيز براي انتخاب از مدلهاي معمولي خطي , تحليل تفكيكي و حدس منطقي وجود دارد. مهمترين نوع اين مدلها براي داده كاوي در بخش بعد (الگوريتمها و مدلهاي داده كاوي)توضيح داده مي شود.الگوريتمهاي زيادي براي ساخت مدلهايتان در دسترس هستند. شما مي توانيد با استفاده از توابع شعاعي يا انتشاري شبكه عصبي بسازيد. براي درخت تصميم شما مي توانيد از ميان طرق cart, c5.0, Quest,CHAID يكي را انتخاب كنيد. برخي از اين الگوريتم ها در مدلها و الگوريتمهاي داده كاوي توضيح داده شده است.هنگام انتخاب يك محصول داده كاوي بايد توجه داشت كه اين محصولات پياده سازيهاي مختلفي از يك الگوريتم خاص دارند حتي اگر اين الگوريتم براي همه آنها نام يكساني داشته باشد. اين تفاوتها در پياده سازي مي تواند بر روي مشخصه هاي قابل استفاده مانند استفاده از حافظه و ذخيره داده و همچنين بر روي مشخصه هاي كارايي مانند سرعت و دقت تاثير بگذارند.بسياري از اهداف تجاري به بهترين شكل به وسيله ساخت انواع مختلفي از مدلها با استفاده از الگوريتمهاي مختلف به دست مي آيند. شما ممكن است تا زماني كه راه هاي مختلفي را امتحان نكنيد قادر نباشيد تعيين كنيد كدام نوع مدل بهترين است.
1-13-طبقه بندي
مسائل طبقه بندي به شناسايي خصوصياتي منجر مي شوند كه مشخص مي نمايند هر مورد به كدام گروه تعلق دارد.اين الگو هم مي تواند براي فهم داده موجود و هم براي پيش بيني اينکه هر نمونه جديد چگونه کار مي کند استفاده شود. براي مثال شما ممکن است بخواهيد پيش بيني کنيد که آيا اشخاص براي پاسخگويي به درخواست يک ميل مستقيم که ممکن است به يک دستگاه تلفن با مسافت زياد آسيب برساند مي توانند گروه بندي شوند يا براي يک عمل جراحي بايد گروه بندي شوند.داده کاوي مدلهاي طبقه بندي را بوسيله امتحان کردن داده طبقه بندي شده(موارد) و نهايتا يافتن يک الگوي پيش گو ايجاد مي کند. اين موارد موجود مي تواند از يك پايگاه داده تاريخي ناشي شود مانند اطلاعات افرادي كه تحت معالجه دارويي خاصي هستند و يا به سمت يك خدمت با مسافت دور جذب شده اند.يا اينكه از تجربه هايي كه طي آن يك نمونه از تمام پايگاه داده در جهان واقعي تست شده باشد و نتايج آن براي ايجاد يك گروه بند استفاده شده باشند منتج شود. براي مثال يك نمونه از ليستي از پيامها به عنوان پيشنهاد فرستاده خواهد شد و نتايج پيام رساني براي ساخت يك مدل طبقه بندي جهت بكار گرفته شدن در تمام پايگاه داده استفاده خواهد شد.
حدس بازگشتي
حدس بازگشتي از داده هاي موجود براي پيش بيني اين كه مقادير داده هاي ديگر چه خواهد بود استفاده مي كند. در ساده ترين حالت حدس مذكور از تكنيكهاي آماري مانند حدس خطي استفاده مي كند. متاسفانه بسياري از مسائل جهان واقع تصويري خطي از مقادير قبلي نيستند. براي نمونه مقادير فروش, ارزش فروش, ارزش سهام و نرخ ورشكستگي محصول براي پيش بيني سخت مي باشد زيرا آنها ممكن است بر فعل و انفعالات پيچيده حاصل از چندين متغير پيش بيني كننده متكي باشند. بنابراين تكنيكهاي پيچيده تري ممكن است براي پيش بيني متغيرهاي آينده ضروري باشند. انواع مدل يكسان اغلب مي توانند هم براي حدس بازگشتي وهم براي طبقه بندي استفاده شوند. براي مثال الگوريتم درخت تصميم CART (درختهاي حدس وطبقه بندي )هم براي ساخت درختهاي حدس و هم براي ساخت درختهاي طبقه بندي به كار مي رود. شبكه هاي عصبي هم مي توانند هر دو نوع مدل نام برده شده را ايجاد نمايند.
سري هاي زماني
سري هاي زماني پيش بيني كننده مقاديري را كه هنوز مقدارشان مشخص نيست بر اساس يك سري از پيشگوهاي متغير با زمان پيش بيني مي كنند. مانند حدس بازگشتي اين روش هم از نتايج معلوم قبلي براي اعمال پيشگويي هاي بعدي اش بهره مي برد. مدلها بايد خواص منحصر بفرد زمان علي الخصوص سلسله مراتب دوره هاي زماني مانند دوره هاي فصلي تاثيرات تقويمي مانند تعطيلات محاسبات تاريخي و ملاحظات خاص مانند تطبيق گذشته با حال را ذخيره نمايند.
1-14-مدلها و الگوريتمهاي داده كاوي
حال بياييد برخي از الگوريتمها و مدلهايي را كه براي كاوش داده استفاده مي شود را بررسي كنيم. اغلب محصولات از انواع گوناگوني از الگوريتمها كه در علم كامپيوتر يا مقالات آماري ارائه شده به همراه پياده سازي خاص آنها كه جهت رسيدن به هدف فروشنده مي باشد استفاده مي نمايند. براي مثال بسياري از فروشندگان نسخه هايي از درختهاي تصميم CART يا CHAID را به همراه امكاناتي براي كار بر روي كامپيوترهاي موازي مي فروشند. برخي از فروشندگان الگوريتمهاي مختص خود دارند كه گرچه ممكن است وابستگي ها يا امكانات اضافي نداشته باشد اما مي تواند خوب كار كند.شايد مهمترين نكنه اي باشد كه هيچ مدل يا الگوريتمي نمي تواند و نبايد به تنهايي استفاده شود. براي هر مساله داده شده طبيعت داده استفاده شده بر روي انتخاب مدلها و الگوريتمهايي كه شما بر مي گزينيد تاثير خواهد گذاشت. نمي توان هيچ مدل يا الگوريتمي را در اين زمينه بهترين ناميد. نتيجتا شما به يك سري ابزار و تكنولوژي جهت يافتن بهترين مدل ممكنه نياز خواهيد داشت.
1-15-شبكه هاي عصبي
شبكه هاي عصبي به طور خاصي مورد استفاده اند چرا كه آنها ابزاري موثر براي مدلسازي مسائل بزرگ و پيچيده كه ممكن است در آنها صدها متغير پيش بيني كننده كه فعل و انفعالات زيادي دارند وجود داشته باشد.(شبكه هاي عصبي زيستي بطور غير قابل مقايسه اي پيچيده تر هستند.)شبكه هاي عصبي مي توانند در مسائل طبقه بندي يا حدسهاي بازگشتي(كه در آنها متغير خروجي پيوسته است) استفاده شوند.
يك شبكه عصبي با يك لايه داخلي شروع مي شود كه در آن هر گره به يك متغير پيشگو منسوب مي گردد. اين گره هاي ورودي به يك تعداد از گره ها در لايه پنهان متصل مي شوند.گره ها در لايه پنهان مي توانند به گره هايي در يك لايه پنهان ديگر يا به يك لايه خروجي متصل شود. لايه خروجي خود شامل يك يا بيشتر متغيرهاي جواب مي باشد.
شکل(1-2):يك شبكه عصبي با يك لايه پنهان
1-16-درخت هاي انتخاب
درخت هاي انتخاب راهي براي نمايش يك سري از قوانين كه به يك كلاس يا مقدار منجر مي شود مي باشند. براي مثال شما ممكن است بخواهيد درخواستهاي وام را برحسب ريسك اعتبار خوب يا بد طبقه بندي كنيد. شكل بعد يك مدل ساده از يك درخت انتخاب به همراه توضيح در مورد تمام بسته هاي پايه آن يعني گره انتخاب, شاخه ها و برگهاي آن كه اين مساله را حل مي كند نشان مي دهد.
شکل(1-3):مدل ساده ازیک درخت انتخاب
اولين بسته گره بالايي تصميم يا ريشه مي باشد كه يك بررسي جهت برقراري شرط خاصي مي نمايد. گره ريشه در اين مثال “Income>$40,000” مي باشد. نتايج اين بررسي منجر مي شود كه درخت به دوشاخه تقسيم گرددكه هر يك نشان دهنده جوابهاي ممكن است.در اين مورد بررسي شرط مذكور مي تواند داراي جواب خير يا بله باشد در نتيجه دو شاخه داريم.
براساس نوع الگوريتم هر گره مي تواند دو يا تعداد بيشتري شاخه داشته باشد. براي مثال CART درختهايي با تنها دوشاخه در هر گره توليد مي كند.چنين درختي يك درخت دودويي مي باشد.مدلهاي مختلف درخت تصميم بطور عمومي در داده كاوي براي كاوش داده و براي استنتاج درخت و قوانين آن كه براي پيش بيني مورد استفاده قرار مي گيرد استفاده مي شوند. يك تعداد از الگوريتمهاي مختلف مي توانند براي ساخت درختهاي تصميم شامل CHAID, CART,Quest و C5.0 بكار روند.اندازه درخت مي تواند از طريق قوانين متوقف شونده كه رشد درخت را محدود مي كنند كنترل شود.
استنتاج قانون
استنتاج قانون روشي براي بدست آوردن يك سري از قوانين براي طبقه بندي موارد مي باشد. اگرچه درختهاي تصميم مي توانند يك سري قوانين توليد كنند روشهاي استنتاج قانون يك مجموعه از قوانين وابسته كه ضرورتا درختي تشكيل نمي دهند را توليد مي نمايد. چون استنتاج كننده قوانين لزوما انشعابي در هر سطح قرار نمي دهد و مي تواند گام بعدي را تشخيص دهد گاهي اوقات مي تواند الگوهاي مختلف و بهتري را براي طبقه بندي بيابد. برخلاف درختان قوانين توليدي ممكن است تمام حالتهاي ممكن را پوشش ندهند.
1-17-الگوريتمهاي ژنتيك
الگوريتمهاي ژنتيك براي يافت الگوها استفاده نمي شود بلكه بيشتر به منظور راهنمايي در مورد فرآيند يادگيري الگوريتمهاي داده كاوي مانند شبكه هاي عصبي مورد استفاده قرار مي گيرد. الگوريتمهاي ژنتيك به عنوان يك متد جهت انجام يك جستجوي هدايت شده براي مدلهاي خوب در فضاي حل مساله عمل مي كند. اين الگوريتمها, الگوريتمهاي ژنتيك ناميده مي شوند چون بطور بي قاعده اي الگوي تكامل زيستي كه در آن اعضاي يك نسل بر سر انتقال خصوصيات خود به نسل بعد رقابت مي كنند تا نهايتا بهترين مدل يافت شود را دنبال مي كنند. اطلاعاتي كه بايد انتقال داده شود در قالب كروموزمها كه شامل پارامترهايي براي ساختن مدل مي باشد قرار مي گيرد.
1-18-فرآيند داده كاوي
مدلهاي فرآيند
با توجه به اينكه يك فرآيند سيستماتيك براي داده كاوي موفق ضروري است بسياري از فروشندگان و همفكران مشاور آنها يك مدل فرآيند براي راهنمايي كاربر خود كه از طريق يك سري مراحل مشخص او را به نتايج خوبي هدايت خواهد كرد طراحي كردند. براي مثال SPSS از مراحل پنجگانه تشخيص دسترسي تحليل عمل و اتوماسيون و SAS از مراحل نمونه گيري, جستجو, تغيير و بهبود, مدل سازي و تعيين استفاده مي نمايد.
اخيرا ائتلاف فروشندگان وكاربران شامل سيستمهاي مهندسي NCR كپنهاك, راه حلهاي جامعSPSS و بانك OHRA در حال ساختن يك فرآيند خاص كه به فرآيند استاندارد صنعتي داده كاوي (CRISP-DM) موسوم است مي باشند. اين فرآيند براي پردازش مدلهاي شركتهاي ديگر كه يك كاره يا دو كاره هستند يكسان مي باشد. اين فرآيند شروع خوبي براي كمك به مردم جهت فهم مراحل ضروري در داده كاوي موفق مي باشد.
مدل فرآيند دو سويه
مدل فرآيند دو سويه كه در زير توضيح داده شده است برخي از موارد پيش بيني را از مدل CRISP-DM به ارث مي برد.
گامهاي اصلي داده كاوي جهت كشف دانش عبارتند از:
1- تعريف مساله
2- ساختن پايگاه داده مربوط به داده كاوي
3- جستجوي داده
4- آماده ساختن داده براي مدل سازي
5- ساختن مدل
6- ارزيابي مدل
7- ساخت مدل ونتايج
به سراغ اين گامها مي رويم تا فرآيند كشف دانش را بهتر متوجه شويم.
تعريف مساله
در ابتداي امر پيش زمينه كشف دانش فهم درست داده و مساله مي باشد. بدون اين فهم درست هيچ الگوريتمي صرف نظر از خبره بودن آن نمي تواند نتيجه مطمئني براي شما حاصل نمايد و همچنين شما قادر نخواهيد بود كه مسائلي را كه سعي در حل آن داريد تعريف كرده و همچنين داده را جهت كاوش آماده نموده و يا نتايج را به طور صحيح تفسير نمائيد. براي استفاده بهتر از داده كاوي شما بايد يك بيان واضح از هدف خود داشته باشيد.
1-19-ساختن يك پايگاه داده داده كاوي
اين گام به همراه دو گام بعدي هسته آماده سازي داده را تشكيل مي دهند. در مجموع گامهاي گفته شده وقت و كار بيشتري از ساير گامها مي برند. ممكن است شما گامهاي تكراري در آماده سازي داده و ساختن مدل داشته باشيد چرا كه در هر مرحله ممكن است به نكته اي برسيد كه شما را بر آن دارد داده خود را بهبود بخشيد. اين گامهاي آماده سازي داده مي تواند 50% تا 90% وقت و كار از تمام فرآيند كشف دانش را به خود اختصاص دهد.داده اي كه مي خواهد كاوش شود بايد در يك پايگاه داده ذخيره شود. بر اساس مقدار داده, پيچيدگي داده و استفاده هايي كه قرار است از آن شود يك فايل معمولي و يا يك SpreadSheet براي اين كار كافي است.به احتمال زياد شما مي خواهيد داده موجود در انباره داده را تغيير دهيد. به علاوه شما ممكن است بخواهيد فيلدهاي جديدي كه از فيلدهاي موجود محاسبه شده است را به انبار داده خود بيافزاييد.اين يكي از دلايل استفاده از يك پايگاه داده جداگانه است.دليل ديگر براي اين كار آن است كه انبار داده هاي يكي شده ممكن است به آساني انواع جستجوهايي را كه شما براي فهم داده به آنها نياز داريد انجام ندهد. مانند پرس و جوهايي كه داده را خلاصه مي كند, گزارشات چند بعدي و بسياري از انواع ديگر از گرافها يا مصورات.
و دليل آخر اينكه شما ممكن است بخواهيد اين داده را در يك سيستم مديريت پايگاه داده به همراه يك طراحي فيزيكي متفاوت از انبار داده خود ذخيره كنيد. مردم به طور روز افزوني در حال انتخاب پايگاه داده هاي خاص منظوره اي هستند كه اين نيازهاي داده كاوي را به نحو مناسبي حمايت كند. به هرحال اگر داده موجود در انبار داده شما اجازه مي دهد كه مراكز منطقي داده اي ايجادكنيد و اگر شما مي توانيد تقاضاي داده كاوي را ارضا نماييد پايگاه داده شما به خوبي وظيفه خود را انجام مي دهد.
مراحل لازم براي ساخت يك پايگاه داده داده كاوي به شكل زير مي باشد:
جمع آوري داده ها
توضيح داده ها
انتخاب داده ها
تعيين كيفيت داده ها و پاك كردن آن
تثبيت و يكپارچگي
ساختن فوق داده (داده هايي كه خود بيانگر توضيحي در مورد داده هاي موجود مي باشند.)
باركردن پايگاه داده مربوط به داده كاوي
نگهداري پايگاه داده مربوط به داده كاوي
اين كارها ممكن است لزوما به همين ترتيب گفته شده انجام نگردند.
جستجوي داده
به بخش توضيح داده براي داده كاوي كه توضيح مختصري راجع به اشكال, تجزيه و تحليل ارتباط و ديگر وسايل جستجوي داده مي باشد نگاهي بياندازيد.هدف شناسايي مهمترين فيلدها در پيش بيني نتيجه و تعيين اينكه كدام يك از داده هاي بدست آمده مفيد مي باشد است.در يك مجموعه داده اي با صدها يا حتي هزاران ستون جستجوي داده مي تواند كار و زمان بر باشد. يك واسط مناسب و جواب كامپيوتر سريع در اين فاز مهم و حياتي مي باشند زيرا هنگامي كه شما براي دريافت پاسخ برخي گراف ها مجبور باشيد 20 دقيقه صبر كنيد ماهيت جستجوي شما به كلي تغيير خواهد كرد.
1-20-آماده سازي داده براي مدل سازي
اين آخرين گام آماده سازي داده قبل از ساخت مدلهاست. چهار قسمت مهم در اين مرحله وجود دارد:
1- انتخاب متغيرها
2- انتخاب سطرها
3- ساختن متغيرهاي جديد
4- تغيير شكل متغيرها
ساختن مدل داده كاوي
مهمترين مساله براي يادآوري در مورد ساخت مدل آن است كه اين كار يك فرآيند تكراري است. شما براي جستجو به مدلهاي جايگزين جهت يافتن سودمندترين آنها جهت حل مسائلتان نياز داريد. آنچه كه شما در جستجوي يك مدل مناسب ياد مي گيريد مي تواند شما را به بازگشتن به عقب و انجام برخي تغييرات در داده مورد استفاده خود و حتي بهبود بيان ساله راهنمايي كند.هنگامي كه شما در مورد نوع پيش بيني كه مي خواهيد انجام دهيد تصميم گرفتيد بايد يك نوع مدل براي ساخت تصميم خود انتخاب كنيد.
آماده سازي و آزمايش مدل داده كاوي احتياج به اين دارد كه داده به حداقل دو گروه شكسته شود: يكي براي آماده كردن مدل و ديگري جهت تست مدل مربوطه. اگر شما از آماده سازي و تست متفاوتي استفاده ننمائيد دقت مدل خواهد بود.
تائيد اعتبارساده
پايه اي ترين روش تست داده تاييد اعتبار ساده مي باشد. براي انجام اين كار چون درصدي از پايگاه داده را به عنوان يك تست پايگاه داده كنار بگذاريد و به هر صورت از آن در برآورد و ساخت مدل استفاده ننمائيد. اين درصد معمولا بين 5 تا 33 مي باشد.
ارزيابي و تفسير
تاييد اعتبار مدل
بعد از ساخت يك مدل شما بايد نتايج آن را ارزيابي نموده و همچنين اهميت آن را نيز توضيح دهيد.
ماتريسهاي پيچيدگي
براي مسائل طبقه بندي يك ماتريس پيچيدگي ابزار مفيدي براي فهم نتايج مي باشد. يك ماتريس پيچيدگي تعداد مقادير كلاس (گروه)مجازي را در مقايسه با تعداد مقادير كلاس(گروه) پيش بيني شده نشان مي دهد. نه تنها چگونگي پيش بيني مدل توسط اين ماتريس نشان داده مي شود بلكه نشان دهنده جزئياتي است كه براي نشان دادن موارد اشتباه ضروري است. ستونها كلاسهاي مجازي و سطرها كلاسهاي پيش بيني شده را نشان مي دهند. بنابراين قطرهاي اين ماتريس بيانگر تمام پيش بيني هاي درست مي باشند. در ماتريس پيچيدگي مي بينيد كه مدل ما 38 تا از 46 تا كلاس B را به درستي پيش بيني كرده است اما 8 تا از آنها اشتباها كلاس بندي شده اند. 2 تا به عنوان كلاسA و6 تا به عنوان كلاس C مي باشند.
در حالات خاص اگر قيمت هاي گوناگون با اشتباهات مختلفي در ارتباط باشند يك مدل با دقت كمتر ممكن است بر يك مدل با دقت بيشتر و در ضمن قيمت بيشتر به خاطر انواع اشتباهاتي كه ايجاد مي كند ترجيح داده شود. براي مثال فرض كنيد در ماتريس بالا هر جواب درست قيمتي معادل 10 دلار و هر جواب نادرست براي كلاس A 5 دلار , براي كلاس B 10 دلار و براي كلاس C 20 دلار داشته باشد. بنابراين هزينه شبكه اي ماتريس معادل:
خواهد داشت.
اما ماتريس شكل بعد را در نظر بگيريد. دقت تا 79% كاهش پيدا كرده است هنگامي كه همان قيمتهاي قبلي را بر روي اين ماتريس اعمال كنيم هزينه كل برابر:
بنابراين اگر بخواهيد مقدار ارزشي مدل را بيشينه كنيد بهتر است كه مدلي با دقت كمتر ولي در عوض با ارزش شبكه اي بيشتر انتخاب نمائيد.
ايجاد معماري مدل و نتايج
هنگامي كه يك مدل ساخته و تاييد اعتبار مي شود مي تواند در دو راه اصلي مورد استفاده قرار گيرد. راه اول براي تحليل گر است كه اعمالي را بر اساس ديد ساده از مدل و نتايج آن معرفي مي كند. راه دوم بكاربردن مدلها در مجموعه داده اي مختلف است. اين مدل مي تواند براي مشخص نمودن ركوردها بر اساس گروه بنديشان و يا مقدار دهي يك امتياز مثلا احتمال انجام يك عمل استفاده گردد.هنگام به دست آوردن يك كاربرد پيچيده داده كاوي اغلب اگر چه بخش بحراني اما كوچك پروژه نهايي به حساب مي آيد. براي مثال دانشي كه از داده كاوي كشف مي شود مي تواند با دانش متخصصان داده و تراكنشهاي ورودي تركيب شود. در يك سيستم تشخيص فرآيند الگوهاي موجود فرآيند مي توانند با الگوهاي كشف شده تلفيق شوند. هنگامي كه موارد مفروض اين فرآيند براي ارزيابي به بررسي كنندگان فرستاده مي شوند بررسي كنندگان ممكن است نياز داشته باشند كه به ركوردهايي در پايگاه داده كه مربوط به قسمتهاي ادعا شده توسط يك سازنده است دسترسي پيدا كنند.به طور كلي مراحلي كه توضيح داده شد براي انجام هر فرآيند داده كاوي لازم به نظر مي رسد.
فصل دوم
کاربرد داده کاوی در پزشکی
2-1- مقدمه
بطور ساده، داده كاوي شامل استخراج دانش از حجم عظيم داده ها مي باشد. دادهكاوي فراتر از جمعآوري و مديريت داده است، و شامل تجزيه و تحليل و پيشگويي ميشود. داده كاوي امكان تشخيص الگوها و روندهاي موجود در داده ها را بصورت خودكار فراهم مي آورد و در بخشهاي مختلف و صنايعي چون بانك، بيمه، پزشكي و خردهفروشي از دادهكاوي به هدف كاهش هزينه¬ها، افزايش تحقيقات و افزايش فروش استفاده ميكنند . اخيرا استفاده از داده كاوي در حوزه پزشكي مورد توجه زيادي قرار گرفته است. معمولا محيط پزشكي غني از اطلاعات است در حالي كه نيازمند دانش مي باشد. تكنيك هاي داده كاوي مي توانند براي كشف دانش مورد نياز استفاده شوند. رشد سريع پايگاه هاي داده پزشكي در كشورهاي پيشرفته، انگيزه اي شده است براي اينكه محققين پزشكي از تكنيك هاي داده كاوي براي استخراج دانش از اين پايگاه داده ها استفاده كنند .امروزه با كمك الگوريتم هاي داده كاوي مي توان الگوهاي نهان در ميان داده ها را استخراج نمود و با ساخت مدل مربوط به پايگاه هاي داده، سيستم كمك تصميم طراحي كرد كه در زمينه تصميم گيري به پزشكان كمك كند.در چند سال اخير استفاده از تكنيك هاي داده كاوي و يادگيري ماشين در داده هاي پزشكي و سلامت يكي از زمينه هاي چالش برانگيز بوده است. داده كاوي پزشكي ويژگي هاي خاص خود را دارد كه آن را از داده كاوي در ساير مسائل و كاربردها مجزا مي سازد. پژوهشگراني كه در ساير زمينه ها عمل داده كاوي انجام مي دهند، ممكن است با محدوديت ها و مشكلاتي از قبيل كاوش در داده هاي ناهمگن، محرمانه و يا خصوصي، حجيم و توزيع شده، و جنبه هاي اخلاقي، حقوقي و امنيتي كمتر برخورد داشته باشند.
2-2-تكنيك هاي داده كاوي در پزشكي
تكنيك هاي داده كاوي شامل گروهي از تكنيك ها و ابزارهاي ناهمگوني هستند كه براي اهداف متفاوتي استفاده مي شوند. اين تكنيك ها و مدل ها بر پايه هوش مصنوعي، يادگيري ماشين، شبكه هاي عصبي ،آمار، شناسايي الگو، سيستم هاي مبتني بر دانش، حصول دانش، بازيابي اطلاعات، محاسبات سرعت بالا و مصورسازي داده1 مي باشند. هر چه حجم داده هاي ذخيره شده افزايش يابد، تكنيك هاي داده كاوي نيز نقش مهمي در پيدا كردن الگوها و استخراج دانش به منظور كمك به تشخيص موثر بيماري ها و ارائه بهتر خدمات و مراقبت هاي پزشكي ايفا مي كنند .الگوريتم هاي استفاده شده در تكنيك هاي داده كاوي سعي مي كنند كه نزديكترين مدل به ويژگي هاي داده هاي مورد نظر را پيدا و ارائه نمايند. مدل ها مي توانند پيشگويانه يا توصيفي باشند.
درمان يك بيماري ممكن است فقط بر اساس پيشينه و وضعيت آن بيمار خاص نباشد و نتايج حاصل از درمان ساير بيماران با علائم مشابه نيز مورد توجه قرار گيرد. در اين روش ها تعيين وضعيت داده هاي آينده، بر مبناي مقادير گذشته و فعلي بيمار صورت مي گيرد. مدل هاي توصيفي براي شناسايي الگوها در داده ها استفاده مي شوند. كلاسه بندي2، رگرسيون3 و تحليل سري هاي زماني4 معروفترين روشها در مدل پيشگويي بوده و خوشه بندي5، قوانين وابستگي6 و مصور سازي معروفترين روش هاي مدل توصيفي مي باشند . اين روش ها به اختصار در ادامه تشريح مي گردند.كلاسه بندي: يك نمونه داده را به يكي از كلاس هاي از قبل تعريف شده انتساب مي كند. در اين روش يك مجموعه از قوانين كلاسه بندي بر مبناي ويژگي هاي مجموعه داده ي آموزشي توليد مي شوند كه مي توانند براي كلاسه بندي نمونه داده ي جديد استفاده شوند.بعنوان مثال قوانين كلاسه بندي درباره يك بيماري مي توانند از روي علائم و مشخصه هاي بيمارهاي شناخته شده ي فعلي كشف و براي تشخيص آن بيماري در بيمارهاي جديد با توجه به علائم بيماري آنها استفاده شوند .
تشخيص پزشكي يكي از مهمترين كاربردهاي كلاسه بندي مي باشد.
رگرسيون: روشي است كه با استفاده از يك تابع، مقدار يك مشخصه را پيشگويي مي كند. اين روش يك مقدار خروجي را بر مبناي مقادير ورودي تخمين مي زند. بعنوان مثالي از كاربرد رگرسيون مي توان تخمين قد كودكان با توجه به مقادير سن و وزن آنها را نام برد.
تحليل سري هاي زماني: در اين روش، مقدار يك خصيصه، با آزمون آن در فواصل زماني مساوي و منظم بدست مي آيد .بعنوان مثال با توجه به شرايط يك بيمار، مقادير خصيصه هاي خاصي ممكن است بر اساس آزمايشات ساعتي و يا روزانه بدست آيند. اين روش مي تواند براي پيش بيني مقادير آينده و يا تعيين شباهت ميان بازه هاي زماني مختلف استفاده شود.
مصورسازي: روش هاي مفيدي براي كشف الگوها در يك مجموعه داده ي پزشكي مي باشند . نمايش داده ها در قالب نمودارها و عكس ها باعث تسهيل در گروه بندي آنها در خوشه هاي متناسب شده و توانايي تصميم گيري بر مبناي داده ها را سريعتر، دقيق تر و همراه با تلاش شناختي كمتر، فراهم مي سازد. بعنوان مثال در يك مجموعه داده ي بيماران قلبي، زير مجموعه ي بيماراني كه بواسطه وضعيت بيماري خود داراي فشار خوني هستند كه بطور غيرعادي بالا است، مي تواند كشف شود و سپس ساير تكنيك هاي داده كاوي روي اين زير مجموعه براي كشف دانش بيشتر اعمال مي گردد .
قوانين وابستگي: اغلب مشاهده مي شود كه يك وابستگي نزديك
)مثبت يا منفي( بين مجموعه اي از داده هاي معين وجود دارد. قوانين وابستگي ،روابط وابستگي بين يك مجموعه از داده ها را توصيف مي كنند كه براي توليد الگوهاي جديد، ساخته و بكار گرفته مي شوند. بعنوان مثال ممكن است مجموعه اي از علائم بيماري بعد از مجموعه اي ديگر از علائم نمايان شوند. يا بين ويژگي هاي ژنتيكي و ظاهري يك بيمار، رابطه اي وجود داشته باشد.
خوشه بندي: شناسايي و گروهبندي مجموعه اي از داده ها يا اشياء به زير كلاس هايي با مفهوم خوشه، بطوري كه يك خوشه شامل يك سري داده هاي مشابه مي باشد كه همانند يك گروه رفتار مي كنند. خوشه بندي همان كلاسه بندي است با اين تفاوت كه كلاس ها از پيش تعريف شده و معين نمي باشند و عمل گروه بندي داده ها بدون نظارت انجام مي گيرد .بعنوان مثال يك مجموعه از بيماري هاي جديد مي توانند بر مبناي شباهت در علائم شان به چندين دسته گروهبندي شده و علائم مشترك بيماري هاي يك دسته، براي توصيف بيماري هاي آن دسته استفاده شوند.
2-3-كاربردهاي داده كاوي پزشكي
پزشكي مدرن حجم انبوهي از اطلاعات ذخيره شده در پايگاه هاي داده پزشكي را توليد مي كند. داده كاوي مي تواند كاربردهاي بسيار زياد و متنوعي در حوزه پزشكي و بهداشت و درمان داشته باشد كه در ادامه ،مهمترين آنها بيان مي گردند.
2-3-1-پيش بيني و تشخيص بيماري ها
امروزه پايگاه داده هاي باليني حجم زيادي از اطلاعات درباره ي بيماران و وضعيت پزشكي آنها را در خود ذخيره مي كنند. استخراج دانش مفيد و تصميم سازي هاي علمي براي تشخيص و بررسي بيماري به كمك اين مجموعه داده ها مي تواند بسيار مفيد واقع شود. تشخيص بيماري و تعيين درمان مناسب براي بيماران در علم پزشكي از اهميت بالايي برخوردار است. انتخاب درمان نامناسب براي بيمار، علاوه بر هدر دادن وقت و پول، مي تواند اثرات زيانباري را نيز بهمراه داشته باشد .حتي در برخي از موارد اين انتخاب نادرست مي تواند منجر به مرگ بيمار شود. همه ي پزشكان در تمام زمينه هاي شغلي خود مهارت ندارند و يا در بعضي از موارد، منابع و نيروي انساني متخصص كمي وجود دارد. از اين رو وجود سيستمي جهت تشخيص و انتخاب نوع درمان مناسب براي بيماران مي تواند مورد استفاده پزشكان قرار گيرد كه ضمن كاهش هزينه ها، افزايش دقت و كارايي را بهمراه خواهد داشت. برخي از بيماري هاي مزمن از قبيل ديابت، چاقي و ناراحتي هاي قلبي و عروقي از عوامل اصلي مرگ و مير و ناتواني در اكثر كشورها بوده و مي توانند با كاوش بر روي داده هاي بيماران مشابه قبلي ،مقايسه و تطبيق علائم مشترك بيماريها ،پيش بيني يا تشخيص داده شوند .
2-3-2-اثر بخشي معالجات
داده كاوي با مقايسه ي عوامل، علائم و سير درمان يك بيماري تحليلي از سير عمليات موثر و كارا ارائه مي كند و مي تواند براي ارزيابي ميزان اثربخشي معالجات پزشكي استفاده شود. بعنوان مثال مقايسه نتايج گروهبندي بيماران درمان شده با رده هاي دارويي متفاوت براي يك بيماري خاص مي تواند بهترين روش معالجه با كمترين هزينه و عارضه را تعيين كند و يا داده كاوي مي تواند به شناسايي معالجات موفق براي يك بيماري خاص كمك كند.از جمله ساير كاربردهاي داده كاوي در اين زمينه، مي توان به پيدا كردن وابستگي و رابطه بين اثرات جانبي مختلف يك روش معالجه، رابطه ي بين روش معالجه بيمار و واكنش او، تعيين موثرترين تركيبات دارويي مناسب براي درمان زير مجموعه اي از بيماران يك بيماري خاص كه واكنش متفاوتي در برابر داروهاي تجويز شده در سير درمان براي مجموعه بيماران آن بيماري از خود نشان مي دهند و تعيين مراحل بازدارنده كه مي توانند باعث كاهش درد بشوند، اشاره كرد.
2-3-3-مديريت خدمات بهداشتي و درماني
داده كاوي با گسترش شناسايي و پيدا كردن بهتر حالات بيماري مزمن و بيماران پرخطر، برنامه ريزي اقدامات مناسب و كاهش تعداد درخواستها و مراجعين به مراكز درماني مي تواند به مديريت خدمات بهداشتي درماني و پزشكي كمك موثري نمايد .بعنوان مثال با دسته بندي بيماران با توجه به ويژگي هاي دموگرافي و وضعيت پزشكي آنها مي توان گروه هايي كه منابع درماني بيشتري را مصرف مي كنند شناسايي و برنامه هايي براي آموزش آنها تدوين و وضعيت پزشكي آنها را مديريت كرد. با كاوش در داده هاي يك مركز درماني مي توان باعث بهبود كيفيت خدمات ارائه شده، گرديد. از جمله مي توان وضعيت بيمار را سريعتر بهبود، و مدت زمان بستري بيمار را كاهش داد، از عوارض باليني اجتناب كرد، اطلاعات مفيد مورد نياز را به پزشكان ارائه نمود. همچنين تعداد نيروي انساني مورد نياز براي عمليات مختلف، ميزان ساعات كاري، تعداد مراجعين، تعداد جراحي ها، داروها و تجهيزات مورد نياز براي آينده را پيش بيني كرد.
2-3-4-مديريت ارتباط با مشتري
مديريت ارتباط با مشتري يك راهكار مؤثر برقراري ارتباط موفق ميان شركت هاي تجاري از قبيل بانك ها و فروشگاه ها با مشتريان خود مي باشد. اين موضوع در حوزه خدمات بهداشتي و درماني نيز كم اهميت نمي باشد. ارتباط با مشتري ممكن است در همه ي بخش ها از جمله مطب هاي پزشكان، بخش هاي بستري بيمار و دپارتمان هاي حسابداري و پذيرش بيمار اتفاق بيفتد.داده كاوي مي تواند براي شناسايي و تعيين اولويت ها، الگوهاي مفيد، نيازهاي فعلي و آينده، به منظور بهبود سطح رضايتمندي در ارائه خدمات بهداشتي و درماني استفاده مي شود. داده كاوي با بررسي و تحليل داده هاي بيماران مي تواند به ارائه اطلاعاتي درباره ي مدت زمان انتظار بيمار، راه هاي ممكن براي بهبود خدمات به او و ارائه دانش درباره ي آنچه كه بيماران از مراكز درماني مي خواهند كمك كند.
استفاده از داده كاوي درون يك سيستم ارتباط با مشتري براي شركت هاي داروسازي نيز بسيار مفيد خواهد بود. شركت هاي داروسازي با كاوش در اينكه پزشكان چه داروها و براي چه اهدافي تجويز مي كنند مي توانند بازار هدف خود را بهتر تعيين كنند، اثرات جانبي سودمند يك دارو را شناسايي كنند و همچنين ارزانترين و موثرترين روش درمان براي يك بيماري را شناسايي كنند. بعلاوه، با داده كاوي روي حجم انبوهي از داده هاي ژنوميك مي توانند تاثير ژنتيك بيمار را در واكنش به يك داروي خاص پيش بيني كنند.
2-3-5-كشف تقلب و سوء استفاده
تكنيك هاي داده كاوي مي توانند تقلب و سوء استفاده از قوانين وضع شده را شناسايي كرده و الگوهاي غيرعادي و ناهنجار در درخواست هاي بيماران، پزشكان، آزمايشگاه ها، كلينيك ها و سايرين را پيدا كنند. كاوش بر روي حجم انبوه نسخه ها، عمليات و سير معالجات باعث شناسايي الگوهاي غيرعادي و كشف تقلب ها، از جمله كلاهبرداري هاي بيمه اي و درخواست هاي پزشكي غيرقانوني مي گردد.
2-4-چالش هاي داده كاوي در پزشكي
مسائل و چالش هايي در رابطه با پياده سازي و بكارگيري داده كاوي در پزشكي وجود دارد كه آن را متمايز از داده كاوي در ساير كاربردها مي كند. آگاهي از اين مسائل باعث بهبود و استفاده صحيح تر از داده كاوي در پزشكي شده و مي تواند در جهت پشتيباني تصميم گيري ها و جلوگيري از بروز خطا ياري رساند. در ادامه به بررسي بعضي از مشكلات چالش برانگيز در عرصه هاي مختلف داده كاوي پزشكي پرداخته مي شود.
2-4-1-حجيم بودن و ناهمگوني داده هاي پزشكي
داده هاي پزشكي خام، حجيم و ناهمگون و توزيع شده هستند
صنعت پزشكي جزء چند صنعتي مي باشد كه با حجم زياد داده و اطلاعات، درگير هستند. اين اطلاعات و داده ها هر روزه در حال افزايش هستند. بعنوان مثال روش هاي عكس برداري از قبيل MRI ،SPECT، PET و مجموعه سيگنال هاي ECG و EEG روزانه تا چندين گيگابايت داده توليد مي كنند . وجود ساختارهاي مختلف داده باعث نوعي ناهمگوني و پيچيدگي در مجموعه داده هاي پزشكي شده است. اين داده ها ممكن است از تصاوير و سيگنال هاي مختلف، ويزيت بيماران ،نتايج آزمايشگاهي و باليني، يادداشت ها، مشاهدات و تفسيرهاي پزشكان و بخش هاي حسابداري و پذيرش بيمار بدست آمده باشند. همه ي اين موارد مي توانند بر پيشگويي، تشخيص، و درمان تاثير گذار باشند و نمي توان از آنها چشم پوشي كرد .اين حجم انبوه داده ها و ناهمگوني نياز به دستگاه هاي ذخيره سازي داده با ظرفيت بالا و ابزارهاي داده كاوي قوي در جهت تحليل و كاوش در داده ها دارد. با وجود آن كه تعداد سيستم ها و ابزارهاي داده كاوي زياد است ،آنچه اين سيستم ها را از يكديگر متمايز مي كند، توانايي آنها در مديريت و استفاده از مقادير حجيم و ناهمگون داده ها مي باشد .توانايي در استفاده و استخراج دانش از اين داده ها بسيار مهم و تعيين كننده مي باشد .اگر اطلاعات ذخيره شده در فرمت قابل درك نباشند، كمتر مفيد خواهند بود. در اين وضعيت، تبديل داده ها به فرمت قابل درك و همگون تر و كاهش ابعاد داده ها شامل نمونه برداري تصادفي از بين حجم انبوه ركوردها و يا انتخاب ويژگي ها و صفات درخور توجه و مرتبط با هدف داده كاوي مفيد خواهد بود. همچنين تكنيك هاي مصورسازي نيز مي توانند نقش موثري در صورت مواجه با حجم زياد داده ها داشته باشند .
زيرا اطلاعات بسيار زيادي را بصورت يك تصوير لحظه اي از نتايج ارائه مي كنند.
2-4-2-اهميت تفسير پزشكان
معمولا تفسير پزشكان از تصاوير، سيگنال ها و هر داده ي باليني ديگر، بصورت دست نوشته هاي بي نظم و ترتيب و به زبان انگليسي مي باشد كه استانداردسازي آنها و در نتيجه داده كاوي بسيار مشكل مي باشد .حتي متخصصين يك زمينه پزشكي نيز بر روي اصطلاحات استفاده شده براي توصيف وضعيت يك بيمار توافق ندارند و ممكن است از نام هاي متفاوتي براي توصيف يك بيماري استفاده كنند .استفاده از يك كامپيوتر مترجم را مي توان بعنوان راه حل بخشي از مشكل فوق پيشنهاد نمود كه عمل ترجمه در آن شامل سه مرحله مي باشد: تحليل زبان منبع ،ترجمه از يك زبان به زبان ديگر و سپس توليد جملات به زبان هدف .سيستم هاي ترجمه ي موجود جملات با بيشتر از ده كلمه را نمي توانند ترجمه كنند. حتي انسان نيز معني يك جمله ي طولاني را در اولين بار خواندن نمي تواند متوجه شود. همچنين براي يك جمله ورودي معمولا يك ترجمه ي منحصر بفرد وجود ندارد. بعلاوه ممكن است اصطلاحات عاميانه ي موجود در جمله ي مبدا در فرهنگ لغات مترجم وجود نداشته باشد و نياز به بروز رساني مداوم آن باشد. استفاده از متن كاوي در دست نوشته ها، يادداشت ها و نسخه هاي تجويز شده توسط پزشكان نيز مي تواند در اين زمينه مفيد باشد.
2-4-3-مالكيت داده ها
در قوانين حقوقي، مالكيت توسط شخصي كه حق فروش يك دارايي را دارد تعيين مي شود . از آنجايي كه فروش داده هاي انساني ناشايست مي باشد، مالكيت داده ها در پزشكي ابهام آميز است. آيا هر بيمار شخصا مالك داده هاي پزشكي جمع آوري شده در رابطه با او مي باشد؟ آيا مراكز درماني يا پزشكان مالك داده ها هستند؟ آيا ارائه كنندگان خدمات بيمه اي مالك داده ها هستند؟ اگر فروش داده هاي انساني ناشايسته است، چگونه مديران داده، داده كاوي و تحليل داده ها را انجام دهند و به اين منبع غني از داده هاي انساني دسترسي داشته باشند؟
2-4-4-ترس از شكايت
يكي از ويژگي هاي ديگر داده كاوي پزشكي، ترس از شكايت عليه پزشكان و ارائه كنندگان خدمات بهداشتي درماني است. هزينه خدمات پزشكي بالا است و سرانه اختصاصي توسط دولت ها به هر بيمار محدود است. بنابراين آزمايشات و داروهاي غير ضروري كه بعضي از پزشكان و مراكز درماني براي يك بيمار تجويز مي كنند ممكن است باعث ايجاد مشكلاتي براي آنان شود. در نتيجه ممكن است پزشكان و مراكز درماني از در اختيار قرار دادن داده هاي بيماران خود براي استفاده داده كاوان خودداري نمايند. همچنين اين داده ها ممكن است برخي از معالجات غلط و نادرست را نيز فاش كنند. وجود ناهنجاري هاي مشهود در سوابق پزشكي يك بيمار ممكن است باعث آغاز يك تحقيق و پيگيري شود و بطور كلي موجب شكاياتي از سوي دولت ها، جامعه ي پزشكي و بيماران شود. در اين وضعيت داده كاوها ممكن است مجبور شوند داده هاي مورد نياز خود را از راه هاي نامناسبي بدست آورند.
2-4-5-محرمانگي و امنيت داده هاي انساني
با توجه به اينكه رازداري پزشكان و مراكز درماني، و اعتماد بيمار به آنان، اصل بسيار مهمي در پزشكي بشمار مي آيد، تحليلگران مي بايست توجه ويژه اي به پياده سازي محرمانگي و امنيت داده هاي پزشكي داشته باشند .حفظ محرمانگي اطلاعات، اجازه دسترسي مستقيم به تمامي داده ها را ممكن نمي سازد. برخي دولت ها قوانين و مقررات خاصي به منظور حمايت از محرمانگي داده هاي پزشكي وضع نموده اند. بعنوان مثال توصيه هايي به منظور پنهان كردن داده هاي مربوط به شناسايي بيمار از قبيل نام، آدرس، شماره تلفن بيمار كرده اند. يكي از اين توصيه ها اينست كه داده هاي مربوط به شناسايي بيمار را طوري پنهان كرد كه به هيچ وجه قابل دست يافتني نباشد. مثلا فقط دسترسي به اطلاعات مربوط به تشخيص بيماري از روي داده هاي بيمار امكانپذير باشد.در بعضي موارد ممكن است اين رويكرد مورد پذيرش واقع نشود. زيرا نيازمند بررسي صحت تكنيك داده كاوي اعمال شده و يا اطلاعات بيشتري از يك بيمار خاص باشد .بعنوان مثال پس از اعمال تكنيك هاي داده كاوي و تشخيص يك بيماري و روش درمان آن، بخواهيم به آن بيماران خاص درباره تشخيص و روش درمان مناسب، اطلاع رساني كرده و يا آنها را تحت معالجه قرار داد. مساله امنيت داده ها در استفاده و بخصوص انتقال داده ها نيز از اهميت خاصي برخوردار است. قبل از اينكه داده هاي مربوط به شناسايي بيماران پنهان يا محرمانه شوند، فقط افراد مجاز مي بايست به داده ها دسترسي داشته باشند. داده هاي پزشكي به يكي از چهار صورت زير مي توانند مهيا شوند.
داده هاي بي شناسه: داده هايي هستند كه اطلاعات مربوط به شناسايي بيمار در لحظه ي جمع آوري داده ها، حذف شده اند.
داده هاي بي شناسه شده: داده هاي اوليه بهمراه اطلاعات شناسايي بيماران مي باشد كه اين اطلاعات، به مرور و بصورت غير بازگشت پذير حذف مي شوند. در اين حالت امكان بازگشت و دسترسي به داده هاي اوليه به هيچ وجه امكانپذير نخواهد بود.
داده هاي با شناسه¬ي كد شده: داده هاي اوليه شامل اطلاعات شناسايي بيماران بوده كه اين اطلاعات كد مي شوند و تحت شرايطي كه توسط كدكننده تعيين مي شود، ديكد شده و بيماران مي توانند شناسايي شوند .
داده هاي با شناسه: داده ها بهمراه اطلاعات شناسايي بيماران مي باشند كه با رضايت و اجازه كتبي بيماران در اختيار قرار مي¬گيرد.
بنظر مي رسد داده هاي پزشكي با شناسه ي كد شده براي اهداف تحقيقاتي و داده كاوي مناسبترين بوده و دسترسي به داده هاي اوليه در صورت نياز تحت شرايطي امكانپذير باشد. تنها ريسك آن مي تواند از دست دادن قابليت اعتماد بيماران باشد. داده كاوها مي بايست به منظور مقابله با دسترسي بدون مجوز به داده ها، از استانداردهاي موجود مطلع بوده و با نحوه آماده سازي داده ها بطوري كه اطلاعات موجود در آنها محرمانه باقي بماند، آشنا باشند.
2-4-6-طبيعت پوياي داده هاي پزشكي
در اغلب موارد، طبيعت مجموعه داده هاي پزشكي پويا مي باشد .ممكن است اشياء و يا خصيصه هاي جديدي اضافه شده و برخي نيز حذف گردند و يا اشياء و خصيصه هايي بجاي آنها جانشين شود. بعنوان مثال نتايج آزمايشات جديد يا تصاوير SPECT براي يك بيمار موجود، جايگزين و يا براي يك بيمار جديد اضافه شوند. در چنين وضعيتي تكنيك هاي داده كاوي بايد قادر باشند در طي زمان تكامل يابند .يعني دانشي كه تاكنون بدست آمده است را بطور كامل بروز نمايند .مشكل اصلي در ارتباط با روش هاي داده كاوي تكاملي، ادغام كردن دانش جديد بدست آمده از داده هاي جديد و دانشي كه از قبل موجود است، مي باشد. عمل ادغام مي تواند به سادگي اضافه كردن دانش جديد به دانش موجود باشد ولي در اغلب موارد بايد دانش موجود را به منظور حفظ سازگاري اصلاح كرد.
2-4-7-داده هاي ناقص و مفقود شده
داده هاي پزشكي جمع آوري شده، اغلب ناقص هستند .بسياري از داده هاي موجود حاوي اطلاعات كافي براي استخراج دانش مطلوب نيستند. برخي از مواردي كه به وقوع اين وضعيت منجر مي شوند عبارتند از: توضيح ناكافي در مورد ويژگي اشياء، تعداد ناكافي اشياء و مقادير مفقود شده براي يك ويژگي معين. بعنوان مثال ممكن است آزمايشات تجويز شده براي يك بيمار بطور كامل انجام نشوند. يكي از نشانه هاي معمول ناقص بودن داده ها زماني بروز مي كند كه دانش توليد شده كيفيت پايين داشته باشد و با استفاده از ديگر روش هاي داده كاوي نتوان آن را بهبود بخشيد. واضح ترين راه براي بهبود بخشيدن به داده هاي ناقص، جمع آوري و ذخيره ي داده هاي تكميلي است. همچنين وجود درصد زيادي از مقادير مفقود شده در داده هاي پزشكي، معمول مي باشد .حتي ممكن است بيش از 51 درصد تمامي مقادير مفقود شده باشند . يك روش ممكن براي مقابله با مقادير مفقود شده اينست كه شبيه ترين شيء به شي اي كه حاوي مقادير مفقود شده است يافت شده و مقادير معلوم متعلق به آن شيء بجاي مقادير مفقود شده جانشين شوند.
2-4-8-داده هاي غير دقيق
داده هاي پزشكي شامل داده هاي غير دقيق نيز هستند. بعنوان مثال اين امكان وجود دارد كه از مقدار دقيق يك آزمايش معين پزشكي اطلاع نداشته باشيم ولي در عوض بدانيم كه آيا مقدار مذكور زياد، متوسط يا كم است . در اين حالت، استفاده از مجموعه هاي فازي مي تواند براي پردازش اين قبيل اطلاعات مفيد باشد.
فهرست پایان نامه داده کاوی در پزشکی


جهت دانلود پایان نامه داده کاوی در پزشکی از فرم زیر اقدام نمایید.
همیار دانشجو |