استنتاج علی: مدل های اقتصاد سنجی در مقابل آزمایش A/B

ساخت وبلاگ

مطالعه مشاهده ای ، مطالعه تجربی ، مدل رگرسیون ، متغیر ابزاری ، مدل اختلاف در اختلاف ، آزمون پارامتری و آزمون غیر پارامتری

به عنوان پزشکان علوم داده ، از ما خواسته شده است که "آیا X Drive Y را هدایت می کند؟"Y نتیجه ای است که ما به آن اهمیت می دهیم. X می تواند یک ویژگی ، محصول یا دارو جدید باشد. به عنوان مثال ، یک صاحب وب سایت می خواهد بپرسد که آیا طراحی صفحه وب جدید منجر به نرخ یا فروش با کلیک بالاتر می شود. یک محقق بالینی می پرسد که آیا یک داروی جدید باعث افزایش سلامت بهتر می شود یا خیر.

متأسفانه ، یک ارتباط خام بین x و y به تنهایی برای کمک به ما در ایجاد روابط علی کافی نیست. عامل پیچیده در اینجا مجموعه ای از ویژگی های دیگر به نام متغیرهای مخدوش است که هر دو X و Y را تحت تأثیر قرار می دهد. به عنوان مثال ، عواملی مانند جغرافیایی بازدید کننده ، جنسیت ، سن و علاقه بر استفاده از ویژگی جدید و نتیجه آن تأثیر می گذارددرآمد فروش. بنابراین ، ما باید ضمن کنترل این متغیرهای مخدوش ، تأثیر طراحی صفحه وب جدید (X) را بر درآمد فروش (Y) جدا کنیم.

بخش اول: مطالعه مشاهده ای و مطالعه تجربی

دو دسته اصلی از طرح ها برای بررسی رابطه بین دو یا چند متغیر در یک مطالعه وجود دارد: مشاهده و تجربی.

  • در یک مطالعه مشاهده ای ، ما داده های واقعی (به عنوان مثال ، x و y) مرتبط در مطالعه را مشاهده و جمع آوری می کنیم بدون اینکه به طور تصادفی هر نوع درمان یا محدودیتی را برای یک گروه تحمیل کنیم.
  • در یک مطالعه آزمایشی ، ما به طور تصادفی درمان را به یک گروه تحمیل می کنیم ، در حالی که گروه دیگر درمان را دریافت نمی کنند ، به طوری که می توانیم رابطه علیت بین درمان و متغیر نتیجه را بررسی کنیم. طراحی و مداخله تصادفی ، مطالعات تجربی را با مطالعات مشاهده ای متفاوت می کند.

مشکل: آیا این مطالعه مشاهده ای است یا تجربی؟

مطالعه 1: یک مطالعه به طور تصادفی دانش آموزان را به یکی از دو گروه اختصاص داد:

  • از یک گروه خواسته شد تا یک برنامه تمرینی دقیق را دنبال کنند.
  • یک گروه از انجام هرگونه تمرین ممنوع بود.

محققان بررسی کردند که کدام گروه تمایل به دریافت معدل بالاتر در پایان یک ترم دارند.

مطالعه 2: یک مطالعه دیگر نمونه تصادفی از دانشجویان را گرفت و عادات ورزشی آنها را بررسی کرد. هر شخص به عنوان یک مربی سبک ، متوسط یا سنگین طبقه بندی می شد. محققان بررسی کردند که گروه ها در پایان یک ترم تمایل به دریافت معدل بالاتر دارند.

مطالعه 1 یک مطالعه تجربی است در حالی که مطالعه 2 یک مطالعه مشاهده ای است. از آنجا که مطالعه 1 به مداخله محققان نیاز داشت در حالی که مطالعه 2 این کار را نکرد.

تفاوت بین مطالعه مشاهده ای و مطالعه تجربی:

  • مطالعات تجربی به طور معمول گران تر است زیرا برای تنظیم آزمایش برای مطالعه به منابع بیشتری نیاز دارد در حالی که یک مطالعه مشاهده ای از طریق بررسی و جمع آوری داده ها می تواند انجام شود. محققان نیازی به مداخله ندارند.
  • مطالعات تجربی به طور معمول از مطالعات مشاهده ای کوتاه تر است زیرا مداخلات محققان باعث می شود تا جمع آوری داده های مربوطه برای مطالعه کارآمدتر شود ، در حالی که ممکن است چندین سال طول بکشد تا جمع آوری داده ها را برای مطالعات مشاهده ای تکمیل کند.
  • شواهد ارائه شده توسط مطالعات تجربی قوی تر از مطالعه مشاهده ای است. رابطه بین متغیرها در یک مطالعه مشاهده ای یک رابطه علیت لازم نیست ، در حالی که در یک مطالعه تجربی ، تصادفی باعث می شود که سایر متغیرهای متغیر (به عنوان مثال ، سن ، جنس ، مکان جغرافیایی ، عادت هزینه) به طور مساوی بین گروه های درمانی و کنترل توزیع شوند. و نمونه های ما نماینده جمعیت ما هستند ، به طوری که ما می توانیم دقیق تر اثر علی درمان را بر نتیجه ای که به آن اهمیت می دهیم بررسی کنیم.

به نظر می رسد که مطالعات تجربی مزایای بیشتری نسبت به مطالعات مشاهده ای دارند. با این حال ، در برخی از مطالعات تحقیقاتی ، مطالعات تجربی گزینه ای امکان پذیر نیست. مثلا،

  • شما تحقیقاتی را بر اساس داده های تاریخی انجام می دهید که در گذشته واگذاری تصادفی از درمان را انجام نداده اند.
  • درمان فقط به جای تحمیل قابل مشاهده است. برخی از اثرات درمانی (به عنوان مثال ، جنسیت ، سطح درآمد خانوار ، نژاد و غیره) توسط محققان قابل دستکاری نیست.
  • تحمیل درمان بر روی یک گروه غیر اخلاقی تلقی می شود. به عنوان مثال ، ما می خواهیم بررسی کنیم که چگونه تغییر در قیمت یک محصول بر درآمد فروش آن تأثیر می گذارد. اگر ما با شارژ گروهی از مشتریان با قیمت بالاتر از گروه دیگر در همان مکان و همان بازه زمانی ، یک مطالعه آزمایشی انجام دهیم ، غیر اخلاقی و یک فاجعه روابط عمومی خواهد بود. در مثال دیگر ، ما می خواهیم بررسی کنیم که آیا دریافت مدرک دانشگاهی بر درآمد کسب شده تأثیر می گذارد. باز هم ، ما نمی توانیم برخی از افراد را به "داشتن مدرک دانشگاهی" تحمیل کنیم. نه تنها غیرممکن است بلکه انجام این کار غیر اخلاقی خواهد بود.

بخش دوم: مطالعه مشاهده ای با مدلهای اقتصاد سنجی

مدل رگرسیون

مدل های اقتصاد سنجی (A. K. A. رگرسیون کنترل شده) یک روش محبوب برای یک مطالعه مشاهده ای برای تخمین چگونگی تغییر متغیرهای پیش بینی کننده (به عنوان مثال ، درمان X و سایر متغیرهای متغیر) است که مربوط به تغییر متغیر پاسخ (Y) است. مهمتر اینکه ، با یک مدل رگرسیون کنترل شده ، می توانیم اثر یک متغیر (به عنوان مثال ، درمان X) را در حالی که ثابت نگه داشتن تمام متغیرهای پیش بینی کننده دیگر را جدا می کنیم ، جدا کنیم.

نه تنها رگرسیون کنترل شده قادر به کنترل متغیرهای متغیر (که بر متغیر پاسخ تأثیر می گذارد) بلکه می تواند متغیرهای مخدوش را نیز کنترل کند ، که می تواند هم بر درمان X و هم متغیرهای پاسخ Y را تحت تأثیر قرار دهد.

به عنوان مثال ، یک وب سایت تجارت الکترونیکی می خواهد بررسی کند که آیا یک ویژگی اتاق مناسب مجازی در وب سایت آنها باعث افزایش درآمد فروش آنها می شود. اگر فقط این ویژگی وب سایت را در مورد درآمد فروش رکود کنیم ، می توانیم به راحتی بین ویژگی اتاق مناسب و درآمد فروش ارتباط مثبت مشاهده کنیم. اگر فقط در آنجا متوقف شویم ، اثر این ویژگی مغرضانه خواهد بود (a. k. a ، تعصب متغیر حذف شده) زیرا یک متغیر مخدوش کننده مهم ، سن ، در مدل گنجانده نشده است. بر اساس تجزیه و تحلیل داده های اضافی ، ما می توانیم دریابیم که ، مشتریان جوانتر تمایل دارند که بیشتر از اتاق مناسب مجازی استفاده کنند و مشتریان جوان تر تمایل دارند که بیشتر در این وب سایت تجارت الکترونیکی هزینه کنند. اگر متغیر سنی را در رگرسیون کنترل شده قرار ندهیم ، ممکن است اثر این ویژگی مغرضانه باشد.

نکاتی برای بررسی اینکه آیا تعصب متغیر در یک مدل کنترل شده وجود دارد

  • در صورت اضافه کردن یک متغیر پیش بینی کننده به مدل رگرسیون ، به طور معناداری باعث افزایش مربع R می شود و اثر درمانی نیز با مقدار قابل توجهی تغییر می کند. این احتمال وجود دارد که مدل قبلی از تعصب متغیر حذف شده رنج ببرد.
  • اگر شامل متغیر (های) اضافی در مدل بر اثر معنادار بر اثر درمان تأثیر نمی گذارد ، ما اطمینان بیشتری داریم که اثر تخمین زده شده یک اثر علیت واقعی بین درمان و متغیر پاسخ است.

آدرس تعصب متغیر حذف شده با استفاده از متغیر ابزاری

مسئله دیگر در مطالعات مشاهده ای ، مخدوش کننده متغیرهایی است که از نظر مفهومی وجود دارند ، اما نمی توان اندازه گیری یا مشاهده کرد ، بنابراین اثر درمانی از تعصب متغیر حذف شده رنج می برد. از جمله متغیر ابزاری (IV) در مدل یک روش محبوب برای رسیدگی به این مسئله است.

بیایید این متغیر ابزاری Z را تعریف کنیم:

  • Z با هیچ متغیر دیگر (از جمله اصطلاح خطا) در مدل ارتباط ندارد
  • z به طور معناداری و به شدت با درمان x ارتباط دارد ، بنابراین به طور غیرمستقیم از طریق x تأثیر می گذارد

در عمل ، یک متغیر ابزاری در دو مرحله قابل اجرا است:

  • مرحله 1: ما متغیر ابزاری را در X انجام می دهیم. به خاطر داشته باشید که باید بین IV و X همبستگی قوی داشته باشیم. در غیر این صورت ، ما هنوز هم ممکن است تعصب در اثر درمان داشته باشیم
  • مرحله 2: ما در مورد X از مرحله 1 و سایر متغیرهای پیش بینی شده y را رکود می کنیم. بنابراین ما اثر درمانی را با دقت بیشتری تخمین می زنیم.

استفاده از متغیر ابزاری

مطالعه موردی: یک سایت رسانه های اجتماعی می خواهد بررسی کند که آیا دوستان بیشتری در همان سایت رسانه های اجتماعی وجود دارد ، باعث می شود کاربر احتمال بازگشت به سایت را بیشتر کند.

اول از همه ، یک مطالعه تجربی خارج از جدول است زیرا ما نمی توانیم به طور تصادفی افرادی را که دوست بیشتری نسبت به دیگران دارند اختصاص دهیم. ثانیا ، از جمله همه متغیرهای مخدوش امکان پذیر نیست. به نظر می رسد استفاده از یک متغیر ابزاری مسیری آسانتر است. یک سایت رسانه های اجتماعی باید یک استراتژی موجود برای دعوت دوستان بیشتری به سایت داشته باشد. به عنوان مثال ، ویژگی ارسال دعوت نامه به دوستان با استفاده از مخاطبین دوست کاربر.

تفاوت در الگوی اختلافات

هنگامی که یک متغیر ابزاری امکان پذیر نباشد ، ما به یک روش جایگزین برای کنترل اثر از متغیرهای مخدوش غیرقابل کنترل نیاز داریم. مدل اختلاف در اختلاف (DID) می تواند گزینه ای مناسب باشد. این نتایج حاصل از دوره قبل از درمان و دوره درمانی بین گروه های درمان و کنترل را مقایسه می کند. فرض کلیدی مورد نیاز برای مدل DID:

  • اگر درمان تحمیل نشود ، متغیرهای نتیجه گروه درمانی و کنترل روند موازی را دنبال می کنند.
  • هر متغیرهای متغیر (از جمله متغیرهای حذف شده) بر متغیرهای نتیجه گروه درمانی و گروههای کنترل به همان روش تأثیر می گذارد.

استفاده از مدل تفاوت در ابعاد

مطالعه موردی: یک فروشگاه خرده فروشی می خواهد بررسی کند که آیا افزایش قیمت یک محصول باعث ایجاد درآمد بیشتر می شود.

اول از همه ، یک مطالعه آزمایشی خارج از جدول است زیرا به طور تصادفی یک محصول را با قیمت های مختلف در همان مکان شارژ می کند ، غیر اخلاقی در نظر گرفته می شود. ثانیا ، ساخت هر دو متغیر مخدوش و متغیر ابزاری به خودی خود یک کار دشوار است. در این حالت ، مدل تفاوت در اختلافات گزینه بهتری است.

ما می توانیم دو فروشگاه خرده فروشی را از شهرهای مختلف انتخاب کنیم و این دو شهر نیز از نظر جمعیت ، سطح درآمد و تقاضا برای محصول قابل مقایسه هستند (فرض روند موازی).

فروشگاه در City 1 (گروه درمانی) در دوره کنترل ، قیمت بالاتری (اثر درمانی) را در دوره کنترل در حالی که فروشگاه در شهر 2 (گروه کنترل) در هر دو دوره به همان قیمت را پرداخت می کند ، به مشتریان متهم می کند.

ما می توانیم مقایسه کنیم که چگونه درآمد بین دو شهر پس از افزایش قیمت با استفاده از یک مدل DID تغییر می کند.

  • β1: این تأثیر را بر متغیر پاسخ در دوره درمانی از عوامل غیر از درمان ما تخمین می زند.
  • β2: این تفاوت متوسط بین گروه های درمان و کنترل را تخمین می زند
  • β3: اثر درمانی خالص بر متغیر پاسخ را تخمین می زند.

بخش سوم: مطالعه تجربی با آزمون A/B

در این بخش ، بیایید در مورد ابزار قدرتمند دیگری برای استنباط علی ، آزمون A/B صحبت کنیم.

آزمون A/B (A. K. A ، کارآزمایی کنترل شده تصادفی) شاید دقیق ترین ابزار برای بررسی علیت باشد. با شناسایی مداوم اهداف جدید از نظر نرخ تبدیل و معیارهای نامزدی و آزمایش ویژگی های جدید ، یک وب سایت می تواند عملکرد خود را بهبود بخشد و یک برنامه می تواند کاربران بیشتری را جذب و حفظ کند. بنابراین آزمون A/B معمولاً در سالهای اخیر در صنعت فناوری استفاده می شود.

آزمون A/B معمولاً در برخی از مراحل لازم انجام می شود: تشکیل فرضیه ، محاسبه اندازه نمونه ، طراحی تصادفی ، تجزیه و تحلیل پس آزمون.

فرضیه

تشکیل فرضیه اولین قدم از هر آزمون A/B است. فرضیه ای بیانیه ای که رابطه علی را که می خواهید تحقیق کنید توصیف می کند. بیایید نمونه ای از فرضیه را بیان کنیم.

هر فرضیه از مؤلفه های کلیدی تشکیل شده است: جمعیت ، درمان ، متریک ارزیابی ، فرضیه تهی و جایگزین

جمعیت: ما باید تعریف کنیم که افراد واجد شرایط برای آزمایش هستند (به عنوان مثال ، کلیه کاربران یا کاربران از یک مکان خاص) و همچنین نحوه تعیین یک موضوع فردی (واحد انحراف). در مثال بالا ، محبوب همه بازدید کنندگان از سایت تجارت الکترونیکی ABC و واحد انحراف شناسه کاربر است.

درمان (مداخله): یک درمان می تواند یک ویژگی جدید یا طراحی جدید باشد. در مثال بالا ، درمان کوپن های ایمیل دریافت می کند. به خاطر داشته باشید که ، درمان معمولاً فقط می تواند یک مداخله باشد. ما نمی توانیم چندین تغییر در یک گروه تحمیل کنیم. به عنوان مثال ، اگر هم برای آزمایش هر دو کوپن ایمیل و کوپن های پستی ارسال کنیم ، نمی توانیم اثر را از هر دو مداخله تشخیص دهیم.

گروه های درمانی و کنترل: هر فردی که توسط درمان تحمیل شود ، متعلق به گروه درمانی است. هر موضوعی که توسط درمان تحمیل نشده باشد ، در گروه کنترل خواهد بود.

متریک ارزیابی (متغیر نتیجه): متریک ارزیابی نتیجه ای است که ما به آن اهمیت می دهیم و مورد بررسی قرار می گیرد. در مثال بالا ، معیار ارزیابی نرخ تبدیل خرید است که به عنوان نسبت بین تعداد بازدیدکنندگانی که خرید می کنند و تعداد کل بازدید کنندگان در این آزمایش تعریف می شود.

انواع مختلفی از معیارهای ارزیابی وجود دارد. مثلا،

  • شمارش: معیارهای نامزدی ، مانند کاربران فعال روزانه (DAU) ، کاربران فعال هفتگی (WAU) ، کاربران فعال ماهانه (MAU) و چسبندگی کاربر (DAU/MAU) معیارهای ارزیابی مشترک هستند
  • توزیع (به عنوان مثال ، میانگین صدک): متریک ارزیابی می تواند یک توزیع باشد. به عنوان مثال ، میانگین زمان جلسه در یک سایت یا میانگین تعداد کلیک قبل از تبدیل.
  • احتمال و نسبت: متریک ارزیابی نیز می تواند یک نسبت باشد. به عنوان مثال ، نرخ تبدیل ، که توسط تعداد موضوعاتی که اقدام مورد نظر را انجام می دهند (به عنوان مثال ، روی پایین کلیک کنید ، خرید کنید) بیش از تعداد کل افراد در یک آزمایش تعریف شده است. میزان احتباس ، که درصد کاربران بازگشت به وب سایت یا برنامه شما را در مدت زمانی اندازه گیری می کند. ردیابی نرخ تبدیل و نرخ نگهداری به شما امکان می دهد عملکرد یک وب سایت را رصد کرده و زمینه هایی را برای بهبود مشخص کنید.

فرضیه تهی و جایگزین: فرضیه تهی بیان می کند که هیچ تفاوتی در متغیر نتیجه بین گروه درمانی و گروه کنترل وجود ندارد. به عبارت دیگر ، درمان بر نتیجه تأثیر نمی گذارد. فرضیه جایگزین آمده است که تفاوت آماری در نتیجه بین دو گروه وجود دارد.

محاسبه اندازه نمونه

مرحله بعدی محاسبه اندازه نمونه برای آزمایش است. ما باید قبل از محاسبه چند مورد را تعیین کنیم.

  • اندازه اثر: این تفاوت متغیر نتیجه (به عنوان مثال ، تغییر میزان تبدیل) بین گروه های درمان و کنترل است. به خاطر داشته باشید که با اندازه کافی نمونه ، حتی تغییرات ریز از آزمایش از نظر آماری معنی دار خواهد بود. بنابراین شما باید در مورد تأثیر تجاری تغییرات و اهمیت عملی فکر کنید. شما باید بپرسید "حداقل تأثیر در نتیجه مداخله که ارزش آن را دارد چه تأثیر دارد؟"ضمن در نظر گرفتن هزینه های توسعه و فرصت. همچنین هرچه اندازه اثر کوچکتر باشد ، داده های بیشتری لازم و آزمایش طولانی تر خواهد بود.
  • سطح و قدرت اهمیت آماری: به طور معمول سطح اهمیت 0. 05 و قدرت به عنوان 0. 8 تعیین شده است. سطح اهمیت (خطای A. K. A نوع I) احتمال قابل قبول برای تشخیص دروغ در هنگام عدم وجود اثر است. بنابراین هرچه سطح اهمیت کوچکتر باشد ، آزمون بهتر می شود و داده های بیشتری نیز لازم است. قدرت این احتمال است که یک آزمایش در هنگام حضور اثر ، اثر را تشخیص دهد. بنابراین هرچه قدرت بالاتر باشد ، آزمون بهتر می شود و به داده های بیشتری نیز نیاز خواهد بود.
  • انحراف استاندارد: این واریانس متغیر نتیجه است. هنگامی که به دست آوردن آن دشوار است ، می توانیم به داده های تاریخی یا دانش متخصصان دامنه اعتماد کنیم تا این موضوع را تخمین بزنیم. هرچه انحراف استاندارد بالاتر باشد ، داده های بیشتری به ما نیاز خواهیم داشت
  • محاسبه اندازه نمونه: پس از اطلاعات ذکر شده در بالا ، فرمول زیر می تواند اندازه نمونه را محاسبه کند. مقادیر z نمره استاندارد با توجه به مقادیر سطح و قدرت اهمیت است. مقدار σ انحراف استاندارد است. μC-μT اندازه اثر است.

تصادفی سازی

پس از فرضیه و اندازه نمونه ، می توانیم به طور تصادفی افراد را به گروههای درمانی و کنترل اختصاص دهیم. تصادفی سازی کلید موفقیت یک آزمون A/B بی طرفانه است. باید شرایط زیر را برآورده کند:

  • باید مطمئن شوید که نمونه های موجود در آزمون نماینده جمعیت هستند. به طوری که نتیجه گیری از نمونه می تواند برای جمعیت اعمال شود.
  • باید مطمئن شوید که متغیرهای متغیرهای متغیر به طور مساوی بین گروه درمانی و گروه کنترل توزیع می شوند. هر عواملی (به عنوان مثال ، جنسیت ، سطح درآمد ، مکان ، نوع دستگاه) که ممکن است بر متغیر نتیجه تأثیر بگذارد ، باید به طور مساوی توزیع شود. به طوری که ما می توانیم ضمن مقایسه سایر متغیرهای متغیر ، تأثیر را بر درمان جدا کنیم.

تجزیه و تحلیل پس آزمون

قبل از اینکه ما تجزیه و تحلیل کنیم که چگونه درمان بر متغیر نتیجه ما در آزمایش تأثیر می گذارد. ما باید در آزمایش یک بررسی عقل انجام دهیم. معیارهایی که ما برای بررسی عقل استفاده می کنیم ، معیارهای ثابت (به عنوان مثال ، تعداد کوکی ها) نامیده می شوند که قرار نیست تحت تأثیر آزمایش قرار بگیرند. بنابراین نباید تغییر در معیارهای ثابت بین گروه های کنترل و درمان ایجاد شود. در غیر این صورت ، نقص هایی در تنظیم آزمایش وجود دارد.

پس از عبور از بررسی عقل ، می توانیم با تجزیه و تحلیل داده های واقعی که به آنها اهمیت می دهیم پردازش کنیم. روشهای بسیاری وجود دارد که می توانیم از آنها استفاده کنیم تا بررسی کنیم که متغیر نتیجه بین گروه های کنترل و درمان متفاوت است یا خیر.

تست های پارامتری: تست های پارامتری وقتی متغیر نتیجه نسبتاً عادی توزیع می شود ، به خوبی کار می کنند. موارد زیر برخی از تست های پارامتری محبوب است:

  • آزمون t دانشجویی: فرض می کنیم واریانس متغیر نتیجه بین گروه های کنترل و درمان یکسان است.
  • آزمون t Welch: هنگامی که اندازه یا واریانس نمونه قابل مقایسه نیست ، آزمون t Welch از آزمون t دانش آموز بهتر عمل می کند
  • آزمایش ANOVA: گاهی اوقات چندین گروه درمانی وجود دارد. قبل از اجرای چندین آزمون t ، ابتدا می توانیم آزمایش ANOVA را که از آزمون f استفاده می کند ، اجرا کنیم تا مشخص کنیم آیا وسایل سه یا چند گروه متفاوت هستند. اگر مقدار p از آزمون f کوچک باشد ، می دانیم که حداقل یک گروه با بقیه متفاوت است. سپس می توانیم وقت خود را صرف آزمایش تست های زوجی کنیم تا دریابیم که کدام گروه متفاوت است. به خاطر داشته باشید که هنگام انجام چندین آزمایش ، باید با استفاده از تصحیح Bonferroni یا میزان کشف کاذب (FDR) ، مقدار P را اصلاح کنیم.

آزمون غیر پارامتری: تست های غیر پارامتری فرضیاتی در مورد توزیع داده های اساسی نمی کنند. آنها گزینه های قابل دوام هستند که متغیر نتیجه مداوم به طور معمول توزیع نمی شود یا دو یا چند نتیجه طبقه بندی شده وجود دارد. موارد زیر برخی از تست های محبوب غیر پارامتری است:

  • آزمون مجذور کای: این یک آزمایش استقلال است که به شما امکان می دهد در صورت وجود ارتباط آماری معنی داری بین درمان و متغیرهای نتیجه وجود داشته باشد. این می تواند با داده های طبقه بندی شده با دو یا چند مقدار نتیجه برخورد کند در حالی که یک آزمون T فقط می تواند داده های طبقه بندی را با دو مقدار نتیجه کنترل کند.
  • Fisher’s exact Test: The chi-squared test is only reliable if the sample size is relatively large( i.e., n>1000). اگر این آستانه برآورده نشود ، می توانید به جای آن از تست دقیق فیشر استفاده کنید.
  • آزمون Ma Whitney U (آزمون جمع رتبه Wilcoxon): این آزمون به جای مقادیر واقعی از رده ها استفاده می کند. هنگام مقایسه متغیر مداوم که به طور معمول توزیع نمی شود یا اندازه نمونه کوچک است ، آزمون جمع رتبه Wilcoxon گزینه خوبی خواهد بود.

مسائل در آزمون A/B و راه حل ها

  • تست های A/B را خیلی زود متوقف کنید: بعد از اینکه اندازه نمونه را محاسبه می کنیم ، ما می دانیم که با تقسیم متوسط ترافیک روزانه ، تعداد روزها را برای اجرای آزمون انجام می دهیم. اگر تعداد کمتر از یک هفته باشد ، باید حداقل 2 هفته آزمون را ادامه دهیم. در صورت امکان ، 1-2 چرخه تجاری بهتر خواهد بود. مردم به صورت روزانه متفاوت رفتار می کنند (به عنوان مثال ، هفته آخر هفته در مقابل آخر هفته) و تحت تأثیر برنامه های خارجی قرار می گیرند (به عنوان مثال ، تعطیلات ، فصل مالیات ، تابستان در مقابل زمستان). ما می توانیم با تست طولانی نتیجه قوی تری کسب کنیم.
  • تأثیر شبکه: در سیستم عامل های رسانه های اجتماعی ، رفتارهای کاربران به احتمال زیاد تحت تأثیر افراد در محافل اجتماعی خود است ، بنابراین فرض استقلال در مورد کاربران نیست. هنگامی که به طور تصادفی هر کاربر را به گروه های کنترل و درمانی اختصاص می دهد ، اثر درمانی از آزمایش معمولاً تحت ارزیابی قرار می گیرد زیرا اثر درمانی ممکن است از طریق حلقه اجتماعی گروه درمانی به گروه کنترل برسد. برای پرداختن به این مسئله ، می توانیم از تصادفی سازی خوشه ای استفاده کنیم که کاربران را در همان حلقه اجتماعی در همان گروه قرار می دهد.
  • اثر جدید و اثر تقدم: مردم به تغییرات/ویژگی های جدید محصول متفاوت واکنش نشان می دهند. برخی از افراد ممکن است از هرگونه تغییر جدید احساس هیجان کنند و دوست دارند به خاطر تلاش جدید ، آن را آزمایش کنند. به این نوع رفتار اثر جدید گفته می شود. از طرف دیگر ، برخی از افراد ممکن است در برابر هرگونه تغییر در یک محصول مقاومت کنند. به این اثر تقدم اثر یا تغییر تغییر نامیده می شود. اگر اثر اولیه کوچکتر یا بزرگتر را مشاهده می کنید ، به احتمال زیاد به دلیل جدید بودن یا اثر تقدم است. برای حل این مسئله ، می توانیم مدت زمان آزمایش را تمدید کنیم زیرا این اثرات در نهایت از بین می رود. از طرف دیگر ، ما می توانیم آزمایش A/B را فقط بر روی کاربران جدید انجام دهیم زیرا کاربران جدید دیدگاه تازه ای دارند و نباید تحت تأثیر این جلوه ها قرار بگیرند.
  • نتایج متناقض: گاهی اوقات ، ما می بینیم که نتایج متناقض از معیارهای ارزیابی چندگانه (به عنوان مثال ، نرخ تبدیل بالا می رود ، اما میزان احتباس پایین می رود). برای پرداختن به این مسئله ، ما می توانیم با یک OEC (معیار ارزیابی بیش از حد) که اهداف کوتاه مدت و بلند مدت را به خود اختصاص می دهد ، و معاملات بین معیارهای مختلف را تشکیل دهیم. با این حال ، شما باید بتوانید تأثیرات مثبت و منفی را تعیین کنید و اطمینان حاصل کنید که تأثیر منفی قابل قبول است.

یادداشت های نهایی

در اینجا برخی از پست های مرتبط وجود دارد که می توانید در صورت علاقه به رگرسیون خطی و استنتاج علی ، کشف کنید.

از خواندن شما متشکرم

اگر از این مقاله لذت می برید و می خواهید یک قهوه برای من بخرید ، لطفا اینجا را کلیک کنید.

برای باز کردن دسترسی کامل به مقالات من می توانید برای عضویت در عضویت ثبت نام کنید و دسترسی نامحدودی به همه چیز در رسانه داشته باشید. لطفاً اگر می خواهید هر زمان که مقاله جدیدی را ارسال کنم ، یک اعلان ایمیل دریافت کنید.< Pan> نتایج متناقض: گاهی اوقات ، ما می بینیم که نتایج متناقض از معیارهای ارزیابی چندگانه (به عنوان مثال ، نرخ تبدیل بالا می رود ، اما میزان حفظ پایین می رود). برای پرداختن به این مسئله ، ما می توانیم با یک OEC (معیار ارزیابی بیش از حد) که اهداف کوتاه مدت و بلند مدت را به خود اختصاص می دهد ، و معاملات بین معیارهای مختلف را تشکیل دهیم. با این حال ، شما باید بتوانید تأثیرات مثبت و منفی را تعیین کنید و اطمینان حاصل کنید که تأثیر منفی قابل قبول است.

فارکس پرشین...
ما را در سایت فارکس پرشین دنبال می کنید

برچسب : نویسنده : احمدي مينا بازدید : <-PostHit-> تاريخ : پنجشنبه 3 فروردين 1402 ساعت: 11:30