پث‌وایز

آمار و سواد داده (Statistics and Data Literacy) · درس ۱۱ از ۱۲ · ۱۲ دقیقه

خوندن یه پژوهش (Reading a Study)

کارآزمایی تصادفی، مطالعه‌ی مشاهده‌ای و هرچی این وسطه: چی یه پژوهش رو محکم می‌کنه، و نشونه‌های هشدار تو گزارش شدنش.

استاندارد طلایی

کارآزمایی تصادفی‌شده‌ی کنترل‌شده

توی یه کارآزمایی تصادفی‌شده‌ی کنترل‌شده (Randomised controlled trial یا RCT)، داوطلب‌ها به‌طور تصادفی به دو گروه تقسیم می‌شن. یکی درمان رو می‌گیره. اون یکی، یعنی گروه کنترل (Control group)، هیچی نمی‌گیره یا یه دارونما (Placebo) می‌گیره، یه قرص الکی که شبیه همونه. چون شانس تعیین می‌کنه کی کجا بره، عامل‌های دیگه، همون عامل‌های مخدوش‌کننده‌ی درس ۶ مثل سن، رژیم غذایی یا شدت بیماری، تقریباً یکسان بین دو گروه پخش می‌شن. پس اگه آخرش دو گروه با هم فرق داشتن، محتمل‌ترین دلیلش درمانه.

اگه آدم‌ها خودشون گروهشون رو انتخاب می‌کردن، شاید باانگیزه‌ترها همه قرص جدید رو برمی‌داشتن، و نتیجه‌ی بهتر رو انگیزه‌شون توضیح می‌داد، نه قرص. یه سکه‌ی شیر یا خط براش مهم نیست کی باانگیزه‌ست.

خودت رو امتحان کن

چرا توی کارآزمایی‌ها آدم‌ها رو به‌طور تصادفی به گروه‌ها می‌فرستن، به‌جای اینکه بذارن خودشون انتخاب کنن؟

  1. چون از پرسیدن از آدم‌ها ارزون‌تره
  2. تا عامل‌های دیگه یکسان پخش بشن، و درمان تنها فرق سیستماتیک بین گروه‌ها باشه
  3. تا مطمئن بشن گروه درمان بزرگ‌تره
  4. تا پژوهشگرها بتونن سالم‌ترین آدم‌ها رو برای درمان انتخاب کنن
جواب رو ببین

تا عامل‌های دیگه یکسان پخش بشن، و درمان تنها فرق سیستماتیک بین گروه‌ها باشه

درسته. شانس سن، سلامت، عادت‌ها و همه‌چیز دیگه رو تقریباً یکسان پخش می‌کنه، حتی عامل‌هایی که هیچ‌کس به فکرش نرسیده اندازه بگیره. اون‌وقت فرق نتیجه‌ها رو می‌شه به حساب درمان گذاشت.

قدم‌به‌قدم ببین

  1. ۲۰۰ داوطلب

    یه ابر از ۲۰۰ نقطه‌ی خاکستری سمت چپ، با برچسب n = 200: آدم‌هایی که سردرد دارن و برای یه کارآزمایی داوطلب شدن. کنارشون یه جعبه‌ی کوچیک بنفش با حرف R منتظره، برای تصادفی‌سازی. هنوز کسی به گروهی فرستاده نشده.

  2. شانس اون‌ها رو به دو گروه تقسیم می‌کنه

    نقطه‌ها از ابر بیرون میان، از جعبه‌ی R رد می‌شن و می‌رن توی یکی از دو گروه ۱۰۰تایی: Rx بالا، با قاب نارنجی، قرص جدید رو می‌گیره؛ placebo پایین، با قاب خاکستری، یه قرص الکی می‌گیره. شانس تعیین می‌کنه کی کجا بره، نه انتخاب خود آدم‌ها. به این می‌گن تصادفی‌سازی.

  3. ۶۰ نفر با قرص بهتر شدن، ۴۵ نفر با قرص الکی

    یه هفته بعد، نقطه‌ی آدم‌هایی که بهتر شدن آبی و پر می‌شه: ۶۰ از ۱۰۰ توی گروه Rx، و ۴۵ از ۱۰۰ توی گروه placebo. خیلی‌ها با قرص الکی هم خوب می‌شن، چون سردرد معمولاً خودش رد می‌شه.

  4. اثر واقعی: +۱۵ واحد

    نقطه‌های پرشده‌ی هر گروه به شکل یه میله برجسته می‌شن، با برچسب 60% برای Rx و 45% برای placebo، و یه کروشه که این دوتا رو به هم وصل می‌کنه نوشته +15 pt. اثر واقعی قرص همین فرقه: ۱۵ واحد درصد. بدون گروه کنترل، کل اون ۶۰ رو به حساب قرص می‌ذاشتی.

خودت رو امتحان کن

توی این کارآزمایی، ۶۰ نفر از ۱۰۰ نفر با قرص جدید و ۴۵ نفر از ۱۰۰ نفر با دارونما بهتر شدن. اثر قرص چقدره؟

  1. ۶۰ درصد: همین تعداد با قرص خوب شدن
  2. ۱۵ واحد درصد: فرق بین دو گروه
  3. ۴۵ درصد: اثر دارونما
  4. روی هم ۱۰۵ نفر کمک گرفتن
جواب رو ببین

۱۵ واحد درصد: فرق بین دو گروه

درسته. ۴۵ نفر از اون ۱۰۰ نفر احتمالاً به‌هرحال بهتر می‌شدن، همون‌طور که گروه دارونما نشون می‌ده. قرص از هر ۱۰۰ نفر ۱۵ نفر دیگه اضافه کرد: اثری به اندازه‌ی ۱۵ واحد درصد.

کورسازی (Blinding)

اسم · پژوهش

اینکه نذاری آدم‌ها بدونن کی درمان واقعی رو گرفته. توی کارآزمایی یک‌سوکور (Single-blind) شرکت‌کننده‌ها نمی‌دونن توی کدوم گروهن. توی کارآزمایی دوسوکور (Double-blind) پژوهشگرهایی که نتیجه‌ها رو اندازه می‌گیرن هم نمی‌دونن. این جلوی اثر دارونما رو محدود می‌کنه و نمی‌ذاره امیدهای کسی اندازه‌گیری‌ها رو یه ذره جابه‌جا کنه.

اگه یه پزشک بدونه بیمارش قرص جدید رو گرفته، ممکنه ناخواسته دردش رو یه کم کمتر ارزیابی کنه. دوسوکور کردن این احتمال رو از بین می‌بره.

دو راه برای مطالعه‌ی آدم‌ها

کارآزمایی تصادفی

پژوهشگرها درمان رو به‌طور تصادفی تعیین می‌کنن.

می‌تونه علت و معلول رو نشون بده. گرونه، اغلب کوچیک و کوتاهه، و برای خیلی از سؤال‌ها غیرممکنه.

مطالعه‌ی مشاهده‌ای

پژوهشگرها آدم‌هایی رو تماشا می‌کنن که رفتارشون رو خودشون انتخاب کردن (مطالعه‌ی هم‌گروهی، مورد-شاهدی، نظرسنجی).

اغلب تنها گزینه‌ی اخلاقی یا عملیه، چون نمی‌شه آدم‌ها رو مجبور به سیگار کشیدن کرد. همبستگی نشون می‌ده؛ خطر اصلیش عامل مخدوش‌کننده‌ست.

خودت رو امتحان کن

مطالعه‌های مشاهده‌ای بی‌ارزشن، چون فقط کارآزمایی‌های تصادفی شاهد حساب می‌شن.

جواب رو ببین

نادرست

غلطه. خیلی از چیزهایی که درباره‌ی سیگار و سرطان می‌دونیم از مطالعه‌های مشاهده‌ای اومده، چون کارآزمایی‌ای که آدم‌ها رو به سیگار کشیدن وادار کنه غیراخلاقیه. همبستگی نشون می‌دن، پس باید با عامل‌های مخدوش‌کننده با دقت برخورد کرد، ولی مطالعه‌های مشاهده‌ای بزرگ و خوب‌اجراشده می‌تونن خیلی باارزش باشن.

یه نردبون تقریبی از شواهد، از ضعیف‌ترین

  1. تجربه‌ی شخصی و نظر کارشناس

    «برای پسرخاله‌م جواب داد.» ارزش یه سؤال رو داره، نه یه نتیجه‌گیری.

  2. پژوهش روی سلول یا حیوان

    «روی موش‌ها» یا «توی آزمایشگاه». سرنخ‌های اولیه‌ی به‌دردبخوری‌ان، ولی خیلی از نتیجه‌ها به آدم‌ها نمی‌رسن.

  3. مطالعه‌های مشاهده‌ای

    آدم‌های واقعی و اغلب تعداد زیاد، ولی همبستگی‌هایی نشون می‌دن که ممکنه عامل‌های مخدوش‌کننده توضیحشون بدن.

  4. کارآزمایی‌های تصادفی‌شده‌ی کنترل‌شده

    شانس گروه‌ها رو متعادل می‌کنه، پس فرق رو می‌شه به حساب درمان گذاشت.

  5. مرورهای نظام‌مند و فراتحلیل‌ها

    کلی پژوهش درباره‌ی یه سؤال رو با هم ترکیب می‌کنن. بالاتر بودن خودبه‌خود یعنی درست بودن نیست، ولی ادعاهای پله‌های پایین‌تر احتیاط بیشتری می‌خوان.

خودت رو امتحان کن

یه تیتر می‌گه «شکلات حافظه رو بهتر می‌کنه». پژوهشِ پشتش روی موش‌ها انجام شده. مشکل اصلی چیه؟

  1. موش‌ها شکلات دوست ندارن
  2. نتیجه‌های روی موش اغلب به آدم‌ها منتقل نمی‌شن
  3. حتماً پژوهش زیادی بزرگ بوده
  4. حافظه رو نمی‌شه اندازه گرفت
جواب رو ببین

نتیجه‌های روی موش اغلب به آدم‌ها منتقل نمی‌شن

درسته. پژوهش‌های حیوانی سرنخ‌های اولیه‌ی خوبی‌ان، ولی خیلی از نتیجه‌های روی موش هیچ‌وقت توی آدم‌ها دیده نمی‌شن. «روی موش‌ها» یه پله‌ی پایین نردبونه، و تیتر حذفش کرده.

سؤال‌هایی که از هر پژوهشی باید بپرسی

  • چند نفر؟ پژوهش ۲۰ نفره شکننده‌ست. کیا بودن؟ نتیجه‌ها ممکنه برای تو هم صدق کنه؟
  • در مقایسه با چی؟ بدون گروه کنترل، هیچ راهی نیست درمان رو از بهبودی‌ای که به‌هرحال پیش می‌اومد جدا کنی.
  • اثر چقدر بزرگ بوده، به‌صورت مطلق (درس ۸)، و چقدر دووم آورده؟
  • داوری‌شده (peer-reviewed) بوده یا پیش‌انتشار (preprint)؟ کی پولش رو داده؟ کسی تکرارش کرده؟ توی پروژه‌های بزرگ تکرار پژوهش‌های روان‌شناسی، تقریباً یک‌سوم تا نصفِ یافته‌های منتشرشده دوباره تأیید نشدن.
  • خبرنامه‌های رسمی و تیترها اغلب بزرگ‌نمایی می‌کنن: «مرتبط با» می‌شه «باعث»، موش‌ها می‌شن آدم. هر وقت تونستی، چکیده‌ی مقاله رو بخون.

خودت رو امتحان کن

کدوم شاهد قوی‌تریه که یه درمان جواب می‌ده؟

  1. یه مطالعه‌ی مشاهده‌ای روی ۵۰ نفر
  2. یه فراتحلیل که ۱۲ کارآزمایی تصادفی رو ترکیب کرده
  3. نظر شخصی و محکم یه پزشک
  4. یه پژوهش آزمایشگاهی روی سلول‌های انسانی
جواب رو ببین

یه فراتحلیل که ۱۲ کارآزمایی تصادفی رو ترکیب کرده

درسته. کارآزمایی‌های تصادفی گروه‌ها رو با شانس متعادل می‌کنن، و ترکیب ۱۲تاشون اثر خوش‌شانسی یا بدشانسی هر کدوم رو صاف می‌کنه. همین اون رو بالای نردبون می‌ذاره.

مرور درس

  • کارآزمایی تصادفی‌شده‌ی کنترل‌شده آدم‌ها رو با شانس به گروه درمان و گروه کنترل تقسیم می‌کنه، تا عامل‌های مخدوش‌کننده یکسان پخش بشن.
  • توی مثال، ۶۰ نفر از ۱۰۰ نفر با قرص و ۴۵ نفر از ۱۰۰ نفر با دارونما بهتر شدن: اثر ۱۵ واحد درصده، نه ۶۰ درصد.
  • کورسازی نمی‌ذاره انتظارهای شرکت‌کننده‌ها و پژوهشگرها نتیجه‌ها رو شکل بده.
  • مطالعه‌های مشاهده‌ای اغلب تنها گزینه‌ان و می‌تونن باارزش باشن، ولی همبستگی نشون می‌دن، نه اثبات علت.
  • بپرس چند نفر، در مقایسه با چی، اثر چقدر بزرگ، کی پولش رو داده و کسی تکرارش کرده یا نه.

فقط نخونش، نگهش دار

پث‌وایز هر ایده رو درست قبل از اینکه فراموشش کنی با یه سؤال کوتاه برمی‌گردونه. رایگان روی اندروید و وب، به فارسی و انگلیسی.

Cafe Bazaar Myket باز کردن نسخه‌ی وب

همه‌ی درس‌های این دوره

  1. میانگین، میانه و مد: سه جور «معدل» (Mean, Median, Mode)
  2. پراکندگی: چیزی که میانگین نمی‌گه (Spread)
  3. منحنی زنگوله‌ای (The Normal Curve)
  4. نمونه‌گیری: چشیدن سوپ (Sampling)
  5. حاشیه‌ی خطا: همون به‌علاوه‌منهای (Margin of Error)
  6. همبستگی، علیت نیست (Correlation vs Causation)
  7. نرخ پایه: عددی که همه یادشون می‌ره (Base Rates)
  8. درصد یا واحد درصد؟ خطر نسبی و مطلق (Percentage Points)
  9. نمودارهایی که گمراه می‌کنن (Misleading Charts)
  10. مقدار p به زبون ساده (P-values)
  11. خوندن یه پژوهش (Reading a Study)
  12. جمع‌بندی: خوندن یه تیتر (Reading a Headline)