پث‌وایز

آمار و سواد داده (Statistics and Data Literacy) · درس ۴ از ۱۲ · ۱۲ دقیقه

نمونه‌گیری: چشیدن سوپ (Sampling)

چطور یه نمونه‌ی تصادفی کوچیک می‌تونه میلیون‌ها نفر رو توصیف کنه، و چرا یه نمونه‌ی خیلی بزرگ که غلط انتخاب شده نمی‌تونه.

از کی می‌پرسی

جامعه و نمونه

جامعه (population) یعنی همه‌ی کسایی که می‌خوای درباره‌شون بدونی: همه‌ی بزرگسال‌های یه کشور، همه‌ی مشتری‌های یه مغازه، همه‌ی لامپ‌هایی که یه کارخونه این هفته ساخته. نمونه (sample) اون بخشیه که واقعاً اندازه می‌گیری. تقریباً هیچ‌وقت کل جامعه رو اندازه نمی‌گیری، چون خیلی گرون یا خیلی طولانیه. پس سؤال اصلی همیشه اینه: این نمونه شبیه جامعه هست یا نه؟

یه نظرسنج می‌خواد بدونه همه‌ی ۶۰ میلیون بزرگسال یه کشور چی فکر می‌کنن، و به ۱٬۰۰۰ نفرشون زنگ می‌زنه. اون ۶۰ میلیون جامعه‌ان؛ اون ۱٬۰۰۰ نفر نمونه.

یه قاشق از یه قابلمه‌ی هم‌زده

برای فهمیدن نمکِ سوپ کل قابلمه رو سر نمی‌کشی؛ یه قاشق کافیه. ولی فقط اگه سوپ رو هم زده باشی. از روی یه قابلمه‌ی هم‌نزده بچشی، شاید فقط آب‌گوشتش بیاد و نمکش نه، هر چقدر هم قاشقت بزرگ باشه. نمونه هم همین‌طوره: یه نمونه‌ی کوچیک می‌تونه یه جامعه‌ی خیلی بزرگ رو توصیف کنه، اگه طوری انتخاب شده باشه که همه رو منصفانه قاطی کنه.

خودت رو امتحان کن

یه دانشگاه می‌خواد بدونه ۲۰٬۰۰۰ دانشجوش چقدر راضی‌ان، و یه پرسش‌نامه برای ۵۰۰ نفرشون ایمیل می‌کنه. جامعه اینجا کیه؟

  1. همون ۵۰۰ دانشجویی که ایمیل گرفتن
  2. همه‌ی ۲۰٬۰۰۰ دانشجوی دانشگاه
  3. همه‌ی دانشجوهای کشور
  4. دانشجوهایی که جواب ایمیل رو می‌دن
جواب رو ببین

همه‌ی ۲۰٬۰۰۰ دانشجوی دانشگاه

درسته. جامعه یعنی همه‌ی کسایی که دانشگاه می‌خواد درباره‌شون بدونه: هر ۲۰٬۰۰۰ دانشجوش. اون ۵۰۰ نفر نمونه‌ان، و کسایی که جواب می‌دن یه گروه کوچیک‌ترن.

قدم‌به‌قدم ببین

  1. یه شهر ۱٬۰۰۰ نفره

    یه شهر ۱٬۰۰۰ نفره، هر نفر یه نقطه، با برچسب N = 1000. نقطه‌های نارنجی، ۴۰۰ تا یعنی ۴۰ نفر از هر ۱۰۰ نفر، چای رو ترجیح می‌دن؛ خاکستری‌ها نه. جعبه‌ی خالیِ سمت راست منتظر یه نمونه‌ست.

  2. ۱۰۰ نفر تصادفی: نمونه می‌گه ۴۱٪

    صد نفر که همه‌جای شهر پخشن، دورشون یه حلقه‌ی بنفش کم‌رنگ کشیده می‌شه و می‌رن توی جعبه، با برچسب n = 100. جواب‌هاشون مرتب چیده شده، اول نارنجی‌ها: ۴۱٪ نمونه چای رو ترجیح می‌دن، نزدیک همون ۴۰٪ واقعی.

  3. نمونه‌های تصادفی تازه، جواب‌های تازه

    حلقه‌ها مدام می‌پرن روی ۱۰۰ نفر تصادفیِ تازه، و جعبه اول ۳۸٪ نشون می‌ده، بعد ۴۳٪، بعد ۴۰٪، بعد ۴۱٪. هر نمونه‌ی تصادفی یه‌کم متفاوت درمیاد، ولی همیشه نزدیک ۴۰٪. به این بالا پایین رفتن می‌گن خطای نمونه‌گیری.

  4. فقط از یه گوشه بپرس: ۷۰٪

    حالا هر ۱۰۰ نفر از یه گوشه انتخاب شدن، بلوک بالا سمت چپِ شبکه، جایی که چای‌دوست‌ها اتفاقاً دور هم جمع شدن. جعبه با رنگ نارنجی ۷۰٪ نشون می‌ده، درحالی‌که عدد واقعی ۴۰٪ـه. این یه نمونه‌ی سوگیرانه‌ست، و پرسیدن از آدم‌های بیشتر از همون گوشه درستش نمی‌کنه.

خودت رو امتحان کن

نظرسنجی آنلاین یه سایت خبری ۵۰٬۰۰۰ رأی می‌گیره. یه مؤسسه‌ی نظرسنجی از ۱٬۰۰۰ بزرگسال به‌طور تصادفی نمونه می‌گیره. کدوم بهتر نشون می‌ده کشور چی فکر می‌کنه؟

  1. نظرسنجی سایت خبری، چون ۵۰٬۰۰۰ نفر خیلی بیشتره
  2. همون ۱٬۰۰۰ نفر تصادفی، چون همه شانس منصفانه‌ای برای انتخاب شدن داشتن
  3. هر دو به یه اندازه، چون هر نظرسنجی بالای ۱٬۰۰۰ نفر قابل اعتماده
جواب رو ببین

همون ۱٬۰۰۰ نفر تصادفی، چون همه شانس منصفانه‌ای برای انتخاب شدن داشتن

درسته. اون ۵۰٬۰۰۰ نفر خواننده‌های همون سایتن که خودشون خواستن رأی بدن؛ یه گوشه از کشور، مثل گوشه‌ی بالا چپِ شبکه. ۱٬۰۰۰ نفر تصادفی همون یه قاشق از سوپ هم‌زده‌ست.

نمونه‌گیری تصادفی (Random Sampling)

روش · آمار

انتخاب نمونه طوری که هر عضو جامعه یه شانس مشخص، و ترجیحاً برابر، برای انتخاب شدن داشته باشه. این نسخه‌ی آماریِ هم زدن قابلمه‌ست. اون‌وقت نمونه معمولاً شبیه جامعه درمیاد، و خطاهایی که می‌مونن تکون‌های کوچیکِ شانسی‌ان که بهشون می‌گن خطای نمونه‌گیری (sampling error) و اندازه‌شون قابل پیش‌بینیه. درس ۵ اندازه‌ش رو می‌گیره.

نمونه‌های تصادفیِ ۱۰۰ نفره از شهر ما ۳۸٪، ۴۳٪، ۴۰٪ و ۴۱٪ دادن، وقتی عدد واقعی ۴۰٪ بود: هیچ‌وقت دقیق نه، همیشه نزدیک.

خودت رو امتحان کن

با اینکه میلیون‌ها جواب داشت، چی باعث شد نظرسنجی Literary Digest سال ۱۹۳۶ اشتباه کنه؟

  1. تعداد جواب‌ها خیلی کم بود
  2. یه نمونه‌ی سوگیرانه: اینکه کی توی فهرست‌هاش بود، و کی خودش خواست جواب بده
  3. رأی‌دهنده‌های روزولت به مجله دروغ گفتن
  4. مجله رأی‌ها رو اشتباه جمع زد
جواب رو ببین

یه نمونه‌ی سوگیرانه: اینکه کی توی فهرست‌هاش بود، و کی خودش خواست جواب بده

درسته. فهرست‌هاش به سمت آدم‌های پولدارتر کج بود، و کسایی که جواب دادن هم باز فرق داشتن. میلیون‌ها جواب از یه گوشه‌ی کج، باز یه جواب کج می‌ده.

خودگزینی (Self-selection)

سوگیری · نظرسنجی

وقتی آدم‌ها خودشون انتخاب می‌کنن که توی نمونه باشن یا نه. نظرسنجی‌های آنلاین، رأی‌گیری‌های تلفنی و فرم‌های «به ما امتیاز بده» بیشتر صدای پرانگیزه‌ترها، خیلی راضی‌ها یا خیلی عصبانی‌ها رو می‌شنون. نتیجه‌شون کسایی رو توصیف می‌کنه که جواب دادن، نه مردم رو. این یه نوع سوگیری نمونه‌گیری (sampling bias)ـه: هر روشی که بعضی‌ها رو به بقیه ترجیح بده.

صفحه‌ی نظرهای یه رستوران پر از امتیاز ۱ و ۵ ستاره‌ست. اون همه مشتری‌ای که به نظرشون معمولی بود، به‌ندرت زحمت نوشتن چیزی رو به خودشون می‌دن.

خودت رو امتحان کن

اگه یه نمونه سوگیرانه باشه، دو برابر کردن اندازه‌ش سوگیری رو از بین می‌بره.

جواب رو ببین

نادرست

غلطه. آدم‌های بیشتر به همون روش، فقط همون کجی رو دقیق‌تر تکرار می‌کنن. پرسیدن از ۲۰۰ نفر توی همون گوشه‌ی پرچای، باز حدود ۷۰٪ می‌ده، نه ۴۰٪. فقط عوض کردنِ روشِ انتخاب، سوگیری رو درست می‌کنه.

دو سوگیری دیگه که ارزش اسم بردن دارن

عدم پاسخ (Non-response)

کسایی که جواب نمی‌دن با کسایی که جواب می‌دن فرق دارن. اگه پدر و مادرهای پرمشغله و کارگرهای شیفت شب هیچ‌وقت تلفن رو جواب ندن، نظرسنجی درباره‌ی وقت آزاد صدای کسایی رو می‌شنوه که بیشترین وقت آزاد رو دارن.

سوگیری بقا (Survivorship)

فقط اونایی رو می‌بینی که موندن. «ساختمون‌های قدیمی محکم‌تر ساخته می‌شدن» همه‌ی ساختمون‌های قدیمی‌ای رو که ریختن یا خراب شدن نادیده می‌گیره؛ فقط محکم‌ها هنوز سرپان که ازشون تعریف کنیم.

خودت رو امتحان کن

یه باشگاه از اعضای خودش نظرسنجی می‌کنه، می‌بینه ۹۰٪ هر هفته ورزش می‌کنن، و اعلام می‌کنه «۹۰٪ مردم این شهر هر هفته ورزش می‌کنن». اشکالش چیه؟

  1. هیچی، ۹۰٪ نتیجه‌ی روشنیه
  2. نمونه اعضای باشگاهن، نه جامعه‌ی شهر که ادعا می‌کنه توصیفش کرده
  3. باشگاه باید از اعضای کمتری می‌پرسید
  4. ورزش هفتگی رو نمی‌شه با نظرسنجی اندازه گرفت
جواب رو ببین

نمونه اعضای باشگاهن، نه جامعه‌ی شهر که ادعا می‌کنه توصیفش کرده

درسته. اعضای باشگاه دقیقاً همون کسایی‌ان که بیشتر از همه احتمال داره ورزش کنن. نتیجه شاید درباره‌ی اعضا درست باشه، ولی جامعه‌ای که ادعا درباره‌شه، یعنی همه‌ی مردم شهر، اصلاً نمونه‌گیری نشده.

چهار سؤال برای هر نظرسنجی

  1. از کی پرسیدن؟

    این گروه با جامعه‌ای که تیتر درباره‌ش حرف می‌زنه جوره، یا فقط یه گوشه‌شه؟

  2. چطور انتخاب شدن؟

    تصادفی، یا خودشون داوطلب شدن، روی یه لینک زدن یا اتفاقی اون دور و بر بودن؟

  3. چند نفر جواب دادن؟

    نرخ پاسخ پایین یعنی جواب‌ها شاید از یه تیکه‌ی غیرعادی از آدم‌هایی باشه که ازشون پرسیدن.

  4. کی جا مونده؟

    کسایی که اینترنت ندارن، کسایی که نموندن، کسایی که وقت جواب دادن نداشتن. ممکنه اونا جواب دیگه‌ای می‌دادن؟

مرور درس

  • جامعه یعنی همه‌ی کسایی که می‌خوای درباره‌شون بدونی؛ نمونه بخشیه که واقعاً اندازه می‌گیری.
  • نمونه‌ی تصادفی یه قاشق از سوپ هم‌زده‌ست: توی شهری که ۴۰٪ چای دوست دارن، نمونه‌های تصادفی ۱۰۰ نفره هر بار نزدیک ۴۰٪ درومدن.
  • سوگیری نمونه‌گیری، مثل پرسیدن فقط از یه گوشه، ۷۰٪ داد، و پرسیدن از آدم‌های بیشتر به همون روش درستش نمی‌کنه.
  • نظرسنجی Literary Digest سال ۱۹۳۶ حدود ۲٫۴ میلیون جواب داشت و باز برنده رو اشتباه گفت؛ بزرگی حریف سوگیری نشد.
  • حواست به خودگزینی، عدم پاسخ و سوگیری بقا باشه، و بپرس از کی پرسیدن، چطور، چند نفر جواب دادن و کی جا مونده.

فقط نخونش، نگهش دار

پث‌وایز هر ایده رو درست قبل از اینکه فراموشش کنی با یه سؤال کوتاه برمی‌گردونه. رایگان روی اندروید و وب، به فارسی و انگلیسی.

Cafe Bazaar Myket باز کردن نسخه‌ی وب

همه‌ی درس‌های این دوره

  1. میانگین، میانه و مد: سه جور «معدل» (Mean, Median, Mode)
  2. پراکندگی: چیزی که میانگین نمی‌گه (Spread)
  3. منحنی زنگوله‌ای (The Normal Curve)
  4. نمونه‌گیری: چشیدن سوپ (Sampling)
  5. حاشیه‌ی خطا: همون به‌علاوه‌منهای (Margin of Error)
  6. همبستگی، علیت نیست (Correlation vs Causation)
  7. نرخ پایه: عددی که همه یادشون می‌ره (Base Rates)
  8. درصد یا واحد درصد؟ خطر نسبی و مطلق (Percentage Points)
  9. نمودارهایی که گمراه می‌کنن (Misleading Charts)
  10. مقدار p به زبون ساده (P-values)
  11. خوندن یه پژوهش (Reading a Study)
  12. جمع‌بندی: خوندن یه تیتر (Reading a Headline)