למה אנחנו רוצים סקר עם "מדגם מייצג"? (פוסט על שגיאות שאפשר ושאי-אפשר להציג)

תשובה: כי סקר עם מדגם לא מייצג צפוי לתת תוצאה לא אמינה לגבי תוצאות האמת של הבחירות.

לפני שנמשיך לדווח על סקרים ומטא-סקרים, ברשותכם רציתי לעשות קצת סדר בנושא של "מדגם מייצג ואקראי" ולנסות להסביר אותו (מה שמכונה בשפה הסטטיסטית "הטייה"). נתחיל בקריקטורה מתאימה מהבלוג המקסים דברים שקרו באמת:

Servey1500

מעבר לכך שהקריקטורה מאד חמודה, היא מציגה מצב שבו הסקר מבוצע על האוכלוסייה שלא מייצגת את אזרחי ישראל (אלא רק את חתולי ישראל).

גם בסקרי בחירות עלול מצב כזה (של דגימת אוכלוסיה לא מייצגת) להתרחש, אם הסוקר מתקשה להגיע לאוכלוסייה הצעירה, הערבית, החרדית וכן הלאה (לדוגמא, כי אין לו אפשרות לחייג לטלפונים סלולרים של צעירים, או כי קשה לראיין את האוכלוסיה הערבית ללא סוקר שדובר ערבית).

באופן כללי, בסקרי בחירות יש שני סוגים עיקריים של טעויות סטטיסטיות: טעויות "הטייה" (bias) וטעויות "שונות" (variance). המצב שמוצג בקריקטורה הוא של טעות הטייה. כעת נרחיב קצת על שתי הטעויות.

להמשיך לקרוא למה אנחנו רוצים סקר עם "מדגם מייצג"? (פוסט על שגיאות שאפשר ושאי-אפשר להציג)