پرش به محتوای اصلی

کار با داده های آماری (انسانی)

بخشی از بانک سؤال طبقه‌بندی‌شده‌ی این مبحث در کوئیز سنتر — رایگان و بدون نیاز به ثبت‌نام

خلاصه‌ی درسنامه

این خلاصه‌ی 30 درصدی درسنامه اصلی است. متن کامل با همه‌ی نکته‌ها، مثال‌های حل‌شده و جمع‌بندی، با ثبت‌نام رایگان در دسترست قرار می‌گیرد.

مفاهیم پایهٔ آمار

آمار = مطالعهٔ گردآوری، سازمان‌دهی، تحلیل و تفسیر داده‌ها برای تصمیم‌گیری در شرایط عدم قطعیت.

مفهوم تعریف
واحد آماری هر فرد یا شیء مورد بررسی
جامعهٔ آماری کل واحدهای آماری
نمونه زیرمجموعه‌ای از جامعه با روش مشخص
نمونهٔ تصادفی نمونه‌ای که همهٔ اعضا شانس یکسان دارند — معرف واقعی جامعه است

متغیر یا کمّی (عددی، قابل محاسبه؛ مثل وزن، نمره) است یا کیفی (دسته‌بندی؛ مثل جنسیت، رشته) — کد دانش‌آموزی عدد است اما متغیر کیفی است چون جمع/تفریقش معنا ندارد.

پارامتر عددی است که جامعه را توصیف می‌کند (ثابت ولی اغلب ناشناخته)؛ آماره عددی است که نمونه را توصیف می‌کند (از نمونه به نمونه تغییر می‌کند). چون اندازه‌گیری پارامتر معمولاً غیرممکن یا گران است، از آماره برای تخمین آن استفاده می‌شود.

روش‌های گردآوری داده: مشاهده (شمارش ترافیک، وزن محصول)، پرسش‌نامه (نظرسنجی گسترده)، مصاحبه (موضوعات پیچیده)، دادگان (اطلاعات ثبت‌شدهٔ موجود). سرشماری یعنی بررسی همهٔ جامعه؛ به‌دلیل هزینه، زمان‌بر بودن و غیرممکن‌بودن در بررسی‌های مخرب (مثل تست کیفیت محصول)، معمولاً از نمونه استفاده می‌شود.

مقیاس‌های اندازه‌گیری: اسمی (فقط نام‌گذاری) و ترتیبی (قابل مرتب‌کردن) هر دو کیفیاند؛ فاصله‌ای (صفر قراردادی، مثل دما) و نسبتی (صفر واقعی، مثل وزن) هر دو کمّیاند. تفاوت کلیدی: در مقیاس نسبتی می‌توان گفت «دو برابر» (وزن ۸۰ دو برابر ۴۰ است) اما در فاصله‌ای نه (نمی‌توان گفت ۲۰ درجه دو برابر ۱۰ درجه گرم‌تر است).


معیارهای گرایش به مرکز

میانگین: xˉ=xin\bar{x}=\dfrac{\sum x_i}{n} — به دادهٔ دورافتاده بسیار حساس است. مثال: در درآمدهای ۱۲، ۲۲، ۲۵، ۲۸، ۳۰، ۳۲، ۴۰ (میلیون ریال)، میانگین ۲۷ است؛ با ورود یک میلیاردر با درآمد ۱۰۰۰، میانگین به حدود ۱۴۸ می‌رسد — عددی کاملاً غیرواقعی.

میانه: دادهٔ وسطی پس از مرتب‌سازی؛ برای nn فرد، جایگاه n+12\tfrac{n+1}{2}؛ برای nn زوج، میانگین دو دادهٔ میانی. میانه به دورافتاده مقاوم است.

مُد: پرتکرارترین داده؛ ممکن است چند مُد یا هیچ مُد وجود نداشته باشد؛ برای داده‌های کیفی تنها معیار قابل‌استفاده است.

کِی از کدام؟ داده‌های عادی ← میانگین؛ وجود دورافتاده ← میانه؛ داده‌های کیفی ← مُد. استثنا: در بودجه‌ریزی حتی با وجود دورافتاده باید از میانگین استفاده کرد (مثال: هزینهٔ جراحی با میانگین ۵۳ و میانهٔ ۳۲.۵ میلیون ریال — بودجه باید بر مبنای میانگین بسته شود، وگرنه کسری می‌آید).

میانگین موزون: xˉw=wixiwi\bar{x}_w=\dfrac{\sum w_i x_i}{\sum w_i} — معدل کارنامه با واحدهای درسی مختلف نمونهٔ آن است.


معیارهای پراکندگی

دو مجموعه می‌توانند میانگین یکسان اما پراکندگی کاملاً متفاوت داشته باشند — پس میانگین به‌تنهایی کافی نیست.

انحراف معیار:

σ=(xixˉ)2n\sigma = \sqrt{\frac{\sum (x_i-\bar{x})^2}{n}}

اگر همهٔ داده‌ها برابر باشند، σ=0\sigma=0. واریانس (σ2\sigma^2) مربع انحراف معیار است.

قانون منحنی نرمال (۶۸-۹۶-۹۹.۷): حدود ۶۸٪ داده‌ها در بازهٔ یک انحراف معیار، ۹۶٪ در دو انحراف معیار و ۹۹.۷٪ در سه انحراف معیار از میانگین قرار دارند.

دامنهٔ میان‌چارکی: وقتی دادهٔ دورافتاده داریم، انحراف معیار مثل میانگین گمراه‌کننده می‌شود؛ به‌جایش:

IQR=Q3Q1\boxed{IQR = Q_3 - Q_1}

که Q1Q_1 میانهٔ نیمهٔ پایینی و Q3Q_3 میانهٔ نیمهٔ بالایی داده‌هاست؛ دقیقاً ۵۰٪ داده‌ها بین Q1Q_1 و Q3Q_3 قرار دارند.

جدول تصمیم نهایی:

وضعیت داده گرایش به مرکز پراکندگی
عادی میانگین انحراف معیار
دورافتاده وجود دارد میانه IQRIQR

ضریب تغییرات (فراتر از کتاب): وقتی دو مجموعه واحد یا میانگین متفاوت دارند، انحراف معیار به‌تنهایی قابل مقایسه نیست:

CV=σxˉ×100%CV = \frac{\sigma}{\bar{x}} \times 100\%

مثلاً کلاسی با xˉ=50,σ=10\bar{x}=50,\sigma=10 همان پراکندگی نسبی کلاسی با xˉ=100,σ=20\bar{x}=100,\sigma=20 را دارد (هر دو CV=20%CV=20\%).

نمونه تست

پاسخنامه‌ی تحلیلی سه‌بخشی برای هر سؤال

  • چرا گزینه‌ی درست، درست است
  • چرا هر گزینه‌ی دیگر غلط است
  • تله‌ی تستی‌ای که باید بشناسی

1. اگر به داده‌های 12,22,25,28,30,32,4012,22,25,28,30,32,40 عدد 10001000 افزوده شود، کدام معیار کمتر تغییر می‌کند؟

  • میانه
  • واریانس
  • میانگین موزون
  • میانگین

پاسخنامه‌ی تحلیلی

میانهٔ داده‌های اولیه (n=7n=7) دادهٔ چهارم یعنی 2828 است. با افزودنِ 10001000 تعداد به 88 می‌رسد و میانه میانگینِ دادهٔ چهارم و پنجم می‌شود: 28+302=29\frac{28+30}{2}=29؛ یعنی فقط 11 واحد تغییر. وارسیِ مستقل: میانگین از 1897=27\frac{189}{7}=27 به 11898=148.625\frac{1189}{8}=148.625 می‌پرد — بیش از 120120 واحد تغییر؛ پس میانه آشکارا کم‌تغییرترین است. «میانگین» رد می‌شود چون دقیقاً همان محاسبهٔ بالا نشان داد بیش از 120120 واحد جابه‌جا می‌شود؛ میانگین **مقدارِ** هر داده را وارد فرمول می‌کند، پس یک دادهٔ غول‌پیکر آن را می‌کشد. «واریانس» رد می‌شود چون اختلافِ داده‌ها از میانگین را هم مجذور می‌کند و در نتیجه از میانگین هم به دورافتاده حساس‌تر است. «میانگین موزون» رد می‌شود چون آن هم مانندِ میانگینِ ساده مقدارِ هر داده را (این‌بار با ضریب) در محاسبه وارد می‌کند و به دادهٔ 10001000 حساس است؛ ضمناً در این سؤال اصلاً وزنی تعریف نشده. تلهٔ تستی: میانه و چارک‌ها فقط به **رتبهٔ** داده‌ها نگاه می‌کنند نه مقدارشان؛ به همین دلیل چه دادهٔ افزوده 10001000 باشد چه یک میلیون، اثرش روی میانه یکسان و ناچیز است.

2. اگر در داده‌ها یک عدد بسیار بزرگ وارد شود، معمولاً کدام معیار بیشتر آسیب می‌بیند؟

  • چارک دوم
  • مد
  • میانه
  • میانگین

پاسخنامه‌ی تحلیلی

میانگین از مجموعِ **مقادیرِ** داده‌ها ساخته می‌شود، پس ورودِ یک عددِ بسیار بزرگ مستقیماً مجموع را بالا می‌برد و میانگین را به سمتِ خود می‌کشد؛ بیشترین آسیب به میانگین می‌رسد. وارسیِ مستقل: در مجموعهٔ 1,2,31,2,3 میانگین 22 و میانه 22 است؛ با افزودنِ 10001000 میانگین به 10064=251.5\frac{1006}{4}=251.5 می‌پرد ولی میانه فقط از 22 به 2.52.5 می‌رود. «مد» رد می‌شود چون مد پرتکرارترین مقدار است و یک دادهٔ **تک** هرچقدر بزرگ باشد فراوانیِ 11 دارد و مد را عوض نمی‌کند. «میانه» رد می‌شود چون بر پایهٔ رتبه است و دادهٔ بزرگ فقط یک رتبه در انتهای فهرست اشغال می‌کند. «چارک دوم» رد می‌شود چون Q2Q_2 نامِ دیگرِ همان میانه است و دقیقاً به همان دلیل مقاوم می‌ماند. تلهٔ تستی: معیارهای مبتنی بر مقدار (میانگین، واریانس، انحراف‌معیار) به دورافتاده حساس‌اند و معیارهای مبتنی بر رتبه (میانه، چارک، IQRIQR) مقاوم؛ «چارکِ دوم» همان میانه است و نباید معیارِ جداگانه پنداشته شود.

3. اگر نمره‌ها 16,15,18,1716,15,18,17 باشند و نمره آخر ضریب 33 داشته باشد، میانگین موزون تقریباً کدام است؟

  • 16.6716.67
  • 17.2517.25
  • 16.1716.17
  • 16.5016.50

پاسخنامه‌ی تحلیلی

نمرهٔ آخر (1717) ضریبِ 33 دارد و سه نمرهٔ دیگر ضریبِ 11. صورتِ کسر مجموعِ (ضریب × نمره) است: 16+15+18+3×17=16+15+18+51=10016+15+18+3\times17=16+15+18+51=100؛ مخرج مجموعِ ضریب‌هاست: 1+1+1+3=61+1+1+3=6. پس میانگینِ موزون =100616.67=\dfrac{100}{6}\approx16.67. وارسیِ مستقل: میانگینِ سادهٔ چهار نمره 664=16.5\frac{66}{4}=16.5 است؛ چون نمرهٔ 1717 (بالاتر از 16.516.5) وزنِ بیشتری گرفته، جواب باید کمی بالاتر از 16.516.5 و کمتر از 1717 باشد — و 16.6716.67 دقیقاً در همین بازه است. «16.1716.17» رد می‌شود چون از تقسیمِ 9797 (جاافتادنِ یکی از سهم‌ها) بر 66 می‌آید. «16.5016.50» رد می‌شود چون همان میانگینِ سادهٔ بدونِ وزن است. «17.2517.25» رد می‌شود چون از تقسیمِ 1004\frac{100}{4} یعنی استفاده از تعدادِ نمرات به‌جایِ مجموعِ ضریب‌ها در مخرج نتیجه می‌شود. تلهٔ تستی: مخرجِ میانگینِ موزون مجموعِ **وزن‌ها** (66) است، نه تعدادِ داده‌ها (44).

4. در مجموعه‌ای با میانگین 1515 و 66 داده، اگر مجموع پنج داده اول 6868 باشد، داده ششم کدام است؟

  • 2020
  • 2121
  • 2222
  • 2323

پاسخنامه‌ی تحلیلی

مجموعِ هر شش داده برابرِ xˉ×n=15×6=90\bar{x}\times n=15\times6=90 است. مجموعِ پنج دادهٔ اول 6868 داده شده، پس دادهٔ ششم =9068=22=90-68=22. وارسیِ مستقل: با افزودنِ 2222 به 6868 مجموع 9090 می‌شود و 90÷6=1590\div6=15 — همان میانگینِ صورتِ سؤال. «2020» رد می‌شود چون مجموع را به 8888 می‌رساند و میانگین 88614.67\frac{88}{6}\approx14.67 می‌شود، نه 1515. «2121» رد می‌شود چون مجموع 8989 و میانگین 14.83\approx14.83 می‌شود. «2323» رد می‌شود چون مجموع 9191 و میانگین 15.17\approx15.17 می‌شود. تلهٔ تستی: ابتدا باید مجموعِ کل را از میانگین بازسازی کرد (15×615\times6) و بعد تفریق کرد؛ تقسیمِ مستقیمِ 6868 بر 55 و مقایسه با 1515 مسیرِ اشتباهی است.

5. در داده‌های عادی و بدون دورافتاده، کدام جفت معیار مناسب‌تر است؟

  • چارک اول و سوم
  • مد و برد
  • میانه و IQRIQR
  • میانگین و انحراف معیار

پاسخنامه‌ی تحلیلی

وقتی داده‌ها عادی‌اند و دورافتاده ندارند، هیچ‌چیز میانگین را نمی‌کشد و انحراف‌معیار هم گمراه نمی‌شود؛ در این حالت این دو معیار بهترین‌اند چون از **همهٔ** داده‌ها استفاده می‌کنند و اطلاعاتِ بیشتری نسبت به معیارهای رتبه‌ای در خود دارند. وارسیِ مستقل: در داده‌های 10,12,14,16,1810,12,14,16,18 میانگین (1414) و میانه (1414) یکی‌اند، پس میانه هیچ مزیتی ندارد درحالی‌که میانگین مجموعِ واقعی را هم نگه می‌دارد. «میانه و IQRIQR» رد می‌شود چون این جفت برای حالتِ **دارایِ دورافتاده** توصیه می‌شود؛ در دادهٔ عادی به بهایِ مقاومتِ غیرِلازم، بخشی از اطلاعاتِ داده‌ها را دور می‌ریزد. «مد و برد» رد می‌شود چون مد برای دادهٔ کمّیِ پیوسته اغلب بی‌معناست و برد فقط به دو دادهٔ انتهایی نگاه می‌کند و ناپایدارترین معیارِ پراکندگی است. «چارک اول و سوم» رد می‌شود چون این دو **مکان‌نما** هستند نه یک جفتِ «مرکز + پراکندگی»؛ سؤال یک معیارِ مرکز و یک معیارِ پراکندگی می‌خواهد. تلهٔ تستی: قاعده دو شاخه دارد — دادهٔ عادی ⟵ میانگین و انحراف‌معیار؛ دادهٔ دارایِ دورافتاده ⟵ میانه و IQRIQR. برعکس‌کردنِ این دو شاخه رایج‌ترین خطای این مبحث است.

6. اگر مقدار یک داده از میانگین 2σ2\sigma کم‌تر باشد، zz آن کدام است؟

  • 11
  • 22
  • 2-2
  • 1-1

پاسخنامه‌ی تحلیلی

نمرهٔ استاندارد از رابطهٔ z=xxˉσz=\dfrac{x-\bar{x}}{\sigma} به دست می‌آید. «کم‌تر بودنِ داده از میانگین به‌اندازهٔ 2σ2\sigma» یعنی xxˉ=2σx-\bar{x}=-2\sigma، پس z=2σσ=2z=\dfrac{-2\sigma}{\sigma}=-2. وارسیِ مستقل: با اعدادِ نمونه، اگر xˉ=50\bar{x}=50 و σ=5\sigma=5 باشد، دادهٔ موردنظر 5010=4050-10=40 است و z=40505=2z=\frac{40-50}{5}=-2 — مستقل از مقدارِ xˉ\bar{x} و σ\sigma همان 2-2 می‌شود. «1-1» رد می‌شود چون متناظرِ فاصلهٔ یک انحراف‌معیاری زیرِ میانگین است، نه دو. «11» رد می‌شود چون هم اندازه‌اش اشتباه است و هم علامتش (یک انحراف‌معیار **بالایِ** میانگین). «22» رد می‌شود چون اندازهٔ درست ولی علامتِ برعکس دارد؛ داده‌ای که زیرِ میانگین است حتماً zz منفی دارد. تلهٔ تستی: علامتِ zz جهتِ داده نسبت به میانگین را نشان می‌دهد — منفی یعنی زیرِ میانگین؛ حذفِ علامت شایع‌ترین خطای این نوع سؤال است.

7. اگر دو کلاس به‌ترتیب (xˉ=50,σ=10)(\bar{x}=50,\sigma=10) و (xˉ=100,σ=20)(\bar{x}=100,\sigma=20) داشته باشند، کدام درست است؟

  • پراکندگی نسبی کلاس اول بیش‌تر است
  • پراکندگی نسبی دو کلاس برابر است
  • بدون دانستن میانه نمی‌توان مقایسه کرد
  • پراکندگی نسبی کلاس دوم بیش‌تر است

پاسخنامه‌ی تحلیلی

برای مقایسهٔ پراکندگیِ **نسبی** باید ضریبِ تغییرات (CV=σ/xˉCV=\sigma/\bar{x}) را سنجید: CV1=1050=0.2CV_1=\dfrac{10}{50}=0.2 و CV2=20100=0.2CV_2=\dfrac{20}{100}=0.2. چون این دو دقیقاً برابرند، پراکندگیِ نسبیِ دو کلاس یکسان است. وارسیِ مستقل: کلاسِ دوم هم میانگین و هم انحراف‌معیارش دقیقاً دو برابرِ کلاسِ اول است؛ چنین مقیاس‌گذاریِ یکنواختی نسبت را تغییر نمی‌دهد، پس CVCV باید ثابت بماند. «پراکندگی نسبی کلاس دوم بیش‌تر است» رد می‌شود چون فقط انحراف‌معیارِ خامِ بزرگ‌ترِ آن (2020 در برابرِ 1010) را می‌بیند و میانگینِ دو برابرش را نادیده می‌گیرد. «پراکندگی نسبی کلاس اول بیش‌تر است» رد می‌شود چون محاسبه دقیقاً برابری را نشان داد و هیچ برتری‌ای برای کلاسِ اول وجود ندارد. «بدون دانستن میانه نمی‌توان مقایسه کرد» رد می‌شود چون فرمولِ CVCV فقط به میانگین و انحراف‌معیار نیاز دارد و میانه اصلاً در آن ظاهر نمی‌شود. تلهٔ تستی: انحراف‌معیارِ بزرگ‌تر لزوماً پراکندگیِ نسبیِ بیشتر نیست؛ هرگاه میانگینِ دو مجموعه متفاوت باشد، مقایسهٔ مستقیمِ σ\sigma بی‌اعتبار است و باید به CVCV رجوع کرد.

8. کدام گزینه درباره آمار توصیفی درست است؟

  • شامل میانگین، میانه، مد، انحراف معیار و IQRIQR است
  • به استنباط درباره جامعه محدود است
  • فقط برای داده‌های کیفی به‌کار می‌رود
  • فقط میانگین را شامل می‌شود

پاسخنامه‌ی تحلیلی

آمارِ توصیفی یعنی خلاصه‌کردن و توصیفِ همان داده‌های در دست؛ ابزارهای آن هم معیارهای مرکز (میانگین، میانه، مد) و هم معیارهای پراکندگی (انحراف‌معیار، IQRIQR) و هم جدول و نمودار را در بر می‌گیرد. وارسیِ مستقل: هیچ‌یک از این معیارها ادعایی دربارهٔ جامعهٔ بیرون از داده‌ها نمی‌کند، پس همگی در قلمروِ توصیفی می‌مانند؛ همین مرزِ «تعمیم‌ندادن» است که توصیفی را از استنباطی جدا می‌کند. «فقط میانگین را شامل می‌شود» رد می‌شود چون میانگین تنها یکی از چند معیارِ توصیفی است و به‌تنهایی حتی پراکندگی را نشان نمی‌دهد. «به استنباط درباره جامعه محدود است» رد می‌شود چون این دقیقاً تعریفِ آمارِ **استنباطی** است، یعنی شاخهٔ مقابلِ توصیفی. «فقط برای داده‌های کیفی به‌کار می‌رود» رد می‌شود چون بیشترِ ابزارهای توصیفی (میانگین، واریانس، چارک) اساساً برای دادهٔ کمّی تعریف شده‌اند. تلهٔ تستی: ملاکِ تشخیصِ توصیفی/استنباطی «تعمیم‌یافتن یا نیافتنِ نتیجه به جامعه» است، نه پیچیدگیِ محاسبات؛ حتی با سرشماریِ کامل هم می‌توان صرفاً آمارِ توصیفی تولید کرد.

9. اگر در یک جامعه، اندازه‌گیری همه افراد ممکن اما بسیار پرهزینه باشد، مناسب‌ترین راه چیست؟

  • استفاده از نمونه و آماره برای تخمین
  • تبدیل متغیرها به کیفی
  • استفاده از مد به‌جای همه معیارها
  • انصراف از تحلیل

پاسخنامه‌ی تحلیلی

پاسخِ درست «استفاده از نمونه و آماره برای تخمین» است؛ وقتی اندازه‌گیریِ کاملِ جامعه ممکن ولی بسیار پرهزینه است، از آماره‌ی به‌دست‌آمده از یک نمونهٔ تصادفی برای تخمینِ پارامتر استفاده می‌شود. «انصراف از تحلیل» تصمیم‌گیری را متوقف می‌کند؛ «تبدیل متغیرها به کیفی» ربطی به مسئلهٔ هزینه ندارد؛ «استفاده از مد به‌جای همه معیارها» یک جایگزینِ اختیاری برای معیارِ مرکزی است، نه راه‌حلِ مسئلهٔ هزینهٔ گردآوری. تلهٔ تستی: بزرگ‌بودنِ نمونه یا سهل‌الوصول‌بودنِ افراد جایگزینِ «تصادفی‌بودن» نیست؛ نمونه‌ای معرفِ جامعه است که با روشِ تصادفی (شانسِ برابر برای همه) انتخاب شده باشد، وگرنه حتی نمونهٔ بزرگ هم می‌تواند تورش داشته باشد.

10. اگر داده‌های مرتب‌شده 4,6,8,10,12,14,16,184,6,8,10,12,14,16,18 باشند، میانه کدام است؟

  • 1111
  • 1212
  • 99
  • 1010

پاسخنامه‌ی تحلیلی

داده‌ها مرتب‌اند و n=8n=8 (زوج)، پس میانه میانگینِ دو دادهٔ میانی یعنی چهارمی و پنجمی است: 10+122=11\dfrac{10+12}{2}=11. وارسیِ مستقل: باید چهار داده زیرِ میانه و چهار داده بالایِ آن باشند — 4,6,8,104,6,8,10 زیرِ 1111 و 12,14,16,1812,14,16,18 بالایِ آن؛ شمارش درست است. «99» رد می‌شود چون میانگینِ دادهٔ سوم و چهارم (8+102\frac{8+10}{2}) است، یعنی یک رتبه زودتر شمرده شده. «1010» رد می‌شود چون فقط دادهٔ چهارم است و از دادهٔ پنجم صرف‌نظر شده. «1212» رد می‌شود چون فقط دادهٔ پنجم است و همان خطا از سمتِ دیگر تکرار شده. تلهٔ تستی: در تعدادِ زوجِ داده، دو دادهٔ میانی جای‌های n2\frac{n}{2} و n2+1\frac{n}{2}+1 یعنی چهارم و پنجم‌اند؛ میانه میانگینِ آن دو است و معمولاً عضوِ خودِ مجموعه نیست.

مباحث مرتبط

ادامه‌ی این مبحث رو ببین

با ثبت‌نام رایگان، به بانک کامل سؤال، شبیه‌ساز کنکور و تحلیل پیشرفت دسترسی داری

ثبت‌نام رایگان