فصل 20 مدل های خطی تعمیم یافته I: شمارش داده ها

ساخت وبلاگ

زیست شناسان اغلب موارد را شمارش می کنند و آزمایش هایی را برای تخمین تأثیر عوامل مختلف بر این شمارش ها طراحی می کنند. به عنوان مثال، اثرات جیوه محیطی بر اندازه کلاچ در یک پرنده، اثرات گرم شدن بر بار انگل در ماهی، یا تاثیر ورزش بر بیان RNA.

داده های شمارش از بسیاری جهات با داده های دارای خطای معمولی متفاوت است، از جمله 1) شمارش ها گسسته هستند و فقط می توانند اعداد صحیح صفر یا مثبت باشند، 2) شمارش ها در سمت کوچک محدوده جمع می شوند و توزیعی با یک انحراف مثبت ایجاد می کنند.، 3) نمونه ای از شمارش ها می تواند دارای فراوانی صفر باشد و 4) واریانس شمارش ها با میانگین افزایش می یابد (شکل 20. 1 را برای برخی از این ویژگی ها ببینید). برخی از داده های شمارش را می توان با یک توزیع نرمال تقریب زد و به طور منطقی با یک مدل خطی مدل کرد، اما اغلب، داده های شمارش با توزیع پواسون یا توزیع دو جمله ای منفی با استفاده از یک مدل خطی تعمیم یافته (GLM) مدل می شوند. توزیع های دوجمله ای پواسون و منفی توزیع های احتمال گسسته با دو ویژگی مهم هستند: 1) توزیع فقط شامل اعداد صحیح صفر و مثبت است و 2) واریانس تابعی از میانگین است. قبل از محاسبات مدرن و پردازنده های سریع، داده های شمارش اغلب با تبدیل پاسخ یا با آزمون های فرضیه ناپارامتریک تجزیه و تحلیل می شد. یکی از دلایل ترجیح رویکرد مدل سازی آماری با GLM این است که می توانیم تخمین های پارامتر قابل تفسیر را بدست آوریم. در مقابل، هم تجزیه و تحلیل داده های تبدیل شده و هم آزمون های فرضیه ناپارامتریک واقعاً ابزارهایی برای محاسبه مقادیر «صحیح» (p) هستند.

Histogram of the count of a trematode parasite larvae in Control vs. Infected fish. Fish in the Infected treatment are infected with a tapeworm.

شکل 20. 1: هیستوگرام شمارش لارو انگل ترماتود در ماهی شاهد در مقابل ماهی آلوده. ماهی های موجود در تیمار Infected با کرم نواری آلوده می شوند.

20. 1 مدل خطی تعمیم یافته

همانطور که در بخش [مفروضات برای استنباط با مدل های آماری] در فصل 1 بیان شد، روش رایجی که محققان زیست شناسی در مورد یک متغیر پاسخ فکر می کنند این است.

[x08egin y_i &= x08eta_0 + x08eta_1 x_i + varepsilon_i \ varepsilon &sim N(0, sigma) ag end]

یعنی ما می توانیم به عنوان مجموع برخی از قسمت های سیستماتیک و "خطای تصادفی" ، که یک قرعه کشی تصادفی از یک توزیع عادی با میانگین صفر و واریانس ( sigma^2 ) است ، پاسخ دهیم. این روش تفکر در مورد تولید پاسخ برای مدل های خطی و مدل های خطی بررسی مدل مفید است ، اما برای مدل های خطی عمومی یا مدل های بررسی شده مدل های عمومی مفید نیست. به عنوان مثال ، اگر می خواهیم تعداد انگل هایی را که با استفاده از توزیع پواسون ، ماهی آلوده کرده اند مدل کنیم ، موارد زیر روش اشتباهی برای فکر کردن در مورد مدل آماری است

[ شروع y_i & = beta_0 + beta_1 x_i + varepsilon_i \ varepsilon & sim poisson ( lambda) tag end ]

یعنی ما نباید از شمارش به عنوان مجموع یک قسمت سیستماتیک و یک قرعه کشی تصادفی از توزیع پواسون فکر کنیم. چرا؟از آنجا که این تعداد (یا شمارش مشروط بر (x )) است که پواسون توزیع می شود ، نه باقیمانده از مدل FIT.

فکر کردن در مورد توزیع داده های شمارش با استفاده از مدل (20. 2) منجر به عواقب پوچ می شود. به عنوان مثال ، اگر میانگین "خطای" پواسون را به صفر تنظیم کنیم (مانند توزیع عادی) ، آنگاه اصطلاح خطا برای هر مشاهده باید صفر باشد (زیرا تنها راه برای بدست آوردن میانگین صفر با غیراعداد صحیح منفی اگر هر مقدار صفر باشد). یا اگر این مطالعه در حال مدل سازی تأثیر یک درمان بر روی شمارش (یعنی (x ) متغیرهای ساختگی باشد) آنگاه ( beta_0 ) میانگین تعداد مورد انتظار گروه کنترل (یا مرجع) است. اما اگر خطای غیر صفر پواسون را به این امر اضافه کنیم ، میانگین گروه کنترل بزرگتر از ( beta_0 ) خواهد بود. این معنی نداردو سرانجام ، معادله (20. 2) به جای یک عدد صحیح ، پاسخ مداوم ایجاد می کند ، زیرا ( beta_0 ) و ( beta_1 ) مداوم هستند.

یک روش بهتر برای فکر کردن در مورد تولید داده برای یک مدل خطی ، زیرا این امر به طور طبیعی منجر به روش صحیح فکر کردن در مورد تولید داده ها برای یک مدل خطی عمومی می شود ،

[ شروع y_i & sim n ( mu_i ، sigma) \ mathrm (y | x) & = mu \ mu_i & = beta_0 + beta_1 x_i tag end ]

یعنی یک پاسخ یک قرعه کشی تصادفی از توزیع عادی با میانگین (mu ) (صفر!) و واریانس ( sigma^2 ) است. خط 1 قسمت تصادفی این مشخصات است. خط 3 قسمت سیستماتیک است.

مشخصات یک مدل خطی عمومی دارای قطعات تصادفی و منظم است اما قسمت سوم را اضافه می کند که این یک تابع پیوند است که قطعات تصادفی و منظم را به هم متصل می کند.

  1. قسمت تصادفی ، که یک توزیع احتمال از خانواده نمایی است (این گاهی اوقات "قسمت تصادفی" نامیده می شود) [ شروع y_i sim mathrm ( mu_i) end ]
  2. قسمت سیستماتیک ، که یک پیش بینی کننده خطی است (من دوست دارم در مورد این به عنوان قسمت قطعی فکر کنم) [ start eta = mathbf boldsymbol end ]
  3. یک تابع پیوند که دو قسمت را به هم وصل می کند [ شروع eta_i = g ( mu_i) end ]

( mu ) (نماد یونانی mu) میانگین مشروط (یا انتظار ( mathrm (y | x) )) پاسخ در مقیاس پاسخ و ( eta ) (نماد یونانی eta است.) میانگین مشروط پاسخ در مقیاس پیوند است. GLM پاسخ با توزیع مشخص شده در قسمت تصادفی را مدل می کند. توزیع احتمال معرفی شده در این فصل پواسون و دوتایی منفی است. عملکرد پیوند طبیعی برای پواسون و binomial منفی "پیوند ورود به سیستم" ، ( eta = log ( mu) ) است. به طور کلی ، در حالی که هر توزیع دارای یک عملکرد پیوند طبیعی (یا "متعارف") است ، می توان از گزینه های دیگر استفاده کرد. با توجه به این تعریف از یک مدل خطی عمومی ، یک مدل خطی یک GLM با توزیع عادی و پیوند هویت است ( ( eta = mu )).

هنگامی که مدل سازی با استفاده از توزیع پواسون یا توزیع دوتایی منفی با پیوند ورود به سیستم شمارش می شود ، مقیاس پیوند خطی است و بنابراین اثرات در مقیاس پیوند افزودنی هستند ، در حالی که مقیاس پاسخ غیرخطی است (این نماینده مقیاس پیوند است) ، وبنابراین اثرات در مقیاس پاسخ چند برابر هستند. اگر اکنون این معنی ندارد ، نمونه ای در زیر آمده است. معکوس عملکرد پیوند ، پارامترها را از مقیاس پیوند به مقیاس پاسخ بازگرداند. بنابراین ، به عنوان مثال ، پیش بینی در مورد فروش پاسخ ( mathrm ( hat) ) است و ضریب در مقیاس پاسخ ( mathrm (b_j) ) است.

20. 2 تعداد داده ها به عنوان مثال - تعداد لاروهای کرم ترماتود در چشم ماهی های استیپتپین استیک بک

مثال ، آزمایشی است که تأثیر عفونت انگل schistocephalus solidus در حساسیت عفونت از انگل دوم ، trematode diplostomum pseudospataceum ، در Threespine Stickleback Fish Gasterosteus Aculeatus 8 را اندازه گیری می کند. سطح درمان "کنترل" (در مقایسه با طوفان) ، "آلوده نشده" (در معرض طوفان اما در معرض آلوده) ، "ال جی آلوده" (در معرض و آلوده به جمعیت رشد کم کرم) و "HG آلوده" است.(در معرض و آلوده به جمعیت رشد بالای کرم شیرین). پاسخ تعداد لاروهای ترماتود در چشم (ترکیبی راست و چپ) از ماهی است. یک هیستوگرام شمارش در شکل 20. 1 برای کنترل و آلوده نشان داده شده است. سطح درمان جیوه.

20. 2. 1 استراتژی مدل سازی

NHST Blues-دانش آموزان غالباً توسط کتابهای درسی ، همکاران یا ادبیات تشویق می شوند تا تجزیه و تحلیل را با فرضیات "آزمایش" اول با آزمون های فرضیه شروع کنند-به عنوان مثال با استفاده از یک آزمون Shaprio-Wilks از عادی بودن به عنوان یک تصمیم تصمیم گیری برای تصمیم گیری در مورد استفاده از یک پارامتریاگر فرضیه تهی مانند آزمون من ویتنی U در صورت رد فرضیه تهی از نرمال بودن ، آزمون مانند (t )-آزمون یا ANOVA باشد. من در مورد این توصیه می کنم ، زیرا 1) این فیلتر پیش آزمون به طور خودکار ارزش (P ) را از آزمون فرضیه بی اعتبار می کند زیرا برای روش فیلتر تنظیم نمی شود ، 2) داده های واقعی فقط تقریباً طبیعی هستند و به عنوان (n (n)) افزایش ، یک آزمایش عادی هر مجموعه داده واقعی را رد می کند ، و 3) آزمون های فرضیه به هر حال نسبت به غیر طبیعی بودن بسیار قوی هستند.

به جای آزمایش فرضیات یک مدل با استفاده از آزمون های فرضیه رسمی قبل از قرار دادن مدل ، یک استراتژی بهتر این است که 1) یک مدل متناسب باشد ، و سپس 2) بررسی مدل با استفاده از توطئه های تشخیصی ، آمار تشخیصی و شبیه سازی.

با استفاده از این داده ها ، یک محقق به طور معمول یک GLM را با پواسون یا لینک توزیع دوتایی منفی و لینک قرار می دهد. در اینجا ، من با یک مدل خطی شروع می کنم تا تفسیر توطئه های تشخیصی با داده های غیر طبیعی را نشان دهم. من از مشخصات "مدل خطی" (معادله (20. 1)) استفاده می کنم زیرا توطئه های دیجوانوستیک برای بررسی مدل مدل خطی از باقیمانده مدل FIT استفاده می کند.

[ diplo _intense_i & = beta_0 + beta_1 uninfected_i + beta_2 آلوده _lg_i + beta_3 آلوده _hg_i + varepsilon_i \ varepsilon & sim n (0 ،

20. 2. 2 بررسی مدل I-یک طرح q-q معمولی

شکل 20. 2a هیستوگرام باقیمانده ها را از مدل خطی متناسب نشان می دهد. طرح نشان می دهد که باقیمانده ها در انتهای منفی دامنه جمع می شوند ، که نشان می دهد یک مدل با یک نتیجه مشروط به طور عادی توزیع شده (یا خطای عادی) به خوبی تقریب نمی یابد.

Diagnostic plots of stickleback parasite data. A) Distribution of the residuals of the fit linear model. B) Normal Q-Q plot of the residuals of the fit linear model.

شکل 20. 2: توطئه های تشخیصی داده های انگل استیک بک. الف) توزیع باقیمانده مدل خطی متناسب. ب) نمودار q-q طبیعی باقیمانده مدل خطی متناسب.

یک روش بهتر برای بررسی این موضوع با طرح q-q معمولی در شکل 20. 2b است که مقدار نمونه ها را برای یک متغیر در برابر مقادیر نظری آنها ترسیم می کند. اگر نتیجه مشروط توزیع عادی باشد ، نقاط تقریباً باید از خط پیروی کنند. در عوض ، برای داده های کرم ، نقاط در هر دو انتها بالاتر از خط هستند. در انتهای چپ (منفی) ، این بدان معنی است که ما شاهد منفی ترین مقادیر مورد انتظار نیستیم (مقادیر مشاهده شده مثبت تر از مقادیر نظری هستند). به یاد داشته باشید که این طرح از باقیمانده است ، اگر ما در مورد این موضوع به عنوان شمارش فکر کنیم ، این بدان معنی است که کوچکترین تعداد ما به اندازه ما انتظار می رود با توجه به میانگین و توزیع عادی ، کوچک نیستند. این نباید تعجب آور باشد - شمارش تا صفر است و تعداد آنها نمی تواند زیر صفر باشد. در انتهای مثبت ، مقادیر نمونه دوباره مثبت تر از مقادیر نظری هستند. با فکر کردن در مورد این موضوع ، این بدان معنی است که با توجه به میانگین و توزیع عادی ، بزرگترین شمارش بزرگتر از حد انتظار است. این الگوی دقیقاً همان چیزی است که ما از داده های شمارش انتظار داریم ، یا حداقل داده هایی را که با صفر مرز است ، شمارش کنید.

پمپ شهود-بیایید یک طرح q-q معمولی بسازیم. مقدار کمی (یا صدک) یک بردار از اعداد ، ارزش نقطه در یک درصد درصد مشخص است. میانه 50 ٪ کمی است. فاصله اطمینان 95 ٪ در مقدار 2. 5 ٪ و 97. 5 ٪ است. در یک طرح q-q معمولی ، ما می خواهیم مقادیر باقیمانده را در برابر مجموعه ای از مقادیر نظری ترسیم کنیم.

  1. برای به دست آوردن مقادیر مشاهده شده ، باقیمانده های مدل خطی متناسب را از منفی ترین تا مثبت ترین آنها رتبه بندی کنید - این مقدار شما هستند! به عنوان مثال ، اگر باقیمانده (n = 145 ) دارید ، نقطه 73th 50 ٪ کمی است.
  2. یک مقدار نظری از توزیع عادی می تواند با استفاده از عملکرد qnorm که مقادیر طبیعی را برای یک بردار مشخص از درصد باز می گرداند ، ساخته شود. از طرف دیگر ، می توان با استفاده از RNORM به طور تصادفی از نقاط (n ) نمونه گرفت. این موارد البته از مقدار نمونه ای استفاده می شود ، بنابراین فقط مقادیر نظری مورد انتظار را تقریبی می کنند ، اما من این را در اینجا اضافه می کنم زیرا ما از این روش در زیر استفاده می کنیم.

اکنون به سادگی مشاهده شده را در برابر مقادیر نظری ترسیم کنید. غالباً ، مقادیر استاندارد شده ترسیم می شوند. یک متغیر استاندارد دارای میانگین صفر و یک انحراف استاندارد از یک است و با 1) محاسبه وکتور در صفر با کم کردن میانگین از هر مقدار ، و 2) تقسیم هر مقدار با انحراف استاندارد بردار. تشخیص دهید که از آنجا که یک انحراف استاندارد تابعی از انحراف از میانگین است ، مهم نیست که ابتدا کدام یک از این عملیات انجام می شود. یک مقدار نظری استاندارد شده توسط qnorm (p ، میانگین = 0 ، SD = 1) مشخص شده است ، که پیش فرض است.

در زیر ، من مقادیر استاندارد مشاهده شده و نظری را در برابر بردار درصد (از 0 تا 100 ٪) ترسیم کرده ام. این طرح همچنین به خوبی نشان می دهد که چگونه باقیمانده داده های کرم از آنچه انتظار می رود در صورتی که این توزیع عادی داشته باشد ، منحرف می شوند. این طرح به خوبی نشان می دهد که منفی ترین رعایت های مشاهده شده به همان اندازه که انتظار می رود با توجه به توزیع عادی منفی نیستند ، که دوباره معنی دارد زیرا این امر حاکی از شمارش منفی است زیرا میانگین نزدیک به صفر است. و به خوبی نشان می دهد که با توجه به توزیع عادی ، مثبت ترین مقدار مشاهده شده مثبت تر از حد انتظار هستند ، باز هم این امر در داده های شمارش مناسب مناسب است. سرانجام ، طرح به خوبی نشان می دهد که میانه با توجه به توزیع عادی ، که در این میانگین قرار دارد ، کمتر از آنچه انتظار می رود مثبت است (یک شکاف مناسب تمایل دارد میانگین را به سمت راست مدیان بکشد).

20. 2. 3 بررسی طرح مدل II-مقیاس-مکان برای بررسی همجنسگرایان

یک مدل خطی همچنین فرض می کند که خطا دارای واریانس ثابت است (یعنی واریانس خطا تابعی از مقدار (x )) یا homoskedasticity نیست. مدل FIT را می توان با استفاده از یک طرح مقیاس در مقیاس ، برای homoskedasticity بررسی کرد ، که یک پراکندگی از ریشه مربع مثبت باقیمانده های استاندارد در برابر مقادیر مناسب 9 است. اگر باقیمانده ها یک توزیع عادی را تقریبی کنند ، یک خط رگرسیون از طریق پراکندگی باید نزدیک به افقی باشد. خط رگرسیون در طرح مقیاس-مکان از تناسب مدل خطی به داده های کرم ، افزایش متمایز در "مقیاس" (ریشه مربع باقیمانده های استاندارد) را با افزایش مقدار مناسب نشان می دهد ، که از داده هایی که انتظار می رودبه صورت طبیعی ، پواسون یا منفی توزیع شده است.

20. 2. 4 دو توزیع برای داده های شمارش - پواسون و دوتایی منفی

الگوی موجود در طرح q-q معمولی در شکل 20. 2b باید یکی را از مدل سازی داده ها با یک توزیع عادی دلسرد کند و در عوض داده ها را با توزیع جایگزین با استفاده از یک مدل خطی تعمیم یافته مدل کند. هیچ نقشه برداری منحصر به فرد بین نحوه تولید داده ها و توزیع خاص وجود ندارد ، بنابراین این تصمیم به آسانی فکر کردن در مورد مکانیسم تولید داده و سپس انتخاب توزیع "صحیح" آسان نیست. بخش 4. 5 در بولکر (XXX) خلاصه ای عالی از نحوه تفکر در مورد فرآیندهای تولید برای توزیع های مختلف در زمینه داده های زیست محیطی است. از آنجا که پاسخ در داده های کرم شمارش می شود ، ما باید توزیع را انتخاب کنیم که مقادیر عدد صحیح مانند پواسون یا دوتایی منفی را ایجاد کند.

  1. POISISON - توزیع پواسون توزیع احتمال تعداد وقایع برخی از چیزها (تخم مرغ ، انگل یا یک متن mRNA خاص) است که توسط فرآیندی تولید می شود که این کار را با سرعت ثابت در هر واحد تلاش می کند (مدت زمان یا فضا)واداین نرخ ثابت ( lambda ) است ، که انتظار است ، بنابراین ( mathrm (y) = mu = lambda ). از آنجا که نرخ در هر تلاش ثابت است ، واریانس یک متغیر پواسون برابر است با میانگین ، ( sigma^2 = mu = lambda ). شکل ؟؟سه نمونه از توزیع پواسون را با ( lambda ) تنظیم شده روی 1 ، 5 و 10 نشان می دهد. کمتری می شود و از نزدیک توزیع عادی تقریبی می کند و 2) احتمال فزاینده ای از جمله صفر (کمتر از 1 ٪ صفر در هنگام میانگین 5) دارد.

بنابراین ، توزیع پواسون برای داده های شمارش مفید است که در آن واریانس مشروط نزدیک به میانگین مشروط است. خیلی اوقات ، داده های شمارش بیولوژیکی به خوبی توسط توزیع پواسون تقریب نمی یابد زیرا واریانس یا کمتر از میانگین است ، نمونه ای از کمبود 10 یا بیشتر از میانگین ، نمونه ای از بیش از حد 11. توزیع مفید برای داده های شمارش با بیش از حد ، دوتایی منفی است.

  1. Binomial منفی - توزیع دوتایی منفی توزیع احتمال گسسته از تعداد موفقیت هایی است که قبل از تعداد مشخصی از خرابی ها رخ می دهد (K ) با توجه به احتمال (P ) موفقیت. این یک روش بسیار مفید برای تفکر در مورد مدل سازی داده های شمارش در زیست شناسی نیست. آنچه مفید است این است که توزیع دوتایی منفی می تواند به سادگی به عنوان روش مدل سازی یک فرآیند پواسون "بیش از حد اسپری" مورد استفاده قرار گیرد. میانگین یک متغیر دوتایی منفی ( mu = k frac است

    ) و واریانس ( sigma^2 = mu + mu^2/k ) است. به عنوان روشی برای مدل سازی یک متغیر پابیسون بیش از حد ، (k ) به عنوان یک پارامتر ** پراکندگی*کنترل میزان بیش از حد بیش از حد عمل می کند و می تواند هر مقدار واقعی و مثبت (نه فقط یک عدد صحیح مثبت) باشد ، از جمله مقادیر کمتر از 1.

 

20. 2. 5 متناسب با GLM با توزیع پواسون در داده های کرم

بیایید GLM را با توزیع پواسون در داده های کرم قرار دهیم. مدل است

[ diplo _intense_i & sim poisson ( mu_i) \ mathrm (خط اول مدل قسمت تصادفی است که بیان می کند به عنوان یک متغیر پواسون تصادفی با میانگین و واریانس ( mu ) (پارامتر نرخ ( lambda ) توزیع پواسون) مدل می شود.

  1. خط دوم بیان می کند که ( mu ) انتظار یا انتظار مشروط است
  2. خط سوم میانگین مشروط را در مقیاس لینک ( ( eta )) با میانگین مشروط در مقیاس پاسخ ( ( mu )) متصل می کند.
  3. خط چهارم پیش بینی کننده خطی است و شامل سه متغیر ساختگی است.
  4. به یاد داشته باشید که میانگین مشروط مقدار مورد انتظار/پیش بینی شده/متناسب/مدل شده در هنگام (x = x_i ) است.

20. 2. 6 بررسی مدل متناسب با شمارش داده ها

ما از مدل FIT برای بررسی 1 استفاده می کنیم. شباهت کلی توزیع های مشاهده شده و نظری 2. اگر توزیع مشاهده شده بیش از حد یا تحت فشار باشد 3. اگر صفرهای بیشتری از آنچه توسط توزیع نظری انتظار می رود وجود داشته باشد. در این صورت ، توزیع مشاهده شده با صفر تورم است

20. 2. 6. 1 مدل بررسی GLM I-طرح Q-Q باقیمانده کمی

از یک طرح کمی (Q-q) برای بررسی شباهت کلی توزیع مشاهده شده با توزیع که تحت مدل انتظار می رود استفاده می شود. جایگزینی برای یک طرح Q-Q معمولی برای تناسب GLM ، یک قطعه Q-Q باقیمانده کمی از باقیمانده های مشاهده شده در مقابل مقدار مورد انتظار است. الگوریتم اساسی برای این است

برای شبیه سازی مقادیر جعلی (P ) پاسخ برای هر ردیف از داده ها از پارامترهای مدل استفاده کنید. این یک ماتریس (n برابر p ) داده های جعلی خواهد بود که در آن هر ستون یک نمونه جدید و تصادفی از جمعیت با پارامترهای برابر با آن است که برای داده های مشاهده شده تخمین زده می شود. برای پواسون ، پارامتر هر مشاهده ( کلاه خواهد بود

  1. _i ) ، مقدار مدل شده مشاهده (i ). برای دوتایی منفی ، پارامترها ( کلاه هستند<mu>_i ) و پارامتر پراکندگی (k ) ، که برای همه مشاهدات یکسان است.<mu>برای هر مشاهده (هر ردیف از ماتریس داده های جعلی) ، کسری از مقادیر شبیه سازی شده را کوچکتر از مقدار مشاهده شده متغیر پاسخ برای آن ردیف محاسبه کنید. این بخش باقیمانده کمی مشاهده شده است ، که از 0 تا 1 متغیر است. اگر داده های واقعی به صورت مشخص شده توسط مدل توزیع شوند ، پس باقیمانده های کمی توزیع یکنواخت خواهند داشت.
  2. باقیمانده های کمی مشاهده شده را از کوچکترین تا بزرگترین و طرح در برابر باقیمانده های کمی نظری از توزیع یکنواخت مرتب کنید. می توان باقیمانده های کمی را به باقیمانده های استاندارد ، عادی تبدیل کرد و سپس با استفاده از یک طرح سنتی q-q سنتی ترسیم کرد اما این مرحله لازم نیست (در صورت گزارش ، یک طرح عادی Q-Q از باقیمانده های کوانتین تبدیل شده ممکن است خوانندگانی را که نتوانسته اند چاپ خوب را بخوانند اشتباه بگیرند)واد
  3. اشتباه اشتباه-یک تصور غلط رایج این است که اگر توزیع پاسخ توزیع پواسون را تقریب دهد ، پس باقیمانده های یک GLM با توزیع پواسون باید به طور معمول توزیع شود ، که می تواند با یک طرح q-q معمولی و Homoskedastic بررسی شود. با یک طرح مقیاس-مکان بررسی شود. هیچ یک از این موارد صحیح نیست زیرا GLM داده ها را تغییر نمی دهد و در واقع ، تعریف مدل چیزی در مورد توزیع یک اصطلاح "خطا" مشخص نمی کند - در تعریف مدل بالا هیچ ( varepsilon ) وجود ندارد! به همین دلیل است که فکر کردن در مورد تعریف یک مدل خطی با مشخص کردن یک اصطلاح خطا با توزیع عادی می تواند گیج کننده باشد و منجر به تصورات غلط در هنگام یادگیری GLMS شود.

نمودار Q-Q با استفاده از باقیمانده های چندتایی با توزیع پواسون نشان می دهد که تعداد لاروهای Diplostomum در چشمان سه ستون فقرات با توزیع پواسون به خوبی تقریب نمی شود - مقادیر مشاهده شده بسیار زیادی در نزدیکی انتهای دم های مورد انتظار وجود دارد که نشان دهنده میزان مورد انتظار است. ارزش ها به اندازه کافی پخش نشده اند. این الگو ظاهر می شود زیرا تعداد مشاهده شده در مقایسه با توزیع پواسون بیش از حد پراکنده است.

20. 2. 6. 2 بررسی مدل GLM II - نمودار پراکندگی

اگر تعداد مشاهده شده توزیع پواسون باشد، پسماندهای پیرسون ((r_i)) و درجات آزادی باقیمانده مدل برازش ((df)) می توانند برای محاسبه آمار پراکندگی استفاده شوند.

که دارای مقدار مورد انتظار 1 است. به جای آزمون فرضیه رسمی این آمار، از یک رویکرد شبیه سازی استفاده می کنم و می پرسم: "اگر تعداد مشاهده شده توزیع پواسون باشد، توزیع فراوانی مورد انتظار از این آمار پراکندگی چیست؟"و سپس از شبیه سازی برای تولید این توزیع مورد انتظار استفاده کنید. الگوریتم برای این است

برای هر مشاهده (i) ، یک عدد پواسون تصادفی با استفاده از (hat ایجاد کنید

  1. ) به عنوان پارامتر.<mu>مدل را برازش کنید و آمار پراکندگی را محاسبه کنید.
  2. 1 و 2 (N_) بار تکرار کنید.
  3. نمودار زیر یک هیستوگرام از آمار پراکندگی محاسبه شده برای 1000 شبیه سازی داده های کرم را نشان می دهد. آمار پراکندگی مشاهده شده 3. 4 است. مقدار مورد انتظار 1. 0 است. میانگین مقادیر شبیه سازی شده 1 است.

شکل 20. 3: آمار پراکندگی مشاهده شده در مقابل مورد انتظار. آمار مشاهده شده با خط قرمز مشخص شده است. هیستوگرام آمارهای مورد انتظار از 1000 شبیه سازی داده های مشاهده شده است.

Observed vs. expected dispersion statistic. The observed statistic marked by the red line. The histogram of expected statistics are from 1000 simulations of the observed data.

20. 2. 7 برازش GLM با توزیع دوجمله ای منفی به داده های کرم

[شروع Diplo\_intensity &sim NB(mu, k)\ mathrm(

) &= mu\ mu &= mathrm(eta)\ eta &= x08eta_0 + x08eta_1 غیر آلوده + x08eta_2 آلوده\_LG + x08eta_3 آلوده\_HG end]این مدل یک توزیع دوجمله ای منفی را مشخص می کند اما در غیر این صورت دقیقاً مانند آنچه در بالا یک توزیع پواسون را مشخص می کند است.

20. 2. 7. 1 بررسی مدل

یک نمودار Q-Q باقیمانده چندک از مدل GLM متناسب با توزیع دو جمله ای منفی در بالا نشان داده شده است. این خیلی خوب به نظر می رسد.

20. 2. 7. 2 میانگین ها و ضرایب مدل

در یک مدل خطی تعمیم یافته تعداد با استفاده از توزیع دو جمله ای پواسون یا منفی، میانگین ها، ضرایب و تضادهای مدل شده را می توان در مقیاس پیوند یا پاسخ گزارش کرد. به یاد داشته باشید، مقیاس پاسخ یک شمارش است، در حالی که مقیاس پیوند یک log(count) است.

میانگین های مدل سازی شده در مقیاس پیوند هستند

در حالی که میانگین در مقیاس پاسخ است

میانگین در مقیاس پاسخ به سادگی نماینده میانگین در مقیاس لینک است. به عنوان مثال ، میانگین سطح کنترل کنترل در مقیاس پاسخ ( Mathrm (1. 821408) = 6. 180555 ) است.

CI در مقیاس پیوند در اطراف میانگین متقارن است اما موارد موجود در مقیاس پاسخ نیستند. این یک ویژگی است ، نه یک اشکال. به یاد داشته باشید که شمارش درست است به این معنی که یک CI دارای فاصله وسیع تر از فاصله چپ خواهد بود. این را بررسی کنید!

اگر یک طرح شامل یک نوار خطای 1 SE در مقیاس پاسخ باشد ، این از نظر فنی صحیح است اما عمل محاسبات CIS را با استفاده از قانون 2*SE از انگشت شست تشویق می کند. این قانون برای داده های شمارش با توزیع های مناسب و راست تجزیه می شود.

ترسیم مقیاس پاسخ CIS از نظر فنی صحیح است و قانون 2*SE انگشت شست را غیر ضروری می کند.

ضرایب مدل در مقیاس پیوند است

انتقال ضرایب (اما نه رهگیری) به مقیاس پاسخ (با استفاده از ( mathrm )) منجر به پاسخ می شود.

توجه داشته باشید که چگونه بسته EMMEANS نام این اصطلاح را به عنوان نسبت مدت ضریب به اصطلاح رهگیری (سطح درمان مرجع) گزارش می دهد. چرا ضرایب در مقیاس پاسخ نسبت به نسبت ها را نشان می دهند؟به یاد داشته باشید که ضریب تفاوت در وسایل مشروط است و ( mathrm (b-a) = frac

  1. )برای یک متغیر ساختگی مانند اینجا (بگویید "HG آلوده") ، نسبت پاسخ است<mathrm(B)><mathrm(A)>1 ) یا (100 (1 - rr_j) ) اگر (rr_j

which give us the relative effect of Infected_HG compared to the Control. Relative effects could be reported as a response ratio in a table, or in the text it could be reported as a percent “Infected HG fish had 71.5% (95%CI: 38.9% - 111.8%) more Diplostomum larvae than Control fish.” Where do these percents come from? The percent effect is (100(RR_j - 1)) larger than the reference mean if the (RR_j>تغییر شکل رهگیری نسبت به آن ایجاد نمی کند زیرا رهگیری در مقیاس لینک تفاوتی ندارد. برای تجزیه و تحلیل کرم ، رهگیری در مقیاس لینک میانگین تعداد گروه کنترل در مقیاس پیوند است و رهگیری با پشتوانه میانگین تعداد گروه کنترل در مقیاس پاسخ است.<1) .

تأثیرات در مقیاس پاسخ افزودنی نیست بلکه چند برابر است! بنابراین ، به عنوان مثال ، میانگین سطح درمان Hg آلوده در مقیاس پاسخ ( overline*rr_ است

) (به یاد داشته باشید که با یک مدل خطی میانگین می تواند باشد (B_ + B_)). بررسی کنید و ببینید که آیا این کار می کند یا خیر.20. 3 کار در r

متناسب با GLM برای شمارش داده ها. خانواده پواسون با عملکرد پایه r glm () مشخص شده است. برای Binomial منفی ، از GLM. NB از بسته انبوه استفاده کنید

قرار دادن GLM به یک پاسخ مشروط مداوم با شکاف راست. خانواده گاما با عملکرد پایه r glm () مشخص شده است.

قرار دادن GLM به یک پاسخ باینری (موفقیت یا عدم موفقیت ، حضور یا عدم حضور ، زنده ماندن یا فوت)

خانواده دو جمله ای با تابع پایه R glm() مشخص می شود.

تطبیق مدل های ترکیبی خطی تعمیم یافته مدل های ترکیبی خطی تعمیم یافته با گلمر از بسته بندی lmer مطابقت دارند.

بسته خوب دیگر برای GLMM ها glmmTMB از بسته glmmTMB است

20. 3. 1 نصب GLM برای شمارش داده ها

منبع انتشار: Benesh, D. P., & Kalbe, M. (2016). بوم شناسی جامعه انگل تجربی: تنوع درون گونه ای در یک کرم نواری بزرگ بر مونتاژ جامعه تأثیر می گذارد. مجله بوم شناسی حیوانات، 85 (4)، 1004-1013.

فایل منبع: “Lab_exp. csv”

پواسون مناسب. با استفاده از بسته DHARma می توان یک نمودار Q-Q باقیمانده چندکی ایجاد کرد

نموداری از آمار پراکندگی را می توان با استفاده از شی برگردانده شده توسط تابع SimulateOutput اما با refit = TRUE تولید کرد که هر تکرار یک مدل را مجدداً تنظیم می کند. اگر فقط به مقدار کمی باقیمانده نیاز باشد، این نصب مجدد ضروری نیست. بسته دارما مجموع مجذور باقیمانده های پیرسون را بر درجات آزادی باقیمانده تقسیم نمی کند و بنابراین مقدار مورد انتظار آماره (df) است.

 

فارکس کاران ایران...
ما را در سایت فارکس کاران ایران دنبال می کنید

برچسب : نویسنده : ديناروند فهيمه بازدید : <-PostHit-> تاريخ : جمعه 19 خرداد 1402 ساعت: 12:17