풀어쓰는 통계학
오늘은 통계학에서 자주 등장하는 카이제곱분포, \(F\)분포, \(T\)분포를 소개하도록 하겠습니다. 이 글은 각 분포가 지니는 성질을 요약해서 정리해두려는 목적으로 작성돼 다소 설명이 부족하다고 느껴질 수 있을 것 같습니다. 1. 카이제곱분포(chi-squre distribution) - \(\alpha = \frac{\nu}{2}\)(\(\nu\)는 양의 정수), \(\beta = 2\)인 감마분포를 자유도 \(\nu\)인 카이제곱분포라고 함. 자유도 \(\nu\)가 커질수록 종 모양의 분포에 가까워지는 특징이 있음\(f(x; \nu) = \frac{1}{2^{\frac{\nu}{2}} \Gamma \left( \frac{\nu}{2} \right)} x^{\frac{\nu}{2} - 1} e^{..
오늘 포스팅에서 다룰 대수의 법칙과 중심극한정리는 확률변수의 수열 \(X_n\)이 어떤 값에 수렴하거나 분포적으로 수렴하는 현상입니다. 따라서 이를 이해하기 위해서는 먼저 평균제곱수렴과 확률수렴, 분포수렴의 개념에 대해 이해하고 넘어가야합니다. 1. 수렴1) 평균제곱수렴: 수열 \(X_n\)이 특정값 X로 평균제곱수렴한다는 것은, \(X_n\)과 \(X\)의 평균제곱오차(MSE, Mean Squared Error)가 점점 0에 가까워진다는 것을 의미합니다. 평균제곱오차란 각 확률변수 \(X_n\)과 특정 값 \(X\)의 차이를 제곱해 평균을 낸 값입니다. 평균제곱수렴은 수식으로 \(X_n \xrightarrow{L^2} X\)로 표현됩니다. 확률변수의 열 \(X_1, X_2, \cdots, X_n, \c..
모집단과 표본은 통계학에서 매우 중요한 개념들입니다. 통계학을 공부한다면 앞으로 계속 맞닥뜨릴 개념인데요, 이 포스팅에서 정리하고 넘어가도록 하겠습니다. 1. 주요 개념1) 모집단(population): 연구나 관찰의 대상이 되는 관심 대상의 전체 집합을 의미합니다. 한 국가의 전체 성인 인구, 특정 학교의 모든 학생, 또는 어떤 공장에서 생산되는 모든 제품 등이 모집단이 될 수 있습니다. 모집단은 크기가 매우 크거나 측정하기 어려울 수 있습니다. 2) 표본(sample): 표본은 모집단에서 선택된 부분 집합으로, 모집단의 특성을 추정하기 위해 사용됩니다. 표본은 비용, 시간, 노력 등의 이유로 전체 모집단을 조사하는 것이 현실적으로 어려울 때 사용되며, 잘 선택된 표본은 모집단을 대표할 수 있는 충..
1. 적률적률(moment)은 물리학에서 사용되는 개념입니다. 물리학에서 모멘트(moment)란, "어떤 물체에 작용하는 힘이 그 물체를 회전시키는 경향"을 의미합니다. 모멘트는 힘과 거리의 곱으로 정의됩니다. 예를 들어 두 명의 사람이 시소를 탄다고 했을 때, 두 사람이 모두 양 끝에 탔을 때와 한 사람은 끝에 한 사람은 한 칸 앞에 탔을 때 시소 축이 회전하려는 경향성(moment)은 달라질 겁니다. 시소에 작용하는 질량(힘)은 같아도, 질량이 분포된 모양(거리)에 따라 모멘트는 달라집니다. 그래서 모멘트는 힘이나 질량이 특정 축을 중심으로 어떻게 분포되어 있는지를 나타내는 중요한 개념이기도 합니다. 물리학의 모멘트(moment) 개념이 통계학의 적률(moment) 개념에 사용된 이유는 바로 이 '..
확률변수의 변수변환이란, f(x)가 주어져있고 Y와 X의 관계가 주어져 있을 때 f(y)를 구하는 방법입니다. 앞서 포스팅한 컨볼루션도 X, Y, Z의 관계가 주어져 있을 때 f(z)를 구한다는 점에서 일종의 변수변환이라고 할 수 있습니다. 이외에도 변환기법, 누적분포함수법으로 변수변환이 가능합니다. 이번 포스팅에서는 변환기법, 누적분포함수법을 다뤄보도록 하겠습니다. 1. 변환기법1) 1 대 1 변환① 이산형 확률변수 변환\(X\)는 확률분포가 \(f(x)\)인 이산형 확률변수이고, \(Y = u(X)\)가 1대1 대응관계여서 \(y = u(x)\), \(x = w(y)\)가 성립할 때, \(Y\)의 확률분포는 \(g(y) = f(w(y))\)이다. 한마디로 말해, f(x)가 주어져있고 Y와 X의 관계..
많은 프로그래밍 도구들이 특정 확률분포를 갖는 데이터를 생성해내는 함수들을 제공하고 있습니다. 예를 들어, R에서는 균등분포를 만들어내는 runif(), 지수분포를 만들어내는 rexp() 등을 사용할 수 있죠. 하지만 프로그래밍 도구들이 제공하지 않는 확률분포의 경우엔 어떻게 데이터를 생성할 수 있을까요? 이때 유용하게 쓸 수 있는 방법이 역변환법과 기각 추출 알고리즘입니다. 1. 역변환법 주어진 확률 분포의 누적분포함수의 역함수를 사용해 난수 데이터를 얻는 방법입니다. 먼저 수식을 보시죠.$$X:=F^{-1}(U)$$확률변수 X의 누적분포함수에 역함수를 취하고, 해당 함수에서 연속균등분포를 변수로 취하면 확률변수 X의 값을 얻을 수 있습니다. 얻고자 하는 확률변수의 1)누적분포함수를 알고 있고, 2)..
변수 X, Y가 독립이고 연속형인 경우 X+Y의 확률밀도함수는 어떻게 구할 수 있을까요?바로 본론으로 들어가겠습니다. X+Y=Z라고 할 때, Z의 확률밀도함수는 이렇게 구할 수 있습니다. $$\begin{aligned}f_{X+Y}(z)=\int_{-\infty}^{\infty} f_X(z-y) f_Y(y) d y \\\end{aligned}$$ 위 식은 가능한(possible) 모든 X와 Y의 결합확률밀도의 합(sum)을 의미한다고 생각하시면 됩니다. 즉 각각 독립인 확률이 동시에 발생할 모든 경우의 합을 의미하는 겁니다. 두 확률분포가 겹치는 영역(Overlapping Area)을 모든 y에 대해서 구해 더하는 것이라고 생각하셔도 좋습니다. 이 식은 아래의 '누적분포함수를 미분하면 확률밀도함수를 ..
1. 이변량 정규분포(Bivariate Normal Distribution) 이변량 정규분포는 두 개의 연속형 확률변수가 정규분포를 따르는 확률분포입니다. X와 Y의 결합확률밀도함수가 아래 식으로 주어질 때 이변량 정규분포를 따른다고 정의합니다. $$ \begin{aligned} &f(x, y)=\frac{1}{2 \pi \sigma_x \sigma_y \sqrt{1-\rho^2}} \exp \left(-\frac{1}{2\left(1-\rho^2\right)}\left[\frac{\left(x-\mu_x\right)^2}{\sigma_x^2}-2 \rho \frac{\left(x-\mu_x\right)\left(y-\mu_y\right)}{\sigma_x \sigma_y}+\frac{\left(y-\m..